OneDrive · Cómo funciona
Por Pedro Albaladejo · ClearCopies
Actualizado 28 de agosto de 2026 · 7 min de lectura
Benchmark de archivos duplicados en OneDrive: 102.610 archivos analizados
Descubre lo que un análisis de solo lectura de ClearCopies encontró en 102.610 archivos de OneDrive, cómo se clasificaron los grupos exactos y qué es lo que el resultado no demuestra.
Las cifras de duplicados en unidades grandes son fáciles de inflar. Contar nombres repetidos, tamaños iguales o cada elemento posterior al primer candidato puede producir un número espectacular sin demostrar que los bytes subyacentes coinciden. Este benchmark registra el resultado más estricto que producen las reglas de evidencia exacta de ClearCopies sobre una biblioteca real de OneDrive con seis cifras de archivos.
El análisis fue de solo lectura. Enumeró los metadatos del proveedor y utilizó huellas de contenido comparables de OneDrive junto con el tamaño exacto en bytes; no descargó los cuerpos originales de los archivos para calcular hashes. Las cifras publicadas son agregadas y anonimizadas: no revelan la identidad de la cuenta, los nombres de archivo, las rutas, los detalles de compartición ni los registros de archivos individuales.
Resumen de decisión
Qué midió el análisis de producción
Cada cifra describe una etapa del mismo inventario de metadatos de solo lectura.
| Valor observado | Medición | Interpretación |
|---|---|---|
| 102.610 | Archivos indexados | La escala del inventario antes de la agrupación de duplicados |
| 584 GB | Inventario de metadatos | Tamaño combinado reportado de la biblioteca de archivos indexada |
| 16.718 | Grupos exactos | Grupos que exigen igual tamaño en bytes y evidencia de huella de contenido comparable |
| 22,4 GB | Estimación de copias adicionales | Almacenamiento que excede al menos un archivo conservado en cada grupo exacto |
Revisado 28 de agosto de 2026. Se trata de una sola biblioteca anonimizada, no de una previsión universal de tasa de duplicados.
Anonymized production benchmark · August 2026
Validated on a six-figure-file OneDrive library
A completed read-only production scan indexed 102,610 files across 584 GB. Exact size-and-fingerprint matching identified 16,718 groups and 22.4 GB of recoverable extra copies. Similar or uncertain files were kept outside that exact total.
- 102,610
- files indexed
- 584 GB
- metadata inventory
- 22.4 GB
- exact recovery estimate
This benchmark exposed the difference between broad possible-match totals and exact recoverable storage, so the product now keeps those classifications visibly separate.
Written by ClearCopies Editorial · Technical review by ClearCopies Engineering
Una lista de comprobación práctica
- 1Inventaria el alcance completo y registra si la enumeración terminó correctamente.
- 2Usa el tamaño en bytes solo para acotar candidatos, nunca como prueba exacta por sí mismo.
- 3Exige una huella de contenido comparable del proveedor antes de crear un grupo exacto.
- 4Calcula el almacenamiento de copias adicionales solo después de conservar al menos un elemento por grupo.
- 5Mantén los archivos inciertos, no compatibles, protegidos o necesarios para la operativa fuera de la estimación de recuperación.
Cómo clasificó el benchmark las copias exactas
El proceso primero agrupó los candidatos por tamaño en bytes y después comparó una huella de contenido proporcionada por OneDrive, como quickXorHash o SHA-1, cuando el proveedor la devolvía. La identidad del algoritmo acompaña al valor, de modo que huellas de tipos distintos nunca se comparan como si fueran intercambiables. Un nombre de archivo, una marca de tiempo, una miniatura o un tamaño igual pueden ayudar a un revisor a investigar, pero no pueden promover un candidato al total exacto.
La paginación, los hashes ausentes, los archivos que cambian, las búsquedas incompletas y los errores del proveedor deben permanecer visibles. Un resultado de aspecto impecable no sirve de nada si el inventario omitió en silencio parte de la unidad. Por eso el benchmark refleja una enumeración completada y la agrupación exacta conservadora que el producto en funcionamiento expone en su interfaz de revisión.
- Candidato: tamaño coincidente o pista contextual
- Grupo exacto: tamaño coincidente más huella de contenido comparable
- Elemento incierto: evidencia insuficiente o incompatible
Qué significan 22,4 GB de almacenamiento recuperable
La estimación cuenta solo las copias que exceden la base conservada en cada grupo exacto. Si aparecen juntos tres elementos idénticos byte a byte, al menos uno permanece; la estimación considera como máximo dos copias adicionales. Es, por tanto, distinta del tamaño total de todos los archivos que participan en un grupo de duplicados.
La igualdad exacta de contenido sigue sin decidir qué archivo es redundante. Una ruta distinta puede poseer el enlace compartido activo, un historial de versiones útil, una obligación de retención o la ubicación canónica de un proyecto. ClearCopies mantiene estos elementos visibles para que el usuario elija cuál conservar en lugar de aceptar una elección automática basada en el nombre de archivo.
Lo que este benchmark no afirma
Una sola cuenta no puede establecer un porcentaje universal de duplicados para los usuarios de OneDrive. Las bibliotecas difieren según las importaciones de cámara, la colaboración, las migraciones, las copias de seguridad, los flujos de trabajo creativos, los tipos de archivo, los requisitos de retención y la antigüedad. El resultado debe tratarse como evidencia de que el método opera a una escala de seis cifras de archivos, no como una promesa de que otra cuenta recuperará la misma proporción de almacenamiento.
Tampoco mide los casi duplicados visuales, los documentos revisados, los medios recomprimidos, los archivos exportados de Google Workspace ni las copias entre proveedores. Esos elementos normalmente tienen bytes distintos y requieren otro método de comparación. Mantenerlos fuera del total exacto evita que una afirmación amplia de similitud se confunda con evidencia segura para la limpieza.
Cómo reproducir una medición defendible
Registra el alcance de la cuenta, el estado de finalización del análisis, el recuento de archivos, el total de bytes, los algoritmos de huella de contenido admitidos y los elementos sin resolver. Conserva la salida agregada antes de la limpieza para que un revisor posterior pueda entender cómo se produjo la estimación. Si la biblioteca cambia sustancialmente, vuelve a analizar en lugar de aplicar una decisión antigua a archivos nuevos.
Para un plan de limpieza, añade comprobaciones de propiedad, compartición, ubicación, formato protegido y retención después de la detección exacta. Revalida cada elemento seleccionado inmediatamente antes de un traslado posterior a la papelera recuperable. La detección demuestra la igualdad de contenido; la revisión y la revalidación hacen más segura la decisión operativa.
Límites y riesgos a revisar
- — El benchmark corresponde a una sola biblioteca y no debe presentarse como una tasa universal de duplicados.
- — Las huellas de contenido del proveedor pueden estar ausentes o no ser compatibles para algunos elementos.
- — La igualdad exacta de contenido no elimina las obligaciones de compartición, propiedad, retención o historial de versiones.
- — Los paneles de almacenamiento y el comportamiento de la papelera de reciclaje pueden retrasar los cambios visibles de cuota tras la limpieza.
Referencias oficiales
Preguntas frecuentes
¿Descargó ClearCopies 584 GB para ejecutar este análisis?
No. El análisis inicial usó metadatos de OneDrive, tamaños en bytes y huellas de contenido proporcionadas por el proveedor. Los cuerpos originales de los archivos no se descargaron para la detección de duplicados.
¿Significan 22,4 GB que todos los archivos listados pueden eliminarse?
No. Es una estimación agregada de copias adicionales tras conservar un elemento base en cada grupo exacto. Cada candidato sigue necesitando una revisión de conservación, compartición, propiedad, historial, protección y retención.
¿Puede este resultado predecir el ahorro para otra cuenta?
No. Demuestra el método y la escala de producción. Otra biblioteca necesita su propio análisis de solo lectura completado, porque los patrones de duplicados y los requisitos operativos varían mucho.
Analiza primero. Decide con evidencia.
ClearCopies lee los metadatos de OneDrive y agrupa las copias exactas por tamaño en bytes más quickXorHash o SHA-1. El análisis no descarga el contenido original de los archivos. Revisas el resultado y exportas un plan antes de cualquier paso de escritura aparte.