El análisis: qué se mide
Cinco métricas sobre una muestra de tus documentos reales. Cada una lleva escritos sus parámetros, porque una cifra sin el umbral que la produjo no se puede comparar con nada.
950 €hasta 1.000 páginas · informe en 24-48 horas1. Documentos que no se pueden leer
Un PDF corrupto, un .docx que no abre, un fichero truncado en una
migración. Para un asistente de IA, un documento que no abre sencillamente no existe:
no aparece en ninguna respuesta y nadie se entera hasta que alguien lo echa de menos.
Se declaran aparte y no entran en el resto de cifras, ni en el numerador ni en el denominador. El informe los lista aunque no haya ninguno, para que quede constancia de que se miró.
2. Cobertura de extracción
La métrica que más veces explica «la IA no encuentra lo que le pido».
Es el porcentaje de páginas que contienen texto realmente extraíble, entendiendo por tal al menos 100 caracteres por página. Un PDF escaneado sin OCR es una imagen: un sistema de recuperación no lee ni una palabra de él, por muy bueno que sea el modelo que tengas detrás.
El informe reparte las páginas sin texto por tipo de fichero, porque la causa no es la misma y el arreglo tampoco:
| Tipo | Qué significa una página sin texto |
|---|---|
.pdf | Casi siempre un escaneo sin OCR: el contenido está, pero como imagen |
.docx / .txt | No hay escaneo posible: el documento es simplemente muy corto |
3. Exposición de datos personales
Recuento por tipo, con una separación que casi ninguna herramienta hace explícita.
- Identificadores con formato verificable
- DNI y NIE por su letra de control, IBAN por mod-97, tarjeta por Luhn, y el número de la Seguridad Social por formato con una palabra de contexto cerca. Aquí el formato basta para afirmar el dato.
- La excepción: el teléfono
- Se reconoce solo por su forma, sin exigir contexto, así que un número de expediente o de factura de nueve cifras puede colarse en esa fila. El informe lo dice en el propio apartado y señala que es la fila que conviene contrastar antes de darla por buena.
- Menciones propuestas por el modelo de lenguaje
- Personas, lugares y organizaciones que el reconocedor de entidades propone por parecido, sin ningún formato que verificar. Requieren revisión manual. En pruebas se han medido casos como «la Ley» clasificado como lugar o «Líquido» —de «Líquido a percibir», en una nómina— como persona. Cuentan como señal de dónde mirar, no como recuento de datos personales.
Las dos categorías nunca se suman en una sola cifra. Sumarlas daría un número más impresionante y sin significado.
4. Fragmentación
Predice una recuperación pobre antes de que montes el sistema.
Un asistente de IA no lee documentos enteros: lee trozos. Si esos trozos salen demasiado cortos o repetidos, la recuperación falla por debajo, y se acaba culpando al modelo. El informe cuenta cuántos fragmentos se generan, cuántos quedan por debajo del mínimo y cuántos están duplicados exactos.
| Parámetro | Valor |
|---|---|
| Ventana deslizante | 1.000 caracteres |
| Solape | 100 caracteres |
| Umbral de «demasiado corto» | 200 caracteres |
Son parámetros de esta auditoría, no verdades del dominio. Se declaran precisamente para que la cifra se pueda comparar con la del sistema que ya tengáis o vayáis a montar, que casi seguro usa otros.
5. Variación de tokens al anonimizar
Cuánto texto movió la anonimización, medido en tokens. Va en anexo, y el informe declara expresamente que no es un ahorro de coste: al sustituir un nombre corto por una etiqueta larga la variación puede salir negativa.
Está en el informe porque es un efecto real de anonimizar y conviene saberlo, no porque sea un argumento de venta.
Y lo que estas cinco no cubren
El alcance está escrito con el mismo detalle que las métricas, y en su propia página. Merece la pena leerlo antes de decidir.
Si el análisis encuentra trabajo que hacer, el escalón siguiente es el setup, y este importe se descuenta de él.