Referencias
Referencias de datos y definiciones de terminología para IA documental. Cada página está verificada en la fuente y diseñada para ser citada.
Estadísticas
Comparativa directa de primera mano: docTR vs Docling en 361 recibos SROIE + 100 CORD — 6,7x latencia, 8,3x costo, 3,0x CER, 2,9x cambio de campo regex. Metodología.
Comparativa directa de primera mano: docTR vs Surya2 en 361 recibos SROIE + 100 CORD — empate en CER, cambio de 4.2x en F1 de campo, brecha de costos de 22x, metodología.
Benchmark de primera parte: EasyOCR vs docTR en 361 recibos SROIE + 100 CORD: docTR un 30 % menos de CER, 1.66x el F1 de campos con LLM; EasyOCR 1.93x el F1 con regex.
Benchmark propio: costo de OCR por cada 1,000 páginas para 8 motores de código abierto en RTX 4090 — $0.048 (docTR) a $1.061 (Surya2). SROIE + CORD, metodología.
Latencia por página de 8 motores OCR de código abierto en RTX 4090 — de 108,7 ms (docTR) a 2.668 ms (Surya2) en p50. Colas de p95, rendimiento y metodología.
Comparativa directa de primera mano: PaddleOCR vs EasyOCR en recibos — CER 0.204 vs 0.283, F1 de regex 2.2x, brecha de costo 2x, paradoja de LLM. Metodología.
Benchmark de primera parte: Surya2 vs Unlimited-OCR vs PaddleOCR-VL en 361 recibos SROIE + 100 recibos CORD: puntuación F1 por campo, equidad de CER, costo y latencia.
Comparativa directa de primera mano: Tesseract (CPU) vs PaddleOCR (GPU) en 361 recibos SROIE + 100 CORD — CER, F1 por campo, paridad de rendimiento, costo. Metodología.
Evaluación comparativa propia: 8 motores OCR de código abierto vs VLM de análisis de documentos en 361 recibos SROIE + 100 recibos CORD — CER, F1 de campo, latencia y costo. Metodología incluida.
Por qué el CER de los VLM está inflado: la normalización de mayúsculas/minúsculas y la estructura del texto de referencia añaden errores fantasma. Datos propios de SROIE + CORD: el F1 de campo es la métrica justa entre familias.
Benchmark propio: el postprocesamiento con LLM supera a regex en la extracción de campos de recibos, F1 de campo para 8 modelos OCR en SROIE + CORD, metodología incluida.
Benchmark de primera parte de 5 modelos de OCR de código abierto en 461 recibos (SROIE + CORD): CER, WER, F1 de campo, latencia, costo por 1.000 páginas.
Tasas de excepciones en la automatización de documentos: 9 % mejor en su clase frente al 22 % promedio, causas raíz, costos de revisión y compensaciones de umbral con todas las fuentes citadas.
Evaluaciones comparativas independientes sobre el costo de procesamiento de documentos por registro: manual $8-16, plantilla $2-5, IA desde $0.02/página. Por tipo de documento, tamaño y geografía.
Datos de precisión de OCR de escritura manual: IAM CER 1.2-1.7%, árabe 8.9-16%, histórico 71-82%. Desglosado por escritura, modelo y tipo de documento. 15 fuentes citables.
Referencias sobre el tiempo de procesamiento de facturas: 12,5 min de gestión manual frente a un ciclo de 9,2 días, según método, complejidad y etapa, con todas las fuentes para citar.
Parámetros de referencia independientes sobre el ROI de la automatización de la entrada de datos: recuperación en 3-12 meses, ahorros del 60-80%, volumen de equilibrio, además de una fórmula para modelar su retorno.
Referencias independientes sobre la precisión del OCR por tipo de documento: 99,2-99,8 % en PDF digitales, 98-99 % en escaneos, 46-95 % en escritura a mano, TEDS en tablas. 15 fuentes citables.
Precisión de OCR en recibos según condición y campo: 90%+ en escaneos limpios, 55-73% en papel térmico descolorido, 67-69% en fotos con teléfono. Totales 95-99%, comercios 73-88%. 14 fuentes.
Referencias independientes sobre tasas de error en la entrada manual de datos: 1-4% a nivel de campo, hasta 40% a nivel de registro, según tipo de documento, industria y rol.
Definiciones
La captura de datos convierte papel, escaneos, PDFs y fotos en datos legibles por máquina. Cómo funciona, sus tipos y conceptos erróneos.
ICR es un reconocimiento de caracteres basado en aprendizaje automático para texto manuscrito con letras separadas. Cómo evolucionó a partir del OCR, las diferencias entre ICR, OCR e IWR, y dónde se utiliza.
La Extracción de información clave (KIE) extrae campos como números de factura y fechas de documentos para convertirlos en datos estructurados. Cómo funciona, límites y conceptos erróneos.
Un PDF con búsqueda es un escaneo con una capa de texto OCR invisible: puedes seleccionar, copiar y usar Ctrl+F en el texto. Cómo funciona, reglas de PDF/A y errores comunes.
La precisión a nivel de campo cuenta los campos extraídos correctamente; la precisión a nivel de carácter cuenta los caracteres leídos correctamente. Una precisión de caracteres del 99 % no significa que el 99 % de los datos sean correctos.
El IDP es un software de IA que captura, clasifica, extrae y valida datos de documentos. Cómo funciona, evolución del OCR a los LLM y conceptos erróneos.
La tasa de STP mide la proporción de documentos procesados sin intervención manual: promedio del sector 32 %, mejor de su clase 49 %, IA 60-80 %. Fórmula y conceptos erróneos.
El OCR convierte imágenes de texto impreso, manuscrito o mecanografiado en datos legibles por máquina. Cómo funciona, los 4 tipos de OCR, su historia y casos de uso.