Precisión del OCR por tipo de documento: PDF digital, escaneo,escritura a mano y referencias de tablas (2026)

Última revisión: 2026-08-10 · Cobertura de datos: Parcial · Fuentes: 16 estudios independientes

Qué cubre esta página: Referencias de precisión del OCR a nivel de caracteres, palabras, campos y estructura, agregadas a partir de estudios revisados por pares (Springer, UNLV ISRI, competiciones ICDAR), organismos gubernamentales (NIST, EDPB, US GPO) y referencias industriales con metodología transparente (AIMultiple). Desglosadas por tipo de documento, resolución de escaneo, tipo de campo e idioma, con la distinción de métrica caracteres-vs-campos-vs-estructura que la mayoría de las afirmaciones de «99% de precisión» omiten. Todas las fuentes son de terceros y verificables de forma independiente.
Qué NO cubre esta página: Tasas de error de entrada manual de datos (consulte Tasas de error de entrada manual de datos), el mecanismo del OCR en sí (consulte ¿Qué es el OCR?) ni afirmaciones específicas de proveedores sobre un producto individual más allá de las cifras de referencia citadas a continuación.

Todas las cifras a continuación se basan en estudios de terceros disponibles públicamente e informes industriales citados en la sección de metodología. Cuando las fuentes discrepan, se utilizan rangos conservadores (valores reportados más bajos–más altos). Esta página es una referencia direccional, no un pronóstico preciso para ningún motor u organización en particular.

Cada proveedor de OCR cita una versión de «99% de precisión». En 16 estudios independientes, esa cifra es cierta para exactamente una condición de documento: texto digital nativo limpio, donde todos los motores principales puntúan por encima del 99.2% — y se vuelve progresivamente menos cierta para todo lo demás: los escaneos limpios bajan al 98–99%, los escaneos históricos y degradados al 71–98%, la escritura a mano a un rango del 46–95% según la solución, y los originales dañados hasta un 72.7%. La cifra no es una mentira; es una medición específica de un tipo de documento presentada como si fuera universal.

99.2–99.8%
Precisión a nivel de caracteres en texto digital nativo limpio / texto mecanografiado: todos los motores superan el 99.2% en texto mecanografiado sencillo (IntuitionLabs 2025); ABBYY reporta hasta un 99.8% en escaneos limpios (afirmación del proveedor)
71–98%
Precisión bruta a nivel de caracteres en escaneos degradados e históricos de periódicos (1803–1954), medida por la Biblioteca Nacional de Australia (Holley 2009): la banda más amplia de cualquier clase de documento común
46–95%
Precisión del reconocimiento de escritura a mano en 12 soluciones modernas (AIMultiple 2026): los mejores sistemas basados en LLM alcanzan el 93–95%, los motores heredados se sitúan cerca del extremo inferior de la banda

De dónde proviene la cifra del "99%" — y por qué induce a error

La cifra del 99% es una medición a nivel de caracteres sobre texto impreso limpio, y la precisión a nivel de caracteres es el enfoque más favorable disponible. Comprender eso — y los otros tres enfoques en uso — explica por qué "99% de precisión del OCR" y "78% de precisión a nivel de campos" pueden ser ambas ciertas para el mismo sistema.

La tasa de error de caracteres (CER) cuenta los caracteres individuales mal leídos: una CER del 1% significa aproximadamente un carácter incorrecto por cada cien. La escala de referencia ampliamente adoptada para texto impreso, formalizada por el programa de digitalización de periódicos de la Biblioteca Nacional de Australia, define un buen OCR como 98–99% de precisión (1–2% de CER), promedio como 90–98% (2–10% de CER) y deficiente por debajo del 90% (Holley, 2009). La guía de OCR del Comité Europeo de Protección de Datos sitúa de forma independiente el rendimiento típico en documentos impresos en 95–99% de precisión a nivel de caracteres, tratando el 98–99% como el nivel de garantía de grado de producción (EDPB, 2024).

El problema es que la precisión a nivel de caracteres es la métrica menos exigente de las que se utilizan. Un documento con 2.000 caracteres y un 99% de precisión a nivel de caracteres aún contiene ~20 caracteres incorrectos. A nivel de palabras, esa misma salida podría alcanzar un 96–98% porque un solo carácter mal leído hace fallar toda la palabra. A nivel de campos — la medida que importa para extraer un número de factura o una fecha — un solo dígito incorrecto hace fallar todo el campo, por lo que un sistema con un 99% de precisión a nivel de caracteres puede ofrecer solo un 78–98% de precisión a nivel de campos según el motor (referencia de BusinessWareTech, 2025). Para tablas, se aplica una cuarta métrica: la similitud de distancia de edición de árbol (TEDS), que puntúa si la estructura de la tabla extraída y el contenido de las celdas coinciden con el original — un eje completamente distinto de la precisión a nivel de caracteres.

El registro histórico muestra lo difícil que es el techo del texto limpio. El Instituto de Investigación en Ciencias de la Información de UNLV realizó pruebas anuales de precisión del OCR de 1992 a 1995 sobre páginas en inglés impresas mecánicamente; los mejores sistemas comerciales pasaron de aproximadamente 94% a 98%+ de precisión a nivel de caracteres y en gran medida se estabilizaron allí (Rice, Jenkins & Nartker, 1995). NIST llegó a la misma conclusión en su evaluación de 1998: una tasa de error de caracteres del 1% solo es alcanzable cuando la fuente es un original mecanografiado limpio y de formato fijo (NIST IR 6101, 1998). Veinticinco años de aprendizaje profundo han empujado ese techo, pero solo para las entradas más limpias.

El tipo de documento es el mayor factor determinante de la precisión del OCR — mayor que la elección del motor. El gráfico a continuación traza el rango publicado para cada clase de documento; la dispersión entre el valor más bajo y el más alto observado es la respuesta honesta, no un único "promedio". Los documentos degradados o escritos a mano producen rangos tan amplios que una estimación puntual sería activamente engañosa.

Desglose por tipo de documento

Rangos de precisión del OCR por tipo de documento: texto digital nativo 99.2–99.8%, impresión escaneada limpia (300 DPI) 98–99%, escaneos degradados/históricos 71–98%, escritura a mano en los mejores sistemas modernos 94–99%, escritura a mano en el rango completo de soluciones 46–95%, originales dañados 72.7–94.7%.

Fuentes: IntuitionLabs (2025) — todos los motores >99.2% en texto mecanografiado sencillo; Holley (2009) — referencia "buena" de 98–99% en impresiones limpias; 71–98.02% de confianza bruta de caracteres en periódicos australianos de 1803–1954; AIMultiple (2026) — escritura a mano 46–95% en 12 soluciones; GatedLexiconNet (2024) — precisión a nivel de palabras en IAM ~94.3%; IJSAT (2026) — originales dañados 72.7–94.7% a 300 DPI. Se utilizan rangos conservadores cuando las fuentes difieren.

Tipo de documento / CondiciónRango de precisiónPunto medioFuenteAñoMuestra
PDF digital nativo (salida ERP/mecanografiada)99,2–99,8%99,5%IntuitionLabs; ABBYY (afirmación del proveedor)2025Todos los motores >99,2% en texto mecanografiado sencillo
Impresión escaneada limpia (300 DPI)98–99%98,5%Holley; EDPB2009 / 2024Referencia de «buen OCR»; colección digitalizada de la NLA
Escaneado — degradado o histórico71–98%~85%Holley2009Más de 30 títulos de periódicos, 1803–1954, confianza bruta de caracteres
Escritura a mano — mejores sistemas modernos (referencias)94–99% a nivel de palabras96%GatedLexiconNet; Referencia de HTR con LLM2024–2025IAM (657 escritores, 13 353 líneas); RIMES (cartas en francés)
Escritura a mano — rango entre soluciones46–95%~70%AIMultiple202612 soluciones, puntuación de similitud SBERT
Foto de original dañado72,7–94,7%~84%IJSAT2026EasyOCR; normal vs. arrugado/sucio/mojado, 300 DPI
Tablas — estructura (digital nativo)TEDS 0,91–0,970,94Tabla de clasificación de PubTabNet (MuTabNet 0,969); TrOCR-ctx (0,909)2024–2025Corpus PubTabNet, similitud estructural TEDS
Tablas — detección (archivo / dibujadas a mano)F1 ponderado 0,49–0,530,51ICDAR 2019 cTDaR2019Pista de archivo, F1 ponderado con IoU 0,6–0,9

Fuentes enumeradas en la tabla anterior. Las cifras de caracteres/palabras provienen de estudios revisados por pares y gubernamentales; las cifras declaradas por proveedores están etiquetadas como tales. TEDS y wF1 son métricas a nivel de estructura y no son directamente comparables con la precisión a nivel de caracteres; consulte Por qué los rangos de precisión son tan amplios. Para la fila de mayor degradación, el piso del 71% es una medición de 2009 sobre el título de periódico histórico con peor rendimiento (la cifra bruta publicada más reciente disponible); los motores modernos en documentos similares obtienen resultados considerablemente mejores (consulte Metodología).

La resolución es la palanca de precisión más controlable, pero la evidencia publicada es más escasa de lo que sugieren los blogs de proveedores. El único estudio gubernamental riguroso — la prueba de la Oficina de Publicaciones del Gobierno de EE. UU. sobre documentos antiguos y descoloridos — encontró que la captura en color (RGB), no una mayor resolución DPI, fue el factor decisivo: el escaneo RGB cumplió con el requisito de precisión de caracteres del 99% de la GPO, mientras que los escaneos bitonales (blanco y negro) de los mismos documentos obtuvieron ~77%, y la reducción de 300 a 200 DPI no produjo ninguna ganancia de precisión (documento técnico de la GPO de EE. UU.).

Desglose por DPI y calidad de escaneo

Resolución / modo de escaneoEfecto observadoFuenteAño
300 DPI o más (estándar)Cumple con una precisión de caracteres del 98–99% en impresiones limpias; se recomiendan 400–600 DPI para fuentes menores de 10 ptGuía de OCR de la Univ. de Pittsburgh; GPO de EE. UU.2024 / ~2022
200 DPIAdecuado en impresiones limpias; la reducción desde 300 no cambió el reconocimiento en las pruebas de la GPOGPO de EE. UU.~2022
Menos de 150 DPIClasificado como factor de degradación de alto impacto; las fuentes pequeñas fallan y la precisión cae por debajo de la banda limpia del 98–99%Glosario de LlamaIndex; piso de degradación según IJSAT (2026)2026
72 DPI (captura de pantalla)Densidad de píxeles insuficiente para una discriminación fiable de caracteres; clasificado como de «alto impacto» en la precisiónGlosario de LlamaIndex2026
Escaneo en color (RGB) frente a bitonal de documentos antiguosRGB alcanzó el 99% frente a ~77% para bitonal en originales antiguos/descoloridosGPO de EE. UU.~2022

Fuentes enumeradas en la tabla anterior. Tenga en cuenta la salvedad honesta: ningún estudio revisado por pares aísla el DPI por sí solo manteniendo constantes todos los demás factores. Por lo tanto, la fila «por debajo de 150 DPI» combina las pautas explícitas de DPI bajo del glosario de referencia de LlamaIndex con el piso de precisión por daño físico medido por IJSAT (2026) a 300 DPI — un indicador indirecto, declarado como tal.

El tipo de campo determina si un error de lectura importa. Una palabra mal leída en un párrafo es invisible para la mayoría de los flujos de trabajo; un dígito mal leído en un número de factura invalida todo el campo. La única referencia publicada que aísla los tipos de campo en múltiples motores es un estudio de extracción de facturas de 2025, y su rango — 40–98% según el tipo de campo y el motor — es la evidencia disponible más clara de que la «precisión del OCR» no es un solo número (BusinessWareTech, 2025).

Desglose por tipo de campo

Tipo de campoRango de precisiónContextoFuenteAño
Campos de texto clave-valor (encabezados de factura)78–98% según el motorGPT-4o + OCR 98%, Azure Document Intelligence 93%, Google Document AI 82%, AWS Textract 78%BusinessWareTech2025
Partidas individuales / filas de tabla40–82% según el motorDetección de partidas: Textract 82% frente a Google Document AI 40% en la misma pruebaBusinessWareTech2025
Campos numéricos (fechas, totales, ID)78–98% (dentro de la banda del campo)El formato restringido ayuda, pero un solo dígito mal leído invalida el campoBusinessWareTech; referencia de facturas de AIMultiple2025–2026
Casillas de verificación / reconocimiento de marcasSin referencia pública fiableVacío de datos — señalado en Limitaciones; la literatura heredada sobre reconocimiento de marcas es anterior al OCR con IA
FirmasSin referencia pública de precisiónVacío de datos — los proveedores informan detección, no precisión de reconocimiento

Fuentes enumeradas en la tabla anterior. Las cifras del 78–98% y 40–82% provienen de una única referencia independiente (BusinessWareTech, 2025, conjunto de pruebas con facturas reales), una fuente de grado C, corroborada en dirección por la referencia de facturas de AIMultiple, que encontró que la precisión disminuye drásticamente en documentos de menor calidad en todas las herramientas (AIMultiple, 2026). Las filas marcadas como «Vacío de datos» no tienen medición de terceros que se pueda citar; se indican como tales en lugar de rellenarse con cifras de proveedores.

El idioma es la dimensión de precisión menos publicitada porque casi ningún proveedor publica referencias por idioma. La única comparación multilingüe revisada por pares —un estudio de 2021 sobre 18 568 imágenes de documentos en inglés y árabe— encontró que la precisión en inglés era «considerablemente mayor» que en árabe con los mismos motores, con una brecha del orden de 10–25 puntos porcentuales en el reconocimiento estándar (Hebert et al., 2021). Las referencias de escritura a mano añaden un segundo dato: la escritura a mano en francés (RIMES) y en inglés (IAM) alcanza hoy una calidad casi de impresión en los mejores sistemas, pero solo con escritura a mano de corpus limpia y estandarizada.

Desglose por idioma y escritura

Idioma / EscrituraPrecisiónEvidenciaFuenteAño
Inglés — impreso (limpio)96–99.5%Referencia base para todos los motores principales en texto limpioHebert et al.; EDPB2021 / 2024
Árabe — impresoAproximadamente 10–25 puntos por debajo del inglésMismos motores, corpus de fuente común única; sigue siendo considerablemente menorHebert et al.2021
Escritura a mano en inglés (referencia IAM)~94.3% de precisión a nivel de palabras SOTAWER 5.73% (GatedLexiconNet); 3.34% WER con GPT-4o-miniGatedLexiconNet; Referencia HTR con LLM2024–2025
Escritura a mano en francés (referencia RIMES)~97–99% de precisión a nivel de caracteresCER 0.9–1.7% en cartas comercialesGatedLexiconNet2024
CJK, devanagari y otras escriturasSin referencia pública comparableVacío de datos: no se encontró ninguna comparación entre motores revisada por pares

Las fuentes se enumeran en la tabla anterior. IAM y RIMES son corpus estandarizados de escritura a mano: la escritura a mano real y desordenada, particularmente la mezcla de imprenta y cursiva, obtiene puntuaciones inferiores a las cifras de estos corpus limpios (la banda del 46–95% entre soluciones en la tabla por tipo de documento es la referencia del mundo real). La brecha del árabe es una interpretación conservadora del hallazgo publicado de que «la precisión para el inglés fue considerablemente mayor que para el árabe» en un corpus de una sola fuente común; un corpus más difícil probablemente la ampliaría.

Por qué los rangos de precisión son tan amplios: cuatro métricas, una palabra

Las contradicciones más evidentes en los datos de precisión del OCR no son errores de medición: son métricas distintas aplicadas a condiciones documentales distintas. «99% de precisión a nivel de caracteres» y «78% de precisión a nivel de campos» describen el mismo sistema; «detección de tablas con F1 ponderado (wF1) de 0.49» y «estructura de tablas con similitud de distancia de edición de árbol (TEDS) de 0.96» describen la misma tecnología en corpus diferentes.

Las cuatro métricas en uso forman una jerarquía estricta de dificultad. La precisión a nivel de caracteres (99%+) es la más fácil de inflar. La precisión a nivel de palabras es menor porque un solo carácter incorrecto hace fallar una palabra: el estudio de corrección de periódicos australianos midió 81.7% de precisión a nivel de palabras en la salida histórica sin procesar, que ascendió a 97.6% tras la corrección manual (Cassidy, 2019, estudio de la Universidad Macquarie sobre la misma clase de corpus). La precisión a nivel de campos es aún menor porque un solo dígito incorrecto hace fallar todo el campo: el rango del 78–98% entre motores mencionado antes. Las métricas estructurales (TEDS para tablas, wF1 para detección) son un eje completamente distinto: una tabla puede leerse con caracteres perfectos y aun así obtener una puntuación baja si la estructura de filas y columnas se reconstruye mal, razón por la cual la detección de tablas en archivos alcanza como máximo wF1 0.49–0.53 incluso mientras el reconocimiento moderno de estructura de tablas llega a TEDS 0.91–0.97 (TrOCR-ctx, 2025; tabla de clasificación de PubTabNet).

El ruido amplifica la dispersión. En el estudio revisado por pares de Hebert et al., añadir una sola capa de ruido artificial a escaneos de libros limpios redujo la precisión a nivel de palabras de aproximadamente 96% a 82.5% para el mejor motor, y a 58.4% para Tesseract de código abierto; dos capas de ruido la redujeron aún más (Hebert et al., 2021). Por eso la respuesta honesta a «¿qué tan preciso es el OCR?» es siempre un rango condicionado al tipo de documento, y por qué cualquier afirmación de una sola cifra debe tratarse como una medición de texto limpio disfrazada de universal.

Cómo Usar Estos Datos

No necesita una auditoría completa para convertir «hemos oído que el OCR tiene una precisión del 99%» —la afirmación que repite todo proveedor y la que esta página pone a prueba— en una expectativa defendible para sus propios documentos. Basta con un cálculo aproximado de tres pasos usando los rangos anteriores, y normalmente revela que la cifra principal no aplica a los documentos que usted realmente procesa.

  1. Clasifique su combinación de documentos. Ordene su volumen en las bandas anteriores —p. ej., para un flujo típico de cuentas por pagar de 1,000 facturas/mes: 70% PDF digitales nativos (99.2–99.8%), 20% escaneos limpios (98–99%), 10% escaneos degradados o archivos con anotaciones manuscritas (punto medio de ~85%).
  2. Convierta la precisión a nivel de caracteres en precisión a nivel de campos. Las cifras a nivel de caracteres favorecen los flujos de extracción. Use en su lugar la banda medida a nivel de campos para su nivel de motor: 93% para un procesador en la nube de gama media, 98% para un pipeline asistido por LLM, 78–82% para motores de gama baja (BusinessWareTech 2025).
  3. Estime el número mensual de errores. Con un 93% de precisión a nivel de campos y 12 campos por factura, 1,000 facturas producen aproximadamente 840 campos incorrectos al mes (1,000 × 12 × 7%) antes de cualquier revisión. Si el 10% de su volumen está degradado o es manuscrito, ese número de errores aumenta según la brecha entre bandas —típicamente 15–30 puntos porcentuales de precisión a nivel de campos.
  4. Decida si el número es aceptable. Si 840 campos incorrectos/mes supera lo que sus sistemas posteriores pueden absorber, las palancas publicadas son: elevar la calidad del escaneo hacia la banda de 300 DPI/RGB (GPO descubrió que esto por sí solo cierra la brecha del 77%→99% en documentos antiguos), derivar los campos de baja confianza a revisión humana, o aplicar la etapa de corrección que elevó la precisión histórica a nivel de palabras del 81.7% al 97.6% (Cassidy, 2019).

Estas son fórmulas de estimación aproximada, no un sustituto de la evaluación comparativa de sus propios documentos. Cada rango publicado en esta página se midió sobre el corpus de otra persona —el único número de precisión que aplica a su flujo de trabajo es el que usted mida en él. El valor de esta página es establecer la expectativa antes de medir.

Preguntas Frecuentes

¿Cuál es la tasa promedio de precisión del OCR?

El promedio depende por completo del tipo de documento. Según las fuentes de esta página, el texto digital nativo limpio promedia una precisión a nivel de caracteres del 99,2–99,8% (IntuitionLabs 2025; ABBYY), los escaneos limpios 98–99% (Holley 2009; EDPB 2024), los escaneos degradados o históricos 71–98% (Holley 2009) y la escritura a mano 46–95% según las soluciones (AIMultiple 2026). Un único número de "precisión promedio del OCR" no es significativo: el rango es la respuesta.

¿Qué es una buena tasa de precisión del OCR?

La escala ampliamente adoptada de la Biblioteca Nacional de Australia define un buen OCR de texto impreso como una precisión a nivel de caracteres del 98–99% (1–2% de CER), promedio como 90–98% y deficiente por debajo del 90% (Holley, 2009). Para la extracción a nivel de campos —la métrica que importa para los datos empresariales— un "bueno" más realista es 93–98%, que solo alcanzaron los motores de primer nivel en la referencia de facturas de 2025.

¿Qué tan preciso es el OCR en documentos escaneados frente a PDF digitales?

Los escaneos limpios de texto impreso alcanzan una precisión a nivel de caracteres del 98–99%, cerca del 99,2–99,8% del texto digital nativo, pero no igual. La brecha se amplía drásticamente cuando los escaneos se degradan: los escaneos históricos de periódicos midieron una precisión bruta del 71–98% (Holley 2009), y los originales dañados cayeron al 72,7–94,7% incluso a 300 DPI (IJSAT 2026). El bajo DPI, la captura bitonal (blanco y negro) y el papel envejecido empujan cada escaneo hacia abajo en la banda.

¿Qué tan preciso es el OCR de escritura a mano?

Los sistemas de última generación alcanzan una precisión a nivel de palabras de ~94–99% en corpus de referencia limpios como IAM y RIMES (GatedLexiconNet 2024; referencia de HTR con LLM 2025), pero en todas las soluciones el rango es 46–95% (AIMultiple 2026): los motores heredados se sitúan cerca del extremo inferior, y la escritura a mano real y desordenada, la mezcla de imprenta y cursiva, o los scripts históricos puntúan muy por debajo de las cifras de corpus limpios.

¿Qué DPI es mejor para la precisión del OCR?

300 DPI es la recomendación estándar: alcanza el rango de precisión a nivel de caracteres del 98–99 % en impresiones limpias, y se aconsejan 400–600 DPI para fuentes menores de 10 pt (guía de OCR de la Universidad de Pittsburgh). Cabe destacar que el estudio del GPO determinó que el modo de color del escaneo influía más que la resolución en documentos antiguos: la captura RGB alcanzó el 99 %, mientras que la bitonal (blanco y negro) obtuvo ~77 %, y reducir la resolución de 300 a 200 DPI no cambió nada.

¿Por qué la precisión del OCR es menor en tablas?

Las tablas añaden un paso de reconocimiento de estructura además del reconocimiento de caracteres: el motor debe reconstruir filas, columnas y celdas combinadas antes de que el contenido pueda utilizarse. Los sistemas modernos alcanzan TEDS 0.91–0.97 en corpus de tablas digitales nativas (tabla de clasificación de PubTabNet; TrOCR-ctx 2025), pero las tablas de archivo o dibujadas a mano descienden a una detección de F1 ponderado (wF1) 0.49–0.53 (ICDAR 2019 cTDaR), y la extracción de partidas individuales en pruebas con facturas reales osciló entre 40–82 % según el motor (BusinessWareTech 2025).

¿La precisión del OCR varía según el idioma?

Sí, de forma significativa. La única comparación entre idiomas revisada por pares encontró que la precisión en inglés era 10–25 puntos porcentuales superior a la del árabe con los mismos motores y corpus (Hebert et al. 2021). Las referencias de escritura a mano muestran que los corpus en francés e inglés alcanzan ahora una calidad casi de impresión en los mejores sistemas, pero no existe una referencia pública comparable para CJK, devanagari u otras escrituras: un vacío de datos real (consulte Limitaciones).

Metodología y fuentes

Cómo se construyó esta página

Esta página agrega datos de 16 estudios independientes que abarcan de 1995 a 2026. Las fuentes se seleccionaron con base en tres criterios: (1) metodología documentada públicamente con tamaño de muestra declarado, (2) datos recopilados en los últimos 3 años cuando estuvieran disponibles, con fuentes más antiguas etiquetadas por año en el texto, y (3) relevancia para el procesamiento de documentos, no para afirmaciones de marketing. Cuando varias fuentes reportan la misma dimensión, se utilizan rangos conservadores (valores más bajos–más altos reportados); preferimos subestimar. Cuando las fuentes discrepan significativamente, la discrepancia se explica por nivel de métrica o corpus, en lugar de promediarse.

La distinción de métricas es la columna vertebral de esta página: las cifras a nivel de caracteres, palabras, campos y estructura (TEDS/wF1) nunca se combinan en un solo número. Las cifras auto-reportadas por proveedores (el 99,8 % de ABBYY) se etiquetan como afirmaciones del proveedor y se usan solo como referencias de límite superior, según la regla de citación de grado D que exige corroboración; en este caso, por la medición independiente de IntuitionLabs que confirma que todos los motores superan el 99,2 % en texto mecanografiado sencillo.

Lista de fuentes

  1. Holley, R. — «How Good Can It Get?» D-Lib Magazine 15(3/4) (2009). Programa de digitalización de periódicos de la Biblioteca Nacional de Australia; mediciones brutas de confianza de caracteres en más de 30 títulos históricos de periódicos, 1803–1954. Proporciona el rango de escaneos degradados del 71–98.02%, la escala buena/regular/mala de 98–99%/90–98%/<90% y el punto de referencia «bueno» de 1–2% de CER.
  2. Hebert, J. et al. — «OCR with Tesseract, Amazon Textract, and Google Document AI: a benchmarking experiment», Journal of Computational Social Science (2021). Revisado por pares; n=322 escaneos de libros en inglés + n=100 escaneos de artículos en árabe × 43 tipos de ruido = 18,568 documentos, 51,304 solicitudes. Proporciona la caída de precisión a nivel de palabras de limpio a ruidoso (~96%→82.5%→58.4%), la brecha entre inglés y árabe, y las comparaciones entre servidor y código abierto.
  3. Rice, S.V., Jenkins, F.R. y Nartker, T.A. — «The Fourth Annual Test of OCR Accuracy», UNLV ISRI (1995). Evaluación independiente anual de OCR comercial en una muestra DOE de 460 páginas + una muestra de revista de 200 páginas. Proporciona la progresión de precisión a nivel de caracteres de 1992–1995 (~94%→98%+) que ancla el techo de texto limpio.
  4. NIST IR 6101 — «Impact of image quality on machine print optical character recognition» (1998). Evaluación del Instituto Nacional de Estándares y Tecnología de EE. UU. de tres productos OCR comerciales en páginas del Registro Federal. Proporciona la restricción de que «una tasa de error del 1% requiere originales limpios de formato fijo».
  5. Comité Europeo de Protección de Datos — «AI Possible Risks & Mitigations: OCR» (2024). Guía técnica del organismo regulador de la UE. Proporciona el rango común del 95–99% para documentos impresos y el nivel de garantía de producción del 98–99%.
  6. Oficina de Publicaciones del Gobierno de EE. UU. — documento técnico «Optimizing OCR Accuracy on Older Documents». Pruebas oficiales de modos de escaneo y mejoras en documentos envejecidos/descoloridos frente al requisito de precisión del 99% del GPO. Proporciona el hallazgo de 99% en RGB frente a ~77% en bitonal y el resultado de reducción de 300→200 DPI.
  7. «Optical Character Recognition Accuracy on Degraded Documents», IJSAT (2026). Revisado por pares; EasyOCR en cuatro condiciones físicas a 300 DPI. Proporciona la escala de precisión de 94.7% normal / 86.9% arrugado / 80.9% sucio / 72.7% mojado.
  8. AIMultiple — «OCR Benchmark: Text Extraction / Capture Accuracy» (2026). Referencia de analistas neutral respecto a proveedores que utiliza similitud coseno de Sentence-BERT; más de 12 soluciones. Proporciona la banda de escritura a mano del 46–95% y los líderes por solución (GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%).
  9. AIMultiple — «Invoice OCR Benchmark: Extraction Accuracy of LLMs vs OCRs» (2026). Referencia neutral respecto a proveedores, más de 400 pares clave-valor de 20 facturas disponibles públicamente. Proporciona el hallazgo de la disminución de precisión entre calidad baja y calidad alta.
  10. Gao, L. et al. — «ICDAR 2019 Competition on Table Detection and Recognition (cTDaR)», ICDAR (2019). Competición académica, 11 equipos, conjuntos de datos modernos y de archivo con tablas dibujadas a mano y escritas a mano. Proporciona el punto de partida de detección de tablas en el track de archivo con wF1 0.49 (modelos posteriores 0.53).
  11. OpenCodePapers — Tabla de clasificación «Table Recognition on PubTabNet» (2024). Agregador técnico de referencias que rastrea los resultados TEDS publicados en el corpus PubTabNet. Proporciona el techo TEDS: MuTabNet 0.9687 (2024), TableMaster 0.9676, SLANet 0.963.
  12. «Tabular context-aware OCR and tabular data reconstruction for historical records» (2025). Revisado por pares; TrOCR-ctx en PubTabNet, SROIE, CORD y corpus históricos. Proporciona puntuaciones de estructura de tablas TEDS 0.909 (PubTabNet), 0.967 (SROIE) y 0.986 (CORD).
  13. «Enhancing handwritten text recognition accuracy with gated mechanisms» (2024). Revisado por pares; GatedLexiconNet en IAM, RIMES, READ-2016. Proporciona cifras de escritura a mano de última generación: WER 5.73 %/CER 2.27 % en IAM y CER 0.9 % en RIMES.
  14. «Benchmarking Large Language Models for Handwritten Text Recognition» (2025, Journal of Documentation). Revisado por pares; LLM propietarios y de código abierto frente a Transkribus en 7 corpus. Proporciona GPT-4o-mini con CER 1.71 %/WER 3.34 % en IAM, GPT-4o con CER 1.69 %/WER 3.66 % en RIMES y el marco de calidad de CER moderno <5 %.
  15. BusinessWareTech — «AWS Textract vs Google, Azure, and GPT-4o: Invoice Extraction Benchmark» (2025). Referencia independiente sobre facturas reales; grado C (conjunto de prueba único, método transparente). Proporciona precisión a nivel de campos del 78–98 % según el motor y detección de partidas individuales del 40–82 % según el motor.
  16. IntuitionLabs — «Pharma Document AI & OCR Accuracy: A Benchmark Report» (2025-04). Investigación industrial que resume una referencia de documentos mixtos; grado C. Proporciona el hallazgo de >99.2 % en todos los motores para texto mecanografiado sencillo y ~98 % general en Google Cloud Vision.
  17. ABBYY FineReader (afirmación del proveedor). Cifra autodeclarada de grado D, utilizada solo como límite superior de texto limpio y etiquetada como tal. «Hasta un 99.8 % de precisión en escaneos limpios»; también documenta la afirmación de mejora en fax/escaneos de baja resolución.
  18. LlamaIndex — Glosario «What is OCR Accuracy Rate?» (2026). Glosario de referencia con tabla de factores de impacto. Proporciona la escala de DPI (72 frente a 300 frente a 600 DPI) y la guía de mínimo de 300 DPI utilizada en la tabla de DPI.
  19. Universidad de Pittsburgh — Guía de biblioteca «Best Practices: OCR». Orientación universitaria sobre digitalización. Proporciona el estándar de 300 DPI y la recomendación de 400–600 DPI para fuentes de <10 pt.
  20. Cassidy, S. — «El impacto de la calidad del OCR en el uso de textos históricos digitalizados» (Universidad Macquarie). Estudio revisado por pares sobre la corrección post-OCR en periódicos históricos. Proporciona el efecto de corrección de precisión a nivel de palabras del 81,7 % al 97,6 %.

Limitaciones

  • Cobertura geográfica: Las fuentes se concentran en América del Norte, la UE, Australia y (para escritura a mano) corpus europeos. No se encontraron datos primarios confiables para América Latina o África; las comparaciones CJK/devanagari están ausentes de la literatura revisada por pares que localizamos.
  • Restricciones metodológicas: Los proveedores en la nube (Google, Azure, Amazon) no publican puntos de referencia de precisión transparentes en cuanto a metodología por tipo de documento; sus cifras de «99 %+» son marketing, no mediciones, y se excluyen aquí salvo que un estudio independiente las haya medido. Varias cifras clave dependen de puntos de datos de un solo estudio (precisión a nivel de campos de BusinessWareTech; degradación de IJSAT) y se etiquetan con su grado. El 99,8 % de ABBYY es una afirmación del proveedor utilizada solo como límite superior corroborado.
  • Vacíos temporales: Los datos de UNLV ISRI (1995) y NIST (1998) tienen más de 27 años, pero siguen siendo los únicos registros longitudinales públicos del techo de precisión en texto limpio; se etiquetan por año y se usan para contexto histórico. El piso de escaneos degradados de Holley (2009) es la cifra bruta publicada más reciente disponible para periódicos históricos; los motores modernos obtienen mejores resultados en dichos documentos (Hebert et al. 2021), por lo que la tabla muestra ambos.
  • Lo que no pudimos encontrar: (1) cualquier referencia pública confiable para el reconocimiento de casillas de verificación/reconocimiento de marcas en el OCR moderno con IA — la literatura es OMR heredado; (2) precisión de reconocimiento de firmas — los proveedores reportan detección, no precisión de reconocimiento; (3) un estudio controlado revisado por pares que aísle el DPI manteniendo constantes otros factores; (4) puntos de referencia estandarizados para OCR de capturas de pantalla; (5) documentos de diseño mixto (texto + tablas + imágenes en una página) más allá de las cifras de partidas individuales, que son el único proxy publicado. Estos vacíos se declaran en lugar de llenarse con cifras de proveedores no verificables.

Referencias relacionadas: Índices de error en la entrada manual de datos: 1-4 % por tipo, industria y función · ¿Qué es el reconocimiento óptico de caracteres (OCR)?

Lecturas relacionadas: Cómo mejorar la precisión del OCR: 10 consejos prácticos · ¿Qué tan precisa es realmente la extracción de documentos con IA? · ABBYY FineReader vs OCR moderno con IA

📮 contact email: [email protected]