Precisión de OCR en recibos: papel térmico, arrugado, descolorido,y referencias multimoneda (2026)

Última revisión: 2026-08-10 · Cobertura de datos: parcial · Fuentes: 14 estudios independientes

Qué cubre esta página: Referencias de precisión de OCR y extracción de información clave específicas de recibos, agregadas a partir de artículos revisados por pares y competiciones (ICDAR SROIE, CORD, KORIE, ReceiptSense, IJSAT), estudios de motores de proveedores del mundo real (AWS Textract en recibos capturados con teléfono) y referencias industriales transparentes en metodología (BusinessWareTech, Google Developer Forum, Doubleword). Desglosado por condición física del recibo, tipo de campo, nivel de motor e idioma — con la distinción de métrica de carácter/palabra/campo etiquetada en cada cifra. Todas las fuentes son de terceros y verificables de forma independiente.
Qué NO cubre esta página: Precisión general de OCR por tipo de documento (ver Precisión de OCR por tipo de documento), precisión de reconocimiento de escritura a mano (ver Precisión de reconocimiento de escritura a mano), ni afirmaciones específicas de proveedores más allá de las cifras de referencia citadas a continuación.

Todas las cifras a continuación se basan en estudios de terceros disponibles públicamente e informes industriales citados en la sección de metodología. Cuando las fuentes discrepan, se utilizan rangos conservadores (valores reportados más bajos–más altos). Los niveles de métrica (carácter / palabra / campo) se etiquetan por cifra y nunca se combinan en un solo número. Esta página es una referencia direccional, no un pronóstico preciso para ningún motor u organización en particular.

La historia del OCR en recibos comienza con un techo, no con una línea base. En la única referencia estandarizada de recibos — SROIE de ICDAR 2019 — el mejor sistema de extracción de información clave obtuvo 90.49% de F1 en recibos escaneados limpios, y más de la mitad de los 18 equipos participantes obtuvo menos del 80% (Huang et al., 2019). Los flujos de gastos reales luego descienden por una escalera de degradación física desde ese techo: el papel térmico descolorido reduce la precisión de palabra del código abierto a 55–73% (KORIE, 2026), y los recibos reales fotografiados con teléfono ofrecen 66.7–68.7% de precisión en el nombre del comercio (estudio RMIT Textract, 2025). Las afirmaciones de los proveedores de "99% de precisión en recibos" describen una condición que los recibos rara vez sobreviven.

90.49%
Mejor F1 a nivel de campo en la referencia de recibos SROIE de ICDAR 2019 (recibos escaneados limpios, métodos de 2019) — y el único equipo de 18 por encima del 90% (Huang et al., 2019)
55–73%
Precisión de palabra de motores de código abierto en recibos térmicos reales descoloridos y arrugados — PaddleOCR el mejor con 73.3%, Tesseract 64.7% (KORIE, 2026, 748 recibos térmicos coreanos)
66.7–68.7%
Coincidencia exacta para el nombre del comercio en 118 recibos reales, ~65% fotografiados con teléfono, ~50% doblados o arrugados (estudio RMIT Textract, 2025)

Desglose por condición del recibo: la escalera de degradación

La precisión del OCR de recibos depende menos del motor que del estado físico del papel y de cómo se capturó. El mismo recibo baja por la escalera — nuevo y plano, descolorido, arrugado, fotografiado con el teléfono — y cada paso cuesta de 5 a 30 puntos de precisión.

Los recibos se diferencian de las facturas en algo que importa más que el diseño: el propio soporte es inestable. La mayoría de los recibos se imprimen en papel térmico, un recubrimiento sensible al calor que se desvanece progresivamente con la exposición a la luz, el calor y el tiempo — un recibo legible el día de la compra puede tener importes de impuestos, fechas y líneas de detalle parcialmente ilegibles semanas después, y ningún motor de OCR puede recuperar texto que ha desaparecido físicamente del papel. Los organizadores de SROIE enumeran explícitamente "mala calidad del papel, mala calidad de tinta e impresión, escáner de baja resolución y distorsión de escaneo, facturas dobladas" entre los desafíos centrales de la referencia (Huang et al., 2019). El gráfico siguiente traza la banda de precisión publicada para cada peldaño de la escalera; la métrica utilizada por cada estudio está etiquetada en la fila, porque los números a nivel de carácter, palabra y campo no son intercambiables. Las cifras de SROIE son puntuaciones F1 — la media armónica de precisión y exhaustividad (Hmean), que requiere tanto que la mayoría de las palabras detectadas sean correctas como que se encuentre la mayoría de las palabras de referencia.

Precisión del OCR de recibos por condición: original plano limpio 94,7% de precisión de caracteres, original arrugado 86,9%, recibos térmicos descoloridos 64,7–73,3% de precisión de palabra en motores de código abierto, recibos reales capturados con teléfono 66,7–68,7% de precisión de campo del nombre del comercio.

Fuentes: IJSAT (2026) — EasyOCR a 300 DPI en documentos impresos, precisión de caracteres (plano 94,7%, arrugado 86,9%; el mismo estudio midió sucio 80,9% y mojado 72,7%); KORIE (2026) — precisión de palabra en 748 recibos térmicos coreanos degradados, 17.587 recortes, motores de código abierto (Tesseract 64,7%, EasyOCR 68,6%, PaddleOCR 73,3%); Estudio RMIT Textract (2025) — precisión de coincidencia exacta del campo nombre del comercio en 118 recibos reales (65% fotos de teléfono, 50% doblados/arrugados, 44% torcidos). Las cifras a nivel de carácter no son directamente comparables con las de nivel de palabra o campo — ver Por qué importan las métricas.

Condición del reciboRango de precisiónMétrica (por estudio)FuenteAñoMuestra
Recibos escaneados limpios (techo de referencia)>90% (7 de 24 equipos); mejor <99%F1 a nivel de palabra (Hmean)SROIE / Huang et al.20191,000 recibos escaneados, 24 equipos
Original plano y limpio (documento impreso)94.7%Precisión de caracteresIJSAT2026EasyOCR, 300 DPI
Original arrugado86.9% (−7.8 pts vs plano)Precisión de caracteresIJSAT2026EasyOCR, 300 DPI
Recibo térmico descolorido / con pliegues55–73% (PaddleOCR 73.3% mejor)Precisión de palabraKORIE2026748 recibos térmicos coreanos, 17,587 recortes, 4 motores
Captura con teléfono del mundo real (campo de comercio)66.7–68.7%Coincidencia exacta a nivel de campoEstudio RMIT Textract2025118 recibos australianos, ~65% fotos de teléfono

Fuentes listadas en la tabla anterior. Las filas de KORIE son la única referencia publicada que conserva los artefactos reales del papel térmico (desvanecimiento de tinta, bandas del cabezal de impresión, desgaste por fricción, pliegues) en lugar de degradación sintética; sus escaneos planos de 300 DPI significan que incluso el mejor caso "escaneado" incorpora el deterioro propio del papel. La fila del techo de SROIE es tecnología de la era 2019 — los motores LLM modernos en el mismo conjunto de datos alcanzan una precisión de campo general del 84.3–93.0% (Doubleword, 2026; ver tabla de niveles de motores).

Desglose por tipo de campo: el total es fácil, el comercio es difícil

El tipo de campo es el segundo factor más determinante, y es notablemente consistente en todos los estudios que lo reportan: los campos numéricos de resumen — especialmente el total — se extraen con mucha más fiabilidad que los campos de identidad de texto, como el nombre del comercio o del proveedor. El gráfico siguiente muestra cinco motores LLM modernos en el conjunto de prueba completo de 626 recibos SROIE, todos medidos con el mismo protocolo de coincidencia exacta a nivel de campo (Doubleword, 2026).

Precisión de coincidencia exacta a nivel de campo en el conjunto de prueba SROIE en 5 motores LLM: importe total 94,9–98,9 %, fecha 84,3–92,5 %, nombre del comercio 73,1–87,7 %.

Fuentes: Doubleword (2026) — 626 recibos de prueba SROIE, coincidencia exacta a nivel de campo, 5 motores (Qwen3-VL-235B/30B, GPT-5-mini/5.2/5-nano). Referencia de grado D de proveedor con metodología totalmente divulgada; corroborada en dirección por ReceiptSense (2024), que encontró que los campos numéricos #Units alcanzan 93,42 F1 mientras que los campos de texto Brand caen a 62,30 F1 en recibos árabe–inglés.

El patrón se mantiene en condiciones y lenguas radicalmente distintas. El estudio RMIT Textract — recibos reales capturados con teléfono, no un corpus limpio — encontró que el total se «detectaba de forma consistente» mientras que los nombres del comercio fallaban (texto cercano mal clasificado, o «Desconocido» cuando estaba ausente), coincidiendo exactamente con la clasificación de Doubleword (2025). La implicación práctica es que un titular de «precisión de OCR de recibos» promedia los campos más fáciles y los más difíciles en un solo número — y los flujos de gastos que solo necesitan el total están abordando una tarea fundamentalmente más fácil que los flujos que necesitan el comercio más las líneas de detalle.

Desglose por nivel de motor

La elección del motor importa menos que la condición y el tipo de campo, pero establece el techo que cada condición puede alcanzar. La tabla siguiente separa cuatro niveles con contextos de medición incompatibles: modelos de investigación ajustados en corpus de recibos (F1 a nivel de campo en las referencias CORD/SROIE), LLM de propósito general sin ajuste, API en la nube en documentos del mundo real y motores tradicionales/heredados.

Nivel de MotorPrecisiónMétrica / ContextoFuenteAño
IA documental ajustada (SOTA en CORD)91,3–97,5% F1 de campoDonut 91,3%, LayoutLMv2 96,0%, LayoutLMv3 97,5% — recibos indonesios limpios, entrenados en la tareaDonut; LayoutLMv2; encuesta MDPI2021–2022
IA documental ajustada (SROIE)97,8% F1 de campo (LayoutLMv2); ~0,95 de media entre artículosRecibos ingleses escaneados limpios; revisión sistemática con F1 media de 0,95LayoutLMv2; KIE SLR2021 / 2024
LLM general, sin ajuste (three-shot)80,9% CORD / 83,9% SROIE F1 de campoSolo aprendizaje en contexto, sin entrenamiento en la tarea — la referencia honesta de "cero configuración"LLM-TKIE2025
Motores LLM modernos en SROIE (2026)84,3–93,0% de precisión de campo generalQwen3-VL-235B 93,0%, GPT-5-mini 87,7%, GPT-5-nano 84,3% — conjunto de prueba completo de 626Doubleword2026
API en la nube en documentos reales diversosF1 0,75–0,85Google Invoice/Expense Parser, ~1.500 diseños diversos (reportado por usuarios)Google Developer Forum2024
API en la nube en recibos reales capturados con teléfono66,7–68,7% campo de nombre del comercioAWS Textract AnalyzeExpense en 118 recibos australianos realesestudio RMIT Textract2025
API en la nube — contexto de factura (referencia más fácil)78–98% de precisión de campoGPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — facturas, no recibos; se muestra como el límite superior más fácilBusinessWareTech2025
OCR tradicional / heredado en recibos~64% (mínimo reportado por la industria)Afirmación de nivel en un documento técnico de proveedor; se usa solo como referencia de grado DDATABASICS2024

Fuentes enumeradas en la tabla anterior. Las cifras de CORD y SROIE son F1 a nivel de campo en corpus de referencia limpios donde el modelo fue ajustado para la tarea — son el techo optimista, no la expectativa del mundo real. Las filas del mundo real (foro de Google, RMIT Textract) miden poblaciones de documentos diferentes y no son directamente comparables; ambas están etiquetadas con sus condiciones. La cifra de DATABASICS es una afirmación de nivel de un solo proveedor y aparece solo como referencia mínima.

Recibos Multimoneda y Multilingües

Los flujos de gastos globales añaden una tercera dimensión: cada conjunto de datos de referencia en esta página es monolingüe o bilingüe, y el único estudio multilingüe publicado con cifras por campo muestra la misma brecha entre total y texto, más una penalización adicional por escritura. En 20,000 recibos mixtos árabe–inglés, los LLM generales sin ajuste alcanzaron solo 32.07–42.98 F1 en zero-shot, subiendo a 60.60–80.26 F1 con tres ejemplos por campo — mientras que los campos numéricos #Units alcanzaron 93.42 F1 frente a 62.30 F1 para los campos de texto Brand (ReceiptSense, 2024). El estudio de RMIT observó el mismo efecto de escritura en producción: los recibos con nombres de productos no ingleses se "parsearon parcialmente", con datos de artículos eliminados silenciosamente (2025).

Idioma / CorpusPrecisiónMétricaFuenteAño
Inglés (SROIE, comercios de Malasia/Singapur)90.49% mejor F1 KIE (2019); 84.3–93.0% LLM general (2026)F1 a nivel de campo / coincidencia exactaSROIE; Doubleword2019 / 2026
Indonesio (CORD)91.3–97.5% F1 de campo (ajustado)F1 a nivel de campoDonut; LayoutLMv22021–2022
Coreano (KORIE, papel térmico degradado)55–73% precisión de palabra (código abierto)Precisión de palabraKORIE2026
Mixto árabe–inglés (ReceiptSense)F1 zero-shot 32–43%; 3-shot 61–80%; campos numéricos 93.4 vs campos de texto 62.3F1 a nivel de campoReceiptSense2024
Nombres de productos no ingleses (mundo real)Artículos parcial o totalmente eliminadosCualitativo (sin métrica de precisión)Estudio RMIT Textract2025

Fuentes enumeradas en la tabla anterior. Ningún estudio revisado por pares aísla el efecto de la moneda (símbolo, convención decimal, códigos de tres letras) manteniendo constante el script — la brecha de "multimoneda" en los flujos de trabajo reales está impulsada principalmente por la variación de script y diseño, y el valor numérico en sí se extrae bien una vez reconocido. Esto se señala como una brecha de datos en Limitaciones en lugar de rellenarse con cifras de proveedores.

Por qué importan las métricas: carácter, palabra y campo son tres respuestas distintas

Las bandas amplias de esta página no son ruido de medición — son tres preguntas diferentes que usan la misma palabra "precisión". Un recibo puede obtener un 98% de precisión de caracteres, ~85% de precisión de palabra y ~75% de precisión de campo al mismo tiempo, y las tres cifras son verdaderas.

La precisión de caracteres cuenta caracteres individuales: una tasa de error del 1% significa un carácter incorrecto por cada cien. La precisión de palabra falla una palabra completa ante cualquier carácter mal leído — se mide como tasa de error de palabra (WER), por eso el mejor motor de KORIE muestra solo un 15,84% de error de caracteres (CER) pero un 26,73% de WER, casi el doble de error a nivel de palabra (KORIE, 2026). La precisión de campo falla un campo completo — nombre del comercio, fecha, importe total — ante cualquier carácter o token incorrecto en él, por eso los organizadores de SROIE concluyeron que "el OCR de recibos tiene requisitos de precisión mucho más altos que las tareas generales de OCR" y por qué el F1 a nivel de campo es la métrica que realmente consumen los flujos de trabajo de gastos (Huang et al., 2019). Cada cifra de esta página está etiquetada con su nivel; mezclarlas en un solo número de "precisión de OCR de recibos" es exactamente cómo se fabrica la afirmación del 99%.

Cómo Usar Estos Datos

No necesitas un proyecto piloto para estimar lo que el OCR de recibos aportará a tu flujo de gastos. Un cálculo rápido de cuatro pasos con los rangos anteriores convierte el «los proveedores dicen 99%» en un número defendible de errores esperados — y normalmente revela que las condiciones de tus recibos, no el motor, determinan el resultado.

  1. Clasifica tu mezcla de recibos por condición. Ordena tu volumen mensual según la escalera anterior. Un flujo típico de gastos de ventas de campo se ve así: 40% capturas planas con teléfono en buen estado (~70% equivalente de palabra), 30% doblados/arrugados (~87% equivalente de carácter), 20% papel térmico descolorido (55–73% palabra), 10% multilingües o con anotaciones manuscritas (peor caso).
  2. Elige el campo que realmente necesitas. Si tu flujo solo necesita el importe total y la fecha, usa las bandas 94.9–98.9% y 84.3–92.5% (Doubleword 2026). Si necesita nombres del comercio — para verificaciones de políticas o análisis de proveedores — usa la banda 73.1–87.7% y espera un mínimo real cercano al 67% (estudio RMIT Textract 2025).
  3. Multiplica para obtener errores esperados por mes. Con un 80% de precisión de campo promedio en 6 campos por recibo y 1,000 recibos/mes, obtienes aproximadamente 1,200 campos incorrectos por mes (1,000 × 6 × 20%) antes de la revisión. Envía solo los campos de baja confianza a revisión humana en lugar de recibos completos — las puntuaciones de confianza por campo que exponen la mayoría de los motores convierten un flujo de re-tecleo completo en una pequeña cola de excepciones.
  4. Establece la expectativa antes de comprar. Compara ese número de errores con tu tasa actual de error de entrada manual (normalmente 1–4% de los campos) y con el costo de revisión de cada campo incorrecto. Cualquier cotización de proveedor por encima de las bandas de esta página para tu mezcla de condiciones específica debería incluir una referencia a nivel de campo con tus propios recibos.

Estas son fórmulas de estimación aproximada, no un sustituto para evaluar tus propios documentos. Cada rango publicado en esta página se midió en el corpus de otra persona — el único número de precisión que aplica a tu flujo de recibos es el que midas en él. El valor de esta página es establecer la expectativa antes de medir y saber qué métrica pedir.

Preguntas Frecuentes

¿Qué tan preciso es el OCR de recibos?

La respuesta honesta es una escalera, no un número: 90%+ a nivel de palabra en recibos escaneados limpios (mejor equipo SROIE 2019, Huang et al.), 55–73% de precisión de palabra en recibos térmicos reales descoloridos (KORIE 2026), y 66.7–68.7% de precisión de campo en nombres de comercios de recibos reales capturados con teléfono (estudio RMIT Textract 2025). Las afirmaciones de los proveedores de 97–99% describen capturas frescas, planas y bien iluminadas de campos fáciles — la parte superior de la escalera, no la del medio.

¿Puede el OCR leer recibos de papel térmico descoloridos?

Parcialmente — y la pérdida es física: el texto térmico descolorido desaparece permanentemente del papel, por lo que ningún motor puede recuperarlo. En recibos térmicos coreanos con desvanecimiento y arrugas reales, los motores de código abierto obtuvieron solo 55–73% de precisión de palabra (KORIE 2026) — el mejor (PaddleOCR, 73.3%) aún falla aproximadamente una de cada cuatro palabras. La única solución fiable es capturar los recibos antes de que se descoloren.

¿Arrugar un recibo afecta la precisión del OCR?

Sí — de forma medible. En una prueba controlada a 300 DPI, arrugar redujo la precisión de caracteres de 94.7% a 86.9%, unos 8 puntos porcentuales; la suciedad y el daño por agua la reducen aún más a 80.9% y 72.7% (IJSAT 2026). Los recibos del mundo real del estudio RMIT estaban ~50% doblados o arrugados, lo que coincide con su resultado de ~67% en el campo del comercio.

¿Qué campo de un recibo es el más difícil de extraer para el OCR?

El nombre del comercio (proveedor) es consistentemente el más difícil, con 73.1–87.7% de precisión de campo en cinco motores LLM, mientras que el importe total es el más fácil con 94.9–98.9% y la fecha se sitúa en medio con 84.3–92.5% (Doubleword 2026, 626 recibos SROIE). La misma clasificación aparece en recibos reales capturados con teléfono (RMIT 2025) y en recibos árabe–inglés (ReceiptSense 2024: campos numéricos 93.4 frente a campos de texto 62.3 F1).

¿Es el OCR de recibos menos preciso que el OCR de facturas?

Sí, en la práctica. Las facturas llegan como PDFs controlados o escaneos planos con diseños estandarizados; los recibos son papel térmico, fotografiados con teléfono, arrugados y sin diseño fijo. La diferencia se nota en motores en la nube comparables: en facturas, la precisión de campo alcanza 78–98% según el motor (BusinessWareTech 2025), mientras que la misma clase de motor en recibos reales capturados con teléfono obtuvo 66.7–68.7% para el campo del nombre del comercio (estudio RMIT Textract 2025).

¿Cuánto afecta la captura con teléfono a la precisión del OCR de recibos frente al escaneo?

No existe una comparación controlada revisada por pares con recibos idénticos — una brecha de datos real (ver Limitaciones). La evidencia disponible: los recibos del estudio RMIT eran ~65% fotos de teléfono con 44% torcidos y 12.7% borrosos, lo que arrojó una precisión de campo del nombre del comercio de 66.7–68.7%, mientras que las referencias SROIE y KORIE que puntúan más alto usaron escaneo plano. Direccionalmente, la captura con teléfono añade torceduras, sombras y desenfoque que empujan la precisión hacia abajo en la escalera, pero la penalización exacta no está medida en la literatura publicada.

¿Qué es SROIE y por qué importa?

SROIE (Scanned Receipt OCR and Information Extraction) es la competencia ICDAR 2019 que creó la primera referencia estandarizada de OCR de recibos: 1,000 recibos escaneados reales con tareas de localización de texto, OCR y campos clave (empresa, dirección, fecha, importe total) (Huang et al., 2019). Importa porque es la única referencia de recibos con resultados publicados entre equipos: incluso el mejor método de 2019 no alcanzó el 99% de precisión que exigen las aplicaciones de recibos. Los LLM modernos sobre el mismo conjunto de datos puntúan 84.3–93.0% en general (Doubleword 2026).

Metodología y Fuentes

Cómo se construyó esta página

Esta página agrega datos de 14 estudios independientes que abarcan de 2019 a 2026. Las fuentes se seleccionaron con base en tres criterios: (1) metodología documentada públicamente con tamaño de muestra declarado, (2) datos recopilados en los últimos 3 años cuando estuvieran disponibles, con fuentes más antiguas etiquetadas por año en el texto, y (3) relevancia para OCR y extracción específicos de recibos, no afirmaciones genéricas sobre documentos. Cuando varias fuentes reportan la misma dimensión, se usan rangos conservadores (valores mínimo–máximo reportados) — preferimos quedarnos cortos. Cuando las fuentes discrepan significativamente, la discrepancia se explica por nivel de métrica, condición del documento o corpus, en lugar de promediarse.

La distinción de métricas es la columna vertebral de esta página: las cifras a nivel de carácter, palabra y campo nunca se mezclan en un solo número, y cada gráfica y fila de tabla etiqueta su métrica. Las cifras auto-reportadas por proveedores (piso de nivel ~64% de DATABASICS) se etiquetan como grado D y se usan solo como referencias corroboradas. Los resultados del benchmark SROIE son tecnología de la era 2019 y se etiquetan por año; los resultados modernos de LLM sobre el mismo conjunto de datos (Doubleword 2026) se muestran junto a ellos para dar vigencia.

Lista de fuentes

  1. Huang, Z. et al. — "ICDAR2019 Competition on Scanned Receipt OCR and Information Extraction" (2019). Informe de competición revisado por pares; 1,000 recibos escaneados, 29/24/18 envíos válidos en tres tareas. Proporciona el mejor F1 de la Tarea 3 del 90.49%, los hallazgos de "solo uno de los 18 equipos superó el 90%"/"más de la mitad por debajo del 80%", y la declaración de la Tarea 2 de que "ni siquiera el mejor método alcanza el requisito del 99%".
  2. Park, S. et al. — "CORD: A Consolidated Receipt Dataset for Post-OCR Parsing" (2019). Artículo académico sobre el conjunto de datos; más de 11,000 recibos de Indonesia, 30 campos en 4 superclases; subconjunto público 800/100/100. Proporciona la definición del corpus y el protocolo de evaluación de F1 a nivel de campo utilizados en las filas de los modelos de investigación.
  3. Xu, Y. et al. — "LayoutLMv2" (ACL 2021). Artículo revisado por pares. Proporciona el F1 de campo CORD del 96.01% (parámetros de 426M) y el F1 de campo SROIE del 97.81%.
  4. Kim, G. et al. — "Donut: OCR-free Document Understanding Transformer" (ECCV 2022). Artículo revisado por pares y repositorio oficial del modelo. Proporciona el F1 de campo CORD del 91.3% (donut-base-finetuned-cord-v2).
  5. "KORIE: A Multi-Task Benchmark for Detection, OCR, and Information Extraction on Korean Retail Receipts" — MDPI Mathematics (2026). Revista revisada por pares; 748 recibos térmicos coreanos con artefactos reales de desvanecimiento, bandas y pliegues; 17,587 recortes de OCR. Proporciona las únicas cifras de palabra con degradación real: PaddleOCR WER 26.73% (73.3% de precisión de palabra), EasyOCR 31.43%, Tesseract 35.26%, BiGRU 44.47%.
  6. "Towards Analysing Invoices and Receipts with Amazon Textract" (RMIT, 2025). Caso de estudio académico (preprint); 118 recibos australianos, ~65% fotografiados con teléfono, ~50% doblados o arrugados, 44% torcidos. Proporciona la coincidencia exacta del nombre del comercio del 68.7% (diseños de texto) / 66.7% (diseños de logotipo), el hallazgo de que "los totales se detectan de forma consistente" y la observación sobre las limitaciones de idioma.
  7. Abdallah, A. et al. — "ReceiptSense: Beyond Traditional OCR" (2024). Preprint académico; 20,000 recibos árabe–inglés, 30,000 imágenes de OCR. Proporciona el F1 zero-shot del 32.07–42.98%, el F1 three-shot del 60.60–80.26% y la brecha entre campos numéricos y de texto (93.42 frente a 62.30).
  8. "Optical Character Recognition Accuracy on Degraded Documents" — IJSAT 17(2) (2026). Revisado por pares; EasyOCR a 300 DPI en cuatro condiciones físicas. Proporciona la escalera de precisión de caracteres plana 94.7% / arrugado 86.9% / sucio 80.9% / mojado 72.7% utilizada para las filas de daños físicos.
  9. "Deep Learning based Key Information Extraction from Business Documents: Systematic Literature Review" (2024). Revisión sistemática académica. Proporciona el F1 de campo promedio entre artículos publicados: CORD 0.94, SROIE 0.95.
  10. "Large language model driven transferable key information extraction mechanism for nonstandardized tables" (2025). Revisado por pares; LLM-TKIE, sin ajuste, 3 disparos. Proporciona CORD F1 80.9 / SROIE F1 83.9 como la referencia de LLM sin configuración.
  11. Doubleword — referencia SROIE de "Extracción de Datos Estructurados" (2026). Referencia del proveedor con metodología totalmente divulgada; conjunto de prueba SROIE completo de 626 recibos, coincidencia exacta a nivel de campo, 5 motores LLM. Proporciona un 84,3–93,0% general y los rangos por campo (importe total 94,9–98,9%, fecha 84,3–92,5%, nombre del comercio 73,1–87,7%).
  12. Google Developer Forum — "Puntuación F1 baja con Document AI en facturas y diseños de gastos diversos: buscando consejos de mejora" (2024). Medición de usuario anecdótica en el foro oficial de Google; ~1.500 documentos diversos. Proporciona el rango real de API en la nube con F1 0,75–0,85.
  13. BusinessWareTech — "AWS Textract vs Google, Azure y GPT-4o: referencia de extracción de facturas" (2025). Referencia independiente de terceros (grado C, método transparente, facturas reales). Proporciona la escalera de motores en contexto de facturas: GPT-4o+OCR 98%, Azure 93%, Google 82%, Textract 78% — el límite superior más fácil para recibos.
  14. DATABASICS — libro blanco "Captura de recibos y OCR para informes de gastos". Libro blanco del proveedor (grado D); usado solo como referencia mínima. Proporciona el marco de niveles de ~64% OCR tradicional / 85–95% mejorado con IA / 97–99% LLM, con la salvedad de que la precisión varía según la calidad de imagen, el diseño y la escritura a mano.

Limitaciones

  • Cobertura geográfica: Las fuentes se concentran en Asia-Pacífico y Medio Oriente (Malasia/Singapur, Indonesia, Corea, Egipto/árabe, Australia). No se encontró ningún benchmark académico específico de recibos para América del Norte, América Latina o África — la precisión de OCR de recibos en EE. UU./Reino Unido solo está documentada actualmente mediante afirmaciones de proveedores e informes anecdóticos de foros, no estudios revisados por pares.
  • Restricciones metodológicas: Los niveles de métrica (carácter / palabra / campo) difieren entre estudios y se etiquetan por fila en lugar de combinarse; varias cifras clave dependen de estudios individuales (degradación térmica de KORIE; campo de comercio de RMIT Textract; multilingüe de ReceiptSense), y las cifras de Doubleword y Google-Forum son de grado D/C (de proveedor o anecdóticas) y se usan con su grado divulgado. Las cifras de arrugado/descolorido de IJSAT provienen de documentos impresos, no de recibos — se espera que los recibos en papel térmico se degraden peor, pero eso es una inferencia, y se indica como tal.
  • Brechas temporales: Los datos de la competencia SROIE son de 2019; sus cifras absolutas reflejan métodos de la era 2019 y se etiquetan por año, con resultados modernos de LLM sobre el mismo conjunto de datos (Doubleword 2026) proporcionados junto a ellos. No se encontró ninguna competencia estandarizada más reciente de recibos con resultados publicados entre equipos después de SROIE 2019.
  • Lo que no pudimos encontrar: (1) ningún estudio controlado revisado por pares que compare captura con teléfono vs escaneo plano en recibos idénticos — la variable más citada en el marketing de proveedores; (2) un benchmark de extracción de líneas de detalle específico de recibos (las únicas cifras de líneas de detalle son en contexto de facturas, 40–82% por motor, BusinessWareTech 2025); (3) ningún estudio que aísle el efecto de la moneda (símbolo, convención decimal) manteniendo constante la escritura; (4) benchmarks para anotaciones manuscritas en recibos (propinas, notas, correcciones); (5) benchmarks públicos para recibos electrónicos/capturas de pantalla vs papel fotografiado. Estas brechas se declaran en lugar de llenarse con cifras de proveedores no verificables.

Referencias relacionadas: Precisión de OCR por tipo de documento · Precisión del reconocimiento de escritura a mano · Desglose de costos del procesamiento de documentos · Índices de error en la captura manual de datos

Lecturas relacionadas: El costo de la captura manual de datos de recibos escritos a mano · Cómo la precisión de la extracción de escritura a mano con IA sigue mejorando

📮 contact email: [email protected]