Precisión del reconocimiento de escritura a mano:
Por escritura, modelo y tipo de documento (2026)
Última revisión: 2026-08-10 · Cobertura de datos: Parcial · Fuentes: 15 estudios independientes
Qué NO cubre esta página: La precisión del OCR de texto impreso (consulte cómo se desempeña el OCR en distintos tipos de documentos), el mecanismo del OCR/HTR en sí (consulte ¿Qué es el OCR?), las tasas de error de entrada manual de datos (consulte tasas de error de tecleo manual) ni las afirmaciones de rendimiento específicas de un proveedor sobre cualquier producto individual más allá de las mediciones independientes citadas a continuación.
Todos los números a continuación se basan en estudios de terceros disponibles públicamente y referencias de la industria citadas en la sección de metodología. Cuando las fuentes discrepan, se utilizan rangos conservadores (valores más bajos–más altos reportados). Esta página es una referencia direccional para la investigación del reconocimiento de escritura a mano y la planificación de digitalización de documentos, no un pronóstico preciso para ningún motor o corpus individual.
Los mejores sistemas en 2026 leen escritura a mano moderna en inglés con una Tasa de error de caracteres (CER) del 1,22–1,71% en la referencia IAM, cerca de la calidad del texto impreso. Si se apunta la misma generación de modelos a manuscritos de los siglos XV–XIX, la tasa de error salta a 71–82% de CER (Crosilla et al., 2025). El reconocimiento de escritura a mano no es un único número de precisión: es una escalera de dificultad cuyos peldaños los establecen la escritura, el estilo de escritura, la arquitectura del modelo y el tipo de documento, aproximadamente en ese orden de impacto.
Por qué la escritura manual es más difícil que el texto impreso
El texto impreso es un conjunto cerrado de glifos estandarizados; la escritura manual es un conjunto abierto de glifos idiosincrásicos. Cada modelo en esta página se enfrenta a las mismas tres diferencias estructurales — y ellas explican por qué cada escritura, estilo y arquitectura se comporta de manera distinta.
Primero, la variación del escritor. No hay dos personas que formen la misma letra de la misma manera. Solo el corpus IAM contiene escritura de 657 escritores diferentes en 13 353 líneas de texto (Heyberger & Guyeux, 2024) — la misma letra aparece en cientos de representaciones materialmente distintas, razón por la cual la precisión sobre la mano de un escritor fijo no significa nada para el reconocimiento de propósito general. Segundo, los caracteres conectados. En la cursiva y en las escrituras totalmente conectadas, las letras se fusionan en ligaduras sin un límite de segmentación limpio — el motor de reconocimiento debe decidir dónde termina un carácter y comienza el siguiente, una decisión que el texto impreso nunca exige. El árabe es el caso extremo: su escritura está totalmente conectada dentro de las palabras, se escribe de derecha a izquierda y sus formas de letra cambian según su posición en la palabra, lo cual es una razón importante de que las referencias en árabe vayan por detrás de las latinas (estudio comparativo de IIETA, 2024). Tercero, las formas de letra dependientes del contexto y ambiguas — una "u" y una "n" descuidadas difieren solo en la dirección de un serif; solo la palabra circundante las desambigua. Por eso casi todos los sistemas modernos combinan un modelo visual con un modelo de lenguaje: en el corpus IAM, añadir un léxico o un modelo de lenguaje suele reducir los errores de palabra en un tercio o más (Reconocimiento de líneas de texto basado en detección, 2024).
La consecuencia práctica es una brecha de métricas persistente. La Tasa de error de caracteres (CER) cuenta los caracteres mal leídos por cada cien — un CER del 2 % significa aproximadamente dos caracteres incorrectos por cada cien. La Tasa de error de palabras (WER) cuenta las palabras completas transcritas incorrectamente; como un solo carácter mal leído hace fallar una palabra entera, la WER en escritura manual suele ser 2–4 veces mayor que la CER — en el corpus árabe KHATT, una CER del 8,9 % coexiste con una WER del 37,6 % (IIETA, 2024). Cualquier afirmación de precisión que cite un solo número sin indicar qué métrica y sobre qué corpus es, en el mejor de los casos, incompleta.
La escritura es el factor de precisión más determinante en el reconocimiento de escritura manual — más que la elección del modelo. El gráfico siguiente traza la banda de CER publicada (desde la mejor reportada hasta la típica entre modelos) para cada corpus de referencia principal. La historia es una escalera: la escritura manuscrita latina moderna está cerca de la calidad de imprenta; el árabe y el chino son un orden de magnitud más difíciles; los documentos históricos son el precipicio — a menos que el modelo haya sido entrenado para ellos.
Desglose por escritura e idioma
Fuentes: Crosilla et al. (2025) — referencia de LLM en IAM/RIMES/READ-2016/Bentham, 8 LLM multimodales; tabla de clasificación de IAM de CodeSOTA (2024–2026) — CER/WER por modelo con fuentes de los artículos; Heyberger y Guyeux (2024) — revisión del estado del arte a nivel de línea (VAN 1.91% CER en RIMES); Springer SNCS (2023) — resultados entre corpus de CVL; IIETA (2024) y MDPI (2024) — resultados de KHATT; competencia china de ICDAR 2013 y PMC11951872 (2024) — tasa de caracteres correctos en chino; arXiv 2409.17095 (2024) — WER entrenado para tareas específicas en READ-2016. La fila de chino usa la tasa de caracteres correctos (CR), no CER — consulte la nota debajo de la tabla.
| Escritura / Corpus | CER (mejor–típico) | WER (mejor–típico) | Fuente | Año | Muestra |
|---|---|---|---|---|---|
| Inglés — IAM (moderno) | 1.2–5.5% | 3.3–16.3% | CodeSOTA; Crosilla | 2024–2026 | 657 escritores, 13,353 líneas, 115,320 palabras |
| Francés — RIMES (moderno, cursiva) | 1.6–4.2% | 2.0–7.7% | Crosilla; Heyberger | 2024–2025 | Cartas comerciales francesas; 1,500 páginas, 12,723 líneas |
| Alemán — CVL (moderno, cursiva) | 3.3–10.9% | 10.4–26.2% | Springer SNCS | 2023 | Dentro del dominio ~3.3% CER; transferencia cruzada del modelo entrenado con IAM 10.89% CER / 26.24% WER |
| Árabe — KHATT (moderno) | 8.9–16.3% | 27.3–43.9% | IIETA; MDPI | 2024 | 1,000 escritores, 4,000 documentos; escritura totalmente conectada de derecha a izquierda |
| Chino — CASIA-HWDB / ICDAR-2013 (moderno) | 6.8–11.2% error de caracteres | — | ICDAR 2013; PMC11951872 | 2013–2024 | 1,020 escritores; reconocimiento de texto sin conexión 88.76% CR (2013) → 93.18% CR (2024) en el conjunto de prueba ICDAR-2013 |
| Alemán histórico — READ-2016 (motores entrenados para tareas específicas) | 3.6–6.2% | 4.1–5.5% | Heyberger; arXiv 2409.17095 | 2016–2024 | 30,000 páginas de actas municipales, siglos XV–XIX; VAN 3.59% CER, DAN 4.10% WER |
| Inglés/alemán histórico — Bentham & READ (LLM generales) | 71–82% | 95–100% | Crosilla | 2025 | 8 LLM multimodales, cero disparos/ajustados; transcripciones consideradas inutilizables |
Fuentes enumeradas en la tabla anterior. Dos notas sobre las métricas: (1) La fila de chino informa la tasa de caracteres correctos (CR), la métrica utilizada tanto por la competencia ICDAR 2013 como por los artículos posteriores: cuenta los caracteres reconocidos correctamente, pero no penaliza las inserciones como lo hace el CER, por lo que es comparable en dirección, pero no idéntica al CER. (2) Las filas históricas se dividen deliberadamente por tipo de modelo: los motores entrenados para tareas específicas y los LLM generales son animales diferentes en los mismos documentos; consulte Desglose por arquitectura del modelo.
El estilo de escritura — letra de imprenta, cursiva o mixta — es la dimensión que los profesionales perciben primero y la que cuenta con menos datos rigurosos. Ningún corpus de referencia importante etiqueta cada muestra como imprenta o cursiva, por lo que la brecha entre imprenta y cursiva se basa en referencias de la industria y en la composición de los propios corpus (RIMES y CVL son cursivos; IAM es mixto).
Desglose por estilo de escritura
| Estilo de escritura | Precisión observada | Evidencia | Fuente | Año |
|---|---|---|---|---|
| Letra de imprenta (manuscrito) | Línea base más fácil; los mejores sistemas se acercan a la calidad de impresión | AIMultiple: «los textos en estilo manuscrito son más fáciles de reconocer, ya que los caracteres se escriben por separado como letras de imprenta»; no existe una referencia académica controlada (brecha de datos) | AIMultiple | 2025 |
| Cursiva (letras unidas) | Referencia de 100 muestras: Gemini 3 Pro 100 %, GPT-5 y olmOCR-2-7B en el nivel superior | 10 escritores × 10 párrafos en cursiva, con conectividad natural e inclinación preservadas; 14 soluciones clasificadas por similitud semántica | Referencia de cursiva de AIMultiple | 2025 |
| Cursiva (a nivel de corpus, entrenada para tareas específicas) | CER 1,6–3,7 % | RIMES (cartas cursivas en francés) y CVL (cursiva en alemán/inglés) alcanzan un CER cercano al de IAM cuando los modelos se entrenan con ellos: la dificultad del estilo es entrenable, no intrínseca | Crosilla; Springer SNCS | 2023–2025 |
| Mixta (imprenta + cursiva en un mismo formulario) | Los mejores modelos por debajo del 95 % a nivel de documento | 10 formularios reales completados a mano que abarcan estilos de imprenta, cursiva y mixtos: GPT-5 Mini y Gemini 2.5 Flash Lite lideraron, pero «incluso los mejores modelos tienen dificultades para alcanzar una precisión empresarial superior al 95 %» | BusinessWareTech | 2025 |
Fuentes enumeradas en la tabla anterior. La brecha de datos se declara honestamente: ningún estudio revisado por pares aísla la precisión de la letra de imprenta frente a la cursiva en un corpus controlado y etiquetado por estilo — RIMES y CVL resultan ser cursivos e IAM mixto, pero ningún punto de referencia etiqueta cada muestra — por lo que la dimensión de estilo aquí se basa en el punto de referencia exclusivo de cursiva de AIMultiple y en la composición del corpus de los resultados revisados por pares, con la salvedad de que una comparación académica directa de estilos aún no existe (consulte Limitaciones).
La arquitectura del modelo ha impulsado una reducción de errores de aproximadamente 5× en el mismo corpus IAM en diez años. La progresión de la tabla de clasificación a continuación — redes recurrentes basadas en CTC, luego transformadores, luego LLM multimodales — es el registro publicado más claro de cómo mejoró la precisión de la escritura a mano, y también es el eje donde la «precisión» depende más de cómo se entrenó el modelo.
Desglose por arquitectura del modelo
| Arquitectura | Era | CER IAM (mejor) | WER IAM (mejor) | Modelos representativos | Fuente |
|---|---|---|---|---|---|
| CNN-LSTM + CTC | 2016–2022 | ~4,1–5,5% | 5,0–16,3% | DAN 5.01 WER; Start-Follow-Read 6.4; PyLaia 7.5–8.4; VAN 16.3 (WER de línea) / 4.45 CER | arXiv 2409.17095; CodeSOTA |
| Transformador (codificador-decodificador) | 2021–2024 | 2,38–2,89% | ~2,4–2,9% (informado) | TrOCR 2,89% CER (2021); DTrOCR 2,38% CER (WACV 2024); HTR-VT 14.9 WER sin preentrenamiento | CodeSOTA; IIETA |
| LLM multimodal (VLM) | 2025–2026 | 1,22–1,75% | 3,34–3,59% | GPT-5 ~1,22% CER (2026); GPT-4o-mini 1,71% CER / 3,34% WER (2025); Claude 3.5 Sonnet 1,75% CER | CodeSOTA; Crosilla |
| Motores OCR de propósito general (sin ajustar) | 2023–2026 | Corpus RIMES: 11–18% CER, 33–53% WER | DOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CER (supermodelos no ajustados en RIMES) | Heyberger | |
Fuentes enumeradas en la tabla anterior. Las filas comparan los mejores resultados publicados en el mismo corpus IAM, excepto la última fila, que informa la evaluación comercial sin ajustar del estudio en RIMES — incluida para mostrar que un motor comercial no ajustado en un corpus desconocido se comporta más como un modelo de investigación de 2016 que uno de 2026. Las comparaciones entre arquitecturas en divisiones idénticas son raras; la «división Aachen» de IAM y la división estándar producen números diferentes para el mismo modelo (p. ej., DRetHTR-base 6.55 WER en IAM-A, 2026).
El tipo de documento determina cuánta de la precisión teórica sobrevive al contacto con la realidad. Los corpus de referencia limpios están segmentados por líneas y escritos en papel liso; los documentos reales llegan como formularios con campos superpuestos, cartas con anotaciones al margen y manuscritos con abreviaturas y tinta desvanecida. La banda publicada para cada tipo de documento — no el techo de la referencia — es la cifra en torno a la cual planificar.
Desglose por tipo de documento
| Tipo de documento | Rango de precisión | Contexto | Fuente | Año |
|---|---|---|---|---|
| Formularios estándar rellenados a mano | Mejores modelos <95% a nivel de documento | 10 formularios reales, letra de imprenta/cursiva/mixta; GPT-5 Mini y Gemini 2.5 Flash Lite lideraron; la extracción de campos estructurados añade fallos a nivel de campo además de los errores de lectura | BusinessWareTech | 2025 |
| Cartas de formato libre (modernas) | CER 1,2–1,9% (SOTA), 11–18% (comercial sin ajustar) | IAM y RIMES son cartas; la brecha entre SOTA y los motores comerciales sin ajustar en el mismo corpus es de un orden de magnitud completo | Crosilla; Heyberger | 2024–2025 |
| Manuscritos históricos | CER 3,6–6,2% (motor entrenado para tareas específicas) / 71–82% (LLM general) | READ-2016, Bentham, escrituras glagolíticas; las abreviaturas, los vocabularios antiguos y la complejidad de la escritura llevan a los motores dedicados a un CER de 4,8–6,05% en las escrituras más difíciles | arXiv 2409.17095; PMC12202554; Crosilla | 2024–2025 |
| Notas del mundo real / documentos mixtos | 46–95% de similitud semántica entre soluciones | Referencia OCR de AIMultiple con 12 soluciones sobre escritura diversa; las soluciones basadas en LLM lideran con 93–95%, los motores OCR heredados se sitúan cerca del extremo inferior de la banda | AIMultiple | 2026 |
Fuentes enumeradas en la tabla anterior. Tenga en cuenta que las filas de «cartas de formato libre» usan CER mientras que «notas del mundo real» usa puntuación de similitud semántica — escalas de medición diferentes, mostradas por separado en lugar de combinadas. La banda de 46–95% es la única cifra que abarca documentos tanto modernos como históricos, limpios y desordenados, en una sola medición.
Cómo usar estos datos
No necesita ejecutar una referencia para convertir la «precisión del reconocimiento de escritura manual» de un número de proveedor en una expectativa defendible para sus propios documentos. Una verificación rápida de cuatro pasos con las tablas anteriores es suficiente, y normalmente revela que la cifra principal se midió en un tipo de documento distinto al que usted procesa.
- Clasifique su documento. Responda cuatro preguntas: escritura (¿latina? ¿árabe? ¿china?), estilo (¿letra de imprenta, cursiva o mixta?), tipo de documento (¿formulario, carta o histórico?) y si el corpus con el que se entrenó su sistema se le parece. Un formulario moderno en escritura latina es la banda fácil; un manuscrito histórico del siglo XIX en escritura no latina es la banda difícil: las tablas anteriores asignan un rango propio a cada banda.
- Elija la métrica honesta. Use la banda de CER si su proceso posterior puede tolerar algunos caracteres incorrectos por cada cien; use la banda de WER si las palabras completas importan (búsqueda, entidades nombradas, direcciones); use la precisión a nivel de documento para formularios donde un campo incorrecto invalida el registro. El mismo sistema puede mostrar legítimamente 1,7 % de CER, 3,3 % de WER y 80 % de precisión a nivel de campo.
- Aplique el descuento por especialización del modelo. Si su motor se entrenó o ajustó en su tipo de documento, el mejor CER publicado está a su alcance (1,2–1,9 % para cartas latinas modernas). Si es un sistema general sin ajustar, prevea el nivel de 11–18 % de CER en cursiva desconocida (Heyberger 2024) o el nivel de 71–82 % en documentos históricos (Crosilla 2025).
- Calcule el tamaño de la cola de revisión. Con un 3 % de WER en 200 páginas manuscritas de 50 palabras cada una, espere aproximadamente 300 palabras incorrectas por lote (200 × 50 × 3 %) antes de cualquier corrección. Con un 16 % de CER en documentos árabes, ese mismo lote tiene miles de caracteres sospechosos: la aritmética determina si la revisión humana, un umbral de confianza o una pasada de corrección posterior con léxico son económicamente necesarios.
Estas son fórmulas de estimación aproximada, no un sustituto de la evaluación comparativa de sus propios documentos. Cada rango publicado en esta página se midió en el corpus de otra persona: el único número de precisión que se aplica a su flujo de trabajo es el que usted mida en él. El valor de esta página es establecer la expectativa antes de medir.
Preguntas frecuentes
¿Qué tan precisa es la escritura a mano en 2026?
Depende casi por completo de la escritura y el tipo de documento. En la escritura inglesa moderna (referencia IAM), los mejores sistemas logran 1,22–1,71 % CER (CodeSOTA 2026; Crosilla 2025); la cursiva francesa es similar con 1,63–1,91 % (Crosilla 2025; Heyberger 2024); el árabe alcanza 8,9–16,3 % CER (IIETA 2024; MDPI 2024); y los modelos generales en manuscritos históricos obtienen 71–82 % CER (Crosilla 2025). En 12 soluciones comerciales con escritura a mano diversa del mundo real, las puntuaciones de similitud semántica oscilan entre 46–95 % (AIMultiple 2026).
¿Cuál es el estado del arte en la base de datos de escritura a mano IAM?
En 2026, GPT-5 reporta ~1,22 % CER en IAM, con GPT-4o-mini en 1,71 % CER / 3,34 % WER (Crosilla 2025) y el HTR-JAND especializado en 1,23 % CER con corrección de léxico (CodeSOTA 2024). En el mismo corpus, el estado del arte previo a los transformers se situaba cerca del 8 % de error de caracteres (Chowdhury & Vig, 2018) y los sistemas típicos CNN-LSTM alcanzaban 7,5–8,4 % WER (PyLaia — arXiv 2409.17095) — las tasas de error se han reducido varias veces, pero IAM sigue siendo la referencia para la escritura inglesa (657 escritores, 13 353 líneas).
¿Puede la IA leer escritura cursiva?
Sí — los principales modelos multimodales ahora manejan bien la cursiva. En la referencia de AIMultiple de 2025 con 100 muestras de cursiva deliberadamente desordenadas, Gemini 3 Pro obtuvo 100 % de similitud semántica, con GPT-5 y olmOCR-2-7B en el nivel superior (AIMultiple, 2025); los motores OCR heredados quedaron rezagados. La cursiva sigue siendo más difícil que la letra de imprenta — los caracteres están unidos, por lo que la segmentación es ambigua — pero la diferencia es cuestión de generación del modelo, no una barrera absoluta.
¿Cómo se compara la precisión de la escritura manuscrita con la del OCR de texto impreso?
El OCR de texto impreso alcanza una precisión de caracteres del 98–99%+ en documentos limpios (consulte Precisión del OCR según el tipo de documento), mientras que los mejores sistemas de escritura manuscrita se sitúan en 98.3–98.8% de precisión de caracteres (1.2–1.7% de CER) en inglés moderno — cercanos pero no iguales — y descienden al 83–91% en árabe y chino, y por debajo del 30% para modelos generales en documentos históricos (Crosilla 2025; IIETA 2024; PMC11951872 2024). La brecha entre texto impreso y manuscrito es de aproximadamente un orden de magnitud en cada escritura.
¿Por qué la precisión del reconocimiento de escritura manuscrita es tan baja en documentos históricos?
Los documentos históricos combinan escrituras antiguas, abreviaturas, tinta desvanecida y vocabularios fuera de los datos de entrenamiento modernos. El resultado es un marcado efecto de especialización del modelo: los motores entrenados para tareas específicas alcanzan un CER del 3.6–6.2% en el corpus READ-2016 y del 4.8–6.05% en las escrituras más difíciles como el glagolítico (Heyberger 2024; PMC12202554 2025), mientras que ocho LLM generales obtuvieron un CER del 71–82% — una transcripción inutilizable (Crosilla 2025). El reconocimiento es posible, pero solo con un modelo entrenado para la colección histórica específica.
¿Qué es un buen CER para el reconocimiento de escritura manuscrita?
La escala de trabajo del campo, adoptada en la literatura de HTR, define un CER inferior al 5% como "muy bueno", del 5–10% como "bueno", y por debajo del 2.5% como "excelente" (Muehlberger et al. 2019; Hodel et al. 2021, según lo aplicado por Crosilla et al. 2025). En la escritura manuscrita moderna en escritura latina, los mejores sistemas se encuentran en la banda "excelente"; en árabe, chino y documentos históricos, "muy bueno" (5–10%) es actualmente el objetivo de producción realista.
¿Cuál es la diferencia entre CER y WER en el reconocimiento de escritura manuscrita?
La tasa de error de caracteres cuenta los caracteres individuales mal leídos; la tasa de error de palabras (WER) cuenta palabras enteras incorrectas, por lo que un solo carácter mal leído hace fallar una palabra completa. En escritura manuscrita, la WER suele ser 2–4 veces mayor que la CER — en el árabe KHATT, un CER del 8.9% coexiste con una WER del 37.6% (IIETA 2024). Verifique siempre qué métrica utiliza una afirmación: "95% de precisión" significa cosas muy diferentes como CER, WER o precisión a nivel de documento.
Metodología y fuentes
Cómo se construyó esta página
Esta página agrega datos de 15 fuentes independientes que abarcan de 2013 a 2026, dominadas por artículos revisados por pares, informes de competencias académicas y una encuesta TPAMI revisada por pares. Las fuentes se seleccionaron según tres criterios: (1) metodología documentada públicamente con tamaño de corpus declarado, (2) resultados reportados en corpus de referencia nombrados (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) o conjuntos de prueba industriales transparentes, y (3) relevancia para el reconocimiento de escritura manual en lugar de afirmaciones de marketing. Cuando varias fuentes reportan la misma dimensión, se utilizan rangos conservadores (valores reportados más bajos–más altos); preferimos subestimar. Cuando las fuentes discrepan significativamente, la discrepancia se explica por nivel de métrica, división del corpus o régimen de entrenamiento, en lugar de promediarse.
La distinción de métricas es la columna vertebral de esta página: la tasa de error de caracteres (CER), la tasa de error de palabras (WER) y la tasa de caracteres correctos (CR) nunca se combinan en un solo número, y los modelos entrenados para tareas específicas frente a los modelos generales se reportan como filas separadas porque son regímenes de medición diferentes sobre los mismos documentos. Las cifras autoinformadas por los proveedores se excluyen por completo: ninguna afirmación de precisión de reconocimiento de escritura publicada por un proveedor superó la prueba de dos fuentes independientes, lo cual es en sí mismo un hallazgo (consulte Limitaciones).
Lista de fuentes
- Crosilla, G., Klic, L. & Colavizza, G. — "Benchmarking Large Language Models for Handwritten Text Recognition," Journal of Documentation 81(7) (2025). Revisado por pares; 8 LLM multimodales × 7 corpus (IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). Proporciona IAM 1,71 % CER/3,34 % WER (GPT-4o-mini), RIMES 1,69 % CER (GPT-4o), histórico 71–82 % CER y las bandas de calidad CER de <5 %/<2,5 %.
- Heyberger, L. & Guyeux, C. — "Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey," Journal of Imaging 10(1):18 (2024). Encuesta revisada por pares; más de 250 estudios. Proporciona especificaciones de corpus (IAM 657 escritores/13 353 líneas, READ 30 000 páginas), SOTA a nivel de línea (VAN 1,91 % CER en RIMES) y resultados comerciales sin ajustar (DOCSUMO 11 % CER, Transkribus 18 % CER en RIMES).
- Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — "Handwritten Text Recognition: A Survey," IEEE TPAMI 48(4) (2026). Encuesta revisada por pares. Proporciona SOTA a nivel de párrafo en IAM (VAN 4,7 %, OrigamiNet 4,6 %) y la reducción de errores del 58 % del paradigma CTC, además de la crítica de generalización fuera de distribución de las referencias actuales.
- CodeSOTA — "IAM Leaderboard" (2024–2026). Agregador técnico de referencias; cada entrada enlaza su artículo original. Proporciona CER/WER por modelo en IAM (GPT-5 ~1,22 % CER, HTR-JAND 1,23 % CER/3,78 % WER, GPT-4o-mini 3,34 % WER, DRetHTR-base 6,55 % WER en IAM-A, MetaWriter 10,32 % WER) y la nota de que el OCR de clase Tesseract no es adecuado para escritura a mano (~12,5 % CER).
- "General Detection-based Text Line Recognition" (2024, arXiv 2409.17095). Preimpresión con tablas comparativas entre modelos. Proporciona comparación de WER en IAM/READ/RIMES (DAN 5,01 WER en IAM, 4,10 en READ; DTrOCR 2,38 en IAM; RIMES mejor 1,99 con modelo de lenguaje) y las estadísticas de la división Aachen de IAM.
- "Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review," SN Computer Science (2023). Revisado por pares. Proporciona cifras de generalización entre corpus: un modelo entrenado en IAM obtiene 10,89 % CER / 26,24 % WER en CVL frente a 8,62 % CER en el propio IAM, y la descripción del corpus CVL (cursiva en alemán/inglés).
- "A Comparative Study of Four Handwritten Text Recognition Models," Ingénierie des Systèmes d'Information 29(6) (2024). Revisado por pares; DAN/VAN/FCN/GFCN en KHATT. Proporciona los mejores resultados de KHATT: DAN 8,9 % CER / 37,6 % WER; VAN 10,7 % CER / 43,9 % WER; y análisis de los desafíos de la escritura árabe (letras totalmente conectadas, formas dependientes de la posición).
- "Machine Learning Approach for Arabic Handwritten Recognition," Applied Sciences 14(19):9020 (2024). Revisado por pares; BiLSTM-CTC en KHATT. Proporciona resultados BiLSTM de KHATT (13,2–15,8 % CER / 27,31–31,6 % WER) y líneas base históricas (MDLSTM 31,3 % WER, 2015); documenta los 1000 escritores / 4000 documentos de KHATT.
- Yin, F. et al. — «ICDAR 2013 Chinese Handwriting Recognition Competition». Competición académica (IEEE). Proporciona el resultado de reconocimiento de texto fuera de línea del 88,76% de tasa de caracteres correctos en conjuntos de prueba derivados de CASIA-HWDB (1.020 escritores).
- «Attention-based Handwritten Chinese Recognition for Power Industry» (2024). Revisado por pares. Proporciona el resultado de ICDAR-2013 de 2024 (92,67% AR / 93,18% CR) y los resultados de HWDB (96,92% AR / 97,66% CR), mostrando la mejora de 2013→2024 en texto chino fuera de línea.
- «Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents» (2025). Revisado por pares; cinco motores × cuatro escrituras. Proporciona la CER por escritura: imprenta de tipo romano 1,74–2,78%, República Croata 3,54–6,32%, glagolítica 4,83–6,05%, taquigrafía 9,53–11,9%.
- «Enhancing Handwritten Text Recognition Accuracy with Gated Mechanisms» (2024). Revisado por pares; GatedLexiconNet. Proporciona un segundo punto de datos de IAM (WER 5,73% / CER 2,27%) y CER de RIMES 0,9% / WER 2,76% de un modelo dedicado.
- AIMultiple — «Handwriting Recognition Benchmark: LLMs vs OCRs» (2025-11). Referencia de analistas independiente del proveedor; 100 muestras cursivas de 10 escritores; canalización de similitud de coseno. Proporciona la referencia solo de cursiva: Gemini 3 Pro 100%, GPT-5 y olmOCR-2-7B en el nivel superior entre 14 soluciones.
- AIMultiple — «OCR Benchmark: Text Extraction / Capture Accuracy» (2026). Independiente del proveedor; más de 12 soluciones. Proporciona la banda de escritura a mano entre soluciones del 46–95% y los líderes por solución (GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%).
- BusinessWareTech — «Handwritten Form Recognition Benchmark» (2025). Referencia independiente, grado C (conjunto de prueba único, método transparente); 10 formularios reales rellenados a mano. Proporciona el hallazgo a nivel de documento de que incluso los mejores modelos se mantienen por debajo del 95% en formularios reales, y que GPT-5 Mini / Gemini 2.5 Flash Lite lideraron.
Limitaciones
- Cobertura geográfica y de escrituras: Los corpus en escritura latina dominan la literatura: inglés (IAM), francés (RIMES) y alemán (CVL, READ). El árabe (KHATT) y el chino (CASIA-HWDB) tienen una cobertura sólida pero más limitada; el japonés, el coreano y la escritura devanagari carecen por completo de referencias estandarizadas de CER/WER en las fuentes que localizamos. La competencia ICDAR 2023 Indic (ganador con 95.94% de tasa de reconocimiento de caracteres en diez escrituras) es el único dato agregado para escrituras índicas y no se incluye en las tablas anteriores porque utiliza una métrica y un conjunto de escrituras diferentes.
- Limitaciones metodológicas: Las divisiones de corpus difieren entre artículos (IAM estándar vs. división de Aachen) y producen números materialmente diferentes para el mismo modelo; los rangos anteriores abarcan ambos donde se publicaron. Ningún corpus importante etiqueta el estilo de escritura (letra de imprenta vs. cursiva) por muestra, por lo que la dimensión de estilo se basa en referencias de la industria en lugar de datos académicos controlados. Los proveedores de la nube (Google, Microsoft, Amazon) no publican mediciones de precisión específicas para escritura manuscrita; sus cifras de «99%+» se aplican a texto impreso, y no se pudieron encontrar dos mediciones independientes de proveedores sobre la precisión de escritura manuscrita, razón por la cual no aparecen cifras de proveedores de grado D en esta página.
- Brechas temporales: La cifra de la competencia china ICDAR 2013 (88.76% CR) tiene 13 años y se utiliza como ancla histórica junto con el resultado de 2024 en el mismo conjunto de prueba. El corpus IAM data de 1999, pero sigue siendo la referencia de facto para la escritura manuscrita en inglés. Los resultados de LLM de 2025–2026 (GPT-4o-mini, GPT-5) son los datos más recientes y se espera que cambien.
- Lo que no pudimos encontrar: (1) un estudio controlado revisado por pares que aísle la precisión de letra de imprenta vs. cursiva en el mismo corpus; (2) una referencia de precisión de escritura manuscrita publicada por proveedores y metodológicamente transparente para Google Document AI, Azure Document Intelligence o Amazon Textract; (3) una referencia estandarizada para documentos mixtos impresos + manuscritos (el caso más común en el mundo real, cubierto actualmente solo por el conjunto de 10 formularios de BusinessWareTech); (4) agregación de la varianza de precisión por escritor; (5) una referencia de la era LLM para escritura manuscrita en chino o árabe comparable al estudio Crosilla basado en IAM. Estas brechas se declaran en lugar de llenarse con afirmaciones no verificables.
Referencias relacionadas: referencias de precisión por tipo de documento · tasa de error de transcripción humana · Costo de procesamiento de documentos por registro · ¿Qué es el reconocimiento óptico de caracteres (OCR)?
Lectura relacionada: Extracción asequible de escritura manuscrita con IA para pequeñas empresas · Cómo ha mejorado la precisión de la extracción de escritura manuscrita con IA