Precisión del reconocimiento de escritura a mano:Por escritura, modelo y tipo de documento (2026)

Última revisión: 2026-08-10 · Cobertura de datos: Parcial · Fuentes: 15 estudios independientes

Qué cubre esta página: Referencias de precisión del reconocimiento de escritura a mano agregadas a partir de estudios revisados por pares y competiciones académicas (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR 2013 Chinese), una encuesta TPAMI revisada por pares, tablas de clasificación de competiciones y referencias de la industria con metodología transparente (AIMultiple). Desglosado por escritura/idioma, estilo de escritura, arquitectura del modelo y tipo de documento, con la distinción entre Tasa de error de caracteres (CER) y Tasa de error de palabras (WER) que la mayoría de las afirmaciones de "99% de precisión en escritura a mano" omiten. Todas las fuentes son de terceros y verificables de forma independiente.
Qué NO cubre esta página: La precisión del OCR de texto impreso (consulte Precisión del OCR por tipo de documento), el mecanismo del OCR/HTR en sí (consulte ¿Qué es el OCR?), las tasas de error de entrada manual de datos (consulte Tasas de error de entrada manual de datos) ni las afirmaciones de rendimiento específicas de un proveedor sobre un producto concreto más allá de las mediciones independientes citadas a continuación.

Todas las cifras siguientes se basan en estudios de terceros disponibles públicamente y referencias de la industria citadas en la sección de metodología. Cuando las fuentes discrepan, se utilizan rangos conservadores (valores mínimo–máximo reportados). Esta página es una referencia direccional para la investigación del reconocimiento de escritura a mano y la planificación de digitalización de documentos, no un pronóstico preciso para ningún motor o corpus en particular.

Los mejores sistemas en 2026 leen escritura a mano moderna en inglés con una Tasa de error de caracteres (CER) del 1,22–1,71% en la referencia IAM, cerca de la calidad del texto impreso. Si se apunta la misma generación de modelos a manuscritos de los siglos XV al XIX, la tasa de error salta al 71–82% de CER (Crosilla et al., 2025). El reconocimiento de escritura a mano no es un único número de precisión: es una escalera de dificultad cuyos peldaños los fijan la escritura, el estilo de escritura, la arquitectura del modelo y el tipo de documento, en ese orden aproximado de impacto.

1,2–1,7%
Mejor CER en escritura inglesa moderna (IAM, 657 escritores) — GPT-5 ~1,22% (CodeSOTA 2026), GPT-4o-mini 1,71% (Crosilla 2025), HTR-JAND 1,23% con corrección de léxico
8,9–16%
Mejor CER en escritura árabe (KHATT) — la escritura moderna más difícil con referencias publicadas; el WER oscila entre 27–44% (IIETA 2024; MDPI 2024)
71–82%
CER de LLM generales en manuscritos históricos (Bentham, READ-2016) — frente al 3,6–6,2% de los motores entrenados para tareas específicas en la misma clase de documento (Crosilla 2025; arXiv 2409.17095)

Por qué la escritura manual es más difícil que el texto impreso

El texto impreso es un conjunto cerrado de glifos estandarizados; la escritura manual es un conjunto abierto de glifos idiosincrásicos. Cada modelo de esta página se enfrenta a las mismas tres diferencias estructurales, y ellas explican por qué cada escritura, estilo y arquitectura que se presentan a continuación se comportan de manera distinta.

Primero, la variación del escritor. No hay dos personas que formen la misma letra de la misma manera. Solo el corpus IAM contiene escritura de 657 escritores distintos en 13 353 líneas de texto (Heyberger y Guyeux, 2024): la misma letra aparece en cientos de representaciones materialmente diferentes, por lo que la precisión sobre la letra de un escritor fijo no significa nada para el reconocimiento de propósito general. Segundo, los caracteres conectados. En la escritura cursiva y en las escrituras totalmente conectadas, las letras se fusionan en ligaduras sin un límite de segmentación claro: el motor de reconocimiento debe decidir dónde termina un carácter y comienza el siguiente, una decisión que el texto impreso nunca impone. El árabe es el caso extremo: su escritura está totalmente conectada dentro de las palabras, se escribe de derecha a izquierda y sus formas de letra cambian según su posición en la palabra, razón principal por la que las referencias en árabe van a la zaga de las latinas (estudio comparativo IIETA, 2024). Tercero, las formas de letra dependientes del contexto y ambiguas: una «u» y una «n» descuidadas solo se diferencian en la dirección de un serif; solo la palabra circundante las desambigua. Por eso casi todos los sistemas modernos combinan un modelo visual con un modelo de lenguaje: en el corpus IAM, añadir un léxico o un modelo de lenguaje suele reducir los errores de palabra en un tercio o más (Reconocimiento de líneas de texto basado en detección, 2024).

La consecuencia práctica es una brecha de métricas persistente. La Tasa de error de caracteres (CER) cuenta los caracteres mal leídos por cada cien: una CER del 2 % significa aproximadamente dos caracteres incorrectos por cada cien. La Tasa de error de palabras (WER) cuenta las palabras completas transcritas incorrectamente; como un solo carácter mal leído hace fallar una palabra entera, la WER en escritura manual suele ser de 2 a 4 veces mayor que la CER: en el corpus árabe KHATT, una CER del 8,9 % coexiste con una WER del 37,6 % (IIETA, 2024). Cualquier afirmación de precisión que cite un solo número sin indicar qué métrica y sobre qué corpus es, en el mejor de los casos, incompleta.

La escritura es el factor de precisión más determinante en el reconocimiento de escritura manual, más que la elección del modelo. El gráfico siguiente muestra la banda de CER publicada (desde la mejor reportada hasta la típica entre modelos) para cada corpus de referencia principal. La historia es una escalera: la escritura manual latina moderna tiene una calidad casi de imprenta; el árabe y el chino son un orden de magnitud más difíciles; los documentos históricos son el precipicio, a menos que el modelo haya sido entrenado para ellos.

Desglose por escritura e idioma

Tasa de error de caracteres por corpus de escritura a mano (del mejor publicado al típico entre modelos): IAM en inglés 1,2–5,5 %, RIMES en francés 1,6–4,2 %, CVL en alemán 3,3–10,9 %, ICDAR-2013 en chino 6,8–11,2 %, KHATT en árabe 8,9–16,3 %, documentos históricos con motores entrenados para tareas específicas 3,6–6,2 %, documentos históricos con LLM generales 71–82 %.

Fuentes: Crosilla et al. (2025) — referencia de LLM en IAM/RIMES/READ-2016/Bentham, 8 LLM multimodales; Clasificación IAM de CodeSOTA (2024–2026) — CER/WER por modelo con fuentes de los artículos; Heyberger y Guyeux (2024) — estudio del estado del arte (SOTA) a nivel de línea (VAN 1,91 % CER en RIMES); Springer SNCS (2023) — resultados entre corpus de CVL; IIETA (2024) y MDPI (2024) — resultados de KHATT; Competencia china ICDAR 2013 y PMC11951872 (2024) — tasa de caracteres correctos en chino; arXiv 2409.17095 (2024) — WER entrenado para tareas específicas en READ-2016. La fila de chino usa la tasa de caracteres correctos (CR), no CER — consulte la nota debajo de la tabla.

Escritura / CorpusCER (mejor–típico)WER (mejor–típico)FuenteAñoMuestra
Inglés — IAM (moderno)1,2–5,5%3,3–16,3%CodeSOTA; Crosilla2024–2026657 escritores, 13 353 líneas, 115 320 palabras
Francés — RIMES (moderno, cursiva)1,6–4,2%2,0–7,7%Crosilla; Heyberger2024–2025Cartas comerciales francesas; 1500 páginas, 12 723 líneas
Alemán — CVL (moderno, cursiva)3,3–10,9%10,4–26,2%Springer SNCS2023Dentro del dominio ~3,3% CER; transferencia cruzada del modelo entrenado con IAM 10,89% CER / 26,24% WER
Árabe — KHATT (moderno)8,9–16,3%27,3–43,9%IIETA; MDPI20241000 escritores, 4000 documentos; escritura totalmente conectada de derecha a izquierda
Chino — CASIA-HWDB / ICDAR-2013 (moderno)6,8–11,2% error de caracteresICDAR 2013; PMC119518722013–20241020 escritores; reconocimiento de texto fuera de línea 88,76% CR (2013) → 93,18% CR (2024) en el conjunto de prueba ICDAR-2013
Alemán histórico — READ-2016 (motores entrenados para tareas específicas)3,6–6,2%4,1–5,5%Heyberger; arXiv 2409.170952016–202430 000 páginas de actas municipales, siglos XV–XIX; VAN 3,59% CER, DAN 4,10% WER
Inglés/alemán históricos — Bentham y READ (LLM generales)71–82%95–100%Crosilla20258 LLM multimodales, cero disparos/ajustados; transcripciones consideradas inutilizables

Fuentes enumeradas en la tabla anterior. Dos notas sobre las métricas: (1) La fila de chino informa la tasa de caracteres correctos (CR), la métrica utilizada tanto por la competencia ICDAR 2013 como por los artículos posteriores: cuenta los caracteres reconocidos correctamente, pero no penaliza las inserciones como lo hace el CER, por lo que es direccionalmente comparable pero no idéntica al CER. (2) Las filas históricas se dividen deliberadamente por tipo de modelo: los motores entrenados para tareas específicas y los LLM generales son animales diferentes en los mismos documentos; consulte Desglose por arquitectura del modelo.

El estilo de escritura — letra de imprenta, cursiva o mixta — es la dimensión que los profesionales perciben primero y la que cuenta con menos datos rigurosos. Ningún corpus de referencia importante etiqueta cada muestra como de imprenta o cursiva, por lo que la brecha entre imprenta y cursiva se basa en referencias de la industria y en la composición de los propios corpus (RIMES y CVL son cursivos; IAM es mixto).

Desglose por estilo de escritura

Estilo de escrituraPrecisión observadaEvidenciaFuenteAño
Letra de imprenta (manuscrito)Referencia más fácil; los mejores sistemas alcanzan una calidad casi de imprentaAIMultiple: «los textos en estilo manuscrito son más fáciles de reconocer porque los caracteres se escriben por separado como letras de imprenta»; no existe una referencia académica controlada (falta de datos)AIMultiple2025
Cursiva (letras unidas)Referencia de 100 muestras: Gemini 3 Pro 100 %, GPT-5 y olmOCR-2-7B en el nivel superior10 escritores × 10 párrafos en cursiva, con conectividad e inclinación naturales preservadas; 14 soluciones clasificadas por similitud semánticaReferencia de cursiva de AIMultiple2025
Cursiva (a nivel de corpus, entrenada para tareas específicas)CER 1,6–3,7 %RIMES (cartas cursivas en francés) y CVL (cursiva en alemán/inglés) alcanzan un CER cercano al de IAM cuando los modelos se entrenan con ellos: la dificultad del estilo es entrenable, no intrínsecaCrosilla; Springer SNCS2023–2025
Mixta (imprenta + cursiva en un mismo formulario)Los mejores modelos por debajo del 95 % a nivel de documento10 formularios reales rellenados a mano que abarcan estilos de imprenta, cursiva y mixtos: GPT-5 Mini y Gemini 2.5 Flash Lite lideraron, pero «incluso los mejores modelos tienen dificultades para superar el 95 % de precisión a nivel empresarial»BusinessWareTech2025

Fuentes enumeradas en la tabla anterior. La brecha de datos se declara con honestidad: ningún estudio revisado por pares aísla la precisión de la letra de imprenta frente a la cursiva en un corpus controlado y etiquetado por estilo; RIMES y CVL resultan ser cursivos e IAM mixto, pero ningún punto de referencia etiqueta cada muestra, por lo que la dimensión de estilo aquí se apoya en el punto de referencia exclusivamente cursivo de AIMultiple y en la composición del corpus de los resultados revisados por pares, con la salvedad de que aún no existe una comparación académica directa de estilos (consulte Limitaciones).

La arquitectura del modelo ha impulsado una reducción de errores de aproximadamente 5 veces en el mismo corpus IAM en diez años. La progresión de la clasificación a continuación — redes recurrentes basadas en CTC, luego transformers y luego LLM multimodales — es el registro publicado más claro de cómo mejoró la precisión de la escritura manuscrita, y también es el eje donde la "precisión" depende más de cómo se entrenó el modelo.

Desglose por arquitectura del modelo

ArquitecturaÉpocaCER IAM (mejor)WER IAM (mejor)Modelos representativosFuente
CNN-LSTM + CTC2016–2022~4,1–5,5 %5,0–16,3 %DAN 5,01 WER; Start-Follow-Read 6,4; PyLaia 7,5–8,4; VAN 16,3 (WER de línea) / 4,45 CERarXiv 2409.17095; CodeSOTA
Transformer (codificador-decodificador)2021–20242,38–2,89 %~2,4–2,9 % (reportado)TrOCR 2,89 % CER (2021); DTrOCR 2,38 % CER (WACV 2024); HTR-VT 14,9 WER sin preentrenamientoCodeSOTA; IIETA
LLM multimodal (VLM)2025–20261,22–1,75 %3,34–3,59 %GPT-5 ~1,22 % CER (2026); GPT-4o-mini 1,71 % CER / 3,34 % WER (2025); Claude 3.5 Sonnet 1,75 % CERCodeSOTA; Crosilla
Motores OCR de uso general (sin ajustar)2023–2026Corpus RIMES: 11–18 % CER, 33–53 % WERDOCSUMO 11 % CER; Transkribus 18 % CER; Ocelus 15 % CER (supermodelos no ajustados en RIMES)Heyberger

Fuentes enumeradas en la tabla anterior. Las filas comparan los mejores resultados publicados en el mismo corpus IAM, excepto la última fila, que informa la evaluación comercial sin ajustar del estudio en RIMES; se incluye para mostrar que un motor comercial no ajustado en un corpus desconocido se comporta más como un modelo de investigación de 2016 que como uno de 2026. Las comparaciones entre arquitecturas en divisiones idénticas son poco frecuentes; la división "Aachen" de IAM y la división estándar producen números diferentes para el mismo modelo (p. ej., DRetHTR-base 6,55 WER en IAM-A, 2026).

El tipo de documento determina cuánta de la precisión teórica sobrevive al contacto con la realidad. Los corpus de referencia limpios están segmentados por líneas y escritos en papel liso; los documentos reales llegan como formularios con campos superpuestos, cartas con anotaciones al margen y manuscritos con abreviaturas y tinta desvanecida. La banda publicada para cada tipo de documento — no el techo de la referencia — es la cifra en torno a la cual planificar.

Desglose por tipo de documento

Tipo de documentoRango de precisiónContextoFuenteAño
Formularios estándar rellenados a manoMejores modelos <95% a nivel de documento10 formularios reales, letra de imprenta/cursiva/mixta; GPT-5 Mini y Gemini 2.5 Flash Lite lideraron; la extracción de campos estructurados añade fallos a nivel de campo además de los errores de lecturaBusinessWareTech2025
Cartas de formato libre (modernas)CER 1,2–1,9% (SOTA), 11–18% (comercial sin ajustar)IAM y RIMES son cartas; la brecha entre SOTA y los motores comerciales sin ajustar en el mismo corpus es de un orden de magnitud completoCrosilla; Heyberger2024–2025
Manuscritos históricosCER 3,6–6,2% (motor entrenado para tareas específicas) / 71–82% (LLM general)READ-2016, Bentham, escritura glagolítica; las abreviaturas, los vocabularios antiguos y la complejidad de la escritura llevan a los motores dedicados a un CER de 4,8–6,05% en las escrituras más difícilesarXiv 2409.17095; PMC12202554; Crosilla2024–2025
Notas del mundo real / documentos mixtos46–95% de similitud semántica entre solucionesReferencia OCR de AIMultiple con 12 soluciones sobre escritura diversa; las soluciones basadas en LLM lideran con 93–95%, los motores OCR heredados se sitúan cerca del fondo de la bandaAIMultiple2026

Fuentes enumeradas en la tabla anterior. Tenga en cuenta que las filas de «cartas de formato libre» usan CER mientras que «notas del mundo real» usa puntuación de similitud semántica — escalas de medición diferentes, mostradas por separado en lugar de combinadas. La banda de 46–95% es la única cifra que abarca tanto documentos modernos como históricos, limpios y desordenados en una sola medición.

Cómo usar estos datos

No necesita ejecutar una referencia para convertir la «precisión del reconocimiento de escritura a mano» de un número de proveedor en una expectativa defendible para sus propios documentos. Basta con una comprobación rápida de cuatro pasos con las tablas anteriores, y normalmente revela que la cifra principal se midió en un tipo de documento distinto del que usted procesa.

  1. Clasifique su documento. Responda cuatro preguntas: escritura (¿latina? ¿árabe? ¿china?), estilo (¿letra de imprenta, cursiva o mixta?), tipo de documento (¿formulario, carta o histórico?) y si el corpus con el que se entrenó su sistema se le parece. Un formulario moderno en escritura latina es la banda fácil; un manuscrito del siglo XIX en escritura no latina es la banda difícil: las tablas anteriores asignan un rango propio a cada banda.
  2. Elija la métrica honesta. Use la banda de CER si su proceso posterior tolera unos pocos caracteres incorrectos por cada cien; use la banda de WER si las palabras completas importan (búsqueda, entidades nombradas, direcciones); use la precisión a nivel de documento para formularios donde un campo incorrecto invalida el registro. El mismo sistema puede mostrar legítimamente 1,7 % de CER, 3,3 % de WER y 80 % de precisión a nivel de campo.
  3. Aplique el descuento por especialización del modelo. Si su motor se entrenó o ajustó en su tipo de documento, el mejor CER publicado está a su alcance (1,2–1,9 % para cartas latinas modernas). Si es un sistema general sin ajustar, presupueste el nivel de CER del 11–18 % en cursiva desconocida (Heyberger 2024), o el nivel del 71–82 % en documentos históricos (Crosilla 2025).
  4. Dimensione la cola de revisión. Con un 3 % de WER en 200 páginas manuscritas de 50 palabras cada una, espere aproximadamente 300 palabras incorrectas por lote (200 × 50 × 3 %) antes de cualquier corrección. Con un 16 % de CER en documentos árabes, ese mismo lote tiene miles de caracteres sospechosos: la aritmética determina si la revisión humana, un umbral de confianza o una pasada de corrección con léxico son económicamente necesarios.

Estas son fórmulas de estimación aproximada, no un sustituto de la evaluación comparativa de sus propios documentos. Cada rango publicado en esta página se midió en el corpus de otra persona: el único número de precisión que se aplica a su flujo de trabajo es el que usted mida en él. El valor de esta página es fijar la expectativa antes de medir.

Preguntas Frecuentes

¿Qué tan precisa es la escritura a mano en 2026?

Depende casi por completo de la escritura y el tipo de documento. En escritura a mano moderna en inglés (referencia IAM), los mejores sistemas logran 1,22–1,71% CER (CodeSOTA 2026; Crosilla 2025); la cursiva francesa es similar con 1,63–1,91% (Crosilla 2025; Heyberger 2024); el árabe alcanza 8,9–16,3% CER (IIETA 2024; MDPI 2024); y los modelos generales en manuscritos históricos obtienen 71–82% CER (Crosilla 2025). En 12 soluciones comerciales con escritura a mano diversa del mundo real, las puntuaciones de similitud semántica oscilan entre 46–95% (AIMultiple 2026).

¿Cuál es el estado del arte en la base de datos de escritura a mano IAM?

Hasta 2026, GPT-5 reporta ~1,22% CER en IAM, con GPT-4o-mini en 1,71% CER / 3,34% WER (Crosilla 2025) y el especializado HTR-JAND en 1,23% CER con corrección de léxico (CodeSOTA 2024). En el mismo corpus, el estado del arte previo al transformer se situaba cerca del 8% de error de caracteres (Chowdhury & Vig, 2018) y los sistemas típicos CNN-LSTM alcanzaban 7,5–8,4% WER (PyLaia — arXiv 2409.17095) — las tasas de error han caído varias veces, pero IAM sigue siendo la referencia estándar para escritura a mano en inglés (657 escritores, 13 353 líneas).

¿Puede la IA leer escritura cursiva?

Sí — los principales modelos multimodales ahora manejan bien la cursiva. En la referencia de 2025 de AIMultiple con 100 muestras de cursiva deliberadamente desordenadas, Gemini 3 Pro obtuvo 100% de similitud semántica, con GPT-5 y olmOCR-2-7B en el nivel superior (AIMultiple, 2025); los motores OCR heredados quedaron rezagados. La cursiva sigue siendo más difícil que la letra de imprenta — los caracteres están unidos, por lo que la segmentación es ambigua — pero la brecha es cuestión de generación del modelo, no una barrera absoluta.

¿Cómo se compara la precisión de la escritura manuscrita con la OCR de texto impreso?

La OCR de texto impreso alcanza 98–99%+ de precisión de caracteres en documentos limpios (consulte Precisión de OCR por tipo de documento), mientras que los mejores sistemas de escritura manuscrita se sitúan en 98.3–98.8% de precisión de caracteres (1.2–1.7% CER) en inglés moderno — cerca pero no igual — y caen al 83–91% en árabe y chino, y por debajo del 30% para modelos generales en documentos históricos (Crosilla 2025; IIETA 2024; PMC11951872 2024). La brecha entre texto impreso y manuscrito es de aproximadamente un orden de magnitud en cada escritura.

¿Por qué la precisión del reconocimiento de escritura manuscrita es tan baja en documentos históricos?

Los documentos históricos combinan escrituras antiguas, abreviaturas, tinta desvanecida y vocabularios fuera de los datos de entrenamiento modernos. El resultado es un marcado efecto de especialización del modelo: los motores entrenados para tareas específicas alcanzan 3.6–6.2% CER en el corpus READ-2016 y 4.8–6.05% en las escrituras más difíciles como el glagolítico (Heyberger 2024; PMC12202554 2025), mientras que ocho LLM generales obtuvieron 71–82% CER — transcripción inutilizable (Crosilla 2025). El reconocimiento es posible, pero solo con un modelo entrenado para la colección histórica específica.

¿Qué es un buen CER para el reconocimiento de escritura manuscrita?

La escala de trabajo del campo, adoptada en la literatura HTR, define un CER inferior al 5% como "muy bueno", 5–10% como "bueno", y por debajo del 2.5% como "excelente" (Muehlberger et al. 2019; Hodel et al. 2021, según lo aplicado por Crosilla et al. 2025). En escritura manuscrita moderna con escritura latina, los mejores sistemas se encuentran en la banda "excelente"; en árabe, chino y documentos históricos, "muy bueno" (5–10%) es actualmente el objetivo de producción realista.

¿Cuál es la diferencia entre CER y WER en el reconocimiento de escritura manuscrita?

La tasa de error de caracteres cuenta los caracteres individuales mal leídos; la tasa de error de palabras (WER) cuenta palabras enteras como incorrectas, por lo que un solo carácter mal leído hace fallar una palabra completa. En escritura manuscrita, la WER suele ser 2–4× más alta que la CER — en árabe KHATT, un CER del 8.9% coexiste con una WER del 37.6% (IIETA 2024). Verifique siempre qué métrica utiliza una afirmación: "95% de precisión" significa cosas muy diferentes como CER, WER o precisión a nivel de documento.

Metodología y fuentes

Cómo se construyó esta página

Esta página agrega datos de 15 fuentes independientes que abarcan de 2013 a 2026, dominadas por artículos revisados por pares, informes de competiciones académicas y una encuesta TPAMI revisada por pares. Las fuentes se seleccionaron según tres criterios: (1) metodología documentada públicamente con el tamaño del corpus indicado, (2) resultados reportados en corpus de referencia nombrados (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) o conjuntos de prueba industriales transparentes, y (3) relevancia para el reconocimiento de escritura manual en lugar de afirmaciones de marketing. Cuando varias fuentes reportan la misma dimensión, se utilizan rangos conservadores (valores más bajos y más altos reportados); preferimos no sobreestimar. Cuando las fuentes discrepan significativamente, la discrepancia se explica por el nivel de métrica, la división del corpus o el régimen de entrenamiento, en lugar de promediarse.

La distinción de métricas es el eje de esta página: la CER, la WER y la tasa de caracteres correctos (CR) nunca se combinan en un solo número, y los modelos entrenados para tareas específicas frente a los modelos generales se reportan como filas separadas porque son regímenes de medición distintos sobre los mismos documentos. Las cifras autoinformadas por los proveedores se excluyen por completo; ninguna afirmación de precisión de escritura manual publicada por un proveedor superó la prueba de dos fuentes independientes, lo cual es en sí mismo un hallazgo (consulte Limitaciones).

Lista de fuentes

  1. Crosilla, G., Klic, L. & Colavizza, G. — «Benchmarking Large Language Models for Handwritten Text Recognition», Journal of Documentation 81(7) (2025). Revisado por pares; 8 LLM multimodales × 7 corpus (IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). Proporciona IAM 1,71 % CER/3,34 % WER (GPT-4o-mini), RIMES 1,69 % CER (GPT-4o), histórico 71–82 % CER y las bandas de calidad de <5 %/<2,5 % CER.
  2. Heyberger, L. & Guyeux, C. — «Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey», Journal of Imaging 10(1):18 (2024). Encuesta revisada por pares; más de 250 estudios. Proporciona especificaciones del corpus (IAM 657 escritores/13 353 líneas, READ 30 000 páginas), SOTA a nivel de línea (VAN 1,91 % CER en RIMES) y resultados comerciales sin ajustar (DOCSUMO 11 % CER, Transkribus 18 % CER en RIMES).
  3. Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — «Handwritten Text Recognition: A Survey», IEEE TPAMI 48(4) (2026). Encuesta revisada por pares. Proporciona SOTA a nivel de párrafo en IAM (VAN 4,7 %, OrigamiNet 4,6 %) y la reducción de error del 58 % del paradigma CTC, además de la crítica de generalización fuera de distribución de las referencias actuales.
  4. CodeSOTA — «IAM Leaderboard» (2024–2026). Agregador técnico de referencias; cada entrada enlaza su artículo original. Proporciona CER/WER por modelo en IAM (GPT-5 ~1,22 % CER, HTR-JAND 1,23 % CER/3,78 % WER, GPT-4o-mini 3,34 % WER, DRetHTR-base 6,55 % WER en IAM-A, MetaWriter 10,32 % WER) y la nota de que el OCR de clase Tesseract no es adecuado para escritura a mano (~12,5 % CER).
  5. «General Detection-based Text Line Recognition» (2024, arXiv 2409.17095). Preimpresión con tablas comparativas entre modelos. Proporciona comparación de WER en IAM/READ/RIMES (DAN 5,01 WER en IAM, 4,10 en READ; DTrOCR 2,38 en IAM; RIMES mejor 1,99 con modelo de lenguaje) y las estadísticas de la división Aachen de IAM.
  6. «Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review», SN Computer Science (2023). Revisado por pares. Proporciona cifras de generalización entre corpus: un modelo entrenado en IAM obtiene 10,89 % CER / 26,24 % WER en CVL frente a 8,62 % CER en el propio IAM, y la descripción del corpus CVL (cursiva en alemán/inglés).
  7. «A Comparative Study of Four Handwritten Text Recognition Models», Ingénierie des Systèmes d'Information 29(6) (2024). Revisado por pares; DAN/VAN/FCN/GFCN en KHATT. Proporciona los mejores resultados en KHATT: DAN 8,9 % CER / 37,6 % WER; VAN 10,7 % CER / 43,9 % WER; y análisis de los desafíos de la escritura árabe (letras totalmente conectadas, formas dependientes de la posición).
  8. «Machine Learning Approach for Arabic Handwritten Recognition», Applied Sciences 14(19):9020 (2024). Revisado por pares; BiLSTM-CTC en KHATT. Proporciona resultados BiLSTM en KHATT (13,2–15,8 % CER / 27,31–31,6 % WER) y líneas base históricas (MDLSTM 31,3 % WER, 2015); documenta los 1000 escritores / 4000 documentos de KHATT.
  9. Yin, F. et al. — «ICDAR 2013 Chinese Handwriting Recognition Competition». Competición académica (IEEE). Proporciona el resultado de reconocimiento de texto fuera de línea del 88,76 % de tasa de caracteres correctos en los conjuntos de prueba derivados de CASIA-HWDB (1020 escritores).
  10. «Attention-based Handwritten Chinese Recognition for Power Industry» (2024). Revisado por pares. Proporciona el resultado ICDAR-2013 de 2024 (92,67 % AR / 93,18 % CR) y los resultados HWDB (96,92 % AR / 97,66 % CR), que muestran la mejora de 2013 a 2024 en texto chino fuera de línea.
  11. «Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents» (2025). Revisado por pares; cinco motores × cuatro escrituras. Proporciona la CER por escritura: imprenta de tipo romano 1,74–2,78 %, República Croata 3,54–6,32 %, glagolítica 4,83–6,05 %, taquigrafía 9,53–11,9 %.
  12. «Enhancing Handwritten Text Recognition Accuracy with Gated Mechanisms» (2024). Revisado por pares; GatedLexiconNet. Proporciona un segundo punto de datos IAM (WER 5,73 % / CER 2,27 %) y RIMES CER 0,9 % / WER 2,76 % de un modelo dedicado.
  13. AIMultiple — «Handwriting Recognition Benchmark: LLMs vs OCRs» (2025-11). Referencia de analistas independiente del proveedor; 100 muestras en cursiva de 10 escritores; canalización de similitud de coseno. Proporciona la referencia solo de cursiva: Gemini 3 Pro 100 %, GPT-5 y olmOCR-2-7B en el nivel superior entre 14 soluciones.
  14. AIMultiple — «OCR Benchmark: Text Extraction / Capture Accuracy» (2026). Independiente del proveedor; más de 12 soluciones. Proporciona la banda de escritura a mano entre soluciones del 46–95 % y los líderes por solución (GPT-5 95 %, olmOCR-2-7B 94 %, Gemini 2.5 Pro 93 %).
  15. BusinessWareTech — «Handwritten Form Recognition Benchmark» (2025). Referencia independiente, grado C (un único conjunto de prueba, método transparente); 10 formularios reales cumplimentados a mano. Proporciona el hallazgo a nivel de documento de que incluso los mejores modelos se mantienen por debajo del 95 % en formularios reales, y que GPT-5 Mini / Gemini 2.5 Flash Lite lideraron.

Limitaciones

  • Cobertura geográfica y de escrituras: Los corpus en escritura latina dominan la literatura: inglés (IAM), francés (RIMES) y alemán (CVL, READ). El árabe (KHATT) y el chino (CASIA-HWDB) tienen una cobertura sólida pero más limitada; el japonés, el coreano y la escritura devanagari carecen de referencias estandarizadas de CER/WER en las fuentes que localizamos. La competencia ICDAR 2023 de escritura índica (ganador con 95.94% de tasa de reconocimiento de caracteres en diez escrituras) es el único dato agregado para escrituras índicas y no se incluye en las tablas anteriores porque utiliza una métrica y un conjunto de escrituras diferentes.
  • Limitaciones metodológicas: Las divisiones de corpus difieren entre artículos (IAM estándar vs. división de Aachen) y producen números materialmente diferentes para el mismo modelo; los rangos anteriores abarcan ambos cuando se publicaron. Ningún corpus importante etiqueta el estilo de escritura (letra de imprenta vs. cursiva) por muestra, por lo que la dimensión de estilo se basa en referencias de la industria en lugar de datos académicos controlados. Los proveedores de la nube (Google, Microsoft, Amazon) no publican mediciones de precisión específicas para escritura a mano; sus cifras de "99%+" se aplican a texto impreso, y no se encontraron dos mediciones independientes de precisión de escritura a mano de proveedores, razón por la cual no aparecen cifras de proveedores con calificación D en esta página.
  • Brechas temporales: La cifra de la competencia china ICDAR 2013 (88.76% CR) tiene 13 años y se utiliza como ancla histórica junto con el resultado de 2024 en el mismo conjunto de prueba. El corpus IAM data de 1999, pero sigue siendo la referencia de facto para escritura a mano en inglés. Los resultados de LLM de 2025–2026 (GPT-4o-mini, GPT-5) son los datos más recientes y se espera que cambien.
  • Lo que no pudimos encontrar: (1) un estudio controlado revisado por pares que aísle la precisión de letra de imprenta vs. cursiva en el mismo corpus; (2) cualquier referencia de precisión de escritura a mano publicada por proveedores y metodológicamente transparente para Google Document AI, Azure Document Intelligence o Amazon Textract; (3) una referencia estandarizada para documentos mixtos impresos y escritos a mano (el caso real más común, actualmente cubierto solo por el conjunto de 10 formularios de BusinessWareTech); (4) agregación de varianza de precisión por escritor; (5) una referencia de la era LLM para escritura a mano en chino o árabe comparable al estudio Crosilla basado en IAM. Estas brechas se declaran en lugar de llenarse con afirmaciones no verificables.

Referencias relacionadas: Precisión de OCR por tipo de documento · Tasas de error en la entrada manual de datos · Costo de procesamiento de documentos por registro · ¿Qué es el reconocimiento óptico de caracteres (OCR)?

Lecturas relacionadas: Extracción asequible de escritura a mano con IA para pequeñas empresas · Cómo ha mejorado la precisión de la extracción de escritura a mano con IA

📮 contact email: [email protected]