Precisão do Reconhecimento de Manuscritos:
Por Escrita, Modelo e Tipo de Documento (2026)
Última revisão: 2026-08-10 · Cobertura de dados: Parcial · Fontes: 15 estudos independentes
O que esta página NÃO cobre: Precisão de OCR para texto impresso (veja como o OCR se sai em diferentes tipos de documento), o mecanismo de OCR/HTR em si (veja O que é OCR?), taxas de erro de entrada manual de dados (veja taxas de erro de digitação manual) ou alegações de desempenho específicas de fornecedores sobre qualquer produto único além das medições independentes citadas abaixo.
Todos os números abaixo são baseados em estudos de terceiros publicamente disponíveis e benchmarks da indústria citados na seção de metodologia. Onde as fontes divergem, faixas conservadoras (valores mais baixos–mais altos relatados) são usadas. Esta página é um benchmark direcional para pesquisa de reconhecimento de manuscritos e planejamento de digitalização de documentos, não uma previsão precisa para qualquer mecanismo ou corpus específico.
Os melhores sistemas em 2026 leem manuscritos modernos em inglês com uma Taxa de Erro de Caracteres (CER) de 1,22–1,71% no benchmark IAM — próximo à qualidade de texto impresso. Aponte a mesma geração de modelos para manuscritos dos séculos XV–XIX, e a taxa de erro salta para 71–82% de CER (Crosilla et al., 2025). O reconhecimento de manuscritos não é um único número de precisão — é uma escada de dificuldade cujos degraus são definidos por escrita, estilo de escrita, arquitetura do modelo e tipo de documento, nessa ordem aproximada de impacto.
Por que a escrita manual é mais difícil que o texto impresso
Texto impresso é um conjunto fechado de glifos padronizados; a escrita manual é um conjunto aberto de glifos idiossincráticos. Cada modelo nesta página enfrenta as mesmas três diferenças estruturais — e elas explicam por que cada escrita, estilo e arquitetura abaixo se comporta de maneira diferente.
Primeiro, a variação entre escritores. Não há duas pessoas que formem a mesma letra da mesma forma. Somente o corpus IAM contém escrita de 657 escritores diferentes em 13.353 linhas de texto (Heyberger & Guyeux, 2024) — a mesma letra aparece em centenas de representações materialmente diferentes, e é por isso que a precisão na mão de um escritor fixo é irrelevante para o reconhecimento de propósito geral. Segundo, caracteres conectados. Na escrita cursiva e em escritas totalmente conectadas, as letras se fundem em ligaduras sem limite de segmentação limpo — o mecanismo de reconhecimento deve decidir onde um caractere termina e o próximo começa, uma decisão que o texto impresso nunca exige. O árabe é o caso extremo: sua escrita é totalmente conectada dentro das palavras, escrita da direita para a esquerda, com formas de letras que mudam dependendo da posição na palavra, o que é um dos principais motivos pelos quais os benchmarks de árabe ficam atrás dos de latim (estudo comparativo IIETA, 2024). Terceiro, formas de letras dependentes de contexto e ambíguas — um "u" e um "n" mal feitos diferem apenas na direção da serifa; somente a palavra ao redor os distingue. É por isso que quase todos os sistemas modernos combinam um modelo visual com um modelo de linguagem: no corpus IAM, adicionar um léxico ou modelo de linguagem normalmente reduz os erros de palavra em um terço ou mais (Reconhecimento de linha de texto baseado em detecção, 2024).
A consequência prática é uma lacuna de métricas persistente. A Taxa de Erro de Caracteres (CER) conta caracteres lidos incorretamente por cem — uma CER de 2% significa aproximadamente dois caracteres errados por cem. A Taxa de Erro de Palavras (WER) conta palavras inteiras transcritas incorretamente; como um único caractere lido incorretamente reprova uma palavra inteira, a WER na escrita manual normalmente fica 2–4× maior que a CER — no corpus árabe KHATT, uma CER de 8,9% coexiste com uma WER de 37,6% (IIETA, 2024). Qualquer alegação de precisão que cite um único número sem dizer qual métrica e em qual corpus é, na melhor das hipóteses, incompleta.
A escrita é o maior fator de precisão no reconhecimento de escrita manual — maior que a escolha do modelo. O gráfico abaixo mostra a faixa de CER publicada (da melhor relatada à típica entre modelos) para cada corpus de benchmark principal. A história é uma escada: a escrita manual moderna em alfabeto latino tem qualidade próxima à impressa; árabe e chinês são uma ordem de grandeza mais difíceis; documentos históricos são o precipício — a menos que o modelo tenha sido treinado para eles.
Detalhamento por Escrita e Idioma
Fontes: Crosilla et al. (2025) — benchmark de LLM em IAM/RIMES/READ-2016/Bentham, 8 LLMs multimodais; CodeSOTA IAM leaderboard (2024–2026) — CER/WER por modelo com fontes de artigos; Heyberger & Guyeux (2024) — pesquisa do estado da arte (SOTA) a nível de linha (VAN 1,91% CER em RIMES); Springer SNCS (2023) — resultados de corpus cruzado CVL; IIETA (2024) & MDPI (2024) — resultados KHATT; Competição ICDAR 2013 de escrita chinesa & PMC11951872 (2024) — Taxa de Caracteres Corretos (CR) chinesa; arXiv 2409.17095 (2024) — WER treinado para tarefa específica READ-2016. A linha chinesa usa Taxa de Caracteres Corretos (CR), não CER — veja a nota abaixo da tabela.
| Escrita / Corpus | CER (melhor–típico) | WER (melhor–típico) | Fonte | Ano | Amostra |
|---|---|---|---|---|---|
| Inglês — IAM (moderno) | 1,2–5,5% | 3,3–16,3% | CodeSOTA; Crosilla | 2024–2026 | 657 escritores, 13.353 linhas, 115.320 palavras |
| Francês — RIMES (moderno, cursivo) | 1,6–4,2% | 2,0–7,7% | Crosilla; Heyberger | 2024–2025 | Cartas comerciais francesas; 1.500 páginas, 12.723 linhas |
| Alemão — CVL (moderno, cursivo) | 3,3–10,9% | 10,4–26,2% | Springer SNCS | 2023 | No domínio ~3,3% CER; transferência cruzada de modelo treinado em IAM 10,89% CER / 26,24% WER |
| Árabe — KHATT (moderno) | 8,9–16,3% | 27,3–43,9% | IIETA; MDPI | 2024 | 1.000 escritores, 4.000 documentos; escrita totalmente conectada da direita para a esquerda |
| Chinês — CASIA-HWDB / ICDAR-2013 (moderno) | 6,8–11,2% erro de caractere | — | ICDAR 2013; PMC11951872 | 2013–2024 | 1.020 escritores; reconhecimento de texto offline 88,76% CR (2013) → 93,18% CR (2024) no conjunto de teste ICDAR-2013 |
| Alemão histórico — READ-2016 (mecanismos treinados para tarefa específica) | 3,6–6,2% | 4,1–5,5% | Heyberger; arXiv 2409.17095 | 2016–2024 | 30.000 páginas de atas de conselho, séculos XV–XIX; VAN 3,59% CER, DAN 4,10% WER |
| Inglês/Alemão históricos — Bentham & READ (LLMs gerais) | 71–82% | 95–100% | Crosilla | 2025 | 8 LLMs multimodais, zero-shot/ajustados; transcrições consideradas inutilizáveis |
Fontes listadas na tabela acima. Duas notas sobre métricas: (1) A linha chinesa reporta a taxa de caracteres corretos (CR), a métrica usada tanto pela competição ICDAR 2013 quanto por artigos posteriores — ela conta caracteres reconhecidos corretamente, mas não penaliza inserções como o CER faz, portanto é comparável em direção, mas não idêntica ao CER. (2) As linhas históricas são divididas deliberadamente por tipo de modelo: mecanismos treinados para tarefa específica e LLMs gerais são animais diferentes nos mesmos documentos — veja Detalhamento por Arquitetura de Modelo.
Estilo de escrita — letra de forma, cursiva ou mista — é a dimensão que os profissionais sentem primeiro e a que tem os dados menos rigorosos. Nenhum benchmark ou corpus importante rotula cada amostra como letra de forma ou cursiva, então a diferença entre letra de forma e cursiva se baseia em benchmarks do setor e na composição dos próprios corpora (RIMES e CVL são cursivos; IAM é misto).
Detalhamento por Estilo de Escrita
| Estilo de Escrita | Precisão Observada | Evidência | Fonte | Ano |
|---|---|---|---|---|
| Letra de forma (manuscrito) | Linha de base mais fácil; sistemas de ponta com qualidade próxima à impressão | AIMultiple: "textos em estilo manuscrito são mais fáceis de reconhecer, pois os caracteres são escritos separadamente como letras de forma"; não existe benchmark acadêmico controlado (lacuna de dados) | AIMultiple | 2025 |
| Cursiva (letras unidas) | Benchmark de 100 amostras: Gemini 3 Pro 100%, GPT-5 & olmOCR-2-7B no topo | 10 escritores × 10 parágrafos cursivos, com conectividade natural e inclinação preservadas; 14 soluções classificadas por similaridade semântica | Benchmark de cursiva da AIMultiple | 2025 |
| Cursiva (nível de corpus, treinado para tarefa) | CER 1,6–3,7% | RIMES (cartas cursivas em francês) e CVL (cursiva em alemão/inglês) alcançam CER próximo ao IAM quando os modelos são treinados neles — a dificuldade do estilo é treinável, não intrínseca | Crosilla; Springer SNCS | 2023–2025 |
| Misto (letra de forma + cursiva no mesmo formulário) | Melhores modelos abaixo de 95% em nível de documento | 10 formulários reais preenchidos à mão abrangendo letra de forma, cursiva e estilos mistos: GPT-5 Mini e Gemini 2.5 Flash Lite lideraram, mas "até os melhores modelos têm dificuldade em alcançar 95%+ de precisão em nível de negócio" | BusinessWareTech | 2025 |
Fontes listadas na tabela acima. A lacuna de dados é declarada com honestidade: nenhum estudo revisado por pares isola a precisão de letra de forma versus cursiva em um corpus controlado e rotulado por estilo — RIMES e CVL são cursivos e IAM é misto, mas nenhum benchmark rotula cada amostra — portanto, a dimensão de estilo aqui se baseia no benchmark exclusivamente cursivo da AIMultiple e na composição do corpus dos resultados revisados por pares, com a ressalva de que uma comparação acadêmica direta de estilos ainda não existe (ver Limitações).
A arquitetura do modelo gerou uma redução de erro de aproximadamente 5× no mesmo corpus IAM em dez anos. A progressão no ranking abaixo — redes recorrentes baseadas em CTC, depois transformers, depois LLMs multimodais — é o registro publicado mais claro de como a precisão da escrita manual melhorou, e também é o eixo em que a "precisão" mais depende de como o modelo foi treinado.
Detalhamento por Arquitetura do Modelo
| Arquitetura | Era | IAM CER (melhor) | IAM WER (melhor) | Modelos Representativos | Fonte |
|---|---|---|---|---|---|
| CNN-LSTM + CTC | 2016–2022 | ~4,1–5,5% | 5,0–16,3% | DAN 5.01 WER; Start-Follow-Read 6.4; PyLaia 7.5–8.4; VAN 16.3 (WER de linha) / 4.45 CER | arXiv 2409.17095; CodeSOTA |
| Transformer (codificador-decodificador) | 2021–2024 | 2,38–2,89% | ~2,4–2,9% (relatado) | TrOCR 2,89% CER (2021); DTrOCR 2,38% CER (WACV 2024); HTR-VT 14.9 WER sem pré-treinamento | CodeSOTA; IIETA |
| LLM multimodal (VLM) | 2025–2026 | 1,22–1,75% | 3,34–3,59% | GPT-5 ~1,22% CER (2026); GPT-4o-mini 1,71% CER / 3,34% WER (2025); Claude 3.5 Sonnet 1,75% CER | CodeSOTA; Crosilla |
| Mecanismos OCR de uso geral (prontos para uso) | 2023–2026 | Corpus RIMES: 11–18% CER, 33–53% WER | DOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CER (supermodelos não ajustados no RIMES) | Heyberger | |
Fontes listadas na tabela acima. As linhas comparam os melhores resultados publicados no mesmo corpus IAM, exceto a última linha, que relata a avaliação comercial pronta para uso do estudo no RIMES — incluída para mostrar que um mecanismo comercial não ajustado em um corpus desconhecido se comporta mais como um modelo de pesquisa de 2016 do que um de 2026. Comparações entre arquiteturas em divisões idênticas são raras; a "divisão Aachen" do IAM e a divisão padrão produzem números diferentes para o mesmo modelo (por exemplo, DRetHTR-base 6.55 WER no IAM-A, 2026).
O tipo de documento determina quanto da precisão teórica sobrevive ao contato com a realidade. Corpora de benchmark limpos são segmentados por linha e escritos em papel comum; documentos reais chegam como formulários com campos sobrepostos, cartas com anotações marginais e manuscritos com abreviações e tinta desbotada. A faixa publicada para cada tipo de documento — não o teto do benchmark — é o número para planejar.
Detalhamento por Tipo de Documento
| Tipo de Documento | Faixa de Precisão | Contexto | Fonte | Ano |
|---|---|---|---|---|
| Formulários padrão preenchidos à mão | Melhores modelos <95% em nível de documento | 10 formulários reais, letra de forma/cursiva/mista; GPT-5 Mini e Gemini 2.5 Flash Lite lideraram; a extração de campos estruturados adiciona falhas em nível de campo além dos erros de leitura | BusinessWareTech | 2025 |
| Cartas de texto livre (modernas) | CER 1,2–1,9% (SOTA), 11–18% (comercial pronto para uso) | IAM e RIMES são cartas; a diferença entre SOTA e mecanismos comerciais sem ajustes no mesmo corpus é uma ordem de grandeza completa | Crosilla; Heyberger | 2024–2025 |
| Manuscritos históricos | CER 3,6–6,2% (treinado para tarefa específica) / 71–82% (LLM geral) | Scripts READ-2016, Bentham, Glagolítico; abreviações, vocabulários antigos e complexidade da escrita empurram mecanismos dedicados para 4,8–6,05% de CER nos scripts mais difíceis | arXiv 2409.17095; PMC12202554; Crosilla | 2024–2025 |
| Notas do mundo real / documentos mistos | 46–95% de similaridade semântica entre soluções | Benchmark de OCR da AIMultiple com 12 soluções em escrita manual diversa; soluções baseadas em LLM lideram com 93–95%, mecanismos OCR legados ficam perto do fundo da faixa | AIMultiple | 2026 |
Fontes listadas na tabela acima. Observe que as linhas de "cartas de texto livre" usam CER enquanto "notas do mundo real" usa pontuação de similaridade semântica — escalas de medição diferentes, mostradas separadamente em vez de combinadas. A faixa de 46–95% é o único número que abrange documentos modernos e históricos, limpos e bagunçados em uma única medição.
Como Usar Estes Dados
Você não precisa executar um benchmark para transformar a "precisão de reconhecimento de escrita manual" de um número de fornecedor em uma expectativa defensável para seus próprios documentos. Uma verificação rápida em quatro etapas usando as tabelas acima é suficiente — e geralmente revela que o número principal foi medido em um tipo de documento diferente do que você processa.
- Classifique seu documento. Responda a quatro perguntas: escrita (latina? árabe? chinesa?), estilo (letra de forma, cursiva ou mista?), tipo de documento (formulário, carta ou histórico?) e se o corpus no qual seu sistema foi treinado se assemelha a ele. Um formulário moderno em escrita latina é a faixa fácil; um manuscrito do século XIX em escrita não latina é a faixa difícil — as tabelas acima dão a cada faixa seu próprio intervalo.
- Escolha a métrica honesta. Use a faixa de CER se seu processo downstream tolerar alguns caracteres errados por cem; use a faixa de WER se palavras inteiras importam (busca, entidades nomeadas, endereços); use precisão em nível de documento para formulários onde um campo errado invalida o registro. O mesmo sistema pode legitimamente mostrar 1,7% de CER, 3,3% de WER e 80% de precisão em nível de campo.
- Aplique o desconto de especialização do modelo. Se seu mecanismo foi treinado ou ajustado para seu tipo de documento, o melhor CER publicado está ao alcance (1,2–1,9% para letras latinas modernas). Se for um sistema geral pronto para uso, reserve para a faixa de 11–18% de CER em cursiva não familiar (Heyberger 2024) — ou a faixa de 71–82% em documentos históricos (Crosilla 2025).
- Dimensione a fila de revisão. Com 3% de WER em 200 páginas manuscritas de 50 palavras cada, espere aproximadamente 300 palavras erradas por lote (200 × 50 × 3%) antes de qualquer correção. Com 16% de CER em documentos árabes, esse mesmo lote tem milhares de caracteres suspeitos — a aritmética determina se revisão humana, um limite de confiança ou uma passagem de pós-correção com léxico é economicamente necessária.
Estas são fórmulas de estimativa aproximada, não um substituto para benchmark de seus próprios documentos. Cada faixa publicada nesta página foi medida no corpus de outra pessoa — o único número de precisão que se aplica ao seu fluxo de trabalho é aquele que você mede nele. O valor desta página é definir a expectativa antes de você medir.
Perguntas Frequentes
Qual é a precisão do reconhecimento de escrita manual em 2026?
Depende quase inteiramente do tipo de escrita e do tipo de documento. Na escrita manual inglesa moderna (benchmark IAM), os melhores sistemas alcançam 1,22–1,71% de CER (CodeSOTA 2026; Crosilla 2025); a cursiva francesa é semelhante, com 1,63–1,91% (Crosilla 2025; Heyberger 2024); o árabe apresenta 8,9–16,3% de CER (IIETA 2024; MDPI 2024); e modelos gerais em manuscritos históricos pontuam 71–82% de CER (Crosilla 2025). Em 12 soluções comerciais testadas em escrita manual diversa do mundo real, os escores de similaridade semântica variam de 46–95% (AIMultiple 2026).
Qual é o estado da arte no banco de dados de escrita manual IAM?
Em 2026, o GPT-5 reporta ~1,22% de CER no IAM, com GPT-4o-mini em 1,71% de CER / 3,34% de WER (Crosilla 2025) e o especializado HTR-JAND em 1,23% de CER com correção de léxico (CodeSOTA 2024). No mesmo corpus, o estado da arte pré-transformer estava perto de 8% de erro de caracteres (Chowdhury & Vig, 2018) e sistemas típicos de CNN-LSTM operavam com 7,5–8,4% de WER (PyLaia — arXiv 2409.17095) — as taxas de erro caíram várias vezes, mas o IAM continua sendo o benchmark de referência para escrita manual em inglês (657 escritores, 13.353 linhas).
A IA consegue ler escrita cursiva?
Sim — os principais modelos multimodais agora lidam bem com cursiva. No benchmark de 2025 da AIMultiple com 100 amostras de cursiva deliberadamente bagunçadas, o Gemini 3 Pro pontuou 100% de similaridade semântica, com GPT-5 e olmOCR-2-7B no topo da lista (AIMultiple, 2025); mecanismos de OCR legados ficaram atrás do grupo. A cursiva continua mais difícil que a letra de forma — os caracteres são unidos, então a segmentação é ambígua — mas a diferença é uma questão de geração do modelo, não uma barreira absoluta.
Como a precisão da escrita manual se compara ao OCR de texto impresso?
O OCR de texto impresso atinge 98–99%+ de precisão de caracteres em documentos limpos (veja Precisão de OCR por Tipo de Documento), enquanto os melhores sistemas de escrita manual ficam em 98,3–98,8% de precisão de caracteres (1,2–1,7% CER) em inglês moderno — próximo, mas não igual — e caem para 83–91% em árabe e chinês, e abaixo de 30% para modelos gerais em documentos históricos (Crosilla 2025; IIETA 2024; PMC11951872 2024). A diferença entre texto impresso e manuscrito é de aproximadamente uma ordem de magnitude em cada escrita.
Por que a precisão do reconhecimento de escrita manual é tão baixa em documentos históricos?
Documentos históricos combinam escritas antigas, abreviações, tinta desbotada e vocabulários fora dos dados de treinamento modernos. O resultado é um efeito acentuado de especialização de modelo: mecanismos treinados para tarefa específica alcançam 3,6–6,2% CER no corpus READ-2016 e 4,8–6,05% nas escritas mais difíceis, como o glagolítico (Heyberger 2024; PMC12202554 2025), enquanto oito LLMs gerais pontuaram 71–82% CER — transcrição inutilizável (Crosilla 2025). O reconhecimento é possível, mas apenas com um modelo treinado para a coleção histórica específica.
O que é um bom CER para reconhecimento de escrita manual?
A escala de trabalho do campo, adotada na literatura de HTR, define CER abaixo de 5% como "muito bom", 5–10% como "bom" e abaixo de 2,5% como "excelente" (Muehlberger et al. 2019; Hodel et al. 2021, conforme aplicado por Crosilla et al. 2025). Em escrita manual moderna em alfabeto latino, os melhores sistemas estão na faixa "excelente"; em árabe, chinês e documentos históricos, "muito bom" (5–10%) é atualmente a meta de produção realista.
Qual é a diferença entre CER e WER no reconhecimento de escrita manual?
Taxa de Erro de Caracteres conta caracteres individuais lidos incorretamente; Taxa de Erro de Palavras (WER) conta palavras inteiras erradas, então um único caractere lido incorretamente falha uma palavra inteira. Na escrita manual, o WER normalmente é 2–4× maior que o CER — no árabe KHATT, 8,9% CER coexiste com 37,6% WER (IIETA 2024). Sempre verifique qual métrica uma afirmação usa: "95% de precisão" significa coisas muito diferentes como CER, WER ou precisão em nível de documento.
Metodologia e Fontes
Como Esta Página Foi Construída
Esta página reúne dados de 15 fontes independentes abrangendo 2013–2026, dominada por artigos revisados por pares, relatórios de competições acadêmicas e uma pesquisa TPAMI revisada por pares. As fontes foram selecionadas com base em três critérios: (1) metodologia publicamente documentada com tamanho de corpus declarado, (2) resultados reportados em corpora de benchmark nomeados (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) ou conjuntos de teste industriais transparentes, e (3) relevância para reconhecimento de escrita manual em vez de alegações de marketing. Quando múltiplas fontes reportam a mesma dimensão, faixas conservadoras (valores mais baixos–mais altos reportados) são usadas — preferimos subestimar. Quando as fontes discordam significativamente, a discordância é explicada pelo nível de métrica, divisão do corpus ou regime de treinamento, em vez de ser diluída por média.
A distinção de métricas é a espinha dorsal desta página: CER, WER e Taxa de Caracteres Corretos (CR) nunca são combinados em um único número, e modelos treinados para tarefa específica versus modelos gerais são reportados como linhas separadas porque são regimes de medição diferentes nos mesmos documentos. Números autorreportados por fornecedores são excluídos totalmente — nenhuma alegação de precisão de escrita manual publicada por fornecedor sobreviveu ao teste de duas fontes independentes, o que por si só é uma descoberta (ver Limitações).
Lista de Fontes
- Crosilla, G., Klic, L. & Colavizza, G. — "Benchmarking Large Language Models for Handwritten Text Recognition," Journal of Documentation 81(7) (2025). Revisado por pares; 8 LLMs multimodais × 7 corpora (IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). Fornece IAM 1,71% CER/3,34% WER (GPT-4o-mini), RIMES 1,69% CER (GPT-4o), histórico 71–82% CER e as faixas de qualidade CER <5% / <2,5%.
- Heyberger, L. & Guyeux, C. — "Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey," Journal of Imaging 10(1):18 (2024). Pesquisa revisada por pares; mais de 250 estudos. Fornece especificações de corpus (IAM 657 escritores/13.353 linhas, READ 30.000 páginas), SOTA em nível de linha (VAN 1,91% CER no RIMES) e resultados comerciais prontos para uso (DOCSUMO 11% CER, Transkribus 18% CER no RIMES).
- Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — "Handwritten Text Recognition: A Survey," IEEE TPAMI 48(4) (2026). Pesquisa revisada por pares. Fornece SOTA em nível de parágrafo no IAM (VAN 4,7%, OrigamiNet 4,6%) e a redução de erro de 58% do paradigma CTC, além da crítica de generalização fora da distribuição dos benchmarks atuais.
- CodeSOTA — "IAM Leaderboard" (2024–2026). Agregador técnico de benchmarks; cada entrada vincula seu artigo original. Fornece CER/WER por modelo no IAM (GPT-5 ~1,22% CER, HTR-JAND 1,23% CER/3,78% WER, GPT-4o-mini 3,34% WER, DRetHTR-base 6,55% WER no IAM-A, MetaWriter 10,32% WER) e a observação de que OCR classe Tesseract não é adequado para manuscritos (~12,5% CER).
- "General Detection-based Text Line Recognition" (2024, arXiv 2409.17095). Pré-print com tabelas de comparação entre modelos. Fornece comparação de WER em IAM/READ/RIMES (DAN 5,01 WER no IAM, 4,10 no READ; DTrOCR 2,38 no IAM; melhor RIMES 1,99 com modelo de linguagem) e as estatísticas da divisão Aachen do IAM.
- "Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review," SN Computer Science (2023). Revisado por pares. Fornece números de generalização entre corpora: um modelo treinado no IAM pontua 10,89% CER / 26,24% WER no CVL vs 8,62% CER no próprio IAM, e a descrição do corpus CVL (cursiva em alemão/inglês).
- "A Comparative Study of Four Handwritten Text Recognition Models," Ingénierie des Systèmes d'Information 29(6) (2024). Revisado por pares; DAN/VAN/FCN/GFCN no KHATT. Fornece os melhores resultados no KHATT: DAN 8,9% CER / 37,6% WER; VAN 10,7% CER / 43,9% WER; e análise dos desafios da escrita árabe (letras totalmente conectadas, formas dependentes da posição).
- "Machine Learning Approach for Arabic Handwritten Recognition," Applied Sciences 14(19):9020 (2024). Revisado por pares; BiLSTM-CTC no KHATT. Fornece resultados BiLSTM no KHATT (13,2–15,8% CER / 27,31–31,6% WER) e linhas de base históricas (MDLSTM 31,3% WER, 2015); documenta os 1.000 escritores / 4.000 documentos do KHATT.
- Yin, F. et al. — "ICDAR 2013 Chinese Handwriting Recognition Competition". Competição acadêmica (IEEE). Fornece o resultado de reconhecimento de texto offline de 88,76% de taxa de caracteres corretos em conjuntos de teste derivados de CASIA-HWDB (1.020 escritores).
- "Attention-based Handwritten Chinese Recognition for Power Industry," (2024). Revisado por pares. Fornece o resultado ICDAR-2013 de 2024 (92,67% AR / 93,18% CR) e resultados HWDB (96,92% AR / 97,66% CR), mostrando a melhora de 2013→2024 no texto offline chinês.
- "Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents" (2025). Revisado por pares; cinco mecanismos × quatro escritas. Fornece CER por escrita: impressão tipo romano 1,74–2,78%, República Croata 3,54–6,32%, glagolítica 4,83–6,05%, taquigrafia 9,53–11,9%.
- "Enhancing Handwritten Text Recognition Accuracy with Gated Mechanisms" (2024). Revisado por pares; GatedLexiconNet. Fornece um segundo ponto de dados IAM (WER 5,73% / CER 2,27%) e RIMES CER 0,9% / WER 2,76% de um modelo dedicado.
- AIMultiple — "Handwriting Recognition Benchmark: LLMs vs OCRs" (2025-11). Benchmark analítico neutro em relação a fornecedores; 100 amostras cursivas de 10 escritores; pipeline de similaridade por cosseno. Fornece o benchmark exclusivo de cursiva: Gemini 3 Pro 100%, GPT-5 e olmOCR-2-7B no nível superior entre 14 soluções.
- AIMultiple — "OCR Benchmark: Text Extraction / Capture Accuracy" (2026). Neutro em relação a fornecedores; 12+ soluções. Fornece a banda de escrita manual entre soluções de 46–95% e líderes por solução (GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%).
- BusinessWareTech — "Handwritten Form Recognition Benchmark" (2025). Benchmark independente, grau C (conjunto de teste único, método transparente); 10 formulários reais preenchidos à mano. Fornece a conclusão a nível de documento de que até os principais modelos permanecen abaixo de 95% em formulários reais, e que GPT-5 Mini / Gemini 2.5 Flash Lite lideraram.
Limitações
- Cobertura geográfica e de escrita: Corpora em escrita latina dominam a literatura — inglês (IAM), francês (RIMES) e alemão (CVL, READ). O árabe (KHATT) e o chinês (CASIA-HWDB) têm cobertura sólida, porém mais limitada; japonês, coreano e escrita devanágari não possuem benchmarks padronizados de CER/WER nas fontes que localizamos. A competição Indic do ICDAR 2023 (vencedor com 95,94% de taxa de reconhecimento de caracteres em dez escritas) é o único dado agregado para a região e não está incluída nas tabelas acima por usar métrica e conjunto de escritas diferentes.
- Restrições metodológicas: As divisões dos corpora diferem entre artigos (padrão IAM vs. divisão Aachen) e produzem números materialmente diferentes para o mesmo modelo — os intervalos acima abrangem ambos onde publicados. Nenhum corpus importante rotula o estilo de escrita (letra de forma vs. cursiva) por amostra, então a dimensão de estilo se apoia em benchmarks do setor, e não em dados acadêmicos controlados. Provedores de nuvem (Google, Microsoft, Amazon) não publicam medições de precisão específicas para escrita manual; seus números de "99%+" se aplicam a texto impresso, e não foram encontradas duas medições independentes de precisão de escrita manual — por isso não há notas de fornecedores com grau D nesta página.
- Lacunas temporais: O resultado da competição chinesa do ICDAR 2013 (88,76% de CR) tem 13 anos e foi usado como âncora histórica junto ao resultado de 2024 no mesmo conjunto de teste. O corpus IAM data de 1999, mas continua sendo o benchmark de facto para escrita manual em inglês. Os resultados de LLM de 2025–2026 (GPT-4o-mini, GPT-5) são os dados mais recentes e devem ser vistos como sujeitos a mudanças.
- O que não conseguimos encontrar: (1) um estudo controlado revisado por pares isolando a precisão de letra de forma vs. cursiva no mesmo corpus; (2) qualquer benchmark de precisão de escrita manual publicado por fornecedores, com metodologia transparente, para Google Document AI, Azure Document Intelligence ou Amazon Textract; (3) um benchmark padronizado para documentos mistos impressos + manuscritos (o caso mais comum no mundo real, coberto atualmente apenas pelo conjunto de 10 formulários da BusinessWareTech); (4) agregação de variância de precisão por escritor; (5) um benchmark da era LLM para escrita manual chinesa ou árabe comparável ao estudo Crosilla baseado no IAM. Essas lacunas são declaradas, e não preenchidas com alegações não verificáveis.
Referências relacionadas: benchmarks de precisão por tipo de documento · taxa de erro de transcrição humana · Custo de Processamento de Documentos por Registro · O que é Reconhecimento Óptico de Caracteres (OCR)?
Leitura relacionada: Extração Acessível de Escrita Manual com IA para Pequenas Empresas · Como a Precisão da Extração de Escrita Manual com IA Melhorou