Precisão no Reconhecimento de Manuscritos:
Por Escrita, Modelo e Tipo de Documento (2026)
Última revisão: 2026-08-10 · Cobertura de dados: Parcial · Fontes: 15 estudos independentes
O que esta página NÃO cobre: Precisão de OCR para texto impresso (veja Precisão de OCR por Tipo de Documento), o mecanismo de OCR/HTR em si (veja O que é OCR?), taxas de erro na entrada manual de dados (veja Taxas de Erro na Entrada Manual de Dados) ou alegações de desempenho específicas de fornecedores sobre qualquer produto, além das medições independentes citadas abaixo.
Todos os números abaixo são baseados em estudos de terceiros publicamente disponíveis e benchmarks da indústria citados na seção de metodologia. Onde as fontes divergem, são usados intervalos conservadores (valores mínimos–máximos relatados). Esta página é um benchmark direcional para pesquisa em reconhecimento de manuscritos e planejamento de digitalização de documentos, não uma previsão precisa para qualquer mecanismo ou corpus específico.
Os melhores sistemas em 2026 leem manuscritos modernos em inglês com uma Taxa de Erro de Caracteres (CER) de 1,22–1,71% no benchmark IAM — próximo da qualidade de texto impresso. Aponte a mesma geração de modelos para manuscritos dos séculos XV–XIX, e a taxa de erro salta para 71–82% de CER (Crosilla et al., 2025). O reconhecimento de manuscritos não é um único número de precisão — é uma escada de dificuldade cujos degraus são definidos pela escrita, estilo de escrita, arquitetura do modelo e tipo de documento, aproximadamente nessa ordem de impacto.
Por que a Escrita Manual é Mais Difícil que Texto Impresso
Texto impresso é um conjunto fechado de glifos padronizados; escrita manual é um conjunto aberto de glifos idiossincráticos. Todo modelo nesta página enfrenta as mesmas três diferenças estruturais — e elas explicam por que cada escrita, estilo e arquitetura abaixo se comporta de forma diferente.
Primeiro, variação do escritor. Não há duas pessoas que formem a mesma letra da mesma maneira. Somente o corpus IAM contém escrita manual de 657 escritores diferentes em 13.353 linhas de texto (Heyberger & Guyeux, 2024) — a mesma letra aparece em centenas de representações materialmente diferentes, e é por isso que a precisão na caligrafia de um escritor fixo não tem significado para reconhecimento de propósito geral. Segundo, caracteres conectados. Na escrita cursiva e em escritas totalmente conectadas, as letras se fundem em ligaduras sem limite de segmentação limpo — o mecanismo de reconhecimento deve decidir onde um caractere termina e o próximo começa, uma decisão que o texto impresso nunca exige. O árabe é o caso extremo: sua escrita é totalmente conectada dentro das palavras, escrita da direita para a esquerda, com formas de letras que mudam conforme sua posição na palavra, o que é um dos principais motivos pelos quais os benchmarks de árabe ficam atrás dos de latim (estudo comparativo IIETA, 2024). Terceiro, formas de letras dependentes de contexto e ambíguas — um "u" e um "n" descuidados diferem apenas na direção de uma serifa; somente a palavra ao redor os desambigua. É por isso que quase todos os sistemas modernos combinam um modelo visual com um modelo de linguagem: no corpus IAM, adicionar um léxico ou modelo de linguagem normalmente reduz os erros de palavras em um terço ou mais (Reconhecimento de linha de texto baseado em detecção, 2024).
A consequência prática é uma lacuna de métricas persistente. A Taxa de Erro de Caracteres (CER) conta caracteres lidos incorretamente por cem — uma CER de 2% significa aproximadamente dois caracteres errados por cem. A Taxa de Erro de Palavras (WER) conta palavras inteiras transcritas incorretamente; como um único caractere lido incorretamente falha uma palavra inteira, a WER em escrita manual normalmente fica 2–4× maior que a CER — no corpus árabe KHATT, uma CER de 8,9% coexiste com uma WER de 37,6% (IIETA, 2024). Qualquer alegação de precisão que cite um único número sem dizer qual métrica e em qual corpus é, na melhor das hipóteses, incompleta.
A escrita é o maior fator de precisão no reconhecimento de escrita manual — maior que a escolha do modelo. O gráfico abaixo mostra a faixa de CER publicada (da melhor relatada à típica entre modelos) para cada corpus de benchmark principal. A história é uma escada: a escrita manual latina moderna está próxima da qualidade de impressão; árabe e chinês são uma ordem de magnitude mais difíceis; documentos históricos são o precipício — a menos que o modelo tenha sido treinado para eles.
Detalhamento por Escrita e Idioma
Fontes: Crosilla et al. (2025) — benchmark de LLM em IAM/RIMES/READ-2016/Bentham, 8 LLMs multimodais; CodeSOTA IAM leaderboard (2024–2026) — CER/WER por modelo com fontes de artigos; Heyberger & Guyeux (2024) — pesquisa de SOTA em nível de linha (VAN 1,91% CER em RIMES); Springer SNCS (2023) — resultados de CVL entre corpora; IIETA (2024) & MDPI (2024) — resultados de KHATT; Competição chinesa ICDAR 2013 & PMC11951872 (2024) — taxa de caracteres corretos em chinês; arXiv 2409.17095 (2024) — WER treinado para tarefa específica em READ-2016. A linha do chinês usa a taxa de caracteres corretos (CR), não CER — veja a nota abaixo da tabela.
| Escrita / Corpus | CER (melhor–típico) | WER (melhor–típico) | Fonte | Ano | Amostra |
|---|---|---|---|---|---|
| Inglês — IAM (moderno) | 1,2–5,5% | 3,3–16,3% | CodeSOTA; Crosilla | 2024–2026 | 657 escritores, 13.353 linhas, 115.320 palavras |
| Francês — RIMES (moderno, cursivo) | 1,6–4,2% | 2,0–7,7% | Crosilla; Heyberger | 2024–2025 | Cartas comerciais francesas; 1.500 páginas, 12.723 linhas |
| Alemão — CVL (moderno, cursivo) | 3,3–10,9% | 10,4–26,2% | Springer SNCS | 2023 | No domínio ~3,3% CER; modelo treinado em IAM com transferência cruzada 10,89% CER / 26,24% WER |
| Árabe — KHATT (moderno) | 8,9–16,3% | 27,3–43,9% | IIETA; MDPI | 2024 | 1.000 escritores, 4.000 documentos; escrita totalmente conectada da direita para a esquerda |
| Chinês — CASIA-HWDB / ICDAR-2013 (moderno) | 6,8–11,2% erro de caractere | — | ICDAR 2013; PMC11951872 | 2013–2024 | 1.020 escritores; reconhecimento de texto offline 88,76% CR (2013) → 93,18% CR (2024) no conjunto de teste ICDAR-2013 |
| Alemão histórico — READ-2016 (mecanismos treinados para tarefa específica) | 3,6–6,2% | 4,1–5,5% | Heyberger; arXiv 2409.17095 | 2016–2024 | 30.000 páginas de atas de conselho, séculos XV–XIX; VAN 3,59% CER, DAN 4,10% WER |
| Inglês/Alemão históricos — Bentham & READ (LLMs gerais) | 71–82% | 95–100% | Crosilla | 2025 | 8 LLMs multimodais, zero-shot/ajustados; transcrições consideradas inutilizáveis |
Fontes listadas na tabela acima. Duas notas sobre métricas: (1) A linha chinesa relata a Taxa de Caracteres Corretos (CR), a métrica usada tanto pela competição ICDAR 2013 quanto por artigos posteriores — ela conta caracteres reconhecidos corretamente, mas não penaliza inserções como a CER faz, portanto é comparável em direção, mas não idêntica à CER. (2) As linhas históricas são divididas deliberadamente por tipo de modelo: mecanismos treinados para tarefa específica e LLMs gerais são animais diferentes nos mesmos documentos — veja Detalhamento por Arquitetura de Modelo.
Estilo de escrita — letra de forma, cursiva ou mista — é a dimensão que os profissionais sentem primeiro e a que tem os dados menos rigorosos. Nenhum corpus de benchmark importante rotula cada amostra como de forma ou cursiva, então a diferença entre impresso e cursivo se baseia em benchmarks do setor e na composição dos próprios corpora (RIMES e CVL são cursivos; IAM é misto).
Detalhamento por Estilo de Escrita
| Estilo de Escrita | Precisão Observada | Evidência | Fonte | Ano |
|---|---|---|---|---|
| Letra de forma (manuscrito) | Base mais fácil; sistemas de ponta com qualidade próxima à impressão | AIMultiple: "textos em estilo manuscrito são mais fáceis de reconhecer, pois os caracteres são escritos separadamente como letras de forma"; não existe benchmark acadêmico controlado (lacuna de dados) | AIMultiple | 2025 |
| Cursiva (letras unidas) | Benchmark de 100 amostras: Gemini 3 Pro 100%, GPT-5 & olmOCR-2-7B no topo | 10 escritores × 10 parágrafos cursivos, com conectividade natural e inclinação preservadas; 14 soluções classificadas por similaridade semântica | Benchmark de cursiva da AIMultiple | 2025 |
| Cursiva (nível de corpus, treinado para tarefa específica) | CER 1,6–3,7% | RIMES (cartas cursivas em francês) e CVL (cursiva em alemão/inglês) alcançam CER próximo ao do IAM quando os modelos são treinados neles — a dificuldade do estilo é treinável, não intrínseca | Crosilla; Springer SNCS | 2023–2025 |
| Misto (forma + cursiva no mesmo formulário) | Melhores modelos abaixo de 95% em nível de documento | 10 formulários reais preenchidos à mão abrangendo estilos de forma, cursivo e misto: GPT-5 Mini e Gemini 2.5 Flash Lite lideraram, mas "até os melhores modelos têm dificuldade em alcançar 95%+ de precisão em nível empresarial" | BusinessWareTech | 2025 |
Fontes listadas na tabela acima. A lacuna de dados é declarada com honestidade: nenhum estudo revisado por pares isola a precisão de letra de forma versus cursiva em um corpus controlado e rotulado por estilo — RIMES e CVL são cursivos e IAM é misto, mas nenhum benchmark rotula cada amostra — portanto, a dimensão de estilo aqui se baseia no benchmark exclusivamente cursivo da AIMultiple e na composição do corpus dos resultados revisados por pares, com a ressalva de que uma comparação acadêmica direta de estilos ainda não existe (veja Limitações).
A arquitetura do modelo impulsionou uma redução de erro de aproximadamente 5× no mesmo corpus IAM em dez anos. A progressão do ranking abaixo — redes recorrentes baseadas em CTC, depois transformers, depois LLMs multimodais — é o registro publicado mais claro de como a precisão da escrita manual melhorou, e também é o eixo onde a "precisão" depende mais de como o modelo foi treinado.
Detalhamento por Arquitetura do Modelo
| Arquitetura | Era | CER IAM (melhor) | WER IAM (melhor) | Modelos Representativos | Fonte |
|---|---|---|---|---|---|
| CNN-LSTM + CTC | 2016–2022 | ~4,1–5,5% | 5,0–16,3% | DAN 5,01 WER; Start-Follow-Read 6,4; PyLaia 7,5–8,4; VAN 16,3 (WER de linha) / 4,45 CER | arXiv 2409.17095; CodeSOTA |
| Transformer (codificador-decodificador) | 2021–2024 | 2,38–2,89% | ~2,4–2,9% (relatado) | TrOCR 2,89% CER (2021); DTrOCR 2,38% CER (WACV 2024); HTR-VT 14,9 WER sem pré-treinamento | CodeSOTA; IIETA |
| LLM multimodal (VLM) | 2025–2026 | 1,22–1,75% | 3,34–3,59% | GPT-5 ~1,22% CER (2026); GPT-4o-mini 1,71% CER / 3,34% WER (2025); Claude 3.5 Sonnet 1,75% CER | CodeSOTA; Crosilla |
| Mecanismos OCR de uso geral (prontos para uso) | 2023–2026 | Corpus RIMES: 11–18% CER, 33–53% WER | DOCSUMO 11% CER; Transkribus 18% CER; Ocelus 15% CER (supermodelos não ajustados no RIMES) | Heyberger | |
Fontes listadas na tabela acima. As linhas comparam os melhores resultados publicados no mesmo corpus IAM, exceto a última linha, que relata a avaliação comercial pronta para uso do estudo no RIMES — incluída para mostrar que um mecanismo comercial não ajustado em um corpus desconhecido se comporta mais como um modelo de pesquisa de 2016 do que um de 2026. Comparações entre arquiteturas em divisões idênticas são raras; a "divisão Aachen" do IAM e a divisão padrão produzem números diferentes para o mesmo modelo (por exemplo, DRetHTR-base 6,55 WER no IAM-A, 2026).
O tipo de documento determina quanto da precisão teórica sobrevive ao contato com a realidade. Corpora de benchmark limpos são segmentados por linha e escritos em papel comum; documentos reais chegam como formulários com campos sobrepostos, cartas com anotações marginais e manuscritos com abreviações e tinta desbotada. A faixa publicada para cada tipo de documento — não o teto do benchmark — é o número para planejar.
Detalhamento por Tipo de Documento
| Tipo de Documento | Faixa de Precisão | Contexto | Fonte | Ano |
|---|---|---|---|---|
| Formulários padrão preenchidos à mão | Melhores modelos <95% em nível de documento | 10 formulários reais, letra de forma/cursiva/mista; GPT-5 Mini e Gemini 2.5 Flash Lite lideraram; a extração de campos estruturados adiciona falhas em nível de campo além dos erros de leitura | BusinessWareTech | 2025 |
| Cartas de formato livre (modernas) | CER 1,2–1,9% (estado da arte), 11–18% (comercial pronto para uso) | IAM e RIMES são cartas; a diferença entre o estado da arte e mecanismos comerciais sem ajustes no mesmo corpus é uma ordem de grandeza completa | Crosilla; Heyberger | 2024–2025 |
| Manuscritos históricos | CER 3,6–6,2% (treinado para tarefa específica) / 71–82% (LLM geral) | READ-2016, Bentham, escritas glagolíticas; abreviações, vocabulários antigos e complexidade da escrita empurram mecanismos dedicados para 4,8–6,05% de CER nas escritas mais difíceis | arXiv 2409.17095; PMC12202554; Crosilla | 2024–2025 |
| Notas do mundo real / documentos mistos | 46–95% de similaridade semântica entre soluções | Benchmark de OCR do AIMultiple com 12 soluções em escrita diversificada; soluções baseadas em LLM lideram com 93–95%, mecanismos de OCR legados ficam perto da base da faixa | AIMultiple | 2026 |
Fontes listadas na tabela acima. Observe que as linhas de "cartas de formato livre" usam CER enquanto "notas do mundo real" usa pontuação de similaridade semântica — escalas de medição diferentes, mostradas separadamente em vez de combinadas. A faixa de 46–95% é o único número que abrange documentos modernos e históricos, limpos e bagunçados em uma única medição.
Como Usar Estes Dados
Você não precisa executar um benchmark para transformar "precisão de reconhecimento de escrita manual" de um número de fornecedor em uma expectativa defensável para seus próprios documentos. Uma verificação rápida de quatro etapas usando as tabelas acima é suficiente — e geralmente revela que o número principal foi medido em um tipo de documento diferente do que você processa.
- Classifique seu documento. Responda a quatro perguntas: escrita (latina? árabe? chinesa?), estilo (letra de forma, cursiva ou mista?), tipo de documento (formulário, carta ou histórico?) e se o corpus no qual seu sistema foi treinado se assemelha a ele. Um formulário moderno em escrita latina é a faixa fácil; um manuscrito histórico do século XIX em escrita não latina é a faixa difícil — as tabelas acima dão a cada faixa seu próprio intervalo.
- Escolha a métrica honesta. Use a faixa de CER se seu processo downstream tolerar alguns caracteres errados por cem; use a faixa de WER se palavras inteiras importarem (busca, entidades nomeadas, endereços); use precisão em nível de documento para formulários onde um campo errado invalida o registro. O mesmo sistema pode legitimamente mostrar 1,7% de CER, 3,3% de WER e 80% de precisão em nível de campo.
- Aplique o desconto de especialização do modelo. Se seu mecanismo foi treinado ou ajustado para seu tipo de documento, o melhor CER publicado está ao alcance (1,2–1,9% para letras latinas modernas). Se for um sistema geral pronto para uso, reserve para a faixa de 11–18% de CER em cursiva não familiar (Heyberger 2024) — ou a faixa de 71–82% em documentos históricos (Crosilla 2025).
- Dimensione a fila de revisão. Com 3% de WER em 200 páginas manuscritas de 50 palavras cada, espere aproximadamente 300 palavras erradas por lote (200 × 50 × 3%) antes de qualquer correção. Com 16% de CER em documentos árabes, esse mesmo lote tem milhares de caracteres suspeitos — a aritmética determina se revisão humana, um limite de confiança ou uma passagem de pós-correção com léxico é economicamente necessária.
Estas são fórmulas de estimativa aproximada, não um substituto para benchmark de seus próprios documentos. Cada intervalo publicado nesta página foi medido no corpus de outra pessoa — o único número de precisão que se aplica ao seu fluxo de trabalho é aquele que você mede nele. O valor desta página é definir a expectativa antes de você medir.
Perguntas Frequentes
Qual é a precisão do reconhecimento de escrita manual em 2026?
Depende quase inteiramente do tipo de escrita e do tipo de documento. Na escrita manual inglesa moderna (benchmark IAM), os melhores sistemas alcançam 1,22–1,71% de CER (CodeSOTA 2026; Crosilla 2025); a cursiva francesa é semelhante, com 1,63–1,91% (Crosilla 2025; Heyberger 2024); o árabe apresenta 8,9–16,3% de CER (IIETA 2024; MDPI 2024); e modelos gerais em manuscritos históricos pontuam 71–82% de CER (Crosilla 2025). Em 12 soluções comerciais em escrita manual diversa do mundo real, os escores de similaridade semântica variam de 46–95% (AIMultiple 2026).
Qual é o estado da arte no banco de dados de escrita manual IAM?
Em 2026, o GPT-5 relata ~1,22% de CER no IAM, com GPT-4o-mini em 1,71% de CER / 3,34% de WER (Crosilla 2025) e o especializado HTR-JAND em 1,23% de CER com correção de léxico (CodeSOTA 2024). No mesmo corpus, o estado da arte pré-transformer situava-se perto de 8% de erro de caracteres (Chowdhury & Vig, 2018) e sistemas típicos CNN-LSTM operavam com 7,5–8,4% de WER (PyLaia — arXiv 2409.17095) — as taxas de erro caíram várias vezes, mas o IAM continua sendo o benchmark de referência para escrita manual em inglês (657 escritores, 13.353 linhas).
A IA consegue ler escrita cursiva?
Sim — os principais modelos multimodais agora lidam bem com cursiva. No benchmark de 2025 da AIMultiple com 100 amostras de cursiva deliberadamente bagunçadas, o Gemini 3 Pro obteve 100% de similaridade semântica, com GPT-5 e olmOCR-2-7B no topo (AIMultiple, 2025); mecanismos OCR legados ficaram atrás do grupo. A cursiva continua mais difícil que a letra de forma — os caracteres são unidos, então a segmentação é ambígua — mas a diferença é uma questão de geração de modelo, não uma barreira absoluta.
Como a precisão da caligrafia se compara ao OCR de texto impresso?
O OCR de texto impresso atinge 98–99%+ de precisão de caracteres em documentos limpos (veja Precisão do OCR por Tipo de Documento), enquanto os melhores sistemas de caligrafia ficam em 98,3–98,8% de precisão de caracteres (1,2–1,7% CER) em inglês moderno — próximo, mas não igual — e caem para 83–91% em árabe e chinês, e abaixo de 30% para modelos gerais em documentos históricos (Crosilla 2025; IIETA 2024; PMC11951872 2024). A diferença entre texto impresso e manuscrito é de aproximadamente uma ordem de magnitude em cada escrita.
Por que a precisão do reconhecimento de caligrafia é tão baixa em documentos históricos?
Documentos históricos combinam escritas antigas, abreviações, tinta desbotada e vocabulários fora dos dados modernos de treinamento. O resultado é um efeito acentuado de especialização do modelo: mecanismos treinados para tarefa específica alcançam 3,6–6,2% CER no corpus READ-2016 e 4,8–6,05% nas escritas mais difíceis, como o glagolítico (Heyberger 2024; PMC12202554 2025), enquanto oito LLMs gerais pontuaram 71–82% CER — transcrição inutilizável (Crosilla 2025). O reconhecimento é possível, mas apenas com um modelo treinado para a coleção histórica específica.
O que é um bom CER para reconhecimento de caligrafia?
A escala de trabalho do campo, adotada na literatura de HTR, define CER abaixo de 5% como "muito bom", 5–10% como "bom" e abaixo de 2,5% como "excelente" (Muehlberger et al. 2019; Hodel et al. 2021, conforme aplicado por Crosilla et al. 2025). Em caligrafia moderna com escrita latina, os melhores sistemas estão na faixa "excelente"; em árabe, chinês e documentos históricos, "muito bom" (5–10%) é atualmente a meta realista de produção.
Qual é a diferença entre CER e WER no reconhecimento de caligrafia?
Taxa de Erro de Caracteres conta caracteres individuais lidos incorretamente; Taxa de Erro de Palavras (WER) conta palavras inteiras erradas, então um único caractere lido incorretamente falha uma palavra inteira. Em caligrafia, o WER normalmente fica 2–4× maior que o CER — no árabe KHATT, 8,9% CER coexiste com 37,6% WER (IIETA 2024). Sempre verifique qual métrica uma afirmação usa: "95% de precisão" significa coisas muito diferentes como CER, WER ou precisão em nível de documento.
Metodologia e Fontes
Como Esta Página Foi Construída
Esta página agrega dados de 15 fontes independentes abrangendo 2013–2026, dominada por artigos revisados por pares, relatórios de competições acadêmicas e uma pesquisa revisada por pares da TPAMI. As fontes foram selecionadas com base em três critérios: (1) metodologia documentada publicamente com tamanho de corpus declarado, (2) resultados relatados em corpora de benchmark nomeados (IAM, RIMES, CVL, KHATT, READ-2016, ICDAR-2013) ou conjuntos de teste industriais transparentes, e (3) relevância para reconhecimento de escrita manual em vez de alegações de marketing. Quando múltiplas fontes relatam a mesma dimensão, faixas conservadoras (valores mais baixos–mais altos relatados) são usadas — preferimos subestimar. Quando as fontes discordam significativamente, a discordância é explicada pelo nível de métrica, divisão do corpus ou regime de treinamento, em vez de ser diluída por média.
A distinção de métricas é a espinha dorsal desta página: CER, WER e Taxa de Caracteres Corretos (CR) nunca são combinados em um único número, e modelos treinados para tarefa específica versus modelos gerais são relatados como linhas separadas porque são regimes de medição diferentes nos mesmos documentos. Números autorrelatados por fornecedores são excluídos inteiramente — nenhuma alegação de precisão de escrita manual publicada por fornecedor sobreviveu ao teste de duas fontes independentes, o que por si só é uma descoberta (ver Limitações).
Lista de Fontes
- Crosilla, G., Klic, L. & Colavizza, G. — "Benchmarking Large Language Models for Handwritten Text Recognition," Journal of Documentation 81(7) (2025). Revisado por pares; 8 LLMs multimodais × 7 corpora (IAM, RIMES, READ-2016, Bentham, Leopardi, LAM, ICDAR-2017). Fornece IAM 1,71% CER/3,34% WER (GPT-4o-mini), RIMES 1,69% CER (GPT-4o), histórico 71–82% CER e as faixas de qualidade <5%/<2,5% CER.
- Heyberger, L. & Guyeux, C. — "Advancements and Challenges in Handwritten Text Recognition: A Comprehensive Survey," Journal of Imaging 10(1):18 (2024). Pesquisa revisada por pares; mais de 250 estudos. Fornece especificações de corpus (IAM 657 escritores/13.353 linhas, READ 30.000 páginas), SOTA em nível de linha (VAN 1,91% CER em RIMES) e resultados comerciais prontos para uso (DOCSUMO 11% CER, Transkribus 18% CER em RIMES).
- Garrido-Muñoz, C., Ríos-Vila, A. & Calvo-Zaragoza, J. — "Handwritten Text Recognition: A Survey," IEEE TPAMI 48(4) (2026). Pesquisa revisada por pares. Fornece SOTA em nível de parágrafo em IAM (VAN 4,7%, OrigamiNet 4,6%) e a redução de erro de 58% do paradigma CTC, além da crítica de generalização fora da distribuição dos benchmarks atuais.
- CodeSOTA — "IAM Leaderboard" (2024–2026). Agregador técnico de benchmarks; cada entrada vincula seu artigo original. Fornece CER/WER por modelo em IAM (GPT-5 ~1,22% CER, HTR-JAND 1,23% CER/3,78% WER, GPT-4o-mini 3,34% WER, DRetHTR-base 6,55% WER em IAM-A, MetaWriter 10,32% WER) e a observação de que OCR classe Tesseract não é adequado para escrita manual (~12,5% CER).
- "General Detection-based Text Line Recognition" (2024, arXiv 2409.17095). Pré-impressão com tabelas de comparação entre modelos. Fornece comparação de WER em IAM/READ/RIMES (DAN 5,01 WER em IAM, 4,10 em READ; DTrOCR 2,38 em IAM; melhor RIMES 1,99 com modelo de linguagem) e as estatísticas da divisão Aachen do IAM.
- "Data Augmentation for Offline Handwritten Text Recognition: A Systematic Literature Review," SN Computer Science (2023). Revisado por pares. Fornece números de generalização entre corpora: um modelo treinado em IAM pontua 10,89% CER / 26,24% WER em CVL vs 8,62% CER no próprio IAM, e a descrição do corpus CVL (cursiva em alemão/inglês).
- "A Comparative Study of Four Handwritten Text Recognition Models," Ingénierie des Systèmes d'Information 29(6) (2024). Revisado por pares; DAN/VAN/FCN/GFCN em KHATT. Fornece os melhores resultados em KHATT: DAN 8,9% CER / 37,6% WER; VAN 10,7% CER / 43,9% WER; e análise dos desafios da escrita árabe (letras totalmente conectadas, formas dependentes de posição).
- "Machine Learning Approach for Arabic Handwritten Recognition," Applied Sciences 14(19):9020 (2024). Revisado por pares; BiLSTM-CTC em KHATT. Fornece resultados BiLSTM em KHATT (13,2–15,8% CER / 27,31–31,6% WER) e linhas de base históricas (MDLSTM 31,3% WER, 2015); documenta os 1.000 escritores / 4.000 documentos do KHATT.
- Yin, F. et al. — "ICDAR 2013 Chinese Handwriting Recognition Competition". Competição acadêmica (IEEE). Fornece o resultado de reconhecimento de texto offline de 88,76% de taxa de caracteres corretos em conjuntos de teste derivados do CASIA-HWDB (1.020 escritores).
- "Attention-based Handwritten Chinese Recognition for Power Industry," (2024). Revisado por pares. Fornece o resultado ICDAR-2013 de 2024 (92,67% AR / 93,18% CR) e resultados HWDB (96,92% AR / 97,66% CR), mostrando a melhoria de 2013→2024 em texto offline chinês.
- "Assessing Advanced Handwritten Text Recognition Engines for Digitizing Historical Documents" (2025). Revisado por pares; cinco mecanismos × quatro escritas. Fornece CER por escrita: impressão romana 1,74–2,78%, República Croata 3,54–6,32%, glagolítica 4,83–6,05%, estenografia 9,53–11,9%.
- "Enhancing Handwritten Text Recognition Accuracy with Gated Mechanisms" (2024). Revisado por pares; GatedLexiconNet. Fornece um segundo ponto de dados IAM (WER 5,73% / CER 2,27%) e RIMES CER 0,9% / WER 2,76% de um modelo dedicado.
- AIMultiple — "Handwriting Recognition Benchmark: LLMs vs OCRs" (2025-11). Benchmark analítico neutro de fornecedor; 100 amostras cursivas de 10 escritores; pipeline de similaridade por cosseno. Fornece o benchmark somente de cursiva: Gemini 3 Pro 100%, GPT-5 e olmOCR-2-7B no topo entre 14 soluções.
- AIMultiple — "OCR Benchmark: Text Extraction / Capture Accuracy" (2026). Neutro de fornecedor; 12+ soluções. Fornece a faixa de escrita manual entre soluções de 46–95% e líderes por solução (GPT-5 95%, olmOCR-2-7B 94%, Gemini 2.5 Pro 93%).
- BusinessWareTech — "Handwritten Form Recognition Benchmark" (2025). Benchmark independente, grau C (conjunto de teste único, método transparente); 10 formulários reais preenchidos à mão. Fornece a constatação em nível de documento de que mesmo os melhores modelos permanecem abaixo de 95% em formulários reais, e que GPT-5 Mini / Gemini 2.5 Flash Lite lideraram.
Limitações
- Cobertura geográfica e de escrita: Os corpora em escrita latina dominam a literatura — inglês (IAM), francês (RIMES) e alemão (CVL, READ). O árabe (KHATT) e o chinês (CASIA-HWDB) têm cobertura sólida, porém mais limitada; japonês, coreano e devanágari não possuem benchmarks padronizados de CER/WER nas fontes que localizamos. A competição Indic do ICDAR 2023 (vencedor com 95,94% de taxa de reconhecimento de caracteres em dez escritas) é o único dado agregado para escritas indianas e não está incluída nas tabelas acima por usar uma métrica e um conjunto de escritas diferentes.
- Restrições metodológicas: As divisões de corpus diferem entre os artigos (IAM padrão vs divisão de Aachen) e produzem números significativamente diferentes para o mesmo modelo — os intervalos acima abrangem ambos quando publicados. Nenhum corpus importante rotula o estilo de escrita (letra de forma vs cursiva) por amostra, então a dimensão de estilo se baseia em benchmarks da indústria, e não em dados acadêmicos controlados. Os fornecedores de nuvem (Google, Microsoft, Amazon) não publicam medições de precisão específicas para escrita manual; seus números de "99%+" se aplicam a texto impresso, e não foram encontradas duas medições independentes de precisão de escrita manual — por isso nenhum dado de fornecedor com nota D aparece nesta página.
- Lacunas temporais: O número da competição chinesa do ICDAR 2013 (88,76% CR) tem 13 anos e foi usado como referência histórica junto com o resultado de 2024 no mesmo conjunto de teste. O corpus IAM data de 1999, mas continua sendo o benchmark de facto para escrita manual em inglês. Os resultados de LLM de 2025–2026 (GPT-4o-mini, GPT-5) são os dados mais recentes e devem mudar.
- O que não conseguimos encontrar: (1) um estudo controlado revisado por pares que isole a precisão de letra de forma vs cursiva no mesmo corpus; (2) qualquer benchmark de precisão de escrita manual publicado por fornecedores com metodologia transparente para Google Document AI, Azure Document Intelligence ou Amazon Textract; (3) um benchmark padronizado para documentos mistos (impresso + manuscrito), o caso mais comum no mundo real, atualmente coberto apenas pelo conjunto de 10 formulários da BusinessWareTech; (4) agregação de variação de precisão por escritor; (5) um benchmark da era LLM para escrita manual em chinês ou árabe comparável ao estudo Crosilla baseado no IAM. Essas lacunas são declaradas em vez de preenchidas com alegações não verificáveis.
Referências relacionadas: Precisão de OCR por Tipo de Documento · Taxas de Erro de Entrada Manual de Dados · Custo de Processamento de Documentos por Registro · O que é Reconhecimento Óptico de Caracteres (OCR)?
Leitura relacionada: Extração Acessível de Escrita Manual com IA para Pequenas Empresas · Como a Precisão da Extração de Escrita Manual com IA Melhorou