Comece aqui

Visão geral

O ImageToTable.ai transforma documentos em dados estruturados, e dados estruturados aqui significam mais do que valores de texto. Você define as colunas que deseja e a IA as preenche — lendo um valor da página, calculando um a partir de números que o documento mostra, inferindo um que o documento não informa ou localizando um elemento visual como assinatura ou logotipo e retornando sua posição na imagem. Resultados de um documento que chegou em várias páginas são mesclados em um único registro, e a tabela final é exportada em linhas e colunas que você pode classificar, somar, filtrar e alimentar em outro sistema — sem redigitação manual em nenhum momento.

O que é o ImageToTable.ai

Documentos entram, dados estruturados saem, sem redigitação manual no meio. Aponte o ImageToTable.ai para imagens, capturas de tela, PDFs, documentos do Word ou texto simples, e ele retorna as informações que eles contêm em linhas e colunas que você pode classificar, somar, filtrar, unir e alimentar em outro sistema. Ao longo do caminho, ele faz mais do que ler texto: pode calcular valores a partir de números que o documento mostra, inferir valores que o documento não informa e localizar um elemento visual como assinatura, logotipo ou carimbo na página.

O trabalho que ele substitui é a entrada manual de dados: uma pessoa lendo valores de recibos, faturas, extratos bancários ou formulários e digitando-os, linha por linha, em uma planilha. Com o ImageToTable.ai, essa etapa de digitação desaparece; a tabela volta já preenchida.

O caminho de um arquivo até uma tabela final é o mesmo todas as vezes: os valores são extraídos, as colunas que você configurou para calcular ou inferir produzem seus resultados, os resultados de um documento que chegou em várias partes são mesclados em um único registro, e a tabela concluída é exportada como dados estruturados.

Ele trabalha com um conjunto de arquivos, não um de cada vez. Os arquivos que você envia juntos formam um lote, que é a unidade que você processa, revisa e exporta; quantas linhas um arquivo contribui depende do que ele contém.

O que não é

Duas coisas com as quais este produto costuma ser confundido, e onde está a diferença:

  • Não é uma ferramenta de OCR apenas de texto. O OCR lê os caracteres de uma página e devolve o texto. Ele pode dizer quais palavras aparecem em um recibo, mas não qual delas é o fornecedor, o total ou o imposto. O ImageToTable.ai lê o que um documento significa além do que ele diz, então consegue encontrar os valores que você pediu mesmo quando nenhum rótulo fixo indica onde eles estão — e consegue localizar um elemento visual, como um retrato ou uma assinatura, sem ler nenhum texto.
  • Não é uma plataforma empresarial de fluxo de trabalho documental. Não é um sistema para desenhar cadeias de aprovação, roteirizar documentos entre equipes ou integrar com um sistema de registros antes que algo útil aconteça. Ele parte de um arquivo e da lista de valores que você quer de volta, e a saída é uma tabela.

A categoria à qual pertence é extração de dados estruturados: documentos entram, dados estruturados saem. Também é descrito como extração semântica ou baseada em intenção, porque o que decide o resultado é o que você pede, não onde os dados estão posicionados na página.

Você nomeia as colunas; a IA encontra os valores

Esse é o modelo inteiro. Você lista as colunas que quer — os mesmos nomes que digitaria como cabeçalhos de uma planilha — e a IA lê cada documento e retorna o valor que pertence a cada nome. Não há modelo de parsing para desenhar, zonas para delimitar em campos, nem modelo para treinar com seus documentos.

Como os nomes das colunas carregam o significado, a mesma lista funciona em documentos com layouts diferentes: um valor não precisa estar no mesmo lugar em todas as páginas para ser encontrado. Uma lista pode ser usada para uma execução única ou salva como um modelo reutilizável; se você preferir não nomear colunas, a IA pode ler o documento e propor uma estrutura de tabela por conta própria.

O valor de uma coluna não precisa ser texto impresso na página. O que uma coluna retorna é definido pelo que sua instrução pede:

  • Ler um valor impresso — o padrão, capturando o valor como aparece.
  • Calcular um valor — calcular a partir de números que o documento mostra, como um total de linha ou a diferença entre dois valores.
  • Julgar ou inferir um valor — decidir um que o documento não declara, como a categoria à qual um recibo pertence.
  • Localizar um elemento visual — em vez de ler texto, encontrar um retrato, assinatura, logotipo ou carimbo na página e retornar onde está; o aplicativo mostra uma prévia recortada dessa região, e o elemento localizado é o que vai para a tabela.

Calcular, julgar e localizar são o que diferencia o produto de uma simples leitura da página, e todos os quatro são configurados da mesma forma, pelo que a instrução da coluna pede. Colunas personalizadas explica como escrever cada tipo.

Onde uma conta se posiciona na escala de Nível de modelo define qual modelo de IA faz o trabalho e, portanto, quantos créditos cada arquivo custa. Quando um documento do mundo real chega como várias fotos ou páginas, a Mesclagem de várias páginas pode consolidar esses resultados em um único registro.

Para onde ir agora

Esta página é a orientação, não o manual. O caminho mais curto para o primeiro resultado está em Início rápido; o vocabulário usado no restante do site está definido no Glossário.

  • Início rápido — o caminho mais curto desde o cadastro até sua primeira tabela estruturada.
  • Modelos e colunas — o que é um modelo, do que uma coluna é feita e onde os modelos salvos podem ser reutilizados.
  • Colunas personalizadas — como uma coluna pode ler um valor diretamente, calculá-lo, inferi-lo ou localizar um elemento visual.
  • Nível de modelo — o nível de qualidade de processamento por trás de uma conta e o que isso significa para os créditos.
  • Mesclagem de várias páginas — transformar um documento recebido como vários arquivos de volta em um único registro.
  • Lotes — como os arquivos são agrupados, nomeados e rastreados durante o processamento.
  • Limites e especificações — tipos de arquivo suportados, limites de páginas e tamanho, e limites do plano.

Para desenvolver com a API em vez do aplicativo web, a documentação para desenvolvedores é um site separado: veja a Documentação da API.

📮 contact email: [email protected]