Resumen
ImageToTable.ai convierte documentos en datos estructurados, y aquí datos estructurados significa más que valores de texto. Usted indica las columnas que desea y la IA las completa — leyendo un valor de la página, calculando uno a partir de las cifras que muestra el documento, determinando uno que el documento no indica o localizando un elemento visual como una firma o un logotipo y devolviendo su posición en la imagen. Los resultados de un documento que llegó en varias páginas se fusionan en un solo registro, y la tabla final se exporta como filas y columnas que puede ordenar, sumar, filtrar e introducir en otro sistema — sin volver a escribir nada a mano en ningún momento.
Qué es ImageToTable.ai
Documentos de entrada, datos estructurados de salida, sin volver a escribir nada a mano en el proceso. Apunte ImageToTable.ai a imágenes, capturas de pantalla, PDF, documentos de Word o texto sin formato, y devolverá la información que contienen como filas y columnas que puede ordenar, sumar, filtrar, combinar e introducir en otro sistema. En el proceso hace más que leer texto: puede calcular valores a partir de las cifras que muestra el documento, determinar valores que el documento no indica y localizar un elemento visual como una firma, un logotipo o un sello en la página.
El trabajo que reemplaza es la introducción manual de datos: una persona que lee valores de recibos, facturas, extractos bancarios o formularios y los escribe, fila por fila, en una hoja de cálculo. Con ImageToTable.ai ese paso de escritura desaparece; la tabla vuelve ya completada.
El camino de un archivo a una tabla final es siempre el mismo: se extraen los valores, las columnas configuradas para calcular o determinar producen sus resultados, los resultados de un documento que llegó en varias partes se fusionan en un solo registro y la tabla completada se exporta como datos estructurados.
Funciona con un conjunto de archivos en lugar de uno a la vez. Los archivos que entrega juntos forman un lote, que es la unidad que procesa, revisa y exporta; cuántas filas aporta un archivo depende de lo que contenga.
Qué no es
Dos cosas con las que este producto se agrupa a menudo, y dónde radica la diferencia:
- No es una herramienta de OCR solo de texto. El OCR lee los caracteres de una página y devuelve el texto. Puede decirle qué palabras aparecen en un recibo, pero no cuál de ellas es el proveedor, el total o el impuesto. ImageToTable.ai lee lo que un documento significa además de lo que dice, por lo que puede encontrar los valores que usted solicitó incluso cuando ninguna etiqueta fija indica dónde se encuentran — y puede localizar un elemento visual como un retrato o una firma sin leer ningún texto en absoluto.
- No es una plataforma empresarial de flujo de trabajo documental. No es un sistema para diseñar cadenas de aprobación, enrutar documentos entre equipos o integrarse con un sistema de registros antes de que pueda ocurrir algo útil. Comienza con un archivo y la lista de valores que usted desea recuperar, y su resultado es una tabla.
La categoría a la que pertenece es la extracción de datos estructurados: documentos de entrada, datos estructurados de salida. También se describe como extracción semántica o basada en la intención, porque lo que decide el resultado es lo que usted solicita, no dónde se encuentra ubicado el dato en la página.
Usted nombra las columnas; la IA encuentra los valores
Ese es el modelo completo. Usted enumera las columnas que desea — los mismos nombres que escribiría como encabezados de una hoja de cálculo — y la IA lee cada documento y devuelve el valor que corresponde a cada nombre. No hay plantilla de análisis que diseñar, ni zonas que dibujar alrededor de los campos, ni modelo que entrenar con sus documentos.
Debido a que los nombres de las columnas transmiten el significado, la misma lista funciona en documentos cuyos diseños difieren: un valor no tiene que estar en el mismo lugar en cada página para ser encontrado. Una lista puede usarse para una sola ejecución o guardarse como una plantilla reutilizable; si prefiere no nombrar columnas en absoluto, la IA puede leer el documento y proponer una estructura de tabla por sí misma.
El valor de una columna no tiene que ser texto impreso en la página. Lo que devuelve una columna está determinado por lo que solicita su instrucción:
- Leer un valor impreso — el valor predeterminado, que toma el valor tal como aparece.
- Calcular un valor — calcular uno a partir de las cifras que muestra el documento, como un total de línea o una diferencia entre dos cantidades.
- Juzgar o inferir un valor — decidir uno que el documento no indica, como la categoría a la que pertenece un recibo.
- Localizar un elemento visual — en lugar de leer texto, encontrar un retrato, una firma, un logotipo o un sello en la página y devolver dónde se encuentra; la aplicación muestra una vista previa recortada de esa región, y el elemento localizado es lo que llega a la tabla.
Calcular, juzgar y localizar son lo que distingue al producto de una simple lectura de la página, y los cuatro se configuran de la misma manera, mediante lo que solicita la instrucción de la columna. Columnas personalizadas cubre cómo escribir cada tipo.
Dónde se sitúa una cuenta en la escala de Nivel de modelo determina qué modelo de IA realiza el trabajo y, por lo tanto, cuántos créditos cuesta cada archivo. Cuando un documento del mundo real llega como varias fotos o páginas, Fusión multipágina puede combinar esos resultados en un único registro.
Dónde continuar
Esta página es la orientación, no el manual. El camino más corto hacia un primer resultado está en Inicio rápido; el vocabulario que usa el resto del sitio se define en el Glosario.
- Inicio rápido — el camino más corto desde el registro hasta su primera tabla estructurada.
- Plantillas y columnas — qué es una plantilla, de qué está hecha una columna y dónde se pueden reutilizar las plantillas guardadas.
- Columnas personalizadas — cómo una columna puede leer un valor directamente, calcularlo, inferirlo o localizar un elemento visual.
- Nivel de modelo — el nivel de calidad de procesamiento detrás de una cuenta y qué significa para los créditos.
- Fusión multipágina — cómo convertir un documento que llegó como varios archivos de nuevo en un solo registro.
- Lotes — cómo se agrupan, nombran y rastrean los archivos durante el procesamiento.
- Límites y especificaciones — tipos de archivo admitidos, límites de página y tamaño, y límites del plan.
Para desarrollar con la API en lugar de la aplicación web, la documentación para desarrolladores es un sitio aparte: consulte la Documentación de API.