Extracción de datos por lotes

Extracción de datos por lotes: Procese varios documentos en una sola hoja de cálculo estructurada sin configurar por formato

Extraer datos manualmente de una pila de documentos toma unos 3 minutos por página; la extracción por lotes procesa cada página en 5-10 segundos, desde cualquier formato, en una sola hoja de cálculo. Sin plantillas, sin clasificación previa.

5-10 s por página · Cualquier formato (PDF/JPG/PNG) · Lote mixto · Hasta un 99 % de precisión en texto impreso

Procesamiento por lotes
PDF / JPG / PNG
Una hoja de cálculo
Columnas con nombre

Qué puede extraer de un lote de documentos

Nombre las columnas que necesita una sola vez: la IA extrae esos valores de cada documento de su lote al comprender su significado, sin importar el formato o diseño. Cada documento se convierte en una fila de una única hoja de cálculo.

Fecha del documento
Número/ID del documento
Proveedor / Remitente
Importe total
Importe de impuestos
Moneda
Descripción de línea de detalle
Cantidad
Precio unitario
Total de línea
Fecha de vencimiento
Categoría (inferida por IA)

Escribe estos nombres de columna una sola vez. La IA los aplica a cada documento del lote — ya sean PDFs, escaneos o fotos.

La extracción de datos por lotes suena sencilla… hasta que intenta configurarla

Toda herramienta promete "subir varios archivos, obtener una hoja de cálculo". La mayoría lo logra solo si todos los documentos comparten la misma plantilla y diseño. Cuando los proveedores varían, los formatos se mezclan y la calidad de origen difiere —el mundo real—, el costo de configuración se hace evidente.

Donde las herramientas tradicionales por lotes añaden costes ocultos de configuración

01

Una plantilla por diseño de documento significa una plantilla por proveedor. Las herramientas basadas en plantillas exigen un analizador por diseño; cuando la factura de cada proveedor tiene una disposición diferente, hay que crear y mantener una configuración distinta para cada uno. Incluso herramientas con IA como Nanonets o Rossum requieren entrenamiento o mapeo de campos por tipo de documento antes de procesar un lote. Un usuario en Reddit describió la situación sin rodeos: "Copiamos datos manualmente de PDF a Excel cada semana y nos lleva muchísimo tiempo." La solución de plantillas no elimina el trabajo, solo lo traslada de copiar a configurar.

02

Los formatos mixtos no se procesan juntos en la mayoría de herramientas. Los PDF nativos, las imágenes escaneadas y las fotos de móvil requieren procesos distintos en las herramientas OCR tradicionales. Los usuarios acaban ejecutando lotes separados por formato y luego fusionando los resultados manualmente. Un desarrollador en Reddit lo expresó claramente: "PDF es un formato de salida legible por humanos. No es un formato de entrada legible por ordenador": los procesos específicos por formato siempre tendrán problemas con lotes mixtos.

03

El tamaño del lote y la visibilidad del progreso son secundarios. Muchas herramientas procesan archivos uno a uno detrás de una única barra de progreso. Cuando un documento falla, no hay forma de saber cuál ni por qué. El verdadero cuello de botella no es la velocidad de la IA, sino la falta de estado por documento, que obliga a reverificar todo el lote manualmente.

Cómo la Extracción por Nombre de Columna Elimina la Configuración Previa al Primer Lote

01

Usted define el resultado, no las reglas de entrada. En lugar de crear un analizador para cada diseño, escribe los nombres de columna que necesita — Fecha del Documento, Proveedor, Monto Total, Impuesto, Fecha de Vencimiento — y la IA encuentra esos valores en cada documento al comprender su significado. "Fecha de Factura" en el PDF de un proveedor y "Fecha de Transacción" en un recibo escaneado de otro se resuelven en su columna "Fecha del Documento". Los nombres de columna son la única configuración y se aplican a todos los documentos del lote, independientemente del proveedor, formato o diseño. Esto es la Extracción de Columnas Personalizadas: la IA lee en busca de significado semántico en lugar de aplicar reglas posicionales.

02

Todos los formatos comparten un solo flujo — no se requiere clasificación previa. Suelte una carpeta con facturas en PDF, recibos escaneados en JPG y fotos móviles en PNG en la misma carga. El modelo de lenguaje visual lee cada archivo de la misma manera: observando los píxeles y extrayendo las columnas nombradas. No existe un "flujo PDF" frente a un "flujo de imagen" — solo un lote, una definición de columna, una hoja de cálculo de salida.

03

Progreso por documento y procesamiento independiente — un archivo defectuoso no arruina el lote. Cada documento se procesa de forma independiente con su propio estado registrado en tiempo real. La vista del lote muestra exactamente qué documentos se han completado, cuáles se están procesando y cuáles tuvieron problemas — sin una barra de progreso única que oculte fallos individuales. El procesamiento toma de 5 a 10 segundos por página (frente a ~3 minutos de ingreso manual por página), y la salida es un único archivo XLSX o CSV consolidado con las columnas que definió.

Extracción de datos por lotes en la práctica: de una carpeta con archivos variados a una hoja de cálculo limpia

Así es como se ve el flujo de trabajo cuando omite la configuración por formato y va directo a definir su salida.

1

Sube todo el lote — el formato no importa

Tu carpeta de fin de mes contiene 30 archivos: 18 facturas PDF de 10 sistemas ERP distintos, 7 recibos escaneados como JPG de oficinas de campo y 5 fotos móviles de albaranes manuscritos. Arrastra los 30 al área de carga. PDF, JPG, PNG, WebP — sin clasificación previa, sin paso de "seleccionar tipo de documento". La carga por lotes maneja aproximadamente 30 archivos a la vez, cada uno de hasta 10 MB.

2

Define tus columnas una vez — se aplican a cada documento

Escribe Fecha del Documento, Proveedor, Número de Factura, Importe Total, Importe del Impuesto, Fecha de Vencimiento. Estos se convierten en los encabezados exactos de tu hoja de cálculo de salida. La IA asigna "Fecha de Factura" en PDF digitales, "Fecha de Transacción" en recibos escaneados y "Fecha" en notas manuscritas a tu columna "Fecha del Documento" — comprendiendo el significado de cada campo, no emparejando una plantilla de tipo de documento. Opcionalmente, añade una columna calculada como Total de Línea (Cant. × Precio Unitario) y la IA realiza la aritmética durante la extracción.

3

Una sola hoja de cálculo de salida — cada documento es una fila

El procesamiento toma de 5 a 10 segundos por página. La salida es un único archivo XLSX: 30 filas, una por documento, con las columnas que definiste. Si la factura de un proveedor no muestra impuesto, esa celda queda vacía — no un cero inventado, no un fallo del lote. Cada fila se extrae de forma independiente, por lo que un escaneo de baja calidad no afecta a las otras 29. La IA también admite columnas inferidas — define una columna "Categoría" con opciones como "Factura / Recibo / Albarán / OC" y la IA clasifica cada documento mientras extrae, produciendo tanto los datos como la etiqueta del tipo de documento en una sola pasada.

Cuándo funciona mejor la extracción por lotes — y cuándo tener precaución

La extracción por lotes maneja de forma fiable formatos mixtos y diseños variados cuando los campos objetivo están etiquetados. Conocer los límites mantiene sus lotes funcionando sin problemas.

Cuándo funciona mejor

Lotes de formatos mixtos que comparten conceptos de campo comunes. Cuando cada documento tiene una fecha, un total y un nombre de proveedor en posiciones distintas, la IA los asigna a sus columnas con nombre sin necesidad de configurar cada documento.

Etiquetas impresas claras cerca de los valores. Hasta un 99% de precisión cuando los campos están etiquetados — "Fecha de factura:" y "Total:" en cualquier posición de la página.

~30 documentos por lote con visibilidad del estado de cada archivo. El estado de cada documento (procesando / completado / error) se ve en tiempo real. Volúmenes mayores se dividen en varios lotes, cada uno genera una hoja de cálculo independiente.

Cuándo tener precaución

Calidad de origen muy degradada. Recibos térmicos descoloridos, escaneos por debajo de 200 DPI o imágenes comprimidas con artefactos. La IA compensa usando el contexto mejor que el OCR tradicional, pero la mala calidad de origen es el mayor cuello de botella en precisión, independientemente del tipo de documento.

Campos muy específicos del documento sin un ancla semántica compartida. Si un documento contiene "Número de sello del contenedor" y nada más en el lote hace referencia a algo similar, la IA no tiene una señal entre documentos para anclarse. Los campos específicos de un tipo se extraen mejor cuando se agrupan con documentos similares.

Valores numéricos sin etiqueta y sin nombres de campo cercanos. Una cifra en dólares sola en un párrafo sin "Total" o "Importe" cerca no le da a la IA una etiqueta con la que coincidir. Los pares etiqueta-valor se extraen de forma fiable; los números aislados en texto narrativo pueden no hacerlo.

Preguntas frecuentes

¿Puedo extraer datos por lotes de PDFs, imágenes escaneadas y fotos de teléfono en una misma subida, o debo separarlos por formato?

Todos los formatos van en el mismo lote. Suba archivos PDF, JPG, PNG, WebP y AVIF juntos. El modelo de lenguaje visual procesa cada archivo en un solo flujo: lee los píxeles, comprende el contenido y extrae las columnas que usted nombró. Una Fecha del Documento encontrada en un PDF nativo se encuentra de la misma manera en un JPG escaneado o en una foto de móvil: mediante reconocimiento semántico, no detección de formato de archivo. No necesita lotes separados por formato ni clasificación manual previa.

¿Qué sucede si un campo que definí —como el Monto del Impuesto— no existe en algunos documentos del lote?

La IA deja esa celda vacía para ese documento, sin inventar un valor ni detener el lote. Una orden de compra sin línea de impuesto mostrará una celda en blanco en la columna Monto del Impuesto, mientras que las facturas del mismo lote que sí tengan impuesto tendrán el valor completado. Ningún error detiene el lote y ningún valor inventado se cuela en su hoja de cálculo. Esto es especialmente útil cuando su lote contiene distintos tipos de documento o formatos de proveedor que comparten campos superpuestos pero no idénticos: cada documento se procesa de forma independiente dentro del mismo marco de columnas.

¿Puedo extraer líneas de detalle en modo lote cuando cada documento tiene un número diferente de filas —desde un solo artículo en una factura hasta 50 líneas en una orden de compra?

Sí. La IA lee la estructura de cada documento de forma independiente y genera tantas filas de salida como contenga ese documento. Una factura de una sola línea produce una fila con los campos de cabecera (Fecha del Documento, Proveedor, Monto Total) y una fila de línea de detalle (Cantidad, Precio Unitario, Total de Línea). Una orden de compra de 50 líneas produce 50 filas, todas bajo los mismos encabezados de columna. No necesita predefinir recuentos de filas ni obtendrá una tabla rota por contenido de longitud variable. Las columnas calculadas como "Total de Línea (Cant. × Precio Unitario)" también funcionan en lotes de longitud variable.

¿Puedo añadir columnas calculadas a una extracción por lotes —por ejemplo, Total de Línea calculado como Cant. × Precio Unitario durante la ejecución del lote?

Sí. Las columnas calculadas le permiten definir cálculos que la IA realiza durante la extracción, sin necesidad de un paso posterior con fórmulas de Excel. Escriba "Total de Línea (Cant. × Precio Unitario)" como nombre de columna, y la IA multiplica los valores que encuentra para Cantidad y Precio Unitario en cada documento del lote, generando el resultado directamente. Esto funciona en todos los documentos, independientemente de cuántas líneas de detalle tenga cada uno. Para usuarios registrados, el Formato de Regla admite cálculos multi-paso más complejos, incluyendo agregación entre filas y lógica condicional.

¿Qué sucede si un documento del lote tiene mala calidad? ¿Afecta a los demás documentos?

No. Cada documento se procesa de forma independiente y su estado se registra en la vista del lote. Si un archivo en un lote de 30 es un escaneo descolorido, la precisión de extracción de ese documento será menor, pero los otros 29 archivos no se verán afectados. El documento de baja calidad sigue apareciendo en el resultado con los valores que la IA pudo extraer, y su fila se identifica claramente para su revisión. Para obtener los mejores resultados, escanee a 300 DPI o más, y use el estado por documento en la vista del lote para identificar qué archivos necesitan atención sin tener que reprocesar todo el lote.

📮 contact email: [email protected]