¿Por qué mi extracción por lotes omitió
la mitad de los archivos? Modos de fallo comunes
Subiste 30 archivos. Solo 22 aparecieron en la hoja de cálculo. Sin mensaje de error, sin advertencia — solo la mitad de tus datos, faltante. Esto es lo que pasó, en orden de probabilidad.
Lo inquietante no son los 8 archivos que no llegaron. Es el silencio que los rodea. Una herramienta de procesamiento por lotes que mostró marcas verdes en todo el tablero, una descarga que parecía completa, y solo después — cuando intentaste conciliar las filas contra los originales — la brecha se reveló. Este patrón es más común de lo que la mayoría de los usuarios cree, y casi nunca es aleatorio. Los archivos no desaparecen sin dejar rastro. Fallan en etapas específicas del flujo, y cada modo de fallo deja una firma.
Este artículo recorre las tres etapas donde los archivos pueden perderse — carga, procesamiento y fusión de salida — en orden de probabilidad de ser el culpable. Al final, tendrás un marco de diagnóstico y una lista de verificación previa a la carga para detectar las causas más comunes antes de que se lleven otros 8 archivos de tu próximo lote.

Conclusiones clave
- Subiste 30 archivos, la herramienta mostró marcas verdes y la descarga parecía completa — pero solo salieron 22 filas, sin ningún mensaje de error para los 8 que desaparecieron.
- Los archivos no desaparecen al azar; fallan en tres puntos específicos del flujo — 60% en la carga (formatos no compatibles como TIFF, caracteres especiales en nombres de archivo, bytes corruptos), 30% durante el procesamiento (caídas de concurrencia, tiempos de espera silenciosos) y 10% durante la fusión (desajustes estructurales).
- Una lista de verificación de 30 segundos previa a la carga — ordenar por extensión, revisar archivos de más de 30MB, sanear nombres de archivo, agrupar por tipo de documento — detecta la mayoría antes de que fallen, y los 8 archivos faltantes casi con seguridad siguen en tu máquina listos para reprocesar.
Etapa 1: El archivo nunca superó la carga

Esta es la causa más común de archivos faltantes y también la más fácil de pasar por alto porque la barra de progreso de carga avanza sin problemas — solo deja de contar antes de que los archivos problemáticos entren en la cola. La herramienta registró estos archivos como "intentados" en lugar de "cargados", y sin un registro de errores por archivo, la brecha pasa desapercibida.
Formato de archivo no compatible
No todos los formatos de imagen y documento son iguales. La mayoría de las herramientas de extracción con IA — ImageToTable.ai incluida — admiten PDF, JPG, PNG, WebP y AVIF. Pero si su lote contiene un archivo TIFF, una foto HEIC de un iPhone o una captura BMP de un sistema más antiguo, el gestor de carga puede simplemente omitirlo. TIFF en particular es un infractor común: muchos escáneres aún usan TIFF de varias páginas por defecto, y aunque TIFF es un contenedor de imagen válido, no está en la lista de entrada de la mayoría de las herramientas de extracción. El archivo parece cargarse — el navegador lo envía — pero el proceso de procesamiento nunca lo recoge.
Cómo verificarlo: Ordene su carpeta de origen por extensión de archivo antes de cargar. Si ve .tiff, .heic, .bmp o .svg, conviértalos a JPG o PNG primero. La mayoría de los sistemas operativos pueden convertir por lotes en el Explorador de archivos o Finder. Un paso de conversión de 30 segundos ahorra horas de confusión posterior.
TIFF es el formato no compatible más común que interrumpe el procesamiento por lotes. Si su escáner usa TIFF por defecto, cambie la configuración de salida a JPEG o PDF antes de escanear el siguiente lote.
Archivos corruptos o incompletos
Un archivo que se abre correctamente en su máquina puede fallar en la verificación de integridad de la carga. El PDF puede tener una última página truncada por una descarga interrumpida desde la nube. La imagen puede tener un encabezado EXIF corrupto por una escritura fallida de la cámara. Un archivo que "se ve bien" en la vista previa — porque el sistema operativo muestra una miniatura en caché — puede fallar cuando la herramienta de extracción intenta leer sus bytes.
Esto es especialmente común con archivos descargados de adjuntos de correo electrónico o enlaces de almacenamiento en la nube. El archivo se abre, el contenido se ve correcto, pero el binario no está intacto. Las herramientas de extracción, a diferencia de los humanos que leen una vista previa, leen los bytes — y los bytes dañados producen resultados vacíos.
Cómo verificar: Intente abrir cada archivo sospechoso y volver a guardarlo. En Adobe Acrobat, use "Archivo → Guardar como → PDF optimizado" para eliminar la corrupción latente. Para imágenes, un re-guardado rápido en cualquier editor de fotos generalmente resuelve los problemas de encabezado.
Límites de tamaño de archivo
La mayoría de las herramientas de extracción limitan los tamaños de archivo individuales. En ImageToTable.ai, el límite de carga estándar acomoda documentos de oficina típicos, pero un PDF escaneado de 200 páginas o una foto de factura de alta resolución tomada a 48 megapíxeles puede excederlo. La herramienta no siempre rechaza la carga de manera visible — puede aceptar los metadatos del archivo pero omitir el contenido real cuando detecta que se ha superado el umbral de tamaño.
Cómo verificar: Revise sus archivos antes de cargarlos. Si algún archivo supera los 30-50 MB, considere dividir los PDF de varias páginas en documentos más pequeños usando un divisor de PDF, o reduzca la resolución de la imagen antes de la carga. Herramientas como PDFsam o la función "Dividir documento" de Adobe Acrobat manejan esto en segundos.
Caracteres especiales en nombres de archivo
Un modo de fallo poco apreciado. Archivos nombrados INV-2026-03-15_återbetalning.pdf o 收据-001.jpg o Invoice (final - DO NOT EDIT).pdf — con caracteres no ASCII, símbolos especiales o rutas de archivo muy largas — pueden fallar durante el paso de escritura en el servidor. La solicitud de carga se completa, el servidor acepta el flujo de archivo, pero cuando intenta escribir el archivo en el almacenamiento temporal usando el nombre de archivo original, el sistema de archivos rechaza la codificación de caracteres. El archivo se cuenta como "recibido" por la capa HTTP pero nunca llega al disco para su procesamiento.
Cómo verificar: Examine sus nombres de archivo para detectar cualquier cosa fuera de los caracteres alfanuméricos estándar, guiones y guiones bajos. Un cambio de nombre masivo rápido — INV-2026-03-15-refund.pdf en lugar del original — elimina esta variable por completo.
Etapa 2: Subidos pero eliminados silenciosamente durante el procesamiento

Esta etapa es más difícil de diagnosticar porque la subida confirmó el éxito. La herramienta muestra 30 archivos subidos, 30 indicadores verdes. Pero durante la fase de procesamiento — cuando la IA lee realmente cada documento y extrae los datos — los archivos pueden caerse de la cinta transportadora sin activar un estado de error. La interfaz de procesamiento dice "Completado" porque el motor principal terminó su trabajo, pero procesó menos documentos de los que se subieron.
Limitación de concurrencia y límites de cola
La extracción con IA es computacionalmente costosa. Cada documento requiere una inferencia del modelo de visión, que consume memoria de GPU y rendimiento de API. Para mantener la estabilidad, las herramientas de extracción aplican límites de concurrencia — normalmente de 4 a 8 ranuras de procesamiento simultáneas por usuario. Cuando subes 50 archivos, entran en una cola y la herramienta los procesa en oleadas: 4 a la vez, luego los siguientes 4, y así sucesivamente.
El problema surge cuando la cola tiene un límite máximo estricto. Algunos sistemas eliminan silenciosamente los archivos que superan la profundidad de la cola. Si tu plan permite 50 archivos por lote pero solo 4 ranuras concurrentes, y el motor de procesamiento encuentra un error persistente en uno de los primeros 4 archivos — por ejemplo, un PDF corrupto que bloquea el lector — puede detener toda la oleada el tiempo suficiente para que los archivos restantes en la cola agoten el tiempo de espera y se descarten. La interfaz sigue mostrando "50 subidos, 46 procesados" — pero los 4 que faltan nunca se intentaron realmente.
Cómo comprobarlo: Divide tu subida en lotes más pequeños de 10 a 15 archivos y procésalos secuencialmente. Si un lote específico pierde archivos de forma constante mientras que los lotes más pequeños no, la limitación de concurrencia es la culpable. Este comportamiento está documentado en múltiples sistemas de procesamiento por lotes — desde Google Document AI hasta canalizaciones de OCR autoalojadas — donde la diferencia entre los recuentos de "subidos" y "procesados" es casi siempre un artefacto de la cola.
Tiempos de espera silenciosos en PDF grandes o complejos
Un PDF con más de 100 páginas o gráficos incrustados complejos puede superar el tiempo de espera de procesamiento por documento del motor de extracción. A diferencia de un error de tiempo de espera explícito — que le indicaría que el archivo falló — algunos sistemas manejan esta situación omitiendo silenciosamente el archivo y continuando con el siguiente. El trabajo de procesamiento registra el archivo como "completado" porque el controlador de tiempo de espera cerró el hilo de forma ordenada, pero no se generó ningún resultado de extracción.
Esto es especialmente común con PDF escaneados que son esencialmente 100 imágenes JPEG separadas agrupadas en un solo archivo. Cada página requiere un pase completo de OCR, y el tiempo acumulado puede superar el umbral de tiempo de espera en la página 70 — después de lo cual el procesador descarta el trabajo acumulado y continúa.
Cómo verificar: Suba el archivo problemático individualmente. Si se procesa correctamente como carga independiente pero se omite en el modo de lote, la causa es el tiempo de espera durante la cola de procesamiento por lotes. Para PDF de varias páginas que superen las 30 páginas, considere dividirlos en documentos más pequeños antes de la carga por lotes.
Tipos de archivo mixtos que se comportan de manera diferente
No todos los tipos de archivo se procesan a la misma velocidad. Un lote que mezcla capturas de pantalla JPG de una sola página con PDF escaneados de 50 páginas crea un ritmo de procesamiento desigual. Los JPG ligeros terminan rápidamente, mientras que los PDF pesados consumen un tiempo de procesamiento desproporcionado. Si el tiempo de espera del lote se calcula sobre el tiempo total de procesamiento de todos los archivos, los PDF lentos pueden hacer que los JPG que llegaron más tarde en la cola se descarten — aunque los JPG se habrían procesado bien por sí solos.
Este es un problema a nivel de sistema que afecta a cualquier herramienta de extracción por lotes, no una peculiaridad de un producto específico. La causa subyacente es que los pipelines de procesamiento normalmente agrupan archivos de manera heterogénea pero miden el tiempo de espera de manera homogénea.
Cómo verificar: Agrupe los archivos por tipo y tamaño antes de subirlos. Procese todos los archivos JPG pequeños en un lote y luego maneje los PDF grandes por separado. Esto aísla los archivos lentos de los rápidos y elimina la contaminación cruzada en la lógica de tiempo de espera.
Etapa 3: Procesados pero perdidos en la fusión

El modo de fallo más raro pero más engañoso. Los 30 archivos se subieron correctamente, los 30 fueron procesados por la IA, los 30 devolvieron resultados de extracción. Pero la salida final fusionada — la única hoja de cálculo que descargó — contiene solo 22 filas. Las otras 8 se procesaron como documentos individuales pero nunca se integraron en la exportación unificada.
Estructuras de archivo diferentes que producen filas desalineadas
Cuando ejecuta extracción por lotes en un conjunto de documentos, el motor de procesamiento por lotes de la herramienta intenta fusionar los resultados en una sola tabla con encabezados de columna coherentes. Esto funciona sin problemas cuando todos los archivos son del mismo tipo — 30 facturas, por ejemplo. Pero si su lote contiene 25 facturas y 5 notas de crédito, las notas de crédito pueden tener campos diferentes (como "Número de nota de crédito" en lugar de "Número de factura"), lo que hace que el algoritmo de fusión cree columnas duplicadas o — en algunas implementaciones — omita filas cuya estructura no coincide con el esquema mayoritario.
Esto no es una pérdida de datos en sentido estricto; la extracción fue exitosa. Pero la lógica de exportación trató estos 8 archivos como valores atípicos estructurales y los excluyó de la tabla unificada para preservar la coherencia de las columnas. La herramienta nunca se lo dijo porque, desde su perspectiva, entregó la fusión más limpia posible.
Cómo verificarlo: Busque diferencias entre sus archivos de origen. Si un subconjunto tiene una orientación de página diferente, un idioma diferente o un tipo de documento fundamentalmente distinto, procese esos archivos como un lote separado. La definición de "lote" importa — su flujo de trabajo debe agrupar archivos por similitud estructural, no por conveniencia de carpeta.
Este problema es particularmente común al procesar por lotes documentos similares pero no idénticos, como extraer tablas de documentos con celdas fusionadas o estructuras anidadas, donde el número de filas por documento varía de manera impredecible.
Lista de verificación previa a la carga — 30 segundos por lote
La mayoría de los modos de falla anteriores comparten un rasgo común: se pueden detectar antes de la carga con una revisión visual rápida de tu carpeta de origen. Trata esta lista como el filtro entre "listo para procesar" y "iniciar el lote". Lleva menos tiempo que solucionar 8 archivos faltantes después.
- Auditoría de formato de archivo — Confirma que cada archivo sea JPG, PNG o PDF. Convierte cualquier TIFF, HEIC, BMP o WebP. Una ordenación rápida por extensión en el Explorador de archivos revela los valores atípicos de inmediato.
- Revisión de tamaño de archivo — Verifica si hay archivos de más de 30 MB. Si ves alguno, divídelo o comprímelo.
- Limpieza de nombres de archivo — Renombra archivos que contengan caracteres especiales (&, %, #, paréntesis) o letras no ASCII (é, ü, å, 中). Limítate a
A-Z,0-9, guiones y guiones bajos. - Verificación de homogeneidad de tipo — ¿Son todos los archivos del mismo tipo de documento? Si mezclas facturas con notas de crédito, órdenes de compra con recibos de entrega, sepáralos en lotes dedicados.
- Prueba puntual con un archivo pesado — Sube tu PDF más grande individualmente y verifica que se procese correctamente. Si se agota el tiempo solo, definitivamente fallará en un lote.
- Cordura del tamaño del lote — Si tienes más de 30 archivos, divídelos en lotes más pequeños de 10 a 15. Los lotes más pequeños aíslan problemas y se completan más rápido de principio a fin.
Cuándo escalar — ¿Es esta la herramienta adecuada para tus archivos?
Ser honesto sobre las limitaciones de la herramienta evita frustraciones repetidas. Si pierdes archivos constantemente en varios lotes y la lista de verificación previa a la carga no revela la causa, considera si tu conjunto de documentos tiene características que van en contra de las suposiciones de diseño de la mayoría de las herramientas de extracción.
Las herramientas de extracción por lotes, incluido ImageToTable.ai, están diseñadas para el caso común: documentos de oficina estándar, escaneos limpios y fotos con contenido legible. No están diseñadas para:
- Documentos individuales extremadamente grandes — Los PDF de más de 500 páginas pertenecen a un canal de gestión de documentos dedicado, no a una cola de extracción por lotes.
- Colecciones altamente heterogéneas — 15 tipos de documentos diferentes en una carpeta llevarán a cualquier motor de fusión al límite. Sepáralos.
- PDF cifrados o con gestión de derechos — Los archivos protegidos por contraseña son omitidos por prácticamente todas las herramientas de extracción. Elimina la protección antes de subirlos.
- Documentos que necesitan posicionamiento de píxel perfecto — Si tu caso de uso requiere conocer las coordenadas X,Y exactas de cada campo, una herramienta de OCR zonal basada en plantillas puede ser más apropiada que un motor de extracción semántica.
Si tus archivos caen en alguna de estas categorías, la solución no es una mejor resolución de problemas, sino ajustar tu flujo de trabajo para que coincida con el diseño de la herramienta. Eso no es un fallo de la herramienta ni de tu proceso. Es una señal de que las características específicas de tu documento necesitan un enfoque diferente para el proceso de extracción.
Preguntas Frecuentes
¿Por qué mi herramienta de extracción no muestra un error cuando fallan los archivos?
La mayoría de las herramientas de extracción reportan a nivel de lote ("30 archivos subidos") en lugar de a nivel de archivo individual. Si un archivo falla durante la carga sin registrarse en la cola de procesamiento, la herramienta no tiene constancia de que estaba destinado a procesarse. La brecha entre tu conteo mental y el conteo de la herramienta existe en el límite donde la responsabilidad pasa de ti al sistema. Las herramientas que brindan seguimiento de estado por archivo son la excepción, no la norma. Una ejecución de OCR por lotes que rastrea el estado por archivo es una de esas excepciones, mostrando en cola, procesando, completado o fallido para cada documento.
¿Puedo recuperar datos de archivos que se omitieron durante el procesamiento por lotes?
Sí, en la mayoría de los casos. Los archivos que fallan durante la carga o el procesamiento generalmente permanecen intactos en tu máquina local. Pásalos por la lista de verificación previa a la carga, corrige el problema identificado (conversión de formato, renombrado, división) y procésalos individualmente o en un lote más pequeño.
¿El orden de los archivos en el diálogo de carga afecta qué archivos se omiten?
No en la mayoría de los sistemas, pero puede parecerlo. Si subes 30 archivos y la cola de procesamiento los procesa en el orden recibido, los archivos que llegan más tarde a la cola tienen más probabilidades de verse afectados por tiempos de espera acumulativos. La solución es reducir el tamaño del lote en lugar de reorganizar el orden de los archivos.
¿Cómo sé si un archivo está corrupto antes de subirlo?
Intenta abrirlo en su aplicación nativa — Adobe Acrobat para PDFs, un visor de fotos para imágenes. Si se abre sin advertencias, probablemente esté intacto. Para verificación por lotes, herramientas como pdfinfo (Linux) o la herramienta "Preflight" de Adobe Acrobat pueden escanear múltiples PDFs para verificar su integridad estructural. Un guardado rápido de los archivos sospechosos generalmente resuelve la corrupción latente.
¿Cuál es el número máximo de archivos que debo incluir en un solo lote?
La mayoría de las herramientas admiten 30-50 archivos por lote, pero la fiabilidad suele alcanzar su punto máximo con 10-15. Los lotes más pequeños se completan más rápido, facilitan el aislamiento de archivos problemáticos y reducen el impacto de la limitación de concurrencia y los tiempos de espera acumulativos. El tamaño del lote es una compensación de fiabilidad, no un límite de funciones.
No Adivines — Diagnostica
Un archivo faltante en una extracción por lotes rara vez es un misterio una vez que sabes dónde buscar. Los fallos de carga representan aproximadamente el 60% de los casos: formatos no compatibles, corrupción y problemas con nombres de archivo. Los fallos de procesamiento (caídas de concurrencia, tiempos de espera, conflictos de tipos mixtos) representan otro 30%. Las omisiones de fusión, el modo de fallo más silencioso, constituyen el 10% restante. Cada uno tiene una solución, y la mayoría de esas soluciones toman menos de un minuto en aplicarse.
Los 8 archivos que perdiste en tu último lote casi con certeza siguen en tu máquina, intactos y listos para procesarse una vez que identifiques la puerta específica que no pudieron cruzar. La diferencia entre "la extracción por lotes omite archivos" y "la extracción por lotes funciona de manera confiable" es saber qué puerta falló y por qué.
Ejecuta la lista de verificación en tu próximo lote. Seguirás teniendo 30 archivos entrando, pero obtendrás 30 filas saliendo.
Sin registro necesario · Funciona con JPG, PNG y PDF