La importación de PDF divide Excel en hojas.Cómo obtener una sola tabla

La importación de PDF de Excel no falla de forma evidente. Reestructura el archivo en algo que parece analizado, pero no lo está. En el hilo de r/excel que pregunta qué función añadirían los usuarios a Excel, un comentario destacado menciona el síntoma exacto: importar datos de PDF "sin ... esparcir cada página en una hoja de cálculo separada". Si ejecutas Datos > Obtener datos > Desde un archivo > Desde PDF en un extracto de varias páginas, obtienes una consulta por página, un nuevo conjunto de encabezados Column1 y Column2 después de la primera página, y filas cortadas en el salto de página. Pediste una hoja de cálculo. Excel devolvió una pila de fragmentos.

Deja de teclear datos — deja que la IA los lea por ti
Sube una imagen o PDF — datos estructurados en 10 segundos
Probar ahora →
Un icono central de una lupa sobre un documento, con tres nodos radiales: PDF de varias páginas, una tabla continua y lectura a nivel de página, sobre un fondo degradado limpio con decoraciones de líneas dibujadas a mano.

Conclusiones clave

  1. Tu extracto de cinco páginas no está dañado: el PDF nunca contenía una sola tabla, por lo que Power Query informa de una tabla por página.
  2. Solo el primer fragmento conserva los títulos reales, por lo que las páginas 2 y 3 recurren a Column1, Column2 y Column3, y Append Queries se niega a alinearlas.
  3. Deja de leer página por página y nombra las columnas que quieres; ImageToTable.ai lee el documento como un único registro y cuarenta extractos se convierten en cuarenta filas.

Lo que realmente obtienes al importar un PDF de varias páginas

Una comparación de dos columnas: el lado izquierdo muestra una pila de documentos etiquetada como 'Lo que obtienes' con 'Varias hojas, una por página' en rojo, el lado derecho muestra una tabla limpia etiquetada como 'Lo que quieres' con 'Una tabla continua' en verde, sobre un fondo degradado con decoraciones de líneas.

La importación casi nunca da error. Devuelve la forma incorrecta, y todos los síntomas posteriores derivan de esa forma. Cuando Power Query se conecta a tu archivo, la ventana del Navigator muestra dos tipos distintos de objetos: tablas individuales cerca de la parte superior y páginas completas cerca de la parte inferior. Si marcas más de una, Power Query crea una consulta independiente para cada elemento. Al elegir Load, Excel escribe cada consulta en su propia hoja, así que un extracto de cinco páginas se convierte en varias hojas de cálculo y la tabla que querías queda repartida entre todas ellas.

De ahí viene eso de que "un PDF se convirtió en varias hojas". No es un daño en tu archivo. Es el conector informando de lo que cree haber encontrado, página por página. Las filas y columnas solo parecen rotas después, porque cada una de esas hojas por página se leyó por separado y se le asignaron sus propios nombres de columna.

Un PDF de varias páginas no llega como una tabla dañada. Llega como varias tablas pequeñas que nunca se unieron, por eso ningún reformateo lo arregla.

Por qué Power Query ve una tabla por página

Un icono central de engranaje que representa Pdf.Tables, con tres nodos radiales: Formato de diseño fijo, MultiPageTables Predeterminado: Verdadero y Cambio de diseño detectado (ámbar), sobre un fondo degradado con decoraciones de líneas.

Power Query no está leyendo mal tu PDF. El formato PDF no contiene una tabla para que la lea. El PDF se especificó como un formato de diseño fijo, estandarizado como ISO 32000, donde cada página es un lienzo de texto y gráficos fijados a coordenadas. La idea de que esas coordenadas forman una tabla de tres columnas con una fila de encabezado es una interpretación, y el formato solo contiene esa interpretación cuando el archivo es un PDF etiquetado con estructura lógica (cláusula 14.8 de ISO 32000). La mayoría de los PDF exportados desde sistemas de contabilidad y banca no están etiquetados.

Así que el conector de Microsoft tiene que adivinar, y esa suposición queda expuesta en una sola función. Pdf.Tables es el motor detrás de Get Data > From PDF. Devuelve una tabla con tres columnas, Name, Kind y Data, y Kind es Table o Page. Una de sus opciones decide lo agresiva que es la suposición: MultiPageTables, que la referencia de Pdf.Tables de Microsoft describe como el control de "si las tablas similares en páginas consecutivas se combinarán automáticamente en una sola tabla". Su valor predeterminado es verdadero.

Ese comportamiento predeterminado explica con precisión el comportamiento de división. Cuando páginas consecutivas comparten la misma estructura, el detector las trata como una sola tabla y las combina. Cuando el diseño cambia de página a página —una banda de encabezado repetida, un número diferente de columnas, un bloque de resumen que aparece solo en una página—, el detector ve tablas diferentes y reporta una por página. Cuanto más marcado sea el mobiliario por página de tu documento, más probable será que obtengas fragmentos.

Esta es la parte que la mayoría de los tutoriales omiten. Te dicen que hagas clic en Append y sigas adelante, sin explicar que el archivo en sí nunca contuvo una sola tabla, por lo que el conector no tenía nada que mantener unido. La imagen completa de lo que un PDF puede y no puede contener vale la pena entenderla antes de culpar a la exportación; consulta cómo los PDF se convierten en datos estructurados para la versión más amplia de esa historia.

Por Qué los Encabezados de la Página 2 se Convierten en Filas de Datos

Una comparación de dos columnas: el lado izquierdo muestra un documento con una flecha hacia arriba etiquetada como 'Página 1' y 'Encabezados: Fecha, Descripción, Monto' en verde, el lado derecho muestra un documento con un signo de interrogación etiquetado como 'Página 2' y 'Encabezados: Column1, Column2, Column3' en rojo, sobre un fondo degradado con decoraciones de líneas.

Los títulos de las columnas existen una sola vez, en el primer fragmento. Después de esa página, las mismas palabras son solo valores de celda. Un usuario en Microsoft Q&A describe el fallo exacto que esto produce: una tabla PDF que abarca tres páginas es "identificada como tres tablas separadas", y "solo la primera tabla contiene los títulos de columna originales, y las otras dos tablas muestran Column1, Column2, etc." Debido a que los nombres de las columnas ya no coinciden, las tablas no se pueden anexar sin edición. Puedes leer el hilo completo en la publicación de Microsoft Q&A.

El mecanismo es sencillo una vez que ves la forma de la salida. Cada tabla por página se detecta de forma independiente, por lo que cada una recibe su propio paso de promoción de encabezado. En la página uno, "Usar la primera fila como encabezados" convierte correctamente Fecha, Descripción y Monto en nombres de columna. En la página dos no hay fila de encabezado que promover, porque los títulos repetidos son simplemente la primera fila de datos. Power Query recurre a Column1, Column2 y Column3. Append Queries, que apila tablas haciendo coincidir los nombres de las columnas, se niega a alinearlas.

Dónde se cortan las filas por la mitad en el salto de página

Los saltos de página caen donde termina el papel, por lo que una descripción ajustada o una celda de varias líneas puede llegar como dos filas. La propia documentación del conector PDF de Microsoft enumera esta limitación conocida en "Handling multi-line rows" y señala Table.FillDown para copiar valores desalineados a la fila superior, o Table.Group para combinar filas adyacentes. Ninguno se ejecuta automáticamente. La misma página indica que EnforceBorderLines controla "si las líneas de borde se aplican siempre como límites de celda" y su valor predeterminado es falso, por lo que una tabla dibujada sin reglas completas puede analizarse con bordes de celda incorrectos.

Ahora se combinan dos modos de fallo. Un registro dividido en un salto de página se convierte en dos filas, y el problema de encabezados de la sección anterior significa que quizás ni lo notes, porque la segunda fila a menudo pierde la etiqueta que la identificaría. Los bordes de celda fusionados o sueltos empeoran el mapeo de columnas, un problema de extracción aparte que se cubre en por qué las celdas fusionadas rompen la extracción de tablas.

Arreglarlo en Excel: Append Queries y el baile de encabezados

La reparación se ejecuta dentro de Excel y son cuatro pasos que repites para cada archivo cuyo diseño difiera. Funciona y es manual. El truco es hacer que cada fragmento se vea igual antes de apilarlos, y luego restaurar los encabezados reales una vez al final.

1

Selecciona los fragmentos

En Navigator, marca Select multiple items y elige las tablas que necesites. Si la lista es ruidosa, puedes cargar el archivo completo y filtrar la consulta por Kind para conservar solo las filas Table.

2

Degrada los encabezados de la primera tabla

En el primer fragmento, usa Transform > Use Headers as First Row. Los títulos de columna reales caen a los datos y la tabla ahora usa Column1, Column2 y Column3, igual que las páginas siguientes.

3

Anexa el resto

Usa Home > Append Queries > Append as New y añade cada fragmento restante. Como todos comparten ahora los mismos nombres de marcador de posición, las columnas se alinean sin renombrar cada una a mano.

4

Restaura los encabezados

En la consulta combinada, haz clic en Use First Row as Headers. Los títulos originales vuelven a la fila superior y las páginas apiladas se convierten en una tabla continua.

Dos advertencias mantienen esto honesto. Los pasos se guardan en la consulta, así que actualizar el mismo archivo es barato, pero un estado de cuenta cuyo diseño cambie el próximo mes puede volver a romper la detección y dejarte rehaciendo la promoción de encabezados. Y si el PDF es un escaneo sin capa de texto, no hay nada que estructurar, porque el conector no ejecuta OCR. Ese caso pertenece a aplicar OCR a un PDF escaneado para Excel.

Deja de teclear datos — deja que la IA los lea por ti
Sube una imagen o PDF — datos estructurados en 10 segundos
Probar ahora →

Una ruta que nunca modela el PDF como páginas

El resultado de una hoja por página es un síntoma de la lectura orientada a páginas, así que la alternativa es dejar de leer página por página. Cuando el objetivo es una tabla en lugar de una copia de la página, puedes definir primero el resultado y dejar que el documento sea la unidad de trabajo. Esta es la diferencia entre la lectura a nivel de página y la comprensión a nivel de documento, y es donde una herramienta de extracción empieza a diferenciarse de un importador de páginas.

Con Extracción de Columnas Personalizadas, escribes los nombres de columna que quieres, como Número de Factura, Fecha de Estado y Monto, y esos nombres se convierten en los encabezados de la tabla final. La herramienta lee el documento para encontrar cada valor en lugar de leer una posición fija, por lo que una banda de encabezado que se repite en la parte superior de cada página se trata como mobiliario de página en lugar de una fila de datos. El resultado es una fila por registro, no una hoja de cálculo por página. Como la unidad es el documento, no hay una segunda página cuyos nombres de columna puedan desalinearse con la primera.

Para una carpeta en lugar de un solo archivo, el mismo diseño se aplica en lote. Procesamiento por lotes prioritario significa que arrastras muchos PDFs a la vez y se fusionan en una sola hoja de cálculo con los mismos encabezados, de modo que cuarenta estados de cuenta mensuales se convierten en cuarenta filas en una tabla en lugar de cuarenta hojas que ensamblas a mano. Los detalles de hacerlo sin un editor de consultas se cubren en procesamiento por lotes de documentos sin código. Si quieres ver la forma del resultado en tu propio archivo antes de comprometerte, la demo integrada a continuación se ejecuta con una muestra.

PDF/JPG/PNG Extracción con IA

Los archivos se procesan de forma segura y no se almacenan.

Cuando cada página es realmente su propio documento

Una tabla continua es la respuesta correcta solo cuando las páginas pertenecen al mismo registro. A veces no es así. Un PDF puede ser una serie de documentos de una página sin relación entre sí, un estado de cuenta diferente por página, un escaneo de docenas de facturas separadas, en cuyo caso forzarlos en una sola tabla general fusionaría registros que deberían permanecer separados. La decisión correcta no es una mejor importación; es una regla de agrupación.

Para eso sirve la fusión de varias páginas. Es una configuración de plantilla que decide qué resultados extraídos pertenecen al mismo documento lógico, y usted configura cómo agrupa: iniciar un nuevo grupo cada vez que cambie el valor de una columna rastreada, emparejar filas que compartan un número de referencia en todo el lote, o agrupar cada número fijo de cargas. Cuando el mismo campo aparece en varias páginas de un grupo, usted elige cómo resolver la superposición: conservar el primer valor, conservar el último, concatenarlos o dividirlos de nuevo en filas separadas. Lo importante es la dirección del control. La herramienta no adivina silenciosamente qué páginas pertenecen juntas; usted proporciona la regla y ella la aplica de manera consistente.

La precisión en las páginas que sí pertenecen juntas aún merece una verificación, que es lo que proporciona el Modo de revisión con verificación asistida por Bbox. Pase el cursor o haga clic en cualquier celda extraída y la imagen original resalta de dónde proviene ese valor, y lo inverso también funciona: haga clic en una región del documento y salta de vuelta a la celda correspondiente. Puede activar el resaltado bajo demanda para un solo archivo o configurarlo para que se ejecute automáticamente después del procesamiento. Para estados de cuenta donde un solo dígito mal leído importa, esa verificación visual es más rápida que volver a leer la página.

Preguntas frecuentes

¿La importación Desde PDF de Excel coloca alguna vez una tabla de varias páginas en una sola hoja automáticamente?

A veces. Cuando las páginas consecutivas comparten la misma estructura de tabla, la opción MultiPageTables, que está activada de forma predeterminada, las combina en una sola tabla. Cuando el diseño cambia de página a página, se detectan como tablas separadas y terminan en hojas de cálculo separadas. No hay ninguna configuración que fuerce páginas arbitrarias en una sola tabla.

¿Por qué las páginas 2 y 3 muestran Column1 y Column2 en lugar de mis encabezados?

La tabla de cada página se detecta por separado, por lo que la promoción de encabezados que aplicaste a la primera página no se traslada. Solo el primer fragmento tiene una fila de encabezado real; los fragmentos posteriores usan nombres de marcador de posición, que es también por lo que Append Queries falla hasta que los nombres coinciden.

¿Puede Google Sheets importar un PDF de varias páginas como una sola tabla?

Google Sheets no tiene un conector nativo que detecte tablas dentro de un PDF como lo hace Power Query. La solución habitual es convertir el PDF a un formato intermedio e importarlo, o usar una herramienta de extracción dedicada que devuelva una hoja de cálculo directamente. Ambas evitan hojas por página, pero solo la ruta de extracción te evita la limpieza.

¿Qué pasa si mi PDF es un escaneo sin capa de texto?

El conector de PDF de Power Query no ejecuta OCR, por lo que un escaneo de imagen puro no tiene texto que estructurar. Necesitas un paso de OCR primero, o una herramienta que lea la imagen directamente. Las ventajas y desventajas se explican en la guía de PDF escaneado a Excel.

¿Hay un ajuste de un clic para evitar que las hojas se dividan?

No. El comportamiento se deriva de cómo un PDF almacena el contenido, no de una casilla de verificación. Las opciones integradas más cercanas son MultiPageTables para estructuras que coinciden y los pasos de Append Queries más encabezados para todo lo demás. Si los archivos son muy grandes, los PDF enormes crean sus propios problemas antes de que la división de páginas siquiera importe. Y si esperabas que Copilot absorbiera la limpieza, esa expectativa tiene sus propias razones, cubiertas en por qué Copilot tiene dificultades con PDF a Excel.

¿Puedo simplemente convertir el PDF a Excel en lugar de importarlo?

Puedes, y es una opción razonable cuando el documento es una tabla limpia única y solo necesitas los números una vez. Cuando la entrada es una carpeta de documentos con formatos diferentes y la salida debe mantener columnas consistentes, una conversión de PDF a Excel basada en columnas es la ruta más estable, porque los encabezados los defines tú en lugar de detectarlos por página.

El resultado de una hoja por página no es un defecto de tu archivo. Es lo que ocurre cuando se pide a un lector orientado a páginas que reconstruya una tabla orientada a registros, y la solución es unir los fragmentos deliberadamente o definir la tabla antes de leer nada.

Una vez que ves la división como una decisión de modelado en lugar de un daño, la decisión es más fácil. Si tienes pocos archivos y tiempo para mantener una consulta, la secuencia de anexar y promover en Excel es suficiente. Si la tabla es el punto y las páginas son solo empaque, nombra las columnas que necesitas y deja que el documento sea la unidad de trabajo. Puedes probarlo con tu propio extracto sin configurar nada, y ver si tu próximo PDF de varias páginas aterriza como una tabla o como un montón de hojas.

Deja de teclear datos — deja que la IA los lea por ti
Sube una imagen o PDF — datos estructurados en 10 segundos
Probar ahora →
📮 contact email: [email protected]