Importação de PDF Divide o Excel em Planilhas.
Como Obter uma Única Tabela
A importação de PDF do Excel não falha de forma óbvia. Ela remodela seu arquivo em algo que parece analisado, mas não está. No tópico do r/excel perguntando qual recurso os usuários adicionariam ao Excel, um comentário principal nomeia o sintoma exato: importar dados de PDFs "sem ... espalhar cada página em uma planilha separada." Execute Dados > Obter Dados > De Arquivo > De PDF em um extrato de várias páginas e você obtém uma consulta por página, um novo conjunto de cabeçalhos Column1 e Column2 após a primeira página, e linhas cortadas na quebra de página. Você pediu uma planilha. O Excel retornou uma pilha de fragmentos.

Principais Conclusões
- Seu extrato de cinco páginas não está danificado: o PDF nunca continha uma única tabela, então o Power Query relata uma tabela por página.
- Apenas o primeiro fragmento mantém os títulos reais, então as páginas 2 e 3 recorrem a Column1, Column2 e Column3 e o Append Queries se recusa a alinhá-las.
- Pare de ler página por página e nomeie as colunas que você deseja; então o ImageToTable.ai lê o documento como um único registro e quarenta extratos viram quarenta linhas.
O que você realmente obtém ao importar um PDF de várias páginas

A importação quase nunca apresenta erro. Ela retorna a forma errada, e todos os sintomas posteriores decorrem dessa forma. Quando o Power Query se conecta ao seu arquivo, a janela do Navigator lista dois tipos diferentes de objetos: tabelas individuais perto do topo e páginas inteiras perto da base. Marque mais de um e o Power Query cria uma consulta separada para cada item. Escolha Carregar e o Excel grava cada consulta em sua própria planilha, então um extrato de cinco páginas se torna várias planilhas e a tabela que você queria agora está distribuída entre todas elas.
É daí que vem "um PDF se tornou várias planilhas". Não é um dano ao seu arquivo. É o conector relatando o que ele acredita ter encontrado, página por página. As linhas e colunas só parecem quebradas depois, porque cada uma dessas planilhas por página foi lida separadamente e recebeu seus próprios nomes de colunas.
Um PDF de várias páginas não chega como uma tabela danificada. Ele chega como várias tabelas pequenas que nunca foram unidas, e é por isso que nenhuma quantidade de reformatação resolve o problema.
Por que o Power Query vê uma tabela por página

O Power Query não está lendo mal o seu PDF. O formato PDF não contém uma tabela para ele ler. O PDF foi especificado como um formato de layout fixo, padronizado como ISO 32000, onde cada página é uma tela de texto e gráficos fixados em coordenadas. A ideia de que essas coordenadas formam uma tabela de três colunas com uma linha de cabeçalho é uma interpretação, e o formato só carrega essa interpretação quando o arquivo é um PDF marcado com estrutura lógica (ISO 32000, cláusula 14.8). A maioria dos PDFs exportados de sistemas contábeis e bancários não é marcada.
Então o conector da Microsoft precisa adivinhar, e a suposição fica exposta em uma única função. Pdf.Tables é o mecanismo por trás de Obter Dados > De PDF. Ele retorna uma tabela com três colunas, Nome, Tipo e Dados, e Tipo é Tabela ou Página. Uma de suas opções decide o quão agressiva é a suposição: MultiPageTables, que a referência do Pdf.Tables da Microsoft descreve como controlando "se tabelas semelhantes em páginas consecutivas serão automaticamente combinadas em uma única tabela". Seu padrão é verdadeiro.
Esse padrão explica exatamente o comportamento da divisão. Quando páginas consecutivas compartilham a mesma estrutura, o detector as trata como uma única tabela e as combina. Quando o layout muda de página para página — uma faixa de cabeçalho repetida, uma contagem diferente de colunas, um bloco de resumo que aparece em apenas uma página — o detector vê tabelas diferentes e relata uma por página. Quanto mais forte for a "mobília" por página do seu documento, maior a probabilidade de você obter fragmentos.
Esta é a parte que a maioria dos tutoriais ignora. Eles dizem para você clicar em Append e seguir em frente, sem explicar que o arquivo em si nunca conteve uma única tabela, então o conector não tinha nada para manter unido. O quadro completo do que um PDF pode e não pode carregar vale a pena entender antes de culpar a exportação; veja como PDFs se tornam dados estruturados para a versão mais ampla dessa história.
Por que os Cabeçalhos na Página 2 Viram Linhas de Dados

Os títulos das colunas existem uma única vez, no primeiro fragmento. Depois dessa página, as mesmas palavras são apenas valores de célula. Um usuário no Microsoft Q&A descreve exatamente a falha que isso produz: uma tabela de PDF que abrange três páginas é "identificada como três tabelas separadas", e "apenas a primeira tabela contém os títulos originais das colunas, e as outras duas tabelas exibem Column1, Column2, etc." Como os nomes das colunas não correspondem mais, as tabelas não podem ser anexadas sem edição. Você pode ler o tópico completo na publicação do Microsoft Q&A.
O mecanismo é simples quando você vê a forma da saída. Cada tabela por página é detectada de forma independente, então cada uma recebe sua própria etapa de promoção de cabeçalho. Na página um, "Usar Primeira Linha como Cabeçalhos" transforma corretamente Data, Descrição e Valor em nomes de colunas. Na página dois, não há linha de cabeçalho para promover, porque os títulos repetidos são simplesmente a primeira linha de dados. O Power Query recorre a Column1, Column2 e Column3. O Append Queries, que empilha tabelas combinando nomes de colunas, então se recusa a alinhá-las.
Onde as Linhas São Cortadas ao Meio na Quebra de Página
As quebras de página ocorrem onde o papel terminava, então uma descrição quebrada em várias linhas ou uma célula multilinha pode chegar como duas linhas. A própria documentação do conector de PDF da Microsoft lista isso como uma limitação conhecida em "Handling multi-line rows" e aponta para Table.FillDown para copiar valores desalinhados para a linha acima, ou Table.Group para combinar linhas adjacentes. Nenhum dos dois é executado automaticamente. A mesma página observa que EnforceBorderLines controla "se as linhas de borda são sempre aplicadas como limites de célula" e tem como padrão falso, então uma tabela desenhada sem regras completas pode ser analisada com as bordas de célula erradas.
Dois modos de falha agora se combinam. Um registro dividido em uma quebra de página se torna duas linhas, e o problema de cabeçalho da seção anterior significa que você pode nem notar, porque a segunda linha frequentemente perde o rótulo que a identificaria. Bordas de célula mescladas ou soltas pioram o mapeamento de colunas, um problema de extração separado abordado em por que células mescladas quebram a extração de tabelas.
Corrigindo no Excel: Append Queries e a Dança dos Cabeçalhos
O reparo é feito dentro do Excel, e são quatro etapas que você repete para cada arquivo cujo layout seja diferente. Funciona, e é manual. O truque é fazer cada fragmento parecer igual antes de empilhá-los e, em seguida, restaurar os cabeçalhos reais uma vez no final.
Selecione os fragmentos
No Navigator, marque Select multiple items e escolha as tabelas necessárias. Se a lista estiver confusa, você pode carregar o arquivo inteiro e filtrar a consulta em Kind para manter apenas as linhas Table.
Rebaixe os cabeçalhos da primeira tabela
No primeiro fragmento, use Transform > Use Headers as First Row. Os títulos reais das colunas caem nos dados, e a tabela agora usa Column1, Column2 e Column3 como as páginas seguintes.
Acrescente o restante
Use Home > Append Queries > Append as New e adicione todos os fragmentos restantes. Como todos agora compartilham os mesmos nomes de espaço reservado, as colunas se alinham sem renomear cada uma manualmente.
Promova os cabeçalhos de volta
Na consulta combinada, clique em Use First Row as Headers. Os títulos originais retornam como a linha superior, e as páginas empilhadas se tornam uma tabela contínua.
Duas ressalvas mantêm isso honesto. As etapas são salvas na consulta, então atualizar o mesmo arquivo é barato, mas um extrato cujo layout mude no próximo mês pode quebrar a detecção novamente e deixar você refazer a promoção do cabeçalho. E se o PDF for um scan sem camada de texto, não há nada para estruturar, porque o conector não executa OCR. Esse caso pertence a como fazer OCR de um PDF escaneado para o Excel.
Uma Abordagem Que Nunca Modela o PDF como Páginas
O resultado de uma planilha por página é um sintoma da leitura orientada à página, portanto, a alternativa é parar de ler página por página. Quando o objetivo é uma tabela em vez de uma cópia da página, você pode definir a saída primeiro e deixar que o documento seja a unidade de trabalho. Esta é a diferença entre leitura a nível de página e compreensão a nível de documento, e é aqui que uma ferramenta de extração começa a divergir de um importador de páginas.
Com Extraction de Colunas Personalizadas, você digita os nomes das colunas que deseja, como Número de Fatura, Data de Declaración e Monto, e esses nomes se tornam os cabeçalhos da tabela final. A ferramenta lê o documento para encontrar cada valor em vez de ler uma posição fixa, portanto, uma banda de cabeçalho que se repete no topo de cada página é tratada como mobiliário de página em vez de uma linha de dados. A saída é uma linha por registro, não uma planilha por página. Como a unidade é o documento, não há uma segunda página cujos nomes de columna possam desviarse do alineamento com a primeira.
Para uma carpeta em vez de um único archivo, o mesmo design se aplica em lote. Processamento Prioritário em Lote significa que você solta muitos PDFs de uma vez e eles se mesclam em uma única planilha com os mesmos cabeçalhos, de modo que quarenta estados de conta mensuales se convertem em quarenta filas em uma tabela em vez de quarenta hojas que você monta manualmente. A mecánica de fazer isso sem um editor de consultas está coberta em processamento de documentos em lote sem código. Se você quiser ver a forma da saída em seu próprio archivo antes de se comprometer, a demo incorporada abaixo é executada em uma muestra.
Os archivos são processados de forma segura e não são almacenados.
Quando Cada Página É Realmente Seu Próprio Documento
Uma tabela contínua é a resposta correta apenas quando as páginas pertencem ao mesmo registro. Às vezes não pertencem. Um PDF pode ser uma sequência de documentos de uma página não relacionados, um extrato de cliente diferente por página, uma digitalização de dezenas de notas fiscais separadas; nesse caso, forçá-los em uma única tabela geral mesclaria registros que deveriam permanecer separados. A decisão certa não é uma importação melhor; é uma regra de agrupamento.
É para isso que serve a mesclagem de várias páginas. É uma configuração de modelo que decide quais resultados extraídos pertencem ao mesmo documento lógico, e você configura como ela agrupa: iniciar um novo grupo sempre que o valor de uma coluna rastreada mudar, corresponder linhas que compartilham um número de referência em todo o lote, ou agrupar um número fixo de uploads. Quando o mesmo campo aparece em várias páginas de um grupo, você escolhe como resolver a sobreposição, mantendo o primeiro valor, mantendo o último, concatenando-os ou dividindo-os novamente em linhas separadas. O importante é a direção do controle. A ferramenta não adivinha silenciosamente quais páginas pertencem juntas; você fornece a regra, e ela aplica essa regra de forma consistente.
A precisão nas páginas que realmente pertencem juntas ainda merece uma verificação, que é o que o Modo de Revisão com Verificação Assistida por Bbox oferece. Passe o mouse ou clique em qualquer célula extraída e a imagem original destaca de onde veio aquele valor, e o inverso também funciona: clique em uma região do documento e ele salta de volta para a célula correspondente. Você pode acionar o destaque sob demanda para um único arquivo ou configurá-lo para ser executado automaticamente após o processamento. Para extratos em que um único dígito lido incorretamente importa, essa verificação visual é mais rápida do que reler a página.
FAQ
A importação Do PDF do Excel coloca automaticamente uma tabela de várias páginas em uma única planilha?
Às vezes. Quando páginas consecutivas compartilham a mesma estrutura de tabela, a opção MultiPageTables, que é verdadeira por padrão, combina-as em uma única tabela. Quando o layout muda de página para página, elas são detectadas como tabelas separadas e vão para planilhas separadas. Não há configuração que force páginas arbitrárias em uma única tabela.
Por que as páginas 2 e 3 mostram Column1 e Column2 em vez dos meus cabeçalhos?
A tabela de cada página é detectada separadamente, então a promoção de cabeçalho aplicada à página um não é transferida. Apenas o primeiro fragmento tem uma linha de cabeçalho real; os fragmentos posteriores usam nomes de espaço reservado, e é por isso que Append Queries falha até que os nomes coincidam.
O Google Sheets consegue importar um PDF de várias páginas como uma única tabela?
O Google Sheets não tem um conector nativo que detecte tabelas dentro de um PDF como o Power Query faz. A solução comum é converter o PDF para um formato intermediário e importá-lo, ou usar uma ferramenta de extração dedicada que retorne uma planilha diretamente. Ambas evitam planilhas por página, mas apenas a rota de extração evita o trabalho de limpeza.
E se meu PDF for um scan sem camada de texto?
O conector de PDF do Power Query não executa OCR, então um scan de imagem puro não tem texto para estruturar. Você precisa de uma etapa de OCR primeiro, ou de uma ferramenta que leia a imagem diretamente. As vantagens e desvantagens estão descritas em o guia de PDF escaneado para Excel.
Existe uma configuração de um clique para impedir a divisão das planilhas?
Não. O comportamento decorre de como um PDF armazena conteúdo, não de uma caixa de seleção. As opções integradas mais próximas são MultiPageTables para estruturas que coincidem e as etapas de Append Queries e cabeçalho para todo o resto. Se os arquivos forem muito grandes, PDFs enormes criam seus próprios problemas antes mesmo da divisão de páginas importar. E se você esperava que o Copilot absorvesse a limpeza, essa expectativa tem seus próprios motivos, abordados em por que o Copilot tem dificuldade com PDF para Excel.
Posso apenas converter o PDF para Excel em vez de importá-lo?
Pode, e é uma escolha razoável quando o documento é uma única tabela limpa e você só precisa dos números uma vez. Quando a entrada é uma pasta de documentos formatados de maneiras diferentes e a saída precisa manter colunas consistentes, uma conversão de PDF para Excel baseada em colunas é o caminho mais estável, porque os cabeçalhos são definidos por você em vez de detectados por página.
Quando você vê a divisão como uma escolha de modelagem em vez de dano, a decisão fica mais fácil. Se você tem alguns arquivos e tempo para manter uma consulta, a sequência de anexar e promover no Excel é suficiente. Se a tabela é o ponto central e as páginas são apenas embalagem, nomeie as colunas que você precisa e deixe o documento ser a unidade de trabalho. Você pode testar isso no seu próprio extrato sem configurar nada, e ver se o seu próximo PDF de várias páginas chega como uma tabela ou como uma pilha de planilhas.