Sua lista de fornecedores tem 200 nomes
Cerca de 120 fornecedores reais
Um líder de compras em uma empresa de 140 pessoas recebeu um projeto de consolidação de fornecedores e um ponto de partida do financeiro: uma lista de mais de 200 fornecedores pagos no último ano. A lista existia. Um panorama utilizável dos gastos, não. O mesmo fornecedor aparecia "de 4 maneiras diferentes", como disse o autor da publicação, e nos registros de reembolso o campo de fornecedor continha nomes de funcionários em vez de nomes de empresas. Um comentarista no tópico estimou que as 200 linhas provavelmente correspondiam a cerca de 120 fornecedores reais (r/procurement).
Essa diferença entre 200 e 120 é o problema central. Você não consegue deduplicar uma lista de fornecedores até que o nome do fornecedor se torne uma chave confiável, e após um ano de compras com cartões pessoais sem rastreamento central, ele ainda não é.

Principais Conclusões
- 200 nomes de fornecedores geralmente correspondem a cerca de 120 fornecedores reais, e essa diferença não é um erro de digitação, mas o resultado padrão de um ano de compras com cartão pessoal.
- "AMZN MKTP US" e "Amazon.com" são o mesmo fornecedor, mas nenhuma correspondência difusa os conecta, porque o descritor truncado quase não compartilha caracteres com o nome da marca.
- Não há um cadastro mestre de fornecedores para limpar, apenas recibos e extratos que nunca estiveram em uma única tabela. Portanto, antes de comparar nomes, coloque todos os registros em uma única planilha com as mesmas colunas (ImageToTable.ai lê pelo nome da coluna, não pelo layout).
O Prazo de Consolidação Encontra uma Lista que Ninguém Consegue Usar

Uma lista de fornecedores do financeiro informa quem foi pago. Raramente informa de quem você realmente está comprando. A consolidação de gastos com fornecedores depende dessa segunda pergunta, e essas duas coisas parecem ser a mesma até você tentar somar os gastos por fornecedor e descobrir que nenhuma linha da mesma empresa concorda com o nome.
Os dados são completos o suficiente. O problema é que a chave não é confiável, e toda pergunta de consolidação depende dessa chave.
Classificar fornecedores por gasto total exige um nome estável. Identificar que três equipes pagam por softwares de gerenciamento de projetos sobrepostos exige um nome estável. Verificar se uma taxa negociada está realmente sendo usada exige um nome estável. Quando a chave é um nome digitado por uma pessoa diferente, em um dia diferente, para cada compra, nenhuma dessas perguntas pode ser respondida, e a alavancagem de negociação que você deveria criar nunca se materializa.
O custo de errar isso não é abstrato. O Open Standards Benchmarking da APQC indica que a organização mediana tem pagamentos duplicados ou errôneos equivalentes a 1,5% dos desembolsos anuais, com os melhores desempenhos ainda em 0,8% (APQC). A APQC aponta dados de baixa qualidade no arquivo mestre de fornecedores como uma das causas centrais (esta é a mesma classe de lista que você está tentando construir do zero). Uma empresa com US$ 10 milhões em gastos está diante de um vazamento de seis dígitos que uma melhor visibilidade dos fornecedores teria capturado.
Onde os Registros Realmente Estão

Em uma empresa sem sistema de compras, o registro do fornecedor não está em um único lugar. Ele está disperso em quatro fontes que nomeiam o fornecedor de maneiras diferentes.
Extratos de cartão
Conforme o descritor do comerciante indica. Esta é uma string gerada por máquina, não um nome escolhido por uma pessoa.
Recibos e PDFs de notas fiscais
O documento real, geralmente uma foto. Frequentemente é o único lugar onde o nome comercial verdadeiro aparece.
Relatórios de despesas
Enviados pelo funcionário que pagou. O pagamento é real, mas o campo "fornecedor" no relatório frequentemente contém o nome do próprio funcionário.
A exportação financeira
Uma planilha montada a partir dos itens acima. Ela cobre o que foi reembolsado ou lançado, não tudo o que foi comprado.
Portanto, a tarefa de consolidação não é "limpar o cadastro de fornecedores." Não existe cadastro de fornecedores. A tarefa é construir um a partir dos registros brutos primeiro, e só então iniciar o trabalho de correspondência de nomes que todos presumem que você começou.
Quatro Motivos Pelos Quais Um Fornecedor Aparece Sob Quatro Nomes

A variação de nomes de fornecedores tem causas mecânicas, e conhecê-las indica quais variantes são seguras para mesclar e quais exigem uma decisão humana.
Ninguém era dono do nome. Com compras descentralizadas, a pessoa que registra uma despesa escolhe o que digitar. Um funcionário escreve "Acme Supply", o próximo escreve "ACME SUPPLY LLC", um terceiro escreve "Acme". A deduplicação por correspondência exata, do tipo que o Excel faz com formatação condicional ou um COUNTIF, retorna quase nada, porque nenhuma das duas strings é idêntica.
O descritor do cartão é truncado e codificado. As operadoras de cartão limitam o descritor do comerciante (o limite é comumente de 22 caracteres), e os processadores o prefixam com sua própria etiqueta. Uma compra na Amazon pode aparecer no extrato como AMZN MKTP US, um pagamento via Square como SQ *MERCHANT. O nome da marca desaparece, substituído por um código. Um recibo da mesma compra diz "Amazon.com". Nenhum algoritmo de similaridade de strings conectará esses dois, porque eles compartilham quase nenhum caractere.
Nome legal, DBA e endereço de remessa são três strings diferentes. A entidade legal de um fornecedor pode ser "Northwind Logistics Holdings LLC", seu nome comercial pode ser "Northwind", e seu endereço de remessa pode pertencer a uma empresa de factoring ou a um processador de pagamentos. O IOFM observa que o campo DBA em um W-9 existe justamente para que um comprador possa conciliar um nome de fatura que difere do nome legal (IOFM). Grandes fornecedores também faturam por divisões, então a mesma empresa controladora pode aparecer como três fornecedores separados com o mesmo ID fiscal.
Os reembolsos registram o pagador, não o beneficiário. Quando um funcionário paga e é reembolsado, a transação no sistema de despesas está vinculada ao funcionário. O fornecedor pode aparecer apenas na imagem do recibo, ou em lugar nenhum se o recibo estiver faltando.
Quatro mecanismos, quatro nomes. Adicione diferenças de maiúsculas e minúsculas, pontuação e sufixos como Inc versus Incorporated, e a proporção de 200 para 120 deixa de parecer um caso atípico e passa a parecer o resultado padrão.
O que a Correspondência Difusa Pode e Não Pode Resolver
A correspondência difusa é o próximo passo padrão e resolve parte do problema. Ela pontua o quão semelhantes duas strings são, em vez de exigir que sejam idênticas. As medidas usuais são distância de edição (Levenshtein, onde a pontuação é o número de alterações de caracteres) e similaridade baseada em tokens (a mesclagem difusa do Power Query usa o algoritmo de similaridade Jaccard, conforme a documentação da Microsoft). Você define um limite de similaridade, e qualquer coisa acima dele é sinalizada como uma possível correspondência.
A correspondência difusa gera candidatos. Ela não toma decisões, e o limite que você escolhe decide qual erro você prefere: omissões ou mesclagens falsas.
O limite é onde ela falha. Reduza-o o suficiente para capturar "ABC Supply Inc." e "ABC Supply LLC", e ela começa a mesclar nomes não relacionados que por acaso compartilham tokens. Um leitor do Excel University documentou a falha com precisão: em um limite de 0,9, a ferramenta correspondeu "Titan" a "Twitch" e "SAVE" a "Pave", e reduzir para cerca de 0,5 para capturar as variantes Inc./LLC produziu falsos positivos demais para revisar (Excel University). Você não pode ajustar seu caminho para fora dessa troca apenas com nomes, e é por isso que a deduplicação em produção pondera o nome contra atributos de suporte, como endereço, ID fiscal, dados bancários ou padrão de transação.
Dois limites importam mais aqui do que o limite de similaridade. Primeiro, a correspondência difusa falha completamente em códigos descritores, porque "AMZN MKTP US" e "Amazon.com" não são strings semelhantes. Segundo, ela não pode decidir se três divisões de uma matriz devem ser um fornecedor ou três. Isso depende de você negociar com elas como um relacionamento ou três, e isso é uma decisão de negócio, não uma comparação de strings.
É também aqui que o trabalho difere de detectar um pagamento duplicado. Detectar que a mesma fatura foi paga duas vezes é uma comparação contra o histórico, e cobrimos esses modos de falha em detecção de faturas duplicadas. Construir uma lista limpa de fornecedores a partir de registros descentralizados e desorganizados é um problema de agrupamento em toda uma população, e precisa ser resolvido antes que qualquer verificação de pagamento duplicado possa ser confiável, porque uma verificação de duplicidade que se baseia em um nome inconsistente perde exatamente os pares que foi criada para encontrar.
Tanto a correspondência difusa quanto qualquer outra técnica de limpeza assumem uma coisa: que todos os registros já estão em uma única tabela com uma coluna de fornecedor utilizável. Após um ano de compras com cartão pessoal, eles não estão. Esse é o passo a corrigir primeiro.
Etapa Um: Coloque Todos os Registros em Uma Única Planilha com as Mesmas Colunas
Antes que qualquer nome possa ser normalizado, cada linha de recibo, fatura e extrato precisa existir em um só lugar, sob os mesmos cabeçalhos de coluna. Isso é um trabalho de extração de dados e vale a pena ser feito de forma que não dependa do layout do documento, porque você está lidando com fotos, digitalizações e PDFs de dezenas de comerciantes, todos formatados de maneiras diferentes.
O ImageToTable.ai usa Extração de Colunas Personalizadas: você digita os nomes das colunas desejadas e a IA localiza o valor correspondente em qualquer lugar da página, entendendo o que o campo significa em vez de onde ele está. Para este trabalho, o conjunto de colunas é pequeno e estável:
Vendor Name(exatamente como impresso no documento ou descritor)Transaction Date (YYYY-MM-DD)AmountCard(qual cartão foi usado na compra)Category (options: Software/Office/Travel/Meals/Other)
Duas dessas colunas trabalham mais do que aparentam. A instrução de formato de data, que a ferramenta chama de Format Requirement, faz com que a data de cada fornecedor seja registrada como a mesma string, então a classificação e a filtragem por período funcionam na primeira tentativa. A coluna Category é um exemplo de coluna inferida, onde a IA preenche um valor que não está impresso no documento, lendo o conteúdo do recibo e escolhendo entre as opções que você forneceu. É assim que a classificação acompanha a extração, em vez de se tornar uma etapa separada.
Como a ferramenta é do tipo Processamento Prioritário em Lote, você envia a pasta inteira e recebe uma única planilha mesclada, em vez de um arquivo por vez. Extratos de cartão que abrangem várias páginas são tratados pela mesclagem de várias páginas, uma configuração de modelo que agrupa páginas do mesmo extrato em um único registro, para que as informações de nível de conta acompanhem os itens de linha. Se você também tiver volumes de fim de ano para processar, o mesmo fluxo de lote e mesclagem é abordado em mais detalhes em processamento de extratos de cartão de crédito em lote.
Por onde você começa depende do que são os documentos. Se a maior parte da pilha são fotos de recibos e faturas por e-mail, o fluxo de trabalho recibo para Excel é o ponto de entrada mais rápido. Se for uma pilha de extratos mensais, comece pela página de extração de extratos de cartão de crédito. De qualquer forma, a saída tem o mesmo formato de tabela, que é o objetivo.
Os arquivos são processados com segurança e não são armazenados.
Uma coisa que o resultado não é: uma lista limpa de fornecedores. A extração entrega todos os registros em uma tabela, com o nome do fornecedor como aparece na fonte. Essa é a matéria-prima para a etapa de julgamento. Verificar esses nomes antes de confiar neles é fácil, pois passar o mouse ou clicar em qualquer célula extraída destaca o ponto exato na imagem original de onde veio, e clicar em uma região da imagem volta para a célula correspondente. Este é o Review Mode com verificação Bbox, e é isso que permite confirmar que uma string estranha é genuinamente o que o documento dizia, e não uma leitura incorreta.
Etapa Dois: Construa o Mapeamento Canônico Manualmente, Com os Dados à Sua Frente
A normalização do nome do fornecedor é uma tarefa de julgamento, e a resposta honesta é que você a faz manualmente, com a tabela extraída ordenada para que a ordem de decisão seja óbvia. Ordene pelo valor total em ordem decrescente e trabalhe de cima para baixo.
Para cada fornecedor, decida qual é o nome canônico e mapeie cada variante para ele em uma segunda coluna. Uma estrutura viável é de três colunas: o Vendor Name bruto da extração, uma coluna Vendor (canonical) que você preenche e uma nota de alias para as variantes que você incorporou. Isso preserva a string original para auditoria, ao mesmo tempo que oferece algo estável para pivotar.
O topo da lista se resolve rapidamente. Oito agências de design viram oito nomes canônicos. Três ferramentas de gerenciamento de projetos sobrepostas viram três, e agora você pode ver a sobreposição e decidir cortar uma. Um agrupamento de linhas de extrato lendo AMZN MKTP US, AMAZON.COM e AMZN Prime pertencem todas à Amazon, mas AWS é gasto com infraestrutura e geralmente pertence à sua própria linha, então a decisão de agrupamento não é apenas "mesclar qualquer coisa semelhante". Essa distinção é exatamente o que a correspondência difusa não consegue fazer, e é por isso que você revisa o mapeamento em vez de aceitar a saída de um algoritmo.
Use as colunas de apoio para confirmar, em vez de adivinhar. Se duas variantes compartilham um cartão, um intervalo de datas e um valor recorrente, muito provavelmente são o mesmo fornecedor. Se compartilham apenas um token como "Supply", provavelmente não são. Identificadores legíveis por máquina são a evidência mais confiável quando existem: um ID fiscal ou um endereço exato supera uma pontuação de similaridade de nome.
Se você quiser um ponto de partida em vez de uma coluna em branco, uma coluna inferida pode propor um agrupamento canônico ou um nome normalizado para cada linha. Trate como um rascunho. Verifique-o contra os totais de gastos antes de confiar nele e espere corrigir a cauda longa manualmente. O julgamento permanece com você porque a consequência de uma mesclagem errada (dois fornecedores reais colapsados em um, escondendo um relacionamento que você queria renegociar) é pior do que o custo de revisar os candidatos.
Esta é uma tarefa mais restrita do que padronizar os formatos dentro das faturas de um único fornecedor, que abordamos separadamente em padronizando dados de faturas de fornecedores. Aqui, o formato já é tratado no momento da extração; o que você está construindo é a camada de identidade sobre ele.
O que esta abordagem ainda não faz
As etapas acima producen uma lista limpa. Não removem o julgamento, e vale a pena ser claro sobre onde a automação para.
Não é um motor automático de deduplicação de mestre de fornecedores. A extração coloca cada registro em uma planilha com os nomes brutos dos fornecedores; não decide quais nomes são a mesma entidade. Esse mapeamento é seu para definir, e o trabalho da ferramenta é tornar esse mapeamento rápido de construir e fácil de verificar.
A correspondência difusa ainda falha em strings não relacionadas, como códigos de descritores, portanto, uma passada puramente algorítmica deixará o tipo de linha AMZN MKTP US sem mesclar. Se uma empresa-mãe e suas divisões são um fornecedor ou vários é uma decisão de negócios, não técnica, e nenhuna ferramenta pode tomá-la por você. E se um reembolso carrega apenas o nome do empregado, sem recibo anexado, pode não haver maneira de recuperar o fornecedor do registro. Esses casos têm que ser resolvidos a partir do extrato do cartão ou do empregado, não dos dados.
Reconciliar o extrato do cartão com seus livros é outra tarefa, e uma onde misturar cartões pessoais e da empresa cria seus próprios problemas, que cobrimos em reconciliación de cartão de crédito. Acertar a camada de fornecedores primeiro facilita essa reconciliação, porque você para de redecidir o mesmo fornecedor todo mês.
Deduplicando uma lista de fornecedores: FAQ
Não posso simplesmente usar a correspondência difusa do Excel Power Query na lista de fornecedores?
Você pode usá-la, e ela capturará algumas variantes, mas tem dois pontos ciegos para este trabalho específico. Não pode conectar um código de descritor a um nome de marca, porque não são strings similares. E o limiar que captura variantes de sufixo também mescla nomes não relacionados, então você acaba revisando cada candidato de qualquer maneira. Power Query é mais útil uma vez que os registros já estão em uma planilha e você está ajustando a lista de candidatos, não como o primeiro e único passo.
Preciso de um sistema completo de cadastro de fornecedores para uma empresa desse porte?
Para uma empresa de 100 a 300 pessoas, uma plataforma de gestão de gastos (Ramp, Brex, Expensify, Bill.com) resolve o problema contínuo ao direcionar gastos futuros por cartões que categorizam fornecedores e sinalizam duplicatas no momento da compra, e ferramentas como Coupa e Zip ampliam isso para compras maiores. Nenhuma delas reconstrói o registro do que já foi comprado com cartões pessoais. Essa lista histórica ainda precisa ser reconstruída a partir de documentos, que é a parte que esta abordagem resolve.
A IA extraiu os nomes dos fornecedores, mas eles ainda estão inconsistentes. E agora?
Isso é esperado. A extração reproduz o nome como ele aparece na fonte, e a fonte é inconsistente. O próximo passo é o mapeamento canônico: ordene por gasto, agrupe as variações e atribua um nome canônico por fornecedor real. A tabela extraída com uma coluna Fornecedor é o resultado final, e é isso que torna os totais confiáveis.
Como lidar com reembolsos que mostram apenas o nome do funcionário?
Use o recibo ou o extrato do cartão como fonte da verdade para o fornecedor e vincule-o ao reembolso por valor e data. Se o recibo estiver faltando, o descritor do cartão é o plano B, por isso capturar a string bruta do fornecedor no extrato é importante mesmo quando parece um código. Quando ambos estiverem ausentes, a despesa não é recuperável a partir dos dados e precisa ser tratada manualmente.
Com que frequência essa lista deve ser reconstruída?
Depois de ter o mapeamento canônico, a manutenção contínua é mais leve, porque novas compras de fornecedores existentes são mapeadas para nomes que você já definiu. Reexecute a extração e o mapeamento para novos gastos e revise os nomes não correspondentes em uma programação. Trimestral é a cadência que as equipes de contas a pagar costumam usar para revisão do cadastro de fornecedores, e isso evita que a lista se deteriore novamente em uma pilha de variações.
O gargalo na consolidação de fornecedores é a camada de identidade, e decidir a qual fornecedor cada registro pertence é o que leva tempo. Quando essa camada existe em uma planilha, classificar gastos e encontrar oportunidades de consolidação leva minutos em vez de semanas. Quando não existe, cada relatório que você cria com base na lista é tão estável quanto os nomes subjacentes. Para uma visão mais ampla de extrair dados estruturados de documentos de despesas, veja o guia de extração de dados de relatórios de despesas. Se os registros abrangem muitos meses, a extração de transações de fim de ano e o pipeline de conciliação de cartão de crédito mostram como a mesma tabela extraída alimenta a conciliação e o trabalho de correspondência de três vias sem ERP que se segue.