Por que a IA erra uma tabela no meu PDF?
Uma tabela em PDF pode parecer perfeita e ainda ser extraída na ordem errada. Veja o que quebra, onde o OCR ajuda e como conferir números importantes.
Você faz uma pergunta para a IA sobre uma tabela em um PDF. Ela responde com segurança, mas um número foi ligado ao mês errado. Ou o total parece certo, só que uma linha ficou de fora. O PDF está visualmente normal. O problema apareceu na extração.
Isso acontece porque uma tabela em PDF costuma ser um layout visual, não uma planilha. A página mostra linhas e colunas para os seus olhos. A camada de texto pode guardar essas palavras como uma sequência solta de fragmentos posicionados.
A tabela parece estruturada para você, não necessariamente para o extrator
Ao criar um PDF, cada pedaço de texto recebe uma posição na página. Um título, o valor de uma célula e uma nota de rodapé podem ser objetos separados. O arquivo pode lembrar onde foram desenhados sem lembrar que um pertence à coluna três, linha sete.
O extrator tenta reconstruir essa relação usando coordenadas. Se duas colunas ficam próximas, uma linha quebra ou o cabeçalho se repete na página seguinte, a ordem de leitura pode mudar. O resultado continua legível para uma pessoa, mas deixa de ser uma tabela confiável.
Quatro formas comuns de uma tabela ser lida errado
- As colunas se misturam. Valores de duas colunas vizinhas aparecem como um fluxo único de texto.
- As linhas quebram de forma inesperada. Um rótulo comprido empurra o valor para a linha seguinte, e a IA liga o valor à linha errada.
- Os cabeçalhos se repetem sem contexto. A quebra de página adiciona outro cabeçalho, mas o texto extraído não deixa clara a divisão.
- As notas parecem dados. Uma nota de rodapé ou subtotal pode virar outro registro, principalmente quando usa a mesma fonte e alinhamento.
Tabelas escaneadas ainda têm outro problema. Pode não existir camada de texto, então o OCR precisa adivinhar os caracteres e as posições antes de a IA receber o documento.
Por que o OCR não resolve todas as tabelas
OCR ajuda quando o PDF é apenas uma imagem da página. Ele transforma as letras visíveis em texto selecionável, o que já melhora bastante. Mas OCR não é o mesmo que reconstruir uma planilha. Bordas, células mescladas, células vazias, sobrescritos e cabeçalhos de várias linhas ainda podem perder o sentido.
Por isso, um resultado de OCR pode ser bom para pesquisar e ainda ser inseguro para fazer uma conta. Se a pergunta depende de um total exato, compare a resposta com a página renderizada.
Uma checagem prática antes de confiar na resposta
- Peça para a IA indicar a página e a linha usadas para cada número importante.
- Abra a página e acompanhe a linha inteira, não apenas o valor.
- Refaça os totais quando o resultado envolver dinheiro, conformidade ou uma decisão.
- Faça uma segunda extração se a ordem parecer estranha ou as colunas tiverem se juntado.
Você pode inspecionar a camada de texto localmente com o PDF para Markdown. Ele adiciona OCR para páginas escaneadas, mas o resultado ainda é uma extração. Trate-o como uma cópia de trabalho, não como prova de que a estrutura da tabela sobreviveu perfeitamente.
Tokens podem esconder o problema
Uma tabela quebrada pode ter uma contagem de tokens perfeitamente normal. As palavras ainda estão lá, então o Contador de Tokens do PDF pode mostrar um número plausível. A contagem diz quanto texto a IA pode receber. Ela não diz se as colunas foram ligadas corretamente.
A mesma diferença vale para custo. A Calculadora de Custo de Tokens estima quanto custa enviar o PDF extraído, mas uma conta menor não torna a tabela danificada mais confiável.
Resumindo
A IA pode errar uma tabela mesmo quando o PDF parece perfeito porque layout visual e ordem do texto são coisas diferentes. Extraia o texto, confira as linhas, valide números importantes contra a página e use OCR como uma etapa útil, não como garantia. Em tabelas importantes, a checagem final ainda é de uma pessoa.