Por que o mesmo PDF custa valores diferentes no GPT-5, Claude e Gemini
O mesmo PDF vira um número diferente de tokens em cada modelo, então o custo muda também. Veja por quê e como comparar antes de enviar.
Passe o mesmo PDF pelo GPT-5 e pelo Claude e você vai ver, quase sempre, duas contagens de tokens diferentes. Mesmo arquivo, mesmo texto, número diferente. Aí chega a conta e ela também vem diferente. Isso pega todo mundo de surpresa e parece erro. Não é.
O motivo é simples quando você enxerga. Cada modelo conta tokens com o próprio tokenizer, e esses tokenizers cortam o texto de jeitos diferentes.
Token não é uma medida fixa
O tokenizer é o programinha que transforma seu texto nos pedaços que o modelo realmente lê. Um tokenizer pode ver "tokenização" como um único token. Outro quebra em "token" e "ização". Mesma palavra, contagem diferente. Faça isso ao longo de um PDF de 30 páginas e os totais se afastam.
Então "quantos tokens tem meu PDF" não tem uma resposta. Tem uma resposta por modelo.
O que cada família usa de verdade
- GPT-4o e GPT-5 usam uma codificação chamada o200k_base. É a mais eficiente do grupo, então costuma reportar menos tokens para o mesmo texto.
- GPT-4 e GPT-3.5 usam o cl100k_base, mais antigo, que geralmente fica um pouco acima.
- Claude usa o próprio tokenizer, e os modelos mais novos empacotam o texto de forma mais densa, então podem reportar bem mais tokens que o GPT para a mesma página.
- Gemini usa outra abordagem (SentencePiece), então a contagem dele fica num ponto próprio.
Nenhum está errado. São réguas diferentes medindo a mesma parede.
Por que a diferença de custo é maior do que parece
Duas coisas mexem na sua conta, e elas se somam.
Primeiro, a contagem de tokens muda por modelo, como acima. Segundo, o preço por token também é diferente por modelo. Um tokenizer mais denso somado a um preço por token mais alto faz o mesmo PDF custar várias vezes mais num modelo do que em outro. E a diferença não é só o preço de tabela. É o preço de tabela multiplicado por uma contagem de tokens que você não controlou.
Um exemplo do formato disso, não são números exatos: se o Claude transforma seu PDF em 20 por cento mais tokens que o GPT-5 e ainda cobra mais por token, a diferença real é esses dois multiplicados, não só a diferença de preço.
Como comparar de verdade
Dois passos, os dois locais e gratuitos.
Primeiro conte os tokens com o tokenizer certo. O Contador de Tokens de PDF mostra a contagem exata para as codificações da OpenAI (o200k para GPT-4o e GPT-5, cl100k para GPT-4) e uma estimativa marcada para Claude e Gemini, já que esses tokenizers não são publicados para o navegador.
Depois transforme essas contagens em dinheiro. A Calculadora de Custo de Tokens multiplica a contagem por modelo pelo preço publicado de cada provedor, então você vê a diferença real antes de enviar qualquer coisa. Dá para editar os preços quando eles mudam.
Uma ressalva honesta
Só a OpenAI publica um tokenizer que roda no navegador, então as contagens do GPT são exatas. Claude e Gemini são estimados a partir delas, perto o bastante para planejar, mas não para faturar. Quando um número precisa ser exato para cobrança, confira no contador do próprio provedor. Para escolher modelo e dimensionar orçamento, a estimativa já resolve.
Resumindo
Não existe uma contagem única de tokens para um PDF. Cada modelo mede com o próprio tokenizer, e o preço de tabela mais barato ainda pode perder para uma contagem mais densa. Conte com a codificação certa, converta para dólar por modelo e decida. Se quiser o lado da janela de contexto disso, veja limites de tokens de PDF por modelo.