Conte tokens para GPT-4o, Claude ou Gemini e veja se o seu PDF cabe na janela de contexto, sem fazer upload.
Todo LLM tem uma janela de contexto, um limite de quanto texto pode processar de uma vez, medido em tokens. Um token equivale a mais ou menos três a quatro caracteres em inglês. Saber quantos tokens tem seu PDF antes de colar no chat ou numa chamada de API ajuda a evitar truncamento silencioso e planejar como dividir documentos grandes.
A ferramenta extrai o texto localmente e tokeniza no seu navegador. Ela mostra contagens exatas para modelos da OpenAI: o200k_base para GPT-5.x, GPT-4o e a série o, e cl100k_base para GPT-4 e GPT-3.5. Claude, Gemini e outros modelos atuais são estimados a partir dessas contagens exatas, porque os tokenizadores deles não são públicos.
O conteúdo do seu PDF é especialmente sensível aqui, porque você provavelmente está checando antes de mandar pra um sistema de IA. O PDFShore extrai e tokeniza inteiramente no seu navegador. O texto nunca sai do seu dispositivo e nada é registrado.
A ferramenta calcula contagens exatas para modelos da OpenAI: o200k_base para GPT-5.x, GPT-4o e a série o, e cl100k_base para GPT-4 e GPT-3.5 Turbo. Claude e Gemini não publicam tokenizadores para navegador, então essas linhas são estimativas. Use as contagens exatas para planejar e confira o provedor quando precisar de precisão de cobrança.
Conteúdo de imagem não pode ser tokenizado diretamente. Se seu PDF é um documento escaneado sem camada de texto embutida, a contagem vai ser muito baixa ou zero. Use PDF para Markdown com OCR habilitado primeiro pra extrair uma camada de texto.
Sim, como estimativas derivadas das contagens exatas do GPT. A linha do Claude multiplica a contagem do GPT-4 por cerca de 1,25, porque o tokenizer dele é mais denso em inglês. Gemini, Llama, Mistral e DeepSeek usam tokenizers da classe tiktoken, então as contagens deles caem na faixa entre GPT-4o e GPT-4 mostrada. Para precisão de cobrança, confira o contador do próprio provedor.
Uma página A4 ou carta cheia de texto costuma ter de 300 a 700 tokens, e 500 é um bom número para planejar. Tabelas densas, código ou outros idiomas puxam para cima, então contar o seu arquivo real vale mais que qualquer regra por página.
Não. Em inglês um token equivale a cerca de três quartos de uma palavra, então um PDF quase sempre tem mais tokens que palavras. Números, pontuação e palavras raras se dividem em tokens extras, por isso o total de tokens fica acima da contagem de palavras.