Cuenta tokens para GPT-4o, Claude o Gemini y comprueba si tu PDF cabe en la ventana de contexto, sin subirlo.
Todo LLM tiene una ventana de contexto, un límite de cuánto texto puede procesar a la vez, medido en tokens. Un token equivale a unos tres o cuatro caracteres en inglés. Saber cuántos tokens tiene tu PDF antes de pegarlo en un chat o una llamada de API ayuda a evitar el truncado silencioso y a planificar cómo dividir documentos grandes.
La herramienta extrae el texto localmente y lo tokeniza en tu navegador. Muestra recuentos exactos para modelos de OpenAI: o200k_base para GPT-5.x, GPT-4o y la serie o, y cl100k_base para GPT-4 y GPT-3.5. Claude, Gemini y otros modelos actuales se estiman a partir de esos recuentos exactos, porque sus tokenizadores no son públicos.
El contenido de tu PDF es especialmente sensible aquí, porque probablemente lo estás revisando antes de entregarlo a un sistema de IA. PDFShore extrae y tokeniza completamente en tu navegador. El texto nunca sale de tu dispositivo y nada se registra.
La herramienta calcula recuentos exactos para modelos de OpenAI: o200k_base para GPT-5.x, GPT-4o y la serie o, y cl100k_base para GPT-4 y GPT-3.5 Turbo. Claude y Gemini no publican tokenizadores para navegador, así que esas filas son estimaciones. Usa los recuentos exactos para planificar y verifica con el proveedor cuando necesites precisión de facturación.
El contenido de imagen no se puede tokenizar directamente. Si tu PDF es un documento escaneado sin capa de texto incrustada, el recuento será muy bajo o cero. Usa PDF a Markdown con OCR habilitado primero para extraer una capa de texto.
Sí, como estimaciones derivadas de los recuentos exactos de GPT. La fila de Claude multiplica el recuento de GPT-4 por alrededor de 1,25, porque su tokenizer es más denso en inglés. Gemini, Llama, Mistral y DeepSeek usan tokenizadores de la clase tiktoken, así que sus recuentos caen en el rango entre GPT-4o y GPT-4 mostrado. Para precisión de facturación, revisa el contador del propio proveedor.
Una página A4 o carta con mucho texto suele tener de 300 a 700 tokens, y 500 es un buen número para planificar. Las tablas densas, el código u otros idiomas lo empujan hacia arriba, así que contar tu archivo real vale más que cualquier regla por página.
No. En inglés un token equivale a unas tres cuartas partes de una palabra, así que un PDF casi siempre tiene más tokens que palabras. Los números, la puntuación y las palabras poco comunes se dividen en tokens extra, por eso el total de tokens queda por encima del recuento de palabras.