Por qué el mismo PDF cuesta distinto en GPT-5, Claude y Gemini
El mismo PDF se convierte en un número distinto de tokens en cada modelo, así que el coste también cambia. Aquí el porqué y cómo comparar antes de enviar.
Pasa el mismo PDF por GPT-5 y por Claude y casi siempre verás dos recuentos de tokens distintos. Mismo archivo, mismo texto, número distinto. Luego llega la factura y también sale distinta. Eso sorprende a todos y parece un error. No lo es.
La razón es simple cuando la ves. Cada modelo cuenta tokens con su propio tokenizador, y esos tokenizadores cortan el texto de formas distintas.
Un token no es algo fijo
El tokenizador es el pequeño programa que convierte tu texto en las piezas que el modelo realmente lee. Un tokenizador puede ver "tokenización" como un solo token. Otro lo parte en "token" e "ización". Misma palabra, recuento distinto. Haz eso a lo largo de un PDF de 30 páginas y los totales se separan.
Así que "cuántos tokens tiene mi PDF" no tiene una respuesta. Tiene una respuesta por modelo.
Qué usa de verdad cada familia
- GPT-4o y GPT-5 usan una codificación llamada o200k_base. Es la más eficiente del grupo, así que suele reportar menos tokens para el mismo texto.
- GPT-4 y GPT-3.5 usan el cl100k_base, más antiguo, que normalmente queda algo por encima.
- Claude usa su propio tokenizador, y los modelos más nuevos empaquetan el texto más denso, así que pueden reportar bastantes más tokens que GPT para la misma página.
- Gemini usa otro enfoque (SentencePiece), así que su recuento queda en su propio punto.
Ninguno está mal. Son reglas distintas midiendo la misma pared.
Por qué la diferencia de coste es mayor de lo que parece
Dos cosas mueven tu factura, y se suman.
Primero, el recuento de tokens cambia según el modelo, como arriba. Segundo, el precio por token también es distinto según el modelo. Un tokenizador más denso sumado a un precio por token más alto hace que el mismo PDF cueste varias veces más en un modelo que en otro. Y la diferencia no es solo el precio de lista. Es el precio de lista multiplicado por un recuento de tokens que no controlaste.
Un ejemplo de la forma que tiene esto, no son números exactos: si Claude convierte tu PDF en un 20 por ciento más tokens que GPT-5 y además cobra más por token, la diferencia real es esos dos multiplicados, no solo la diferencia de precio.
Cómo comparar de verdad
Dos pasos, los dos locales y gratis.
Primero cuenta los tokens con el tokenizador correcto. El Contador de Tokens de PDF muestra el recuento exacto para las codificaciones de OpenAI (o200k para GPT-4o y GPT-5, cl100k para GPT-4) y una estimación marcada para Claude y Gemini, ya que esos tokenizadores no se publican para el navegador.
Luego convierte esos recuentos en dinero. La Calculadora de Coste de Tokens multiplica el recuento por modelo por el precio publicado de cada proveedor, así ves la diferencia real antes de enviar nada. Puedes editar los precios cuando cambien.
Una salvedad honesta
Solo OpenAI publica un tokenizador que corre en el navegador, así que los recuentos de GPT son exactos. Claude y Gemini se estiman a partir de ellos, cerca para planificar, pero no para facturar. Cuando un número tiene que ser exacto para cobro, verifícalo con el contador del propio proveedor. Para elegir modelo y dimensionar presupuesto, la estimación basta.
En resumen
No existe un recuento único de tokens para un PDF. Cada modelo mide con su propio tokenizador, y el precio de lista más barato aún puede perder ante un recuento más denso. Cuenta con la codificación correcta, convierte a dólares por modelo y decide. Si quieres el lado de la ventana de contexto de esto, mira límites de tokens de PDF por modelo.