Tokens für GPT-4o, Claude oder Gemini zählen und prüfen, ob Ihr PDF ins Kontextfenster passt, ohne Upload.
Jedes LLM hat ein Kontextfenster, eine Begrenzung, wie viel Text es auf einmal verarbeiten kann, gemessen in Tokens. Ein Token entspricht etwa drei bis vier Zeichen englischem Text. Wenn Sie wissen, wie viele Tokens Ihr PDF hat, bevor Sie es in einen Chat oder API-Aufruf einfügen, können Sie stille Abschneidungen vermeiden und die Aufteilung großer Dokumente planen.
Das Werkzeug extrahiert den Text lokal und tokenisiert ihn in Ihrem Browser. Es zeigt exakte Werte für OpenAI-Modelle: o200k_base für GPT-5.x, GPT-4o und die o-Serie sowie cl100k_base für GPT-4 und GPT-3.5. Claude, Gemini und andere aktuelle Modelle werden aus diesen exakten Werten geschätzt, da ihre Tokenizer nicht veröffentlicht sind.
Ihr PDF-Inhalt ist hier besonders sensibel, weil Sie ihn wahrscheinlich prüfen, bevor Sie ihn einem KI-System übergeben. PDFShore extrahiert und tokenisiert vollständig in Ihrem Browser. Der Text verlässt Ihr Gerät nie, und es wird nichts protokolliert.
Das Tool berechnet exakte Werte für OpenAI-Modelle: o200k_base für GPT-5.x, GPT-4o und die o-Serie sowie cl100k_base für GPT-4 und GPT-3.5 Turbo. Claude und Gemini veröffentlichen keine Tokenizer für den Browser, daher sind diese Zeilen Schätzungen. Nutzen Sie die exakten Werte zur Planung und prüfen Sie bei genauer Abrechnung den Anbieter.
Bildinhalt kann nicht direkt tokenisiert werden. Wenn Ihr PDF ein gescanntes Dokument ohne eingebettete Textebene ist, wird die Zählung sehr niedrig oder null sein. Verwenden Sie zuerst PDF zu Markdown mit aktiviertem OCR, um eine Textebene zu extrahieren.
Ja, als Schätzungen aus den exakten GPT-Werten. Die Claude-Zeile multipliziert die GPT-4-Zählung mit etwa 1,25, da ihr Tokenizer bei Englisch dichter ist. Gemini, Llama, Mistral und DeepSeek verwenden Tokenizer der tiktoken-Klasse, daher liegen ihre Werte im gezeigten Bereich zwischen GPT-4o und GPT-4. Für eine genaue Abrechnung prüfen Sie den Zähler des Anbieters selbst.
Eine textreiche A4- oder Letter-Seite hat meist 300 bis 700 Tokens, und 500 ist eine sichere Planungszahl. Dichte Tabellen, Code oder andere Sprachen treiben sie höher, also schlägt das Zählen Ihrer echten Datei jede Pro-Seite-Regel.
Nein. Im Englischen entspricht ein Token etwa drei Vierteln eines Wortes, also hat ein PDF fast immer mehr Tokens als Wörter. Zahlen, Satzzeichen und seltene Wörter zerfallen in zusätzliche Tokens, weshalb die Tokenzahl über der Wortzahl liegt.