Datei-Token-Zähler

PDF Token Zähler

Zählen Sie die Tokens in einer PDF-, Word-, TXT-, Markdown-, JSON- oder CSV-Datei — und sehen Sie, was das Senden kostet. Dieser PDF Token Rechner extrahiert den Text und tokenisiert ihn vollständig in Ihrem Browser: nichts wird hochgeladen, keine Anmeldung nötig.

In Ihrem Browser verarbeitet — kein Upload

PDF-, DOCX-, TXT-, MD- oder JSON-Datei hier ablegen

oder klicken zum Durchsuchen — mehrere Dateien willkommen

PDFDOCXTXTMDJSONCSVXMLHTMLYAML
Tokens
0
Wörter
0
Zeichen
0
Input-Kosten
$0.0000
Kontextfenster0%
0 Tokens verwendet1M Limit

Die Zählung für OpenAI-Modelle ist exakt und nutzt denselben BPE-Tokenizer wie die API. Anthropic, Google, xAI, DeepSeek und Meta veröffentlichen ihre Tokenizer nicht — für diese Modelle läuft Ihr Text durch einen BPE-Referenztokenizer, und das Ergebnis wird auf den Tokenizer des jeweiligen Modells skaliert. Deshalb melden Claude Opus 5 und Claude Sonnet 4.6 nicht mehr denselben Wert.

Schritt für Schritt

So zählen Sie Tokens in einem PDF

  1. 1

    Datei hinzufügen

    Ziehen Sie eine PDF-, DOCX-, TXT-, Markdown-, JSON- oder CSV-Datei auf den Zähler oben, oder klicken Sie zum Durchsuchen. Mehrere Dateien gleichzeitig sind kein Problem.

  2. 2

    Der Text wird auf Ihrem Gerät extrahiert

    PDFs werden Seite für Seite mit pdf.js gelesen; .docx-Archive werden entpackt und ihr WordprocessingML in Leserichtung durchlaufen. Nichts wird irgendwohin gesendet.

  3. 3

    Wählen Sie das Modell, über das Sie abrechnen

    Die Zählung wird mit dem Tokenizer dieses Modells neu berechnet — exakt bei OpenAI, ein gekennzeichneter Näherungswert bei Anbietern, die ihren Tokenizer nicht veröffentlichen.

  4. 4

    Anzahl, Kosten und Kontextfenster ablesen

    Tokens, Wörter, Zeichen und Input-Kosten — dazu, wie viel vom Kontextfenster des Modells das Dokument belegen würde.

Unterstützte Formate

Alle Dateitypen, die dieser Token Rechner liest

Ein Werkzeug für Dokumente, Prosa und strukturierte Daten. Die Extraktion unterscheidet sich je Format; der Tokenizer nicht.

PDF

PDF Token Zähler

Die Textebene wird Seite für Seite mit pdf.js extrahiert, bis zu 500 Seiten pro Datei. Funktioniert mit allem, was echten Text enthält — Berichte, Verträge, Fachartikel, exportierte Präsentationen. Scans brauchen zuerst OCR, und der Zähler sagt Ihnen, wenn er auf einen trifft.

DOCX

DOC & DOCX Token Zähler

Eine .docx ist ein ZIP-Archiv, also entpackt der Zähler sie im Browser und liest word/document.xml direkt — Absätze, Tabellen und Zeilenumbrüche in Dokumentreihenfolge, wobei Feldfunktionen und verfolgte Löschungen übersprungen werden. Das alte binäre .doc muss vorher als .docx oder PDF neu gespeichert werden.

TXT

TXT Token Zähler

Reiner Text ist der einfachste Fall: als UTF-8 gelesen und genau so tokenisiert, wie er auf der Festplatte liegt. Praktisch für Prompt-Dateien, Transkripte, kopierte Texte und Log-Auszüge, die Sie an ein Modell übergeben wollen.

MD

Markdown (MD) Token Zähler

Markdown wird gezählt, wie es geschrieben ist — samt Syntax, denn genau das erhält das Modell. Raute-Zeichen für Überschriften, Listenpunkte, Tabellen-Pipes und Code-Fences sind alle Tokens, für die Sie zahlen. Deshalb liegt eine README oft höher, als ihre Wortzahl vermuten lässt.

JSON

JSON Token Zähler

Geschweifte und eckige Klammern, Anführungszeichen, Doppelpunkte und Einrückungen werden alle tokenisiert. Strukturierte Daten sind deutlich dichter als Prosa — oft nahe an einem Token pro zwei Zeichen. Zehn Sekunden Zählen lohnen sich, bevor Sie ein JSON-Objekt in einen Prompt einfügen. JSONL wird ebenfalls unterstützt.

CSV

CSV, XML, YAML & HTML

Daten- und Markup-Formate werden als Text gelesen und wortwörtlich gezählt. Wiederholte Tags, Trennzeichen und Anführungszeichen dominieren die Zählung — ein Tabellen-Export kann daher ein Mehrfaches dessen kosten, was dieselben Daten als Prosa kosten würden.

Token-Preise

Was ein Dokument kostet, Modell für Modell

Nur Input-Preise — Output wird separat abgerechnet und kostet typischerweise das Drei- bis Fünffache.

Input-Token-Preise pro Modell, inklusive Kosten für 1.000 Tokens, 200.000 Tokens und 1.000.000 Tokens sowie Tokens pro US-Dollar
ModellPro 1 Mio. Tokens1.000 Tokens200.000 TokensTokens pro $1
GPT-5.6 TerraOpenAI$2.00$0.00200$0.400500.000
GPT-5.6 LunaOpenAI$0.200$0.00020$0.0405.000.000
GPT-5.5OpenAI$5.00$0.00500$1.00200.000
Claude Sonnet 5Anthropic$2.00$0.00200$0.400500.000
Claude Haiku 4.5Anthropic$1.00$0.00100$0.2001.000.000
Gemini 3.1 ProGoogle$2.00$0.00200$0.400500.000
Gemini 3.7 FlashGoogle$0.750$0.00075$0.1501.333.333
Grok 4.6xAI$2.00$0.00200$0.400500.000
DeepSeek V4 FlashDeepSeek$0.440$0.00044$0.0882.272.727

Tokens, Wörter und Seiten im Vergleich

Ungefähre Wortzahl, Seitenzahl und GPT-5.6 Terra-Input-Kosten für gängige Token-Mengen
Tokens≈ Wörter≈ SeitenGPT-5.6 Terra Input
1.0007501,5$0.00200
10.0007.50015$0.020
100.00075.000150$0.200
200.000150.000300$0.400
1.000.000750.0001.500$2.00

Angenommen englische Prosa mit etwa 0,75 Wörtern pro Token und 500 Wörtern pro Seite. Code, JSON und nicht-lateinische Schriften sind deutlich dichter.

FAQ

Häufig gestellte Fragen

Zählung & Kosten

Wie kann ich Tokens zählen?

Lassen Sie den Text durch denselben Tokenizer laufen, den das Modell verwendet. OpenAI veröffentlicht seinen, daher sind die Zahlen für GPT-5.6, GPT-5.4, GPT-4.1 und GPT-4o exakt — diese Seite lädt das echte BPE-Vokabular (o200k_base) in Ihren Browser und zählt damit. Anthropic, Google, xAI, DeepSeek und Meta veröffentlichen ihre Tokenizer nicht, deshalb sind diese Werte Näherungen und mit „ca." gekennzeichnet. Für eine grobe Kontrolle bei englischer Prosa: Zeichenzahl durch 4 teilen.

Wie zählt man Tokens in einer PDF-Datei?

Ein PDF muss zuerst wieder in Text verwandelt werden, bevor es tokenisiert werden kann. Ziehen Sie die Datei in den Zähler am Anfang dieser Seite: Er extrahiert die Textebene Seite für Seite mit pdf.js und tokenisiert das Ergebnis — vollständig in Ihrem Browser, ohne Upload. Bleibt die Zählung leer, ist das PDF fast sicher ein Scan ohne Textebene und bräuchte zuerst OCR.

Wie viel sind 1.000.000 Tokens?

Etwa 750.000 Wörter oder ungefähr 1.500 Seiten gewöhnlicher Prosa — fünf bis sechs vollständige Romane. In Geld hängt es ganz vom Modell ab: 1.000.000 Input-Tokens kosten $2.00 bei GPT-5.6 Terra, $0.200 bei GPT-5.6 Luna und $5.00 bei GPT-5.5. Output-Tokens werden separat abgerechnet und kosten das Drei- bis Fünffache.

Wie viel sind 200.000 Tokens?

Etwa 150.000 Wörter oder ungefähr 300 Seiten — ein kompletter Roman. Jahrelang war das die übliche Obergrenze des Kontextfensters, und bei den kleineren Modellen ist sie es noch; die aktuellen Spitzenmodelle fassen deutlich mehr — GPT-5.6 Terra nimmt rund 1.050.000 Tokens, ein Dokument dieser Größe füllt also nicht mehr allein eine ganze Anfrage. Zu GPT-5.6 Terra-Input-Preisen kostet es $0.400.

Was kosten 1.000 Tokens?

1.000 Input-Tokens kosten $0.00200 bei GPT-5.6 Terra, $0.00020 bei GPT-5.6 Luna, $0.00200 bei Claude Sonnet 5 und $0.00200 bei Gemini 3.1 Pro. Anbieter nennen ihre Preise pro Million Tokens — teilen Sie den Listenpreis also durch 1.000, um den Wert pro 1.000 Tokens zu erhalten.

Wie berechnet man den Token-Preis?

Preis = (Input-Tokens ÷ 1.000.000) × Input-Rate + (Output-Tokens ÷ 1.000.000) × Output-Rate. Rechnen Sie beide Richtungen getrennt, denn jeder Anbieter verlangt mehr für das, was das Modell schreibt, als für das, was Sie senden. Wenn Sie denselben Prompt-Anfang über mehrere Anfragen wiederverwenden, prüfen Sie, ob ein Preis für gecachten Input gilt — typischerweise 10 % bis 50 % des Normalpreises.

Warum kosten Tokens Geld?

Anbieter rechnen nach Tokens ab, weil Tokens das sind, was das Modell tatsächlich verarbeitet: jedes Token in Ihrem Prompt und jedes Token in der Antwort verbraucht Rechenleistung. Sie zahlen bei jeder Anfrage für beide Richtungen. Deshalb wird ein langes Dokument teuer, das in jeder Runde eines Gesprächs erneut mitgeschickt wird — dieselben Seiten werden jedes Mal wieder bezahlt.

Wie wird ein Token gemessen?

Ein Token ist eine Teilwort-Einheit aus dem Byte-Pair-Encoding-Vokabular des Modells — kein Zeichen und kein Wort. Häufige englische Wörter sind meist ein Token; längere oder seltenere zerfallen in mehrere, „tokenization" wird also zu „token" + „ization". Satzzeichen und führende Leerzeichen zählen ebenfalls. Englisch liegt im Schnitt bei etwa 4 Zeichen oder 0,75 Wörtern pro Token; Code, JSON, nicht-lateinische Schriften und Emojis sind viel dichter, teils ein Token pro Zeichen. Deutsche Komposita fallen ebenfalls dichter aus als englische Prosa.

Wie viele Tokens bekommt man für $1?

Ein Dollar Input reicht für etwa 500.000 Tokens bei GPT-5.6 Terra, 5.000.000 bei GPT-5.6 Luna, 200.000 bei GPT-5.5 und 500.000 bei Claude Sonnet 5. Teilen Sie 1.000.000 durch den Input-Preis pro Million, um den Wert für jedes Modell in der Tabelle oben zu erhalten.

Dateien hochladen

Welche Dateitypen kann ich in den Token Rechner laden?

PDF, DOCX, TXT, Markdown (.md), JSON, JSONL, CSV, TSV, XML, HTML, YAML und einfache Log-Dateien. PDFs werden mit pdf.js gelesen, .docx-Dateien entpackt und aus ihrem WordprocessingML gelesen, alles andere als UTF-8-Text. Das alte binäre .doc wird nicht unterstützt — speichern Sie es zuerst als .docx oder PDF.

Sind meine hochgeladenen Dateien privat?

„Hochladen" bedeutet hier nur, dass Ihr Browser die Datei von Ihrer Festplatte liest. PDF-Verarbeitung, .docx-Entpacken und Tokenisierung laufen als JavaScript auf Ihrem Gerät, und die Tokenizer-Vokabulare werden von dieser Website ausgeliefert, nicht von einem fremden CDN. Kein Dateiinhalt wird übertragen, protokolliert oder gespeichert — vertrauliche Verträge und interne Dokumente können Sie also gefahrlos prüfen.

Wie groß darf die Datei maximal sein?

10 MB pro Datei, und von PDFs werden die ersten 500 Seiten gelesen. Beide Grenzen schützen Ihren eigenen Browser-Tab — die Extraktion läuft sequenziell, und jede Seite eines sehr großen Dokuments gleichzeitig im Speicher zu halten, würde ihn einfrieren. Wird ein PDF begrenzt, zeigt die Dateizeile, wie viele Seiten gelesen wurden.

Kann ich Tokens in einem gescannten PDF zählen?

Nicht direkt. Ein Scan ist ein Bild von Text ohne Textebene, es gibt also nichts zu extrahieren, und der Zähler meldet, dass kein Text gefunden wurde. Lassen Sie die Datei zuerst durch OCR laufen — die meisten PDF-Programme haben eine Funktion „Text erkennen" — und laden dann das durchsuchbare PDF.

Kann ich mehrere Dateien gleichzeitig laden?

Ja. Wählen Sie mehrere Dateien aus oder ziehen Sie sie hinein: Jede erhält eine eigene Zeile mit eigener Token-Zahl, während die Statistik-Karten die Gesamtsumme zeigen. Diese Summe ist die relevante Zahl, wenn Sie die Dokumente zu einem einzigen Prompt zusammenfügen wollen.

Kann ich Tokens in einem Word-Dokument (.docx) zählen?

Ja, für .docx und .docm. Der Zähler entpackt das Archiv, liest word/document.xml und durchläuft Absätze, Tabellen und Zeilenumbrüche in Leserichtung, wobei Feldfunktionen und verfolgte Löschungen übersprungen werden. Kopf- und Fußzeilen sowie Fußnoten liegen in separaten Teilen des Archivs und sind nicht in der Zählung enthalten.

Funktioniert der PDF Token Zähler mit passwortgeschützten PDFs?

Nein. Ein verschlüsseltes PDF lässt sich ohne Passwort nicht lesen, und der Zähler meldet es als geschützt, anstatt zu raten. Öffnen Sie es mit dem Passwort und speichern es neu, oder nutzen Sie die Funktion „Sicherheit entfernen" Ihres PDF-Programms, und laden dann die ungeschützte Kopie.

Wie genau ist die Token-Zählung?

Exakt bei OpenAI-Modellen, weil dasselbe BPE-Vokabular verwendet wird wie in der API — 12.431 Tokens für GPT-5.6 sind genau die Zahl, die Ihnen für diesen Text berechnet wird. Bei Anthropic, Google, xAI, DeepSeek und Meta ist der Wert eine Schätzung, mit „ca." gekennzeichnet, und liegt bei englischer Prosa meist innerhalb von 10–15 %. Die Extraktion schwankt stärker als die Tokenisierung: Leserichtung, Tabellen und Spaltenlayout eines PDFs bestimmen, welche Leerzeichen im Text landen — und Leerzeichen werden mitgezählt.

Warum ist die Token-Zahl meines PDFs höher als erwartet?

Meist wegen des Layouts. Tabellen, mehrspaltige Seiten, auf jeder Seite wiederholte Kopfzeilen und harte Zeilenumbrüche überleben die Extraktion, und jeder dieser Umbrüche und überzähligen Leerzeichen ist ein Token. Gescannte Seiten in einem ansonsten textbasierten PDF fallen dagegen ganz heraus und drücken die Zahl nach unten. Öffnen Sie das Panel mit dem extrahierten Text unter dem Zähler, um genau zu sehen, was tokenisiert wurde.

Brauche ich ein Konto oder einen API-Schlüssel?

Nein. Keine Anmeldung, kein API-Schlüssel, kein Limit. Die Tokenizer laufen lokal in Ihrem Browser, es gibt also keinen Dienst, an dem man sich anmelden müsste, und nichts abzurechnen.

Lieber eingefügten Text zählen?

Der Haupt-Token-Rechner zählt Tokens beim Tippen, mit farbcodierter Aufschlüsselung, wie Ihr Text zerlegt wird, und einem direkten Preisvergleich über alle Modelle.