Modellpreise

KI-Modell-Preise

Jeder Preis hier stammt von der Preisseite des jeweiligen Anbieters, geprüft am 22. August 2026. Vergleichen Sie Input-, Cache- und Output-Preise von 56 Modellen aus 11 Häusern — und tragen Sie Ihre eigenen Token-Mengen ein, um zu sehen, was eine einzelne Anfrage bei jedem Modell kostet.

  • 56 Modelle
  • 11 Anbieter
  • Geprüft am 22. August 2026
Anfrage berechnen
Vorgaben

Zum Sortieren auf eine Spaltenüberschrift klicken.

Input-, Cache- und Output-Preise pro Million Tokens für 56 KI-Modelle, mit Kontextfenster, Genauigkeit der Token-Zählung und geschätzten Kosten pro Anfrage
pro 1 Mio.pro 1 Mio.pro 1 Mio.Zählungpro Anfrage
GPT-5.6 Sol1OpenAI$4.00$0.400$20.001Mexakt$0.060
GPT-5.6 Terra1OpenAI$2.00$0.200$12.001Mexakt$0.032
GPT-5.6 Luna1OpenAI$0.200$0.020$1.201Mexakt$0.00320
GPT-5.51OpenAI$5.00$0.500$30.001Mexakt$0.080
GPT-5.41OpenAI$2.50$0.250$15.001Mexakt$0.040
GPT-5.4 mini1OpenAI$0.750$0.075$4.50400Kexakt$0.012
GPT-5.4 nano1OpenAI$0.200$0.020$1.25400Kexakt$0.00325
GPT-5.11OpenAI$1.25$0.125$10.00400Kexakt$0.022
GPT-4.11OpenAI$2.00$0.500$8.001Mexakt$0.028
GPT-4o1OpenAI$2.50$1.25$10.00128Kexakt$0.035
GPT-4o Mini1OpenAI$0.150$0.075$0.600128Kexakt$0.00210
Claude Fable 52Anthropic$10.00$1.00$50.001Mca.$0.150
Claude Opus 52Anthropic$5.00$0.500$25.001Mca.$0.075
Claude Opus 4.82Anthropic$5.00$0.500$25.001Mca.$0.075
Claude Opus 4.72Anthropic$5.00$0.500$25.001Mca.$0.075
Claude Opus 4.62Anthropic$5.00$0.500$25.001Mca.$0.075
Claude Opus 4.52Anthropic$5.00$0.500$25.00200Kca.$0.075
Claude Sonnet 52Anthropic$2.00$0.200$10.001Mca.$0.030
Claude Sonnet 4.62Anthropic$3.00$0.300$15.001Mca.$0.045
Claude Sonnet 4.52Anthropic$3.00$0.300$15.00200Kca.$0.045
Claude Haiku 4.52Anthropic$1.00$0.100$5.00200Kca.$0.015
Gemini 3.1 Pro3Google$2.00$0.200$12.001Mca.$0.032
Gemini 3.7 FlashGoogle$0.750$0.075$3.751Mca.$0.011
Gemini 3.5 FlashGoogle$1.50$0.150$9.001Mca.$0.024
Gemini 3.5 Flash-LiteGoogle$0.300$0.030$2.501Mca.$0.00550
Gemini 2.5 Pro3Google$1.25$0.125$10.001Mca.$0.022
Grok 4.64xAI$2.00$0.500$6.00500Kca.$0.026
Grok 4.54xAI$2.00$0.300$6.00500Kca.$0.026
Grok 4.34xAI$1.25$0.200$2.501Mca.$0.015
Grok Build 0.14xAI$1.00$0.200$2.00256Kca.$0.012
DeepSeek V4 Pro5DeepSeek$1.32$0.044$3.961Mca.$0.017
DeepSeek V4 Flash5DeepSeek$0.440$0.014$1.321Mca.$0.00572
LLaMA 3.3 70B6Meta (via API)$1.04$1.04128Kca.$0.011
Qwen3.7 Max1617Alibaba$2.50$0.250$7.501Mca.$0.033
Sonar7918Perplexity$1.00$1.00ca.$0.011
Sonar Pro7918Perplexity$3.00$15.00ca.$0.045
Sonar Reasoning Pro918Perplexity$2.00$8.00ca.$0.028
Sonar Deep Research8918Perplexity$2.00$8.00ca.$0.028
Kimi K310Moonshot AI$3.00$0.300$15.001Mca.$0.045
Kimi K2.7 Code1011Moonshot AI$0.950$0.190$4.00262Kca.$0.013
Kimi K2.610Moonshot AI$0.950$0.160$4.00262Kca.$0.013
MiniMax M31213MiniMax$0.300$0.060$1.201Mca.$0.00420
MiniMax M2.714MiniMax$0.300$0.060$1.20205Kca.$0.00420
MiniMax M2.5MiniMax$0.300$0.030$1.20205Kca.$0.00420
GLM-5.315Z.ai$1.40$0.280$4.401Mca.$0.018
GLM-5.215Z.ai$1.40$0.280$4.401Mca.$0.018
GLM-515Z.ai$1.00$0.200$3.20200Kca.$0.013
GLM-5-Turbo15Z.ai$1.20$0.240$4.00200Kca.$0.016
GLM-4.715Z.ai$0.600$0.120$2.20200Kca.$0.00820
GLM-4.7-FlashX15Z.ai$0.070$0.014$0.400200Kca.$0.00110
GLM-4.5-Air15Z.ai$0.200$0.040$1.10128Kca.$0.00310
GLM-4.5-X1518Z.ai$2.20$0.440$8.90ca.$0.031
Qwen3.7 Plus1617Alibaba$0.400$0.040$1.601Mca.$0.00560
Qwen3.6 Flash1617Alibaba$0.250$0.025$1.501Mca.$0.00400
Qwen3.5 Flash17Alibaba$0.100$0.010$0.4001Mca.$0.00140
Qwen3 Coder Plus1617Alibaba$1.00$0.100$5.001Mca.$0.015

Anmerkungen

  1. OpenAI berechnet Prompts über 272K Input-Tokens zu einem höheren Satz; angegeben ist die Standardstufe.
  2. Die Cache-Spalte zeigt Anthropics Leserate bei einem Cache-Treffer. Das Schreiben in den Cache kostet mehr als normaler Input.
  3. Google berechnet Prompts über 200K Input-Tokens etwa zum doppelten dieser Sätze.
  4. Ab 200K Prompt-Tokens berechnet xAI die gesamte Anfrage zum doppelten dieser Input-, Cache- und Output-Sätze.
  5. Standardsätze (Hauptzeit). Zwischen 01:00–04:00 und 06:00–10:00 UTC berechnet DeepSeek die Hälfte.
  6. Meta liefert Modellgewichte statt einer API, deshalb ist dies ein gehosteter Serverless-Preis (Together AI) und kein Erstanbieter-Preis.
  7. Zusätzlich zu den Token-Sätzen berechnet Perplexity die Suche pro Anfrage: 5, 8 oder 12 US-Dollar je 1.000 Anfragen, je nach Umfang des Suchkontexts.
  8. Deep Research berechnet außerdem 2 US-Dollar pro 1 Mio. Zitat-Tokens, 3 US-Dollar pro 1 Mio. Reasoning-Tokens und 5 US-Dollar je 1.000 Suchen.
  9. Sonar-Chat-Completions sind in Perplexitys Agent-API übergegangen; die Sonar-Modelle werden bis zum 27. September 2026 unterstützt.
  10. Moonshot nennt diese Sätze ohne Steuern.
  11. Die Variante „-highspeed“ berechnet Input und Output zum doppelten Satz.
  12. Standard-Servicestufe bis 512K Input-Tokens. Darüber wird die gesamte Anfrage doppelt berechnet, die Priority-Stufe kostet etwa das 1,5-Fache.
  13. MiniMax führt dies als dauerhaften Rabatt von 50 % — der Listenpreis ist doppelt so hoch.
  14. Die Variante „-highspeed“ berechnet den doppelten Satz.
  15. Cache-Treffer liest Z.ai zu einem Fünftel des Input-Satzes ab.
  16. Alibaba staffelt nach Anfragegröße: Wird eine Input-Schwelle überschritten (256K bei den meisten Modellen, 32K bei Qwen3 Coder Plus), wird die gesamte Anfrage neu bepreist — bis zu 1,20 US-Dollar Input / 4,80 US-Dollar Output bei Qwen3.7 Plus und 6,00 / 60,00 US-Dollar bei Qwen3 Coder Plus.
  17. Alibabas Preisliste für Singapur (international). Die Region Peking wird getrennt und abweichend abgerechnet.
  18. Für dieses Modell veröffentlicht der Anbieter kein Kontextfenster, deshalb steht in der Spalte „—“.

Alle Sätze in US-Dollar pro 1 Mio. Tokens.

Am 22. August 2026 gegen die Preisseite jedes Anbieters geprüft.

Anbieter ändern Preise ohne Ankündigung, und mehrere berechnen zusätzlich zum Token-Satz — prüfen Sie vor jeder Budgetplanung die Seite des Anbieters.

Günstigste zuerst

Bestes Verhältnis pro Million Tokens

Die Output-Sätze dieser Tabelle reichen von $0.400 bis $50.00 pro 1 Mio. Tokens — Faktor 125. Das ist ein größerer Hebel als jede Prompt-Optimierung.

Günstigster Input

  1. 1GLM-4.7-FlashXZ.ai$0.070pro 1 Mio. Tokens
  2. 2Qwen3.5 FlashAlibaba$0.100pro 1 Mio. Tokens
  3. 3GPT-4o MiniOpenAI$0.150pro 1 Mio. Tokens
  4. 4GLM-4.5-AirZ.ai$0.200pro 1 Mio. Tokens
  5. 5GPT-5.6 LunaOpenAI$0.200pro 1 Mio. Tokens

Günstigster Output

  1. 1GLM-4.7-FlashXZ.ai$0.400pro 1 Mio. Tokens
  2. 2Qwen3.5 FlashAlibaba$0.400pro 1 Mio. Tokens
  3. 3GPT-4o MiniOpenAI$0.600pro 1 Mio. Tokens
  4. 4SonarPerplexity$1.00pro 1 Mio. Tokens
  5. 5LLaMA 3.3 70BMeta (via API)$1.04pro 1 Mio. Tokens
Nach Anbieter

Anbieter in dieser Tabelle

11 Anbieter, jeweils verlinkt mit der Preisseite, aus der diese Werte stammen.

FAQ

Häufige Fragen

Welches KI-Modell ist am günstigsten?

Beim Input GLM-4.7-FlashX mit $0.070 pro 1 Mio. Tokens, beim Output GLM-4.7-FlashX mit $0.400 pro 1 Mio. Welches Modell für Sie am günstigsten ist, hängt vom Zuschnitt Ihres Verkehrs ab: Ein Prompt mit 10.000 Tokens und einer Antwort mit 1.000 Tokens kostet bei GLM-4.7-FlashX $0.00110 und bei GPT-5.6 Terra $0.032. Tragen Sie oben Ihre eigenen Mengen ein, dann sortiert sich die Tabelle danach.

Wie vergleiche ich Modellpreise fair?

Gewichten Sie Input und Output so, wie Sie das Modell tatsächlich nutzen. Anbieter verlangen für das, was das Modell schreibt, das Drei- bis Fünffache dessen, was Sie senden — GPT-5.6 Terra kostet $2.00 im Input und $12.00 im Output. Eine Zusammenfassung, die viel liest und wenig schreibt, ordnet die Modelle deshalb völlig anders als ein Codegenerator, der das Gegenteil tut. Tragen Sie oben beide Mengen ein, statt nur Input-Sätze zu vergleichen, und lesen Sie die Anmerkungen: Mehrere Anbieter bepreisen die gesamte Anfrage neu, sobald ein Prompt eine Input-Schwelle überschreitet.

Was ist Cache-Preisgestaltung beim Input?

Wenn aufeinanderfolgende Anfragen denselben Anfang teilen — einen System-Prompt, ein Dokument, einen langen Few-Shot-Block — können Anbieter diesen Teil aus dem Cache liefern und billiger abrechnen. Die Cache-Spalte zeigt genau diese Leserate bei einem Treffer, meist 10 bis 20 % des Standard-Input-Satzes: Claude Sonnet 5 liest gecachten Input zu $0.200 statt $2.00. Das Schreiben in den Cache ist nicht immer kostenlos, und ein Gedankenstrich bedeutet, dass der Anbieter überhaupt keinen Cache-Satz veröffentlicht.

Wie aktuell sind diese Preise?

Jeder Wert wurde am 22. August 2026 von der Preisseite des jeweiligen Anbieters gelesen, und jede Anbieterkarte verlinkt zurück auf diese Seite. Nichts wird live abgerufen, betrachten Sie die Tabelle also als Momentaufnahme: Anbieter ändern Sätze ohne Ankündigung, und wer mit Aktions- oder Nebenzeit-Preisen arbeitet (MiniMax, DeepSeek), ändert sie am häufigsten.

Warum steht in manchen Feldern ein Gedankenstrich?

Weil der Anbieter diesen Wert nicht veröffentlicht — und Raten wäre schlechter, als das Feld leer zu lassen. Perplexity nennt für die Sonar-Modelle kein Kontextfenster, Z.ai für GLM-4.5-X keine variantenspezifische Kontextlänge, und die gehostete LLaMA-Zeile von Meta hat keinen Cache-Satz. Ein Gedankenstrich bedeutet immer „nicht veröffentlicht“, niemals „null“.

Für welche Modelle kann diese Seite Tokens exakt zählen?

Für 11 der 56 Zeilen — die OpenAI-Modelle, weil OpenAI seinen Tokenizer veröffentlicht und der Rechner das echte BPE-Vokabular (o200k_base) in Ihrem Browser lädt. Alles andere ist mit „ca.“ markiert und wird über Zeichen pro Token genähert; bei deutscher und englischer Prosa liegt das etwa 10 bis 15 % daneben, bei Code, JSON und nicht-lateinischen Schriften mehr. Die Preise sind für jede Zeile Erstanbieter-Daten; nur die Token-Zahlen unterscheiden sich in ihrer Verlässlichkeit.

Sind Such- und Anfragegebühren in diesen Preisen enthalten?

Nein — die Tabelle zeigt nur Token-Sätze, und einige Anbieter rechnen zusätzlich ab. Sonar verlangt je nach Kontextumfang 5 bis 12 US-Dollar pro 1.000 Anfragen für die Suche, Sonar Deep Research zusätzlich Gebühren für Zitat-Tokens, Reasoning-Tokens und einzelne Suchen, und gehostete Open-Weight-Modelle kosten, was der Hoster verlangt, nicht was der Modellhersteller nennt. Die Anmerkungen kennzeichnen jede Zeile, bei der der Token-Satz nicht die ganze Rechnung ist.

Was kostet ein langer Prompt wirklich?

Nehmen Sie 200.000 Input-Tokens — ein ganzer Roman oder ein Vertrag von einigen hundert Seiten. Dieser eine Prompt kostet $0.400 bei GPT-5.6 Terra, $0.400 bei Claude Sonnet 5, $0.600 bei Kimi K3 und $0.020 bei Qwen3.5 Flash. Achten Sie bei dieser Größe auf die Stufen-Anmerkungen: Bei Grok 4.6 wird ein Prompt von 200K Tokens für die gesamte Anfrage doppelt berechnet.

Zuerst die Tokens zählen

Ein Preis pro Million Tokens sagt erst etwas aus, wenn Sie wissen, wie viele Tokens Ihr Text hat. Der Token-Rechner zählt beim Tippen und rechnet das Ergebnis über die Modelle hinweg um; der Datei-Zähler macht dasselbe für PDFs und Word-Dokumente.