Token-Rechner
Berechnen Sie die Kosten für die Nutzung von KI-Sprachmodellen. Schätzen Sie Tokens aus Text und vergleichen Sie Preise zwischen Modellen wie GPT-5, Claude und Gemini.
$
$
$0.02
Eingabe: $0.0050 · Ausgabe: $0.01
$1.75
100 anfragen pro tag
$52.50
30 tage
$638.75
365 tage
Tokens aus Text schätzen
Zeichen
0
Wörter
0
Geschätzte Tokens
~0
Token-Rechner: API-Kosten pro Anfrage, Tag, Monat und Jahr für GPT-5.6, Claude Opus 5, Gemini und DeepSeek.
Der Token-Rechner rechnet Eingabe-Tokens, Ausgabe-Tokens und Anfragen pro Tag in die API-Kosten pro Anfrage, Tag, Monat und Jahr um. Die Listenpreise der Modelle von OpenAI, Anthropic, Google, xAI, DeepSeek, Mistral, Amazon, Meta und Cohere sind hinterlegt; einen eigenen Tarif tragen Sie unter „Benutzerdefiniert“ ein.
Was ein Token ist und warum die Rechnung in Dollar je Million ankommt
Ein Token ist das Textstück, das ein Sprachmodell tatsächlich verarbeitet: meist ein Wortstamm, eine Endung, eine Ziffernfolge oder ein Satzzeichen. Englische Fließtexte laufen bei etwa vier Zeichen je Token, weshalb alle großen Anbieter ihre Tarife in Dollar je Million Tokens ausweisen. Deutsche Fachprosa liegt darüber, weil Komposita wie „Kraftfahrzeughaftpflichtversicherung“ in mehrere Stücke zerfallen und die Tokenizer der verbreiteten Modelle überwiegend an englischem Material trainiert wurden.
Vermessen hat diesen Aufschlag das OpenGPT-X-Konsortium um das Fraunhofer IAIS im Teuken-7B-Papier, das die Tokenizer-Fertility – die durchschnittliche Zahl von Tokens je Wort – für 24 europäische Sprachen vergleicht. Deutsch liegt dort bei jedem der untersuchten englischzentrierten Tokenizer (Mistral, Llama 3, GPT) über dem englischen Wert, und die Autoren benennen als Folge ausdrücklich „additional inference costs“. Wie groß der Abstand bei Ihrem Textbestand ausfällt, entscheiden Tokenizer und Textsorte; belastbar wird die Zahl erst, wenn Sie das usage-Feld Ihrer eigenen API-Antworten auslesen. Ein Rechner, der Ihnen dafür einen festen Prozentsatz vorgibt, verkauft eine Schätzung als Messung.
Abgerechnet wird zweigeteilt. Eingabe-Tokens sind alles, was in die Anfrage geht: System-Prompt, mitgeschickter Kontext, bisheriger Gesprächsverlauf und die eigentliche Frage. Ausgabe-Tokens sind die Antwort. Der Ausgabepreis liegt fast überall höher, weil das Modell jedes Antwort-Token einzeln vorhersagt und anhängt, während es die Eingabe in einem Durchgang liest. Wie weit die beiden Seiten auseinanderliegen, steht in der Spalte „Ausgabe ÷ Eingabe“ der Tabelle weiter unten: Claude Opus 5 verlangt für die Ausgabe das 5-Fache der Eingabe, Gemini 2.5 Pro das 8-Fache, Grok 4.3 nur das 2-Fache. Für die Planung folgt daraus eine einfache Reihenfolge: die Antwortlänge zu deckeln bringt meist mehr als den Prompt zu kürzen.
Die Spanne zwischen den hinterlegten Modellen ist größer, als die Diskussion um einzelne Anbieter vermuten lässt. GPT-5.5 Pro kostet auf der Eingabeseite das 857,1-Fache von Amazon Nova Micro. Die vollständige Rangfolge steht in der Tabelle weiter unten, sortiert nach dem Eingabepreis. Hinterlegt ist überall der Standardtarif für Einzelanfragen: kein Batch-Rabatt, kein Prompt-Caching, kein Off-Peak-Fenster, keine Langkontext-Stufe. Diese Nachlässe sind bei den Anbietern dokumentiert und gehören in eine zweite Rechnung, sobald der Modellvergleich auf dem Standardtarif steht.
Drei Einschränkungen gehören zur Tabelle dazu. Erstens rechnen GPT-5.6 Sol, Terra und Luna, Gemini 3.1 Pro, Gemini 2.5 Pro sowie Grok 4.5 und Grok 4.3 oberhalb einer Kontextschwelle nach einem höheren Tarif – bei den beiden Grok-Modellen und den Gemini-Modellen ab 200.000 Tokens. Hinterlegt ist der Kurzkontext-Tarif, weil ein flaches Preismodell je Token alles ist, was sich hier ehrlich abbilden lässt. Zweitens halbiert DeepSeek seine Sätze in den Off-Peak-Stunden. Drittens verdoppelt Gemini 3.6 Flash zum 1. Januar 2027 auf $1,50 und $7,50 je Million; wer heute einen Jahresplan darauf aufbaut, sollte dieses Datum im Kalender stehen haben.
Alle Beträge stehen in US-Dollar, weil die Anbieter darin fakturieren. Zwischen dieser Zahl und dem Betrag, der Ihr Konto trifft, liegen der Kurs des Abrechnungstages und das Fremdwährungsentgelt Ihrer Karte oder Ihres Zahlungsdienstleisters; auf einer Preisliste taucht beides nicht auf.
Dazu kommt die Umsatzsteuer. Bezieht ein deutsches Unternehmen eine sonstige Leistung von einem Anbieter mit Sitz im übrigen Gemeinschaftsgebiet, geht die Steuerschuld nach § 13b Abs. 1 UStG auf den Leistungsempfänger über. Die Handelskammer Hamburg beschreibt die Folge für die Rechnung: Sie wird ohne Umsatzsteuer ausgestellt und muss sowohl die USt-IdNr. des leistenden Unternehmers als auch die des Leistungsempfängers tragen. Fehlt Ihre USt-IdNr. im Kundenkonto, rechnet der Anbieter stattdessen die Umsatzsteuer seines Sitzlandes auf.
Ein letzter Punkt, an dem eine Preisliste in die Irre führt: Anthropic dokumentiert in seiner Preisübersicht, dass Modelle ab Claude 4.7 – darunter Opus 5, Opus 4.8 und Sonnet 5 – einen neueren Tokenizer verwenden, der denselben Text in rund 30 % mehr Tokens zerlegt als der vorherige. Tarif und Tokenizer bewegen sich damit unabhängig voneinander, und nur einer von beiden steht in der Preisliste – wer einen Modellwechsel allein an der Tarifzeile bewertet, rechnet deshalb mit der halben Bewegung.
So kommen Sie vom Modellnamen zum Jahresbetrag
Das Formular liest sich von oben nach unten, aber seine Zeilen schreiben einander: Die Modellauswahl füllt die beiden Preisfelder, und ein von Hand eingetragener Preis schaltet die Auswahl auf „Benutzerdefiniert“ zurück.
1. Modell wählen. Das Auswahlfeld „Modell“ ist nach Anbietern gruppiert, und jeder Eintrag trägt seinen Tarif bereits im Namen, sodass der Preis schon beim Aufklappen neben dem Modellnamen steht. Die Auswahl füllt beide Preisfelder automatisch; voreingestellt ist Claude Opus 5. Für alles, was nicht in der Liste steht – ein selbst gehostetes Modell, ein Reseller-Tarif, ein Azure- oder Bedrock-Kontingent –, gibt es den Eintrag „Benutzerdefiniert“.
2. Preis und Einheit prüfen. Die beiden Felder heißen „Eingabe ($/1M Tokens)“ und „Ausgabe“ mit derselben Einheit. Der Schalter daneben stellt zwischen 1K und 1M um und rechnet dabei um, was bereits im Feld steht: Aus 5 je Million werden 0,005 je Tausend. Wer einen Preis von Hand eintippt, setzt das Auswahlfeld damit auf „Benutzerdefiniert“ zurück – die Anzeige sagt Ihnen so, dass ab jetzt Ihr Tarif gilt und nicht mehr der hinterlegte.
3. Tokens und Frequenz eintragen. In die dritte Zeile kommen „Eingabe-Tokens“, „Ausgabe-Tokens“ und „Anfragen pro Tag“. Die Voreinstellung steht auf 1.000, 500 und 100 und beschreibt damit einen kleinen internen Assistenten.
4. Die vier Karten lesen. Sie heißen „Kosten pro Anfrage“, „Tägliche Kosten“, „Monatliche Kosten“ und „Jährliche Kosten“. Unter der ersten Karte stehen Eingabe- und Ausgabeanteil getrennt, sodass sich ablesen lässt, ob der Prompt oder die Antwort die Rechnung treibt. Die Beträge erscheinen in US-Schreibweise, mit vorangestelltem Dollarzeichen und Punkt als Dezimaltrennzeichen, weil die Anbieter in Dollar abrechnen und Sie den Wert so ohne Umdenken gegen Ihre Abrechnung halten können.
5. Tokens aus einem echten Text schätzen. Der Abschnitt „Tokens aus Text schätzen“ zeigt seine drei Zahlen erst, sobald etwas im Feld steht: „Zeichen“, „Wörter“ und „Geschätzte Tokens“. Das Feld fasst bis zu 2.000 Zeichen. Die Schätzung folgt max(⌈Zeichen ÷ 4⌉, ⌈Wörter × 1,33⌉), nimmt also den größeren der beiden Wege. Sie kennt keinen Tokenizer und ersetzt ihn nicht: für die Abrechnung zählt, was das usage-Feld der API zurückmeldet, oder bei OpenAI-Modellen tiktoken.
Die Rechnung hinter den Karten passt in eine Zeile: Eingabe-Tokens ÷ 1.000.000 × Eingabepreis, plus Ausgabe-Tokens ÷ 1.000.000 × Ausgabepreis. Dieses Ergebnis mal Anfragen pro Tag ergibt die Tagessumme, mal 30 den Monat und mal 365 das Jahr. Der Monat hat hier immer 30 Tage und kennt keinen Kalender. Das ist Absicht, denn so bleiben zwei Hochrechnungen aus verschiedenen Monaten vergleichbar; ein realer Monat mit 31 Tagen fällt entsprechend rund 3 % höher aus, der Februar rund 7 % niedriger.
Der eingestellte Fall steht laufend in der Adresse der Seite; der Knopf „Teilen“ öffnet dazu ein Menü mit „Link kopieren“ und den üblichen Kanälen. Für eine Budgetfreigabe ist das der kürzeste Weg: Sie schicken dem Einkauf den Link statt einer Beschreibung, und die Gegenseite sieht dieselben vier Karten mit denselben Annahmen. Gerechnet wird dabei im Browser, ohne Serveranfrage und ohne API-Kontingent. Der eingefügte Text wandert allerdings mit in den Link – wer einen internen System-Prompt ausmisst, leert das Feld, bevor er den Link weitergibt.
Solange die Token-Zahlen aus einer Schätzung stammen, ist die Jahreskarte eine Annahme, die auf den Cent genau aussieht. Sobald die Anwendung echte Anfragen beantwortet, ersetzen Sie sie durch den Mittelwert aus dem usage-Feld der API – das ist der eine Schritt, der aus der Hochrechnung eine Zahl macht, die eine Freigabe trägt.
Was 1 Mio. Tokens je Modell kostet: Eingabe, Ausgabe und ihr Verhältnis
| Modell | Eingabe (USD / 1 Mio. Tokens) | Ausgabe (USD / 1 Mio. Tokens) | Ausgabe ÷ Eingabe |
|---|---|---|---|
| Amazon Nova Micro | $0,035 | $0,14 | 4× |
| Cohere Command R7B | $0,0375 | $0,15 | 4× |
| Gemini 2.5 Flash-Lite | $0,10 | $0,40 | 4× |
| Mistral Small 4 | $0,15 | $0,60 | 4× |
| GPT-5.6 Luna | $0,20 | $1,20 | 6× |
| GPT-5.4 Nano | $0,20 | $1,25 | 6,3× |
| Gemini 3.1 Flash-Lite | $0,25 | $1,50 | 6× |
| Codestral | $0,30 | $0,90 | 3× |
| DeepSeek V4 Flash | $0,30 | $1,20 | 4× |
| Gemini 3.5 Flash-Lite | $0,30 | $2,50 | 8,3× |
| Gemini 2.5 Flash | $0,30 | $2,50 | 8,3× |
| Mistral Large 3 | $0,50 | $1,50 | 3× |
| Llama 3.3 70B | $0,59 | $0,79 | 1,3× |
| Gemini 3.6 Flash | $0,75 | $3,75 | 5× |
| GPT-5.4 Mini | $0,75 | $4,50 | 6× |
| Amazon Nova Pro | $0,80 | $3,20 | 4× |
| Claude Haiku 4.5 | $1 | $5 | 5× |
| Grok 4.3 | $1,25 | $2,50 | 2× |
| Gemini 2.5 Pro | $1,25 | $10 | 8× |
| DeepSeek V4 Pro | $1,32 | $3,96 | 3× |
| Mistral Medium 3.5 | $1,50 | $7,50 | 5× |
| Gemini 3.5 Flash | $1,50 | $9 | 6× |
| GPT-5.3 Codex | $1,75 | $14 | 8× |
| Grok 4.5 | $2 | $6 | 3× |
| Claude Sonnet 5 | $2 | $10 | 5× |
| GPT-5.6 Terra | $2 | $12 | 6× |
| Gemini 3.1 Pro | $2 | $12 | 6× |
| Cohere Command R+ | $2,50 | $10 | 4× |
| Amazon Nova Premier | $2,50 | $12,50 | 5× |
| GPT-5.4 | $2,50 | $15 | 6× |
| Claude Sonnet 4.6 | $3 | $15 | 5× |
| GPT-5.6 Sol | $4 | $20 | 5× |
| Claude Opus 5 | $5 | $25 | 5× |
| Claude Opus 4.8 | $5 | $25 | 5× |
| GPT-5.5 | $5 | $30 | 6× |
| Claude Fable 5 | $10 | $50 | 5× |
| GPT-5.5 Pro | $30 | $180 | 6× |
Durchgerechnete Fälle mit Zahlen aus dem Rechner
Support-Bot im Onlineshop: 5.000 Gespräche am Tag
Ein Händler beantwortet Kundenanfragen mit einem Bot. Jedes Gespräch trägt rund 2.000 Eingabe-Tokens – System-Prompt, Bestelldaten, Verlauf, Frage – und 800 Ausgabe-Tokens für die Antwort, bei 5.000 Gesprächen am Tag.
| Modell | pro Anfrage | pro Monat | pro Jahr |
|---|---|---|---|
| Claude Opus 5 | $0,03 | $4.500,00 | $54.750,00 |
| GPT-5.6 Terra | $0,0136 | $2.040,00 | $24.820,00 |
| Claude Sonnet 5 | $0,012 | $1.800,00 | $21.900,00 |
| Gemini 3.6 Flash | $0,0045 | $675,00 | $8.212,50 |
| DeepSeek V4 Flash | $0,0016 | $234,00 | $2.847,00 |
| Gemini 2.5 Flash-Lite | $0,00052 | $78,00 | $949,00 |
| Amazon Nova Micro | $0,000182 | $27,30 | $332,15 |
Die Modellwahl ist bei dieser Last der größte Hebel: zwischen Claude Opus 5 und Amazon Nova Micro liegen im Jahr $54.750,00 gegen $332,15. Das ist allerdings kein fairer Vergleich, denn ein Bot, der Bestelldaten interpretieren und Rückgabefristen korrekt anwenden soll, ist auf Nova Micro nicht gut aufgehoben.
Interessanter ist die Mitte. Claude Sonnet 5 kostet $1.800,00 im Monat, GPT-5.6 Terra $2.040,00. Auf der Eingabeseite liegt Terra bei 100 % des Sonnet-5-Satzes; auf der Ausgabeseite trennt die beiden $10 gegen $12 je Million. Der Abstand schrumpft deshalb, sobald die Last eingabelastiger wird: Bei 8.000 zu 200 Tokens und sonst gleichen Annahmen stehen $2.700,00 gegen $2.760,00. Genau dafür steht die Aufteilung nach Eingabe und Ausgabe unter der ersten Karte.
Für die Budgetfreigabe zählt die vierte Karte. Ein Monatsbetrag von $1.800,00 klingt handhabbar; $21.900,00 im Jahr ist eine Position, die in die Planung gehört und in Deutschland zusätzlich durch Wechselkurs und Umsatzsteuer läuft.
RAG über die eigene Dokumentation: 8.000 Tokens Kontext, 1.000 Abfragen am Tag
Ein Team hängt einen Retrieval-Schritt vor das Modell: Pro Frage wandern rund 8.000 Tokens aus der internen Dokumentation in den Prompt, die Antwort bleibt bei etwa 500 Tokens, und das System beantwortet 1.000 Fragen am Tag.
GPT-5.6 Sol: $0,042 je Abfrage, $42,00 am Tag, $1.260,00 im Monat, $15.330,00 im Jahr.
Claude Sonnet 5: $0,021 je Abfrage, $630,00 im Monat, $7.665,00 im Jahr.
Gemini 3.6 Flash: $0,0079 je Abfrage, $236,25 im Monat, $2.874,38 im Jahr.
DeepSeek V4 Flash: $0,003 je Abfrage, $90,00 im Monat, $1.095,00 im Jahr.
Das Bild kippt gegenüber dem Chatbot. Bei 8.000 zu 500 Tokens entfallen bei allen vier Modellen gut drei Viertel der Rechnung auf die Eingabeseite, und der Ausgabepreis, an dem sich Modellvergleiche sonst entscheiden, fällt kaum noch ins Gewicht. Für Dokumentenarbeit und RAG ist deshalb der Eingabetarif die Kennzahl, auf die Sie schauen – bei GPT-5.6 Sol sind das $4 je Million, bei Gemini 3.6 Flash $0,75, bei DeepSeek V4 Flash $0,30.
Zwei Hinweise zu dieser Rechnung. Erstens gilt bei Gemini 3.6 Flash ab dem 1. Januar 2027 der doppelte Tarif, also $1,50 und $7,50 je Million; die Jahreszahl oben verdoppelt sich damit für jeden Monat nach diesem Datum. Zweitens ist ein RAG-Prompt der Idealfall für Prompt-Caching, weil ein großer Teil des Kontexts über viele Anfragen hinweg identisch bleibt. Ein Cache-Treffer wird bei OpenAI und Anthropic mit 10 % des Eingabetarifs berechnet; bei GPT-5.6 Sol sind das $0,40 statt $4. Um das abzubilden, wählen Sie „Benutzerdefiniert“ und tragen den Mischtarif ein, den Ihre tatsächliche Trefferquote ergibt.
Deutscher Text, englisches Budget: was der Aufschlag im Jahr ausmacht
Viele Token-Schätzungen stammen aus englischen Beispielen, aus einem Blogbeitrag oder aus der Dokumentation eines Anbieters. Wenn Ihre Anwendung deutsche Texte verarbeitet, sind diese Zahlen zu niedrig angesetzt, und die Abweichung wächst mit dem Anteil an Fachsprache, Behördendeutsch und Komposita.
Die Formel des Rechners ist in den Token-Zahlen linear. Ein Aufschlag von 30 % auf die Token-Zahl schlägt deshalb exakt als 30 % auf jede der vier Karten durch – da gibt es keinen Sockel und keine Staffel, die etwas abfedert. Am Support-Bot aus dem ersten Beispiel lässt sich das direkt ablesen. Mit 2.000 zu 800 Tokens kostet Claude Sonnet 5 $1.800,00 im Monat und $21.900,00 im Jahr. Zerfällt derselbe Inhalt auf Deutsch in 2.600 zu 1.040 Tokens, stehen dort $2.340,00 und $28.470,00.
Die 30 % sind hier ein Rechenbeispiel, keine Konstante. Belastbar wird die Zahl so: Nehmen Sie 20 bis 50 echte Anfragen aus dem Betrieb, lesen Sie das usage-Feld der API-Antwort aus, bilden Sie den Mittelwert, und tragen Sie diesen in „Eingabe-Tokens“ und „Ausgabe-Tokens“ ein. Das dauert eine halbe Stunde und ersetzt jede Faustregel.
Sprache und Modellgeneration werden dabei regelmäßig verwechselt, obwohl sie unabhängig voneinander wirken. Der Sprachaufschlag steckt in Ihrem Textbestand: Deutsch erzeugt auf englischzentrierten Tokenizern mehr Tokens je Wort als Englisch, gemessen im Teuken-7B-Papier des OpenGPT-X-Konsortiums. Er bleibt, solange die Anwendung deutsch bedient wird, und kein Modellwechsel nimmt ihn Ihnen ab.
Der Generationsaufschlag steckt im Modell. Anthropic dokumentiert, dass Claude 4.7 und neuer denselben Text in rund 30 % mehr Tokens zerlegen als die Vorgänger – rechnerisch dieselbe Bewegung wie oben, nur mit anderer Ursache. Beim Sprachaufschlag bleibt die Tarifzeile dabei stehen; beim Generationswechsel bewegt sie sich mit, denn Sonnet 4.6 steht bei $3/$15 und Sonnet 5 bei $2/$10. Derselbe Bot kostet auf Sonnet 4.6 mit 2.000 zu 800 Tokens $2.700,00 im Monat und auf Sonnet 5 mit den 2.600 zu 1.040 Tokens der neuen Generation $2.340,00. Der Tarif ist um ein Drittel gefallen, die Rechnung nur um rund ein Achtel.
Wer beide Aufschläge gleichzeitig trägt – deutsche Texte auf einem Modell der neuen Generation –, rechnet sie übereinander: 1,3 × 1,3 ergibt den Faktor 1,69 auf die Token-Zahl und damit auf alle vier Karten.
Von der Dollarzahl zur Position in der Buchhaltung: Umsatzsteuer und Wechselkurs
Die vier Karten zeigen den Nettobetrag in US-Dollar, den der Anbieter für die Tokens verlangt. Im deutschen Rechnungswesen kommt diese Zahl nicht unverändert an, und was sie unterwegs verändert, steht auf keiner Preisliste.
Am Wechselkurs führt kein Weg vorbei. Belastet wird in Dollar; was Ihr Konto trifft, hängt vom Kurs des Abrechnungstages und vom Fremdwährungsentgelt der Karte oder des Zahlungsdienstleisters ab. Ein Rechner, der einen fest verdrahteten Kurs mitliefert, ist ab dem Tag falsch, an dem sich der Kurs bewegt. Sinnvoller ist es, den Aufschlag als Faktor auf die Tarife zu legen: Wählen Sie „Benutzerdefiniert“ und multiplizieren Sie beide Preise mit Ihrem eigenen Alles-inklusive-Faktor. Kostet Sie die Umrechnung samt Entgelt 2 %, wird aus Claude Sonnet 5 mit $2/$10 ein Tarif von $2,04 und $10,20 je Million – und weil die Formel linear ist, steigen alle vier Karten um dieselben 2 %.
Bei der Umsatzsteuer entscheidet ein einziges Feld im Kundenkonto. Für eine sonstige Leistung, die ein deutsches Unternehmen von einem im übrigen Gemeinschaftsgebiet ansässigen Anbieter bezieht, geht die Steuerschuld nach § 13b Abs. 1 UStG auf den Leistungsempfänger über. Die Handelskammer Hamburg beschreibt die praktische Seite: Die Rechnung kommt ohne Umsatzsteuer, muss die USt-IdNr. beider Seiten ausweisen, und der Empfänger meldet die Steuer in der Voranmeldung an und zieht sie bei voller Vorsteuerberechtigung im selben Schritt wieder ab – unter dem Strich fließt kein Geld ans Finanzamt.
Daraus folgt eine Aufgabe, die in fünf Minuten erledigt ist und sonst monatelang liegen bleibt: Tragen Sie Ihre USt-IdNr. im Kundenkonto des Anbieters ein, bevor die erste nennenswerte Rechnung läuft. Fehlt sie, behandelt der Anbieter Sie wie einen privaten Endkunden und rechnet die Umsatzsteuer seines Sitzlandes auf. Aus dem Nettobetrag der Karten wird dann ein Bruttobetrag, der je nach Sitzland des Anbieters deutlich über dem hier gerechneten liegt, und die Korrektur einer bereits ausgestellten Rechnung ist aufwendiger als der Eintrag vorab.
Für eine Budgetvorlage heißt das: Nehmen Sie die Jahreskarte, legen Sie Ihren Wechselkurs-Faktor darauf, und weisen Sie den Betrag als Netto aus. Den Link zum eingestellten Fall liefert der Knopf „Teilen“ mit, damit die Annahmen nachvollziehbar bleiben.
Tokens aus Text schätzen: was unter dem Textfeld steht
Der Schätzer rechnet mit max(⌈Zeichen ÷ 4⌉, ⌈Wörter × 1,33⌉) und nimmt den größeren der beiden Werte. Welcher Weg gewinnt, hängt am Satzbau, und für deutsche Texte lässt sich das an zwei Sätzen zeigen.
Der Satz „Die Softwareentwicklungsabteilung hat die Kostenberechnungsgrundlage für Sprachmodelle vollständig überarbeitet und dokumentiert.“ hat 129 Zeichen und 11 Wörter. Über die Zeichen ergibt das ⌈129 ÷ 4⌉ = 33, über die Wörter ⌈11 × 1,33⌉ = 15. Angezeigt werden 33 geschätzte Tokens: Bei Komposita gewinnt die Zeichenseite deutlich.
Der Satz „Hallo Welt, wie geht es dir heute?“ hat 34 Zeichen und 7 Wörter. Über die Zeichen sind das ⌈34 ÷ 4⌉ = 9, über die Wörter ⌈7 × 1,33⌉ = 10. Angezeigt werden 10 Tokens, hier führt also die Wortseite. Ein englischer Kontrollsatz mit 84 Zeichen und 18 Wörtern landet aus demselben Grund bei 24 Tokens.
Die Heuristik zählt Zeichen und Wörter. Für lange deutsche Fachbegriffe liegt sie tendenziell zu niedrig, weil ein echter BPE-Tokenizer ein Kompositum in mehr Stücke zerlegt als ein glatter Vierer-Schnitt. Code, JSON, lange Zahlenkolonnen und Emoji zerfallen noch stärker. Für einen Budgetrahmen reicht die Schätzung; für die Abstimmung mit der Abrechnung nehmen Sie das usage-Feld der API oder, bei OpenAI-Modellen, tiktoken mit der Kodierung o200k_base.
Ein praktischer Weg, den Schätzer zu nutzen: Fügen Sie einen echten System-Prompt ein statt eines Beispielsatzes. Der System-Prompt ist der Teil, der bei jeder einzelnen Anfrage mitfährt, und er ist in vielen Anwendungen länger als die Nutzerfrage. Was hier 400 Tokens zeigt, steht bei 5.000 Anfragen am Tag für zwei Millionen Eingabe-Tokens täglich – und genau diese Zahl tragen Sie dann in „Eingabe-Tokens“ ein.
Fehler, die eine Token-Kalkulation regelmäßig verzerren
- Nur die Karte „Kosten pro Anfrage“ lesen. Ein Betrag im Bereich weniger Cent je Anfrage wirkt harmlos, und genau dort verlieren Projekte ihr Budget. Maßgeblich ist Preis mal Frequenz mal Tage: Der Support-Bot aus den Beispielen kostet auf Claude Sonnet 5 $0,012 je Gespräch und $21.900,00 im Jahr. Füllen Sie „Anfragen pro Tag“ aus, bevor Sie eine Zahl weitergeben.
- Eingabe- und Ausgabepreis vertauschen. Die Ausgabeseite ist fast überall die teurere, und um wie viel, steht in der Spalte „Ausgabe ÷ Eingabe“: 5 bei Claude Opus 5, 5 bei GPT-5.6 Sol, 8 bei Gemini 2.5 Pro und nur 2 bei Grok 4.3. Wer optimiert, beginnt deshalb bei max_tokens und nicht beim Prompt.
- Token-Zahlen aus einer englischen Messung übernehmen. Deutsche Texte erzeugen auf englischzentrierten Tokenizern mehr Tokens je Wort, gemessen im Teuken-7B-Papier des OpenGPT-X-Konsortiums. Weil die Formel linear ist, wandert der Aufschlag eins zu eins in die Jahreskarte. Messen Sie ihn am eigenen Textbestand über das usage-Feld, statt einen Prozentwert aus einem englischsprachigen Beitrag zu übernehmen.
- Einen gefallenen Tarif als gefallene Rechnung verbuchen. Claude Sonnet 4.6 steht bei $3/$15, Claude Sonnet 5 bei $2/$10 – ein Drittel weniger je Million auf beiden Seiten. Ab Claude 4.7 läuft laut Anthropic aber ein neuerer Tokenizer, der denselben Text in rund 30 % mehr Tokens zerlegt, und am Monatsbetrag des Support-Bots kommt von dem Drittel deshalb rund ein Achtel an: $2.700,00 gegen $2.340,00. Messen Sie die Token-Zahlen am neuen Modell nach, bevor Sie einen Wechsel mit dem Tarifvergleich begründen.
- Den Gesprächsverlauf vergessen. Die API ist zustandslos: In Runde zehn schicken Sie die neun vorherigen Runden erneut mit, weshalb die Eingabe-Tokens fast quadratisch wachsen und ein mittellanger Dialog auf Zehntausende Tokens je Aufruf kommt. Entweder Sie halten ein gleitendes Fenster der letzten Runden, oder Sie fassen ältere Nachrichten zusammen – und tragen dann den realistischen Mittelwert in „Eingabe-Tokens“ ein, nicht die Länge der ersten Frage.
- Caching und Batch aus der Rechnung lassen. Beides sind Nachlässe, die die Anbieter in ihren Preisübersichten selbst ausweisen. Ein Cache-Treffer wird bei OpenAI und Anthropic mit 10 % des Eingabetarifs berechnet – bei GPT-5.6 Sol also $0,40 statt $4 –, und Anthropic verlangt für das Schreiben eines Fünf-Minuten-Caches das 1,25-Fache des Eingabetarifs, sodass sich ein Cache bereits ab dem ersten Treffer rechnet. Nicht zeitkritische Arbeit läuft über die Batch-API mit 50 % Nachlass auf beide Seiten.
- Den Langkontext-Aufschlag übersehen. Bei Grok 4.5, Grok 4.3, Gemini 3.1 Pro und Gemini 2.5 Pro gilt oberhalb von 200.000 Tokens Prompt ein höherer Tarif, und auch GPT-5.6 Sol, Terra und Luna rechnen oberhalb einer Kontextschwelle anders ab. Hinterlegt ist überall der Kurzkontext-Tarif. Wer ganze Aktenbestände in einen einzigen Aufruf legt, trägt den höheren Satz unter „Benutzerdefiniert“ nach.
- Die Umsatzsteuer erst beim Jahresabschluss betrachten. Ohne hinterlegte USt-IdNr. behandelt ein Anbieter mit Sitz im EU-Ausland Sie wie einen Endkunden und rechnet die Umsatzsteuer seines Sitzlandes auf; mit hinterlegter Nummer greift die Steuerschuldnerschaft des Leistungsempfängers nach § 13b Abs. 1 UStG, und die Rechnung kommt netto. Die Karten hier zeigen immer den Nettobetrag – prüfen Sie einmal, welchen Betrag Ihre Karte tatsächlich belastet.
- Für jede Aufgabe das Spitzenmodell einsetzen. Klassifizieren, Extrahieren, Umformulieren und Weiterleiten laufen auf GPT-5.6 Luna, Claude Haiku 4.5, Mistral Small 4 oder DeepSeek V4 Flash zuverlässig genug. Zwischen GPT-5.6 Sol und GPT-5.6 Luna liegt innerhalb derselben Familie der Faktor 20 auf der Eingabeseite. Eine Weiche, die nach Schwierigkeit verteilt und nur im Zweifel eskaliert, halbiert in der Praxis oft die Rechnung.
- Eine Einführungsaktion als Dauerpreis budgetieren. Neue Modelle starten häufig zu einem befristeten Satz, und Vergleichstabellen übernehmen diesen Satz gern ohne Hinweis auf das Ablaufdatum. Hier steht überall der Standardtarif für Einzelanfragen, damit eine Jahresplanung den Tag übersteht, an dem die Aktion endet. Einen Aktionspreis rechnen Sie bei Bedarf unter „Benutzerdefiniert“ nach.
Häufige Fragen zu Token-Kosten und LLM-APIs
Was kostet GPT-5.6 Sol pro 1 Mio. Tokens?
GPT-5.6 Sol kostet $4 je Million Eingabe-Tokens und $20 je Million Ausgabe-Tokens zum Standardtarif. GPT-5.6 Terra liegt bei $2/$12, GPT-5.6 Luna bei $0,20/$1,20.
Was kostet Claude Opus 5 pro 1 Mio. Tokens?
Claude Opus 5 kostet $5 je Million Eingabe-Tokens und $25 je Million Ausgabe-Tokens. Claude Sonnet 5 liegt bei $2/$10, Claude Haiku 4.5 bei $1/$5.
Warum kosten Ausgabe-Tokens mehr als Eingabe-Tokens?
Weil das Modell die Antwort Token für Token vorhersagt und anhängt, die Eingabe dagegen in einem Durchgang liest. Der Faktor steht in der Tabelle: 5 bei Claude Opus 5, 5 bei GPT-5.6 Sol, 2 bei Grok 4.3.
Wie viele Tokens hat ein deutsches Wort?
Es gibt keine Konstante, und jede Zahl, die ohne Tokenizer genannt wird, ist eine Schätzung. Im Teuken-7B-Papier des OpenGPT-X-Konsortiums liegt die Fertility für Deutsch – also die Zahl der Tokens je Wort – bei jedem verglichenen englischzentrierten Tokenizer über dem englischen Wert; ein Kompositum wie „Krankenversicherungsbeitrag“ zerfällt in mehrere Stücke, während „und“ oder „ich“ je ein Token belegen. Der Schätzer auf dieser Seite rechnet nicht mit einem Wortfaktor, sondern nimmt den größeren Wert aus Zeichen ÷ 4 und Wörter × 1,33. Für Ihre eigene Anwendung ist das usage-Feld der API die einzige belastbare Quelle: 20 bis 50 echte Anfragen auswerten genügt.
Sind deutsche Texte in der KI-Nutzung teurer als englische?
Bei gleichem Inhalt ja, weil dieselbe Aussage auf Deutsch in mehr Tokens zerfällt und die Abrechnung an den Tokens hängt, nicht an den Wörtern. Das OpenGPT-X-Konsortium führt in seinem Teuken-7B-Papier genau diesen Punkt als „additional inference costs“ für nicht-englische europäische Sprachen an. Wie groß der Aufschlag ausfällt, hängt am Tokenizer des Modells und an Ihrer Textsorte – Behördendeutsch und technische Fachsprache mit langen Komposita liegen deutlich über einer einfachen Chat-Konversation. Rechnen Sie den gemessenen Aufschlag direkt in die Felder „Eingabe-Tokens“ und „Ausgabe-Tokens“ ein; weil die Formel linear ist, erscheint er unverändert in der Jahreskarte.
Was kostet ein KI-Chatbot pro Monat?
Das hängt an Modell, Gesprächslänge und Volumen. Für einen Bot mit 2.000 Eingabe- und 800 Ausgabe-Tokens je Gespräch bei 5.000 Gesprächen am Tag: Claude Opus 5 $4.500,00, GPT-5.6 Terra $2.040,00, Claude Sonnet 5 $1.800,00, Gemini 3.6 Flash $675,00, DeepSeek V4 Flash $234,00 und Amazon Nova Micro $27,30. Bei einem internen Assistenten mit 100 Anfragen am Tag, also einem Fünfzigstel dieser Last, sind es auf Claude Sonnet 5 $36,00 im Monat.
Wie rechne ich die Token-Kosten in Euro um?
Die Anbieter fakturieren in US-Dollar, deshalb zeigen die Karten Dollar. Für einen Euro-Betrag brauchen Sie zwei Angaben, die nur Sie haben: den Kurs Ihres Abrechnungstages und das Fremdwährungsentgelt Ihrer Karte oder Ihres Zahlungsdienstleisters. Ein fest eingebauter Kurs wäre ab dem nächsten Handelstag falsch, deshalb steht hier keiner. Der saubere Weg: Wählen Sie „Benutzerdefiniert“ und multiplizieren Sie beide Tarife mit Ihrem Alles-inklusive-Faktor. Bei 2 % wird aus Claude Sonnet 5 mit $2/$10 ein Tarif von $2,04 und $10,20, und alle vier Karten steigen um dieselben 2 %.
Zahle ich auf die API-Rechnung Umsatzsteuer?
Als deutsches Unternehmen mit hinterlegter USt-IdNr. in der Regel nicht direkt an den Anbieter. Für eine sonstige Leistung von einem im übrigen Gemeinschaftsgebiet ansässigen Unternehmer geht die Steuerschuld nach § 13b Abs. 1 UStG auf Sie als Leistungsempfänger über; die Handelskammer Hamburg beschreibt die Folge: Die Rechnung wird ohne Umsatzsteuer ausgestellt und muss die USt-IdNr. beider Seiten tragen, Sie melden die Steuer in der Voranmeldung an und ziehen sie bei voller Vorsteuerberechtigung im selben Schritt wieder ab. Fehlt Ihre Nummer im Kundenkonto, rechnet der Anbieter stattdessen die Umsatzsteuer seines Sitzlandes auf. Prüfen Sie den Eintrag, bevor die erste größere Rechnung läuft.
Welches Modell hat das beste Preis-Leistungs-Verhältnis?
Das entscheidet sich an Ihrer eigenen Testmenge. Die sechs günstigsten Einträge im Katalog sind Amazon Nova Micro ($0,035/$0,14), Cohere Command R7B ($0,0375/$0,15), Gemini 2.5 Flash-Lite ($0,10/$0,40), Mistral Small 4 ($0,15/$0,60), GPT-5.6 Luna ($0,20/$1,20) und GPT-5.4 Nano ($0,20/$1,25). Eine Stufe darüber liegen DeepSeek V4 Flash $0,30/$1,20, Codestral $0,30/$0,90 und Gemini 3.1 Flash-Lite $0,25/$1,50; im Mittelfeld arbeiten Claude Haiku 4.5 $1/$5, Grok 4.3 $1,25/$2,50 und DeepSeek V4 Pro $1,32/$3,96. Der praktikable Weg ist eine Weiche: einfache Aufgaben auf die günstige Stufe, und nur bei Bedarf auf GPT-5.6 Sol, Claude Opus 5 oder Claude Fable 5 eskalieren.
Der Tarif von Claude Sonnet ist gesunken – sinkt meine Rechnung genauso?
Nein, deutlich weniger. Die Tarifzeile fällt um ein Drittel: Sonnet 4.6 steht bei $3/$15, Sonnet 5 bei $2/$10. Anthropic dokumentiert aber, dass Modelle ab Claude 4.7 – darunter Opus 5, Opus 4.8 und Sonnet 5 – einen neueren Tokenizer verwenden, der denselben Text in rund 30 % mehr Tokens zerlegt als die Vorgängergeneration, und dieser Aufschlag frisst den Tarifvorteil zum großen Teil auf. Am Support-Bot mit 2.000 zu 800 Tokens und 5.000 Gesprächen am Tag: auf Sonnet 4.6 $2.700,00 im Monat, auf Sonnet 5 mit denselben Texten und damit 2.600 zu 1.040 Tokens $2.340,00. Aus einem Drittel weniger Tarif werden so rund 13 % weniger Rechnung. Zwischen Opus 4.8 und Opus 5 entfällt der Tokenizer-Effekt, weil beide bereits zur neuen Generation gehören. Messen Sie die Token-Zahlen nach jedem Generationswechsel neu, statt die alten zu übernehmen.
Wie zähle ich Tokens exakt, bevor ich die API aufrufe?
Für OpenAI-Modelle mit der Bibliothek tiktoken und der Kodierung o200k_base. Für alles andere bleibt das usage-Feld der API-Antwort die verbindliche Quelle, weil die Tokenizer von Anthropic, Google und Meta nicht in gleicher Form offenliegen. Der Schätzer auf dieser Seite liefert die schnelle Hausnummer für eine Budgetplanung.
Was ist das Kontextfenster, und wie wirkt es auf die Kosten?
Das Kontextfenster ist die größte Zahl an Tokens, die ein Modell in einer Anfrage verarbeitet, Eingabe und Ausgabe zusammengenommen. Ein großes Fenster senkt den Preis für das Ausschöpfen dieses Fensters nicht, denn jedes mitgeschickte Token wird zum Eingabetarif abgerechnet. Zwei Modelle können dasselbe Fenster ausweisen und trotzdem unterschiedlich abrechnen – bei Grok 4.5, Grok 4.3, Gemini 3.1 Pro und Gemini 2.5 Pro gilt oberhalb von 200.000 Tokens ein höherer Tarif, hinterlegt ist hier jeweils der Kurzkontext-Satz. Für sehr lange Prompts tragen Sie den höheren Satz unter „Benutzerdefiniert“ nach.
Warum verbraucht ein Dialog mit wenigen Runden so viele Tokens?
Weil die API zustandslos ist: Jede Runde schickt den gesamten bisherigen Verlauf erneut mit. In Runde zehn stecken die neun vorherigen Runden in der Eingabe, weshalb die Token-Zahl fast quadratisch wächst. Prompt-Caching, ein gleitendes Fenster der letzten Runden oder eine periodische Zusammenfassung halten das in Grenzen.
Verbrauchen Bilder und Dateien auch Tokens?
Ja. Multimodale Modelle zerlegen ein Bild in Kacheln und rechnen diese in Tokens um; je nach Auflösung reicht die Spanne von einigen Hundert bis über tausend Tokens für ein einzelnes Bild. PDF-, Word- und Excel-Dateien werden meist vorher in Text umgewandelt und wie Text abgerechnet. Anwendungen mit hohem Bildanteil – Belegerkennung, Screenshot-Analyse, Wareneingangsprüfung – treiben die Rechnung am schnellsten, deshalb sollten Sie den realen Verbrauch an einer Teststichprobe messen, bevor Sie ein Budget dafür festschreiben.
Kann ich ein Modell rechnen, das nicht in der Liste steht?
Ja, über den Eintrag „Benutzerdefiniert“ im Auswahlfeld „Modell“. Damit tragen Sie beide Tarife selbst ein, und der Schalter neben den Preisfeldern stellt zwischen 1K und 1M um. Das ist auch der richtige Weg für ein Azure-OpenAI- oder Bedrock-Kontingent, für den Tarif eines Resellers, für einen ausgehandelten Rahmenvertrag oder für ein selbst gehostetes Modell, dessen Kosten Sie aus Serverstunden auf einen Preis je Million Tokens umgerechnet haben.
Gelten die Preise auch bei EU-Hosting über Azure oder Bedrock?
Nein, hinterlegt sind die Listenpreise der Erstanbieter-APIs. Azure OpenAI und Amazon Bedrock führen eigene Preislisten, und bei Azure unterscheidet sich der Tarif zusätzlich danach, ob ein Deployment global, in der EU-Datenzone oder regional gebunden läuft – etwa in Germany West Central. Wenn Ihre Anwendung personenbezogene Daten verarbeitet und die Verarbeitung an eine Region gebunden sein muss, nehmen Sie den Satz aus der Preisliste Ihres Deployments und tragen ihn unter „Benutzerdefiniert“ ein. Die Struktur der Rechnung bleibt gleich; nur die beiden Tarife ändern sich.
Ist der Token-Rechner kostenlos, und bleiben meine Texte privat?
Die Nutzung kostet nichts und verlangt keine Anmeldung. Der Text, den Sie in den Schätzer einfügen, wird im Browser verarbeitet: Er geht an keinen Server und verbraucht kein API-Kontingent. Der Inhalt des Textfelds wandert allerdings in die Adresse der Seite, damit ein geteilter Link denselben Fall zeigt; wer einen internen System-Prompt ausmisst, leert das Feld deshalb vor dem Teilen. Die Tarife stammen aus den öffentlichen Preislisten der Anbieter.
Wie genau ist die Kostenschätzung?
Die Multiplikation selbst ist exakt: Token-Zahlen mal Tarif je Million, und bei korrekten Eingaben trifft der Betrag je Anfrage die Position auf Ihrer Abrechnung. Die Unsicherheit sitzt in den Eingaben. Stammen die Token-Zahlen aus dem Schätzer und nicht aus dem usage-Feld, tragen sie den Fehler der Heuristik weiter, und bei deutscher Fachprosa zeigt der glatte Vierer-Schnitt eher zu wenig an. Der Monat läuft hier pauschal über 30 Tage; ein Monat mit 31 Tagen liegt rund 3 % darüber, der Februar rund 7 % darunter. Nachlässe fehlen ebenfalls, weil überall der Standardtarif für Einzelanfragen hinterlegt ist: Prompt-Caching, die Batch-API und ausgehandelte Rahmenverträge rechnen darunter ab. Und für ein deutsches Budget kommen Wechselkurs und Fremdwährungsentgelt noch hinzu. Für eine Budgetfreigabe ist das Ergebnis damit belastbar genug; verbindlich wird erst die Abrechnung des Anbieters.
Ich kenne meine Monatskosten. Wie senke ich die Rechnung?
Am stärksten wirkt die Modellwahl, und sie lässt sich hier direkt nachrechnen. Zwischen GPT-5.6 Sol und GPT-5.6 Luna liegt auf der Eingabeseite der Faktor 20. Tragen Sie dieselbe Last einmal mit dem Spitzenmodell und einmal mit der kleinen Stufe ein und lesen Sie die Differenz in der Jahreskarte ab.
Nachlässe bilden Sie über „Benutzerdefiniert“ ab. Ein Cache-Treffer kostet bei OpenAI und Anthropic 10 % des Eingabetarifs, die Batch-API 50 % auf beide Seiten; tragen Sie den Mischtarif ein, den Ihre tatsächliche Trefferquote ergibt – bei GPT-5.6 Sol also einen Eingabewert zwischen $0,40 und $4. Derselbe Weg trägt einen ausgehandelten Rahmenvertrag und ein Azure- oder Bedrock-Kontingent.
Auf der Ausgabeseite wirkt jedes eingesparte Token stärker als auf der Eingabeseite; wie viel stärker, steht in der Spalte „Ausgabe ÷ Eingabe“ – bei Claude Opus 5 das 5-Fache. Ein gesetztes max_tokens kostet keine Entwicklungszeit und wirkt ab dem nächsten Aufruf.
Und ein Posten verschwindet aus der Abrechnung, ohne dass ein einziges Token wegfällt. Mit hinterlegter USt-IdNr. greift die Steuerschuldnerschaft des Leistungsempfängers nach § 13b Abs. 1 UStG und die Rechnung kommt netto; ohne sie rechnet ein Anbieter mit Sitz im EU-Ausland die Umsatzsteuer seines Sitzlandes auf, und der belastete Betrag liegt über dem, was die vier Karten zeigen. Der Eintrag im Kundenkonto dauert fünf Minuten, die Korrektur einer bereits ausgestellten Rechnung deutlich länger.