Was sind Tokens bei KI-Sprachmodellen?
Tokens sind die kleinsten Verarbeitungseinheiten, die KI-Sprachmodelle wie GPT, Claude, Gemini, Grok, DeepSeek, Mistral und Llama verwenden, um Text zu verstehen und zu erzeugen. Ein Token ist keine feste Einheit -- es kann ein ganzes Wort, ein Wortteil, ein einzelnes Zeichen oder sogar ein Satzzeichen sein. Im Englischen entspricht ein Token im Durchschnitt etwa 4 Zeichen oder 0,75 Wörtern; im Deutschen liegt das Verhältnis wegen der typischen Komposita (zusammengesetzten Wörter) oft höher.
Die API-Kosten aller großen KI-Anbieter -- OpenAI (GPT), Anthropic (Claude), Google (Gemini), xAI (Grok), DeepSeek, Mistral AI und Meta (Llama) -- werden pro Token abgerechnet, nicht pro Wort oder Zeichen. Dabei unterscheidet man zwischen Input-Tokens (der Text, den Sie an das Modell senden) und Output-Tokens (die Antwort des Modells). Output-Tokens sind in der Regel 3- bis 8-mal teurer als Input-Tokens.
Für Entwickler, Unternehmen und KI-Anwender im DACH-Raum ist das Verständnis von Tokens entscheidend, um API-Kosten zu planen und zu optimieren. Unser Token-Rechner hilft Ihnen, die Token-Anzahl eines Textes zu ermitteln und die Kosten über verschiedene Modelle hinweg sofort zu vergleichen.
Wie berechnet man KI-Token und API-Kosten?
Um die Kosten eines API-Aufrufs zu berechnen, benötigen Sie drei Informationen: die Anzahl der Input-Tokens, die Anzahl der Output-Tokens und den Preis pro Token des gewählten Modells.
Schritt-für-Schritt-Anleitung:
1. Ermitteln Sie die Token-Anzahl Ihres Eingabetextes. Unser Rechner nutzt dafür den BPE-Tokenizer (Byte Pair Encoding), den auch GPT und Claude verwenden. Die Faustregel für Deutsch: 1 Wort ergibt durchschnittlich 1,3 bis 1,5 Tokens.
2. Schätzen Sie die erwarteten Output-Tokens. Eine kurze Antwort hat typischerweise 50-150 Tokens, eine ausführliche Erklärung 500-1.500 Tokens.
3. Multiplizieren Sie die Input-Tokens mit dem Input-Preis und die Output-Tokens mit dem Output-Preis des gewählten Modells.
4. Addieren Sie beide Werte, um die Gesamtkosten pro Anfrage zu erhalten.
Beispiel: Sie senden einen Prompt mit 800 Input-Tokens an GPT-5.4 ($2,50 pro 1 Mio. Input-Tokens) und erhalten eine Antwort mit 400 Output-Tokens ($15,00 pro 1 Mio. Output-Tokens). Die Kosten betragen: (800 × 0,0000025) + (400 × 0,000015) = 0,002 + 0,006 = $0,008 pro Anfrage -- umgerechnet etwa 0,0073 EUR.
Bei 10.000 solchen Anfragen pro Monat lägen die Kosten bei rund 73 EUR. Unser Rechner führt diese Berechnung automatisch durch und vergleicht die Ergebnisse über alle gängigen Modelle hinweg.
Häufig gestellte Fragen zu KI-Tokens und Kosten
Wie viele Tokens hat ein deutsches Wort?
Ein deutsches Wort besteht im Durchschnitt aus 1,3 bis 1,5 Tokens -- mehr als im Englischen (ca. 1,0 bis 1,3 Tokens pro Wort). Der Grund: Die Tokenizer der großen KI-Modelle wurden überwiegend auf englischen Texten trainiert und zerlegen lange deutsche Komposita in mehrere Teil-Tokens. Das Wort 'Krankenversicherung' wird beispielsweise in 3-4 Tokens zerlegt, während einfache Wörter wie 'ich' oder 'und' jeweils nur ein Token ergeben.
Warum sind Output-Tokens teurer als Input-Tokens?
Output-Tokens sind 3- bis 8-mal teurer, weil die Generierung von Text rechenintensiver ist als das Lesen. Beim Input verarbeitet das Modell alle Tokens parallel (Encoding). Beim Output muss es dagegen jeden Token einzeln vorhersagen und sequenziell erzeugen (Decoding), was deutlich mehr GPU-Rechenleistung erfordert.
Was kostet eine einzelne ChatGPT-API-Anfrage?
Eine typische API-Anfrage mit GPT-5.4 (500 Input-Tokens, 300 Output-Tokens) kostet etwa $0,006 -- umgerechnet rund 0,0053 EUR. Bei 1.000 solchen Anfragen pro Tag ergibt das rund 159 EUR monatlich. Mit dem günstigeren GPT-5.4 Nano sinken die Kosten auf unter 0,001 EUR pro Anfrage, also rund 13 EUR pro Monat für dieselbe Menge.
Welches KI-Modell hat das beste Preis-Leistungs-Verhältnis?
Das hängt vom Anwendungsfall ab. Die günstigsten Modelle (Input/Output pro 1 Mio. Tokens): Amazon Nova Micro ($0,035/$0,14), Cohere Command R7B ($0,0375/$0,15), Gemini 2.5 Flash-Lite ($0,10/$0,40), DeepSeek V4 Flash ($0,14/$0,28), Mistral Small 4 ($0,15/$0,60) und GPT-5.6 Luna ($0,20/$1,20). Die Mittelklasse: Gemini 3.1 Flash-Lite ($0,25/$1,50), Gemini 2.5 Flash ($0,30/$2,50), Gemini 3.5 Flash-Lite ($0,30/$2,50), DeepSeek V4 Pro ($0,435/$0,87), Mistral Large 3 ($0,50/$1,50), GPT-5.4 Mini ($0,75/$4,50), Claude Haiku 4.5 ($1/$5), Grok 4.3 ($1,25/$2,50). Die Premium-Modelle: Gemini 3.5 Flash ($1,50/$9), Mistral Medium 3.5 ($1,50/$7,50), Gemini 3.1 Pro ($2/$12), GPT-5.4 ($2,50/$15), Claude Sonnet 4.6 ($3/$15), Claude Opus 4.8 ($5/$25), GPT-5.5 ($5/$30), Claude Fable 5 ($10/$50). Als Faustregel: Testen Sie mehrere Modelle mit Ihren konkreten Aufgaben und vergleichen Sie Qualität und Kosten.
Wie kann ich meine monatlichen KI-Kosten vorab berechnen?
Schätzen Sie drei Werte: (1) die durchschnittliche Anzahl Input-Tokens pro Anfrage, (2) die durchschnittliche Anzahl Output-Tokens pro Antwort und (3) die Anzahl der Anfragen pro Monat. Multiplizieren Sie diese Werte mit den Token-Preisen des gewählten Modells. Unser Token-Rechner erledigt dies automatisch: Geben Sie Ihren Text ein, wählen Sie ein Modell, und Sie sehen sofort die Kosten pro Anfrage und die hochgerechneten Monatskosten.
Sind deutsche Texte teurer als englische bei der KI-Verarbeitung?
Ja, typischerweise 20 bis 30 % teurer. Deutsche Texte erzeugen mehr Tokens als die gleiche Information auf Englisch, weil die BPE-Tokenizer auf englischdominanten Trainingsdaten basieren. Lange Komposita wie 'Kraftfahrzeughaftpflichtversicherung' werden in viele Tokens zerlegt. Auch Umlaute (ä, ö, ü) und das ß können zusätzliche Tokens verursachen. Wer KI-gestützte Anwendungen für den deutschen Markt plant, sollte diesen Aufschlag in der Kostenkalkulation berücksichtigen.
Was ist der Unterschied zwischen Tokens und Wörtern?
Wörter sind linguistische Einheiten, die durch Leerzeichen getrennt werden. Tokens sind dagegen algorithmische Einheiten, die ein KI-Modell intern verwendet. Ein Wort kann aus einem oder mehreren Tokens bestehen. Das englische Wort 'hello' ist ein Token, aber 'unbelievable' wird in 'un', 'believ' und 'able' zerlegt -- drei Tokens. Im Deutschen ist das Verhältnis noch ungünstiger: 'Gesundheitsministerium' ergibt typischerweise 4-5 Tokens. Satzzeichen, Zahlen und Sonderzeichen sind jeweils eigene Tokens.
Wie unterscheiden sich die Preise von GPT, Claude und Gemini?
Stand Juni 2026: Die Flaggschiff-Modelle kosten pro 1 Mio. Input/Output-Tokens: Claude Fable 5 ca. $10/$50, GPT-5.5 ca. $5/$30, Claude Opus 4.8 ca. $5/$25, Gemini 3.1 Pro ca. $2/$12, Mistral Medium 3.5 ca. $1,50/$7,50. Die Mittelklasse-Modelle: Claude Sonnet 4.6 $3/$15, GPT-5.4 $2,50/$15, Gemini 3.5 Flash $1,50/$9, Grok 4.3 $1,25/$2,50, GPT-5.4 Mini $0,75/$4,50. Die Budget-Modelle: Claude Haiku 4.5 $1/$5, Gemini 3.5 Flash-Lite $0,30/$2,50, GPT-5.4 Nano $0,20/$1,25, DeepSeek V4 Flash $0,14/$0,28, Gemini 2.5 Flash-Lite $0,10/$0,40, Mistral Small 4 $0,15/$0,60, Amazon Nova Micro $0,035/$0,14. Die Preise sind im Vergleich zu 2024 um etwa 80 % gesunken.
Wie vergleichen sich alle KI-API-Anbieter beim Preis im Jahr 2026?
Hier ein vollständiger Preisvergleich aller großen KI-API-Anbieter (Input/Output pro 1 Mio. Tokens, Stand Juni 2026):
Ultra-Budget: Amazon Nova Micro $0,035/$0,14 | Command R7B (Cohere) $0,0375/$0,15 | Mistral Small 4 $0,15/$0,60 | Gemini 2.5 Flash-Lite $0,10/$0,40.
Budget: DeepSeek V4 Flash $0,14/$0,28 | GPT-5.4 Nano (OpenAI) $0,20/$1,25 | Gemini 3.1 Flash-Lite $0,25/$1,50 | Codestral (Mistral) $0,30/$0,90 | Gemini 2.5 Flash $0,30/$2,50 | Gemini 3.5 Flash-Lite $0,30/$2,50.
Mittelklasse: DeepSeek V4 Pro $0,435/$0,87 | Mistral Large 3 $0,50/$1,50 | Llama 3.3 70B via Groq $0,59/$0,79 | GPT-5.4 Mini (OpenAI) $0,75/$4,50 | Claude Haiku 4.5 (Anthropic) $1/$5 | Grok 4.3 (xAI) $1,25/$2,50 | Gemini 2.5 Pro (Google) $1,25/$10 | Command R+ (Cohere) $2,50/$10.
Premium: Gemini 3.5 Flash (Google) $1,50/$9 | Mistral Medium 3.5 $1,50/$7,50 | Gemini 3.1 Pro (Google) $2/$12 | GPT-5.4 (OpenAI) $2,50/$15 | Nova Premier (Amazon) $2,50/$12,50 | Claude Sonnet 4.6 (Anthropic) $3/$15 | Claude Opus 4.8 (Anthropic) $5/$25 | GPT-5.5 (OpenAI) $5/$30 | Claude Fable 5 (Anthropic) $10/$50.
Alle Preise in USD. Viele Anbieter gewähren zusätzlich Rabatte für Batch-Verarbeitung (bis 50 %) und Prompt-Caching (Cache-Treffer kosten bei OpenAI und Anthropic nur 10 % des Input-Preises). Beachten Sie: OpenAI hat ältere Modelle wie GPT-4.1, GPT-4o, o3 und GPT-5 bis 5.3 aus dem Standard-Preisangebot entfernt, und DeepSeek hat V3.2 und R1 in der V4-Familie zusammengeführt. Open-Source-Modelle wie Llama 4 und DeepSeek V4 können über Hosting-Anbieter wie Groq besonders günstig genutzt werden.
Welche KI-Modelle eignen sich am besten für Programmierung, Reasoning und kreative Aufgaben?
Programmierung: Claude Fable 5, Claude Opus 4.8 und Claude Sonnet 4.6 (Anthropic) gelten als die stärksten Modelle für Code-Generierung, Debugging und Refactoring. Codestral (Mistral, $0,30/$0,90) ist speziell für Code optimiert und bietet ein hervorragendes Preis-Leistungs-Verhältnis, Devstral 2 ($0,40/$2,00) zielt auf agentische Coding-Workflows. GPT-5.5 und GPT-5.4 (OpenAI) liefern ebenfalls starke Code-Ergebnisse.
Reasoning und komplexe Logik: GPT-5.5 und GPT-5.4 (OpenAI) arbeiten mit mehrstufigem Chain-of-Thought-Reasoning. DeepSeek V4 Pro ($0,435/$0,87) bietet starkes Reasoning zum Budget-Preis. Gemini 3.1 Pro (Google) überzeugt bei langen, analytischen Aufgaben.
Kreative Texte und Konversation: Claude Sonnet 4.6 erzeugt besonders natürliche und kreative Texte zu ausgewogenen Kosten. Grok 4.3 (xAI, $1,25/$2,50) punktet mit humorvollem Stil und Echtzeitdaten-Zugriff. Gemini 3.5 Flash verarbeitet multimodale Inhalte besonders schnell.
Kontextfenster für große Projekte: Claude Fable 5, Claude Opus 4.8 und Claude Sonnet 4.6 bieten ein 1-Mio.-Token-Kontextfenster zum Standardpreis. Auch Grok 4.3, DeepSeek V4 und Gemini 2.5 Pro unterstützen jeweils 1 Mio. Tokens -- ideal für die Analyse großer Codebasen oder umfangreicher Dokumente.
Was kostet GPT-5.6 Sol pro Million Tokens?
GPT-5.6 Sol kostet $5 pro Million Input-Tokens und $30 pro Million Output-Tokens. Terra liegt bei $2/$12, Luna bei $0,20/$1,20. Für einen Chatbot mit 2.000 Input- und 500 Output-Tokens bei 100 Anfragen pro Tag sind das $75,00 im Monat mit Sol, $30,00 mit Terra und $3,00 mit Luna – zwischen der günstigsten und der teuersten Stufe liegt genau der Faktor 25.
Was kostet Claude Opus 5, und ist es günstiger als GPT-5.6 Sol?
Claude Opus 5 kostet $5 pro Million Input-Tokens und $25 pro Million Output-Tokens; Claude Sonnet 5 liegt bei $3/$15. Opus 5 verlangt denselben Input-Preis wie GPT-5.6 Sol, aber weniger für den Output – die Antwort hängt also von Ihrem Verhältnis ab: Beim selben Chatbot mit 2.000/500 Tokens und 100 Anfragen pro Tag kostet Opus 5 monatlich $67,50 gegenüber $75,00 bei Sol. Bei input-schweren Aufgaben liegen beide dagegen weniger als einen Cent pro Anfrage auseinander.
Ein neues Modell zum gleichen Preis – kostet es wirklich dasselbe?
Nicht unbedingt. Modelle ab Claude 4.7 (Opus 5, Opus 4.8, Sonnet 5) nutzen einen neuen Tokenizer, der denselben Text in rund 30 % mehr Tokens zerlegt als Sonnet 4.6 und früher. Sonnet 5 und Sonnet 4.6 stehen beide mit 3/15 USD in der Preisliste, doch eine Last, die auf Sonnet 4.6 monatlich $40,50 kostete, liegt auf Sonnet 5 bei etwa $52,65. Der Wechsel von Opus 4.8 zu Opus 5 ist dagegen neutral, weil beide schon denselben neuen Tokenizer verwenden.
Wichtige Begriffe rund um KI-Tokens
Token
Die kleinste Verarbeitungseinheit eines KI-Sprachmodells. Ein Token kann ein Wort, ein Wortteil oder ein einzelnes Zeichen sein. Die API-Kosten werden pro Token berechnet.
Tokenisierung (Tokenization)
Der Prozess, bei dem Rohtext in eine Folge von Tokens zerlegt wird. Moderne Modelle verwenden Byte Pair Encoding (BPE), das häufige Zeichenfolgen als einzelne Tokens zusammenfasst.
BPE (Byte Pair Encoding)
Ein Algorithmus zur Tokenisierung, der iterativ die häufigsten Zeichenpaare in einem Trainingskorpus zusammenfasst. GPT-5.4 (OpenAI), Claude Opus 4.8 (Anthropic), Gemini 3.1 Pro (Google), Grok 4.3 (xAI), Llama 4 (Meta), DeepSeek V4 (DeepSeek) und Mistral Large 3 (Mistral AI) verwenden Varianten dieses Verfahrens.
Kontextfenster (Context Window)
Die maximale Anzahl von Tokens (Input + Output), die ein Modell in einer einzelnen Anfrage verarbeiten kann. Claude Fable 5, Claude Opus 4.8 und Claude Sonnet 4.6 bieten ein 1-Mio.-Token-Kontextfenster zum Standardpreis, Grok 4.3 und DeepSeek V4 unterstützen ebenfalls 1 Mio. Tokens und Gemini 2.5 Pro bis zu 1 Mio. Tokens.
Input-Tokens
Alle Tokens, die Sie an das Modell senden: Ihr Prompt, der System-Prompt, mitgesendeter Kontext und der bisherige Chatverlauf. Diese werden zum Input-Preis abgerechnet.
Output-Tokens
Die vom Modell generierten Tokens in der Antwort. Output-Tokens sind typischerweise 3- bis 8-mal teurer als Input-Tokens, da die sequenzielle Textgenerierung mehr Rechenleistung erfordert.
Prompt-Caching
Eine Technik, bei der wiederholt verwendete Prompt-Teile (z. B. System-Prompt) serverseitig zwischengespeichert werden. Reduziert die Input-Token-Kosten für den gecachten Anteil um bis zu 90 %.
LLM (Large Language Model)
Ein großes Sprachmodell, das auf riesigen Textmengen trainiert wurde und menschenähnliche Texte erzeugen kann. Die wichtigsten LLMs (Stand 2026): GPT-5.5 (OpenAI), Claude Fable 5 (Anthropic), Gemini 3.1 Pro (Google), Grok 4.3 (xAI), Llama 4 (Meta), DeepSeek V4 (DeepSeek), Mistral Medium 3.5 (Mistral AI), Command R+ (Cohere) und Nova Premier (Amazon).