KI-API-Kosten berechnest du aus den tatsächlich abgerechneten Input- und Output-Tokens, dem gewählten Modell und zusätzlichen Gebühren. Dieser Vergleich zeigt ausgewählte API-Preise und ein überprüfbares Beispiel für 15.000 Produktbeschreibungen.
Preis- und Quellenstand: 15. September 2026. Alle Modellpreise unten sind in USD je Million Tokens angegeben. Die Berechnungen sind ein hypothetisches Planungsbeispiel, kein gemessener Kundenfall und kein Qualitätsbenchmark.
- Für 15.000 Aufrufe mit je 200 Input- und 150 abgerechneten Output-Tokens entstehen 3 Millionen Input- und 2,25 Millionen Output-Tokens.
- Chat-Abos und API-Abrechnung sind unterschiedliche Angebote. Ein Abo-Preis lässt sich nicht direkt mit einem API-Tokenpreis vergleichen.
- Ein günstigeres Modell spart nur dann im Gesamtprozess, wenn Qualität, Fehlerquote und Nachbearbeitung passen.
Was sind Tokens und warum bestimmen sie KI-Kosten?
Token-Grundlagen in 60 Sekunden
Ein Token kann ein Wort, einen Wortteil, ein Satzzeichen oder ein anderes Textelement abbilden. Wie ein Text zerlegt wird, hängt vom Tokenizer des Modells ab. Eine feste Umrechnung von deutschen Wörtern in Tokens ist deshalb keine belastbare Abrechnungsgrundlage. Auch Systemanweisungen, übergebene Dokumente, Werkzeugbeschreibungen und Gesprächsverlauf können zur Eingabe gehören.
Verwende für die Planung den Tokenzähler des gewählten Anbieters und gleiche die Schätzung mit den Nutzungsdaten realer Testaufrufe ab. Die OpenAI-Dokumentation zum Zählen von Tokens beschreibt diesen Ansatz.
Input vs. Output Tokens: Der Kostenhebel
Die hier verglichenen Tarife haben unterschiedliche Preise für Eingabe und Ausgabe. Der Gesamtpreis hängt von beiden Mengen ab. Bei Modellen mit internem Reasoning kann die abrechenbare Ausgabe zusätzliche Tokens enthalten, die nicht vollständig im sichtbaren Antworttext erscheinen. Ein Ausgabelimit von 150 sichtbaren Tokens ist daher nicht automatisch mit 150 abgerechneten Tokens gleichzusetzen.
Context-Länge als Preistreiber
Ein größeres Kontextfenster ist zunächst ein Kapazitätslimit. Ob lange Eingaben einen anderen Tarif auslösen, steht in der jeweiligen Modellpreisliste. Prüfe Grenzwert und Berechnungsbasis für das konkrete Modell. Das Aufteilen eines Dokuments in mehrere Anfragen kann Kontext verlieren, wiederholte Eingaben erzeugen und zusätzliche Ausgaben verursachen; es ist kein automatischer Spartipp.
KI-Preisvergleich 2026: Die aktuellen Zahlen
Die folgende Auswahl vergleicht Standard-API-Tarife für Text mit kurzen Eingaben, ohne Cache, Batch-Verarbeitung, Regionalzuschläge oder Zusatzwerkzeuge. Sie ist kein vollständiges Marktverzeichnis. Preise vor Steuern, Währungsumrechnung und gegebenenfalls Zahlungsgebühren; keine Euro-Umrechnung unterstellt.
| Modell | Input: USD / 1 Mio. Tokens | Output: USD / 1 Mio. Tokens | Quelle |
|---|---|---|---|
| GPT-5.6 Luna | 0,20 | 1,20 | OpenAI: Standard, kurzer Kontext |
| GPT-5.6 Sol | 4,00 | 20,00 | OpenAI: GPT-5.6 Sol |
| Claude Sonnet 5 | 2,00 | 10,00 | Anthropic: Modellpreise |
| Gemini 2.5 Flash | 0,30 | 2,50 | Google: Standard, Text |
Claude Sonnet 5: Anthropic erklärt ausdrücklich, dass 2/10 USD der Standardpreis bleibt. Die ursprünglich für September angekündigte Erhöhung auf 3/15 USD findet nicht statt. Die frühere Angabe in diesem Artikel wurde entsprechend korrigiert.
GPT-5.6 Sol: OpenAI bezeichnet 4/20 USD als Aktionspreis, der mindestens bis 21. November 2026 verfügbar ist. Für Eingaben über 272.000 Tokens nennt die Modellseite abweichende Sätze für die gesamte Anfrage. Unser Beispiel liegt deutlich darunter.
Gemini: Die Zeile bezieht sich ausdrücklich auf gemini-2.5-flash und Texteingaben. Andere Modellversionen, Modalitäten und Verarbeitungsklassen haben eigene Preise. Bei der Budgetplanung zählt die vollständige Modellkennung.
Was kostet ein Token bei Claude?
Beim hier betrachteten Claude Sonnet 5 entsprechen die Standardpreise 0,000002 USD pro Input-Token und 0,000010 USD pro Output-Token. Das ist eine Umrechnung der genannten Millionentarife und gilt nicht pauschal für alle Claude-Modelle. Kosten für Cache-Schreibvorgänge, Werkzeuge oder andere Nutzungsarten müssen nach ihrer eigenen Tarifposition ergänzt werden.
Praxisbeispiel: 15.000 Produktbeschreibungen pro Monat
Hypothetische Annahmen: 500 Beschreibungen pro Tag an 30 Tagen, genau ein erfolgreicher API-Aufruf je Beschreibung, 200 insgesamt abgerechnete Input-Tokens und 150 insgesamt abgerechnete Output-Tokens je Aufruf. Keine Wiederholungen, zusätzlichen Tool-Aufrufe oder darüber hinausgehenden Reasoning-Tokens.
- Aufrufe: 500 × 30 = 15.000
- Input: 15.000 × 200 = 3.000.000 Tokens
- Output: 15.000 × 150 = 2.250.000 Tokens
Formel: API-Tokenkosten = Input-Tokens ÷ 1.000.000 × Input-Preis + Output-Tokens ÷ 1.000.000 × Output-Preis.
Kostenvergleich mit den 2026er-Preisen
| Modell | Inputkosten USD | Outputkosten USD | Summe USD / Monat |
|---|---|---|---|
| GPT-5.6 Luna | 0,60 | 2,70 | 3,30 |
| GPT-5.6 Sol | 12,00 | 45,00 | 57,00 |
| Claude Sonnet 5 | 6,00 | 22,50 | 28,50 |
| Gemini 2.5 Flash | 0,90 | 5,625 | 6,53 |
Die Summen werden erst am Ende auf Cent gerundet. Bei Gemini ergibt sich vor Rundung 6,525 USD. Dies sind ausschließlich modellierte Tokenkosten. Redaktion, Implementierung, Infrastruktur, Fehler und Zusatzdienste sind nicht eingerechnet.
Korrekturhinweis: Die frühere Fassung setzte für dasselbe Volumen fälschlich 30 Millionen Input- und 22,5 Millionen Output-Tokens an. Dadurch waren die Tokenmengen um den Faktor zehn zu hoch. Zusätzlich ist der Sonnet-Preis korrigiert. Frühere Summen wie 427,50 USD sind für dieses Szenario daher nicht gültig.
Quality-Check: Welches Modell erfüllt deine Anforderungen?
Die Tabelle sagt nichts darüber aus, ob die Texte für deinen Shop geeignet sind. Prüfe mit denselben Produktdaten unter anderem Faktentreue, Vollständigkeit, Tonalität, Formatfehler und benötigte Korrekturzeit. Lege vor dem Vergleich fest, wann ein Ergebnis akzeptabel ist. Es wurden für diesen Artikel keine vergleichenden A/B-Tests durchgeführt.
Eine aussagekräftige Kennzahl ist der Gesamtaufwand pro akzeptiertem Ergebnis: API-Gebühren plus Nachbearbeitung und Wiederholungen, geteilt durch die Anzahl akzeptierter Ergebnisse. Ein niedriger Listenpreis allein entscheidet diesen Vergleich nicht.
Versteckte Kosten und Preisfallen vermeiden
Context-Window Kostenfallen
Erfasse die gesamte Eingabe je Aufruf, einschließlich wiederholtem Kontext. Prüfe anschließend, ob der gewählte Tarif zwischen kurzen und langen Eingaben unterscheidet. Eine allgemeine 128.000- oder 200.000-Token-Grenze für alle Gemini- oder GPT-Modelle wäre irreführend.
API-Limits und Überschreitungsgebühren
Anfragelimits und Tokenlimits hängen von Modell, Konto und Nutzungsklasse ab. Sie sind Durchsatzgrenzen und nicht automatisch feste Ausgabenobergrenzen. Begrenze Wiederholungsversuche und parallele Jobs, protokolliere Fehler und definiere einen Abbruch für fehlerhafte Schleifen. Budgetwarnungen und ein tatsächlich durchgesetzter Anwendungsstopp sind getrennte Funktionen.
Subscription versus Pay-per-Use
Vergleiche die Leistung, die dein Prozess wirklich benötigt: interaktiver Chat, automatisierte API-Aufrufe oder ein anderes Produkt. Es gibt keinen allgemeinen Schwellenwert von 50 Millionen Tokens, ab dem ein Chat-Abo die API ersetzt. Auch Enterprise-Rabatte und Verfügbarkeitszusagen lassen sich nur dem konkreten Angebot entnehmen.
Tokenomics-Strategien für verschiedene Use Cases
Optimiere zuerst die akzeptierten Ergebnisse. Reduziere anschließend unnötigen Kontext, überprüfe die benötigte Ausgabelänge und teste ein günstigeres Modell an derselben Aufgabe. Eine Verteilung auf mehrere Modelle ist eine zu prüfende Projektentscheidung; pauschale Einsparungen von 80 oder 90 Prozent bei unveränderter Qualität werden hier nicht behauptet.
- Batch: Für zeitversetzte Aufgaben können andere Preise gelten. Prüfe Unterstützung, Bearbeitungsfrist und Tarif des konkreten Modells.
- Cache: Wiederverwendbarer Kontext kann günstiger abgerechnet werden. Cache-Schreiben, Aufbewahrung und Trefferquote beeinflussen die Rechnung; ähnliche Anfragen sind nicht automatisch Cache-Treffer.
- Zusatzkosten: Suche, Werkzeuge, Audio, Bilder und externe Datenquellen können eigene Gebühren haben. Ermittle sie getrennt von reinen Text-Tokens.
Nutze eine Stichprobe echter, zulässiger Arbeitsaufgaben. Speichere Modellkennung, Tarifstand, Tokenverbrauch, Zusatzgebühren, Ergebnisprüfung und Korrekturzeit. Damit lässt sich eine Monatsprognose aus gemessenen Durchschnittswerten erstellen und bei Änderungen nachvollziehbar aktualisieren.
Rechtliche Aspekte der KI-Nutzung in Deutschland
Der Verarbeitungskontext gehört zur Anbieterwahl: Prüfe Datenregion, Aufbewahrung, Zugriffsrechte, Unterauftragnehmer und die für dein Angebot geltenden Vereinbarungen. Aus einem Anbieternamen allein lässt sich weder eine bestimmte Datenregion noch die Eignung für personenbezogene Daten ableiten.
Auch Nutzungsrechte sind gesondert zu prüfen. § 2 UrhG knüpft den Werksschutz an eine persönliche geistige Schöpfung. Daraus folgt nicht, dass beliebige KI-Ausgaben frei weiterverwendbar sind: Rechte an übernommenen Bestandteilen sowie andere Rechte können unabhängig davon relevant sein. Für diese Prüfung ist im Projekt Zeit einzuplanen; dieser Kostenvergleich ersetzt keine Prüfung des konkreten Falls.
Fazit
Beginne mit einem typischen Ablauf, messe seine abgerechneten Tokens und rechne mit dem passenden, datierten Tarif. Vergleiche danach Fehlerquote und Nachbearbeitung. So entsteht ein überprüfbares Budget statt eines pauschalen Sparversprechens.
Grundlagen vertiefen: Prompt Engineering mit Beispielen. Für die Umsetzung eines Unternehmensprozesses hilft unsere KI-Beratung.
Häufige Fragen zu KI-Tokenkosten
Was kostet ein KI-Token?
Der Preis hängt von Modell, Eingabe oder Ausgabe und Verarbeitungsklasse ab. Teile den Preis je Million Tokens durch eine Million. Zusätzliche Gebühren sind separat zu berücksichtigen.
Was kostet ein Token bei Claude Sonnet 5?
Am 15. September 2026 nennt Anthropic für den Standardtarif 2 USD je Million Input-Tokens und 10 USD je Million Output-Tokens. Das entspricht 0,000002 USD beziehungsweise 0,000010 USD pro Token.
Sind günstige Modelle automatisch wirtschaftlicher?
Nein. Entscheidend sind die gesamten Kosten je akzeptiertem Ergebnis einschließlich Nachbearbeitung, Wiederholungen und Zusatzdiensten. Ein niedriger Tokenpreis belegt keine gleiche Ergebnisqualität.
Methodik: Quellenanalyse der verlinkten Anbieterpreislisten und rechnerisch geprüftes Modellbeispiel, aktualisiert am 15. September 2026 mit KI-Unterstützung. Kein eigener Modell-Leistungsbenchmark. Tarife, Verfügbarkeit und Produktbedingungen können sich ändern.
Weitere Einordnung: Claude-Kosten und Google AI Studio. Die jeweils aktuelle Anbieterpreisliste bleibt für die Kalkulation maßgeblich.

Florian Schröder ist Gründer von AI Rockstars, KI-Stratege und Prompt Engineer. Er berät Unternehmen bei der praktischen Implementierung von generativer KI und Automation.









