KI-Modelle im Vergleich 2026: API-Preise und welches Modell für dein Unternehmen

Consultoría EHERO

12 minutos de lectura

Es gibt kein „bestes KI-Modell“: Es gibt Aufgaben, und fast immer löst sie ein Modell, das günstiger ist, als man denkt. Hier siehst du KI-Modelle im Vergleich: die offiziellen API-Preise von Claude, GPT-6, Gemini, DeepSeek und Mistral vom 3. Oktober 2026 und welches Modell zu welcher Aufgabe in einem Unternehmen passt.

Dies ist eine lebende Seite. Wir aktualisieren sie jedes Mal, wenn ein Modell erscheint oder sich ein Preis ändert, und am Ende vermerken wir, was sich geändert hat und wann.

Preise geprüft am 3. Oktober 2026

Die neuesten Modelle, die man nutzen kann: Claude Opus 5.5 und Fable 5.1 (Anthropic), GPT-6 Astra und GPT-6.1 Sol (OpenAI), Gemini 3.8 Flash (Google).

Und Gemini 4? Es existiert, ist aber noch nicht nutzbar. Google stellte Gemini 4 Argon am 30. September 2026 vor, und derzeit wird es nur von einer Gruppe von Cybersicherheits-Verteidigern genutzt.

Was als Nächstes ändert: die Freigabe von Gemini 4 Argon, ohne angekündigtes Datum, und Gemini 3.8 Flash, dessen Preis sich am 1. Januar 2027 verdoppelt.

Die kurze Antwort

Die fünf Anbieter verkaufen im Grunde dasselbe in drei Stufen, und der Preisunterschied zwischen der unteren und der oberen Stufe beträgt das Hundertfache.

  • Kleine Stufe (GPT-6 Luna, Gemini 3.5 Flash-Lite, DeepSeek Flash, Claude Haiku 4.5): zum Lesen, Klassifizieren und Extrahieren von Daten in großen Mengen. Dort läuft der Großteil der Automatisierung in einem Unternehmen.
  • Mittlere Stufe (Claude Sonnet 5.5, GPT-6.1 Sol, Gemini 3.8 Flash, Mistral Large): zum Schreiben, Zusammenfassen und fundierten Antworten. Claude Sonnet 5.5 und GPT-6.1 Sol kosten gleich viel.
  • Hohe Stufe (Claude Opus 5.5, GPT-6 Astra, Claude Fable 5.1): zum Programmieren, für mehrstufige Aufgaben und für alles, was die mittlere Stufe nicht schafft.

Die Regel, die wir verwenden: mit der kleinen Stufe anfangen, mit echten Fällen testen und nur dann eine Stufe höher gehen, wenn es scheitert. Später wieder herunterzugehen passiert fast nie, also sollte man nicht oben anfangen.

API-Preise, Modell für Modell

Listenpreise in US-Dollar pro eine Million Tokens, so wie sie jeder Anbieter veröffentlicht. Steuern sind nicht enthalten.

Anbieter Modell Eingabe Ausgabe Wie der Hersteller es beschreibt
Anthropic Claude Fable 5.1 10 $ 50 $ Anspruchsvolles Reasoning und autonome Langzeitarbeit
Claude Opus 5.5 4 $ 20 $ Der von Anthropic empfohlene Ausgangspunkt für die meisten Aufgaben
Claude Sonnet 5.5 2 $ 10 $ Die beste Kombination aus Geschwindigkeit und Intelligenz
Claude Haiku 4.5 1 $ 5 $ Das schnellste der Familie
OpenAI GPT-6 Astra 10 $ 50 $ Das Flaggschiffmodell für komplexes Reasoning und Programmierung
GPT-6.1 Sol 2 $ 10 $ Gleichgewicht zwischen Intelligenz und Kosten
GPT-6 Luna 0,10 $ 0,50 $ Hohe Menge bei niedrigen Kosten
Google Gemini 3.1 Pro (Vorabversion) 2 $ 12 $ Text-, Bild- und Videoverständnis sowie Agenten. Noch keine stabile Version
Gemini 3.8 Flash 0,75 $ 3,75 $ Das leistungsfähigste Flash-Modell. Preis bis 31.12.2026; ab 1.1.2027 1,50 $ und 7,50 $
Gemini 3.5 Flash-Lite 0,30 $ 2,50 $ Hohe Menge, Übersetzung und einfache Datenverarbeitung
DeepSeek DeepSeek V4 Pro 1,32 $ 3,96 $ Unterstützt keine Bilder. Außerhalb der Spitzenzeiten kostet es die Hälfte
DeepSeek Flash (V4.1) 0,30 $ 1,20 $ Unterstützt Bilder. Außerhalb der Spitzenzeiten kostet es die Hälfte
Mistral Mistral Large 0,50 $ 1,50 $ Das große Modell des europäischen Anbieters

Die Quellen sind die Preisseiten der einzelnen Anbieter, unten verlinkt. OpenAI hält außerdem GPT-6 Sol zum gleichen Preis wie GPT-6.1 Sol; in einem neuen Projekt wählt man 6.1. Gemini 4 Argon steht nicht in der Tabelle, weil es noch nicht nutzbar ist.

Gemini 4 Argon: Was bekannt ist

Gemini 4 existiert. Google stellte es am 30. September 2026 unter dem Namen Gemini 4 Argon als sein neues Frontier-Modell vor, aber am 3. Oktober kann es weder über die offene API genutzt werden noch erscheint es in der Gemini-Modellliste.

  • Wer Zugriff hat. Eine Gruppe vertrauenswürdiger Cybersicherheits-Verteidiger im Fairwind-Programm von Google sowie die internen Teams von Google selbst.
  • Wann es freigeschaltet wird. Ohne Datum. Google sagt, es werde es so bald wie möglich öffnen, beginnend mit zahlenden API-Kunden und Abonnenten von Google AI Ultra, sobald die Schutzmaßnahmen fertig getestet sind.
  • Was es kosten wird. Es startet mit einem Einführungspreis von 2 $ pro Million Eingabe-Tokens und 10 $ für die Ausgabe, mit 95 % günstigerem Cache für die Eingabe. Nach Ablauf dieser Phase steigt es auf 4 $ und 20 $.
  • Wofür Google es präsentiert. Für lange, mehrstufige Aufgaben: Programmierung, spezialisierte Büroarbeit wie juristische oder finanzielle Arbeit und Verteidigung gegen Cyberangriffe. Es kann bis zu eine Million Ausgabe-Tokens in einer einzigen Antwort erzeugen.

Für ein Unternehmen, das heute automatisiert, ändert sich nichts: Man baut mit den Modellen, die bereits nutzbar sind, und bereitet den Wechsel des Modells über eine Einstellung vor. Wenn Argon freigeschaltet wird, fügen wir es mit seinen Preisen der Tabelle hinzu.

Wie man einen Preis pro Token liest

Die API wird nicht pro Monat oder pro Nutzer bezahlt: Man zahlt für verarbeiteten Text, gemessen in Tokens. Ein Token ist ein Wortteil. Als Referenz schätzt Anthropic, dass eine Million Tokens in seinen aktuellen Modellen etwa 555.000 Wörtern entsprechen.

  • Eingabe ist das, was man sendet: die Anweisungen und das Dokument.
  • Ausgabe ist die Antwort. Sie kostet je nach Modell drei- bis achtmal mehr als die Eingabe.
  • Das Reasoning zählt als Ausgabe. Modelle, die vor dem Antworten nachdenken, berechnen dieses Reasoning, auch wenn man es nicht sieht. Google sagt das in seiner Preisgestaltung: Der Ausgabepreis enthält die Reasoning-Tokens.
  • Jeder Anbieter zählt Tokens anders. Derselbe Text ergibt nicht überall dieselbe Anzahl. Anthropic weist darauf hin, dass seine neueren Modelle mit demselben Text rund 30 % mehr Tokens erzeugen als die vorherigen.

Darum dient der Preis pro Million zur Einordnung, nicht zur centgenauen Kalkulation. Die tatsächlichen Kosten ergeben sich aus Tests mit deinen Dokumenten.

Was es in der Praxis kostet

Zwei typische Aufgaben, berechnet mit den Preisen aus der Tabelle. Die Annahmen stammen von uns und sind offen einsehbar, damit du sie durch deine eigenen ersetzen kannst:

  • 1.000 Rechnungen lesen und ihre Daten zurückgeben: 2.000 Eingabe-Tokens und 300 Ausgabe-Tokens pro Rechnung, wobei der Text bereits aus dem PDF extrahiert wurde.
  • 1.000 Produktbeschreibungen verfassen: 800 Eingabe-Tokens und 600 Ausgabe-Tokens pro Beschreibung.
Modell 1.000 Rechnungen lesen 1.000 Beschreibungen verfassen
GPT-6 Luna 0,35 $ 0,38 $
DeepSeek Flash (zu Spitzenzeiten; außerhalb davon die Hälfte) 0,96 $ 0,96 $
Gemini 3.5 Flash-Lite 1,35 $ 1,74 $
Mistral Large 1,45 $ 1,30 $
Gemini 3.8 Flash 2,63 $ 2,85 $
Claude Haiku 4.5 3,50 $ 3,80 $
Claude Sonnet 5.5 7,00 $ 7,60 $
GPT-6.1 Sol 7,00 $ 7,60 $
Gemini 3.1 Pro 7,60 $ 8,80 $
Claude Opus 5.5 14,00 $ 15,20 $
GPT-6 Astra 35,00 $ 38,00 $
Claude Fable 5.1 35,00 $ 38,00 $

Das ist eine Berechnung mit Listenpreisen, keine Messung. Bei Modellen, die Reasoning nutzen, ist die tatsächliche Ausgabe größer als die sichtbare Antwort, und die Rechnung steigt. Wenn die Rechnung als Bild und nicht als Text eingeht, ebenfalls.

Die belastbare Erkenntnis: Dieselbe Arbeit kostet je nach Stufe Centbeträge oder Dutzende Dollar. Die Wahl des Modells wiegt hundertmal mehr als jeder Rabatt.

Welches Modell für welche Aufgabe

Das ist der Ausgangspunkt, den wir beim Aufbau eines Prozesses verwenden. Es ist keine Qualitätsklassifizierung: Es geht darum, womit man zuerst testet.

Aufgabe Beginne mit Warum
Daten aus Dokumenten extrahieren (Rechnungen, Lieferscheine, Bestellungen) Kleine Stufe Es ist viel Volumen, und die Antwort lässt sich mit Regeln prüfen: Wenn Netto plus MwSt. nicht den Gesamtbetrag ergibt, weiß man es
Klassifizieren und verteilen (E-Mails, Vorfälle, Bewertungen) Kleine Stufe Die Ausgabe ist ein Label: wenige Tokens und wenig Spielraum für Erfindungen
Katalog übersetzen Kleine oder mittlere Stufe Die kleine Stufe reicht für Attribute und kurze Texte; die mittlere für Beschreibungen, die verkaufen müssen
Texte verfassen (Produktbeschreibungen, Antworten an Kunden, Zusammenfassungen) Mittlere Stufe Hier fällt der Ton auf, und ein Mensch wird es lesen
Mehrstufige Aufgaben (nachschlagen, entscheiden, in ein anderes Programm schreiben) Mittlere oder hohe Stufe Ein Fehler in einem Schritt zieht sich durch die nächsten; es lohnt sich, für weniger Fehler zu zahlen
Programmieren Hohe Stufe Dafür stellen Anthropic und OpenAI ihre großen Modelle vor

Der Test, der entscheidet, ist immer derselbe: zwanzig echte Fälle von dir, mit der bereits bekannten richtigen Antwort, durch das kleine Modell geschickt. Wenn es die trifft, die es treffen muss, gibt es nichts mehr zu kaufen.

Vier Wege, weniger zu zahlen

  1. Batch-Verarbeitung. Wenn es nicht eilt, berechnen Anthropic, OpenAI, Google und Mistral die Hälfte, wenn man es im Batch schickt. Eine nächtliche Runde Rechnungen oder Datensätze ist der klassische Fall.
  2. Anweisungs-Cache. Wenn alle Anfragen dieselben langen Anweisungen wiederholen, wird dieser Teil ab der zweiten Nutzung stark reduziert berechnet. Bei Claude zu einem Zehntel des Einstiegspreises oder weniger.
  3. Erst das kleine Modell. Das kleine Modell soll das Einfache lösen und nur das, was unklar bleibt, an das mittlere weitergeben. Das ist meist der größte Rabatt von allen.
  4. Kurze Ausgaben. Die Ausgabe ist das Teure. Die Daten in einer festen Struktur und ohne Erklärungen anzufordern, senkt die Kosten und erleichtert nebenbei die Prüfung.

Was der Preis nicht sagt

  • Was sie mit deinen Daten machen. Gemini hat eine kostenlose Stufe, aber Google weist darauf hin, dass dort der Inhalt zur Verbesserung seiner Produkte verwendet wird; in der kostenpflichtigen nicht. Bei Kunden- oder Personaldaten ist die kostenlose Stufe keine Option. Bevor man personenbezogene Daten an irgendeinen Anbieter sendet, sollte man seinen Auftragsverarbeitungsvertrag und den Verarbeitungsort prüfen; DeepSeek ist ein chinesisches Unternehmen und Mistral französisch.
  • Vorabversion ist nicht stabil. Gemini 3.1 Pro ist weiterhin in der Vorabversion. Ein solches Modell kann sich mit wenig Vorlauf ändern oder zurückgezogen werden und ist keine gute Basis für einen Prozess, der allein funktionieren muss.
  • Sehr lange Dokumente kosten mehr. OpenAI verdoppelt den Einstiegspreis bei langem Kontext, und Gemini 3.1 Pro verdoppelt ihn ab 200.000 Tokens.
  • Preise bewegen sich. Gemini 3.8 Flash verdoppelt seinen Preis am 1. Januar 2027, und DeepSeek berechnet das Doppelte in seinen Spitzenzeiten, die in die Nacht und den Morgen Spaniens fallen.
  • Das Modell ist nicht das Projekt. Die Rechnung des Anbieters ist meist der kleine Teil. Teuer ist die Anbindung an dein Programm, der Umgang mit Sonderfällen und die Entscheidung, was ein Mensch prüft.

Welchen Prozess möchtest du nicht mehr von Hand machen?

Wir bauen Automatisierungen für Online-Shops und KMU: Wir messen, was der Prozess heute kostet, testen mit euren Dokumenten, welches das günstigste Modell ist, das ihn löst, und lassen es laufen, mit einer Person, die dort prüft, wo es nötig ist. Die KI läuft mit eurem eigenen API-Schlüssel: Der Verbrauch wird vom Anbieter auf eurem Konto abgerechnet, ohne Zwischenhändler oder Aufschläge.

Berechnen, was es euch kostet, es von Hand zu machen · Ein Fallbeispiel ansehen: Lieferantenrechnungen

Häufige Fragen

Wie viel kostet die ChatGPT-API?

Das hängt vom Modell ab. Am 3. Oktober 2026 kostet GPT-6 Luna 0,10 $ pro Million Eingabetokens und 0,50 $ für Ausgaben; GPT-6.1 Sol 2 $ und 10 $; GPT-6 Astra 10 $ und 50 $. Abgerechnet wird nach Nutzung, ohne feste Gebühr.

Wie viel kostet die Claude-API?

Claude Haiku 4.5 kostet 1 $ pro Million Eingabetokens und 5 $ für Ausgaben; Sonnet 5.5 2 $ und 10 $; Opus 5.5 4 $ und 20 $; Fable 5.1 10 $ und 50 $.

Wie viel kostet die Gemini-API?

Gemini 3.5 Flash-Lite kostet 0,30 $ für Eingaben und 2,50 $ für Ausgaben pro Million Tokens. Gemini 3.8 Flash kostet 0,75 $ und 3,75 $ bis zum 31. Dezember 2026 und ab Januar das Doppelte. Es gibt eine kostenlose Stufe mit Limits, in der Google den Inhalt zur Verbesserung seiner Produkte verwendet.

Gibt es Gemini 4?

Ja. Google stellte Gemini 4 Argon am 30. September 2026 vor, aber am 3. Oktober kann man es noch nicht nutzen: Es wird nur von einer Gruppe von Cybersecurity-Verteidigern genutzt und erscheint nicht in der Gemini-API. Zuerst wird es für zahlende API-Kunden und Abonnenten von Google AI Ultra geöffnet, ohne Datum. Das Neueste, was man heute nutzen kann, ist Gemini 3.8 Flash. Gemma 4 ist etwas anderes: die Familie offener Modelle von Google.

Wie viel wird Gemini 4 Argon kosten?

Google hat einen Einführungspreis von 2 $ pro Million Eingabetokens und 10 $ für Ausgaben angekündigt, der nach Ablauf dieses Zeitraums auf 4 $ und 20 $ steigen wird. Wie lange das dauert, hat Google nicht gesagt.

Ist ein ChatGPT- oder Claude-Abonnement dasselbe wie die API?

Nein. Das Abonnement ist dafür da, dass eine Person den Chat mit einer festen Gebühr nutzt. Die API ist dafür da, dass ein Programm das Modell aufruft, und es wird nach Tokens bezahlt. Um einen Prozess zu automatisieren, braucht man die API.

Welches KI-Modell ist für ein Unternehmen am besten?

Das günstigste, das deine Aufgabe mit deinen Dokumenten löst. Für das Extrahieren von Daten und Klassifizieren reicht meist die kleine Stufe; fürs Schreiben die mittlere; die hohe wird für Programmierung und mehrstufige Arbeiten reserviert.

Sind die Preise inklusive Mehrwertsteuer?

Nein. Es sind Listenpreise in Dollar und ohne Steuern. Welche anfallen, hängt vom Anbieter und vom Standort deines Unternehmens ab.

Wie oft ändern sich die Modelle?

Mehrmals im Jahr bei jedem Anbieter. Deshalb ist es sinnvoll, dass der Prozess nicht von einem bestimmten Modell abhängt: Ein Wechsel sollte eine Einstellung sein, nicht eine komplette Neuentwicklung.

Änderungsprotokoll

  • 3-10-2026. Erste Version, mit den an diesem Tag geprüften Listenpreisen von Anthropic, OpenAI, Google, DeepSeek und Mistral sowie dem, was Google über Gemini 4 Argon angekündigt hat, das noch nicht nutzbar ist.

Fazit

Ein Modell zu wählen heißt, eine Stufe zu wählen, und die Stufe bestimmt die Aufgabe. Fang mit dem kleinen an, teste mit deinen Fällen und steig nur auf, wenn es scheitert. Der Rest des Vergleichs ändert sich alle paar Monate, und deshalb halten wir ihn hier aktuell.

Die Preise sind die von jedem Anbieter zum angegebenen Datum veröffentlichten Listenpreise und können sich ändern. Die Kostenbeispiele sind Richtwerte, kein Angebot.

Nützliche Links

Möchtest du über alle Neuigkeiten auf dem Laufenden bleiben?

Folge uns in unseren sozialen Netzwerken, damit du nichts verpasst!

Abonniere unseren Newsletter

Erhalte exklusive Angebote und Neuigkeiten.

Erhalte 10 % Rabatt auf deine erste Bestellung!