Warum Teams welches Modell für KI-Agenten wählen: Preis, Leistung und die Rechnung dahinter

715f80f3-2870-46c4-a2ef-eef7c334d286

TL;DR

  • Die Preisspanne ist enorm, die Leistungsspanne klein: Die Ausgabepreise reichen von 0,60 bis 50 US-Dollar je Million Token, ein Faktor 83. Laut Artificial Analysis erreicht GPT-5.6 Luna 51 von 59 Indexpunkten des Spitzenmodells Sol, bei rund 80 Prozent geringeren Kosten je Aufgabe.
  • Teams wählen aus zwei Motiven: Laut a16z setzen Anthropic-Kunden auf die jeweils neuesten Modelle, während bei OpenAI auch ältere, „gut genug“ laufende Familien bleiben, und 81 Prozent nutzen drei oder mehr Familien. Laut Datadog legten Gemini und Claude binnen eines Jahres um 20 und 23 Prozentpunkte zu, wer wechselt, tut es laut Dataiku überwiegend, um Kosten zu senken.
  • Der Listenpreis ist die falsche Zahl: Je Token ist Luna 25 Mal günstiger als Sol, je Aufgabe nur etwa 5 Mal. Agenten brauchen laut Gartner mindestens fünfmal so viel Inferenz wie Chatbots, dazu kommen 10 Prozent Aufschlag für EU-Datenresidenz bei Anthropic und OpenAI.
  • Ein Support-Gespräch verursacht laut Beispielrechnung 0,4 bis 30 Cent Modellkosten, eine agentische Kundenservice-Interaktion kostet laut EY 2026 im Schnitt rund 1,20 Dollar. Plattformen berechnen laut Intercom etwa 1 Dollar je gelöstem Fall, ein menschlicher Kontakt kostet laut Gartner 13,50 Dollar.
  • Europäische Modelle gewinnen nicht über Rohleistung: Mistral Medium 3.5 liegt laut Artificial Analysis bei 30 Indexpunkten und 1,20 Dollar je Aufgabe. Dafür bietet Mistral EU-Standardhosting, offene Gewichte und Selbstbetrieb.

Ein Unternehmen will einen Support-Agenten bauen und fragt drei Anbieter, welches Modell sich lohnt. Die Preislisten reichen von 0,60 bis 50 US-Dollar je Million Ausgabetoken, ein Faktor 83. Das teuerste Modell ist aber nicht 83 Mal besser, und das billigste nicht automatisch das günstigste, wenn es dreimal so viele Token verbraucht. Wer Agenten und Chatbots baut, muss deshalb drei Zahlen zusammenbringen: den Preis je Aufgabe, die Leistung bei der eigenen Aufgabe und die Nebenkosten für Standort, Ausfall und Wechsel.

Dieser Artikel sortiert die Zahlen. Er zeigt, warum Teams welches Modell wählen, was die Modelle 2026 tatsächlich kosten, wie sie in unabhängigen Tests abschneiden und wo europäische Anbieter wie Mistral in dieser Rechnung stehen. Die Preise sind Stichtagswerte aus Juli bis Oktober 2026 und ändern sich schnell: OpenAI senkte den Preis von GPT-5.6 Luna nur drei Wochen nach dem Start um 80 Prozent.

Warum Teams ein Modell wählen: zwei Motive, ein Ergebnis

Die belastbarsten Daten zum Auswahlverhalten stammen 2026 aus den USA und von Werkzeuganbietern, sie zeigen aber ein klares Muster. a16z befragte Führungskräfte großer US-Unternehmen: 75 Prozent der Anthropic-Kunden hatten die jeweils neuesten Modelle im Produktivbetrieb, weit mehr als ältere, billigere Varianten. Bei OpenAI laufen dagegen auch frühere Modellfamilien weiter, weil sie früh eingeführt wurden und „gut genug“ funktionieren. 81 Prozent nutzen drei oder mehr Modellfamilien, nach 68 Prozent ein Jahr zuvor, und die Gesamtkosten offener und geschlossener Modelle nähern sich laut a16z an.

Datadog wertet dagegen echte Modellaufrufe von mehr als tausend Kunden aus. OpenAI kommt dort auf 63 Prozent Anteil, doch Gemini und Claude haben binnen eines Jahres um 20 und 23 Prozentpunkte zugelegt. Für 2026 sieht Datadog keinen klaren Gewinner, Teams halten mehrere Modelle gleichzeitig im Einsatz. Das passt zu den Zahlen von LangChain, wo über drei Viertel in Produktion oder Entwicklung mehrere Modelle nutzen.

Scheinbar widerspricht dem der Dataiku-Bericht auf Basis einer Harris-Umfrage unter 600 CIOs: 81 Prozent erwarten für 2026 zwei oder mehr Anbieter, und 55 Prozent haben bereits mindestens einmal gewechselt, vor allem, um Kosten zu senken. Beides stimmt, aber für verschiedene Aufgaben. Für die schweren Schritte zahlen Teams für das beste verfügbare Modell, für das Massengeschäft wechseln sie des Preises wegen. Daraus folgt die Architektur, die sich in den Daten abzeichnet: Routing nach Schwierigkeit.

Im Betrieb zählt neben Qualität vor allem das Tempo. Laut dem State of Agent Engineering 2026 von LangChain nennen 32 Prozent der Befragten Qualität als größte Hürde für den Produktivbetrieb und 20 Prozent die Latenz. Über zwei Drittel nutzen OpenAI GPT, ein Drittel betreibt eigene Modelle, und 57 Prozent verzichten auf Fine-Tuning (LangChain).

chart langchain

Was die Modelle kosten: die Preisleiter 2026

Die Preise für Agenten-Modelle verteilen sich auf drei Klassen. Ganz unten stehen Schnellmodelle wie GPT-5.6 Luna (0,20 Dollar Eingabe, 1,20 Dollar Ausgabe je Million Token, laut OpenAI), Mistral Small 4 und Mistral Large 3 (0,15/0,60 und 0,50/1,50 Dollar laut Preisübersichten wie Spheron). In der Mitte arbeiten Claude Haiku 4.5 (1/5 Dollar), Sonnet 5.5 (2/10), GPT-5.6 Terra (2/12), Gemini 3.5 Flash (1,50/9), Gemini 3.1 Pro (2/12) und Mistral Medium 3.5 (1,50/7,50). Oben stehen Claude Opus 5.5 (4/20 Dollar, laut Artificial Analysis), GPT-5.6 Sol (5/30) und Claude Fable 5.1 (10/50, laut BenchLM).

chart prices

Die Listenpreise sind dabei beweglich. Am 30. Juli senkte OpenAI Luna um 80 Prozent und Terra um 20 Prozent, drei Wochen nach der allgemeinen Verfügbarkeit, und führte für Sol einen Fast-Modus ein, der laut OpenAI bis zu 2,5 Mal schneller ist und das Doppelte kostet. Tempo hat damit einen eigenen Preis. Anthropic setzte Opus 5.5 um 20 Prozent unter Opus 5 an und senkte den Preis für gelesene Cache-Inhalte von 0,50 auf 0,20 Dollar je Million Token (Artificial Analysis).

Die größeren Hebel stehen im Kleingedruckten. Die Batch-API von Anthropic halbiert Preise für Aufträge, die nicht sofort fertig sein müssen. Prompt-Caching berechnet wiederholte Eingaben zu einem Bruchteil: Bei Haiku 4.5 kostet ein Cache-Treffer 0,10 statt 1 Dollar, bei Opus 5.5 0,20 statt 4 Dollar (Anthropic). Für Agenten mit langen, immer gleichen Systemanweisungen ist das oft wichtiger als der Vergleich der Listenpreise.

Für europäische Unternehmen kommt die Datenresidenz hinzu. Bei Claude auf Amazon Bedrock und Google Vertex AI kosten regionale Endpunkte, die das Routing in einer Region garantieren, laut Anthropic-Dokumentation 10 Prozent mehr als globale. OpenAI berechnet für Regional Processing bei Modellen, die ab dem 5. März 2026 erschienen sind, ebenfalls 10 Prozent Aufschlag (OpenAI-Dokumentation). Eine Auswertung von Requesty fand, dass zehn von dreizehn EU-fähigen Modellen in der EU-Region genau 10 Prozent mehr kosten. Mistral betreibt seine Plattform dagegen standardmäßig in der EU (Wavect). Datenresidenz ist damit ein Aufschlag von 10 Prozent, nicht von Faktor 10.

Was ein Gespräch wirklich kostet

Aus Preisen je Million Token wird erst eine Zahl, wenn man ein Gespräch rechnet. Nimmt man als Annahme 20.000 Eingabe- und 2.000 Ausgabetoken je Support-Gespräch, ohne Caching und Rabatte, liegen die Modellkosten zwischen 0,4 Cent (Mistral Small 4) und 30 Cent (Claude Fable 5.1). Die Mittelklasse kostet 3 bis 6 Cent, Opus 5.5 12 und Sol 16 Cent. Die Annahme ist bewusst einfach und konservativ gewählt.

chart conversation

Die Zahl relativiert den Preisvergleich, bildet aber nur den einfachen Fall ab. Plattformen berechnen für ein gelöstes Gespräch ein Vielfaches davon: Intercom verlangt für Fin etwa 0,99 Dollar je gelöstem Fall, Zendesk rund 1,50 bis 2 Dollar, und HubSpot senkte den Preis seines Customer Agent im April 2026 laut BoldDesk von 1 Dollar je Gespräch auf 0,50 Dollar je gelöstem Gespräch. Ein menschlich bearbeiteter Kontakt kostet laut Gartner im Schnitt 13,50 Dollar (Fin.ai). Gartner erwartet zugleich, dass die Kosten je Lösung bei generativer KI bis 2030 über 3 Dollar steigen könnten (Alhena), eine Prognose, die vor allem zeigt, wie unsicher die Preislogik noch ist.

Die Rechnung hat eine Einschränkung: Agenten verbrauchen mehr als einen einfachen Chat. Gartner stellte im August fest, dass das Routing einer Aufgabe an ein agentisches Reasoning-Modell die Inferenzkosten mindestens verfünffacht, und erwartet, dass die Kosten je agentischem Workflow bis 2028 um mehr als das Fünffache steigen, obwohl die Tokenpreise weiter fallen. Agenten benötigen laut CIO.com fünf- bis dreißigmal so viele Token wie ein Chatbot. Nach der Auswertung der FinOps Foundation überschritten 2026 bei 73 Prozent der Organisationen die KI-Kosten die ursprüngliche Planung (Sourcecode), und EY beziffert die Kosten einer agentischen Kundenservice-Interaktion 2026 auf rund 1,20 Dollar.

Nach Messungen von Artificial Analysis nutzt Claude Opus 5.5 im Index etwa 119.000 Ausgabetoken je Aufgabe, Opus 5 rund 73.000, Fable 5.1 rund 78.000 und GPT-6 Astra rund 27.000. Beim Sprung von GPT-5.4 auf GPT-5.5 verdoppelte sich der Preis je Token, der um 40 Prozent geringere Tokenverbrauch fing das fast auf, am Ende blieben rund 20 Prozent Mehrkosten (Artificial Analysis). Der Preis je Token sagt also wenig über den Preis je Aufgabe. Einzelne Anbieter gehen deshalb eigene Wege: Intercom beschreibt sein Fin Apex 1.0 als speziell für den Kundenservice gebautes Modell, das Frontier-Modelle bei Lösungsquote, Latenz und Kosten übertreffe. Das ist die Aussage des Anbieters selbst.

Wie die Modelle performen

Unabhängige Vergleiche liefert vor allem Artificial Analysis. Der Intelligence-Index fasst unter anderem agentische Tests wie Terminal-Bench 2.1 und τ³-Banking zusammen. Zum Start von GPT-5.6 im Juli erreichte Sol 59 Punkte bei 1,04 Dollar je Aufgabe, Terra 55 Punkte bei 0,55 Dollar und Luna 51 Punkte bei 0,21 Dollar. Luna holt damit rund 86 Prozent der Punktzahl von Sol bei etwa einem Fünftel der Kosten je Aufgabe und liegt laut Artificial Analysis auf dem Niveau von Gemini 3.5 Flash (50 Punkte, 0,59 Dollar je Aufgabe), bei geringeren Kosten (AI Tools Review).

chart scatter

Hier zeigt sich, warum Routing sich lohnt. Je Token ist Luna 25 Mal günstiger als Sol (0,20 gegenüber 5 Dollar Eingabe), je Aufgabe nur etwa 5 Mal, weil Luna mehr Token verbraucht. Die Leistungslücke ist mit 8 Punkten gering, die Kostenlücke gleichzeitig groß. Laut den von OpenAI genannten Terminal-Bench-2.1-Werten liegen Sol bei 88,8, Terra bei 87,4 und Luna bei 84,7 Prozent, zitiert nach OrcaRouter.

Auf der aktuellen Skala von Artificial Analysis führt Claude Opus 5.5 den Index mit 58 Punkten an, der höchste je gemessene Wert, wie Artificial Analysis festhält. Vier von fünf Aufwandsstufen von Opus 5.5 liegen auf der Pareto-Linie aus Leistung und Kosten je Aufgabe, sind also bei vergleichbarer Leistung nicht zu schlagen. Anthropic selbst gibt laut TechJack Solutions an, Opus 5.5 koste bei typischen Arbeitslasten 40 Prozent weniger als Opus 5, weil es weniger Token braucht. Die Zahlen lassen sich nicht direkt mit den Juli-Werten vergleichen: Der Index wird neu skaliert, GPT-5.6 Sol steht im aktuellen Vergleich bei 47 statt bei 59 Punkten.

Gerade deshalb taugt der Index als Größenordnung, nicht als Rangliste. Er sagt, dass die Spitzenmodelle eng beieinander liegen, die Preise dagegen weit auseinander. Welches Modell auf der eigenen Aufgabe besser abschneidet, entscheidet ein eigener Test.

Wo Mistral in der Rechnung steht

Europas wichtigster Anbieter taucht in dieser Rechnung anders auf als die US-Modelle. Mistral Medium 3.5, im April 2026 erschienen, ist ein dichtes Modell mit 128 Milliarden Parametern und 256.000 Token Kontext, das laut LLM Reference als offene Gewichte unter modifizierter MIT-Lizenz vorliegt und sich auf nur vier H100- oder H200-GPUs selbst betreiben lässt. Mistral selbst nennt 77,6 Prozent auf SWE-bench Verified, und ModelGrep listet 94 Prozent auf dem agentischen τ²-Bench von Artificial Analysis. Der Preis liegt bei 1,50/7,50 Dollar.

Im Gesamtindex von Artificial Analysis kommt Medium 3.5 auf 30 Punkte, die Spitzenmodelle liegen im Juli bei 50 bis 59. Weil es viele Token verbraucht, kostet eine Indexaufgabe laut AI Tools Review 1,20 Dollar, mehr als bei Sol (1,04 Dollar). Auf dieser Rechnung ist Mistral weder billiger noch besser. Das erklärt, warum die Entscheidung für Mistral selten über Leistung oder Listenpreis fällt, sondern über andere Gründe: Standardhosting in der EU ohne Residenz-Aufschlag, offene Gewichte, Selbstbetrieb und Anpassung an eigenes Wissen, etwa bei ASML mit dem Angebot Forge. Red Hat fragte im März 500 IT-Entscheider: 79 Prozent nennen Transparenz und Nachprüfbarkeit als wertvollsten Vorteil offener Software, 75 Prozent die Kontrolle darüber, wie und wo KI läuft.

Mistral wächst trotzdem: Am 8. September meldete das Unternehmen laut The Paypers 3 Milliarden Euro bei über 21 Milliarden Euro Bewertung und über 125 Unternehmenskunden, darunter Airbus, ASML und HSBC. SAP bietet seit der Sapphire im Mai Mistral und Cohere als souveräne Optionen auf der eigenen Cloud an. Wie schnell sich Modelle ändern, zeigt Mistral selbst: Medium 3 und 3.1 wurden zum 22. Mai 2026 abgekündigt, Nachfolger ist Medium 3.5. Wer eine Version fest einplant, plant auch ihren Wechsel ein.

Routing und Selbstbetrieb: zwei Wege, die Rechnung zu senken

Zwei Strategien versprechen niedrigere Kosten. Die erste ist Routing auf kleinere Modelle. Gartner empfiehlt im August ausdrücklich optimiertes Inference-Tiering, Routing und Orchestrierung, um komplexe Aufgaben auf kostengünstigere Intelligenz abzustimmen. Wie das aussieht, zeigt OpenAI selbst: Die automatische Prüffunktion in ChatGPT und im Codex-CLI läuft seit Juli auf GPT-5.6 Luna statt auf GPT-5.4, was laut OpenAI etwa zehnmal weniger kosten soll. Mistral Small 4 und Luna zeigen die Preisklasse, in der solche Routineschritte 2026 laufen.

diagram slm

Die zweite Strategie ist der Selbstbetrieb offener Modelle. Er gibt Kontrolle über Standort und Kosten, setzt aber Auslastung und Know-how voraus: Mistral Medium 3.5 lässt sich laut Anbieter auf vier GPUs betreiben, doch nur rund ein Drittel der Teams in der LangChain-Umfrage investiert überhaupt in eigene Modelle. Öffentlich belastbare Vergleichsrechnungen sind selten, a16z sieht die Gesamtkosten beider Welten zusammenrücken.

Verfügbarkeit: der Preis, der nicht auf der Liste steht

Zu den Kosten gehört das Risiko, dass ein Modell fehlt. Am 12. Juni setzte Anthropic den Zugang zu Fable 5 und Mythos 5 aus, um US-Exportkontrollen zu entsprechen, nach Aufhebung der Auflagen am 30. Juni kehrte er am 1. Juli zurück (Anthropic). Andere Modelle blieben verfügbar. Die EU-Kommission legte am 7. Juli einen Aktionsplan mit Notfallmaßnahmen für entzogenen Zugang vor (The Record). Kai Waehner empfiehlt deshalb mehrere Modelle hinter einer Orchestrierungsschicht und für kritische Prozesse einen Rückfallpfad ohne KI, nennt aber auch den Preis: mehr APIs, mehr Governance, nicht übertragbare Prompts (Waehner).

diagram arch

Warum Teams wen wählen

Tabelle: Familie | Warum Teams sie wählen | Preis je Mio. Token (ein/aus) | Der Haken

Auf einen Blick

Tabelle: Kennzahl | Wert | Quelle

Was das für Unternehmen bedeutet

Kosten je Aufgabe messen, nicht je Token. Schon ein Pilot mit Protokollierung von Eingabe- und Ausgabetoken zeigt, was ein gelöster Fall tatsächlich kostet. Listenpreise sagen darüber wenig.

Nach Schwierigkeit routen. Routineschritte laufen auf Schnellmodellen, schwere Fälle auf dem Spitzenmodell. Der Abstand von 8 Indexpunkten bei rund einem Fünftel der Kosten je Aufgabe ist das stärkste Argument dafür.

Caching und Batch zuerst nutzen. Wiederholte Systemanweisungen zu 5 bis 10 Prozent des Eingabepreises und halbierte Preise für nicht eilige Aufträge sparen meist mehr als der Wechsel des Anbieters.

Datenresidenz mit 10 Prozent einplanen. Bei Claude und GPT kostet die EU-Region einen Aufschlag, bei Mistral ist sie Standard. Wer die Wahl zwischen beiden hat, rechnet das mit, entscheidet aber auch nach Leistung.

Eigene Testfälle statt Ranglisten. Indizes werden neu skaliert, Anbieter melden eigene Werte, und Benchmarks bilden nicht die eigene Aufgabe ab. Ein fester Testsatz je Rolle zeigt bei jedem Modellwechsel, ob die Qualität hält.

Wechsel einplanen. Preise fallen innerhalb von Wochen, Versionen werden nach Monaten abgekündigt, Zugänge können ausfallen. Ein zweites Modell hinter einem Failover und ein Budget für Neutests gehören zum Betrieb.

Kritisch eingeordnet

Die Zahlen dieses Artikels haben Grenzen. Die Preise sind Listenpreise mit Stichtag, die Preise für Google und Mistral stammen teils aus Preisübersichten Dritter, und neuere Generationen wie GPT-6 sind bereits erschienen, sodass die GPT-5.6-Werte als dokumentierte Referenz dienen. Der Intelligence-Index von Artificial Analysis wird neu skaliert, die Werte aus Juli und Oktober sind nicht direkt vergleichbar, und der Vergleich mit Mistral Medium 3.5 beruht auf Angaben aus der Zeit vor der Neuskalierung. a16z und Dataiku befragen überwiegend US-Unternehmen, Datadog und LangChain stammen von Werkzeuganbietern, und a16z und Dataiku beschreiben unterschiedliche Wechselmotive. EY-Werte und die FinOps-Auswertung stammen aus Zweitberichten. Die Kosten je Gespräch sind eine eigene Beispielrechnung, Intercoms Aussagen zu Fin Apex und Gartners Prognosen sind Angaben der Anbieter und Analysten. Eine europaweite Studie zu Kosten und Leistung von Modellen in Agenten gibt es nicht.

Was als Nächstes zu erwarten ist

Die Preise dürften weiter fallen, die Preisspanne zwischen Schnell- und Spitzenmodellen dürfte aber bleiben. Mit GPT-6, neuen Gemini-Generationen und weiteren Mistral-Modellen steht die nächste Runde an. Der Zusammenschluss von Cohere und Aleph Alpha soll später in diesem Jahr abgeschlossen werden, die EU-Kommission will bis Ende des Jahres einen Blueprint für gesicherten Modellzugang vorlegen. Und Gartner erwartet, dass die Inferenzkosten je agentischem Workflow bis 2028 um mehr als das Fünffache steigen, weshalb Routing und Kostenkontrolle wichtiger werden.

Die Rechnung hinter dem Agenten

Die Frage „Welches Modell ist das beste?“ führt bei Agenten in die Irre. Die Leistung liegt bei den Spitzenmodellen eng beieinander, die Preise liegen weit auseinander, und der Preis je Token sagt wenig über den Preis je gelöstem Fall. Teams wählen deshalb nach Leistung für die schweren Schritte, nach Kosten für das Volumen und nach Standort, Kontrolle und Verfügbarkeit für den Rest.

Europäische Modelle sind in dieser Rechnung selten die günstigste oder stärkste Wahl, aber oft die, bei der Standort, Eigenbetrieb und Anpassung am meisten wiegen. Entscheidend ist, dass sich jede dieser Entscheidungen später ändern lässt.

Eine Randnotiz für Anbieter von Agenten und Chatbots

Wer, wie agentivo.ai, Agenten und Chatbots für Unternehmen auf bestehenden Modellen per API baut, zahlt Tokenpreise und kauft damit auch Preisänderungen, Versionswechsel und Ausfälle ein. Kunden verdienen deshalb Antworten auf drei Fragen: welches Modell in welchem Schritt läuft, was ein gelöster Fall kostet und was passiert, wenn ein Anbieter ausfällt oder den Preis ändert.

Quellen und weiterführende Informationen

Sign Up for Exclusive Updates and Offers