Finde das richtige KI-Modell

Preise, Kontext und Leistung von 369 Modellen aus 56 Anbietern. Mit Fit Score für deinen Einsatzzweck.

Modelle
369
Anbieter
56
Stand
04.10. 12:53 Uhr · gespeichert
Nächster Abgleich
T−00:59:53

Modell-Finder

Wähle Einsatzzweck und Budget. Alle bewertbaren Modelle werden nach unserem Fit Score sortiert.

Einsatzzweck

Schreiben, planen, Ideen entwickeln

Priorität

Kosten geschätzt für 1 Mio. Input- und 250.000 Output-Tokens pro Monat, API-Basistarife.

Empfehlungen

93 passende Modelle

#ModellFitKosten / MonatKontextAktionen
1

Anthropic

85,54,50 $1 Mio.
2

Xiaomi

85,30,653 $1,1 Mio.
3

Z.ai

82,40,275 $1 Mio.
4

OpenAI

81,64,50 $*1,1 Mio.
5

Anthropic

81,29,00 $1 Mio.

Klick auf einen Modellnamen zeigt, wie der Score entsteht. Methodik · Berechnet mit gespeichertem Datenstand.

Wechsel-Check

Gibt es für dein aktuelles Modell eine günstigere Alternative mit ähnlichem Leistungsindex?

Was bekommst du für dein Geld?

KI-Modelle lesen, schreiben und rechnen in Tokens ab, kleinen Textbausteinen. So viel steckt darin, und so weit reicht dein Budget.

1 Mio. Tokens ≈ 600.000 Wörter ≈ 2.400 Seiten ≈ 8 Romane

Claude Sonnet 5.5: 2,00 $ pro 1 Mio. Input-Tokens, 10,00 $ pro 1 Mio. Output-Tokens. Voreingestellt ist die beste Empfehlung aus dem Finder.

AufgabeKosten pro AufgabeFür 10,00 $

Chat-Antworten

Frage mit kurzem Verlauf, ausführliche Antwort · ≈ 800 Tokens

0,6 Cent≈ 1.800×

E-Mails entwerfen

Stichpunkte rein, fertige E-Mail raus · ≈ 650 Tokens

0,4 Cent≈ 2.200×

Dokumente zusammenfassen

10 Seiten lesen, eine Seite Zusammenfassung · ≈ 4.700 Tokens

0,013 $≈ 750×

Code-Reviews

500 Zeilen Code prüfen und kommentieren · ≈ 6.500 Tokens

0,021 $≈ 480×

Bücher analysieren

Ein Buch mit 300 Seiten am Stück auswerten · ≈ 127.000 Tokens

0,27 $≈ 37×

Faustregel für deutschen Text: 1 Token ≈ 0,6 Wörter, 1 Seite = 250 Wörter, 1 Roman = 300 Seiten, 1 Codezeile ≈ 10 Tokens. Je nach Modell, Sprache und Inhalt weicht das ab; die Kosten sind Basistarife ohne Caching, Staffelpreise und Steuern.

Die Spitze fliegt in Formation

Das jeweils stärkste Modell von 5 Anbietern liegt nur 12,2 Punkte auseinander. Welches passt, entscheidet deine Aufgabe, nicht der Rang.

  1. Claude Opus 5.5Anthropic57,6
  2. GPT-6 AstraOpenAI52,7
  3. Grok 4.7xAI46,4
  4. MiMo-V2.6-ProXiaomi46,3
  5. Qwen3.8 Max (0902)Qwen45,4

Katalog

Der vollständige AgentKernel Katalog. Fit Score für dein Profil „Alltag“.

/

Katalog wird aktualisiert … · Stand 04. Okt. 2026, 12:53 Uhr

AuswahlModellFähigkeiten

Anthropic

Reasoning
Vision
Tools
85,5561 Mio.2,00 $10,00 $

Xiaomi

Reasoning
Vision
Tools
85,346,31,1 Mio.0,435 $0,87 $

Z.ai

Reasoning
Vision
Tools
82,441,81 Mio.0,15 $0,50 $

OpenAI

Reasoning
Vision
Tools
81,651,81,1 Mio.2,00 $*10,00 $*

Anthropic

Reasoning
Vision
Tools
81,257,61 Mio.4,00 $20,00 $

DeepSeek

Reasoning
Vision
Tools
79,239,51 Mio.0,003 $2,40 $

OpenAI

Reasoning
Vision
Tools
79,238,11,1 Mio.0,10 $*0,50 $*

Z.ai

Reasoning
Tools
79,144,81 Mio.1,40 $4,40 $

Xiaomi

Reasoning
Vision
Tools
7937,91,1 Mio.0,14 $0,28 $

xAI

Reasoning
Vision
Tools
78,546,4500.0002,00 $*6,00 $*

OpenAI

Reasoning
Vision
Tools
77,847,61,1 Mio.2,00 $*10,00 $*

OpenAI

Reasoning
Vision
Tools
77,537,31,1 Mio.0,20 $*1,20 $*

Qwen

Reasoning
Vision
Tools
77,545,41 Mio.2,00 $6,00 $

Google

Reasoning
Vision
Tools
77,440,91 Mio.0,75 $3,75 $

OpenAI

Reasoning
Vision
Tools
77,2471,1 Mio.2,00 $*10,00 $*

1–15 von 369 Modellen

Preise in USD pro 1 Mio. Tokens, Basistarif. * Staffelpreise möglich. „offen“: Daten fehlen, „–“: erfüllt deine Anforderungen nicht. Beides ist keine schlechte Bewertung.

Gleiche Umlaufbahn, 5× Preisspanne

8 Modelle liegen höchstens zehn Punkte unter der Spitze des Leistungsindex. Bei 1 Mio. Input- und 250.000 Output-Tokens kosten sie zwischen 4,50 $ und 22,50 $ pro Monat.

Nachrichten

Releases und Forschung aus sechs Originalquellen, Originaltitel mit Link zum Herausgeber.

Quellen werden abgerufen …

Themen werden aus Schlagwörtern im Titel abgeleitet. Meldungen von Anbietern sind keine unabhängigen Tests.

Reichweite: eine Million Tokens

111 Modelle von 23 Anbietern nehmen mindestens 1 Mio. Tokens in einer Anfrage an. Das sind rund 2.400 Seiten Text oder 8 Romane auf einmal, genug für ganze Codebasen oder Aktenordner.

Häufige Fragen

Tokens, Kosten und Kontext in Klartext. Die Zahlen stammen aus dem aktuellen AgentKernel Katalog.

Was ist ein Token?

Ein Token ist ein kleiner Textbaustein, meist ein Wortteil. KI-Modelle lesen, schreiben und rechnen in Tokens ab. Als Faustregel entspricht ein Token bei deutschem Text etwa 0,6 Wörtern: 1.000 Tokens sind rund 600 Wörter oder gut zwei Seiten.

Was kann ich mit einer Million Tokens machen?

Eine Million Tokens sind etwa 600.000 Wörter, rund 2.400 Seiten oder 8 Romane. Das reicht zum Beispiel für etwa 1.300 ausführliche Chat-Antworten, 1.500 E-Mail-Entwürfe oder rund 210 Zusammenfassungen zehnseitiger Dokumente.

Was kostet ein KI-Modell im Monat?

Bei 1 Mio. Input- und 250.000 Output-Tokens pro Monat kosten die 99 bewerteten, kostenpflichtigen Modelle im AgentKernel Katalog zwischen 0,036 $ und 22,50 $, im Median 0,90 $ (API-Basistarife, Stand 04. Okt. 2026). Chat-Abos werden anders abgerechnet; kostenlose Varianten haben meist Nutzungslimits.

Welches KI-Modell ist das beste?

Das hängt von Aufgabe und Budget ab. Das jeweils stärkste Modell von 5 Anbietern liegt im AgentKernel Leistungsindex nur 12,2 Punkte auseinander. Der Modell-Finder gewichtet Leistung, Kosten, Kontext und Funktionen für deinen Einsatzzweck, statt einen Sieger zu küren.

Was ist ein Kontextfenster?

Das Kontextfenster ist die größte Textmenge, die ein Modell in einer einzigen Anfrage verarbeiten kann, gemessen in Tokens: Frage, mitgeschickte Dokumente, Verlauf und Antwort zusammen. 111 Modelle im Katalog schaffen mindestens 1 Mio. Tokens, also rund 2.400 Seiten auf einmal.

Was ist der Unterschied zwischen Input- und Output-Tokens?

Input-Tokens sind der Text, den du an das Modell schickst, Output-Tokens der Text, den es schreibt. Output ist meist deutlich teurer: im AgentKernel Katalog im Median 4-mal so teuer wie Input. Lange Dokumente mit kurzen Antworten sind deshalb oft günstiger als man denkt.

Wie aktuell sind die Daten?

Der AgentKernel Katalog mit 369 Modellen von 56 Anbietern wird stündlich abgeglichen, Nachrichten alle 15 Minuten. Stand dieser Seite: 04. Okt. 2026. Preise sind die gelisteten Basistarife in US-Dollar pro einer Million Tokens.

Wie entsteht der AgentKernel Fit Score?

Der Fit Score kombiniert vier Teilwerte von 0 bis 100: Leistungsniveau, Budgetspielraum, Kontextreserve und passende Funktionen. Die Gewichtung hängt vom Einsatzzweck und deiner Priorität ab; die vollständige Formel steht im Abschnitt Methodik.

Einordnung

Redaktionelle Zusammenfassungen von AgentKernel, Stand 02.10.2026. Belege verlinken auf die Originalquellen.

Aktuelle Entwicklungen

OpenAI stellt Sol für anspruchsvolle Coding- und Wissensarbeit vor. Anthropic richtet Sonnet auf klar umrissene Alltagsaufgaben aus. Der gemeinsame Trend: mehr Spezialisierung innerhalb einer Modellfamilie.

Thema: Modelle & Kosten

Unsere Einordnung: Vergleiche Qualität und Tokenpreise getrennt. Prüfe anschließend an eigenen Aufgaben, ob der vermeintlich günstigere Kandidat auch weniger Versuche benötigt.

Langfristige Fragen

Entscheidend ist, ob ein System längere, mehrstufige Aufgaben zuverlässig zu Ende bringt. METR untersucht das mit Aufgaben, deren Schwierigkeit über menschliche Bearbeitungszeit beschrieben wird.

Stand der Dinge: Messbarer Fortschritt

Worauf es als Nächstes ankommt

Erfolgsquote bei längeren Aufgaben, Fehlererholung und die Zahl nötiger menschlicher Eingriffe.

Ein 50%-Zeithorizont bedeutet eine geschätzte Erfolgswahrscheinlichkeit von 50%. Er ist keine zugesicherte autonome Laufzeit und kein Maß für die Automatisierbarkeit aller Berufe.

METR: Task-Completion Time Horizons

Methodik

So entsteht der Fit Score (Version 1.0): vier Teilwerte von 0 bis 100, gewichtet nach Einsatzzweck und Priorität.

TeilwertBerechnungDein Gewicht
Allgemeines LeistungsniveauLeistungsindex ÷ 60 × 100, höchstens 100

Beispiel: 45 Indexpunkte ergeben 75

55 %
Budgetspielraum100 ÷ (1 + Monatskosten ÷ Budget), kostenlos = 100

Beispiel: halbes Budget ergibt 67

35 %
Kontextreserve70 bei erfülltem Mindestkontext, bis 100 bei vierfacher Reserve

Beispiel: 128.000 bei 64.000 Minimum ergibt 80

10 %
Funktionen für dein ProfilTool Calling und Reasoning je 50; Profil Dokumente: Datei- und Bildeingabe je 50

Beispiel: nur Tools ergibt 50

0 %
ProfilLeistungBudgetKontextFunktionenMindestkontext
Alltag (deine Auswahl)55 %35 %10 %0 %16.000
Coding60 %20 %10 %10 %64.000
Agenten50 %25 %10 %15 %32.000
Dokumente50 %20 %25 %5 %128.000
Gewichtung je Einsatzzweck. Deine Zeile berücksichtigt die Priorität „Ausgewogen“.
  • Priorität: „Leistung“ verschiebt bis zu 30 Prozentpunkte vom Budget zur Leistung, „Sparen“ bis zu 25 Punkte in die Gegenrichtung.
  • Offen / kein Fit: „offen“ heißt, Leistungsindex, Preis oder Kontextangabe fehlen. „Kein Fit“ heißt, der Kontext ist zu klein, die Kosten liegen über dem Budget, Tool Calling fehlt im Profil Agenten, die Bildeingabe fehlt oder kostenlose Varianten sind ausgeblendet.
  • Kosten: Input-Tokens × Input-Preis + Output-Tokens × Output-Preis, gelisteter Basistarif, ohne Caching, Staffelpreise und Steuern.
  • Wechsel-Check: ein passendes Modell mit geringeren Kosten und höchstens fünf Indexpunkten Abstand zum aktuellen Modell.

Datengrundlage: Katalog, Preise und Fähigkeiten aus der OpenRouter Models API; Leistungsindex auf Basis des Intelligence Index von Artificial Analysis. Wir prüfen und vereinheitlichen diese Daten, messen die Benchmarks aber nicht selbst. Der Fit Score ist eine Orientierung, kein aufgabenspezifischer Test. Prüfe deine Favoriten mit eigenen Aufgaben.