KI-Forschung wird in der physischen Welt überprüfbar.
Google DeepMind
Preise, Kontext und Leistung von 369 Modellen aus 56 Anbietern. Mit Fit Score für deinen Einsatzzweck.
Wähle Einsatzzweck und Budget. Alle bewertbaren Modelle werden nach unserem Fit Score sortiert.
Einsatzzweck
Schreiben, planen, Ideen entwickeln
Priorität
Kosten geschätzt für 1 Mio. Input- und 250.000 Output-Tokens pro Monat, API-Basistarife.
Empfehlungen
93 passende Modelle
Klick auf einen Modellnamen zeigt, wie der Score entsteht. Methodik · Berechnet mit gespeichertem Datenstand.
Wechsel-Check
Gibt es für dein aktuelles Modell eine günstigere Alternative mit ähnlichem Leistungsindex?
KI-Modelle lesen, schreiben und rechnen in Tokens ab, kleinen Textbausteinen. So viel steckt darin, und so weit reicht dein Budget.
1 Mio. Tokens ≈ 600.000 Wörter ≈ 2.400 Seiten ≈ 8 Romane
Claude Sonnet 5.5: 2,00 $ pro 1 Mio. Input-Tokens, 10,00 $ pro 1 Mio. Output-Tokens. Voreingestellt ist die beste Empfehlung aus dem Finder.
Faustregel für deutschen Text: 1 Token ≈ 0,6 Wörter, 1 Seite = 250 Wörter, 1 Roman = 300 Seiten, 1 Codezeile ≈ 10 Tokens. Je nach Modell, Sprache und Inhalt weicht das ab; die Kosten sind Basistarife ohne Caching, Staffelpreise und Steuern.
Das jeweils stärkste Modell von 5 Anbietern liegt nur 12,2 Punkte auseinander. Welches passt, entscheidet deine Aufgabe, nicht der Rang.
Der vollständige AgentKernel Katalog. Fit Score für dein Profil „Alltag“.
Katalog wird aktualisiert … · Stand 04. Okt. 2026, 12:53 Uhr
1–15 von 369 Modellen
Preise in USD pro 1 Mio. Tokens, Basistarif. * Staffelpreise möglich. „offen“: Daten fehlen, „–“: erfüllt deine Anforderungen nicht. Beides ist keine schlechte Bewertung.
8 Modelle liegen höchstens zehn Punkte unter der Spitze des Leistungsindex. Bei 1 Mio. Input- und 250.000 Output-Tokens kosten sie zwischen 4,50 $ und 22,50 $ pro Monat.
Releases und Forschung aus sechs Originalquellen, Originaltitel mit Link zum Herausgeber.
Quellen werden abgerufen …
Google DeepMind
OpenAI
Anthropic
Themen werden aus Schlagwörtern im Titel abgeleitet. Meldungen von Anbietern sind keine unabhängigen Tests.
111 Modelle von 23 Anbietern nehmen mindestens 1 Mio. Tokens in einer Anfrage an. Das sind rund 2.400 Seiten Text oder 8 Romane auf einmal, genug für ganze Codebasen oder Aktenordner.
Tokens, Kosten und Kontext in Klartext. Die Zahlen stammen aus dem aktuellen AgentKernel Katalog.
Ein Token ist ein kleiner Textbaustein, meist ein Wortteil. KI-Modelle lesen, schreiben und rechnen in Tokens ab. Als Faustregel entspricht ein Token bei deutschem Text etwa 0,6 Wörtern: 1.000 Tokens sind rund 600 Wörter oder gut zwei Seiten.
Eine Million Tokens sind etwa 600.000 Wörter, rund 2.400 Seiten oder 8 Romane. Das reicht zum Beispiel für etwa 1.300 ausführliche Chat-Antworten, 1.500 E-Mail-Entwürfe oder rund 210 Zusammenfassungen zehnseitiger Dokumente.
Bei 1 Mio. Input- und 250.000 Output-Tokens pro Monat kosten die 99 bewerteten, kostenpflichtigen Modelle im AgentKernel Katalog zwischen 0,036 $ und 22,50 $, im Median 0,90 $ (API-Basistarife, Stand 04. Okt. 2026). Chat-Abos werden anders abgerechnet; kostenlose Varianten haben meist Nutzungslimits.
Das hängt von Aufgabe und Budget ab. Das jeweils stärkste Modell von 5 Anbietern liegt im AgentKernel Leistungsindex nur 12,2 Punkte auseinander. Der Modell-Finder gewichtet Leistung, Kosten, Kontext und Funktionen für deinen Einsatzzweck, statt einen Sieger zu küren.
Das Kontextfenster ist die größte Textmenge, die ein Modell in einer einzigen Anfrage verarbeiten kann, gemessen in Tokens: Frage, mitgeschickte Dokumente, Verlauf und Antwort zusammen. 111 Modelle im Katalog schaffen mindestens 1 Mio. Tokens, also rund 2.400 Seiten auf einmal.
Input-Tokens sind der Text, den du an das Modell schickst, Output-Tokens der Text, den es schreibt. Output ist meist deutlich teurer: im AgentKernel Katalog im Median 4-mal so teuer wie Input. Lange Dokumente mit kurzen Antworten sind deshalb oft günstiger als man denkt.
Der AgentKernel Katalog mit 369 Modellen von 56 Anbietern wird stündlich abgeglichen, Nachrichten alle 15 Minuten. Stand dieser Seite: 04. Okt. 2026. Preise sind die gelisteten Basistarife in US-Dollar pro einer Million Tokens.
Der Fit Score kombiniert vier Teilwerte von 0 bis 100: Leistungsniveau, Budgetspielraum, Kontextreserve und passende Funktionen. Die Gewichtung hängt vom Einsatzzweck und deiner Priorität ab; die vollständige Formel steht im Abschnitt Methodik.
Redaktionelle Zusammenfassungen von AgentKernel, Stand 02.10.2026. Belege verlinken auf die Originalquellen.
OpenAI stellt Sol für anspruchsvolle Coding- und Wissensarbeit vor. Anthropic richtet Sonnet auf klar umrissene Alltagsaufgaben aus. Der gemeinsame Trend: mehr Spezialisierung innerhalb einer Modellfamilie.
Thema: Modelle & Kosten
Unsere Einordnung: Vergleiche Qualität und Tokenpreise getrennt. Prüfe anschließend an eigenen Aufgaben, ob der vermeintlich günstigere Kandidat auch weniger Versuche benötigt.
Entscheidend ist, ob ein System längere, mehrstufige Aufgaben zuverlässig zu Ende bringt. METR untersucht das mit Aufgaben, deren Schwierigkeit über menschliche Bearbeitungszeit beschrieben wird.
Stand der Dinge: Messbarer Fortschritt
Worauf es als Nächstes ankommt
Erfolgsquote bei längeren Aufgaben, Fehlererholung und die Zahl nötiger menschlicher Eingriffe.
Ein 50%-Zeithorizont bedeutet eine geschätzte Erfolgswahrscheinlichkeit von 50%. Er ist keine zugesicherte autonome Laufzeit und kein Maß für die Automatisierbarkeit aller Berufe.
METR: Task-Completion Time HorizonsSo entsteht der Fit Score (Version 1.0): vier Teilwerte von 0 bis 100, gewichtet nach Einsatzzweck und Priorität.
Datengrundlage: Katalog, Preise und Fähigkeiten aus der OpenRouter Models API; Leistungsindex auf Basis des Intelligence Index von Artificial Analysis. Wir prüfen und vereinheitlichen diese Daten, messen die Benchmarks aber nicht selbst. Der Fit Score ist eine Orientierung, kein aufgabenspezifischer Test. Prüfe deine Favoriten mit eigenen Aufgaben.