For the complete documentation index, see llms.txt. This page is also available as Markdown.

LLM-Updates

Dieser Abschnitt bietet die neuesten Updates zu den in Blockbrain verfügbaren LLMs. Nutzer können sich über neu hinzugekommene Modelle, Modellverbesserungen, Verfügbarkeit von Anbietern, Ausmusterungen und Ersetzungen informieren.

Gemini 3.8 Flash, Claude 5.1 Fable, GPT 6 Astra

1. Gemini 3.8 Flash

Google (EU)

Gemini 3.8 Flash ist jetzt mit EU-Hosting über Vertex AI verfügbar. Es ist der Nachfolger von Gemini 3.7 Flash und Googles intelligentestes Arbeitspferd-Modell und bietet deutliche Verbesserungen bei Softwareentwicklung, agentischen Aufgaben und mehrstufigem Reasoning. Es ist darauf ausgelegt, bei komplexen Aufgaben mehr zu leisten, indem es zusätzliche Reasoning-Schritte ausführt und Werkzeuge iterativ aufruft, und das bei derselben Geschwindigkeit und den gleichen niedrigen Einstiegskosten wie 3.7 Flash.

Mit einem Kontextfenster von 1 Mio. Tokens eignet es sich gut für langfristiges Coden, autonome Agenten und kritische Analysen in Finanz- und Rechtsbereichen. Am besten für Teams, die Reasoning nahe der Frontier und agentenorientierte Workflows ohne Flaggschiff-Preise wollen.

Modelltyp: LLM-Router Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Gemini 3.7 Flash

2. Claude Fable 5.1

Anthropic (EU)

Claude Fable 5.1 ist jetzt mit EU-Hosting über Google AI verfügbar. Es ist ein großes Upgrade für Coding und Wissensarbeit und bietet dank verbesserter autonomer Problemlösung ein besseres multidisziplinäres Reasoning. Es führt Enterprise Frontier Safeguards für Null-Datenaufbewahrung ein und reduziert Fehlalarme in Cybersecurity-Workflows spürbar. Niedrigere Preise für Cache-Lesezugriffe senken die typischen Workload-Kosten im Vergleich zu Fable 5 um etwa 25 % (und bei agentischen Arbeiten um bis zu 45 %).

Mit einem Kontextfenster von 1 Mio. Tokens eignet es sich gut für agentische wissenschaftliche Forschung, komplexes Terminal-Coding und lang laufende professionelle Workflows, bei denen das Modell seine eigene Arbeit überprüfen und iterieren muss. Am besten für Teams, die überlegene Coding- und Reasoning-Qualität zu einem hochkompetitiven Preisniveau wollen.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Claude Fable 5

1. GPT 6 Astra

OpenAI (EU)

GPT 6 Astra ist jetzt mit EU-Hosting über OpenAI verfügbar. Es ist das bisher intelligenteste und am besten ausgerichtete Modell von OpenAI und setzt einen neuen Standard für Computernutzung, Softwareentwicklung und komplexes Reasoning. Es erreicht menschliche Parität bei neuartigen Problemlösungen mit einem Score von 99,9 % auf ARC-AGI-3 und verbessert dabei das Intent-Verständnis und die Vorlagentreue deutlich.

Mit einem Kontextfenster von 1 Mio. Tokens eignet es sich gut für autonome Datenanalyse, Softwaretests, komplexe UI/UX-Generierung und das Navigieren neuartiger digitaler Umgebungen. Außerdem führt es persistenten Kontextabruf ein, sodass sich das Modell wichtige Details über lange Sitzungen hinweg merken kann, ohne sie zusammenzufassen. Am besten für Teams, die erstklassiges Reasoning, strikte Vorlagentreue und das weltweit leistungsfähigste Modell für die Computernutzung bei komplexen mehrstufigen Automatisierungen benötigen.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: GPT 5.6 Sol

Auto Router (General) und Gemini 3.7 Flash

1. Auto Router (General)

Google (EU)

Der Auto Router (General) ist jetzt in der Produktion verfügbar. Er leitet jede Anfrage automatisch anhand der Aufgabenkomplexität an das richtige Modell weiter, sodass Nutzer qualitativ hochwertige Antworten erhalten, ohne selbst ein Modell auswählen zu müssen. Einfache Nachrichten gehen an GPT 5.6 Luna, alltägliche und anspruchsvolle Arbeiten an Qwen 235B, und reasoningintensive Anfragen werden an Claude Sonnet 5 weitergeleitet.

Über gemischte Workloads hinweg lieferte der Router eine Antwortqualität, die mit einem Frontier-Modell vergleichbar war, bei etwa 40 % der Kosten und mit einer Latenz auf Augenhöhe oder besser. Am besten als Standard für Teams mit unterschiedlichen Workloads geeignet, bei denen die meisten Anfragen keine Flaggschiff-Fähigkeiten benötigen, die Option zum Eskalieren aber offen bleiben sollte. Das Modell-Routing erfolgt automatisch und erfordert keine Konfiguration.

Modelltyp: LLM-Router Kontextfenster: 128K Tokens Empfohlen für: Gemischte Workloads

2. Gemini 3.7 Flash

Google (EU)

Gemini 3.7 Flash ist jetzt mit EU-Hosting über Vertex AI verfügbar. Es ist der Nachfolger von Gemini 3.6 Flash und verbessert Coding, Wissensarbeit und Webentwicklung. Google meldet 65,3 % auf DeepSWE v1.1 (statt 49,0 %) und 30,4 % auf AutomationBench für Geschäftsworkflows (statt 17,0 %).

Mit einem Kontextfenster von 1 Mio. Tokens und Text-, Bild-, Audio-, Video- und PDF-Eingaben eignet es sich gut für Coding-Agenten, mehrstufige Automatisierung und alltägliche agentische Workflows. Am besten für Teams, die starke Coding- und Tool-Nutzungsleistung ohne Flaggschiff-Preise wollen.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Gemini 3.6 Flash

Gemini 3.6 Flash, Kimi K3, Qwen3 Next 80B A3B Thinking und GPT OSS 120B

1. Gemini 3.6 Flash

Google (EU)

Gemini 3.6 Flash ist jetzt mit EU-Hosting über Vertex AI. Es ist der Nachfolger von Gemini 3.5 Flash und Googles Arbeitspferd-Modell und bietet bessere Qualität bei Coding, Wissensarbeit und multimodaler Arbeit, während die Token-Effizienz spürbar verbessert wird. Google meldet auf dem Artificial Analysis Index etwa 17 % weniger Ausgabetokens als bei 3.5 Flash.

Mit einem Kontextfenster von 1 Mio. Tokens und Text-, Bild-, Audio-, Video- und PDF-Eingaben eignet es sich gut für agentische Workflows, die Analyse langer Dokumente, Diagramm- und visuelles Reasoning sowie alltägliches Coden. Außerdem schließt es mehrstufige Workflows in weniger Durchläufen ab und zeigt bei der Codegenerierung niedrigere Raten an Kompilierungsfehlern und Überarbeitungen. Am besten für Teams, die ein einziges Modell für mehrstufige Tool-Nutzung und multimodale Arbeit ohne Flaggschiff-Preise wollen.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Gemini 3.5 Flash

2. Kimi K3

Nebius (EU)

Kimi K3 ist jetzt mit EU-Hosting über Nebius. Es ist das Flaggschiff-Open-Weight-Modell von Moonshot AI und das erste Open-Source-Modell in der 3-Billionen-Parameter-Klasse mit 2,8 Billionen Parametern, mit einem Artificial Analysis Intelligence Index-Wert von 57,1, dem derzeit stärksten erfassten Open-Weight-Ergebnis.

Mit einem Kontextfenster von 1 Mio. Tokens, mit nativer Bildverarbeitung und ständig aktivem Reasoning ist es für langfristiges Coden, Arbeiten an großen Repositories, agentische Forschung sowie Dokumenten- und visuelle Analyse konzipiert. Zum Launch erreichte es 93,5 % auf GPQA Diamond und 91,2 % auf BrowseComp. Am besten für anspruchsvolle Workloads, bei denen Teams frontiernahe Qualität auf einem Open-Weight-Modell mit EU-Hosting wollen.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Kimi K2.5

3. Qwen3 235B A22B Instruct

Nebius (EU)

Qwen3 235B A22B Instruct ist jetzt mit EU-Hosting über Nebius. Es ist ein Mixture-of-Experts-Modell mit insgesamt 235 Mrd. Parametern und nur 22 Mrd. aktiven Parametern pro Token, wodurch die Inferenzkosten im Verhältnis zur Leistungsfähigkeit niedrig bleiben. Es ist keine Frontier-Veröffentlichung der aktuellen Generation, bleibt aber eine verlässliche Allzweck-Option.

Mit einem 262K-Token-Kontextfensterund es bewältigt mehrsprachige Aufgaben, Befolgen von Anweisungen, strukturierte Ausgaben und Tool-Nutzung gut. Am besten für allgemeine Workloads mit hohem Durchsatz, bei denen Kosten wichtiger sind als erstklassiges Reasoning, und für Teams, die eine Open-Weight-Fallback-Option unter EU-Hosting benötigen.

Modelltyp: LLM Kontextfenster: 262K Tokens

4. GPT OSS 120B

Nebius (EU)

GPT OSS 120B ist OpenAIs Open-Weight-Mixture-of-Experts-Modell, jetzt verfügbar mit EU-Hosting über Nebius. Es hat insgesamt 117 Mrd. Parameter und aktiviert 5,1 Mrd. pro Vorwärtsdurchlauf; außerdem unterstützt es konfigurierbare Reasoning-Tiefe, vollen Chain-of-Thought-Zugriff und native Tool-Nutzung einschließlich Function Calling und strukturierter Ausgabe.

Mit einem 131K-Token-Kontextfensterund eignet sich für hochdurchsatzige Reasoning-Aufgaben, Klassifikation, Extraktion und Tool-Calling-Agenten, bei denen Latenz und Kosten die begrenzenden Faktoren sind. Der Listenpreis bei Nebius beträgt $0,15 pro 1 Mio. Eingabe- und $0,60 pro 1 Mio. Ausgabetokens. Am besten für Teams, die billige, schnelle Open-Weight-Inferenz in der EU mit anpassbarem Reasoning-Aufwand benötigen.

Modelltyp: LLM Kontextfenster: 131K Tokens

GPT 5.6 Fast Mode und Gemini 3.5 Flash (Lite)

1. GPT 5.6 Sol (Fast)

OpenAI (EU)

GPT 5.6 Sol (Fast) ist jetzt mit EU-Hosting über OpenAI. Es liefert die Flaggschiff-Intelligenz von GPT 5.6 Sol mit bis zu 2,5× schnelleren Geschwindigkeiten, was es zu einer starken Wahl macht, wenn sowohl maximale Leistungsfähigkeit als auch geringe Latenz entscheidend sind.

Mit einem 1M Token-Kontextfenster, Es eignet sich besonders gut für komplexes Coding, fortgeschrittenes Reasoning, lang laufende Agenten, Forschung und andere anspruchsvolle Workflows, bei denen Teams erstklassige Ergebnisse benötigen, ohne auf die üblichen Antwortzeiten eines Flaggschiffs warten zu müssen. Der Fast Mode behält die gleiche Intelligenz wie GPT 5.6 Sol bei ungefähr doppelt so hohem Preis.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: GPT 5.6 Sol, wenn schnellere Antworten erforderlich sind

2. GPT 5.6 Terra (Fast)

OpenAI (EU)

GPT 5.6 Terra (Fast) ist jetzt mit EU-Hosting über OpenAI. Sie bietet dieselbe ausgewogene Intelligenz wie GPT 5.6 Terra mit beschleunigten Antwortzeiten und liefert nahezu Flaggschiff-Qualität für alltägliche Workflows, bei denen Latenz wichtig ist.

Mit einem 1M Token-Kontextfenster, es eignet sich gut für zeitkritisches Coding, Dokumentenanalyse, Tool-Nutzung, Wissensarbeit und mehrstufige Automatisierung. Es ist ein praktischer Mittelweg für Teams, die mehr Leistungsfähigkeit als bei leichten Modellen brauchen, aber nicht die volle Tiefe oder die Kosten der Sol-Stufe benötigen. Der Fast Mode ist ungefähr doppelt so teuer wie die Standardversion.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: GPT 5.6 Terra, wenn schnellere Antworten erforderlich sind

3. GPT 5.6 Luna (Fast)

OpenAI (EU)

GPT 5.6 Luna (Fast) ist jetzt mit EU-Hosting über OpenAI. Für maximalen Durchsatz entwickelt, liefert es dieselbe Intelligenz wie GPT 5.6 Luna mit beschleunigten Antwortgeschwindigkeiten und ist damit ideal für Workloads, bei denen schnelle und konsistente Ausgaben Priorität haben.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders gut für Automatisierungen mit hohem Volumen, Datenextraktion, Klassifikation, kundenorientierte Assistenten, Dokumentenverarbeitung und andere zeitkritische Produktionsaufgaben. Es behält Lunas starke Kosteneffizienz bei und liefert nahezu sofortige Antworten, wobei der Fast Mode ungefähr doppelt so teuer ist wie die Standardversion.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: GPT 5.6 Luna, wenn schnellere Antworten erforderlich sind

4. Gemini 3.5 Flash (Lite)

OpenAI (EU)

Gemini 3.5 Flash-Lite ist jetzt mit EU-Hosting über Google AI. Es ist das schnellste und kostengünstigste Modell in der Gemini-3.5-Familie und für Geschwindigkeit, Skalierung und produktive Workloads mit hohem Volumen ausgelegt.

Mit einem 1M Mit einem Token-Kontextfenster und Ausgabegeschwindigkeiten von bis zu 350 Tokens pro Sekunde ist es ein großes Upgrade gegenüber Gemini 3.1 Flash-Lite. Es eignet sich besonders gut für agentische Suche, Dokumentenverarbeitung, Datenextraktion, Klassifikation und andere Workflows mit hohem Durchsatz, bei denen die Minimierung von Latenz und Kosten wichtiger ist als die Nutzung eines größeren Allzweckmodells.

Modelltyp: LLM Kontextfenster: 1 Mio. Tokens Empfohlenes Upgrade von: Gemini 3.1 Flash (Lite)

Qwen, Llama, GPT und Gemma

1. Qwen 3VL 235B

StackIT (EU)

Qwen 3VL 235B ist jetzt mit EU-Hosting über StackIt. Es ist ein leistungsstarkes Open-Weight-Vision-Language-Modell für fortgeschrittene multimodale Arbeit, einschließlich der Verarbeitung langer Dokumente, erweitertem Videoverständnis, komplexer visueller Analyse und agentischen Workflows.

Mit einem 218K Token-Kontextfenster, es eignet sich besonders für Teams, die High-End-multimodale Fähigkeiten benötigen und die Infrastruktur für ein schwergewichtiges Modell haben.

Modelltyp: LLM Kontextfenster: 218K Tokens

2. Qwen3.6 27B

StackIT (EU)

Qwen3.6 27B ist jetzt mit EU-Hosting über StackIt. Es ist ein multimodales Open-Weight-Modell, das für seine Größe besonders starke agentische Coding-Fähigkeiten liefert. Das Modell eignet sich gut für Softwareentwicklung, Frontend-Workflows, Tool-Nutzung, visuelle Analyse und andere Aufgaben, die Coding mit multimodalem Verständnis verbinden.

Mit einem 262K Token-Kontextfenster bietet es ein starkes Gleichgewicht aus Leistungsfähigkeit, Bereitstellungsflexibilität und Unterstützung für lange Kontexte.

Modelltyp: LLM Kontextfenster: 262K Tokens

3. Llama 3.3 70B

StackIT (EU)

Llama 3.3 70B ist jetzt mit EU-Hosting über StackIt. Es ist ein ausgewogenes, leistungsstarkes Open-Weight-Modell, das robuste Reasoning-Fähigkeiten und durchgängig zuverlässige Ausgabequalität über ein breites Spektrum von Aufgaben hinweg bietet.

Mit einem 128K Token-Kontextfenster, es eignet sich besonders für komplexe Analysen, die Erstellung längerer Inhalte, kontextbezogene Entscheidungsunterstützung und allgemeine Unternehmens-Workflows, die verlässliche Leistung erfordern.

Modelltyp: LLM Kontextfenster: 128K Tokens

4. GPT OSS 120B

StackIT (EU)

GPT OSS 120B ist jetzt mit EU-Hosting über StackIt. Es ist das größte Open-Weight-Reasoning-Modell von OpenAI, entwickelt für fortgeschrittenes Coding, Reasoning, Tool-Calling und agentische Workflows.

Mit einem 131K Token-Kontextfenster, es eignet sich besonders für Unternehmensagenten, komplexe Entwicklungsaufgaben und spezialisierte Bereitstellungen, bei denen Organisationen mehr Kontrolle über ihre Daten und Modellinfrastruktur benötigen.

Modelltyp: LLM Kontextfenster: 131K Tokens

5. GPT OSS 20B

StackIT (EU)

GPT OSS 20B ist jetzt mit EU-Hosting über StackIt. Es ist ein kompaktes Open-Weight-Reasoning-Modell für latenzarme, private und spezialisierte Bereitstellungen. Das Modell unterstützt Coding, Mathematik, Tool-Nutzung und agentische Workflows und benötigt dabei nur 16 GB Speicher.

Mit einem 131K Token-Kontextfenster, es eignet sich besonders für private Agenten, lokale Inferenz und kostensensible Bereitstellungen, die leistungsfähiges Reasoning ohne schwere Infrastruktur benötigen.

Modelltyp: LLM Kontextfenster: 131K Tokens

6. Gemma 3 27B

StackIT (EU)

Gemma 3 27B ist jetzt mit EU-Hosting über StackIt. Es ist ein leistungsfähiges multimodales Open-Weight-Modell mit Unterstützung für Text- und Bildeingaben, mehr als 140 Sprachen, Function Calling und strukturierte Ausgaben.

Mit einem 131K Token-Kontextfenster, es eignet sich besonders für Dokumentenanalyse, mehrsprachige Assistenten, visuelle Aufgaben und flexible agentische Workflows, die zuverlässiges multimodales Verständnis in einem vergleichsweise kompakten Modell erfordern.

Modelltyp: LLM Kontextfenster: 131K Tokens

Claude Opus 5

1. Claude Opus 5

AWS Bedrock (EU)

Claude Opus 5 ist jetzt mit EU-Hosting über AWS Bedrock. Es ist ein großer Sprung gegenüber Opus 4.8 zum gleichen Preis und liefert nahezu Fable-5-Intelligenz zu ungefähr halben Kosten. Das Modell ist besonders stark bei komplexer professioneller Arbeit und lang laufenden Agenten-Workflows, bei denen es seine Ausgaben selbst überprüfen, verifizieren und verbessern muss.

Mit einem Kontextfenster von 1 Mio. Tokens ist Opus 5 das empfohlene Upgrade für AWS-Bedrock-Nutzer, die mehr Intelligenz und Zuverlässigkeit ohne Preiserhöhung des Modells benötigen.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Opus 4.8

2. Claude Opus 5

Google AI (EU)

Claude Opus 5 ist jetzt mit EU-Hosting über Google AI. Es ist ein großer Sprung gegenüber Opus 4.8 zum gleichen Preis und liefert nahezu Fable-5-Intelligenz zu ungefähr halben Kosten. Das Modell ist besonders stark bei komplexer professioneller Arbeit und lang laufenden Agenten-Workflows, bei denen es seine Ausgaben selbst überprüfen, verifizieren und verbessern muss.

Mit einem Kontextfenster von 1 Mio. Tokens ist Opus 5 das empfohlene Upgrade für AWS-Bedrock-Nutzer, die mehr Intelligenz und Zuverlässigkeit ohne Preiserhöhung des Modells benötigen.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Opus 4.8

Grok 4.5

1. Grok 4.5

xAI (US)

Grok 4.5 ist jetzt mit US-Hosting über xAI. xAIs neuestes Flaggschiffmodell kombiniert starkes Reasoning mit schnellen Antwortgeschwindigkeiten und wettbewerbsfähigen Preisen, mit besonderen Stärken in realer Softwareentwicklung, Coding-Agenten und der Ausführung agentischer Aufgaben.

Mit einem 500k Token-Kontextfenster, es eignet sich besonders für technische Workflows, Anwendungsentwicklung, Produktivität im Business und komplexe Wissensarbeit, die hohe Leistungsfähigkeit ohne die Latenz und Kosten langsamer Flaggschiffmodelle erfordert.

Modelltyp: LLM Kontextfenster: 500.000 Tokens Empfohlenes Upgrade von: Grok 4

Claude Sonnet 5

1. Claude Sonnet 5

Google AI (EU)

Claude Sonnet 5 ist jetzt mit EU-Hosting über Vertex AI. Es ist ein großes Upgrade gegenüber Sonnet 4.6 und liefert nahezu Flaggschiff-Leistung bei Reasoning, Coding, Tool-Nutzung und Wissensarbeit zu geringeren Kosten als Spitzenmodelle.

Mit einem 1M Token-Kontextfenster ist Sonnet 5 besonders gut geeignet für komplexe, mehrstufige Aufgaben, die Analyse großer Dokumente und Codebasen sowie Automatisierungs-Workflows, die hohe Leistungsfähigkeit ohne Premium-Preise erfordern.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Sonnet 4.6

Gemini 3.5 Flash, Mistral Medium 3.5 und Claude-Modelle

1. Gemini 3.5 Flash

Google AI (EU)

Gemini 3.5 Flash ist jetzt mit EU-Hosting über Google AI. Es ist ein großer Sprung gegenüber Gemini 3.1 Pro und kombiniert starke agentische, Coding-, Finanz- und multimodale Fähigkeiten mit der Geschwindigkeit, die man von einem Flash-Modell erwartet.

Sein 1M Token-Kontextfenster macht es besonders effektiv für die schnelle Bearbeitung mehrstufiger Aufgaben, Coding-Workflows, Dokumentenanalyse und Automatisierung.

Das Modell bietet Minimal, Niedrig, Mittel und Hoch Thinking-Modi, mit denen Nutzer je nach Aufgabe Antwortgeschwindigkeit und tieferes Reasoning ausbalancieren können.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Gemini 2.5 Flash

2. Mistral Medium 3.5

Mistral (EU)

Mistral Medium 3.5 ist jetzt mit EU-Hosting über Mistral. Dieses Open-Weight-Modell vereint Mistrals frühere Reasoning- und Coding-Linien in einem einheitlichen Modell und bietet starke Leistung für agentisches Coden, Tool-Nutzung und mehrstufige technische Arbeit.

Mit einem 256k Token-Kontextfenster, es eignet sich besonders für Coding-Agenten, Softwareentwicklungs-Workflows, technische Automatisierung und Anwendungen, die ein leistungsfähiges Allzweckmodell mit Open-Weight-Flexibilität benötigen.

Modelltyp: LLM Kontextfenster: 256.000 Tokens Empfohlenes Upgrade von: Mistral Medium

3. Claude Opus 4.8

AWS Bedrock (EU)

Claude Opus 4.8 ist jetzt mit EU-Hosting über AWS Bedrock. Es ist ein erhebliches Upgrade gegenüber Opus 4.7 und bietet stärkere Fähigkeiten bei agentischem Coding, Computernutzung und komplexen lang laufenden Aufgaben. Verbesserte Ehrlichkeit und Zuverlässigkeit machen es zudem zu einem verlässlicheren Partner für Workflows, die dauerhafte Autonomie und präzise Berichterstattung erfordern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für anspruchsvolle Engineering-Arbeiten, Computer-Use-Agenten, Codebase-Management und Wissensaufgaben mit hoher Tragweite.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Opus 4.7reyouki

4. Claude Opus 4.7

AWS Bedrock (EU)

Claude Opus 4.7 ist jetzt mit EU-Hosting über AWS Bedrock. Es ist ein großes Upgrade gegenüber Opus 4.6 und für schwierige praktische Coding- und Engineering-Arbeiten gedacht, die mit größerem Vertrauen delegiert werden können. Über das Coding hinaus bietet es stärkere Leistung bei Reasoning, Tool-Nutzung und komplexen Wissensaufgaben.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für fortgeschrittene Softwareentwicklung, Codebase-Analyse, lang laufende Agenten und anspruchsvolle mehrstufige Workflows. Für AWS-Bedrock-Nutzer von Opus 4.6 ist Opus 4.7 das empfohlene Upgrade.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Opus 4.6

5. Claude Opus 4.6

AWS Bedrock (EU)

Claude Opus 4.6 ist jetzt mit EU-Hosting über AWS Bedrock. Es verbessert Opus 4.5 bei Coding, agentischer Aufgabenausführung, Codebase-Management, strukturierten Reviews und Debugging. Außerdem bietet es konsistentere und effizientere Leistung bei anspruchsvollen Analyse-, Dokumentenprüfungs- und Multitasking-Workflows.

Mit einem 1M Token-Kontextfenster, es eignet sich gut für komplexe Technikarbeit, lang laufende Agenten, umfangreiche Dokumentenarbeit und Aufgaben, die zuverlässiges Reasoning über mehrere Schritte hinweg erfordern.

Das Modell bietet Niedriges, mittleres, hohes und maximales Reasoning Modi, die von schnelleren und effizienteren Antworten bis hin zur maximalen Reasoning-Tiefe für die komplexesten Aufgaben reichen.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Thinking-Modi: Niedriges Reasoning, mittleres Reasoning, hohes Reasoning, maximales Reasoning Empfohlenes Upgrade von: Claude Opus 4.5

6. Claude Sonnet 4.6 (Fast)

AWS Bedrock (EU)

Claude Sonnet 4.6 (Fast) ist jetzt mit EU-Hosting über AWS Bedrock. Diese Konfiguration arbeitet ausschließlich im Non-Reasoning-Modus, um erweiterte Denkschritte zu umgehen und latenzärmere Antworten zu liefern, während die grundlegende Qualität von Sonnet 4.6 erhalten bleibt.

Mit einem 1M Kontextfenster eignet es sich am besten für reaktionsschnelle Chat-Erlebnisse, hochvolumige Produktions-Workloads, unkomplizierte Coding-Unterstützung, Dokumentenverarbeitung und Agenten-Workflows, bei denen Geschwindigkeit wichtiger ist als tieferes Reasoning.

Modelltyp: LLM Kontextfenster: 1 Million Tokens

7. Claude Haiku 4.5

AWS Bedrock (EU)

Claude Haiku 4.5 ist jetzt mit EU-Hosting über AWS Bedrock. Es ist ein schnelles und kosteneffizientes Modell, das starke Fähigkeiten bei Coding, Reasoning, Tool-Nutzung und Interface-Interaktion in Produktionsgröße liefert. Seine Geschwindigkeit und die Fähigkeit, Aufgaben parallel auszuführen, machen es besonders effektiv als Worker-Modell in Multi-Agenten-Systemen.

Mit einem 200k Token-Kontextfenster und einer verfügbaren Fast-Konfiguration eignet es sich gut für Backend-Automatisierung, Chat-Workloads, Coding-Unterstützung und hochvolumige Agentensysteme, bei denen Reaktionsfähigkeit und geringere Kosten Priorität haben.

Modelltyp: LLM Kontextfenster: 200.000 Tokens Empfohlenes Upgrade von: Claude Haiku 3.5

Claude Sonnet 5, Gemini 3.1 Flash (Lite) Image, GPT-5.6-Modelle

1. Claude Sonnet 5

AWS Bedrock (EU)

Claude Sonnet 5 ist jetzt mit EU-Hosting über AWS Bedrock. Es ist ein großes Upgrade gegenüber Sonnet 4.6 und liefert nahezu Flaggschiff-Leistung bei Reasoning, Coding, Tool-Nutzung und Wissensarbeit zu geringeren Kosten als Spitzenmodelle.

Mit einem 1M Token-Kontextfenster ist Sonnet 5 besonders gut geeignet für komplexe, mehrstufige Aufgaben, die Analyse großer Dokumente und Codebasen sowie Automatisierungs-Workflows, die hohe Leistungsfähigkeit ohne Premium-Preise erfordern.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: Claude Sonnet 4.6

2. Gemini 3.1 Flash-Lite Image

Google AI (US)

Gemini 3.1 Flash-Lite Image ist jetzt mit US-Hosting über Google AI. Dieses leichte Bildgenerierungsmodell bietet eine schnelle und kosteneffiziente Option, um Visuals direkt innerhalb der Plattform zu erstellen. Es eignet sich besonders gut für Bildgenerierung in hoher Stückzahl, schnelles kreatives Experimentieren, einfache Marketing-Assets und Workflows, bei denen Durchlaufzeit und Erschwinglichkeit wichtiger sind als die fortgeschrittenen Steuerungsmöglichkeiten größerer Bildmodelle.

Modelltyp: Bildmodell Anbieter: Google AI Hosting: USA

3. GPT 5.6 Sol

Azure AI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über Azure AI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.5

4. GPT 5.6 Terra

Azure AI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über Azure AI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.4

5. GPT 5.6 Luna

Azure AI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über Azure AI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.4, GPT 5.4 Nano, GPT 5.4 Mini

GPT-5.6-Modelle

1. GPT 5.6 Sol

OpenAI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über OpenAI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.5

2. GPT 5.6 Terra

OpenAI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über OpenAI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.4

3. GPT 5.6 Luna

OpenAI (EU)

GPT-5.6 Sol ist jetzt mit EU-Hosting über OpenAI. Es ist das leistungsfähigste Modell der GPT-5.6-Familie und darauf ausgelegt, die hochwertigsten Ergebnisse für komplexe und anspruchsvolle Arbeiten zu liefern.

Mit einem 1M Token-Kontextfenster, es eignet sich besonders für schwieriges Reasoning, lang laufende Aufgaben, fortgeschrittene Forschung, komplexes Coding, dokumentenintensive Analysen und Workflows, bei denen Genauigkeit und Tiefe wichtiger sind als Geschwindigkeit oder Kosten.

Modelltyp: LLM Kontextfenster: 1 Million Tokens Empfohlenes Upgrade von: GPT 5.4, GPT 5.4 Nano, GPT 5.4 Mini

Zuletzt aktualisiert