> For the complete documentation index, see [llms.txt](https://docs.blockbrain.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.blockbrain.ai/de/fur-benutzer/alles-uber-llms/blockbrain-leitfaden-zur-llm-auswahl.md).

# Blockbrain-Leitfaden zur LLM-Auswahl

### Wie Blockbrain die Nutzung misst&#x20;

Jede Aktion in Blockbrain – Nachrichten, Datei-Uploads oder Agentenläufe – verbraucht Compute Blocks (CBs), eine transparente, nutzungsbasierte Kennzahl, die die tatsächlichen Rechenkosten jeder Operation widerspiegelt. CBs werden hauptsächlich durch die Token-Nutzung von LLMs bestimmt, und ihr Verbrauch spiegelt direkt die Input-/Output-Token-Preise jedes Modells wider.&#x20;

> **Ein teureres Modell = proportional höherer CB-Verbrauch.**&#x20;

### Standardempfehlung&#x20;

| Modell                                   | Qualität | Geschwindigkeit | Kosteneff. | Preisgestaltung (Input/Output pro 1 Mio. Token) |
| ---------------------------------------- | -------- | --------------- | ---------- | ----------------------------------------------- |
| Gemini 2.5 Flash                         | 4.3      | 4.8             | 4.6        | $0.50 / $3.00                                   |
| GPT 5.4 Mini (Budget-Alternative)        | 4.3      | 4.5             | 4.2        | $0.40 / $1.60                                   |
| Claude Haiku 4.5 (Qualitäts-Alternative) | 4.2      | 3.6             | 4.0        | $1.00 / $5.00                                   |

> &#x20;**Gemini 2.5 Flash** ist die beste Allround-Wahl — hervorragende Qualität, schnell, kosteneffizient, mit einem Kontextfenster von 1 Mio. Token.&#x20;

### Schnelle Entscheidungs-Matrix&#x20;

| Priorität                 | Primäre Wahl                    | Budget-Option                   | Premium-Option          |
| ------------------------- | ------------------------------- | ------------------------------- | ----------------------- |
| Täglicher Gebrauch        | Gemini 2.5 Flash                | GPT 5.4 Mini                    | Gemini 2.5 Pro ($2/$12) |
| Maximale Kosteneinsparung | GPT 4o Mini ($0.15/$0.60)       | GPT 5.4 Mini                    | Gemini 2.5 Flash        |
| Höchste Qualität          | Claude Opus 4.8 Max ($5/$25)    | Gemini 2.5 Pro                  | GPT 5.5 Pro ($5/$30)    |
| Schnellste Antwort        | Claude Sonnet 4.6 Fast ($3/$15) | Gemini 2.5 Flash                | GPT 5.4 Low Thinking    |
| Kreatives Schreiben       | Claude Sonnet 4.6 ($3/$15)      | Claude Haiku 4.5                | Claude Opus 4.8         |
| Code-Entwicklung          | GPT 5.3 Codex ($1.75/$14)       | Mistral Codestral ($0.30/$0.90) | Claude Opus 4.8         |
| Komplexes Schlussfolgern  | o3 ($2/$8)                      | o4 Mini ($1.10/$4.40)           | GPT 5.5 Pro             |

### Wichtige Überlegungen&#x20;

* **Output-Token kosten mehr als Input-Token** - priorisieren Sie Modelle mit niedrigen Output-Kosten für Berichte, Dokumente und Codegenerierung.&#x20;
* **Kontextfenster mit 1 Mio. Token** (Gemini 2.5 Flash/Pro, Claude Sonnet 4.6) umfassen \~3.000 Textseiten – entscheidend für Dokumentenanalyse und lange Gespräche.&#x20;
* **Premium-Modelle summieren sich schnell**: 1.000 Anfragen kosten mit GPT 5.4 Mini ca. \~$0.68 gegenüber ca. \~$10.00 mit Claude Opus 4.8.&#x20;

### Praxisnahe Kostenbeispiele für LLM-Anfragen und Empfehlungen <a href="#heading-title-text" id="heading-title-text"></a>

#### Kategorie: Direkte LLM-Aufrufe <a href="#category-direct-llm-calls" id="category-direct-llm-calls"></a>

#### 1 – Claude Opus 4.8 <a href="#id-1-claude-opus-4.8" id="id-1-claude-opus-4.8"></a>

* **Beispielabfrage**: "Verwandle diese groben Workshop-Notizen in ein ausgefeiltes strategisches Empfehlungsmemo für das Lenkungskomitee, in der Struktur Situation-Komplikation-Lösung" + angehängte rohe Workshop-Notizen (\~1,5-stündige Strategiesitzung, unordentliche Live-Notizen)
* **Input-Token**: \~1,640
* **Output-Token**: \~1,000
* **Input-Token-Kosten** (pro 1 Mio.): $5.00
* **Output-Token-Kosten** (pro 1 Mio.): $25.00
* **Compute Blocks**: \~3,320
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.10
* **Empfehlung**: **Gemini 3.1 Flash-Lite** - es kam auf \~101 CBs (\~€0.003), also etwa 33-mal günstiger als Opus. Aber das ist kein klarer Sieg: Das Memo von Gemini ließ die Struktur weg, die die Opus-Version enthielt. Claude Sonnet 4.6 (Beispiel 1.1) ist ein sichererer Mittelweg mit etwa 1,67-mal weniger CBs bei vergleichbarer Tiefe; Gemini lohnt sich nur, wenn das kürzere, weniger detaillierte Format für diesen Anwendungsfall tatsächlich ausreicht.

#### 1.1 – Claude Sonnet 4.6, dieselbe Anfrage wie bei 1 <a href="#id-1.1-claude-sonnet-4.6-same-query-as-1" id="id-1.1-claude-sonnet-4.6-same-query-as-1"></a>

* **Beispielabfrage**: Wie bei Beispiel 1
* **Input-Token**: \~1,640
* **Output-Token**: \~1,000
* **Input-Token-Kosten** (pro 1 Mio.): $3.00
* **Output-Token-Kosten** (pro 1 Mio.): $15.00
* **Compute Blocks**: \~1,992
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.06
* **Empfehlung**: **GPT 5 Mini** war etwa 9-mal günstiger als Opus und etwa 5,7-mal günstiger als Sonnet, während es ein *noch* gründlicheres Memo als beide Claude-Modelle erzeugte – das Gegenteil des Kompromisses von Gemini 3.1 Flash Lite, das zwar noch günstiger war, aber weniger detailliert. Von den drei getesteten Alternativen zu Opus bei genau dieser Anfrage wirkt GPT-5 Mini derzeit wie das beste Preis-Leistungs-Verhältnis: der größte Teil der Kosteneinsparung ohne Verzicht auf Details.

#### 2 – Claude Opus 4.8, mehrstufige / mehrdokumentige Analyse <a href="#id-2-claude-opus-4.8-multi-turn-multi-document-analysis" id="id-2-claude-opus-4.8-multi-turn-multi-document-analysis"></a>

* **Beispielabfrage**: Zwei-Runden-Gespräch. Runde 1: Analysiere eine Haftungsklausel in einem Frachtvertrag im Vergleich zu einem Gerichtsurteil und einem Memo mit Präzedenzfällen der Kanzlei und entwirf ein strukturiertes juristisches Memo (Issue / anwendbares Recht / Analyse / Risiko / Empfehlung). Runde 2, derselbe Thread: "Vertrete die Gegenposition – warum könnte dies trotz des Risikos durchsetzbar sein?"
* **Input-Token**: \~5.199 zusammen (Runde 1: 3 Quelldokumente + Anweisung, \~1.785; Runde 2: der gesamte Input+Output aus Runde 1 erneut als Kontext gesendet, \~3.374, + neue Anweisung, \~40)
* **Output-Token**: \~2.807 zusammen (Runde 1 Memo \~1.589 + Runde 2 Gegenposition \~1.218)
* **Input-Token-Kosten** (pro 1 Mio.): $5.00
* **Output-Token-Kosten** (pro 1 Mio.): $25.00
* **Compute Blocks**: \~9,617
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.29
* **Empfehlung**: Für dieses Niveau an juristischer Argumentationsqualität **GPT-5** ist eine plausible Alternative, angesichts seiner aktuellen Stärke bei strukturierten Schlussfolgerungsaufgaben – aber ein leichteres Modell wie Gemini Flash ist hier wahrscheinlich **nicht** geeignet, da die Messlatte für juristische Analysen hoch ist. Der größere Hebel ist unabhängig vom Modell die Gesprächslänge: Der kurze Prompt in Runde 2 sendet trotzdem den gesamten Inhalt von Runde 1 erneut als Kontext, sodass die Kosten mit jeder Folge-Runde steigen.

#### 2.1 – Claude Sonnet 4.6, dasselbe Zwei-Runden-Gespräch wie bei 2 <a href="#id-2.1-claude-sonnet-4.6-same-two-turn-conversation-as-2" id="id-2.1-claude-sonnet-4.6-same-two-turn-conversation-as-2"></a>

* **Beispielabfrage**: Wie bei 2
* **Input-Token**: \~5.503 zusammen (Runde 1: dieselben 1.785 wie in der Opus-Version; Runde 2: Input+Output aus Runde 1 erneut gesendet, \~3.678, + neue Anweisung, \~40)
* **Output-Token**: \~3.402 zusammen (Runde 1 Memo 1.893 + Runde 2 Gegenposition 1.509 – beides real und beide länger als die Opus-Entsprechungen von \~1.589 und \~1.218)
* **Input-Token-Kosten** (pro 1 Mio.): $3.00
* **Output-Token-Kosten** (pro 1 Mio.): $15.00
* **Compute Blocks**: \~6,754
* Kosten (bei 30 € / 1 Mio. Compute Blocks): \~€0.203
* **Empfehlung**: **Wechsel zu GPT-5.** Obwohl es deutlich günstiger ist als Claude Opus (2), erzeugt Sonnet 4.6 paradoxerweise *längere* Ausgaben (3.402 vs. \~2.807 Token zusammen), was die Kosten ohne klaren Qualitätsvorteil erhöht. Mit \~€0.203 pro Zwei-Runden-Gespräch bleibt es teurer als GPT-5 bei vergleichbarer oder besserer Ausgabe. Siehe Abschnitt 2 für den vollständigen Kostenvergleich.

#### 3 – Claude Opus 4.8, Abgleich quantitativer Daten <a href="#id-3-claude-opus-4.8-quantitative-data-reconciliation" id="id-3-claude-opus-4.8-quantitative-data-reconciliation"></a>

* **Beispielabfrage**: Anhand von drei KPI-/Datendokumenten (einer vierteljährlichen Kennzahlentabelle, einer Segmentaufgliederung und einem Memo mit Kommentaren der Führungsebene) die 2–3 größten strategischen Risiken identifizieren, jedes mit konkreten Zahlen und Quartals-zu-Quartals-Trends untermauern, die ARR-Zahlen über die Dokumente hinweg abgleichen und jede Abweichung kennzeichnen sowie die Erzählung der Führungsebene mit der tatsächlichen Datenlage vergleichen.
* **Input-Token**: \~1.284 (3 Quelldokumente + Anweisung)
* **Output-Token**: \~1,233
* **Input-Token-Kosten** (pro 1 Mio.): $5.00
* **Output-Token-Kosten** (pro 1 Mio.): $25.00
* **Compute Blocks**: \~3,725
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.11
* **Empfehlung**: **GPT-5 Nano** entsprach inhaltlich im Wesentlichen dieser Analyse – dieselben 3 Risiken identifiziert, dieselbe $0.6M ARR-Abweichung berechnet, dieselbe Schwere-Rangfolge – bei etwa 61-mal weniger CBs als Opus (\~61 CBs vs. \~3.725).

#### 3.1 – Claude Sonnet 4.6, dieselbe Anfrage wie bei 3  <a href="#id-3.1-claude-sonnet-4.6-same-query-as-3" id="id-3.1-claude-sonnet-4.6-same-query-as-3"></a>

* **Anfrage** **Beispiel**: Wie bei 3
* **Input** **Token**: \~1,284
* **Output** **Token**: 1,208
* **Input** **Token** **Kosten** (pro 1 Mio.): $3.00
* **Output** **Token** **Kosten** (pro 1 Mio.): $15.00
* **Compute** **Blocks**: \~2,197
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.066
* **Empfehlung**: **Gemini Flash-Lite oder GPT-5 Mini-Klasse.** Mit \~€0.066 pro Anfrage ist Sonnet 4.6 bereits kosteneffizient – aber der Abgleich arithmetischer Werte ist eine strukturierte, regelgebundene Aufgabe, die kein Frontier-Reasoning erfordert. Leichtere Modelle können die Genauigkeit möglicherweise zu einem Bruchteil der Kosten erreichen.

***

#### Kategorie: Websuche <a href="#category-web-search" id="category-web-search"></a>

Die Websuche wird durch einen Suchanbieter (Tavily / Linkup / Perplexity) plus ein Synthese-LLM unterstützt. Die folgenden Zahlen sind für diese konkreten Beispiel-Läufe real; eine andere Anfrage könnte mehr oder weniger kosten, je nachdem, wie viele Quellen letztlich gelesen werden und welcher Anbieter bzw. welches Modell die Synthese übernimmt.

#### 1 – Rechercheanfrage zum EU AI Act <a href="#id-1-eu-ai-act-research-query" id="id-1-eu-ai-act-research-query"></a>

* **Beispielabfrage**: "Was sind die neuesten Änderungen am EU AI Act, die Unternehmen wie uns als KI-Anbieter betreffen könnten?" – führte 3 Suchanfragen aus, las 6 Quellen (über Linkup, in der EU gehostet)
* **Input-Token**: \~6.000–8.500 (angenommen \~900–1.300 Token/Quelle × 6 Quellen)
* **Output-Token**: \~911
* **Input-Token-Kosten** (pro 1 Mio.): $3.00 (Modell: Sonnet 4.6)
* **Output-Token-Kosten** (pro 1 Mio.): $15.00
* **Compute Blocks**: \~3.200–3.900
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.10–€0.12
* **Empfehlung**: **Prompting-Ansatz:** Diese Anfrage nutzte eine breite, offene Formulierung ("was sind die neuesten Änderungen") – eine enger gefasste Version, z. B. "Welche Änderungen am EU AI Act wurden seit Juni 2026 veröffentlicht, die insbesondere Unternehmen betreffen?", würde wahrscheinlich die Anzahl der Suchanfragen des Agenten und die Anzahl der Quellen, die er lesen möchte, verringern und damit die CB-Kosten direkt senken. Offene Recherche-Prompts lösen in der Regel mehr Tool-Aufrufe aus als eine eng umrissene Frage mit derselben Absicht.

#### 2 – EUR/USD-Wechselkurs <a href="#id-2-eur-usd-exchange-rate" id="id-2-eur-usd-exchange-rate"></a>

* **Beispielabfrage**: "Wie hoch ist heute der EUR/USD-Wechselkurs?" – führte 1 Suchanfrage aus, las 1 Quelle ([Investing.com - Aktienkurse & Finanznachrichten](http://investing.com/) )
* **Input-Token**: \~300–650
* **Output-Token**: \~64
* **Input-Token-Kosten** (pro 1 Mio.): $3.00
* **Output-Token-Kosten** (pro 1 Mio.): $15.00
* **Compute Blocks**: \~190–290
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.006–€0.009
* **Empfehlung**: **Prompting-Ansatz:** Dieser Prompt ist bereits so eng wie möglich gefasst (eine einzige Tatsache, keine Unklarheit über Umfang oder Zeitraum) — ein gutes Referenzbeispiel dafür, wie ein effizient eingegrenzter Websearch-Prompt aussieht, mit wenig Spielraum, die Tool-Aufrufe weiter zu reduzieren.

#### 3 – Recherche zu Haftung von KI-Anbietern / MCP-Tool-Calling <a href="#id-3-ai-vendor-liability-mcp-tool-calling-research" id="id-3-ai-vendor-liability-mcp-tool-calling-research"></a>

* **Beispielabfrage**: "Gab es veröffentlichte regulatorische Leitlinien zur Haftung von KI-Anbietern für Tool-Calling-Architekturen im MCP-Stil?" – führte 3 Suchanfragen aus, las 8 Quellen (die meisten der drei Beispiele)
* **Input-Token**: \~7.200–10.400
* **Output-Token**: \~819
* **Input-Token-Kosten** (pro 1 Mio.): $3.00
* **Output** **Token** **Kosten** (pro 1 Mio.): $15.00
* **Compute** **Blocks**: \~3.390–4.350
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.10–€0.13
* **Empfehlung**: Kam trotz des Lesens von mehr Quellen (8 vs. 6) kostenseitig nahe an Beispiel 1 heran, weil die Ausgabe kürzer war. **Prompting-Ansatz:** Die offene Formulierung ("gab es irgendwelche Leitlinien") hat den Agenten wahrscheinlich dazu veranlasst, breiter über mehr Quellen zu suchen, als eine enger gefasste Frage es erfordert hätte – eine spezifischere Unterfrage, z. B. "Adressiert der EU AI Act ausdrücklich MCP-artige Tool-Calling-Architekturen?", würde wahrscheinlich die Quellanzahl und damit die CB-Kosten senken, allerdings auf Kosten des Risikos, breiteren Kontext zu verpassen, den eine weiter gefasste Suche liefern könnte.

***

### Kategorie: Outlook-Agent <a href="#category-outlook-agent" id="category-outlook-agent"></a>

Die Kosten hängen davon ab, welche Tools der Agent letztlich aufruft und wie viel Schlussfolgerung er benötigt, was im Voraus nicht festgelegt ist.

#### 1 – Kalender-Konfliktprüfung <a href="#id-1-calendar-conflict-check" id="id-1-calendar-conflict-check"></a>

* **Anfrage** **Beispiel**: "Prüfe meinen Kalender auf Konflikte nächsten Dienstag Nachmittag" – der Agent schloss auf das Datum, rief das Outlook-Kalender-Tool auf und lieferte eine Konfliktanalyse
* **Input** **Token**: \~1.700–3.500
* **Output** **Token**: \~400
* **Input** **Token** **Kosten** (pro 1 Mio.): $3.00
* **Output** **Token** **Kosten** (pro 1 Mio.): $15.00
* **Compute** **Blocks**: \~1.100–1.650
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.03–€0.05
* **Empfehlung**: **Prompting-Ansatz:** Dieser Prompt ist bereits eng gefasst (ein Datum, ein Zeitfenster) – ein gutes Beispiel für einen effizient eingegrenzten Agenten-Prompt, mit wenig Spielraum, die Tool-Aufrufe hier weiter zu reduzieren.

#### 2 – Postfachsuche <a href="#id-2-mailbox-search" id="id-2-mailbox-search"></a>

* **Anfrage** **Beispiel**: "Zeige mir alle E-Mails an, die in den letzten zwei Wochen den SharePoint-Connector erwähnen" – der Agent berechnete den Datumsbereich, rief das Postfachsuch-Tool auf und gab 3 passende E-Mails mit einer Zusammenfassung zurück
* **Input** **Token**: \~1.700–3.500
* **Output** **Token**: \~411
* **Input** **Token** **Kosten** (pro 1 Mio.): $3.00
* **Output** **Token** **Kosten** (pro 1 Mio.): $15.00
* **Compute** **Blocks**: \~1.150–1.700
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.03–€0.05
* **Empfehlung**: Nahezu identische Kosten wie beim ersten Anwendungsfall in dieser Kategorie – bestätigt, dass einfache Outlook-Aktionen mit einem einzelnen Tool-Aufruf unabhängig vom konkret verwendeten Tool ähnlich viel kosten. **Prompting-Ansatz:** Das spezifische Schlüsselwort und das explizite Zeitfenster hielten dies günstig; eine vage Fassung wie "zeige mir alles zu SharePoint" ohne Datumsbereich könnte den Agenten zu einer viel breiteren (und teureren) Postfachsuche zwingen.

#### 3 – Komplexe mehrstufige Workflow-Anfrage <a href="#id-3-complex-multi-step-workflow-request" id="id-3-complex-multi-step-workflow-request"></a>

* **Anfrage** **Beispiel**: "Wenn eine E-Mail von der Produktgruppe eintrifft, klassifiziere sie nach Arbeitsstrom, extrahiere Aktionspunkte in eine strukturierte Liste, protokolliere sie in meinem Tracker, entwerfe eine Antwort, wenn es Routine ist, und benachrichtige mich in Teams."
* **Input** **Token**: \~1.550–3.050
* **Output** **Token**: \~950
* **Input** **Token** **Kosten** (pro 1 Mio.): $3.00
* **Output** **Token** **Kosten** (pro 1 Mio.): $15.00
* **Compute** **Blocks**: \~1.890–2.340
* **Kosten** (bei 30 € / 1 Mio. Compute Blocks): \~€0.06–€0.07
* **Empfehlung**: **Prompting-Ansatz:** Dieser Prompt bündelte sechs unterschiedliche Aufgaben in einer Anfrage. Wenn man dies in Anfragen aufteilt, die der Agent tatsächlich erfüllen kann – z. B. "klassifiziere und protokolliere Aktionspunkte aus E-Mails, die ich dir weiterleite", wobei der Echtzeit-Trigger und die Teams-Teile wegfallen – würde man die durch Fähigkeitsgrenzen verursachte Sackgasse vollständig vermeiden und eine viel kürzere, günstigere und nützlichere Antwort erhalten.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.blockbrain.ai/de/fur-benutzer/alles-uber-llms/blockbrain-leitfaden-zur-llm-auswahl.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
