For the complete documentation index, see llms.txt. This page is also available as Markdown.

How to Choose the Right LLM

A detailed LLM selection guide explaining how Blockbrain measures usage via Compute Blocks, with concrete model recommendations for company-wide deployment and specific use cases.

When using Blockbrain, understanding how computational resources are measured and allocated is essential for getting the most out of the platform. At the heart of this system lies a transparent and usage-based metric: Compute Blocks (CBs).

Every action at Blockbrain - sending a message, uploading a file, or running an agent - consumes Compute Blocks (CBs). CBs reflect the actual computational cost of each operation and are composed primarily of tokens used by Large Language Models (LLMs).

CB usage directly mirrors the input and output token pricing of each LLM. For example, if Opus 4.8 is 66.67% more expensive than Sonnet 4.6 in terms of input and output token prices, its CB consumption will also be approximately 66.67% higher.


Default Recommendation for Company-Wide Use

Primary Choice: Gemini 2.5 Flash

Blockbrain Metrics:

  • Answer Quality: 3.2/5

  • Speed: 4.8/5

  • Cost Efficiency: 4.6/5

  • Context: 1M tokens | Provider: Vertex AI (EU)

Pricing: $0.50 input / $3.00 output per million tokens

Why this model? Excellent balance of quality, speed, and cost with a massive 1M token context window - ideal for diverse business use cases.

Alternative #1: GPT 5.4 Mini

Blockbrain Metrics:

  • Quality: 4.3 | Speed: 4.5 | Cost Efficiency: 4.2

  • Context: 400k tokens | Provider: OpenAI (EU)

Pricing: $0.40 input / $1.60 output per million tokens

Why consider? Competitive quality at low cost - excellent for high-volume deployment.

Alternative #2: Claude Haiku 4.5

Blockbrain Metrics:

  • Quality: 3.6 | Speed: 3.6 | Cost Efficiency: 4.0

  • Context: 200k tokens | Provider: Vertex AI (EU)

Pricing: $1 input / $5 output per million tokens

Why consider? Highest quality among budget-tier models. Excellent for teams that need better reasoning while maintaining cost efficiency.


Scenario-Based Recommendations

Highest Quality (Premium Tasks)

Winner: Claude Opus 4.8 (VERY EXPENSIVE )

  • Blockbrain Rating: Quality 4.9

  • Pricing: $5 input / $25 output per million tokens

Cost Warning: At $25 per million output tokens, this costs 8x more than Gemini 2.5 Flash. For 10,000 responses/month (1,000 tokens each), expect $250+ in output costs alone.

When to use: Reserve for mission-critical tasks, C-suite deliverables, complex strategic analysis, or when absolute best quality is non-negotiable.

Budget Quality Option: Gemini 2.5 Pro

  • Quality: 3.6 | Speed: 4.3 | Cost Efficiency: 3.7

  • Pricing: $2 input / $12 output per million tokens

  • Best premium option without extreme cost

Maximum Speed

Winner: Claude Sonnet 4.6 Fast

  • Blockbrain Rating: Speed: 5.0 | Answer Quality: 3.8

  • Pricing: $3 input / $15 output per million tokens

  • Context: 1M tokens | Provider: Vertex AI (EU)

Why it wins: Achieves maximum speed (5.0) with excellent quality (4.5). Ideal for real-time applications, customer-facing chatbots, and time-sensitive workflows.

Runner-up: Gemini 2.5 Flash

  • Speed: 4.8 | Answer Quality: 3.8

  • Pricing: $0.50 input / $3 output (5x cheaper outputs)

  • Better value for most speed-critical applications

Code Development Excellence

Winner: Gemini 3.5 Flash

Blockbrain Metrics:

  • Quality: 4.6 | Speed: 4.6 | Cost Efficiency: 3.7

  • Context: 1M tokens | Provider: Vertex AI (EU)

  • Pricing: $1.5 input / $9 output per million tokens

Why it wins: Highest quality for code development (4.6) with excellent speed. Purpose-built for coding and agentic tasks.

Alternative: GPT 5.3 Codex

Blockbrain Metrics:

  • Quality: 4.4 | Speed: 4.2 | Cost Efficiency: 3.5

  • Context: 400k tokens | Provider: OpenAI (EU)

  • Pricing: $1.75 input / $14 output per million tokens

Why it wins: High quality for code development (4.4) with excellent speed. Purpose-built for software development, code generation, and technical tasks.

Premium Option: Claude Opus 4.8

  • Answer Quality: 4.9 | Pricing: $5 / $25

  • Best for: Complex architectural decisions, critical code review

Creative & Writing Tasks

Winner: Claude Sonnet 4.6

  • Blockbrain Rating: Quality 4.4 | Speed: 3.8 | Cost Efficiency: 3.3

  • Pricing: $3 input / $15 output per million tokens

  • Context: 1M tokens | Provider: Vertex AI (EU)

Why it wins: Claude models excel at nuanced writing, tone control, and creative content. Sonnet 4.6 delivers flagship-quality writing (4.7) at mid-tier pricing—exceptional value for creative work.

Budget Alternative: Claude Haiku 4.5

  • Quality: 3.6 | Pricing: $1 input / $5 output

  • Excellent for: creative briefs, social media, email drafts

Premium Option: Claude Opus 4.8

  • Quality: 4.9 | Pricing: $5 / $25

  • Best for: High-stakes content, brand manifestos, critical communications

Complex Reasoning Tasks

Winner: o3 (OpenAI Reasoning Model)

Blockbrain Metrics:

  • Quality: 3.5 | Speed: 2.3 | Cost Efficiency: 3.7

  • Context: 200k tokens | Provider: Azure AI (EU)

  • Pricing: $2 input / $8 output per million tokens

  • Performance: 20% improvement over o1 in coding, math, and science with multimodal reasoning and autonomous tool use.

  • Best for: Complex problem-solving, scientific analysis, advanced coding, mathematical proofs.

Budget Alternative: o4 Mini

  • Quality: 3.4 | Speed: 3.7 | Cost Efficiency: 4.1

  • Pricing: $1.10 input / $4.40 output

  • 80–90% of o3's reasoning power at 45% lower cost

Premium Option: GPT 5.5 Pro

  • Quality: 4.9 | Pricing: $5 / $30

  • Most advanced reasoning available, but very expensive


Decision Matrix

Priority
Primary Recommendation
Budget Alternative
Premium Option

Balanced everyday use

Gemini 2.5 Flash ($0.50/$3)

GPT 5.4 Mini ($0.40/$1.60)

Gemini 2.5 Pro ($2/$12)

Maximum cost savings

GPT 4o Mini ($0.15/$0.60)

GPT 5.4 Mini ($0.40/$1.60)

Gemini 2.5 Flash ($0.50/$3)

Highest quality

Claude Opus 4.8 Max ($5/$25)

Gemini 2.5 Pro ($2/$12)

GPT 5.5 Pro ($5/$30)

Fastest response

Claude Sonnet 4.6 Fast ($3/$15)

Gemini 2.5 Flash ($0.50/$3)

GPT 5.4 Low Thinking ($2.50/$15)

Creative work

Claude Sonnet 4.6 ($3/$15)

Claude Haiku 4.5 ($1/$5)

Claude Opus 4.8 ($5/$25)

Code development

Gemini 3.5 Flash ($1.5/$9)

GPT 5.3 Codex ($1.75/$14)

Claude Opus 4.8 ($5/$25)

Complex reasoning

o3 ($2/$8)

o4 Mini ($1.10/$4.40)

GPT 5.5 Pro ($5/$30)


Strategic Recommendations

For Most Companies: Multi-Model Strategy

We recommend a tiered approach:

  • Tier 1 (80% of queries): Fast, cost-efficient models

    • Gemini 2.5 Flash or GPT 5.4 Mini

    • Use for: emails, summaries, Q&A, basic analysis

  • Tier 2 (15% of queries): Balanced premium models

    • Claude Sonnet 4.6 or Gemini 2.5 Pro

    • Use for: reports, complex content, strategic analysis

  • Tier 3 (5% of queries): Flagship models

    • Claude Opus 4.8 (only when necessary)

    • Use for: critical decisions, high-stakes content, C-suite materials

Estimated Savings: 60–75% vs. using flagship models for everything


Final Recommendations by Company Size

Startups & Small Teams (<50 people)

Default: GPT 5.4 Mini — $0.40 input / $1.60 output

  • Excellent quality for price (4.3)

  • Broad capability across use cases

  • Low absolute cost for getting started

Alternative: Gemini 2.5 Flash — $0.50 input / $3 output

  • Slightly higher cost but 1M context window

  • Better for document-heavy workflows

Mid-Size Companies (50–500 people)

Default: Gemini 2.5 Flash — $0.50 input / $3 output

  • Best balanced performance (3.2 quality, 4.8 speed)

  • 1M context window for versatility

  • Scales well with volume

Specialist Add-ons:

  • Engineering: GPT 5.3 Codex ($1.75/$14) or Mistral Codestral ($0.30/$0.90)

  • High-quality content: Claude Sonnet 4.6 ($3/$15)

Enterprises (500+ people)

Default: Multi-model strategy

Department
Recommended Model
Pricing (Input/Output)

Engineering

GPT 5.3 Codex + Mistral Codestral (volume) / Gemini 3.5 Flash

$1.75/$14 + $0.30/$0.90 / $1.5/$9

Creative / Marketing

Claude Sonnet 4.6

$3/$15

Analytics

Gemini 2.5 Pro

$2/$12

General Workforce

Gemini 2.5 Flash

$0.50/$3

Executive / Critical

Claude Opus 4.8

$5/$25

Cost Management:

  • Implement model routing based on query complexity

  • Set monthly budgets per team

  • Monitor usage patterns quarterly


Important Considerations

Output Token Costs Matter Most

For typical conversational AI:

  • Input: System prompt + user query = 500 tokens

  • Output: AI response = 200–500 tokens

Example cost for 1,000 queries (500 input tokens, 300 output tokens):

Model
Input Cost
Output Cost
Total

GPT 4o Mini

$0.075

$0.18

$0.26

GPT 5.4 Mini

$0.20

$0.48

$0.68

Gemini 2.5 Flash

$0.25

$0.90

$1.15

Claude Haiku 4.5

$0.50

$1.50

$2.00

Claude Sonnet 4.6

$1.50

$4.50

$6.00

Claude Opus 4.8

$2.50

$7.50

$10.00

Output-heavy use cases (reports, documentation, code generation) should prioritize low output-cost models.

Context Window Value

Model
Context Window

Gemini 2.5 Flash / Pro

1M tokens

Claude Sonnet 4.6

1M tokens

Most others

128k–400k tokens

Mistral Codestral

32k tokens

When it matters: Document analysis, long conversations, comprehensive research, multi-file code review.

Pro tip: A 1M context window can hold 750,000 words or 3,000 pages of text.

Provider Considerations

All Blockbrain models are EU-hosted, ensuring:

  • GDPR compliance – Data processed within EU boundaries

  • Data residency – Meets European regulatory requirements

  • Lower latency – For European customers


Best Practices for Cost Optimization

1. Prompt Engineering

Reduce output tokens by 30–50%

Either add this in the initial instructions of the bot, or prompt it directly:

  • Request concise responses: "Answer in 2–3 sentences" or use in the sendbox Options → Length: Short / Very Short

  • Use structured outputs: "Respond in bullet points"

  • Avoid redundancy: "Don't repeat the question"

Impact: Can reduce costs by 40%+ for output-heavy models.

2. Smart Model Routing

Query Type
Recommended Model

Simple (FAQ, definitions)

GPT 5.4 Mini

Standard (analysis, drafting)

Gemini 2.5 Flash

Complex (strategic, critical)

Claude Sonnet 4.6 / Opus 4.8

Impact: 50–70% cost reduction vs. using premium models for everything.

3. Caching & Reuse

  • Cache common prompts (Prompt Library)

  • Reuse context where possible (e.g. via Insights)

  • Implement RAG (Retrieval-Augmented Generation) via the database to reduce context size

Impact: 20–30% reduction in input token costs.


Model Comparison Table (Top Recommendations)

Model
Answer Quality
Speed
Cost Eff.
Input $
Output $

Gemini 3.5 Flash

4.6

4.6

3.7

$1.5

$9

Gemini 2.5 Flash

3.2

4.8

4.6

$0.50

$3.00

All-around default

GPT 5.4 Mini

4.3

4.5

4.2

$0.40

$1.60

Budget-conscious

GPT 4o Mini

2.3

5.0

5.0

$0.15

$0.60

Maximum savings

Claude Haiku 4.5

3.6

3.6

4.0

$1.00

$5.00

Quality on budget

GPT 5.3 Codex

4.4

4.2

3.5

$1.75

$14.00

Code development

Mistral Codestral

3.4

3.9

5.0

$0.30

$0.90

Code (budget)

Claude Sonnet 4.6

4.4

3.0

3.3

$3.00

$15.00

Creative / writing

Claude Sonnet 4.6 Fast

3.8

5.0

3.7

$3.00

$15.00

Speed + quality

Gemini 2.5 Pro

3.6

4.1

3.7

$2.00

$12.00

Premium balanced

Claude Opus 4.8

4.9

4.1

3

$5.00

$25.00

Claude Opus 4.7

4.8

4.2

3

$5.00

$25.00

Claude Opus 4.6

4.5

2.8

3.0

$5.00

$25.00

Top-tier quality

GPT 5.5 Pro

4.9

1.2

1.8

$5.00

$30.00

Max quality / reasoning

o3

3.5

2.3

3.7

$2.00

$8.00

Complex reasoning

o4 Mini

3.4

3.7

4.1

$1.10

$4.40

Reasoning value

Conclusion

The Blockbrain model portfolio offers excellent options for every use case and budget.

For most companies, we recommend:

  1. Start with Gemini 2.5 Flash as your default model (e.g. in your Company GPT)

  2. Add GPT 5.4 Mini for budget-conscious teams

  3. Introduce specialist models (Gemini 3.5 Flash, GPT 5.3 Codex, Claude Sonnet 4.6)

  4. Reserve premium models (Opus, GPT 5.5 Pro) for critical work only

This approach typically delivers:

  • 60–75% cost savings vs. premium-only deployment

  • 90%+ user satisfaction

  • Flexibility to scale and optimize over time

Last updated