How to Choose the Right LLM
A detailed LLM selection guide explaining how Blockbrain measures usage via Compute Blocks, with concrete model recommendations for company-wide deployment and specific use cases.
When using Blockbrain, understanding how computational resources are measured and allocated is essential for getting the most out of the platform. At the heart of this system lies a transparent and usage-based metric: Compute Blocks (CBs).
Every action at Blockbrain - sending a message, uploading a file, or running an agent - consumes Compute Blocks (CBs). CBs reflect the actual computational cost of each operation and are composed primarily of tokens used by Large Language Models (LLMs).
CB usage directly mirrors the input and output token pricing of each LLM. For example, if Opus 4.8 is 66.67% more expensive than Sonnet 4.6 in terms of input and output token prices, its CB consumption will also be approximately 66.67% higher.
Default Recommendation for Company-Wide Use
Primary Choice: Gemini 2.5 Flash
Blockbrain Metrics:
Answer Quality: 3.2/5
Speed: 4.8/5
Cost Efficiency: 4.6/5
Context: 1M tokens | Provider: Vertex AI (EU)
Pricing: $0.50 input / $3.00 output per million tokens
Why this model? Excellent balance of quality, speed, and cost with a massive 1M token context window - ideal for diverse business use cases.
Alternative #1: GPT 5.4 Mini
Blockbrain Metrics:
Quality: 4.3 | Speed: 4.5 | Cost Efficiency: 4.2
Context: 400k tokens | Provider: OpenAI (EU)
Pricing: $0.40 input / $1.60 output per million tokens
Why consider? Competitive quality at low cost - excellent for high-volume deployment.
Alternative #2: Claude Haiku 4.5
Blockbrain Metrics:
Quality: 3.6 | Speed: 3.6 | Cost Efficiency: 4.0
Context: 200k tokens | Provider: Vertex AI (EU)
Pricing: $1 input / $5 output per million tokens
Why consider? Highest quality among budget-tier models. Excellent for teams that need better reasoning while maintaining cost efficiency.
Scenario-Based Recommendations
Highest Quality (Premium Tasks)
Winner: Claude Opus 4.8 (VERY EXPENSIVE )
Blockbrain Rating: Quality 4.9
Pricing: $5 input / $25 output per million tokens
Cost Warning: At $25 per million output tokens, this costs 8x more than Gemini 2.5 Flash. For 10,000 responses/month (1,000 tokens each), expect $250+ in output costs alone.
When to use: Reserve for mission-critical tasks, C-suite deliverables, complex strategic analysis, or when absolute best quality is non-negotiable.
Budget Quality Option: Gemini 2.5 Pro
Quality: 3.6 | Speed: 4.3 | Cost Efficiency: 3.7
Pricing: $2 input / $12 output per million tokens
Best premium option without extreme cost
Maximum Speed
Winner: Claude Sonnet 4.6 Fast
Blockbrain Rating: Speed: 5.0 | Answer Quality: 3.8
Pricing: $3 input / $15 output per million tokens
Context: 1M tokens | Provider: Vertex AI (EU)
Why it wins: Achieves maximum speed (5.0) with excellent quality (4.5). Ideal for real-time applications, customer-facing chatbots, and time-sensitive workflows.
Runner-up: Gemini 2.5 Flash
Speed: 4.8 | Answer Quality: 3.8
Pricing: $0.50 input / $3 output (5x cheaper outputs)
Better value for most speed-critical applications
Code Development Excellence
Winner: Gemini 3.5 Flash
Blockbrain Metrics:
Quality: 4.6 | Speed: 4.6 | Cost Efficiency: 3.7
Context: 1M tokens | Provider: Vertex AI (EU)
Pricing: $1.5 input / $9 output per million tokens
Why it wins: Highest quality for code development (4.6) with excellent speed. Purpose-built for coding and agentic tasks.
Alternative: GPT 5.3 Codex
Blockbrain Metrics:
Quality: 4.4 | Speed: 4.2 | Cost Efficiency: 3.5
Context: 400k tokens | Provider: OpenAI (EU)
Pricing: $1.75 input / $14 output per million tokens
Why it wins: High quality for code development (4.4) with excellent speed. Purpose-built for software development, code generation, and technical tasks.
Premium Option: Claude Opus 4.8
Answer Quality: 4.9 | Pricing: $5 / $25
Best for: Complex architectural decisions, critical code review
Creative & Writing Tasks
Winner: Claude Sonnet 4.6
Blockbrain Rating: Quality 4.4 | Speed: 3.8 | Cost Efficiency: 3.3
Pricing: $3 input / $15 output per million tokens
Context: 1M tokens | Provider: Vertex AI (EU)
Why it wins: Claude models excel at nuanced writing, tone control, and creative content. Sonnet 4.6 delivers flagship-quality writing (4.7) at mid-tier pricing—exceptional value for creative work.
Budget Alternative: Claude Haiku 4.5
Quality: 3.6 | Pricing: $1 input / $5 output
Excellent for: creative briefs, social media, email drafts
Premium Option: Claude Opus 4.8
Quality: 4.9 | Pricing: $5 / $25
Best for: High-stakes content, brand manifestos, critical communications
Complex Reasoning Tasks
Winner: o3 (OpenAI Reasoning Model)
Blockbrain Metrics:
Quality: 3.5 | Speed: 2.3 | Cost Efficiency: 3.7
Context: 200k tokens | Provider: Azure AI (EU)
Pricing: $2 input / $8 output per million tokens
Performance: 20% improvement over o1 in coding, math, and science with multimodal reasoning and autonomous tool use.
Best for: Complex problem-solving, scientific analysis, advanced coding, mathematical proofs.
Budget Alternative: o4 Mini
Quality: 3.4 | Speed: 3.7 | Cost Efficiency: 4.1
Pricing: $1.10 input / $4.40 output
80–90% of o3's reasoning power at 45% lower cost
Premium Option: GPT 5.5 Pro
Quality: 4.9 | Pricing: $5 / $30
Most advanced reasoning available, but very expensive
Decision Matrix
Balanced everyday use
Gemini 2.5 Flash ($0.50/$3)
GPT 5.4 Mini ($0.40/$1.60)
Gemini 2.5 Pro ($2/$12)
Maximum cost savings
GPT 4o Mini ($0.15/$0.60)
GPT 5.4 Mini ($0.40/$1.60)
Gemini 2.5 Flash ($0.50/$3)
Highest quality
Claude Opus 4.8 Max ($5/$25)
Gemini 2.5 Pro ($2/$12)
GPT 5.5 Pro ($5/$30)
Fastest response
Claude Sonnet 4.6 Fast ($3/$15)
Gemini 2.5 Flash ($0.50/$3)
GPT 5.4 Low Thinking ($2.50/$15)
Creative work
Claude Sonnet 4.6 ($3/$15)
Claude Haiku 4.5 ($1/$5)
Claude Opus 4.8 ($5/$25)
Code development
Gemini 3.5 Flash ($1.5/$9)
GPT 5.3 Codex ($1.75/$14)
Claude Opus 4.8 ($5/$25)
Complex reasoning
o3 ($2/$8)
o4 Mini ($1.10/$4.40)
GPT 5.5 Pro ($5/$30)
Strategic Recommendations
For Most Companies: Multi-Model Strategy
We recommend a tiered approach:
Tier 1 (80% of queries): Fast, cost-efficient models
Gemini 2.5 Flash or GPT 5.4 Mini
Use for: emails, summaries, Q&A, basic analysis
Tier 2 (15% of queries): Balanced premium models
Claude Sonnet 4.6 or Gemini 2.5 Pro
Use for: reports, complex content, strategic analysis
Tier 3 (5% of queries): Flagship models
Claude Opus 4.8 (only when necessary)
Use for: critical decisions, high-stakes content, C-suite materials
Estimated Savings: 60–75% vs. using flagship models for everything
Final Recommendations by Company Size
Startups & Small Teams (<50 people)
Default: GPT 5.4 Mini — $0.40 input / $1.60 output
Excellent quality for price (4.3)
Broad capability across use cases
Low absolute cost for getting started
Alternative: Gemini 2.5 Flash — $0.50 input / $3 output
Slightly higher cost but 1M context window
Better for document-heavy workflows
Mid-Size Companies (50–500 people)
Default: Gemini 2.5 Flash — $0.50 input / $3 output
Best balanced performance (3.2 quality, 4.8 speed)
1M context window for versatility
Scales well with volume
Specialist Add-ons:
Engineering: GPT 5.3 Codex ($1.75/$14) or Mistral Codestral ($0.30/$0.90)
High-quality content: Claude Sonnet 4.6 ($3/$15)
Enterprises (500+ people)
Default: Multi-model strategy
Engineering
GPT 5.3 Codex + Mistral Codestral (volume) / Gemini 3.5 Flash
$1.75/$14 + $0.30/$0.90 / $1.5/$9
Creative / Marketing
Claude Sonnet 4.6
$3/$15
Analytics
Gemini 2.5 Pro
$2/$12
General Workforce
Gemini 2.5 Flash
$0.50/$3
Executive / Critical
Claude Opus 4.8
$5/$25
Cost Management:
Implement model routing based on query complexity
Set monthly budgets per team
Monitor usage patterns quarterly
Important Considerations
Output Token Costs Matter Most
For typical conversational AI:
Input: System prompt + user query = 500 tokens
Output: AI response = 200–500 tokens
Example cost for 1,000 queries (500 input tokens, 300 output tokens):
GPT 4o Mini
$0.075
$0.18
$0.26
GPT 5.4 Mini
$0.20
$0.48
$0.68
Gemini 2.5 Flash
$0.25
$0.90
$1.15
Claude Haiku 4.5
$0.50
$1.50
$2.00
Claude Sonnet 4.6
$1.50
$4.50
$6.00
Claude Opus 4.8
$2.50
$7.50
$10.00
Output-heavy use cases (reports, documentation, code generation) should prioritize low output-cost models.
Context Window Value
Gemini 2.5 Flash / Pro
1M tokens
Claude Sonnet 4.6
1M tokens
Most others
128k–400k tokens
Mistral Codestral
32k tokens
When it matters: Document analysis, long conversations, comprehensive research, multi-file code review.
Pro tip: A 1M context window can hold 750,000 words or 3,000 pages of text.
Provider Considerations
All Blockbrain models are EU-hosted, ensuring:
GDPR compliance – Data processed within EU boundaries
Data residency – Meets European regulatory requirements
Lower latency – For European customers
Best Practices for Cost Optimization
1. Prompt Engineering
Reduce output tokens by 30–50%
Either add this in the initial instructions of the bot, or prompt it directly:
Request concise responses: "Answer in 2–3 sentences" or use in the sendbox Options → Length: Short / Very Short
Use structured outputs: "Respond in bullet points"
Avoid redundancy: "Don't repeat the question"
Impact: Can reduce costs by 40%+ for output-heavy models.
2. Smart Model Routing
Simple (FAQ, definitions)
GPT 5.4 Mini
Standard (analysis, drafting)
Gemini 2.5 Flash
Complex (strategic, critical)
Claude Sonnet 4.6 / Opus 4.8
Impact: 50–70% cost reduction vs. using premium models for everything.
3. Caching & Reuse
Cache common prompts (Prompt Library)
Reuse context where possible (e.g. via Insights)
Implement RAG (Retrieval-Augmented Generation) via the database to reduce context size
Impact: 20–30% reduction in input token costs.
Model Comparison Table (Top Recommendations)
Gemini 3.5 Flash
4.6
4.6
3.7
$1.5
$9
Gemini 2.5 Flash
3.2
4.8
4.6
$0.50
$3.00
All-around default
GPT 5.4 Mini
4.3
4.5
4.2
$0.40
$1.60
Budget-conscious
GPT 4o Mini
2.3
5.0
5.0
$0.15
$0.60
Maximum savings
Claude Haiku 4.5
3.6
3.6
4.0
$1.00
$5.00
Quality on budget
GPT 5.3 Codex
4.4
4.2
3.5
$1.75
$14.00
Code development
Mistral Codestral
3.4
3.9
5.0
$0.30
$0.90
Code (budget)
Claude Sonnet 4.6
4.4
3.0
3.3
$3.00
$15.00
Creative / writing
Claude Sonnet 4.6 Fast
3.8
5.0
3.7
$3.00
$15.00
Speed + quality
Gemini 2.5 Pro
3.6
4.1
3.7
$2.00
$12.00
Premium balanced
Claude Opus 4.8
4.9
4.1
3
$5.00
$25.00
Claude Opus 4.7
4.8
4.2
3
$5.00
$25.00
Claude Opus 4.6
4.5
2.8
3.0
$5.00
$25.00
Top-tier quality
GPT 5.5 Pro
4.9
1.2
1.8
$5.00
$30.00
Max quality / reasoning
o3
3.5
2.3
3.7
$2.00
$8.00
Complex reasoning
o4 Mini
3.4
3.7
4.1
$1.10
$4.40
Reasoning value
Conclusion
The Blockbrain model portfolio offers excellent options for every use case and budget.
For most companies, we recommend:
Start with Gemini 2.5 Flash as your default model (e.g. in your Company GPT)
Add GPT 5.4 Mini for budget-conscious teams
Introduce specialist models (Gemini 3.5 Flash, GPT 5.3 Codex, Claude Sonnet 4.6)
Reserve premium models (Opus, GPT 5.5 Pro) for critical work only
This approach typically delivers:
60–75% cost savings vs. premium-only deployment
90%+ user satisfaction
Flexibility to scale and optimize over time
Last updated

