LLM-Vergleich: Das Framework für die richtige Modellwahl
Stefan öffnete die API-Rechnung: 47.000 EUR. In einem einzigen Monat. GPT-4o für alles — Klassifikation, E-Mail-Zusammenfassung, Code. Das 5-Dimensionen-Framework für systematische Modellauswahl, das seine Kosten auf 9.400 EUR reduzierte.
Der Markt hat sich fundamental verändert: Bei gleicher Leistung sinken die Preise für LLM-Inferenz laut a16z etwa um den Faktor 10 pro Jahr. Context Windows haben sich bei einer Million Tokens standardisiert. Reasoning-Modelle sind zum primären Differenzierungsfaktor geworden.
Die Modell-Landschaft 2026
Proprietary Frontier: GPT-4o/GPT-5 (Generalist, Reasoning, Microsoft-Ecosystem), Claude Opus 4.6/Sonnet 4.6 (Code, Architektur, Safety, 200K Context), Gemini 2.0 Flash/Pro (Multimodal, Speed, 1M Context), Llama 3.3 70B (Open Source, On-Prem).
Open-Source-Revolution: DeepSeek V3.2 (Reasoning auf GPT-5-Niveau, self-hostable), Mistral Large (EU-basiert, DSGVO-nativ, multilingual), Phi-4 (MATH-Benchmark besser als GPT-4o, MIT-Lizenz).
Für den Mittelstand zählen Parameter, DACH-Eignung und Kosten:
| Modell | Parameter | DACH-Eignung | Kosten (API) |
|---|---|---|---|
| GPT-4o | ~200B+ | Mittel (US-Server) | ~2,50–10 USD/1M Tokens |
| Llama 3.3 70B | 70B | Hoch (On-Premise möglich) | ~0,23–0,90 USD/1M Tokens |
| Mistral 7B | 7B | Sehr hoch (EU-Firma, Open Source) | ~0,05–0,25 USD/1M Tokens |
| Phi-4 | 14B | Sehr hoch (lokal deploybar) | ~0,07–0,15 USD/1M Tokens |
Mistral für den DACH-Raum: Französisches Unternehmen, Open Source, DSGVO-konform deploybar, überdurchschnittliche Sprachunterstützung für Deutsch.
Das 5-Dimensionen-Framework
Dimension 1: Task-Komplexität
| Level | Beispiel-Tasks | Modell-Klasse | Typische Kosten |
|---|---|---|---|
| Level 1: Klassifikation | Sentiment, Spam-Filter | Small Model | $0.15–0.60/1M Tokens |
| Level 2: Extraktion & Zusammenfassung | Dokument-Parsing | Mid-Tier | $0.30–15/1M Tokens |
| Level 3: Generierung & Analyse | Content, Code | Frontier | $3–30/1M Tokens |
| Level 4: Komplexes Reasoning | Multi-Step-Planung, Architektur | Reasoning-Modell | $15–75/1M Tokens |
Die Faustregel: Die meisten Enterprise-Tasks fallen in Level 1–2. Genau dort liegt das größte Einsparpotenzial.
Dimension 2: Daten-Sensitivität & Compliance
- Stufe A (Public Data) → Cloud-API möglich
- Stufe B (Internal Data) → EU-hosted API oder Virtual Private Cloud
- Stufe C (Regulated Data) → On-Premise oder EU-basierter Anbieter (Mistral, Self-hosted Llama)
- Stufe D (Classified) → Air-gapped On-Premise, kein externer API-Zugriff
DACH-Compliance-Checkliste: DPA mit dem Anbieter, Datenverarbeitung in der EU, Art. 28 DSGVO dokumentiert, EU AI Act Risk-Level bestimmt, High-Risk-Dokumentation falls zutreffend, Betriebsrat beachtet, Fallback-Strategie und Exit-Plan definiert.
Dimension 3: Volumen & Latenz
- < 1.000 Requests/Tag: Frontier-Modell via API
- 1.000–100.000/Tag: Mid-Tier + Caching
- > 100.000/Tag: Fine-tuned Small Model oder Self-hosted
- Echtzeit (< 200ms): Gemini Flash oder Edge-Deployment
Dimension 4: Integrations-Anforderungen
Function Calling und Tool-Use: Die Genauigkeit schwankt je nach Szenario stark, bei Multi-Turn-Aufrufen liegt sie deutlich niedriger als bei einfachen Einzelaufrufen (Berkeley Function Calling Leaderboard). 37 % der von a16z befragten 100 Enterprise-CIOs nutzen bereits fünf oder mehr Modelle (a16z, 2025).
Dimension 5: Total Cost of Ownership (TCO)
Self-Hosting lohnt sich typischerweise ab 50.000+ Requests pro Tag mit Llama 3.3 70B auf dedizierter GPU-Infrastruktur. Darunter ist Cloud-API fast immer günstiger — wenn man DevOps-Kosten ehrlich einrechnet.
Die Hybrid-Strategie: Das 3-Tier-Modell
Tier 1 — Frontier API (15% der Tasks): Claude Opus oder GPT-5 für komplexes Reasoning, Architektur-Entscheidungen.
Tier 2 — Mid-Tier API (60% der Tasks): Claude Sonnet, GPT-4o oder Gemini Pro für Content-Generierung, Code, Analyse.
Tier 3 — Günstiges Modell (25% der Tasks): GPT-4o-mini, Gemini Flash oder Self-hosted Llama für Klassifikation und Batch-Processing.
Claude, GPT oder Open Source: Was für DACH-Unternehmen passt
Claude: Beste Code-Qualität, Constitutional AI, 200K Context. Kein EU-Rechenzentrum (Stand Q1 2026). Ideal für Code-Generierung, Architektur-Design, Compliance-Prüfung.
GPT-4o: Größtes Ecosystem, stärkstes Reasoning in ambiguösen Aufgaben, Azure-Hosting in Frankfurt. Teuerster Anbieter, Output-Qualität kann variieren. Ideal für Complex Reasoning, Microsoft-zentrische Unternehmen.
Gemini 2.0: 1M Token Context, Gemini Flash als schnellste Inferenz bei niedrigsten Kosten ($0.30/1M Output), Google Cloud Frankfurt. Weniger Code-Struktur als Claude. Ideal für Multimodale Analyse, High-Volume-Processing.
Open Source (Mistral-Empfehlung für DACH): EU-basiert (Paris), DSGVO-nativ, starke Multilingual-Performance. Mistral Large konkurriert mit Claude Sonnet bei deutlich geringerem Compliance-Aufwand.
Kleine Modelle: Wann Llama 3 GPT-4 schlägt
SLM gewinnt wenn:
- Der Task eng definiert ist (Klassifikation, Extraktion, FAQ-Beantwortung)
- Hohe Volumina anfallen (ab ~10.000 Anfragen/Tag)
- Latenz kritisch ist (SLMs: 20–80ms vs. LLMs: 500–1.500ms)
- Datenhoheit nicht verhandelbar ist (On-Premise deployment)
- Konsistenz wichtiger ist als Kreativität
LLM gewinnt wenn:
- Der Task offen und komplex ist (Multi-Step-Reasoning, kreative Texte)
- Breites Weltwissen gebraucht wird
- Wenige Daten für Fine-Tuning vorhanden sind
- Anforderungen sich häufig ändern
Das Portfolio-Modell: Der intelligente Router
Anfrage rein
|
[Komplexitäts-Classifier]
|
+-- Einfach → SLM (Fine-tuned) ~0,10 EUR/1000
|
+-- Mittel → Llama 3.3 70B ~0,50 EUR/1000
|
+-- Komplex → GPT-4o / Claude 3.5 ~5,00 EUR/1000Ergebnis: Der Großteil der Anfragen landet beim SLM, nur ein kleiner Teil beim LLM. In den RouteLLM-Benchmarks sanken die Kosten je nach Benchmark um 35 bis über 85 %, bei 95 % der GPT-4-Qualität.
Weiterlesen
Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.
- KI für Unternehmen: Der Guide für den MittelstandGrundlagen
- LLM-Architektur für den Mittelstand: Der komplette Guide 2026Überblick
- Token-Optimierung: Wie du LLM-Kosten um 40% senkstVertiefung
- Enterprise LLM-Architektur: Wie man strukturierte Daten zuverlässig aus unstrukturierten Texten extrahiertVertiefung
- Prompt Engineering für Unternehmen: System Prompts, Chain-of-Thought und TestingVertiefung
Verwandte Artikel
KI-Automatisierung vs. RPA: Wann welche Lösung passt
4 Min LesezeitEnterprise LLM-Architektur: Wie man strukturierte Daten zuverlässig aus unstrukturierten Texten extrahiert
4 Min LesezeitWorkflow Design für KI-Systeme — Best Practices für den Mittelstand
3 Min LesezeitTechnical Debt in KI-Automation-Stacks — Schulden erkennen & abbezahlen
3 Min LesezeitWelche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?
Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.
5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung