Merlin MechlerMERLIN MECHLER
Alle Artikel
3 Min Lesezeit

LLM-Vergleich: Das Framework für die richtige Modellwahl

Stefan öffnete die API-Rechnung: 47.000 EUR. In einem einzigen Monat. GPT-4o für alles — Klassifikation, E-Mail-Zusammenfassung, Code. Das 5-Dimensionen-Framework für systematische Modellauswahl, das seine Kosten auf 9.400 EUR reduzierte.

LLMProduktivitätKI-InfrastrukturMittelstandAutomatisierung

Der Markt hat sich fundamental verändert: Bei gleicher Leistung sinken die Preise für LLM-Inferenz laut a16z etwa um den Faktor 10 pro Jahr. Context Windows haben sich bei einer Million Tokens standardisiert. Reasoning-Modelle sind zum primären Differenzierungsfaktor geworden.

Die Modell-Landschaft 2026

Proprietary Frontier: GPT-4o/GPT-5 (Generalist, Reasoning, Microsoft-Ecosystem), Claude Opus 4.6/Sonnet 4.6 (Code, Architektur, Safety, 200K Context), Gemini 2.0 Flash/Pro (Multimodal, Speed, 1M Context), Llama 3.3 70B (Open Source, On-Prem).

Open-Source-Revolution: DeepSeek V3.2 (Reasoning auf GPT-5-Niveau, self-hostable), Mistral Large (EU-basiert, DSGVO-nativ, multilingual), Phi-4 (MATH-Benchmark besser als GPT-4o, MIT-Lizenz).

Für den Mittelstand zählen Parameter, DACH-Eignung und Kosten:

ModellParameterDACH-EignungKosten (API)
GPT-4o~200B+Mittel (US-Server)~2,50–10 USD/1M Tokens
Llama 3.3 70B70BHoch (On-Premise möglich)~0,23–0,90 USD/1M Tokens
Mistral 7B7BSehr hoch (EU-Firma, Open Source)~0,05–0,25 USD/1M Tokens
Phi-414BSehr hoch (lokal deploybar)~0,07–0,15 USD/1M Tokens

Mistral für den DACH-Raum: Französisches Unternehmen, Open Source, DSGVO-konform deploybar, überdurchschnittliche Sprachunterstützung für Deutsch.

Das 5-Dimensionen-Framework

Dimension 1: Task-Komplexität

LevelBeispiel-TasksModell-KlasseTypische Kosten
Level 1: KlassifikationSentiment, Spam-FilterSmall Model$0.15–0.60/1M Tokens
Level 2: Extraktion & ZusammenfassungDokument-ParsingMid-Tier$0.30–15/1M Tokens
Level 3: Generierung & AnalyseContent, CodeFrontier$3–30/1M Tokens
Level 4: Komplexes ReasoningMulti-Step-Planung, ArchitekturReasoning-Modell$15–75/1M Tokens

Die Faustregel: Die meisten Enterprise-Tasks fallen in Level 1–2. Genau dort liegt das größte Einsparpotenzial.

Dimension 2: Daten-Sensitivität & Compliance

  • Stufe A (Public Data) → Cloud-API möglich
  • Stufe B (Internal Data) → EU-hosted API oder Virtual Private Cloud
  • Stufe C (Regulated Data) → On-Premise oder EU-basierter Anbieter (Mistral, Self-hosted Llama)
  • Stufe D (Classified) → Air-gapped On-Premise, kein externer API-Zugriff

DACH-Compliance-Checkliste: DPA mit dem Anbieter, Datenverarbeitung in der EU, Art. 28 DSGVO dokumentiert, EU AI Act Risk-Level bestimmt, High-Risk-Dokumentation falls zutreffend, Betriebsrat beachtet, Fallback-Strategie und Exit-Plan definiert.

Dimension 3: Volumen & Latenz

  • < 1.000 Requests/Tag: Frontier-Modell via API
  • 1.000–100.000/Tag: Mid-Tier + Caching
  • > 100.000/Tag: Fine-tuned Small Model oder Self-hosted
  • Echtzeit (< 200ms): Gemini Flash oder Edge-Deployment

Dimension 4: Integrations-Anforderungen

Function Calling und Tool-Use: Die Genauigkeit schwankt je nach Szenario stark, bei Multi-Turn-Aufrufen liegt sie deutlich niedriger als bei einfachen Einzelaufrufen (Berkeley Function Calling Leaderboard). 37 % der von a16z befragten 100 Enterprise-CIOs nutzen bereits fünf oder mehr Modelle (a16z, 2025).

Dimension 5: Total Cost of Ownership (TCO)

Self-Hosting lohnt sich typischerweise ab 50.000+ Requests pro Tag mit Llama 3.3 70B auf dedizierter GPU-Infrastruktur. Darunter ist Cloud-API fast immer günstiger — wenn man DevOps-Kosten ehrlich einrechnet.

Die Hybrid-Strategie: Das 3-Tier-Modell

Tier 1 — Frontier API (15% der Tasks): Claude Opus oder GPT-5 für komplexes Reasoning, Architektur-Entscheidungen.

Tier 2 — Mid-Tier API (60% der Tasks): Claude Sonnet, GPT-4o oder Gemini Pro für Content-Generierung, Code, Analyse.

Tier 3 — Günstiges Modell (25% der Tasks): GPT-4o-mini, Gemini Flash oder Self-hosted Llama für Klassifikation und Batch-Processing.

Claude, GPT oder Open Source: Was für DACH-Unternehmen passt

Claude: Beste Code-Qualität, Constitutional AI, 200K Context. Kein EU-Rechenzentrum (Stand Q1 2026). Ideal für Code-Generierung, Architektur-Design, Compliance-Prüfung.

GPT-4o: Größtes Ecosystem, stärkstes Reasoning in ambiguösen Aufgaben, Azure-Hosting in Frankfurt. Teuerster Anbieter, Output-Qualität kann variieren. Ideal für Complex Reasoning, Microsoft-zentrische Unternehmen.

Gemini 2.0: 1M Token Context, Gemini Flash als schnellste Inferenz bei niedrigsten Kosten ($0.30/1M Output), Google Cloud Frankfurt. Weniger Code-Struktur als Claude. Ideal für Multimodale Analyse, High-Volume-Processing.

Open Source (Mistral-Empfehlung für DACH): EU-basiert (Paris), DSGVO-nativ, starke Multilingual-Performance. Mistral Large konkurriert mit Claude Sonnet bei deutlich geringerem Compliance-Aufwand.

Kleine Modelle: Wann Llama 3 GPT-4 schlägt

SLM gewinnt wenn:

  • Der Task eng definiert ist (Klassifikation, Extraktion, FAQ-Beantwortung)
  • Hohe Volumina anfallen (ab ~10.000 Anfragen/Tag)
  • Latenz kritisch ist (SLMs: 20–80ms vs. LLMs: 500–1.500ms)
  • Datenhoheit nicht verhandelbar ist (On-Premise deployment)
  • Konsistenz wichtiger ist als Kreativität

LLM gewinnt wenn:

  • Der Task offen und komplex ist (Multi-Step-Reasoning, kreative Texte)
  • Breites Weltwissen gebraucht wird
  • Wenige Daten für Fine-Tuning vorhanden sind
  • Anforderungen sich häufig ändern

Das Portfolio-Modell: Der intelligente Router

Anfrage rein
    |
[Komplexitäts-Classifier]
    |
    +-- Einfach → SLM (Fine-tuned)         ~0,10 EUR/1000
    |
    +-- Mittel → Llama 3.3 70B             ~0,50 EUR/1000
    |
    +-- Komplex → GPT-4o / Claude 3.5      ~5,00 EUR/1000

Ergebnis: Der Großteil der Anfragen landet beim SLM, nur ein kleiner Teil beim LLM. In den RouteLLM-Benchmarks sanken die Kosten je nach Benchmark um 35 bis über 85 %, bei 95 % der GPT-4-Qualität.

Weiterlesen

Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.

Nächster Schritt

Welche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?

Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.

5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung