Merlin MechlerMERLIN MECHLER
Alle Artikel
8 Min Lesezeit

Token-Optimierung: Wie du LLM-Kosten um 40% senkst

LLM-Token sind die Währung der KI-Ära — und viele Teams verschwenden einen großen Teil ihres Token-Budgets durch vermeidbare Ineffizienzen. Dieser Artikel zeigt sechs bewährte Strategien mit denen du deine API-Kosten deutlich senkst: Prompt Engineering, Caching, Batching, Model Routing, Compression und Token Budgets.

LLMTokenKostenOptimierungPrompt Engineering

Ende Januar kommt die Rechnung: $47.000 für LLM-API-Calls. Dein CFO ruft an. "Wir geben mehr für KI-Tokens aus als für unser gesamtes Cloud-Hosting. Ist das normal?"

Die ehrliche Antwort: Ja, es ist normal. Und nein, es muss nicht so sein.

Das Team hatte in drei Monaten eine RAG-Pipeline, einen Sales-Chatbot und ein Reporting-Tool gebaut. Alles lief über GPT-4o. Jeder Call schickte den vollen System Prompt, zehn RAG-Chunks und den gesamten Konversationsverlauf mit. Niemand hatte max_tokens gesetzt. Niemand hatte sich gefragt, ob ein $0.15-Modell die gleiche Klassifikation genauso gut erledigen kann wie ein $2.50-Modell.

Angenommen, nach vier Wochen gezielter Optimierung liegt die Rechnung bei $12.700 pro Monat, mit gleichen Features und gleicher Qualität: Das sind 73 % weniger Kosten.

Das Token-Problem: Warum LLM-Kosten explodieren

LLM-APIs rechnen pro Token ab. Ein Token entspricht ca. 4 Zeichen oder ¾ eines englischen Wortes. Das klingt harmlos — bis du die Zahlen hochrechnest.

Drei Kostentreiber, die fast jedes Team unterschätzt: Erstens kosten Output-Tokens bei den großen Anbietern typischerweise 4- bis 6-mal so viel wie Input-Tokens (Anthropic, OpenAI). Ein Modell, das dir drei Absätze liefert wenn ein Satz gereicht hätte, ist ein Kostenmultiplikator. Zweitens multiplizieren Agentic Workflows alles — wenn dein Agent für eine User-Anfrage 10–30 LLM-Calls orchestriert, wird aus einem $0.01-Request schnell ein $0.30-Request. Drittens verführen große Context Windows: 128K Tokens? Verlockend, alles reinzupacken. Aber du zahlst für jedes Token, auch für die Teile, die das Modell ignoriert.

Die Token-Kosten-Landschaft 2026

Die Wahl des Modells ist bereits die erste Optimierung. GPT-4o kostet $2.50/$10.00 per 1M Input/Output-Tokens, GPT-4o mini nur $0.15/$0.60. Claude 3.5 Haiku liegt bei $0.80/$4.00. DeepSeek V3 bei $0.27/$1.10.

Kerninsight: Gecachte Tokens kosten bei Anthropic für die meisten Modelle nur 10 % des normalen Input-Preises (Anthropic; Beispiel Claude 3.5 Sonnet 2024: $0.30/1M gecacht vs. $3.00/1M normal). Das erste Schreiben in den Cache kostet einen Aufschlag. Das ist kein Rundungsfehler — das ist der größte einzelne Kostenhebel, den die meisten Teams nicht nutzen.

Die 6 Optimierungs-Strategien im Detail

Strategie 1: Prompt Engineering — Weniger Tokens, gleiche Qualität

Einsparung: weniger Input-Tokens durch systematische Prompt-Kompression. Die meisten Prompts lesen sich wie eine höfliche E-Mail an den Chef: viel Kontext, viele Floskeln, dreimal dasselbe anders formuliert. LLMs brauchen das nicht. Sie brauchen Präzision.

Prompt Compression ist das Low-Hanging Fruit: weniger Tokens durch Eliminierung von Redundanz — nicht durch Weglassen von Information. Structured Output statt Freitext spart bei den teuersten Output-Tokens: Sage dem Modell, es soll in JSON antworten statt in Prosa. System Prompt Engineering lohnt sich besonders, weil dein System Prompt bei jedem einzelnen Request mitgeschickt wird.

Strategie 2: Prompt Caching — Der größte Einzelhebel

Einsparung: bis zu 90 % auf gecachte, wiederkehrende Prompt-Prefixe (Anthropic).

Stell dir vor, du gehst jeden Morgen in dasselbe Café und bestellst denselben Kaffee. Aber statt dich zu erkennen, fragt der Barista jedes Mal nach deinem Namen, deiner Bestellung, deinen Allergien. Genau so arbeiten die meisten LLM-Systeme: Bei jedem Request wird der komplette Kontext neu verarbeitet — auch wenn fast alles identisch ist.

Der Schlüssel zur hohen Cache-Hit-Rate: Strukturiere Prompts so, dass der statische Teil immer am Anfang steht und der variable Teil immer am Ende. Klingt trivial — aber die meisten Codebases mischen beides wild durcheinander.

Semantic Caching geht noch weiter: Es speichert die vollständige Response und liefert sie bei ähnlichen (nicht identischen) Queries aus — ganz ohne LLM-Call. Der optimale Similarity Threshold: 0.85. Darunter zu viele falsche Matches, darüber trifft der Cache kaum.

Semantic Caching

Standard-Caching mit exaktem String-Match trifft nur, wenn ein Prompt Zeichen für Zeichen wiederkehrt. Selbst minimale Variationen im Prompt erzeugen Cache Misses: "Was sind die Vorteile von RAG?" und "Welche Vorteile hat RAG?" sind semantisch identisch, erzeugen beim exakten Match aber zwei separate LLM-Calls.

So funktioniert Semantic Caching:

  1. Der eingehende Prompt wird durch ein Embedding-Modell geschickt (z.B. text-embedding-3-small).
  2. Vector Search im Cache: Gibt es einen gespeicherten Prompt mit Cosine Similarity über dem Threshold?
  3. Hit: gecachte Antwort zurückgeben, 0 LLM-Tokens verbraucht.
  4. Miss: LLM-Call ausführen, Ergebnis plus Embedding im Cache speichern.

Semantic Caching lohnt sich bei Kundensupport-Bots mit vielen ähnlichen Fragen, bei FAQ-Systemen und internen Wissens-Chatbots sowie bei Klassifikations-Tasks (Sentiment, Kategorisierung). Nicht lohnend ist es bei kreativer Content-Generierung, bei der jede Antwort einzigartig sein soll, und bei Echtzeit-Datenabfragen wie Kursen, Wetter oder Live-Daten.

Prefix Caching und KV-Cache

Wenn 100 Requests den gleichen System-Prompt haben (z.B. 1.000 Tokens), wird der KV-Cache für diese 1.000 Tokens nur einmal berechnet. Speedup: 6x bei der Latenz, proportionale GPU-Kostenreduktion.

ROI-Rechnung Anthropic Prompt Caching: Bei einem 2.000-Token-System-Prompt und 10.000 Calls pro Tag sparst du rund 48 USD pro Tag, also rund 1.450 EUR pro Monat.

Plattform-Support:

  • vLLM: automatisches Prefix Caching (seit v0.4)
  • OpenAI API: automatisches Prefix Caching für Prompts ab 1.024 Tokens, mit Rabatt auf gecachte Tokens je nach Modell (OpenAI)
  • Anthropic: Prompt Caching (bei den meisten Modellen 90 % Rabatt beim Lesen aus dem Cache, Anthropic)

Strategie 3: Batch Processing — 50% Rabatt von der API

Einsparung: 50% auf API-Kosten durch asynchrone Batch-Verarbeitung.

Nicht jeder LLM-Call muss in Echtzeit passieren. Dein nächtliches Lead-Scoring? Dein wöchentlicher Content-Tagging-Lauf? Deine Evaluation-Suite? All das kann warten — und wenn es wartet, zahlst du die Hälfte. OpenAI, Anthropic und Google bieten alle 50 % Rabatt für Batch-Requests; die Verarbeitung läuft innerhalb von bis zu 24 Stunden, ohne formales SLA.

Prompt Packing

Die mächtigste Batch-Technik: mehrere unabhängige Tasks in einem einzigen LLM-Call bündeln.

Vorher: 5 Calls × rund 500 Tokens = 2.500 Tokens, jeder Call lädt denselben System-Prompt mit. Nachher: 1 Call × rund 1.200 Tokens. Der System-Prompt (typischerweise 300–800 Tokens) wird nur einmal gezählt statt fünfmal.

Best Practice: Starte mit 5er-Batches, miss die Qualität und skaliere auf 10–15, wenn die Accuracy stabil bleibt. In der Originalstudie zu Batch Prompting sanken Token- und Zeitkosten mit sechs Aufgaben pro Call auf bis zu ein Fünftel (Cheng et al., 2023).

Strategie 4: Model Routing — Das richtige Modell für den richtigen Task

Einsparung: in den RouteLLM-Benchmarks 35 bis über 85 % bei 95 % der GPT-4-Qualität, durch Routing einfacher Aufgaben an günstigere Modelle.

Viele deiner LLM-Calls brauchen kein GPT-4o. Sentiment-Klassifikation, Daten-Extraktion aus strukturierten Texten, Formatierung — das kann oft auch ein Modell, das rund 17-mal günstiger ist (GPT-4o mini gegenüber GPT-4o laut OpenAI-Preisliste 2024).

Routing-Logik als Rechenbeispiel mit Input-Preisen pro 1M Tokens: Einfache Tasks (70 %) → GPT-4o mini ($0.15), mittlere Tasks (20 %) → GPT-4o ($2.50), komplexe Tasks (10 %) → Claude Opus 4.1 ($15.00). Im Mittel kostet das $2.11 pro 1M Input-Tokens: rund 86 % weniger als alles über Claude Opus 4.1 und rund 16 % weniger als alles über GPT-4o.

Strategie 5: Context Compression — Mehr Relevanz, weniger Tokens

Einsparung: weniger Kontext-Tokens durch intelligente Kompression.

RAG-Chunk-Optimierung ist der größte Hebel: Von Top-10 Chunks × 500 Tokens = 5.000 Tokens auf Top-3 Chunks × 300 Tokens = 900 Tokens. 82 % weniger Tokens (Rechnung) — der Schlüssel ist bessere Retrieval-Qualität (Re-Ranking), nicht mehr Quantität.

Conversation Summarization für lange Chat-Sessions: Ab einem Schwellwert den bisherigen Verlauf zusammenfassen statt komplett mitzuschicken. Tool-Output-Filtering für Agentic Workflows: Filtere vor dem LLM-Call, nicht danach — oft reichen 50 statt 2.000 Tokens.

Vier Compression-Techniken

Technik 1: Selective Context Compression (LLMLingua). Ein kleines Sprachmodell bewertet, welche Tokens im Prompt semantisch relevant sind, und entfernt redundante Tokens. Laut Originalpaper ist bis zu 20-fache Kompression mit geringem Leistungsverlust möglich (Jiang et al., 2023); den Qualitätsverlust für deinen Task musst du selbst messen.

Technik 2: Structured Output Forcing. Statt freie Textantworten zu generieren, erzwinge JSON- oder Schema-Output. Das reduziert Output-Tokens deutlich, im Beispiel um 80 %: rund 150 Output-Tokens für eine unstrukturierte Churn-Analyse gegenüber rund 30 Tokens als JSON bei gleichem Informationsgehalt.

Technik 3: Context Windowing mit Relevanz-Scoring. Bei RAG-Pipelines: Statt alle 10 Retrieved Chunks zu nutzen, bewerte die Relevanz und nimm nur die Top-3 mit Reranker. Ergebnis: deutlich weniger Tokens.

Technik 4: System Prompt Optimization. System Prompts wachsen unkontrolliert. Systematische Optimierung (Audit, Deduplizierung, Kondensierung, Versionierung) spart System-Prompt-Tokens bei jedem einzelnen Request.

Strategie 6: Token Budgets — Governance auf Token-Ebene

Wirkung: Kostenkontrolle durch systematisches Budget-Management.

Ohne Token-Budgets ist LLM-Nutzung wie eine Kreditkarte ohne Limit. Governance-Maßnahmen die sofort wirken: max_tokens pro Call setzen, Token-Alerts bei >20% Abweichung vom Durchschnitt, Dashboard für Token-Verbrauch pro Feature/Team/Endpoint, monatliche Token-Audits.

Der Multiplikator-Effekt

Die Strategien wirken multiplikativ, nicht additiv. Rechenbeispiel mit angenommenen Einsparungen je Schritt, von $10.000/Monat Ausgangsbasis: Prompt Engineering (-30%) → $7.000, Prompt Caching (-60%) → $2.800, Model Routing (-50%) → $1.400, Context Compression (-40%) → $840, Batch Processing (-30%) → $588, Token Budgets (-15%) → $500.

Ein zweites Rechenbeispiel als Stacking: Baseline 100%, nach Multi-Model-Routing 50%, nach Semantic Caching mit 40% Hit Rate 30%, nach Prompt Packing für Backend-Jobs 22%, nach Prompt Compression (2x) 16%, nach Prefix- und KV-Cache 12%. Von 100% auf 12% ist eine Kostenreduktion um 88%: Bei 15.000 EUR/Monat Baseline bleiben rund 1.800 EUR/Monat.

Anti-Patterns: Was du vermeiden solltest

Blindes Downgrading ohne Qualitätsmessung führt zu Kundenbeschwerden und Rückwechsel — Netto-Einsparung null. Over-Caching mit zu niedrigem Similarity Threshold (< 0.80) liefert falsche Antworten. Kontext-Starvation durch zu aggressive Kompression macht Antworten vage. Output-Token-Blindheit ist der häufigste Fehler: Du optimierst stundenlang den Input und ignorierst, dass das Modell 500-Wort-Antworten generiert wo 50 Wörter reichten. Und: Einmalige Optimierung reicht nicht — Token-Preise und Modelle ändern sich alle 3–6 Monate.

Monitoring: Optimierung als Dauerbetrieb

Fünf Metriken musst du dauerhaft tracken:

  • Cost per Call je Modell: abnehmend über die Zeit, zeigt die Routing-Effektivität.
  • Cache Hit Rate: über 30% bei Semantic Caching, unter 20% heißt Threshold anpassen.
  • Token Efficiency (Output/Input): über 0.3, niedriger heißt Prompt zu lang.
  • Quality Score aus Stichproben: über 95%, damit die Optimierung der Qualität nicht schadet.
  • P95 Latency: unter 3 Sekunden, die User Experience nicht opfern.

Implementierungs-Roadmap

Phase 1 (Woche 1–2, Quick Wins): max_tokens auf allen Calls setzen, Prompt-Audit der Top-10 teuersten Calls, Structured Output für Extraction/Classification, Token-Monitoring einrichten.

Phase 2 (Woche 2–4): Prompt-Struktur optimieren (statische Teile voran), Provider-natives Prompt Caching aktivieren, Model Routing einführen, Batch Processing für Offline-Pipelines.

Phase 3 (Woche 4–8): Semantic Caching evaluieren, RAG-Pipeline mit Re-Ranking optimieren, Conversation Summarization, Token-Budget-Framework pro Endpoint.

Fazit

Token-Optimierung ist kein einmaliges Projekt, sondern ein kontinuierlicher Engineering-Prozess. Die Modelle werden günstiger, aber die Nutzung wächst schneller. Wer jetzt die Infrastruktur für Caching, Routing und Monitoring aufbaut, hat einen strukturellen Kostenvorteil. In beiden Rechenbeispielen kommt der größte Teil der Einsparung aus Caching und Routing. Starte dort.

Weiterlesen

Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.

Nächster Schritt

Welche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?

Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.

5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung