Merlin MechlerMERLIN MECHLER
Alle Artikel
9 Min Lesezeit

Multi-Agent-Systeme im Mittelstand: Patterns, Frameworks und Fallstricke

CrewAI vs LangGraph vs AutoGen im direkten Vergleich. 5 Orchestrierungs-Patterns, Structured Handoff Protocols, Fehlerbehandlung und DSGVO-Compliance für Multi-Agent-Systeme im DACH-Mittelstand.

Agentic WorkflowsAutomatisierungEnterprise LLMMittelstand

Ein einzelner LLM-Agent löst eine Aufgabe. Mehrere Agenten lösen komplexe Geschäftsprozesse. Der Unterschied: Ein Agent beantwortet eine Frage. Ein Multi-Agent-System führt einen gesamten Workflow autonom aus — von der Datenrecherche über die Analyse bis zur Entscheidungsvorlage.

Das Problem: Die meisten Multi-Agent-Implementierungen im Mittelstand scheitern nicht an der Technologie, sondern an der Orchestrierung.



Grundlagen: Agent und Multi-Agent-System

Was ein LLM-Agent ist

Ein LLM-Agent besteht aus drei Kernkomponenten:

  1. LLM als "Gehirn": Ein Sprachmodell (GPT-4, Claude, Llama) das Kontext versteht, plant und Entscheidungen trifft
  2. Tools als "Hände": Zugriff auf externe Systeme — APIs, Datenbanken, Dateien, andere Services
  3. Memory als "Gedächtnis": Kontext über einzelne Interaktionen hinaus — was wurde besprochen, was wurde bereits erledigt, welche Präferenzen hat der Nutzer

Ein einzelner Agent kann bereits mächtig sein: Ein Sales-Agent, der Leads recherchiert, CRM-Daten abfragt und personalisierte E-Mails formuliert. Oder ein Code-Review-Agent, der Pull Requests liest, Fehler identifiziert und Verbesserungsvorschläge schreibt.

Was ein Multi-Agent-System ist

Wenn ein einzelner Agent nicht reicht — weil der Prozess zu komplex ist oder unterschiedliche Expertisen erfordert — kommen Multi-Agent Systems ins Spiel.

Stell dir ein Team vor:

  • Recherche-Agent: Sammelt Informationen aus verschiedenen Quellen
  • Analyse-Agent: Bewertet und strukturiert die gesammelten Daten
  • Schreib-Agent: Formuliert den finalen Output
  • Quality-Agent: Prüft das Ergebnis auf Fehler und Konsistenz

Jeder Agent hat seine Stärke, seine eigenen Tools und seinen eigenen Kontext. Ein Orchestrator koordiniert, wer wann dran ist.


1. Wann Multi-Agent — und wann nicht

Wann ein einzelner Agent reicht

  • Einfache Q&A über eine Wissensdatenbank
  • Datenextraktion aus strukturierten Dokumenten
  • Klassifikations-Tasks (Sentiment, Kategorisierung)
  • Einfache Workflows mit linearem Ablauf

Agent oder Chatbot?

SituationChatbot reichtAgent nötig
Einfache Frage-AntwortJaNein
Mehrstufiger ProzessNeinJa
Externe Daten nötigNeinJa
Ergebnis muss geprüft werdenNeinJa
Wiederkehrende AufgabeNeinJa

Faustregel: Wenn du heute mehr als 3 Klicks oder Tabs brauchst, um eine Aufgabe zu erledigen, ist sie ein Agent-Kandidat.

Wann Multi-Agent notwendig wird

KriteriumSingle AgentMulti-Agent
Aufgabenkomplexität1–3 Schritte5+ Schritte mit Verzweigungen
SpezialisierungGeneralist reichtUnterschiedliche Expertise nötig
ParallelisierungSequenziell OKTeilaufgaben parallel möglich
Context WindowAlles passt reinZu viel Kontext für einen Agent

Faustregel: Wenn dein System Prompt über 2.000 Tokens wächst und der Agent trotzdem Schritte vergisst — dann ist es Zeit für Multi-Agent.


2. Die 5 Orchestrierungs-Patterns

Pattern 1: Sequential Pipeline

Agenten arbeiten nacheinander: [Researcher] → [Analyst] → [Writer] → [Reviewer]

Einsatz: Content-Erstellung, Datenverarbeitung, Report-Generierung

Vorteil: Einfach zu debuggen, klare Verantwortlichkeiten

Nachteil: Langsam (keine Parallelisierung), ein Fehler blockiert alles

Pattern 2: Parallel Fan-Out / Fan-In

Coordinator verteilt Teilaufgaben parallel an Agenten, Synthesizer fasst zusammen.

Einsatz: Research-Tasks, Multi-Source-Analyse, Due Diligence

Vorteil: Schnell (parallel), skaliert mit Teilaufgaben

Pattern 3: Hierarchical Delegation

Manager-Agent delegiert an Spezialisten und entscheidet basierend auf deren Output.

Einsatz: Komplexe Entscheidungsprozesse, IT-Helpdesk, automatisierte Analyse

Vorteil: Flexibel, Manager kann dynamisch entscheiden welchen Agenten er braucht

Pattern 4: Debate / Adversarial

Zwei oder mehr Agenten argumentieren aus verschiedenen Perspektiven. Ein Judge-Agent entscheidet.

Einsatz: Risikoanalyse, Vertragsprüfung, strategische Entscheidungen

Vorteil: Höhere Qualität durch adversariale Prüfung

Nachteil: Teuer (3× LLM-Calls minimum), langsam

Pattern 5: Autonomous Swarm

Agenten agieren selbstständig, kommunizieren über einen Shared State.

Einsatz: Monitoring-Systeme, Event-Driven-Workflows

Vorteil: Hochflexibel, skaliert dynamisch

Nachteil: Schwer zu debuggen, erfordert robuste Guardrails

Pattern-Auswahl nach Use Case

Use CaseEmpfohlenes Pattern
Report-GenerierungSequential Pipeline
Markt-ResearchParallel Fan-Out
IT-Helpdesk L2/L3Hierarchical Delegation
VertragsprüfungDebate / Adversarial
Echtzeit-MonitoringAutonomous Swarm

Delegation über Ziele statt Prozeduren

Das Anti-Pattern ist prozedurales Mikromanagement: "Schritt 1: Suche nach AI-Regulierung 2024. Schritt 2: Lies die ersten drei Treffer." Der Subagent führt aus und passt nichts an.

Besser: Ziel und Qualitätskriterien vorgeben, die Strategie dem Agenten überlassen.

GOAL: Comprehensive coverage of recent AI regulatory developments

QUALITY CRITERIA:
- Recency: Prioritize sources from the last 6 months
- Coverage: Include EU, US, and APAC perspectives
- Depth: Focus on policy implications

You determine the search strategy. Adapt based on what you find.

Der Effekt: Findet der Subagent eine primäre Policy-Quelle, geht er dort tiefer. Adaptiv statt rigide.

3. Framework-Vergleich: CrewAI vs LangGraph vs AutoGen

CrewAI: Das Team-Metapher-Framework

Konzept: Agenten sind "Crew Members" mit definierten Rollen, Zielen und Backstories.

Stärken: Intuitive API, eingebaute Delegation, gute Defaults, aktive Community.

Schwächen: Weniger Kontrolle über den Execution Flow, keine native State Machine.

Ideal für: Teams, die schnell starten wollen. Sequential und einfache hierarchische Workflows.

LangGraph: Die State-Machine für Agenten

Konzept: Agenten als Nodes in einem gerichteten Graphen. Volle Kontrolle über den Execution Flow.

Stärken: Explizite State Machine, Cycles und Loops nativ, Checkpointing und Human-in-the-Loop eingebaut, Debugging durch Graph-Visualisierung.

Schwächen: Steilere Lernkurve, mehr Boilerplate.

Ideal für: Komplexe Workflows mit Bedingungen, Loops und Compliance-Anforderungen.

AutoGen: Das Conversation-Framework

Konzept: Agenten kommunizieren über Nachrichten (Chat-Paradigma).

Stärken: Natürliches Konversations-Paradigma, Code-Execution eingebaut, gute Azure-Integration.

Schwächen: Weniger deterministisch, Debugging bei langen Konversationen schwierig.

Ideal für: Explorative Tasks, Code-Generation mit Ausführung.

KriteriumCrewAILangGraphAutoGen
LernkurveFlachSteilMittel
Flow-KontrolleMittelSehr hochNiedrig
DebuggingMittelSehr gutSchwierig
Production-ReadinessMittelHochMittel
Loops/CyclesBegrenztNativChat-basiert
Human-in-the-LoopPluginEingebautEingebaut

Empfehlung für den Mittelstand:

  • Einstieg/PoC: CrewAI (schnellster Start)
  • Production: LangGraph (volle Kontrolle, Checkpointing)
  • Microsoft-Stack: AutoGen (Azure-Integration)

4. Kommunikationsprotokolle zwischen Agenten

Das zentrale Problem

Agenten kommunizieren über natürliche Sprache. Das erzeugt:

  1. Informationsverlust: Agent B ignoriert relevante Details aus Agent A's Output
  2. Halluzinierte Übergaben: Agent B erfindet Informationen, die Agent A nie geliefert hat
  3. Format-Mismatch: Agent A liefert Prosa, Agent B erwartet JSON

Lösung: Structured Handoff Protocol

Definiere für jede Agent-zu-Agent-Übergabe ein Pydantic-Schema mit Pflichtfeldern (query, sources_found, key_findings, confidence, data_gaps). Das erzwingt strukturierte Kommunikation, verhindert Informationsverlust und macht Debugging trivial.

Format Conversion Layer

Agent A liefert Prosa, Agent B erwartet JSON: Bei jeder Übergabe geht Format verloren. Ein Format Conversion Layer bringt alle Subagent-Outputs in eine gemeinsame Zwischenrepräsentation:

class IntermediateRepresentation:
    claim: str        # die Aussage
    evidence: str     # Begründung
    source: str       # Herkunft
    confidence: float

Dazu gehört eine Zitierregel im Synthesis-Prompt: Jede Aussage nennt ihre Quelle, zum Beispiel "[Claim] (Source: [source_field])". Sonst verschwinden die Herkunftsangaben in der Zusammenfassung.

Message Bus vs Direct Handoff

AnsatzVorteileNachteileEinsatz
Direct HandoffEinfach, schnellTight Coupling2–3 Agenten
Message Queue (Redis/RabbitMQ)Entkoppelt, skalierbarInfrastruktur-Overhead4+ Agenten
Shared State (Blackboard)FlexibelConsistency-ProblemeSwarm-Patterns

5. Fehlerbehandlung — Wo Multi-Agent-Systeme wirklich scheitern

Die 5 häufigsten Failure Modes

Failure 1: Endlosschleifen

Agent A fragt Agent B. Agent B fragt Agent A.

Lösung: Max-Iteration-Limit pro Agent (typisch: 3–5 Iterationen).

Failure 2: Quality Degradation

Jeder Agent fügt Rauschen hinzu. Nach 5 Agenten ist der Output unbrauchbar.

Lösung: Quality Gates zwischen Agenten. Nächster Agent startet nur über Threshold.

Failure 3: Context Window Overflow

Akkumulierter Kontext überschreitet das Context Window.

Lösung: Summarization-Agent zwischen Schritten.

Failure 4: Inconsistent Personas

Agenten widersprechen sich.

Lösung: Shared Context Document, das alle Agenten als Basis erhalten.

Failure 5: Silent Failures

Falsches Ergebnis mit hohem "Confidence Score".

Lösung: Adversarial Checks. Validation-Agent prüft stichprobenartig Zwischenergebnisse.

Robustness-Checklist

  • Max-Iteration-Limits für alle Agenten gesetzt?
  • Quality Gates zwischen allen Übergaben?
  • Timeout pro Agent (typisch: 30–60 Sekunden)?
  • Fallback-Strategie wenn ein Agent versagt?
  • Logging aller Handoffs für Post-Mortem-Analyse?
  • Cost-Ceiling pro Workflow-Durchlauf?
  • Human-Escalation-Trigger definiert?

6. Memory & State Management

Die drei Memory-Schichten

SchichtScopePersistenzBeispiel
Working MemoryEinzelner Agent, aktueller TaskFlüchtigChat-History im aktuellen Call
Shared StateAlle Agenten, aktueller WorkflowWorkflow-DauerZwischenergebnisse, Handoff-Daten
Long-Term MemoryAlle Agenten, alle WorkflowsPermanentKundendaten, gelernte Präferenzen

Shared Vector Store statt Daisy-Chaining

Das Anti-Pattern: Jeder Agent hängt das komplette Gesprächsprotokoll an den nächsten (Daisy-Chaining). Die Token-Kosten wachsen mit jeder Übergabe, und ein Absturz in der Kette verliert alles davor.

Das Pattern: Alle Subagents schreiben ihre Findings in einen gemeinsamen Vector Store. Der Synthesis-Agent holt per Semantic Search nur, was er braucht.

class SharedVectorStore:
    def write_finding(self, agent_id: str, finding: dict) -> None:
        # Claim, Quelle und Confidence indexieren
        self.index(agent_id, finding)

    def read_findings(self, query: str, top_k: int = 10) -> list[dict]:
        # Semantic Search statt Volltext-Log
        return self.search(query, top_k)

Der Effekt: Der State bleibt erhalten (stürzt Agent C ab, liegen die Findings von A und B noch im Store), der Synthesis-Agent liest nur Relevantes, und die Agenten laufen entkoppelt parallel.


7. Cost Engineering für Multi-Agent-Systeme

Model Tiering pro Agent

Agent-RolleEmpfohlenes ModellBegründung
Router / ClassifierGPT-4o-miniEinfache Entscheidung
ResearcherGPT-4oBraucht gutes Reasoning
WriterGPT-4o / Claude SonnetQualität im Output
ValidatorGPT-4o-miniJa/Nein-Entscheidungen
SummarizerGPT-4o-miniKompression, nicht Kreation

Ersparnis: Beim Routing zwischen starkem und schwachem Modell sparte RouteLLM je nach Benchmark 35 bis über 85 % gegenüber reinem GPT-4, bei 95 % der GPT-4-Qualität.

Lazy Evaluation: Aktiviere Agenten nur bei Bedarf (z.B. Reviewer nur wenn Confidence Score < 0,85).

Parallelisierung und Prompt Caching

Sequenzielle Verarbeitung ist der häufigste Latenz-Killer: Zehn Analysen hintereinander dauern zehnmal so lang wie eine. Unabhängige Subagent-Aufrufe laufen parallel:

async def process_precedents_parallel(precedents: list[dict]) -> list[dict]:
    tasks = [analyze_single(p) for p in precedents]
    return await asyncio.gather(*tasks)

Ergebnis im Beispiel: rund 20 statt 180 Sekunden.

Für die Synthese über 80.000 und mehr Tokens akkumulierter Findings gehört Prompt Caching dazu: Der gemeinsame Kontext wird einmal übertragen und bei Folgeaufrufen aus dem Cache gelesen.

messages = [{"type": "text", "text": cached_context, "cache_control": {"type": "ephemeral"}}]

Prompt Caching senkt bei langen Prompts laut Anthropic die Kosten um bis zu 90 % und die Latenz um bis zu 85 %.

Kosten-Benchmarks

Workflow-TypAgentenKosten mit Tiering
Report-Generierung30,12–0,20 EUR/Durchlauf
Lead Research40,20–0,40 EUR/Durchlauf
Vertragsprüfung50,40–0,80 EUR/Durchlauf
Full Sales Workflow60,60–1,20 EUR/Durchlauf

8. DACH-spezifische Considerations

Sprache: System-Prompts auf Deutsch für bessere Output-Qualität bei deutschen Daten.

DSGVO in Multi-Agent-Systemen:

  • Datenminimierung: Nur relevante Daten an jeden Agent (Scope-basierte Handoffs)
  • PII nicht in Long-Term Memory speichern
  • Audit-Log pro Handoff für Dokumentationspflicht
  • TTL + explizite Löschroutine für Kundendaten

Hosting: Azure OpenAI mit EU-Region für sensible Daten. Anthropic API hat derzeit kein EU-Datacenter — Auftragsverarbeitungsvertrag prüfen.


9. Implementation Roadmap

Phase 1: PoC (Woche 1–2)

  • Einen Use Case identifizieren (idealerweise interner Prozess)
  • CrewAI für schnellen Prototyp, 2–3 Agenten, Sequential Pipeline
  • Manuelles Testing mit 10–20 Beispielen

Phase 2: Hardening (Woche 3–4)

  • Structured Handoff Protocol implementieren
  • Quality Gates, Max-Iteration-Limits und Timeouts
  • Logging aller Agent-Interaktionen

Phase 3: Production (Woche 5–8)

  • Migration zu LangGraph für Production-Kontrolle
  • Model Tiering implementieren
  • Monitoring-Dashboard (Kosten, Qualität, Latenz pro Agent)

Phase 4: Optimization (Woche 9–12)

  • Workflow-Level Caching
  • Lazy Evaluation für optionale Agenten
  • A/B-Testing verschiedener Agent-Konfigurationen

10. Die 7 Regeln für Multi-Agent im Mittelstand

  1. Starte mit Single-Agent. Multi-Agent nur wenn Single-Agent nachweislich nicht reicht.
  2. Wähle das einfachste Pattern, das funktioniert.
  3. Structured Handoffs statt Free-Text-Übergaben.
  4. Model Tiering ab Tag 1.
  5. Max-Iteration-Limits sind nicht optional.
  6. Logging ist die wichtigste Infrastruktur.
  7. Human-in-the-Loop für alles, was extern sichtbar wird.

Verwandte Artikel

Weiterlesen

Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.

Nächster Schritt

Welche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?

Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.

5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung