Merlin MechlerMERLIN MECHLER
Alle Artikel
3 Min Lesezeit

Technical Debt in KI-Automation-Stacks — Schulden erkennen & abbezahlen

37 Workflows, 14 Make-Szenarien, 8 Python-Skripte — und dann kündigt der einzige Entwickler, der die Hälfte davon gebaut hat. Die 7 Schuldenarten in KI-Automation-Stacks und ein 6-Wochen-Abbauplan.

AutomatisierungAgentic WorkflowsProduktivitätKI-InfrastrukturBest Practices

Lisa, Head of Operations bei einem Hamburger Logistikunternehmen, hatte in 18 Monaten eine beeindruckende KI-Infrastruktur aufgebaut: 37 n8n-Workflows, 14 Make-Szenarien, 8 Custom Python-Skripte, 3 LLM-Agenten. Die Geschäftsführung war begeistert.

Dann kündigte der einzige Entwickler, der die Hälfte der Workflows gebaut hatte.

Innerhalb von zwei Wochen brachen 11 Workflows. Niemand wusste, warum. Die Dokumentation bestand aus Slack-Nachrichten und dem Gedächtnis eines Menschen, der nicht mehr da war. Kosten für externe Notfall-Beratung: 47.000 EUR.

Lisa hatte kein Technologie-Problem. Lisa hatte Technical Debt.

Technical Debt in KI-Stacks ist gefährlicher als in klassischer Software weil drei Faktoren zusammenkommen: Nicht-deterministische Systeme (LLMs liefern unterschiedliche Outputs, Bugs sind schwerer zu reproduzieren), Tool-Sprawl (durchschnittlich 4-7 verschiedene Automation-Tools gleichzeitig), und implizites Wissen (Prompts, Entscheidungslogik und Fallback-Regeln sind selten dokumentiert).

Die 7 Schuldenarten in KI-Automation-Stacks

Sieben Schuldenarten kommen in fast jedem KI-Automation-Stack vor. Zu jeder gehört eine Lösung.

1. Workflow Sprawl Debt

Workflows werden ad hoc erstellt, ohne Registry, ohne Naming-Konventionen, ohne Lifecycle-Management. Bei Lisas Unternehmen liefen 9 der 37 Workflows seit Monaten ohne Funktion — Kosten: 340 EUR/Monat für nichts.

Lösung: Workflow-Registry mit Name, Owner, Zweck, Abhängigkeiten und letztem Review. Quartalsweises Audit.

2. Prompt Rot

Prompts degradieren über die Zeit. Modell-Updates ändern das Verhalten. Aber der Prompt bleibt derselbe wie vor 8 Monaten. Prompt-Stuffing erhöht die Token-Kosten, und lange Kontexte können die Output-Qualität senken (Liu et al., 2023).

Lösung: Prompt-Versionierung, monatlicher Review, zentrale Prompt-Bibliothek.

3. Integration Debt

Fragile Punkt-zu-Punkt-Integrationen ohne Error Handling, ohne Retry-Logik, ohne Monitoring. Ein API-Update eines Drittanbieters bricht mehrere Workflows gleichzeitig.

Lösung: API-Abstraktionsschicht, Dependency-Map, täglicher Healthcheck-Workflow.

4. Knowledge Debt

Die gefährlichste Schuldenart. Workflow-Logik existiert nur im Kopf derjenigen, die sie gebaut haben. "Frag Lisa, die weiß wie das funktioniert" — und Lisa ist nicht mehr da.

Lösung: "Workflow ADR" für jeden kritischen Workflow, Bus-Factor-Analyse (alles unter 2 Personen ist kritisch), monatliche "Show & Tell"-Sessions.

5. Testing Debt

Workflows laufen ohne Tests in Production. Jede Änderung ist ein Experiment in Production.

Lösung: 5-10 Test-Cases pro kritischem Workflow, Shadow Mode (parallel ohne Outputs), Canary Deployments.

6. Observability Debt

"Läuft der Workflow noch?" ist eine ernstgemeinte Frage. Ohne Monitoring dauert die mittlere Erkennungszeit für Workflow-Fehler durchschnittlich 3–7 Tage. Mit Monitoring: unter 15 Minuten.

Lösung: Dashboard mit 5 Kern-Metriken, Alerts auf Anomalien, wöchentliches 15-Minuten-Review.

7. Governance Debt

Kein Verarbeitungsverzeichnis für KI-Workflows, kein Audit Trail, keine Transparenzpflichten.

Lösung: KI-Workflow-Register analog zum Verarbeitungsverzeichnis, quartalsweises Compliance-Review.

Technical Debt Scoring: Mach es messbar

Bewerte jeden Workflow auf einer Skala von 0 (kein Debt) bis 5 (kritisch) in jeder der 7 Dimensionen.

Gesamtscore: 0–7: Healthy | 8–15: Warning | 16–24: Danger | 25–35: Critical (Stop-the-Line)

Lisas Stack hätte einen Score von 29 gehabt. Aber niemand hatte gemessen.

Der 6-Wochen Debt-Reduction-Plan

Woche 1–2: Inventur und Scoring

  • Alle Workflows inventarisieren: Tool, Name, Owner, Zweck, Status
  • Technical Debt Score für jeden Workflow berechnen
  • Bus-Factor-Analyse: Wer kann welchen Workflow warten?

Woche 3–4: Quick Wins und kritische Fixes

  • Zombie-Workflows deaktivieren
  • AV-Verträge mit LLM-Anbietern aktualisieren
  • Basis-Monitoring für Top-5 kritischste Workflows

Woche 5–6: Strukturelle Verbesserungen

  • Naming-Konvention definieren
  • Prompt-Versionierungssystem einführen
  • Quartals-Review-Termin blocken

Agentic Debt: Die neue Schuldenart 2026

Mit dem Aufstieg von KI-Agenten entsteht eine neue Dimension von Technical Debt: Agent Sprawl (unkontrollierte Vermehrung), Permission Creep (schrittweise mehr Zugriffsrechte), Context Rot (Performance degradiert mit zunehmender Konversationslänge), Coordination Debt (bei streng sequenziellen Aufgaben verloren alle getesteten Multi-Agent-Varianten laut Google Research, 2026 39 bis 70 % Leistung).

Teams, die Zeit für Debt Reduction investieren, bauen langfristig schneller neue Features als Teams, die alles in neue Features stecken.

Was der Schuldenabbau bringt

In Code niedriger Qualität dauert die Bearbeitung von Issues laut einer Studie über 39 Codebasen im Schnitt 124 % länger als in gesundem Code (Tornhill & Borg, 2022). Laut einer Stripe-Umfrage (2018) gehen im Schnitt rund 17 von 41 Wochenstunden eines Entwicklers in Technical Debt.

Weiterlesen

Grundlagen zu KI für Unternehmen und die Artikel, die dieses Thema vertiefen.

Nächster Schritt

Welche Arbeit kostet in deinem Unternehmen heute zu viel Zeit?

Die KI-Mitarbeiter-Fit-Prüfung zeigt, ob ein KI-Mitarbeiter wiederkehrende operative Arbeit in eurem Prozess übernehmen kann. Du bekommst eine klare Antwort, kein Tool-Pitch.

5 Fragen · etwa 3 Minuten · klare Fit-Einschätzung