Ein KI-Workflow, den jemand nur durch das Querlesen einiger Antworten prüft, ist ein Experiment. Auch nach sechs Monaten im Einsatz.
Prompts, Skills und Agenten-Logiken definieren Softwareverhalten. Und Softwareverhalten braucht dieselbe Disziplin wie klassischer Code: einen stabilen Satz realistischer Praxisfälle, automatisierte Assertions zur Prüfung der Ausgaben und Regressionstests bei jeder Änderung an Prompt, Modell oder Datenquelle.
Assertions testen Eigenschaften, die sich maschinell verifizieren lassen: Wird das geforderte Schema eingehalten? Verweigert das Modell Antworten auf unzulässige Fragen? Werden die erwarteten Tools aufgerufen? Sind Aussagen durch Quellen belegt? Nichts davon setzt voraus, dass im Alltag ein Mensch jede Ausgabe mitliest.
Entscheidend ist die Reihenfolge bei Fehlern: Ein fehlschlagender Fall wandert immer zuerst in die Testsuite, bevor der Prompt nachjustiert wird. Wer es umgekehrt macht, riskiert, dass die Korrektur an einer Stelle älteres, funktionierendes Verhalten an anderer Stelle unbemerkt aushebelt.
Und der größte Hebel für den Betrieb: Die Frage „Können wir auf ein günstigeres Modell wechseln?“ wird damit von einer riskanten Bauchentscheidung zu einem simplen Testlauf auf Knopfdruck.