Nicht das Tool ist das Problem.
Fast jeder Betrieb, der mich anruft, hat schon Werkzeuge. Oft zu viele. Was fehlt, ist die Ordnung drumherum: wer entscheidet was, was darf automatisch passieren, und woran merkst du, dass etwas still stehengeblieben ist. Diese Seite erklärt genau das, ohne Fachsprache.
Viermal dieselbe Reihenfolge.
Ein Onlineshop, ein Kundensupport, eine Personalsuche und ein Buchungssystem. Vier Dinge, die nichts miteinander zu tun haben, und bei denen der erste Schritt jedes Mal derselbe war. Was sich nie ändert, ist die Reihenfolge.
Onlineshop für Grabschmuck
Erst 16 Monate echte Suchanfragen sammeln, dann entscheiden, worüber überhaupt geschrieben wird.
Kundensupport einer Schmuckmarke
Erst 660 echte Tickets auswerten, dann die Regeln schreiben, nach denen geantwortet wird.
Personalsuche für Kfz-Prüfingenieure
Erst lesen, worüber sich diese Leute in Foren wirklich beschweren, dann die Stellenanzeige texten.
Buchungssystem eines Flugsimulators
Erst prüfen, was ein Kunde tatsächlich angezeigt bekommt, dann der Einstellung glauben.
Erst messen, was wirklich passiert. Dann automatisieren.
Neun Handgriffe, die ich jedes Mal mache.
Nichts davon ist Zauberei, und keines davon ist von mir erfunden worden. Es sind neun Gewohnheiten, die ich mir an Fehlern angeeignet habe, die mich Geld gekostet haben. Sie haben Namen, damit man über sie reden kann.
Kaltstart-Test
Neuer Chat, keine Vorgeschichte. Läuft es trotzdem?
Die ehrlichste Prüfung für jeden Ablauf: einmal bei null anfangen, so als wüsste niemand mehr, worum es geht. Alles, was du dabei von Hand nacherzählen musst, ist eine Lücke. Der Test kostet zehn Minuten und zeigt genau die Stellen, an denen etwas nur deshalb funktioniert, weil du zufällig weißt, was es braucht. Das sind dieselben Stellen, an denen es stehenbleibt, sobald du zwei Wochen weg bist.
Autonomie-Stufen
Wie viel Leine die KI bekommt, wird vorher festgelegt.
Jede Aufgabe bekommt eine von vier Stufen, eingeteilt nach vier Fragen: Lässt es sich rückgängig machen? Wen trifft es, wenn es schiefgeht? Was kostet ein Fehlversuch? Geht es um Marke, Geld oder Recht? Alles, was einen Kunden erreicht, bleibt auf der vorsichtigsten Stufe, bis es gute Gründe für etwas anderes gibt. Im Zweifel gilt die vorsichtigere.
Leerstellenprobe
Kann die Quelle eine Lücke überhaupt zeigen?
Viele Systeme liefern über ihre neuere Schnittstelle nur noch die Felder aus, die tatsächlich gefüllt sind. Das ist sauberer und meistens ein Fortschritt. Für eine Vollständigkeitsprüfung ist es tödlich: die findet auf dieser Grundlage per Konstruktion nie eine Lücke. Und null Lücken ist genau das Ergebnis, das man sich erhofft hat, also fragt niemand nach. Bevor eine Quelle für so eine Prüfung genutzt wird, legt man einen bekannt lückenhaften Fall daneben und schaut, ob die Lücke überhaupt sichtbar wird.
Regelvorrang
Die Regel entscheidet. Das Modell schreibt es nur auf.
Die Entscheidung trifft eine Regel, die du gelesen und freigegeben hast. Das Modell bekommt sie fertig und formuliert sie aus. Es sieht die Regeln nie und wird nie gefragt, wie die Richtlinie lautet. Passt keine Regel, sagt das System genau das und gibt ab. Das ist der Unterschied zwischen einem Ablauf, den du prüfen kannst, und einem, dem du glauben musst.
Rückspiel
Erst gegen die eigene Vergangenheit laufen lassen, dann live.
Alte Fälle mit verdecktem Ausgang nachspielen, mit dem vergleichen, was damals wirklich passiert ist, und jede Abweichung einzeln lesen. Die eine Hälfte sind Fehler in den Regeln. Die andere Hälfte sind Fälle, die du selbst mal anders entschieden hast, und genau daraus entstehen die guten Regeln. Kostet ein paar Tage und keinen einzigen echten Kunden.
Quellennachweis
Jeder Agent nennt, was er gelesen hat. Wer das nicht sagt, hat nicht gelesen.
Ein Plan sollte von fünf unabhängigen KI-Gutachtern zerlegt werden. Der Text kam bei keinem einzigen an, die Übergabe war leer. Kein Agent hat abgebrochen. Alle fünf lieferten lesbare, gut formulierte, zuversichtliche Urteile über ein Dokument, das sie nie gesehen hatten. Ein Modell ohne Kontext schweigt nicht, es wird plausibel. Seitdem muss jeder Durchlauf ausweisen, was tatsächlich als Eingabe ankam, bevor irgendjemand dem Ergebnis glaubt.
Ergebnisprobe
Prüfe, was herauskommt, nicht was eingestellt ist.
Nach jeder Änderung wird das Ergebnis geprüft, und zwar an der Kante, nicht in der Mitte. Fehler sitzen fast immer genau an der Grenze zwischen zwei Fällen. Diese eine Gewohnheit hätte mir 26 Tage stillen Ausfall und rund 1.100 Euro erspart: die Einstellung sah korrekt aus, die Schnittstelle meldete sie korrekt zurück, und trotzdem kam beim Kunden nichts an.
Frischeprüfung
Überwacht wird das Alter der Daten, nicht der Lauf-Status.
Grün heißt nicht, dass etwas ankommt. Bei mir liefen drei Abläufe wochenlang mit Erfolgsmeldung und schrieben dabei keine Zeile. Dazu braucht ein Wächter einen dritten Zustand: nicht nur „läuft" und „kaputt", sondern auch „gar nicht gemessen". Ohne den dritten Zustand meldet jeder Zugriffsfehler einen Defekt, den es nicht gibt, und du drehst an einer Einstellung, die in Ordnung war.
Wächterprobe
Einen Alarm prüfst du, indem du ihn absichtlich auslöst.
Ein Wächter, der nichts meldet, sieht exakt aus wie eine saubere Strecke. Beide erzeugen dieselbe Ausgabe, nämlich keine. Bei mir lief eine automatische Prüfung sechs Wochen lang als Programm, das nichts tat und trotzdem Erfolg meldete. Aufgefallen ist das nicht durch einen Fehlalarm und nicht durch einen fehlenden, sondern weil jemand die Prüfung selbst geprüft hat. Seitdem monatlich: eine Wegwerf-Eingabe mit einem bekannten Verstoß bauen und den Alarm erwarten. Dauert fünf Minuten.
Wenn du selbst schon automatisierst: das hier ist der Teil, den man überspringt, weil er keinen Spaß macht. Er ist der Grund, warum Abläufe ohne einen weiterlaufen.
Wie viel darf die KI allein entscheiden?
Das ist keine Glaubensfrage, sondern eine Einstufung. Jede Aufgabe bekommt eine Stufe, und die Stufe sagt, wie viel Leine sie hat. Zieh am Regler.
Erst Plan, dann Freigabe
Die KI schlägt vor und zeigt vorher genau, was sie tun würde. Ausgeführt wird erst nach deinem Ja. Der Normalfall für alles, was Geld oder Außenwirkung berührt.
- ✕Ausführen ohne Freigabe
- ✕Mehrere Schritte am Stück
Eingestuft wird nach vier Fragen: Lässt es sich rückgängig machen? Wen trifft es, wenn es schiefgeht? Was kostet ein Fehlversuch? Geht es um Marke, Geld oder Recht? Und wenn du zwischen zwei Stufen schwankst, gilt immer die vorsichtigere.
Drei Fehler, die von außen wie Erfolg aussahen.
Alle drei sind mir oder meinen Kunden wirklich passiert. Sie haben eines gemeinsam: Es gab keine Fehlermeldung. Die Einstellung war gespeichert, der Ablauf meldete Erfolg, und trotzdem passierte nichts.
Die Einstellung war richtig. Das Ergebnis nicht.
In meinem eigenen Shop konnte 26 Tage lang niemand einen Warenkorb über 99 Euro abschließen. Die Einstellung sah korrekt aus, und die Schnittstelle meldete sie sogar korrekt zurück. Gezeigt hat es erst der Blick auf das, was ein Kunde tatsächlich angezeigt bekommt. Rund 1.100 Euro Umsatz und 13 blockierte Warenkörbe später. Seitdem wird nach jeder Änderung das Ergebnis geprüft, nicht die Einstellung, und zwar genau an der Kante, nicht in der Mitte.
Grün heißt nicht, dass etwas läuft.
Drei Abläufe meldeten wochenlang Erfolg und schrieben dabei keine einzige Zeile. Der Status war grün, das Ergebnis war leer. Ein Ablauf gilt bei mir deshalb erst als aktiv, wenn nachweislich etwas ankommt, nicht wenn er gestartet wurde. Überwacht wird seitdem, wie alt die Daten sind, nicht ob der Lauf durchgelaufen ist.
Gespeichert und trotzdem wirkungslos.
Bei einem Kunden nahm das Buchungssystem die Beschränkung „+2 Tage" an, speicherte sie und ignorierte sie still, weil das Feld intern nur Englisch versteht. Die deutsche Anleitung des Herstellers zeigte ausgerechnet das deutsche Beispiel. Die Beschränkung war nie aktiv, und niemand hätte es je gemerkt.
Regeln entscheiden. Die KI formuliert nur.
Das ist der Unterschied zwischen einem System, dem du vertraust, und einem, das du nach zwei Wochen wieder abschaltest. Die Entscheidung trifft eine Regel, die du gelesen und freigegeben hast. Die KI bekommt diese Entscheidung fertig und schreibt sie nur noch auf. Sie sieht die Regeln nie und wird nie gefragt, wie die Richtlinie lautet. Passt keine Regel, sagt das System genau das und gibt an einen Menschen ab. Ein leeres Ergebnis ist ein richtiges Ergebnis.
Bau dir den Ablauf und lass ihn laufen.
Links baust du, rechts siehst du das Ergebnis. Dieselbe Anfrage geht jedes Mal rein. Schalt zwischen den beiden Bauweisen um und drück ein paar Mal auf Ausführen. Der Unterschied steht danach im Protokoll, nicht in meiner Behauptung.
Eingabe: Rückgabe am Tag 34, Kundin seit 2023
Die Knoten lassen sich ziehen. Die Verbindungen halten.
- Noch nichts gelaufen. Drück auf Ausführen.
Jedes Mal von vorn erklären.
Du machst einen neuen Chat auf und tippst erst mal alles wieder hin: was die Firma macht, wie du schreibst, was letztes Mal entschieden wurde, welche Regeln gelten. Es funktioniert. Dann wird das Gespräch lang und die Antworten werden schlechter. Und der eine Prompt, der wirklich gut war, liegt in einem Verlauf, den du nicht wiederfindest.
Das ist kein Bedienfehler. Die KI bekommt bei jedem Anlauf das, woran du dich in dem Moment zufällig erinnerst. Ich sorge dafür, dass sie stattdessen immer genau das bekommt, was für diesen einen Schritt gebraucht wird, ohne dass du es zusammensuchst. Wie das darunter gebaut ist, ist mein Problem und nicht deins. Was du merkst, ist: du erklärst nicht mehr von vorn, die Antworten bleiben gleich gut, und sie bleiben es auch dann, wenn jemand anderes fragt.
Die nächste Stufe erst, wenn die davor wirklich läuft. Für etwas, das du zweimal im Jahr machst, brauchst du kein System, da reicht ein gespeicherter Prompt. Wenn ich dir im Erstgespräch davon abrate, ist das auch eine Antwort, und sie kostet dich nichts.
Nicht alles wissen. Das Richtige wissen.
Jedes Kästchen ist ein Stück von dem, was dein Betrieb weiß: Preisliste, Rückgaberegeln, Markenstimme, Lieferantenkontakte, Urlaubsplan. Ein Schritt braucht davon fast nie mehr als eine Handvoll. Schalt um.
Alles reinkippen wirkt gründlich und ist das Gegenteil. Je mehr Unbeteiligtes mitgeladen wird, desto eher greift das Modell nach dem Falschen, und bezahlt wird jedes Kästchen, auch die grauen.
Token: die Häppchen, in die ein KI-Modell Text zerlegt. Grob ein Token je vier Zeichen. Abgerechnet wird danach, und irgendwann ist das Fenster voll.
Reden wir 25 Minuten über deinen Ablauf.
Kostenlos und unverbindlich, per Video oder vor Ort in Berlin. Du bekommst am Ende eine ehrliche Einschätzung, auch wenn die lautet, dass du dafür niemanden brauchst.
Meine Zusage: Läuft ein übergebener Ablauf nicht so, wie wir ihn vorher beschrieben haben, baue ich nach, bis er es tut. Ohne neue Rechnung und ohne Diskussion darüber, wessen Schuld es war.
Termin aussuchen.
Such dir einen Slot, der dir passt. Die paar Fragen im Formular sind da, damit ich vorbereitet ins Gespräch gehe.
Der Klick lädt den Kalender von Cal.com, dabei werden Daten dorthin übertragen. Vorher wird nichts geladen. Datenschutz