Wie ich arbeite

Nicht das Tool ist das Problem.

Fast jeder Betrieb, der mich anruft, hat schon Werkzeuge. Oft zu viele. Was fehlt, ist die Ordnung drumherum: wer entscheidet was, was darf automatisch passieren, und woran merkst du, dass etwas still stehengeblieben ist. Diese Seite erklärt genau das, ohne Fachsprache.

Warum das branchenunabhängig ist

Viermal dieselbe Reihenfolge.

Ein Onlineshop, ein Kundensupport, eine Personalsuche und ein Buchungssystem. Vier Dinge, die nichts miteinander zu tun haben, und bei denen der erste Schritt jedes Mal derselbe war. Was sich nie ändert, ist die Reihenfolge.

Eigener Betrieb

Onlineshop für Grabschmuck

Erst 16 Monate echte Suchanfragen sammeln, dann entscheiden, worüber überhaupt geschrieben wird.

Kundenprojekt

Kundensupport einer Schmuckmarke

Erst 660 echte Tickets auswerten, dann die Regeln schreiben, nach denen geantwortet wird.

Praxissemester

Personalsuche für Kfz-Prüfingenieure

Erst lesen, worüber sich diese Leute in Foren wirklich beschweren, dann die Stellenanzeige texten.

Kundenprojekt

Buchungssystem eines Flugsimulators

Erst prüfen, was ein Kunde tatsächlich angezeigt bekommt, dann der Einstellung glauben.

Erst messen, was wirklich passiert. Dann automatisieren.

Die Verfahren

Neun Handgriffe, die ich jedes Mal mache.

Nichts davon ist Zauberei, und keines davon ist von mir erfunden worden. Es sind neun Gewohnheiten, die ich mir an Fehlern angeeignet habe, die mich Geld gekostet haben. Sie haben Namen, damit man über sie reden kann.

Bevor gebaut wird
01

Kaltstart-Test

Neuer Chat, keine Vorgeschichte. Läuft es trotzdem?

Die ehrlichste Prüfung für jeden Ablauf: einmal bei null anfangen, so als wüsste niemand mehr, worum es geht. Alles, was du dabei von Hand nacherzählen musst, ist eine Lücke. Der Test kostet zehn Minuten und zeigt genau die Stellen, an denen etwas nur deshalb funktioniert, weil du zufällig weißt, was es braucht. Das sind dieselben Stellen, an denen es stehenbleibt, sobald du zwei Wochen weg bist.

02

Autonomie-Stufen

Wie viel Leine die KI bekommt, wird vorher festgelegt.

Jede Aufgabe bekommt eine von vier Stufen, eingeteilt nach vier Fragen: Lässt es sich rückgängig machen? Wen trifft es, wenn es schiefgeht? Was kostet ein Fehlversuch? Geht es um Marke, Geld oder Recht? Alles, was einen Kunden erreicht, bleibt auf der vorsichtigsten Stufe, bis es gute Gründe für etwas anderes gibt. Im Zweifel gilt die vorsichtigere.

03

Leerstellenprobe

Kann die Quelle eine Lücke überhaupt zeigen?

Viele Systeme liefern über ihre neuere Schnittstelle nur noch die Felder aus, die tatsächlich gefüllt sind. Das ist sauberer und meistens ein Fortschritt. Für eine Vollständigkeitsprüfung ist es tödlich: die findet auf dieser Grundlage per Konstruktion nie eine Lücke. Und null Lücken ist genau das Ergebnis, das man sich erhofft hat, also fragt niemand nach. Bevor eine Quelle für so eine Prüfung genutzt wird, legt man einen bekannt lückenhaften Fall daneben und schaut, ob die Lücke überhaupt sichtbar wird.

Beim Bauen
04

Regelvorrang

Die Regel entscheidet. Das Modell schreibt es nur auf.

Die Entscheidung trifft eine Regel, die du gelesen und freigegeben hast. Das Modell bekommt sie fertig und formuliert sie aus. Es sieht die Regeln nie und wird nie gefragt, wie die Richtlinie lautet. Passt keine Regel, sagt das System genau das und gibt ab. Das ist der Unterschied zwischen einem Ablauf, den du prüfen kannst, und einem, dem du glauben musst.

05

Rückspiel

Erst gegen die eigene Vergangenheit laufen lassen, dann live.

Alte Fälle mit verdecktem Ausgang nachspielen, mit dem vergleichen, was damals wirklich passiert ist, und jede Abweichung einzeln lesen. Die eine Hälfte sind Fehler in den Regeln. Die andere Hälfte sind Fälle, die du selbst mal anders entschieden hast, und genau daraus entstehen die guten Regeln. Kostet ein paar Tage und keinen einzigen echten Kunden.

06

Quellennachweis

Jeder Agent nennt, was er gelesen hat. Wer das nicht sagt, hat nicht gelesen.

Ein Plan sollte von fünf unabhängigen KI-Gutachtern zerlegt werden. Der Text kam bei keinem einzigen an, die Übergabe war leer. Kein Agent hat abgebrochen. Alle fünf lieferten lesbare, gut formulierte, zuversichtliche Urteile über ein Dokument, das sie nie gesehen hatten. Ein Modell ohne Kontext schweigt nicht, es wird plausibel. Seitdem muss jeder Durchlauf ausweisen, was tatsächlich als Eingabe ankam, bevor irgendjemand dem Ergebnis glaubt.

Im Betrieb
07

Ergebnisprobe

Prüfe, was herauskommt, nicht was eingestellt ist.

Nach jeder Änderung wird das Ergebnis geprüft, und zwar an der Kante, nicht in der Mitte. Fehler sitzen fast immer genau an der Grenze zwischen zwei Fällen. Diese eine Gewohnheit hätte mir 26 Tage stillen Ausfall und rund 1.100 Euro erspart: die Einstellung sah korrekt aus, die Schnittstelle meldete sie korrekt zurück, und trotzdem kam beim Kunden nichts an.

08

Frischeprüfung

Überwacht wird das Alter der Daten, nicht der Lauf-Status.

Grün heißt nicht, dass etwas ankommt. Bei mir liefen drei Abläufe wochenlang mit Erfolgsmeldung und schrieben dabei keine Zeile. Dazu braucht ein Wächter einen dritten Zustand: nicht nur „läuft" und „kaputt", sondern auch „gar nicht gemessen". Ohne den dritten Zustand meldet jeder Zugriffsfehler einen Defekt, den es nicht gibt, und du drehst an einer Einstellung, die in Ordnung war.

09

Wächterprobe

Einen Alarm prüfst du, indem du ihn absichtlich auslöst.

Ein Wächter, der nichts meldet, sieht exakt aus wie eine saubere Strecke. Beide erzeugen dieselbe Ausgabe, nämlich keine. Bei mir lief eine automatische Prüfung sechs Wochen lang als Programm, das nichts tat und trotzdem Erfolg meldete. Aufgefallen ist das nicht durch einen Fehlalarm und nicht durch einen fehlenden, sondern weil jemand die Prüfung selbst geprüft hat. Seitdem monatlich: eine Wegwerf-Eingabe mit einem bekannten Verstoß bauen und den Alarm erwarten. Dauert fünf Minuten.

Wenn du selbst schon automatisierst: das hier ist der Teil, den man überspringt, weil er keinen Spaß macht. Er ist der Grund, warum Abläufe ohne einen weiterlaufen.

Die Frage, an der alle hängenbleiben

Wie viel darf die KI allein entscheiden?

Das ist keine Glaubensfrage, sondern eine Einstufung. Jede Aufgabe bekommt eine Stufe, und die Stufe sagt, wie viel Leine sie hat. Zieh am Regler.

A0A1A2A3

Erst Plan, dann Freigabe

Die KI schlägt vor und zeigt vorher genau, was sie tun würde. Ausgeführt wird erst nach deinem Ja. Der Normalfall für alles, was Geld oder Außenwirkung berührt.

Bleibt auf dieser Stufe tabu
  • ✕Ausführen ohne Freigabe
  • ✕Mehrere Schritte am Stück

Eingestuft wird nach vier Fragen: Lässt es sich rückgängig machen? Wen trifft es, wenn es schiefgeht? Was kostet ein Fehlversuch? Geht es um Marke, Geld oder Recht? Und wenn du zwischen zwei Stufen schwankst, gilt immer die vorsichtigere.

Warum Kontrolle mitgebaut wird

Drei Fehler, die von außen wie Erfolg aussahen.

Alle drei sind mir oder meinen Kunden wirklich passiert. Sie haben eines gemeinsam: Es gab keine Fehlermeldung. Die Einstellung war gespeichert, der Ablauf meldete Erfolg, und trotzdem passierte nichts.

26
Tage unbemerkt

Die Einstellung war richtig. Das Ergebnis nicht.

In meinem eigenen Shop konnte 26 Tage lang niemand einen Warenkorb über 99 Euro abschließen. Die Einstellung sah korrekt aus, und die Schnittstelle meldete sie sogar korrekt zurück. Gezeigt hat es erst der Blick auf das, was ein Kunde tatsächlich angezeigt bekommt. Rund 1.100 Euro Umsatz und 13 blockierte Warenkörbe später. Seitdem wird nach jeder Änderung das Ergebnis geprüft, nicht die Einstellung, und zwar genau an der Kante, nicht in der Mitte.

3
tote Abläufe

Grün heißt nicht, dass etwas läuft.

Drei Abläufe meldeten wochenlang Erfolg und schrieben dabei keine einzige Zeile. Der Status war grün, das Ergebnis war leer. Ein Ablauf gilt bei mir deshalb erst als aktiv, wenn nachweislich etwas ankommt, nicht wenn er gestartet wurde. Überwacht wird seitdem, wie alt die Daten sind, nicht ob der Lauf durchgelaufen ist.

0
Mal ausgelöst

Gespeichert und trotzdem wirkungslos.

Bei einem Kunden nahm das Buchungssystem die Beschränkung „+2 Tage" an, speicherte sie und ignorierte sie still, weil das Feld intern nur Englisch versteht. Die deutsche Anleitung des Herstellers zeigte ausgerechnet das deutsche Beispiel. Die Beschränkung war nie aktiv, und niemand hätte es je gemerkt.

Der Bauplan

Regeln entscheiden. Die KI formuliert nur.

Das ist der Unterschied zwischen einem System, dem du vertraust, und einem, das du nach zwei Wochen wieder abschaltest. Die Entscheidung trifft eine Regel, die du gelesen und freigegeben hast. Die KI bekommt diese Entscheidung fertig und schreibt sie nur noch auf. Sie sieht die Regeln nie und wird nie gefragt, wie die Richtlinie lautet. Passt keine Regel, sagt das System genau das und gibt an einen Menschen ab. Ein leeres Ergebnis ist ein richtiges Ergebnis.

Zum Anfassen

Bau dir den Ablauf und lass ihn laufen.

Links baust du, rechts siehst du das Ergebnis. Dieselbe Anfrage geht jedes Mal rein. Schalt zwischen den beiden Bauweisen um und drück ein paar Mal auf Ausführen. Der Unterschied steht danach im Protokoll, nicht in meiner Behauptung.

Eingabe: Rückgabe am Tag 34, Kundin seit 2023

Anfrage kommt reinRegeln prüfenKI formuliertMensch prüftAntwort raus

Die Knoten lassen sich ziehen. Die Verbindungen halten.

Protokoll
  • Noch nichts gelaufen. Drück auf Ausführen.
Das Problem, das selten jemand benennt

Jedes Mal von vorn erklären.

Du machst einen neuen Chat auf und tippst erst mal alles wieder hin: was die Firma macht, wie du schreibst, was letztes Mal entschieden wurde, welche Regeln gelten. Es funktioniert. Dann wird das Gespräch lang und die Antworten werden schlechter. Und der eine Prompt, der wirklich gut war, liegt in einem Verlauf, den du nicht wiederfindest.

Das ist kein Bedienfehler. Die KI bekommt bei jedem Anlauf das, woran du dich in dem Moment zufällig erinnerst. Ich sorge dafür, dass sie stattdessen immer genau das bekommt, was für diesen einen Schritt gebraucht wird, ohne dass du es zusammensuchst. Wie das darunter gebaut ist, ist mein Problem und nicht deins. Was du merkst, ist: du erklärst nicht mehr von vorn, die Antworten bleiben gleich gut, und sie bleiben es auch dann, wenn jemand anderes fragt.

Chat→Gespeicherter Prompt→System, das sich selbst versorgt

Die nächste Stufe erst, wenn die davor wirklich läuft. Für etwas, das du zweimal im Jahr machst, brauchst du kein System, da reicht ein gespeicherter Prompt. Wenn ich dir im Erstgespräch davon abrate, ist das auch eine Antwort, und sie kostet dich nichts.

Kontext, sparsam geladen

Nicht alles wissen. Das Richtige wissen.

Jedes Kästchen ist ein Stück von dem, was dein Betrieb weiß: Preisliste, Rückgaberegeln, Markenstimme, Lieferantenkontakte, Urlaubsplan. Ein Schritt braucht davon fast nie mehr als eine Handvoll. Schalt um.

Geladen
42.000Token
Davon gebraucht
3.200Token

Alles reinkippen wirkt gründlich und ist das Gegenteil. Je mehr Unbeteiligtes mitgeladen wird, desto eher greift das Modell nach dem Falschen, und bezahlt wird jedes Kästchen, auch die grauen.

Token: die Häppchen, in die ein KI-Modell Text zerlegt. Grob ein Token je vier Zeichen. Abgerechnet wird danach, und irgendwann ist das Fenster voll.

Erstgespräch

Reden wir 25 Minuten über deinen Ablauf.

Kostenlos und unverbindlich, per Video oder vor Ort in Berlin. Du bekommst am Ende eine ehrliche Einschätzung, auch wenn die lautet, dass du dafür niemanden brauchst.

01Du beschreibst einen Handgriff, der dich jede Woche Zeit kostet
02Wir schauen, ob sich das lohnt und was es ungefähr kostet
03Du bekommst eine Empfehlung, auch wenn sie gegen ein Projekt spricht

Meine Zusage: Läuft ein übergebener Ablauf nicht so, wie wir ihn vorher beschrieben haben, baue ich nach, bis er es tut. Ohne neue Rechnung und ohne Diskussion darüber, wessen Schuld es war.

Termin aussuchen.

Such dir einen Slot, der dir passt. Die paar Fragen im Formular sind da, damit ich vorbereitet ins Gespräch gehe.

Der Klick lädt den Kalender von Cal.com, dabei werden Daten dorthin übertragen. Vorher wird nichts geladen. Datenschutz