Ich habe drei Coding-Agenten mit Absicht weniger Fähigkeiten gegeben
Claude Code liefert einen Allzweck-Agenten, der in einer Codebasis fast alles kann. Daneben betreibe ich drei Spezialisten mit 46 ausdrücklichen Verboten, weil die Fähigkeit dort aufhört, die Grenze zu sein, wo Fehler Geld kosten.
Claude Code ist um einen Allzweck-Agenten herum gebaut, der in einer Codebasis fast alles kann, damit schneller geliefert wird. Daneben habe ich 3 Spezialisten eingerichtet, jeden mit Absicht zu weniger fähig.
Warum das zählt
Stellen Sie einen Generalisten ein, und er kann alles. Das ist der Wert und das Risiko: Nichts sagt ihm, welche Entscheidungen er eskalieren muss und wann er aufhören soll.
Mit einem agentischen Coding-Werkzeug ist es dasselbe. Es liest Ihre Codebasis, ändert Dateien, führt Befehle aus, bedient die Versionsverwaltung. Für offene Arbeit ist genau diese Reichweite der Punkt.
Sobald die Arbeit Systeme berührt, in denen Fehler Geld kosten, ist nicht mehr die Fähigkeit die Grenze, sondern das Urteil. Der Agent muss wissen, was er verweigert und wann er für einen Menschen anhält.
Dieses Urteil ist die Schicht, die ich auf ein Werkzeug lege, das bereits funktioniert.
Ein großer Teil der Ingenieurarbeit in agentischer KI steckt in den Grenzen.
Wie es funktioniert
Ein Leitender Forscher, ein Leitender Ingenieur, ein Prüfender Ingenieur. 46 ausdrückliche Verbote zwischen ihnen.
Manche Grenzen sind strukturell. Die Werkzeugliste des Ingenieurs enthält kein Web und keine Recherchewerkzeuge, er kann eine API also nicht stillschweigend raten. Er fragt den Forscher namentlich, mit genauer Bibliothek und Dateizeile, und aus einer vagen Übergabe wird eine Anfrage, die jemand beantworten kann.
Andere sind nur Prompt-Regeln, und ich halte diesen Unterschied offen. Anthropic dokumentiert, dass die Freigabeliste für das Starten weiterer Agenten allein den Agenten der Hauptsitzung bindet, also nenne ich die Pipeline nicht versiegelt.
Der Prüfende Ingenieur führt alle 8 Qualitätsgates selbst erneut aus, statt den Bericht des Ingenieurs zu lesen. Eine Behauptung ist kein Beleg.
Der berechtigte Einwand lautet, dass Gates Reibung sind und jedes davon Wartungsschuld. Meine sitzen nur an den Schritten, die teuer rückgängig zu machen sind, und das ist der Test, den ich anlege, bevor ein weiteres dazukommt.
Jede Grenze oben hat etwas gekostet. Die nützliche Frage an jemanden, der so etwas betreibt, ist nicht, welche Grenze er zuerst gezogen hat. Sie lautet, welche er zuerst wieder entfernen würde.