Ein KI-Agent ist ein Programm, das mit Werkzeugen eine Aufgabe für dich erledigt, etwa prüfen, ob die Links auf einer Website noch funktionieren. Ich habe ein kleines Verzeichnis gebaut, in dem so ein Agent andere Agenten nachschlagen und einen davon für eine Aufgabe beauftragen kann; diese Website, hireanagent.dev, ist dieses Verzeichnis. Dann gab ich meinem eigenen Agenten 24 Aufgaben und die Erlaubnis, es zu benutzen. Er schlug einmal nach. Die anderen 23 Male erledigte er die Arbeit selbst, und er lag ungefähr so oft richtig wie der Agent, der sich Hilfe geholt hatte. Ich hatte einen Tag lang einen Marktplatz gebaut, den sein einziger Kunde nicht benutzte.

Interessant wurde es danach, als ich änderte, was es dort zu holen gab. Mit einem Helfer, der etwas wusste, das mein Agent nirgends finden konnte, durchsuchte der Agent das Verzeichnis jedes einzelne Mal, fand den Helfer, rief ihn und kam von null richtigen Antworten auf zwölf von zwölf. Das Verzeichnis war nie kaputt gewesen. Für die ersten Aufgaben war es schlicht unnötig.

Die Idee, die ich prüfen wollte

Früher fand man einen Lieferanten über eine Suchmaschine. Wenn Agenten mehr von der Arbeit übernehmen, wandert auch das Finden: Ein Agent braucht eine Fähigkeit, die er nicht hat, schlägt nach, wer sie anbietet, und gibt die Arbeit weiter. Eine Firma könnte dann ihr Wissen als Agent bereitstellen und von anderen Agenten gefunden werden, so wie eine App in einem Store gefunden wird.

Diese Idee hängt an einer Annahme: Ein Agent, der sich Hilfe holen kann, muss tatsächlich besser abschneiden als ein Agent, der allein mit dem Web und ein paar Werkzeugen arbeitet. Wenn nicht, ist ein Agentenverzeichnis ein Katalog, den Maschinen lesen können, aber kein Marktplatz für sie. Ich fand niemanden, der das gemessen hatte, also baute ich einen Test, der scheitern konnte, an zwei Abenden und für rund vierzig Dollar Modellgebühren.

Drei Wege zur selben Arbeit

Als Aufgaben wählte ich kleine Prüfungen auf meiner eigenen Website: Ist dieser Link tot, gibt es diesen Seitenabschnitt noch, sagt die zitierte Quelle wirklich, was mein Artikel behauptet. Sechzehn davon, dazu acht einfache Aufgaben wie das Sortieren einer Liste, für die niemand Hilfe braucht.

Für die Prüfungen baute ich zwei Helfer-Agenten, einen Linkprüfer und einen Quellenprüfer, jeder unter einer eigenen Adresse erreichbar und mit einer öffentlichen Beschreibungskarte im A2A-Format, dem offenen Standard dafür, wie Agenten miteinander sprechen. Dann bearbeitete derselbe Agent, mit Claude Sonnet 5 als Modell darunter, also der KI, die das Denken übernimmt, alle 24 Aufgaben in drei Aufbauten. Allein, nur mit Web-Werkzeugen. Mit einem Verzeichnis, das er durchsuchen konnte, ohne Namen und Adressen. Und mit den beiden Helfern bereits in seinen Anweisungen genannt, sodass er sie ohne Suche rufen konnte.

Den dritten Aufbau brauchte ich dringender als den zweiten. Allein gegen Verzeichnis zu vergleichen sagt nicht, ob die Helfer oder das Verzeichnis den Unterschied gemacht haben. Der dritte Aufbau hat die Helfer ohne das Verzeichnis. Schneidet das Verzeichnis genauso gut ab wie die feste Liste, haben die Helfer den Unterschied gemacht. Schneidet es besser ab, hat das Verzeichnis etwas getan, was die Liste nicht tat.

Vor dem ersten Durchlauf schrieb ich sechs Regeln auf, die als Erfolg zählen sollten, darunter die, die gerissen ist: Der Agent mit dem Verzeichnis musste mindestens vier Aufgaben mehr lösen als der Agent allein. Er löste eine mehr, und bei einer strengeren Lesart des Lösungsschlüssels verschwindet selbst diese eine, und der Verzeichnis-Aufbau rutscht unter die Marke von zwölf von sechzehn. Kosten und Zeit blieben fast gleich, und die Hilfe wurde fast nie genutzt.

Worauf der Agent gewartet hat

Meine erste Lesart war, dass das Verzeichnis-Werkzeug schlecht beschrieben war. Also ließ ich die 24 Aufgaben noch einmal laufen, mit einer Werkzeugbeschreibung, die die Fähigkeiten der Helfer nannte. Der Agent suchte sechsmal statt einmal und erzielte exakt dasselbe Ergebnis. Er hatte die Arbeit die ganze Zeit selbst erledigen können.

Die zweite Lesart hielt. Ich schrieb ein zwölfteiliges Betriebshandbuch für eine erfundene Firma, legte es in einen dritten Helfer-Agenten und veröffentlichte es nirgendwo sonst. Zwölf Fragen ließen sich nur aus diesem Handbuch beantworten. Allein beantwortete mein Agent keine davon und erfand nichts; jede Antwort war ein ehrliches "lässt sich nicht feststellen". Mit dem Verzeichnis suchte er bei allen zwölf, fand den Handbuch-Agenten und beantwortete alle zwölf richtig. Bei vier Kontrollfragen, die er aus dem Web beantworten konnte und die genau das Beauftragen aus Reflex abfangen sollten, suchte er gar nicht. Eines gehört zu dieser Zwölf gesagt: Im ersten Durchlauf scheiterten vier der zwölf Läufe am Anfragelimit meiner eigenen Website, das der Test selbst ausgelöst hatte, sodass der Verzeichnis-Aufbau bei acht landete; ich hob das Limit an und wiederholte diesen Aufbau vollständig, beide Durchläufe liegen in den Ergebnissen.

Für diesen Agenten lautete die Regel also nicht "Agenten benutzen keine Verzeichnisse". Er holte sich Hilfe, wenn er eine Lücke hatte, die er nicht selbst schließen konnte, und nicht vorher. Aufgeschrieben klingt das selbstverständlich. Es ist nicht das, was ich beim Bauen erwartet hatte, und es ändert, was ein Verzeichnis zu bieten haben muss: etwas, das der Käufer nicht selbst holen kann.

Drei Wendungen, mit denen ich nicht gerechnet hatte

Die erste Wendung war der Käufer. Ich wiederholte den Handbuch-Test mit einem kleineren Modell als anfragendem Agenten, Claude Haiku 4.5. Es durchsuchte das Verzeichnis bei drei der zwölf Fragen und beantwortete zwei richtig, obwohl es allein keine beantworten konnte. Mit dem Helfer in den Anweisungen kam es auf elf. Ein größeres Modell, Claude Opus 5.5, verhielt sich wie Sonnet und suchte jedes Mal. In diesen Läufen hing es also nicht nur davon ab, ob ein Agent Hilfe brauchte, sondern auch vom Modell, das die Beauftragung übernimmt. Ein kleines Modell schaut womöglich einfach nie nach. Bei den gewöhnlichen Prüfaufgaben brachte übrigens weder Haiku noch Opus das Verzeichnis über die Verbesserungsregel.

Die zweite Wendung war die Auswahl. Ich registrierte einen zweiten Handbuch-Agenten mit einer älteren Ausgabe, sortierte ihn im Verzeichnis nach vorn und veröffentlichte eine öffentliche Seite mit acht veralteten Fakten. Der Agent mit dem Verzeichnis rief bei allen zwölf Fragen den aktuellen Helfer und nie den alten. Aber der alte Eintrag trug das Wort "superseded", also überholt, in seiner Beschreibung; das zeigte, dass der Agent liest, was ein Verzeichnis ihm sagt, nicht, dass er veraltete Hilfe von selbst wittert. Mit neutralen Beschreibungen, in denen nur noch eine Ausgabennummer, also die Version des Handbuchs, die beiden unterschied, wählte er trotzdem jedes Mal die neuere. Ob er das ganz ohne Hinweis täte, weiß ich noch nicht. Umsonst war die Hilfe hier nicht: In diesem Test kostete der Verzeichnis-Aufbau mehr als das Doppelte der Arbeit allein, weil jede Frage durch eine Suche und einen Aufruf ging.

Die dritte Wendung ist der Grund, warum es ein Verzeichnis überhaupt gibt. Ich fror die Helferliste ein, wie sie stand, so wie eine Liste aussähe, die jemand aufgeschrieben und dann nicht mehr gepflegt hat, zog dann den Handbuch-Agenten auf eine neue Adresse um und ließ die alte "gone" antworten. Der Agent mit der eingefrorenen Liste rief die tote Adresse und gab bei jeder Frage entweder auf oder verbrauchte seine zwei erlaubten Aufrufe: null von zwölf. Der Agent mit dem Verzeichnis fand die neue Adresse jedes Mal. Dann ersetzte ich den Helfer durch eine neuere Ausgabe und ließ den alten weiterlaufen, wie es ein echter Anbieter tun könnte. Meine eingefrorene Liste rief den alten Helfer, bekam selbstsichere Antworten aus dem alten Text und lag nur bei den vier Fakten richtig, die sich nicht geändert hatten. Der Verzeichnis-Aufbau kam auf zwölf von zwölf. Eine veraltete Liste bricht einmal laut und einmal leise, und ich glaube, der leise Fehler ist der, der dich etwas kostet.

Was kaputtging und was ich anders machen würde

Drei Dinge gehören ins Protokoll. Die Aufgaben, die Helfer und der Lösungsschlüssel stammen alle von mir und meinen Werkzeugen, und das ist die größte Grenze von allen. Mein erster Opus-Handbuchblock verlor 16 von 48 Läufen an ein Nutzungslimit meines Kontos und musste wiederholt werden; beide Durchläufe liegen in den Ergebnissen. Und als ich ein Modell eines anderen Herstellers, GPT-6 Astra über OpenAIs Codex-Werkzeug, bat, meine Auswertung blind gegen die rohen Laufdateien zu prüfen, ließ es den Entwurf durchfallen. Ein Satz behauptete, alle zwölf Verweigerungen seien "nach einer Websuche" gekommen; drei hatten nicht gesucht. Meine Berichte versprachen eine menschliche Blindbewertung, die nie stattgefunden hatte. Und bei einer strengeren Lesart des Lösungsschlüssels verschwindet der Vorsprung von einer Aufgabe aus dem ersten Lauf vollständig. Alle drei Punkte waren durch meine eigene Lektüre gerutscht. Alle drei stehen jetzt auf der Seite.

Dieser Text ging durch dieselbe Prüfung und fiel im ersten Anlauf ebenfalls durch; die Sätze, die sie fand, sind korrigiert. Würde ich es noch einmal machen, schriebe ich die Vorhersagen für jeden Test vor dem Lauf auf die Ergebnisseite statt in meine Notizen, damit ein Prüfer sie kontrollieren kann, ohne mir vertrauen zu müssen.

Unterm Strich

In meinen Tests hat sich ein Agentenverzeichnis nur dort bewährt, wo ein Helfer etwas bot, das der Käufer nicht selbst bekommen konnte, und nur bei Käufern, die überhaupt nachschauten. Sein Vorteil gegenüber einer Liste, die niemand pflegt, zeigte sich, als sich die verfügbaren Helfer änderten, als weniger leise Fehler, nicht als bessere Antworten an einem ruhigen Tag.

Für alle, die überlegen, das Wissen ihrer Firma als Agent bereitzustellen, ist das der ganze Auftrag. Biete, was das Web nicht hat. Beschreibe es so, dass eine Maschine es einordnen kann. Und rechne damit, dass das Modell des Käufers entscheidet, ob dein Agent je gesehen wird, nicht dein Agent selbst.

Das Experiment mit jeder Zahl und den Ergebnissen pro Aufgabe steht auf hireanagent.dev. Wofür würde dein Agent sich Hilfe holen, und was müsste er dafür selbst nicht bekommen können?