Kiwop Labs · Quartalsreihe
KI-Agenten im Betrieb
Was die Agenten von Nexo, der Plattform, mit der Kiwop arbeitet, wirklich tun: Läufe, Fehler, von einem Menschen unterschriebene oder verworfene Vorschläge, vom autonomen Worker gelieferte PRs, klassifizierte E-Mails und Kosten. Ein Fenster von 90 Tagen, vom 14. Juni 2026 bis 12. September 2026. Keine Namen, keine Texte, keine Versprechen.
Was das Quartal sagt
- 30 verschiedene Agenten liefen 1.191 Mal; 97,6 % endeten ohne Fehler. Der mittlere Lauf dauert 70 s, die langsamsten 10 % überschreiten 164 s.
- Agenten schlugen 293 Aufgabenkommentare vor; 98 waren an Kunden gerichtet, und ein Mensch unterschrieb 50 (51 %). Der Rest wurde verworfen oder wartet noch. Die Unterschrift dauert im Median 78,2 Stunden: die menschliche Prüfung ist keine Formalität.
- Der autonome Worker übernahm 25 delegierte Aufgaben und lieferte 19 PRs, mit 0,4 Stunden Median zwischen Übernahme und Lieferung. Der Direktor prüfte 30 Aufgaben und delegierte nur 4.
- Bei E-Mails bearbeitete der Klassifikator 120 eingehende Threads und legte 22 Aufgaben an; der Wächter prüfte 1.634 ausgehende und blockierte 102. Menschen akzeptierten 65,1 % seiner Vorschläge.
- Kosten: 1.097 € über API im Fenster abgerechnet, plus 1.378 € Abonnementverbrauch zu API-Preisen bewertet. Das CLI auf dem Server verbrauchte 2.546 $ zum Listenpreis, davon 39 % der autonome Worker.
Proaktive Agenten
Die Wächter: Agenten, die von selbst auslösen (per Cron, Ereignis oder durch einen anderen Lauf), den Projektstatus lesen und etwas vorschlagen oder warnen. Jeder Lauf speichert Status, Dauer und Warnstufe.
| Kennzahl | Wert |
|---|---|
| Läufe | 1.191 |
| Abgeschlossen | 1.163 |
| Fehlgeschlagen | 16 |
| Erfolg (%) | 97,6 |
| Aktive Agenten | 30 |
| Mediane Dauer (s) | 70 |
| Dauer p90 (s) | 164 |
| Nach Warnstufe | warning: 215 · ok: 858 · sin nivel: 28 · critical: 90 |
Von einem Menschen unterschriebene Vorschläge
Ein von einem Agenten geschriebener Kommentar entsteht ausstehend und unsichtbar, bis die Person, in deren Namen er erscheint, ihn in der Web-App unterschreibt. Per API lässt er sich nicht unterschreiben. Das ist die echte menschliche Akzeptanzrate, keine Schätzung.
| Kennzahl | Wert |
|---|---|
| Vorgeschlagene Kommentare | 293 |
| Interne Notizen | 195 |
| An den Kunden | 98 |
| Unterschrieben | 184 |
| Unterschrieben (%) | 62,8 |
| An den Kunden, unterschrieben | 50 |
| An den Kunden, unterschrieben (%) | 51 |
| Stunden bis zur Unterschrift (Median) | 78,2 |
Autonomer Worker und Aufgaben-Direktor
Der Direktor prüft jede neue Aufgabe und entscheidet, ob er sie an den Worker (ein Claude Code auf dem Server) delegiert oder einem Menschen überlässt. Der Worker übernimmt, arbeitet in einem isolierten Worktree und liefert einen PR. Niemand merged für ihn.
| Kennzahl | Wert |
|---|---|
| Vom Worker übernommene Aufgaben | 25 |
| Gelieferte PRs | 19 |
| Stunden von Übernahme bis Lieferung (Median) | 0,4 |
| Worker-Durchläufe | 17.634 |
| Mittlere Warteschlange | 0 |
| Vom Direktor geprüfte Aufgaben | 30 |
| An den Worker delegiert | 4 |
| An einen Menschen übergeben | 1 |
E-Mail: Klassifikator und Wächter
Der Klassifikator liest eingehende E-Mails und entscheidet, ob es Aufgabe, Antwort oder Rauschen ist, mit seiner Konfidenz. Der Wächter prüft ausgehende E-Mails vor dem Versand und gibt ok, Vorschlag oder Sperre zurück. Beides korrigiert ein Mensch.
| Kennzahl | Wert |
|---|---|
| Klassifizierte Threads | 120 |
| Nach Typ | reply: 56 · ignore: 38 · task: 26 |
| Nach Konfidenz | sin dato: 82 · high: 27 · low: 11 |
| Klassifikator fehlgeschlagen (%) | 0,8 |
| Mediane Latenz (ms) | 9.900 |
| Mit Entscheidung | 63 |
| Nach Entscheidung | thread_duplicate: 3 · sin decidir: 54 · mirrored: 9 · auto_attached: 32 · auto_created: 22 |
| Angelegte Aufgaben | 22 |
| Prüfungen | 1.634 |
| Nach Urteil | suggest: 117 · block: 102 · ok: 1.415 |
| Akzeptierte Vorschläge (%) | 65,1 |
| Mediane Latenz (ms) | 7.912 |
| Vorschläge pro Prüfung (Mittel) | 0,41 |
Anfragen an das Hauskriterium
Agenten und Team fragen das „Gehirn“ (das dokumentierte Kriterium des Hauses), bevor sie entscheiden. Erreicht die Antwort die Mindestähnlichkeit nicht, wird an einen Menschen eskaliert.
| Kennzahl | Wert |
|---|---|
| Anfragen | 231 |
| An einen Menschen eskaliert | 97 |
| Eskaliert (%) | 42 |
| Bewertet | 0 |
| Nützlich (%) | – |
| Mediane Ähnlichkeit | 0,52 |
Lead-Agent
Automatisches Nachfassen eingehender Leads: Entwürfe, die ein Mensch prüft, automatischer Stopp, wenn sie nicht geprüft werden, und Aussortieren von Anbietern und Rauschen.
| Kennzahl | Wert |
|---|---|
| Sequenzen | 45 |
| Nach Status | waiting: 3 · stopped: 37 · scheduled: 1 · replied: 4 |
| Gesendete Nachfassungen | 8 |
| Nach Stoppgrund | activa: 8 · borrador sin revisar durante 6 días: 1 · clasificado como «Proveedor»: no se contacta: 17 · not_business: 9 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 2 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 2 |
KI-Kosten
Metering pro Aufruf für alles, was durch das KI-Gateway von Nexo geht. Wir trennen das über API Abgerechnete von dem, was über Abonnements läuft (zu API-Preisen bewertet, um es vergleichen zu können, aber nicht pro Token bezahlt).
| Kennzahl | Wert |
|---|---|
| Aufrufe | 9.169 |
| Eingabe-Tokens | 544.278.896 |
| Ausgabe-Tokens | 9.413.571 |
| Über API abgerechnet (€) | 1.097,27 |
| Über Abonnement, API-Äquivalent (€) | 1.377,7 |
| Nach Anbieter | openai: 1 · anthropic: 9.168 |
| Verschiedene Modelle | 10 |
| Mediane Latenz (ms) | 14.623 |
| Cache-Lesungen (%) | 0 |
| Funktion | Aufrufe | Eingabe-Tokens | Ausgabe-Tokens | Kosten (€) |
|---|---|---|---|---|
| Proaktive Agenten | 4.288 | 290.013.290 | 7.137.445 | 1.431,31 |
| Chat | 1.930 | 92.911.386 | 461.443 | 401,42 |
| E-Mail-Wächter | 1.707 | 89.551.896 | 778.444 | 292,86 |
| E-Mail-Klassifikator | 678 | 29.726.208 | 392.811 | 158,66 |
| Projekt-Chat | 248 | 26.912.108 | 361.827 | 109,97 |
| Ausgehende E-Mail | 219 | 9.648.065 | 64.547 | 49,73 |
| Academy | 73 | 4.198.449 | 109.663 | 23,87 |
| Newsletter | 14 | 723.411 | 75.011 | 5,49 |
| SEO-Inhalte | 10 | 493.227 | 29.944 | 1,09 |
| CRO | 2 | 100.856 | 2.436 | 0,57 |
Und das andere Buch: die CLI-Sitzungen auf dem Server (autonomer Worker, Relay und Plattform-Binary), aus den Transkripten gemessen und zum Listenpreis bewertet.
| Herkunft | Sitzungen | Runden | Listenkosten ($) |
|---|---|---|---|
| Claude-Relay | 2.620 | 3.561 | 1.032,92 |
| Autonomer Worker | 542 | 5.494 | 995,24 |
| Plattform-Binary | 1.300 | 4.508 | 494,4 |
| Gehirn-Relay | 1.195 | 2.371 | 22,89 |
| Nicht klassifiziert | 6 | 10 | 0,16 |
| Total | 5.663 | 15.944 | 2.545,61 |
Die Crons, die alles tragen
Alles oben läuft auf geplanten Aufgaben. Das ist ihre vollständige Historie im Fenster: wie viele, wie viele absichtlich übersprungen wurden und wie viele scheiterten.
| Kennzahl | Wert |
|---|---|
| Läufe | 217.849 |
| Verschiedene geplante Aufgaben | 241 |
| Nach Ergebnis | skipped: 11.593 · failed: 118 · running: 1 · ok: 206.137 |
| Fehlgeschlagen (%) | 0,05 |
| Mediane Dauer (ms) | 1.963 |
Warum wir das veröffentlichen
- Weil fast alles, was man über Agenten im Betrieb liest, Versprechen sind. Das hier sind Zähler einer Plattform, die seit Monaten eine echte Agentur betreibt, mit ihren Fehlern und Verwerfungen.
- Weil die menschliche Unterschriftsrate die Zahl ist, die am meisten zählt und am seltensten veröffentlicht wird: wie viele Vorschläge eines Agenten die Person überleben, die sie liest.
- Weil die echten Kosten (zwei Bücher: API und Abonnement) entscheiden, ob sich ein Agent lohnt, und fast niemand sie zeigt.
Methode
- Eine reine Leseabfrage in SQL auf der Datenbank von Nexo, vollständig veröffentlicht. Sie läuft jedes Quartal über ein Fenster von 90 Tagen und erzeugt nur Aggregate.
- Nichts Identifizierbares: keine Kunden, keine Projekte, keine Texte, keine IDs. Verteilungen und Mediane.
- Die Daten stammen von einem Unternehmen (Kiwop) und einer Plattform (Nexo). Es ist keine Marktstichprobe, sondern ein vollständiger realer Fall.
- Die Definitionen (was ein Lauf ist, was eine Unterschrift ist, was ein gelieferter PR ist) stehen in der Abfrage und in der Labs-Dokumentation.
Grenzen
- Das Fenster umfasst Änderungen der Plattform selbst: neue Agenten, Korrekturen der Cache-Preise, Delegationsregeln. Ein Sprung zwischen Quartalen kann eine Änderung von uns sein, nicht der Welt.
- Abonnementkosten werden zum Vergleich zu API-Preisen bewertet; es ist kein gezahltes Geld.
- Nicht unterschriebene Kommentare umfassen verworfene und noch wartende: wir unterscheiden sie nicht.
- Die Dauer eines Laufs schließt das Warten auf die API ein.
Offene Daten
Zitieren
Kiwop Labs (2026-09). KI-Agenten im Betrieb: aggregierte Telemetrie aus Nexo. https://www.kiwop.com/de/labs/ki-agenten-im-betrieb
Daten unter CC BY 4.0. Abfrage und Methode offen.
Sprechen wir.
Technische Erstberatung
KI, Sicherheit und Performance. Diagnose mit phasenweisem Vorschlag.
- NDA verfügbar
- Antwort <24h
- Phasenweiser Vorschlag
Ihr erstes Meeting ist mit einem Solutions Architect, nicht mit einem Verkäufer.
Diagnose anfordern