Kiwop Labs · Quartalsreihe

KI-Agenten im Betrieb

Was die Agenten von Nexo, der Plattform, mit der Kiwop arbeitet, wirklich tun: Läufe, Fehler, von einem Menschen unterschriebene oder verworfene Vorschläge, vom autonomen Worker gelieferte PRs, klassifizierte E-Mails und Kosten. Ein Fenster von 90 Tagen, vom 14. Juni 2026 bis 12. September 2026. Keine Namen, keine Texte, keine Versprechen.

1.191Agentenläufe
97,6 %enden ohne Fehler
51 %Kundenvorschläge, von einem Menschen unterschrieben
19vom Worker gelieferte PRs
1.097€ API abgerechnet

Was das Quartal sagt

  1. 30 verschiedene Agenten liefen 1.191 Mal; 97,6 % endeten ohne Fehler. Der mittlere Lauf dauert 70 s, die langsamsten 10 % überschreiten 164 s.
  2. Agenten schlugen 293 Aufgabenkommentare vor; 98 waren an Kunden gerichtet, und ein Mensch unterschrieb 50 (51 %). Der Rest wurde verworfen oder wartet noch. Die Unterschrift dauert im Median 78,2 Stunden: die menschliche Prüfung ist keine Formalität.
  3. Der autonome Worker übernahm 25 delegierte Aufgaben und lieferte 19 PRs, mit 0,4 Stunden Median zwischen Übernahme und Lieferung. Der Direktor prüfte 30 Aufgaben und delegierte nur 4.
  4. Bei E-Mails bearbeitete der Klassifikator 120 eingehende Threads und legte 22 Aufgaben an; der Wächter prüfte 1.634 ausgehende und blockierte 102. Menschen akzeptierten 65,1 % seiner Vorschläge.
  5. Kosten: 1.097 € über API im Fenster abgerechnet, plus 1.378 € Abonnementverbrauch zu API-Preisen bewertet. Das CLI auf dem Server verbrauchte 2.546 $ zum Listenpreis, davon 39 % der autonome Worker.

Proaktive Agenten

Die Wächter: Agenten, die von selbst auslösen (per Cron, Ereignis oder durch einen anderen Lauf), den Projektstatus lesen und etwas vorschlagen oder warnen. Jeder Lauf speichert Status, Dauer und Warnstufe.

KennzahlWert
Läufe1.191
Abgeschlossen1.163
Fehlgeschlagen16
Erfolg (%)97,6
Aktive Agenten30
Mediane Dauer (s)70
Dauer p90 (s)164
Nach Warnstufewarning: 215 · ok: 858 · sin nivel: 28 · critical: 90

Von einem Menschen unterschriebene Vorschläge

Ein von einem Agenten geschriebener Kommentar entsteht ausstehend und unsichtbar, bis die Person, in deren Namen er erscheint, ihn in der Web-App unterschreibt. Per API lässt er sich nicht unterschreiben. Das ist die echte menschliche Akzeptanzrate, keine Schätzung.

KennzahlWert
Vorgeschlagene Kommentare293
Interne Notizen195
An den Kunden98
Unterschrieben184
Unterschrieben (%)62,8
An den Kunden, unterschrieben50
An den Kunden, unterschrieben (%)51
Stunden bis zur Unterschrift (Median)78,2

Autonomer Worker und Aufgaben-Direktor

Der Direktor prüft jede neue Aufgabe und entscheidet, ob er sie an den Worker (ein Claude Code auf dem Server) delegiert oder einem Menschen überlässt. Der Worker übernimmt, arbeitet in einem isolierten Worktree und liefert einen PR. Niemand merged für ihn.

KennzahlWert
Vom Worker übernommene Aufgaben25
Gelieferte PRs19
Stunden von Übernahme bis Lieferung (Median)0,4
Worker-Durchläufe17.634
Mittlere Warteschlange0
Vom Direktor geprüfte Aufgaben30
An den Worker delegiert4
An einen Menschen übergeben1

E-Mail: Klassifikator und Wächter

Der Klassifikator liest eingehende E-Mails und entscheidet, ob es Aufgabe, Antwort oder Rauschen ist, mit seiner Konfidenz. Der Wächter prüft ausgehende E-Mails vor dem Versand und gibt ok, Vorschlag oder Sperre zurück. Beides korrigiert ein Mensch.

KennzahlWert
Klassifizierte Threads120
Nach Typreply: 56 · ignore: 38 · task: 26
Nach Konfidenzsin dato: 82 · high: 27 · low: 11
Klassifikator fehlgeschlagen (%)0,8
Mediane Latenz (ms)9.900
Mit Entscheidung63
Nach Entscheidungthread_duplicate: 3 · sin decidir: 54 · mirrored: 9 · auto_attached: 32 · auto_created: 22
Angelegte Aufgaben22
Prüfungen1.634
Nach Urteilsuggest: 117 · block: 102 · ok: 1.415
Akzeptierte Vorschläge (%)65,1
Mediane Latenz (ms)7.912
Vorschläge pro Prüfung (Mittel)0,41

Anfragen an das Hauskriterium

Agenten und Team fragen das „Gehirn“ (das dokumentierte Kriterium des Hauses), bevor sie entscheiden. Erreicht die Antwort die Mindestähnlichkeit nicht, wird an einen Menschen eskaliert.

KennzahlWert
Anfragen231
An einen Menschen eskaliert97
Eskaliert (%)42
Bewertet0
Nützlich (%)
Mediane Ähnlichkeit0,52

Lead-Agent

Automatisches Nachfassen eingehender Leads: Entwürfe, die ein Mensch prüft, automatischer Stopp, wenn sie nicht geprüft werden, und Aussortieren von Anbietern und Rauschen.

KennzahlWert
Sequenzen45
Nach Statuswaiting: 3 · stopped: 37 · scheduled: 1 · replied: 4
Gesendete Nachfassungen8
Nach Stoppgrundactiva: 8 · borrador sin revisar durante 6 días: 1 · clasificado como «Proveedor»: no se contacta: 17 · not_business: 9 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 2 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 2

KI-Kosten

Metering pro Aufruf für alles, was durch das KI-Gateway von Nexo geht. Wir trennen das über API Abgerechnete von dem, was über Abonnements läuft (zu API-Preisen bewertet, um es vergleichen zu können, aber nicht pro Token bezahlt).

KennzahlWert
Aufrufe9.169
Eingabe-Tokens544.278.896
Ausgabe-Tokens9.413.571
Über API abgerechnet (€)1.097,27
Über Abonnement, API-Äquivalent (€)1.377,7
Nach Anbieteropenai: 1 · anthropic: 9.168
Verschiedene Modelle10
Mediane Latenz (ms)14.623
Cache-Lesungen (%)0
FunktionAufrufeEingabe-TokensAusgabe-TokensKosten (€)
Proaktive Agenten4.288290.013.2907.137.4451.431,31
Chat1.93092.911.386461.443401,42
E-Mail-Wächter1.70789.551.896778.444292,86
E-Mail-Klassifikator67829.726.208392.811158,66
Projekt-Chat24826.912.108361.827109,97
Ausgehende E-Mail2199.648.06564.54749,73
Academy734.198.449109.66323,87
Newsletter14723.41175.0115,49
SEO-Inhalte10493.22729.9441,09
CRO2100.8562.4360,57

Und das andere Buch: die CLI-Sitzungen auf dem Server (autonomer Worker, Relay und Plattform-Binary), aus den Transkripten gemessen und zum Listenpreis bewertet.

HerkunftSitzungenRundenListenkosten ($)
Claude-Relay2.6203.5611.032,92
Autonomer Worker5425.494995,24
Plattform-Binary1.3004.508494,4
Gehirn-Relay1.1952.37122,89
Nicht klassifiziert6100,16
Total5.66315.9442.545,61

Die Crons, die alles tragen

Alles oben läuft auf geplanten Aufgaben. Das ist ihre vollständige Historie im Fenster: wie viele, wie viele absichtlich übersprungen wurden und wie viele scheiterten.

KennzahlWert
Läufe217.849
Verschiedene geplante Aufgaben241
Nach Ergebnisskipped: 11.593 · failed: 118 · running: 1 · ok: 206.137
Fehlgeschlagen (%)0,05
Mediane Dauer (ms)1.963

Warum wir das veröffentlichen

  • Weil fast alles, was man über Agenten im Betrieb liest, Versprechen sind. Das hier sind Zähler einer Plattform, die seit Monaten eine echte Agentur betreibt, mit ihren Fehlern und Verwerfungen.
  • Weil die menschliche Unterschriftsrate die Zahl ist, die am meisten zählt und am seltensten veröffentlicht wird: wie viele Vorschläge eines Agenten die Person überleben, die sie liest.
  • Weil die echten Kosten (zwei Bücher: API und Abonnement) entscheiden, ob sich ein Agent lohnt, und fast niemand sie zeigt.

Methode

  • Eine reine Leseabfrage in SQL auf der Datenbank von Nexo, vollständig veröffentlicht. Sie läuft jedes Quartal über ein Fenster von 90 Tagen und erzeugt nur Aggregate.
  • Nichts Identifizierbares: keine Kunden, keine Projekte, keine Texte, keine IDs. Verteilungen und Mediane.
  • Die Daten stammen von einem Unternehmen (Kiwop) und einer Plattform (Nexo). Es ist keine Marktstichprobe, sondern ein vollständiger realer Fall.
  • Die Definitionen (was ein Lauf ist, was eine Unterschrift ist, was ein gelieferter PR ist) stehen in der Abfrage und in der Labs-Dokumentation.

Grenzen

  • Das Fenster umfasst Änderungen der Plattform selbst: neue Agenten, Korrekturen der Cache-Preise, Delegationsregeln. Ein Sprung zwischen Quartalen kann eine Änderung von uns sein, nicht der Welt.
  • Abonnementkosten werden zum Vergleich zu API-Preisen bewertet; es ist kein gezahltes Geld.
  • Nicht unterschriebene Kommentare umfassen verworfene und noch wartende: wir unterscheiden sie nicht.
  • Die Dauer eines Laufs schließt das Warten auf die API ein.

Offene Daten

Zitieren

Kiwop Labs (2026-09). KI-Agenten im Betrieb: aggregierte Telemetrie aus Nexo. https://www.kiwop.com/de/labs/ki-agenten-im-betrieb

Daten unter CC BY 4.0. Abfrage und Methode offen.

← Zurück zu Kiwop Labs

Sprechen wir.

Technische Erstberatung

KI, Sicherheit und Performance. Diagnose mit phasenweisem Vorschlag.

  • NDA verfügbar
  • Antwort <24h
  • Phasenweiser Vorschlag

Ihr erstes Meeting ist mit einem Solutions Architect, nicht mit einem Verkäufer.

Diagnose anfordern