Kiwop Labs · kwartaalreeks

AI-agenten in productie

Wat de agenten van Nexo, het platform waarmee Kiwop werkt, echt doen: runs, fouten, voorstellen die een mens ondertekent of verwerpt, PR’s van de autonome worker, geclassificeerde e-mail en kosten. Een venster van 90 dagen, van 14 juni 2026 tot 12 september 2026. Geen namen, geen teksten, geen beloftes.

1.191agentruns
97,6 %eindigen zonder fout
51 %klantvoorstellen ondertekend door een mens
19PR’s opgeleverd door de worker
1.097€ API gefactureerd

Wat het kwartaal zegt

  1. 30 verschillende agenten draaiden 1.191 keer; 97,6 % eindigde zonder fout. De mediane run duurt 70 s en de traagste 10 % gaat boven 164 s.
  2. Agenten stelden 293 taakopmerkingen voor; 98 waren voor de klant en een mens ondertekende er 50 (51 %). De rest is verworpen of wacht nog. Ondertekenen duurt mediaan 78,2 uur: menselijke beoordeling is geen formaliteit.
  3. De autonome worker claimde 25 gedelegeerde taken en leverde 19 PR’s op, met mediaan 0,4 uur tussen claimen en opleveren. De directeur beoordeelde 30 taken en delegeerde er slechts 4.
  4. Bij e-mail behandelde de classificeerder 120 inkomende threads en maakte 22 taken aan; de bewaker beoordeelde 1.634 uitgaande berichten en blokkeerde er 102. Mensen accepteerden 65,1 % van zijn suggesties.
  5. Kosten: 1.097 € via API gefactureerd in het venster, plus 1.378 € abonnementsverbruik gewaardeerd tegen API-prijzen. De CLI op de server verbruikte 2.546 $ tegen lijstprijs, waarvan 39 % door de autonome worker.

Proactieve agenten

De wachters: agenten die zelf afgaan (per cron, per gebeurtenis of door een andere run), de projectstatus lezen en iets voorstellen of waarschuwen. Elke run slaat status, duur en waarschuwingsniveau op.

MeetwaardeWaarde
Runs1.191
Voltooid1.163
Mislukt16
Succes (%)97,6
Actieve agenten30
Mediane duur (s)70
Duur p90 (s)164
Per waarschuwingsniveauwarning: 215 · ok: 858 · sin nivel: 28 · critical: 90

Voorstellen ondertekend door een mens

Een door een agent geschreven opmerking ontstaat als in afwachting en onzichtbaar, tot de persoon op wiens naam hij verschijnt hem in de webapp ondertekent. Ondertekenen via API bestaat niet. Dit is het echte menselijke acceptatiepercentage, geen schatting.

MeetwaardeWaarde
Voorgestelde opmerkingen293
Interne notities195
Voor de klant98
Ondertekend184
Ondertekend (%)62,8
Voor de klant, ondertekend50
Voor de klant, ondertekend (%)51
Uren tot ondertekening (mediaan)78,2

Autonome worker en taakdirecteur

De directeur beoordeelt elke nieuwe taak en beslist of hij ze delegeert aan de worker (een Claude Code op de server) of aan een mens laat. De worker claimt, werkt in een geïsoleerde worktree en levert een PR op. Niemand merget voor hem.

MeetwaardeWaarde
Door de worker geclaimde taken25
Opgeleverde PR’s19
Uren van claimen tot opleveren (mediaan)0,4
Worker-passes17.634
Gemiddelde wachtrij0
Door de directeur beoordeelde taken30
Gedelegeerd aan de worker4
Overgedragen aan een mens1

E-mail: classificeerder en bewaker

De classificeerder leest inkomende e-mail en beslist of het een taak, een antwoord of ruis is, met zijn vertrouwen. De bewaker beoordeelt uitgaande e-mail voor verzending en geeft ok, suggestie of blokkade terug. Beide worden door een mens gecorrigeerd.

MeetwaardeWaarde
Geclassificeerde threads120
Per typereply: 56 · ignore: 38 · task: 26
Per vertrouwensin dato: 82 · high: 27 · low: 11
Classificeerder mislukt (%)0,8
Mediane latentie (ms)9.900
Met beslissing63
Per beslissingthread_duplicate: 3 · sin decidir: 54 · mirrored: 9 · auto_attached: 32 · auto_created: 22
Aangemaakte taken22
Beoordelingen1.634
Per oordeelsuggest: 117 · block: 102 · ok: 1.415
Geaccepteerde suggesties (%)65,1
Mediane latentie (ms)7.912
Suggesties per beoordeling (gemiddeld)0,41

Vragen aan het huiscriterium

Agenten en het team vragen het “brein” (het gedocumenteerde criterium van het huis) voordat ze beslissen. Haalt het antwoord de minimale gelijkenis niet, dan wordt het naar een mens geëscaleerd.

MeetwaardeWaarde
Vragen231
Geëscaleerd naar een mens97
Geëscaleerd (%)42
Beoordeeld0
Nuttig (%)
Mediane gelijkenis0,52

Lead-agent

Automatische opvolging van inkomende leads: concepten die een mens beoordeelt, automatische stop als ze niet beoordeeld worden, en het afvoeren van leveranciers en ruis.

MeetwaardeWaarde
Reeksen45
Per statuswaiting: 3 · stopped: 37 · scheduled: 1 · replied: 4
Verzonden opvolgingen8
Per stopredenactiva: 8 · borrador sin revisar durante 6 días: 1 · clasificado como «Proveedor»: no se contacta: 17 · not_business: 9 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 2 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 2

Kosten van AI

Metering per aanroep van alles wat door de AI-gateway van Nexo gaat. We scheiden wat via API gefactureerd wordt van wat via abonnementen loopt (gewaardeerd tegen API-prijzen om te kunnen vergelijken, maar niet per token betaald).

MeetwaardeWaarde
Aanroepen9.169
Invoertokens544.278.896
Uitvoertokens9.413.571
Via API gefactureerd (€)1.097,27
Via abonnement, API-equivalent (€)1.377,7
Per aanbiederopenai: 1 · anthropic: 9.168
Verschillende modellen10
Mediane latentie (ms)14.623
Cache-lezingen (%)0
FunctieAanroepenInvoertokensUitvoertokensKosten (€)
Proactieve agenten4.288290.013.2907.137.4451.431,31
Chat1.93092.911.386461.443401,42
E-mailbewaker1.70789.551.896778.444292,86
E-mailclassificeerder67829.726.208392.811158,66
Projectchat24826.912.108361.827109,97
Uitgaande e-mail2199.648.06564.54749,73
Academy734.198.449109.66323,87
Nieuwsbrief14723.41175.0115,49
SEO-content10493.22729.9441,09
CRO2100.8562.4360,57

En het andere boek: de CLI-sessies op de server (de autonome worker, de relay en de platformbinary), gemeten uit de transcripten en gewaardeerd tegen lijstprijs.

HerkomstSessiesBeurtenLijstkosten ($)
Claude-relay2.6203.5611.032,92
Autonome worker5425.494995,24
Platformbinary1.3004.508494,4
Brein-relay1.1952.37122,89
Niet geclassificeerd6100,16
Total5.66315.9442.545,61

De crons die alles dragen

Alles hierboven draait op geplande taken. Dit is hun volledige geschiedenis in het venster: hoeveel, hoeveel bewust overgeslagen en hoeveel mislukt.

MeetwaardeWaarde
Runs217.849
Verschillende geplande taken241
Per resultaatskipped: 11.593 · failed: 118 · running: 1 · ok: 206.137
Mislukt (%)0,05
Mediane duur (ms)1.963

Waarom we dit publiceren

  • Omdat bijna alles wat over agenten in productie te lezen is, beloftes zijn. Dit zijn tellers van een platform dat al maanden een echt bureau draait, met zijn fouten en verwerpingen.
  • Omdat het menselijke ondertekeningspercentage het cijfer is dat het meest telt en het minst wordt gepubliceerd: hoeveel voorstellen van een agent de persoon die ze leest overleven.
  • Omdat de echte kosten (twee boeken: API en abonnement) bepalen of een agent loont, en bijna niemand ze laat zien.

Methode

  • Eén alleen-lezen SQL-query op de database van Nexo, volledig gepubliceerd. Hij draait elk kwartaal over een venster van 90 dagen en levert alleen aggregaten.
  • Niets identificeerbaars: geen klanten, geen projecten, geen teksten, geen id’s. Verdelingen en medianen.
  • De data komt van één bedrijf (Kiwop) en één platform (Nexo). Het is geen marktsteekproef; het is één volledige echte case.
  • De definities (wat een run is, wat een ondertekening is, wat een opgeleverde PR is) staan in de query en in de Labs-documentatie.

Beperkingen

  • Het venster overspant wijzigingen van het platform zelf: nieuwe agenten, correcties van de cacheprijs, delegatieregels. Een sprong tussen kwartalen kan een verandering van ons zijn, niet van de wereld.
  • Abonnementskosten worden tegen API-prijzen gewaardeerd om te vergelijken; het is geen betaald geld.
  • Niet-ondertekende opmerkingen omvatten verworpen en nog wachtende: we maken geen onderscheid.
  • De duur van een run omvat het wachten op de API.

Open data

Citeren

Kiwop Labs (2026-09). AI-agenten in productie: geaggregeerde telemetrie uit Nexo. https://www.kiwop.com/nl/labs/ai-agenten-in-productie

Data onder CC BY 4.0. Query en methode open.

← Terug naar Kiwop Labs

Laten we praten.

Technisch intakegesprek

AI, beveiliging en prestaties. Diagnose met gefaseerd voorstel.

  • NDA beschikbaar
  • Antwoord <24u
  • Gefaseerd voorstel

Je eerste gesprek is met een Solutions Architect, niet met een verkoper.

Diagnose aanvragen