Kiwop Labs · kwartaalreeks
AI-agenten in productie
Wat de agenten van Nexo, het platform waarmee Kiwop werkt, echt doen: runs, fouten, voorstellen die een mens ondertekent of verwerpt, PR’s van de autonome worker, geclassificeerde e-mail en kosten. Een venster van 90 dagen, van 14 juni 2026 tot 12 september 2026. Geen namen, geen teksten, geen beloftes.
Wat het kwartaal zegt
- 30 verschillende agenten draaiden 1.191 keer; 97,6 % eindigde zonder fout. De mediane run duurt 70 s en de traagste 10 % gaat boven 164 s.
- Agenten stelden 293 taakopmerkingen voor; 98 waren voor de klant en een mens ondertekende er 50 (51 %). De rest is verworpen of wacht nog. Ondertekenen duurt mediaan 78,2 uur: menselijke beoordeling is geen formaliteit.
- De autonome worker claimde 25 gedelegeerde taken en leverde 19 PR’s op, met mediaan 0,4 uur tussen claimen en opleveren. De directeur beoordeelde 30 taken en delegeerde er slechts 4.
- Bij e-mail behandelde de classificeerder 120 inkomende threads en maakte 22 taken aan; de bewaker beoordeelde 1.634 uitgaande berichten en blokkeerde er 102. Mensen accepteerden 65,1 % van zijn suggesties.
- Kosten: 1.097 € via API gefactureerd in het venster, plus 1.378 € abonnementsverbruik gewaardeerd tegen API-prijzen. De CLI op de server verbruikte 2.546 $ tegen lijstprijs, waarvan 39 % door de autonome worker.
Proactieve agenten
De wachters: agenten die zelf afgaan (per cron, per gebeurtenis of door een andere run), de projectstatus lezen en iets voorstellen of waarschuwen. Elke run slaat status, duur en waarschuwingsniveau op.
| Meetwaarde | Waarde |
|---|---|
| Runs | 1.191 |
| Voltooid | 1.163 |
| Mislukt | 16 |
| Succes (%) | 97,6 |
| Actieve agenten | 30 |
| Mediane duur (s) | 70 |
| Duur p90 (s) | 164 |
| Per waarschuwingsniveau | warning: 215 · ok: 858 · sin nivel: 28 · critical: 90 |
Voorstellen ondertekend door een mens
Een door een agent geschreven opmerking ontstaat als in afwachting en onzichtbaar, tot de persoon op wiens naam hij verschijnt hem in de webapp ondertekent. Ondertekenen via API bestaat niet. Dit is het echte menselijke acceptatiepercentage, geen schatting.
| Meetwaarde | Waarde |
|---|---|
| Voorgestelde opmerkingen | 293 |
| Interne notities | 195 |
| Voor de klant | 98 |
| Ondertekend | 184 |
| Ondertekend (%) | 62,8 |
| Voor de klant, ondertekend | 50 |
| Voor de klant, ondertekend (%) | 51 |
| Uren tot ondertekening (mediaan) | 78,2 |
Autonome worker en taakdirecteur
De directeur beoordeelt elke nieuwe taak en beslist of hij ze delegeert aan de worker (een Claude Code op de server) of aan een mens laat. De worker claimt, werkt in een geïsoleerde worktree en levert een PR op. Niemand merget voor hem.
| Meetwaarde | Waarde |
|---|---|
| Door de worker geclaimde taken | 25 |
| Opgeleverde PR’s | 19 |
| Uren van claimen tot opleveren (mediaan) | 0,4 |
| Worker-passes | 17.634 |
| Gemiddelde wachtrij | 0 |
| Door de directeur beoordeelde taken | 30 |
| Gedelegeerd aan de worker | 4 |
| Overgedragen aan een mens | 1 |
E-mail: classificeerder en bewaker
De classificeerder leest inkomende e-mail en beslist of het een taak, een antwoord of ruis is, met zijn vertrouwen. De bewaker beoordeelt uitgaande e-mail voor verzending en geeft ok, suggestie of blokkade terug. Beide worden door een mens gecorrigeerd.
| Meetwaarde | Waarde |
|---|---|
| Geclassificeerde threads | 120 |
| Per type | reply: 56 · ignore: 38 · task: 26 |
| Per vertrouwen | sin dato: 82 · high: 27 · low: 11 |
| Classificeerder mislukt (%) | 0,8 |
| Mediane latentie (ms) | 9.900 |
| Met beslissing | 63 |
| Per beslissing | thread_duplicate: 3 · sin decidir: 54 · mirrored: 9 · auto_attached: 32 · auto_created: 22 |
| Aangemaakte taken | 22 |
| Beoordelingen | 1.634 |
| Per oordeel | suggest: 117 · block: 102 · ok: 1.415 |
| Geaccepteerde suggesties (%) | 65,1 |
| Mediane latentie (ms) | 7.912 |
| Suggesties per beoordeling (gemiddeld) | 0,41 |
Vragen aan het huiscriterium
Agenten en het team vragen het “brein” (het gedocumenteerde criterium van het huis) voordat ze beslissen. Haalt het antwoord de minimale gelijkenis niet, dan wordt het naar een mens geëscaleerd.
| Meetwaarde | Waarde |
|---|---|
| Vragen | 231 |
| Geëscaleerd naar een mens | 97 |
| Geëscaleerd (%) | 42 |
| Beoordeeld | 0 |
| Nuttig (%) | – |
| Mediane gelijkenis | 0,52 |
Lead-agent
Automatische opvolging van inkomende leads: concepten die een mens beoordeelt, automatische stop als ze niet beoordeeld worden, en het afvoeren van leveranciers en ruis.
| Meetwaarde | Waarde |
|---|---|
| Reeksen | 45 |
| Per status | waiting: 3 · stopped: 37 · scheduled: 1 · replied: 4 |
| Verzonden opvolgingen | 8 |
| Per stopreden | activa: 8 · borrador sin revisar durante 6 días: 1 · clasificado como «Proveedor»: no se contacta: 17 · not_business: 9 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 2 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 2 |
Kosten van AI
Metering per aanroep van alles wat door de AI-gateway van Nexo gaat. We scheiden wat via API gefactureerd wordt van wat via abonnementen loopt (gewaardeerd tegen API-prijzen om te kunnen vergelijken, maar niet per token betaald).
| Meetwaarde | Waarde |
|---|---|
| Aanroepen | 9.169 |
| Invoertokens | 544.278.896 |
| Uitvoertokens | 9.413.571 |
| Via API gefactureerd (€) | 1.097,27 |
| Via abonnement, API-equivalent (€) | 1.377,7 |
| Per aanbieder | openai: 1 · anthropic: 9.168 |
| Verschillende modellen | 10 |
| Mediane latentie (ms) | 14.623 |
| Cache-lezingen (%) | 0 |
| Functie | Aanroepen | Invoertokens | Uitvoertokens | Kosten (€) |
|---|---|---|---|---|
| Proactieve agenten | 4.288 | 290.013.290 | 7.137.445 | 1.431,31 |
| Chat | 1.930 | 92.911.386 | 461.443 | 401,42 |
| E-mailbewaker | 1.707 | 89.551.896 | 778.444 | 292,86 |
| E-mailclassificeerder | 678 | 29.726.208 | 392.811 | 158,66 |
| Projectchat | 248 | 26.912.108 | 361.827 | 109,97 |
| Uitgaande e-mail | 219 | 9.648.065 | 64.547 | 49,73 |
| Academy | 73 | 4.198.449 | 109.663 | 23,87 |
| Nieuwsbrief | 14 | 723.411 | 75.011 | 5,49 |
| SEO-content | 10 | 493.227 | 29.944 | 1,09 |
| CRO | 2 | 100.856 | 2.436 | 0,57 |
En het andere boek: de CLI-sessies op de server (de autonome worker, de relay en de platformbinary), gemeten uit de transcripten en gewaardeerd tegen lijstprijs.
| Herkomst | Sessies | Beurten | Lijstkosten ($) |
|---|---|---|---|
| Claude-relay | 2.620 | 3.561 | 1.032,92 |
| Autonome worker | 542 | 5.494 | 995,24 |
| Platformbinary | 1.300 | 4.508 | 494,4 |
| Brein-relay | 1.195 | 2.371 | 22,89 |
| Niet geclassificeerd | 6 | 10 | 0,16 |
| Total | 5.663 | 15.944 | 2.545,61 |
De crons die alles dragen
Alles hierboven draait op geplande taken. Dit is hun volledige geschiedenis in het venster: hoeveel, hoeveel bewust overgeslagen en hoeveel mislukt.
| Meetwaarde | Waarde |
|---|---|
| Runs | 217.849 |
| Verschillende geplande taken | 241 |
| Per resultaat | skipped: 11.593 · failed: 118 · running: 1 · ok: 206.137 |
| Mislukt (%) | 0,05 |
| Mediane duur (ms) | 1.963 |
Waarom we dit publiceren
- Omdat bijna alles wat over agenten in productie te lezen is, beloftes zijn. Dit zijn tellers van een platform dat al maanden een echt bureau draait, met zijn fouten en verwerpingen.
- Omdat het menselijke ondertekeningspercentage het cijfer is dat het meest telt en het minst wordt gepubliceerd: hoeveel voorstellen van een agent de persoon die ze leest overleven.
- Omdat de echte kosten (twee boeken: API en abonnement) bepalen of een agent loont, en bijna niemand ze laat zien.
Methode
- Eén alleen-lezen SQL-query op de database van Nexo, volledig gepubliceerd. Hij draait elk kwartaal over een venster van 90 dagen en levert alleen aggregaten.
- Niets identificeerbaars: geen klanten, geen projecten, geen teksten, geen id’s. Verdelingen en medianen.
- De data komt van één bedrijf (Kiwop) en één platform (Nexo). Het is geen marktsteekproef; het is één volledige echte case.
- De definities (wat een run is, wat een ondertekening is, wat een opgeleverde PR is) staan in de query en in de Labs-documentatie.
Beperkingen
- Het venster overspant wijzigingen van het platform zelf: nieuwe agenten, correcties van de cacheprijs, delegatieregels. Een sprong tussen kwartalen kan een verandering van ons zijn, niet van de wereld.
- Abonnementskosten worden tegen API-prijzen gewaardeerd om te vergelijken; het is geen betaald geld.
- Niet-ondertekende opmerkingen omvatten verworpen en nog wachtende: we maken geen onderscheid.
- De duur van een run omvat het wachten op de API.
Open data
Citeren
Kiwop Labs (2026-09). AI-agenten in productie: geaggregeerde telemetrie uit Nexo. https://www.kiwop.com/nl/labs/ai-agenten-in-productie
Data onder CC BY 4.0. Query en methode open.
Laten we praten.
Technisch intakegesprek
AI, beveiliging en prestaties. Diagnose met gefaseerd voorstel.
- NDA beschikbaar
- Antwoord <24u
- Gefaseerd voorstel
Je eerste gesprek is met een Solutions Architect, niet met een verkoper.
Diagnose aanvragen