Kiwop Labs · série trimestrielle
Agents IA en production
Ce que font vraiment les agents de Nexo, la plateforme avec laquelle Kiwop opère : exécutions, échecs, propositions signées ou écartées par une personne, PR livrées par le worker autonome, courrier classé et coût. Fenêtre de 90 jours, du 14 juin 2026 au 12 septembre 2026. Sans noms, sans textes, sans promesses.
Ce que dit le trimestre
- 30 agents différents ont tourné 1 191 fois ; 97,6 % se sont terminés sans erreur. L’exécution médiane dure 70 s et les 10 % les plus lentes dépassent 164 s.
- Les agents ont proposé 293 commentaires de tâche ; 98 étaient destinés au client et une personne en a signé 50 (51 %). Le reste a été écarté ou attend encore. La signature prend une médiane de 78,2 heures : la relecture humaine n’est pas une formalité.
- Le worker autonome a réclamé 25 tâches déléguées et livré 19 PR, avec 0,4 heures de médiane entre réclamer et livrer. Le directeur a examiné 30 tâches et n’en a délégué que 4.
- Côté courrier, le classificateur a traité 120 fils entrants et créé 22 tâches ; le gardien a examiné 1 634 sortants et en a bloqué 102. Les personnes ont accepté 65,1 % de ses suggestions.
- Coût : 1 097 € facturés par API sur la fenêtre, plus 1 378 € de consommation par abonnement valorisée au prix API. Le CLI sur le serveur a consommé 2 546 $ au prix catalogue, dont 39 % pour le worker autonome.
Agents proactifs
Les vigies : des agents qui se déclenchent seuls (par cron, par événement ou par une autre exécution), lisent l’état du projet et proposent quelque chose ou alertent. Chaque exécution enregistre statut, durée et niveau d’alerte.
| Métrique | Valeur |
|---|---|
| Exécutions | 1 191 |
| Terminées | 1 163 |
| Échouées | 16 |
| Succès (%) | 97,6 |
| Agents actifs | 30 |
| Durée médiane (s) | 70 |
| Durée p90 (s) | 164 |
| Par niveau d’alerte | warning: 215 · ok: 858 · sin nivel: 28 · critical: 90 |
Propositions signées par une personne
Un commentaire écrit par un agent naît en attente et invisible jusqu’à ce que la personne au nom de laquelle il paraît le signe dans l’application. Il n’existe aucun moyen de le signer par API. C’est le vrai taux d’acceptation humaine, pas une estimation.
| Métrique | Valeur |
|---|---|
| Commentaires proposés | 293 |
| Notes internes | 195 |
| Pour le client | 98 |
| Signés | 184 |
| Signés (%) | 62,8 |
| Pour le client, signés | 50 |
| Pour le client, signés (%) | 51 |
| Heures jusqu’à la signature (médiane) | 78,2 |
Worker autonome et directeur de tâches
Le directeur examine chaque nouvelle tâche et décide s’il la délègue au worker (un Claude Code sur le serveur) ou la laisse à une personne. Le worker réclame, travaille dans un worktree isolé et livre une PR. Personne ne merge à sa place.
| Métrique | Valeur |
|---|---|
| Tâches réclamées par le worker | 25 |
| PR livrées | 19 |
| Heures entre réclamer et livrer (médiane) | 0,4 |
| Passages du worker | 17 634 |
| File moyenne | 0 |
| Tâches examinées par le directeur | 30 |
| Déléguées au worker | 4 |
| Renvoyées à une personne | 1 |
Courrier : classificateur et gardien
Le classificateur lit le courrier entrant et décide s’il s’agit d’une tâche, d’une réponse ou de bruit, avec sa confiance. Le gardien examine le sortant avant l’envoi et renvoie ok, suggestion ou blocage. Les deux sont corrigés par une personne.
| Métrique | Valeur |
|---|---|
| Fils classés | 120 |
| Par type | reply: 56 · ignore: 38 · task: 26 |
| Par confiance | sin dato: 82 · high: 27 · low: 11 |
| Classificateur en échec (%) | 0,8 |
| Latence médiane (ms) | 9 900 |
| Avec décision | 63 |
| Par décision | thread_duplicate: 3 · sin decidir: 54 · mirrored: 9 · auto_attached: 32 · auto_created: 22 |
| Tâches créées | 22 |
| Examens | 1 634 |
| Par verdict | suggest: 117 · block: 102 · ok: 1 415 |
| Suggestions acceptées (%) | 65,1 |
| Latence médiane (ms) | 7 912 |
| Suggestions par examen (moyenne) | 0,41 |
Consultations du critère maison
Les agents et l’équipe interrogent le « cerveau » (le critère documenté de la maison) avant de décider. Si la réponse n’atteint pas la similarité minimale, elle est remontée à une personne.
| Métrique | Valeur |
|---|---|
| Consultations | 231 |
| Remontées à une personne | 97 |
| Remontées (%) | 42 |
| Évaluées | 0 |
| Utiles (%) | – |
| Similarité médiane | 0,52 |
Agent leads
Suivi automatique des leads entrants : brouillons qu’une personne relit, arrêt automatique s’ils ne sont pas relus, et écart des fournisseurs et du bruit.
| Métrique | Valeur |
|---|---|
| Séquences | 45 |
| Par état | waiting: 3 · stopped: 37 · scheduled: 1 · replied: 4 |
| Relances envoyées | 8 |
| Par motif d’arrêt | activa: 8 · borrador sin revisar durante 6 días: 1 · clasificado como «Proveedor»: no se contacta: 17 · not_business: 9 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 2 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 2 |
Coût de l’IA
Comptage par appel de tout ce qui passe par la passerelle IA de Nexo. Nous séparons ce qui est facturé par API de ce qui passe par abonnement (valorisé au prix API pour pouvoir comparer, mais non payé au token).
| Métrique | Valeur |
|---|---|
| Appels | 9 169 |
| Tokens d’entrée | 544 278 896 |
| Tokens de sortie | 9 413 571 |
| Facturé par API (€) | 1 097,27 |
| Par abonnement, équivalent API (€) | 1 377,7 |
| Par fournisseur | openai: 1 · anthropic: 9 168 |
| Modèles distincts | 10 |
| Latence médiane (ms) | 14 623 |
| Lectures de cache (%) | 0 |
| Fonction | Appels | Tokens entrée | Tokens sortie | Coût (€) |
|---|---|---|---|---|
| Agents proactifs | 4 288 | 290 013 290 | 7 137 445 | 1 431,31 |
| Chat | 1 930 | 92 911 386 | 461 443 | 401,42 |
| Gardien du courrier | 1 707 | 89 551 896 | 778 444 | 292,86 |
| Classificateur de courrier | 678 | 29 726 208 | 392 811 | 158,66 |
| Chat de projet | 248 | 26 912 108 | 361 827 | 109,97 |
| Courrier sortant | 219 | 9 648 065 | 64 547 | 49,73 |
| Academy | 73 | 4 198 449 | 109 663 | 23,87 |
| Newsletter | 14 | 723 411 | 75 011 | 5,49 |
| Contenu SEO | 10 | 493 227 | 29 944 | 1,09 |
| CRO | 2 | 100 856 | 2 436 | 0,57 |
Et l’autre registre : les sessions du CLI sur le serveur (le worker autonome, le relais et le binaire de la plateforme), mesurées à partir des transcriptions et valorisées au prix catalogue.
| Origine | Sessions | Tours | Coût catalogue ($) |
|---|---|---|---|
| Relais Claude | 2 620 | 3 561 | 1 032,92 |
| Worker autonome | 542 | 5 494 | 995,24 |
| Binaire de la plateforme | 1 300 | 4 508 | 494,4 |
| Relais du cerveau | 1 195 | 2 371 | 22,89 |
| Non classé | 6 | 10 | 0,16 |
| Total | 5 663 | 15 944 | 2 545,61 |
Les crons qui tiennent le tout
Tout ce qui précède tourne sur des tâches planifiées. Voici leur historique complet sur la fenêtre : combien, combien ont été sautées volontairement et combien ont échoué.
| Métrique | Valeur |
|---|---|
| Exécutions | 217 849 |
| Tâches planifiées distinctes | 241 |
| Par résultat | skipped: 11 593 · failed: 118 · running: 1 · ok: 206 137 |
| Échouées (%) | 0,05 |
| Durée médiane (ms) | 1 963 |
Pourquoi nous publions cela
- Parce que presque tout ce qu’on lit sur les agents en production est une promesse. Ceci sont les compteurs d’une plateforme qui fait tourner une vraie agence depuis des mois, avec ses échecs et ses rejets.
- Parce que le taux de signature humaine est la donnée qui compte le plus et se publie le moins : combien de propositions d’un agent survivent à la personne qui les lit.
- Parce que le coût réel (deux registres : API et abonnement) est ce qui décide si un agent est rentable, et presque personne ne le montre.
Méthode
- Une requête SQL en lecture seule sur la base de données de Nexo, publiée intégralement. Elle s’exécute chaque trimestre sur une fenêtre de 90 jours et ne produit que des agrégats.
- Rien d’identifiable : ni clients, ni projets, ni textes, ni ids. Distributions et médianes.
- Les données proviennent d’une seule entreprise (Kiwop) et d’une seule plateforme (Nexo). Ce n’est pas un échantillon du marché ; c’est un cas réel complet.
- Les définitions (ce qu’est une exécution, une signature, une PR livrée) sont dans la requête et dans la documentation de Labs.
Limites
- La fenêtre traverse des changements de la plateforme elle-même : nouveaux agents, corrections du prix du cache, règles de délégation. Un saut entre trimestres peut être un changement de notre part, pas du monde.
- Le coût par abonnement est valorisé au prix API pour la comparaison ; ce n’est pas de l’argent payé.
- Les commentaires non signés incluent ceux écartés et ceux qui attendent encore : nous ne les distinguons pas.
- La durée d’une exécution inclut l’attente de l’API.
Données ouvertes
Comment citer
Kiwop Labs (2026-09). Agents IA en production : télémétrie agrégée de Nexo. https://www.kiwop.com/fr/labs/agents-ia-en-production
Données sous licence CC BY 4.0. Requête et méthode ouvertes.
Parlons-en.
Consultation technique initiale
IA, sécurité et performance. Diagnostic avec proposition par phases.
- NDA disponible
- Réponse <24h
- Proposition par phases
Votre premier rendez-vous est avec un Architecte Solutions, pas un commercial.
Demander un diagnostic