Kiwop Labs · série trimestrielle
Agents IA en production
Ce que font vraiment les agents de Nexo, la plateforme avec laquelle Kiwop opère : exécutions, échecs, propositions signées ou écartées par une personne, PR livrées par le worker autonome, courrier classé et coût. Fenêtre de 90 jours, du 3 juillet 2026 au 1 octobre 2026. Sans noms, sans textes, sans promesses.
Ce que dit le trimestre
- 28 agents différents ont tourné 1 293 fois ; 93,7 % se sont terminés sans erreur. L’exécution médiane dure 88 s et les 10 % les plus lentes dépassent 175 s.
- Les agents ont proposé 500 commentaires de tâche ; 168 étaient destinés au client et une personne en a signé 90 (53,6 %). Le reste a été écarté ou attend encore. La signature prend une médiane de 78,2 heures : la relecture humaine n’est pas une formalité.
- Le worker autonome a réclamé 25 tâches déléguées et livré 18 PR, avec 0,7 heures de médiane entre réclamer et livrer. Le directeur a examiné 155 tâches et n’en a délégué que 23.
- Côté courrier, le classificateur a traité 216 fils entrants et créé 31 tâches ; le gardien a examiné 1 247 sortants et en a bloqué 111. Les personnes ont accepté 68,8 % de ses suggestions.
- Coût : 762 € facturés par API sur la fenêtre, plus 1 736 € de consommation par abonnement valorisée au prix API. Le CLI sur le serveur a consommé 3 284 $ au prix catalogue, dont 32 % pour le worker autonome.
Agents proactifs
Les vigies : des agents qui se déclenchent seuls (par cron, par événement ou par une autre exécution), lisent l’état du projet et proposent quelque chose ou alertent. Chaque exécution enregistre statut, durée et niveau d’alerte.
| Métrique | Valeur |
|---|---|
| Exécutions | 1 293 |
| Terminées | 1 212 |
| Échouées | 69 |
| Succès (%) | 93,7 |
| Agents actifs | 28 |
| Durée médiane (s) | 88 |
| Durée p90 (s) | 175 |
| Par niveau d’alerte | warning: 230 · ok: 910 · sin nivel: 81 · critical: 72 |
Propositions signées par une personne
Un commentaire écrit par un agent naît en attente et invisible jusqu’à ce que la personne au nom de laquelle il paraît le signe dans l’application. Il n’existe aucun moyen de le signer par API. C’est le vrai taux d’acceptation humaine, pas une estimation.
| Métrique | Valeur |
|---|---|
| Commentaires proposés | 500 |
| Notes internes | 332 |
| Pour le client | 168 |
| Signés | 354 |
| Signés (%) | 70,8 |
| Pour le client, signés | 90 |
| Pour le client, signés (%) | 53,6 |
| Heures jusqu’à la signature (médiane) | 78,2 |
Worker autonome et directeur de tâches
Le directeur examine chaque nouvelle tâche et décide s’il la délègue au worker (un Claude Code sur le serveur) ou la laisse à une personne. Le worker réclame, travaille dans un worktree isolé et livre une PR. Personne ne merge à sa place.
| Métrique | Valeur |
|---|---|
| Tâches réclamées par le worker | 25 |
| PR livrées | 18 |
| Heures entre réclamer et livrer (médiane) | 0,7 |
| Passages du worker | 48 987 |
| File moyenne | 0 |
| Tâches examinées par le directeur | 155 |
| Déléguées au worker | 23 |
| Renvoyées à une personne | 10 |
Courrier : classificateur et gardien
Le classificateur lit le courrier entrant et décide s’il s’agit d’une tâche, d’une réponse ou de bruit, avec sa confiance. Le gardien examine le sortant avant l’envoi et renvoie ok, suggestion ou blocage. Les deux sont corrigés par une personne.
| Métrique | Valeur |
|---|---|
| Fils classés | 216 |
| Par type | reply: 130 · ignore: 45 · task: 41 |
| Par confiance | sin dato: 157 · high: 40 · low: 19 |
| Classificateur en échec (%) | 4,6 |
| Latence médiane (ms) | 10 249 |
| Avec décision | 124 |
| Par décision | thread_duplicate: 19 · sin decidir: 73 · mirrored: 28 · auto_attached: 65 · auto_created: 31 |
| Tâches créées | 31 |
| Examens | 1 247 |
| Par verdict | suggest: 93 · block: 111 · ok: 1 043 |
| Suggestions acceptées (%) | 68,8 |
| Latence médiane (ms) | 7 849 |
| Suggestions par examen (moyenne) | 0,24 |
Consultations du critère maison
Les agents et l’équipe interrogent le « cerveau » (le critère documenté de la maison) avant de décider. Si la réponse n’atteint pas la similarité minimale, elle est remontée à une personne.
| Métrique | Valeur |
|---|---|
| Consultations | 154 |
| Remontées à une personne | 66 |
| Remontées (%) | 42,9 |
| Évaluées | 0 |
| Utiles (%) | – |
| Similarité médiane | 0,54 |
Agent leads
Suivi automatique des leads entrants : brouillons qu’une personne relit, arrêt automatique s’ils ne sont pas relus, et écart des fournisseurs et du bruit.
| Métrique | Valeur |
|---|---|
| Séquences | 75 |
| Par état | waiting: 4 · stopped: 63 · replied: 6 · exhausted: 2 |
| Relances envoyées | 11 |
| Par motif d’arrêt | activa: 12 · el lead ya no existe: 2 · not_business: 9 · parada manual por Josep Purroy: el correo del lead rebota (554 5.7.1): 1 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 4 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 18 · borrador sin revisar durante 6 días: 1 · ya le contestaron a mano desde josep@kiwop.com: 1 · clasificado como «Proveedor»: no se contacta: 19 · particular que quiere formarse: con el correo del curso basta: 1 · clasificado como «Prácticas»: no se contacta: 1 |
Coût de l’IA
Comptage par appel de tout ce qui passe par la passerelle IA de Nexo. Nous séparons ce qui est facturé par API de ce qui passe par abonnement (valorisé au prix API pour pouvoir comparer, mais non payé au token).
| Métrique | Valeur |
|---|---|
| Appels | 11 500 |
| Tokens d’entrée | 564 418 480 |
| Tokens de sortie | 10 685 590 |
| Facturé par API (€) | 761,81 |
| Par abonnement, équivalent API (€) | 1 736,09 |
| Par fournisseur | openai: 1 008 · anthropic: 10 492 |
| Modèles distincts | 13 |
| Latence médiane (ms) | 12 136 |
| Lectures de cache (%) | 0 |
| Fonction | Appels | Tokens entrée | Tokens sortie | Coût (€) |
|---|---|---|---|---|
| Agents proactifs | 6 307 | 324 460 628 | 8 697 397 | 1 524,84 |
| Chat | 2 275 | 98 426 113 | 489 634 | 419,55 |
| Gardien du courrier | 1 605 | 78 452 290 | 512 331 | 240,29 |
| Classificateur de courrier | 788 | 31 652 077 | 432 698 | 172,74 |
| Chat de projet | 171 | 15 614 418 | 220 955 | 55,18 |
| Courrier sortant | 246 | 10 067 224 | 88 497 | 52,23 |
| Academy | 77 | 4 324 947 | 117 371 | 24,98 |
| Newsletter | 15 | 758 602 | 82 193 | 5,85 |
| Contenu SEO | 13 | 561 325 | 42 078 | 1,64 |
| CRO | 2 | 100 856 | 2 436 | 0,57 |
| operations_slack_audio | 1 | 0 | 0 | 0,03 |
Et l’autre registre : les sessions du CLI sur le serveur (le worker autonome, le relais et le binaire de la plateforme), mesurées à partir des transcriptions et valorisées au prix catalogue.
| Origine | Sessions | Tours | Coût catalogue ($) |
|---|---|---|---|
| Binaire de la plateforme | 5 362 | 10 618 | 1 168,64 |
| Worker autonome | 549 | 6 154 | 1 059 |
| Relais Claude | 2 620 | 3 561 | 1 032,92 |
| Relais du cerveau | 1 195 | 2 371 | 22,89 |
| Non classé | 7 | 10 | 0,16 |
| Total | 9 733 | 22 714 | 3 283,61 |
Les crons qui tiennent le tout
Tout ce qui précède tourne sur des tâches planifiées. Voici leur historique complet sur la fenêtre : combien, combien ont été sautées volontairement et combien ont échoué.
| Métrique | Valeur |
|---|---|
| Exécutions | 259 134 |
| Tâches planifiées distinctes | 256 |
| Par résultat | skipped: 17 519 · failed: 47 · running: 1 · ok: 241 567 |
| Échouées (%) | 0,02 |
| Durée médiane (ms) | 1 872 |
Pourquoi nous publions cela
- Parce que presque tout ce qu’on lit sur les agents en production est une promesse. Ceci sont les compteurs d’une plateforme qui fait tourner une vraie agence depuis des mois, avec ses échecs et ses rejets.
- Parce que le taux de signature humaine est la donnée qui compte le plus et se publie le moins : combien de propositions d’un agent survivent à la personne qui les lit.
- Parce que le coût réel (deux registres : API et abonnement) est ce qui décide si un agent est rentable, et presque personne ne le montre.
Méthode
- Une requête SQL en lecture seule sur la base de données de Nexo, publiée intégralement. Elle s’exécute chaque trimestre sur une fenêtre de 90 jours et ne produit que des agrégats.
- Rien d’identifiable : ni clients, ni projets, ni textes, ni ids. Distributions et médianes.
- Les données proviennent d’une seule entreprise (Kiwop) et d’une seule plateforme (Nexo). Ce n’est pas un échantillon du marché ; c’est un cas réel complet.
- Les définitions (ce qu’est une exécution, une signature, une PR livrée) sont dans la requête et dans la documentation de Labs.
Limites
- La fenêtre traverse des changements de la plateforme elle-même : nouveaux agents, corrections du prix du cache, règles de délégation. Un saut entre trimestres peut être un changement de notre part, pas du monde.
- Le coût par abonnement est valorisé au prix API pour la comparaison ; ce n’est pas de l’argent payé.
- Les commentaires non signés incluent ceux écartés et ceux qui attendent encore : nous ne les distinguons pas.
- La durée d’une exécution inclut l’attente de l’API.
Données ouvertes
Comment citer
Kiwop Labs (2026-10). Agents IA en production : télémétrie agrégée de Nexo. https://www.kiwop.com/fr/labs/agents-ia-en-production
Données sous licence CC BY 4.0. Requête et méthode ouvertes.
Parlons-en.
Consultation technique initiale
IA, sécurité et performance. Diagnostic avec proposition par phases.
- NDA disponible
- Réponse <24h
- Proposition par phases
Votre premier rendez-vous est avec un Architecte Solutions, pas un commercial.
Parler à un architecte