Kiwop Labs · Quartalsreihe

KI-Agenten im Betrieb

Was die Agenten von Nexo, der Plattform, mit der Kiwop arbeitet, wirklich tun: Läufe, Fehler, von einem Menschen unterschriebene oder verworfene Vorschläge, vom autonomen Worker gelieferte PRs, klassifizierte E-Mails und Kosten. Ein Fenster von 90 Tagen, vom 3. Juli 2026 bis 1. Oktober 2026. Keine Namen, keine Texte, keine Versprechen.

1.293Agentenläufe
93,7 %enden ohne Fehler
53,6 %Kundenvorschläge, von einem Menschen unterschrieben
18vom Worker gelieferte PRs
762€ API abgerechnet

Was das Quartal sagt

  1. 28 verschiedene Agenten liefen 1.293 Mal; 93,7 % endeten ohne Fehler. Der mittlere Lauf dauert 88 s, die langsamsten 10 % überschreiten 175 s.
  2. Agenten schlugen 500 Aufgabenkommentare vor; 168 waren an Kunden gerichtet, und ein Mensch unterschrieb 90 (53,6 %). Der Rest wurde verworfen oder wartet noch. Die Unterschrift dauert im Median 78,2 Stunden: die menschliche Prüfung ist keine Formalität.
  3. Der autonome Worker übernahm 25 delegierte Aufgaben und lieferte 18 PRs, mit 0,7 Stunden Median zwischen Übernahme und Lieferung. Der Direktor prüfte 155 Aufgaben und delegierte nur 23.
  4. Bei E-Mails bearbeitete der Klassifikator 216 eingehende Threads und legte 31 Aufgaben an; der Wächter prüfte 1.247 ausgehende und blockierte 111. Menschen akzeptierten 68,8 % seiner Vorschläge.
  5. Kosten: 762 € über API im Fenster abgerechnet, plus 1.736 € Abonnementverbrauch zu API-Preisen bewertet. Das CLI auf dem Server verbrauchte 3.284 $ zum Listenpreis, davon 32 % der autonome Worker.

Proaktive Agenten

Die Wächter: Agenten, die von selbst auslösen (per Cron, Ereignis oder durch einen anderen Lauf), den Projektstatus lesen und etwas vorschlagen oder warnen. Jeder Lauf speichert Status, Dauer und Warnstufe.

KennzahlWert
Läufe1.293
Abgeschlossen1.212
Fehlgeschlagen69
Erfolg (%)93,7
Aktive Agenten28
Mediane Dauer (s)88
Dauer p90 (s)175
Nach Warnstufewarning: 230 · ok: 910 · sin nivel: 81 · critical: 72

Von einem Menschen unterschriebene Vorschläge

Ein von einem Agenten geschriebener Kommentar entsteht ausstehend und unsichtbar, bis die Person, in deren Namen er erscheint, ihn in der Web-App unterschreibt. Per API lässt er sich nicht unterschreiben. Das ist die echte menschliche Akzeptanzrate, keine Schätzung.

KennzahlWert
Vorgeschlagene Kommentare500
Interne Notizen332
An den Kunden168
Unterschrieben354
Unterschrieben (%)70,8
An den Kunden, unterschrieben90
An den Kunden, unterschrieben (%)53,6
Stunden bis zur Unterschrift (Median)78,2

Autonomer Worker und Aufgaben-Direktor

Der Direktor prüft jede neue Aufgabe und entscheidet, ob er sie an den Worker (ein Claude Code auf dem Server) delegiert oder einem Menschen überlässt. Der Worker übernimmt, arbeitet in einem isolierten Worktree und liefert einen PR. Niemand merged für ihn.

KennzahlWert
Vom Worker übernommene Aufgaben25
Gelieferte PRs18
Stunden von Übernahme bis Lieferung (Median)0,7
Worker-Durchläufe48.987
Mittlere Warteschlange0
Vom Direktor geprüfte Aufgaben155
An den Worker delegiert23
An einen Menschen übergeben10

E-Mail: Klassifikator und Wächter

Der Klassifikator liest eingehende E-Mails und entscheidet, ob es Aufgabe, Antwort oder Rauschen ist, mit seiner Konfidenz. Der Wächter prüft ausgehende E-Mails vor dem Versand und gibt ok, Vorschlag oder Sperre zurück. Beides korrigiert ein Mensch.

KennzahlWert
Klassifizierte Threads216
Nach Typreply: 130 · ignore: 45 · task: 41
Nach Konfidenzsin dato: 157 · high: 40 · low: 19
Klassifikator fehlgeschlagen (%)4,6
Mediane Latenz (ms)10.249
Mit Entscheidung124
Nach Entscheidungthread_duplicate: 19 · sin decidir: 73 · mirrored: 28 · auto_attached: 65 · auto_created: 31
Angelegte Aufgaben31
Prüfungen1.247
Nach Urteilsuggest: 93 · block: 111 · ok: 1.043
Akzeptierte Vorschläge (%)68,8
Mediane Latenz (ms)7.849
Vorschläge pro Prüfung (Mittel)0,24

Anfragen an das Hauskriterium

Agenten und Team fragen das „Gehirn“ (das dokumentierte Kriterium des Hauses), bevor sie entscheiden. Erreicht die Antwort die Mindestähnlichkeit nicht, wird an einen Menschen eskaliert.

KennzahlWert
Anfragen154
An einen Menschen eskaliert66
Eskaliert (%)42,9
Bewertet0
Nützlich (%)–
Mediane Ähnlichkeit0,54

Lead-Agent

Automatisches Nachfassen eingehender Leads: Entwürfe, die ein Mensch prüft, automatischer Stopp, wenn sie nicht geprüft werden, und Aussortieren von Anbietern und Rauschen.

KennzahlWert
Sequenzen75
Nach Statuswaiting: 4 · stopped: 63 · replied: 6 · exhausted: 2
Gesendete Nachfassungen11
Nach Stoppgrundactiva: 12 · el lead ya no existe: 2 · not_business: 9 · parada manual por Josep Purroy: el correo del lead rebota (554 5.7.1): 1 · reconciliado: la conversación ya existía en el buzón: 1 · borrador sin revisar durante 4 días: 4 · borrador sin revisar durante 7 días: 1 · proveedor haciendo outreach: fuera del pipeline comercial: 4 · clasificado como «Otro»: no se contacta: 18 · borrador sin revisar durante 6 días: 1 · ya le contestaron a mano desde josep@kiwop.com: 1 · clasificado como «Proveedor»: no se contacta: 19 · particular que quiere formarse: con el correo del curso basta: 1 · clasificado como «Prácticas»: no se contacta: 1

KI-Kosten

Metering pro Aufruf für alles, was durch das KI-Gateway von Nexo geht. Wir trennen das über API Abgerechnete von dem, was über Abonnements läuft (zu API-Preisen bewertet, um es vergleichen zu können, aber nicht pro Token bezahlt).

KennzahlWert
Aufrufe11.500
Eingabe-Tokens564.418.480
Ausgabe-Tokens10.685.590
Über API abgerechnet (€)761,81
Über Abonnement, API-Äquivalent (€)1.736,09
Nach Anbieteropenai: 1.008 · anthropic: 10.492
Verschiedene Modelle13
Mediane Latenz (ms)12.136
Cache-Lesungen (%)0
FunktionAufrufeEingabe-TokensAusgabe-TokensKosten (€)
Proaktive Agenten6.307324.460.6288.697.3971.524,84
Chat2.27598.426.113489.634419,55
E-Mail-Wächter1.60578.452.290512.331240,29
E-Mail-Klassifikator78831.652.077432.698172,74
Projekt-Chat17115.614.418220.95555,18
Ausgehende E-Mail24610.067.22488.49752,23
Academy774.324.947117.37124,98
Newsletter15758.60282.1935,85
SEO-Inhalte13561.32542.0781,64
CRO2100.8562.4360,57
operations_slack_audio1000,03

Und das andere Buch: die CLI-Sitzungen auf dem Server (autonomer Worker, Relay und Plattform-Binary), aus den Transkripten gemessen und zum Listenpreis bewertet.

HerkunftSitzungenRundenListenkosten ($)
Plattform-Binary5.36210.6181.168,64
Autonomer Worker5496.1541.059
Claude-Relay2.6203.5611.032,92
Gehirn-Relay1.1952.37122,89
Nicht klassifiziert7100,16
Total9.73322.7143.283,61

Die Crons, die alles tragen

Alles oben läuft auf geplanten Aufgaben. Das ist ihre vollständige Historie im Fenster: wie viele, wie viele absichtlich übersprungen wurden und wie viele scheiterten.

KennzahlWert
Läufe259.134
Verschiedene geplante Aufgaben256
Nach Ergebnisskipped: 17.519 · failed: 47 · running: 1 · ok: 241.567
Fehlgeschlagen (%)0,02
Mediane Dauer (ms)1.872

Warum wir das veröffentlichen

  • Weil fast alles, was man über Agenten im Betrieb liest, Versprechen sind. Das hier sind Zähler einer Plattform, die seit Monaten eine echte Agentur betreibt, mit ihren Fehlern und Verwerfungen.
  • Weil die menschliche Unterschriftsrate die Zahl ist, die am meisten zählt und am seltensten veröffentlicht wird: wie viele Vorschläge eines Agenten die Person überleben, die sie liest.
  • Weil die echten Kosten (zwei Bücher: API und Abonnement) entscheiden, ob sich ein Agent lohnt, und fast niemand sie zeigt.

Methode

  • Eine reine Leseabfrage in SQL auf der Datenbank von Nexo, vollständig veröffentlicht. Sie läuft jedes Quartal über ein Fenster von 90 Tagen und erzeugt nur Aggregate.
  • Nichts Identifizierbares: keine Kunden, keine Projekte, keine Texte, keine IDs. Verteilungen und Mediane.
  • Die Daten stammen von einem Unternehmen (Kiwop) und einer Plattform (Nexo). Es ist keine Marktstichprobe, sondern ein vollständiger realer Fall.
  • Die Definitionen (was ein Lauf ist, was eine Unterschrift ist, was ein gelieferter PR ist) stehen in der Abfrage und in der Labs-Dokumentation.

Grenzen

  • Das Fenster umfasst Änderungen der Plattform selbst: neue Agenten, Korrekturen der Cache-Preise, Delegationsregeln. Ein Sprung zwischen Quartalen kann eine Änderung von uns sein, nicht der Welt.
  • Abonnementkosten werden zum Vergleich zu API-Preisen bewertet; es ist kein gezahltes Geld.
  • Nicht unterschriebene Kommentare umfassen verworfene und noch wartende: wir unterscheiden sie nicht.
  • Die Dauer eines Laufs schließt das Warten auf die API ein.

Offene Daten

Zitieren

Kiwop Labs (2026-10). KI-Agenten im Betrieb: aggregierte Telemetrie aus Nexo. https://www.kiwop.com/de/labs/ki-agenten-im-betrieb

Daten unter CC BY 4.0. Abfrage und Methode offen.

← Zurück zu Kiwop Labs

Sprechen wir.

Technische Erstberatung

KI, Sicherheit und Performance. Diagnose mit phasenweisem Vorschlag.

  • NDA verfügbar
  • Antwort <24h
  • Phasenweiser Vorschlag

Ihr erstes Meeting ist mit einem Solutions Architect, nicht mit einem Verkäufer.

Mit einem Architekten sprechen