Claude Code opende in enkele weken 388 pull requests op Anthropics eigen apps, waarvan het team er 180 heeft gemerged, schrijft Boris Cherny, de bedenker van Claude Code, op LinkedIn. Dat komt neer op een merge-percentage van 46.
Daarmee ligt er een narekenbaar getal onder de belofte die elk Nederlands ontwikkelteam inmiddels krijgt voorgeschoteld: laat de agent het onderhoud doen. Het getal valt twee kanten op. Ruim de helft van wat de agent opende haalde het niet, en alle 388 pull requests moesten wel langs een reviewer. De tijdwinst zit dus niet bij de mensen die code beoordelen, maar bij de mensen die dit opruimwerk anders zelf hadden zitten doen.
Twaalf routines in één Slack-kanaal
De opzet is opvallend kaal. Anthropic heeft een Slack-kanaal met de naam proj-claude-maintains-apps, en daarin werkt Claude Tag elke dag een vaste set routines af op iOS, Android, desktop, web, de CLI en de Agent SDK. Claude Tag is de variant die als vast teamlid in je Slack-kanalen meeleest en opdrachten zelfstandig afmaakt.
Die routines dekken twaalf soorten onderhoudswerk. Een crash fuzzer opent de app in een simulator, tikt willekeurig rond tot er iets crasht, zoekt de oorzaak en zet er een fix voor klaar. Een dup unifier speurt de codebase af naar bijna-identieke abstracties en stelt voor ze samen te voegen. De dead code remover haalt aantoonbaar onbereikbare code weg en zet bij verdachte code eerst logging neer, om de dag erna te controleren of hij echt ongebruikt is. Verder draaien er routines voor het vereenvoudigen van geneste bedrijfslogica, het opsporen van logicafouten, het weggooien van tests die nooit kunnen falen, het uitzetten van feature flags van al volledig uitgerolde functies, het repareren van instabiele CI-tests en het herstellen van laagschendingen in de architectuur.
Wat opvalt is wat er niet in zit: uitgekiende prompt engineering. Cherny deelde een paar van zijn eigen opdrachten in Slack en die staan in gewone spreektaal. "lets start new daily routines for crash fuzzing ios, android, and desktop apps e2e", schrijft hij, met de instructie om de echte apps te gebruiken zonder mocks. De enige harde eis die erachter staat is procedureel: elke pull request moet /verify draaien en een reproductie plus een waarheidstabel in de pull request plaatsen. Het bericht dateert van 19 juli, wat de "afgelopen weken" uit zijn post op ongeveer vier weken zet.

Wat 46 procent zegt over je reviewcapaciteit
Claude krijgt zulke pull requests er meestal in één keer goed doorheen, schrijft Cherny. Lukt dat niet, dan laat het team Claude zijn routine bijstellen zodat het de dag erna beter gaat, en dat kost soms een paar dagen. Anthropic kijkt nu hoe het mergen van dit soort mechanische wijzigingen sneller kan.
Dat laatste zinnetje verraadt waar de rekening terechtkomt. Verdeel je 388 pull requests over ongeveer vier weken en zes platformen, dan komen er zo'n veertien per werkdag binnen bij mensen die ze moeten beoordelen, en meer dan de helft daarvan blijkt achteraf weggegooid werk voor de reviewer. Dat patroon is niet nieuw. Anthropic meldde in juni al dat 65 procent van de code in zijn eigen productteam door Claude wordt geschreven, en uit de AI Coding Impact 2026 Benchmark van Opsera bleek dat AI de tijd tot een pull request met tot 58 procent verkort, maar dat AI-gegenereerde pull requests 4,6 keer langer in review blijven hangen en 15 tot 18 procent meer fouten introduceren.
Het verschil met dat beeld zit in het soort werk. Crash fixes, dode code en overbodige tests zijn mechanisch en verifieerbaar: een reviewer kan in een paar minuten zien of het klopt, en een terugdraaiing kost weinig. Precies daar levert een merge-percentage van 46 nog steeds nettowinst op. Bij werk waar een ontwerpkeuze in zit ligt die rekensom anders, en Anthropic zet zijn routines daar dan ook niet op.
Deze routines kun je zelf aanzetten
Voor wie iets vergelijkbaars wil proberen wijst Cherny naar routines, de functie die Anthropic op 14 april uitbracht. Een routine is een opgeslagen Claude Code-configuratie: een prompt, een of meer repositories, een omgeving en een set connectoren, die vanzelf gaat draaien. Er zijn drie soorten triggers, en je kunt ze combineren: een schema (elk uur, dagelijks, op werkdagen of wekelijks, met een minimum van één uur tussen runs), een API-endpoint dat je vanuit je monitoring of je deploypijplijn aanroept, en GitHub-gebeurtenissen zoals een geopende pull request of een release. Aanmaken kan op claude.ai/code/routines, in de desktopapp of met /schedule in de terminal.
Twee dingen horen erbij voordat je dit op een echte repository loslaat. Een run draait als een volledige cloudsessie zonder goedkeuringsvragen, op Anthropics eigen infrastructuur of in de zelf-gehoste omgeving van je organisatie, en Claude pusht zijn werk naar branches met het voorvoegsel claude/. Bij het aanmaken staan bovendien al je gekoppelde connectoren standaard aan, inclusief hun schrijfacties, dus alles wat de routine niet nodig heeft haal je er beter meteen uit.
Er zit een plafond op. Het aantal runs is begrensd op vijf per dag op Pro, vijftien op Max en vijfentwintig op Team en Enterprise, waarna aanvullende runs alleen doorgaan als je organisatie verbruikstegoeden heeft aanstaan. De functie zit nog in research preview, en een eigenaar van een Team- of Enterprise-organisatie kan routines voor alle leden uitzetten.
Waar het controlepunt heen schuift
Sinds vandaag start elke nieuwe Claude Code-sessie op Pro, Max en Team standaard in auto mode, waarin een classifier goedkeurt in plaats van de ontwikkelaar. Routines gaan daar nog een stap voorbij: in de sessie zelf zit helemaal geen mens meer, en het eerste menselijke moment is de pull request.
Dat maakt de keuze welk werk je zo uitbesteedt belangrijker dan de vraag of het model het aankan. De twaalf routines van Anthropic hebben één ding gemeen: het resultaat is na te rekenen en goedkoop terug te draaien. Cherny noemt zijn eigen experiment dan ook geen opgeloste zaak, maar "early signs of life". Voor een ontwikkelteam is 46 procent daarmee geen scorebord, maar een prijskaartje: zoveel ruis mag er tegenover het opgeruimde onderhoud staan voordat het reviewwerk duurder wordt dan het werk dat je ermee wegneemt.
Veelgestelde vragen
Onderhoud dat vanzelf loopt
Zo'n dagelijkse routine werkt alleen als je vooraf bepaalt welk werk narekenbaar is en waar een mens moet blijven kijken. Ik denk daarin mee, ontwerp de opzet en richt hem in, van koppeling tot draaiende automatisering, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
