Vrouw typt code op het scherm van een laptop.
Nieuws14 augustus · 16:215 min leestijd

Claude Code opent 388 pull requests op Anthropics apps, 180 gemerged

Claude Code draait dagelijks twaalf onderhoudsroutines op Anthropics eigen apps en opende zo 388 pull requests, waarvan er 180 zijn gemerged. Wat dat merge-percentage van 46 zegt over de reviewcapaciteit van je eigen ontwikkelteam.

Claude Code opende in enkele weken 388 pull requests op Anthropics eigen apps, waarvan het team er 180 heeft gemerged, schrijft Boris Cherny, de bedenker van Claude Code, op LinkedIn. Dat komt neer op een merge-percentage van 46.

Daarmee ligt er een narekenbaar getal onder de belofte die elk Nederlands ontwikkelteam inmiddels krijgt voorgeschoteld: laat de agent het onderhoud doen. Het getal valt twee kanten op. Ruim de helft van wat de agent opende haalde het niet, en alle 388 pull requests moesten wel langs een reviewer. De tijdwinst zit dus niet bij de mensen die code beoordelen, maar bij de mensen die dit opruimwerk anders zelf hadden zitten doen.

Twaalf routines in één Slack-kanaal

De opzet is opvallend kaal. Anthropic heeft een Slack-kanaal met de naam proj-claude-maintains-apps, en daarin werkt Claude Tag elke dag een vaste set routines af op iOS, Android, desktop, web, de CLI en de Agent SDK. Claude Tag is de variant die als vast teamlid in je Slack-kanalen meeleest en opdrachten zelfstandig afmaakt.

Die routines dekken twaalf soorten onderhoudswerk. Een crash fuzzer opent de app in een simulator, tikt willekeurig rond tot er iets crasht, zoekt de oorzaak en zet er een fix voor klaar. Een dup unifier speurt de codebase af naar bijna-identieke abstracties en stelt voor ze samen te voegen. De dead code remover haalt aantoonbaar onbereikbare code weg en zet bij verdachte code eerst logging neer, om de dag erna te controleren of hij echt ongebruikt is. Verder draaien er routines voor het vereenvoudigen van geneste bedrijfslogica, het opsporen van logicafouten, het weggooien van tests die nooit kunnen falen, het uitzetten van feature flags van al volledig uitgerolde functies, het repareren van instabiele CI-tests en het herstellen van laagschendingen in de architectuur.

Wat opvalt is wat er niet in zit: uitgekiende prompt engineering. Cherny deelde een paar van zijn eigen opdrachten in Slack en die staan in gewone spreektaal. "lets start new daily routines for crash fuzzing ios, android, and desktop apps e2e", schrijft hij, met de instructie om de echte apps te gebruiken zonder mocks. De enige harde eis die erachter staat is procedureel: elke pull request moet /verify draaien en een reproductie plus een waarheidstabel in de pull request plaatsen. Het bericht dateert van 19 juli, wat de "afgelopen weken" uit zijn post op ongeveer vier weken zet.

Slackbericht van Boris Cherny van 19 juli waarin hij in gewone taal dagelijkse routines opdraagt voor crash fuzzing op iOS, Android en desktop, plus een logica-bugfixer, een simplifier, een dup unifier en het verwijderen van dode code. (Bron: Boris Cherny / Anthropic via The Decoder)
Slackbericht van Boris Cherny van 19 juli waarin hij in gewone taal dagelijkse routines opdraagt voor crash fuzzing op iOS, Android en desktop, plus een logica-bugfixer, een simplifier, een dup unifier en het verwijderen van dode code. (Bron: Boris Cherny / Anthropic via The Decoder)

Wat 46 procent zegt over je reviewcapaciteit

Claude krijgt zulke pull requests er meestal in één keer goed doorheen, schrijft Cherny. Lukt dat niet, dan laat het team Claude zijn routine bijstellen zodat het de dag erna beter gaat, en dat kost soms een paar dagen. Anthropic kijkt nu hoe het mergen van dit soort mechanische wijzigingen sneller kan.

Dat laatste zinnetje verraadt waar de rekening terechtkomt. Verdeel je 388 pull requests over ongeveer vier weken en zes platformen, dan komen er zo'n veertien per werkdag binnen bij mensen die ze moeten beoordelen, en meer dan de helft daarvan blijkt achteraf weggegooid werk voor de reviewer. Dat patroon is niet nieuw. Anthropic meldde in juni al dat 65 procent van de code in zijn eigen productteam door Claude wordt geschreven, en uit de AI Coding Impact 2026 Benchmark van Opsera bleek dat AI de tijd tot een pull request met tot 58 procent verkort, maar dat AI-gegenereerde pull requests 4,6 keer langer in review blijven hangen en 15 tot 18 procent meer fouten introduceren.

Het verschil met dat beeld zit in het soort werk. Crash fixes, dode code en overbodige tests zijn mechanisch en verifieerbaar: een reviewer kan in een paar minuten zien of het klopt, en een terugdraaiing kost weinig. Precies daar levert een merge-percentage van 46 nog steeds nettowinst op. Bij werk waar een ontwerpkeuze in zit ligt die rekensom anders, en Anthropic zet zijn routines daar dan ook niet op.

Deze routines kun je zelf aanzetten

Voor wie iets vergelijkbaars wil proberen wijst Cherny naar routines, de functie die Anthropic op 14 april uitbracht. Een routine is een opgeslagen Claude Code-configuratie: een prompt, een of meer repositories, een omgeving en een set connectoren, die vanzelf gaat draaien. Er zijn drie soorten triggers, en je kunt ze combineren: een schema (elk uur, dagelijks, op werkdagen of wekelijks, met een minimum van één uur tussen runs), een API-endpoint dat je vanuit je monitoring of je deploypijplijn aanroept, en GitHub-gebeurtenissen zoals een geopende pull request of een release. Aanmaken kan op claude.ai/code/routines, in de desktopapp of met /schedule in de terminal.

Twee dingen horen erbij voordat je dit op een echte repository loslaat. Een run draait als een volledige cloudsessie zonder goedkeuringsvragen, op Anthropics eigen infrastructuur of in de zelf-gehoste omgeving van je organisatie, en Claude pusht zijn werk naar branches met het voorvoegsel claude/. Bij het aanmaken staan bovendien al je gekoppelde connectoren standaard aan, inclusief hun schrijfacties, dus alles wat de routine niet nodig heeft haal je er beter meteen uit.

Er zit een plafond op. Het aantal runs is begrensd op vijf per dag op Pro, vijftien op Max en vijfentwintig op Team en Enterprise, waarna aanvullende runs alleen doorgaan als je organisatie verbruikstegoeden heeft aanstaan. De functie zit nog in research preview, en een eigenaar van een Team- of Enterprise-organisatie kan routines voor alle leden uitzetten.

Waar het controlepunt heen schuift

Sinds vandaag start elke nieuwe Claude Code-sessie op Pro, Max en Team standaard in auto mode, waarin een classifier goedkeurt in plaats van de ontwikkelaar. Routines gaan daar nog een stap voorbij: in de sessie zelf zit helemaal geen mens meer, en het eerste menselijke moment is de pull request.

Dat maakt de keuze welk werk je zo uitbesteedt belangrijker dan de vraag of het model het aankan. De twaalf routines van Anthropic hebben één ding gemeen: het resultaat is na te rekenen en goedkoop terug te draaien. Cherny noemt zijn eigen experiment dan ook geen opgeloste zaak, maar "early signs of life". Voor een ontwikkelteam is 46 procent daarmee geen scorebord, maar een prijskaartje: zoveel ruis mag er tegenover het opgeruimde onderhoud staan voordat het reviewwerk duurder wordt dan het werk dat je ermee wegneemt.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

Onderhoud dat vanzelf loopt

Zo'n dagelijkse routine werkt alleen als je vooraf bepaalt welk werk narekenbaar is en waar een mens moet blijven kijken. Ik denk daarin mee, ontwerp de opzet en richt hem in, van koppeling tot draaiende automatisering, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Anthropic maakt Chrome-zijbalk van Claude een volledige Cowork-sessie
Nieuws
4 min

13 aug 14:26

Anthropic maakt Chrome-zijbalk van Claude een volledige Cowork-sessie

Anthropic maakt de Chrome-zijbalk van Claude een volwaardige Cowork-sessie: skills, connectors en je gespreksgeschiedenis lopen door van browser naar desktop. Max en Team nu, Pro volgt, Enterprise pas na goedkeuring van een beheerder.

Fable 5 is niet meer gratis: dit veranderde op 20 juli
Nieuws
3 min

13 jul 08:11

Fable 5 is niet meer gratis: dit veranderde op 20 juli

Anthropic stelt de overstap van Claude Fable 5 naar betaalde verbruikscredits opnieuw uit, nu tot 19 juli. Tot dan blijft het topmodel gratis in je abonnement, voor maximaal de helft van je wekelijkse limiet.

Gemini-app passeert een miljard maandelijkse gebruikers
Nieuws
4 min

11 aug 22:24

Gemini-app passeert een miljard maandelijkse gebruikers

De Gemini-app telt een miljard maandelijkse gebruikers, evenveel als ChatGPT. Interessanter dan het getal is wat eronder ligt: wie Workspace Business of Enterprise afneemt, betaalt al voor deze assistent.

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs
Nieuws
5 min

11 aug 20:24

Onderzoekers lezen verborgen AI-redeneringen uit en vinden 182 credentials in publieke logs

Onderzoekers van de Universiteit Tübingen en Snyk ontcijferden de verborgen denkstappen van Claude, GPT en Gemini via de API's zelf. In publieke agent-logs vonden ze 62 API-sleutels en 33 wachtwoorden.

Anthropic zet Claude Code per 14 augustus standaard in auto mode
Nieuws
6 min

8 aug 18:08

Anthropic zet Claude Code per 14 augustus standaard in auto mode

Vanaf 14 augustus start elke nieuwe Claude Code-sessie op Pro, Max en Team in auto mode, waarin een classifier goedkeurt. Wat dat betekent voor teams die handmatige goedkeuring als controlemaatregel hebben vastgelegd.

MCP schrapt sessies: het protocol achter AI-agents wordt stateless
Nieuws
6 min

28 jul 16:14

MCP schrapt sessies: het protocol achter AI-agents wordt stateless

Het Model Context Protocol wordt vandaag stateless. Sessies, de initialize-handdruk en de sessie-header verdwijnen, wat MCP-servers eenvoudiger schaalbaar maakt maar bestaande eigen implementaties breekt. Dit verandert er concreet.