GitHub Copilot kiest vanaf eind oktober per taak tussen lokale en cloudmodellen, meldt Microsoft; de experimentele preview verschijnt in de Copilot-app, CLI en Visual Studio Code.
Een ontwikkelteam kan code en prompts daarmee lokaal laten verwerken of een taak via een cloudmodel afhandelen. De route bepaalt waar inferentie plaatsvindt, maar niet welke bestanden, shellcommando’s, netwerkverbindingen of sleutels de agent mag gebruiken. Voor Nederlandse organisaties komen modelkeuze, datastromen en toegangsbeleid daardoor samen in één codeerworkflow, terwijl het technisch verschillende beslissingen blijven.
Copilot kan de route kiezen of vastzetten
In Auto laat GitHub Copilot zelf kiezen wanneer een taak op het apparaat of in de cloud wordt verwerkt. Tijdens een sessie met meerdere beurten houdt de router rekening met taakcontext en cache, zodat Copilot eerder verwerkte context kan hergebruiken. De ontwikkelaar kan ook zelf een lokaal model of endpoint kiezen als een workflow een specifieke aanbieder, modelversie of aansluiting vereist.
De aankondiging noemt MAI Code 1.1 Flash via de Windows ML-provider en lokale endpoints die de OpenAI-API ondersteunen. Daaruit kiest de ontwikkelaar zelf een model. Auto en handmatige selectie zijn verschillende bedieningsvormen: de route aan Copilot overlaten of vooraf een lokale keuze vastleggen.

Microsoft noemt later in oktober als moment voor de experimentele preview. De aankondiging noemt de Copilot-app, CLI en VS Code, maar geen ondersteunde abonnementen, landen of beheerinstellingen om Auto tot een lokale route te beperken.
MAI Code laat de hardwaregrens zien
Microsoft gebruikt MAI Code 1.1 Flash als voorbeeld van lokale code-inferentie. Het model telt 137 miljard parameters, waarvan er 6,8 miljard per keer actief zijn. De gekwantiseerde variant op het apparaat neemt volgens het bedrijf 53 GB in, 80 procent minder dan de versie met Bfloat16-gewichten voor de cloud. NVIDIA meldt dat RTX Spark-laptops vanaf 16 oktober beschikbaar zijn, met maximaal 128 GB gedeeld geheugen in Surface Laptop Ultra; de voorverkoop start op 7 oktober. Dezelfde geheugenpool biedt ook ruimte aan het besturingssysteem, programma’s, de uitvoersoftware en de cache voor de gesprekscontext.
Bij een context van 256.000 tokens piekte het gemeten geheugengebruik op 75,5 GB. Microsoft rapporteert promptverwerking tot 923,5 tokens per seconde bij een context van 64.000 tokens en 769,8 bij 128.000. Op SWE-Bench Verified, met 500 programmeertaken, scoorde de lokale variant 70,80 procent tegenover 72,6 procent voor de standaardversie. Op Terminal-Bench 2.1, met 89 taken, waren de scores 66,29 en 62,9 procent. De resultaten komen uit Microsofts eigen metingen.
Die metingen zijn op 5 oktober uitgevoerd met een Windows ARM64-runtime op basis van llama.cpp en CUDA, plus DFlash2-speculative decoding. De voetnoot noemt een synthetische codegeneratietaak en waarschuwt dat prestaties verschillen per apparaat en configuratie. De benchmarks garanderen daarom niet dat een team dezelfde snelheid of taakvoltooiing haalt op andere pc’s. Microsoft publiceert geen prijsvergelijking met cloudgebruik. Lokale inferentie kan cloudverbruik beperken, maar hardware, geheugen en beheer tellen mee in de totale kosten.
Een lokale inferentie is geen offline sessie
Een code-agent voert shellopdrachten normaal gesproken uit met de rechten van het gebruikersaccount. Microsoft Execution Containers, kortweg MXC, kunnen toegang tot bestanden, netwerken, inloggegevens en systeemfuncties begrenzen, ongeacht welk model om een actie vraagt. Op Windows gebruikt Copilot BaseContainer van ProcessContainer, op macOS Seatbelt en op Linux bubblewrap.
Als sandboxing aanstaat, draaien shellopdrachten en standaard lokale MCP-servers en taalservers binnen de procesgrens. De ingebouwde bestandsfuncties draaien in GitHub Copilot zelf. De agent controleert hun verzoeken tegen het beleid, maar het besturingssysteem dwingt die controle niet af als isolatie van een apart proces. Externe MCP-servers vallen buiten de lokale processandbox; waar regels gelden, controleert Copilot hun verbinding in het eigen proces. GitHub had lokale en cloud-sandboxen voor Copilot in juni in publieke preview gezet.
Een lokale modelroute betekent dus niet vanzelf dat alle data en tools lokaal blijven. Auto kan naar een cloudmodel schakelen en een externe MCP-server blijft buiten de lokale procesgrens. Voor een team zijn de modelroute en de rechten van opdrachten twee aparte onderdelen van het beveiligingsbeleid.
GitHub voegt de uitvoerplek aan Auto toe
GitHub voegde in april ondersteuning toe voor eigen aanbieders en lokale modellen in Copilot CLI, inclusief een offline stand. Op 4 september volgde Project HydraFusion als onderzoekspreview voor routering tussen meerdere modellen. De nieuwe stap voegt daaraan de keuze toe tussen modeluitvoering op de computer en in de cloud.
De modelkeuze was al onderwerp van beleid: GitHub verving in juni de handmatige modelkiezer in Free en Student door Copilot Auto. Een dag eerder presenteerde Microsoft lokale bestandscontext en pc-acties naast RTX Spark-computers met maximaal 128 GB gedeeld geheugen. Nu voegt Copilot een automatische keuze van uitvoerplek toe aan eerdere keuzes over het model en de lokale agentomgeving.
Microsoft noemt geen Nederlandse prijs voor geschikte pc’s, kosten per voltooide programmeertaak of overzicht van welke teams de preview krijgen. Ook staat er niet of beheerders Auto kunnen beperken tot uitsluitend lokale modellen. De eerdere routering koos vooral tussen modellen; deze preview voegt de computer waarop de inferentie draait toe. Dat raakt cloudkosten, bedrijfslogica in broncode en de rechten van agenten. De preview staat gepland voor later in oktober, maar de voorwaarden en beheeropties bepalen hoe organisaties de route kunnen inzetten.
Veelgestelde vragen
AI die binnen je grenzen werkt
Ik denk mee over de data, rechten en uitvoerroute van je AI-proces. Daarna ontwerp en realiseer ik de oplossing end-to-end, self-hosted waar dat kan.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
