Computerscherm met programmeercode en een menu voor AI-acties.
Nieuws8 oktober · 06:155 min leestijd

GitHub Copilot krijgt modelroutering tussen pc en cloud

GitHub Copilot gaat taken automatisch lokaal of in de cloud verwerken. De keuze raakt de datastroom van broncode, het geheugen dat modellen vragen en de rechten waarmee agenten tools uitvoeren.

GitHub Copilot kiest vanaf eind oktober per taak tussen lokale en cloudmodellen, meldt Microsoft; de experimentele preview verschijnt in de Copilot-app, CLI en Visual Studio Code.

Een ontwikkelteam kan code en prompts daarmee lokaal laten verwerken of een taak via een cloudmodel afhandelen. De route bepaalt waar inferentie plaatsvindt, maar niet welke bestanden, shellcommando’s, netwerkverbindingen of sleutels de agent mag gebruiken. Voor Nederlandse organisaties komen modelkeuze, datastromen en toegangsbeleid daardoor samen in één codeerworkflow, terwijl het technisch verschillende beslissingen blijven.

Copilot kan de route kiezen of vastzetten

In Auto laat GitHub Copilot zelf kiezen wanneer een taak op het apparaat of in de cloud wordt verwerkt. Tijdens een sessie met meerdere beurten houdt de router rekening met taakcontext en cache, zodat Copilot eerder verwerkte context kan hergebruiken. De ontwikkelaar kan ook zelf een lokaal model of endpoint kiezen als een workflow een specifieke aanbieder, modelversie of aansluiting vereist.

De aankondiging noemt MAI Code 1.1 Flash via de Windows ML-provider en lokale endpoints die de OpenAI-API ondersteunen. Daaruit kiest de ontwikkelaar zelf een model. Auto en handmatige selectie zijn verschillende bedieningsvormen: de route aan Copilot overlaten of vooraf een lokale keuze vastleggen.

GitHub Copilot toont een codecontrole met Auto en MAI Code 1.1 Flash. Bron: Microsoft
GitHub Copilot toont een codecontrole met Auto en MAI Code 1.1 Flash. Bron: Microsoft

Microsoft noemt later in oktober als moment voor de experimentele preview. De aankondiging noemt de Copilot-app, CLI en VS Code, maar geen ondersteunde abonnementen, landen of beheerinstellingen om Auto tot een lokale route te beperken.

MAI Code laat de hardwaregrens zien

Microsoft gebruikt MAI Code 1.1 Flash als voorbeeld van lokale code-inferentie. Het model telt 137 miljard parameters, waarvan er 6,8 miljard per keer actief zijn. De gekwantiseerde variant op het apparaat neemt volgens het bedrijf 53 GB in, 80 procent minder dan de versie met Bfloat16-gewichten voor de cloud. NVIDIA meldt dat RTX Spark-laptops vanaf 16 oktober beschikbaar zijn, met maximaal 128 GB gedeeld geheugen in Surface Laptop Ultra; de voorverkoop start op 7 oktober. Dezelfde geheugenpool biedt ook ruimte aan het besturingssysteem, programma’s, de uitvoersoftware en de cache voor de gesprekscontext.

Bij een context van 256.000 tokens piekte het gemeten geheugengebruik op 75,5 GB. Microsoft rapporteert promptverwerking tot 923,5 tokens per seconde bij een context van 64.000 tokens en 769,8 bij 128.000. Op SWE-Bench Verified, met 500 programmeertaken, scoorde de lokale variant 70,80 procent tegenover 72,6 procent voor de standaardversie. Op Terminal-Bench 2.1, met 89 taken, waren de scores 66,29 en 62,9 procent. De resultaten komen uit Microsofts eigen metingen.

Die metingen zijn op 5 oktober uitgevoerd met een Windows ARM64-runtime op basis van llama.cpp en CUDA, plus DFlash2-speculative decoding. De voetnoot noemt een synthetische codegeneratietaak en waarschuwt dat prestaties verschillen per apparaat en configuratie. De benchmarks garanderen daarom niet dat een team dezelfde snelheid of taakvoltooiing haalt op andere pc’s. Microsoft publiceert geen prijsvergelijking met cloudgebruik. Lokale inferentie kan cloudverbruik beperken, maar hardware, geheugen en beheer tellen mee in de totale kosten.

Een lokale inferentie is geen offline sessie

Een code-agent voert shellopdrachten normaal gesproken uit met de rechten van het gebruikersaccount. Microsoft Execution Containers, kortweg MXC, kunnen toegang tot bestanden, netwerken, inloggegevens en systeemfuncties begrenzen, ongeacht welk model om een actie vraagt. Op Windows gebruikt Copilot BaseContainer van ProcessContainer, op macOS Seatbelt en op Linux bubblewrap.

Als sandboxing aanstaat, draaien shellopdrachten en standaard lokale MCP-servers en taalservers binnen de procesgrens. De ingebouwde bestandsfuncties draaien in GitHub Copilot zelf. De agent controleert hun verzoeken tegen het beleid, maar het besturingssysteem dwingt die controle niet af als isolatie van een apart proces. Externe MCP-servers vallen buiten de lokale processandbox; waar regels gelden, controleert Copilot hun verbinding in het eigen proces. GitHub had lokale en cloud-sandboxen voor Copilot in juni in publieke preview gezet.

Een lokale modelroute betekent dus niet vanzelf dat alle data en tools lokaal blijven. Auto kan naar een cloudmodel schakelen en een externe MCP-server blijft buiten de lokale procesgrens. Voor een team zijn de modelroute en de rechten van opdrachten twee aparte onderdelen van het beveiligingsbeleid.

GitHub voegt de uitvoerplek aan Auto toe

GitHub voegde in april ondersteuning toe voor eigen aanbieders en lokale modellen in Copilot CLI, inclusief een offline stand. Op 4 september volgde Project HydraFusion als onderzoekspreview voor routering tussen meerdere modellen. De nieuwe stap voegt daaraan de keuze toe tussen modeluitvoering op de computer en in de cloud.

De modelkeuze was al onderwerp van beleid: GitHub verving in juni de handmatige modelkiezer in Free en Student door Copilot Auto. Een dag eerder presenteerde Microsoft lokale bestandscontext en pc-acties naast RTX Spark-computers met maximaal 128 GB gedeeld geheugen. Nu voegt Copilot een automatische keuze van uitvoerplek toe aan eerdere keuzes over het model en de lokale agentomgeving.

Microsoft noemt geen Nederlandse prijs voor geschikte pc’s, kosten per voltooide programmeertaak of overzicht van welke teams de preview krijgen. Ook staat er niet of beheerders Auto kunnen beperken tot uitsluitend lokale modellen. De eerdere routering koos vooral tussen modellen; deze preview voegt de computer waarop de inferentie draait toe. Dat raakt cloudkosten, bedrijfslogica in broncode en de rechten van agenten. De preview staat gepland voor later in oktober, maar de voorwaarden en beheeropties bepalen hoe organisaties de route kunnen inzetten.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI die binnen je grenzen werkt

Ik denk mee over de data, rechten en uitvoerroute van je AI-proces. Daarna ontwerp en realiseer ik de oplossing end-to-end, self-hosted waar dat kan.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Genoemde integraties

Dit artikel noemt deze tools. Ik koppel ze op maat aan je eigen systemen.

Gerelateerde artikelen

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger
Nieuws
4 min

12 aug 08:22

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, 73 procent goedkoper dan zijn voorganger

Microsoft zet MAI-Code-1.1-Flash in GitHub Copilot, met een listprijs die 73 procent onder die van zijn voorganger ligt. Wat het model kost, wat het kan, en waarom het bij Business en Enterprise standaard uit staat.

Microsoft brengt lokale AI-agenten naar Windows-pc's
Nieuws
5 min

7 okt 22:54

Microsoft brengt lokale AI-agenten naar Windows-pc's

Copilot gaat lokale bestanden gebruiken en acties uitvoeren, terwijl RTX Spark de rekenkracht naar Windows-pc's brengt. De voorverkoop is gestart; de eerste laptops zijn vanaf 16 oktober beschikbaar.

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code
Nieuws
4 min

7 aug 12:24

Agent Plugins 1.0 maakt agentuitbreidingen draagbaar tussen ChatGPT, Copilot en VS Code

Amazon, Cursor, Microsoft, OpenAI en Vercel publiceerden een open pakketformaat voor Agent Skills en MCP-servers. Google sluit aan als core maintainer. Je bouwt een agentuitbreiding voortaan een keer, niet per client.

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze
Nieuws
6 min

3 jul 04:10

Kimi K2.7 Code nu kiesbaar in GitHub Copilot: eerste open-weight model in de modelkeuze

GitHub heeft Kimi K2.7 Code algemeen beschikbaar gemaakt in de Copilot-modelkeuze. Het is het eerste open-weight model in de picker, fors goedkoper dan de frontier-modellen, en je devteam kan vandaag overstappen zonder tooling te wijzigen.

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna
Nieuws
4 min

22 sep 22:12

OpenAI verlaagt API-prijzen voor GPT-6 Sol en Luna

OpenAI brengt GPT-6 Sol en Luna uit met lagere API-tarieven: 2 en 10 dollar voor Sol, 0,10 en 0,50 dollar voor Luna per miljoen tokens. Voor Nederlandse teams wordt modelkeuze per taak belangrijker.

Microsoft kondigt Project Zenith aan voor pc's die 30B-modellen lokaal draaien
Nieuws
4 min

4 sep 20:22

Microsoft kondigt Project Zenith aan voor pc's die 30B-modellen lokaal draaien

Microsoft kondigt Project Zenith aan, een vooraf ingerichte Windows 11-opzet voor ontwikkelmachines met 64 GB geheugen en 250 GB/s bandbreedte. Modellen van 30 miljard parameters draaien er lokaal, en dat verschuift de AI-rekening van tokens naar hardware.