Microsoft wil zijn nieuwe AI-chip Maia 300 dit najaar publiek onthullen, mogelijk al in september, en onderhandelt met TSMC over productiecapaciteit voor ruim 300.000 exemplaren met levering in 2027. Dat meldt The Information op basis van ingewijden. Microsoft zelf heeft niets aangekondigd.
Voor een Nederlands bedrijf dat AI-werk op Azure draait gaat het niet om de chipnaam, maar om een tweede rekenspoor binnen dezelfde cloud. Elke versneller die Microsoft zelf ontwerpt is capaciteit die het niet bij Nvidia hoeft in te kopen, en dat raakt drie dingen tegelijk: wat een miljoen tokens kost, of er in een drukke week nog capaciteit vrij is, en hoe hard je inferencecode aan CUDA vastzit. Voorlopig is dit een routekaart en geen prijslijst. Er ligt geen aankondiging, geen leverdatum en geen Europese regio.
Wat er nu al draait
Maia 300 volgt op Maia 200, dat Microsoft op 26 januari aankondigde en dat inmiddels in Azure draait. Die chip komt van TSMC's 3-nanometerproces, telt ruim 140 miljard transistors en levert meer dan 10 petaFLOPS in 4-bits precisie binnen een verbruik van 750 watt, met 216 GB HBM3e-geheugen ernaast. Microsoft claimt daarmee 30 procent meer prestatie per dollar dan de nieuwste generatie hardware. De chip is expliciet voor inference gebouwd, niet voor training: hij draait modellen, hij traint ze niet.
Twee details bepalen wat je er als afnemer aan hebt. Het eerste is geografie. Maia 200 startte in de Azure-regio US Central bij Des Moines in Iowa, met US West 3 bij Phoenix als volgende. Wie zijn data om juridische redenen in West-Europa houdt, komt er dus voorlopig niet bij. Het tweede is software. De Maia SDK bevat PyTorch-integratie, een Triton-compiler, een kernelbibliotheek en een kostencalculator. Dat is precies de laag waar leveranciersafhankelijkheid ontstaat of juist niet: draait je inference op PyTorch en Triton, dan is overstappen werk. Hangt hij aan handgeschreven CUDA-kernels, dan is het herbouw.

Wat Microsoft er zelf al over zei
De septemberdatum staat op gespannen voet met wat Microsoft eerder zelf uitdroeg. Andrew Wall, general manager van Azure Maia, zei tegen Techzine dat Maia 300 ergens in 2027 wordt verwacht en dat Maia 200 daarna nog vier tot vijf jaar in gebruik blijft. Een onthulling in het najaar en chips die pas in 2027 geleverd worden sluiten elkaar niet uit, maar het gat tussen een aankondiging en beschikbare capaciteit in jouw regio is hier het hele verhaal.
De volumes zijn navenant onzeker. Microsoft mikt volgens Reuters uiteindelijk op capaciteit voor meer dan een miljoen Maia 300-chips, maar componentenschaarste en de lopende onderhandelingen met TSMC kunnen dat plan inperken. De eerste Maia kwam in november 2023 uit, en sindsdien bleef Microsoft achter op Google en Amazon in het opschalen van eigen silicium.
Anthropic is de test
Microsoft wil grote afnemers op de chip krijgen, en Anthropic staat daarbij bovenaan. Die gesprekken lopen al langer. In mei werd bekend dat Anthropic met Microsoft praat over het draaien van Claude-modellen op Azure Maia-servers, nog in een vroeg stadium, waarbij Anthropic ook input wil op het ontwerp van de volgende Maia-generatie. Datzelfde bedrijf bevestigde begin augustus een eigen chipteam voor Claude en werft siliciumingenieurs, terwijl het zijn rekenkracht spreidt over Nvidia, AWS, Google en AMD. Een externe klant die zijn modellen op Maia zet, is voor Microsoft het bewijs dat de chip meer is dan een interne kostenpost.
Waar dit heen wijst
Microsoft dekt zich op meerdere sporen in. In juli nam het AMD's Helios-rack met 72 versnellers af voor Azure, naast de eigen Maia-lijn en de bestaande Nvidia-vloot. Meta start in september de productie van zijn eigen AI-chip Iris bij Broadcom en TSMC. Eigen silicium is bij de grote clouds geen zijspoor meer, het is de hoofdbeweging in AI-infrastructuur.
Wat al die stappen delen is dat ze op de softwarelaag worden beslist en niet op de siliciumlaag: de echte drempel om van Nvidia weg te stappen zit niet in de chip maar in de CUDA-software eronder. Voor wie nu rekenkracht inkoopt is dat de bruikbare lezing van dit soort berichten. De vraag is niet welke chip het snelst is, maar in welke regio hij staat en welke SDK hij spreekt. Dat bepaalt of een tweede rekenspoor over twee jaar echte keuze oplevert, of alleen een andere naam op dezelfde rekening.
Veelgestelde vragen
Bouwen zonder vast te zitten
Welke chip of cloud er over twee jaar onder je AI-werk ligt, weet niemand. Ik denk met je mee over die keuze, ontwerp de opzet en bouw hem ook, met zoveel mogelijk zelf in beheer zodat je later nog kunt schuiven.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
