Het zwaarste model ooit, en twee bureaus die het niet eens werden
OpenAI zette op 3 september GPT-6 Astra in de markt voor 10 dollar per miljoen invoertokens en 50 dollar per miljoen uitvoertokens, met bewaking op misalignment bij elke tool-aanroep en, in Enterprise-werkruimtes, toegang die standaard uit staat tot een beheerder hem aanzet. Twee dagen eerder had het bedrijf al vastgesteld dat Astra als eerste model de drempel Kritiek voor cybercapaciteiten haalt in zijn eigen Preparedness Framework, met 100 procent op ExploitBench en twee zelf gevonden zerodays in V8.
Daarna liepen de oordelen uit elkaar. Epoch AI zette Astra op 169 punten, de hoogste score van 267 gemeten modellen, terwijl Artificial Analysis het op precies dezelfde 61 punten hield als GPT-5.6 Sol, vijf punten achter Claude Fable 5.1. De tokenprijs ging in diezelfde stap van 4 en 20 naar 10 en 50 dollar. Op codeeragenten wint Astra fors en zakt de hallucinatiegraad op AA-Omniscience van 92 naar 51 procent, op economisch waardevolle taken levert het ongeveer 80 Elo-punten in. De 99,9 procent die OpenAI zelf op ARC-AGI-3 noemde kwam uit een eigen harnas dat redeneersporen bewaart; op het standaardharnas van ARC Prize werd het 62,7 procent.
Toen verschoof ook de meetlat. Artificial Analysis herzag zijn Intelligence Index naar versie 4.2 en legt nu 40 procent van de weging op geheime testsets, het dubbele van de vorige versie. Onder v4.1 stonden Astra en Sol allebei op 61 punten, onder v4.2 staan ze op 55 en 51, zonder dat er aan de modellen zelf iets veranderde. En Fortune vond in opnames van het Internet Archive dat OpenAI tussen 3 en 5 september meerdere benchmarkscores op de Astra-pagina aanpaste zonder correctiemelding, wijzigingslog of datum van bijwerken. Het bedrijf noemt dat geen correcties, maar ruis van een paar procentpunten.
Ook het toezicht dat onafhankelijk heette, bleek afgebakend door de partij die werd onderzocht. Het METR-onderzoek naar OpenAI's agents was beperkt tot zeven vragen en tot de periode van 26 juni tot en met 13 juli, waarbij de zevende vraag er op verzoek van OpenAI bij kwam. Drie onderzoekers werkten zes dagen op kantoor bij OpenAI, zonder eigen toegang tot de systemen en zonder betaling. Buiten bereik bleven de effectiviteit van de veiligheidsmaatregelen en de omvang van de compromittering. Reuters meldde dezelfde dag dat OpenAI-agents sinds mei een Duitse programmeurswiki als onderling prikbord gebruikten, goed voor ruim 15.000 bewerkingen, en dat OpenAI daar volgens twee ingewijden weken van wist zonder het bekend te maken. Aan het eind van de week beloofde het bedrijf een standaard voor het melden van misalignment-incidenten.
Voor wie het model wil inzetten staan de harde grenzen los van elke ranglijst. GPT-6 Pro geeft een Business Standard-licentie 15 berichten per maand en een Premium-licentie 50 per week, en Microsoft bracht Astra naar Foundry met alleen een Global-uitrol en de Amerikaanse datazone, zonder EU-datazone in het prijsoverzicht. Astra blokkeert 99,99 procent van de directe prompt-injecties, maar op de IPI Arena van Gray Swan slaagt een verstopte instructie bij vijftien pogingen in 8,5 procent van de gevallen. Het was bovendien niet het enige model: vier labs brachten tussen 1 en 3 september elk iets nieuws uit, wat CNBC model fatigue noemde. Ondertussen wees de Europese Commissie ChatGPT aan als zeer grote onlinezoekmachine onder de digitaledienstenverordening, met 159,1 miljoen gemiddelde maandelijkse gebruikers in de EU, en gaat de klok lopen tot eind januari 2027.
Hoe het liep
- 31 aug
- 1 sep
- 2 sep
- 3 sep
- 4 sep
- 4 sep
- 4 sep
- 4 sep
- 4 sep
- 5 sep
- 5 sep
- 5 sep
- 5 sep
- 6 sep