Gisteren Cijfer
zet in samengestelde index Gemini 3.8 Live Extended Thinking op 82,6
“De onafhankelijke Speech to Speech-pagina van Artificial Analysis zet Gemini 3.8 Live Extended Thinking op 82,6 in zijn samengestelde index” Google lanceert Gemini 3.8 Live voor realtime spraakagenten Maandag 14 sep Cijfer
rapporteert dat een index-taak met Astra gemiddeld 3,26 dollar kost tegenover 7,63 dollar met Fable 5.1
“gemiddeld kost een index-taak met Astra 3,26 dollar, tegenover 7,63 dollar met Fable 5.1.” Artificial Analysis zet GPT-6 en Claude gelijk op 53 Maandag 14 sep Bewering
ontkent dat de aanpassingen bedoeld waren om OpenAI te bevoordelen
“ontkent dat de aanpassingen bedoeld waren om OpenAI te bevoordelen.” Artificial Analysis zet GPT-6 en Claude gelijk op 53 Maandag 14 sep Feit
plaatst GPT-6 Astra en Claude Fable 5.1 samen bovenaan met 53 punten
“Artificial Analysis zet GPT-6 Astra en Claude Fable 5.1 samen bovenaan met 53 punten” Artificial Analysis zet GPT-6 en Claude gelijk op 53 Dinsdag 8 sep Cijfer
kent toe 15 punten op de eigen Intelligence Index aan MiniCPM5-2B
“Een onafhankelijke meting van Artificial Analysis geeft het model 15 punten op de eigen Intelligence Index” OpenBMB brengt MiniCPM5-2B uit voor lokale AI Zaterdag 5 sep Cijfer
laat rusten op geheime testsets
“laat 40 procent van de weging nu rusten op geheime testsets” Artificial Analysis herziet zijn AI-index en zet 40 procent op geheime tests Zaterdag 5 sep Feit
herziet Intelligence Index naar versie 4.2
“Artificial Analysis herziet zijn Intelligence Index naar versie 4.2” Artificial Analysis herziet zijn AI-index en zet 40 procent op geheime tests Vrijdag 4 sep Feit
meet geen vooruitgang voor GPT-6 Astra ten opzichte van GPT-5.6 Sol
“Artificial Analysis geen enkele vooruitgang meet ten opzichte van de voorganger” Benchmarkbureaus spreken elkaar tegen over GPT-6 Astra Donderdag 3 sep Cijfer
rekent om naar 1,67 dollar per duizend audiominuten
“rekent het nieuwe tarief om naar 1,67 dollar per duizend audiominuten” Microsoft zet MAI-Transcribe-2 op tien dollarcent per uur audio Donderdag 3 sep Feit
teste Muse Spark 1.1
“de eerste externe meting van Artificial Analysis Muse Spark 1.1 op 71,3 op de coding-index” Meta lanceert Muse Spark 1.3 met 25 procent minder tokens 27 aug Cijfer
rekent om naar 5 dollar per duizend minuten
“Artificial Analysis rekent dat om naar 5 dollar per duizend minuten, dus zo'n 30 dollarcent per uur opname.” Google lanceert Gemini 3.5 Transcribe met Nederlands in de API 24 aug Cijfer
mat een snelheid van 3.400 uitgaande tokens per seconde
“Artificial Analysis mat dat op het open model Gemma 4 31B met een context van 100.000 tokens” Nvidia zet Groq 3 LPX in volle productie, Nebius neemt hem als eerste af 15 aug Feit
vergelijkt de prestaties van Opus 5 en Kimi K3
“Benchmarkpartij Artificial Analysis zet Opus 5 op zijn hoogste effort-stand op 63 punten in zijn intelligentie-index tegen 60 voor Kimi K3” Amerikaanse AI-labs verlagen tarieven, tokenindex een kwart lager 13 aug Feit
evalueerde DeepSeek-V4-Pro
“Meetbureau Artificial Analysis heeft 0813 inmiddels doorgemeten en komt uit op 53 op zijn Intelligence Index” DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk 13 aug Cijfer
geeft een score van 60 aan Kimi K3
“en 60 voor Kimi K3” DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk 13 aug Cijfer
geeft een score van 62 aan Claude Fable 5
“tegen 62 voor Claude Fable 5” DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk 13 aug Cijfer
geeft een score van 53 aan DeepSeek-V4-Pro
“Meetbureau Artificial Analysis heeft 0813 inmiddels doorgemeten en komt uit op 53 op zijn Intelligence Index” DeepSeek brengt V4-Pro uit preview en houdt de tarieven gelijk 6 aug Cijfer
berekende prijzen voor V4-Flash en GPT-5.6 Luna
“Meetbureau Artificial Analysis komt voor V4-Flash uit op een gemengde prijs van 0,06 dollar per miljoen tokens” DeepSeek kondigt een brede prijsverhoging aan voor zijn API 3 aug Cijfer
rangschikt H3
“Artificial Analysis zet H3 op één bij videobewerking met een Elo van 1130” MiniMax zet gewichten van videomodel H3 online en sluit de EU uit 31 jul Bewering
zet H3 op één voor videobewerking
“Meetplatform Artificial Analysis zet H3 op één voor videobewerking” MiniMax lanceert videomodel H3 en publiceert de gewichten binnen dagen 31 jul Cijfer
plaatst op Intelligence Index V4-Flash op 50 tegen 56 voor Claude Opus 4.8
“Op de onafhankelijke Intelligence Index van Artificial Analysis staat V4-Flash op 50 tegen 56 voor Claude Opus 4.8” DeepSeek zet V4-Flash in publieke beta en rekent in piekuren straks het dubbele 31 jul Feit
geeft 40 punten op de Intelligence Index aan Inkling Small
“Inkling Small haalt 40 punten op de Intelligence Index” Thinking Machines brengt Inkling Small uit met een kwart van de parameters 17 jul Cijfer
geeft Kimi K3 een score van 57 op zijn Intelligence Index
“Onafhankelijk testlab Artificial Analysis geeft K3 een score van 57 op zijn Intelligence Index” Moonshot bereidt Kimi K3 voor: een open model dat mikt op Anthropics Opus 4.8 17 jul Cijfer
geeft Kimi K3 een score van 57 op Intelligence Index
“Artificial Analysis geeft K3 een score van 57 op zijn Intelligence Index” Moonshot bereidt Kimi K3 voor: een open model dat mikt op Anthropics Opus 4.8 1 jul Cijfer
berekent gemiddelde kosten per taak van Sonnet 5: $2,29, Sonnet 4.6: $1,20, Opus 4.8: $1,97
“Artificial Analysis komt uit op gemiddeld $2,29 per taak voor Sonnet 5, tegen ongeveer $1,20 voor Sonnet 4.6 en $1,97 voor het duurdere Opus 4.8” Claude Sonnet 5: zelfde tarief, hogere AI-rekening per taak 15 jun Feit
verwijderde uit ranglijst en verving DeepSWE
“Artificial Analysis haalde SWE-Bench Pro medio juni al uit zijn ranglijst en verving het door DeepSWE” OpenAI trekt aanbeveling van codeerbenchmark SWE-Bench Pro in na eigen audit