Twee onderzoekers in witte jassen werken achter computers in een laboratorium.
Nieuws3 oktober · 01:082 min leestijd

Ai2 publiceert AstaBrief 8B voor onderzoeksrapporten

Ai2 publiceert AstaBrief 8B, een open model dat opgehaalde literatuur omzet in rapporten met bronverwijzingen. R&D-teams kunnen de workflow lokaal uitproberen, maar de hoofdtest richt zich op computerwetenschappelijke vragen.

AstaBrief 8B maakt een geciteerd rapport uit een onderzoeksvraag en opgehaalde literatuurfragmenten; Ai2 publiceerde op 2 oktober de modelgewichten en trainingsdata bij de open release.

Voor Nederlandse R&D-teams opent dit de mogelijkheid om rapportgeneratie op eigen infrastructuur te beproeven. Ai2 deelt ook een voorbeeldworkflow voor eigen pdf-bestanden. Dat kan literatuuronderzoek in life sciences of materiaalonderzoek ondersteunen, maar de gepubliceerde hoofdtest gebruikt computerwetenschappelijke vragen.

Wat de proef wel en niet meet

In Ai2's volledige Asta-pipeline duurde Fast mode gemiddeld 51,1 seconden per rapport. Claude-aangedreven Thinking mode duurde gemiddeld 178,5 seconden. Dat is ongeveer 3,5 keer sneller binnen die workflow, niet een meting van de modelgewichten alleen.

AstaBrief haalde op ScholarQA-CS2, een set van 200 computerwetenschappelijke vragen, 90,5 op citatieprecisie en 78,2 op citatiedekking; de modelkaart vermeldt ook Apache 2.0 als licentie. Ai2 noemt onderzoek en onderwijs als beoogd gebruik volgens zijn Responsible Use Guidelines. Citatieprecisie meet of een bron de gekoppelde bewering ondersteunt; citatiedekking meet of alle claims in het rapport door citaten worden onderbouwd. Het grootste deel van de training en evaluatie vond plaats in 2025. Ai2 heeft de volledige vergelijking niet opnieuw uitgevoerd met de huidige topmodellen.

Ai2 vergelijkt AstaBrief met andere modellen op SQABench-CS2, met scores voor onder meer citatieprecisie en citatiedekking. Beeld: Ai2
Ai2 vergelijkt AstaBrief met andere modellen op SQABench-CS2, met scores voor onder meer citatieprecisie en citatiedekking. Beeld: Ai2

De cijfers zeggen dus nog niet hoe het model presteert met literatuur uit andere vakgebieden of met eigen documenten. Dat onderscheid telt: in vier PwC-rapporten met verzonnen bronvermeldingen bleken keurige verwijzingen op zichzelf geen bewijs dat de bron de claim droeg. Voor R&D-teams draait een proef daarom niet alleen om het rapport, maar ook om de stap van iedere belangrijke claim terug naar de bronpassage en de reikwijdte van de conclusie.

Veelgestelde vragen

Alisina Nawabi
Geschreven doorAlisina Nawabi

AI Product Engineer & Solutions Architect

AI voor eigen onderzoek

Ik denk mee over je onderzoeksworkflow, ontwerp de AI-toepassing en realiseer en automatiseer die van eerste proef tot dagelijks gebruik. Waar dat kan, richt ik de oplossing self-hosted in, zodat je onderzoeksdocumenten op je eigen infrastructuur blijven.

Meer informatie

Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

Gerelateerde artikelen

AWS maakt Strands Decider 2B open source
Nieuws
3 min

1 okt 22:34

AWS maakt Strands Decider 2B open source

AWS publiceert Strands Decider 2B onder Apache 2.0. Het beslismodel kiest uit vaste opties en haalt volgens AWS een mediane latentie van 115 milliseconden op een RTX 3090. Eigen rekenkracht en beheer blijven onderdeel van de kosten.

Anthropic publiceert bouwplan voor koopagents in je eigen webshop
Nieuws
5 min

3 sep 04:11

Anthropic publiceert bouwplan voor koopagents in je eigen webshop

Anthropic zet werkende code voor een koopagent en een winkeliersagent op Claude online, onder Apache 2.0. Het afrekenen laat het bouwplan bewust bij jou. Wat dat betekent voor je webshop vlak voor de feestdagen.

Advieskantoren werven forward deployed engineers nu AI naar productie moet
Nieuws
6 min

25 aug 10:27

Advieskantoren werven forward deployed engineers nu AI naar productie moet

Deloitte, Accenture, Capgemini en McKinsey zoeken forward deployed engineers die AI in de dagelijkse bedrijfsvoering inpassen. Het profiel is schaars, en dat verandert de rekensom voor wie een AI-traject uitbesteedt.

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten
Nieuws
6 min

24 aug 16:12

Thomson Reuters bouwt eigen AI-model op open Chinese gewichten

Thomson Reuters trainde voor 40 miljoen dollar een eigen AI-model op open Qwen-gewichten en de eigen juridische archieven. De benchmarks laten precies zien waar eigen data wel en niet loont.

Block geeft agentwerkplek Berd vrij onder Apache 2.0
Nieuws
5 min

19 aug 02:25

Block geeft agentwerkplek Berd vrij onder Apache 2.0

Block brengt Berd uit als open source: een desktopwerkplek die met goose, Claude Code en Codex werkt, elk model toelaat en de gespreksgeschiedenis op je eigen machine bewaart. Gratis, maar zonder centrale beheerlaag.

GCC weigert AI-gegenereerde code boven de 15 regels
Nieuws
4 min

31 jul 22:11

GCC weigert AI-gegenereerde code boven de 15 regels

Het stuurcomité van GCC weigert voortaan AI-gegenereerde code die boven de auteursrechtelijke drempel van ongeveer vijftien regels uitkomt. De reden is de licentieketen: code zonder menselijke auteur is code die niemand bezit.