Beam is het eerste open-weightmodel van Reflection. Bij vergelijkbare scores met GLM-5.2 zou het model drie tot vier keer minder inferentiecompute gebruiken, meldt het bedrijf.
Een lagere rekenlast per afgeronde codeer- of agenttaak kan bij veel verzoeken GPU-tijd en stroomverbruik drukken. Maar Reflection publiceert nog geen prijs per verzoek, downloadbare gewichten of definitieve hardware-eisen. Een Nederlandse inkoper kan de beloofde besparing dus nog niet doorrekenen.
Beam richt zich op code en lange agenttaken
Beam verwerkt alleen tekst en gebruikt een sparse mixture-of-experts-opzet: het telt 501 miljard parameters, waarvan er 23 miljard per token actief zijn. Het aantal actieve parameters beschrijft hoeveel er per token meerekenen, niet hoeveel geheugen de volledige gewichten vragen. Reflection richt het op programmeren, redeneren en AI-agenten. Het bedrijf noemt een contextvenster tot één miljoen tokens en zegt Beam te hebben voorgetraind op 23,8 biljoen tokens uit webbronnen en gelicentieerde datasets.
Op Terminal-Bench 2.1 scoort Beam volgens Reflection 80,1, tegenover 81,0 voor GLM-5.2. Dezelfde tabel zet GLM-5.3 op 88,2 en Qwen 3.8 Max op 86,6. De uitkomst is dus smaller dan een algemene claim over Chinese modellen verslaan: Beam zit dicht bij GLM-5.2 op deze test, terwijl andere modellen hoger scoren.

GLM-5.2 is een bruikbare vergelijking omdat de gewichten ervan publiek beschikbaar zijn voor lokale inzet met gangbare inferentiesoftware, schrijft Z.ai. Teams kunnen die basis al testen terwijl Beam op de wachtlijst staat. Reflection richt Beam volgens Fortune op ondernemingen, de publieke sector en ontwikkelaars.
De kostenclaim meet niet de hele rekening
De factor drie tot vier is geen gemeten prijsverschil. Reflection schat de rekenlast voor gegenereerde tokens op basis van actieve parameters en gemiddelde antwoordlengte. De berekening sluit promptverwerking, rekenwerk bij lange contexten en extra rekenwerk voor het serveren uit. Dat maakt de grafiek een benadering van inferentiecompute, geen vergelijking van euro’s per taak.
De scores komen van Reflection zelf. TechCrunch schrijft dat de prestatieclaims nog niet onafhankelijk zijn gecontroleerd. Reflection gebruikt Artificial Analysis en DataCurve voor resultaten van andere modellen, maar publiceert nog geen onafhankelijke Beam-run of reproduceerbare serverconfiguratie. Een benchmarkscore vertelt dus niet hoeveel geheugen, capaciteit of beheertijd een inzet vraagt.
Bij veel codeer- of agentverzoeken telt de uitkomst per geslaagde taak. Een efficiënter model kan minder rekenwerk vragen, maar een lange redeneerroute kan meer tokens gebruiken. Zonder prijs, geheugengebruik, taakduur en kwaliteit op eigen voorbeelden voorspelt de verhouding op de grafiek de uiteindelijke rekening niet.
De gewichten komen later deze maand
Op 5 oktober zijn de gewichten niet publiek te downloaden. Reflection zegt dat Beam nog een laatste veiligheidstoets en evaluaties doorloopt; alleen geselecteerde gebruikers kunnen vroege toegang aanvragen. Later deze maand wil het bedrijf de gewichten onder Apache 2.0 publiceren, samen met een technisch rapport, modelkaart en materiaal om het model te draaien, beoordelen en fijn af te stemmen.
Open gewichten zijn niet automatisch volledige open source. Reflection noemt gewichten en gebruiksmaterialen, maar belooft niet de 23,8 biljoen trainingstokens of alle trainingscode en -methoden te publiceren. Dat bepaalt wat teams straks kunnen controleren of namaken. De precieze reikwijdte van Apache 2.0 is pas te beoordelen wanneer de gewichten en modelkaart verschijnen.
De timing valt samen met een Europese release. Aleph Alpha publiceerde op 3 oktober Kolibri met downloadbare gewichten onder Apache 2.0. De modelkaart noemt ongeveer 78 GB geheugen voor de FP8-gewichten en minimaal twee A100-kaarten of één H200, B200 of B300. Dat geeft Europese teams al een concrete route om een model te testen. Voor Beam zijn zulke specificaties er nog niet, dus 23 miljard actieve parameters zeggen niet welke serveropstelling nodig is.
Reflection verkoopt ook de weg naar inzet
Beam volgt op een grote infrastructuurstap. In juni legde Reflection voor maximaal 6,3 miljard dollar toegang tot Nvidia GB300-capaciteit in SpaceX’ Colossus vast. TechCrunch beschreef een looptijd tot 2029 en betalingen van 150 miljoen dollar per maand vanaf 1 juli. De deal vergroot Reflections toegang tot capaciteit, al zegt de Beam-aankondiging niet of juist die chips voor dit model zijn gebruikt. De overeenkomst zegt niets over de uiteindelijke klantprijs.
De oprichters zeggen dat Reflection inkomsten verwacht uit software en infrastructuur voor het aanpassen, uitrollen en op schaal draaien van modellen en agents, vertelt Alex Heath. Daarmee komt er een commerciële laag rond het gewichtenbestand. Voor inkopers kan de keuze straks gaan tussen eigen beheer, een cloudplatform of dienstverlening van de maker, met andere kosten en datastromen per route.
Dat raakt ook de eerdere afweging rond open modellen: zelf hosten haalt de greep van een aanbieder weg, maar een gehost model behoudt de afhankelijkheid van leverancier en jurisdictie. Een Amerikaanse open-weightoptie verbreedt het aanbod naast Chinese modellen, maar lost dat vraagstuk alleen op als een organisatie de gewichten daadwerkelijk kan en wil beheren.
Beam voegt een Amerikaanse kandidaat toe naast Chinese modellen en Europese gewichten die al te downloaden zijn. De volgende toets komt zodra Reflection bestanden, licentievoorwaarden en serververeisten publiceert. Dan kunnen teams eigen taken draaien en de totale kosten vergelijken, inclusief hardware, stroom en beheer. Tot die release blijft de besparingsclaim een benchmark van Reflection, geen begrotingspost die al omlaag kan.
Veelgestelde vragen
Van model naar werkproces
Ik denk mee over hoe een model in je organisatie past, ontwerp de oplossing en realiseer het hele traject tot livegang. Waar het kan, automatiseer ik self-hosted, zodat je controle houdt over je systemen en gegevens.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.

