Met Beam lanceert Reflection AI zijn eerste open weight model. Het is een sparse Mixture of Experts model met 501 miljard parameters in totaal, waarvan er per token slechts 23 miljard actief zijn. Beam is gebouwd voor coding, reasoning en agentic workloads. De belofte is helder: prestaties die meekunnen met grotere open modellen, tegen een fractie van de inference compute. Reflection publiceert de weights later deze maand onder een Apache 2.0 licentie. Intussen kan een selecte groep gebruikers een vroege versie testen via een waitlist.

Wat is Beam van Reflection AI?

Reflection AI is een startup uit Brooklyn, opgericht in 2024 door de voormalige Google DeepMind onderzoekers Misha Laskin en Ioannis Antonoglou. Het bedrijf haalde volgens PitchBook ongeveer 4,7 miljard dollar op bij investeerders zoals Nvidia, Sequoia Capital en Lightspeed Venture Partners. Beam is het eerste model uit een reeks, en het team traint volgens eigen zeggen al aan de opvolger.

De belangrijkste specificaties op een rij:

  • Architectuur: sparse Mixture of Experts met 501 miljard parameters, 23 miljard actief
  • Pretraining: 23,8 biljoen tokens uit het web, publieke bronnen en gelicentieerde datasets
  • Context window: 1 miljoen tokens
  • Modaliteit: enkel tekst
  • Licentie: Apache 2.0

Ter vergelijking: GLM 5.2 van het Chinese Z.ai telt ongeveer 744 miljard parameters, waarvan 40 miljard actief. Beam is dus kleiner, en dat is belangrijk.

Hoe presteert Beam op benchmarks?

Reflection positioneert Beam als een stap vooruit voor de Westerse open weight frontier. Op coding en agentic taken noemt het bedrijf Beam competitief met GLM 5.2 en dicht in de buurt van Qwen 3.8 Max van Alibaba. Kimi K3 van Moonshot AI blijft volgens Reflection zelf sterker in pure capaciteit. Die eerlijkheid is opvallend in een lanceringsbericht.

Enkele gerapporteerde scores:

  • 80,9 op SWEBench Verified, tegenover 77,6 voor Inkling van Thinking Machines Lab
  • 80,1 op Terminal Bench v2.1, tegenover 88,3 voor Kimi K3
  • 77,2 op SWE Bench Pro v2 Hard
  • 97,8 op AIME 2026
  • 90,5 op GPQA Diamond
  • 36,2 op Humanity’s Last Exam zonder tools

Alle cijfers komen van Reflection en zijn nog onafhankelijk geverifieerd. Ook de claim dat Beam op geavanceerde reasoning benchmarks GLM 5.2 evenaart met drie tot vier keer minder inference compute, is een inschatting. Reflection berekent die compute als tweemaal het aantal actieve parameters vermenigvuldigd met het gemiddelde aantal gegenereerde tokens. Prompt prefill, attention en serving overhead werden niet gemeten. Het gaat dus om een indicatie van efficiëntie.

Meer intelligentie per token

Reflection noemt Beam een workhorse model voor bedrijven, overheden en developers. Dat label hangt samen met hoe het model leerde redeneren. Tijdens training kreeg Beam een instelbare length penalty die geslaagde oplossingen beloont en overbodige tokens ontmoedigt.

Het verloop daarvan is interessant. In het begin van de reinforcement learning fase verbeterden de prestaties terwijl de antwoorden korter werden. Het model leerde taken efficiënter op te lossen. Later, toen de agentic vaardigheden sterker werden, groeiden de antwoorden opnieuw, maar die extra tokens leverden ook extra prestaties op.

Als gebruiker krijg je die afweging zelf in handen via een reasoning effort parameter. Een lage instelling geeft kortere antwoorden, een hoge instelling laat het model langer nadenken over complexe taken. Zo stem je de rekenkracht af op de taak en op je budget.

De reinforcement learning run achter Beam

Reinforcement learning was voor Reflection de centrale as om Beam op te schalen. De cijfers:

  • 10.500 Nvidia GB300 GPU’s, vier weken lang
  • meer dan 100 miljoen rollouts met een maximale context van 256.000 tokens
  • ongeveer 1,3 miljard sandboxes voor training en beoordeling
  • bijna een miljoen omgevingen voor coding, agentic taken en STEM

Reflection beschouwt dit als een van de grootste RL runs ooit door een open lab. Belangrijker is de observatie dat de capaciteiten bleven stijgen naarmate er meer compute bij kwam, zonder teken van een plateau.

Om dat stabiel te houden, trainde het team met asynchronous policy gradients. Bij lange rollouts worden tokens gegenereerd door verschillende versies van het model, wat voor instabiliteit zorgt. Reflection ontwikkelde nieuwe algoritmes waardoor het systeem stabiel bleef leren van interacties die tot 107 weight versies of ongeveer een dag achterliepen op de huidige policy.

Datakwaliteit bleek doorslaggevend

De omgevingen kwamen grotendeels uit synthetische data pipelines, aangevuld met data van leveranciers en open source bronnen. Elke taak werd gefilterd op moeilijkheid, zodat ze voor het model haalbaar maar niet te gemakkelijk was. Er werd ook geselecteerd op kwaliteit. Taken die vaag of misleidend waren, werden verwijderd. Volgens Reflection leidde elk compromis op datakwaliteit tot een plateau in capaciteiten.

Vaardigheden die verder reiken dan de training

Een van de opvallendste bevindingen gaat over generalisatie. Tijdens een fase waarin Beam trainde op reasoning, software engineering en terminal taken, werd het model ook beter in browsen, terwijl er geen enkele browsing taak in de mix zat. Met toegang tot het web leerde Beam op eigen houtje andere large language models te raadplegen en OCR API’s te gebruiken om documenten te lezen.

Een stevige basis via pretraining

Reinforcement learning bouwt verder op een goed base model. Beam werd in minder dan vier weken gepretraind op 6.144 Nvidia GB300 NVL72 GPU’s, met infrastructuur die Reflection grotendeels zelf bouwde. De goodput, het aandeel van de tijd dat effectief naar bruikbare trainingsstappen ging, haalde op het einde 92,3 procent.

Architecturaal combineert Beam lokale en globale attention, fijnmazige routed experts en load balancing zonder auxiliary loss. Het resultaat is een bijna perfect gelijkmatige verdeling over de experts: de drukste expert draaide op het einde van pretraining gemiddeld 1,04 keer de gemiddelde belasting. Een midtraining fase breidde de effectieve context uit naar 1 miljoen tokens.

Veiligheid en alignment

Voor alignment trainde Reflection een tweede model vanuit hetzelfde checkpoint, met een eigen SFT en RL pipeline gericht op gedragsprincipes. Dat model en de grote RL teacher werden samengevoegd via multi teacher on policy distillation. De principes zijn in drie lagen opgedeeld: regels die Beam nooit mag breken, kwaliteiten zoals accurate claims en het erkennen van onzekerheid, en een standaardstijl die direct, grondig en proactief is.

De veiligheidsdataset werd adversarieel opgebouwd. Elke ronde werden geslaagde aanvallen teruggevoerd in de training van de volgende ronde. CEO Misha Laskin vertelde aan Semafor dat het Amerikaanse Center for Advancing Innovation and Standards for Super Intelligence en het Britse AI Safety Institute het model mee beoordelen. Reflection belooft de veiligheidsresultaten te publiceren en de interne evaluaties open source te maken.

Waarom Reflection kiest voor open weights

Laskin vergelijkt gesloten modellen met het huren van een appartement. Op de Sources podcast zei hij: “The only way to own intelligence is, by definition, if it’s open.” Die visie vertaalt zich in een concreet businessmodel. Reflection wil met zogenaamde AI factories instellingen en landen helpen om eigen lokale AI systemen te bouwen op hun eigen data. Met Shinsegae Group bouwt het bedrijf een sovereign AI cloud van 250 megawatt in Zuid-Korea, en via de Genesis Mission van het Amerikaanse Department of Energy bedient Reflection de nationale laboratoria.

Waar het echt om draait bij Beam

De ruwe benchmarkscores van Beam zijn sterk, maar de efficiëntie is beter dan ze er op papier uitzi. Bij agentic workflows roept een model zichzelf tientallen of honderden keren aan binnen één taak. Elke besparing per token vermenigvuldigt zich dan over de hele keten. Als onafhankelijke tests de claims van Reflection bevestigen, zal Beam vooral aantrekkelijk zijn voor teams die agents op grote schaal willen draaien zonder dat de rekening ontspoort.