Met Kolibri 1 zet Aleph Alpha een taalmodel neer dat zich bewust op twee talen richt: Duits en Engels. Het bedrijf uit Heidelberg bracht het model op 3 oktober 2026 uit, de Dag van de Duitse Eenheid, met de volledige weights op Hugging Face onder de licentie Apache 2.0. Kolibri 1 is een mixture of experts model met 78 miljard parameters, waarvan er per token slechts 3,46 miljard actief zijn. Het doel is duidelijk. Organisaties in de publieke sector, de industrie en de luchtvaart moeten een krachtig model op hun eigen servers kunnen draaien, zonder data naar Amerikaanse of Chinese cloudproviders te sturen.

Hoe de MoE architectuur van Kolibri 1 werkt

Een mixture of experts model verdeelt zijn netwerk in vele kleine blokken, de experts. Een router stuurt elk token naar slechts een handvol daarvan. Kolibri 1 telt 50 lagen met elk 384 experts. Per token worden 6 experts via de router geselecteerd, aangevuld met 1 gedeelde expert die altijd meedoet. Zo krijg je de capaciteit van een groot model met de rekenkost per token van een model van ongeveer 3 miljard parameters.

Die efficiëntie heeft een prijs. Het volledige model moet in het geheugen staan, ook al werkt maar een klein deel tegelijk. In FP8 nemen de weights ongeveer 78 GB in beslag.

Een tokenizer die Duitse samenstellingen begrijpt

Het meest specifieke onderdeel van Kolibri 1 is misschien de tokenizer. Duits staat bekend om zijn lange samenstellingen, en generieke tokenizers hakken die vaak in onlogische stukjes. Aleph Alpha ontwikkelde daarom een nieuw algoritme, UniBPE. Het behoudt de stapsgewijze aanpak van BPE, maar gebruikt het trainingsdoel van Unigram om te bepalen welke combinaties in de vocabulaire terechtkomen. Het resultaat respecteert de morfologie van de taal beter.

Een voorbeeld uit de lancering maakt dat concreet. Het woord Bundessozialgerichtes wordt opgesplitst in Bundes, sozial, gericht en es. Met een vocabulaire van 128.000 tokens haalt Kolibri 1 een compressie van 4,7 bytes per token voor Duits en 4,2 voor Engels. Minder tokens per document betekent dat je meer tekst in de context krijgt en minder rekenkracht verbruikt. Bij RAG over lange Duitse wetteksten, contracten of handleidingen weegt dat voordeel door.

Lange context tot een miljoen tokens

Het model werd stapsgewijs getraind op steeds langere sequenties: 16.384 tokens tijdens pre-training, 65.536 tijdens mid-training en 262.144 tokens in een laatste fase. Dat laatste getal is de native contextlengte. Omdat positionele codering via RoPE alleen in de sliding window lagen wordt toegepast, kan de context in principe verder uitgebreid worden zonder extra trucs. Aleph Alpha valideerde kwaliteit en efficiëntie tot 1.048.576 tokens.

Voor complexe taken en toepassingen waar latency telt, raadt het bedrijf aan om onder 262.144 tokens te blijven. De eigen cijfers tonen waarom. Op de RULER test zakt het basismodel van 86,9 bij 4.000 tokens naar 63,2 bij een miljoen tokens. Een miljoen tokens werkt dus, met merkbaar minder precisie.

Redeneren op vier niveaus en tool calling

Kolibri 1 is een reasoning model met instelbare denkinspanning. Via de parameter reasoning_effort kies je tussen none, low, medium en high. Zo weeg je kosten en snelheid af tegen kwaliteit. Een eenvoudige vraag beantwoordt het model meteen, een complexe analyse krijgt meer denkwerk.

Een opvallend detail is dat Kolibri 1 in het Duits redeneert wanneer de vraag in het Duits gesteld wordt. Tijdens supervised fine-tuning gebruikte Aleph Alpha 10,6 miljard tokens aan Duitse redeneerdata, en tijdens reinforcement learning kreeg het model een beloning voor taalconsistentie in zowel de redenering als het antwoord. Voor Duitstalige gebruikers wordt de denkstap daardoor beter te volgen.

Daarnaast ondersteunt het model tool calling in Hermes stijl, te combineren met de reasoning mode. Tijdens de training maskeerde Aleph Alpha foutieve tool calls en terminalacties. Het model leerde daardoor herstellen van fouten zonder die fouten zelf over te nemen. Dat maakt Kolibri 1 geschikt voor agentic workflows die API’s aanroepen, code uitvoeren of zoekopdrachten draaien.

Liever eerlijk twijfelen dan hallucineren

Voor bedrijven die met gevoelige documenten werken, is een zelfverzekerd fout antwoord vaak erger dan geen antwoord. Aleph Alpha trainde Kolibri 1 daarom expliciet om zich te onthouden wanneer het antwoord niet in de documenten staat. Daarvoor bouwde het team RL omgevingen rond een eigen Merlin Arthur protocol.

Het principe is speels. Het model krijgt telkens een vraag met delen van de context verborgen. Merlin verbergt stukken zodat het juiste antwoord waarschijnlijker wordt, en daar moet het model correct antwoorden. Morgana verbergt juist de cruciale informatie, en dan moet het model aangeven dat het het niet weet. Ook de originele, onveranderde vraag zat in de training.

Training op 24 biljoen tokens

Kolibri 1 werd volledig vanaf nul getraind. De pre-training besloeg 20 biljoen tokens, gevolgd door 3,44 biljoen in mid-training en 201 miljard voor de uitbreiding van de context. Dat brengt het totaal op bijna 24 biljoen tokens. Volgens de model card bestaat de data voor ongeveer 62,5 procent uit Engels, 23,9 procent uit Duits en 13,6 procent uit code. De lanceringspost noemt een Duits aandeel van 21,3 procent, een verschil dat Aleph Alpha nog niet heeft rechtgezet.

De pre-training liep 21 dagen op 768 NVIDIA B200 GPU’s, goed voor ongeveer 392.000 GPU uren. Mid-training vroeg nog eens 5 dagen. De infrastructuur stond in Duitsland en Finland. Het geschatte energieverbruik voor pre-training, mid-training en de contextfase bedraagt ongeveer 950 MWh, zonder fine-tuning en RL.

Bij de datacuratie zette Aleph Alpha in op filtering van illegale en schadelijke bronnen, deduplicatie, kwaliteitsclassificatie en het verwijderen van persoonsgegevens. Het bedrijf filterde bovendien bewust op politieke bias die via synthetische data van andere modellen kon binnensluipen, en voegde data toe rond mensenrechten, rechtsstaat en pluralisme.

Wat de benchmarks van Kolibri 1 wel en niet zeggen

De opvallendste cijfers zijn sterk. Kolibri 1 scoort 84,3 op GPQA Diamond in het Engels en 81,3 in het Duits, 96,9 op AIME 2025, 96,0 op AIME 2026 en 85,9 op LiveCodeBench. Aleph Alpha vergelijkt het model vooral met andere MoE modellen met een vergelijkbaar aantal actieve parameters, zoals Qwen3.6, Nemotron 3 Super en Mistral Small 4.

Aleph Alpha stelt dat publieke benchmarks slecht weergeven wat zijn klanten nodig hebben. Op eigen testsuites voor de publieke sector, toeleveranciers in de automotive en de luchtvaart verbeterde Kolibri 1 sterk ten opzichte van zijn nooit gepubliceerde voorganger Kolibri Origin, in de luchtvaart van 0,14 naar 0,59. Die tests zijn niet openbaar en dus niet controleerbaar. Onafhankelijke resultaten waren er bij de lancering nog niet.

Hardware en licentie

Kolibri 1 vraagt datacenterhardware. Het minimum is twee A100 of H100 kaarten met 80 GB, of één H200, B200 of B300. Twee H100’s leveren krap voldoende geheugen. Een H200 met 141 GB geeft meer ademruimte voor lange contexten. Volgens Aleph Alpha verwerkten twee H100’s 18 gelijktijdige verzoeken van 256.000 tokens. Om het model te draaien heb je het pakket aleph-alpha-inference nodig, een plugin voor vLLM. Ondersteuning in de transformers bibliotheek ontbreekt nog, al hebben gebruikers het model intussen ook op een NVIDIA DGX Spark aan de praat gekregen.

De licentie Apache 2.0 laat commercieel gebruik, aanpassing en fine-tuning toe. Ze geldt wel alleen voor de weights en configuratiebestanden. Trainingscode, architectuur, methodes en data blijven eigendom van Aleph Alpha. Je krijgt het getrainde model, zonder het recept om het opnieuw te bouwen.

Voor wie Kolibri 1 echt zinvol is

Kolibri 1 is ontworpen voor chatbots en documentworkflows waarin een mens de output controleert voor er actie volgt. In beslissingsondersteuning hoort het model aan de adviserende kant. Denk aan vraag en antwoord systemen over interne documentatie, het opstellen van teksten en onderzoekstools voor kennisbanken. Aleph Alpha heeft de EU GPAI Code of Practice ondertekend en ontwierp het model met de EU AI Act en de GDPR in het achterhoofd.

Werk je in het Frans, Spaans of Pools, dan biedt dit model weinig meerwaarde. Gaat het om lange Duitse documenten die je organisatie niet mogen verlaten, dan is Kolibri 1 een goede optie.

Een soeverein model met een onzekere toekomst

De technische keuzes van Kolibri 1 zijn doordacht, en de focus op Duits vult een niche. Toch hangt er een vraagteken boven het project. Aleph Alpha tekende recent een bindend akkoord om te fuseren met het Canadese Cohere, dat onder eigen naam verdergaat met Heidelberg als onderzoekshub. Wie Kolibri 1 vandaag kiest om redenen van soevereiniteit, doet er goed aan het model op de eigen documenten te testen naast Qwen. Kijk daarbij ook naar wie de volgende versies zal bouwen.