Elk product dat een taalmodel uitrolt, moet dezelfde ongemakkelijke vragen beantwoorden. Promoot deze tekst geweld tegen een beschermde groep? Is deze afbeelding veilig om aan een minderjarige te tonen? Het juiste antwoord hangt telkens af van het product, het publiek en het moment. Shieldstral, de nieuwe safety classifier van Mistral, pakt dit probleem aan. In plaats van een vaste lijst met risico’s in de modelgewichten te verankeren, formuleer je je in een gewone vraag in natuurlijke taal of de vraag conform het veiligheidsbeleid is en je krijgt een gekalibreerde veiligheidsscore terug. Mistral brengt de gewichten uit onder de Apache 2.0 licentie. Dit is een eerste release binnen de Open Secure AI Alliance die het samen met NVIDIA en andere organisaties vormt.
Het probleem met traditionele guardrail-modellen
De meeste guardrail-modellen leren tijdens de training over een vaste set schadecategorieën. Wil je zo’n model inzetten in een nieuwe context, dan betekent dat opnieuw trainen. Dat klopt niet want dezelfde inhoud kan volkomen acceptabel zijn voor een tool voor cybersecurityonderzoek en tegelijk schadelijk op een platform voor mentale gezondheid. Omdat veiligheidsdefinities per toepassing en domein verschillen, bestaat er simpelweg geen universeel correcte set categorieën om het model op te baseren. Wie moderatie serieus neemt, zit daardoor vast aan dure hertrainingen of aan gehoste API’s waar je per call voor betaalt zonder controle over de gehanteerde regels.
Shieldstral in de praktijk
Shieldstral benadert contentmoderatie als een binaire vraag-antwoord taak. Elke beoordeling bestaat uit drie onderdelen. De instructie beschrijft de evaluatiecontext, de strengheid en eventueel een definitie van wat als onveilig geldt. De query is een enkele vraag met ja of nee als antwoord, bijvoorbeeld of de inhoud fysiek geweld promoot. Het document is de te beoordelen inhoud, zoals een prompt, een antwoord, een combinatie van beide of een afbeelding met optionele tekst.
Tijdens de inferentie leest het model alleen de logits van ja en nee uit en normaliseert die via een softmax tot een continue veiligheidsscore. Die ogenschijnlijk eenvoudige formulering doet veel werk. Ze bundelt promptclassificatie, moderatie van antwoorden, weigeringsdetectie en toxiciteitsdetectie. Omdat het beleid volledig in de prompt leeft, past een checkpoint zich aan nieuwe beleidsregels aan zonder dat er iets aan de LLM moet veranderen. Een moderatieteam herschrijft de beleidsregels in een tekstbestand en draait de classifier opnieuw, lokaal, op één GPU. Geen finetuning, geen externe partij en geen wachttijd.
Een continue veiligheidsscore in plaats van een label
Omdat Shieldstral in één forward pass een gekalibreerde kans op ja of nee teruggeeft, hang je niet af van een vast label. Je kiest zelf de drempelwaarde die past bij je risicoprofiel en je rangschikt de inhoud op vertrouwen. Een platform voor tieners stelt de grens strenger in dan een tool voor securityonderzoekers, met exact hetzelfde model eronder.
Benchmarks en specificaties van de 3B safety classifier
Mistral vergeleek Shieldstral met open guard models tot zeven keer zijn omvang. Het evalueerde op tekstveiligheid, weigeringsdetectie, aanpasbaarheid aan nieuw beleid en multimodale benchmarks. Alle evaluatiesamples waren van de trainingsdata afgescheiden. Volgens de officiële modelkaart scoort het model 99,4 procent F1 op HarmBench, 97,7 procent op VLGuard en 88,1 procent op WildGuardTest. Op multimodale moderatie zet het daarmee een nieuw record neer.
Onder de motorkap zit Ministral-3-3B-Base, met een contextvenster van 32K tokens waarmee ook langere gesprekken volledig worden meegenomen. Het model dekt twaalf talen en draait in BF16 op één NVIDIA GPU met 16 GB geheugenVoor een veiligheidslaag is dit bescheiden hardware.
De trainingsdata maakt het verschil
De kerngedachte achter Shieldstral is dat een klein model veel grotere kan verslaan als je vertrekt van de juiste trainingsdata. Om die data goed te krijgen, moest Mistral vier problemen oplossen. De trainingset omvatte 54,1 miljoen samples.
Heterogene bronnen verenigen
Publieke veiligheidsdatasets komen niet overeen qua taxonomieën, labels en annotatieconventies. Mistral zette elke dataset met een eigen processor om naar hetzelfde formaat. De labels zijn gevarieerd, zodat het model generaliseert over formuleringen in plaats van één stijl te overfitten. Ook de strengheid werd per bron gekalibreerd. Streng voor jailbreaks, soepeler voor data over antwoordkwaliteit.
Over discriminatie leren in plaats van vanbuiten leren
Wie op een vaste set beleidslabels traint, leert alleen die labels herkennen en redeneert niet over de precieze grenzen van dit beleid. Mistral bouwde daarom sets van opzettelijk vergelijkbare, makkelijk te verwarren beleidsregels. Een LLM herschreef veilige teksten tot contrastieve paren waarbij elke variant precies één regel schendt. Het model leert zo welke regels een stuk content overtreedt. Tijdens de inference leert het model over de door gebruikers gedefinieerde regels.
Veiligheid verankeren in beeld
Onveilige afbeeldingen laten zich niet zo makkelijk door een taalmodel samenvatten. Visuele veiligheidsdata is dus schaars. Het team vulde de beperkte moderatiedatasets aan met algemene beelddatasets.
Drie checkpoints samengevoegd tot één model
De training gebeurde met LoRA, waarna drie checkpoints via SLERP werden samengevoegd. Eén is gekalibreerd op publieke data, een tweede gebruikte gegenereerde data toe en de derde is het oorspronkelijke instructiemodel. De merge combineert kalibratie en aanpasbaarheid in één model. De volledige pipeline draaide op Forge, Mistrals platform voor het trainen, alignen en evalueren van maatwerkmodellen. Forge regelde de infrastructuur, het sharden van data en modellen, de metrics en de logging, zodat het team zich kon concentreren op de data waar de kwaliteit van een veiligheidsmodel nu eenmaal uit voortkomt.
Wat Shieldstral betekent voor ontwikkelaars
Tot nu toe hadden teams die taalmodellen in productie draaien grofweg twee keuzes. Gehoste API’s voor moderatie met kosten per call en weinig inzicht in de regels, of grotere open modellen die serieuze hardware vragen om op schaal te draaien. Een guard model van 3 miljard parameters dat op één middelgrote GPU past en zich zonder finetuning aan nieuw beleid aanpast, verlaagt de drempel voor iedereen. Van startup tot onderzoeksgroepen die geen eigen veiligheidsstack kunnen betalen. De Apache 2.0 licentie geeft je bovendien het recht het model aan te passen. De positionering binnen de Open Secure AI Alliance onderstreept de ambitie om open en controleerbare veiligheidstooling een volwaardig alternatief te maken voor gesloten standaardoplossingen.