Met FLUX 3 zet Black Forest Labs een stap richting modellen die de wereld begrijpen zoals mensen dat doen: via meerdere zintuigen tegelijk. Waar eerdere generatieve modellen zich richten op één soort gegevens, leert FLUX 3 beeld, video en audio gezamenlijk binnen dezelfde architectuur. Geen enkel medium beschrijft de werkelijkheid volledig, maar samen begrijpen ze dezelfde onderliggende realiteit beter.
Het model is beschikbaar in early access en positioneert zich als visuele intelligentie. Systemen die waarnemen, voorspellen en handelen in fysieke en digitale omgevingen.
Multimodaal leren
Een beeld legt ruimtelijke structuren vast op één moment. Video voegt de dimensie tijd toe en toont hoe objecten bewegen en welke fysieke wetten daarbij gelden. Audio onthult oorzakelijke verbanden tussen mechanische gebeurtenissen en hun akoestische gevolgen, informatie die je met beeld alleen mist. Taal koppelt deze w
Self-Flow als technische basis
FLUX 3 bouwt voort op Self-Flow, de aanpak van Black Forest Labs om multimodale generatie en begrip binnen dezelfde architectuur op elkaar af te stemmen. In vergelijkingen met de klassieke Flow Matching-methode geeft Self-Flow minder fouten tijdens het genereren.
Ook de rekencapaciteit en dataschaal zijn aanzienlijk vergroot. Het resultaat is één model dat video, beeld en audio gelijktijdig verwerkt, zonder aparte pipelines of losse componenten.
Wat FLUX 3 concreet kan
Het model genereert video’s met bijbehorend geluid tot twintig seconden lang. Alle uitvoer bevat native audio, wat betekent dat het geluid samen met beeld ontstaat en niet achteraf wordt toegevoegd. De belangrijkste functies op een rij:
- Tekst-naar-video waarbij een prompt direct resulteert in bewegend beeld met geluid
- Beeld-naar-video door een startframe te animeren of stilstaande beelden als visuele referentie te gebruiken
- Video-naar-video waarbij centrale elementen zoals een personage uit een bronclip meegaan naar een nieuwe scène
- Generatieve video-audio-continuering vanuit bestaande video- en audiofragmenten
- Keyframe-naar-video voor gecontroleerde overgangen tussen vastgelegde momenten
- Meertalige dialoog met stemmen die passen bij het personage in beeld
- Agentic chaining van losse clips tot langere, meerdelige sequenties
Bovendien werkt het model met een breed spectrum aan visuele stijlen en beeldverhoudingen. Flux 3 scoort ook sterk op typografie en animatie.
Prestaties
In tests met tien seconden durende tekst-naar-videoclips op 720p met audio kwam FLUX 3 er in menselijke voorkeurstesten sterk uit. Het model werd geprefereerd boven Luma Ray 3.2 in 93 procent van de vergelijkingen en boven Runway Gen-4.5 in 77 procent. Tegenover Grok Imagine Video lag de voorkeur op 69 procent, en boven Kling v3 Pro op 60 procent. Ook ten opzichte van Seedance 2.0 en Gemini Omni Flash haalde FLUX 3 een voorkeurscore van 52 procent.
Deze cijfers zijn voorlopig, want zowel het model als de omliggende infrastructuur bevinden zich nog in ontwikkeling. De verwachting is dat de resultaten tijdens de early access periode verder verbeteren. Waar FLUX 3 nu al bovengemiddeld presteert is bij het vastleggen van menselijke gezichtsuitdrukkingen, het koppelen van geluid aan fysieke gebeurtenissen en het genereren van meertalige inhoud.
Consistentie
Door visuele referenties te gebruiken kunnen personages consistent blijven over meerdere scènes heen. In combinatie met agentic chaining opent dat de deur naar sequenties van meerdere minuten. Voor makers die eerder tegen de grens van tien tot twintig seconden aanliepen, is dit een fundamentele verbetering.
Van beeldgeneratie naar voorspelling van acties
De ambitie reikt verder dan content creatie. FLUX 3 wordt ook ingezet voor actievoorspelling, Ten eerste door native actievoorspelling direct in het model te integreren, voortbouwend op eerder werk rond Self-Flow. Ten tweede door de voorgetrainde videobackbone te gebruiken als basis waarop gespecialiseerde actiemodellen kunnen worden gefinetuned met taakspecifieke data.
Een van de eerste partners hiervoor is mimic robotics. Samen ontwikkelden ze FLUX-mimic, een video-actiemodel dat de FLUX 3-backbone combineert met de expertise van mimic over robots. Het model wordt onder meer getest bij Audi. Fysieke AI en contentcreatie gebeuren met hetzelfde model. Beide hebben een model nodig dat begrijpt hoe de wereld zich gedraagt.
Beeldsynthese naast video
Naast video kan FLUX 3 ook beelden genereren en bewerken in uiteenlopende stijlen, beeldverhoudingen en resoluties. In tussentijdse evaluaties toont het model duidelijke verbeteringen ten opzichte van eerdere FLUX-versies, vooral bij het verwerken van complexe prompts en het genereren van tekst in beeld. Een early access versie voor FLUX 3 Image volgt enkele weken na de videoversie.
Uitrol in fasen
De komende maanden komen verschillende modellen uit, elk met een early access-periode voor feedback en veiligheidstesten:
- FLUX 3 Video: video- en audiogeneratie via API’s en private weight access
- FLUX-mimic en FLUX 3 Action: actievoorspelling via geselecteerde onderzoeks- en commerciële partners
- FLUX 3 Image: beeldsynthese en -bewerking via API’s en private weight access
- FLUX 3 Dev: open-weight toegang tot de multimodale backbone voor zowel contentcreatie als actievoorspelling
De richting achter het model
FLUX 3 laat zien dat de scheiding tussen generatieve media en fysieke AI wegvalt. Een systeem dat begrijpt hoe een glas breekt, hoort dat geluid ook te kunnen genereren en weet hoe een robotarm dat glas voorzichtig moet vastpakken. Black Forest Labs wil perceptie, actie en voorspellingen verenigen in één model.