Black Forest Labs, een Duits AI-lab, bracht FLUX 3 uit: één model dat beeld, video met geluid én de aansturing van robots in dezelfde architectuur leert, en dat al op een productielijn van Audi wordt getest. Het lab is opgericht in augustus 2024 door oud-medewerkers van Stability AI die eerder Stable Diffusion bouwden.
Voor een Nederlandse machinebouwer of maakbedrijf dat zijn automatisering niet volledig aan één leverancier wil ophangen, komt er zo een fysieke-AI-optie bij die niet uit de Nvidia-hoek en niet uit een Chinees lab komt. De inzet is niet zomaar een demovideo: FLUX 3 stuurt in tests een robotarm aan die op de band van Audi flexibele deurrubbers plaatst, precies het soort buigzame materiaal waar starre automatisering op stukloopt.
Eén model, geen losse pijplijnen
Het verschil met veel bestaande systemen zit in de training. FLUX 3 leert beeld, video en audio gezamenlijk binnen één architectuur, op basis van wat het lab de Self-Flow-aanpak noemt, in plaats van losse modellen die achteraf aan elkaar geknoopt worden. Volgens oprichter Robin Rombach is dat de kern: een model dat alleen beeld leert, kan alleen beeld maken, terwijl video en actie het model laten begrijpen hoe de fysieke wereld zich gedraagt.

Dat gedeelde brein is uitbreidbaar met een vierde modaliteit: actie. Naast tekst, beeld, video en audio zit er een aparte encoder en decoder voor beweging in het model, waarmee FLUX 3 niet alleen pixels maar ook de handelingen van een robot voorspelt.
Van 20 seconden video tot een robotarm
Aan de mediakant genereert FLUX 3 video's van maximaal 20 seconden met ingebouwd, gesynchroniseerd geluid, een primeur voor het lab. In eigen voorkeurstests kreeg het model de voorkeur boven Luma Ray 3.2 in 93 procent en boven Runway Gen-4.5 in 77 procent van de vergelijkingen; tegen een sterkere concurrent als Kling v3 Pro zakt dat naar 60 procent. Die cijfers komen van het lab zelf, niet uit een onafhankelijke test.
De robotkant loopt via FLUX-mimic, gebouwd met een gespecialiseerd roboticabedrijf. Bij Audi plaatst dat systeem flexibele deurrubbers met een reactietijd van ongeveer 101 milliseconden, zacht materiaal dat conventionele automatisering nauwelijks aankon. Het is nog een test op echte productietaken, geen volledige uitrol, maar het tilt de belofte boven de demofase uit.
Een Europees alternatief op de fabrieksvloer
De timing plaatst FLUX 3 in een druk veld. Nvidia bracht kort geleden Cosmos 3 Edge uit en bond meteen Japanse industriereuzen als Fanuc, Kawasaki en SoftBank aan zijn physical-AI-stack, terwijl Alibaba met zijn Qwen-Robot-suite die machines handen, voeten en een brein geeft dezelfde beweging vanuit China maakt. Voor een maakbedrijf dat de perceptie en besturing van zijn machines niet aan één ecosysteem wil vastklinken, is een Duitse aanbieder een reële verbreding van de keuze.
Beschikbaar is het nog beperkt. De videofunctie zit in early access, beeldgeneratie volgt de komende weken, en de actievoorspelling loopt voorlopig alleen via geselecteerde partners. Een open-gewicht versie, FLUX 3 Dev, staat later dit jaar op de planning; prijzen noemt het lab nog niet.
Wat deze release vooral laat zien, is dat fysieke AI, modellen die niet alleen praten maar ook kijken en handelen, geen exclusief terrein meer is van Nvidia of de grote Chinese labs. Het onderwerp verschuift van de vraag of een model een robot kan aansturen naar de vraag van wie je die laag betrekt en hoe makkelijk je er weer los van komt. Voor wie automatisering op de werkvloer plant, wordt de keuze voor een AI-leverancier daarmee net zo strategisch als de keuze voor de machines zelf.
Veelgestelde vragen
Automatisering zonder lock-in
Ik denk met je mee welke AI en automatisering echt bij je proces passen, ontwerp de oplossing en bouw hem end-to-end, self-hosted waar dat kan, zodat je niet aan één leverancier vastzit.
Dit artikel is geproduceerd samen met het Agent Team. Meer over de redactie.
