NinA聽AI

Blog 路 AI & Beeldgeneratie

Een klein Duits AI videomodel verslaat de grote jongens

Olaf Lemmens, Founder NinA AI Agency24 juli 2026 路 6 min leestijd

Donderdag is altijd de zwaarste dag voor AI-releases. Modellen buitelen over elkaar heen, iedereen wil de aandacht, en meestal zakt de helft binnen een week weg. Vorige donderdag was zo’n dag. OpenAI lanceerde een nieuwe stem voor ChatGPT, Anthropic deed iets soortgelijks, en normaal was dat het gesprek van de dag geweest.

Maar mijn oog bleef hangen bij iets anders. Een klein Duits bedrijf uit Freiburg, Black Forest Labs, kondigde FLUX 3 aan. Een videomodel, dacht ik eerst. Nog eentje. Tot ik doorlas en bij de robots kwam.

Want het bijzondere aan dit verhaal zit niet in de video’s die het maakt. Het zit in wat er gebeurt als je hetzelfde model op een fabrieksvloer bij Audi zet.


TL;DR

Black Forest Labs, het Duitse bedrijf achter de FLUX-beeldmodellen, lanceerde FLUX 3: een model dat beeld, video en audio in één architectuur leert, met tekst-naar-video tot 20 seconden en native gesynchroniseerd geluid. De echte verrassing is dat exact dezelfde videobackbone via ‘FLUX-mimic’ robots aanstuurt bij Audi, waar ze zachte materialen en kabels hanteren die met conventionele robotica onmogelijk waren. Sommige taken zijn te finetunen met 30 minuten robotdata, en het systeem reageert in ongeveer 101 milliseconden.

CEO Robin Rombach stelt dat contentcreatie en fysieke AI dezelfde wereldkennis delen. Maar er is bijna niks onafhankelijk geverifieerd: geen prijzen, geen parameteraantallen, geen externe benchmarks.


Wat FLUX tot nu toe was

Even terug naar wie deze mensen zijn, want dat maakt het verhaal groter. Black Forest Labs is opgericht in 2024 in Freiburg, door de onderzoekers die eerder latent diffusion en Stable Diffusion op de kaart zetten. Robin Rombach is de CEO. Als je ooit een generatieve functie in Photoshop, Canva of Picsart hebt gebruikt, is de kans groot dat er een FLUX-model onder zit.

Het is geen hobbyclub. In december 2025 haalden ze 300 miljoen dollar op in een Series B, tegen een waardering van 3,25 miljard. Salesforce Ventures en Anjney Midha leidden die ronde, met a16z, NVIDIA, General Catalyst en Temasek erbij. Bij die aankondiging bleek er ook nog een eerder verzwegen Series A te zijn geweest. Opgeteld gaat het over meer dan 450 miljoen dollar.

Dat is de context waarin FLUX 3 nu binnenkomt. Niet als experiment, maar als het eerste multimodale foundation model van een bedrijf met serieus geld en serieuze afkomst.


Beeld, video en audio in één model

FLUX 3 is gelanceerd op 23 juli 2026. De kern is een architectuur die BFL ‘Self-Flow’ noemt: beeld, video en audio worden gezamenlijk geleerd binnen één framework in plaats van als losse modellen die je aan elkaar plakt.

De headline-feature is tekst-naar-video tot 20 seconden, met native gesynchroniseerde audio. Dus geen video eerst maken en er daarna geluid onder monteren, maar dialoog, geluidseffecten en omgevingsgeluid die meteen meekomen. Daarnaast kan het model doorgaan vanuit een startframe, video’s als referentie gebruiken, en losse clips aan elkaar rijgen tot langere scenes.

Getraind is het op tientallen miljoenen uren algemene video. En daar zit al een hint: er zaten ook honderdduizenden uren video bij die specifiek over menselijke en robot-manipulatietaken gaan. Dat laatste bleek geen bijzaak.


Waarom een videomodel opeens een robot kan aansturen

BFL nam dezelfde videobackbone en paste die aan voor robotica, onder de naam FLUX-mimic, ontwikkeld met het Zwitserse mimic robotics. En ze zetten dat niet in een demo, maar in de productie bij Audi.

Christoph Schneider van Audi’s Production Lab zegt dat de robots werk oplossen dat met conventionele robotica onmogelijk zou zijn geweest. Complex soft-body manipulation, noemt hij het. Denk aan kabels vastpakken en vervormbare materialen hanteren, precies het soort taken waar starre geprogrammeerde robotarmen op vastlopen. Sommige taken zijn volgens BFL te finetunen met slechts 30 minuten robotdata. En het systeem zou reageren in ongeveer 101 milliseconden, in de buurt van menselijke visuele reflexen.

De redenering van Rombach erachter is de eigenlijke claim. Zijn stelling is dat een model dat leert om overtuigende video te genereren, iets moet begrijpen van hoe de wereld werkt: hoe dingen bewegen, vallen, buigen. En dat diezelfde wereldkennis een robot kan aansturen. Contentcreatie en fysieke AI die uit dezelfde bron putten. Vier woorden: hetzelfde model, andere output.


Maar toch...

Nu even scherp blijven, want het verhaal is minder rond dan de aankondiging doet vermoeden. BFL heeft namelijk bijna niks vrijgegeven waarmee je de claims kunt controleren. Geen prijzen, geen parameteraantal, geen quantizaties, geen hardware-eisen, geen licentievoorwaarden. En geen enkele beeldmodel-benchmark.

De video-benchmarks die er wel zijn, komen van BFL zelf en zijn niet onafhankelijk geverifieerd. In hun eigen vergelijkingen won FLUX 3 in 93 procent van de gevallen van Luma Ray 3.2 en in 77 procent van Runway Gen 4.5. Tegen Seedance 2.0 en Gemini Omni Flash waren de uitkomsten een stuk nauwer. Dat zijn interessante cijfers, maar het blijven de cijfers van de verkoper.

De uitrol is bovendien gefaseerd. FLUX 3 Video en FLUX 3 Action zijn nu in early access via API en private weights voor een paar partners. De beeldversie volgt over enkele weken, en een open-weight Dev-versie is gepland voor later in 2026. Die aanpak, eerst beperkt en dan pas breder, kennen we inmiddels van Anthropic en OpenAI. Ik noem liever wat er nu daadwerkelijk staat dan wat straks misschien komt.


Wat dit praktisch voor jou betekent

Even los van de hype, want de praktische kant is voor de meeste bedrijven relevanter dan het robot-spektakel. Drie dingen om mee te nemen.

1. Als je nu al FLUX gebruikt via Canva, Photoshop of een ander platform, verandert er op korte termijn niks. De open Dev-versie waar je zelf mee zou kunnen bouwen komt pas later dit jaar, en tot die tijd draait het achter API’s en private deals. Wachten is hier prima.

2. Video met native audio in één stap scheelt op termijn een hoop montagewerk. Als je content maakt, hou dit type modellen in de gaten, maar reken jezelf nog niet rijk: zonder prijzen weet niemand wat een minuut video gaat kosten.

3. De robotkant is voorlopig iets voor fabrieken met Audi-budgetten, niet voor het mkb. Maar het onderliggende idee, dat één model getraind op de echte wereld meerdere taken tegelijk kan, is wel waar de komende jaren de winst zit. Niet tien losse tools, maar één fundament dat je op verschillende problemen zet.

Ik begon deze editie met een videomodel dat ik bijna oversloeg tussen alle donderdag-releases. Wat het bijzonder maakt is niet de video, maar dat dezelfde techniek een robot bij Audi zachte kabels leert vastpakken. Of Rombach gelijk heeft dat beeld genereren en robots aansturen echt uit dezelfde wereldkennis komen, weten we pas als de onafhankelijke benchmarks er zijn. Voorlopig is het een mooie belofte met te weinig cijfers eronder.

Mijn vraag aan jou: zie je in jouw werk plek voor zulke video-modellen, of blijft dit voorlopig iets om van een afstandje te bekijken? Laat het me weten in de reacties, ik lees ze allemaal.

Tot de volgende,

Olaf Lemmens

Founder NinA AI Agency


Kijk ook eens op www.nina-ai.nl