FLUX 3 (Black Forest Labs) schlägt Runway Gen-4.5 in 77 % der Video-Präferenz-Tests

24. Juli 2026, 12:08

Black Forest Labs, das Team hinter den FLUX-Bildmodellen, hat gerade FLUX 3 veröffentlicht — und es ist nicht mehr nur ein Bildgenerator. Es ist ein Modell, das Bild, Video und Audio aus einem einzigen Satz Gewichte erzeugt, gemeinsam trainiert statt drei separater Modelle, die hinter einer API zusammengekettet sind.

Was es tatsächlich kann

Text-zu-Video, Bild-zu-Video, Video-zu-Video, bis zu 20 Sekunden mit nativer Audio — einschließlich mehrsprachigem Dialog und Keyframe‑Übergängen. In direkten Präferenztests schlug es Runway Gen-4.5 (77 %), Luma Ray 3.2 (93 %) und Grok Imagine (69 %). Dieselben Gewichte sagen auch Roboteraktionen voraus, über eine Partnerschaft mit Mimic Robotics.

Warum es wichtig ist

Dies ist das erste einheitliche Bild‑plus‑Video‑plus‑Audio‑Fundamentmodell des Open‑Camps und es stand am Tag seiner Veröffentlichung an der Spitze von HackerNews. Die Einführung erfolgt gestaffelt: Video ist jetzt im Early Access, Bild folgt in den kommenden Wochen, und API‑Zugang sowie private und offene Gewichte (FLUX 3 Dev) kommen in den nächsten Monaten. Die API ist der Ort, an dem Entwickler die Generierung in ihre eigenen Apps einbinden — denken Sie an einen einzigen Aufruf für einen untertitelten, gesprochenen Dialog‑Clip, anstatt ein Video‑Modell an ein separates TTS‑System zu koppeln.