Verwandeln Sie statische Bilder in bewegungssynchronisierte, hochdetaillierte Videoinhalte mit flexibler Steuerung durch Wan 2.6.
FLUX 3 ist das nächste einheitliche Modell von Black Forest Labs. Es wurde gemeinsam auf Bildern, Video und Audio trainiert, sodass Bewegung und Ton aus demselben Fundament heraus verstanden werden. Diese Seite konzentriert sich auf die Videofunktionen und vermittelt einen Eindruck davon, wie sich FLUX 3 Video in der Produktion einsetzen lässt.
Hinweis: FLUX 3 Video erscheint demnächst. Diese Seite bietet eine Vorschau, während Black Forest Labs das öffentliche Modell und die API fertigstellt.
Darum ist FLUX 3 Video für Kreative interessant:
Ein schneller Überblick über die Fähigkeiten von FLUX 3 Video:
Black Forest Labs beschreibt FLUX 3 Video als ein multimodales Modell mit mehreren Generierungsmodi, wobei jede Ausgabe natives Audio enthält. Offiziell bestätigt sind:
Darüber hinaus bietet FLUX 3 Video:
FLUX 3 Video hebt sich dadurch ab, dass Bild und Ton gemeinsam konzipiert und nicht nachträglich zusammengesetzt werden. In einem Durchlauf kann es Dialoge, Geräusche, Atmosphäre und Musik passend zur Handlung erzeugen: Eine zuschlagende Tür erhält ihr eigenes Aufprallgeräusch, ein Alarm pulsiert synchron mit einer Warnleuchte, und eine Figur kann sprechen, während sich die Kamera in derselben Einstellung bewegt.
Diese Synchronität ergibt sich aus dem Training des Modells. Black Forest Labs zufolge entfielen mehr als 95 % des Trainingsaufwands von FLUX 3 auf Videovorhersage. Dadurch musste das Modell Kontakt, Bewegung, Gewicht sowie Ursache und Wirkung lernen – mit anderen Worten, das Verhalten der physischen Welt. Audio wird anschließend als Folge dieses Weltmodells gelernt. Deshalb passen Geräusche zu den sichtbaren Ereignissen, die sie verursachen, und Sprache folgt den Lippenbewegungen. Für Kreative bedeutet das: Bewegungen wirken physikalisch plausibel, und die Tonspur unterstützt den Schnitt, statt gegen ihn zu arbeiten.
Mit diesen Hinweisen erzielen Sie während der Vorschau von FLUX 3 Video besser vorhersehbare Ergebnisse:
Da sich FLUX 3 Video noch im Early Access befindet, stammen die aussagekräftigsten Hinweise aus den vorläufigen Auswertungen von Black Forest Labs mit 10 Sekunden langen 720p-Clips samt Audio. In diesen Direktvergleichen bevorzugten Testpersonen FLUX 3 gegenüber zahlreichen Alternativen: gegenüber Luma Ray 3.2 in 93 % der Vergleiche, Runway Gen-4.5 in 77 %, Grok Imagine Video in bis zu 69 %, Kling v3 Pro in 60 % sowie Seedance 2.0 und Gemini Omni Flash jeweils in 52 %. Die Zahlen sind vorläufig und dürften sich noch verändern, bilden für die folgenden Vergleiche jedoch eine sachlichere Grundlage als bloße Versprechen.
FLUX 3 Video ist die Vorschau auf ein Modell, das sich noch in einem begrenzten Early Access befindet. Folgende Erwartungen sind daher realistisch:
Betrachten Sie FLUX 3 Video als Ausblick auf die weitere Entwicklung: Fähigkeiten und Grenzen werden sich auf dem Weg zur allgemeinen Verfügbarkeit weiter verändern.
Black Forest Labs führt FLUX 3 AI als ein multimodales Fundament mit mehreren Versionen ein. Jede davon erscheint nach einer eigenen Early-Access-Phase schrittweise. Der offizielle Veröffentlichungsplan sieht Folgendes vor:
Black Forest Labs hat bestätigt, dass offene Modellgewichte geplant sind. Sobald das FLUX-3-Dev-Basismodell verfügbar ist, dürfte als nächster logischer Schritt ein Community-Workflow für FLUX 3 LoRA folgen, einschließlich FLUX 3 dev LoRA-Finetuning für wiederkehrende Figuren, Stile und Markenlooks. Das entspräche dem großen LoRA-Ökosystem, das rund um frühere FLUX-Versionen entstanden ist.
Für die meisten Teams übernimmt FLUX 3 Video die alltägliche Clipproduktion. FLUX 3 Dev und FLUX 3 dev LoRA eröffnen zusätzlich den Weg zu selbst gehosteten Anpassungen.
Kurz gesagt: FLUX 3 Video erscheint demnächst auf RunComfy. Das multimodale Fundament verwandelt Prompts und Referenzmedien in filmreife Clips mit synchronisiertem, nativ erzeugtem Audio.
Verwandeln Sie statische Bilder in bewegungssynchronisierte, hochdetaillierte Videoinhalte mit flexibler Steuerung durch Wan 2.6.
Erstelle in Sekunden realistische Bewegtbilder mit Dreamina 3.0.
Generieren Sie ein Video aus einer erforderlichen Text-Prompt. Wählen Sie sechs Seitenverhältnisse, `540p`, `720p` oder `1080p`, eine Dauer von `5` oder `9` Sekunden und optionale Schleifenwiedergabe.
Erstelle filmische Clips mit Audio, nahtlosen Szenen und präziser Steuerung
Verwandle Bilder mit Hailuo 2.3 in realistische Videos voller kreativer Bewegung.
Realistische Video- und Bildgenerierung für Kreative & Filmemacher
FLUX 3 Video erscheint demnächst. Mit dieser Vorschau können Sie die Bedienung erkunden, während Black Forest Labs das einheitliche multimodale Modell und seine API fertigstellt. Bis das FLUX-3-Backend aktiviert wird, entsprechen die sichtbaren Eingabefelder und Limits dem Modell, das derzeit diese Vorschau antreibt.
FLUX 3 Video verwandelt Prompts sowie optionale Bild-, Video- und Audioreferenzen in filmreife Kurzclips mit nativem Ton. Es richtet sich an Werbekreation, Film-Previsualisierung und Markengeschichten, bei denen Referenzkonsistenz und synchronisiertes Audio wichtig sind.
FLUX 3 Video soll die Arbeit von Black Forest Labs auf einem multimodalen Fundament um Bewegung und Audio erweitern. Fünf Aufgaben sind offiziell bestätigt: Text-zu-Video, Bild-zu-Video, Video-zu-Video, Video- und Audiofortsetzung sowie Keyframe-zu-Video. Hinzu kommen natives Audio, mehrsprachige Dialoge und bis zu 20 Sekunden lange Clips in einem Durchlauf. Die tatsächlichen Fortschritte hängen von Ihren Inhalten ab; vergleichen Sie nach der Veröffentlichung daher Clips mit demselben Prompt.
FLUX 3 Video erzeugt in einem Durchlauf bis zu 20 Sekunden lange Clips – etwa doppelt so lang wie die bei vielen Videomodellen üblichen 10 Sekunden. Das schafft Raum für Dialogmomente und langsamere dramatische Einstellungen. Clips lassen sich zudem zu mehrminütigen Multi-Shot-Sequenzen verketten, während Figuren konsistent bleiben. Beim Modell, das diese Vorschau derzeit antreibt, liegt die Dauer zwischen 4 und 15 Sekunden; das vollständige FLUX-3-Video-Modell ist auf bis zu 20 Sekunden ausgelegt.
Ja. Natives Audio ist ein Kernziel von FLUX 3 Video. Beim Modell, das diese Vorschau derzeit antreibt, können Sie die Audioerzeugung aktivieren, um synchronisierte Sprache, Soundeffekte und Musik auszugeben. Damit sind lippensynchrone, mehrsprachige Clips möglich. Für stummes Video lässt sich die Funktion deaktivieren. Die Qualität der Lippensynchronität hängt vom Prompt und der beschriebenen Szene ab.
Der Großteil des Trainingsaufwands von FLUX 3 entfiel auf Videovorhersage. Dadurch musste das Modell Kontakt, Bewegung, Gewicht sowie Ursache und Wirkung lernen – also das Verhalten der physischen Welt. Natives Audio wird auf diesem Weltmodell aufgebaut. Deshalb passen Geräusche zu den sichtbaren Ereignissen, die sie verursachen, und Sprache folgt den Lippenbewegungen. In der Praxis fällt FLUX 3 Video durch ausdrucksstarke Gesichter und physikalisch plausible Bewegung auf.
Referenzsteuerung ist ein zentraler Bestandteil von FLUX 3 Video. Referenzbilder und ein klarer Prompt helfen, Identität, Kleidung und Stimmung über die Frames hinweg zu verankern. FLUX 3 ist zudem darauf ausgelegt, ein Motiv aus einem Ausgangsclip in eine neue Szene zu übertragen. Beim Modell, das derzeit diese Vorschau antreibt, können Sie innerhalb der unterstützten Limits Bild-, Video- und Audioreferenzen hinzufügen, um die Konsistenz zu stärken.
Beim Modell, das diese Vorschau derzeit antreibt, werden für Prompts auf Chinesisch höchstens etwa 500 Zeichen und auf Englisch höchstens etwa 1000 Wörter empfohlen. Sie können bis zu 9 Referenzbilder, 3 Referenzvideos von jeweils 2–15 Sekunden und 3 Audioreferenzen von jeweils 2–15 Sekunden und unter 15 MB anhängen. Nur der Prompt ist erforderlich. Prüfen Sie die aktuelle Parameteranzeige, da sich die Limits mit der Veröffentlichung von FLUX 3 Video ändern werden.
Verfügbar sind 480p, 720p (Standard), 1080p und 4K. Das Seitenverhältnis kann adaptiv gewählt werden – standardmäßig bestimmt das Modell das nächstgelegene Verhältnis – oder fest auf 16:9, 9:16, 4:3, 3:4, 1:1 oder 21:9 eingestellt werden. Beim Modell, das diese Vorschau derzeit antreibt, beträgt die Dauer eine ganze Sekundenzahl zwischen 4 und 15, standardmäßig 5 Sekunden. Das vollständige FLUX-3-Video-Modell ist auf bis zu 20 Sekunden pro Generierung ausgelegt.
FLUX 3 AI ist als ein Fundament mit mehreren Versionen geplant. Neben dem gehosteten FLUX 3 Video hat Black Forest Labs FLUX 3 Image, FLUX 3 Action (die Robotikarbeit FLUX-mimic) und FLUX 3 Dev als multimodales Open-Weight-Basismodell angekündigt. Black Forest Labs hat bestätigt, dass offene Gewichte geplant sind. Sobald FLUX 3 Dev verfügbar ist, ist mit einem Community-Workflow für FLUX 3 LoRA zu rechnen, einschließlich FLUX 3 dev LoRA-Training für wiederkehrende Figuren, Stile und Markenlooks.
Erstellen Sie zunächst einen Prototyp in der RunComfy-Modelloberfläche und rufen Sie danach dieselbe Vorlage über die RunComfy API mit identischen Input-Feldern auf (prompt, images, videos, audios, aspect_ratio, duration, resolution, generate_audio, seed). Prüfen Sie Prompts und Medienlimits zuerst in der Oberfläche und verwenden Sie anschließend Ihren API-Schlüssel und Ihr Guthaben für automatisierte Aufträge.
Die Generierungen verbrauchen Guthaben abhängig von der Länge des erzeugten Videos im Modell, das diese Vorschau derzeit antreibt: Seedance 2.0 Pro kostet $0.08 pro Sekunde bei 480p, $0.175 pro Sekunde bei 720p, $0.40 pro Sekunde bei 1080p und $0.90 pro Sekunde bei 4K. Maßgeblich ist die auf dieser Seite angezeigte Preisangabe; sie wird aktualisiert, sobald FLUX 3 Video erscheint.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





