Article
MiniMax H3: Open-Weights Video-Modell mit Stereo-Audio und 2K in ComfyUI
Day-Zero in ComfyUI
MiniMax H3 ist seit heute verfügbar — mit offenen Gewichten und nativem Support in ComfyUI ab Release-Tag. Es ist die dritte Generation von MiniMax’ Video-Modell (nach Hailuo 01 und 02) und die erste die vollständig mit offenen Gewichten veröffentlicht wird.
Was es kann
H3 ist ein multimodales omni-modal Video-Modell. Input: Text, Bilder, Video und Audio — in beliebiger Kombination. Output: Video mit nativem Stereo-Audio bis 2K Auflösung, bis zu 15 Sekunden pro Clip.
Die Modi umfassen:
- Text-to-Video: Nur Prompt
- Image-to-Video: Ein Bild zum Leben erwecken
- First/Last-Frame-Kontrolle: Anfangs- und/oder Endframe vorgeben, Modell füllt auf
- Reference-basierte Generierung: Referenz-Bilder, -Video oder -Audio als Anker für Subjekt, Bewegung oder Stimme
Natives Stereo-Audio
Der Audio-Output ist keine Post-Processing-Schicht sondern ein integrierter Bestandteil des Modells. Jedes generierte Video enthält Stereo-Ton, der zusammen mit dem Bildmaterial in einem Durchlauf erzeugt wird.
Multimodales Kontext-Verständnis
Die Fähigkeit die MiniMax besonders hervorhebt: H3 nimmt Bilder, Audio und Video gleichzeitig auf und löst sie gegen einen Prompt auf, der erklärt wie die Inputs zusammenhängen. Beschreibe die Beziehung zwischen deinen Eingaben und dem gewünschten Shot — das Modell übernimmt die cross-modale Arbeit.
Motion Transfer und Editing
Eine Referenz-Video kann Bewegung liefern — eine Kamerafahrt, eine Performance, einen Schnitt-Rhythmus — während Subjekt und Stil aus anderen Quellen kommen. Kombiniert mit In-Place-Editing ermöglicht das iteratives Arbeiten an einem Shot ohne den Kontext zu verlieren.
Lokal auf einer 3060
Trotz der beeindruckenden Fähigkeiten ist das Modell für lokale Inferenz optimiert und läuft laut ComfyUI-Team auf einer RTX 3060. ComfyUI bietet optimierte Workflows und eine Integration in Comfy Cloud für GPU-Intensivere Aufgaben.