
Minimax H3
MiniMax H3 ist ein Open-Weights, wirklich multimodaler KI-Videogenerator, der Text, Bilder, Video und Audio zu 4–15 Sekunden langen Clips (bis zu 2K/1440p) mit nativem Stereoklang, starker Charakterkontinuität und anweisungsbasierter Bearbeitung mischt.
https://minimaxh3.ai/?utm_source=aipure

Produktinformationen
Aktualisiert:Aug 7, 2026
Was ist Minimax H3
H3 gehört zu einer neueren Klasse von Videomodellen, die eine ganze Szene als einen Job behandeln, anstatt sie aus separaten Phasen zusammenzusetzen. Man gibt ihm eine Mischung aus Material – einen Prompt, einige Standbilder, einen Clip, eine Sprachprobe – und es erarbeitet, wie die Personen, Gesten, der Klang, die Stimmung, die Bildkomposition und die visuelle Behandlung in diesen Referenzen zueinander in Beziehung stehen, bevor es etwas produziert. Was zurückkommt, ist eine Aufnahme zwischen vier und fünfzehn Sekunden in 2K, wobei der Ton bereits Teil des Renderings ist.
Hauptfunktionen von Minimax H3
MiniMax H3 ist ein quelloffenes, universelles multimodales Videogenerierungsmodell, das einen einheitlichen Kontext aus Text, Bildern, Videoclips und Audiospuren verstehen kann, um kurze Videos (ca. 4–15 Sekunden) mit nativ synchronisiertem Stereo-Audio zu produzieren. Es unterstützt mehrere Workflows – Text-zu-Video, Bild-zu-Video, Steuerung des ersten/letzten Frames, referenzbasierte Generierung und anweisungsbasierte Videobearbeitung – sodass Kreative Aufnahmen in einfacher Sprache generieren oder überarbeiten können, während die Charakterkontinuität, Kamerabewegung, der Stil und das Sounddesign über den gesamten Clip hinweg erhalten bleiben, wobei die Ausgabe über gehostete Systeme bis zu 2K und bei lokalen Basisbereitstellungen bis zu ~768p an der kurzen Kante erreichen kann.
Einheitlicher multimodaler Kontext (Text + Bild + Video + Audio): Akzeptiert gemischte Eingaben in einer einzigen Anfrage – bis zu 9 Bilder, 3 Videoclips und 3 Audiospuren (insgesamt 12 Dateien) – und verarbeitet diese gemeinsam, um Charaktere, Bewegung, Kamerasprache, Stimmen und Stil zu einem kohärenten Ergebnis zu verschmelzen.
Native Stereo-Audio-Generierung & Sprach-/Audio-Referenz: Gibt Videos mit integriertem synchronisiertem Stereo-Sound (Umgebung, SFX, Musik und Dialog) aus und kann bereitgestellte Audio-Referenzen verwenden, um Gesang/Stimmton und Timing zu steuern und Soundeffekte mit den Aktionen auf dem Bildschirm abzustimmen.
Referenzgesteuerte Steuerung (Identität, Bewegung, Stil): Verwendet Referenzbilder, um Gesichter/Charaktere konsistent zu halten, Referenzvideos, um Choreografie oder Kamerabewegungen zu übertragen, und Referenzaudio, um Stimme/Musik zu steuern – was „Omni-Referenz“-Workflows ermöglicht, die in natürlicher Sprache beschrieben werden.
Anweisungsbasierte Videobearbeitung (konversationelle Iteration): Bearbeitet einen vorhandenen Clip über Anweisungen in einfacher Sprache (Objekte/Subjekte tauschen, Kleidung ändern, Hintergrund ersetzen, neu beleuchten, Dialog umschreiben), während unberührte Bereiche stabil bleiben, um eine schnellere Bild-für-Bild-Iteration zu ermöglichen.
Mehrere Generierungsmodi & Seitenverhältnisse: Unterstützt Text-zu-Video, Bild-zu-Video, Interpolation des ersten und letzten Frames sowie Video-zu-Video/Bearbeitung in gängigen Formaten (z. B. 16:9, 9:16, 1:1, 21:9), passend für filmische und soziale Ausgaben.
Open-Weights-Ökosystem + gehostete API-Option: Veröffentlicht unter einer Community-Lizenz mit offenen Gewichten und Tooling-Unterstützung (z. B. Diffusers-Pipeline, ComfyUI-Workflows, vLLM/SGLang-Serving-Rezepte), während es auch über gehostete APIs für höherwertige Pipelines wie 2K-Regeneration zugänglich ist.
Anwendungsfälle von Minimax H3
Marketing- & Markenanzeigen: Verwandeln Sie Produktaufnahmen und Briefings in kurze Werbemittel mit lesbarem Text/Logos auf dem Bildschirm, kontrollierter Kamerasprache und integriertem Sounddesign – und iterieren Sie dann schnell, indem Sie Details (Beleuchtung, Hintergrund, Text, VO) über Anweisungen bearbeiten.
E-Commerce-Produktpräsentationen: Animieren Sie statische Produktfotos zu ausgefeilten Listing-Videos, einschließlich Verpackungsdetails, Bildunterschriften und synchronisierter Atmosphäre/Musik, ohne ein physisches Shooting.
Spieleentwicklung & -inhalte (CG, Trailer, UI-Demos): Generieren Sie spielähnliche Sequenzen, Charakter-PVs und animierte UI-Walkthroughs, bei denen Konsistenz wichtig ist (HUD-/Menülesbarkeit, Stabilität des Charaktermodells), indem Sie Referenzen verwenden, um Designs modellgetreu zu halten.
Stilisierte Animation & Musikvideo-Inhalte: Produzieren Sie Clips in verschiedenen Looks (Anime, Knetanimation, Pixelkunst, 3D-Fantasy) und synchronisieren Sie Action-Beats mit Musik/SFX, wobei Stil- und Bewegungsreferenzen für einen kohärenten visuellen Rhythmus genutzt werden.
Film-Previsualisierung & kurze narrative Szenen: Erstellen Sie 4–15 Sekunden lange filmische Beats mit Regie-Kamerainstruktionen (Dolly, Rack Focus, Schnitte/Titelkarten) und nativem Audio, nützlich für Storyboarding, Pitch-Materialien und schnelle Konzeptexploration.
Produktion von Social Short-Form Content: Generieren Sie schnell vertikale (9:16) Sound-on-Clips für TikTok/Reels/Shorts aus Textaufforderungen und optionalen Referenzen, und verfeinern Sie diese dann mit konversationellen Bearbeitungen, anstatt sie von Grund auf neu zu rendern.
Vorteile
Starke multimodale Flexibilität: kombiniert Text, Bilder, Video und Audio in einem Kontext statt separater Tools.
Native synchronisierte Stereo-Audio (einschließlich Dialog/SFX/Ambiente) reduziert den Bedarf an separaten Sounddesign-Durchläufen.
Anweisungsbasierte Bearbeitung ermöglicht schnelle Iteration bei gleichzeitiger Beibehaltung stabiler Elemente wie Charakteridentität und Szenenlayout.
Open-Weights-Verfügbarkeit plus breite Ökosystemunterstützung (Pipelines/Workflows/Serving-Stacks) ermöglicht Anpassung und lokale Experimente.
Nachteile
Der vollständige 2K-Workflow kann von gehosteten Stufen abhängen; lokale Open-Weight-Versionen können stärker eingeschränkt sein (z. B. ~768p kurze Kante Basisausgabe) und hardwareintensiv sein.
Die Community-Lizenz enthält Nutzungsbeschränkungen (z. B. Verpflichtungen zur rechtmäßigen Nutzung und Beschränkungen der Verwendung von Ausgaben/Modellen zur Verbesserung anderer KI-Modelle).
Der Fokus auf kurze Clip-Dauer (ungefähr 4–15 Sekunden) bedeutet, dass längere Erzählungen das Zusammenfügen mehrerer Generierungen und die externe Verwaltung der Kontinuität erfordern.
Wie verwendet man Minimax H3
1) Wählen Sie, wie Sie MiniMax H3 ausführen möchten (App, gehostete API oder lokale Open-Weights): Wählen Sie einen Workflow: (a) Web-/App-Erfahrung (schnellster Start): Verwenden Sie die MiniMax H3 App/Website, um im Chat zu generieren und zu bearbeiten. (b) Gehostete API (serverlos): Senden Sie asynchrone Jobs und laden Sie MP4 herunter, wenn sie fertig sind. (c) Lokale Open-Weights (ComfyUI oder vLLM): Führen Sie H3-Base lokal für 768p-Ausgabe aus; beachten Sie, dass gehostete Context-IR- und 2K-Upscaling-Module separate gehostete Stufen sind.
2) Entscheiden Sie Ihren Generierungsmodus (Text-zu-Video, Bild-zu-Video mit erstem/letztem Frame oder Referenz-zu-Video): MiniMax H3 wird als zwei aufgabenbezogene Checkpoints veröffentlicht: FL2VA (Text-zu-Video + Erst-/Letztbild-Konditionierung) und Ref2VA (referenzbasierte Generierung). Wählen Sie: Text-zu-Video nur für Prompts; Bild-zu-Video für die Steuerung des ersten und/oder letzten Frames; Referenz-zu-Video, um mehrere Bilder/Videos/Audio-Referenzen zu kombinieren (insgesamt bis zu 12 Dateien: bis zu 9 Bilder, 3 Videos, 3 Audios).
3) Schreiben Sie einen „Regie-Prompt“ (Subjekt + Aktion + Kamera + Licht + Ton): Beschreiben Sie, was im Clip passiert, nicht nur ein Standbild. Fügen Sie Kamerasprache (z. B. Tracking Shot, Rack Focus, Handheld), Beleuchtung/Zeit (goldene Stunde, Neon-Nacht) hinzu und weisen Sie den Ton explizit als eigene Spur an (Ambiente, SFX, Musik, Dialog). H3 gibt nativen Stereoton aus, daher sollte der Ton bewusst spezifiziert werden, um unerwünschten Ton zu vermeiden.
4) Wenn Sie Referenzen verwenden, weisen Sie jeder Referenz eine explizite Aufgabe zu: Wenn Sie Bilder/Videos/Audio bereitstellen, geben Sie an, was jedes davon steuert (Charakteridentität, Hintergrund, Choreografie, Stil, Musikbett, Stimmton). Beispielmuster: „Verwenden Sie @Bild 1 für Gesicht und Outfit des Charakters; @Bild 2 für den zweiten Charakter; @Bild 3 für die Umgebung; @Video 1 für Kamerabewegung und Aktionsrhythmus; @Audio 1 für Hintergrundmusik; fügen Sie synchronisierte Hit-/Sprung-/Waffen-SFX hinzu.“
5) Wählen Sie Dauer und Seitenverhältnis: Legen Sie eine Clip-Länge innerhalb des unterstützten Bereichs fest (üblicherweise 5–15 Sekunden, je nach Plattform). Wählen Sie ein Seitenverhältnis wie 21:9, 16:9, 4:3, 1:1, 3:4 oder 9:16 (oder lassen Sie H3 in einigen Schnittstellen die Bildkomposition automatisch auswählen).
6) Generieren über die App (schneller Startpfad): In der MiniMax H3 App/Website: (1) Wählen Sie MiniMax H3, wechseln Sie zu Video. (2) Fügen Sie Ihren Prompt ein und laden Sie optional Referenzen hoch (Bilder/Videos/Audio). (3) Wählen Sie Seitenverhältnis und Dauer. (4) Klicken Sie auf Generieren, um ein Video mit nativem Stereoton zu erhalten. (5) Laden Sie das Ergebnis herunter.
7) Generieren über gehostete API (asynchrone Job-Einreichung): Erstellen Sie einen API-Schlüssel (z. B. EvoLink). POSTen Sie eine asynchrone Generierungsanfrage, erhalten Sie eine Aufgaben-ID, fragen Sie den Status ab und laden Sie dann das resultierende MP4 herunter, wenn es abgeschlossen ist. Verwenden Sie die korrekte Modell-ID für Ihren Modus (z. B. „minimax-h3-text-to-video“). Mischen Sie keine modusspezifischen Felder (z. B. akzeptiert die Textroute kein image_start; die Referenzroute akzeptiert kein image_start/image_end).
8) Beispiel-API-Anfrage (Text-zu-Video): Senden Sie JSON wie: { "model": "minimax-h3-text-to-video", "prompt": "Ein einsamer Reisender geht bei Sonnenuntergang an einer windgepeitschten Klippe entlang, filmischer Tracking Shot", "duration": 5, "quality": "2k", "aspect_ratio": "16:9" }. Fragen Sie dann per Aufgaben-ID ab, bis es fertig ist, und laden Sie das MP4 herunter.
9) Lokale ComfyUI-Einrichtung: Knoten installieren und Modelldateien platzieren: Installieren Sie ComfyUI und die benutzerdefinierten MiniMax H3-Knoten (z. B. ComfyUI-MiniMaxH3). Laden Sie die erforderlichen Gewichte herunter und platzieren Sie sie: Diffusionsmodell (z. B. minimax_h3_fl2va_pruned_int8_convrot.safetensors), Text-Encoder (z. B. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors) und beide VAEs: minimax_h3_video_vae_fp16.safetensors (Video) + minimax_h3_audio_vae_fp32.safetensors (Audio). Stellen Sie sicher, dass Ihr Workflow VAEDecodeAudio enthält, das mit SaveVideo verbunden ist, damit Audio in die Ausgabe geschrieben wird.
10) Lokale ComfyUI: Korrekte Auflösung wählen (nicht zu klein): H3 hat eine Mindestauflösung von 384p; 256p schlägt fehl. Verwenden Sie die offiziellen Auflösungs-Presets/-Vorlagen. Die native Leinwand von H3 hat eine kurze Kante von 768px (begrenzt auf 768×1344, Vielfache von 32). Für eine lokale Ausgabe in voller Qualität erhöhen Sie die Megapixel auf etwa ~1,0 bei 16:9 (ungefähr 1344×768).
11) Lokale ComfyUI: Den richtigen Knoten für Ihren Modus ausführen: Für FL2VA (Text + optionaler erster/letzter Frame) verwenden Sie den MiniMaxH3ImageToVideo-Knoten und verbinden Sie Bilder mit first_frame und/oder last_frame. Für Ref2VA (Multi-Referenz) verwenden Sie den MiniMaxH3ReferenceToVideo-Knoten und stellen Sie geordnete Bild-/Video-/Audio-Referenzen mit expliziten Rollen bereit, die im Prompt beschrieben sind.
12) Lokale vLLM (ROCm) Serving-Option (fortgeschritten): Wenn Sie mit vLLM Omni auf ROCm bereitstellen, verwenden Sie das offizielle vllm/vllm-omni-rocm:minimax-h3-Image und bedienen Sie entweder /path/to/MiniMax-H3/FL2VA oder /path/to/MiniMax-H3/Ref2VA, je nach Anfragetyp. Tauschen Sie den bedienten Pfad aus und starten Sie neu, um zwischen FL2VA- und Ref2VA-Verarbeitung zu wechseln.
13) Iterieren Sie mithilfe von anweisungsbasierter Bearbeitung (eine Sache ändern, den Rest stabil halten): Nach einer Generierung verfeinern Sie, indem Sie eine einfache Bearbeitungsanweisung geben (Outfit tauschen, Hintergrund ersetzen, neu beleuchten, Dialog umschreiben usw.). H3 ist darauf ausgelegt, unberührte Teile stabil zu halten, während die angeforderte Änderung angewendet wird. Für eine zuverlässige Iteration ändern Sie jeweils eine Variable und behalten Sie eine funktionierende Basislinie bei.
14) Häufige Probleme beheben (Audio, Auflösung und „kaputte“ Prompts): Wenn der Ton falsch klingt, fügen Sie explizite Tonanweisungen hinzu (Ambiente, Musikstil, SFX-Timing, Dialogabsicht). Wenn die Ausgabe lokal fehlschlägt oder beschädigt aussieht, stellen Sie sicher, dass die Auflösung ≥384p ist und beide Video- und Audio-VAEs mit VAEDecodeAudio geladen sind, das mit SaveVideo verbunden ist. Wenn ein Prompt in gehostetem Hailuo/App funktioniert, aber nicht lokal, denken Sie daran, dass gehostete Pipelines eine Context-IR-Vorverarbeitung enthalten können; lokal benötigen Sie möglicherweise eine explizitere Struktur und Referenzrollen-Zuweisung.
15) Exportieren und das Ergebnis angemessen verwenden: Laden Sie das MP4 (mit nativem Stereoton) herunter. Wenn Sie Open Weights verwenden, befolgen Sie die MiniMax H3 Community License Agreement und alle Nutzungsbeschränkungen; gehostete APIs können global verfügbar sein, während Open-Weight-Bedingungen territorial sein und Einschränkungen wie kein Distilling enthalten können.
Minimax H3 FAQs
MiniMax H3 ist ein Open-Weights, universelles multimodales Videogenerierungsmodell, das Text, Bilder, Videos und Audio zusammen in einem einzigen Kontext lesen und kohärente audiovisuelle Videoclips generieren kann.
Beliebte Artikel

Atoms: Eine Multi-Agenten-KI-Plattform, die Ideen in startbereite Produkte verwandelt
May 22, 2026

Nano Banana SBTI: Was es ist, wie es funktioniert und wie man es im Jahr 2026 einsetzt
Apr 15, 2026

Atoms Review – Der KI-Produkt-Builder, der die digitale Erstellung im Jahr 2026 neu definiert
Apr 10, 2026

Kilo Claw: Wie man einen echten "Do-It-For-You" KI-Agenten bereitstellt und verwendet (2026 Update)
Apr 3, 2026







