独立モデルガイド / MiniMaxとは無関係 2026年8月4日更新

MiniMax H3:1つのモデル。あらゆるシグナル。

MiniMax H3 はテキスト、画像、動画、音声の参照を1つのクリエイティブコンテキストに統合します。検証済みのプロンプト構造、ComfyUI ワークフロー、ローカル実行要件を確認できます。

スクロールして確認
H3_blueprint_spec.json● 検証済み仕様
// MiniMax H3 Prompt Blueprint
{
  "model": "MiniMax-H3""modalities": ["text""image""video""audio"],
  "resolution": "768p base / up to 2K regenerate""workflow": "ComfyUI / API-assisted""blueprint": {
    "SUBJECT": "[character / identity / product]""ACTION": "[camera movement / beat]""AUDIO": "[dialogue + stereo ambience]""PRESERVE": "[face / lighting / style]"
  }
}
最終確認:2026年8月4日768p ローカル · 2K ハイブリッド · ステレオ
公式ウェイト利用可能
Hugging Face稼働中
ModelScope稼働中
ComfyUIT2V / I2V / R2V
ローカルベース768p
フル 2Kハイブリッド / API
公式 GGUF掲載なし
[01]41つのコンテキストに統合される入力モダリティ
[02]2K発表された動画出力解像度
[03]15s発表された最大クリップ時間
[04]2.0ネイティブステレオ音声生成
テキストから動画 画像から動画 プロンプトガイド API とワークフロー ネイティブステレオ音声
01 / 機能マップ

分かれた入力を1つの方向性へ。

01 — コンテキスト

統合されたマルチモーダル理解

公式発表では、H3 はテキスト、画像、動画、音声を1つの共有コンテキストとして理解します。アイデンティティ、動き、音、演出を同時に扱うクリエイティブブリーフに役立ちます。

02 — 出力

ネイティブ音声付き動画

発表では、最大15秒、2K、ステレオ音声を同じ結果として生成する動画が説明されています。プロバイダーによって設定は異なる場合があります。

03 — 制御

参照素材を軸にした演出

参照素材に役割を与えます。画像は被写体、動画は動き、音声クリップは声、テキストは最終指示に使います。役割を明確にすると曖昧さを減らせます。

04 — 反復

コンテキスト内再生成

MiniMax は、H3 が1つのモデル内で生成と対象を絞った編集を支援すると説明しています。実際には、変更点と維持すべき要素の両方を明記してください。

モデル名 / 入手先

MiniMax H3 の正しい入口から始める。

01

名称と表記のバリエーション

MiniMax H3 は minimaxh3、minimax-h3、minmax h3、minmaxh3、mini max h3、h3 minimax とも検索されます。いずれも同じモデル名の一般的な表記ゆれで、別モデルではありません。

02

オープンウェイトとモデル入手先

MiniMax H3 のオープンウェイトチェックポイントは公式モデルハブで案内されています。ローカルガイドでは Hugging Face / ModelScope のウェイトと ComfyUI ファイル、GitHub のワークフローテンプレートを分けて説明しているため、ランタイムに合うパッケージを選んでください。

03

Hailuo H3 / 海螺 H3

検索では MiniMax H3 が Hailuo H3 や 海螺 H3 と関連付けられることもあります。これは検索上の関連として扱い、ダウンロード前に公式ソースでモデルの同一性とライセンスを確認してください。

04

オンライン体験と公式性

「minimax h3 official website」で検索した場合も、このページは公式の入口ではなく独立ガイドとしてご利用ください。オンラインのプロンプト作成体験を提供しますが、公式の推論サービスではありません。

02 / クリエイティブ領域

フレームだけでなく結果を演出する。

01

ブランド映像

1つのキャンペーン方針に沿って、製品の外観、タイポグラフィ、カメラワーク、音楽、音声を調整します。

02

プロダクトストーリー

画像参照で製品のアイデンティティを保ち、明確なショットの時間設計で登場、デモ、トランジションを組み立てます。

03

モーション転送

動画参照の動きをどのように適用するかを説明し、一貫性を保つ被写体と背景要素を指定します。

04

UI とゲームコンセプト

本格的な制作パイプラインに入る前に、UI の動き、世界の遷移、VFX のビート、映像と音のテンポを試作します。

03 / ワークフロー

監督のようにブリーフを書く。

H3 の価値は「入力が多いこと」ではありません。それぞれの入力に役割を与え、最終ショットで信号をどう組み合わせるかを記述できることです。

不変要素を定義する

フレーム間で変化させてはいけないアイデンティティ、製品、ロゴ、色、空間関係を指定します。

すべての参照素材に役割を与える

各画像、動画、音声ファイルから何を借りるかを明記します。参照素材同士の関係を暗黙にしないでください。

ショットを時間軸で組み立てる

冒頭、中盤のビート、終わりを書きます。カメラワーク、被写体の動き、トランジション、音のキューを順番に含めます。

一度に1つの変数を修正する

反復する際は、意図した変更を1つに絞り、維持条件を繰り返します。編集結果を評価しやすくなります。

04 / プロンプト設計図

ショットを組み立てる。

この制作環境に依存しない構造を出発点にします。角括弧の項目を置き換え、利用するUIやAPIプロバイダーに合わせて表現を調整してください。

ベストプラクティス: 何が変わり、何が動き、何が聞こえ、何を変えてはいけないかを記述します。

H3_director_brief.txt
SUBJECT: [identity, clothing, product details]
ACTION: [one clear physical action]
ENVIRONMENT: [location, lighting, weather, atmosphere]

CAMERA: [shot size, lens feel, movement]
TIMING: [opening → middle beat → final frame]
AUDIO: [dialogue, ambience, music, stereo position]

REFERENCES:
- Image 1 provides [identity / product / style]
- Video 1 provides [motion / camera / timing]
- Audio 1 provides [voice / rhythm / ambience]

PRESERVE: [face, logo, colors, layout, background]
AVOID: [unwanted changes or artifacts]
インターフェースの構文や参照制限は異なる場合があります。これはブリーフの枠組みであり、特定プロバイダーの API スキーマではありません。
05 / FAQ

よくある質問

MiniMax H3 とは?

MiniMax は H3 を、テキスト、画像、動画、音声を統合コンテキストで理解する汎用マルチモーダル生成モデルと説明しています。クリエイティブな動画ワークフローでの生成、参照、編集を想定しています。

MiniMax H3 は何を生成できますか?

発表では、最大2K・15秒・ネイティブステレオ音声の動画生成に加え、指示への追従、テキストとブランドの描画、video-to-video のモーション転送が強調されています。具体的なモードや制限はプロバイダーによって異なる場合があります。

MiniMax H3 はオープンウェイトですか?

はい。MiniMax は MiniMax H3 Community License の下で H3-Base FL2VA と Ref2VA のチェックポイントを公開しています。ホスト型の H3-Context-IR システムと H3-Regenerate-2K モジュールは、初回のオープンウェイト公開には含まれません。

MiniMax H3 の API はありますか?

第三者のモデルプラットフォームはホスト型 H3 エンドポイントを発表しています。この独立ガイドは API を提供せず、各プロバイダーの稼働時間、価格、地域アクセス、パラメーター対応を保証しません。最新の公式ドキュメントを確認してください。

MiniMax H3 にはどうプロンプトを書けばよいですか?

主体、アクション、環境、カメラ、タイミング、音声、参照の役割、維持条件、避けたい変化を含む構造化ブリーフを使います。複数参照では、各ファイルが何を提供するかを明記してください。

MiniMax H3 はローカルで実行できますか?

公開済みの H3-Base FL2VA と Ref2VA のパスはローカル実行に対応します。H3-Base のローカル出力は 768p と記載されています。フル 2K 出力には H3-Regenerate-2K/API 支援ワークフローを使いますが、初回のオープンウェイト公開には含まれません。

情報源の扱い

構築する前に確認しましょう。

H3 は新しいモデルで、提供状況は変化しています。本ページの製品情報は、発表、公式モデルカード、ネイティブ ComfyUI ドキュメント、明示的にラベル付けしたプロバイダー情報に限定しています。

すべての参照素材に役割を持たせる。

プロンプト生成器を使う