発生日:2026年8月11日

オープンソースプロジェクトのh3-metalは、Apple Silicon向けのネイティブなMiniMax-H3推論を実装した。プロンプトからの動画・音声生成、最初と最後のフレームによる条件付け、順序付きの画像・動画・音声参照が、エンドツーエンドで動作する。現在は、M3 MaxおよびM5 Maxシステム向けのMetal性能とメモリの最適化に開発の重点が置かれている。

このコマンドラインエンジンは、元のBF16モデルチェックポイントを使用し、ローカルのMiniMax-H3スナップショットに加えてFFmpegとFFprobeを必要とする。情報表示コマンドは、すべての重みを読み込むことなくモデル構造を確認し、選択されたMetalデバイスを報告する。プロンプトフラグを指定しない場合、同じバイナリーが対話型セッションを開始し、リクエスト間でプロンプトの条件付け、準備済みの拡散トランスフォーマー、動画デコーダーを保持する。

ユーザーは、開始画像と終了画像を永続的に設定したり、番号付きの画像としてモデルに提示される順序付きの一般参照を追加したりできる。この2つの条件付けモードを混在させることはできない。生成されたファイルはセッションディレクトリーに書き込まれ、コマンドを使ってシードの変更、状態の確認、出力の表示、選択した動画の保存ができる。

文書化されているバランス型プリセットでは、毎秒24フレームで22フレーム、約0.92秒の動画を、20回のノイズ除去パスと50のトランスフォーマーブロック中45ブロックを使用して生成する。選択したノイズ除去器の結果を再利用することで、新たに行う評価の回数を減らす。オプションのターミナルプレビューは複数のグラフィックスプロトコルに対応するが、追加のプレビューデコーダーを常駐させ、約10GiBの一時的なモデルストレージを追加で使用する。

迅速な反復作業向けには、4回のノイズ除去パスにより、M5 Max上で512ピクセル四方のキツネのサンプルを約3.5秒で生成した。これに対し、29パスの参照版では26.4秒だった。動画全体の構造的類似性は、このサンプルで0.556、別のサーファーのテストで0.547だった。これらの測定値は選択された検証用プロンプトについてのものであり、一般的な品質を保証するものではない。

SSDストリーミングモードでは、2つのブロックをメモリに保持し、GPUの動作中に次のブロックをストレージから読み込むことで、常駐するトランスフォーマーのストレージ使用量を減らす。M5 Maxでは、追跡対象のトランスフォーマーテンソルのストレージ使用量が、512ピクセル四方で約36.5GiBから2.0GiBへ、864×480では2.1GiBへと減少した。ウォーム状態のフォワードパスは遅くなり、このオプションが速度と引き換えにメモリを節約する明示的な選択肢であることを示している。OS、メディア、エンコーダー、デコーダーの要件は別に存在するため、システム全体のメモリ使用量はこれより多いままである。

このエンジンは、レイヤー削減、速度再利用、トークン削減、より小さな内部キャンバスも提供する。ドキュメントは、積極的な組み合わせによって構図、動き、身体構造が変化したり、視覚的なアーティファクトが生じたりする可能性があると警告している。したがって、h3-metalは、実用的な推論実装であると同時に、チューニング環境でもある。ユーザーは、各変更をモデルのより完全な出力と比較しながら、より高速なプレビューか、より高コストな参照経路かを選択できる。

解像度の制限により、幅と高さは32の倍数である必要があり、最大画素積は768×1,344となる。H3-Baseは768pモデルとして設計されているため、こうした機械的な制限は、すべての小さなキャンバスで有用な品質が得られることを保証するものではない。