MiniMax-M3は、MiniMaxが開発したマルチモーダル基盤モデルです。テキスト、画像、ビデオ入力をサポートし、テキスト出力を行います。100万トークンのコンテキストウィンドウを備え、長期的なエージェントタスク、コーディング、ツール利用に適しています。このモデルは、MiniMax Sparse Attention(MSA)を採用しており、フルアテンションをKVブロック選択に置き換えることで、長いコンテキストにおけるトークンあたりの計算量を削減しています。これにより、100万トークン時には従来の世代と比較して約20分の1のコストを実現し、プレフィルとデコードが大幅に高速化されつつ、ほとんどのタスクで品質を維持しています。
インターリーブされたデータで学習されたネイティブなマルチモーダルモデルであり、インタラクティブなユーザーシミュレーターフレームワークを通じて、多ターンかつ実運用に近いコラボレーション向けにチューニングされています。このモデルは、単発の実行ではなく、持続的で多段階のタスクを志向しています。
コメント(0件)