MiniMax-M3 是 MiniMax 自主研发的多模态基础模型。它支持文本、图像和视频输入,并生成文本输出,具备 100 万 Token 的上下文窗口,适用于长期智能体任务、代码编写和工具调用等场景。
该模型采用 MiniMax Sparse Attention(MSA) 技术,通过 KV 块选择机制替代全注意力机制,大幅降低长上下文场景下每个 Token 的计算量——在 100 万 Token 时,成本约为上一代模型的二十分之一,同时显著提升预填充和解码速度,且在绝大多数任务上保持同等质量。
MiniMax-M3 基于交错数据以原生多模态方式进行训练,并通过交互式用户模拟器框架针对多轮、贴近实际生产的协作场景进行了调优。模型定位更倾向于处理持续性、多步骤的复杂任务,而非单次执行的简单指令。
评论(0)