1. 能处理更完整的软件工程任务
Muse Spark 1.2 Contributor 不只适合生成代码片段。
它可以先读代码库,再拆任务、修改多个文件、调用工具、运行测试,然后根据结果继续修。
像重构、Bug 修复、代码迁移这类工作,更需要这种连续处理能力,而不是单次回答写得多漂亮。
Terminal-Bench 和 DeepSWE 这类评测也更接近这个方向:看的不是会不会写一个函数,而是能不能把任务做下去。
2. 更偏 Agent 工作流
Muse Spark 1.2 和 Meta 的编程 Agent Muse Code 采用 co-train 方式训练。
这种训练路线强调连续操作:先规划,再调用工具,读取结果,然后决定下一步。
如果你的使用场景是 IDE Agent、自动修复、批量开发任务,这一点比普通聊天能力更重要。
模型需要做的不是每次等你重新下命令,而是能沿着一个目标持续工作。
3. 104 万 token 上下文,加上多模态输入
104 万 token 的价值很直接:一次能放进去更多代码和资料。
分析跨文件依赖、读大型仓库、对照技术文档改代码时,不需要频繁拆上下文。
它还支持图像、视频、音频和 PDF 输入。
比如设计稿、接口文档、技术 PDF 和代码,可以放在同一个任务里处理,不需要先手动把所有内容转成纯文本。
4. 相比 Muse Spark 1.1,进化在哪?
Muse Spark 1.2 的提升主要落在复杂任务完成度上。
Terminal-Bench 2.1 提升 6.7 个百分点,DeepSWE 1.1 提升 6.3 个百分点。
再加上更明确的 Agent 训练路线,1.2 的方向已经很清楚:少一点“帮你写段代码”,多一点“把这个开发任务做完”。
如果 1.1 更像在验证编程能力,1.2 则更接近真正干工程活。
评论(0)