1. 编程能力
Muse Spark 1.3 这次比较明显的变化,是编程任务里的执行效率。
Meta 给出的数据包括:
- 工具调用次数减少约 20%
- 完成任务消耗的 token 减少约 25%
- 输出更精简
这几项比单纯说“代码能力更强”更有参考价值。复杂编程任务往往要反复读文件、调用工具、修改代码、检查结果,少几次无效调用,直接影响任务成本和执行速度。
DeepSWE v1.1 中,Muse Spark 1.3 得分 75.4,高于图表中列出的 GPT 5.6 Sol 和 Opus 5。
Artificial Analysis 的独立评测也显示,1.3 的综合智能分数相比 1.2 提高约 4 分。
榜单可以说明方向,但对实际开发来说,是否少返工、少做无效操作,往往更重要。
2. Agent 能力
1.3 另一个重点是长周期编程任务。
这类任务不是生成一段代码就结束,而是连续读文件、调用工具、修改内容、检查结果,再决定下一步。
Agent 最怕的也不是某一步做错,而是前面理解错了,后面还沿着错误方向继续执行。
Meta 提到,1.3 遇到模糊提示时更倾向于先澄清,而不是自己补全条件。
这个变化对 Agent 很实用。任务越长,早期判断失误的成本越高。少走一次错误分支,往往比多做几次工具调用更有价值。
Meta AI 负责人 Alexandr Wang 表示,已经有“两位数百分比”的开发者选择 Contributor 层级。
这个数字至少说明,有一批开发者愿意接受更宽松的数据条款,换取更低的调用成本。
3. 多模态和长上下文
Muse Spark 1.3 的上下文窗口是 100 万 tokens,大约可以容纳 75 万个英文单词。
适合整仓代码分析、长文档、多文件任务和长周期 Agent。
长上下文真正实用的地方,不是数字大,而是能减少手动拆文件、截代码和反复补背景的次数。
输入支持文本、图像、视频、音频和 PDF,输出只有文本。
如果需求是生成图片、视频或音频,这个模型不适用。
4. 相比 Muse Spark 1.2 的进化
Muse Spark 1.2 在 8 月 5 日发布,1.3 在 9 月 2 日上线,两代之间不到一个月。
主要变化集中在效率和 Agent 行为:
- 工具调用减少约 20%
- token 消耗减少约 25%
- Terminal-Bench 2.1 从 82.9 提升到 88.8
- 遇到模糊任务时更愿意确认需求
- 长任务里更少沿错误方向持续执行
这些数字主要来自 Meta 官方测试。
Artificial Analysis 的独立结果支持 1.3 相比 1.2 有提升,但官方数据能否在不同环境里完整复现,还要看更多第三方测试。
1.3 的变化更像是把执行过程收得更干净,而不是单纯把模型能力往上抬一档。
评论(0)