1. 科研能力涨得有点猛
Terminal-Bench-Science 上,Fable 5.1 拿到了 52.6%。
上一代 Fable 5 是 24.7%。
这不是多了三五个百分点,而是直接翻了一倍还多。
它做的也不是“解释一下什么是蛋白质”这种知识问答,而是真正要调工具的科研任务。
官方给出的案例包括蛋白质设计、GPU 内核优化,还有拿 NASA 的历史数据去做高精度金星地图。
后面这个挺夸张,分辨率提高了接近 10 倍。
这类任务难就难在不能只靠背答案。模型要自己调用工具、检查结果、发现问题,再继续改。
偶尔一步做对不难,连续几十步别掉链子才难。
2. 编程和自动化工作流更强
在 Terminal-Bench 4.0 和 AutomationBench 上,Fable 5.1 相比前代都有明显提升。
这里有个比跑分更值得看的点:推理档位。
Anthropic 给出的数据里,Fable 5.1 在中低推理档位,就能做到接近上一代高推理档位的表现。
这对开发者很现实。
模型能力强不强是一回事,每次任务烧多少 Token 又是另一回事。
如果不用次次把推理强度拉满,就能把原先需要高档位做的任务跑下来,那省下来的可不是一点。
3. 真能连续“上班”很久
Ramp 做过一次挺狠的测试:让 Fable 5.1 连续跑了 38 个小时。
谁平时没事让 AI 连跑 38 小时?
普通用户肯定不会。
但做 Agent、自动化业务、数据实验的团队,还真有这种需求。
这 38 个小时里,模型不是一直等人喂下一步指令。它会自己发现问题、修正数据、启动实验,最后把结果整理成报告。
这才是长任务里最麻烦的地方。
跑三个步骤没问题,跑到第三十步还能记得自己为什么在做这件事,就不是一个量级了。
4. 写东西终于没那么爱“排版”
这个改动不大,但用得多的人应该挺有感。
有研究人员提到,Fable 5.1 写作时少了一些滥用粗体、标题和列表的情况,对风格要求也更听话了。
AI 写长文有个老毛病:一句话能说完,非得拆成三个小标题、五个 bullet,最后再来个“总结”。
看着特别像在交作业。
Fable 5.1 在这方面收了一点。
不是说它突然会写文学作品了,只是少了一些那种一眼就能看出来的“AI 排版癖”。
相比上一代 Fable 5,变了什么?
Fable 5 更像一个很聪明的解题模型。
到了 5.1,Anthropic 明显更在意另一件事:模型能不能把活从头做到尾。
不是只给一个漂亮答案。
而是查问题、用工具、回头检查、继续跑,必要时自己修正。
再配上这次缓存读取降价,路线其实很清楚——Fable 5.1 就是冲着那些真正拿 Claude 当“数字员工”用的人去的。
评论(0)