1. 四个方向,基本就是投研每天在干的事
蚂蚁给它定了四个方向:
看着像套话,但做投研的人应该能认出来,这几件事就是自己每天都在干的。
FinFIRST 也不是只考“金融知识记得多少”。
它会看答案准不准、数据全不全、计算口径是否合理,还要求关键数据和结论能追溯到原始资料。
按官方结果,Ling 3.0 Flash Fin 比较擅长优先找官方、一手和高可信来源。
做投研最怕的不是模型说得不流畅,而是数字看着挺像那么回事,最后却找不到出处。
2. 不只回答问题,还要把任务跑下去
Ling 3.0 Flash Fin 也测了 Finance Agent、APEX-Agents、SpreadsheetBench、τ³-Banking 这些金融 Agent 基准。
这些测试和普通问答不是一回事。
问“什么是自由现金流”,答对就结束了。
真实金融工作流往往是先找数据,再整理表格,接着计算,发现口径不对还得回头查,最后再写成报告。
步骤一多,模型很容易在中间跑偏。
Fin 这次强化的,就是这种长链路任务。
所以如果只是拿它问几个金融知识点,确实有点浪费。
3. 金融加强了,通用能力没明显掉
在 AA Intelligence Index v4.1.1 上,模型得分从 38 提升到 41。
至少从这项测试看,金融专项训练没有把通用推理、编程和数学能力丢掉。
这点很重要。
真实的金融分析很少只靠“懂金融”。
你可能要读财报、写 Python 处理数据、做计算,最后还得把逻辑写清楚。
如果模型一做领域强化就严重偏科,反而不太好用。
4. 推理模式可以开关
Ling 3.0 Flash Fin 支持切换推理模式。
复杂任务时打开,让模型多走几步;简单问题就关掉,省 Token,也少一点延迟。
放到金融分析里很好理解。
读财报、做估值,需要多想几步。
如果只是抽个字段、查个基础信息,就没必要每次都走完整推理。
同一个模型里能切换,比为了不同任务来回换模型省事。
相比 Ling 3.0 Flash,变了什么?
两者底子一样:
- 124B 总参数
- 5.1B 激活参数
- 256K 上下文
Ling 3.0 Flash 是通用模型,Fin 则是在它上面继续做金融领域训练。
所以变化不是模型变大,而是模型更“偏金融”。
一个适合通用执行,一个明显冲着年报、投研、估值和金融 Agent 去。
但这里也有现实问题。
Ling 3.0 Flash 已经能让外部开发者自己部署和验证,Fin 现在还不行。
权重正式开放、第三方评测出来之前,官方分数可以看,但别全信。
评论(0)