1. 视觉反馈闭环
这是 Ling-3.0-flash-VL 最值得看的部分。
很多视觉任务卡住的地方,不是模型看不懂,而是看到之后不知道下一步怎么处理。
Ling-3.0-flash-VL 的思路是让模型继续观察任务状态。
例如图片转网页,它可以根据页面效果继续修改代码,而不是生成一次结果后结束。
GUI Agent 也是类似。
模型需要知道当前界面状态,执行操作,再根据结果决定下一步。
我觉得这个方向比单纯提高视觉问答成绩更接近实际使用。
很多自动化任务真正浪费时间的地方,是错误之后的人工修正。
2. 原生多模态训练
Ling-3.0-flash-VL 采用原生多模态训练,让视觉和语言能力在同一套训练体系里发展。
蚂蚁公布的信息显示,加入视觉能力后,文本能力没有下降,在 Artificial Analysis Intelligence Index 上比纯文本版本提升了 4 分。
它使用任意分辨率视觉编码器和 VideoRoPE 处理视频信息。
对我来说,这部分最实际的意义是:处理网页截图、长图或者视频时,不需要先把输入整理得特别规整,模型有更大的发挥空间。
这类设计对研究展示很好看,但真正能不能改善工作流,还得看实际任务效果。
3. 124B 参数,只激活 5.5B
Ling-3.0-flash-VL 使用 MoE 架构。
124B 是模型总参数量,每次推理只激活其中 5.5B。
这个设计的价值主要体现在部署。
模型规模看起来很大,但实际运行压力不会等同于完整 124B 模型。
FP8 版本约 126GB。
如果团队想自己部署多模态模型,这种架构比单纯堆参数更现实。
我会更关注它实际运行时的速度和稳定性,而不是参数数字本身。
4. 从文本 Agent 到视觉 Agent
Ling-3.0-flash 原本主要处理文本任务。
加入视觉能力后,它能参与更多需要观察环境的流程。
比如网页操作、界面分析、截图理解。
以前搭 Agent 时,如果任务涉及界面,很多信息只能通过文字描述传给模型。
现在模型可以直接读取视觉信息。
这个变化对已经使用 Ling-3.0-flash 的开发者比较直接。
如果原来的流程只是文本处理,变化不会特别大。
但如果任务本身需要看页面、识别状态,再决定下一步动作,使用场景会明显扩大。
评论(0)