Ling 3.0 Flash VL

蚂蚁百灵系列在 9 月 9 日开源了 Ling-3.0-flash-VL,这是该系列第一个原生多模态模型。Ling-3.0-flash-VL 加入了视觉反馈闭环:模型可以观察当前状态,根据执行结果继续调整。
Advertisement 728 × 90
公司Inclusionai
上下文131K
发布日期2026-09
更新日期2026-09-15

Ling 3.0 Flash VL 概述

Ling-3.0-flash-VL 不是从零训练的新模型,而是在 Ling-3.0-flash 的 MoE 架构基础上加入视觉能力。

模型总参数量为 124B,单次推理激活 5.5B 参数。

它支持图像、文本和视频输入,输出为文本,上下文窗口最高 256K token。

主要应用方向包括:

GUI 自动化
前端代码生成
医疗报告分析
图像和视频理解

例如生成网页时,它可以读取页面结构,生成代码,再根据结果继续调整。

模型已经开源 BF16 和 FP8 版本,采用 MIT 协议,可从 Hugging Face 和 ModelScope 获取。FP4 和 INT4 版本计划后续发布。

Ling 3.0 Flash VL 定价

套餐价格说明
Ling Studio 免费体验 可直接体验模型能力

Ling 3.0 Flash VL 主要功能

1. 视觉反馈闭环

这是 Ling-3.0-flash-VL 最值得看的部分。

很多视觉任务卡住的地方,不是模型看不懂,而是看到之后不知道下一步怎么处理。

Ling-3.0-flash-VL 的思路是让模型继续观察任务状态。

例如图片转网页,它可以根据页面效果继续修改代码,而不是生成一次结果后结束。

GUI Agent 也是类似。

模型需要知道当前界面状态,执行操作,再根据结果决定下一步。

我觉得这个方向比单纯提高视觉问答成绩更接近实际使用。

很多自动化任务真正浪费时间的地方,是错误之后的人工修正。


2. 原生多模态训练

Ling-3.0-flash-VL 采用原生多模态训练,让视觉和语言能力在同一套训练体系里发展。

蚂蚁公布的信息显示,加入视觉能力后,文本能力没有下降,在 Artificial Analysis Intelligence Index 上比纯文本版本提升了 4 分。

它使用任意分辨率视觉编码器和 VideoRoPE 处理视频信息。

对我来说,这部分最实际的意义是:处理网页截图、长图或者视频时,不需要先把输入整理得特别规整,模型有更大的发挥空间。

这类设计对研究展示很好看,但真正能不能改善工作流,还得看实际任务效果。


3. 124B 参数,只激活 5.5B

Ling-3.0-flash-VL 使用 MoE 架构。

124B 是模型总参数量,每次推理只激活其中 5.5B。

这个设计的价值主要体现在部署。

模型规模看起来很大,但实际运行压力不会等同于完整 124B 模型。

FP8 版本约 126GB。

如果团队想自己部署多模态模型,这种架构比单纯堆参数更现实。

我会更关注它实际运行时的速度和稳定性,而不是参数数字本身。


4. 从文本 Agent 到视觉 Agent

Ling-3.0-flash 原本主要处理文本任务。

加入视觉能力后,它能参与更多需要观察环境的流程。

比如网页操作、界面分析、截图理解。

以前搭 Agent 时,如果任务涉及界面,很多信息只能通过文字描述传给模型。

现在模型可以直接读取视觉信息。

这个变化对已经使用 Ling-3.0-flash 的开发者比较直接。

如果原来的流程只是文本处理,变化不会特别大。

但如果任务本身需要看页面、识别状态,再决定下一步动作,使用场景会明显扩大。

总结

Ling-3.0-flash-VL 最吸引我的地方,是它没有停留在“看懂图片”。

它想解决的是看完之后怎么继续做。

我会优先拿它测试网页生成、界面理解、资料分析这类任务。

这些任务允许一定程度人工检查,也能比较容易判断模型到底有没有减少工作量。

如果只是图片描述、普通视觉问答,我不会选择这种规模的模型。

如果涉及关键业务流程或者不可逆操作,我也不会直接让它自动执行。

对我来说,Ling-3.0-flash-VL 现在更像一个适合放进工作流里测试的模型。

真正决定它价值的,不是参数规模,而是它能不能少让我做几轮重复修改。

评论(0)

发表评论

Advertisement 728 × 90

Inclusionai 模型对比

模型 上下文 定价 API 发布 全球热度
Ling 3.0 Flash VL
131K $0.060 / $0.180 per 1M YES 2026-09
262K 免费 YES 2026-08
44/100
262K $0.075 / $0.625 per 1M YES 2026-05
53/100
262K $0.010 / $0.030 per 1M YES 2026-04
42/100

类似模型

Ling 3.0 Flash Fin (free)
62
蚂蚁百灵这周上线了 Ling 3.0 Flash Fin,一款专门做金融任务的模型。 OpenRouter 限时免费一个月,输入输出都是 0 美元。 做投研、财务分析、金融 Agent 的,这个月很适合拿真实数据去试。
Inclusionai
Ring-2.6-1T
61
Ring-2.6-1T 是一个拥有 1万亿(1T)参数规模的思考型模型,其中包含 630亿(63B)活跃参数。它专为真实世界中的智能体(Agent)工作流程打造……
Inclusionai
Ling-2.6-flash
46
Ling 2.6 Flash在走一条不太一样的路线。别的模型还在拼 benchmark,它更在意一件很实际的事:同样的任务,能不能少用一点 Token。
Inclusionai
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba