Mistral Medium 3.5

1.70
法国 AI 公司 Mistral 一直有很强的“欧洲挑战者”色彩。到了 Mistral Medium 3.5,我更明显地感觉到,它开始把方向押得很具体:编码、工具调用和 Agent。
Advertisement 728 × 90
公司Mistral AI
上下文262K
发布日期2026-04
更新日期2026-09-07

Mistral Medium 3.5 概述

Mistral Medium 3.5 由 Mistral AI 于 2026 年 4 月 29 日发布,参数规模 1280 亿,采用 Dense 稠密架构,上下文窗口为 256K tokens。

它是 Mistral 首款“融合模型”(merged model),把指令遵循、推理和编码整合进同一套权重,不需要根据任务来回切换模型或 checkpoint。

能力覆盖文本对话、代码生成与调试、图像理解、函数调用、工具使用以及多步骤 Agent。支持中文、日文、法文等数十种语言。

模型权重以修改版 MIT 许可证发布在 Hugging Face,可用于商业和非商业场景。

两项比较醒目的成绩是:

SWE-Bench Verified:77.6%
τ³-Telecom:91.4 分

SWE-Bench Verified 测的是模型解决真实 GitHub Issue 的能力。77.6% 已经进入高端编码模型的竞争区间。

但跑分只能说明上限,不能直接等同于真实开发体验。复杂代码库里还有依赖关系、历史代码、上下文噪声和多轮修改,这些都不是一个 benchmark 数字能完全覆盖的。

Mistral Medium 3.5 定价

套餐价格说明
API 输入 $1.50 / 百万 tokens 按输入 token 数计费
API 输出 $7.50 / 百万 tokens 按生成 token 数计费

API 上下文窗口上限为 262,144 tokens,最大输出同样为 262,144 tokens。

拿 Claude Sonnet 4.6 做参照,后者 API 输入 $3/百万 tokens、输出 $15/百万 tokens,Medium 3.5 基本是半价。

DeepSeek-V4 Pro 输入价格约为 $1.74/百万 tokens,和它比较接近。Mistral 的差异更多落在 256K 上下文、自托管和 Agent 能力上。

Agent 场景里,价格比普通聊天更重要。一次任务可能连续读代码、调工具、改文件、跑测试,再根据结果继续修第二轮。调用链一长,token 消耗很快,模型单价会直接影响长期成本。

Mistral Medium 3.5 主要功能

1. 推理强度可调:高档有用,但别一直开

Medium 3.5 支持 reasoning_effort 参数。

设置 "none" 时更偏快速响应;切到 "high" 后,模型会投入更多计算处理问题。

普通代码补全、解释函数、修改范围明确的小 Bug,我更倾向于直接用低推理强度。开 High 经常得不到成比例的提升,等待感却会明显增加。

到了跨文件修改、依赖追踪,或者需要先理解一段历史代码为什么这么写,高推理模式才更有价值。它会更主动检查上下游关系,而不是看到报错就立刻给出第一种修法。

有一次处理跨文件代码问题时,它第一轮其实已经找到了报错点,开到高推理后却没有马上收手,又沿着依赖链继续追了一层。最后的修改确实更完整,但那个过程也让我很直观地意识到:High 模式有时候不是“更聪明”,而是“更不愿意草率交卷”。

这也解释了为什么我不会把 High 当默认档。复杂任务值得开,简单任务反而可能只是多等一会儿。

2. 原生多模态视觉:单独看普通,和编码结合后更实用

Medium 3.5 带有视觉编码器,可以直接处理不同尺寸和比例的图片。

流程图、UI 截图、数学公式等输入都能分析。

“能看图”本身已经不是旗舰模型里的稀缺能力。它更实用的地方,是视觉、代码和工具调用都在同一模型里。

比如前端开发时,可以把 UI 截图和项目代码一起交给它;排查问题时,也可以同时输入报错截图、架构图和相关代码。

这时候视觉能力不是单独的识图功能,而是 Agent 获取环境信息的一部分。

3. 函数调用与 Agent:这是 Medium 3.5 真正的重点

Function Calling 和结构化 JSON 输出属于模型原生能力。

配合 256K 上下文,它可以处理连续工具调用,在较长任务链里保留代码、历史操作和工具返回结果。

Mistral 也把 Medium 3.5 用在 Vibe Coding Agent 上。用户可以通过 CLI 或 Le Chat 发起云端编码任务,让模型连续执行修改代码、安装依赖、运行测试、提交 PR 等步骤。

Medium 3.5 的很多能力其实都围绕这一点展开:

  • 256K 上下文装代码和任务历史
  • reasoning effort 处理复杂步骤
  • Function Calling 连接工具
  • 视觉能力补上 UI、截图和图表输入

拆开看都不算少见,组合起来就更像一块专门为 Coding Agent 准备的底座

总结

优势

  • 128B Dense 架构,覆盖编码、视觉、推理和工具调用
  • 256K 上下文,适合大型代码库和长任务链
  • 最大输出约 26 万 tokens
  • SWE-Bench Verified 77.6%,编码能力进入高端模型竞争区间
  • reasoning effort 可以按任务复杂度调节
  • API 价格约为 Claude Sonnet 4.6 的一半
  • 支持自托管
  • Function Calling、视觉和编码集中在同一模型里,适合 Agent 开发

限制

  • 没有免费 API 额度
  • 128B 稠密模型不轻,自托管对硬件和运维都有要求
  • High 模式并不是每次都能换来对应的质量提升
  • 256K 上下文解决的是“能放进去”,不代表超长代码库里所有依赖都能稳定抓准
  • 只做聊天、摘要和普通写作时,很多能力用不上

推荐人群

软件工程师、Coding Agent 开发者、中大型 AI 团队,以及有自托管和数据控制需求的企业。

尤其是正在做长任务链 Agent,又比较在意 API 成本的团队,Medium 3.5 值得拿真实项目跑一轮。

不推荐人群

预算有限的个人学习者、只需要基础聊天的用户,以及单纯追求最高 benchmark 分数的人。

Mistral Medium 3.5 真正值得看的,不是 77.6% 这个数字本身,而是它放进 Coding Agent 后,能不能真的帮你少写几轮代码、少跑几次无效调用。

如果工作流确实需要长上下文、工具调用和复杂编码,它有竞争力;如果这些能力都用不上,那它就是一款规格很高、但有些过剩的模型。

评论(0)

发表评论

Advertisement 728 × 90

类似模型

Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba
Kimi K3
96
Moonshot AI 最新旗舰模型,具备超长上下文、多模态理解和智能 Agent 任务执行能力。
Moonshotai