Laguna M.1

1.15
第一次看 Laguna M.1 的规格,我先想到的是:这得多贵? 2250 亿参数、256K 上下文、专门做编程 Agent,训练还用了 6144 张 NVIDIA Hopper GPU。 结果一看价格:免费。 至少现阶段,Poolside 官方 API 和 OpenRouter 都能直接用。
Advertisement 728 × 90
公司Poolside
上下文262K
发布日期2026-04
更新日期2026-09-09

Laguna M.1 概述

Laguna M.1 是 Poolside 在 2026 年 4 月发布的开源 MoE 基础模型,目标很明确:做长周期、能自己执行任务的编程 Agent。

它有 2250 亿总参数,单次推理激活约 230 亿参数。

MoE 的好处就是模型可以做得很大,但不需要每次把全部参数都跑一遍。Laguna M.1 一共有 70 层,前 3 层是密集层,后面 67 层是稀疏 MoE。内部放了 256 个专家,每次只调用其中 16 个。

对部署端来说,这比 2250 亿参数全激活现实得多,但它依然不是轻量模型。完整权重很大,本地运行的硬件门槛也不低。

上下文窗口是 256K tokens,最大输出大约 3.2 万 tokens。它支持推理模式,也能在多次工具调用之间继续思考。

这一点对编程 Agent 很关键。它不是问一次、答一次,而是要读代码、改文件、执行命令、看报错,再决定下一步。如果每次工具调用后思路都断掉,任务很容易越跑越偏。

模型权重采用 Apache 2.0 协议开放,可以直接从 Hugging Face 下载。

Laguna M.1 只处理文本输入和文本输出。

它的定位也很窄:就是编程 Agent。

拿它做普通聊天没太大意义,也别指望它去看截图、图片或视频。

Laguna M.1 定价

套餐价格说明
Poolside 官方 API 限时免费 通过 platform.poolside.ai 调用
OpenRouter 免费 模型 ID:poolside/laguna-m.1:free
本地部署 FP8 版 模型免费,硬件自备 Hugging Face 下载,需要支持 FP8 的 GPU
本地部署 BF16 版 模型免费,硬件自备 完整权重约 452GB

Poolside 已经写明“限时免费”,但还没有公布何时开始收费,也没有给正式价格表。

OpenRouter 上依然可以免费调用。

对开发者来说,这个阶段其实很好判断:先用。

编程 Agent 这类模型,光看 benchmark 很难知道合不合自己的代码库。既然 API 不收费,就没必要先围着参数表猜。把真实仓库、真实 issue、真实终端任务丢进去跑一遍,比看十张榜单更有用。

如果有 GPU 资源,也可以直接拉 FP8 版本自己部署。

BF16 完整权重大约 452GB,这个数字已经把绝大多数个人开发者挡在门外了。不是“显卡差一点也能凑合”的级别,而是需要认真算机器配置。

Laguna M.1 主要功能

1. 它不是代码聊天机器人,而是要自己把任务跑完

Laguna M.1 的设计重点不是帮你补几行代码,而是让 Agent 接到任务以后继续往下做。

比如给它一个终端任务,它可以先分析需求,再修改代码、执行命令、检查结果、修 bug,然后继续迭代。

真正耗钱和耗时间的地方也在这里。

普通代码助手可能只调用一次模型。Agent 跑一个完整任务,后台很可能调用很多轮,还要不断接收终端结果。

这也是为什么 Laguna M.1 的长上下文和工具调用能力,比普通聊天能力更重要。

Poolside 还配套提供了终端编程 Agent “pool”,以及云端开发环境 “Shimmer”。

他们不是只做一个模型,而是在尝试把模型直接放进完整的编程执行链路里。

2. 编程成绩不错,但不是榜单第一

Laguna M.1 在主流编程基准上的表现,已经属于开源模型里比较强的一档。

SWE-bench Verified 得分 74.6%,SWE-bench Multilingual 是 63.1%,SWE-bench Pro 为 49.2%,Terminal-Bench 2.0 则是 45.8%。

拿 DeepSeek-V4 Flash 做参照,对方在这四项上的成绩分别是 79.0%、73.3%、52.6% 和 56.9%。

所以 Laguna M.1 的位置其实很清楚:已经很强,但还不是所有编程 benchmark 都能压过头部模型。

对实际开发来说,我反而不太在意这几分差距。

如果模型放进你自己的代码库后,能少失败一次完整任务、少让工程师人工接管一次,价值往往比 benchmark 高 3 个点更直接。

更何况 Laguna M.1 现在还能免费试,没必要只看榜单做判断。直接拿真实 issue、真实仓库和终端任务跑一遍,答案会更有参考价值。

3. 256K 上下文,省下的是“代码到底给它看哪些”

256K 对编程 Agent 的价值,不是“能塞很多字”这么简单。

真正麻烦的是大型代码库。

上下文小的时候,一个 Agent 不可能一次看到所有相关文件。你得先检索,再判断哪些文件值得送进去;改完一个模块以后,又可能发现依赖藏在另一个目录。

最后经常变成:模型还没开始真正解决问题,外面已经写了一堆代码,专门负责挑文件、切上下文、补历史。

256K 不能让这些问题全部消失,但至少能让 Agent 同时看到更多相关代码。

跨文件重构、追调用链、理解配置和测试之间的关系时,这个差别很实际。

少漏一个关键文件,就可能少跑一轮错误修改。

总结

Laguna M.1 最值得注意的其实不是 2250 亿参数,而是两个更现实的点:

它是专门为编程 Agent 做的,而且现阶段免费。

编程能力已经处在开源模型的第一梯队,256K 上下文也很适合大型代码仓库。MoE 让单次推理只激活约 230 亿参数,不需要每次都跑满整个 2250 亿。

更关键的是,你可以几乎零 API 成本地拿真实任务测试。

一个编程模型到底好不好,最难回答的问题从来不是“榜单多少分”,而是“它能不能把我仓库里的这个 bug 真修掉”。

免费阶段正好把这个验证成本压到了最低。

限制也很明确。

它只处理文本,不认图片、视频和音频;用途集中在编程 Agent,不适合拿来做通用聊天。正式收费标准还没有出来,免费能维持多久也没人知道。

本地部署也不是低门槛。

BF16 完整模型约 452GB,就算有 FP8 版本,对 GPU 和显存依然有要求。

如果你在做 AI 编程 Agent,或者正在评估自动修 bug、终端执行、代码库级任务,这个模型很适合直接拉进测试列表。

原因很简单:现在试它几乎没有 API 成本。

如果只是做普通文本问答,没必要搬这么大的模型。

需要视觉输入的项目也可以直接排除。

至于想在个人电脑上本地跑 M.1 的开发者,先看硬件,再看模型。452GB 的权重,不是换张显卡就能解决的问题。

评论(0)

发表评论

Advertisement 728 × 90

Poolside 模型对比

模型 上下文 定价 API 发布 全球热度
Laguna M.1
262K $0.200 / $0.400 per 1M YES 2026-04
31/100
1M $0.100 / $0.200 per 1M YES 2026-07
39/100
262K $0.060 / $0.120 per 1M YES 2026-07
29/100

类似模型

Laguna XS 2.1
25
Laguna XS 2.1 给我的感觉:Poolside 没打算跟那些千亿、万亿参数模型正面拼规模。 它更关心另一个问题:一个能真正写代码、调工具的 Agent,能不能直接跑在自己的电脑上。
Poolside
Laguna S 2.1
24
Laguna S 2.1更想解决一个实际问题:能不能只激活一小部分参数,就把一个会写代码、会调工具的 Agent 跑在单机上。
Poolside
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba