Hy4 preview

8月28日,腾讯混元发布新一代大语言模型 Hy4 preview,模型权重同步开源。 官方给它的定位很直接:“为生产力而生”。 看完这次更新,我的第一印象是,腾讯这次没打算跟着榜单跑,而是把重点押在了一个更实际的问题上:这模型到底能不能真帮人干活。
Advertisement 728 × 90
公司Tencent
上下文1M
发布日期2026-08
更新日期2026-09-01

Hy4 preview 概述

Hy4 preview 采用混合专家(MoE)架构,总参数 770B,也就是 7700 亿,激活参数 49B,上下文窗口达到 1M tokens。

1M tokens 是什么概念?大概能塞下《三体》三部曲,再加一份年报。

这类超长上下文的价值,不是数字看起来大,而是长文档、完整代码库、会议记录、研究材料都可以尽量一次放进去,不用切成很多碎片反复喂给模型。

Hy4 preview 支持文本输入和文本输出。腾讯这次明显把训练重点往四个方向倾斜:代码、办公分析、科研和游戏开发。

模型已经接入 WorkBuddy、CodeBuddy 国内版和国际版,以及元宝、ima。开发者也可以通过腾讯云 Tokenhub 和 OpenRouter 调用 API。

架构上,它吸收了不少开源路线里已经验证过的方案,包括大 MoE、稀疏注意力、Hyper-Connection 等。DeepSeek、GLM 这些模型走过的路,腾讯这次也挑了不少成熟方案拿来整合。

Hy4 preview 定价

套餐价格说明
按量付费(输入) 6 元 / 百万 tokens 标准 API 输入
按量付费(输出) 18 元 / 百万 tokens 模型生成内容
缓存命中(输入) 0.3 元 / 百万 tokens 重复上下文命中缓存后的价格

通过 WorkBuddy 或 CodeBuddy 使用,上线后有两周限时免费体验。Hy3 在这两个平台的免费期也延长到了 9 月 30 日。

Hy4 preview 暂时没有订阅制套餐。

单看输入 6 元、输出 18 元 / 百万 tokens,这个价格不算便宜,在开源模型里大致属于中游。比 DeepSeek V4 Pro 贵,但比 Kimi K3 和 Claude Opus 5 便宜。

真正有吸引力的是缓存。

重复上下文命中后,输入价格直接降到 0.3 元 / 百万 tokens。长对话、固定提示词、重复文档、持续运行的 Agent,这些任务一旦调用量起来,缓存成本差距会很明显。

Hy4 preview 主要功能

1. 1M 上下文,能塞进去,也能找出来

Hy4 preview 的上下文窗口从 Hy3 的 256K 提升到 1M,容量接近 4 倍。

这种升级对长文档和大型代码库最实用。

有媒体做过一次比较暴力的测试:把《三体》三部曲和一份年报一起放进模型,让它找出罗辑提到“黑暗森林”的相关段落,同时分析年报里的投资策略。

Hy4 preview 最后找出了 8 处相关内容,还能定位到具体章节。

这类测试比单纯写“支持 1M 上下文”更有参考价值。

因为真正重要的不是能不能塞进去,而是塞进去以后还能不能把东西找出来、继续分析。

2. Agent 和编程能力提升很大

Hy4 preview 这次变化最明显的地方,还是 Agent 和软件工程任务。

几个公开指标的提升很直观:

  • DeepSWE:28.0 → 64.3
  • Terminal Bench 2.1:70.8 → 85.4
  • Toolathlon-Verified:56.2 → 74.1

这些测试都不是普通问答。

模型需要自己理解任务、调用工具、读取结果,再决定下一步做什么。有些任务还要连续跑很多轮,对上下文跟踪和执行稳定性要求很高。

腾讯还找了 163 名专家,对 203 个真实工程任务做盲测。Hy4 preview 平均得分 2.99 / 4,略高于 Kimi K3 的 2.94 和 GLM 5.3 的 2.92。

单看差距不算夸张,但至少说明它在真实工程任务里不是只靠榜单数据撑场面。

3. 腾讯把训练重点压在四类任务上

Hy4 preview 这次的方向很明确。

  • 软件工程:加强长程开发、任务规划、调试和验证,前端生成也专门优化了视觉和交互质量。
  • 办公分析:覆盖复杂办公环境、金融分析、跨文件协作,从整理信息一直做到文档交付。
  • 游戏开发:一句需求就能生成可玩的原型,还可以继续通过多轮交互往下改。
  • 科学研究:加强 AI 研发、分子动力学、凝聚态物理、基础数学等方向的推理和求解。

这四类任务有个共同点:都不是问一句答一句。

它们更像真正的工作,需要模型持续理解、执行、修正,再继续下一步。

4. 从 Hy3 到 Hy4 preview,升级不只是参数

和 Hy3 相比,Hy4 preview 的规模确实大了一圈。但这次真正有意思的,不只是参数变大。

第一,Hy4 preview 开始参与自己的研发。

按照腾讯公布的信息,它会自己提出优化方案、跑实验,再根据实验结果继续调整。过程中产生的代码、日志和反馈,会进入下一轮探索。

这已经不是单纯“人训练模型”了,而是模型开始帮着一起做模型研发。

第二,它还参与了推理系统优化。

Hy4 preview 自主分析了推理系统的性能瓶颈,针对算子融合和通信做优化,最后让端到端吞吐量相比基线提升了 31.8%。

这点比“参数又涨了多少”更有意思。

因为它不只是被优化的对象,也开始参与优化自己的训练和推理流程。

总结

优势

Hy4 preview 最有价值的地方,就是“生产力”这个方向做得够集中。

1M 上下文、Agent、编程、办公分析都不是为了凑功能,而是明显围绕真实工作流来做。

缓存价格也很有竞争力。只要业务里有大量重复上下文,0.3 元 / 百万 tokens 会比标准输入价格省很多。

限制

Hy4 preview 还是 preview 版本,稳定性肯定要继续看。

它暂时还是纯文本定位,没有明确的多模态能力。涉及图片、视频、复杂视觉文档的任务,它就没那么合适。

价格也不是最低档。和同类开源模型比,它走的是性能、上下文和成本之间的中间路线。

推荐人群

比较适合真准备把模型接进业务里的开发者和技术团队。

长文档、代码开发、Agent、办公自动化,或者业务里本身就有大量重复上下文,这几类场景最适合拿 Hy4 preview 去实测。

两周免费期也够用了。别看榜单,直接拿自己的任务跑一遍,最容易判断它值不值得用。

不推荐人群

如果你追求的是数学、复杂逻辑这类任务的极限推理能力,Hy4 preview 未必是第一选择。

如果业务要求完全本地部署、不依赖云端 API,也要重新算一遍 GPU、显存和运维成本,不能只看模型已经开源。

评论(0)

发表评论

Advertisement 728 × 90

Tencent 模型对比

模型 上下文 定价 API 发布 全球热度
Hy4 preview
1M $0.834 / $2.501 per 1M YES 2026-08
262K $0.140 / $0.580 per 1M YES 2026-07
59/100

类似模型

关联工具