1. 1M 上下文,能塞进去,也能找出来
Hy4 preview 的上下文窗口从 Hy3 的 256K 提升到 1M,容量接近 4 倍。
这种升级对长文档和大型代码库最实用。
有媒体做过一次比较暴力的测试:把《三体》三部曲和一份年报一起放进模型,让它找出罗辑提到“黑暗森林”的相关段落,同时分析年报里的投资策略。
Hy4 preview 最后找出了 8 处相关内容,还能定位到具体章节。
这类测试比单纯写“支持 1M 上下文”更有参考价值。
因为真正重要的不是能不能塞进去,而是塞进去以后还能不能把东西找出来、继续分析。
2. Agent 和编程能力提升很大
Hy4 preview 这次变化最明显的地方,还是 Agent 和软件工程任务。
几个公开指标的提升很直观:
- DeepSWE:28.0 → 64.3
- Terminal Bench 2.1:70.8 → 85.4
- Toolathlon-Verified:56.2 → 74.1
这些测试都不是普通问答。
模型需要自己理解任务、调用工具、读取结果,再决定下一步做什么。有些任务还要连续跑很多轮,对上下文跟踪和执行稳定性要求很高。
腾讯还找了 163 名专家,对 203 个真实工程任务做盲测。Hy4 preview 平均得分 2.99 / 4,略高于 Kimi K3 的 2.94 和 GLM 5.3 的 2.92。
单看差距不算夸张,但至少说明它在真实工程任务里不是只靠榜单数据撑场面。
3. 腾讯把训练重点压在四类任务上
Hy4 preview 这次的方向很明确。
- 软件工程:加强长程开发、任务规划、调试和验证,前端生成也专门优化了视觉和交互质量。
- 办公分析:覆盖复杂办公环境、金融分析、跨文件协作,从整理信息一直做到文档交付。
- 游戏开发:一句需求就能生成可玩的原型,还可以继续通过多轮交互往下改。
- 科学研究:加强 AI 研发、分子动力学、凝聚态物理、基础数学等方向的推理和求解。
这四类任务有个共同点:都不是问一句答一句。
它们更像真正的工作,需要模型持续理解、执行、修正,再继续下一步。
4. 从 Hy3 到 Hy4 preview,升级不只是参数
和 Hy3 相比,Hy4 preview 的规模确实大了一圈。但这次真正有意思的,不只是参数变大。
第一,Hy4 preview 开始参与自己的研发。
按照腾讯公布的信息,它会自己提出优化方案、跑实验,再根据实验结果继续调整。过程中产生的代码、日志和反馈,会进入下一轮探索。
这已经不是单纯“人训练模型”了,而是模型开始帮着一起做模型研发。
第二,它还参与了推理系统优化。
Hy4 preview 自主分析了推理系统的性能瓶颈,针对算子融合和通信做优化,最后让端到端吞吐量相比基线提升了 31.8%。
这点比“参数又涨了多少”更有意思。
因为它不只是被优化的对象,也开始参与优化自己的训练和推理流程。
评论(0)