阿里公布过一个很受关注的软件工程测试。
Qwen3.8-Max 连续运行了 16 天,从零开始开发一个可以自我改进的 Agent 框架。
这16天里,它不是简单地不停生成代码,而是在反复做一套完整流程:
写代码、运行测试、看结果、发现问题,再继续修改。
这件事其实比单次写出一段好代码难得多。
现在会写代码的大模型很多,但任务一旦拖得很长,模型就容易开始跑偏。
前面定好的目标可能忘了,修了一个 Bug 又带出新的 Bug,文件越来越多以后,整个项目也越来越难管理。
所以“16天”真正值得关注的,不是这个数字有多夸张,而是模型在这么长的任务里还能不能继续往前做。
当然,这仍然是阿里官方公布的一次测试,不能直接理解成任何软件项目交给它以后,都可以16天完全不用人管。
真实项目里还会碰到开发环境、权限、依赖、第三方 API、部署和团队协作等问题。
除了编程,Qwen3.8-Max 还强化了长上下文、多模态和工具调用能力。
云端版最高支持 100 万 Token 上下文,可以一次处理非常多的资料。
开放权重版 Qwen3.8-2.4T-A95B 原生支持大约 26万 Token,也可以进一步扩展到约100万 Token。
不过两个版本不能完全混着看。
Qwen3.8-Max 云端版可以处理文本、图片和视频;开放权重的 Qwen3.8-2.4T-A95B 目前主要是纯文本模型。
开放版还有一个特点:默认必须使用思考模式,更适合复杂任务,但拿来做特别简单的问答就显得有点重。


评论(0)