1. 专业领域翻译
30B-A3B 对金融、法律、政治、教育等 8 个专业领域做了优化。
DomainMTBench 中,它的金融领域 XCOMET 得分是 97.08,法律领域是 89.15。
专业翻译真正让人头疼的,往往不是某句话完全翻错。
更常见的是另一种情况:一份十几页的技术文档,前五页把某个术语翻成 A,翻到后面突然变成 B;或者法律长句每个词都认识,组合起来却把原来的逻辑层级拆散了。
这种问题看单句很难发现,放进完整文档里就很扎眼。
所以专业翻译里,我会更看重术语稳定性和长文本的一致性。30B-A3B 的优势也更适合放在这个维度上看。
2. 指令遵循
Hy-MT2 这一代比 Hy-MT1.5 更“听指令”。
可以直接告诉它:
“翻译结果简洁精炼,每句不超过 15 个字。”
也可以提前放入术语表,规定某个词只能使用指定译法。
真正做项目时,要求通常不会只有一条。
格式别动,标点保留,字段名不能翻,产品名固定,语气统一,有些内容还要控制长度。
一条一条看都不复杂,叠在一起之后,很多模型就开始漏。
Hy-MT2 专门加强了这部分。腾讯也做了 IFMTBench 来测试复杂翻译指令,30B-A3B 的得分是 84.69。
这类数据我反而比单纯的“译文更流畅”更愿意看,因为它直接关系到模型能不能进正式工作流。
3. 真实业务场景表现
30B-A3B 在 WildMTBench 上的 GEMBA 得分是 89.87,高于 Gemini 3.1 Pro。
WildMTBench 更接近真实翻译环境,文本不像标准 benchmark 那么干净规整。
这一项挺容易被忽略,但我觉得很有参考价值。
真正拿到手里的资料,很少长得像考试题。技术文档会混着缩写、表格字段和半截英文,商业材料里有行业黑话,合同又是一长串嵌套句。
这种东西才最考验翻译模型。
标准测试跑得漂亮是一回事,放进这种杂乱文本里还能稳住,是另一回事。30B-A3B 在 WildMTBench 上的成绩,至少说明它不是只擅长做 benchmark。
4. 相比 Hy-MT1.5 的进化
从 Hy-MT1.5 到 Hy-MT2,最容易感知的还是指令遵循。
前代碰到多个要求同时出现,更容易顾此失彼。Hy-MT2 对术语、格式、长度和风格这些限制处理得更稳。
少数民族语言翻译也有提升。
在中国大陆少数民族语言相关测试中,包括藏语、维吾尔语和蒙古语,30B-A3B 的 XCOMET 得分达到 62.44,高于 Gemini 3.1 Pro。
Hy-MT2 这一代还把低比特量化做得很激进。
这项能力和 30B-A3B 的直接关系没那么大,它本身还是更适合服务器和云端。但同系列的 1.8B 已经能压到约 440MB,在手机端本地跑翻译。
一个系列里,大模型往专业能力走,小模型往端侧走,产品路线其实划得挺清楚。
评论(0)