1. 日语不是“翻译通顺”就结束了
Kimi K2.6 本身已经能处理日语,Namazu 如果只是把句子润得更顺,其实没多少吸引力。
Sakana 调的还有商务措辞、敬语,以及政治和历史敏感话题里的表达分寸。
官方用 FairPoliticsQA 测过模型回答政治、历史敏感问题时的中立性。Kimi K2.6 基座得分 34.10%,Namazu 是 56.30%。
这个数字别看得太重。测试是 Sakana 自己做的,一个中立性基准也代表不了完整的日语能力。它更适合拿来判断训练方向:Sakana 动的不只是语法和词汇,还有回答方式。
普通聊天里可能感觉不大。换成客户邮件、客服回复、品牌内容或者正式商务文本,这类差异才更值得看。
2. 搜索和代码不用自己再拼一层
Namazu 内置网络搜索和代码执行。
查实时资料时可以自己搜,碰到计算、数据处理或者代码验证,也能直接调用代码环境。一个任务里来回调用几次都可以,不需要人工把每个步骤拆开。
拿市场调研来说,以前常见的做法是先让模型列关键词,人去搜,再把结果贴回来继续跑。Namazu 把这一串动作接起来了。
没什么神秘的,也不是新发明。好处就是少搭一点东西,尤其做调研类 Agent 时会省事不少。
3. 价格没因为“日语增强”再加一层
Namazu 用 OpenAI 兼容接口,对已有项目很友好,不需要专门为它重写调用层。
价格也很直白:输入 $0.95 / 1M tokens,输出 $4.00 / 1M tokens,和 Kimi K2.6 保持一致。
我反而比较看重这一点。日语后训练做了,价格没跟着涨。
原本在 Kimi K2.6 和同价位模型之间摇摆、又刚好要做日本市场的,Namazu 就是那个不用纠结太久的选择。先跑同一批日语任务,比盯着参数表有用。
4. 上一代还像研究项目,这次已经能接业务了
Sakana 早期也做过类似实验,用 DeepSeek、Llama 等基座测试日语适配和回答中立性。
那批东西研究味比较重。Namazu 的区别很现实:基座换成 Kimi K2.6,搜索和代码执行直接塞进 API,开发者拿到之后就能接。
不用下载权重,不用自己部署推理服务,也少搭一层工具系统。
换句话说,前面的实验在验证这条路能不能走,Namazu 已经开始卖车票了。
评论(0)