近日,清华大学与微信团队发布了一项名为DynamicRubric的研究,并将这套方法用在了微信搜一搜的AI问答中。
这项研究盯住了大模型训练里一个容易被忽略的问题:模型越来越强,给模型打分的标准却可能还停在原地。
大模型训练时,通常会一次生成多个答案,再由评分系统判断哪个更好。模型根据这些结果不断调整。可当几个答案都写得不错,差距只剩下一些细节时,固定的评分标准往往就不够用了。有些答案看上去没错,但没有真正回答用户的问题;有些信息很多,读起来却不够顺。
DynamicRubric的变化就在这里。它不会一直拿着同一张“评分表”,而是根据不同问题和候选答案,重新确定评价重点。遇到知识类问题,更看重准确和完整;遇到解释类问题,还会关注表达是否清楚、有没有绕弯子。
这有点像老师给学生出题。学生基础还不扎实时,先看答案对不对;等水平提高后,就会进一步看思路是否清晰、细节是否严谨。评分标准变细了,模型才知道自己还能往哪里改。
论文显示,研究团队使用80亿参数模型进行测试后,DynamicRubric在多项答案比较任务中表现不错。采用这套方法训练的模型,在开放问答、数学、编程和科学知识等任务上也有所提升。
经过优化的模型已经上线微信搜一搜AI问答,每天处理数千万次请求。论文提到,新模型上线后,搜索量、用户使用时长和正向互动等指标有所改善,并已经替代原有模型承接线上流量。具体数据没有公开。
对普通用户来说,这项变化不会变成一个显眼的新功能。大家更可能在使用时慢慢察觉:有些回答更贴近问题了,内容也更顺一些,少一点答非所问,多一点真正有用的信息。
DynamicRubric并不是给大模型找到了一条捷径。它更像是在提醒行业,模型进步之后,评价模型的方法也不能停下来。只有“老师”不断提高要求,“学生”才有继续进步的空间。