一项分数装不下所有问题
斯坦福 CRFM 的 HELM 研究于 2022 年提出综合语言模型评估框架,在统一条件下考察多种场景和指标。核心指标包括准确性、校准、鲁棒性、公平性、偏差、毒性与效率。不同目标可能存在权衡,只看准确率容易漏掉其他问题。这里引用的是方法,不是今天的模型排名。我会先看评估覆盖了什么,再决定那个分数和眼前的任务到底有没有关系。
给摘要助手出几道不好糊弄的题
这是我的假想测试:一个小助手负责把会议文字稿变成待办。先选一组经授权的样本,标注应提取的任务、负责人和期限。然后盯住几种错误:凭空增加承诺、漏掉否定句、把“下周再讨论”写成“下周必须完成”。最后一种,句子只差一点,意思却变了。把每类错误记录清楚,之后修改提示或流程,才知道改善的是哪里。
最好看的一次,不够
我建议一起保存测试日期、输入、系统配置和评分规则,留出未用于调试的样本。输出会波动,就重复测试,把波动写出来,不只展示最好的一次。那些错得有意思的结果,我倒不舍得直接删掉,会旁注一句“这里为什么会这样”,留着复查。小测试集能帮助发现问题,但覆盖不了所有场景。结果里应该说明哪些任务没测,哪些判断仍需人工复核。我喜欢这种不太漂亮、但能继续检查的记录:哪里有进步,哪里还不稳,一眼看得出来。读者也不用猜我们省略了什么。