模型评测这些年内卷成什么样了?你打开任何一个榜单,看到的全是接近天花板但又毫无意义的数字。Simon Willison 显然也受够了。他联合 Prime Radiant 实验室扔出来的 smevals,几乎是在向整个行业喊话:别再看那些精心粉饰的通用基准了,自己动手,用你的业务场景去拷问模型。
这东西没有花哨的控制台,没有实时滚动的积分榜。它就是一份 YAML 配置、几行命令,加上一套干净到极致的运行与打分分离机制。而它最狠的地方在于,把“写 eval”这件事交给了编码代理。这等于说,你只要说清楚想考模型什么,代理帮你出题。
三次迭代才扔出来的答案
这不是 Willison 第一次在评测这件事上较劲。他的前两次尝试被不少开发者收藏、魔改,但一直没摆脱一个尴尬:配置麻烦,跑起来慢,出结果之后你还得手动拼报告。smevals 几乎是冲着这些痛点反复打磨的第三次重构。
第一次用脚本,第二次用插件,这一次直接用 uvx
过去你得先搭环境,再配依赖,甚至要手动对齐不同模型的 API 格式。smevals 的做法粗暴得可爱:uvx smevals run,一条命令拉起一切。uvx 负责临时隔离环境,不需要你污染全局 Python 包。gpt-5.5、claude-opus-4.6 之类的新模型,改个配置就能跑。这种“拿来即用”的思路,让评测从“今天先搭环境,明天再跑”变成“聊完需求直接出分”。
跑分和打分必须分离
绝大多数评测工具边跑模型边打分,表面看省时间,实则把两个完全不同的逻辑搅在一起。模型调用昂贵,不稳定,偶尔还会超时。打分逻辑却需要绝对稳定和可审计。smevals 把“运行”拆成独立的执行阶段,输出原始交互记录;之后单独执行打分,可以反复复盘、重打分而不用重新烧钱调用模型。这种设计对于需要审计评测过程的企业团队来说,直接甩开那些黑盒评分数条街。
你拿到的不再是一堆数字,而是一个可分享的 HTML 报告
更妙的是最终产物:静态 HTML 报告。没有需要登录才能看的仪表盘,没有因后端下线就消失的数据。你可以把报告扔进任何静态服务器,甚至直接邮件发给决策者。Willison 自己常年用静态站点说话,这份报告的风格延续了他一贯的偏好——信息密度极高,无废话,一眼看清模型在哪些任务上掉链子。
让编码代理去写 eval 吧,你只负责审题
smevals 有一个预设,现在听起来已经很自然了:大部分评估用例的编写可以外包给编码代理。你只需用自然语言描述评估目标和打分维度,代理生成对应的 Python 评测脚本。听起来简单,但这是第一次有人把“代理写评测”集成进一个如此轻量的框架里,而不是作为一个需要额外配置的插件。
一个 YAML 文件,决定你对决的模型阵容
所有配置挤在一个 YAML 里:模型列表、评测套件路径、打分规则、输出目录。这种极简配置的底气来自对模版主义的彻底放弃。它不预设你该用什么维度衡量模型好坏。你想比代码正确性、想比回复结构、想比是否触发了你的内部安全红线,全部通过自定义打分实现。
从通用榜单到业务评测,有时候就差一个下午
多数团队对“自建基准”敬而远之,原因无他:太耗人。smevals 尝试把这项成本压缩到一个下午。你召集团队列出一批最容易踩坑的真实查询,用编码代理生成初版 eval,然后再花一小时人工微调。接下来让 uvx 把所有候选模型跑一遍,报告自动生成。通用榜单这时候沦为背景板,你手里那份按业务压力测试出来的成绩单才是采购模型的决策依据。
轻量级的背后不是简陋,是对症下药
千万不要把 smevals 的“轻量”误解成玩具。它主动削掉的不只是依赖,还是一整套不必要的复杂性。没有服务端,没有数据库,没有实时流。这种设计哲学在当今动不动就要求 Kubernetes 集群的评测工具里,简直反潮流得清新。
没有服务器撑腰,只有可靠的文件机制
运行过程中所有中间结果落到本地文件,打分器读取文件干活。即便中途网络断了,已经跑完的模型交互不会丢失。恢复时不用从头再来,只需继续未完成的任务。对于模型调用成本动辄上百美元的大规模横向测试,这个能力相当于直接替你省下一笔可观的云计算账单。
花哨的功能砍掉,留下的是可复现
smevals 刻意不去做那些“看起来很酷”的可视化调试功能,而是死守在可复现这一件事上。只要配置文件和评测用例不变,任何人、任何时间都能跑出同一份成绩。这对于内部决策、供应商对比甚至论文引证,都是不可替代的信任基础。那些数值飘忽不定的在线榜单,在可复现面前不值一提。
落地这件事,smevals 替你跨过了最难的那道坎
很多评测工具死在最后一公里:你辛辛苦苦出了分,却没法向团队解释分数是怎么来的,也不知道下一步该优化什么。smevals 用天然的分阶段执行和原始聊天记录保留,把评测结果变成了可追溯的决策材料。
每一次打分,都能回查原始对话
报告里每一项得分都可以点进去看到对应的模型完整回复。不是截断的片段,是完整的消息流。这意味着评测不再是一个人按头认可的数字游戏。任何一个持不同意见的同事,都可以翻开原始交互,和你争论打分是否公允。决策的透明度一下子拉满。
把你从调参地狱里拉出来
使用 smevals 你不太容易陷入“调 prompt 一周跑分三分钟”的怪圈。因为框架本身不偏向任何 prompt 工程策略,它只是忠实地执行你定义的评测。如果你连续三次迭代都发现模型在某个业务场景下无药可救,就别再折腾 prompt 了,可能该换个模型。这种清晰的归因能力,比任何调参秘籍都实用。
Willison 这次交付的,显然不是一个要征服所有人的平台,而是一把锋利的手术刀。它切开的,是模型选择中那些看似复杂实则拖沓的流程。下次有人再扔给你一份 LLM 排行榜,你可以反问一句:咱们拿自己的业务跑过 smevals 了吗?

