你的 AI Agent 工具调用到底准不准?多数团队只盯一个数字:任务成功率。这个指标几乎没用。OpenRouter 最近发布的教程直接点破——一次失败的调用里藏着两类完全不同的病,混在一起测,等于什么都没测。
第一类叫工具选择错误:模型压根没挑对函数,该查订单的去发了邮件。根因通常不在模型本身,而在工具描述边界模糊、工具数量堆得太多、命名彼此相似。第二类叫参数错误:函数挑对了,槽位填歪了——日期格式不对、枚举值瞎编、必填项漏填。这多半是 JSON Schema 约束不清、字段缺少示例。把这两类拆开统计,你才知道该动提示词里的工具说明,还是该动参数结构,而不是笼统地"再调调模型"。
做法其实不复杂。准备一批带标准答案的用例,每个用例写明期望调用的工具和期望参数,跑完分别算工具选择准确率和参数准确率。如果选择准确率高、参数准确率低,就别再折腾工具列表了,去补 Schema 和示例;反过来,先精简工具再谈参数。两个数字分开看,优化方向会自己浮出来——这也是这套评测方法真正的价值所在。

