别急着吹牛。你的智能体可能连入门线都没摸到。StartupBench——一个从真实AI初创公司产品工作流里提炼出来的端到端智能体基准——抛出了一组让人不安的数据:即便在统一智能体框架下,目前最强的模型也只能完成大约30%的任务。不是90%,不是70%,是30%。这个数字撕开了一道口子,让所有人看清楚:我们引以为傲的Agent能力,在面对真实用户任务时,远没有想象中那么能打。
一道让大模型集体翻车的真实考题
过去几年,智能体基准并不少。但绝大多数都有一个致命的共同点:任务由研究者自己设计。研究者坐在实验室里,想象用户会遇到什么问题,然后把这些问题变成测试集。这就像闭卷考试由教练自己出题,答案早就刻在出题人的脑子里。StartupBench的聪明之处在于,它把出题权还给了市场。
使命的分野:研究者自娱自乐还是市场验证产品
StartupBench的题目全部来自有真实用户采纳的AI初创公司产品工作流。什么叫“有真实用户采纳”?就是这些产品已经上线、有人付费、有人天天在用。这意味着每一条任务不是凭空捏造的“伪需求”,而是被市场和用户验证过的“真流程”。当你在这样的数据集上测试智能体,考的不是模型记住了多少题库,而是它能否在真实操作链路里把活儿干完。
这个差异是根本性的。研究者自选任务的结果再好,也只能证明模型在研究者设定的轨道里跑得顺。可一旦把模型丢进真实世界的复杂流程里,比如让它在十几个交互步骤里理解用户意图、记住上下文、调用合适工具、处理意外输入——现有的Agent立刻就露出了马脚。StartupBench做的,就是把这块遮羞布狠狠扯了下来。
30%的完成率:智能体的能力分水岭
我们得正视这组数字的分量。在统一智能体框架下,最强的模型也只完成约30%的任务。这是评估团队在端到端场景里、以完整任务为单位计算的结果。它不以“某一步回答正确”计分,而是以“整个任务是否跑通”论英雄。
为什么端到端这么难?因为真实任务不是单轮问答,而是一条完整链路。一步出错,全盘崩塌。30%的完成率意味着,即便最强模型,也扛不住真实用户环境下三分之二以上的复杂任务。这不是模型“差一点点”,这是系统性塌方。
失灵背后的两大元凶
如果说30%的完成率是表面症状,那么真正的病灶在哪里?StartupBench的失败分析指向了两位头号元凶:复杂指令遵循和领域专业知识。这两点看起来是老生常谈,但在端到端场景里,它们的杀伤力被放大了不止一个量级。
复杂指令遵循:不是听懂了,而是走着走着就忘了
很多模型在单轮指令测试里表现优异,你让它“写一封邮件”,它写得漂亮;让它“总结这份文档”,它归纳得清楚。但真实任务从来不是单指令。用户会说:“把这个Excel里的数据整理成报告,按季度分组,对比去年同期表现,然后发给销售总监,记得抄送财务,最好再附上图表。”这就完了吗?没有。中途用户可能还会追加条件:“哦对了,去年数据在第4个文件夹里,别用旧版。”
复杂指令遵循考验的不是模型听不听得懂,而是它能不能在长链路里保持方向感。StartupBench暴露出来的残酷现实是:模型做着做着就迷失了。它可能记得第一步要干什么,却在第五步时忘了最初的约束条件;也可能执行到中途,把用户“只统计线上渠道”的要求替换成了“全渠道统计”。这种失忆不是偶然bug,而是当前大模型的系统性问题。指令越长,条件越多,遵循度就断崖式下跌。
领域专业知识的悬挂:没有行业常识的Agent寸步难行
另一个失败来源更扎心:领域专业知识。通用大模型什么都懂一点,但什么都懂的代价就是什么都不精。StartupBench从AI初创公司的产品工作流里提炼任务,意味着这些任务本身就带有强烈的业务属性和垂直领域知识。
你要智能体帮你完成一个HR科技产品的候选人筛选流程,它需要的不只是“读懂简历”这种通用能力,还涉及对招聘行业规则的理解、对岗位职责与候选人技能的隐性匹配逻辑的把握。如果你让一个擅长写诗的大模型去做这件事,它的表现和让它解微积分没什么两样。
更麻烦的是,领域专业知识无法靠通用训练语料全覆盖。很多行业知识以隐性方式存在于老员工的脑子里,或者散落在小圈子的专业社区里。模型没学过,就是不会。StartupBench明确告诉我们:在真实世界里,通用智能体最缺的恰恰是那一层与行业深度绑定的“临门一脚”知识。
StartupBench的独特坐标:为什么它不只是一项评测
一个基准的价值,不在于它给出了什么分数,而在于它改变了什么视角。StartupBench真正意义上的贡献,是把评估焦点从“榜单得分”硬生生拉回到“端到端交付能力”上。这不是一个技术微调,这是一次评价体系的换轨。
从研究者自选任务到真实世界工作流
传统的基准测试,本质上是一场开卷考试。研究者划定范围,模型在这个范围内作答。但StartupBench把考场搬到了真实战场上。它从有真实用户的产品里抓取工作流,这些工作流不以测试模型的意愿为转移,它们就是现实世界每天都在发生的操作。用户在软件里点击、输入、等待、检查、修改——这些看似琐碎的操作,构成了智能体必须面对的真实任务集。
这种“从市场中来、到市场中去”的构建路径,让StartupBench在基准圈子里显得格外另类。它不关心研究者是否觉得任务合理,只关心真实用户是否真的这么干。如果有人质疑任务太难、太偏,StartupBench的回应很简单:用户就是这么做事的。
闭环能力的直接度量:跑不通,一切白搭
端到端评测的价值在于,它把“能力”重新定义为“闭环”。过去我们说一个模型强,往往是在某一个环节强。比如检索准确、生成流畅、理解到位。但StartupBench用整条工作流来拷问模型:你能否从一个原始用户指令出发,自己拆解步骤、调用合适的工具、处理中途出现的变量、最终提交一个可交付的成果?
它的计分逻辑很冷酷——不跑通,就不算分。这种“完型填空”式评测方式对Agent提出了极致要求:不仅会做每一步,还要能把每一步串联成一个可验收的整体。这种能力在消费级聊天场景里可有可无,但在真实的工作场景里,它就是智能体的命值。
当基准开始说人话:行业格局的连锁反应
一个足够扎实的基准,从来不会默默影响一两个团队。它一旦建立起来,就会啃噬整个研发链条。StartupBench给出的可复现结果——约30%的完成率——正在给整个行业传递一个信号:你们之前吹那么多,真正能干活的版本在哪里?
从躺在榜单上到下场解决问题
一些团队已经开始把注意力从“刷分”转移到“补短板”上。这是一个重要的转向。以往的Agent竞赛,大家比拼的是谁在测试集上先过90%。但StartupBench用一条真实产品工作流告诉你:测试集过了90%又怎样?你在真实任务里还是只能干成三成。
这种落差会让理性的人重新分配资源。与其优化PPT指标,不如去啃“复杂指令遵循”和“领域知识注入”这些硬骨头。新基准的价值,就在于它让这些被淡化的系统性问题重新回到聚光灯下。
开源基准的漩涡效应:一切才刚刚开始
StartupBench选择了开源。这一点很关键。公开发布的基准,意味着所有人拿到的都是同一张考卷,同一套评分规则。任何团队都可以跑自己的模型,复现结果,找出差距。
可以预见,接下来的几个月,会有更多实验室公开自己的StartupBench分数。那些在30%及格线附近挣扎的模型会被反复拷问:你能不能跨过40%?50%?有没有可能逼近70%?这种竞争是有利的——它把行业的注意力从“我能生成多美的文案”拉向“我能不能在真实用户任务里当一个靠谱的执行者”。
当然,这个基准本身也在进化。它从初创公司产品里提炼工作流,这是第一步。未来,随着更多产品形态和任务类型的加入,StartupBench的覆盖面和判卷标准会越来越接近真实的终极考试——那不是实验室里的幻境,而是市场、用户、商业价值同时在场的一次大考。
智能体的下一个战场,不在SOTA的榜单上,而在真实用户的工作流里。StartupBench只是递过来一面镜子。至于镜子里的你,是继续躲在舒适区里吹嘘全能,还是面对那30%的缺口老老实实补课——这个选择,比任何算法更新都快一步抵达未来。

