小红书 AllSpark 团队把 Iris 的权重和评测代码一起放了出来。没有预热,没有"敬请期待",一个 Search Agent 模型就这么摊在开源社区面前。真正的看点不在参数规模,而在于它同时交出了三样东西:数据怎么造、SFT 和 RL 怎么接、评测怎么做。做过智能体的人心里都清楚,这三样里只要藏着一样,别人复现就是空谈。
内容平台养一个搜索智能体,图什么
搜索框里长出来的,已经不是排序问题
传统搜索是个排序任务:给你一个 query,返回一列文档,好坏的评判标准是相关性。搜索智能体完全是另一回事——它要决定搜不搜、搜什么、搜几次、什么时候收手。这中间夹着多跳推理、工具调用、上下文裁剪,每一步都可能出错,而且错误会累积。小红书的场景恰好把这种能力逼了出来:社区里大量 query 是"XX 怎么选""求推荐",答案散在十几篇笔记里,需要跨篇聚合、比对、筛掉软广。单篇笔记解决不了的事,才是智能体的活。
AllSpark 在内部是个什么位置
AllSpark 是小红书的大模型团队,dots.llm 是他们对外讲话的口子。内容公司做模型,外界的第一反应往往是"又一个跟风的"。这个判断放在两年前也许成立,现在不成立了。推荐系统和搜索智能体共享同一套底层能力——猜意图、召回候选、重排结果,区别在于智能体的动作空间大得多,它能在搜索中途改主意。这种从推荐栈里长出来的经验,是纯模型团队花钱也买不到的。
权重公开,标准也就一起交出去了
开源权重和评测代码,本质上是把裁判权让出去。谁都能拿 Iris 跑一遍自己的 case,好坏立马见分晓。敢这么做,通常源于一个冷静的判断:真正值钱的壁垒在数据和场景,不在那几百 G 的权重文件。小红书手里握着场景,权重给别人不心疼;反过来,别人拿权重去别的场景里跑,也跑不出小红书的护城河。这笔账算得很清楚。
把训练链路拆开看,脏活都在细节里
轨迹数据:难的不是采,是筛
搜索智能体的训练数据不是问答对。一条完整轨迹里塞着:用户问题、模型思考、生成的 search query、返回的页面、再思考、再搜索、最终答案。链条一长,噪声就有了藏身之处。最典型的一种污染是搜索结果里混进不相关页面,模型学到的不是"忽略噪声",而是"硬着头皮作答"。所以数据构造的核心工序是过滤和标注——标出哪条轨迹是好的,好在哪一步,坏在哪个动作。这部分工作量,业内普遍承认占了整个训练周期的一大半。
冷启动 SFT:先教格式,再教刹车
监督微调阶段要干的事,是把"思考—搜索—整合"这套动作模式刻进模型。这一步门槛不高,做坏却很容易。常见的坏法是模型学会了搜索的姿态,却没学会判断:一次搜索足够的问题非要搜五轮,或者刚拿到结果就急着下结论。真正有效的 SFT 数据里必须塞进反例——让模型见过"这里不该搜""现在该停"长什么样。只喂最优解,模型学不会边界。
RL 阶段最棘手的问题:奖励打哪儿来
搜索引擎本身是动态的。同一个 query 今天和明天返回的结果可能不一样,这对强化学习几乎是灾难——同一动作两次采样,reward 对不上。业内的通行解法是把奖励拆开:答案的正确性交给可验证的判官或规则去判,格式合规单独给分,工具调用的合理性再加一项。拆得越细,信号越稳;但拼起来的奖励函数也越容易被模型找到缝隙。它会精准地学会怎么拿分,而不是学会怎么把问题解决好。这道题目前没有完美答案。
评测是脏活,也是真正的分水岭
统一评测到底在统一什么
搜索智能体的评测长期处于混沌状态。各家自建数据集,自定评价标准,最后拿出来的分数根本没法横向比。所谓统一评测,要统一的是三件事:任务定义(什么算成功)、工具接口(搜索返回的格式是否一致)、以及失败判定(搜不到、搜错、答非所问要不要分开算)。这三条只要有一条不对齐,榜单上的排名就没有意义。Iris 把评测代码一起开源,真正解决的其实是这个信任问题。
端到端评测里的隐形成本
跑一次端到端评测远比跑一次静态 benchmark 贵。每个样本都要真实发起搜索请求,涉及网络延迟、接口限流、结果漂移。样本量上千之后,评测本身成了一套需要运维的工程系统。很多团队在训练上舍得投入,到评测环节就草草了事,用几百条样本得出一个漂亮结论。这种分数放进论文没问题,拿去做产品决策会出事。
这套东西能搬走多少
中小团队的机会窗口确实打开了
权重有了,评测代码有了,剩下的工作是把数据配方复刻出来——按官方说法,数据与训练配方会陆续公布。对没有资源从头训练底座模型的团队来说,这等于跳过最烧钱的一段。可以直接在 Iris 上做领域适配:法律检索、医疗文献、内部知识库。搜索智能体的通用能力加上垂直领域的数据,往往比从零训一个通用模型更快见到效果。
下一个瓶颈大概率不在模型
模型能力还在涨,工具生态却跟不上。搜索接口的质量参差不齐,返回内容的噪声率、时效性、结构化程度都直接影响最终效果。智能体再聪明,喂给它一堆软广和过时页面,也只能输出一堆像模像样的废话。真正决定搜索智能体上限的,很可能不是下一次训练配方公开,而是整个网页内容生态能不能被更干净地读取。这一环,目前还看不到解法。

