小红书技术把 dots3-note Preview 放到了开源社区。总参数 280B,激活参数只有 16B,上下文拉到 512K,文本、视觉、语音一起上。这一连串数字里,最值得注意的不是“大”,而是“轻”。复杂推理和长程 Agent 任务才是这次发布真正指向的地方。开源模型打到这个程度,已经不是在刷参数榜了。
这套参数组合,不像表面那么轻
280B总参、16B激活,MoE的账本怎么算
很多人看到 280B 总参数会先愣一下,再看到 16B 激活参数又会松口气。这种差距本身就是 MoE 架构 的典型特征。总参数意味着模型的知识池有多大,激活参数意味着每次实际干活的参数有多少。16B 的激活规模放到今天的模型市场里不算激进,但它把推理成本压到了一个相对可接受的范围。对开源社区来说,这个数字比单纯的跑分重要。很多人只盯着能力上限,忽略了部署门槛。小红书技术这次很坦白:给的是一个预览版,不是那种只能看不能跑的巨兽。16B 激活带来的单卡可行性,才是个人开发者和中小团队真正关心的事。你可以把它当作一个能塞进现有推理框架里的东西,而不是又一台显卡熔炉。
512K上下文,是能力边界还是一次押注
512K 上下文已经能装下很多长文档、长对话甚至一部分代码仓库。但上下文长度从来不是简单的内存参数。它考验的是模型在长序列里保持注意力、不丢失线索、不被噪声带偏的能力。很多模型宣称超长上下文,实际在中间段位置的信息召回率掉得很惨。dots3-note Preview 把 512K 作为默认能力放出来,至少说明团队在长程注意力上做了针对性处理。否则开个超长窗口却找不回关键信息,反而会砸招牌。长程 Agent 任务里尤其如此:一个任务执行几十步、上百步,早期观察、用户指令、中间结果全都要同时放在上下文里。窗口不是一个卖点,是任务能不能跑完的物理边界。开源之后,社区一定会拿“大海捞针”和长文档问答去测。这一关过了,512K 才从参数变成价值。
多模态理解,不是把三种模态塞进一个模型
语音与视觉为何必须与文本同池训练
过去做多模态,很多团队走的是拼接路线:文本框一个模型,视觉编码器一个模型,语音再挂一个,最后靠接口缝起来。这个思路快,但脆弱。跨模态的对齐误差会一路传导到推理层。dots3-note Preview 直接把文本、视觉、语音放进同一个模型里做理解,意义不在功能叠加,而在让不同模态的证据能在同一套参数里互相校正。比如一个任务里既有截图、又有语音指令、还有文字日志,模型不能把三者分开处理后拼结论。它需要在一个统一的表征空间里决定哪个信息更重要。对 Agent 场景来说,这种能力不是锦上添花。真实世界里的任务输入从来不会只给你干干净净的文本。屏幕、话音、图片混着来,模型如果只能处理其中一种,很多活根本接不住。
复杂推理需要跨模态证据链
复杂推理最怕的是信息源单一。只靠文本,很多现实任务就变成了纸上谈兵。视觉信息提供界面状态、环境反馈;语音包含用户指令、情绪和歧义;文本则负责结构化的逻辑链条。dots3-note Preview 强调多模态理解,不是为了让模型看图说话,而是为了让它在推理过程中能调用不同来源的证据。比如在长程 Agent 任务中,用户先发一段语音说要改某个界面,再截一张图说明当前状态,模型必须把语音中的指代和图像里的具体位置对上,还要结合之前的对话历史判断下一步动作。这种 跨模态证据链 一旦断裂,后面每一步都可能被错误放大。技术上能做到三条通道共池,至少说明团队没有把多模态当作演示功能,而是当成了复杂推理的基础设施。
TEMPO跟长程Agent死磕
稀疏奖励的坑,靠穷举填不平
强化学习训练 Agent,最怕奖励给得太晚。任务跑了几十步,最后只有成功或失败一个信号;中间每一步该不该表扬,模型根本不知道。这种 稀疏奖励 问题在长程任务里被无限放大。穷举试错不可行,状态空间太大,样本效率低到没法看。很多团队尝试用密集奖励、人工规则去补,结果不是奖励设计本身变成新的负担,就是模型学会了刷分而不是真正完成任务。TEMPO 的切入角度很有意思:它不假装奖励可以凭空变密,而是换一条路,让智能体自己学会估计每一步的价值。这就绕开了“外部奖励给不到位”的死结。奖励依然稀疏,但训练信号不再完全依赖外部反馈。这个思路不新,可在 Agent 训练里真正落地成结构,不容易。
每个宏观步骤,都让智能体变成批评者
TEMPO 的核心做法是,在同一个智能体执行任务时,每个宏观步骤切换一次角色:从执行者变成 critic。用测试时推理去估计当前步骤的回报,再反过来指导训练。听起来有点绕,但逻辑很直接——既然外部奖励来得晚,就让模型自我评估“这一步走到现在,值多少”。这种 critic 不是另一个独立网络,而是智能体本身在推理阶段换一个姿态干活。这样的好处是省掉一套复杂的价值估计模型,同时让评估更贴近模型自身的认知边界。对于长程 Agent 任务,这意味着模型不需要等到最后失败才知道某一步错了。它可以在宏观步骤切换时不断修正策略。这个结构把测试时推理变成了一种训练信号来源,而不是只有部署阶段才用的技巧。对开源社区来说,这是可以直接借鉴的训练框架。
测试时推理反哺训练,结构比概念重要
测试时推理 反哺训练,学术上并不新鲜。真正难的是把这件事变成稳定的结构。很多方法在论文里效果好,一放到长程任务上就崩,因为它要么对计算资源要求过高,要么对价值估计的误差极其敏感。TEMPO 的聪明之处在于不做全盘重建,而是在宏观步骤上做局部评估。它把问题分割成若干可以判断的节点,而不是每步都算一笔账。这个粒度选择很关键:太细,计算爆炸;太粗,信号又变得模糊。小红书技术把 TEMPO 和 dots3-note Preview 一起放出来,等于告诉社区,模型能力和训练方法不是两件事。一个主打长程 Agent 的模型,如果训练时没有相应的机制配合,最后只能在排行榜上好看几周。训练结构才是决定它能不能真干活的底层原因。
开源放预览版,打的什么算盘
在Hugging Face上放出一个“预览版”
“Preview”这个词在开源模型里很微妙。它意味着还没打磨到完美,但也意味着团队愿意把中间状态拿出来给人看。小红书技术选择在 Hugging Face 上放出 dots3-note Preview,本身就带着试探和共建的意思。开源社区不缺闭门造车的巨无霸,缺的是能让人真实跑起来、给出反馈、快速迭代的模型。280B 总参、16B 激活的组合,配上 512K 上下文和多模态输入,这个配置放在预览阶段,说明团队想测试的不只是模型下限,还包括社区对长程 Agent 任务的接受度。预览版可能有很多不完整的地方,但它的方向信号很明确:我要做的是 Agent 能用的模型,不是又一个聊天机器人。真正有心在这个方向上做产品的人,会顺着这个信号找过来。
长程Agent场景里,轻量就是入场券
Agent 任务和聊天场景最大的不同,是模型必须被高频调用。一次任务可能被唤起几十次、上百次,每一步都要输出动作、观察结果、规划下一步。如果单次推理成本太高,再强的模型也扛不住真实场景的消耗。16B 激活参数在这个意义上不只是技术选择,而是产品判断。它让模型有机会在边缘设备或受限算力环境中持续运行,让长程任务不会因为账单问题中途夭折。开源模型里,轻量正在变成硬门槛,而不是可选项。dots3-note Preview 在 280B 参数池上保持 16B 激活,算是把知识容量和运行效率做了一次平衡。能否真正被广泛采用,还要看社区跑起来之后的表现。但从一开始就把长程 Agent 作为优化目标,位置卡得不算晚。
dots3-note Preview 不会因为“Preview”两个字就自动变得可靠。开源模型的质量,最终要用大量真实任务去检验。不过小红书技术这次把目光从榜单上的单项能力移开,转向了复杂推理、长程 Agent 和训练方法,这件事本身比发一个顶尖分数重要。TEMPO 的结构、多模态的同池训练、512K 的上下文窗口,这几块拼在一起,指向的不是“我能回答什么”,而是“我能替你干完什么”。对开源生态来说,这种带着明确任务导向的发布,比一味追求参数规模的模型有看头。接下来就看社区怎么把预览版推进到下一个版本了。

