机器人学习有一个始终绕不开的坎:怎么给操作任务定义奖励。偏好标注成本高、进度启发式常引入偏差。上个月公布的 RynnValue 换了一个截然不同的角度——它用 时间距离 直接做监督信号,完全不依赖人工偏好或任务进度假设。这听起来简单,但背后是一个开源的价值基础模型,直接从原始时间戳生成标签,一下子扩展到了超 7,000 小时、约 300 万条指令条件片段。
传统价值函数训练要么靠人类反馈构造成对比较,要么利用任务完成度这种粗粒度信号。时间距离的妙处在于,它天然就存在于数据中:序列里任意两帧之间的时间间隔就是现成的稠密目标。RynnValue 的价值模型学会了预测到达目标状态还需多少时间,从而给出一个连续、可微的奖励界面。更关键的是,这种设计让它具备了跨具身、跨任务和跨视角的泛化能力——无论机械臂是 UR5 还是 Franka,无论任务是抓取还是旋拧,同一个价值模型都能给出有意义的打分。对于长期受困于奖励设计的机器人策略来说,这相当于提供了一个即插即用的 无偏好奖励接口。
这个方向最大的启示或许是:大规模机器人数据并不缺监督,缺的是能把原始信号转换成有效训练目标的方式。时间戳免费、稠密、无偏见,RynnValue 证明了即使没有繁琐标注,价值基础模型也能在真实世界的多样性上站稳脚跟。项目代码和模型已经开源,或许很快它就会被塞进各种仿真到现实迁移的 pipeline 里,成为策略学习的一个标准组件。

