面壁智能把机器人的“大脑”彻底开源了。没有扣扣索索,直接放出MiniCPM-Robot系列,包含1.5B参数的视觉-语言-动作(VLA)模型和一套高性能推理框架,个人开发者拿过来就能让自己的机械臂动起来。这在具身智能圈子里,算是头一回有人把门槛压得这么低。
这次开源的两个模型分工明确。MiniCPM-RobotManip负责操作,让机器人看懂场景、听懂指令、直接输出动作,是一个真正端到端的VLA模型。1.5B的体量不大,但在真实机器人上的物体抓取、放置任务里跑得相当稳。另一个MiniCPM-RobotTrack专注目标跟踪,无论物体移动还是视角变换,都能死死咬住目标。两条腿走路,覆盖了具身场景里“看懂”和“跟住”这两个高频需求。面壁还顺手发布了推理框架PhyAI,专门为机器人任务优化,强调理解、记忆、行动一体化,不是把视觉模型和运动模型简单拼接,而是从底层让信号流动更顺畅。
1.5B的VLA模型能开放到这个程度,在行业里极其罕见。很多机构会把类似模型包装成Demo或API,但面壁直接给出完整权重和可复现的推理链路,意味着学生、极客、小型实验室都能在真实机器人上验证想法。这对具身智能的普及推动,远比发一篇论文来得实在。这种毫无保留的开放,才是开源该有的样子。如果你手里有台机械臂,现在就能 clone 跑起来。

