LingBot-VLA 2.0 面向多机器人形态下的视觉语言动作生成,处理的是实验室 VLA 的落地缺口。以 55 维统一向量容纳机械臂、末端、夹爪、灵巧手、腰、头和移动底盘。
LingBot-VLA 2.0 面向多机器人形态下的视觉语言动作生成,处理的是实验室 VLA 在数据质量、全身动作空间和未来变化判断上的落地缺口。项目整理约 6 万小时预训练数据,以 55 维统一向量容纳机械臂、末端、夹爪、灵巧手、腰、头和移动底盘,并用稀疏 MoE 动作专家与深度、视频双查询蒸馏连接当前几何和未来动态。论文在 GM-100、RoboTwin 2.0 与长程移动操作上给出结果,仓库则提供 6B 权重、后训练代码和 WebSocket 策略服务。下面结合论文、源码和单卡服务器部署,拆解它怎样从 checkpoint 变成可在浏览器操作的推理服务。
LingBot-VLA 2.0 是面向真实机器人操作的视觉语言动作基础模型。它使用约 6 万小时机器人与第一视角视频完成预训练,把不同机器人映射到统一 55 维状态和动作空间,再通过稀疏 MoE 动作专家分配控制能力。模型还利用 LingBot-Depth 和 DINO-Video 蒸馏当前几何与未来动态,可在浏览器上传三路相机画面、填写状态和任务指令,返回动作向量供仿真或受控机器人系统继续消费。
具体详细使用可以参考LingBot-VLA 2.0:从视觉语言理解走向可部署的机器人动作策略