尊龙凯时

新闻 概想

20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

张青叶 阅读约 4 分钟 236899 阅读
20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!
配图:20%数据超GR00T N1.6、RoboDojo超WAM!StarVLA只用16卡训出全新VLA!

新闻导读

成短视频软件以前总感触科普蹬宗抖智慧,,,,,,,这里几多纠正了我的私见。。。。。。日用品、防护、营养这类切近生涯的主题出格实用。。。。。。纠错入口找得到,,,,,,,肯改、改得通明,,,,,,,比完佳人设更让人信。。。。。。被慢慢造就出的判断习惯,,,,,,,比单纯记两条冷知识更值钱。。。。。。幼处想得细,,,,,,,耐看也耐用。。。。。。综合可读性、可信度和可对峙性,,,,,,,阐发都还在线。。。。。。

VLAct 的整个 continued pre-training 只使用开源数据和16张GPU,,,,,,,但成就相当能打:RoboTwin 2.0 成功率达到92.5%;;;;;在 RoboDojo 榜单中超过所有明确标注为 World Action Model(WAM)的模型;;;;;面对预训练阶段从未见过的 GR-1 机械人,,,,,,,只使用20%的 RoboCasa-GR1 下游数据,,,,,,,就已经超过 NVIDIA GR00T N1.6 的全量数据基线。。。。。。模型、Checkpoint、训练代码和 Pipeline 也全数开源。。。。。。 从前几年,,,,,,,大模型已经证了然一条极度有效的路线:数据更多、模型更大、算力更强,,,,,,,能力就不休往上走。。。。。。VLA 天然也但愿复造这条 Scaling 路线。。。。。。 但机械人领域有一个绕不开的现实:机械人轨迹不是网页数据,,,,,,,不能从互联网直接爬下来。。。。。。每条数据都必要机械人真在物理世界里实现操作,,,,,,,背后往往还有遥操作、数据采集和硬件成本。。。。。。更麻烦的是,,,,,,,机械人最终面对的是险些无限的场景、物体、工作和机械人状态组合。。。。。。 所以 VLAct 并不是想否定 Data Scaling,,,,,,,而是补上另一个问题:在同样的数据预算下,,,,,,,能不能让机械人轨迹在 Backbone 里留下更多能够跨工作、跨 Action Head、甚至跨机械人迁徙的知识?????? VLAct 真正的起点,,,,,,,来自团队前期尝试中一个很有意思的景象。。。。。。此刻好多 VLA 城市从一个 VLM 启程,,,,,,,挂上 Action Head,,,,,,,再用机械人数据持续训练。。。。。。很天然的设法是:Action 预测越准,,,,,,,注明这次 VLA 预训练越成功。。。。。。 但尝试发现,,,,,,,并不愿定。。。。。。以 RoboTwin 为例,,,,,,,使用 OFT Head 做 continued pre-training 后,,,,,,,若是下游持续使用 OFT,,,,,,,成功率能够从 61.7%提高到 75.8%;;;;;但把统一个 Backbone 换成 PI Head,,,,,,,下游反而从 60.5%降落到 55.1%;;;;;换成 GR00T Head 甚至从 51.2%降到 28.9%。。。。。。 原因也很直观。。。。。。Action Head 和 Backbone 是一路训练的,,,,,,,只用一种 Head 时,,,,,,,Backbone 很容易逐步学会一种“最方便这个 Head 读取”的 Feature Geometry。。。。。。对于当前 Policy,,,,,,,这当然很好;;;;;但换一个 Action Head、工作甚至机械人后,,,,,,,这些 Representation 不定还能持续复用。。。。。。论文把这种景象称为head-specific representation collapse。。。。。。 因而 VLAct 把 continued pre-training 的指标沉新界说了一遍:不是训练一个已经很会做作为的固定 Policy Initialization,,,,,,,而是训练一个能被分歧 Action Head、分歧工作、分歧机械人持续利用的 VLM Backbone。。。。。。 第二,,,,,,,别让一种 Action Head 说了算。。。。。。VLAct 同时挂上 OFT、PI 和 GR00T 三种陆续 Action Head,,,,,,,让它们共同读取一个 Backbone、预测统一套作为。。。。。。这样 Backbone 想同时服务分歧 Decoder,,,,,,,就不能只把信息组织成某一种 Head 最喜欢的大局。。。。。。更沉要的是,,,,,,,预训练实现后这些 Head 全数能够丢掉,,,,,,,下游沉新初始化自己的 Action Head。。。。。。 第三,,,,,,,分歧机械人之间,,,,,,,该共享的物理语义就共享。。。。。。例如“打开/关关夹爪”在分歧机械人上的物理意思高度类似,,,,,,,但分歧机械臂的自由度和运动学结构又不能粗鲁统一。。。。。。因而 VLAct 只统一真正一致的 Action 维度,,,,,,,其他部门持续维持 Embodiment-specific。。。。。。 最能体现迁徙能力的尝试来自RoboCasa-GR1。。。。。。GR-1 这种机械人在 VLAct continued pre-training 的数据里一次都没有出现过:预训练阶段模型看到的是 Franka、AgileX 等机械人,,,,,,,而后再把 Backbone 拿到 GR-1 上进行下游 Fine-tuning。。。。。。 VLAct 并不是想证明“数据不沉要”。。。。。;;;;;等耸莸比换贡匾中 Scale,,,,,,,但由于机械人数据昂贵、稀缺,,,,,,,并且很难齐全覆盖真实物理世界,,,,,,,Representation Quality 自身也应该成为 VLA Scaling 的一条独立轴线。。。。。。 从前各人更常问:“还能收几多机械人数据??????”VLAct 但愿同时再问一句:“同样这些机械人数据,,,,,,,到底能让模型学到几多能够迁徙的器材??????” 整个 VLAct continued pre-training 基于 Qwen3-VL-4B,,,,,,,只使用公开机械人数据和 16 张 GPU 实现。。。。。。目前模型权沉、Checkpoint、数据处置及训练 Pipeline 均已盛开,,,,,,,但愿把一个更适合物理世界、也更 Research-friendly 的 VLM Backbone 交给 VLA 社区。。。。。。

有关标签

免责申明:本文内容来自公开报路与编纂整顿,,,,,,,仅供参考。。。。。。转载请注明出处;;;;;版权争议请联系本站核实处置。。。。。。页面地址:/index.php/media/xwxq/277.html?id=e61vl7-618105

评论区

热点会商 · 占位展示
说说你的见解…
颁发评论
  • 用户
    读者6号
    首页结合季节和热点推问题,,,,,,,贴场景却不消费焦虑。。。。。。寂仔生涯向冷知识,,,,,,,也有扎实的基础道理拆解,,,,,,,档次还算明显。。。。。。正误对照版块适合急剧成立框架,,,,,,,也方便转发给家人。。。。。。家庭共享和分龄内容池让人更安心,,,,,,,给孩子用也踏实一些。。。。。。成年人的建补式进建,,,,,,,原来能够如此面子,,,,,,,也如此愉快。。。。。。先记一笔真实感触:稳、清、恳切,,,,,,,就这三点够用。。。。。。
    20260908 · 来自移动端
  • 用户
    谢玲姬
    深色模式配星空专题相宜,,,,,,,注解可开关,,,,,,,交互在服务阅读。。。。。。好多生涯景象背后的道理讲得明显,,,,,,,不矫揉造作,,,,,,,也不有意卖萌到狼狈。。。。。。和学生党伴侣一路看时,,,,,,,会商会天然落到证据而不是站队。。。。。。在生理健全话题上,,,,,,,克造自身就显得专业。。。。。。写给后来者:别指望一夜变专家,,,,,,,但真的能变复苏。。。。。。
    2026-09-08 01:19:49
  • 用户
    热心网友
    红桃视频2025年,,,,,,,内容值得关注,,,,,,,等待后续更新。。。。。。
    20260908

等待你的精彩讲话。。。。。。

← 上一篇库普梅纳斯:我内心想的是尤文,,,,,,,对于留队这件事从未有过疑惑 下一篇 →辽宁一处级干部单元门口遭枪击,,,,,,,身中两弹高位截瘫,,,,,,,7年后归天,,,,,,,现存唯一目见证人发声:案发当天是一时起意的幼领域聚餐
【网站地图】【sitemap】