XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链
机构 * XPeng Inc(小鹏汽车)
AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。
大厂专区
XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链
机构 * XPeng Inc(小鹏汽车)
AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。
R2S-EGO:面向稀疏捕获虚实迁移的双代理细化方法
机构 * XPENG Robotics(小鹏机器人) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 R2S-EGO耦合机器人与几何双代理,通过固定预算选择细化视觉资产,在Replica场景实验中,其PSNR与G1坐立成功率均显著优于现有R2S基线。
Comments 11 pages, 6 figures, 4 tables, and 1 algorithm
Athena-WBC:用于长尾人形机器人全身控制的能力对齐策略专家
机构 * XPENG ROBOTICS(XPENG机器人)
AI总结 研究发现仅靠重新分配训练精力改进人形运动跟踪控制器不完整。提出Athena-WBC,含能力对齐策略专家,动态专家用特定目标,平衡专家用重力课程,经蒸馏和微调,提升长尾运动恢复及跟踪性能。
Comments 27 pages, including appendix. Preprint
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。
从不确定性到稳定性和保真度:利用Fisher信息引导稀疏视角3D高斯溅射
机构 * Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Xpeng Motors(小鹏汽车)
AI总结 针对稀疏视角下3D高斯溅射过拟合问题,提出基于Fisher信息指导几何先验使用和正则化的方法,通过主动选择信息量大的支撑视图和自适应调整高斯移除概率,提升渲染稳定性和保真度。
ROVE: 通过强化学习解锁人类干预用于人形机器人操作
机构 * XPENG Robotics(小鹏机器人) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。
使远见可操作:在世界动作模型中重新利用表示对齐
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人)
AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。