XCoT-VLA: Executable Chain-of-Thought for Vision-Language-Action Driving
XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链
机构 * XPeng Inc(小鹏汽车)
AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。
大厂专区
XCoT-VLA:面向视觉-语言-动作自动驾驶的可执行思维链
机构 * XPeng Inc(小鹏汽车)
AI总结 该研究提出XCoT-VLA,用可执行CoT令牌替代自然语言CoT,结合Reason FFN与Control FFN实现轨迹生成,在自动驾驶任务中降低了误差并满足实时规划要求。
R2S-EGO:面向稀疏捕获虚实迁移的双代理细化方法
机构 * XPENG Robotics(小鹏机器人) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 R2S-EGO耦合机器人与几何双代理,通过固定预算选择细化视觉资产,在Replica场景实验中,其PSNR与G1坐立成功率均显著优于现有R2S基线。
Comments 11 pages, 6 figures, 4 tables, and 1 algorithm
鲁棒残差有限标量量化用于神经压缩
机构 * XPENG Motors(小鹏汽车) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
AI总结 本文提出鲁棒残差有限标量量化(RFSQ),通过可学习缩放因子和可逆层归一化策略解决多阶段设置中残差幅度衰减问题,实验表明其在音频和图像领域均有效。
Comments 5 pages, 2 figures
X-Foresight:一种通过预测世界建模的联合视觉-动作因果预测网络
机构 * PWM Team(PWM团队) ; XPeng Inc.(XPeng公司)
AI总结 提出X-Foresight,一种将预测世界模型直接集成到VLA架构中的方法,通过长程分块自回归策略和课程学习,联合学习世界建模与实时动作控制,以解决视频预测中的低熵冗余和长程因果建模难题。
Athena-WBC:用于长尾人形机器人全身控制的能力对齐策略专家
机构 * XPENG ROBOTICS(XPENG机器人)
AI总结 研究发现仅靠重新分配训练精力改进人形运动跟踪控制器不完整。提出Athena-WBC,含能力对齐策略专家,动态专家用特定目标,平衡专家用重力课程,经蒸馏和微调,提升长尾运动恢复及跟踪性能。
Comments 27 pages, including appendix. Preprint
Drive-JEPA:视频JEPA结合多模态轨迹蒸馏实现端到端驾驶
机构 * Virginia Tech(弗吉尼亚理工学院) ; Purdue University(普渡大学) ; XPENG Motors(小鹏汽车) ; Nanjing University(南京大学)
AI总结 提出Drive-JEPA框架,结合视频联合嵌入预测架构(V-JEPA)与多模态轨迹蒸馏,通过自监督视频预训练和动量感知选择机制提升端到端驾驶的规划性能,在NAVSIM上达到新最优。
回答时保持忠实:为视觉语言模型强化学习返回流畅且基于视觉依据的答案
机构 * GMLab ; Hong Kong Polytechnic University(香港理工大学) ; XPENG Robotics(XPENG机器人)
AI总结 提出Faithful Warm-Start (FWS)策略,通过构建具有明确视觉-语言因果关系的FaithfulQA数据集并利用VLM裁判净化,在强化学习前预热模型,提升答案准确性、稳定训练并减少无视觉依据的推理。
X-Mind: 通过预测世界模型实现高效视觉思维链的端到端驾驶
机构 * XPeng Inc.(小鹏汽车)
AI总结 提出X-Mind框架,将预测世界模型内化为视觉思维链,通过紧凑的草图表示和循环块扩散方案,实现高效、低延迟的端到端驾驶策略。
TuringViT:让最先进的视觉Transformer人人可用
机构 * Foundation Model Team, Xpeng Inc.(小鹏汽车基础模型团队)
AI总结 提出TuringViT,通过图灵线性注意力、VISTA-Curation数据构建和原生动态分辨率预训练,仅用10%数据即可超越开源ViT基线,并显著提升下游VLM性能和高分辨率延迟。
从不确定性到稳定性和保真度:利用Fisher信息引导稀疏视角3D高斯溅射
机构 * Nanyang Technological University(南洋理工大学) ; University of Science and Technology of China(中国科学技术大学) ; Zhejiang University(浙江大学) ; Xpeng Motors(小鹏汽车)
AI总结 针对稀疏视角下3D高斯溅射过拟合问题,提出基于Fisher信息指导几何先验使用和正则化的方法,通过主动选择信息量大的支撑视图和自适应调整高斯移除概率,提升渲染稳定性和保真度。
ROVE: 通过强化学习解锁人类干预用于人形机器人操作
机构 * XPENG Robotics(小鹏机器人) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 提出ROVE框架,利用强化学习和乐观价值估计,从次优人类干预轨迹中学习高价值行为,提升人形机器人操作性能。
使远见可操作:在世界动作模型中重新利用表示对齐
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人)
AI总结 针对世界动作模型中视觉预测与动作提取不匹配的问题,提出AGRA方法,通过对齐视频扩散特征与语义表示,提升动作解码器对任务相关区域的关注,从而改善操作任务的性能与泛化能力。
OmniGUI: 评估多模态智能手机环境中的GUI代理的基准测试
机构 * XPeng Motors(小鹏汽车)
AI总结 本文提出OmniGUI基准测试,用于评估在多模态智能手机环境中GUI代理的能力,通过连续的多模态输入(包括静态图像、同步音频和视频片段)来模拟真实世界交互,发现当前模型在需要同步时间和听觉信号的环境中表现下降。
SpatialForge: 从开放世界2D图像中提升3D感知空间推理
机构 * Lingnan University(岭南大学) ; XPENG Robotics(小鹏机器人)
AI总结 本文提出SpatialForge,通过大规模合成数据提升空间推理能力,构建了包含1000万对空间问答的大型数据集,验证了2D数据扩展对3D空间推理的有效性。
EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) ; XPeng Motors(小鹏汽车)
AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。
Comments 19 pages, 5 figures, 5 tables
PPLLaVA:通过提示引导的视频序列理解
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学) ; XPeng Inc.(小鹏汽车有限公司) ; Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)
AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。
Comments Accepted to ICLR' 26
DIAL: 通过潜在世界建模解耦意图与动作以实现端到端VLA
机构 * The University of Hong Kong(香港大学) ; XPENG Robotics(小鹏机器人) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
AI总结 DIAL通过潜在意图瓶颈解耦意图与动作,利用VLM进行潜在世界建模并结合轻量策略实现端到端VLA,实验表明其在RoboCasa GR1任务中优于现有方法,且在真实世界部署中表现稳健。
Comments Project page: https://xpeng-robotics.github.io/dial
X-Cache:跨块块缓存用于少步自回归世界模型推理
机构 * AI Infra Team, XPeng Inc.(AI基础设施团队,小鹏汽车)
AI总结 本文提出X-Cache,一种无需训练的加速方法,通过跨连续生成块缓存而非去噪步骤来提升少步自回归世界模型的推理效率,实现71%的块跳过率和2.6倍的速度提升,同时保持最小的性能下降。
Comments Technical Report
UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言
机构 * XPENG Robotics(小鹏机器人) ; Tsinghua University(清华大学) ; The University of Hong Kong(香港大学)
AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。
Comments Project page: https://xpeng-robotics.github.io/unit/
基于可解释性的语音预训练模型说话人解耦
机构 * XPENG Motors(小鹏汽车) ; China National Aviation Fuel Group Limited(中国航空油料集团有限公司) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出InterpTRQE-SptME和InterpTF-SptME,通过SHAP分析量化并过滤语音嵌入中的说话人信息,实验显示在保持识别准确率的同时显著降低说话人残留信息。
Comments 5 pages, 4 figures
X-World: 可控的以自身为中心的多摄像头世界模型用于可扩展的端到端驾驶
机构 * GWM Team(长城汽车团队) ; XPeng Inc.(小鹏汽车)
AI总结 X-World通过可控的多摄像头生成世界模型,实现高质量多视角视频生成,支持跨摄像头一致性、长时间动态稳定性和严格动作遵循,为可扩展的端到端驾驶评估提供基础。
Comments Technical Report
DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成
机构 * XPeng Motors
AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。
Pip-Stereo:基于迭代优化的立体匹配的渐进迭代剪枝器
机构 * ARIDGE XPENG
AI总结 Pip-Stereo通过渐进迭代剪枝和硬件优化,实现高效实时立体匹配。
Comments Accepted to CVPR 2026 (3D vision track)
关于并行文本生成的综述:从并行解码到扩散语言模型
机构 * Peking University(北京大学) ; University of Illinois Chicago(伊利诺伊大学香槟分校) ; Tsinghua University(清华大学) ; XPENG ; Alibaba Group(阿里巴巴集团) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文综述了并行文本生成技术,分析了基于AR和非AR的方法,评估了其在速度、质量和效率上的权衡,并指出了未来研究方向。
ME-IGM:最大熵多智能体强化学习中的个体-全局-最大
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang University(浙江大学) ; XPeng Inc.(XPeng公司) ; The University of Hong Kong(香港大学) ; INFIFORCE Intelligent Tech. Co., Ltd.(INFIFORCE智能科技有限公司)
AI总结 ME-IGM是一种结合最大熵探索与IGM条件的新型多智能体强化学习算法,通过解决局部策略与联合策略不一致问题,提升探索效率和性能。
Comments Published in the Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25 - 29, 2026, IFAAMAS, 19 pages
UniDWM: 通过多维表征学习实现统一的驾驶世界模型
机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) ; School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) ; Xpeng Motors Technology Co Ltd(小鹏汽车科技有限公司)
AI总结 UniDWM通过多维表征学习实现统一驾驶世界模型,提升自动驾驶中的轨迹规划和4D重建能力。
面向自动驾驶的高效视觉问答流水线:场景区域压缩
机构 * University of Southern California(南加州大学) ; XPeng(小鹏)
AI总结 本文提出SRC-Pipeline框架,通过场景区域压缩技术,在保持性能的同时显著降低计算成本,提升自动驾驶中的实时视觉问答效率。
Comments 7 pages
FutureX: 通过潜在链式思维世界模型增强端到端自动驾驶
机构 * FNii-Shenzhen(FNii深圳分部) ; SSE, CUHK-Shenzhen(SSE,CUHK深圳分校) ; Xpeng Motors(小鹏汽车) ; MiroMind AI(MiroMind人工智能) ; Xidian University(西安电子科技大学)
AI总结 FutureX通过链式思维世界模型增强端到端自动驾驶,提升复杂场景下的运动规划质量与安全性。
HybridWorldSim: 一种可扩展且可控的高保真驾驶仿真器
机构 * XPeng Motors ; ShanghaiTech University(上海科技大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 HybridWorldSim通过整合多遍神经重建与生成模型,实现高保真驾驶仿真,提供可扩展且可控的仿真环境及新的多遍数据集MIRROR,推动自动驾驶研究。
Comments Project page: https://hybridworldsim.github.io/
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute for AI(向量人工智能研究所) ; University of Waterloo(滑铁卢大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Tesla(特斯拉) ; XPeng Motors(小鹏汽车) ; Leapmotor ; Nvidia(英伟达) ; DiDi(滴滴出行) ; Canada CIFAR AI Chair(加拿大 CIFAR 人工智能主席)
Comments IROS 2025