arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-09 至 2026-06-09 共收录 8 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 2 篇

2505.21457 2026-06-09 cs.CV cs.AI 版本更新 62%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03528 2026-06-09 cs.CV 版本更新 57%

Coop-WD: Cooperative Perception with Weighting and Denoising for Robust V2V Communication

Coop-WD:具有加权和去噪的协作感知用于鲁棒V2V通信

Chenguang Liu, Jianjun Chen, Yunfei Chen, Yubei He, Zhuangkun Wei, Hongjian Sun, Haiyan Lu, Qi Hao

机构 * Department of Engineering, Durham University(工程系,达勒姆大学) Faculty of Engineering and Information Technology, University of Technology, Sydney(工程与信息技术学院,悉尼技术大学) Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对V2V通信损伤对协作感知的影响,提出联合加权与去噪框架Coop-WD,通过自监督对比模型和条件扩散概率模型分层增强特征,并设计高效变体Coop-WD-eco降低计算开销,在各类信道下优于传统方法。

Comments submitted to IEEE Transactions on Intelligent Transportation Systems

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 端到端驾驶 2 篇

2511.17855 2026-06-09 cs.AI cs.RO 版本更新 62%

QuickLAP: Quick Language-Action Preference Learning for Semi-Autonomous Agents

QuickLAP: 为半自主代理快速语言-动作偏好学习

Jordan Abi Nader, David Lee, Nathaniel Dennler, Andreea Bobu

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24238 2026-06-09 cs.RO 版本更新 57%

Decentralized End-to-End Multi-AAV Pursuit Using Predictive Spatio-Temporal Observation via Deep Reinforcement Learning

基于深度强化学习的去中心化端到端多无人艇追捕

Yude Li, Zhexuan Zhou, Huizhe Li, Yanke Sun, Yenan Wu, Yichen Lai, Yiming Wang, Youmin Gong, Jie Mei

机构 * School of Intelligence Science and Engineering(智能科学与工程学院) Guangdong Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与自适应机器人重点实验室) Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制与现代自动化设备重点实验室) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 端到端驾驶 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出一种去中心化端到端多智能体强化学习框架,通过预测时空观测实现自主空中群体在复杂环境中的追捕,提升捕获效率和协同成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 1 篇

2606.02274 2026-06-09 cs.RO 版本更新 90%

Dexterity-BEV: Aligning 3D World and Actions for Generalizable Robot Policies Learning

Dexterity-BEV: 对齐3D世界与动作以实现通用机器人策略学习

Huayi Zhou, Wei Gao, Dekun Lu, Ruiji Liu, Zhanqi Zhang, Ziyang Zhang, Jian Chen, Wenlve Zhou, Sheng Xu, Shumin Li, Kangyi Guo, Shichen Xu, Zixin Huang, Yongyi Su, Kui Jia

机构 * DexForce Technology(德克斯技术公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 BEV与占用 :BEV(title,title_cn);分类 cs.RO

AI总结 提出Dexterity-BEV框架,通过对齐顶点图和顶点谱的3D表示以及鸟瞰图对齐,解决2D基础模型在3D操作中的局限性,提升机器人策略的泛化能力。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 1 篇

2605.01320 2026-06-09 cs.CV 版本更新 90%

PACE: Post-Causal Entropy Modeling for Learned LiDAR Point Cloud Compression

PACE:用于学习LiDAR点云压缩的后因果熵建模

Jiahao Zhu, Kang You, Dandan Ding, Zhan Ma

机构 * School of Information Science and Technology, Hangzhou Normal University, Hangzhou, China.(信息科学与技术学院,杭州师范大学,杭州,中国) School of Electronic Science and Engineering, Nanjing University, Nanjing, China(电子科学与工程学院,南京大学,南京,中国)

专题命中 激光雷达 :LiDAR(title,title_cn);分类 cs.CV

AI总结 PACE通过非因果骨干网络和轻量级预测器提升LiDAR点云压缩效率,实现90%以上的解码延迟降低和BD-BR节省。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2602.21172 2026-06-09 cs.AI cs.CV 版本更新 62%

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他自动驾驶 1 篇

2601.07013 2026-06-09 stat.ML cs.LG 版本更新 50%

Conditional Normalizing Flows for Forward and Backward Joint State and Parameter Estimation

条件归一化流用于前向和后向联合状态与参数估计

Luke S. Lagunowich, Guoxiang Grayson Tong, Daniele E. Schiavazzi

机构 * Department of Computer Science and Engineering University of Notre Dame(计算机科学与工程系诺特达姆大学) Department of Pediatrics Stanford University(儿科系斯坦福大学) Department of Applied and Computational Mathematics and Statistics University of Notre Dame(应用与计算数学与统计系诺特达姆大学)

专题命中 其他自动驾驶 :autonomous driving(abstract)

AI总结 针对非线性非高斯系统,提出基于条件归一化流的状态滤波方法,结合MLP、Transformer或Mamba-SSM生成条件嵌入,并引入最优传输动力学损失缓解过参数化,在自动驾驶和COVID-19联合估计中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏