arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-03-27 至 2026-03-27 共收录 23 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 7 篇

2603.25502 2026-03-27 cs.CV 57%

RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models

RealRestorer:迈向通用的现实世界图像修复的大型图像编辑模型

Yufeng Yang, Xianfang Zeng, Zhangqi Jiang, Fukun Yin, Jianzhuang Liu, Wei Cheng, jinghong lan, Shiyu Liu, Yuqi Peng, Gang YU, Shifeng Chen

机构 * Southern University of Science and Technology(南方科技大学) StepFun Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出RealRestorer,通过构建大规模数据集和训练先进开源模型,提升现实世界图像修复的泛化能力,并引入RealIR-Bench评估基准,实验表明其在开源方法中表现最佳。

Comments 27 pages, 15 figures, Project homepage: https://yfyang007.github.io/RealRestorer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25275 2026-03-27 cs.CV 57%

V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception

V2U4Real: 一种用于车辆与无人机协同感知的真实世界大规模数据集

Weijia Li, Haoen Xiang, Tianxu Wang, Shuaibing Wu, Qiming Xia, Cheng Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University, China(福建省城市智能感知与计算重点实验室,厦门大学,中国) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(多媒体可信感知与高效计算教育部重点实验室,厦门大学,中国)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出V2U4Real数据集,用于研究跨视角协同感知,包含56K激光雷达帧、56K多视角图像和700K标注的3D边界框,评估了多种先进模型,展示了V2U协作在提升感知鲁棒性和远距离感知方面的有效性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25218 2026-03-27 cs.CV 57%

SDD-YOLO: A Small-Target Detection Framework for Ground-to-Air Anti-UAV Surveillance with Edge-Efficient Deployment

SDD-YOLO:一种面向地面到空中反无人机监视的高效边缘部署小目标检测框架

Pengyu Chen, Haotian Sa, Yiwei Hu, Yuhan Cheng, Junbo Wang

机构 * Chien-Shiung Wu College, Southeast University(东南大学吴健雄学院) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出SDD-YOLO框架,针对地面到空中反无人机监视中的小目标检测问题,通过高分辨率检测头和改进的训练策略提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25131 2026-03-27 cs.CV 57%

Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation

去噪与对齐:迈向无源无监督领域适应的鲁棒全景语义分割

Yaowen Chang, Zhen Cao, Xu Zheng, Xiaoxin Mi, Zhen Dong

机构 * Wuhan University(武汉大学) HKUST (Guangzhou)(香港科技大学(广州)) Wuhan University of Technology(武汉理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出DAPASS框架,通过全景置信度引导去噪和上下文分辨率对抗模块,解决无源领域适应中因几何失真和数据缺失导致的伪标签不准确问题,提升户外和室内场景的语义分割性能。

Comments Accepted to CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24699 2026-03-27 cs.RO 57%

Saranga: MilliWatt Ultrasound for Navigation in Visually Degraded Environments on Palm-Sized Aerial Robots

Saranga:用于手掌大小空中机器人在视觉退化环境中的导航的毫瓦超声波

Manoj Velmurugan, Phillip Brush, Colin Balfour, Richard J. Przybyla, Nitin J. Sanket

机构 * Perception and Autonomous Robotics (PeAR) Group(感知与自主机器人组) Worcester Polytechnic Institute(沃思彻斯特理工学院) TDK InvenSense

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 Saranga通过低功耗超声波感知栈在视觉退化环境中实现导航,利用双超声波阵列定位障碍物,并通过物理降噪和深度学习去噪方法解决信号噪声问题,实现在密集雾、黑暗和雪中导航。

Journal ref Science Robotics Vol 11, Issue 112, eadz9609 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 6 篇

2602.20060 2026-03-27 cs.CV cs.RO 84%

MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶

Junli Wang, Yinan Zheng, Xueyi Liu, Zebin Xing, Pengfei Li, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Zhongpu Xia, Long Chen, Qichao Zhang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaomi EV(小米汽车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)

专题命中 规划控制 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25462 2026-03-27 cs.RO cs.AI 76%

Temporally Decoupled Diffusion Planning for Autonomous Driving

时间解耦的扩散规划用于自动驾驶

Xiang Li, Bikun Wang, John Zhang, Jianjun Wang

专题命中 规划控制 :autonomous driving(title);分类 cs.RO、cs.AI

AI总结 本文提出时间解耦扩散模型(TDDM),通过噪声掩码方法解决动态城市环境中即时安全与长期目标的平衡问题,改进轨迹生成并提升复杂场景下的规划性能。

Comments icaps

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10822 2026-03-27 cs.RO 74%

MIGHTY: Hermite Spline-based Efficient Trajectory Planning

MIGHTY:基于Hermite样条的高效轨迹规划

Kota Kondo, Yuwei Wu, Vijay Kumar, Jonathan P. How

机构 * Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空航天系,麻省理工学院) Department of Electrical and Systems Engineering, University of Pennsylvania(电气与系统工程系,宾夕法尼亚大学)

专题命中 规划控制 :trajectory planning(title);分类 cs.RO

AI总结 MIGHTY通过Hermite样条实现时空优化,利用连续搜索空间提升效率,仿真中计算时间与旅行时间分别减少9.3%和13.1%,硬件测试中实现高速飞行和动态障碍物应对。

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10461 2026-03-27 cs.LG cs.AI math.OC 57%

T-SKM-Net: Trainable Neural Network Framework for Linear Constraint Satisfaction via Sampling Kaczmarz-Motzkin Method

T-SKM-Net:基于采样Kaczmarz-Motzkin方法的可训练神经网络框架用于线性约束满足

Haoyu Zhu, Yao Zhang, Jiashen Ren, Qingchun Hou

专题命中 规划控制 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出T-SKM-Net框架,通过将混合约束问题转化为纯不等式问题,并结合采样Kaczmarz-Motzkin方法进行迭代求解,实现神经网络在约束满足中的高效处理,同时保证了端到端的可训练性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.01222 2026-03-27 cs.RO 57%

Chance-Constrained Iterative Linear-Quadratic Stochastic Games

机会约束迭代线性二次随机博弈

Hai Zhong, Yutaka Shimizu, Jianyu Chen

机构 * Institute for Interdisciplinary Sciences, Tsinghua University(清华大学交叉信息研究院) Tier IV, Inc.(Tier IV公司) Shanghai Qizhi Institute(上海期智研究院)

专题命中 规划控制 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出CCILQGames算法,通过增广拉格朗日方法解决机会约束随机博弈问题,在自动驾驶场景中验证了其生成安全交互策略的能力。

Comments Updated version of the published IEEE RA-L paper. Assumption 1 and strategy space definition revised to make the information structure explicit. Theorem 1 assumptions are more explict. No changes to algorithm or experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11331 2026-03-27 cs.IT math.IT 50%

AMBER: An Adaptive Multimodal Mask Transformer for Beam Prediction with Missing Modalities

AMBER: 一种自适应多模态掩码变换器用于缺失模态的波束预测

Chenyiming Wen, Binpu Shi, Min Li, Ming-Min Zhao, Min-Jian Zhao, Jiangzhou Wang

专题命中 规划控制 :LiDAR(abstract)

AI总结 AMBER通过自适应处理多模态数据中的缺失模态问题,提升波束预测的鲁棒性和准确性,实验表明其在真实世界数据集上优于现有多模态学习基线。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 2 篇

2512.10660 2026-03-27 cs.CV 79%

Closing the Navigation Compliance Gap in End-to-end Autonomous Driving

弥合端到端自动驾驶中的导航合规性差距

Hanfeng Wu, Marlon Steiner, Michael Schmidt, Alvaro Marcos-Ramiro, Christoph Stiller

专题命中 端到端驾驶 :autonomous driving(title);BEV(abstract);分类 cs.CV

AI总结 本文提出NAVI指标和NavControl数据集,通过轨迹评分规划器NaviHydra提升导航合规性,实现92.7 PDM和77.5 CM成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 79%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 端到端驾驶 :self-driving(title,abstract);分类 cs.RO

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 2 篇

2503.06986 2026-03-27 cs.CV 79%

ConcreTizer: Model Inversion Attack via Occupancy Classification and Dispersion Control for 3D Point Cloud Restoration

ConcreTizer:通过占用分类和分散控制进行模型反向攻击以恢复3D点云

Youngseok Kim, Sunwook Hwang, Hyung-Sin Kim, Saewoong Bahk

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) System LSI, Samsung Electronics(三星电子系统LSI) Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 BEV与占用 :occupancy(title,abstract);分类 cs.CV

AI总结 针对3D点云数据的模型反向攻击研究,通过占用分类和分散控制技术恢复受损点云场景,实验验证了其有效性及3D数据的脆弱性。

Comments Added acceptance note (ICLR 2025) to the heading

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25608 2026-03-27 cond-mat.mtrl-sci cond-mat.mes-hall cond-mat.str-el 50%

Single Atom Magnets on Thermally Stable Adsorption Sites: Dy on NaCl(100)

单原子磁体在热稳定吸附位点上:Dy在NaCl(100)上

M. Pivetta, M. Blanco-Rey, S. Reynaud, R. Baltic, A. Rary-Zinque, S. Toda Cosi, F. Patthey, B. V. Sorokin, A. Singha, F. Donati, A. Barla, L. Persichetti, P. Gambardella, A. Arnau, F. Delgado, S. Rusponi, H. Brune

专题命中 BEV与占用 :occupancy(abstract)

AI总结 研究发现Dy单原子在NaCl(100)表面具有磁双稳态,展现出长磁 relaxation时间,为首个热稳定吸附位点的单原子磁体。

Comments Main: 9 pages, 4 figures. Supplement: 15 pages, 11 figures, 10 tables

Journal ref Phys. Rev. Lett. 136, 086203 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 5 篇

2603.25672 2026-03-27 cs.RO cs.CV 81%

Can Users Specify Driving Speed? Bench2Drive-Speed: Benchmark and Baselines for Desired-Speed Conditioned Autonomous Driving

用户可以指定驾驶速度吗?Bench2Drive-Speed:用于期望速度条件下的自动驾驶的基准和基线

Yuqian Shao, Xiaosong Jia, Langechuan Liu, Junchi Yan

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(复旦大学可信具身人工智能研究所) NVIDIA(英伟达)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出Bench2Drive-Speed基准,通过引入用户期望速度和超车指令,设计了Speed-Adherence Score和Overtake Score等指标,验证了在不增加真实世界数据收集的情况下,通过重新标注常规驾驶数据可实现速度监督。

Comments Project page: https://thinklab-sjtu.github.io/Bench2Drive-Speed/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 81%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25740 2026-03-27 cs.RO cs.AI cs.CV cs.LG cs.MA 67%

Drive My Way: Preference Alignment of Vision-Language-Action Model for Personalized Driving

Drive My Way: 为个性化驾驶的视觉-语言-动作模型偏好对齐

Zehao Wang, Huaide Jiang, Shuaiwu Dong, Yuping Wang, Hang Qiu, Jiachen Li

机构 * University of California, Riverside(加州大学河滨分校) University of Michigan(密歇根大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出Drive My Way框架,通过学习用户驾驶习惯和自然语言指令,实现个性化驾驶,提升对用户意图的适应能力。

Comments IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR 2026); Project website: https://dmw-cvpr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25199 2026-03-27 cs.CV 57%

TacSIm: A Dataset and Benchmark for Football Tactical Style Imitation

TacSIm: 一场足球战术风格仿真的数据集和基准

Peng Wen, Yuting Wang, Qiurui Wang

专题命中 仿真评测 :occupancy(abstract);分类 cs.CV

AI总结 TacSIm通过模拟英超比赛中的球员动作,提供了一种评估足球战术风格仿真的新方法,利用空间占用相似性和运动向量相似性进行量化评估。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09575 2026-03-27 cs.RO 57%

Traffic Scene Generation from Natural Language Description for Autonomous Vehicles with Large Language Model

基于大语言模型的自然语言描述生成交通场景用于自动驾驶车辆

Bo-Kai Ruan, Hao-Tang Tsui, Yung-Hui Li, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) Carnegie Mellon University(卡内基梅隆大学) AI Research Center, Hon Hai Research Institute(鸿海研究院人工智能研究中心)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出TTSG框架,通过自然语言生成可控交通场景,解决文本到空间布局、无预设位置场景构建及多智能体行为规划问题,实验表明其在安全关键场景中碰撞率低且提升驾驶 captioning 模型性能。

Comments Accepted by WAD@CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他自动驾驶 1 篇

2603.25510 2026-03-27 cs.CV cs.AI cs.LG eess.IV 82%

Challenges in Hyperspectral Imaging for Autonomous Driving: The HSI-Drive Case

自动驾驶中超光谱成像的挑战:HSI-Drive案例

Koldo Basterretxea, Jon Gutiérrez-Zaballa, Javier Echanobe

机构 * University of the Basque Country(巴斯克大学)

专题命中 其他自动驾驶 :autonomous driving(title,abstract);分类 cs.CV、eess.IV、cs.AI

AI总结 本文探讨自动驾驶中超光谱成像面临的挑战,分析了HSI-Drive数据集实验中使用的技术,重点在实时运算需求与嵌入式平台计算资源限制下的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏