arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-07-09 至 2026-07-09 共收录 17 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 4 篇

2607.06896 2026-07-09 cs.RO cs.CV 新提交 84%

Dynamic Object Detection and Tracking in Construction: A Fisheye Camera and LiDAR Sensor Fusion Model

建筑中的动态目标检测与跟踪:一种鱼眼相机与激光雷达传感器融合模型

Yilong Chen, Huili Huang, Yong K. Cho

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 感知 :LiDAR(title,abstract);occupancy(abstract);分类 cs.RO、cs.CV

AI总结 针对建筑等复杂环境中机器人动态目标检测与跟踪问题,提出融合鱼眼相机与激光雷达传感器的框架,通过在配准点云里识别移动物体、投影坐标分配语义标签并结合图像检测更新卡尔曼滤波器观测,具有高精度、简单且鲁棒的特点。

Comments 4 pages, 8 figures, submitted to IEEE International Conference on Robotics and Automation (ICRA) 2025 Future of Construction Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07357 2026-07-09 cs.RO cs.AI 新提交 62%

HumAIN: Human-Aware Implicit Social Robot Navigation

HumAIN:人类感知的隐式社交机器人导航

Daeun Song, Nhat Le, Jeffrey Chen, Mohammad Nazeri, Amirreza Payandeh, Rohan Chandra, Reuth Mirsky, Ross Mead, Ling Xiao, Xuesu Xiao

机构 * Ewha Womans University(梨花女子大学) George Mason University(乔治梅森大学) University of Virginia(弗吉尼亚大学) Tufts University(塔夫茨大学) Semio(Semio公司) Hokkaido University(北海道大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。

Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06700 2026-07-09 cs.RO 新提交 57%

CILC: Cryptographically-secure Inter-agent Loop Closure Candidate Detection for Multi-Agent Collaborative SLAM

CILC:用于多智能体协作SLAM的加密安全的智能体间闭环候选检测

Andrew Fishberg, Yixuan Jia, Jonathan P. How

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 研究多智能体协作SLAM中智能体间闭环候选检测问题,提出CILC系统,利用安全多方计算仅对隐私敏感且计算量轻的GD相似性比较步骤进行加密处理,在模拟和硬件实验中验证其能保持实时性、通信可行并减轻信息泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16106 2026-07-09 cs.PF cs.AR cs.DC 新提交 50%

Edge-Inference Governors Need Memory-Clock State

超越CPU-GPU频率:内存时钟和尾部效应对边缘推理延迟估计的影响

Jaehoon Kang

专题命中 感知 :occupancy(abstract)

AI总结 通过测量NVIDIA Jetson Orin Nano,发现内存时钟是缺失的维度、聚合丢失率隐藏突发性、频率切换存在延迟,这些现象超出传统频率感知延迟模型的范围。

Comments 23 pages, 15 figures, 23 tables. Code and data: https://github.com/dankang21/jetson-latency-lab ; traces: https://zenodo.org/records/21236659

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 1 篇

2605.15207 2026-07-09 cs.LG cs.MA 版本更新 50%

TeamTR: Trust-Region Fine-Tuning for Multi-Agent LLM Coordination

TeamTR: 用于多智能体大语言模型协调的信赖区域微调

Yi Xie, Siao Liu, Falong Fan, Yuanqi Yao, Yue Zhao, Bo Liu

机构 * Department of Electrical \& Computer Engineering, University of Arizona Engineering College, Soochow University INSAIT, Sofia University "St. Kliment Ohridski" Department of Electrical Computer Engineering, Stony Brook University

专题命中 规划控制 :occupancy(abstract)

AI总结 本文提出TeamTR,通过信赖区域框架在每个组件更新后重采样轨迹并控制每个智能体的发散度,解决多智能体系统中因上下文分布变化导致的性能下降问题,实验表明其在协调回归抑制和组件替换支持方面优于单智能体和序列基线。

Comments 9pages, Accepted at ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 2 篇

2510.24108 2026-07-09 cs.RO cs.CV 版本更新 81%

Zero-Human Demonstration End-to-end Autonomous Driving with Trajectory Scorer

基于轨迹评分器的零人类示范端到端自动驾驶

Zhenxin Li, Nadine Chang, Wenhao Yao, Xinglong Sun, Zi Wang, Maying Shen, Jingde Chen, Jingyu Song, Kailin Li, Zuxuan Wu, Shiyi Lan, Jose M. Alvarez

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究所) Fudan University(复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) NVIDIA University of Michigan(密歇根大学) East China Normal University(华东师范大学)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.RO、cs.CV

AI总结 研究提出ZTRS,一种基于强化学习的端到端自动驾驶规划范式,仅依靠真实世界图像和规则奖励训练,无需人类示范。通过详尽策略优化,能更好推广到长尾驾驶场景,在相关数据集上展现出优于模仿学习方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18735 2026-07-09 cs.CV cs.AI 版本更新 62%

Thinking Ahead: Foresight Intelligence in MLLMs and World Model

提前思考:多模态语言模型和世界模型中的预见智能

Zhantao Gong, Liaoyuan Fan, Qing Guo, Xun Xu, Xulei Yang, Shijie Li

机构 * College of Software, Nankai University, China(南开大学软件学院) The University of Hong Kong, China(香港大学) NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)

专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 1 篇

2601.17163 2026-07-09 physics.chem-ph cond-mat.str-el nucl-th 版本更新 50%

Degenerate coupled-cluster theory

退化耦合簇理论

So Hirata

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出一种能扩展至任意退化或非退化Slater行列式参考的耦合簇方法,适用于多种电子分布和自旋多重度情况,并开发了新的多参考耦合簇理论以处理强相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 激光雷达 3 篇

2607.06782 2026-07-09 cs.RO cs.CV 新提交 73%

G-PROBE: Cross-FOV Place Recognition and Certainty-Coupled Localization for 3D Point Clouds

G-PROBE:用于3D点云的跨视场位置识别和确定性耦合定位

Jinseop Lee

机构 * SK Intellix(SK智能科技)

专题命中 激光雷达 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 研究针对3D点云在有限或不对称视场下全局定位难的问题,提出G-PROBE框架。通过虚拟传感器分解、跨视场分支集合等方法,结合确定性耦合定位,无需学习。在多数据集和模式上评估,该框架性能出色,端到端可用性高,在不对称视场下优势明显。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06829 2026-07-09 cs.CV 新提交 57%

Rail Track Extraction from Rasterized Classified Point Clouds Using a Full-Resolution, Fully Convolutional Recurrent Neural Network

使用全分辨率全卷积递归神经网络从光栅化分类点云提取铁轨

Alexander Gribov, Jie Chang

机构 * Esri(环境系统研究所公司)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.CV

AI总结 介绍利用全卷积递归神经网络从分类3D点云提取铁轨的新方法,先光栅化点,经神经网络、形态学操作、平滑处理等步骤,用动态时间规整算法找中心线,人工干预少,实验验证了该方法提取铁轨的有效性。

Comments 15 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22469 2026-07-09 eess.SP 版本更新 50%

Multi-Modal Beamforming with Model Compression and Modality Generation for V2X Networks

用于车联网的基于模型压缩和模态生成的多模态波束成形

Chen Shang, Dinh Thai Hoang, Jiadong Yu

专题命中 激光雷达 :LiDAR(abstract)

AI总结 针对6G车联网中ISAC范式的不足,提出基于分层Transformer的多模态学习框架BeamTransFuser,利用跨模态相关性提升波束预测性能,开发剪枝方案减少延迟,引入生成模型处理模态缺失,实验证明该方案优于现有基线。

Comments 15 pages, 5 figures

Journal ref IEEE Transactions on Mobile Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 仿真评测 6 篇

2607.07601 2026-07-09 cs.RO cs.AI 新提交 81%

CARLA-GS: Decoupling Representation, Reasoning, and Physics Simulation for Autonomous Driving Corner-Case Synthesis

CARLA-GS:用于自动驾驶极端情况合成的解耦表示、推理和物理模拟

Kaicong Huang, Meng Ma, Ruimin Ke

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 仿真评测 :autonomous driving(title,abstract);分类 cs.RO、cs.AI

AI总结 研究自动驾驶极端情况合成问题,提出CARLA-GS模块化管道,解耦视觉表示、语义推理和物理执行并保持跨模块耦合,能从实际驾驶数据生成可编辑场景,经多智能体大语言模型推理等步骤,实现可控生成及逼真、时空一致的视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07133 2026-07-09 cs.RO cs.AI 81%

A Digital Twin Framework for Metamorphic Testing of Autonomous Driving Systems Using Generative Model

面向自动驾驶系统元形测试的数字孪生框架:基于生成模型

Tony Zhang, Burak Kantarci, Umair Siddique

机构 * School of Electrical Engineering and Computer Science(电气工程与计算机科学学院) reasonX Labs Inc.(reasonX实验室)

专题命中 仿真评测 :autonomous driving(title);self-driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于生成模型的数字孪生框架,用于自动驾驶系统的元形测试,通过生成多样化驾驶场景提升测试覆盖率和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07103 2026-07-09 cs.LG cs.DB 新提交 78%

A knowledge-augmented dataset of high-risk driving scenarios with LLM annotations for autonomous driving

一个用于自动驾驶的具有大语言模型注释的高风险驾驶场景知识增强数据集

Heye Huang, Jingguang Li, Zhiyuan Zhou, Paul Liang, Mingyu Wu, Kitae Jang, Jianqiang Wang

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Fudan University(复旦大学) Massachusetts Institute of Technology(麻省理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

专题命中 仿真评测 :autonomous driving(title,abstract)

AI总结 研究自动驾驶中高风险场景数据不足问题,核心方法是构建K-Risk数据集,整合多源轨迹数据并利用大语言模型生成注释,主要贡献是为自动驾驶开发和评估提供标准化基础。

Comments 22 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.01683 2026-07-09 cs.CV 版本更新 74%

ROAD-Waymo: A Large-Scale Action Awareness Dataset for Autonomous Driving

ROAD-Waymo:一个用于自动驾驶的大规模动作感知数据集

Salman Khan, Izzeddin Teeti, Reza Javanmard Alitappeh, Mihaela C. Stoian, Eleonora Giunchiglia, Gurkirt Singh, Andrew Bradley, Fabio Cuzzolin

机构 * Oxford Brookes University(奥克斯福德布鲁克斯大学) MAZUST University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) ETH Zurich(苏黎世联邦理工学院)

专题命中 仿真评测 :autonomous driving(title);分类 cs.CV

AI总结 本文提出ROAD-Waymo数据集,用于道路场景中代理、动作等检测技术开发与基准测试,比现有数据集更大更具挑战性,含大量标注数据,通过新注释管道增强完整性,还能解决不同国家道路场景的域适应问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07196 2026-07-09 cs.RO cs.AI cs.LG cs.SE 新提交 62%

Validate the Dream Before You Trust Its Verdict: Admissibility for World-Model Simulators

在信任世界模型模拟器的裁决之前先验证其可靠性:世界模型模拟器的可接受性

Christian Oefinger, Finn Rasmus Schäfer, Korbinian Moller, Mattia Piccinini, Johannes Betz

机构 * Autonomous Vehicle Systems Lab(自主车辆系统实验室) Technical University of Munich(慕尼黑技术大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 研究世界模型模拟器裁决的可靠性问题,基于安全关键模拟的可信度实践定义可接受性阶梯,通过自动驾驶实例验证,指出视觉保真度不能预测行动稳健性,为世界模型模拟器的评估提供了新框架。

Comments Accepted at RSS 2026 Workshop on Robot World Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06957 2026-07-09 cs.RO cs.LG 新提交 57%

Flow-ERD: Agent-type Aware Flow Matching with Entropy-Regularized Distillation for Diverse Traffic Simulation

Flow-ERD:用于多样化交通模拟的基于熵正则化蒸馏的智能体类型感知流匹配

Seulbin Hwang, Kiyoung Om, Daejung Kim, Jinhan Lee

机构 * NAVER LABS Corp.(NAVER实验室公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO

AI总结 为解决交通模拟中多样性未被充分探索的问题,提出Flow-ERD模拟器,其核心方法是智能体类型感知流匹配与熵正则化蒸馏,能联合追求现实性和多样性,在测试基准中排名第一,主导帕累托前沿。

Comments 8 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏