arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-08-11 至 2026-08-11 共收录 21 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 21 篇

2608.09333 2026-08-11 cs.RO 新提交 79%

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

专题命中 感知 :autonomous driving(title,abstract);分类 cs.RO

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20336 2026-08-11 cs.RO 版本更新 79%

Autonomous Driving with Priority-Ordered STL Specifications Under Multimodal Uncertainty

多模态不确定性下基于优先级排序STL规范的自动驾驶

Taha Bouzid, Shuhao Qi, Mircea Lazar, Sofie Haesaert

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 感知 :autonomous driving(title);trajectory planning(abstract);分类 cs.RO

AI总结 提出一种不确定性感知的轨迹规划框架,通过信号时序逻辑的词典序优先级处理冲突目标,并结合模型预测路径积分控制实现,在仿真中验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08421 2026-08-11 cs.CV cs.AI 版本更新 73%

ATLASFusion: Aggregation Tracking with Location-Aware Sparse Fusion for Robust Spatio-Temporal Multi-View Pedestrian Tracking

ATLASFusion:用于鲁棒时空多视角行人跟踪的位置感知稀疏融合聚合跟踪

Keisuke Toida, Taigo Sakai, Takeshi Nakamura, Hiroshi Shimizu, Kazuhiro Hotta

机构 * Meijo University(名古屋大学) Chubu Electric Power Co., Inc.(Chubu电力公司)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出ATLASFusion框架,通过稀疏透视变换、密度感知加权聚合等技术解决多视角行人跟踪的特征畸变问题,在基准测试中提升精度与鲁棒性,且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00637 2026-08-11 cs.RO 版本更新 70%

Global-Local Attention Decomposition for Terrain Encoding in Humanoid Perceptive Locomotion

全局-局部注意力分解用于人形感知运动中的地形编码

Shengcheng Fu, Yang Zhang, Zhanxiang Cao, Liyun Yan, Yizhi Chen, Yunpeng Yin, Yue Gao

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Humanoid Robot (Shanghai) Co., Ltd.(人形机器人(上海)有限公司)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出全局-局部注意力分解(GLAD)方法,通过粗到细编码器分离全局地形感知和局部立足点选择,实现人形机器人在稀疏立足点和受限环境中的鲁棒运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07577 2026-08-11 cs.CV cs.AI cs.RO 新提交 67%

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects

开放世界层次感知:针对类无关候选区域的分类抽象,用于安全处理词汇外道路对象

Felix Schaller

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出开放世界层次感知层,在类无关区域候选上实现分类抽象,通过结合三类开放世界信号,在自动驾驶留类基准测试中,可安全处理词汇外道路对象且无分类错误。

Comments 6 pages, 4 figures, 1 table. Third paper in a series; v1 archived at Zenodo, doi:10.5281/zenodo.21593472. Code: https://github.com/freshNfunky/IE2025-Research-Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08025 2026-08-11 cs.RO cs.AI 新提交 62%

DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea

DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器

Jiaming Chen, Juntao Yang, Zhentao Zou, Qi Ming, Yi Yu, Zhihang Zhong, Xue Yang, Xue Jiang, Yue Zhou

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。

Comments 16pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07750 2026-08-11 cs.CV cs.AI 新提交 62%

Multi-Task Consistency-based Detection of Adversarial Attacks

基于多任务一致性的对抗攻击检测

Cong Chen, Jean-Philippe Monteuuis, Jonathan Petit

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶中DNNs易受对抗攻击且现有防御成本高的问题,提出基于多任务视觉任务输出一致性的高效检测方案,在BDD100k数据集上对PGD攻击的ROC-AUC达99.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07579 2026-08-11 cs.CV cs.AI 新提交 62%

Geometry Beats Estimated Depth: RGB-Only Multi-Camera 3D Tracking under Sim2Real

几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪

Abdullah Naeem, Anav Katwal, Ayon Dey, Noman Khan, Md Tamjidul Hoque

机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) PinPark, Inc.(PinPark公司)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11554 2026-08-11 cs.RO cs.CV cs.LG 版本更新 62%

HyperDet: 3D Object Detection with Hyper 4D Radar Point Clouds

HyperDet: 基于超4D雷达点云的3D目标检测

Yichun Xiao, Runwei Guan, Jin Jin, Fangqiang Ding

机构 * University of Edinburgh(爱丁堡大学) HKUST (GZ)(香港科技大学(广州)) University of Oxford(牛津大学) MIT(麻省理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。

Comments 11 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09597 2026-08-11 cs.CV 新提交 57%

ResemBrick: Brick Reconstruction from Photographs with Perceptual Fidelity and Buildability

ResemBrick:从照片重建兼具感知保真度与可建造性的积木模型

Xilun Chen, Hanwen Wan, Yusong Zhao, Zexin Lin, Ruixiang Liao, Xiaoqiang Ji

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 ResemBrick将离散化与组装耦合,通过预算占用补全和可建造性构建,生成兼具感知保真度与可建造性的积木模型,性能优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09493 2026-08-11 cs.CV 新提交 57%

GeoRoute: Geometry-Aware Hybrid Inference for Traffic Future-Frame Prediction

GeoRoute:面向交通未来帧预测的几何感知混合推理方法

Khang Minh Le, Hieu Dinh Trung Pham, Luu Thanh Danh, Nam-Tien Le, Hieu Anh Ngo, Phuong Huu Vu Tran, Son Nguyen Minh Le, Nguyen Trong Nghia, Tu Tran Thi Cam, Huy Minh Nhat Nguyen, Cuong Tuan Nguyen

机构 * Vietnamese-German University(越南-德国大学) University of Science, Ho Chi Minh City(胡志明市科学大学) Ho Chi Minh City University of Technology(胡志明市技术大学) University of Information Technology, Ho Chi Minh City(胡志明市信息技术大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 GeoRoute是一种无需训练的几何感知混合推理框架,通过多帧深度分层渲染器和视角条件选择预测器,在AI City Challenge Track 5基准上实现了具有竞争力的交通未来帧预测性能,提升了静态几何稳定性。

Comments accepted to the ECCV 2026 AI City Challenge Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08947 2026-08-11 cs.CV cs.HC cs.LG 新提交 57%

Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis

网络摄像头眼动能否约束驾驶模型中的 mesa 目标?一项仪器精度分析

Lennox Anderson, Ahmed Boutar, Jonah Mulcrone, Tal Erez

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 该研究探究能否用 WebGazer 眼动数据约束自动驾驶模型的 mesa 目标,经多组实验发现无统计显著效果,原因是 WebGazer 误差过大无法实现物体级注视归因。

Comments 6 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08476 2026-08-11 cs.CV 新提交 57%

RayLift: Lifting Complementary Ray-Wise Evidence with 3D Geometry Priors for Semantic Scene Completion

RayLift:利用3D几何先验提升互补射线级证据以实现语义场景补全

Meng Wang, Hongxia Yu, Wenzhe He, Xingdong Song, Huilong Pi, Jiapeng Zhang, Ruihui Li

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 针对现有语义场景补全方法的深度误差传播问题,提出RayLift框架,通过互补上下文编码器、深度射线证据提升模块和语义感知体素集成器,在两个基准数据集上实现优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07643 2026-08-11 cs.CV cs.LG 新提交 57%

Data collection from highways: a geometric, class-agnostic approach to embedded vehicle counting

高速公路数据采集:一种用于嵌入式车辆计数的几何、类别无关方法

Lucas Gouveia Omena Lopes, William W. M. Lira, Alexandre M. Lima, Thales M. A. Vieira

机构 * Universidade Federal de Alagoas(阿拉戈斯联邦大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出一种面向嵌入式设备的类别无关几何车辆计数方法,无需物体模型与训练集,在树莓派硬件上快于实时运行,实地部署准确率达91%,适用于无标注数据等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00854 2026-08-11 cs.RO 版本更新 57%

Minute-Scale Training for Microrobot Navigation

微型机器人导航的分钟级训练

Yinghan Sun, Aoji Zhu, Xiang Ji, Yamei Li, Jiachi Zhao, Yun Wang, Li Zhang, Huijun Gao, Lidong Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文针对微型机器人DRL导航训练耗时久的问题,提出含全向量化模拟器与TSR奖励框架的学习框架,将训练缩至10分钟内,支持零样本部署,可缩短设计周期、加速部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09245 2026-08-11 cs.CV 版本更新 57%

Bridging Object Detection and Segmentation with Polygon Detection Transformers

面向多实例分割的多边形检测变换器

Jiacheng Sun, Jiaqi Lin, Wenlong Hu, Haoyang Li, Xinghong Zhou, Chenghai Mao, Xinliang Zhang, Jianya Guo, Yuqiang Zhai, Yan Peng, Xiaomao Li

机构 * Shanghai University(上海大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 Poly-DETR通过极坐标表示将实例分割转化为稀疏顶点回归,实现更轻量的高分辨率分割,优于现有极坐标方法并在特定领域表现更优。

Comments Substantially revised and extended version with a new title, additional co-authors, new methodology, expanded experiments and analyses, and supplementary material in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00367 2026-08-11 cs.CR cs.AI 57%

PatchBlock: A Lightweight Defense Against Adversarial Patches for Embedded EdgeAI Devices

PatchBlock: 一种轻量级对抗性补丁防御方法用于边缘边缘AI设备

Nandish Chattopadhyay, Abdul Basit, Amira Guesmi, Muhammad Abdullah Hanif, Bassem Ouni, Muhammad Shafique

机构 * eBRAIN Lab, Division of Engineering, New York University (NYU) Abu Dhabi, UAE(eBRAIN实验室,工程系,纽约大学(NYU)阿布扎赫德分校) DakAI, Dubai, UAE(DakAI,迪拜,阿联酋)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 PatchBlock是一种轻量级防御方法,通过异常检测和降维技术有效检测并中和对抗性补丁,提升边缘AI设备的鲁棒性与效率。

Comments 7 pages, 5 figures, 5 tables, Accepted to DATE 2026

Journal ref 2026 Design, Automation & Test in Europe Conference (DATE), Verona, Italy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09062 2026-08-11 cs.CV cs.LG 版本更新 57%

SIP: Site in Pieces- A Dataset of Disaggregated Construction-Phase 3D Scans for Semantic Segmentation and Scene Understanding

SIP: 构建阶段碎片化3D扫描数据集——用于语义分割和场景理解

Seongyong Kim, Yong Kwon Cho

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 SIP数据集通过碎片化3D扫描反映施工现场实际约束,为建筑场景的语义分割和理解提供高质量基准数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08425 2026-08-11 cs.NI cs.DC 新提交 50%

PSP: Low-Overhead Packet-Level Load Balancing for Stale-State and Bandwidth-Asymmetric Networks

PSP:面向 stale 状态与带宽非对称网络的低开销报文级负载均衡

Jiaqi Liu, Chunyang Zhang, Heng Pan, Yanbiao Li

专题命中 感知 :occupancy(abstract)

AI总结 针对数据中心网络微突发与高并发问题,提出概率状态比例(PSP)报文级负载均衡算法,其性能优于 JSQ、随机调度,与 Top-k 相当且硬件成本更低,实现性能、稳定性与开销的平衡。

Comments 12 pages, 10 figures, 5 tables. Accepted by IEEE LCN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07725 2026-08-11 cs.LG 新提交 50%

Finite Constant Frontiers and Auditable Regret Certificates for Average-Reward Reinforcement Learning

平均奖励强化学习的有限常数前沿与可审计后悔证书

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 感知 :occupancy(abstract)

AI总结 本文针对平均奖励强化学习,提出感知常数的比较协议,推导通信MDP的有限下界证书,改进已发表系数,给出跨度约束乐观学习者的可审计组合规则,完成相关形式化与诊断测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25316 2026-08-11 eess.SP 版本更新 50%

An Extended Object Poisson Multi-Bernoulli Filter with Zero-Inflated Poisson Measurement Model Using Belief Propagation

基于零膨胀泊松模型和置信传播的扩展目标PMB滤波器

Xueqi Qiu, Yuxuan Xia, Hyowon Kim, Chaoqun Yang

专题命中 感知 :LiDAR(abstract)

AI总结 提出一种利用粒子置信传播高效实现零膨胀泊松模型下扩展目标泊松多伯努利滤波器的方法,通过因子图分解数据关联,提高估计精度和运行速度。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏