arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-06-16 至 2026-06-16 共收录 14 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 14 篇

2606.15896 2026-06-16 cs.RO cs.LG 新提交 70%

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors

LoComposition:无需步态先验的地形自适应高效四足运动

Loukas Kordos, Leonard T. Franz, Simon Rappenecker, Oliver Hausdoerfer, Angela P. Schoellig, Pavel Kolev, Georg Martius

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑工业大学) University of Stuttgart(斯图加特大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种将任务奖励、操作约束、能量最小化和地形感知分离的框架,无需显式步态先验,在四足机器人上实现高效地形自适应运动,运输成本降低56%,违规减少96%。

Comments 17 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07742 2026-06-16 cs.CV 70%

Efficient 3D Perception on Multi-Sweep Point Cloud with Gumbel Spatial Pruning

多扫点云上的高效3D感知与Gumbel空间修剪

Tianyu Sun, Jianhao Li, Xueqian Zhang, Zhongdao Wang, Bailan Feng, Hengshuang Zhao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Noah’s Ark Lab(诺亚实验室) Department of Computer Science, University of Hong Kong(香港大学计算机科学系)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究了户外环境中点云感知问题,通过累积多个连续点云扫描以提高感知精度,引入Gumbel空间修剪层有效减少冗余点,提升3D感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 67%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 62%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16558 2026-06-16 cs.AI cs.RO cs.SY eess.SY 新提交 62%

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。

Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24058 2026-06-16 cs.CV cs.AI 版本更新 62%

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

通过注意力不平衡修正减轻LVLM中的对象幻觉

Han Sun, Qin Li, Peixin Wang, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University(上海可信计算实验室,东华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 发现多模态和token间注意力不平衡是对象幻觉的因果因素,提出轻量级解码干预方法AIR,通过重新分配注意力权重修正不平衡,在多个基准上减少幻觉达35.1%,并提升通用能力。

Comments CVPR 2026 Findings Track, code is available at https://github.com/Ice-wave/AIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17049 2026-06-16 cs.CV 新提交 57%

BRDFusion: Physics Meets Generation for Urban Scene Inverse Rendering

BRDFusion:物理与生成结合的城市场景逆渲染

Yi-Ruei Liu, Jie-Ying Lee, Zheng-Hui Huang, Yu-Lun Liu, Chih-Hao Lin

机构 * National Yang Ming Chiao Tung University University of Illinois Urbana-Champaign National Taiwan University

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 提出BRDFusion框架,结合物理建模与生成先验,实现城市场景逆渲染,在保持物理一致性的同时修复伪影,支持新视角重光照、夜间模拟和动态物体编辑。

Comments Project page: https://shigon255.github.io/brdfusion-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15287 2026-06-16 cs.CV 新提交 57%

G2IA: Geometry-Guided Instance-Aware Retrieval and Refinement for Cross-Modal Place Recognition

G2IA: 几何引导的实例感知跨模态地点识别检索与精炼

Xianyun Jiao, Jingyi Xu, Zhongmiao Yan, Xieyuanli Chen, Ling Pei

机构 * Shanghai Jiao Tong University(上海交通大学) National University of Defense Technology(国防科技大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 提出G2IA框架,通过几何引导的实例感知检索和跨模态局部形状与空间布局验证,解决图像到点云地点识别中的模态差异和感知混淆问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15154 2026-06-16 cs.RO 新提交 57%

Task-Aware Environment Augmentation for Reliable Navigation via Shielded Conditional Diffusion

任务感知的环境增强:通过屏蔽条件扩散实现可靠导航

Bharawee Phoompho, Gokul Puthumanaillam, Yan Miao, Ruben Hernandez, Tim Bretl, Sayan Mitra, Melkior Ornik

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 针对部分可观测环境下的轨迹规划可靠性问题,提出任务感知的环境增强方法SCoDA,利用条件扩散模型学习最优视觉标记布局,通过屏蔽采样引导标记放置,提升轨迹执行可靠性和完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 57%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16069 2026-06-16 eess.SP 新提交 50%

Data Scarcity in Gas Load Profiling: Generalized Proxy-Guided Load and Temporal Disaggregation

燃气负荷分析中的数据稀缺性:广义代理引导的负荷与时间分解

Lucas Krome, Mahtab Aboufazeli, Soosan Beheshti, Bala Venkatesh

专题命中 感知 :occupancy(abstract)

AI总结 针对燃气数据稀缺问题,提出广义代理引导的负荷与时间分解框架,通过四阶段过程从低频数据重建高保真热负荷曲线,在11栋多单元住宅数据集上实现总燃气消耗均方百分比误差6.37%。

Comments This work has been accepted for presentation/publication at the 2026 IEEE Canadian Conference on Electrical and Computer Engineering (CCECE). The final published version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15463 2026-06-16 physics.ins-det cs.ET 新提交 50%

DarkFlow: Hierarchical Digital SiPM Architecture with Low-Loss Dataflow Readout for Dark Matter Detection

DarkFlow:用于暗物质探测的具有低损耗数据流读出的分层数字SiPM架构

Zirui Wang, Aras Repond, Shawn Westerdale, Wantong Li

专题命中 感知 :occupancy(abstract)

AI总结 提出DarkFlow分层数字SiPM架构,通过本地数据聚合、相对时间编码、背压控制和占用感知eDRAM突发缓冲,在十亿光子事件率下实现超低丢包,有效刷新率提升2.14倍,数字读出面积占比小于0.86%。

Comments Accepted to GLSVLSI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15221 2026-06-16 cs.CR 新提交 50%

Robust and Precise Application Fingerprinting on 5G Physical Uplink Channel

5G物理上行链路上的鲁棒且精确的应用指纹识别

Yu Li, Liqi Zhuang, Dong Wei, Jiwen Luo, Hang Zhang, Meng Zhang, Xiaona Li, Weiqing Huang

专题命中 感知 :occupancy(abstract)

AI总结 针对5G加密控制信道打破传统攻击链的问题,本文发现物理层侧信道(上行MCS稳定导致PRB数量反映IP包长度),结合上行控制信道重构双向流量,设计了三步被动攻击Crosshair,通过盲提取、数据增强和跨模态对齐实现高精度应用识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14992 2026-06-16 cs.AR cs.LG 新提交 50%

KATANA: A Fast, Low-Power Mapping of Kalman Filters onto Edge NPUs for Real-Time Tracking

KATANA:一种将卡尔曼滤波器快速、低功耗映射到边缘NPU上用于实时跟踪的方法

Bodhisatwa Kundu, Anish Rooj, Sumit Saha, Abhradeep Sarkar, Arghadip Das, Arnab Raha, Mrinal K. Naskar

机构 * Indian Institute of Technology, Kharagpur(印度理工学院,Khargpur分校)

专题命中 感知 :autonomous driving(abstract)

AI总结 针对实时跟踪系统中卡尔曼滤波器在边缘设备上的功耗和实时性约束,提出KATANA框架,通过三种代数图重写将LKF/EKF映射到商用NPU,在Intel Core Ultra系列上实现高达97.9%的动态能耗降低。

详情

展开后加载摘要…

URL PDF HTML 收藏