arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 21211 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6063 篇

2511.16857 2026-04-21 cs.CV cs.RO 62%

BOP-ASK: Object-Interaction Reasoning for Vision-Language Models

BOP-ASK:面向视觉-语言模型的对象交互推理

Vineet Bhat, Sungsu Kim, Valts Blukis, Greg Heinrich, Prashanth Krishnamurthy, Ramesh Karri, Stan Birchfield, Farshad Khorrami, Jonathan Tremblay

机构 * New York University(纽约大学) NVIDIA(英伟达)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 本文提出BOP-ASK数据集,用于训练和评估视觉-语言模型的对象交互推理能力,包含15万张图像和3300万对问题答案,涵盖六个任务,验证了模型在复杂环境中的空间推理能力。

Comments Accepted at CVPR 2026. Code, Datasets & Benchmark available at https://bop-ask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16582 2026-04-21 cs.CV cs.AI 62%

Camo-M3FD: A New Benchmark Dataset for Cross-Spectral Camouflaged Pedestrian Detection

Camo-M3FD:一种新的跨光谱伪装行人检测基准数据集

Henry O. Velesaca, Andrea Mero, Guillermo A. Castillo, Angel D. Sappa

机构 * ESPOL Polytechnic University(ESPOL理工大学) Computer Vision Center, Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机视觉中心) Software Engineering Department, Research Center for Information and Communication Technologies (CITIC-UGR), University of Granada(格拉纳达大学软件工程系,信息与通信技术研究中心(CITIC-UGR)) Università della Svizzera Italiana(瑞士意大利大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Camo-M3FD数据集,用于跨光谱伪装行人检测,通过高精度图像对和标准化评估框架提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16086 2026-04-20 cs.CV cs.AI cs.LG stat.ML 62%

Stylistic-STORM (ST-STORM) : Perceiving the Semantic Nature of Appearance

Stylistic-STORM (ST-STORM):感知外观的语义本质

Hamed Ouattara, Pierre Duthon, Pascal Houssam Salmane, Frédéric Bernardin, Omar Ait Aider

机构 * Intelligent Transportation Systems Research Team, Cerema(智能交通系统研究团队,Cerema) Clermont Auvergne INP, Université Clermont Auvergne, Institut Pascal, CNRS(克莱蒙奥弗涅INP,克莱蒙奥弗涅大学,帕斯卡尔研究所,CNRS)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 ST-STORM通过分离外观(风格)与内容的语义模态,改进自监督学习框架,提升对复杂外观现象的识别能力,同时保持语义表现的稳定性。

Comments 20 pages, 16 figures, ICPR 2026 (28th International Conference on Pattern Recognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10391 2026-04-14 cs.CV cs.AI 62%

FishRoPE: Projective Rotary Position Embeddings for Omnidirectional Visual Perception

FishRoPE: 用于全方位视觉感知的投影旋转位置嵌入

Rahul Ahuja, Mudit Jain, Bala Murali Manoghar Sai Sudhakar, Venkatraman Narayanan, Pratik Likhar, Varun Ravi Kumar, Senthil Yogamani

机构 * Automated Driving, Qualcomm Technologies, Inc(高通技术公司自动驾驶部门) Automated Driving, Qualcomm India Private Limited(高通印度私人有限公司自动驾驶部门)

专题命中 感知 :BEV(abstract);分类 cs.CV、cs.AI

AI总结 本文提出FishRoPE,通过轻量框架将冻结的视觉基础模型适配到鱼眼几何,利用旋转位置嵌入重新参数化注意力机制,实现角分离而非像素距离的处理,提升全方位视觉感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06982 2026-04-13 cs.CV cs.AI 62%

IntrinsicWeather: Controllable Weather Editing in Intrinsic Space

IntrinsicWeather: 内在空间中可控的天气编辑

Yixin Zhu, Zuo-Liang Zhu, Jian Yang, Miloš Hašan, Jin Xie, Beibei Wang

机构 * Nanjing University(南京大学) Nankai University(南开大学) NVIDIA(英伟达)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出IntrinsicWeather框架,通过内在空间编辑实现可控天气生成,利用内在映射提升大场景控制能力,并在合成与真实数据集上验证其优越性。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04843 2026-04-07 cs.CV cs.AI 62%

InfBaGel: Human-Object-Scene Interaction Generation with Dynamic Perception and Iterative Refinement

InfBaGel: 基于动态感知和迭代细化的人-物体-场景交互生成

Yude Zou, Junji Gong, Xing Gao, Zixuan Li, Tianxing Chen, Guanjie Zheng

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Sichuan University(四川大学) Shenzhen University(深圳大学) The University of Hong Kong(香港大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种粗到细的指令条件交互生成框架,结合一致性模型的迭代去噪过程,通过动态感知策略和 bump-aware 指导减少物理伪影,提升 HOSI 和 HOI 生成性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04490 2026-04-07 eess.SP cs.AI eess.IV 62%

RAVEN: Radar Adaptive Vision Encoders for Efficient Chirp-wise Object Detection and Segmentation

RAVEN:用于高效脉冲波束成像的雷达自适应视觉编码器

Anuvab Sen, Mir Sayeed Mohammad, Saibal Mukhopadhyay

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 感知 :BEV(abstract);分类 eess.IV、cs.AI

AI总结 RAVEN通过高效处理雷达数据实现目标检测和分割,采用自适应编码和早退出机制提升效率,减少计算量和延迟。

Comments CVPR submission / conference paper

Journal ref Computer Vision and Pattern Recognition Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02903 2026-04-06 cs.CV cs.AI 62%

RayMamba: Ray-Aligned Serialization for Long-Range 3D Object Detection

RayMamba:基于射线对齐的长距离3D目标检测串行化

Cheng Lu, Mingqian Ji, Shanshan Zhang, Zhihao Li, Jian Yang

机构 * School of Computer Science and Technology, Nanjing University of Science and Technology(南京理工大学计算机科学与技术学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 RayMamba通过射线对齐策略优化稀疏场景下的3D目标检测,提升远距离场景的上下文建模效率,实现mAP和NDS的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 62%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26724 2026-03-31 cs.CV cs.RO 62%

An Annotation-to-Detection Framework for Autonomous and Robust Vine Trunk Localization in the Field by Mobile Agricultural Robots

一种用于田间自主和鲁棒葡萄藤主干定位的标注到检测框架

Dimitrios Chatziparaschis, Elia Scudiero, Brent Sams, Konstantinos Karydis

机构 * Dept. of Environmental Sciences, Univ. of California, Riverside(加州大学河滨分校环境科学系) Gallo(嘉露酒庄)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种标注到检测框架,利用有限标注数据训练多模态检测器,通过跨模态标注转移和早起传感器融合,提升田间葡萄藤主干定位的鲁棒性与准确性。

Comments 7 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26018 2026-03-30 cs.CV cs.RO 62%

GeoReFormer: Geometry-Aware Refinement for Lane Segment Detection and Topology Reasoning

GeoReFormer:基于几何的车道线段检测与拓扑推理 refinement

Danny Abraham, Nikhil Kamalkumar Advani, Arun Das, Nikil Dutt

机构 * University of California, Irvine(加州大学尔湾分校) Bosch North America(博世北美)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 GeoReFormer 提出一种统一的查询架构,通过嵌入几何和拓扑诱导偏差,提升车道线段检测和拓扑推理的精度与一致性,实现在 OpenLane-V2 上 34.5% 的 mAP 成绩。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20583 2026-03-25 cs.RO cs.CV 62%

GHOST: Ground-projected Hypotheses from Observed Structure-from-Motion Trajectories

GHOST:从观测到结构从运动轨迹中推导出的地面投影假设

Tomasz Frelek, Rohan Patil, Akshar Tumu, Henrik I. Christensen

机构 * Department of Computer Science and Engineering, UC San Diego, United States(计算机科学与工程系,加州大学圣地亚哥分校,美国)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种可扩展的自监督方法,用于在复杂城市环境中从单目图像中分割可行的车辆轨迹。通过大规模监控摄像头视频,利用记录的车辆运动作为隐式监督,通过单目结构从运动恢复相机轨迹,并投影到地面平面以生成未手动标注的区域空间掩码。

Comments 8 pages, 27 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20777 2026-03-24 cs.LG cs.AI cs.CV 62%

OmniPatch: A Universal Adversarial Patch for ViT-CNN Cross-Architecture Transfer in Semantic Segmentation

OmniPatch: 一种适用于ViT-CNN跨架构迁移的通用对抗补丁

Aarush Aggarwal, Akshat Tomar, Amritanshu Tiwari, Sargam Goyal

机构 * Data Science Group, Indian Institute of Technology Roorkee(数据科学组,印度理工学院罗里克分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出OmniPatch,一种能跨图像和ViT-CNN架构通用的对抗补丁训练框架,无需目标模型参数即可提升语义分割的鲁棒性。

Comments 10 pages, 4 figures, ICLR 2026: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20234 2026-03-24 cs.RO cs.AI 62%

Emergency Lane-Change Simulation: A Behavioral Guidance Approach for Risky Scenario Generation

紧急车道变更模拟:一种行为引导方法用于高风险场景生成

Chen Xiong, Cheng Wang, Yuhang Liu, Zirui Wu, Ye Tian

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能系统工程学院) Guangdong Provincial Key Laboratory of Intelligent Transportation System, Sun Yat-sen University(广东省智能交通系统重点实验室) Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) School of Traffic Engineering and the Key Laboratory of Road and Traffic Engineering, Ministry of Education, Tongji University(同济大学交通工程学院及交通工程重点实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种基于行为学习的方法,通过优化序列生成对抗网络学习紧急车道变更行为,结合递归近端策略优化策略生成高风险碰撞场景,提升风险探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18218 2026-03-20 cs.CV cs.RO 62%

Semantic Segmentation and Depth Estimation for Real-Time Lunar Surface Mapping Using 3D Gaussian Splatting

基于3D高斯溅射的实时月球表面制图中的语义分割与深度估计

Guillem Casadesus Vila, Adam Dai, Grace Gao

机构 * Department of Aeronautics and Astronautics(航空航天系)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种实时制图框架,结合密集感知模型与3D高斯溅射表示,在挑战性环境下实现高精度月球表面制图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16927 2026-03-19 cs.CV eess.IV 62%

Leveraging Large Vision Model for Multi-UAV Co-perception in Low-Altitude Wireless Networks

利用大型视觉模型实现低空无线网络中多无人机协同感知

Yunting Xu, Jiacheng Wang, Ruichen Zhang, Changyuan Zhao, Yinqiu Liu, Dusit Niyato, Liang Yu, Haibo Zhou, Dong In Kim

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) Alibaba Cloud(阿里云) School of Electronic Science and Engineering, Nanjing University(南京大学电子科学与技术学院) Department of Electrical and Computer Engineering, Sungkyunkwan University(成均馆大学电子与计算机工程系)

专题命中 感知 :BEV(abstract);分类 cs.CV、eess.IV

AI总结 本文提出一种通信高效的多无人机协同感知框架BHU,通过Top-K选择机制和Swin-large-based MaskDINO编码器提升感知性能,同时利用深度强化学习优化协作无人机选择和资源分配,实验表明在资源受限环境下感知性能提升超5%且通信开销降低85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16439 2026-03-18 cs.CV cs.AI 62%

CD-FKD: Cross-Domain Feature Knowledge Distillation for Robust Single-Domain Generalization in Object Detection

CD-FKD:跨域特征知识蒸馏用于目标检测中鲁棒的单域泛化

Junseok Lee, Sungho Shin, Seongju Lee, Kyoobin Lee

机构 * Advanced Robotics Lab, LG Electronics(LG电子先进机器人实验室) Place AI Flatform, Naver(NAVER人工智能平台) Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(全州科学技术院人工智能融合系)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CD-FKD方法,通过全局和实例级特征蒸馏提升学生网络的泛化能力,有效应对跨域变化,实验表明其在目标域泛化和源域性能上优于现有方法。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13365 2026-03-17 cs.CV cs.AI 62%

WaveComm: Lightweight Communication for Collaborative Perception via Wavelet Feature Distillation

WaveComm: 通过小波特征蒸馏实现轻量级协作感知通信

Erdemt Bao, Jin Yang

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 WaveComm通过小波变换减少通信开销,保持低带宽环境下感知性能,实验显示在通信量减少至原值86.3%和87.0%时仍保持先进性能。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 62%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19195 2026-03-10 cs.CV cs.AI 62%

Rethinking Driving World Model as Synthetic Data Generator for Perception Tasks

重新思考驾驶世界模型作为感知任务的合成数据生成器

Kai Zeng, Zhanqian Wu, Kaixin Xiong, Xiaobao Wei, Xiangyu Guo, Zhenxin Zhu, Kalok Ho, Lijun Zhou, Bohan Zeng, Ming Lu, Haiyang Sun, Bing Wang, Guang Chen, Hangjun Ye, Wentao Zhang

机构 * Peking University(北京大学) Xiaomi EV(小米电动车) Huazhong University of Science and Technology(华中科技大学) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Zhongguancun Academy(中关村学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 Dream4Drive通过生成高质量的合成数据提升自动驾驶感知任务性能

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13912 2026-03-10 cs.RO cs.AI 62%

Energy-Efficient SLAM via Joint Design of Sensing, Communication, and Exploration Speed

通过联合设计感知、通信和探索速度实现节能SLAM

Zidong Han, Ruibo Jin, Xiaoyang Li, Bingpeng Zhou, Qinyu Zhang, Yi Gong

机构 * Southern University of Science and Technology(南方科技大学) Harbin Institute of Technoglogy (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) The School of Electronics and Communication Engineering(电子与通信工程学院) Sun Yat-sen University(中山大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI

AI总结 本文提出通过联合优化感知、通信和探索速度,实现节能的持续SLAM系统,利用深度学习方法提升地图重建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02200 2026-03-03 cs.CV cs.AI cs.LG 62%

Adaptive Confidence Regularization for Multimodal Failure Detection

多模态故障检测的自适应置信度正则化

Moru Liu, Hao Dong, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所)

专题命中 感知 :self-driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出自适应置信度正则化方法,通过检测多模态预测中的置信度退化,提升故障识别的可靠性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26324 2026-03-03 cs.RO cs.AI cs.MA 62%

COMRES-VLM: Coordinated Multi-Robot Exploration and Search using Vision Language Models

COMRES-VLM: 基于视觉语言模型的多机器人协同探索与搜索

Ruiyang Wang, Hao-Lun Hsu, David Hunt, Jiwoo Kim, Shaocheng Luo, Miroslav Pajic

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 COMRES-VLM通过视觉语言模型实现多机器人系统的协同探索与搜索,提升探索效率和目标物体搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22731 2026-02-27 cs.RO cs.CV 62%

Sapling-NeRF: Geo-Localised Sapling Reconstruction in Forests for Ecological Monitoring

Sapling-NeRF: 用于森林生态监测的地理定位幼树重建

Miguel Ángel Muñoz-Bañón, Nived Chebrolu, Sruthi M. Krishna Moorthy, Yifu Tao, Fernando Torres, Roberto Salguero-Gómez, Maurice Fallon

机构 * Oxford Robotics Institute, Department of Engineering Science, University of Oxford, Oxford, UK(牛津大学机器人研究所、工程科学系、牛津大学、牛津、英国) Group of Automation, Robotics and Computer Vision, University of Alicante, Alicante, Spain(自动化、机器人与计算机视觉小组、阿尔瓦登特大学、阿尔瓦登特、西班牙) Department of Biology, University of Oxford, Oxford, UK(生物学系、牛津大学、牛津、英国)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Sapling-NeRF方法,结合NeRF、LiDAR SLAM和GNSS,实现地理定位的幼树重建,提升森林生态监测的精度和长期数据采集能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06491 2026-02-27 cs.CV cs.RO 62%

PPT: Pretraining with Pseudo-Labeled Trajectories for Motion Forecasting

PPT:基于伪标签轨迹的运动预测预训练

Yihong Xu, Yuan Yin, Éloi Zablocki, Tuan-Hung Vu, Alexandre Boulch, Matthieu Cord

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 PPT通过利用伪标签轨迹进行预训练,提升运动预测的泛化能力和在低数据环境下的性能。

Comments 8 pages, 6 figures, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18207 2026-02-27 cs.CV cs.AI 62%

From Open Vocabulary to Open World: Teaching Vision Language Models to Detect Novel Objects

从开放词汇到开放世界:教会视觉语言模型检测新物体

Zizhao Li, Zhengkang Xiang, Joseph West, Kourosh Khoshelham

机构 * The University of Melbourne Parkville, VIC, Australia(墨尔本大学帕克维尔分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种开放世界框架,使OVD模型能够检测新物体,通过引入OWEL和MSCAL方法提升模型对远超出分布物体的识别能力。

Comments Accepted by BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18850 2026-02-24 cs.RO cs.AI 62%

When the Inference Meets the Explicitness or Why Multimodality Can Make Us Forget About the Perfect Predictor

当推理遇见显式性或为什么多模态可以让我们忘记完美预测器

J. E. Domínguez-Vidal, Alberto Sanfeliu

机构 * Institut de Robòtica i Informàtica Industrial (CSIC-UPC)(机器人与信息工业研究所(CSIC-UPC)) Universitat Politècnica de Catalunya - BarcelonaTech (UPC)(加泰罗尼亚理工大学-巴塞罗那技术大学(UPC))

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI

AI总结 本文探讨了在人机协作任务中,显式通信与推理系统结合的效果,发现人类更倾向于自然的交互方式,且最佳策略是两者的结合。

Comments Original version submitted to the International Journal of Social Robotics. Final version available on the SORO website

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00497 2026-02-24 cs.RO cs.CV 62%

FLUID: A Fine-Grained Lightweight Urban Signalized-Intersection Dataset of Dense Conflict Trajectories

FLUID: 一种细粒度轻量级密集冲突轨迹的城市信号交叉口数据集

Yiyang Chen, Zhigang Wu, Guohong Zheng, Xuesong Wu, Liwen Xu, Haoyuan Tang, Zhaocheng He, Haipeng Zeng

机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(智能系统工程学院,中山大学) Guangdong Provincial Key Laboratory of Intelligent Transportation Systems(广东省智能交通系统重点实验室) Pengcheng Laboratory(鹏城实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 FLUID数据集通过细粒度轨迹记录和轻量级处理框架,为研究城市信号交叉口的密集冲突提供了高时空精度的数据支持。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20174 2026-02-24 cs.CV cs.AI 62%

LRR-Bench: Left, Right or Rotate? Vision-Language models Still Struggle With Spatial Understanding Tasks

LRR-Bench:左、右还是旋转?视觉-语言模型在空间理解任务上仍面临挑战

Fei Kong, Jinhao Duan, Kaidi Xu, Zhenhua Guo, Xiaofeng Zhu, Xiaoshuang Shi

机构 * University of Electronic Science and Technology of China(电子科技大学) Drexel University(德雷塞尔大学) Tianyijiaotong Technology Ltd.(天奕交通技术有限公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 LRR-Bench通过合成数据评估视觉-语言模型在空间理解任务上的性能,发现其在复杂任务上的表现远低于人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17252 2026-02-20 cs.CV cs.SY eess.IV eess.SY 62%

A Multi-modal Detection System for Infrastructure-based Freight Signal Priority

基于基础设施的货运信号优先的多模态检测系统

Ziyan Zhang, Chuheng Wei, Xuanpeng Zhao, Siyan Li, Will Snyder, Mike Stas, Peng Hao, Kanok Boriboonsomsin, Guoyuan Wu

专题命中 感知 :LiDAR(abstract);分类 cs.CV、eess.IV

AI总结 本文提出了一种基于激光雷达和摄像头的多模态货运车辆检测系统,通过混合传感架构和卡尔曼滤波实现稳定实时性能,用于支持基于基础设施的货运信号优先应用。

Comments 12 pages, 15 figures. Accepted at ICTD 2026. Final version to appear in ASCE Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏