arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 1476 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 仿真评测 1476 篇

2604.04198 2026-07-02 cs.CV cs.RO 版本更新 62%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 62%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17015 2026-06-19 cs.AI cs.MA cs.RO 版本更新 62%

UniMM: A Unified Mixture Model Framework for Multi-Agent Simulation

UniMM:一种用于多智能体仿真的统一混合模型框架

Longzhong Lin, Xuewu Lin, Kechun Xu, Haojian Lu, Lichao Huang, Rong Xiong, Yue Wang

机构 * Zhejiang University(浙江大学) Horizon Robotics

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出UniMM框架统一回归混合模型与离散NTP模型,通过闭环样本生成缓解分布偏移,并在WOSAC基准上取得最优性能。

Comments Accepted author manuscript. The version of record has been published in IEEE Transactions on Pattern Analysis and Machine Intelligence

Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, Early Access, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12207 2026-06-11 cs.RO cs.AI 新提交 62%

Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends

具身基准构建的智能自动化:流程、具身、模拟器与趋势

Jinshan Lai, Jianwei Hu, Baoyang Jiang, Fengchun Zhang, Leyuan Wang, Haotian Li, Yida Wang, Tingxuan Huang, Xi Ren, Qiang Ma

机构 * University of Electronic Science and Technology of China(电子科技大学) Qiyuan Lab(启元实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文综述具身智能基准构建的五阶段流程,分析从人工到自动化再到智能体闭环的转变,指出自动化将成本转向验证与治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09746 2026-06-09 cs.CV cs.AI cs.LG 新提交 62%

Hybrid Robustness Verification for Spatio-Temporal Neural Networks

时空神经网络的混合鲁棒性验证

Sherwin Varghese, Matthew Wicker, Alessio Lomuscio

机构 * Imperial College London(伦敦帝国学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对3D CNN在视频和体素输入中的鲁棒性验证,提出时空约束建模和STBP框架,实现精确闭式传播与可扩展近似,在UCF-101等基准上提升1.7倍认证鲁棒准确率。

Comments Accepted at the 9th International Symposium on AI Verification (SAIV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21172 2026-06-09 cs.AI cs.CV 版本更新 62%

NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

NoRD: 一种无需推理的高数据效率视觉-语言-动作模型

Ishaan Rawal, Shubh Gupta, Yihan Hu, Wei Zhan

机构 * Applied Intuition Texas A&M University(德克萨斯大学A&M分校) UC Berkeley(伯克利加州大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出NoRD模型,通过无需推理标注和仅需<60%数据微调,结合Dr. GRPO算法克服难度偏差,实现与现有VLA模型相当的性能,显著降低数据与计算开销。

Comments Accepted to CVPR 2026. Code available at: https://github.com/Applied-Open-Source/nord

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07366 2026-06-08 cs.CV cs.LG cs.RO 新提交 62%

Dash2Sim: Closed-Loop Driving Simulation from in-the-wild Dashcam Videos

Dash2Sim: 来自野外行车记录仪视频的闭环驾驶仿真

Anurag Ghosh, Francesco Pittaluga, Khiem Vuong, Angela Chen, Juan Alvarez-Padilla, Manmohan Chandraker, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学) NEC Labs America(NEC美国实验室) MIT(麻省理工学院) UC San Diego(加州大学圣地亚哥分校)

专题命中 仿真评测 :self-driving(abstract);分类 cs.RO、cs.CV

AI总结 提出Dash2Sim框架,将单目行车记录仪视频转化为度量级、地理参考的4D驾驶日志,用于闭环仿真,并构建ROADWork4D基准数据集,验证了施工区场景对规划器的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06423 2026-06-05 cs.RO cs.AI 62%

RiskFlow: Fast and Faithful Safety-Critical Traffic Scenario Generation

RiskFlow: 快速且保真的安全关键交通场景生成

Qi Lan, Yining Tang, Yu Shen, Yi Zhou, Yuhao Wei, Jie Li, Guofa Li

机构 * National University of Singapore(新加坡国立大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出RiskFlow框架,通过动作空间中的单次前向传输替代迭代去噪,实现快速、保真的安全关键多智能体交通场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08438 2026-06-02 cs.CV cs.AI 62%

A Survey of 3D Reconstruction with Event Cameras

事件相机三维重建综述

Chuanzhi Xu, Haoxian Zhou, Langyi Chen, Haodong Chen, Zeke Zexi Hu, Zhicheng Lu, Ying Zhou, Vera Chung, Qiang Qu, Weidong Cai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文首次全面综述了基于事件相机的三维重建方法,按输入模态(立体、单目、多模态)和重建技术(几何、深度学习、神经渲染如NeRF和3DGS)分类,并讨论了数据集、评估、表示和动态场景重建等挑战。

Comments This survey has been accepted for publication in the Computational Visual Media Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.15676 2026-06-02 cs.CV cs.AI 62%

Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation

多模态3D智能的最新进展:综合调查与评估

Yinjie Lei, Zixuan Wang, Feng Chen, Guoqing Wang, Peng Wang, Yang Yang

机构 * College of Electronics and Information Engineering, Sichuan University(四川大学电子信息工程学院) School of Computer Science, University of Adelaide(阿德莱德大学计算机科学学院) School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文系统综述了多模态3D智能方法,提出基于模态和任务的新分类法,并比较了基准数据集上的结果,最后讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04863 2026-05-28 cs.CV cs.AI 62%

Manboformer: Learning Gaussian Representations via Spatial-temporal Attention Mechanism

Manboformer: 通过时空注意力机制学习高斯表示

Ziyue Zhao, Qining Qi, Jianfa Ma

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对自动驾驶3D语义占用预测中高斯表示性能不足的问题,提出利用时空自注意力机制优化GaussianFormer,以提升模型性能。

Comments After careful self-check, we found several unnoticed deficiencies and incomplete discussions in this manuscript. To ensure the rigor and accuracy of academic results, we decide to withdraw this preprint. A refined, complete, and rigorous version will be submitted soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24037 2026-05-26 cs.CV cs.AI 62%

Mode-as-Sequence: Translating Multimodal Motion Prediction into Unified Sequential Mode Modeling

模式即序列:将多模态运动预测转化为统一序列模式建模

Zikang Zhou, Haibo Hu, Xinhong Chen, Yifan Zhang, Nan Guan, Yung-Hui Li, Chun Jason Xue, Jianping Wang

机构 * City University of Hong Kong(香港城市大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞)) Hon Hai Research Institute(富士康研究学院) Mohamed bin Zayed University of Artificial Intelligence(莫莫丁·宾·扎耶德人工智能大学)

专题命中 仿真评测 :LiDAR(abstract);分类 cs.CV、cs.AI

AI总结 提出Mode-as-Sequence框架,将无序模式集转化为有序模式序列并显式建模模式间依赖,通过ModeSeq和Parallel ModeSeq两种实例化方法解决多模态运动预测中的模式坍塌和置信度排序问题,在Waymo数据集上取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV 62%

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.02604 2026-04-27 cs.CV cs.AI 62%

PSI: A Benchmark for Human Interpretation and Response in Traffic Interactions

PSI:用于交通互动中人类解释与响应的基准

Taotao Jing, Tina Chen, Renran Tian, Yaobin Chen, Joshua Domeyer, Heishiro Toyoda, Rini Sherony, Zhengming Ding

机构 * Tulane University(路易斯安那州立大学) Purdue University(普渡大学) North Carolina State University(北卡罗来纳州立大学) Toyota Motor North America(丰田美国公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 PSI基准通过捕捉行人过马路意图的动态变化,结合人类文本解释,为开发可解释且符合人类认知的自动驾驶系统提供支持。

Comments Published in NeurIPS 2025 datasets and benchmarks track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11400 2026-04-14 cs.RO cs.CV 62%

EagleVision: A Multi-Task Benchmark for Cross-Domain Perception in High-Speed Autonomous Racing

EagleVision:面向高速自动驾驶赛事的多任务基准测试

Zakhar Yagudin, Murad Mebrahtu, Ren Jin, Jiaqi Huang, Yujia Yue, Dzmitry Tsetserukou, Jorge Dias, Majid Khonji

机构 * Skolkovo Institute of Science, Intelligent Space Robotics Laboratory, Center for Engineering Systems and Sciences(斯科尔科沃科学技术学院,智能空间机器人实验室,工程系统与科学中心) Khalifa University, KUCARS-KU Center for Autonomous Robotic Systems, Department of Computer Science(哈利法大学,KUCARS-KU自主机器人系统中心,计算机科学系) Beijing Institute of Technology, Beijing Key Laboratory of UAV Autonomous Control(北京理工大学,北京无人机自主控制重点实验室)

专题命中 仿真评测 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出EagleVision基准测试,用于研究高速自动驾驶赛事中跨领域感知问题,通过统一的LiDAR多任务基准,提供新标注的3D边界框数据及共同评估协议,验证了跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 62%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23369 2026-04-13 cs.CV cs.RO 62%

SimScale: Learning to Drive via Real-World Simulation at Scale

SimScale:通过大规模真实世界模拟学习驾驶

Haochen Tian, Tianyu Li, Haochen Liu, Jiazhi Yang, Yihang Qiu, Guang Li, Junli Wang, Yinfeng Gao, Zhang Zhang, Liang Wang, Hangjun Ye, Tieniu Tan, Long Chen, Hongyang Li

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) OpenDriveLab at The University of Hong Kong(香港大学OpenDriveLab) Xiaomi EV(小米汽车)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SimScale框架,通过合成大规模未见状态提升自动驾驶鲁棒性和泛化能力,实验显示在navhard和navtest上分别提升8.6和2.9 EPDMS。

Comments CVPR 2026 Oral. Project page: https://opendrivelab.com/SimScale

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08031 2026-04-10 cs.RO cs.CV 62%

Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆

Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo

机构 * Jilin University(吉林大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Tongji University(同济大学) NKIARI Nankai University(南开大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07151 2026-04-09 cs.RO cs.CV 62%

An RTK-SLAM Dataset for Absolute Accuracy Evaluation in GNSS-Degraded Environments

一种用于GNSS退化环境中绝对精度评估的RTK-SLAM数据集

Wei Zhang, Vincent Ress, David Skuddis, Uwe Soergel, Norbert Haala

机构 * Institute for Photogrammetry and Geoinformatics, University of Stuttgart(斯图加特大学摄影测量与地理信息学研究所)

专题命中 仿真评测 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一个地质参考数据集和评估方法,揭示RTK-SLAM系统在绝对精度评估中的缺陷,通过分离RTK接收器与地面真实值,评估不同SLAM系统在开放天空和室内环境下的精度表现。

Comments Accepted by ISPRS congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09228 2026-04-07 cs.CV cs.AI 62%

Clear Roads, Clear Vision: Advancements in Multi-Weather Restoration for Smart Transportation

清晰的道路,清晰的视野:智能交通中多天气恢复的进展

Vijay M. Galshetwar, Praful Hambarde, Prashant W. Patil, Akshay Dudhane, Sachin Chaudhary

机构 * Finolex Academy of Management and Technology(Finolex管理与技术学院) Drone Lab, Centre for Artificial Intelligence and Robotics, IIT Mandi(印度理工学院曼迪分校人工智能与机器人中心无人机实验室) Mehta Family School of Data Science and Artificial Intelligence, IIT Guwahati(印度理工学院古瓦哈提分校梅塔家族数据科学与人工智能学院) SPACE42 Centre of Excellence: Artificial Intelligence, School of Computer Science, UPES Dehradun(UPES德拉敦分校计算机科学学院人工智能卓越中心)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了图像和视频恢复技术,以缓解天气引起的视觉障碍,分类了传统方法和数据驱动模型,并讨论了多天气系统和未来方向。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01723 2026-04-03 cs.RO cs.AI 62%

Causal Scene Narration with Runtime Safety Supervision for Vision-Language-Action Driving

基于运行时安全监督的因果场景叙述用于视觉-语言-动作驾驶

Yun Li, Yidu Zhang, Simon Thompson, Ehsan Javanmardi, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) TIER IV, Inc.(TIER IV 公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CSN方法,通过意图约束对齐、定量 grounding 和结构分离重构VLA文本输入,提升驾驶评分并增强安全性。

Comments 18 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26067 2026-03-30 cs.CV cs.AI 62%

R-PGA: Robust Physical Adversarial Camouflage Generation via Relightable 3D Gaussian Splatting

R-PGA:通过可重照明的3D高斯点散布实现鲁棒的物理对抗伪装生成

Tianrui Lou, Siyuan Liang, Jiawei Liang, Yuze Gao, Xiaochun Cao

机构 * School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区网络空间安全学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligent Systems Engineering, Shenzhen Campus, Sun Yat-sen University(中山大学深圳校区智能工程学院)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出R-PGA框架,通过可重照明的3D高斯点散布技术,解决自动驾驶系统中对抗性伪装生成的鲁棒性问题,提升复杂动态场景下的泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24989 2026-03-30 cs.RO cs.AI 62%

Learning Rollout from Sampling:An R1-Style Tokenized Traffic Simulation Model

从采样中学习:一种R1风格的分词交通仿真模型

Ziyan Wang, Peng Chen, Ding Li, Chiwei Li, Qichao Zhang, Zhongpu Xia, Guizhen Yu

机构 * State Key Laboratory of Intelligent Transportation System, Key Laboratory of Autonomous Transportation Technology for Special Vehicles, Ministry of Industry and Information Technology, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院,智能交通系统国家重点实验室,特种车辆自主运输技术重点实验室(工业和信息化部)) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所,多模态人工智能系统国家重点实验室)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 本文提出R1Sim模型,通过分词交通仿真结合熵引导采样和GRPO优化,实现探索与利用的平衡,生成真实安全的多智能体行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19852 2026-03-23 cs.CV cs.AI cs.LG 62%

Failure Modes for Deep Learning-Based Online Mapping: How to Measure and Address Them

深度学习在线建图的失效模式:如何衡量和解决这些模式

Michael Hubbertz, Qi Han, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学) Aptiv Services Deutschland GmbH(Aptiv Services 德国分公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出框架识别和测量深度学习在线建图的失效模式,通过分离记忆输入特征和过拟合已知地图几何的效应,引入基于Fréchet距离的重建统计量和互补失效模式评分,分析数据集偏差并提出地图几何感知诊断方法,实验表明多样化和平衡的训练集能提升性能。

Comments Accepted to CVPR 2026, final camera ready version is published there

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24096 2026-03-06 cs.CV cs.AI cs.LG 62%

DiffusionHarmonizer: Bridging Neural Reconstruction and Photorealistic Simulation with Online Diffusion Enhancer

DiffusionHarmonizer: 通过在线扩散增强器连接神经重建与逼真模拟

Yuxuan Zhang, Katarína Tóthová, Zian Wang, Kangxue Yin, Haithem Turki, Riccardo de Lutio, Yen-Yu Chang, Or Litany, Sanja Fidler, Zan Gojcic

机构 * NVIDIA University of Toronto(多伦多大学) Cornell University(康奈尔大学) Technion(技术学院)

专题命中 仿真评测 :self-driving(abstract);分类 cs.CV、cs.AI

AI总结 DiffusionHarmonizer通过在线扩散增强器提升神经重建与逼真模拟的结合,解决动态物体整合与伪影问题,提高模拟保真度。

Comments For more details and updates, please visit our project website: https://research.nvidia.com/labs/sil/projects/diffusion-harmonizer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23993 2026-03-03 cs.CV cs.RO 62%

Advancing Multi-agent Traffic Simulation via R1-Style Reinforcement Fine-Tuning

通过R1风格强化微调推进多智能体交通模拟

Muleilan Pei, Shaoshuai Shi, Shaojie Shen

机构 * Hong Kong University of Science and Technology(香港理工大学) Voyager Research, Didi Chuxing(Voyager研究,滴滴出行)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 SMART-R1通过R1风格强化微调提升多智能体交通模拟的现实度与性能

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18060 2026-02-26 cs.LG cs.AI cs.RO 62%

SPACeR: Self-Play Anchoring with Centralized Reference Models

SPACeR:基于集中参考模型的自我对战锚定

Wei-Jer Chang, Akshay Rangesh, Kevin Joseph, Matthew Strong, Masayoshi Tomizuka, Yihan Hu, Wei Zhan

机构 * Applied Intuition University of California, Berkeley(加州大学伯克利分校) New York University(纽约大学) Stanford University(斯坦福大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 SPACeR通过集中参考模型指导自我对战,实现高效、可扩展的自动驾驶策略生成。

Comments Accepted at ICLR 2026. Project page: https://spacer-ai.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08831 2026-02-23 cs.CV cs.LG cs.RO 62%

View Invariant Learning for Vision-Language Navigation in Continuous Environments

连续环境中视觉语言导航的视角不变学习

Josh Qixuan Sun, Huaiyuan Weng, Xiaoying Xing, Chul Min Yeum, Mark Crowley

机构 * Department of Electrical and Computer Engineering, University of Waterloo(电气与计算机工程系,滑铁卢大学) Department of Civil and Environmental Engineering, University of Waterloo(土木与环境工程系,滑铁卢大学) Department of Electrical and Computer Engineering, Northwestern University(电气与计算机工程系,西北大学)

专题命中 仿真评测 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VIL框架,通过对比学习和教师-学生机制提升连续环境中视觉语言导航的视角鲁棒性,实验表明其在多个基准数据集上性能优越。

Comments This paper is accepted to RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18094 2026-02-23 cs.CV cs.AI cs.DB 62%

OODBench: Out-of-Distribution Benchmark for Large Vision-Language Models

OODBench: 用于大型视觉-语言模型的分布外基准

Ling Lin, Yang Bai, Heng Su, Congcong Zhu, Yaoxing Wang, Yang Zhou, Huazhu Fu, Jingrun Chen

机构 * University of Science and Technology of China Suzhou Institute for Advanced Research, USTC Key Laboratory of the Ministry of Education for Mathematical Foundations Unmanned System Research Institute, Northwestern Polytechnical University

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 OODBench提出了一种自动化方法,用于构建评估大型视觉-语言模型处理分布外数据能力的基准,并展示了当前模型在面对此类数据时的性能下降。

Comments 54 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14989 2026-02-17 cs.CV cs.AI cs.LG 62%

ThermEval: A Structured Benchmark for Evaluation of Vision-Language Models on Thermal Imagery

ThermEval: 一种用于评估视觉语言模型在热成像上的性能的结构化基准

Ayush Shrivastava, Kirtan Gangani, Laksh Jain, Mayank Goel, Nipun Batra

机构 * Indian Institute of Technology, Gandhinagar, India(印度理工学院加尔各答分校) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 ThermEval通过结构化基准评估视觉语言模型在热成像上的性能,揭示其在温度推理和颜色映射转换上的不足,推动热视觉语言模型的发展。

Comments 8 Pages with 2 figures of main content. 2 pages of References. 10 pages of appendix with 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏