arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-07 至 2026-07-07 共收录 45 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 45 篇

2607.02642 2026-07-07 cs.RO 新提交 90%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 机器人数据与评测 :world model(title,abstract);robot policy(title);manipulation(abstract);robot foundation model(abstract)

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16215 2026-07-07 cs.RO cs.CV 版本更新 87%

TiROD: Tiny Robotics Dataset and Benchmark for Continual Object Detection

TiROD:小型机器人数据集和持续物体检测基准

Francesco Pasti, Riccardo De Monte, Davide Dalle Pezze, Gian Antonio Susto, Nicola Bellotto

机构 * Department of Information Engineering(信息工程系)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出TiROD数据集,用于评估适用于小型机器人平台的轻量持续学习策略,通过NanoDet检测器测试不同场景下的持续学习挑战。

Comments Accepted at Journal of Intelligent Robotics & Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05390 2026-07-07 cs.RO cs.CV 新提交 86%

Deform360: A Massive Multi-view Visuotactile Dataset for Deformable World Models

Deform360:面向可变形世界模型的大规模多视图视觉触觉数据集

Hongyu Li, Wanjia Fu, Xiaoyan Cong, Zekun Li, Binghao Huang, Hanxiao Jiang, Xintong He, Yiqing Liang, Rao Fu, Tao Lu, Srinath Sridhar, Kevin A. Smith, George Konidaris, Yunzhu Li

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :world model(title,abstract);manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 针对可变形物体世界建模缺乏大规模真实数据的问题,构建含多视图视觉与触觉信息的Deform360数据集,评估现有主流世界模型,为相关研究提供基准。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04880 2026-07-07 cs.RO 新提交 85%

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);robot policy(abstract);分类 cs.RO

AI总结 针对大规模预训练模型在特定环境泛化有限的问题,提出PRISM端到端管道,从单张图像和自然语言指令生成个性化机器人数据集,构建场景并合成演示,实验表明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04352 2026-07-07 cs.CV 新提交 83%

Last-Meter Precision Navigation for UAVs: A Diffusion-Refined Aerial Visual Servoing Approach

无人机的最后一米精确导航:一种扩散细化的空中视觉伺服方法

Yaxuan Li, Jiarui Zeng, Shaofei Huang, Zhedong Zheng

机构 * FST and ICI, University of Macau(澳门大学科技学院及资讯与通信技术研究所)

专题命中 机器人数据与评测 :navigation(title,abstract);world model(abstract);分类 cs.CV

AI总结 研究无人机最后一米精确导航,提出DreamNav框架,先粗估计旋转,再用预训练世界模型模拟未来视觉观测选轨迹,贡献PairUAV基准测试,实验表明DreamNav性能优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03072 2026-07-07 cs.MA cs.RO 新提交 83%

LOTUSim: Multi-Domain Simulator for Marine Robotics

LOTUSim:海洋机器人多域模拟器

Cédric Buche, Juliette Grosset, Hélène Lechêne, Marie Dubromel, Pierig Havez-Bodivit, Malcom Neo, Julien Prodhon

机构 * CROSSING IRL 2010, CNRS(CROSSING IRL 2010,CNRS) Naval Group, France(法国海军集团) IMT Atlantique(IMT阿蒂旺)

专题命中 机器人数据与评测 :robotics(title,abstract);robotic(abstract);分类 cs.RO

AI总结 介绍LOTUSim多域海洋模拟器,其贡献一是支持多用户跨系统交互,确保实时性与可扩展性;二是有高效水下电流模型,验证显示相比常用模型精度大幅提升,适合海洋机器人研究。

Journal ref 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), IROS, Sep 2026, Pittsburgh (Etats-Unis), United States

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20216 2026-07-07 cs.AI cs.CE cs.CV cs.LG cs.RO 83%

CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents

CostNav:一个用于现实世界经济成本评估的物理AI代理导航基准

Haebin Seong, Sungmin Kim, Yongjun Cho, Myunchul Joe, Geunwoo Kim, Yubeen Park, Sunhoo Kim, Samwoo Seong, Yoonshik Kim, Suhwan Choi, Jaeyoon Jung, Jiyong Youn, Jinmyung Kwak, Sunghee Ahn, Jaemin Lee, Younggil Do, Seungyeop Yi, Woojin Cheong, Minhyeok Oh, Minchan Kim, Seongjae Kang, Youngjae Yu, Yunsung Lee

机构 * KAIST(韩国国立科学技术院) University of California, Irvine(加州大学 Irvine 分校) Seoul National University(首尔国立大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 CostNav引入了一个经济导航基准,通过结合物理模拟和行业数据,评估AI代理的经济可行性,发现高任务成功率并不保证经济性,CANVAS在非零SLA合规性下表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04146 2026-07-07 cs.RO cs.AI cs.CL cs.CR cs.LG 新提交 82%

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

!帝国,小型甚大阵:数据投毒对开源机器人技术的影响

Stefan Bühler, Mark Schutera

机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。

Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31672 2026-07-07 cs.CV cs.AI 新提交 81%

WorldRoamBench: An Open-World Benchmark for Long-Horizon Stability of Interactive World Models

WorldRoamBench:交互式世界模型长时稳定性的开放世界基准

Ting-Bing Xu, Jiacheng Sui, Zhe Gao, Kewei Shi, Wenjin Yang, Zhicheng Liu, Zhaoxu Sun, Mingchao Sun, Hongyu Pan, Fan Jiang, Mu Xu, Qi Fan, Yang Gao, Yong Li, Baoquan Chen

机构 * AMAP CV Lab, Alibaba Group(阿里巴巴集团AMAP CV实验室) Nanjing University(南京大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出WorldRoamBench基准,从动作、视觉、物理和记忆四维度评估交互式世界模型的长时稳定性,包含600+测试用例,揭示现有模型在所有维度均不理想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22867 2026-07-07 cs.CV cs.RO 版本更新 81%

MUSON: A Reasoning-oriented Multimodal Dataset for Socially Compliant Navigation in Urban Environments

MUSON:用于城市环境中社会合规导航的面向推理的多模态数据集

Zhuonan Liu, Xinyu Zhang, Zishuo Wang, Runji Cai, Tomohito Kawabata, Qianyi Li, Xuance Peng, Tianze Yu, Zhen Xiong, Xuesu Xiao, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(北海道大学信息科学研究生院) Graduate School of Computer Science, George Mason University(乔治·马歇尔大学计算机科学研究生院)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 研究社会合规导航问题,利用视觉语言模型,引入含10110个自我中心样本的多模态数据集MUSON,采用五步注释框架,为推进该导航提供有效基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 79%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03144 2026-07-07 econ.GN q-fin.EC 新提交 78%

DSGE as a Structured World Model:Benchmarking Counterfactual Generalization in Economic Worlds

作为结构化世界模型的动态随机一般均衡模型:经济世界中反事实泛化的基准测试

Wenli Xu

专题命中 机器人数据与评测 :world model(title,abstract)

AI总结 研究现代世界模型在反事实状态下的弱点,提出动态随机一般均衡(DSGE)模型是结构化世界模型,介绍DSGE-Gym基准,发现学习的世界模型在路径外崩溃,用DSGE生成的数据训练可减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14625 2026-07-07 cs.IT math.IT 版本更新 78%

Digital Twin Synchronization Over Mobile Embodied AI Network With Agentic Intelligence

基于移动具身AI网络的数字孪生同步

Zhouxiang Zhao, Jiaxiang Wang, Yahao Ding, Yinchao Yang, Zhaohui Yang, Mohammad Shikh-Bahaei, Julie A. McCann, Zhaoyang Zhang, Kaibin Huang

专题命中 机器人数据与评测 :embodied AI(title,abstract)

AI总结 本文提出基于移动具身AI网络的数字孪生同步框架,通过五阶段闭环工作流和分层优化算法,实现高保真同步并降低偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13660 2026-07-07 cs.RO cs.CV 版本更新 76%

Towards Spatial Trace with Reasoning in Vision-Language Models for Robotics

面向机器人视觉-语言模型的具有推理能力的空间轨迹

Enshen Zhou, Yibo Li, Jingkun An, Jiayuan Zhang, Shanyu Rong, Mengzhen Liu, Yi Han, Yuheng Ji, Huajie Tan, Jiawei He, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Lu Sheng, Shanghang Zhang

专题命中 机器人数据与评测 :robotics(title);分类 cs.RO、cs.CV

AI总结 本文提出RoboTracer,一种3D感知的视觉语言模型,通过空间编码器和回归监督解码器提升空间推理能力,并结合强化学习训练实现多步度量推理,最终在复杂场景中实现高效空间轨迹生成。

Comments Accepted to ECCV 2026. Project page: https://zhoues.github.io/RoboTracer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交 70%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09458 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 70%

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

SilvaScenes:自然森林冠层下图像中的树木检测与物种分类

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defosse, Frédéric Moore, Philippe Nolet, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval(北方机器人实验室,拉瓦尔大学) Département des sciences du bois et de la forêt, Université Laval(林业与木材科学系,拉瓦尔大学) Institut des Sciences de la Forêt tempérée, Université du Québec en Outaouais(温带森林科学研究所,魁北克outsouais大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对深度学习发展下森林自动化需求,提出SilvaScenes数据集,用于自然森林冠层下图像的树种实例分割,评估显示树干分割可行,物种分割有挑战,还指出关键问题及图像分辨率的作用。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03553 2026-07-07 cs.CV cs.RO 新提交 66%

iVISION-2DCD: A Long-Term Change Detection Dataset for Large-Scale Outdoor Construction Monitoring

iVISION-2DCD:用于大规模户外建筑监测的长期变化检测数据集

Dayou Mao, Yuchen Lin, Ashkan Ebadi, John Zelek, Alexander Wong, Yuhao Chen

机构 * National Research Council Canada(加拿大国家研究委员会) Vision and Image Processing Research Group, Systems Design Engineering, University of Waterloo(滑铁卢大学系统设计工程系视觉与图像处理研究小组)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO、cs.CV

AI总结 研究从检测建筑工地变化监测施工进度,针对跨视角变化检测算法缺开源基准数据集问题,用LiDAR点云生成iVISION-2DCD数据集,提出合成数据生成等方法,为相关领域带来新挑战。

Comments 11 pages, 7 figures, 1 table. Accepted for publication at the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026). Project page: https://danielmao2019.github.io/iVISION-2DCD-dataset.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04745 2026-07-07 cs.RO cs.CV 新提交 62%

Trajectory-Anchor Optimization for Overconfident Thermal Visual Place Recognition: Zero-Leakage OOD Auditing and Kidnapped-Robot Recovery

用于过度自信的热视觉场所识别的轨迹锚点优化:零泄漏异常检测与绑架机器人恢复

Zhiyuan Lu, Kanji Tanaka

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 研究针对基于基础模型的热视觉场所识别前端在分布外或未映射条件下的过度自信强制匹配失败问题,提出轨迹锚点优化(TAO),通过压缩多视图时间验证解决组合挑战,实现高效故障安全过滤。

Comments 11 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04616 2026-07-07 cs.RO cs.AI 新提交 62%

SILO: Simulation-in-the-Loop Sim-to-Real Transfer for Multi-Stage Cable Routing

SILO:用于多阶段电缆布线的回路内仿真的仿真到现实转移

Stone Tao, Jie Xu, Hesam Rabeti, Yashraj Narang, Yijie Guo, Iretiayo Akinola

机构 * NVIDIA Corporation(英伟达公司) University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 针对电缆等物体复杂变形导致的线性可变形操纵难题,提出基于GPU并行仿真的强化学习框架及新部署策略,实现多阶段电缆布线的仿真到现实转移,提升成功率并减少周期时间。

Comments Website: https://silo-cable-routing.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02866 2026-07-07 cs.CV cs.RO 新提交 62%

E-TraMamba: A New Paradigm for Efficient Long-Term 3D Feature Tracking with Event Cameras

E-TraMamba:一种用于事件相机的高效长期3D特征跟踪的新范式

Juwei Shen, Yujie Wu, Changwen Chen

机构 * Department of Computing, FCMS(计算系(FCMS)) The Hong Kong Polytechnic University(香港理工大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对现有3D跟踪器在处理稀疏、噪声事件流时的问题,提出E-TraMamba框架,采用线性状态空间模型和多尺度线索融合等方法,构建数据集,实验表明其性能达最优,适用于多种视觉任务。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02680 2026-07-07 cs.CV cs.AI 新提交 62%

K9-Bench: Evaluating Multimodal LLMs on Canine-Centric Videos

K9-Bench:在以犬类为中心的视频上评估多模态大语言模型

Khush Attarde, Yusuf Ali, Megha Thukral, Divye Bhutani, Thomas Ploetz, Zsolt Kira

机构 * Ogmen Robotics Inc.(Ogmen机器人公司) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 介绍K9-Bench基准,通过约5000个问答对测试多模态大语言模型对犬类动作和互动理解。提出数据生成管道创建数据集,发现前沿模型在犬类任务上零样本性能有限,还提供通用数据集构建管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02646 2026-07-07 cs.RO cs.CV 新提交 62%

EVA-Client: A Unified Data Collection, Inference, and Deployment Framework for Embodied Policies on Real Robots

EVA-Client:用于真实机器人上具身策略的统一数据收集、推理和部署框架

Heqing Yang, Yang Yi, Liyao Wang, Linqing Zhong, Donglin Yang, Ruipu Wu, Zitong Bai, Fengjiao Chen, Manyuan Zhang, Linjiang Huang, Si Liu

机构 * CoLab, Beihang University(协同实验室,北京航空航天大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 介绍EVA-Client框架,它位于策略服务器和物理硬件之间,统一策略迭代循环的真实机器人阶段。贡献包括组件解耦架构、可检查执行及每次评估兼具数据收集功能,还整合多种实时推理策略。

Comments https://colalab.net/projects/eva-client

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20742 2026-07-07 cs.RO cs.AI 新提交 62%

A Digital Twin Framework for Traffic-Aware UAV Pavement Monitoring in Open-Traffic Conditions

无需封闭车道的交通感知无人机路面监测数字孪生框架

Yamil Uchani, Grace Luna, Edwin Salcedo, Mauricio Figueroa

机构 * School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 提出基于Unity的数字孪生框架,集成YOLOv8n检测与分类器,实现交通感知无人机路面监测,无需封闭车道,实验评估三种遮挡恢复策略,最高覆盖率达97.95%。

Comments Accepted for publication in the proceedings of the 6th Annual IEEE International Conference on Digital Twins and Parallel Intelligence (DTPI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10840 2026-07-07 cs.LG cs.AI q-bio.QM 版本更新 62%

Clin-JEPA: A Multi-Phase Co-Training Framework for Joint-Embedding Predictive Pretraining on EHR Patient Trajectories

Clin-JEPA:一种多阶段协同训练框架,用于EHR患者轨迹的联合嵌入预测预训练

Yixuan Yang, Mehak Arora, Ryan Zhang, Baraa Abed, Junseob Kim, Tilendra Choudhary, Md Hassanuzzaman, Kevin Zhu, Ayman Ali, Chengkun Yang, Alasdair Edward Gent, Victor Moas, Rishikesan Kamaleswaran

机构 * Duke University(杜克大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Clin-JEPA框架,通过多阶段预训练稳定协同训练编码器和预测器,解决EHR数据中联合嵌入预测的挑战,实现多任务下游任务的高性能表现。

Comments 18 pages, 4 figures, 8 tables. Code: https://github.com/Kamaleswaran-Lab/Clin-JEPA

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11797 2026-07-07 cs.RO cs.CV 版本更新 62%

AnchorDream: Repurposing Video Diffusion for Embodiment-Aware Robot Data Synthesis

AnchorDream:将视频扩散用于具身感知机器人数据合成

Junjie Ye, Rong Xue, Basile Van Hoorick, Pavel Tokmakov, Muhammad Zubair Irshad, Yue Wang, Vitor Guizilini

机构 * Toyota Research Institute(丰田研究院) USC Physical Superintelligence (PSI) Lab(USC物理超智能(PSI)实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.CV

AI总结 针对机器人示范数据收集瓶颈,AnchorDream利用预训练视频扩散模型,通过机器人运动渲染来合成数据,无需环境建模,从少量示范生成多样高质量数据集,提升下游策略学习。

Comments Project page: https://jay-ye.github.io/AnchorDream/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16923 2026-07-07 cs.CR cs.AI cs.LG 版本更新 62%

UNDREAM: Bridging Differentiable Rendering and Photorealistic Simulation for End-to-end Adversarial Attacks

UNDREAM:为端到端对抗攻击弥合可微渲染与逼真模拟的差距

Mansi Phute, Matthew Hull, Haoran Wang, Alec Helbling, ShengYun Peng, Willian Lunardi, Martin Andreoni, Wenke Lee, Duen Horng Chau

机构 * Georgia Institute of Technology(佐治亚理工学院) Technology Innovation Institute(技术创新研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 针对自动驾驶等安全关键应用中深度学习模型对抗攻击测试问题,介绍UNDREAM框架,通过弥合逼真模拟器与可微渲染器差距,实现对3D物体对抗扰动的端到端优化,开启物理对抗攻击研究新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 62%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08983 2026-07-07 cs.RO cs.AI 版本更新 62%

Rational Inverse Reasoning: Few-Shot Imitation by Inferring Intent through Planning

理性逆推理:通过规划推断意图进行少样本模仿

Ben Zandonati, Tomás Lozano-Pérez, Leslie Pack Kaelbling

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究人类能从少量示范学习新操作任务,而现代机器人模仿学习需大量示范且适应性差的差距。提出理性逆推理,将少样本模仿视为对潜在解释程序的推理,通过视觉语言模型和分层规划器迭代优化候选集,在少样本设置中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏