arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 1546 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 263 篇

2503.06796 2026-07-15 cs.RO 版本更新 70%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 70%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09458 2026-07-07 cs.CV cs.AI cs.LG cs.RO 版本更新 70%

SilvaScenes: Tree Detection and Species Classification from Under-Canopy Images in Natural Forests

SilvaScenes:自然森林冠层下图像中的树木检测与物种分类

David-Alexandre Duclos, William Guimont-Martin, Gabriel Jeanson, Arthur Larochelle-Tremblay, Martine Lapointe, Théo Defosse, Frédéric Moore, Philippe Nolet, François Pomerleau, Philippe Giguère

机构 * Northern Robotics Laboratory, Université Laval(北方机器人实验室,拉瓦尔大学) Département des sciences du bois et de la forêt, Université Laval(林业与木材科学系,拉瓦尔大学) Institut des Sciences de la Forêt tempérée, Université du Québec en Outaouais(温带森林科学研究所,魁北克outsouais大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对深度学习发展下森林自动化需求,提出SilvaScenes数据集,用于自然森林冠层下图像的树种实例分割,评估显示树干分割可行,物种分割有挑战,还指出关键问题及图像分辨率的作用。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24009 2026-07-03 cs.GR cs.AI cs.CV cs.LG cs.RO 版本更新 70%

Learning 3D-Gaussian Simulators from RGB Videos

从RGB视频学习3D高斯模拟器

Mikel Zhobro, Andreas René Geist, Georg Martius

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出3DGSim,一种从多视角RGB视频直接学习物理交互的3D模拟器,统一了3D场景重建、粒子动力学预测和视频合成,能泛化到未见过的多体交互和新场景编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04825 2026-06-23 cs.RO 版本更新 70%

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning

HapTile: 用于接触丰富模仿学习的触觉感知视觉-触觉-语言-动作数据集

Amirhosein Alian, Yongqiang Zhao, Shiyi Gu, Xuyang Zhang, Zhuo Chen, Christopher E. Mower, Haitham Bou-Ammar, Shan Luo

机构 * King’s College London, UK(伦敦国王学院) Huawei, Noah’s Ark Lab, UK(华为、诺亚实验室) University College London, UK(伦敦大学学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出HapTile数据集,通过集成指尖触觉反馈和操作员触觉感知,为接触丰富的机器人操作任务提供视觉-触觉-语言-动作联合数据,并验证其在策略学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07118 2026-06-09 cs.RO 版本更新 70%

QuadVerse: An Integrated Framework Aligning Visual-Physical Reality for Quadruped Simulation

QuadVerse:一种对齐视觉-物理现实用于四足仿真的集成框架

Yuxiang Chen, Yuanhao Wang, Ziheng Zhang, Meng Zhang, Yu Liu, Yufei Jia, Tiancai Wang, Erjin Zhou, Jin Xie

机构 * Nanjing University(南京大学) BUPT(北京邮电大学) DEXMAL Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robot learning(abstract);navigation(abstract);分类 cs.RO

AI总结 提出QuadVerse框架,通过重建场景校准视觉、物理和致动器,利用3DGS和接触校准减少仿真到现实的差距,实现零样本视觉导航策略部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12407 2026-08-18 cs.RO cs.CV cs.LG 版本更新 67%

MiDAS: A Multimodal Data Acquisition System and Dataset for Robot-Assisted Minimally Invasive Surgery

MiDAS:一种用于机器人辅助微创手术的多模态数据采集系统和数据集

Keshara Weerasinghe, Seyed Hamid Reza Roodabeh, Andrew Hawkins, Zhaomeng Zhang, Zachary Schrader, Homa Alemzadeh

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MiDAS是一种开源多模态数据采集系统,能够实现机器人辅助微创手术的非侵入式数据采集,并发布首个高保真仿真模型的缝合任务数据集。

Comments 29 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06191 2026-08-12 cs.RO cs.CV cs.LG 版本更新 67%

Learning in ImaginationLand: Omnidirectional Policies through 3D Generative Models (OP-Gen)

在ImaginationLand中学习:通过3D生成模型(OP-Gen)实现全向策略

Yifei Ren, Edward Johns

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 该研究提出用3D生成模型(OP-Gen)从单个真实演示扩充数据集,学习全向策略,可减少所需演示数,在多任务上性能优于基线方法。

Comments Project webpage with robot videos: https://www.robot-learning.uk/op-gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新 67%

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20853 2026-08-06 cs.CV cs.AI cs.LG eess.IV 版本更新 67%

MODEST: Multi-Optics Depth-of-Field Stereo Dataset

MODEST:多光学深度景深立体数据集

Nisarg K. Trivedi, Vinayaka A. Belludi, Li-Yun Wang

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出首个高分辨率立体DSLR数据集,涵盖18000张图像,系统变化焦距和光圈,用于研究单目和立体深度估计及景深渲染等任务。

Comments Website, dataset and software tools now available for purely non-commercial, academic research purposes. Significant new contributions. Project page: https://modest-dataset.netlify.app/ Huggingface: https://huggingface.co/datasets/independent-vision-lab/MODEST

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14833 2026-08-06 cs.RO cs.AI cs.LG 版本更新 67%

Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability

Curiosity-Diffuser:引导扩散模型提升可靠性的好奇心机制

Zihao Liu, Xing Liu, Yuhang Dong, Haitao Chang, Zhengxiong Liu, Panfeng Huang

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对机器人神经网络模型不稳定的问题,提出Curiosity-Diffuser方法,结合RND好奇心模块与分类器引导扩散提升策略可靠性,经仿真与真实实验验证有效

Comments Accepted for publication in Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11734 2026-07-20 cs.RO cs.CV cs.GR cs.LG 版本更新 67%

NeuralActuator: Neural Actuation Modeling for Robot Dynamics and External Force Perception

神经执行器:用于机器人动力学和外力感知的神经驱动建模

Zhiyang Dou, John U. Onyemelukwe, Hangxing Zhang, Heng Zhang, Minghao Guo, Yunsheng Tian, Michal Piotr Lipiec, Joshua Jacob, Chao Liu, Peter Yichen Chen, Yuri Ivanov, Wojciech Matusik

机构 * MIT(麻省理工学院) Amazon(亚马逊)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对低成本平台执行器动力学致模拟到现实误差问题,提出NeuralActuator模型,能联合预测多种内容,引入NAD数据集,通过可微模拟训练,经多平台实验验证其在电机状态估计等方面有应用价值。

Comments RSS 2026. Outstanding Systems Paper Award. Project Page: https://people.csail.mit.edu/frankzydou/projects/NeuralActuator/index.html Code: https://github.com/Frank-ZY-Dou/Dynamics-Modeling/tree/main/NeuralActuator

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 67%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 67%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03485 2026-06-17 cs.CV cs.AI cs.RO 版本更新 67%

Phys4D: Fine-Grained Physics-Consistent 4D Modeling from Video Diffusion

Phys4D: 从视频扩散模型实现细粒度物理一致的4D建模

Haoran Lu, Shang Wu, Songling Liu, Jianshu Zhang, Maojiang Su, Guo Ye, Chenwei Xu, Lie Lu, Pranav Maneriker, Fan Du, Manling Li, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Dolby Laboratories(杜比实验室)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出Phys4D流水线,通过三阶段训练(伪监督预训练、物理监督微调、强化学习校正)从视频扩散模型学习物理一致的4D世界表示,显著提升细粒度时空与物理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00241 2026-06-17 cs.LG cs.AI cs.CL cs.CV 版本更新 67%

Mordal: Automated Pretrained Model Selection for Vision Language Models

Mordal: 面向视觉语言模型的自动化预训练模型选择

Shiqi He, Insu Jang, Mosharaf Chowdhury

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出Mordal框架,通过减少候选模型数量和评估时间,自动化搜索用户定义任务的最佳视觉语言模型,相比网格搜索降低GPU耗时8.9-11.6倍,加权Kendall's τ平均提升69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18714 2026-06-16 cs.RO cs.AI cs.LG 版本更新 67%

Explainable deep learning improves human mental models of self-driving cars

可解释深度学习提升人类对自动驾驶汽车的心理模型

Eoin M. Kenny, Akshay Dharmavaram, Sang Uk Lee, Tung Phan-Minh, Shreyas Rajesh, Yunqing Hu, Laura Major, Momchil S. Tomov, Julie A. Shah

机构 * Computer Science & Artificial Intelligence Laboratory (CSAIL), Massachusetts Institute of Technology(计算机科学与人工智能实验室(CSAIL),麻省理工学院) Motional AD Inc.(Motional AD公司) Department of Psychology and Center for Brain Science, Harvard University(心理学系和大脑科学中心,哈佛大学) Department of Aeronautics and Astronautics, Massachusetts Institute of Technology(航空与宇航系,麻省理工学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出概念包装网络(CW-Net),在真实自动驾驶车上实现可解释规划,通过因果性概念解释提升驾驶员对车辆行为的预测能力,尤其在意外场景中。

Comments MST & JAS contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29599 2026-08-17 cs.RO cs.CV 版本更新 66%

How to Relieve Distribution Shifts in Semantic Segmentation for Off-Road Environments

如何缓解越野环境语义分割中的分布偏移

Ji-Hoon Hwang, Daeyoung Kim, Hyung-Suk Yoon, Dong-Wook Kim, Seung-Woo Seo

机构 * Department of Electrical and Communication Engineering, Seoul National University(电子与通信工程系,首尔国立大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 提出ST-Seg框架,通过风格扩展和纹理正则化缓解越野场景中源-目标域差异和传感器退化导致的分布偏移,提升语义分割鲁棒性。

Comments 8 pages, 6 figures. Accepted to IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 10, issue. 5, pp. 4500-4507, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21666 2026-08-04 cs.RO cs.CV 版本更新 66%

Uncertainty Quantification for Visual Object Pose Estimation: S-Lemma Ellipsoidal Bounds

视觉目标姿态估计的不确定性量化

Lorenzo Shaikewitz, Charis Georgiou, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO、cs.CV

AI总结 SLUE通过凸优化方法为视觉目标姿态估计提供高概率的椭球不确定性界,有效缩小平移界限并保持方向精度。

Comments 18 pages, 9 figures. Code available: https://github.com/MIT-SPARK/PoseUncertaintySets. Published in IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18314 2026-07-29 cs.CV cs.GR cs.RO 版本更新 66%

Diff2DGS: Reliable Reconstruction of Occluded Surgical Scenes via 2D Gaussian Splatting

Diff2DGS: 通过2D高斯点散布实现遮挡手术场景的可靠重建

Tianyi Song, Danail Stoyanov, Evangelos Mazomenos, Francisco Vasconcelos

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV;robotics(comments)

AI总结 Diff2DGS通过两阶段框架提升遮挡手术场景的3D重建精度,结合扩散模型和可学习变形模型,实现更准确的几何和外观重建。

Comments This work has been accpeted by the IEEE Robotics and Automation Letters(RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04746 2026-07-29 cs.RO 版本更新 65%

CADENCE: Predicting Realized MAPF Execution Time Beyond Sum of Costs

CADENCE:预测实际MAPF执行时间超越成本总和

Abhishek Seetharamu, Badrikanath Praharaj, Sreeram MV

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotic(abstract,comments);分类 cs.RO;robotics(comments)

AI总结 提出CADENCE框架,通过分析原始运动负担和交互感知协调特征,发现原始运动负担能显著提高多智能体路径规划执行时间的预测精度,超越传统成本总和指标。

Comments 7 pages, 4 figures, 3 tables and this paper was accepted at Multi-Agent Robotic Systems: Real-World Collaboration and Interaction a workshop at the international conference of robotics and automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07084 2026-08-18 cs.RO cs.AI 版本更新 62%

Flow Motion Policy: Manipulator Motion Planning with Flow Matching Models

流运动策略:基于流匹配模型的机械臂运动规划

Davood Soleymanzadeh, Xiao Liang, Minghui Zheng

机构 * Zachry Department of Civil and Environmental Engineering, Texas A&M University(德克萨斯A&M大学Zachry土木与环境工程系)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出流运动策略,一种基于流匹配模型的机械臂运动规划方法,通过生成路径分布实现高效推理优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24900 2026-08-18 cs.CV cs.AI 版本更新 62%

OpenGPT-4o-Image: A Comprehensive Dataset for Advanced Image Generation and Editing

OpenGPT-4o-Image:用于高级图像生成与编辑的综合数据集

Zhihong Chen, Xuehai Bai, Yang Shi, Chaoyou Fu, Huanyu Zhang, Haotian Wang, Xiaoyan Sun, Zhang Zhang, Liang Wang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang

机构 * USTC(中国科学技术大学) Kling Team(Kling团队) HDU(华中科技大学) PKU(北京大学) NJU(南京大学) CASIA(中国科学院自动化研究所) THU(清华大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 该研究构建了涵盖11个领域51个子任务的OpenGPT-4o-Image数据集,经其微调主流模型后,图像编辑任务性能最高提升18%、生成任务最高提升13%,证实系统化数据构建对多模态AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01584 2026-08-18 cs.LG cs.AI cs.CY 版本更新 62%

VirnyFlow: Optimizing ML Pipelines for Accuracy, Fairness, and Stability at Scale

VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化

Denys Herasymuk, Anastasiia Mozghova, Nazar Protsiv, Vladyslav Sydorak, Julia Stoyanovich

机构 * Ukrainian Catholic University(乌克兰天主教大学) New York University(纽约大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01236 2026-08-17 cs.RO cs.AI 版本更新 62%

LLM-Advisor: An LLM Advisor for Cost-efficient Path Planning across Multiple Terrains

LLM-Advisor: 一种用于多地形高效路径规划的LLM基准

Ling Xiao, Toshihiko Yamasaki

机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) Department of Information and Communication Engineering, The University of Tokyo(东京大学信息与通信工程系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 LLM-Advisor利用大型语言模型优化多地形路径规划,提升路径成本效率,适用于现实场景。

Comments This paper has been accepted by IEEE Transactions on Automation Science and Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08131 2026-08-13 cs.RO cs.CV 版本更新 62%

UniGround: Universal 3D Visual Grounding via Training-Free Scene Parsing

UniGround: 通过无训练场景解析实现通用三维视觉接地

Jiaxi Zhang, Yunheng Wang, Wei Lu, Taowen Wang, Shuning Zhang, Yixiao Feng, Junzhe Xu, Shunwang Sun, Weisheng Xu, Yuetong Fang, Renjing Xu

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) Shanghai Normal University(上海师范大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。

Comments 30 pages,9 figures,11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新 62%

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 62%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06122 2026-08-10 cs.LG cs.AI 版本更新 62%

Is Self-Pretraining really useful to improve diagnosis in medical Time Series?

自预训练(SPT)真的有助于改进医疗时间序列的诊断吗?

Omar Coser, Antonio Orvieto, Paolo Soda, Loredana Zollo

机构 * Università Campus Bio-Medico di Roma(罗马生物医学大学校园大学) Umeå University(于默奥大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(埃利斯研究所蒂宾根分所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 该研究探究自预训练(SPT)对Transformer在医疗时间序列诊断任务的影响,发现SPT可提升分类准确率0-6个百分点,是无需修改架构的通用有效策略。

Comments 21 pages, 7 figures,4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13108 2026-08-10 cs.RO cs.CV eess.IV 版本更新 62%

Panoramic Multimodal Semantic Occupancy Prediction for Quadruped Robots

四足机器人全景多模态语义占用预测

Guoqiang Zhao, Zhe Yang, Sheng Wu, Fei Teng, Mengfei Duan, Yuanfan Zheng, Kai Luo, Kailun Yang

机构 * School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出PanoMMOcc数据集和VoxelHound框架,通过垂直抖动补偿和多模态信息融合提升四足机器人全景多模态3D感知性能。

Comments The dataset and code will be publicly released at https://github.com/SXDR/PanoMMOcc

详情

展开后加载摘要…

URL PDF HTML 收藏