arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-03-24 至 2026-03-24 共收录 29 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 29 篇

2512.19402 2026-03-24 cs.RO cs.CV cs.GR 84%

Real2Edit2Real: Generating Robotic Demonstrations via a 3D Control Interface

Real2Edit2Real:通过3D控制界面生成机器人演示

Yujie Zhao, Hongwei Fan, Di Chen, Shengcong Chen, Liliang Chen, Xiaoqi Li, Guanghui Ren, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学) PKU-AgiBot Lab(北大AgiBot实验室) AgiBot

专题命中 机器人数据与评测 :robotic(title);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Real2Edit2Real框架,通过3D可编辑性与2D视觉数据结合,减少重复数据收集,提升空间泛化能力,实验表明其数据效率提升显著。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12224 2026-03-24 cs.RO cs.AI 84%

RoboFAC: A Comprehensive Framework for Robotic Failure Analysis and Correction

RoboFAC:机器人故障分析与纠正的综合框架

Zewei Ye, Weifeng Lu, Minghao Ye, Tao Lin, Shuo Yang, Junchi Yan, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 RoboFAC通过构建大规模故障中心数据集,开发轻量级多模态模型,提升机器人故障诊断与纠正能力,实验显示其故障分析准确率比GPT-4o高34.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20285 2026-03-24 cs.AI 83%

AgentComm-Bench: Stress-Testing Cooperative Embodied AI Under Latency, Packet Loss, and Bandwidth Collapse

AgentComm-Bench: 在延迟、丢包和带宽崩溃下压力测试协作具身AI

Aayam Bansal, Ishaan Gangwani

机构 * Synthetic Sciences(合成科学)

专题命中 机器人数据与评测 :embodied AI(title,abstract);navigation(abstract);分类 cs.AI

AI总结 AgentComm-Bench通过六个通信退化维度系统性压力测试协作具身AI,揭示通信依赖任务在延迟、丢包和带宽崩溃下的性能急剧下降,提出基于冗余消息编码的轻量通信策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21669 2026-03-24 cs.RO cs.CV 81%

PRM-as-a-Judge: A Dense Evaluation Paradigm for Fine-Grained Robotic Auditing

PRM-as-a-Judge:细粒度机器人审计的密集评估范式

Yuheng Ji, Yuyang Liu, Huajie Tan, Xuchuan Huang, Fanding Huang, Yijie Xu, Cheng Chi, Yuting Zhao, Huaihai Lyu, Peterson Co, Mingyu Cao, Qiongyu Zhang, Zhe Li, Enshen Zhou, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang, Xiaolong Zheng

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学系,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) University of Sydney(悉尼大学) Beihang University(北航大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出PRM-as-a-Judge方法,通过过程奖励模型对轨迹视频进行密集评估,引入OPD指标系统,验证了宏一致性与微分辨率特性,揭示了主流策略在长周期任务中的行为特征与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09444 2026-03-24 cs.RO 80%

Data Scaling for Navigation in Unknown Environments

未知环境中的导航数据扩展

Lauri Suomela, Naoki Takahata, Sasanka Kuruppu Arachchige, Harry Edelman, Joni-Kristian Kämäräinen

机构 * Signal Processing Research Centre, Faculty of Information Technology and Communication Sciences, Tampere University(信号处理研究中心,信息科技与通信科学学院,塔尔皮奥大学) Graduate School of Information Sciences, Tohoku University(信息科学研究生院,东北大学) Faculty of Engineering, Turku University of Applied Sciences(工程学院,图尔库应用科学大学)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 研究通过大规模数据和多样性提升未知环境导航性能,发现数据多样性比数量更重要,且简单回归模型在嘈杂数据中表现更优。

Comments Robotics and Automation Letters (RA-L) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05848 2026-03-24 cs.CV cs.AI cs.RO 80%

Goal Force: Teaching Video Models To Accomplish Physics-Conditioned Goals

目标力:教视频模型实现物理条件化的目标

Nate Gillman, Yinghua Zhou, Zitian Tang, Evan Luo, Arjan Chakravarthy, Daksh Aggarwal, Michael Freeman, Charles Herrmann, Chen Sun

机构 * Brown University(布朗大学) Cornell University(康奈尔大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出Goal Force框架,通过显式力矢量和中间动力学定义目标,使视频模型能零样本泛化到复杂现实场景,实现基于物理的视频生成与规划。

Comments Camera ready version (CVPR 2026). Code and interactive demos at https://goal-force.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22212 2026-03-24 cs.CV 79%

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

Omni-WorldBench:迈向全面的交互导向的世界模型评估

Meiqi Wu, Zhixin Cai, Fufangchen Zhao, Xiaokun Feng, Rujing Dang, Bingze Song, Ruitian Tian, Jiashu Zhu, Jiachen Lei, Hao Dou, Jing Tang, Lei Sun, Jiahong Wu, Xiangxiang Chu, Zeming Liu, Kaiqi Huang

机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.CV

AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04304 2026-03-24 cs.SE 78%

Robotics Meets Software Engineering: A First Look at the Robotics Discussions on Stackoverflow

机器人与软件工程的交汇:对StackOverflow上机器人讨论的首次观察

Hisham Kidwai, Danika Passler Bates, Sujana Islam Suhi, Md Nahidul Islam Opu, James Young, Shaiful Chowdhury

专题命中 机器人数据与评测 :robotics(title,abstract)

AI总结 研究分析StackOverflow上500个机器人相关问题,发现机器人社区规模小导致问题曝光少,且问题关注度低,但发现机器人运动和执行器等主题持续占据讨论主导地位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21566 2026-03-24 cs.CV cs.AI cs.DB cs.LG cs.RO 77%

CataractSAM-2: A Domain-Adapted Model for Anterior Segment Surgery Segmentation and Scalable Ground-Truth Annotation

白内障手术分割与可扩展地面真实标注的领域适应模型CataractSAM-2

Mohammad Eslami, Dhanvinkumar Ganeshkumar, Saber Kazeminasab, Michael G. Morley, Michael V. Boland, Michael M. Lin, John B. Miller, David S. Friedman, Nazlee Zebardast, Lucia Sobrin, Tobias Elze

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰弗逊高中科学与技术学校) Mass Eye and Ear, Harvard Medical School(麻省眼耳研究所,哈佛医学院) Harvard Ophthalmology AI Lab, Schepens Eye Research Institute of Mass Eye and Ear, Harvard Medical School(哈佛眼科学人工智能实验室,麻省眼耳研究所的谢普恩斯眼研究学院,哈佛医学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出CataractSAM-2,一种针对白内障眼科手术视频的实时语义分割模型,结合稀疏提示与视频掩码传播框架,提升标注效率并推动高质量地面真实标注的可扩展生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06199 2026-03-24 cs.RO 74%

DYMO-Hair: Generalizable Volumetric Dynamics Modeling for Robot Hair Manipulation

DYMO-Hair: 通用的体积动力学建模用于机器人头发操控

Chengyang Zhao, Uksang Yoo, Arkadeep Narayan Chaudhury, Giljoo Nam, Jonathan Francis, Jeffrey Ichnowski, Jean Oh

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人学院) Epic Games, Inc.(Epic Games公司) Meta Codec Avatars Lab(Meta编码人像实验室) Bosch Center for Artificial Intelligence(博世人工智能中心)

专题命中 机器人数据与评测 :manipulation(title);分类 cs.RO

AI总结 DYMO-Hair通过体积动力学建模和动作条件化潜在状态编辑机制,实现了对多样化发型的通用化机器人头发护理系统,实验表明其在未见过的发型上表现更优。

Comments To appear in ICRA 2026. Project page: https://dymohair.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI 70%

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20992 2026-03-24 cs.RO 70%

Geometrically Plausible Object Pose Refinement using Differentiable Simulation

基于可微模拟的几何合理物体姿态细化

Anil Zeybek, Rhys Newbury, Snehal Dikhale, Nawid Jamali, Soshi Iba, Akansel Cosgun

机构 * Monash University(墨尔本大学) Honda Research Institute(本田研究院) Technical University of Munich(慕尼黑技术大学) Physical AI(物理AI)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出结合可微物理模拟、可微渲染和视觉-触觉传感的多模态姿态优化方法,提升空间准确性和物理一致性,实验表明在初始估计准确和高初始不确定性下,显著优于标准ICP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20827 2026-03-24 cs.RO 70%

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

Swim2Real: 基于视觉-语言模型的系统辨识用于仿真到现实迁移

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes

机构 * University of Warsaw(华沙大学) IDEAS NCBR EPFL(瑞士联邦理工学院) ETH Zurich(苏黎世联邦理工学院) Nomagic

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Swim2Real系统,利用视觉-语言模型反馈校准水下仿真实验室,无需手动设计搜索阶段。通过同时校准16个参数,显著提升仿真到现实的迁移效果,实现零样本强化学习迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 67%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22102 2026-03-24 cs.CV cs.GR cs.RO 62%

FreeArtGS: Articulated Gaussian Splatting Under Free-moving Scenario

FreeArtGS: 自由移动场景下的关节高斯溅射重建

Hang Dai, Hongwei Fan, Han Zhang, Duojin Wu, Jiyao Zhang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机科学系,北京大学CFCS) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) PrimeBot

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 FreeArtGS通过自由移动部分分割、关节估计和端到端优化,实现高可扩展性的自由移动关节物体重建,实验表明其在真实资产生成中具有实用性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15054 2026-03-24 cs.CL cs.AI cs.LG q-bio.BM 62%

MolLangBench: A Comprehensive Benchmark for Language-Prompted Molecular Structure Recognition, Editing, and Generation

MolLangBench: 一种全面的分子结构识别、编辑和生成语言提示基准

Feiyang Cai, Jiahui Bai, Tao Tang, Guijuan He, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) HitGen University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolLangBench,用于评估分子语言接口任务,发现现有模型在分子识别和编辑任务上表现欠佳,生成任务更差,强调了对化学应用中更可靠AI系统的研发需求。

Comments ICLR-2026 Camera-Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07698 2026-03-24 cs.CV cs.RO 62%

sim2art: Accurate Articulated Object Modeling from a Single Video using Synthetic Training Data Only

sim2art:仅使用合成训练数据从单个视频准确建模可变形物体

Arslan Artykov, Tom Ravaud, Corentin Sautier, Vincent Lepetit

机构 * LIGM, École Nationale des Ponts et Chaussées, IP Paris, CNRS, France(LIGM实验室,巴黎国立桥梁与道路学院,IP巴黎,法国国家科学研究中心,法国)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出sim2art框架,通过单目视频重建可变形物体的3D部分分割和关节参数,采用基于帧表面点采样的稳健表示,无需依赖长期对应关系,实现仿真与现实数据的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.12339 2026-03-24 cs.RO cs.CV 62%

SPOT: Point Cloud Based Stereo Visual Place Recognition for Similar and Opposing Viewpoints

SPOT:基于点云的立体视觉位置识别用于相似和对立视角

Spencer Carmichael, Rahul Agrawal, Ram Vasudevan, Katherine A. Skinner

机构 * Department of Robotics, University of Michigan(机器人学系,密歇根大学) Department of Robotics and the Department of Mechanical Engineering, University of Michigan(机器人学系和机械工程系,密歇根大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SPOT技术,利用立体视觉里程计估计的结构进行对立视角视觉位置识别,通过双距离矩阵序列匹配方法提升识别精度,实验表明在不同光照条件下,SPOT在对立视角识别中达到91.7%的召回率,且存储和运行效率优于现有方法。

Comments Expanded version with added appendix. Published in ICRA 2024. Project page: https://umautobots.github.io/spot

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20932 2026-03-24 cs.RO 61%

Implementing Robust M-Estimators with Certifiable Factor Graph Optimization

通过可验证因子图优化实现鲁棒M-估计量

Zhexin Xu, Hanna Jiamei Zhang, Helena Calatrava, Pau Closas, David M. Rosen

机构 * Institute for Experiential Robotics(体验机器人研究所)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出通过可验证因子图优化实现鲁棒M-估计量,利用快速局部优化在光滑流形上解决内嵌WLS子问题,提升估计质量并有效扩展到实际问题规模。

Comments The paper was accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12335 2026-03-24 cs.RO cs.SY eess.SY 57%

Semi-Infinite Programming for Collision-Avoidance in Optimal and Model Predictive Control

为最优控制和模型预测控制中的碰撞避免设计半无限编程

Yunfan Gao, Florian Messerer, Niels van Duijkeren, Rashmi Dabir, Moritz Diehl

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世有限公司,企业研究) Department of Microsystems Engineering (IMTEK), University of Freiburg(弗赖堡大学微系统工程系(IMTEK)) Fernride GmbH(费尔纳里德公司) Institute of Automatic Control, RWTH Aachen University(亚琛工业大学自动化研究所) Department of Mathematics, University of Freiburg(弗赖堡大学数学系)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出了一种新的碰撞避免方法,通过半无限编程解决机器人与障碍物的碰撞问题,并结合局部缩减和主动集方法提高效率。

Comments 20 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04317 2026-03-24 cs.CV cs.CL 57%

WiFi-GEN: High-Resolution Indoor Imaging from WiFi Signals Using Generative AI

WiFi-GEN:利用生成式人工智能进行高分辨率室内成像

Jianyang Shi, Bowen Zhang, Amartansh Dubey, Ross Murch, Liwen Jing

机构 * Pengcheng Laboratory(鹏城实验室) College of Big Data and Internet(大数据与互联网学院) Shenzhen Technology University(深圳技术大学) Department of Electrical Engineering(电子工程系) Indian Institute of Technology Delhi(印度理工学院德里分校) Department of Electronic and Computer Engineering(电子与计算机工程系) HKUST(香港科技大学) School of Computer Science and Technology(计算机科学与技术学院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出WiFi-GEN,通过生成式人工智能将测量到的WiFi功率转换为高分辨率室内图像,其形状重建精度比物理模型方法高275%,且Frechet Inception Distance得分降低82%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16177 2026-03-24 cs.LG 57%

The Finetuner's Fallacy: When to Pretrain with Your Finetuning Data

微调者的谬误:何时应使用微调数据进行预训练

Christina Baek, Ricardo Pio Monti, David Schwab, Amro Abbas, Rishabh Adiga, Cody Blakeney, Maximilian Böther, Paul Burstein, Aldo Gael Carranza, Alvin Deng, Parth Doshi, Vineeth Dorna, Alex Fang, Tony Jiang, Siddharth Joshi, Brett W. Larsen, Jason Chan Lee, Katherine L. Mentzer, Luke Merrick, Haakon Mongstad, Fan Pan, Anshuman Suri, Darren Teh, Jason Telanoff, Jack Urbanek, Zhengping Wang, Josh Wills, Haoli Yin, Aditi Raghunathan, J. Zico Kolter, Bogdan Gaza, Ari Morcos, Matthew Leavitt, Pratyush Maini

机构 * DatologyAI Team(DatologyAI团队)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG

AI总结 本文研究了一种简单策略,即专门预训练(SPT),通过在预训练阶段重复使用小领域数据集,以提升领域性能并保留通用能力。实验显示,SPT能减少预训练token数量,提升领域表现,同时降低过拟合风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01641 2026-03-24 cs.CV 57%

FideDiff: Efficient Diffusion Model for High-Fidelity Image Motion Deblurring

FideDiff:高效的高保真图像运动去模糊扩散模型

Xiaoyang Liu, Zhengyan Zhou, Zihang Xu, Jiezhang Cao, Zheng Chen, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.CV

AI总结 本文提出FideDiff,一种高效的单步扩散模型,用于高保真图像运动去模糊。通过将运动去模糊转化为扩散过程,结合Kernel ControlNet和自适应时间步预测,提升了去模糊性能。

Comments Accepted to ICLR 2026. Code is available at https://github.com/xyLiu339/FideDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20310 2026-03-24 cs.CV cs.GR 57%

GraphiContact: Pose-aware Human-Scene Robust Contact Perception for Interactive Systems

GraphiContact: 人体-场景鲁棒接触感知用于交互系统

Xiaojian Lin, Yaomin Shen, Junyuan Ma, Yujie Sun, Chengqing Bu, Wenxin Zhang, Zongzheng Zhang, Hao Fei, Lei Jin, Hao Zhao

机构 * Tsinghua University, China(清华大学, 中国) XR System Application Research Center, Nanchang Research Institute, Zhejiang University, China(浙江大学南昌研究院XR系统应用研究中心, 中国) Beijing University of Posts and Telecommunications, China(北京邮电大学, 中国) University of Chinese Academy of Sciences, China(中国科学院大学, 中国) National University of Singapore, Singapore(新加坡国立大学, 新加坡)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出GraphiContact框架,结合单图像3D人体网格重建,利用重建的体几何结构进行接触推理,通过引入SIMU训练策略提升鲁棒性,在五个基准数据集上实现了接触预测和3D人体重建的提升。

Comments 15 pages, 9 figures, Accepted at ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20225 2026-03-24 cs.CY cs.AI 57%

The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks

AGI的来临?专家人设是否超越专家基准?

Drake Mullens, Stella Shen

机构 * Tarleton State University(塔尔顿州立大学) University of Texas at Tyler(德克萨斯大学泰勒分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 研究探讨专家人设是否能提升语言模型性能,发现其效果受多种机制限制,通过控制实验揭示了人设在特定任务中的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17016 2026-03-24 cs.RO 57%

Efficient and Reliable Teleoperation through Real-to-Sim-to-Real Shared Autonomy

通过实-仿-实共享自主性实现高效可靠的远程操作

Shuo Sha, Yixuan Wang, Binghao Huang, Antonio Loquercio, Yunzhu Li

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出一种实-仿-实共享自主框架,利用k近邻人类代理模拟操作员行为,通过模型无关强化学习训练残差陪练策略,提升新手操作成功率和经验操作者执行效率,同时提高下游模仿学习的演示质量。

Comments Project Page: https://residual-copilot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19740 2026-03-24 cs.CV 57%

LEMON: A Large Endoscopic MONocular Dataset and Foundation Model for Perception in Surgical Settings

LEMON:一个大规模内窥镜单目数据集和用于手术场景感知的基础模型

Chengan Che, Chao Wang, Tom Vercauteren, Sophia Tsoka, Luis C. Garcia-Peraza-Herrera

机构 * Department of Informatics, King’s College London, UK(伦敦国王学院信息学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出LEMON数据集,通过新型聚合管道收集4K手术视频,提供938小时高质量内容,包含两项新任务。基于该数据集的LemonFM基础模型在多个任务中表现优异,显著提升手术识别和分割性能。

Comments Accepted at CVPR2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.18529 2026-03-24 cs.CL 50%

Instructional Text Across Disciplines: A Survey of Representations, Downstream Tasks, and Open Challenges Toward Capable AI Agents

跨学科指令文本:对表示、下游任务和有能力AI代理的综述

Abdulfattah Safa, Tamta Kapanadze, Arda Uzunoğlu, Gözde Gül Şahin

机构 * KUIS AI Lab, Koç University, Istanbul, Türkiye(KUIS AI实验室,科克大学,伊斯坦布尔,土耳其) Koç University, Istanbul, Türkiye(科克大学,伊斯坦布尔,土耳其) Johns Hopkins University, Baltimore, USA(约翰霍普金斯大学,巴尔的摩,美国) Friedrich-Alexander-Universität Erlangen-Nürnberg, Germany(埃尔兰根-纽伦堡弗里德里希-亚历山大大学,德国)

专题命中 机器人数据与评测 :robotics(abstract)

AI总结 本文综述了指令文本的表示方法、下游任务及挑战,旨在为AI代理提供统一视角,填补不同研究方向间的空白。

Comments Pre-CoLI print. Accepted for publication in Computational Linguistics (MIT Press). Advance online publication. March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08455 2026-03-24 cs.CL 50%

Bot Meets Shortcut: How Can LLMs Aid in Handling Unknown Invariance OOD Scenarios?

机器人与捷径:大型语言模型如何帮助处理未知不变性OOD场景?

Shiyan Zheng, Herun Wan, Minnan Luo, Junhang Huang

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文研究了现有社交机器人检测器在真实场景中的鲁棒性不足问题,提出基于大语言模型的缓解策略,通过对抗数据增强提升模型在捷径学习场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏