arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-12 至 2026-05-12 共收录 33 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 33 篇

2605.10653 2026-05-12 cs.RO 88%

Embodied AI in Action: Insights from SAE World Congress 2026 on Safety, Trust, Robotics, and Real-World Deployment

具身人工智能在行动:来自2026年SAE世界大会关于安全、信任、机器人和现实世界部署的洞察

Jan-Mou Li, Paul Schmitt, Wei Tong, Majed Mohammed, Akshay Chalana, Arpan Kusari, Edward Griffor

专题命中 机器人数据与评测 :robotics(title,abstract);embodied AI(title,abstract);分类 cs.RO

AI总结 本文探讨了具身人工智能在现实系统中的应用挑战,强调需通过系统工程、生命周期管理与标准制定来确保安全可靠部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09441 2026-05-12 cs.RO 83%

Beyond Isolation: A Unified Benchmark for General-Purpose Navigation

超越孤立:一个通用导航的统一基准

Samson Sun, Tianyi Yang, Tengyue Wang, Yikai Xue, Zhengjie Xu, Lingming Zhang, Qichen Zhang, Chao Liang, Zhipeng Zhang

机构 * AutoLab, SAI, Shanghai Jiao Tong University(自动化实验室、上海交通大学) Research Lab, Anyverse Dynamics(Anyverse Dynamics 研究实验室)

专题命中 机器人数据与评测 :navigation(title,abstract);embodied agent(abstract);分类 cs.RO

AI总结 本文提出OmniNavBench基准,通过复合复杂性、形态通用性和演示质量三大变革,解决通用导航中跨技能协调与跨形态泛化的问题,揭示现有方法在复杂导航任务中的不足。

Comments Accepted at RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09613 2026-05-12 cs.RO cs.CV 82%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);robot foundation model(abstract);robotic(abstract)

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10921 2026-05-12 cs.RO 79%

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10872 2026-05-12 cs.RO cs.AI cs.CL 76%

REI-Bench: Can Embodied Agents Understand Vague Human Instructions in Task Planning?

REI-Bench: 体感代理能否在任务规划中理解模糊的人类指令?

Chenxi Jiang, Chuhao Zhou, Jianfei Yang

机构 * MARS Lab, School of Mechanical and Aerospace Engineering(MARS实验室,机械与航空航天工程学院)

专题命中 机器人数据与评测 :embodied agent(title);分类 cs.RO、cs.AI

AI总结 本文研究模糊参照表达对LLM任务规划的影响,提出REI-Bench基准,发现模糊性会显著降低机器人规划性能,提出任务导向上下文认知方法提升表现。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08489 2026-05-12 cs.RO 74%

LE-PAVD: Learning-Enhanced Physics-Aware Vehicle Dynamics for High-Speed Autonomous Navigation

LE-PAVD:学习增强的物理感知车辆动力学用于高速自主导航

Musabbir Ahmed Arrafi, Malik Ali, Nicholas M. Stiffler, Krishna Bhavithavya Kidambi

专题命中 机器人数据与评测 :navigation(title);分类 cs.RO

AI总结 本文提出LE-PAVD,结合物理先验知识与学习组件,通过仿真和真实数据训练,提升状态预测精度并降低误差,同时减少计算成本,实现在高速自主导航中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 70%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 70%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 机器人数据与评测 :embodied AI(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23629 2026-05-12 cs.GR 67%

From Visual Synthesis to Interactive Worlds: Toward Production-Ready 3D Asset Generation

从视觉合成到交互世界:迈向可生产3D资产生成

Jiafeng Wu, Zhuofan Lou, Jian Liu, Dazhao Du, Chunchao Guo, Song Guo

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract)

AI总结 本文探讨了从孤立视觉形状到可部署的结构化资产的3D内容生成进展,分析了游戏开发、AI、世界模拟等对3D资产的需求,提出基于资产生产流程的分类方法,评估现有方法的生成质量和可用性,并指出数据质量、生成可控性等挑战。

Comments Preprint. Jiafeng Wu and Zhuofan Lou contributed equally. Project page: https://christinebobby.github.io/production-ready-3d-survey/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08136 2026-05-12 cs.CV cs.AI cs.RO 67%

Benchmarking ResNet Backbones in RT-DETR: Impact of Depth and Regularization under environmental conditions

在RT-DETR中评估ResNet主干:环境条件下深度和正则化的影响

Pamela Barboza, Víctor Castelli, Belén Pereira, Ricardo Grando, Bruna de Vargas, Augusto Calfani

机构 * Robotics and Artificial Intelligence Laboratory, Technological University of Uruguay(机器人与人工智能实验室,乌拉圭技术大学) Artificial Intelligence Laboratory, Technological University of Uruguay(人工智能实验室,乌拉圭技术大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文评估RT-DETR在环境和超参数变化下的圆物体检测性能,比较了四种ResNet主干在不同丢弃率下的置信度和准确率,发现ResNet50在光照变化中表现最佳,ResNet34在背景变化中表现最佳。

Comments Accepted at the International Conference on Data Science, Technology and Applications (DATA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10307 2026-05-12 cs.CV cs.GR cs.RO 62%

PaMoSplat: Part-Aware Motion-Guided Gaussian Splatting for Dynamic Scene Reconstruction

PaMoSplat:基于部分感知的运动引导高斯散射动态场景重建

Yinan Deng, Jianyu Dou, Jiahui Wang, Jingyu Zhao, Yi Yang, Yufeng Yue

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 PaMoSplat通过引入部分感知和运动先验,提出一种动态高斯散射框架,提升动态场景重建的渲染质量和跟踪精度。

Comments Accepted by TCSVT. Project Url: https://pamosplat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22963 2026-05-12 cs.RO cs.AI 62%

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

通过自由形式语言控制人形机器人:一个统一动作词汇的大型语言动作模型

Zhirui Liu, Kaiyang Ji, Ke Yang, Yahao Fan, Jingyi Yu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Humanoid-LLA模型,通过统一的人形机器人动作词汇解决语言与动作数据稀缺及物理稳定性问题,实现自由语言指令到全身动作的直接转换,提升人形机器人在真实环境中的泛化能力和动作多样性。

Comments Project page: https://humanoidlla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11906 2026-05-12 cs.CV cs.RO 62%

SegSTRONG-C: Segmenting Surgical Tools Robustly On Non-adversarial Generated Corruptions -- An EndoVis'24 Challenge

SegSTRONG-C: 在非对抗性生成扰动下稳健分割手术工具 -- 一个EndoVis'24挑战

Hao Ding, Yuqian Zhang, Tuxun Lu, Ruixing Liang, Hongchao Shu, Lalithkumar Seenivasan, Yonghao Long, Qi Dou, Cong Gao, Yicheng Leng, Seok Bong Yoo, Eung-Joo Lee, Negin Ghamsarian, Klaus Schoeffmann, Raphael Sznitman, Zijian Wu, Yuxin Chen, Septimiu E. Salcudean, Samra Irshad, Shadi Albarqouni, Seong Tae Kim, Yueyi Sun, An Wang, Long Bai, Hongliang Ren, Ihsan Ullah, Ho-Gun Ha, Attaullah Khan, Hyunki Lee, Satoshi Kondo, Satoshi Kasai, Kousuke Hirasawa, Sita Tailor, Ricardo Sanchez-Matilla, Imanol Luengo, Tianhao Fu, Jun Ma, Bo Wang, Marcos Fernández-Rodríguez, Estevao Lima, João L. Vilaça, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Intuitive Surgical Inc.(Intuitive Surgical公司) University of Arizona(亚利桑那大学) Chonnam National University(全州大学) University of British Columbia(不列颠哥伦比亚大学) Kyung Hee University(庆熙大学) University H(大学H)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 SegSTRONG-C挑战旨在研究模型在非对抗性扰动下的退化问题,通过生成清洁与扰动样本,评估工具分割算法的鲁棒性,并揭示提升鲁棒性的关键方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09225 2026-05-12 cs.CR cs.AI cs.LG 62%

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

Jailbreak攻击的艺术:为LLM安全制定超越二进制评分的Jailbreak攻击

Ismail Hossain, Tanzim Ahad, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大规模组合式Jailbreak数据集、自动化生成方法及OPTIMUS评估器,系统性解决Jailbreak攻击的生成、分类与评估问题,揭示了安全与隐蔽最优区域。

Comments This paper is under review on of top security venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08321 2026-05-12 cs.LG cs.AI cs.CY cs.HC cs.MA 62%

LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

LLM卫士:通过第三方对话监督缓解对抗说服

Lennart Wachowiak, Scott D. Blain, David Williams-King, Samuele Marro

机构 * University of Oxford(牛津大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.LG

AI总结 研究通过引入第三方LLM卫士模型,降低对抗性LLM对用户的操纵成功率,实验显示卫士模型使对手成功率从65.4%降至30.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08167 2026-05-12 cs.CV cs.AI 62%

Digital Image Forgery Detection Using Transfer Learning

利用迁移学习的数字图像伪造检测

Fatma Betul Buyuk, Gozde Karatas Baydogmus, Ali Buldu, Ayaulym Tulendiyeva, Zhuldyz Baizhumanova

机构 * Marmara University, Department of Computer Engineering(马尔马拉大学计算机工程系) Loyola University Chicago, Department of Computer Science(芝加哥洛伊拉大学计算机科学系) Biruni University, Department of Computer Engineering(比鲁尼大学计算机工程系)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出一种基于迁移学习的数字图像伪造检测框架,结合压缩感知特征增强与深度卷积神经网络,通过混合输入表示和自适应阈值优化策略提升检测鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12027 2026-05-12 cs.RO 61%

3DRO: Lidar-level SE(3) Direct Radar Odometry Using a 2D Imaging Radar and a Gyroscope

3DRO:基于2D成像雷达和陀螺仪的激光雷达级SE(3)直接雷达里程计

Cedric Le Gentil, Daniil Lisus, Timothy D. Barfoot

机构 * Robotics Institute, University of Toronto(多伦多大学机器人研究所) Mobile Robotics Lab, ETH Zurich(苏黎世联邦理工学院移动机器人实验室)

专题命中 机器人数据与评测 :robotics(abstract,comments);分类 cs.RO

AI总结 本文提出3DRO,扩展SE(2)直接雷达里程计框架以实现SE(3)状态估计,通过2D速度估计保持数据平面性并结合3D陀螺仪测量,实现激光雷达级精度。

Comments Accepted for presentation at the ICRA 2026 Workshop on Radar in Robotics (poster: https://drive.google.com/file/d/1P_iBrGxPiZL644B-dHxbvdY-UJUzd4Kp/view )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10707 2026-05-12 cs.RO 57%

ObjView-Bench: Rethinking Difficulty and Deployment for Object-Centric View Planning

ObjView-Bench:重新思考面向对象的视图规划中的难度与部署

Sicong Pan, Hao Hu, Xuying Huang, Benno Wingender, Maren Bennewitz

机构 * University of Bonn(波恩大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出ObjView-Bench框架,通过分离视图规划评估中的三个关键因素,改进了面向对象的视图规划评估方法,并展示了部署导向的评估协议对方法性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 57%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16593 2026-05-12 cs.RO 57%

Scalable Inspection Planning via Flow-based Mixed Integer Linear Programming

基于流的混合整数线性规划的可扩展检查规划

Adir Morgan, Kiril Solovey, Oren Salzman

机构 * Technion--Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院,海法,以色列)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO

AI总结 本文提出基于流的混合整数线性规划方法,解决大规模检查规划问题,提升求解效率和解的质量,适用于医疗和基础设施等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06248 2026-05-12 cs.CV 57%

Deepfake Detection that Generalizes Across Benchmarks

跨基准测试的深度伪造检测

Andrii Yermakov, Jan Cech, Jiri Matas, Mario Fritz

机构 * Czech Technical University in Prague(捷克技术大学布拉格分校) CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出GenD方法,通过参数高效调整预训练视觉编码器实现跨基准测试的深度伪造检测,展示出通过微调层归一化参数和超球面特征流形增强泛化能力,优于其他复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10079 2026-05-12 cs.CV 57%

SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation

SocialDirector: 无训练的社会互动控制多人物视频生成

Liangyang Ouyang, Ruicong Liu, Caixin Kang, Yifei Huang, Yoichi Sato

机构 * The University of Tokyo(东京大学) Shanda AI Research Tokyo(Shanda AI东京研究所)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 SocialDirector通过调节交叉注意力图提升多人物视频生成的社会互动准确性,解决演员动作不匹配和社交动态紊乱问题,实验表明其能显著提升互动真实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09678 2026-05-12 cs.AI 57%

Absurd World: A Simple Yet Powerful Method to Absurdify the Real-world for Probing LLM Reasoning Capabilities

荒诞世界:一种简单却强大的方法,用于将现实世界扭曲以探测LLM推理能力

Ryan Albright, Golam Md Muktadir, Zarif Ikram, S M Jubaer, Mehrab Hossain, Dianbo Liu

机构 * The Nueva School(新维学校) University of Southern California(南加州大学) Notre Dame College(诺特大学) Arizona State University(亚利桑那州立大学) National University of Singapore(新加坡国立大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI

AI总结 本文提出Absurd World框架,通过扭曲现实世界来测试LLM的推理能力,验证其在简单逻辑任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09591 2026-05-12 cs.CV 57%

From Pixels to Concepts: Do Segmentation Models Understand What They Segment?

从像素到概念:分割模型是否理解它们所分割的内容?

Shuang Liang, Zeqing Wang, Yuxian Li, Xihui Liu, Han Wang

机构 * Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) CASIC, The University of Hong Kong(香港大学中国科学院自动化所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出CAFE基准,评估可提示分割模型对概念的忠实性。通过属性层面的反事实操纵,测试模型在误导性提示下的表现,揭示分割模型可能依赖视觉显著但语义误导的线索。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19279 2026-05-12 cs.LG cs.CL 57%

MapFormer: Self-Supervised Learning of Cognitive Maps with Input-Dependent Positional Embeddings

MapFormer:基于输入依赖位置嵌入的自监督认知图学习

Victor Rambaud, Salvador Mascarenhas, Yair Lakretz

机构 * Institut Jean Nicod(让·内科研究所) LSCP(LSCP实验室) Département d’Études Cognitives - ENS, EHESS, CNRS, PSL University(认知研究系 - 巴黎高等师范学院,高等社会科学学院,国家科学研究中心,巴黎综合理工学院)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG

AI总结 MapFormer通过输入依赖的位置嵌入学习认知图,结合绝对和相对位置编码,实现事件记忆和工作记忆建模,在多个认知任务中表现出色,实现近完美的分布外泛化。

Comments 19 pages (29 with appendix), 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08730 2026-05-12 cs.LG cs.CR 57%

Classification-Head Bias in Class-Level Machine Unlearning: Diagnosis, Mitigation, and Evaluation

类别级机器去学习中的分类头偏差:诊断、缓解与评估

Weidong Zheng, Kongyang Chen, Yuanwei Guo, Yatie Xiao

机构 * School of Computer Science and Cyber Engineering, Guangzhou University(计算机科学与电子工程学院,广州大学) School of Artificial Intelligence, Guangzhou University(人工智能学院,广州大学) Guangzhou Institute of Internet of Things(广州物联网研究院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG

AI总结 本文揭示了类别级去学习中的偏差主导捷径,提出BiasShift和两种新的机制,通过引入新的指标量化偏差依赖性,实验表明方法在保持去学习性能的同时更稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08712 2026-05-12 cs.CV 57%

From Articulated Kinematics to Routed Visual Control for Action-Conditioned Surgical Video Generation

从运动学至路由视觉控制:用于动作条件化外科视频生成

Bohan Li, Shuojue Yang, Baorui Peng, Xianda Guo, Erli Zhang, Youqi Tao, Junfeng Duan, Daguang Xu, Qi Dou, Xin Jin, Wenjun Zeng, Hao Zhao, Yueming Jin

机构 * SJTU(上海交通大学) NUS(国立新加坡大学) THU(清华大学) EIT(欧洲研究所) WHU(武汉大学) Harvard(哈佛大学) NVIDIA(NVIDIA公司) CUHK(香港大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV

AI总结 本文提出一种运动学至视觉提升范式,通过五种图像对齐的控制模态生成动作条件化外科视频,采用分层路由框架提升控制精度与效率,构建新基准并验证方法有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08695 2026-05-12 cs.CV 57%

EditSleuth: A Dataset of Grounded Reasoning Chains for Image-Edit Forensics

EditSleuth:用于图像编辑取证的 grounded 推理链数据集

Van-Loc Nguyen, AprilPyone MaungMaung, Minh-Triet Tran, Isao Echizen

机构 * University of Science, Vietnam National University Ho Chi Minh City(越南胡志明市国家大学科学大学) National Institute of Informatics(国立信息研究所)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出EditSleuth数据集,包含257,725个图像编辑三元组,用于图像编辑取证的 grounded 推理。数据集包含编辑图像、源图像、二元编辑掩码、12类编辑分类标签、难度评分和六步推理链,通过确定性方法生成,并验证了难度评分与编辑类型的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08664 2026-05-12 cs.CV 57%

IPAD-CLIP: Teaching CLIP to Detect Image Local Perceptual Artifacts

IPAD-CLIP: 教授CLIP检测图像局部感知伪影

Juan Wang, Xinyu Sun, Ke Zhang, Jin Wang, Bing Li, Weiming Hu, Liang Wang

机构 * Minzu University of China(民族大学) OPPO Co., Ltd.(OPPO公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出IPAD-CLIP框架,通过增强文本和视觉空间中的伪影判别能力,解决局部感知伪影检测问题,提出包含3520张伪影图像的基准数据集,显著优于现有方法。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10203 2026-05-12 cs.SD eess.AS 50%

Polyphonia: Zero-Shot Timbre Transfer in Polyphonic Music with Acoustic-Informed Attention Calibration

Polyphonia:在多声部音乐中利用声学感知注意力校准实现零样本音色迁移

Haowen Li, Tianxiang Li, Yi Yang, Boyu Cao, Qi Liu

机构 * School of Future Technology, South China University of Technology, Guangzhou, China.(未来技术学院,华南理工大学,广州,中国)

专题命中 机器人数据与评测 :manipulation(abstract)

AI总结 本文提出Polyphonia框架,通过声学感知注意力校准实现多声部音乐中精确的零样本音色迁移,提升目标音色对齐精度的同时保持音乐保真度和非目标音色完整性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏