arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-26 至 2026-05-26 共收录 136 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 3 篇

2511.15407 2026-05-26 cs.AI cs.CV cs.LG 67%

IPR-1: Interactive Physical Reasoner

IPR-1:交互式物理推理器

Mingyu Zhang, Lifeng Zhuo, Tianxi Tan, Guocan Xie, Xian Nie, Yan Li, Renjie Zhao, Zizhu He, Ziyu Wang, Jiting Cai, Yong-Lu Li

机构 * CARNEGIE MELLON UNIVERSITY(卡内基梅隆大学)

专题命中 机器人基础模型 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出IPR模型,通过世界模型滚动评分和强化VLM策略,结合物理中心动作代码PhysCode,在1000+异构游戏基准上实现鲁棒的物理推理,性能超越GPT-5并零样本迁移至未见游戏。

Comments Accepted by CVPR 2026. 13 pages of main text and 20 pages of appendices. Project page: https://mybearyzhang.github.io/ipr-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24203 2026-05-26 cs.RO 57%

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance

Afford-VLA:通过内化可操作性实现动作对齐的视觉规划

Runze Wang, Yuqian Fu, Yu Li, Tao Lin, Tianwen Qian, Mohamed Elhoseiny, Bo Zhao, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) KAUST(康斯坦丁·亚历山大科研大学) SJTU(上海交通大学) East China Normal University(华东师范大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 提出Afford-VLA框架,通过内化任务条件可操作性作为显式视觉规划接口,利用可学习<AFF>令牌查询交互区域并解码为紧凑嵌入以直接条件化动作生成,在多个模拟基准上取得最先进性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 模仿学习与强化学习 9 篇

2605.15971 2026-05-26 cs.RO 79%

OHP-RL: Online Human Preference as Guidance in Reinforcement Learning for Robot Manipulation

OHP-RL:在线人类偏好作为机器人操作强化学习中的指导

Yunyang Mo, Jian Li, Qiwei Wu, Yihang Kang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO

AI总结 提出OHP-RL框架,利用人类干预作为偏好信息,通过状态依赖偏好门自适应调节策略学习,在Franka机器人接触丰富的操作任务中实现高成功率、快速收敛和低人类干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09179 2026-05-26 cs.AI 79%

Hide-and-Shill: A Reinforcement Learning Framework for Market Manipulation Detection in Symphony-a Decentralized Multi-Agent System

Hide-and-Shill:面向交响乐系统中市场操纵检测的强化学习框架——一个去中心化多智能体系统

Ronghua Shi, Yiou Liu, Yuchun Feng, Lynn Ai, Bill Shi, Zhuang Liu

机构 * Department of Information Systems, City University of Hong Kong(香港城市大学信息系统系) Business School, University of New South Wales(新南威尔士大学商学院) Division of Engineering Science, University of Toronto(多伦多大学工程科学系) ProphetAI Data Technology Co., Ltd.(ProphetAI数据技术有限公司) Gradient, 3 FRASER STREET DUO TOWER, SINGAPORE(Gradient新加坡办公室)

专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.AI

AI总结 提出一个多智能体强化学习框架,通过动态对抗博弈建模操纵者与检测者的交互,利用延迟代币价格反应识别可疑模式,并集成GRPO、理论奖励函数和多模态智能体管道,在去中心化交响乐系统中实现无需中心化预言机的鲁棒操纵检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25414 2026-05-26 cs.RO 74%

How to Mitigate the Distribution Shift Problem in Robotics Control: A Robust and Adaptive Approach Based on Offline to Online Imitation Learning

如何缓解机器人控制中的分布偏移问题:一种基于离线到在线模仿学习的鲁棒自适应方法

Hyung-Suk Yoon, Seung-Woo Seo

机构 * Department of Electronic and Computer Engineering, Seoul National University, Seoul, South Korea(电子与计算机工程系,首尔国立大学,首尔,韩国)

专题命中 模仿学习与强化学习 :robotics(title);分类 cs.RO

AI总结 提出一种鲁棒离线到自适应在线模仿学习框架,通过离线阶段利用判别器扩展状态-动作覆盖和在线阶段自监督模仿学习,缓解分布偏移问题。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04054 2026-05-26 eess.SY cs.SY 71%

Necessary and Sufficient Conditions for the Optimization-Based Concurrent Execution of Learned Robotic Tasks

基于优化的学习型机器人任务并发执行的充分必要条件

Sheikh A. Tahmid, Gennaro Notomista

专题命中 模仿学习与强化学习 :robotic(title)

AI总结 本文提出定理,给出在状态空间子集内使用最小范数控制器并发执行一组学习任务(通过强化学习学习的值函数编码)的充分必要条件,并扩展框架以处理折扣因子训练的值函数。

Comments To be presented at ACC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25584 2026-05-26 cs.RO cs.AI 62%

Acting on the Unseen: Communication-Free Collaborative Filtering for Decentralized Multi-Robot Task Allocation

作用于未知:面向分散式多机器人任务分配的无通信协同过滤

Alexander Apartsin, Yigal Meshulam, Yehudit Aperstein

机构 * Holon Institute of Technology(霍洛技术学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维夫工程学院)

专题命中 模仿学习与强化学习 :robotics(abstract);分类 cs.RO、cs.AI

AI总结 针对零知识多机器人任务分配问题,提出基于在线低秩协同过滤的SwarmCF方法,无需通信、先验知识或协调者,实现每个机器人在未见任务上的有效行动,并证明其样本复杂度优势。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25424 2026-05-26 cs.LG cs.AI 62%

SeqRoute: Global Budget-Aware Sequential LLM Routing via Offline Reinforcement Learning

SeqRoute: 通过离线强化学习实现全局预算感知的顺序LLM路由

Zhongling Xu, Shunan Zheng, Wei Wang

机构 * Department of Operations Research and Industrial Engineering(运筹学与工业工程系)

专题命中 模仿学习与强化学习 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 提出SeqRoute框架,将多轮LLM路由建模为有限时域马尔可夫决策过程,通过离线强化学习(CQL)和事后预算重标记(HBR)学习延迟满足,在全局预算约束下优化成本与质量,降低破产率至1%以下。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22894 2026-05-26 cs.GR cs.LG cs.RO 62%

SCRIPT: Scalable Diffusion Policy with Multi-stage Training for Language-driven Physics-based Humanoid Control

SCRIPT: 面向语言驱动的物理仿真人体控制的可扩展扩散策略与多阶段训练

Jingyan Zhang, Han Liang, Ruichi Zhang, Bin Li, Juze Zhang, Xin Chen, Jingya Wang, Lan Xu, Jingyi Yu

机构 * ShanghaiTech University(上海科技大学) University of Pennsylvania(宾夕法尼亚大学) Stanford University(斯坦福大学)

专题命中 模仿学习与强化学习 :embodied agent(abstract);分类 cs.RO、cs.LG

AI总结 提出SCRIPT框架,通过联合动作-状态-文本扩散Transformer和多阶段训练(监督模仿预训练+混合奖励强化学习后训练),实现语言指令驱动的物理仿真人体控制,在文本对齐、运动质量和物理真实性上超越现有方法。

Comments Project page: https://zhanglele12138.github.io/SCRIPT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 62%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 模仿学习与强化学习 :world model(abstract);分类 cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24436 2026-05-26 cs.MA cs.LG cs.RO 62%

A Reinforcement Learning Inspired Latent Yield Based Adaptive Algorithm Switching Mechanism

一种受强化学习启发的基于潜在收益的自适应算法切换机制

Jayprakash S. Nair, Jimson Mathew, Shivashankar B. Nair

机构 * Indian Institute of Technology Patna(印度理工学院帕纳布分校) Indian Institute of Technology Guwahati(印度理工学院古瓦哈提分校)

专题命中 模仿学习与强化学习 :robotic(abstract);分类 cs.RO、cs.LG

AI总结 针对在线或动态环境中算法选择困难的问题,提出一种受强化学习启发的潜在收益方法,通过封装奖励和惩罚触发探索与利用,实现自适应算法切换,并在排序算法和机器人避障任务中验证了有效性。

Comments Accepted and published in the Proceedings of the 29th European Conference on Applications of Evolutionary Computation (EvoApplications 2026), held as part of EvoStar 2026, Toulouse, France, April 8 to 10, 2026. Lecture Notes in Computer Science (LNCS), Springer Nature Switzerland

Journal ref Applications of Evolutionary Computation, EvoApplications 2026, LNCS, Springer Nature Switzerland, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 人机交互与遥操作 5 篇

2605.02900 2026-05-26 cs.CR cs.AI cs.CV cs.RO 87%

Safety in Embodied AI: A Survey of Risks, Attacks, and Defenses

具身人工智能的安全性:风险、攻击与防御综述

Xiao Li, Xiang Zheng, Yifeng Gao, Xinyu Xia, Yixu Wang, Xin Wang, Ye Sun, Yunhan Zhao, Ming Wen, Jiayu Li, Zixing Chen, Xun Gong, Yi Liu, Yige Li, Yutao Wu, Cong Wang, Jun Sun, Yixin Cao, Zhineng Chen, Jingjing Chen, Tao Gui, Qi Zhang, Zuxuan Wu, Xipeng Qiu, Xuanjing Huang, Tiehua Zhang, Zhipeng Wei, Kun Wang, Xinfeng Li, Hanxun Huang, Sarah Erfani, James Bailey, Jianping Wang, Chaowei Xiao, Ran He, Bo Li, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) City University of Hong Kong(香港城市大学) Jilin University(吉林大学) Singapore Management University(新加坡管理大学) Deakin University(德肯大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学) Chinese Academy of Sciences(中国科学院) The University of Melbourne(墨尔本大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 人机交互与遥操作 :embodied AI(title,abstract);robotics(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文综述了具身AI在感知、认知、规划、行动及交互全流程中的安全风险、攻击与防御方法,提出了多层次分类体系,并指出了多模态感知融合脆弱性、规划不稳定及人机交互可信度等关键挑战。

Comments Survey paper; 75 pages, 4 figures, 18 tables; v2 expands embodied-specific coverage of agentic threats, World Action Model threats, and contextual risk mitigation, with over 100 new references added. Project page: https://x-zheng16.github.io/Awesome-Embodied-AI-Safety/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23941 2026-05-26 cs.AI cs.RO 81%

MEMOR-E: In-Context and Fine-Tuned LLM Personalization for Alzheimer's Assistive Robotics

MEMOR-E: 面向阿尔茨海默病辅助机器人的上下文与微调大语言模型个性化

Maissa Abir Smaili, Eren Sadikoglu, Ransalu Senanayake

机构 * Istanbul Medipol University(伊斯坦布尔梅迪波大学) Arizona State University(亚利桑那州立大学)

专题命中 人机交互与遥操作 :robotics(title);robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出移动四足机器人MEMOR-E,结合微调与上下文学习的大语言模型,实现阿尔茨海默病患者的个性化认知支持与可解释人机交互。

Comments 8 pages 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24020 2026-05-26 cs.CV cs.AI 73%

Machine Intelligence that Understands Visual and Linguistic Information and Interacts with Humans and Environments

理解视觉与语言信息并与人类及环境交互的机器智能

Van Quang Nguyen

机构 * System Information Sciences(信息科学系)

专题命中 人机交互与遥操作 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 本文提出GRIT、LTMI和两阶段指令解释框架,分别改进图像描述、视觉对话和交互式指令跟随任务,在准确性和效率上取得领先结果。

Comments Doctoral dissertation, Tohoku University, 2022. Uploaded for archival purposes. 146 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00848 2026-05-26 cs.RO 57%

EgoExo++: Integrating On-demand Exocentric Visuals with 2.5D Ground Surface Estimation for Interactive Teleoperation of Underwater ROVs

EgoExo++:结合按需外中心视觉与2.5D地面估计的水下ROV交互式遥操作

Adnan Abdullah, Ruo Chen, Ioannis Rekleitis, Md Jahidul Islam

机构 * RoboPI Laboratory, Dept. of ECE, University of Florida, USA(罗博实验室,电子与计算机工程系,佛罗里达大学,美国) Dept. of ME, University of Delaware, USA(机械工程系,德雷塞尔大学,美国)

专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.RO

AI总结 针对水下ROV遥操作视野受限问题,提出EgoExo++方法,通过几何驱动的视觉SLAM合成外中心视图并实时估计2.5D地面,提升操作性能和用户体验。

Comments EgoExo++ (Accepted in IJRR), V7/V3, metadata updated, 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24350 2026-05-26 cs.RO cs.HC 57%

PACT: Proactive Asking for Continual Task Assistance in Human-Robot Collaboration

PACT:人机协作中持续任务辅助的主动询问

Chengbo He, Sheng Li, Chenyang Ma, Bochao Zou, Li Sun, Jiansheng Chen, Junliang Xing, Yuanchun Shi, Huimin Ma

机构 * University of Science and Technology Beijing(北京科技大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO

AI总结 提出PACT框架,通过强化学习在部分观测下决定何时主动询问用户以澄清任务,从而在跨日人机协作中逐步提高辅助准确性和澄清效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 机器人数据与评测 26 篇

2605.25874 2026-05-26 cs.CV 83%

WBench: A Comprehensive Multi-turn Benchmark for Interactive Video World Model Evaluation

WBench:面向交互式视频世界模型评估的综合多轮基准

Kaining Ying, Hengrui Hu, Siyu Ren, Jiamu Li, Fengjiao Chen, Ziwen Wang, Xuezhi Cao, Xunliang Cai, Henghui Ding

机构 * Fudan University(复旦大学) Meituan Longcat Team(美团Longcat团队)

专题命中 机器人数据与评测 :world model(title,abstract);navigation(abstract);分类 cs.CV

AI总结 提出WBench,一个包含五个维度、289个测试用例和1058轮交互的综合多轮基准,用于系统评估交互式世界模型,并发现现有模型在不同维度上表现不一。

Comments Technical report of WBench. Homepage: https://meituan-longcat.github.io/WBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24339 2026-05-26 cs.RO 83%

IsaacIPC: Coupling High-Fidelity Simulation and Realistic Rendering for Contact-Rich Robotic Systems

IsaacIPC: 面向高接触度机器人系统的高保真仿真与逼真渲染耦合框架

Qixin Liang, Zhongqing Han

机构 * Anker Humanoid Lab(安ker人形实验室) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 提出IsaacIPC框架,通过耦合GPU加速增量势接触(IPC)与IsaacSim/Lab,实现仿真与视觉网格间的变形映射,并引入几何砂浆接触势(GMCP)改善触觉传感中的接触压力分布,支持刚柔耦合机器人仿真。

Comments This is a tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24074 2026-05-26 cs.CV cs.RO 80%

WideDepth: Millimeter-Accurate Benchmark for Fisheye Depth Estimation

WideDepth: 用于鱼眼深度估计的毫米级精度基准

Ilia Indyk, Ignat Penshin, Ivan Sosin, Maxim Monastyrny, Aleksei Valenkov, Ilya Makarov

机构 * Robotics Center(机器人中心) AXXX Trusted AI Research Center, RAS(可信人工智能研究中心,俄罗斯科学院)

专题命中 机器人数据与评测 :robotics(abstract,comments);manipulation(abstract);navigation(abstract);分类 cs.RO、cs.CV

AI总结 提出首个室内鱼眼深度估计数据集WideDepth,包含101个场景的5K高分辨率立体对和毫米级真值,并引入基于LiDAR的立体鱼眼图像生成方法,评估多种模型,微调后性能提升高达62%。

Comments Accepted to IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16435 2026-05-26 cs.RO cs.CL cs.HC 79%

What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics

机器人应该能够回答哪些问题?一个用于可解释机器人的用户问题数据集

Lennart Wachowiak, Andrew Coles, Gerard Canal, Oya Celiktutan

机构 * King's College London, CDT in Safe and Trusted AI(国王学院伦敦大学,安全与可信人工智能中心) King's College London(国王学院伦敦大学)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO

AI总结 本文通过收集100名参与者的1893个问题,构建了一个面向家用机器人的用户问题数据集,涵盖12个类别和70个子类别,旨在帮助机器人学家确定机器人需要回答的关键问题类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24931 2026-05-26 cs.RO 77%

Learning High-Frequency Continuous Action Chunks in Latent Space

在潜在空间中学习高频连续动作块

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) National University of Singapore, Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) Fudan University, Shanghai, China(复旦大学)

专题命中 机器人数据与评测 :robotics(abstract,abstract_cn);robotic(abstract);分类 cs.RO

AI总结 本文提出通过变分自编码器将高频动作学习从动作空间转移到潜在空间,并引入Reuse-then-Refine块级精炼策略,以提升高频控制的时间与空间一致性,实现复杂接触任务的平滑执行。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25401 2026-05-26 cs.RO 74%

Path Following Control System of Line-of-Sight Guidance for Robotic Dolphin with Multi-Link Mechanism in Underwater Simulator

水下模拟器中多连杆机构仿生海豚的视线导引路径跟踪控制系统

Takumi Asada, Takao Oki, Hideo Furuhashi, Kenta Tabata, Renato Miyagusuku, Koichi Ozaki

机构 * Utsunomiya University(乌山大学) Aichi Institute of Technology(爱知技术大学)

专题命中 机器人数据与评测 :robotic(title);分类 cs.RO

AI总结 针对多连杆仿生自主水下航行器(BAUV),提出了一种基于视线导引的路径跟踪控制系统,并在水下模拟器中进行了参数确定和控制方法评估。

Journal ref 2026 IEEE/SICE International Symposium on System Integration (SII). IEEE, 2026. p. 844-849

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06687 2026-05-26 cs.CV cs.CL cs.ET cs.MM cs.RO 73%

TimeSpot: Benchmarking Geo-Temporal Understanding in Vision-Language Models in Real-World Settings

TimeSpot: 在真实世界场景中评估视觉语言模型的地理时间理解能力

Azmine Toushik Wasi, Shahriyar Zaman Ridoy, Koushik Ahamed Tonmoy, Kinga Tshering, S. M. Muhtasimul Hasan, Wahid Faisal, Tasnim Mohiuddin, Md Rizwan Parvez

机构 * Computational Intelligence and Operations Laboratory (CIOL), Bangladesh(计算智能与运筹实验室(CIOL),孟加拉国) Shahjalal University of Science and Technology (SUST), Sylhet, Bangladesh(沙赫jalal科学与技术大学(SUST),沙赫里尔,孟加拉国) North South University (NSU), Dhaka, Bangladesh(北南大学(NSU),达卡,孟加拉国) Qatar Computing Research Institute (QCRI), Doha, Qatar(卡塔尔计算研究中心(QCRI),多哈,卡塔尔)

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 提出TimeSpot基准,通过1,455张全球图像评估视觉语言模型在时间属性(季节、月份、时段、日光相位)和地理属性(大洲、国家、气候带、环境类型、经纬度)上的推理能力,发现现有模型性能低下,尤其时间推理不足。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25210 2026-05-26 cs.LG cs.AI stat.ML 73%

Multi-Objective Learning for Diffusion Models: A Statistical Theory under Semi-Supervised Learning

扩散模型的多目标学习:半监督学习下的统计理论

Ziheng Cheng, Yixiao Huang, Hanlin Zhu, Haoran Geng, Somayeh Sojoudi, Jitendra Malik, Pieter Abbeel, Xin Guo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 针对扩散模型在多目标学习中因模型容量增大导致统计成本高的问题,提出半监督两阶段训练方法,利用未标记数据通过伪样本蒸馏,证明所需配对样本量仅取决于专家模型复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09458 2026-05-26 cs.RO 70%

Stein Variational Ergodic Surface Coverage with SE(3) Constraints

Stein变分遍历曲面覆盖与SE(3)约束

Jiayun Li, Yufeng Jin, Sangli Teng, Dejian Gong, Georgia Chalvatzaki

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Honda Research Institute Europe GmbH(本田欧洲研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 70%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24965 2026-05-26 cs.CV cs.AI cs.LG 67%

Cross-Domain Generalization Limits of Vision Foundation Models in Facial Deepfake Detection

视觉基础模型在面部深度伪造检测中的跨域泛化极限

Ibrahim Delibasoglu

机构 * Department of Software Engineering, Faculty of Computer and Information Sciences(软件工程系,计算机与信息科学学院)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文通过系统评估三种视觉基础模型(RoPE-ViT、DINOv3、NVIDIA C-RADIOv4-H)在DF40基准上的线性探测性能,揭示了它们在面部深度伪造检测中的跨域泛化极限,发现基础模型对全脸合成保持高判别力,但对局部编辑技术存在根本性边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07039 2026-05-26 cs.RO cs.AI 62%

AEROS: A Single-Agent Operating Architecture with Embodied Capability Modules

AEROS:一种具有具身能力模块的单智能体操作架构

Xue Qin, Simin Luan, John See, Cong Yang, Zhijun Li

机构 * School of Software, Harbin Institute of Technology(哈尔滨工业大学软件学院) School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院) School of Mathematical and Computer Sciences, Heriot-Watt University, Malaysia Campus(赫瑞-沃森大学马来西亚分校数学与计算机科学学院) School of Future Science and Engineering, Soochow University(苏州大学未来科学与工程学院)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 提出AEROS架构,将机器人建模为单一持久智能主体,通过可安装的具身能力模块扩展能力,实现模块化可扩展性、可组合能力执行和一致的系统级安全。

Comments Submitted to Engineering Applications of Artificial Intelligence (EAAI). 48 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24562 2026-05-26 cs.CV cs.AI 62%

PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction

PEDESTRIANQA: 面向行人意图与轨迹预测的视觉-语言模型基准

Naman Mishra, Shankar Gangisetty, C. V. Jawahar

机构 * CVIT, IIIT-Hyderabad, India(IIIT-海得拉巴计算机视觉与智能技术研究所,印度)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 提出大规模视频数据集PedestrianQA,将行人意图和轨迹预测转化为带结构化理由的问答任务,通过微调视觉-语言模型显著提升预测准确性与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03983 2026-05-26 cs.RO cs.CV 62%

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

通过静态-动态解耦实现高效长程视觉-语言-动作模型

Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying

机构 * Yale University(耶鲁大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 提出DySta框架,通过将视觉输入解耦为多级静态和动态令牌,减少上下文长度并复用KV缓存,实现高效多帧集成和推理,在基准测试和真实任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏