arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-05-20 至 2026-05-20 共收录 29 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 29 篇

2506.01418 2026-05-20 cs.RO cs.CV 90%

SEMNAV: Enhancing Visual Semantic Navigation in Robotics through Semantic Segmentation

SEMNAV: 通过语义分割增强机器人中的视觉语义导航

Rafael Flor-Rodríguez, Carlos Gutiérrez-Álvarez, Francisco Javier Acevedo-Rodríguez, Sergio Lafuente-Arroyo, Roberto J. López-Sastre

机构 * University of Alcalá(阿尔卡萨大学) CAM-UAH Ministry of Science and Innovation of Spain(西班牙科学与创新部)

专题命中 机器人数据与评测 :robotics(title,abstract);navigation(title,abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出SEMNAV,一种利用语义分割作为环境主要视觉输入表示的方法,以增强机器人代理的感知和决策能力,通过引入高层面的语义信息,提升模型在未知环境中的泛化能力,并引入SEMNAV数据集进行训练。

Journal ref Applied Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19328 2026-05-20 cs.CR cs.RO 85%

RoboJailBench: Benchmarking Adversarial Attacks and Defenses in Embodied Robotic Agents

RoboJailBench: 对具身体验机器人代理中对抗攻击和防御的基准测试

Doguhuan Yeke, Yanming Zhou, Leo Y. Lin, Hongyu Cai, Antonio Bianchi, Z. Berkay Celik

机构 * Purdue University(普渡大学)

专题命中 机器人数据与评测 :robotic(title);robotics(abstract,abstract_cn);embodied AI(abstract);分类 cs.RO

AI总结 本文提出RoboJailBench,通过建立安全分类学、引入意图对比数据集管道以及提供一个演进的存储库,为具身体验人工智能中的对抗攻击和防御提供了标准化评估框架,同时构建了一个新的分类平衡数据集并增强了五个现有数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19986 2026-05-20 cs.RO cs.CV cs.LG 85%

Beyond Binary Success: A Diagnostic Meta-Evaluation Framework for Fine-Grained Manipulation

超越二元成功:一种用于细粒度操控的诊断元评估框架

He-Yang Xu, Pengyuan Zhang, Zongyuan Ge, Xiaoshuai Hao, Serge Belongie, Xin Geng, Yuxin Peng, Xiu-Shen Wei

机构 * Southeast University(东南大学) Monash University(墨尔本大学) Xiaomi EV(小米电动车) University of Copenhagen(哥本哈根大学) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(title,abstract);embodied AI(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出MetaFine框架,通过分解理解、感知和受控行为三个维度,诊断细粒度操控中的能力瓶颈,并通过因果干预识别视觉编码器在保持局部空间结构方面的关键限制,从而提升操控精度。

Comments Project page: https://metafine.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19940 2026-05-20 cs.AI cs.RO 81%

Robotics-Inspired Guardrails for Foundation Models in Socially Sensitive Domains

受机器人启发的用于社会敏感领域基础模型的护栏

Rebecca Ramnauth, Drazen Brscic, Brian Scassellati

机构 * Yale University(耶鲁大学) Kyoto University(京都大学)

专题命中 机器人数据与评测 :robotics(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于机器人学的护栏框架,用于在社会敏感领域中对基础模型进行运行时行为控制,以减少交互轨迹中向不良状态的漂移,并适应多样化的社会情境。

Comments Under review at Journal of Artificial Intelligence Research (JAIR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19690 2026-05-20 cs.RO 80%

D-CLING: Prior-Preserving Depth-Conditioned Fine-Tuning for Navigation Foundation Models

D-CLING: 保留先验知识的深度条件细调方法用于导航基础模型

Shintaro Nakaoka, Takayuki Kanai, Kazuhito Tanaka

机构 * Frontier Research Center, Toyota Motor Corporation(丰田电机公司前沿研究中心)

专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出了一种新的细调方法,通过利用大规模预训练同时高效学习新环境或相机配置等新设置,从而在保留预训练知识的同时提升导航模型的鲁棒性和准确性。

Comments This paper has been accepted to the 2026 IEEE International Conference on Robotics and Automation (ICRA 2026), which will be held in Vienna, Austria, from June 1 to 5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19957 2026-05-20 cs.CV cs.AI cs.RO 80%

World-Ego Modeling for Long-Horizon Evolution in Hybrid Embodied Tasks

为混合具身体验中的长时域演化构建世界-自我模型

Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出了一种新的世界-自我建模范式,通过分解未来演化为世界和自我组件,解决混合任务中长时域具身体验中的退化问题,并通过HTEWorld基准测试验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19341 2026-05-20 cs.CL cs.AI cs.LG stat.ML 76%

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

HalluWorld: 一个用于通过参考世界模型控制幻觉的基准

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * Carnegie Mellon University(卡内基梅隆大学) Patronus AI Independent Researcher(独立研究者) Stanford University(斯坦福大学) The Ohio State University(俄亥俄州立大学) DegenAI Labs(DegenAI实验室)

专题命中 机器人数据与评测 :world model(title);分类 cs.AI、cs.LG

AI总结 本文提出HalluWorld基准,通过显式参考世界模型研究语言模型的幻觉问题,发现不同任务中幻觉表现不一致,表明幻觉源于多种失败模式而非单一能力。

Comments HalluWorld benchmark (code and data) at github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19004 2026-05-20 cs.CV cs.LG cs.RO 75%

EgoTraj: Real-World Egocentric Human Trajectory Dataset for Multimodal Prediction

EgoTraj: 用于多模态预测的现实世界人轨迹数据集

Ahmad Yehia, Abduallah Mohamed, Tianyi Wang, Jiseop Byeon, Kun Qian, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(土木、建筑与环境工程系,德克萨斯大学奥斯汀分校) Meta Reality Labs(Meta现实实验室) School of Architecture, The University of Texas at Austin(建筑学院,德克萨斯大学奥斯汀分校)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 本文提出EgoTraj数据集,用于多模态预测,包含75个真实城市环境中的人导航轨迹,提供了同步的RGB视频和地面真实数据,包括6自由度头部姿态、3D眼 gaze向量和场景注释,展示了该数据集在AR感知、导航和辅助系统中的应用价值。

Comments 21 pages, 14 figures. Project page: https://github.com/yehiahmad/EgoTraj

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07303 2026-05-20 cs.RO 70%

Robots that learn to evaluate models of collective behavior

能够评估集体行为模型的机器人

Mathis Hocke, Andreas Gerken, David Bierbach, Jens Krause, Tim Landgraf

机构 * Department of computer science, Freie Universität Berlin(自由大学柏林计算机科学系) SCIoI Excellence Cluster, Technische Universität Berlin(柏林技术大学SCIoI卓越中心) Faculty of Life Sciences, Humboldt-Universität zu Berlin(柏林洪堡大学生命科学学院) Department of Fish Biology, Fisheries, and Aquaculture, Leibniz Institute of Freshwater Ecology and Inland Fisheries(莱比锡淡水生态与内陆渔业研究所鱼类生物学、渔业与水产养殖系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于强化学习的框架,利用仿生机器人鱼评估活鱼行为的计算模型,通过闭环交互量化真实鱼与模拟鱼行为的差异,展示了学习驱动的机器人实验如何发现行为模型的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16309 2026-05-20 eess.IV cs.CV physics.med-ph 70%

Rapid patient-specific neural networks for intraoperative X-ray to volume registration

快速的患者特异性神经网络用于术中X射线到体积的配准

Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach, Sarah Frisken, Neel Dey, Polina Golland

机构 * Harvard-MIT Health Sciences and Technology, Massachusetts Institute of Technology(哈佛-麻省理工健康科学与技术, 麻省理工学院) Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(计算机科学与人工智能实验室, 麻省理工学院) Department of Radiology, Harvard Medical School(哈佛医学院放射科) Saint Luke’s Marion Bloch Neuroscience Institute(圣路易斯马里恩布洛克神经科学研究所) Department of Critical Care Medicine, Shriners Children’s Hospital(谢尔曼儿童医院重症医学科) Department of Interventional Neuroradiology, Boston Children’s Hospital(波士顿儿童医院介入神经放射科) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提努拉A·马丁诺斯生物医学成像中心, 麻省总医院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出了一种自监督框架xvr,结合患者特异性神经网络和梯度优化,实现了快速且准确的2D到3D配准,通过物理模拟生成训练数据,无需手动标注,提升了临床和研究社区的广泛应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19136 2026-05-20 cs.RO 70%

Automatically Improving Simulation Physics for Articulated Objects

自动提升仿真的物理特性用于关节物体

Anh-Quan Pham

机构 * Penn(宾夕法尼亚大学) PennPAL Lab(宾夕法尼亚大学PAL实验室)

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文研究了如何通过量化评估框架和多模态仿真反馈方法,提升关节物体在仿真中的物理真实性和稳定性,从而提高机器人学习的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19130 2026-05-20 cs.LG cs.AI cs.CL cs.CV 67%

EgoBabyVLM: Benchmarking Cross-Modal Learning from Naturalistic Egocentric Video Data

EgoBabyVLM:基于自然主义第一人称视频数据的跨模态学习基准测试

Dongyan Lin, Phillip Rust, Angel Villar Corrales, Alvin W. M. Tan, Mahi Luthra, Charles-Éric Saint-James, Rashel Moritz, Sheila Krogh-Jespersen, Vanessa Stark, Surya Parimi, Jiayi Shen, Youssef Benchekroun, Yosuke Higuchi, Martin Gleize, Tom Fizycki, Nicolas Hamilakis, Manel Khentout, Sho Tsuji, Balázs Kégl, Juan Pino, Michael C. Frank, Emmanuel Dupoux

机构 * Meta Superintelligence Labs(Meta超智能实验室) Stanford University(斯坦福大学) Meta Reality Labs(Meta现实实验室) The University of Tokyo(东京大学)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 研究探讨了儿童如何从有限的视觉-语言输入中获得语言 grounding 的鲁棒性,提出了 EgoBabyVLM 挑战,推动模型在自然主义数据中实现 grounded language learning。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20072 2026-05-20 cs.AI cs.RO 62%

Probing Embodied LLMs: When Higher Observation Fidelity Hurts Problem Solving

探查具身大语言模型:当更高的观察保真度损害问题解决

Oussama Zenkri, Oliver Brock

机构 * Robotics and Biology Laboratory, Technische Universität Berlin, Germany(柏林技术大学机器人与生物学实验室) Science of Intelligence, Research Cluster of Excellence, Berlin, Germany(柏林科学智能研究卓越集群) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了具身大语言模型在不同观察信息下的行为,发现高保真度观察反而降低了问题解决能力,核心方法是通过实验改变可用信息并测量行为变化,主要贡献是揭示了感知误差与推理失败的交互影响。

Comments Submitted to From Animals to Animats: The 18th International Conference on the Simulation of Adaptive Behavior (SAB)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20055 2026-05-20 cs.SE cs.AI cs.RO 62%

Towards LLM-Assisted Architecture Recovery for Real-World ROS~2 Systems: An Agent-Based Multi-Level Approach to Hierarchical Structural Architecture Reconstruction

面向现实世界ROS~2系统的LLM辅助架构恢复:一种基于智能体的多级方法用于分层结构架构重建

Dominique Briechle, Raj Chanchad, Tobias Geger, Ruidi He, Dhruv Jajadiya, Dhruv Kapadiya, Andreas Rausch, Meng Zhang

机构 * Institute for Software and Systems Engineering, Clausthal University of Technology, Clausthal-Zellerfeld 38678, Germany(软件与系统工程研究所, Clausthal 技术大学, Clausthal-Zellerfeld 38678,德国)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出了一种基于智能体的多级方法,用于恢复复杂ROS~2系统中的分层结构架构,通过改进的提示和多级中间架构表示,提高了架构恢复的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16137 2026-05-20 cs.CV cs.RO 62%

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System

STABLE: 通过语义-物理双系统生成仿真准备的桌面布局

Zhen Luo, Yixuan Yang, Xudong Xu, Jinkun Hao, Zhaoyang Lyu, Feng Zheng, Jiangmiao Pang, Yanwei Fu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 本文提出STABLE,一种通过语义-物理双系统生成仿真准备的桌面布局的方法,通过语义推理模块生成粗略布局,物理校正模块校正布局以确保物理合理性,从而提升场景的物理有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19484 2026-05-20 cs.CV cs.AI cs.GR cs.HC 62%

CutVerse: A Compositional GUI Agents Benchmark for Media Post-Production Editing

CutVerse: 一个用于媒体后期制作编辑的组合式GUI代理基准测试

Haobo Hu, Xiangwu Guo, Zhiheng Chen, Difei Gao, Haotian Liu, Libiao Jin, Qi Mao

机构 * MIPG, Communication University of China(MIPG,中国传媒大学) National University of Singapore(新加坡国立大学) USEIT AI(USEIT人工智能)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出CutVerse,一个用于评估自主GUI代理在真实媒体后期制作环境中的能力的基准测试,揭示现有代理在复杂、长周期媒体后期制作工作流中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11417 2026-05-20 cs.RO cs.AI 62%

Efficient Emotion-Aware Iconic Gesture Prediction for Robot Co-Speech

高效的情绪感知图标手势预测用于机器人同声传译

Edwin C. Montiel-Vazquez, Christian Arzate Cruz, Stefanos Gkikas, Thomas Kassiotis, Giorgos Giannakakis, Randy Gomez

机构 * School of Engineering(工程学院) Honda Research Institute Japan(本田日本研究院) Department of Electronic Engineering(电子工程系)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种轻量级的transformer模型,通过文本和情绪单独生成图标手势的位置和强度,无需音频输入,在BEAT2数据集上优于GPT-4o,在语义手势位置分类和强度回归方面表现更佳,且计算紧凑,适合实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09872 2026-05-20 cs.LG cs.AI 62%

WARC-Bench: Web Archive Based Benchmark for GUI Subtask Executions

WARC-Bench:基于网络存档的GUI子任务执行基准

Sanjari Srivastava, Gang Li, Cheng Chang, Rishu Garg, Manpreet Kaur, Charlene Y. Lee, Yuezhang Li, Yining Mao, Ignacio Cases, Yanan Xie, Peng Qi

机构 * Uniphore

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WARC-Bench,一个基于网络存档的GUI子任务执行基准,通过438个任务评估多模态AI代理在子任务上的能力,实验表明SFT和RLVR方法在提升子任务执行效果上取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18974 2026-05-20 cs.CV cs.AI cs.MM 62%

Harnessing Self-Supervised Features for Art Classification

利用自监督特征进行艺术分类

Federico Melis, Davide Bilardello, Emanuele Prato, Evelyn Turri, Lorenzo Baraldi

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文研究了监督和自监督主干作为特征提取器在艺术分类和检索中的有效性,特别是绘画,通过DINO家族和CLIP模型的实验评估,证明自监督主干在艺术分类中能带来一致的性能提升,并为现实应用如虚拟现实中的博物馆导航提供了见解。

Comments IRCDL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20529 2026-05-20 cs.RO cs.MA 61%

A Practical Framework of Key Performance Indicators for Multi-Robot Lunar and Planetary Field Tests

多机器人月球和行星实地测试的关键绩效指标实用框架

Julia Richter, David Oberacker, Gabriela Ligeza, Valentin T. Bickel, Philip Arm, William Talbot, Marvin Grosse Besselmann, Florian Kehl, Tristan Schnell, Hendrik Kolvenbach, Rüdiger Dillmann, Arne Roennau, Marco Hutter

机构 * Robotic Systems Lab (RSL), ETH Zürich(罗伯特系统实验室(RSL),苏黎世联邦理工学院) FZI Research Center for Information Technology(信息技术研究所以及中心) Machine Intelligence and Robotics Lab (MaiRo), Karlsruhe Institute for Technology (KIT)(机器智能与机器人实验室(MaiRo),卡尔斯鲁厄理工学院) Department of Environmental Sciences, University of Basel(巴塞尔大学环境科学系) European Space Agency/ESTEC(欧洲航天局/ESTEC) Center for Space and Habitability, University of Bern(伯尔尼大学空间与宜居性中心) Space Instruments Group, University of Zürich(苏黎世大学空间仪器组) Space Science and Technology, ETH Zürich(苏黎世联邦理工学院空间科学与技术)

专题命中 机器人数据与评测 :robotic(abstract,comments);分类 cs.RO

AI总结 本文提出了一种基于多机器人月球场景的KPI框架,用于评估和比较不同实地测试的性能,强调效率、鲁棒性和精度的场景依赖性优先级,并通过实地测试验证了其在实际应用中的有效性。

Comments Presented at ICRA 2026 Workshop on Multi-Agent Robotic Systems: Real-World Collaboration and Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19728 2026-05-20 cs.CV 57%

Aero-World: Action-Conditioned Aerial Video Generation from Inertial Controls

Aero-World: 从惯性控制生成动作条件的空中视频

Abdul Mohaimen Al Radi, Kunyang Li, Yuzhang Shang, Mubarak Shah, Yu Tian

机构 * Institute of Artificial Intelligence, University of Central Florida(中央佛罗里达大学人工智能研究所)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 本文提出Aero-World,一种将预训练图像到视频扩散模型转换为可控空中视频生成器的方法,通过注入加速度和角速度序列,利用冻结的物理探测器提供惯性一致性监督,从而提高生成视频对低级动作信号的符合度和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 57%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19630 2026-05-20 cs.AI 57%

EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection

EMO-BOOST:情感增强的音频视觉特征用于深度伪造检测中的泛化改进

Aritra Marik, Marcel Klemt, Anna Rohrbach

机构 * Technical University of Darmstadt(达姆施塔特技术大学) ELIZA

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出EMO-BOOST框架,通过融合传统RGB和声学聚焦检测器与基于情感的EmoForensics检测器,利用高阶语义线索提升深度伪造检测的泛化能力,实验显示在FakeAVCeleb数据集上平均跨操纵泛化AUC提升了2.1%。

Comments Accepted at SAFE@CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19386 2026-05-20 cs.CV 57%

MatPhys: Learning Material-Aware Physics Parameters for Deformable Object Simulation from Videos

MatPhys: 从视频中学习材料感知的物理参数以模拟可变形物体

Yang Yang, Yiyan Wang, Zheming Liu, Naoya Iwamoto

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Huawei Technologies Japan K.K(华为技术日本株式会社)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV

AI总结 本文提出MatPhys方法,通过单视角视频预测弹簧-质量参数,解决了现有方法在材料假设和跨场景一致性方面的不足,从而提升可变形物体模拟的准确性和泛化能力。

Comments Submitted to Siggrah Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 57%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16626 2026-05-20 cs.CR cs.AI 57%

SLEIGHT-Bench: A Benchmark of Evasion Attacks Against Agent Monitors

SLEIGHT-Bench: 一种针对代理监控的对抗攻击基准

Elle Najt, Colin Toft, Tyler Tracy, Fabien Roger, Joe Benton

机构 * Anthropic Fellows Program(Anthropic Fellow计划) University of Waterloo(多伦多大学) Redwood Research(Redwood研究) Anthropic

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI

AI总结 本文提出SLEIGHT-Bench基准,用于评估代理监控对多种攻击策略的防御能力,发现20种攻击在Opus 4.6监控下未被检测到,同时识别了多种规避策略并展示了监控性能的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04525 2026-05-20 cs.RO 57%

HDFlow: Hierarchical Diffusion-Flow Planning for Long-horizon Tasks

HDFlow:用于长时间任务的分层扩散-流规划

Nandiraju Gireesh, Yuanliang Ju, Chaoyi Xu, Weiheng Liu, Yuxuan Wan, He Wang

机构 * Peking University(北京大学) University of Toronto(多伦多大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO

AI总结 本文提出HDFlow,一种新的分层规划框架,利用扩散和修正流模型的优势,克服了单一范式生成规划器的局限性,通过在模拟和现实中的家具组装任务验证其有效性。

Comments ICML 2026 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02223 2026-05-20 cs.SD cs.CV 57%

Toward Fine-Grained Speech Inpainting Forensics:A Dataset, Method, and Metric for Multi-Region Tampering Localization

迈向细粒度语音修补取证:一个多区域篡改定位的数据集、方法和度量标准

Tung Vu, Yen Nguyen, Hai Nguyen, Cuong Pham, Cong Tran

机构 * Posts and Telecommunications Institute of Technology

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV

AI总结 本文提出MIST数据集、ISA方法和SF1@tau度量标准,用于多区域语音修补检测,揭示现有深度伪造检测器在细粒度语音修补检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11234 2026-05-20 cs.CV 57%

RoomPilot: Controllable Indoor Scene Synthesis via Multimodal Semantic Parsing

RoomPilot: 通过多模态语义解析实现可控的室内场景合成

Wentang Chen, Shougao Zhang, Yiman Zhang, Tianhao Zhou, Ruihui Li

机构 * School of Information Science and Engineering, Hunan University(信息科学与工程学院,湖南大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.CV

AI总结 该研究提出RoomPilot框架,通过多模态语义解析实现可控的室内场景合成,解决了现有方法输入模态有限和生成过程隐式的问题,提高了场景结构和语义的可控性。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏