arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-27 至 2026-07-27 共收录 64 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身导航 17 篇

2607.21964 2026-07-27 cs.RO cs.AI 新提交 81%

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14514 2026-07-27 cs.CV cs.AI 版本更新 81%

VTM-Nav: Harnessing Cross-Episode Experience for Object-Goal Navigation with Hierarchical Visual-Topological Memory

VTM-Nav:用于跨情节对象目标导航的分层视觉拓扑记忆

Xiaoran Xu, Yupeng Wu, Tianyu Xue, Yifan Xu, Xuanran Dong, Xiaoshan Yang, Changsheng Xu

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉科学学院) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV

AI总结 研究跨情节对象目标导航问题,提出无训练的VLM导航框架\method,其带有分层视觉拓扑记忆,通过粗到细匹配检索经验,在三个基准测试中性能最佳,证明跨数据集结构化视觉拓扑经验复用有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12291 2026-07-27 cs.RO cs.CV 版本更新 81%

OpenNavMap: Multi-Session Appearance-Based Topometric Mapping for Scalable Visual Navigation

OpenNavMap: 无需结构的拓扑制图通过大规模协作定位

Jianhao Jiao, Changkun Liu, Jingwen Yu, Boyi Liu, Qianyi Zhang, Yue Wang, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Electronic and Computer Engineering, Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Institute of Robotics and Automatic Information System, Nankai University(机器人与自动信息系统研究所,南开大学) College of control science and engineering, Zhejiang University(控制科学与工程学院,浙江大学) AI Centre, Department of Computer Science, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 OpenNavMap通过大规模协作定位实现无需结构的拓扑制图,利用3D几何模型进行按需重建,实现高精度的子图对齐和全局一致性。

Comments 21 pages, 20 figures, https://rpl-cs-ucl.github.io/OpenNavMap_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11204 2026-07-27 cs.RO 版本更新 79%

Stop to Decide: Latency-Aware Proprioceptive Navigation Primitives for Mapping-Free Quadruped Inspection

停止并决策:用于无地图四足机器人巡检的延迟感知本体导航原语

Hanting Suo, Haonan Yan, Liang Wang, Aiguo Song

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究计算能力受限的四足机器人导航延迟问题,提出基于逻辑剂量 - 反应模型的方法,探测器位于机载无地图无学习堆栈中,能在多种任务中良好表现,完成巡检路线,给出了如临界循环速率等部署规则。

Comments 29 pages, 10 figures, 8 tables. Hanting Suo and Haonan Yan contributed equally. Revised framing, presentation, and discussion; experimental results are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21944 2026-07-27 cs.HC 新提交 78%

VisionPulse: A Virtual Reality System Enabling Accessible Discovery and Navigation for Blind and Low Vision Users

VisionPulse:一个为盲人和低视力用户实现无障碍发现与导航的虚拟现实系统

Samuel Martin, Pooyan Fazli, Hasti Seifi

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究针对盲人和低视力用户在VR中自由探索受限的问题,提出VisionPulse系统,让用户通过自然动作和多模态反馈探索虚拟环境,经实验验证该系统受用户青睐,为包容性VR设计提供了参考。

Comments accepted to ACM ASSETS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21945 2026-07-27 math.OC 新提交 78%

Strategic Inference of Adversarial Navigation Objectives for Unmanned Underwater Vehicles

无人水下航行器对抗导航目标的策略推理

Ruimeng Hu, Xu Yang

专题命中 具身导航 :navigation(title,abstract)

AI总结 研究无人水下航行器对抗导航目标推理,推导连续时间似然模型及相关估计器,分析费希尔信息敏感性,建立流场几何与目标可识别性联系,扩展框架到依赖扫描观测模型并进行数值实验验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20679 2026-07-27 cs.RO 版本更新 74%

Towards Capability-Aware Traversability Navigation for Unstructured Environments

面向非结构化环境的能力感知可通行性导航

Gianluca Capezzuto, Felipe Tommaselli, Matheus P. Angarola, Ricardo V. Godoy, Marcelo Becker

机构 * University of São Paulo(圣保罗大学)

专题命中 具身导航 :navigation(title);分类 cs.RO

AI总结 研究非结构化环境中可通行性估计,提出能力感知可通行性(CAT)框架,将物理限制嵌入空间特征空间,通过交互式标注和SPADE块改进可通行性预测,在多数据集上领先,实现实例感知避障。

Comments 8 pages, 7 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page: https://capability-aware-traversability.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22166 2026-07-27 cs.RO cs.AI 新提交 62%

Learning Spatiotemporal Decision Priors for Efficient Path Planning under Partial Observability

学习时空决策先验以实现部分可观测性下的高效路径规划

Yi Liu, Hongda Zhang, Leyao Zou, Chunlei Meng, Ziqing Zhou, Yuning Chen, Zhuo Zou, Lida Xu, Zhongxue Gan, Chun Ouyang

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Information Science and Technology, Fudan University(信息科学与技术学院,复旦大学) Department of Information Technology, Old Dominion University(信息技术系,老 Dominion 大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.AI

AI总结 研究部分可观测性下的路径规划问题,提出ImiPath框架,从示范轨迹提炼时空决策先验,经局部时空观测表示和时空注意力策略网络转换为决策先验并纳入异构规划器,提升路径质量与搜索效率,验证了框架的适应性和实际部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06706 2026-07-27 cs.RO 61%

Exploring Unstructured Environments using Minimal Sensing on Cooperative Nano-Drones

利用合作微无人机的最小感知探索无结构环境

Pedro Arias-Perez, Alvika Gautam, Miguel Fernandez-Cortizas, David Perez-Saura, Srikanth Saripalli, Pascual Campoy

机构 * Computer Vision and Aerial Robotics Group at Universidad Politécnica de Madrid(马德里理工大学计算机视觉与空中机器人小组) Centre for Automation and Robotics C.A.R. (UPM-CSIC)(自动化与机器人中心(UPM-CSIC)) Department of Mechanical Engineering, Texas A&M University(机械工程系,德克萨斯A&M大学)

专题命中 具身导航 :navigation(abstract);分类 cs.RO;robotics(comments)

AI总结 本文提出ExploreBug算法,通过最小感知能力实现微无人机群在无结构环境中的高效探索与制图。

Comments Submitted to IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22123 2026-07-27 cs.RO 新提交 57%

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation

DB-VIO:具有增强视觉惯性表示的双分支视觉惯性里程计

Ziyu Wan, Lin Zhao

机构 * National University of Singapore(新加坡国立大学)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究针对视觉惯性里程计问题,提出DB-VIO双分支框架,通过融入深度线索、姿态先验和解耦姿态估计进行运动特定时间建模,实验表明该方法在自动驾驶和空中机器人基准测试中性能优异,提升了旋转和平移估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21611 2026-07-27 cs.HC cs.AI 新提交 57%

A Systematic Survey on Image Description Techniques for STEM Domains

关于STEM领域图像描述技术的系统综述

Marco Cardia, Letizia Angileri, Marina Buzzi, Giulio Galesi, Barbara Leporini

专题命中 具身导航 :navigation(abstract);分类 cs.AI

AI总结 综述20项关于AI描述STEM视觉的研究,关注可及性和人机交互。分析目标视觉类型等多方面内容,指出从静态转向交互式多模态系统,同时存在事实不准确等挑战,最后概述人机交互关键研究方向。

Comments This is the Author's Original Manuscript of an article accepted for publication in International Journal of Human-Computer Interaction, published by Taylor and Francis. The Version of Record is available at DOI 10.1080/10447318.2026.2668031

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22357 2026-07-27 eess.SP 新提交 50%

Uncertainty-Aware Fusion for Resilient Distributed Radar Sensing

用于弹性分布式雷达传感的不确定性感知融合

Christian Eckrich, Maik Pfefferkorn, Rolf Findeisen, Abdelhak M. Zoubir, Vahid Jamali

专题命中 具身导航 :robotic(abstract)

AI总结 研究移动智能体中FMCW雷达与静态雷达传感器融合以降目标状态估计不确定性问题,通过坐标变换等推导出CRLB,揭示更新率与量化保真度权衡,数值模拟表明选参数对降不确定性很关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21679 2026-07-27 astro-ph.SR astro-ph.GA astro-ph.IM physics.hist-ph 新提交 50%

Echoes of Star Stories: Integrating Indigenous narratives into modern stellar astrophysics

星际故事的回响:将本土叙事融入现代恒星天体物理学

Dionysios Gakis

专题命中 具身导航 :navigation(abstract)

AI总结 研究探讨将澳大利亚原住民、普韦布洛人等不同本土社区的叙事融入现代恒星天体物理学,强调其与现代模型的关联,通过跨文化合作整合传统,以丰富教育、公众参与并激发科学假设,架起文化与科学的桥梁。

Comments 7 pages, accepted for publication in Proceedings of Oxford XIII / IAU Symposium 399

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20517 2026-07-27 math.DS math.OC stat.CO 版本更新 50%

Transient Stability of Nonlinear Stochastic Dynamics: A Finite-Amplitude Logarithmic Measure Framework

传感器数据注入非线性随机飞行动力学中的暂态不稳定性边界

Surya Ratna Prakash D, Soumyendu Raha

专题命中 具身导航 :navigation(abstract)

AI总结 本文提出基于对数范数的框架,用于分析非线性Ito随机微分方程的有限时间暂态稳定性,揭示均值与路径行为的区别,并展示数据约束动态中的稳定性与鲁棒性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01844 2026-07-27 quant-ph cond-mat.mtrl-sci 版本更新 50%

Mapping g-factors and complex intervalley coupling in Si/SiGe by conveyor-mode shuttling

在Si/SiGe中通过传送模式穿梭映射g因子和复杂谷间耦合

Mats Volmer, Tom Struck, Arnau Sala, Jhih-Sian Tu, Stefan Trellenkamp, Davide Degli Esposti, Giordano Scappucci, Hendrik Bluhm, Łukasz Cywiński, Lars R. Schreiber

专题命中 具身导航 :manipulation(abstract)

AI总结 本研究通过传送模式穿梭技术实现了Si/SiGe中量子点g因子和谷间耦合的高精度映射,为量子芯片研发提供关键数据。

Comments 21 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19345 2026-07-27 cs.HC 版本更新 50%

Navigating the Last Mile: Evaluating Head- and Cane-Mounted Cameras for Egocentric Spatial Awareness

解决最后一公里问题:评估用于自我中心空间感知的头戴式和手杖式摄像头

Apurv Varshney, Lucas Nadolskis, Tobias Höllerer, Michael Beyeler

专题命中 具身导航 :navigation(abstract)

AI总结 研究盲人行人“最后一公里”导航问题,通过混合方法,调查盲人使用者习惯并进行案例研究,用SLAM和NeRFs比较头戴与手杖式摄像头,发现核心权衡,为混合XR系统架构提供考量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身推理 5 篇

2607.19190 2026-07-27 cs.RO cs.AI 版本更新 88%

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

专题命中 具身推理 :world model(title,abstract);robotics(abstract);manipulation(abstract);robotic(abstract)

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10135 2026-07-27 cs.CV cs.AI 版本更新 81%

BiWM: Advancing Open-Source Interactive Video World Models with Bidirectional Autoregression

BiWM:利用双向自回归推进开源交互式视频世界模型

Shaohao Rui, Xiaofeng Mao, Zhanyu Zhang, Peijia Lin, Yansong Zhu, Yibo Zhang, Haibin Wan, Zhangrui Zhao, Weijie Ma

机构 * LynnReal AI Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 提出BiWM框架,通过双向自回归范式将预训练视频骨干转化为交互式世界模型,仅需两阶段训练(微调+分布匹配蒸馏),支持多尺度模型和长程生成,优于现有因果流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21686 2026-07-27 cs.AI 新提交 79%

Persistent Computational State: A Session-Centric Runtime for Generative World Models

持久计算状态:用于生成式世界模型的以会话为中心的运行时

Zhen Lin

专题命中 具身推理 :world model(title,abstract);分类 cs.AI

AI总结 研究发现当前视频世界模型用作模拟器失败的归因不完整,定义了持久计算状态(PCS),构建以会话为中心的运行时,通过测量发现PCS,实现低检查点和恢复成本以及新的内存管理方式。

Comments 29 pages, 8 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22000 2026-07-27 cs.SD 新提交 78%

Music-JEPA: Learning a World Model of Sound from Action

Music-JEPA:从动作中学习声音的世界模型

Ziyu Wang, Kun Fang, Yann LeCun

专题命中 具身推理 :world model(title,abstract)

AI总结 研究提出Music-JEPA,将音乐构建为动作条件系统,用JEPA学习钢琴声音世界模型,在离线状态下用配对数据训练。实验表明模型能捕捉音乐动作与声音关系,其表示支持下游任务并能通过规划实现钢琴转录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21645 2026-07-27 cs.LG cs.AI 新提交 62%

Multi-Horizon Consistency as Geometry: When Latent Dynamics Contract, and When They Do Not

多时间尺度一致性即几何:潜在动力学何时收缩,何时不收缩

Kavya Bhand, Aadi Joshi

机构 * Vishwakarma Institute of Technology(维斯瓦卡玛理工学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 研究视频预测器和世界模型中多时间尺度潜在一致性权重λ对过渡几何的作用,通过实验测量L20,q95和E20等指标,发现λ能改善移动MNIST数据集相关指标,且软一致性作用有域限制,还得出随机强迫定律统一控制域。

Comments 22 pages, 9 figures. Diagnostic study of multi-horizon latent consistency, expansion proxies (L20), and a stochastic-forcing law for world-model geometry. Code and experiment logs to be released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2607.21725 2026-07-27 cs.RO 新提交 70%

Addressing the Orchestration Gap in Generalist Robots via Physical Agency

通过物理智能解决通用机器人中的编排差距

Liane Galanti, Dhruv Shah, Tri Dao

机构 * Princeton University(普林斯顿大学) Together AI(联合人工智能)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 研究通用机器人行动推理问题,提出将相关能力分解为语言条件策略/控制智能体与高级智能体管理器/编排器,构建物理智能体编排器Pigey,经评估其在模拟和实际任务中性能显著提升,缩小了编排差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 人机交互与遥操作 1 篇

2607.21802 2026-07-27 cs.RO cs.IR 新提交 57%

StARS: Socially Appropriate Robot Actions via a Recommender System-Driven Approach

StARS:通过推荐系统驱动的方法实现社交适宜的机器人动作

Erencem Ozbey, Fethiye Irmak Dogan, Jin Huang, Hatice Gunes

机构 * Bogazici University(博阿齐奇大学) University of Cambridge(剑桥大学)

专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.RO

AI总结 研究人机交互中社交适宜动作生成问题,提出模型无关框架StARS,结合协同过滤与可学习场景表示生成用户特定适宜性得分,在多数据集评估中提升性能与一致性,支持个性化动作选择。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 机器人数据与评测 10 篇

2604.26577 2026-07-27 cs.AI cs.CY cs.RO 版本更新 84%

Benchmarking the Safety of Large Language Models for Robotic Health Attendant Control

对大型语言模型在机器人健康护理员控制中的安全性的基准测试

Mahiro Nakao, Kazuhiro Takemoto

机构 * Kyushu Institute of Technology(九州工业技术大学)

专题命中 机器人数据与评测 :robotic(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 本文通过270条有害指令评估72个LLM,在模拟环境中测试其安全性,发现模型大小和发布日期影响安全性能,专有模型更安全,但医疗领域微调和提示防御策略效果有限,需将安全性作为首要考量。

Comments 20 pages, 9 figures, 3 tables, 8 pages supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03159 2026-07-27 cs.CV cs.AI cs.RO 版本更新 82%

NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation

NVIDIA OmniDreams:用于闭环自动驾驶仿真的实时生成式世界模型

NVIDIA, :, Aarti Basant, Amlan Kar, Despoina Paschalidou, Fangyin Wei, Francesco Ferroni, Guillermo Garcia Cobo, Haithem Turki, Huan Ling, Jaewoo Seo, James Lucas, Jay Zhangjie Wu, Jialiang Wang, Jonathan Lorraine, Jun Gao, Kai He, Katarina Tothova, Kevin Xie, Michał Tyszkiewicz, Qi Wu, Riccardo de Lutio, Ruilong Li, Sanja Fidler, Seung Wook Kim, Tianchang Shen, Tianshi Cao, Tobias Pfaff, William Lew, Xindi Wu, Xuanchi Ren, Yifan Lu, Yuxuan Zhang, Zan Gojcic, Zian Wang

专题命中 机器人数据与评测 :world model(title,abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出OmniDreams,一个基于Cosmos扩散模型训练的基础生成式世界模型,通过自回归生成动作条件视频,实现闭环仿真中复杂长尾场景的实时合成,并验证其在策略模型训练中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00713 2026-07-27 cs.CV 版本更新 79%

RAD: A Dataset and Benchmark for Real-Life Anomaly Detection with Robotic Observations

RAD:面向机器人观测的真实异常检测数据集与基准

Kaichen Zhou, Xinhai Chang, Taewhan Kim, Jiadong Zhang, Yang Cao, Chufei Peng, Fangneng Zhan, Hao Zhao, Hao Dong, Kai Ming Ting, Ye Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Great Bay University(大湾大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Nanjing University(南京大学) Deakin University(德克萨斯大学)

专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV

AI总结 提出RAD数据集,包含13类日常物体和4种缺陷,从60多个机器人视角在非受控光照下采集,用于评估2D特征、3D重建和视觉语言模型在姿态无关的异常检测中的表现,发现2D方法优于3D和VLM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22014 2026-07-27 cs.AI cs.CL cs.CV cs.RO 新提交 75%

Zero-Shot Mission-Level Evaluation for Aerial MLLM Agents

用于空中多模态大语言模型智能体的零样本任务级评估

Suman Navaratnarajah, Taehyoung Kim, Jona Ruthardt, Ishaan Bhimwal, Ryousuke Yamada, Yannik Blei, Wolfram Burgard, Yuki M Asano

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究空中MLLMs在零样本下解决长期具身任务的能力,引入MissionBench基准,含120个任务。对比22个模型与人类表现,发现模型成功率低,虽规模扩大有收益,但任务级能力需协调多种能力,凸显具身AI改进的前景与风险。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22345 2026-07-27 cs.RO cs.AI 新提交 62%

Teachy Mini: Development and Preliminary Evaluation of a Knowledge-Based Generative Social Robot for Higher Education

Teachy Mini:用于高等教育的基于知识的生成式社交机器人的开发与初步评估

Stephan Vonschallen, Karim Kaufmann, Dominique Oberle, Friederike Eyssel, Theresa Schmiedel

机构 * Institute of Information Systems, Zurich University of Applied Sciences(苏黎世应用科学大学信息系统研究所) Center for Cognitive Interaction Technology, Bielefeld University(比勒费尔德大学认知交互技术中心)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 研究针对生成式社交机器人在高等教育辅导中的风险,基于知识的设计要求开发Teachy Mini系统,经初步评估,该系统在负责任辅导行为及个性化等方面表现更佳,虽在部分方面与对照无显著差异,但显示出基于知识的设计对学习效果有积极作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22325 2026-07-27 cs.CV cs.RO 新提交 62%

Geometric 2D Scene Graph Generation

几何二维场景图生成

Christoph Jahn, Urs Waldmann, Bastian Goldluecke

机构 * Mercedes-Benz AG(梅赛德斯-奔驰股份公司) Department of Computer and Information Science, University of Konstanz(康斯坦茨大学计算机与信息科学系)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 针对消费品生产及机器人装配中部件装配关系表示问题,提出不依赖语义数据、可处理小数据集的方法。利用Faster R-CNN输出经处理生成邻接矩阵,输入基于aGCN架构的暹罗网络表征连接,在玩具模型部件数据集上验证了该方法。

Comments Accepted at the 18th International Conference on Agents and Artificial Intelligence ICAART 2026, Marbella, Spain

Journal ref Jahn, C., Waldmann, U. and Goldluecke, B. (2026). Geometric 2D Scene Graph Generation. In Proceedings of the 18th International Conference on Agents and Artificial Intelligence - ICAART 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21856 2026-07-27 cs.LG cs.AI cs.CL 新提交 62%

LeAct: Learning to Reason from Expert Actions

LeAct:从专家行动中学习推理

Ziran Yang, Chengshuai Shi, Raj Ghugare, Benjamin Eysenbach, Karthik Narasimhan, Chi Jin

机构 * Princeton University(普林斯顿大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.LG

AI总结 研究如何从专家行动中恢复思维链,提出LeAct方法,通过优化潜在变量,让学生为专家行动采样候选思维链并保留有效链。该方法在多个博弈和机器人基准测试中表现出色,使专家系统成为基础模型推理教师的新来源。

Comments 27 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏