arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 476 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 476 篇

2607.06383 2026-07-08 cs.RO 新提交 70%

Towards Real-World Applications with an Autonomous Powered Wheelchair

迈向具有自主动力轮椅的现实世界应用

Simone Arreghini, Alessandro Giusti, Alex Bordini, Enrico Ferrara, Giovanni Fulgoni, Antonio Paolillo

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫勒人工智能研究所(IDSIA),瑞士意大利语区大学 - 瑞士南部应用科学与艺术大学) Genny Factory(Genny工厂)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 针对动力轮椅自主性有限等问题,研究通过在商用自平衡轮椅上集成自主感知、手势交互和导航等技术构建概念验证原型,并在叫车和跟人等应用中展示,凸显自主与辅助结合潜力及可行性,也指出技术挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05363 2026-07-07 cs.AI 新提交 70%

SovereignPA-Bench: Evaluating User-Owned Personal Agents under Evolving Intent, Platform Mediation, and Consent Constraints

SovereignPA-Bench:在演化意图、平台中介与同意约束下评估用户自有个人智能体

Dylan Zongmin Liu

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.AI

AI总结 针对现有基准未考量个人智能体用户主权保护的问题,提出可执行基准SovereignPA-Bench,从多维度评估智能体主权能力,验证全主权框架可显著降低隐私泄露等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04610 2026-07-07 cs.RO 新提交 70%

RoboVista: Evaluating Vision Language Models for Diverse Robot Applications

RoboVista:评估用于各种机器人应用的视觉语言模型

Shuangyu Xie, Kaiyuan Chen, Ziyang Chen, Simeon Adebola, Yixuan Huang, Zehan Ma, Tianshuang Qiu, Wentao Yuan, Dhruv Shah, Pannag R. Sanketi, Ken Goldberg

机构 * University of California, Berkeley(加州大学伯克利分校) Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对机器人多样应用,提出模块化评估框架Robot Question Answering及基准RoboVista,其源于真实机器人系统等,含多任务类型VQA实例,实验表明现有视觉语言模型有差距,且与现实任务执行相关。

Comments Accepted to RSS 2026. Project website: https://berkeleyautomation.github.io/robovista/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03470 2026-07-07 cs.CV 新提交 70%

PhysMirror: Physics-Aware Mirror Object Generation

物理镜像:物理感知镜像对象生成

Xuan-Bach Mai, Duy-Phuc Nguyen, Quoc-Van Le, Tam V. Nguyen, Thanh-Toan Do, Huu Le, Duong-Van Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City(胡志明市科学大学) Vietnam National University, Ho Chi Minh City(胡志明市越南国家大学) University of Dayton(代顿大学) Monash University(莫纳什大学) VinFast(VinFast公司) VinUniversity(Vin大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 针对现代文本到图像扩散模型合成物理精确镜像反射的挑战,提出物理感知生成框架PhysMirror,通过3D空间先验执行投影几何,引入评估指标,实验表明其在反射精度等方面优于基线。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31388 2026-07-01 cs.CV 新提交 70%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31086 2026-07-01 cs.CV 新提交 70%

CasaMaestro: Multi-View Panoramas for House-Scale 3D Reconstruction

CasaMaestro:用于房屋级3D重建的多视角全景图

Yuzhou Ji, Xiaotian Yang, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV

AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 70%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25212 2026-06-26 cs.RO 新提交 70%

RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation

RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识

Xincheng He, Rongrong Zhang, Wei Jiang, Wenqiang Xu

机构 * Way-Robotics(Way-机器人)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23006 2026-06-23 cs.RO 新提交 70%

ISOPoT: Imaging Sonar Odometry by Point Tracking

ISOPoT:基于点跟踪的成像声纳里程计

Jaša Samec, Vid Rijavec, Marko Peljhan, Aleksander Grm, Andrej Androjna, Danijel Skočaj, Matej Dobrevski

机构 * Faculty of Computer and Information Science, University of Ljubljana(卢布尔雅那大学计算机与信息科学学院) Faculty of Maritime Studies and Transport, University of Ljubljana(卢布尔雅那大学海事研究与运输学院) OZON Research Group, TIMTEC(TIMTEC公司OZON研究组) MAT Systemics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校MAT系统学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 提出ISOPoT方法,利用现代点跟踪技术构建声纳里程计管道,通过多帧点轨迹作为主要对应表示,结合轻量级优化提升鲁棒性,在真实水下数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21100 2026-06-23 cs.RO 新提交 70%

Factor-Aware Mixture-of-Experts with Pretrained Encoder for Combinatorial Generalization

面向组合泛化的因子感知混合专家与预训练编码器

Feihong Zhang, Guojian Zhan, Zeyu He, Yinuo Wang, Likun Wang, Tianze Zhu, Yao Lyu, Tao Zhang, Tinghao Yi, Wei You, Shengbo Eben Li

机构 * Tsinghua University(清华大学) SunRisingAI Ltd.(日升AI有限公司) EFORT Intelligent Robot Co., Ltd.(埃夫特智能机器人有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出FAME框架,结合因子感知混合专家与预训练编码器,通过三阶段训练实现视觉机器人操作在多变环境中的组合泛化,在Meta-World和真实任务中分别提升34%和35%。

Comments 8 pages, 9 figures, accepted by the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 70%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09139 2026-06-23 cs.CV 新提交 70%

A Geometric Framework for Absolute Pose and Velocity Estimation with Event Cameras

事件相机的绝对位姿与速度估计的几何框架

Zibin Liu, Shunkun Liang, Banglei Guan, Yang Shang, Qifeng Yu, Ji Zhao

机构 * National University of Defense Technology(国防科技大学) independent researcher(独立研究者)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出利用3D直线及其触发事件的几何约束,通过线性与多项式求解器同时估计事件相机的绝对位姿和速度,最少仅需三个对应关系,在精度和效率上超越现有方法。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19948 2026-06-19 cs.AI 新提交 70%

Advancing DialNav through Automatic Embodied Dialog Augmentation

通过自动具身对话增强推进DialNav

Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

机构 * Korea University(高丽大学) Trillion Labs

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI

AI总结 提出自动生成管道构建大规模RAINbow数据集(238K episodes),结合双策略训练和定位模型,在DialNav任务上实现成功率显著提升(Val Seen +89%,Val Unseen +100%)。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16788 2026-06-16 cs.RO 新提交 70%

SoK: Security and Privacy of Foundation-Model-Powered Robots

SoK: 基础模型驱动机器人的安全与隐私

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出F-E-S-G结构边界框架,系统分析基础模型驱动机器人的安全与隐私风险,并基于96篇论文揭示威胁模式、防御不匹配和评估差距。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 70%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09967 2026-06-10 cs.CV 新提交 70%

ABot-Earth 0.5: Generative 3D Earth Model

ABot-Earth 0.5:生成式3D地球模型

Ming Qian, Tianjian Ouyang, Mingchao Sun, Zijian Wang, Jincheng Xiong, Jiarong Han, Yongchang Zhang, Jiawei Zhang, Xu Wang, Yu Liu, Luyang Tang, Fei Yu, Zengye Ge, Mengmeng Du, Yuan Liu, Nianfei Fan, Song Wang, Yingliang Peng, Chunxue Jia, Yang Liu, Shiying Zeng, Haozhe Shi, Junnan Lai, Hongyu Pan, Zheng Wu, Ning Guo, Mu Xu, Hang Zhang

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV

AI总结 提出ABot-Earth 0.5框架,利用3D高斯泼溅从卫星图像生成大规模无缝3D环境,每平方公里合成时间低于10分钟,支持实时交互可视化,降低3D重建成本。

Comments From Amap-cvlab, Alibaba. Official page: https://abot-earth.amap.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04765 2026-08-06 cs.RO cs.AI cs.CV 新提交 67%

Explicit Language Memory for Long-Horizon Planning in Vision-Language-Action Models

用于视觉-语言-动作模型长程规划的显式语言记忆

Houze Xu, Jizhong Li, Ziyi Ye

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对视觉-语言-动作模型长程规划的挑战,提出带显式语言记忆模块的分层架构,经仿真与实机实验验证,可提升复杂长程任务的成功率、鲁棒性与决策可解释性。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04121 2026-08-06 cs.RO cs.AI cs.CV 新提交 67%

Interpretable Fuzzy Inference for UAV Target Tracking Using Bounding-Box Geometry

基于边界框几何的无人机目标跟踪可解释模糊推理

Reza Ahmari, Ahmad Mohammadi, Vahid Hemmati, Nicholas Edmond, Hossein Z. Saghazadeh, Olusola Odeyomi, Parham Kebria, Abdollah Homaifar

机构 * North Carolina A&T State University(北卡罗来纳农工州立大学)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 该研究针对无人机视觉制导的偏航角估计难题,提出基于YOLO边界框特征的可解释模糊推理框架,经实验验证其精度高、数据效率高且计算轻量,适用于实时无人机制导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03496 2026-08-05 cs.RO cs.AI cs.CV cs.SY eess.SY 新提交 67%

Principles of Robot Autonomy

机器人自主原则

Daniele Gammelli, Joseph Lorenzetti, Katie Luo, Gioele Zardini, Marco Pavone

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本书基于斯坦福数十年教学经验,构建现代自主栈核心要素,衔接经典机器人学与物理AI,配套Jupyter笔记本与练习,为自主系统相关人员提供实用基础资源。

Comments 531 pages. Pre-publication version of a book forthcoming from Cambridge University Press, posted with the permission of the publisher

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01049 2026-08-04 cs.AI cs.CV cs.LG 新提交 67%

FactorJEPA: Factorizing Monolithic Futures into Layout-Agent-Interaction Channels for Crowded and Chaotic Global South Urban Worlds

FactorJEPA:将整体未来分解为布局-智能体-交互通道以应对拥挤混乱的全球南方城市场景

Kapil Wanaskar, Gaytri Jena, Aman Chadha, Vinija Jain, Vasu Sharma, Amitava Das

专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 针对全球南方拥挤混乱的城市场景,该研究构建了首个大规模数据集DENSEWORLD-115k,并提出FactorJEPA模型,通过分解结构提升JEPA性能,相关结果在不同主干网络上具有一致性。

Comments 42 pages. Independent preprint. Dataset: https://huggingface.co/datasets/anonymousML123/denseworld-115k ; checkpoints: https://huggingface.co/datasets/anonymousML123/factorjepa-outputs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26055 2026-07-29 cs.RO cs.AI cs.LG 新提交 67%

$π\mathbf{R}^2$: Reactive Real-time Flow Policies

$π\mathbf{R}^2$:反应式实时流策略

Sungjae Park, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究通用操作策略反应性和实时性问题,提出$\pi\mathbf{R}^2$方法,将条件分快速和慢速通道,采用延迟自适应流调度,能在保留大型主干等的同时,让策略实时反应并提高成功率。

Comments Preprint(20 pages). Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21522 2026-07-24 cs.RO cs.AI cs.CL cs.CV 新提交 67%

GS-Agent: Creating 4D Physical Worlds With Generative Simulation

GS-Agent:通过生成式模拟创建4D物理世界

Hongxin Zhang, Chunru Lin, Junyan Li, Zhou Xian, Tsun-Hsuan Wang, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Genesis AI(创世纪人工智能公司)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究旨在从自然语言描述创建4D物理世界。核心方法是提出GS-Agent这一端到端多智能体框架,分解任务并让多智能体与物理引擎协作。主要贡献是能有效转换自然语言为物理合理的4D世界,实现相机和灯光控制,为新范式奠基。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21488 2026-07-24 cs.LG cs.AI cs.MA cs.RO 新提交 67%

Compact Latent Coordination for Autonomous Vehicles at Unsignalized Intersections

无信号交叉口自动驾驶车辆的紧凑潜在协调

Gil Lifshits, Igal Bilik, Gilad Katz

机构 * Ben-Gurion University of the Negev(内盖夫本古里安大学)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对无信号交叉口自动驾驶车辆协调难题提出MAPS分层DRL架构,主智能体生成编码全局策略的原型计划,工作智能体结合局部观测执行控制。实验表明MAPS能实现无碰撞导航、减少行驶时间,且原型计划泛化能力强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交 67%

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08741 2026-07-10 cs.GR cs.CV cs.LG cs.RO 新提交 67%

ARDY: Autoregressive Diffusion with Hybrid Representation for Interactive Human Motion Generation

ARDY:用于交互式人体运动生成的具有混合表示的自回归扩散

Kaifeng Zhao, Mathis Petrovich, Haotian Zhang, Tingwu Wang, Siyu Tang, Davis Rempe

机构 * NVIDIA(英伟达) ETH Zürich(苏黎世联邦理工学院)

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究旨在解决交互式应用中人体运动生成问题,提出ARDY框架,采用混合表示和两阶段自回归变压器去噪器,能通过在线文本提示和运动学约束实现高保真运动生成,经评估验证了有效性和实用性。

Comments ACM Transactions on Graphics (SIGGRAPH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01111 2026-07-02 cs.RO cs.AI cs.LG 新提交 67%

FAR: Failure-Aware Retry for Test-Time Recovery and Continual Policy Improvement

FAR: 面向测试时恢复与持续策略改进的失败感知重试

Haoran Hao, Shahram Najam Syed, Jeffrey Ichnowski, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出FAR框架,通过失败对比偏好适应和轻量动作扰动,使机器人从测试时失败中学习并自主恢复,结合成功轨迹持续改进策略,在仿真和真实任务中成功率分别提升17.6%和11.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31694 2026-07-01 cs.RO cs.AI cs.CL cs.CV 新提交 67%

RCT: A Robot-Collected Touch-Vision-Language Dataset for Tactile Generalization

RCT:用于触觉泛化的机器人采集触觉-视觉-语言数据集

Jingbo He, Michael Färber, Roberto Calandra

机构 * ScaDS.AI, TU Dresden(德累斯顿工业大学ScaDS.AI) LASR Lab, TU Dresden(德累斯顿工业大学LASR实验室)

专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出RCT数据集,包含机器人按压122种工业材料采集的触觉数据,通过接触序列划分暴露了材料泛化难题,为触觉感知提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 67%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15251 2026-06-16 cs.RO cs.AI cs.LG 新提交 67%

Driving, Fast or Slow? Neuro-Symbolic Guidance for Motion Prediction in Multi-Modal Ground Mobility

驾驶,快或慢?多模态地面移动中运动预测的神经符号引导

Simon Kohaut, Felix Divo, Julius Hahnewald, Benedict Flade, Julian Eggert, Kristian Kersting, Devendra Singh Dhami

机构 * Artificial Intelligence and Machine Learning Lab, TU Darmstadt(达姆施塔特工业大学人工智能与机器学习实验室) Honda Research Institute(本田研究所) Hessian Center for AI (hessian.AI)(黑森州人工智能中心) Centre for Cognitive Science(认知科学中心) German Center for AI (DFKI)(德国人工智能研究中心) Uncertainty in Artificial Intelligence Lab, TU Eindhoven(埃因霍温理工大学人工智能不确定性实验室)

专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出TraCS框架,通过神经符号方法将交通规则编码为概率一阶逻辑,增强黑盒运动预测模型的可解释性和合规性,在Argoverse 2上持续提升SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏