arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8657 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8657 篇

2604.18205 2026-04-21 cs.CV cs.RO 73%

A Comparative Evaluation of Geometric Accuracy in NeRF and Gaussian Splatting

神经渲染中NeRF与高斯散射几何精度的比较评估

Mikolaj Zielinski, Eryk Vykysaly, Bartlomiej Biesiada, Jan Baturo, Mateusz Capala, Dominik Belter

机构 * Institute of Robotics and Machine Intelligence, Poznan University of Technology(机器人与机器智能研究所,波兹南技术大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出评估神经渲染方法几何精度的流程,包含19个多样场景,系统评估重建方法的表面和形状保真度,补充传统视觉指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10916 2026-04-20 cs.CV cs.AI 73%

ReXSonoVQA: A Video QA Benchmark for Procedure-Centric Ultrasound Understanding

ReXSonoVQA:面向以过程为中心的超声理解的视频问答基准

Xucheng Wang, Xiaoman Zhang, Sung Eun Kim, Ankit Pal, Pranav Rajpurkar

机构 * Harvard Medical School(哈佛医学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 ReXSonoVQA是一个包含514个视频片段和514个问题的视频问答基准,旨在评估动作-目标推理、artifact解决与优化及过程上下文与规划能力,测试VLMs在动态过程理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14399 2026-04-17 cs.RO cs.AI cs.SY eess.SY 73%

SpaceMind: A Modular and Self-Evolving Embodied Vision-Language Agent Framework for Autonomous On-orbit Servicing

SpaceMind:一种模块化且自我进化的具身视觉-语言代理框架,用于自主在轨服务

Aodi Wu, Haodong Han, Xubo Luo, Ruisuo Wang, Shan He, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.RO、cs.AI

AI总结 本文提出SpaceMind框架,通过模块化和自我进化机制,实现自主在轨服务中的视觉感知、三维空间推理和多阶段任务执行,验证了其在不同环境下的鲁棒性和适应性。

Comments 23 pages, 6 figures, 7 tables. Code available at https://github.com/wuaodi/SpaceMind

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02738 2026-04-17 cs.RO cs.LG 73%

Flow with the Force Field: Learning 3D Compliant Flow Matching Policies from Force and Demonstration-Guided Simulation Data

流体与力场:从力和示范引导的仿真数据中学习3D顺应性流匹配策略

Tianyu Li, Yihan Li, Zizhe Zhang, Nadia Figueroa

机构 * GRASP Lab, University of Pennsylvania(GRASP实验室,宾夕法尼亚大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出一种框架,通过单人示范生成力引导的仿真数据,结合顺应性策略提升视觉模仿学习的性能,验证了在真实机器人任务中的可靠性与适应性。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11386 2026-04-14 cs.RO cs.CV 73%

ComSim: Building Scalable Real-World Robot Data Generation via Compositional Simulation

ComSim:通过组合模拟构建可扩展的现实世界机器人数据生成

Yiran Qin, Jiahua Ma, Li Kang, Wenzhan Li, Yihang Jiao, Xin Wen, Xiufeng Song, Heng Zhou, Jiwen Yu, Zhenfei Yin, Xihui Liu, Philip Torr, Yilun Du, Ruimao Zhang

机构 * CUHK-Shenzhen(香港中文大学(深圳)) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) USTC(中国科学技术大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Harvard University(哈佛大学)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Compositional Simulation方法,结合经典模拟与神经模拟生成准确的动作-视频对,通过闭环数据增强管道生成大规模高质量训练数据,减少仿真到现实的域差距,提升现实环境中的政策模型性能。

Comments 14 pages, 8 figures, 4 tables; supplementary material included; Project page: https://faceong.github.io/ComSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 73%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人数据与评测 :manipulation(abstract);world model(abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05057 2026-04-14 cs.RO cs.CV 73%

StaMo: Unsupervised Learning of Generalizable Robot Motion from Compact State Representation

StaMo:从紧凑状态表示中无监督学习通用机器人运动

Mingyu Liu, Jiuhe Shu, Hui Chen, Zeju Li, Canyu Zhao, Jiange Yang, Shenyuan Gao, Hao Chen, Chunhua Shen

机构 * State Key Laboratory of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Nanjing University(南京大学) HKUST(香港科技大学) Ant Group(蚂蚁集团)

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出StaMo方法,通过轻量编码器和预训练扩散变换器解码器学习高效紧凑状态表示,提升机器人运动性能,并发现通过潜在插值获得的token差异可作为有效潜动作,增强策略协同训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09330 2026-04-13 cs.RO cs.CV 73%

VAG: Dual-Stream Video-Action Generation for Embodied Data Synthesis

VAG:用于具身数据合成的双流视频-动作生成

Xiaolei Lang, Yang Wang, Yukun Zhou, Chaojun Ni, Kerui Li, Jiagang Zhu, Tianze Liu, Jiajun Lv, Xingxing Zuo, Yun Ye, Guan Huang, Xiaofeng Wang, Zheng Zhu

机构 * GigaAI Zhejiang University(浙江大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 机器人数据与评测 :world model(abstract);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 本文提出VAG模型,通过双流框架联合生成视频和动作,提升跨模态一致性,实现高效且准确的视频-动作配对生成,支持轨迹回放并提升下游策略泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08418 2026-04-10 cs.RO cs.AI 73%

Exploring Temporal Representation in Neural Processes for Multimodal Action Prediction

探索神经过程在多模态动作预测中的时间表示

Marco Gabriele Fedozzi, Yukie Nagai, Francesco Rea, Alessandra Sciutti

机构 * DIBRIS Department, University of Genoa(热那亚大学DIBRIS系) CONTACT Unit, Italian Institute of Technology(意大利理工学院CONTACT单元) International Research Center for Neurointelligence, The University of Tokyo(东京大学国际神经智能研究中心)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文研究了条件神经过程在机器人自监督多模态动作预测中的应用,提出改进的DMBN-PTE模型以提升时间信息表示的鲁棒性。

Comments Submitted to the AIC 2023 (9th International Workshop on Artificial Intelligence and Cognition)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06228 2026-04-09 cs.LG cs.AI cs.CL cs.DS cs.IR cs.IT math.IT 73%

Probabilistic Language Tries: A Unified Framework for Compression, Decision Policies, and Execution Reuse

概率语言树:压缩、决策策略和执行重用的统一框架

Gregory Magarshak

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出概率语言树(PLTs),通过显式表示生成模型隐含定义的前缀结构,实现最优无损压缩、序列决策问题的策略表示以及记忆化索引。核心成果是指导缓存定理,证明PLT缓存在查询次数低于阈值时具有更低的预期推理成本。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05800 2026-03-31 cs.RO cs.CV 73%

3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks

3D CAVLA:利用深度和3D上下文来泛化视觉语言动作模型以应对未见任务

Vineet Bhat, Yu-Hsiang Lan, Prashanth Krishnamurthy, Ramesh Karri, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学库朗数学科学研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出3D-CAVLA框架,通过引入链式推理、深度感知和任务导向的感兴趣区域检测,提升视觉语言动作模型在未见任务中的泛化能力,实验表明其在模拟和现实任务中均表现出色。

Comments Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18746 2026-03-30 cs.CV cs.AI 73%

Any4D: Open-Prompt 4D Generation from Natural Language and Images

Any4D: 从自然语言和图像生成开放提示的4D生成

Hao Li, Qiao Sun

专题命中 机器人数据与评测 :world model(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出Primitive Embodied World Models,通过限制视频生成时间范围,实现语言与视觉表示的细粒度对齐,降低学习复杂度,提升数据效率,并减少推理延迟,支持复杂任务的组合泛化。

Comments The authors identified issues in the 4D generation pipeline and evaluation that affect result validity. To ensure scientific accuracy, we will revise the methodology and experiments thoroughly before resubmitting. This version should not be cited or relied upon

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09622 2026-03-26 cs.RO cs.AI 73%

DIDLM: A SLAM Dataset for Difficult Scenarios Featuring Infrared, Depth Cameras, LIDAR, 4D Radar, and Others under Adverse Weather, Low Light Conditions, and Rough Roads

DIDLM:一种针对困难场景的SLAM数据集,包含红外、深度相机、LIDAR、4D雷达等,在恶劣天气、低光条件和粗糙路面下

Weisheng Gong, Chen He, Kaijie Su, Qingyong Li, Tong Wu, Z. Jane Wang

机构 * School of Information Science and Technology, Northwest University(信息科学与技术学院,西北大学) Department of Electrical and Computer Engineering, The University of British Columbia(电气与计算机工程系,不列颠哥伦比亚大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出DIDLM数据集,包含红外、深度相机、LIDAR、4D雷达等多传感器数据,用于解决恶劣天气、低光和粗糙路面下的SLAM问题,提供GPS/INS地面真实数据,支持自动驾驶和地面机器人应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23386 2026-03-25 cs.CV cs.GR cs.RO 73%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09109 2026-03-20 cs.RO cs.CV 73%

FoldNet: Learning Generalizable Closed-Loop Policy for Garment Folding via Keypoint-Driven Asset and Demonstration Synthesis

FoldNet:通过关键点驱动的资产和演示合成学习通用的闭环策略用于服装折叠

Yuxing Chen, Bowen Xiao, He Wang

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种合成服装数据集,通过关键点驱动的资产和演示合成,学习通用的服装折叠闭环策略,提升现实世界成功率25%。

Comments Project: https://pku-epic.github.io/FoldNet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17524 2026-03-19 cs.RO cs.AI 73%

KineVLA: Towards Kinematics-Aware Vision-Language-Action Models with Bi-Level Action Decomposition

KineVLA:面向运动学感知的视觉-语言-动作模型及双层动作分解

Gaoge Han, Zhengqing Gao, Ziwen Li, Jiaxin Huang, Shaoli Huang, Fakhri Karray, Mingming Gong, Tongliang Liu

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KineVLA模型,通过双层动作分解实现运动学感知,提升动作执行的精度与可控性,实验表明其在运动学敏感基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 73%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12936 2026-03-16 cs.RO cs.CV 73%

MotionAnymesh: Physics-Grounded Articulation for Simulation-Ready Digital Twins

MotionAnymesh:基于物理的运动模拟数字双胞胎生成

WenBo Xu, Liu Liu, Li Zhang, Dan Guo, RuoNan Liu

专题命中 机器人数据与评测 :embodied AI(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 本文提出MotionAnymesh框架,通过结合物理先验知识和几何物理联合估计,解决静态3D网格转化为可交互数字双胞胎的难题,提升模拟精度和物理可行性。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16667 2026-03-13 cs.RO cs.CV 73%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05932 2026-03-09 cs.CV cs.RO 73%

FTSplat: Feed-forward Triangle Splatting Network

FTSplat:前馈三角形散射网络

Xiong Jinlin, Li Can, Shen Jiawei, Qi Zhigang, Sun Lei, Zhao Dongyang

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 FTSplat通过前馈三角形生成网络实现高效的三维重建,无需每场景优化,直接生成可用于模拟的连续三角形表面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10085 2026-03-03 cs.CV cs.AI 73%

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

VITA:通过视觉语言模型的测试时间适应实现零样本价值函数

Christos Ziakas, Alessandra Russo

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。

Comments International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20566 2026-02-25 cs.RO cs.CV 73%

BFA++: Hierarchical Best-Feature-Aware Token Prune for Multi-View Vision Language Action Model

BFA++: 多视角视觉语言动作模型的分层最佳特征感知令牌剪枝

Haosheng Li, Weixin Mao, Zihan Lan, Hongwei Xiong, Hongan Wang, Chenyang Si, Ziwei Liu, Xiaoming Deng, Hua Chen

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) LimX Dynamic(LimX动态) Nanjing University(南京大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 BFA++通过分层最佳特征感知令牌剪枝提升多视角视觉语言动作模型的效率和成功率

Comments 9 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07730 2026-02-24 cs.LG cs.RO 73%

Multistep Quasimetric Learning for Scalable Goal-conditioned Reinforcement Learning

多步准度量学习用于可扩展的目标导向强化学习

Bill Chunyuan Zheng, Vivek Myers, Benjamin Eysenbach, Sergey Levine

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG

AI总结 本文提出了一种基于多步准度量学习的离线目标导向强化学习方法,通过多步蒙特卡洛回报提升长视野任务的性能,并在现实世界机器人操作中实现了多步拼接。

Journal ref ICLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08822 2026-02-19 cs.RO cs.AI 73%

FreqPolicy: Efficient Flow-based Visuomotor Policy via Frequency Consistency

FreqPolicy: 通过频率一致性实现高效的基于流的视觉-运动策略

Yifei Su, Ning Liu, Dong Chen, Zhen Zhao, Kun Wu, Meng Li, Zhiyuan Xu, Zhengping Che, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) NLPR, MAIS, Institute of Automation of Chinese Academy of Sciences(神经语言处理实验室、人工智能研究所、中国科学院自动化研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 FreqPolicy通过频率一致性约束提升基于流的视觉-运动策略的效率与质量,实现高效、高质量的动作生成。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11526 2026-02-17 cs.RO cs.AI 73%

Foundation Models in Autonomous Driving: A Survey on Scenario Generation and Scenario Analysis

自动驾驶中的基础模型:场景生成与场景分析的综述

Yuan Gao, Mattia Piccinini, Yuchen Zhang, Dingrui Wang, Korbinian Moller, Roberto Brusnicki, Baha Zarrouki, Alessio Gambi, Jan Frederik Totz, Kai Storms, Steven Peters, Andrea Stocco, Bassam Alrifaee, Marco Pavone, Johannes Betz

专题命中 机器人数据与评测 :navigation(abstract);world model(abstract);分类 cs.RO、cs.AI

AI总结 本文综述了基础模型在自动驾驶场景生成与分析中的应用,探讨了相关模型、方法及挑战。

Comments IEEE Open Journal of Intelligent Transportation Systems

Journal ref IEEE Open Journal of Intelligent Transportation Systems, 03 February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13806 2026-02-17 cs.CV cs.RO 73%

Gaussian Sequences with Multi-Scale Dynamics for 4D Reconstruction from Monocular Casual Videos

具有多尺度动态的高斯序列用于从单目随意视频中进行4D重建

Can Li, Jie Gu, Jingmin Chen, Fangzhou Qiu, Lei Sun

机构 * Nankai University(南开大学) Rightly Robotics

专题命中 机器人数据与评测 :robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本文提出了一种基于多尺度动态的高斯序列方法,用于从单目随意视频中实现准确且一致的4D重建,通过多级运动组合和多模态先验约束提升重建保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04955 2026-02-17 cs.RO cs.AI 73%

Experimental Evaluation of ROS-Causal in Real-World Human-Robot Spatial Interaction Scenarios

在真实人类-机器人空间交互场景中对ROS-Causal的实验评估

Luca Castri, Gloria Beraldo, Sariah Mghames, Marc Hanheide, Nicola Bellotto

机构 * School of Computer Science, University of Lincoln, UK(林肯大学计算机科学学院) Dept. of Information Engineering, University of Padua, Italy(帕多瓦大学信息工程系) National Research Council of Italy(意大利国家研究理事会)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本研究评估了ROS-Causal框架在真实人类-机器人空间交互场景中的性能,通过模拟和实验室实验验证其在因果发现和机器人部署中的有效性。

Comments Published at 2024 IEEE International Conference on Robot and Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10775 2026-02-12 cs.CV cs.AI eess.IV 73%

A New Dataset and Performance Benchmark for Real-time Spacecraft Segmentation in Onboard Computers

一种新的数据集和性能基准用于机载计算机上的实时航天器分割

Jeffrey Joan Sam, Janhavi Sathe, Nikhil Chigali, Naman Gupta, Radhey Ruparel, Yicheng Jiang, Janmajay Singh, James W. Berck, Arko Barman

机构 * Department of Computer Science, Rice University(计算机科学系,里士大学) Johnson Space Center, NASA(约翰逊航天中心,美国国家航空航天局) Data to Knowledge Lab, Rice University(数据到知识实验室,里士大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种新的航天器分割数据集和性能基准,通过真实航天器模型和混合背景生成,结合噪声和失真模拟,用于实时机载应用的图像分割挑战测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10015 2026-02-12 cs.RO cs.AI 73%

RoboSubtaskNet: Temporal Sub-task Segmentation for Human-to-Robot Skill Transfer in Real-World Environments

RoboSubtaskNet: 人类-机器人技能转移中的时间子任务分割用于现实环境

Dharmendra Sharma, Archit Sharma, John Rebeiro, Vaibhav Kesharwani, Peeyush Thakur, Narendra Kumar Dhar, Laxmidhar Behera

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 RoboSubtaskNet通过结合增强注意力的I3D特征和改进的MS-TCN,实现了人类-机器人技能转移中的时间子任务分割,提升了现实环境中的机器人操作性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18083 2026-02-11 cs.LG cs.RO 73%

What Do You Need for Compositional Generalization in Diffusion Planning?

在扩散规划中你需要什么才能实现组合泛化?

Quentin Clark, Florian Shkurti

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学)

专题命中 机器人数据与评测 :manipulation(abstract);navigation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出Eq-Net架构,通过位移等变性、局部感受野和推断选择实现扩散规划的组合泛化,展示其在导航和操作任务中的有效性。

Comments 8 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏