arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8660 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8660 篇

2504.02918 2026-06-30 cs.CV 70%

Evaluating Newtonian Mechanics in Video Generative Models with Real Physical Systems

在视频生成模型中评估牛顿力学

Antonios Tragoudaras, Chenyu Zhang, Daniil Cherniavskii, Antonios Vozikis, Thijmen Nijdam, Derck W. E. Prinzhorn, Mark Bodracska, Nicu Sebe, Andrii Zadaianchuk, Efstratios Gavves

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出Morpheus框架,通过真实物理系统评估视频生成模型对牛顿力学的理解能力,揭示当前模型在物理原理编码上的不足。

Comments Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00599 2026-06-30 cs.CV 70%

XYZ-IBD: Benchmarking Robust 6D Object Pose Estimation under Real-World Industrial Complexity

XYZ-IBD:在现实工业复杂性下评估鲁棒的6D物体姿态估计的基准测试

Junwen Huang, Jiaqi Hu, Peter KT Yu, Slobodan Ilic, Martin Sundermeyer, Benjamin Busam

机构 * Technical University of Munich(慕尼黑工业大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) XYZ Robotics ROBOX Google(谷歌)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 XYZ-IBD是一个专门针对工业分拣的高精度基准,包含75个多视角真实场景,通过高密度随机堆叠和多实例模糊性反映真实机器人操作挑战,验证了工业视觉中6D姿态估计的性能退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28182 2026-06-29 cs.LG cs.AI cs.CV cs.RO 新提交 70%

LLawCo: Learning Laws of Cooperation for Modeling Embodied Multi-Agent Behavior

LLawCo: 学习合作法则以建模具身多智能体行为

Qinhong Zhou, Chuang Gan, Anoop Cherian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mitsubishi Electric Research Laboratories(三菱电机研究实验室)

专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出LLawCo框架,通过反思失败提取行为模式并推导高层合作法则,结合监督微调融入推理,提升具身多智能体在分散部分可观测环境中的合作效率与任务成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25212 2026-06-26 cs.RO 新提交 70%

RigPI: Dynamic Parameter Identification of Rigid Body via VLM-Seeded Differentiable Simulation

RigPI: 通过VLM种子可微仿真进行刚体动力学参数辨识

Xincheng He, Rongrong Zhang, Wei Jiang, Wenqiang Xu

机构 * Way-Robotics(Way-机器人)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RigPI框架,结合视觉语言模型初始化和可微物理仿真梯度优化,两步策略实现刚体与多连杆刚体动力学参数精确辨识,实验验证了其鲁棒性和预测有效性。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23006 2026-06-23 cs.RO 新提交 70%

ISOPoT: Imaging Sonar Odometry by Point Tracking

ISOPoT:基于点跟踪的成像声纳里程计

Jaša Samec, Vid Rijavec, Marko Peljhan, Aleksander Grm, Andrej Androjna, Danijel Skočaj, Matej Dobrevski

机构 * Faculty of Computer and Information Science, University of Ljubljana(卢布尔雅那大学计算机与信息科学学院) Faculty of Maritime Studies and Transport, University of Ljubljana(卢布尔雅那大学海事研究与运输学院) OZON Research Group, TIMTEC(TIMTEC公司OZON研究组) MAT Systemics, University of California, Santa Barbara(加州大学圣塔芭芭拉分校MAT系统学)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 提出ISOPoT方法,利用现代点跟踪技术构建声纳里程计管道,通过多帧点轨迹作为主要对应表示,结合轻量级优化提升鲁棒性,在真实水下数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21596 2026-06-23 cs.CV 新提交 70%

$ϕ$-Scene: Physically Grounded Image-to-3D Scene Reconstruction

$\phi$-Scene: 物理驱动的图像到3D场景重建

Haodong Li, Lulu Shao, Haolin Lu, Yu Fu, Yen-Ru Chen, Seemandhar Jain, Manmohan Chandraker

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 机器人数据与评测 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 提出$\phi$-Scene方法,将单图像3D场景重建视为拓扑驱动的物理组装过程,通过SDF优化和刚体仿真解决穿透与不稳定接触问题,在3D-Front数据集上取得最优性能。

Comments Project page: https://phi-scene.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21100 2026-06-23 cs.RO 新提交 70%

Factor-Aware Mixture-of-Experts with Pretrained Encoder for Combinatorial Generalization

面向组合泛化的因子感知混合专家与预训练编码器

Feihong Zhang, Guojian Zhan, Zeyu He, Yinuo Wang, Likun Wang, Tianze Zhu, Yao Lyu, Tao Zhang, Tinghao Yi, Wei You, Shengbo Eben Li

机构 * Tsinghua University(清华大学) SunRisingAI Ltd.(日升AI有限公司) EFORT Intelligent Robot Co., Ltd.(埃夫特智能机器人有限公司)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出FAME框架,结合因子感知混合专家与预训练编码器,通过三阶段训练实现视觉机器人操作在多变环境中的组合泛化,在Meta-World和真实任务中分别提升34%和35%。

Comments 8 pages, 9 figures, accepted by the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 70%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09139 2026-06-23 cs.CV 新提交 70%

A Geometric Framework for Absolute Pose and Velocity Estimation with Event Cameras

事件相机的绝对位姿与速度估计的几何框架

Zibin Liu, Shunkun Liang, Banglei Guan, Yang Shang, Qifeng Yu, Ji Zhao

机构 * National University of Defense Technology(国防科技大学) independent researcher(独立研究者)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出利用3D直线及其触发事件的几何约束,通过线性与多项式求解器同时估计事件相机的绝对位姿和速度,最少仅需三个对应关系,在精度和效率上超越现有方法。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04825 2026-06-23 cs.RO 版本更新 70%

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning

HapTile: 用于接触丰富模仿学习的触觉感知视觉-触觉-语言-动作数据集

Amirhosein Alian, Yongqiang Zhao, Shiyi Gu, Xuyang Zhang, Zhuo Chen, Christopher E. Mower, Haitham Bou-Ammar, Shan Luo

机构 * King’s College London, UK(伦敦国王学院) Huawei, Noah’s Ark Lab, UK(华为、诺亚实验室) University College London, UK(伦敦大学学院)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出HapTile数据集,通过集成指尖触觉反馈和操作员触觉感知,为接触丰富的机器人操作任务提供视觉-触觉-语言-动作联合数据,并验证其在策略学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19948 2026-06-19 cs.AI 新提交 70%

Advancing DialNav through Automatic Embodied Dialog Augmentation

通过自动具身对话增强推进DialNav

Leekyeung Han, Sangwon Jung, Hyunji Min, Jinseong Jeong, Minyoung Kim, Paul Hongsuck Seo

机构 * Korea University(高丽大学) Trillion Labs

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI

AI总结 提出自动生成管道构建大规模RAINbow数据集(238K episodes),结合双策略训练和定位模型,在DialNav任务上实现成功率显著提升(Val Seen +89%,Val Unseen +100%)。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16788 2026-06-16 cs.RO 新提交 70%

SoK: Security and Privacy of Foundation-Model-Powered Robots

SoK: 基础模型驱动机器人的安全与隐私

Xueluan Gong, Chen Chen, Jinxin Liu, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University(武汉大学网络空间安全学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出F-E-S-G结构边界框架,系统分析基础模型驱动机器人的安全与隐私风险,并基于96篇论文揭示威胁模式、防御不匹配和评估差距。

Comments 21 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 70%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09967 2026-06-10 cs.CV 新提交 70%

ABot-Earth 0.5: Generative 3D Earth Model

ABot-Earth 0.5:生成式3D地球模型

Ming Qian, Tianjian Ouyang, Mingchao Sun, Zijian Wang, Jincheng Xiong, Jiarong Han, Yongchang Zhang, Jiawei Zhang, Xu Wang, Yu Liu, Luyang Tang, Fei Yu, Zengye Ge, Mengmeng Du, Yuan Liu, Nianfei Fan, Song Wang, Yingliang Peng, Chunxue Jia, Yang Liu, Shiying Zeng, Haozhe Shi, Junnan Lai, Hongyu Pan, Zheng Wu, Ning Guo, Mu Xu, Hang Zhang

机构 * AMAP CV Lab(AMAP视觉实验室)

专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV

AI总结 提出ABot-Earth 0.5框架,利用3D高斯泼溅从卫星图像生成大规模无缝3D环境,每平方公里合成时间低于10分钟,支持实时交互可视化,降低3D重建成本。

Comments From Amap-cvlab, Alibaba. Official page: https://abot-earth.amap.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07118 2026-06-09 cs.RO 版本更新 70%

QuadVerse: An Integrated Framework Aligning Visual-Physical Reality for Quadruped Simulation

QuadVerse:一种对齐视觉-物理现实用于四足仿真的集成框架

Yuxiang Chen, Yuanhao Wang, Ziheng Zhang, Meng Zhang, Yu Liu, Yufei Jia, Tiancai Wang, Erjin Zhou, Jin Xie

机构 * Nanjing University(南京大学) BUPT(北京邮电大学) DEXMAL Tsinghua University(清华大学)

专题命中 机器人数据与评测 :robot learning(abstract);navigation(abstract);分类 cs.RO

AI总结 提出QuadVerse框架,通过重建场景校准视觉、物理和致动器,利用3DGS和接触校准减少仿真到现实的差距,实现零样本视觉导航策略部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06130 2026-06-05 cs.RO 70%

Towards Realistic 3D Sonar Simulation

面向真实3D声纳仿真

Youssef Attia, Davide Costa, Francesco Wanderlingh, Filippo Campagnaro, Enrico Simetti

机构 * IEEE

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文提出一种模块化架构,结合GPU加速图形引擎与物理声学传播原理,在NVIDIA Isaac Sim中实现基于Water Linked 3D-15传感器的体积3D声纳模型,并通过硬件在环配置验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05873 2026-06-05 cs.RO cs.AI cs.CV cs.LG 70%

LadderMan: Learning Humanoid Perceptive Ladder Climbing

LadderMan: 学习人形机器人感知爬梯

Siheng Zhao, Yuanhang Zhang, Ziqi Lu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Yue Wang, C. Karen Liu, Guanya Shi

机构 * Amazon FAR(亚马逊FAR) USC(美国南加州大学) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出LadderMan系统,通过两阶段学习管道和视觉基础模型,使人形机器人能够鲁棒地攀爬多种梯子并在梯子上进行操控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05159 2026-06-04 cs.RO 70%

X4Val: Learning Neural Surrogates for Variance-Reduced Policy Evaluation

X4Val: 学习方差缩减策略评估的神经代理模型

Rachel Luo, Michael Watson, Apoorva Sharma, Heng Yang, Han Qi, Edward Schmerling, Sushant Veer, Boris Ivanovic, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究院) Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出X4Val框架,通过嵌入多域数据并学习可迁移预测器,结合控制变量估计器实现无配对样本下的方差缩减,在自动驾驶和机器人操作任务中方差降低达38.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04829 2026-06-04 cs.RO 70%

M3imic: Learning a Versatile Whole-Body Controller for Multimodal Motion Mimicking

M3imic: 学习用于多模态运动模仿的通用全身控制器

Zuxing Lu, Ziang Zheng, Yao Lyu, Jingyu Liu, Feihong Zhang, Song Lu, Xin Yuan, Changyin Sun, Xingxing Zuo, Shengbo Eben Li

机构 * School of Automation, Southeast University(东南大学自动化学院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) Department of Robotics, Mohamed Bin Zayed University of Artificial Intelligence(马尔代夫比兹亚德大学人工智能学院机器人系)

专题命中 机器人数据与评测 :manipulation(abstract,abstract_cn);分类 cs.RO

AI总结 提出M3imic框架,通过模态特定编码器将异构运动参考模态(机器人关节角度、人体姿态轨迹、末端执行器位姿)映射到共享潜在空间,并利用大规模强化学习训练单一策略,实现无需模态特定重训练的sim-to-real迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04773 2026-06-04 cs.CV cs.CL 70%

NextMotionQA: Benchmarking and Judging Human Motion Understanding with Vision-Language Models

NextMotionQA: 使用视觉语言模型基准测试和评判人体运动理解

Yong Cao, Chuqiao Li, Xianghui Xie, Gerard Pons-Moll, Andreas Geiger

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Saarland Informatics Campus(萨尔兰州信息学院)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 提出NextMotionQA基准,通过三项互补任务和多粒度难度分层,系统评估视觉语言模型在人体运动理解中的能力,并揭示其在细粒度评判中的局限性。

Comments 23 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02246 2026-06-02 cs.CV 70%

Ego-METAS: Egocentric online Multimodal Energy-efficient Temporal Action Segmentation benchmark

Ego-METAS:面向自我中心的在线多模态节能时间动作分割基准

Maria Santos-Villafranca, Jesus Bermudez-cameo, Alejandro Perez-Yus, Giovanni Maria Farinella, Antonino Furnari

机构 * University of Zaragoza - I3A(萨拉戈塔大学 - I3A) Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系)

专题命中 机器人数据与评测 :embodied AI(abstract);embodied agent(abstract);分类 cs.CV

AI总结 为解决资源受限设备上的能耗感知问题,提出了首个自我中心在线多模态节能时间动作分割基准Ego-METAS,包含超过100小时未裁剪视频和5种模态,要求模型动态选择传感器并遵守能量预算,评估显示最优路由高度依赖场景,现有方法难以适应连续环境。

Comments Project Page: https://maria-sanvil.github.io/Ego-METAS-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29973 2026-06-02 cs.RO 70%

Replicable Simulation-Based Robot Validation through Provenance

通过数据溯源实现可复现的基于仿真的机器人验证

Argentina Ortega, Samuel Wiest, Frederik Pasch, Nico Hochgeschwender

机构 * Argentine Institute of Technology(阿根廷技术研究所)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 针对基于仿真的机器人验证可复现性不足的问题,提出将数据溯源与FAIR原则集成到测试流程中,通过追踪工件链接和附加机器可读元数据来增强可复现性,并在移动机器人导航数据集上验证了该方法。

Comments Accepted for publication at 2026 IEEE RAS International Conference on Engineering Reliable Autonomous Systems (ERAS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14010 2026-06-02 cs.RO 70%

URDF-Anything+: End-to-End Generation for Simulation-Ready Articulated Assets

URDF-Anything+:面向仿真就绪铰接资产的端到端生成

Zhuangzhe Wu, Yue Xin, Chengkai Hou, Minghao Chen, Yaoxu Lyu, Jieyu Zhang, Shanghang Zhang

机构 * Peking University(北京大学) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :robotics(abstract);manipulation(abstract);分类 cs.RO

AI总结 提出URDF-Anything+,一种端到端自回归扩散框架,从单张RGB图像直接生成仿真就绪的URDF模型,统一建模部件几何与铰接结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28110 2026-05-28 cs.RO 70%

STR Robot: Design of an Autonomous Mobile Robot from Simulation to Reality

STR机器人:从仿真到现实的自主移动机器人设计

Vinh Nguyen, Gia-Uy Le, Tien-Dat Nguyen, Tri-Tin Nguyen, Vinh-Hao Nguyen

机构 * Faculty of Electrical and Electronic Engineering, Ho Chi Minh City University of Technology, VNU-HCM(电子工程学院,胡志明市技术大学,VNU-HCM)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种基于现有机械平台的自主移动机器人仿真到现实实现方法,重点开发机载控制、自定位和自主导航系统,并通过仿真和实验验证其可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14075 2026-05-28 cs.RO cs.SY eess.SY 70%

RCM Constraint-Consistent Dynamic Control in Surgical Robots

手术机器人中的RCM约束一致性动态控制

Yu Li, Hamid Sadeghian, Zewen Yang, Valentin Le Mesle, Sami Haddadin

机构 * Munich Institute of Robotics and Machine Intelligence, Technical University of Munich, Germany(慕尼黑机器人与机器智能研究所,慕尼黑技术大学,德国) Mohamed Bin Zayed University of Artificial Intelligence, Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学,阿布扎比,阿联酋)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 将远程运动中心(RCM)建模为流变完整约束,并集成到基于投影的逆动力学控制器中,实现扭矩层面的约束一致控制,降低RCM残差并平滑扭矩曲线。

Comments Accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09458 2026-05-26 cs.RO 70%

Stein Variational Ergodic Surface Coverage with SE(3) Constraints

Stein变分遍历曲面覆盖与SE(3)约束

Jiayun Li, Yufeng Jin, Sangli Teng, Dejian Gong, Georgia Chalvatzaki

机构 * Department of Computer Science, TU Darmstadt(图宾根大学计算机科学系) Honda Research Institute Europe GmbH(本田欧洲研究院) University of California, Berkeley(加州大学伯克利分校)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种基于预条件SE(3) Stein变分梯度下降的采样即优化方法,用于生成满足SE(3)约束的遍历轨迹,实现复杂3D点云曲面的高质量覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10543 2026-05-26 cs.CV 70%

TIE: Time Interval Encoding for Video Generation over Events

TIE:面向事件视频生成的时间区间编码

Zhilei Shu, Shangwen Zhu, Zihang Liang, Xiaofan Li, Qianyu Peng, Xinyu Cui, Bo Ye, Yiming Li, Fan Cheng, Jian Zhao, Yang Cao, Zheng-Jun Zha, Ruili Feng

机构 * University of Science and Technology of China(中国科学技术大学) Matrix Team(Matrix团队) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) The Pennsylvania State University(宾夕法尼亚州立大学) Zhongguancun Academy(中关村学院) The University of Hong Kong(香港大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 提出时间区间编码(TIE),将旋转位置嵌入推广为区间感知形式,解决扩散变换器(DiT)在重叠事件视频生成中时间区间无法表示的问题,显著提升时间可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20774 2026-05-21 cs.RO 70%

VLA-REPLICA: A Low-Cost, Reproducible Benchmark for Real-World Evaluation of Vision-Language-Action Models

VLA-REPLICA: 一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准

Alex S. Huang, Jiahui Zhang, Shiqing Tang, Yu Xiang

机构 * Intelligent Robotics and Vision Lab, University of Texas at Dallas(德克萨斯大学达拉斯分校智能机器人与视觉实验室) Allen High School(艾伦高中)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出VLA-REPLICA,一种低成本、可重复的现实世界评估视觉-语言-动作模型的基准,通过使用现成组件构建,提供一致的环境用于政策评估,并包含多样化的操作任务和小规模演示数据集,用于目标域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07303 2026-05-20 cs.RO 70%

Robots that learn to evaluate models of collective behavior

能够评估集体行为模型的机器人

Mathis Hocke, Andreas Gerken, David Bierbach, Jens Krause, Tim Landgraf

机构 * Department of computer science, Freie Universität Berlin(自由大学柏林计算机科学系) SCIoI Excellence Cluster, Technische Universität Berlin(柏林技术大学SCIoI卓越中心) Faculty of Life Sciences, Humboldt-Universität zu Berlin(柏林洪堡大学生命科学学院) Department of Fish Biology, Fisheries, and Aquaculture, Leibniz Institute of Freshwater Ecology and Inland Fisheries(莱比锡淡水生态与内陆渔业研究所鱼类生物学、渔业与水产养殖系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于强化学习的框架,利用仿生机器人鱼评估活鱼行为的计算模型,通过闭环交互量化真实鱼与模拟鱼行为的差异,展示了学习驱动的机器人实验如何发现行为模型的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16309 2026-05-20 eess.IV cs.CV physics.med-ph 70%

Rapid patient-specific neural networks for intraoperative X-ray to volume registration

快速的患者特异性神经网络用于术中X射线到体积的配准

Vivek Gopalakrishnan, David-Dimitris Chlorogiannis, Andrew Abumoussa, Anna M. Larson, Nazim Haouchine, Darren B. Orbach, Sarah Frisken, Neel Dey, Polina Golland

机构 * Harvard-MIT Health Sciences and Technology, Massachusetts Institute of Technology(哈佛-麻省理工健康科学与技术, 麻省理工学院) Computer Science and Artificial Intelligence Laboratory, Massachusetts Institute of Technology(计算机科学与人工智能实验室, 麻省理工学院) Department of Radiology, Harvard Medical School(哈佛医学院放射科) Saint Luke’s Marion Bloch Neuroscience Institute(圣路易斯马里恩布洛克神经科学研究所) Department of Critical Care Medicine, Shriners Children’s Hospital(谢尔曼儿童医院重症医学科) Department of Interventional Neuroradiology, Boston Children’s Hospital(波士顿儿童医院介入神经放射科) Athinoula A. Martinos Center for Biomedical Imaging, Massachusetts General Hospital(阿提努拉A·马丁诺斯生物医学成像中心, 麻省总医院)

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出了一种自监督框架xvr,结合患者特异性神经网络和梯度优化,实现了快速且准确的2D到3D配准,通过物理模拟生成训练数据,无需手动标注,提升了临床和研究社区的广泛应用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏