arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 8660 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人数据与评测 8660 篇

2603.26685 2026-03-31 cs.RO cs.AI cs.CV cs.LG 70%

Contextual Graph Representations for Task-Driven 3D Perception and Planning

基于任务驱动的3D感知与规划的上下文图表示

Christopher Agia

专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文研究了现有具身AI环境在机器人任务规划与3D场景图交集中的适用性,构建了评估现有经典规划器的基准,并探索图神经网络在规划领域关系结构不变性中的应用。

Comments University of Toronto Undergraduate Thesis, 2021. 85 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24941 2026-03-27 cs.CV cs.CL 70%

Beyond Attention Magnitude: Leveraging Inter-layer Rank Consistency for Efficient Vision-Language-Action Models

超越注意力幅度:利用层间排名一致性提升高效视觉-语言-动作模型

Peiju Liu, Jinming Liu, Xipeng Qiu, Xuanjing Huang

机构 * Fudan University(复旦大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出TIES框架,通过层间排名一致性动态平衡注意力幅度,提升视觉-语言-动作模型的效率,实现在CogACT+SIMPLER基准上成功率提升6%并减少78%的token使用。

Comments 10 pages, 7 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22666 2026-03-27 cs.CV 70%

ArtPro: Self-Supervised Articulated Object Reconstruction with Adaptive Integration of Mobility Proposals

ArtPro: 基于自监督的可动物体重建与移动提案的自适应整合

Xuelu Li, Zhaonan Wang, Xiaogang Wang, Lei Wu, Manyi Li, Changhe Tu

机构 * Shandong University(山东大学) Southwest University(西南大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 ArtPro提出了一种自监督框架,通过自适应整合移动提案来解决传统方法在复杂多部件物体重建中的精度和稳定性问题,实验表明其在合成和真实物体上均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 70%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20150 2026-03-26 cs.RO 70%

HortiMulti: A Multi-Sensor Dataset for Localisation and Mapping in Horticultural Polytunnels

HortiMulti:一种用于温室局部化与建图的多传感器数据集

Shuoyuan Xu, Zhipeng Zhong, Tiago Barros, Matthew Coombes, Cristiano Premebida, Hao Wu, Cunjia Liu

机构 * Department of Aeronautical and Automotive Engineering, Loughborough University(航空航天与汽车工程系,洛桑大学) Department of Electrical and Computer Engineering, Institute of Systems and Robotics, University of Coimbra(电气与计算机工程系,系统与机器人研究所,科英布拉大学) Antobot Ltd, Arise Innovation Hub(Antobot公司,Arise创新中心)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出HortiMulti数据集,用于解决温室环境中局部化与建图的挑战,通过多传感器数据验证现有方法的不足,为农业机器人提供可靠资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21577 2026-03-24 cs.AI 70%

Mind over Space: Can Multimodal Large Language Models Mentally Navigate?

心灵超越空间:多模态大语言模型能否进行心理导航?

Qihui Zhu, Shouwei Ruan, Xiao Yang, Hao Jiang, Yao Huang, Shiji Zhao, Hanwei Fan, Hang Su, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学计算机科学与技术系) School of Automation Science and Electrical Engineering , Beihang University(北京航空航天大学自动化科学与电气工程学院) college of AI, Tsinghua University(清华大学人工智能学院) Department of Computer Science and Technology , Tsinghua University(清华大学计算机科学与技术系)

专题命中 机器人数据与评测 :embodied agent(abstract);navigation(abstract);分类 cs.AI

AI总结 本文提出Video2Mental基准测试,评估多模态大语言模型的空间导航能力,发现标准预训练模型无法自然生成空间表示,NavMind通过显式认知地图提升导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20992 2026-03-24 cs.RO 70%

Geometrically Plausible Object Pose Refinement using Differentiable Simulation

基于可微模拟的几何合理物体姿态细化

Anil Zeybek, Rhys Newbury, Snehal Dikhale, Nawid Jamali, Soshi Iba, Akansel Cosgun

机构 * Monash University(墨尔本大学) Honda Research Institute(本田研究院) Technical University of Munich(慕尼黑技术大学) Physical AI(物理AI)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出结合可微物理模拟、可微渲染和视觉-触觉传感的多模态姿态优化方法,提升空间准确性和物理一致性,实验表明在初始估计准确和高初始不确定性下,显著优于标准ICP基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20827 2026-03-24 cs.RO 70%

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

Swim2Real: 基于视觉-语言模型的系统辨识用于仿真到现实迁移

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes

机构 * University of Warsaw(华沙大学) IDEAS NCBR EPFL(瑞士联邦理工学院) ETH Zurich(苏黎世联邦理工学院) Nomagic

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出Swim2Real系统,利用视觉-语言模型反馈校准水下仿真实验室,无需手动设计搜索阶段。通过同时校准16个参数,显著提升仿真到现实的迁移效果,实现零样本强化学习迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19616 2026-03-23 cs.CV 70%

UniPR: Unified Object-level Real-to-Sim Perception and Reconstruction from a Single Stereo Pair

UniPR: 一种统一的基于单立体对的物体级实拍到仿真感知与重建框架

Chuanrui Zhang, Yingshuang Zou, ZhengXian Wu, Yonggen Ling, Yuxiao Yang, Ziwei Wang

机构 * NTU(国立新加坡大学) Tencent Robotics X(腾讯机器人实验室) Futian Laboratory(福田实验室) HKUST(香港科技大学) THU(清华大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.CV

AI总结 本文提出UniPR,一种端到端的物体级实拍到仿真感知与重建框架,通过几何约束解决尺度模糊问题,消除了对类别特定规范的依赖,并通过大规模立体数据集LVS6D提升研究效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14460 2026-03-23 cs.RO 70%

Learning Discrete Abstractions for Visual Rearrangement Tasks Using Vision-Guided Graph Coloring

通过视觉引导的图着色学习视觉排列任务的离散抽象

Abhiroop Ajith, Constantinos Chamzas

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出通过结合结构约束和注意力引导的视觉距离,学习视觉排列任务的离散图结构抽象,以支持高效规划。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17850 2026-03-19 cs.RO 70%

ProbeFlow: Training-Free Adaptive Flow Matching for Vision-Language-Action Models

ProbeFlow: 无需训练的自适应流匹配用于视觉-语言-动作模型

Zhou Fang, Jiaqi Wang, Yi Zhou, Qiongfeng Shi

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室,中华人民共和国教育部,中国) School of Electronic Science & Engineering, Southeast University, China(东南大学电子科学与工程学院,中国)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ProbeFlow通过动态调度积分步骤减少冗余网络计算,提升动作解码效率和系统延迟,保持动作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.11279 2026-03-19 cs.RO cs.SY eess.SY 70%

Project-Based Learning for Robot Control Theory: A Robot Operating System (ROS) Based Approach

基于项目学习的机器人控制理论:基于机器人操作系统(ROS)的方法

Siavash Farzan

机构 * Robotics Engineering Department(机器人工程系) Worcester Polytechnic Institute(沃斯特理工学院)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出六个项目式任务,利用ROS和Gazebo模拟环境,帮助学生通过实践掌握控制理论和机器人技术,弥补理论与实践的差距。

Comments 24 pages, 15 figures, accepted for publication in the 2023 ASEE Annual Conference Proceedings, American Society for Engineering Education

Journal ref 2023 ASEE Annual Conference & Exposition, Baltimore, Maryland. https://strategy.asee.org/43968

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16882 2026-03-19 eess.SY cs.RO cs.SY math.DG 70%

The Port-Hamiltonian Structure of Vehicle Manipulator Systems

车辆机械臂系统的端哈密顿结构

Ramy Rashad

机构 * Control and Instrumentation Engineering department and Interdisciplinary Research Center for Smart Mobility and Logistics, King Fahd University of Petroleum and Minerals(控制与仪器工程系和智能交通与物流跨学科研究中心,国王法赫德石油与矿物大学) Instrumentation Engineering department(仪器工程系) Interdisciplinary Research Center for Smart Mobility(智能交通跨学科研究中心) Logistics, King Fahd University of Petroleum(物流,国王法赫德石油大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出车辆机械臂系统的端哈密顿描述,揭示了复杂机械系统的能量流动与守恒特性,通过哈密顿约简理论推导了端哈密顿动力学,并给出了标准形式和惯性解耦形式,适用于控制设计和数值模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 70%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 机器人数据与评测 :embodied agent(abstract);manipulation(abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16240 2026-03-18 cs.RO 70%

Industrial cuVSLAM Benchmark & Integration

工业 cuVSLAM 评估与集成

Charbel Abi Hana, Kameel Amareen, Mohamad Mostafa, Dmitry Slepichev, Hesam Rabeti, Zheng Wang, Mihir Acharya, Anthony Rizk

机构 * Idealworks NVIDIA

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 本文评估了视觉里程计和视觉SLAM系统在真实物流环境中的导航性能,通过对比多种视觉里程计方法及大规模生产设施数据集,验证了cuVSLAM与定制SLAM后端结合的高精度映射能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00831 2026-03-17 cs.CV 70%

UPGS: Unified Pose-aware Gaussian Splatting for Dynamic Scene Deblurring

UPGS:面向动态场景模糊的统一姿态感知高斯点分布

Zhijing Wu, Longguang Wang

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.CV

AI总结 本文提出统一优化框架,通过将相机姿态作为可学习参数与3DGS属性结合,实现端到端优化,提升动态去模糊的重建质量和姿态估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13785 2026-03-17 cs.RO 70%

Robust Sim-to-Real Cloth Untangling through Reduced-Resolution Observations via Adaptive Force-Difference Quantization

通过自适应力差量化实现鲁棒的仿真到现实布料解缠

Yoshihisa Tsurumine, Yuki Kadokawa, Kohei Hayashi, Christian Diehm, Takamitsu Matsubara

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出自适应力差量化方法,通过降低观测分辨率和学习自适应量化阈值,提升仿真到现实布料解缠的鲁棒性。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10565 2026-03-12 cs.RO 70%

TacLoc: Global Tactile Localization on Objects from a Registration Perspective

TacLoc: 从配准角度实现物体的全局触觉定位

Zirui Zhang, Boyang Zhang, Fumin Zhang, Huan Yin

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 TacLoc通过单次点云配准方法实现物体的高效触觉定位,无需预训练模型或渲染数据,提升了姿态估计的准确性和效率。

Comments 8 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07480 2026-03-10 cs.RO 70%

GSAT: Geometric Traversability Estimation using Self-supervised Learning with Anomaly Detection for Diverse Terrains

基于自监督学习与异常检测的几何可 traversability 估计:GSAT

Dongjin Cho, Miryeong Park, Juhui Lee, Geonmo Yang, Younggun Cho

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 GSAT通过自监督学习与异常检测,在潜在空间中构建正超球体,实现对不同地形的可通行性估计,提升自主导航的可靠性。

Comments 8 pages, 8 figures, accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26558 2026-03-10 cs.RO 70%

Radio-based Multi-Robot Odometry and Relative Localization

基于无线电的多机器人里程计与相对定位

Andrés Martínez-Silva, David Alejo, Luis Merino, Fernando Caballero

机构 * Service Robotics Laboratory. University Pablo de Olavide(服务机器人实验室。 Pablo de Olavide 大学) Department of System Engineering and Automation(系统工程与自动化系)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于UWB和雷达的多机器人相对定位系统,利用低成本传感器和优化框架实现鲁棒的相对位置估计,并通过SITL模拟和真实数据验证,优于现有闭式方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24099 2026-03-10 cs.CV 70%

Unified Multi-Modal Interactive & Reactive 3D Motion Generation via Rectified Flow

通过修正流实现统一的多模态交互与反应3D运动生成

Prerit Gupta, Shourya Verma, Ananth Grama, Aniket Bera

机构 * Department of Computer Science Purdue University(计算机科学系 哈佛大学)

专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 DualFlow通过修正流实现多模态双人运动生成,提升运动质量与节奏同步性。

Comments Under review at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05807 2026-03-09 cs.CV 70%

EventGeM: Global-to-Local Feature Matching for Event-Based Visual Place Recognition

EventGeM:基于事件的视觉位置识别的全局到局部特征匹配

Adam D. Hines, Gokul B. Nair, Nicolás Marticorena, Michael Milford, Tobias Fischer

机构 * Queensland University of Technology(昆士兰理工大学)

专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 EventGeM通过全局到局部特征融合提升基于事件的视觉位置识别性能,实现高精度实时定位。

Comments 10 pages, 4 figures, 5 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19074 2026-03-09 cs.RO 70%

Sample-Based Hybrid Mode Control: Asymptotically Optimal Switching of Algorithmic and Non-Differentiable Control Modes

基于样本的混合模式控制:算法与非可微控制模式的渐近最优切换

Yilang Liu, Haoxiang You, Ian Abraham

机构 * Department of Mechanical Engineering and Material Science, Yale University(机械工程与材料科学系,耶鲁大学)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于样本的混合模式控制方法,通过整数优化实现算法与非可微控制模式的渐近最优切换,适用于机器人任务中的复杂行为合成与高效控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04208 2026-03-05 cs.RO 70%

GSeg3D: A High-Precision Grid-Based Algorithm for Safety-Critical Ground Segmentation in LiDAR Point Clouds

GSeg3D:一种高精度基于网格的算法,用于激光雷达点云中的安全关键地面分割

Muhammad Haider Khan Lodhi, Christoph Hertzberg

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 GSeg3D提出了一种高精度基于网格的地面分割算法,以满足自动驾驶和机器人在安全关键场景中的高精度需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01178 2026-03-03 cs.RO 70%

riMESA: Consensus ADMM for Real-World Collaborative SLAM

riMESA: 基于共识ADMM的现实世界协作SLAM

Daniel McGann, Michael Kaess

专题命中 机器人数据与评测 :robotics(abstract);navigation(abstract);分类 cs.RO

AI总结 riMESA是一种基于共识ADMM的鲁棒增量分布式C-SLAM后端,能实时处理多机器人团队的定位与建图任务,准确度提升超过7倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21157 2026-03-02 cs.RO 70%

HALO: A Unified Vision-Language-Action Model for Embodied Multimodal Chain-of-Thought Reasoning

HALO:一种用于具身多模态推理的统一视觉-语言-动作模型

Quanxin Shou, Fangqi Zhu, Shawn Chen, Puxin Yan, Zhengyang Yan, Yikun Miao, Xiaoyi Pang, Zicong Hong, Ruikai Shi, Hao Huang, Jie Zhang, Song Guo

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 HALO提出了一种统一的视觉-语言-动作模型,通过结合文本推理、视觉子目标预测和增强的动作预测,实现具身多模态链式推理,提升了机器人在复杂环境中的表现和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23283 2026-02-27 cs.RO 70%

Simple Models, Real Swimming: Digital Twins for Tendon-Driven Underwater Robots

简单模型,真实游泳:用于腱驱动水下机器人的数字孪生

Mike Y. Michelis, Nana Obayashi, Josie Hughes, Robert K. Katzschmann

机构 * Soft Robotics Lab and ETH AI Center, ETH Zurich(ETH苏黎世人工智能中心) Prema Lab, New York University(纽约大学Prema实验室) CREATE Lab, EPFL(EPFL CREATE实验室)

专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于简化流体力学模型的腱驱动水下机器人,通过高效模拟环境实现快速泛化,展示了其在强化学习中的有效性及作为数字孪生的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23253 2026-02-27 cs.RO 70%

SPARR: Simulation-based Policies with Asymmetric Real-world Residuals for Assembly

SPARR: 基于模拟的策略与不对称现实残差的装配

Yijie Guo, Iretiayo Akinola, Lars Johannsmeier, Hugo Hadfield, Abhishek Gupta, Yashraj Narang

机构 * Nvidia University of Washington(华盛顿大学)

专题命中 机器人数据与评测 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 SPARR通过结合模拟训练的基础策略和现实残差策略,有效解决现实世界装配任务中的性能下降问题,提升成功率并减少循环时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00062 2026-02-26 cs.CV cs.AI cs.LG cs.RO 70%

World Simulation with Video Foundation Models for Physical AI

基于视频基础模型的世界模拟用于物理AI

NVIDIA, :, Arslan Ali, Junjie Bai, Maciej Bala, Yogesh Balaji, Aaron Blakeman, Tiffany Cai, Jiaxin Cao, Tianshi Cao, Elizabeth Cha, Yu-Wei Chao, Prithvijit Chattopadhyay, Mike Chen, Yongxin Chen, Yu Chen, Shuai Cheng, Yin Cui, Jenna Diamond, Yifan Ding, Jiaojiao Fan, Linxi Fan, Liang Feng, Francesco Ferroni, Sanja Fidler, Xiao Fu, Ruiyuan Gao, Yunhao Ge, Jinwei Gu, Aryaman Gupta, Siddharth Gururani, Imad El Hanafi, Ali Hassani, Zekun Hao, Jacob Huffman, Joel Jang, Pooya Jannaty, Jan Kautz, Grace Lam, Xuan Li, Zhaoshuo Li, Maosheng Liao, Chen-Hsuan Lin, Tsung-Yi Lin, Yen-Chen Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Yifan Lu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Seungjun Nah, Yashraj Narang, Abhijeet Panaskar, Lindsey Pavao, Trung Pham, Morteza Ramezanali, Fitsum Reda, Scott Reed, Xuanchi Ren, Haonan Shao, Yue Shen, Stella Shi, Shuran Song, Bartosz Stefaniak, Shangkun Sun, Shitao Tang, Sameena Tasmeen, Lyne Tchapmi, Wei-Cheng Tseng, Jibin Varghese, Andrew Z. Wang, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Jiashu Xu, Dinghao Yang, Xiaodong Yang, Haotian Ye, Seonghyeon Ye, Xiaohui Zeng, Jing Zhang, Qinsheng Zhang, Kaiwen Zheng, Andrew Zhu, Yuke Zhu

专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 Cosmos-Predict2.5和Cosmos-Transfer2.5通过统一生成和增强的模拟能力,推动物理AI领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21015 2026-02-25 cs.CV 70%

From Perception to Action: An Interactive Benchmark for Vision Reasoning

从感知到行动:一个交互式基准测试用于视觉推理

Yuhao Wu, Maojia Song, Yihuai Lan, Lei Wang, Zhiqiang Hu, Yao Xiao, Heng Zhou, Weihua Zheng, Dylan Raharja, Soujanya Poria, Roy Ka-Wei Lee

机构 * Singapore University of Technology(新加坡科技设计大学) Singapore Management University (SMU), Singapore(新加坡管理学院) Nanyang Technological University (NTU), Singapore(南洋理工大学) University of Science(科学大学)

专题命中 机器人数据与评测 :embodied agent(abstract);manipulation(abstract);分类 cs.CV

AI总结 CHAIN基准测试通过交互式3D物理驱动环境,评估模型在动态环境中理解、规划和执行基于物理约束的结构化动作序列的能力。

Comments Work in processing. Website: https://social-ai-studio.github.io/CHAIN/

详情

展开后加载摘要…

URL PDF HTML 收藏