arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3091 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3091 篇

2604.09338 2026-04-13 cs.AI cs.CL 70%

Mind the Gap Between Spatial Reasoning and Acting! Step-by-Step Evaluation of Agents With Spatial-Gym

注意空间推理与行动之间的差距!通过Spatial-Gym进行分步评估代理

Lars Benedikt Kaesberg, Tianyu Yang, Niklas Bauer, Terry Ruas, Jan Philip Wahle, Bela Gipp

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI

AI总结 本文提出Spatial-Gym环境,通过2D网格谜题的分步决策任务评估模型在空间推理中的能力,发现分步格式对弱模型有益但对强模型有负面影响,且视觉模型在空间环境中的表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 70%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01184 2026-04-02 cs.CV 70%

Object Affordance Recognition and Grounding via Multi-scale Cross-modal Representation Learning

基于多尺度跨模态表示学习的对象 affordance 识别与定位

Xinhang Wan, Dongqiang Gou, Xinwang Liu, En Zhu, Xuming He

机构 * National University of Defense Technology(国防科技大学) ShanghaiTech University(上海科技大学)

专题命中 具身推理 :embodied AI(abstract);manipulation(abstract);分类 cs.CV

AI总结 本文提出一种新的方法,通过学习 affordance 意识的 3D 表示和分阶段推理策略,解决对象 affordance 定位与分类任务中的依赖关系建模问题,提升识别效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29798 2026-04-01 cs.CV 70%

SceneTeract: Agentic Functional Affordances and VLM Grounding in 3D Scenes

SceneTeract:代理功能可能性与视觉语言模型在3D场景中的 grounded 性

Léopold Maillard, Francis Engelmann, Tom Durand, Boxiao Pan, Yang You, Or Litany, Leonidas Guibas, Maks Ovsjanikov

机构 * École Polytechnique(巴黎综合理工学院) Dassault Systèmes(达索系统) Stanford University(斯坦福大学) USI Lugano(卢加诺大学) Technion(以色列理工学院) NVIDIA(英伟达)

专题命中 具身推理 :embodied AI(abstract);embodied agent(abstract);分类 cs.CV

AI总结 SceneTeract 通过结合高层语义推理与低层几何检查,验证3D场景功能,评估合成环境中的功能失败及VLM对功能可能性的预测能力,揭示语义信心与物理可行性之间的系统性不匹配。

Comments Project page: https://sceneteract.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22899 2026-03-25 cs.RO 70%

Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring

Agile-VLA: 通过隐式 affordance 锚定实现少样本工业姿态校正

Teng Yan, Zhengyang Pei, Chengyu Shi, Yue Yu, Yikun Chen, Zilong Zhu, Zelin Fang, Kaile Guo, Zihang Wang, Peigen Tian, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 具身推理 :robot learning(abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出Agile-VLA框架,通过隐式affordance锚定机制将几何视觉线索映射为参数化动作原语,减少对高延迟语义推理的依赖,实现边缘设备上的高频率动态操作控制。

Comments 8 pages. Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14874 2026-02-17 cs.RO 70%

Affordance Transfer Across Object Instances via Semantically Anchored Functional Map

通过语义锚定的功能映射实现跨物体实例的 affordance 转移

Xiaoxiang Dong, Weiming Zhi

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Australian Centre for Robotics, The University of Sydney(悉尼大学机器人中心) College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出语义锚定的功能映射方法,通过单个视觉示范实现跨不同几何物体的 affordance 转移,提升机器人感知与行动的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12065 2026-02-13 cs.RO 70%

Affordance-Graphed Task Worlds: Self-Evolving Task Generation for Scalable Embodied Learning

具身学习的可扩展任务生成:基于 affordance 的任务世界

Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

专题命中 具身推理 :robot learning(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出 AGT-World 框架,通过结构化图方法实现任务空间的精确分解,并结合混合反馈机制实现策略的自进化,从而提升机器人任务生成的可扩展性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09638 2026-02-11 cs.CV 70%

VideoAfford: Grounding 3D Affordance from Human-Object-Interaction Videos via Multimodal Large Language Model

VideoAfford: 通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding

Hanqing Wang, Mingyu Liu, Xiaoyu Chen, Chengwei MA, Yiming Zhong, Wenti Yin, Yuhao Liu, Zhiqing Cui, Jiahao Yuan, Lu Dai, Zhiyuan Ma, Hui Xiong

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.CV

AI总结 VideoAfford通过多模态大语言模型实现人类-物体交互视频中的3D affordance grounding,结合动态交互先验和空间感知损失函数,提升机器人操作的可操作区域识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09899 2026-01-27 cs.RO 70%

Semantic2D: Enabling Semantic Scene Understanding with 2D Lidar Alone

Semantic2D: 仅使用2D激光雷达实现语义场景理解

Zhanteng Xie, Yipeng Pan, Yinqiang Zhang, Jia Pan, Philip Dames

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) Department of Mechanical Engineering, Temple University(机械工程系, Temple大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 Semantic2D通过仅使用2D激光雷达实现语义场景理解,提出首个公开数据集和细粒度分割算法,提升机器人导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09954 2026-01-26 cs.CV 70%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12538 2026-01-21 cs.AI cs.CL 70%

Agentic Reasoning for Large Language Models

大语言模型的代理推理

Tianxin Wei, Ting-Wei Li, Zhining Liu, Xuying Ning, Ze Yang, Jiaru Zou, Zhichen Zeng, Ruizhong Qiu, Xiao Lin, Dongqi Fu, Zihao Li, Mengting Ai, Duo Zhou, Wenxuan Bao, Yunzhe Li, Gaotang Li, Cheng Qian, Yu Wang, Xiangru Tang, Yin Xiao, Liri Fang, Hui Liu, Xianfeng Tang, Yuji Zhang, Chi Wang, Jiaxuan You, Heng Ji, Hanghang Tong, Jingrui He

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在开放和动态环境中的代理推理方法,通过三个层次的框架提升单体、自我进化和集体多代理推理能力,并提出了未来研究方向。

Comments Project: https://github.com/weitianxin/Awesome-Agentic-Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18028 2026-01-21 cs.LG cs.AI cs.CV cs.RO 70%

Knot So Simple: A Minimalistic Environment for Spatial Reasoning

结非简单:一种用于空间推理的极简环境

Zizhao Chen, Yoav Artzi

专题命中 具身推理 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 KnotGym是一种用于空间推理的极简交互环境,通过不同复杂度的绳子操作任务测试感知、推理与操作整合的挑战。

Comments Fix camera ready footer

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20425 2026-01-01 cs.RO 70%

OSVI-WM: One-Shot Visual Imitation for Unseen Tasks using World-Model-Guided Trajectory Generation

OSVI-WM:通过世界模型引导轨迹生成实现单次视觉模仿

Raktim Gautam Goswami, Prashanth Krishnamurthy, Yann LeCun, Farshad Khorrami

机构 * New York University Tandon School of Engineering(纽约大学Tandon工程学院) New York University Courant Institute of Mathematical Sciences(纽约大学Courant数学科学研究所) Meta-FAIR

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 OSVI-WM通过世界模型引导轨迹生成,实现对未见任务的单次视觉模仿学习,提升机器人执行复杂任务的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04537 2025-12-05 cs.CV 70%

X-Humanoid: Robotize Human Videos to Generate Humanoid Videos at Scale

X-Humanoid:将人类视频机器人化以生成大规模人形视频

Pei Yang, Hai Ci, Yiren Song, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show实验室)

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.CV

AI总结 X-Humanoid通过生成式视频编辑方法,将人类视频机器人化,生成大规模人形视频数据集,提升人形机器人研究的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16484 2025-11-21 cs.CV 70%

Flow and Depth Assisted Video Prediction with Latent Transformer

基于流和深度的视频预测与潜在变换器

Eliyas Suleyman, Paul Henderson, Eksan Firkat, Nicolas Pugeault

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 本文提出基于流和深度的视频预测方法,通过整合点流和深度信息提升遮挡场景下的预测性能和背景运动准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13782 2025-11-19 cs.AI 70%

Imagine in Space: Exploring the Frontier of Spatial Intelligence and Reasoning Efficiency in Vision Language Models

Xiaoxing Lian, Aidong Yang, Jun Zhu, Peng Wang, Yue Zhang

专题命中 具身推理 :navigation(abstract);world model(abstract);分类 cs.AI

Comments 10 pages,a detail and effective benchmark for spatial reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25760 2025-11-04 cs.CV 70%

Multimodal Spatial Reasoning in the Large Model Era: A Survey and Benchmarks

Xu Zheng, Zihao Dongfang, Lutao Jiang, Boyuan Zheng, Yulong Guo, Zhenquan Zhang, Giuliano Albanese, Runyi Yang, Mengjiao Ma, Zixin Zhang, Chenfei Liao, Dingcheng Zhen, Yuanhuiyi Lyu, Yuqian Fu, Bin Ren, Linfeng Zhang, Danda Pani Paudel, Nicu Sebe, Luc Van Gool, Xuming Hu

专题命中 具身推理 :embodied AI(abstract);navigation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09585 2025-10-20 cs.CV 70%

Elevating Visual Perception in Multimodal LLMs with Visual Embedding Distillation

Jitesh Jain, Zhengyuan Yang, Humphrey Shi, Jianfeng Gao, Jianwei Yang

机构 * Microsoft Research, Redmond(微软研究院(红mond)) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

Comments Project Page: https://praeclarumjj3.github.io/visper_lm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02029 2025-09-16 cs.RO 70%

RoboBrain 2.0 Technical Report

BAAI RoboBrain Team, Mingyu Cao, Huajie Tan, Yuheng Ji, Xiansheng Chen, Minglan Lin, Zhiyu Li, Zhou Cao, Pengwei Wang, Enshen Zhou, Yi Han, Yingbo Tang, Xiangqi Xu, Wei Guo, Yaoxu Lyu, Yijie Xu, Jiayu Shi, Mengfei Du, Cheng Chi, Mengdi Zhao, Xiaoshuai Hao, Junkai Zhao, Xiaojie Zhang, Shanyu Rong, Huaihai Lyu, Zhengliang Cai, Yankai Fu, Ning Chen, Bolun Zhang, Lingfeng Zhang, Shuyi Zhang, Dong Liu, Xi Feng, Songjing Wang, Xiaodan Liu, Yance Jiao, Mengsi Lyu, Zhuo Chen, Chenrui He, Yulong Ao, Xue Sun, Zheqi He, Jingshu Zheng, Xi Yang, Donghai Shi, Kunchang Xie, Bochao Zhang, Shaokai Nie, Chunlei Men, Yonghua Lin, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * BAAI RoboBrain Team(百度人工智能研究院RoboBrain团队)

专题命中 具身推理 :embodied AI(abstract);embodied agent(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00258 2025-08-29 cs.AI q-bio.NC 70%

Possible Principles for Aligned Structure Learning Agents

Lancelot Da Costa, Tomáš Gavenčiak, David Hyland, Mandana Samiei, Cristian Dragos-Manta, Candice Pattisapu, Adeel Razi, Karl Friston

机构 * VERSES AI Research Lab(VERSES AI研究实验室) Charles University(查尔斯大学) University of Oxford(牛津大学) Mila, Quebec AI Institute(魁北克人工智能研究院) McGill University(麦吉尔大学) University of Montreal(蒙特利尔大学) University College London(伦敦大学学院) Monash University(莫纳什大学) CIFAR Azrieli Global Scholars Program(CIFAR阿兹里埃利全球学者计划)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI

Comments 24 pages of content, 33 with references; accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15125 2025-08-19 cs.AI 70%

Contemplative Artificial Intelligence

Ruben Laukkonen, Fionn Inglis, Shamil Chandaria, Lars Sandved-Smith, Edmundo Lopez-Sola, Jakob Hohwy, Jonathan Gold, Adam Elwood

专题命中 具身推理 :embodied agent(abstract);world model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05937 2025-08-11 cs.RO 70%

Affordance-Guided Dual-Armed Disassembly Teleoperation for Mating Parts

Gen Sako, Takuya Kiyokawa, Kensuke Harada, Tomoki Ishikura, Naoya Miyaji, Genichiro Matsuda

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(大阪大学系统创新系) Industrial Cyber-physical Systems Research Center, The National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Manufacturing Innovation Division, Panasonic Holdings Corporation(松下电器控股公司)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03575 2025-07-11 cs.CV cs.AI cs.LG cs.RO 70%

Cosmos World Foundation Model Platform for Physical AI

NVIDIA, :, Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, Daniel Dworakowski, Jiaojiao Fan, Michele Fenzi, Francesco Ferroni, Sanja Fidler, Dieter Fox, Songwei Ge, Yunhao Ge, Jinwei Gu, Siddharth Gururani, Ethan He, Jiahui Huang, Jacob Huffman, Pooya Jannaty, Jingyi Jin, Seung Wook Kim, Gergely Klár, Grace Lam, Shiyi Lan, Laura Leal-Taixe, Anqi Li, Zhaoshuo Li, Chen-Hsuan Lin, Tsung-Yi Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Arsalan Mousavian, Seungjun Nah, Sriharsha Niverty, David Page, Despoina Paschalidou, Zeeshan Patel, Lindsey Pavao, Morteza Ramezanali, Fitsum Reda, Xiaowei Ren, Vasanth Rao Naik Sabavat, Ed Schmerling, Stella Shi, Bartosz Stefaniak, Shitao Tang, Lyne Tchapmi, Przemek Tredak, Wei-Cheng Tseng, Jibin Varghese, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Xinyue Wei, Jay Zhangjie Wu, Jiashu Xu, Wei Yang, Lin Yen-Chen, Xiaohui Zeng, Yu Zeng, Jing Zhang, Qinsheng Zhang, Yuxuan Zhang, Qingqing Zhao, Artur Zolkowski

机构 * NVIDIA

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20220 2025-06-10 cs.CV 70%

DINeMo: Learning Neural Mesh Models with no 3D Annotations

Weijie Guo, Guofeng Zhang, Wufei Ma, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Peking University(北京大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

Comments Accepted to 3rd Workshop on Compositional 3D Vision at CVPR 2025 (C3DV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20964 2025-05-28 cs.LG cs.IT math.IT 70%

Semantic Communication meets System 2 ML: How Abstraction, Compositionality and Emergent Languages Shape Intelligence

Mehdi Bennis, Salem Lahlou

机构 * Centre of Wireless Communications, University of Oulu(奥卢大学无线通信中心) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03875 2025-04-08 cs.CV 70%

3D Scene Understanding Through Local Random Access Sequence Modeling

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Honglin Chen, Khai Loong Aw, Daniel L. K. Yamins

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.CV

Comments Project webpage: https://neuroailab.github.io/projects/lras_3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03142 2025-03-21 cs.RO 70%

AffordDP: Generalizable Diffusion Policy with Transferable Affordance

Shijie Wu, Yihang Zhu, Yunao Huang, Kaizhen Zhu, Jiayuan Gu, Jingyi Yu, Ye Shi, Jingya Wang

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01292 2025-02-04 cs.CV 70%

LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan

专题命中 具身推理 :embodied AI(abstract);navigation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12812 2025-01-23 cs.RO 70%

PSGSL: A Probabilistic Framework Integrating Semantic Scene Understanding and Gas Sensing for Gas Source Localization

Pepe Ojeda, Javier Monroy, Javier Gonzalez-Jimenez

专题命中 具身推理 :robotics(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09823 2024-11-18 cs.CV 70%

Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting

Yian Wang, Xiaowen Qiu, Jiageng Liu, Zhehuan Chen, Jiting Cai, Yufei Wang, Tsun-Hsuan Wang, Zhou Xian, Chuang Gan

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏