arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3091 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3091 篇

2605.04506 2026-05-14 cs.CV cs.AI 73%

Ilov3Splat: Instance-Level Open-Vocabulary 3D Scene Understanding in Gaussian Splatting

Ilov3Splat:基于高斯散射的实例级开放词汇3D场景理解

Binh Long Nguyen, Kien Nguyen, Sridha Sridharan, Clinton Fookes, Peyman Moghadam

机构 * School of Electrical Engineering and Robotics(电气工程与机器人学学院) Queensland University of Technology(昆士兰理工大学) CSIRO Robotics(CSIRO机器人部) CSIRO

专题命中 具身推理 :robotics(abstract,abstract_cn);分类 cs.AI、cs.CV

AI总结 本文提出Ilov3Splat框架,通过增强高斯散射以实现实例级开放词汇3D场景理解,利用多分辨率哈希嵌入和对比损失提升语言语义关联与实例区分能力。

Comments The International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07758 2026-04-10 cs.CV cs.AI 73%

DailyArt: Discovering Articulation from Single Static Images via Latent Dynamics

DailyArt: 从单张静态图像中通过潜在动态发现关节

Hang Zhang, Qijian Tian, Jingyu Gong, Daoguo Dong, Xuhong Wang, Yuan Xie, Xin Tan

专题命中 具身推理 :embodied AI(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 DailyArt通过合成介导推理解决单张图像中关节估计问题,无需多视角输入或显式部分标注,实现关节参数同时恢复和部分级新状态合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01415 2026-03-25 cs.RO cs.AI 73%

RoboMemory: A Brain-inspired Multi-memory Agentic Framework for Interactive Environmental Learning in Physical Embodied Systems

RoboMemory:一种脑启发的多记忆代理框架,用于物理具身系统中的交互环境学习

Mingcong Lei, Honghao Cai, Yuyuan Yang, Yimou Wu, Jinke Ren, Zezhou Cui, Liangchen Tan, Junkun Hong, Gehan Hu, Shuangyu Zhu, Shaohan Jiang, Ge Wang, Junyuan Tan, Zhenglin Wan, Zheng Li, Zhen Li, Shuguang Cui, Yiming Zhao, Yatong Han

机构 * FNii-Shenzhen(FNii-深圳) SSE, CUHK-Shenzhen(SSE,CUHK-深圳) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Ising AI

专题命中 具身推理 :embodied agent(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 本文提出RoboMemory框架,通过整合空间、时间、事件和语义记忆,提升机器人在复杂环境中的长期规划与交互学习能力,实验表明其在EmbodiedBench上成功率提升26.5%,超越现有SOTA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04158 2026-03-05 cs.RO cs.AI 73%

GarmentPile++: Affordance-Driven Cluttered Garments Retrieval with Vision-Language Reasoning

GarmentPile++: 基于视觉-语言推理的基于 affordance 的杂乱衣物检索

Mingleyang Li, Yuran Wang, Yue Chen, Tianxing Chen, Jiaqi Liang, Zishun Shen, Haoran Lu, Ruihai Wu, Hao Dong

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

AI总结 GarmentPile++通过结合视觉-语言推理和视觉affordance感知,实现基于语言指令的杂乱衣物安全检索,确保每次检索一件衣物,提升家庭助理机器人任务执行能力。

Comments ICRA2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08585 2026-02-09 cs.AI cs.CV 73%

Simulating the Visual World with Artificial Intelligence: A Roadmap

用人工智能模拟视觉世界:一条路线图

Jingtong Yue, Ziqi Huang, Zhaoxi Chen, Xintao Wang, Pengfei Wan, Ziwei Liu

机构 * Robotics Institute Carnegie Mellon University(卡内基梅隆大学机器人研究所) S-Lab Nanyang Technological University(南洋理工大学S实验室) Kling Team Kuaishou Technology(快手科技 Kling 团队)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出了一种基于隐式世界模型和视频渲染器的视频基础模型,用于模拟物理动态、智能体交互和任务规划,涵盖四代视频生成技术,应用于机器人、自动驾驶和互动游戏等领域。

Comments Project page: https://world-model-roadmap.github.io/ Github Repo: https://github.com/ziqihuangg/Awesome-From-Video-Generation-to-World-Model

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20208 2026-01-29 cs.RO cs.CV 73%

TRACER: Texture-Robust Affordance Chain-of-Thought for Deformable-Object Refinement

TRACER: 适用于变形物体细化的纹理鲁棒触觉链

Wanjun Jia, Kang Li, Fan Yang, Mengfei Duan, Wenrui Chen, Yiming Jiang, Hui Zhang, Kailun Yang, Zhiyong Li, Yaonan Wang

机构 * School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 TRACER通过纹理鲁棒触觉链框架,提升变形物体在复杂纹理下的触觉识别精度和长视界任务成功率。

Comments The source code and dataset will be made publicly available at https://github.com/Dikay1/TRACER

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01223 2025-12-02 cs.CV cs.AI 73%

S$^2$-MLLM: Boosting Spatial Reasoning Capability of MLLMs for 3D Visual Grounding with Structural Guidance

S$^2$-MLLM:通过结构指导提升多模态大语言模型在3D视觉定位中的空间推理能力

Beining Xu, Siting Zhu, Zhao Jin, Junxian Li, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 S$^2$-MLLM通过隐式空间推理提升多模态大语言模型在3D视觉定位中的空间推理能力,实现高效且准确的3D场景理解。

Comments 18 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01999 2025-11-05 cs.RO cs.AI 73%

TRACE: Textual Reasoning for Affordance Coordinate Extraction

Sangyun Park, Jin Kim, Yuchen Cui, Matthew S. Brown

机构 * ABB Robotics(ABB机器人公司) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

Comments ICCV 2025. *Equal contribution. †Corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04390 2025-10-07 cs.CV cs.AI cs.CL 73%

MorphoSim: An Interactive, Controllable, and Editable Language-guided 4D World Simulator

Xuehai He, Shijie Zhou, Thivyanth Venkateswaran, Kaizhi Zheng, Ziyu Wan, Achuta Kadambi, Xin Eric Wang

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) University of California, Los Angeles(加州大学洛杉矶分校) IIT Bombay(印度理工学院班加罗尔) Microsoft(微软公司)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25794 2025-10-01 cs.CV cs.AI 73%

Point-It-Out: Benchmarking Embodied Reasoning for Vision Language Models in Multi-Stage Visual Grounding

Haotian Xue, Yunhao Ge, Yu Zeng, Zhaoshuo Li, Ming-Yu Liu, Yongxin Chen, Jiaojiao Fan

机构 * Georgia Tech(佐治亚理工学院) NVIDIA(英伟达)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10548 2025-07-15 cs.CV cs.AI cs.CL 73%

EmbRACE-3K: Embodied Reasoning and Action in Complex Environments

Mingxian Lin, Wei Huang, Yitang Li, Chengjie Jiang, Kui Wu, Fangwei Zhong, Shengju Qian, Xin Wang, Xiaojuan Qi

专题命中 具身推理 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV

Comments Project page: https://mxllc.github.io/EmbRACE-3K/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11564 2025-07-08 cs.RO cs.CV 73%

PAVLM: Advancing Point Cloud based Affordance Understanding Via Vision-Language Model

Shang-Ching Liu, Van Nhiem Tran, Wenkai Chen, Wei-Lun Cheng, Yen-Lin Huang, I-Bin Liao, Yung-Hui Li, Jianwei Zhang

机构 * Technical Aspects of Multimodal Systems (TAMS), Department of Informatics, University of Hamburg(汉堡大学信息学院多模态系统技术部门) Hon Hai Research Institute (HHRI)(鸿海研究机构) Department of Electrical Engineering, National Taiwan University(台湾大学电子工程系) Department of Computer Science and Technology, National Tsinghua University(清华大学计算机科学与技术系)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09965 2025-06-23 cs.CV cs.AI 73%

Reinforcing Spatial Reasoning in Vision-Language Models with Interwoven Thinking and Visual Drawing

Junfei Wu, Jian Guan, Kaituo Feng, Qiang Liu, Shu Wu, Liang Wang, Wei Wu, Tieniu Tan

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Ant Group(蚂蚁集团) CUHK MMLab(香港中文大学MMLab) Nanjing University(南京大学)

专题命中 具身推理 :manipulation(abstract);navigation(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20648 2025-04-30 cs.CV cs.AI 73%

SpaRE: Enhancing Spatial Reasoning in Vision-Language Models with Synthetic Data

Michael Ogezi, Freda Shi

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.06442 2024-12-13 cs.CV cs.RO 73%

QueSTMaps: Queryable Semantic Topological Maps for 3D Scene Understanding

Yash Mehan, Kumaraditya Gupta, Rohit Jayanti, Anirudh Govil, Sourav Garg, Madhava Krishna

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Accepted at 2024 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) as Oral Presentation. Also presented at the 2nd Workshop on Open-Vocabulary 3D Scene Understanding (OpenSUN3D) at CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00499 2024-09-04 cs.RO cs.CV 73%

DAP: Diffusion-based Affordance Prediction for Multi-modality Storage

Haonan Chang, Kowndinya Boyalakuntla, Yuhan Liu, Xinyu Zhang, Liam Schramm, Abdeslam Boularias

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Paper Accepted by IROS2024. Arxiv version is 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05603 2024-04-09 cs.CV cs.AI 73%

Self-Explainable Affordance Learning with Embodied Caption

Zhipeng Zhang, Zhimin Wei, Guolei Sun, Peng Wang, Luc Van Gool

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07473 2023-12-18 cs.RO cs.AI 73%

Where2Explore: Few-shot Affordance Learning for Unseen Novel Categories of Articulated Objects

Chuanruo Ning, Ruihai Wu, Haoran Lu, Kaichun Mo, Hao Dong

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.AI

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.01920 2023-04-13 cs.CV cs.RO 73%

Review on 6D Object Pose Estimation with the focus on Indoor Scene Understanding

Negar Nejatishahidin, Pooya Fayyazsanavi

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.RO、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.05200 2022-11-11 cs.CV cs.RO 73%

Affordance detection with Dynamic-Tree Capsule Networks

Antonio Rodríguez-Sánchez, Simon Haller-Seeber, David Peer, Chris Engelhardt, Jakob Mittelberger, Matteo Saveriano

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments IEEE-RAS International Conference on Humanoid Robots (Humanoids 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05624 2022-04-13 cs.CV cs.LG 73%

Continual Predictive Learning from Videos

Geng Chen, Wendong Zhang, Han Lu, Siyu Gao, Yunbo Wang, Mingsheng Long, Xiaokang Yang

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV、cs.LG

Comments Accepted by CVPR 2022 (Oral). Code is available at https://github.com/jc043/CPL

详情

展开后加载摘要…

URL PDF HTML 收藏
2001.02364 2020-02-18 cs.RO cs.CV 73%

Learning to Move with Affordance Maps

William Qi, Ravi Teja Mullapudi, Saurabh Gupta, Deva Ramanan

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.RO、cs.CV

Comments Published at ICLR 2020. For code, see https://github.com/wqi/A2L

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05815 2026-03-09 cs.RO 72%

Hierarchical Latent Action Model

层次化潜在动作模型

Hanjung Kim, Lerrel Pinto, Seon Joo Kim

机构 * Yonsei University(延世大学) New York University(纽约大学)

专题命中 具身推理 :world model(abstract,comments);robotic(abstract);分类 cs.RO

AI总结 HiLAM通过建模长期时间信息,从无动作视频中发现高层次潜在技能,提升了动态技能发现的鲁棒性。

Comments ICLR 2026 Workshop - 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02857 2026-02-04 cs.RO 72%

Latent Perspective-Taking via a Schrödinger Bridge in Influence-Augmented Local Models

通过影响增强的局部模型实现潜在的视角转换

Kevin Alcedo, Pedro U. Lima, Rachid Alami

机构 * Institute for Systems and Robotics(系统与机器人研究所) Universidade de Lisboa(里斯本大学) LAAS-CNRS(拉沙尔国家研究中心) Artificial and Natural Intelligence Toulouse Institute (ANITI)(图卢兹人工智能与自然智能研究所)

专题命中 具身推理 :world model(abstract,comments);navigation(abstract);分类 cs.RO

AI总结 本文提出了一种基于影响增强的局部模型和施罗德桥的神经符号框架,用于实现机器人在社交交互中的心理状态推断和决策规划。

Comments Extended Abstract & Poster, Presented at World Modeling Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10489 2025-08-15 cs.LG 72%

Learning State-Space Models of Dynamic Systems from Arbitrary Data using Joint Embedding Predictive Architectures

Jonas Ulmen, Ganesh Sundaram, Daniel Görges

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 具身推理 :robotics(abstract,comments);world model(abstract);分类 cs.LG

Comments 6 Pages, Published in IFAC Joint Symposia on Mechatronics & Robotics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.00871 2023-03-03 cs.CV cs.AI cs.LG cs.RO 72%

Bayesian Deep Learning for Affordance Segmentation in images

Lorenzo Mur-Labadia, Ruben Martinez-Cantin, Jose J. Guerrero

专题命中 具身推理 :robotics(abstract,comments);分类 cs.RO、cs.AI、cs.CV

Comments 2023 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25532 2026-08-18 gr-qc 版本更新 71%

A New Self-Dual Gravitational Instanton Solution on a Local Conformal Kählerian Manifold in a Brane World Model

一种在膜世界模型中局部共形凯勒流形上的新自对偶引力瞬子解

Reinoud Jan Slagter

专题命中 具身推理 :world model(title)

AI总结 本文在共形膨胀子引力中找到了一种真空类克尔扭曲时空上的精确引力瞬子解,该解由一阶偏微分方程导出,与自对偶性相关,其奇点由五次多项式决定,拓扑为S^3×R/Z_2,并利用克莱因瓶上的对径边界条件描述了霍金粒子蒸发过程,最后揭示了与Janis-Newman-Winicour模型之间的联系。

Comments Version V4 : final. pictures improved --- spelling improved --- comments welcome---73 pages---70 pictures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01561 2026-08-04 cs.HC 新提交 71%

FedWorld: Scope-Aware Federation of Agent World Models

FedWorld:感知范围的智能体世界模型联邦

Yuchao Hou

专题命中 具身推理 :world model(title)

AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31689 2026-07-01 cs.SE 新提交 71%

ScratchWorld: Evaluating If World Models Compute Executable Consequences

ScratchWorld: 评估世界模型是否计算可执行后果

Yufeng Lin, Jialu Zhang

专题命中 具身推理 :world model(title)

AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16576 2026-06-16 cs.CL 新提交 71%

Can LLM Agents Infer World Models? Evidence from Agentic Automata Learning

LLM智能体能否推断世界模型?来自智能体自动机学习的证据

Reef Menaged, Gili Lior, Shauli Ravfogel, Roee Aharoni, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(海法大学) New York University(纽约大学) Google Research(谷歌研究)

专题命中 具身推理 :world model(title)

AI总结 提出智能体自动机学习框架,通过成员查询和等价查询评估LLM智能体发现隐藏确定性有限自动机的能力,发现性能随DFA规模增加而急剧下降,推理模型优于非推理模型但仍存在规划、整合和假设构建缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏