arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2508.05937 2025-08-11 cs.RO 70%

Affordance-Guided Dual-Armed Disassembly Teleoperation for Mating Parts

Gen Sako, Takuya Kiyokawa, Kensuke Harada, Tomoki Ishikura, Naoya Miyaji, Genichiro Matsuda

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(大阪大学系统创新系) Industrial Cyber-physical Systems Research Center, The National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) Manufacturing Innovation Division, Panasonic Holdings Corporation(松下电器控股公司)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments 6 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03575 2025-07-11 cs.CV cs.AI cs.LG cs.RO 70%

Cosmos World Foundation Model Platform for Physical AI

NVIDIA, :, Niket Agarwal, Arslan Ali, Maciej Bala, Yogesh Balaji, Erik Barker, Tiffany Cai, Prithvijit Chattopadhyay, Yongxin Chen, Yin Cui, Yifan Ding, Daniel Dworakowski, Jiaojiao Fan, Michele Fenzi, Francesco Ferroni, Sanja Fidler, Dieter Fox, Songwei Ge, Yunhao Ge, Jinwei Gu, Siddharth Gururani, Ethan He, Jiahui Huang, Jacob Huffman, Pooya Jannaty, Jingyi Jin, Seung Wook Kim, Gergely Klár, Grace Lam, Shiyi Lan, Laura Leal-Taixe, Anqi Li, Zhaoshuo Li, Chen-Hsuan Lin, Tsung-Yi Lin, Huan Ling, Ming-Yu Liu, Xian Liu, Alice Luo, Qianli Ma, Hanzi Mao, Kaichun Mo, Arsalan Mousavian, Seungjun Nah, Sriharsha Niverty, David Page, Despoina Paschalidou, Zeeshan Patel, Lindsey Pavao, Morteza Ramezanali, Fitsum Reda, Xiaowei Ren, Vasanth Rao Naik Sabavat, Ed Schmerling, Stella Shi, Bartosz Stefaniak, Shitao Tang, Lyne Tchapmi, Przemek Tredak, Wei-Cheng Tseng, Jibin Varghese, Hao Wang, Haoxiang Wang, Heng Wang, Ting-Chun Wang, Fangyin Wei, Xinyue Wei, Jay Zhangjie Wu, Jiashu Xu, Wei Yang, Lin Yen-Chen, Xiaohui Zeng, Yu Zeng, Jing Zhang, Qinsheng Zhang, Yuxuan Zhang, Qingqing Zhao, Artur Zolkowski

机构 * NVIDIA

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20220 2025-06-10 cs.CV 70%

DINeMo: Learning Neural Mesh Models with no 3D Annotations

Weijie Guo, Guofeng Zhang, Wufei Ma, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Peking University(北京大学)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

Comments Accepted to 3rd Workshop on Compositional 3D Vision at CVPR 2025 (C3DV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20964 2025-05-28 cs.LG cs.IT math.IT 70%

Semantic Communication meets System 2 ML: How Abstraction, Compositionality and Emergent Languages Shape Intelligence

Mehdi Bennis, Salem Lahlou

机构 * Centre of Wireless Communications, University of Oulu(奥卢大学无线通信中心) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03875 2025-04-08 cs.CV 70%

3D Scene Understanding Through Local Random Access Sequence Modeling

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Honglin Chen, Khai Loong Aw, Daniel L. K. Yamins

专题命中 具身推理 :robotics(abstract);manipulation(abstract);分类 cs.CV

Comments Project webpage: https://neuroailab.github.io/projects/lras_3d/

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03142 2025-03-21 cs.RO 70%

AffordDP: Generalizable Diffusion Policy with Transferable Affordance

Shijie Wu, Yihang Zhu, Yunao Huang, Kaizhen Zhu, Jiayuan Gu, Jingyi Yu, Ye Shi, Jingya Wang

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01292 2025-02-04 cs.CV 70%

LSceneLLM: Enhancing Large 3D Scene Understanding Using Adaptive Visual Preferences

Hongyan Zhi, Peihao Chen, Junyan Li, Shuailei Ma, Xinyu Sun, Tianhang Xiang, Yinjie Lei, Mingkui Tan, Chuang Gan

专题命中 具身推理 :embodied AI(abstract);navigation(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12812 2025-01-23 cs.RO 70%

PSGSL: A Probabilistic Framework Integrating Semantic Scene Understanding and Gas Sensing for Gas Source Localization

Pepe Ojeda, Javier Monroy, Javier Gonzalez-Jimenez

专题命中 具身推理 :robotics(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09823 2024-11-18 cs.CV 70%

Architect: Generating Vivid and Interactive 3D Scenes with Hierarchical 2D Inpainting

Yian Wang, Xiaowen Qiu, Jiageng Liu, Zhehuan Chen, Jiting Cai, Yufei Wang, Tsun-Hsuan Wang, Zhou Xian, Chuang Gan

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09340 2024-09-25 cs.CV cs.AI cs.CL cs.LG cs.RO 70%

SceneVerse: Scaling 3D Vision-Language Learning for Grounded Scene Understanding

Baoxiong Jia, Yixin Chen, Huangyue Yu, Yan Wang, Xuesong Niu, Tengyu Liu, Qing Li, Siyuan Huang

专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV

Comments ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.04193 2024-09-13 cs.RO 70%

ToolEENet: Tool Affordance 6D Pose Estimation

Yunlong Wang, Lei Zhang, Yuyang Tu, Hui Zhang, Kaixin Bai, Zhaopeng Chen, Jianwei Zhang

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.16927 2024-08-16 cs.RO cs.AI cs.CV cs.LG 70%

End-to-end Autonomous Driving: Challenges and Frontiers

Li Chen, Penghao Wu, Kashyap Chitta, Bernhard Jaeger, Andreas Geiger, Hongyang Li

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08691 2024-06-14 cs.CV cs.AI cs.LG cs.RO 70%

UnO: Unsupervised Occupancy Fields for Perception and Forecasting

Ben Agro, Quinlan Sykora, Sergio Casas, Thomas Gilles, Raquel Urtasun

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05938 2024-05-28 cs.RO 70%

Efficient Learning of Fast Inverse Kinematics with Collision Avoidance

Johannes Tenhumberg, Arman Mielke, Berthold Bäuml

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

Comments Presented at the 2023 IEEE-RAS International Conference on Humanoid Robots

Journal ref 2023 IEEE-RAS International Conference on Humanoid Robots (Humanoids)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.16308 2024-02-27 cs.RO 70%

DreamUp3D: Object-Centric Generative Models for Single-View 3D Scene Understanding and Real-to-Sim Transfer

Yizhe Wu, Haitz Sáez de Ocáriz Borde, Jack Collins, Oiwi Parker Jones, Ingmar Posner

专题命中 具身推理 :robotics(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04617 2023-10-10 cs.RO cs.AI cs.CV cs.LG 70%

SlotGNN: Unsupervised Discovery of Multi-Object Representations and Visual Dynamics

Alireza Rezazadeh, Athreyi Badithela, Karthik Desingh, Changhyun Choi

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10932 2023-09-21 cs.RO 70%

Open-Vocabulary Affordance Detection using Knowledge Distillation and Text-Point Correlation

Tuan Van Vo, Minh Nhat Vu, Baoru Huang, Toan Nguyen, Ngan Le, Thieu Vo, Anh Nguyen

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10911 2023-09-21 cs.RO 70%

Language-Conditioned Affordance-Pose Detection in 3D Point Clouds

Toan Nguyen, Minh Nhat Vu, Baoru Huang, Tuan Van Vo, Vy Truong, Ngan Le, Thieu Vo, Bac Le, Anh Nguyen

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

Comments Project page: https://3DAPNet.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14548 2023-04-10 cs.CV cs.AI cs.LG cs.RO 70%

Viewpoint Equivariance for Multi-View 3D Object Detection

Dian Chen, Jie Li, Vitor Guizilini, Rares Ambrus, Adrien Gaidon

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments 11 pages, 4 figures; accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.10764 2019-07-22 cs.CV 70%

Veritatem Dies Aperit- Temporally Consistent Depth Prediction Enabled by a Multi-Task Geometric and Semantic Scene Understanding Approach

Amir Atapour-Abarghouei, Toby P. Breckon

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.CV

Comments CVPR 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1901.10673 2019-01-31 cs.RO 70%

Invariant Feature Mappings for Generalizing Affordance Understanding Using Regularized Metric Learning

Martin Hjelm, Carl Henrik Ek, Renaud Detry, Danica Kragic

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
1604.03692 2016-04-22 cs.RO cs.AI cs.CV cs.LG 70%

Learning Social Affordance for Human-Robot Interaction

Tianmin Shu, M. S. Ryoo, Song-Chun Zhu

专题命中 具身推理 :robot learning(abstract);分类 cs.RO、cs.AI、cs.CV

Comments International Joint Conference on Artificial Intelligence (IJCAI), 2016

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.09812 2021-02-22 cs.LG cs.AI cs.RO 69%

Deep Latent Competition: Learning to Race Using Visual Control Policies in Latent Space

Wilko Schwarting, Tim Seyde, Igor Gilitschenski, Lucas Liebenwein, Ryan Sander, Sertac Karaman, Daniela Rus

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG;robot learning(comments)

Comments Wilko, Tim, and Igor contributed equally to this work; published in Conference on Robot Learning 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01372 2026-08-19 cs.LG cs.AI cs.CV 版本更新 67%

BRo-JEPA: Learning Modular Transformations in Latent Space

BRo-JEPA:在潜空间中学习模算术

Divyansh Jha, Yuanfang Xie, Brennen Yu, Varan Mehra

机构 * Georgia Institute of Technology(佐治亚理工学院) NYU Langone Health(纽约大学Langone医疗中心)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出BRo-JEPA模型,通过在潜空间中施加模10算术的循环结构,实现零样本泛化,解决了标准模型无法外推未见操作的问题。

Comments 20 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02365 2026-08-04 cs.AI cs.LG cs.RO 新提交 67%

Faster-WAM: Do World Action Models Need Deep Action Modules?

Faster-WAM:世界动作模型需要深度动作模块吗?

Liheng Ma, Rui Heng Yang, Zhanguang Zhang, Mateo Clemente, Ziwen Hu, Tongtong Cao, Yingxue Zhang

机构 * Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Huawei Celia Team(华为Celia团队) Labs(2012实验室)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 针对现有WAMs动作模块深度绑定视频骨干网络导致延迟高的问题,提出以视频为中心的DoT架构,构建Faster-WAM,实现低延迟、高性能与强泛化,较Fast-WAM提速3.2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02330 2026-08-03 cs.CV cs.AI cs.LG 版本更新 67%

ActionParty: Multi-Subject Action Binding in Generative Video Games

ActionParty:生成视频游戏中的多主体动作绑定

Alexander Pondaven, Ziyi Wu, Igor Gilitschenski, Philip Torr, Sergey Tulyakov, Fabio Pizzati, Aliaksandr Siarohin

机构 * Snap Research(Snap研究院) University of Oxford(牛津大学) University of Toronto(多伦多大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。

Comments ECCV 2026 - Project page: https://action-party.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19191 2026-07-22 cs.CV cs.AI cs.LG 新提交 67%

ABot-World-0: Infinite Interactive World Rollout on a Single Desktop GPU

ABot-World-0:在单台桌面GPU上进行无限交互式世界展开

Fan Jiang, Zhaoxu Sun, Mengchao Wang, Ziyu Zhu, Chiyu Wang, Yunpeng Zhang, Wenlin Liu, Yun Wang, Xue Zheng, Rui Sun, Junfeng Ni, Hongyu Pan, Zhongxu Sun, Fei Yu, Zengye Ge, Mengmeng Du, Nianfei Fan, Mingchao Sun, Yu Liu, Yongchang, Yanqing Zhu, Jiahang Wang, Ning Ying, Yuze Xuan, Di Yang, Zhicheng Liu, Zhe Gao, Tingbing Xu, Jiacheng Sui, Wenjin Yang, Junnan Lai, Shufeng Liu, Yuan Liu, Zheng Zhou, Yingliang Peng, Dawei Cao, Kaifeng Sheng, Yuxiang Cai, Fei Lu, Mu Xu, Ning Guo

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 介绍ABot-World-0这一用于实时长视野闭环交互的动作条件视频世界模型,利用多源数据学习世界动态。通过多种技术提炼模型,设计控制界面与部署堆栈,在单台桌面GPU上实现高效视频流传输,实验验证其有竞争力的可控性和世界演变能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16582 2026-07-21 cs.RO cs.AI cs.CV 新提交 67%

Autonomous VR-Based Risk Detection for Situational Awareness in Dangerous Settings

基于自主虚拟现实的危险环境态势感知风险检测

Mohammad Eskandari, Murali Krishna Varma Indukuri, Stephanie M. Lukin, Cynthia Matuszek

机构 * Interactive Robotics and Language Lab, University of Maryland Baltimore County(马里兰大学巴尔的摩县分校交互式机器人与语言实验室) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究在高风险环境中,提出基于VR的人机交互框架,利用VLM辅助机器人识别潜在危险并标注兴趣点,通过VR界面呈现给操作员,经实验验证该方法能有效支持态势感知,提升交互体验。

Comments 7 Pages, Accepted to RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16012 2026-07-20 cs.CV cs.AI cs.RO 新提交 67%

DPNeXt: A Lightweight Multi-Scale Feature Fusion Framework for Efficient ViT-Based Multi-Task Dense Prediction

DPNeXt:用于基于高效视觉Transformer的多任务密集预测的轻量级多尺度特征融合框架

Jehun Kang, Jungha Wang, Youngjun Hwang, David Hyunchul Shim

机构 * School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 研究针对机器人感知系统多任务学习中现有解码策略瓶颈,提出DPNeXt框架,用双深度可分离倒置瓶颈及MTBG策略,在多任务密集预测上表现出色,相比DPT大幅减少参数并提升推理速度。

Comments 8 pages, 5 figures. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04978 2026-07-07 cs.LG cs.CV cs.RO 新提交 67%

Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control

Qantara:用于多范式联合嵌入预测架构控制的桥流训练

Ruslan Rakhimov, George Bredis, Yuriy Maksyuta, Daniil Gavrilov

机构 * T-Tech

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究针对联合嵌入预测架构(JEPAs)单一推理范式问题,提出Qantara,通过端到端联合训练目标,同一检查点服务三种推理范式,提升控制性能,推动JEPAs从单范式规划器向多范式控制器转变。

Comments 16 pages, 3 figures, 6 tables. Project page: https://corl-team.github.io/qantara

详情

展开后加载摘要…

URL PDF HTML 收藏