arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3100 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3100 篇

2603.09951 2026-03-11 cs.LG cs.AI cs.SE 62%

Towards a Neural Debugger for Python

迈向Python的神经调试器

Maximilian Beck, Jonas Gehring, Jannik Kossen, Gabriel Synnaeve

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出神经调试器,通过模拟传统调试器实现交互式代码执行控制,提升神经模型在代码执行预测与逆向推理中的能力。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15918 2026-02-19 cs.CV cs.AI 62%

EarthSpatialBench: Benchmarking Spatial Reasoning Capabilities of Multimodal LLMs on Earth Imagery

EarthSpatialBench: 多模态大语言模型在地球影像上空间推理能力的基准测试

Zelin Xu, Yupu Zhang, Saugat Adhikari, Saiful Islam, Tingsong Xiao, Zibo Liu, Shigang Chen, Da Yan, Zhe Jiang

机构 * University of Florida(佛罗里达大学) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 EarthSpatialBench是一个用于评估多模态大语言模型在地球影像上空间推理能力的综合基准测试,涵盖空间距离、方向、拓扑关系及复杂几何查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17873 2026-02-04 cs.CV cs.AI 62%

SurgVidLM: Towards Multi-grained Surgical Video Understanding with Large Language Model

SurgVidLM:迈向多粒度外科视频理解的大型语言模型

Guankun Wang, Junyi Wang, Wenjin Mo, Long Bai, Kun Yuan, Ming Hu, Jinlin Wu, Junjun He, Yiming Huang, Nicolas Padoy, Zhen Lei, Hongbin Liu, Nassir Navab, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) Sun Yat-sen University(中山大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑技术大学) Monash University(墨尔本大学) Centre for Artificial Intelligence and Robotics, HKISI-CAS(人工智能与机器人中心,HKISI-CAS) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 具身推理 :robotic(abstract);分类 cs.AI、cs.CV

AI总结 SurgVidLM通过多粒度分析提升外科视频理解能力,结合全局与局部机制实现更精确的手术流程解析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00608 2026-02-03 cs.AI cs.GR cs.LG 62%

Scalable Generative Game Engine: Breaking the Resolution Wall via Hardware-Algorithm Co-Design

可扩展的生成游戏引擎:通过硬件-算法协同设计突破分辨率限制

Wei Zeng, Xuchen Li, Ruili Feng, Zhen Liu, Fengwei An, Jian Zhao

机构 * School of Microelectronics, Southern University of Science and Technology (SUSTech)(南方科技大学电子学院) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) University of Waterloo(滑铁卢大学) School of Marxism, Tsinghua University(清华大学马克思主义学院) Zhongguancun Academy(中关村学院)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出硬件-算法协同设计框架,通过优化资源分配和减少内存带宽使用,实现高分辨率实时生成游戏,提升像素吞吐量50倍,达到26.4 FPS和48.3 FPS的流畅性能。

Comments Preprint, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17123 2026-01-27 cs.HC cs.CV cs.RO 62%

Acoustic Field Video for Multimodal Scene Understanding

用于多模态场景理解的声学场视频

Daehwa Kim, Chris Harrison

专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.CV

AI总结 本文提出声学场视频作为多模态场景理解的新输入方式,通过整合空间声学数据显著提升视觉-语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14339 2026-01-22 cs.CV cs.AI 62%

CityCube: Benchmarking Cross-view Spatial Reasoning on Vision-Language Models in Urban Environments

CityCube:在城市环境中对视觉-语言模型的跨视角空间推理进行基准测试

Haotian Xu, Yue Hu, Zhengqiu Zhu, Chen Gao, Ziyou Wang, Junreng Rao, Wenhao Lu, Weishi Li, Quanjun Yin, Yong Li

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学北京研究院) Department of Electronic Engineering, Tsinghua University(电子工程系,清华大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV

AI总结 CityCube是一个用于评估视觉-语言模型在城市环境中跨视角空间推理能力的基准,通过多视角问答对揭示模型与人类表现的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11644 2026-01-21 cs.CV cs.AI 62%

Predicting When to Trust Vision-Language Models for Spatial Reasoning

预测何时信任视觉-语言模型进行空间推理

Muhammad Imran, Yugyung Lee

机构 * University of Missouri Kansas City(密苏里大学堪萨斯城分校)

专题命中 具身推理 :robotics(abstract);分类 cs.AI、cs.CV

AI总结 本研究提出一种基于视觉的置信度估计框架,通过几何验证提升VLM空间推理的可靠性,实验显示其在BLIP-2和CLIP上的AUROC显著优于文本方法基线。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24712 2026-01-06 cs.RO cs.AI 62%

LSRE: Latent Semantic Rule Encoding for Real-Time Semantic Risk Detection in Autonomous Driving

LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测

Qian Cheng, Weitao Zhou, Cheng Jing, Nanshan Deng, Junze Wen, Zhaoyang Liu, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.AI

AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22771 2025-12-30 cs.CV cs.AI 62%

Next Best View Selections for Semantic and Dynamic 3D Gaussian Splatting

语义与动态3D高斯散射的下一最佳视角选择

Yiqian Li, Wen Jiang, Kostas Daniilidis

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 具身推理 :embodied agent(abstract);分类 cs.AI、cs.CV

AI总结 本文提出基于Fisher信息的主动学习算法,用于语义与动态3D高斯散射的视角选择,提升渲染质量和语义分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14442 2025-12-17 cs.CV cs.RO 62%

A4-Agent: An Agentic Framework for Zero-Shot Affordance Reasoning

A4-Agent: 一种用于零样本 affordance 推理的代理框架

Zixin Zhang, Kanghao Chen, Hanqing Wang, Hongfei Zhang, Harold Haodong Chen, Chenfei Liao, Litao Guo, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) SJTU(上海交通大学) Knowin

专题命中 具身推理 :embodied AI(abstract);分类 cs.RO、cs.CV

AI总结 A4-Agent 提出一种无需训练的代理框架,通过三个阶段的流水线实现零样本 affordance 推理,优于现有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12080 2025-12-16 cs.CV cs.LG 62%

BAgger: Backwards Aggregation for Mitigating Drift in Autoregressive Video Diffusion Models

BAgger: 逆向聚合用于缓解自回归视频扩散模型中的漂移

Ryan Po, Eric Ryan Chan, Changan Chen, Gordon Wetzstein

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 BAgger通过自监督方法缓解自回归视频扩散模型中的漂移问题,利用标准分数或流匹配目标提升长期运动稳定性与视觉一致性。

Comments Project page here: https://ryanpo.com/bagger

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04231 2025-12-05 cs.RO cs.AI 62%

CRAFT-E: A Neuro-Symbolic Framework for Embodied Affordance Grounding

CRAFT-E:一种用于具身赋能力量接地的神经符号框架

Zhou Chen, Joe Lin, Carson Bulgin, Sathyanarayanan N. Aakur

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI

AI总结 CRAFT-E通过结合神经符号方法和具身感知,提供了一种可解释且可定制的框架,用于辅助机器人系统中基于赋能力量的物体选择。

Comments 20 pages. 3 figures, 4 tables. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20462 2025-11-27 cs.CV cs.LG 62%

STARFlow-V: End-to-End Video Generative Modeling with Normalizing Flows

STARFlow-V:基于归一化流的端到端视频生成模型

Jiatao Gu, Ying Shen, Tianrong Chen, Laurent Dinh, Yuyang Wang, Miguel Angel Bautista, David Berthelot, Josh Susskind, Shuangfei Zhai

机构 * Apple(苹果公司)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 STARFlow-V基于归一化流提出端到端视频生成模型,具备端到端学习、鲁棒因果预测和原生似然估计等优势,实现了高质量自回归视频生成。

Comments 21 pages, 9 figures. Code and samples are available at https://github.com/apple/ml-starflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18319 2025-11-25 cs.AI cs.LG cs.SY eess.SY 62%

Weakly-supervised Latent Models for Task-specific Visual-Language Control

弱监督潜在模型用于任务特定的视觉语言控制

Xian Yeow Lee, Lasitha Vidyaratne, Gregory Sin, Ahmed Farahat, Chetan Gupta

机构 * Industrial AI Lab, Hitachi America, Ltd.(日立美国有限公司工业人工智能实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种任务特定的潜在动态模型,利用目标状态监督学习动作诱导位移,以提高空间定位任务中的视觉语言控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16655 2025-11-21 cs.CV cs.LG 62%

Solving Spatial Supersensing Without Spatial Supersensing

无需空间超感知的解决方法

Vishaal Udandarao, Shyamgopal Karthik, Surabhi S. Nath, Andreas Hochlehnert, Matthias Bethge, Ameya Prabhu

机构 * Tübingen AI Center, University of Tübingen(图宾根人工智能中心,图宾根大学) Max Planck Institute for Biological Cybernetics(马克斯·普朗克生物 cybernetics 研究所)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

AI总结 Cambrian-S通过定制推理策略在无需空间超感知的情况下解决视频世界模型基准。

Comments Tech Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13537 2025-11-18 cs.LG cs.AI 62%

Competence-Aware AI Agents with Metacognition for Unknown Situations and Environments (MUSE)

Rodolfo Valiente, Praveen K. Pilly

机构 * Intelligent Systems Center, HRL Laboratories(智能系统中心,HRL实验室)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

Comments Replaced all references to "self-awareness" with the more accurate term "self-assessment"; Updated Figure 2; Added recent pertinent work from the cognitive computational neuroscience literature; Removed the non-apples-to-apples comparison with Dreamer-v3 for self-assessment; Added additional experiments to validate the role of accurate self-assessment in effective self-regulation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11702 2025-11-18 cs.CV cs.AI eess.IV 62%

Task-Aware 3D Affordance Segmentation via 2D Guidance and Geometric Refinement

Lian He, Meng Liu, Qilang Ye, Yu Zhou, Xiang Deng, Gangyi Ding

专题命中 具身推理 :embodied agent(abstract);分类 cs.AI、cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11601 2025-11-18 cs.DC cs.AI cs.LG 62%

Mind the Gap: Revealing Inconsistencies Across Heterogeneous AI Accelerators

Elliott Wen, Sean Ma, Ewan Tempero, Jens Dietrich, Daniel Luo, Jiaxing Shen, Kaiqi Zhao, Bruce Sham, Yousong Song, Jiayi Hua, Jia Hong

机构 * The University of Auckland(奥克兰大学) Hong Kong Polytechnic University(香港Polytechnic大学) Victoria University of Wellington(但尼丁维多利亚大学) Harbin Institute of Technology(哈尔滨工业大学) Lingnan University(岭大大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10721 2025-11-17 cs.CV cs.LG 62%

Fast Data Attribution for Text-to-Image Models

Sheng-Yu Wang, Aaron Hertzmann, Alexei A Efros, Richard Zhang, Jun-Yan Zhu

机构 * Carnegie Mellon University(卡内基梅隆大学) Adobe Research(Adobe研究) UC Berkeley(伯克利大学)

专题命中 具身推理 :world model(abstract);分类 cs.CV、cs.LG

Comments NeurIPS 2025 camera ready. Project page: https://peterwang512.github.io/FastGDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09578 2025-11-14 cs.LG cs.AI physics.comp-ph 62%

HeatGen: A Guided Diffusion Framework for Multiphysics Heat Sink Design Optimization

Hadi Keramati, Morteza Sadeghi, Rajeev K. Jaiman

机构 * Department of Mechanical Engineering(机械工程系) University of British Columbia(不列颠哥伦比亚大学) Institute for Nano- and Microfluidics(纳微流体研究所) Technical University of Darmstadt(德累斯顿技术大学)

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10509 2025-11-04 cs.CV cs.LG 62%

TESGNN: Temporal Equivariant Scene Graph Neural Networks for Efficient and Robust Multi-View 3D Scene Understanding

Quang P. M. Pham, Khoi T. N. Nguyen, Lan C. Ngo, Truong Do, Dezhen Song, Truong-Son Hy

机构 * Department of Robotics(机器人学系) Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎伊德人工智能大学) College of Engineering and Computer Science(工程与计算机科学学院) VinUniversity(文大学) Department of Computer Science(计算机科学系) The University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 具身推理 :robotics(abstract);分类 cs.CV、cs.LG

Comments arXiv admin note: text overlap with arXiv:2407.00609

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24161 2025-10-29 cs.AI cs.MM cs.RO 62%

BLM$_1$: A Boundless Large Model for Cross-Space, Cross-Task, and Cross-Embodiment Learning

Wentao Tan, Bowen Wang, Heng Zhi, Chenyu Liu, Zhe Li, Jian Liu, Zengrong Lin, Yukun Dai, Yipeng Chen, Wenjie Yang, Enci Xie, Hao Xue, Baixu Ji, Chen Xu, Zhibin Wang, Tianshi Wang, Lei Zhu, Heng Tao Shen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 具身推理 :embodied agent(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21860 2025-10-28 cs.RO cs.AI 62%

Butter-Bench: Evaluating LLM Controlled Robots for Practical Intelligence

Callum Sharrock, Lukas Petersson, Hanna Petersson, Axel Backlund, Axel Wennström, Kristoffer Nordström, Elias Aronsson

机构 * Andon Labs(安登实验室)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05341 2025-10-24 cs.CV cs.AI 62%

Direct Numerical Layout Generation for 3D Indoor Scene Synthesis via Spatial Reasoning

Xingjian Ran, Yixuan Li, Linning Xu, Mulin Yu, Bo Dai

机构 * The University of Hong Kong(香港大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 具身推理 :embodied AI(abstract);分类 cs.AI、cs.CV

Comments Project Page: https://directlayout.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19752 2025-10-23 cs.RO cs.AI 62%

Learning Affordances at Inference-Time for Vision-Language-Action Models

Ameesh Shah, William Chen, Adwait Godbole, Federico Mora, Sanjit A. Seshia, Sergey Levine

机构 * UC Berkeley(伯克利大学) Physical Intelligence(物理智能)

专题命中 具身推理 :robotics(abstract);分类 cs.RO、cs.AI

Comments 7 pages and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10255 2025-10-22 cs.CV cs.RO 62%

When LLMs step into the 3D World: A Survey and Meta-Analysis of 3D Tasks via Multi-modal Large Language Models

Xianzheng Ma, Brandon Smart, Yash Bhalgat, Shuai Chen, Xinghui Li, Jian Ding, Jindong Gu, Dave Zhenyu Chen, Songyou Peng, Jia-Wang Bian, Philip H Torr, Marc Pollefeys, Matthias Nießner, Ian D Reid, Angel X. Chang, Iro Laina, Victor Adrian Prisacariu

机构 * University of Oxford(牛津大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) Technical University of Munich(慕尼黑技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Simon Fraser University(西蒙·弗雷泽大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 具身推理 :navigation(abstract);分类 cs.RO、cs.CV

Comments 2nd version update to Jun.2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11943 2025-10-21 cs.AI cs.LG cs.LO cs.MA 62%

Agentic System with Modal Logic for Autonomous Diagnostics

Antonin Sulc, Thorsten Hellert

专题命中 具身推理 :world model(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22281 2025-09-29 cs.CV cs.RO 62%

MesaTask: Towards Task-Driven Tabletop Scene Generation via 3D Spatial Reasoning

Jinkun Hao, Naifu Liang, Zhen Luo, Xudong Xu, Weipeng Zhong, Ran Yi, Yichen Jin, Zhaoyang Lyu, Feng Zheng, Lizhuang Ma, Jiangmiao Pang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) SII Southern University of Science and Technology(南方科技大学) Peking University(北京大学)

专题命中 具身推理 :manipulation(abstract);分类 cs.RO、cs.CV

Comments Accepted by NeurIPS 2025; Project page: https://mesatask.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20754 2025-09-26 cs.AI cs.RO 62%

Meta-Memory: Retrieving and Integrating Semantic-Spatial Memories for Robot Spatial Reasoning

Yufan Mao, Hanjing Ye, Wenlong Dong, Chengjie Zhang, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 具身推理 :robotic(abstract);分类 cs.RO、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19555 2025-09-25 cs.RO cs.LG 62%

AnySafe: Adapting Latent Safety Filters at Runtime via Safety Constraint Parameterization in the Latent Space

Sankalp Agrawal, Junwon Seo, Kensuke Nakamura, Ran Tian, Andrea Bajcsy

机构 * The Ohio State University(俄亥俄州立大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) NVIDIA Research(NVIDIA研究)

专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏