arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3091 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3091 篇

hep-th/0201037 2009-11-30 hep-th 71%

Intersecting brane world models from D8-branes on (T^2 x T^4/Z_3)/Omega R_1 type IIA orientifolds

Gabriele Honecker

专题命中 具身推理 :world model(title)

Comments 30 pages, 7 figures

Journal ref JHEP 0201 (2002) 025

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-th/0110070 2009-11-30 hep-th gr-qc 71%

Brane World Models With Bulk Scalar Fields

Eanna E. Flanagan, S. -H. Henry Tye, Ira Wasserman

专题命中 具身推理 :world model(title)

Comments 16 pages

Journal ref Phys.Lett. B522 (2001) 155-165

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-th/0104049 2009-11-30 hep-th gr-qc hep-ph 71%

Second Order Perturbations in the Randall-Sundrum Infinite Brane-World Model

Hideaki Kudoh, Takahiro Tanaka

专题命中 具身推理 :world model(title)

Comments 15 pages, 2 figures, comment and reference added, typos corrected

Journal ref Phys.Rev. D64 (2001) 084022

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-ph/0112210 2009-11-30 hep-ph hep-th 71%

Gauge/Anomaly Syzygy and Generalized Brane World Models of Supersymmetry Breaking

Ann E. Nelson, Neal Weiner

专题命中 具身推理 :world model(title)

Comments 4 pages, RevTeX

Journal ref Phys.Rev.Lett. 88 (2002) 231802

详情

展开后加载摘要…

URL PDF HTML 收藏
astro-ph/9907080 2009-11-30 astro-ph gr-qc 71%

A conserved variable in the perturbed hydrodynamic world model

J. Hwang

专题命中 具身推理 :world model(title)

Comments 4 pages, no figure, To appear in Phys. Rev. D

Journal ref Phys.Rev. D60 (1999) 103512

详情

展开后加载摘要…

URL PDF HTML 收藏
gr-qc/0205002 2009-11-30 gr-qc hep-th 71%

Rigidity theorems in the braneworld model

Hideo Kodama

专题命中 具身推理 :world model(title)

Comments 7 pages in LaTeX with the PTP style. No figure. To be published in the proceedings of the workshop "Braneworld -- Dynamics of spacetime with boundary --"

Journal ref Prog.Theor.Phys.Suppl.148:277-283,2003

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-th/0104177 2009-11-30 hep-th gr-qc hep-ph 71%

A 6-D Brane World Model

Panagiota Kanti, Richard Madden, Keith A. Olive

专题命中 具身推理 :world model(title)

Comments 22 pages, LaTeX file, no figures

Journal ref Phys.Rev.D64:044021,2001

详情

展开后加载摘要…

URL PDF HTML 收藏
nlin/0306015 2009-11-30 nlin.AO q-bio 71%

Learning a world model and planning with a self-organizing, dynamic neural system

Marc Toussaint

专题命中 具身推理 :world model(title)

Comments 9 pages, see http://www.marc-toussaint.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-th/0207193 2009-11-30 hep-th 71%

Brane World Models And Darboux Transformations

A. V. Yurov

专题命中 具身推理 :world model(title)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-th/0110273 2009-11-30 hep-th 71%

Thick brane world model from perfect fluid

V. D. Ivashchuk, V. N. Melnikov

专题命中 具身推理 :world model(title)

Comments 11 pages, Latex, to be published in Grav. Cosmol. 7, 241-245 (2001)

Journal ref Grav.Cosmol. 7 (2001) 241-245

详情

展开后加载摘要…

URL PDF HTML 收藏
hep-ph/0203165 2009-11-30 hep-ph 71%

Testing Brane World Models with Ultra High Energy Cosmic Rays

Houri Ziaeepour

专题命中 具身推理 :world model(title)

Comments Impportant modifications. A section has been added to discuss the probability of bulk mode production

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14804 2026-08-18 cs.AI 新提交 70%

Generated Context versus Governed State: Functional Conditions for Accountable Longitudinal Clinical Reasoning

生成式上下文与受控状态:可问责纵向临床推理的功能条件

Augusto Bernardo Pissarra, Victor Lorena de Farias Souza

机构 * MyndwareMed(迈恩德韦尔医疗)

专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.AI

AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08023 2026-08-13 cs.RO 版本更新 70%

4D-WAM: Infusing Spatiotemporal Awareness into World Action Models through Trajectory Fields

4D-WAM:通过轨迹场将时空感知注入世界动作模型

Lishan Yang, Wenxuan Song, Xi Wang, Pingyue Sheng, Zheng Fang, Ziyang Zhou, Junjie He, Haodong Yan, Jiayi Chen, Nan Sun, Qiao Sun, Pengwei Wang, Lingqiao Liu, Yan Wang, Yuxiang Gao, Feras Dayoub, Haoang Li

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 70%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 70%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 具身推理 :embodied AI(abstract);robotic(abstract);分类 cs.CV

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23969 2026-07-31 cs.RO 版本更新 70%

LeapBot-WA: World-Anchor Action Models via Predictive Latent Alignments

LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型

Pei Liu, Nan Zheng, Lang Zhang, Daojie Peng, Yanan Zhang, Feilong Kong, Mingyue Feng, Jiachao Liu, Yaonong Wang, Qifeng Chen, Jun Ma

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27145 2026-07-30 cs.CV 新提交 70%

Explainable and Resource-Efficient Spatial Reasoning in Multimodal LLMs for Decision-Critical Applications

面向决策关键型应用的多模态大语言模型中可解释且资源高效的空间推理

Piyush Jain, Kousik Dasgupta, Rajarshi Roy, Subarna Tripathi

机构 * Heritage Institute of Technology(遗产技术学院) Kalyani Government Engineering College(卡利亚尼政府工程学院) IAIRO Intel Corporation(英特尔公司)

专题命中 具身推理 :robotics(abstract);embodied AI(abstract);分类 cs.CV

AI总结 针对多模态大语言模型空间判断不透明及细粒度空间理解不足的问题,提出无需训练的ByDeWay-V2框架,结合YOLO-World-L注入空间谓词,在多个基准上显著提升空间推理性能,适配资源受限场景。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19889 2026-07-23 cs.CV 新提交 70%

LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition

LAVIFT:用于手术交互识别的潜在动作引导视觉微调

Jiajun Cheng, Subarna Tripathi, Sainan Liu, Xiaofan Yu, Shan Lin

机构 * Arizona State University(亚利桑那州立大学) University of California, Merced(加州大学默塞德分校) Intel Corporation(英特尔公司)

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.CV

AI总结 研究针对手术交互识别中预训练模型适应细粒度交互的挑战,提出LAViFiT框架,通过逆动力学模型、前向世界模型及补丁级SIG正则化器,实现视觉语言微调,提升了识别率和图像-文本对齐,增强了特征基础和空间连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06165 2026-07-08 cs.RO 新提交 70%

EAGOR: Embodied Reasoning in Omni-direction

EAGOR:全方位的具身推理

Shriram Damodaran, Soumyaratna Debnath, Yan Wu, Wei-Yun Yau, Addison Lin Wang

机构 * EmPACT Lab, NTU Singapore Institute for Infocomm Research, A*STAR Singapore(EmPACT实验室,南洋理工大学信息与通信研究所,A*STAR新加坡)

专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.RO

AI总结 研究针对现有视觉语言模型在处理360°观测时方向估计不一致的问题,提出无需训练的几何感知框架EAGOR,将方向推理表述为球面上的递归贝叶斯估计,引入球谐信念场,实验证明其性能优于现有方法。

Comments 12 Pages, 7 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01784 2026-07-03 cs.CV 新提交 70%

SpaceEra++: A Unified Framework Towards 3D Spatial Reasoning in Video

SpaceEra++: 面向视频中3D空间推理的统一框架

Weili Guan, Haoyu Zhang, Meng Liu, Qianlong Xiang, Yaowei Wang, Liqiang Nie

机构 * School of Information Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)信息科学与技术学院) Shenzhen Loop Area Institute(深圳河套学院) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院) Pengcheng Laboratory(鹏城实验室) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院) Zhongguancun Academy(中关村学院) City University of Hong Kong(香港城市大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.CV

AI总结 提出SpaceEra++框架,通过ScenePick帧采样策略缓解输入不足,并利用SpaceAlign对齐绝对坐标与相对空间关系增强推理,在多个基准上超越强基线。

Comments Accepted by IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 70%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 具身推理 :manipulation(abstract);world model(abstract);分类 cs.CV

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27364 2026-06-26 cs.CV 新提交 70%

PhysiFormer: Learning to Simulate Mechanics in World Space

PhysiFormer: 在世界空间中学习模拟力学

Yiming Chen, Yushi Lan, Andrea Vedaldi

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV

AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。

Comments Project page: https://yimingc9.github.io/physiformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25241 2026-06-25 cs.RO 新提交 70%

GRAFT: Graph-Based Affordance Transfer via Part Correspondence

GRAFT: 基于部件对应的图结构功能迁移

Mengying Lin, Utkarsh Mishra, Ajay Mandlekar, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出GRAFT框架,利用部件级图表示和几何感知对应,通过单次演示实现零样本操作迁移,解决泛化到未见物体的挑战。

Journal ref In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 8746-8755

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07413 2026-06-10 cs.RO 版本更新 70%

Going with the Flow: Koopman Behavioral Models as Pseudo Planners for Visuo-Motor Dexterity

随流而行:Koopman行为模型作为视觉运动灵巧性的伪规划器

Yunhai Han, Jiaqi Fu, Linhao Bai, Ziyu Xiao, Zhaodong Yang, Yogita Choudhary, Krishna Jha, Chuizheng Kong, Shreyas Kousik, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 具身推理 :world model(abstract,abstract_cn);分类 cs.RO

AI总结 提出统一行为模型(UBM),将灵巧技能建模为耦合动力系统,确保时间一致性;基于Koopman算子实现线性潜空间,通过在线重规划实现反应性和适应性,在模拟和真实任务中达到或超越现有方法。

Comments Website: https://k-ubm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09640 2026-06-09 cs.RO 新提交 70%

Physics-Aware Sparse Learning and Selective Online Adaptation for Euler-Lagrange Robot Dynamics

面向欧拉-拉格朗日机器人动力学的物理感知稀疏学习与选择性在线自适应

Rishabh Dev Yadav, Samaksh Ujjawal, Sihao Sun, Spandan Roy, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) International Institute of Information Technology Hyderabad(海得拉巴国际信息技术学院) Delft University of Technology(代尔夫特理工大学) Newcastle University(纽卡斯尔大学)

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO

AI总结 提出一种保结构残差学习框架,将模型误差分解为惯性修正、科里奥利项和广义力残差,通过物理约束学习机械部分,并用稀疏历史依赖潜变量模型和贝叶斯线性回归在线自适应扰动敏感部分,提升多机器人平台动力学预测与轨迹跟踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26239 2026-05-27 cs.CV cs.MA 70%

Sentinel: Embodied Cooperative Spatial Reasoning and Planning

Sentinel:具身协同空间推理与规划

Xiangye Lin, Hongxin Zhang, Ruxi Deng, Qinhong Zhou, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 具身推理 :embodied agent(abstract);navigation(abstract);分类 cs.CV

AI总结 提出Sentinel挑战和CoSaR框架,通过自然语言通信与空间导航算法结合,解决多智能体在城市规模户外环境中的协同空间推理与规划问题。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24394 2026-05-26 cs.RO 70%

RoboHitch: Learning Visual Affordance from Disordered Keypoints for Hitch Knots Tying

RoboHitch: 从无序关键点学习视觉可供性用于系结

Jiahui Zuo, Boyang Zhang, Fumin Zhang

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 提出RoboHitch框架,利用无序3D关键点和RGB图像从人类演示中学习系结,通过动态图自编码器和卷积自编码器融合特征,预测抓取和放置可供性,实现遮挡下的系结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17517 2026-05-19 cs.RO 70%

AffordVLA: Injecting Affordance Representations into Vision-Language-Action Models via Implicit Feature Alignment

AffordVLA: 通过隐式特征对齐将 affordance 表示注入到视觉-语言-动作模型中

Weijie Kong, Zhian Su, Wei Yu, Huixu Dong

机构 * Grasp Lab, School of Mechanical Engineering of Zhejiang University(浙大机械工程学院抓取实验室)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出 AffordVLA 框架,通过隐式特征对齐将以操作为中心的 affordance 表示注入到视觉-语言-动作模型中,以提升动作准确性,实验表明其在仿真和现实中的表现优于现有方法。

Comments 13pages, 10figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 70%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04052 2026-04-21 cs.RO cs.CL 70%

Stable Language Guidance for Vision-Language-Action Models

用于视觉-语言-动作模型的稳定语言引导

Zhihao Zhan, Yuhao Chen, Jiaying Zhou, Qinhan Lyu, Hao Liu, Keze Wang, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Lab of Big Data Analysis & Processing(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era AI实验室)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出RSS框架,通过解耦物理 affordance 与语义执行,提升视觉-语言-动作模型在语言扰动下的鲁棒性,实验表明其在多种操作基准测试中达到最优性能。

Comments Accepted to ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏