arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 3091 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 具身推理 3091 篇

2605.08808 2026-05-12 cs.CV cs.AI cs.LG 75%

Curvature-Aware Captioning:Leveraging Geodesic Attention for 3D Scene Understanding

曲率感知的描述生成:利用测地注意力实现3D场景理解

Ziyao He, Yingjie Liu, ZhangYangRui, Mingsong Chen, Xuan Tang, Xian Wei

机构 * East China Normal University(东华大学)

专题命中 具身推理 :navigation(abstract);robotic(abstract);分类 cs.AI、cs.CV、cs.LG

AI总结 本文提出曲率感知描述生成框架,通过非欧几里得测地注意力机制解决定位与上下文化冲突,提升3D场景描述的精度与连贯性。

Comments CVPR2026 Highlight!

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV 75%

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29419 2026-04-01 cs.RO cs.AI cs.CV 75%

RAAP: Retrieval-Augmented Affordance Prediction with Cross-Image Action Alignment

RAAP:基于跨图像动作对齐的检索增强的可达性预测

Qiyuan Zhuang, He-Yang Xu, Yijun Wang, Xin-Yang Zhao, Yang-Yang Li, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University(东南大学计算机科学与工程学院、新一代人工智能技术与交叉应用重点实验室) Southeast University-Monash University Joint Graduate School, Southeast University(东南大学-蒙纳士大学联合研究生院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 RAAP通过结合检索与对齐学习,统一了可达性检索与动作方向预测,利用密集对应转移接触点并预测动作方向,实现了跨未见物体和类别的稳健泛化。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14758 2025-09-19 cs.RO cs.CV cs.LG cs.SY eess.SY 75%

Designing Latent Safety Filters using Pre-Trained Vision Models

Ihab Tabbara, Yuxuan Yang, Ahmad Hamzeh, Maxwell Astafyev, Hussein Sibai

机构 * Department of Computer Science and Engineering, Washington University in St. Louis(计算机科学与工程系,华盛顿大学圣路易斯分校)

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21906 2025-06-02 cs.RO cs.AI cs.CV 75%

ChatVLA-2: Vision-Language-Action Model with Open-World Embodied Reasoning from Pretrained Knowledge

Zhongyi Zhou, Yichen Zhu, Junjie Wen, Chaomin Shen, Yi Xu

机构 * Midea Group(美的集团) East China Normal University(华东师范大学)

专题命中 具身推理 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments Project page: https://chatvla-2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14948 2025-05-22 cs.CV cs.AI cs.LG 75%

Programmatic Video Prediction Using Large Language Models

Hao Tang, Kevin Ellis, Suhas Lohit, Michael J. Jones, Moitreya Chatterjee

机构 * Mitsubishi Electric Research Laboratories (MERL)(三菱电机研究实验室(MERL))

专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24388 2025-04-02 cs.AI cs.CL cs.CV cs.LG 75%

RIG: Synergizing Reasoning and Imagination in End-to-End Generalist Policy

Zhonghan Zhao, Wenwei Zhang, Haian Huang, Kuikun Liu, Jianfei Gao, Gaoang Wang, Kai Chen

专题命中 具身推理 :embodied agent(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11974 2024-12-18 cs.RO cs.AI cs.CL cs.CV 75%

Emma-X: An Embodied Multimodal Action Model with Grounded Chain of Thought and Look-ahead Spatial Reasoning

Qi Sun, Pengfei Hong, Tej Deep Pala, Vernon Toh, U-Xuan Tan, Deepanway Ghosal, Soujanya Poria

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

Comments https://github.com/declare-lab/Emma-X, https://huggingface.co/declare-lab/Emma-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01953 2024-08-08 cs.RO cs.CV cs.LG 75%

EqvAfford: SE(3) Equivariance for Point-Level Affordance Learning

Yue Chen, Chenrui Tie, Ruihai Wu, Hao Dong

专题命中 具身推理 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV、cs.LG

Comments Accept to CVPRWorkshop on Equivariant Vision: From Theory to Practice 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14481 2026-08-17 cs.RO cs.AI 新提交 74%

Ensuring Safe Physical AI in Urban Mobility via Hazard-Informed Synthesized Envelopes

通过危险信息合成包络确保城市移动中的安全物理人工智能

Alexei Odinokov, Rostislav Yavorskiy

机构 * Xortech DOO

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

AI总结 针对异构机器人城市部署的安全挑战,提出结合危险分析与运行时执行的统一框架,通过跨层安全转换保障物理AI的城市移动安全。

Comments The 2026 International Conference on Control, Robotics Engineering and Technology (CRET 2026), https://www.cret.net/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03604 2026-04-09 cs.CV cs.AI 74%

A Lightweight Library for Energy-Based Joint-Embedding Predictive Architectures

一种轻量级的用于基于能量的联合嵌入预测架构库

Basile Terver, Randall Balestriero, Megi Dervishi, David Fan, Quentin Garrido, Tushar Nagarajan, Koustuv Sinha, Wancong Zhang, Mike Rabbat, Yann LeCun, Amir Bar

机构 * Meta FAIR INRIA(法国国家信息与自动化研究所) New York University(纽约大学)

专题命中 具身推理 :world model(abstract,comments);navigation(abstract);分类 cs.AI、cs.CV

AI总结 本文提出EB-JEPA库,展示如何将图像级自监督学习的表示学习技术扩展到视频和动作条件世界模型,通过实验验证其在任务中的有效性。

Comments v2: clarify confusion in definition of JEPAs vs. regularization-based JEPAs v3: Camera-ready of ICLR world models workshop, fixed formatting and ViT config / results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00226 2025-12-02 cs.CV cs.AI 74%

DenseScan: Advancing 3D Scene Understanding with 2D Dense Annotation

DenseScan: 通过2D密集标注提升3D场景理解

Zirui Wang, Tao Zhang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Wuhan University(武汉大学)

专题命中 具身推理 :robotics(abstract);navigation(abstract);分类 cs.AI、cs.CV;embodied AI(comments)

AI总结 DenseScan通过2D密集标注提升3D场景理解,结合多视角图像和多模态大语言模型生成丰富语义标注,拓展下游任务应用。

Comments Workshop on Space in Vision, Language, and Embodied AI at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00779 2025-09-25 cs.RO cs.LG cs.SY eess.SY 74%

Uncertainty-aware Latent Safety Filters for Avoiding Out-of-Distribution Failures

Junwon Seo, Kensuke Nakamura, Andrea Bajcsy

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.LG;robot learning(comments)

Comments Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12197 2025-02-10 cs.RO cs.AI 74%

Towards Interpretable Visuo-Tactile Predictive Models for Soft Robot Interactions

Enrico Donato, Thomas George Thuruthel, Egidio Falotico

专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO、cs.AI;robotics(comments)

Comments IEEE RAS EMBS 10th International Conference on Biomedical Robotics and Biomechatronics (BioRob 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13901 2026-08-17 cs.RO 新提交 74%

Ontology-Grounded World Models for Failure Diagnosis and Closed-Loop Repair in Physical AI Systems

用于物理人工智能系统故障诊断与闭环修复的本体论驱动世界模型

Kailin Wang, Haoxiang Jie, Yaoyuan Yan, Jiacheng Zhou, Zhiyou Heng

机构 * AI Lab, Country Garden Services Group(碧桂园服务集团AI实验室) Fudan University(复旦大学) Omni AI

专题命中 具身推理 :world model(title);分类 cs.RO

AI总结 本文提出分层于EV-WM之上的Onto-EV-WM本体驱动接口,在PointMaze、LIBERO-Goal等基准测试中实现高故障修复成功率,为物理AI系统提供有效的故障诊断与闭环修复方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13492 2026-08-14 cs.AI 新提交 74%

AlayaWorld: Interactive Long-Horizon World Modeling - Full Technical Report (v1.1)

AlayaWorld:交互式长时世界建模——完整技术报告(v1.1)

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge, Yuanyang Yin, Jiaming Tan, Kang He, Liaoyuan Fan, Mingliang Zhai, Ruicong Liu, Xiaojie Xu, Xuangeng Chu, Zhen Li, Zhengyuan Lin, Zhixiang Wang, Zian Meng, Zihui Gao

机构 * Alaya Lab(Alaya实验室)

专题命中 具身推理 :world model(title);分类 cs.AI

AI总结 本报告改进AlayaWorld,通过调整条件信号设计等六项修改优化交互式长时世界建模,保留原有架构等核心部分。

Comments Authors are listed alphabetically by the first name and their role. See the contribution section for details

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07301 2026-08-10 cs.LG 新提交 74%

From Optimal Actions to World Models: Identifiability of Transition Kernels in Discounted MDPs

从最优动作到世界模型:折扣马尔可夫决策过程中转移核的可识别性

Neal Batra

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 该研究探讨折扣马尔可夫决策过程中仅从最优动作可恢复的转移概率信息,明确了不同形式奖励对转移核可识别性的影响,证明了转移核的可识别条件及相关维度特性。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28487 2026-07-31 cs.CV 新提交 74%

AuricularWorld: Hierarchical Action-Guided World Modeling for Fine-Grained Auricular Structure Segmentation from CT Scans

AuricularWorld:用于CT扫描中耳部结构细粒度分割的分层动作引导世界建模

Jingwen Yang, Senmao Wang, Luoyao Kang, Runmeng Cui, Keying Zhang, Yunjia Bao, Haifan Gong, Lin Lin, Haiyue Jiang

机构 * Plastic Surgery Hospital, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院北京协和医学院整形外科医院) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 该研究针对CT耳部细粒度分割难题,提出分层动作引导的AuricularWorld世界建模框架,通过迭代解剖学推理提升分割精度,使HD95降低超43%,验证了潜在世界模型推理的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26040 2026-07-29 cs.LG stat.ML 新提交 74%

Reinformed Dreamer: An Asymmetric World Model Efficiently Trained through Latent Guidance

强化信息梦行者:通过潜在引导有效训练的非对称世界模型

Gaspard Lambrechts, Adrien Bolland, Daniel Ebi, Damien Ernst

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 研究基于模型的强化学习中,非对称学习对观测及特权信息表示的影响。针对‘信息梦行者’局限性,提出用潜在引导的新目标,形成‘强化信息梦行者’算法,实验显示其比之前非对称方法有更持续改进。

Comments 8 pages, 18 pages total, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20441 2026-07-24 cs.CL cs.LG 新提交 74%

Belief Propagation in LLM World Models: Measuring Strategic Information Bias with Prediction Markets

大语言模型世界模型中的信念传播:用预测市场测量战略信息偏差

Mykola Khandoga, Yevhen Kostiuk, Anton Polishko, Yurii Filipchuk, Kostiantyn Kozlov, Dmytro Zamriy, Artur Kiulian

机构 * Future Principle(未来原理) Aarhus University(奥胡斯大学)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 研究大语言模型结合预测市场测量信息偏差,通过消融特定文本偏差贡献,应用于乌克兰相关预测市场发现英语新闻背景致偏差,主要源于文本,补充乌军事分析源可减偏差,此偏差在多架构中会持续并影响下游决策。

Comments Accepted at UNLP 2026. 12 pages, 8 figures, 11 tables. Dataset available at https://huggingface.co/datasets/OpenBabylon/unlp-ukraine-forecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11836 2026-07-14 cs.CV 新提交 74%

Cycle-World: Mitigating Error Accumulation in Long-term Video World Models via Reverse-Prediction Cycle Consistency

循环世界:通过反向预测循环一致性减轻长期视频世界模型中的误差累积

Zihan Su, Teng Hu, Jiangning Zhang, Ruiyan Wang, Ran Yi, Lizhuang Ma, Dacheng Tao

机构 * School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机科学学院) Institute of Cyber-Systems and Control, Zhejiang University, Hangzhou, China(浙江大学控制系统研究所) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 针对自回归扩散模型在长视频生成中误差累积问题,提出循环世界框架,通过训练和推理阶段的时间可逆性及反向预测模型抑制误差,实验证明其在VBench基准测试中显著减轻误差漂移,提升生成质量和时间一致性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28185 2026-06-16 cs.CV 版本更新 74%

Visual Generation in the New Era: An Evolution from Atomic Mapping to Agentic World Modeling

新时代的视觉生成:从原子映射到智能世界建模的演进

Keming Wu, Zuhao Yang, Kaichen Zhang, Shizun Wang, Haowei Zhu, Sicong Leng, Zhongyu Yang, Qijie Wang, Sudong Wang, Ziting Wang, Zili Wang, Hui Zhang, Haonan Wang, Hang Zhou, Yifan Pu, Xingxuan Li, Fangneng Zhan, Bo Li, Lidong Bing, Yuxin Song, Ziwei Liu, Wenhu Chen, Jingdong Wang, Xinchao Wang, Xiaojuan Qi, Shijian Lu, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学) University of Waterloo(滑铁卢大学) StepFun MiroMind Baidu(百度) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LMMs-Lab(LMMs实验室)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 提出五级分类法(原子生成、条件生成、上下文生成、智能生成、世界建模生成),分析流匹配、统一理解与生成模型等关键技术,并指出现有评估高估感知质量而忽视结构、时序和因果缺陷。

Comments Project Page: https://github.com/EvolvingLMMs-Lab/Evolving-Visual-Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12316 2026-06-11 cs.CV 新提交 74%

Slots, Transitions, Loops: Learning Composable World Models for ARC

槽、转换、循环:学习可组合的ARC世界模型

Gege Gao, Bernhard Schölkopf, Andreas Geiger

机构 * University of Tübingen(图宾根大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 提出Loop-OWM架构,通过颜色原型槽、演示条件任务摘要和循环转换模型,学习ARC任务中的视觉符号规则,在ARC-1和ARC-2上超越基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09312 2026-06-09 cs.LG cs.PL 新提交 74%

Toward Compiler World Models: Learning Latent Dynamics for Efficient Tensor Program Search

迈向编译器世界模型:学习潜在动态以实现高效张量程序搜索

Haolin Pan, Lianghong Huang, Xvlin Zhou, Mingjie Xing, Yanjun Wu

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 提出一种受世界模型启发的评估器,通过轻量级过渡模型在连续潜在空间中展开调度动作,避免昂贵AST变异和重复编码,在TVM AutoScheduler中实现比Ansor更优的延迟和测量效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24517 2026-05-26 cs.LG cs.CL 74%

ECHO: Terminal Agents Learn World Models for Free

ECHO: 终端代理免费学习世界模型

Vaishnavi Shrivastava, Piero Kauffmann, Ahmed Awadallah, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 提出ECHO混合目标,通过预测环境观测令牌将终端反馈转化为密集监督信号,显著提升CLI代理在TerminalBench-2.0上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19950 2026-05-20 cs.CV 74%

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01529 2026-05-20 cs.LG 74%

Learning Abstract World Models with a Group-Structured Latent Space

通过组结构潜在空间学习抽象世界模型

Thomas Delliaux, Nguyen-Khanh Vu, Vincent François-Lavet, Elise van der Pol, Emmanuel Rachelson

机构 * ISAE-SUPAERO ETH Zürich(瑞士联邦理工学院) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Microsoft Research AI for Science(微软研究院人工智能科学部)

专题命中 具身推理 :world model(title);分类 cs.LG

AI总结 该研究通过在低维表示流形上引入几何先验,改进了马尔可夫决策过程的抽象模型学习,从而提升有限数据下的泛化能力,并在具有旋转和翻译特征的环境中实现了更有效的强化学习任务学习。

Comments 20 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02072 2026-05-13 cs.CL cs.AI 74%

Express Your Doubts -- Probabilistic World Modeling Should not be Based on Token logprobs

表达怀疑——概率世界建模不应基于token logprobs

Eitan Wagner, Omri Abend

机构 * Eitan Wagner Omri Abend

专题命中 具身推理 :world model(title);分类 cs.AI

AI总结 本文探讨了大型语言模型作为概率估计器在世界概率估计中的应用问题,指出基于token logprobs的局限性,并提倡第二阶预测方法以提高概率合理性。

Comments Accepted to ICML 2026 (position track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22039 2026-04-15 cs.CV 74%

SparseWorld-TC: Trajectory-Conditioned Sparse Occupancy World Model

SparseWorld-TC: 基于轨迹的稀疏占用世界模型

Jiayuan Du, Yiming Zhao, Zhenglong Guo, Yong Pan, Wenbo Hou, Zhihui Hao, Kun Zhan, Qijun Chen

机构 * Tongji University(同济大学) Li Auto Inc(力汽车公司)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 本文提出了一种基于轨迹的未来3D场景占用预测新架构,通过端到端方式直接从原始图像特征预测多帧占用,避免了离散token化和BEV表示的限制,实现了nuScenes基准上的1-3秒占用预测最优性能。

Comments Accepted by CVPR2026 as an oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02315 2026-03-26 cs.CV 74%

FOCUS: Optimal Control for Multi-Entity World Modeling in Text-to-Image Generation

FOCUS:多实体世界建模中的最优控制

Eric Tillmann Bill, Enis Simsar, Thomas Hofmann

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 具身推理 :world model(title);分类 cs.CV

AI总结 本文提出FOCUS框架,通过将流匹配转化为随机最优控制,解决文本生成图像中多实体场景的属性泄露和身份纠缠问题,提出两种算法提升多实体对齐性能。

Comments Project Page: https://ericbill21.github.io/FOCUS/

详情

展开后加载摘要…

URL PDF HTML 收藏