arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-07-21 至 2026-07-21 共收录 51 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 1 篇

2606.14409 2026-07-21 cs.RO cs.AI 版本更新 81%

Hy-Embodied-0.5-VLA: From Vision-Language-Action Models to a Real-World Robot Learning Stack

Hy-Embodied-0.5-VLA:从视觉-语言-动作模型到真实世界机器人学习栈

He Zhang, Lingzhu Xiang, Haitao Lin, Zeyu Huang, Minghui Wang, Dingyan Zhong, Yubo Dong, Yihao Wu, Yongming Rao, Dongsheng Zhang, Wanjia He, Ling Chen, Kai Huang, Jiahao Chen, Sichang Su, Xumin Yu, Ziyi Wang, Chengwei Zhu, Xiao Teng, Yuchun Guo, Yufeng Zhang, Yuandong Liu, Rui Wang, Zisheng Lu, Han Hu, Zhengyou Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 机器人学习 :robot learning(title,abstract);分类 cs.RO、cs.AI

AI总结 提出端到端机器人学习栈HyVLA-0.5,涵盖数据收集、模型设计、预训练与微调、RL后训练及真实部署,各组件协同工作。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人操作 18 篇

2602.02402 2026-07-21 cs.RO cs.AI cs.CV physics.app-ph 版本更新 88%

SoMA: A Real-to-Sim Neural Simulator for Robotic Soft-body Manipulation

SoMA:一种用于机器人软体操作的实-仿真神经模拟器

Mu Huang, Hui Wang, Kerui Ren, Linning Xu, Yunsong Zhou, Mulin Yu, Bo Dai, Jiangmiao Pang

机构 * Fudan University, China(复旦大学) Shanghai Artificial Intelligence Laboratory, China(上海人工智能实验室) Shanghai Jiao Tong University, China(上海交通大学) The Chinese University of Hong Kong, China(香港中文大学) The University of Hong Kong, China(香港大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title);分类 cs.RO、cs.AI、cs.CV

AI总结 SoMA是一种用于机器人软体操作的实-仿真神经模拟器,通过统一的潜在神经空间实现可控、稳定的长周期操作和泛化能力。

Comments Project page: https://city-super.github.io/SoMA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新 86%

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 机器人操作 :robotic(title,abstract);manipulation(title);分类 cs.RO

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14183 2026-07-21 cs.RO cs.CV 版本更新 86%

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE:用于具身学习的开放自我中心操纵数据集和工具链

Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

机构 * Ant Group(蚂蚁集团)

专题命中 机器人操作 :manipulation(title,abstract);robot learning(abstract);world model(abstract);分类 cs.RO、cs.CV

AI总结 研究旨在为具身学习提供数据集和工具链,提出Open-AoE。它涵盖从手机捕捉到模型训练全流程,含约2000小时视频及多种注释等。通过整合多环节,降低数据贡献与重用障碍,为相关研究提供实用开放基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26897 2026-07-21 cs.RO cs.SY eess.SY 版本更新 83%

Stochastic Entanglement of Deterministic Origami Tentacles For Robust Robotic Grasping

确定性折纸tentacle的随机纠缠用于通用机器人抓取

Alec Boron, Bokun Zheng, Ziyang Zhou, Noel Naughton, Suyi Li

机构 * Department of Mechanical Engineering, Virginia Tech, VA, USA(弗吉尼亚理工大学机械工程系)

专题命中 机器人操作 :robotic(title,abstract);manipulation(abstract);分类 cs.RO

AI总结 本文提出一种折纸tentacle抓取器,通过确定性变形编程与随机纠缠协同实现通用物体抓取,结合折纸力学与Cosserat杆模拟,验证了其在动态环境中的抓取能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14350 2026-07-21 cs.CV 版本更新 79%

Beyond Pairwise Relations: Dynamic Manipulation Hypergraphs for Vision-Based Human Activity Recognition

用于HAR的动态操纵超图:超越成对关系:基于视觉的人类活动识别的动态操纵超图

Fatemeh Ziaeetabar

机构 * School of Mathematics, Statistics and Computer Science, College of Science, University of Tehran(德黑兰大学理学院数学、统计与计算机科学学院)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.CV

AI总结 研究基于视觉的人类活动识别中的细粒度操纵问题。提出动态操纵超图框架,通过多特征编码实体、谓词排序超边候选等进行建模。实验表明该方法在HO-F1上优于成对图和静态超图,证明时变高阶关系建模的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03387 2026-07-21 cs.RO 版本更新 79%

Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation

感受意外:通过残差触觉表示实现用于丰富接触操作的ResTacVLA

Pengwei Zhang, Bin Xie, Xinpan Meng, Xinyu Guo, Ce Hao, Fang Deng, Long Cheng, Tiancai Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村科学城) Dexmal(德克斯马尔)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 为解决触觉感知融入视觉语言动作模型时的模态坍塌问题,提出ResTacVLA,将触觉数据转为残差触觉表示,过滤视觉可预测动态,经矢量量化瓶颈离散化,利用视觉先验不确定性自适应控制触觉整合。

Comments 8 pages, 6 figures, 3 tables. Accepted by IROS 2026, Project page: https://awilekong.github.io/ResTacVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28196 2026-07-21 cs.RO 版本更新 79%

Learning Stable In-Grasp Manipulation in a Non-Dropping Action Space

在非掉落动作空间中学习稳定的抓取内操作

Ha Thang Long Doan, Hikaru Arita, Kazuto Nakashima, Kenji Tahara

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 提出将灵巧操作技能分解为多个简单/可分析组件,并利用经典物理和控制理论约束引导学习,实现稳定高效的抓取内重定位/重定向。

Comments This work has been submitted to the Taylor & Francis for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06570 2026-07-21 cs.RO 版本更新 77%

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

无监督发现部署日志中的故障分类

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 机器人操作 :manipulation(abstract);navigation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出无监督发现部署日志中的故障分类方法,通过视觉-语言推理和语义聚类,提升机器人系统鲁棒性和故障监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31581 2026-07-21 cs.AI 版本更新 70%

Choosing the Lens: Strategic Perspective Activation in Context-Dependent Argumentation

选择视角:上下文相关论证中的策略性视角激活

Albert Sadowski, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 机器人操作 :manipulation(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出上下文相关论证框架(CDAF),通过击败函数和视角标记特化,研究代理如何通过选择相关性集和优先级来策略性地影响论证结果。

Comments Accepted to LAMAS&SR workshop at FLoC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24357 2026-07-21 cs.RO 版本更新 70%

A Sensorless, Inherently Compliant Anthropomorphic Musculoskeletal Hand Driven by Electrohydraulic Actuators

无传感器、本征柔顺的人形肌理手驱动电液执行器

Misato Sonoda, Ronan Hinchet, Amirhossein Kazemipour, Yasunori Toshimitsu, Robert K. Katzschmann

机构 * Soft Robotics Lab, ETH Zurich, Switzerland(苏黎世联邦理工学院软机器人实验室,瑞士) The University of Tokyo, Japan(东京大学,日本)

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出一种无传感器、本征柔顺的人形肌理手,利用电液执行器实现高运动灵活性与物理柔顺性,通过机械放大机构提升抓取能力,实验验证了其在复杂环境中的安全性和抓取性能。

Comments Accepted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06491 2026-07-21 cs.RO cs.AI 版本更新 62%

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA: 学习速度可控的视觉-语言-动作策略

Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

机构 * RUC(中国人民大学) FDU(福建大学) UNC(北卡罗来纳大学教堂山分校)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO、cs.AI

AI总结 提出TempoVLA,通过可变速度轨迹增强和速度条件机制,实现机器人操作中速度的双向灵活控制,并支持动态速度调节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15659 2026-07-21 cs.RO 版本更新 57%

Continuously Stable Structure through Plastic Deformation

通过塑性变形实现的连续稳定结构

Junlong Xiao, Yaoqiang Pan, Xuan Zhang, Michael Yu Wang, Chao Chen

专题命中 机器人操作 :robotic(abstract);分类 cs.RO

AI总结 研究针对软机器人稳定性不足问题,提出通过塑性变形实现的连续稳定结构并集成到软夹爪,利用塑性变形机制、引入生物启发 paw 垫、开发数学模型及优化折纸结构,提升了夹爪稳定性和抓取能力,在多种场景表现良好。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13832 2026-07-21 cs.RO 版本更新 57%

GraspADMM: Improving Dexterous Grasp Synthesis via ADMM Optimization

GraspADMM:通过ADMM优化改进灵巧抓取合成

Liangwang Ruan, Jiayi Chen, He Wang, Baoquan Chen

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 本文提出GraspADMM框架,通过ADMM优化提升抓取的多样性、运动学可行性及动态稳定性,实验表明其在抓取成功率上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00126 2026-07-21 cs.RO 版本更新 57%

Compositional Diffusion with Guided Search for Long-Horizon Planning

用于长期规划的带引导搜索的组合扩散

Utkarsh A Mishra, David He, Yongxin Chen, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 机器人操作 :manipulation(abstract);分类 cs.RO

AI总结 研究针对组合生成模型在局部分布多模态时的模式平均问题,提出带引导搜索的组合扩散方法(CDGS),通过特定采样、过滤和重采样解决问题,在机器人操作任务上表现出色且跨领域通用。

Comments 38 pages, 18 figures, ICLR 2026 ORAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15523 2026-07-21 cs.HC 版本更新 50%

Interactive Mascot: A Scene-Centric Interaction Grammar for Data Visualizations

交互式吉祥物:一种用于数据可视化的以场景为中心的交互语法

Zhicheng Liu

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究针对以场景为中心的可视化系统交互抽象与语义组件不匹配问题,提出交互式吉祥物语法。通过建模交互行为为组件间信息流及引入依赖图执行模型来实现。实现与Vega-Lite相当性能,涵盖其交互空间且支持多种交互,经用户研究语法可学习可用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22838 2026-07-21 cs.GT 版本更新 50%

How Many Votes is a Lie Worth? Measuring Strategyproofness through Resource Augmentation

谎言的票数有多少?通过资源增强测量策略性

Ratip Emin Berker, Vincent Conitzer, Eden Hartman, Jiayuan Liu, Caspar Oesterheld

专题命中 机器人操作 :manipulation(abstract)

AI总结 通过资源增强测量策略性,研究不同投票规则的操纵潜力,证明排序计数在操纵潜力上表现最佳。

Comments 39 pages, 2 figures, new results on runoff rules

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16393 2026-07-21 cond-mat.dis-nn cond-mat.mes-hall 版本更新 50%

Arbitrary Control of Non-Hermitian Skin Modes via Disorder and An Electric Field

通过无序和电场对非厄米趋肤模式进行任意控制

Zhao-Fan Cai, Yang Li, Yu-Ran Zhang, Xiaomin Wei, Zhongmin Yang, Tao Liu, Franco Nori

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究如何在二维非厄米晶格中控制趋肤模式积累位置,核心方法是结合无序与电场,可任意控制边界定位位置,还展示了在互易晶格中的相关操纵,为二维非厄米系统工程应用提供新途径。

Comments Published version in Phys. Rev. Research 8, 033021

Journal ref Phys. Rev. Research 8, 033021 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05047 2026-07-21 cond-mat.mtrl-sci cond-mat.str-el 版本更新 50%

Moiré-resonant surface state in ultrathin RuO$_2$

超薄 RuO₂ 中的莫尔共振表面态

Philipp Keßler, Andreas Feuerpfeil, Armando Consiglio, Hendrik Hohmann, Ronny Thomale, Jonas Erhardt, Bing Liu, Vedran Jovic, Ralph Claessen, Patrick Härtl, Matteo Dürrnagel, Simon Moser

专题命中 机器人操作 :manipulation(abstract)

AI总结 研究通过多种方法对 Ru(0001) 上的超薄 RuO₂(110) 进行研究,发现非磁性电荷序及亚稳表面重构,未发现磁有序,为探索莫尔辅助电子序提供了有趣平台。

Journal ref Phys. Rev. Research 8, 033058 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身导航 7 篇

2510.23509 2026-07-21 cs.RO 版本更新 88%

Logic-Guided Socially-aware Robot Navigation World Model

逻辑引导的社会感知机器人导航世界模型

Weizheng Wang, Obi Ike, Soyun Choi, Sungeun Hong, Aniket Bera, Byung-Cheol Min

机构 * School of Applied and Creative Computing, Purdue University(应用与创意计算学院,普渡大学) Department of Computer Science, Purdue University(计算机科学系,普渡大学) Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Computer Science and Department of Intelligent Systems Engineering, Indiana University Bloomington(计算机科学系和智能系统工程系,印第安纳大学布卢明顿分校)

专题命中 具身导航 :navigation(title,abstract);world model(title,abstract);分类 cs.RO

AI总结 提出NaviWM,通过结合结构化世界模型和逻辑驱动推理链,增强大语言模型在动态人类空间中生成社交合规且物理安全的导航决策的能力。

Comments The authors have decided to withdraw this manuscript due to concerns regarding its current scope, framing, and presentation. Please do not cite this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03920 2026-07-21 cs.RO 版本更新 79%

LH-AVLN: A Benchmark for Long-Horizon Audio-Visual-Language Navigation

LH-AVLN:长距离视听语言导航基准测试

Rufeng Chen, Yue Chang, Zili Shao, Zhaofan Zhang, Li Chen, Hechang Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 介绍长距离视听语言导航基准LH-AVLN,结合多目标任务执行等。提出免训练参考智能体PAG-Nav,可维护语义地图并规划。实验表明现有智能体完成任务有困难,PAG-Nav提供更强诊断基线。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14643 2026-07-21 cs.AI 版本更新 79%

Arbor: A Framework for Reliable Navigation of Critical Conversation Flows

Arbor:一种用于关键对话流程可靠导航的框架

Luís Silva, Diogo Gonçalves, Catarina Farinha, Clara Matos, Luís Ungaro

专题命中 具身导航 :navigation(title,abstract);分类 cs.AI

AI总结 Arbor通过分解决策树导航为节点级任务,提升了医疗分诊中对话流程的准确性和效率,使小型模型能超越大模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12972 2026-07-21 cs.RO 版本更新 79%

SplatSearch: Instance Image Goal Navigation for Mobile Robots using 3D Gaussian Splatting and Diffusion Models

SplatSearch:使用3D高斯点云和扩散模型的移动机器人实例图像目标导航

Siddarth Narasimhan, Matthew Lisondra, Haitong Wang, Goldie Nejat

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 研究移动机器人的实例图像目标导航问题,提出SplatSearch架构,利用3D高斯点云重建和多视角扩散模型,结合前沿探索策略,在多种环境实验中验证其性能优于现有方法。

Comments Project Page: https://splat-search.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12115 2026-07-21 cs.RO 版本更新 57%

A Behavioral State Vocabulary in Sony ERS-111 R-CODE

索尼 ERS-111 R-CODE 中的行为状态词汇表

Christopher A. Tucker

机构 * Sony(索尼)

专题命中 具身导航 :robotic(abstract);分类 cs.RO

AI总结 研究索尼 ERS-111 AIBO 的 R-CODE 样本行为图,通过语料库级分析比较命名状态,识别反复出现的控制词汇,发现其构建例程的语法,还指出这种基于状态的抽象对构建新行为例程及在受限机器人系统中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22881 2026-07-21 cs.RO eess.SP 版本更新 57%

A Vendor-Agnostic LiDAR Data Conversion System with Multi-Signal Detection and Multi-Format Output

一种支持多信号检测和多格式输出的厂商无关LiDAR数据转换系统

Param Patel, Jay Dave, Pratyush Chakraborty

机构 * BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区) Department of Electrical and Electronics Engineering, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区电气与电子工程系) Department of Computer Science and Information Systems, BITS Pilani, Hyderabad Campus(比拉理工学院海德拉巴校区计算机科学与信息系统系)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 提出一种厂商无关的LiDAR数据转换系统,通过加权多信号方法自动识别传感器厂商,并输出五种标准格式,解决了多厂商SDK不兼容问题。

Comments Manuscript submitted at Software: Practice and Experience

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14553 2026-07-21 physics.flu-dyn physics.comp-ph 版本更新 50%

Learning to traverse convective flows at moderate to high Rayleigh numbers

在中等至高雷诺数下学习穿越对流流动

Ao Xu, Hua-Lin Wu, Ben-Rui Xu, Heng-Dong Xi

专题命中 具身导航 :navigation(abstract)

AI总结 研究了在Prandtl数Pr=0.71和单元长宽比Γ=4的Rayleigh-Bénard对流中,自驱动惯性颗粒的导航问题,通过强化学习控制器选择推进加速度,发现随着雷诺数Ra增加,成功率变化趋势由急剧转向渐进,同时推进能量需求降低,POD分析揭示了流体重组的影响。

Comments 37 pages, 21 figures

Journal ref Journal of Fluid Mechanics 2026, 1039, A18

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 具身推理 7 篇

2607.14169 2026-07-21 cs.AI cs.LG 版本更新 81%

When a Verified World Model Still Loses: Play-Adequacy vs Prediction-Accuracy in LLM-Synthesized Code World Models

当经过验证的世界模型仍然失败时:大语言模型合成代码世界模型中的游戏充分性与预测准确性

Javier Aguilar Martín

机构 * AGILabs(AGILabs实验室)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型合成的代码世界模型,发现其虽预测准确率高,但在游戏中仍失败,存在验证与正确的差距,揭示危害规律,指出更多数据无法修复,相同机制在信念推理函数上重现,表明规划世界模型充分性应基于搜索分布或游戏衡量。

Comments 41 pages, 4 figures. Code and reproduction log: https://github.com/JaviMaligno/code-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10203 2026-07-21 cs.LG cs.AI 版本更新 81%

Adaptive Compute in Latent World Models: When Depth Helps, Hurts, or Doesn't Matter

深度在组合中何时得以保留?潜在世界模型中的计算-质量机制

Achyuthan Sivasankar

机构 * New York University(纽约大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨潜在世界模型中深度在组合时的情况,用浅度惩罚ρ测试九个深度思维控制任务,发现三种机制,揭示反转机制由训练产生,其与观察/动作维度等相关,还指出任务机制受多种因素影响及相关注意事项。

Comments 15 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07996 2026-07-21 cs.CV cs.RO 版本更新 81%

3D and 4D World Modeling: A Survey

3D和4D世界建模:一项综述

Lingdong Kong, Yu Yang, Jianbiao Mei, Youquan Liu, Ao Liang, Dekai Zhu, Dongyue Lu, Wei Yin, Xiaotao Hu, Mingkai Jia, Junyuan Deng, Kaiwen Zhang, Yang Wu, Tianyi Yan, Shenyuan Gao, Song Wang, Linfeng Li, Liang Pan, Yong Liu, Jianke Zhu, Wei Tsang Ooi, Steven C. H. Hoi, Ziwei Liu

机构 * WorldBench Team(WorldBench团队)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV

AI总结 该综述针对世界建模中对3D和4D表示利用不足及定义分类缺失的问题,通过建立精确概念、引入结构化分类法,系统总结相关数据集和评估指标,讨论应用、挑战与方向,为3D和4D世界建模领域提供基础参考。

Comments Survey; Project Page at https://worldbench.github.io/survey GitHub Repo at https://github.com/worldbench/awesome-3d-4d-world-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05558 2026-07-21 cs.LG 版本更新 79%

Autoregressive Diffusion World Models for Off-Policy Evaluation of LLM Agents

自回归扩散世界模型用于LLM智能体的离线评估

Kaixuan Liu, Guojun Xiong, Weinan Zhang, Shengpu Tang

机构 * Department of Computer Science, Emory University(埃默里大学计算机科学系) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.LG

AI总结 提出ADWM框架,通过自回归扩散世界模型从预收集轨迹中模拟环境响应,实现无需在线交互的LLM智能体策略离线评估。

详情

展开后加载摘要…

URL PDF HTML 收藏