arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-17 至 2026-08-17 共收录 53 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人操作 15 篇

2608.14049 2026-08-17 cs.RO 新提交 88%

FlatLab: A Unified Methodology Framework and Simulation-Based Benchmark for Robotic Manipulation of Flat Objects

FlatLab:面向扁平物体机器人操作的统一方法论框架及基于仿真的基准测试

Xingyu Zhu, Wenshuo Han, Zhouyu Wang, Yuran Wang, Ruihai Wu, Hao Dong, Fan Tang, Hechang Chen, Hyung Jin Chang, Yixing Gao

机构 * Jilin University(吉林大学) Peking University(北京大学) Chinese Academy of Sciences(中国科学院) University of Birmingham(伯明翰大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(title,abstract);分类 cs.RO

AI总结 该研究针对扁平物体机器人操作泛化能力有限的问题,提出含策略生成器与执行模块的统一框架,并构建FlatLab仿真基准,方法泛化效果优于现有基线。

Comments This paper is accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00033 2026-08-17 cs.RO cs.AI cs.CV 版本更新 85%

Learning Dexterous Manipulation Using Contact Wrench Guidance From Human Demonstration

利用人类演示的接触力引导学习灵巧操作

Xinghao Zhu, Zixi Liu, Shalin Jain, Chenran Li, Milad Noori, Michael Andres Lin, Huihua Zhao, John Welsh, Mrinal Verghese, Wei Liu, Tingwu Wang, Xingye Da, Zhengyi Luo, Vishal Kulkarni, Naema Bhatti, Yuke Zhu, Linxi Fan, Bowen Wen, Danfei Xu, Soha Pouya, Yan Chang

机构 * NVIDIA(英伟达)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI、cs.CV

AI总结 提出CHORD框架,通过物体中心的接触力空间引导,利用人类演示的力和力矩信息增强强化学习,在包含4739个双臂灵巧操作任务的大规模基准上平均成功率82.12%,并泛化到全身操作和真实世界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14379 2026-08-17 cs.RO cs.AI 新提交 84%

Reflex: Enabling Fast and Predictive Vision-Language-Action Models for Reaction-Critical Manipulation

Reflex:面向反应关键型操作的快速且可预测的视觉-语言-动作模型

Yuxuan Chen, Wanruo Zhang, Xiao Li

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 机器人操作 :manipulation(title,abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 针对现有VLA模型忽略动态交互场景的问题,提出面向反应关键型操作的ReflexBench基准与无需大规模机器人数据预训练的ReflexVLA模型,其可提升动态操作性能并保持静态操作精度。

Comments 8 pages, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13904 2026-08-17 cs.RO 新提交 83%

Communication in modular robotic motor control: Bilateral controllers under realistic constraints

模块化机器人电机控制中的通信:现实约束下的双边控制器

Jingwen Li, Levin Kuhlmann, Jason Friedman, Gideon Kowadlo

机构 * Monash University(莫纳什大学) Tel Aviv University(特拉维夫大学) Cerenaut(瑟雷诺特公司)

专题命中 机器人操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO

AI总结 该研究提出受大脑双侧结构启发的模块化GRU双边控制器,在双臂肌肉骨骼仿真任务中,其性能优于整体架构及无通信的模块化控制器,证明模块间通信可优化机器人运动的精度、成本与稳定性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14061 2026-08-17 cs.RO 版本更新 81%

MorphIt: Flexible Spherical Approximation of Robot Morphology for Representation-driven Adaptation

MorphIt:面向表征驱动适应的机器人形态的灵活球形近似

Nataliya Nechyporenko, Yutong Zhang, Sean Campbell, Alessandro Roncone

机构 * Human Interaction and RObotics [HIRO] Group(人机交互与机器人[HIRO]组) Department of Computer Science(计算机科学系) College of Engineering and Applied Science(工程与应用科学学院) University of Colorado Boulder(科罗拉多大学波尔得分校)

专题命中 机器人操作 :robotics(abstract);manipulation(abstract);navigation(abstract);robotic(abstract)

AI总结 MorphIt是一种新型球形近似框架,可将机器人形态表征作为可调资源,通过梯度优化实现任务驱动型形态适应,速度比同类方法快达100倍,能提升机器人碰撞检测等能力,为机器人操作开辟新前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14028 2026-08-17 cs.RO cs.AI 新提交 81%

AdvDex: Learning Dexterous Manipulation from Human Demonstrations via Joint-Aligned Actions and Adversarial Learning

AdvDex:通过关节对齐动作与对抗学习从人类演示中学习灵巧操作

Zhiyue Zhao, Jingyi Wu, Hairuo Liu, Mingyu Liu, Liyang Li, Hengdi Zhang, Tong He, Zhengxue Cheng

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Paxini Tech(帕西尼科技)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO、cs.AI

AI总结 AdvDex是一种统一视觉-语言-动作框架,通过OmniShare数据集、JAAS动作空间与领域对抗学习,实现从人类和机器人演示中学习灵巧操作,提升跨实体泛化与技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14244 2026-08-17 cs.RO eess.SY 新提交 79%

Vibration Suppression in Collaborative Flexible Payload Manipulation Using Passive Force Control

基于被动力控制的协作式柔性负载操作中的振动抑制

Alaa Abderrahim, Antonio Rosales, Ferdinando Milella, Markku Suomalainen, Shuai Li

机构 * VTT Technical Research Centre of Finland Ltd(芬兰VTT技术研究中心) RP Technical University of Kaiserslautern(凯泽斯劳滕RP工业大学) UK Atomic Energy Authority(英国原子能管理局) University of Oulu(奥卢大学)

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 本文针对大型重型结构操作中的振动问题,提出基于主从异构工业机械臂协作的被动力控制策略,通过导纳控制器与等效质量-弹簧-阻尼模型实现振动抑制,经模拟与实验验证了方法的有效性。

Comments Published in the proceedings of the 2026 European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10780 2026-08-17 cs.RO 版本更新 79%

StageWAM: Joint-Embedding Stage Prediction for World-Action Models in Robot Manipulation

JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测

Xiao Liu, Yuguang Yang, Xi Wang, Kai Jiang, Cheng Chi, Yong Xu, Wenchao Ding, Yilun Chen, Yan Wang

专题命中 机器人操作 :manipulation(title,abstract);分类 cs.RO

AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14462 2026-08-17 cs.RO 新提交 70%

THRIVE: Therapeutic Humanoid Robot In Virtual Environment

THRIVE:虚拟环境中的治疗性人形机器人

Jin Xu, Yu-Ping Chen, Ayanna Howard

专题命中 机器人操作 :manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 本文提出了家用康复平台THRIVE,集成VR上肢康复游戏、摄像头运动追踪与机器人治疗师,采用模块化设计,为上肢运动障碍儿童提供持续且具吸引力的上肢治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09035 2026-08-17 cs.SD cs.AI cs.MM 版本更新 57%

MusicLayout: Explicit Structural Planning for Controllable Text-to-Music Generation

MusicLayout:用于可控文本生成音乐的显式结构规划

Shuyu Li, Kejun Zhang, Jiahe Lei, Shulei Ji, Zihao Wang, Jiaxing Yu, Wanying Wu, Lei Wang

机构 * College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Innovation Center of Yangtze River Delta, Zhejiang University(浙江大学长三角创新中心) The Chinese University of Hong Kong(香港中文大学) Shandong University(山东大学) Chu Kochen Honors College, Zhejiang University(浙江大学竺可桢学院) Ant Group(蚂蚁集团)

专题命中 机器人操作 :manipulation(abstract);分类 cs.AI

AI总结 针对文本生成音乐结构隐含难控的问题,提出MusicLayout显式中间表示,将其集成到统一自回归框架实现布局级控制,实验证实该方法可改进音乐长程结构组织并支持布局级控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02169 2026-08-17 cs.LG 版本更新 57%

Responsiveness Verification: Will Predictions Change? How Much? How Often?

响应性验证:预测会改变吗?改变多少?改变频率如何?

Harry Cheon, Meredith Stewart, Bogdan Kulynych, Tsui-Wei Weng, Berk Ustun

专题命中 机器人操作 :manipulation(abstract);分类 cs.LG

AI总结 本研究提出测量响应性的算法与交互模型框架,搭配统计保证,可用于检测累犯预测的排除情况、估计内容审核博弈成本、测试LLM基准鲁棒性,提升模型安全性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13765 2026-08-17 eess.SP 新提交 50%

Energy Efficient Multi-User Beamforming and 3D Position Optimization for SIM-Assisted UAVs

面向智能超表面(SIM)辅助无人机的节能多用户波束成形与三维位置优化

Chandan Kumar Sheemar, Giovanni Iacovelli, Sourabh Solanki, Wali Ullah Khan, George C. Alexandropoulos, Symeon Chatzinotas

专题命中 机器人操作 :manipulation(abstract)

AI总结 针对配备堆叠智能超表面的节能无人机多用户通信,提出联合优化数字预编码、SIM相移与无人机三维位置的算法,大幅提升能效并揭示关键设计权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13984 2026-08-17 physics.optics 新提交 50%

Multi-quantum-channel mediated tunable single-photon skyrmions from metasurfaces

超构表面介导的多量子通道可调谐单光子斯格明子

Yan Wang, Zhenyu Guo, Minggui Liang, Shuangchun Wen, Yijie Shen, Hailu Luo

专题命中 机器人操作 :manipulation(abstract)

AI总结 该研究利用超构表面实现偏振纠缠光子对的多通道量子态分布,通过多通道量子测量介导生成可调谐单光子斯格明子,为抗噪高维量子信息处理提供了可行路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13761 2026-08-17 cond-mat.soft 新提交 50%

From suspensions to porous multilayers: microstructure formation and particle packing in drying colloidal films

从悬浮液到多孔多层膜:胶体薄膜干燥过程中的微结构形成与颗粒堆积

Qingguang Xie, Jens Harting

专题命中 机器人操作 :manipulation(abstract)

AI总结 本研究通过数值模拟结合理论模型,揭示胶体薄膜干燥时颗粒间相互作用决定最终多孔结构,为定制功能层提供指导。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00030 2026-08-17 physics.gen-ph 版本更新 50%

Building an analogue simulator of a photonic quantum computer with transparent tape, maple syrup, and cat lasers, and implementing first quantum algorithms in the classroom

用透明胶带、枫糖浆和猫激光器构建光量子计算机的模拟器,并在课堂上实现首个量子算法

Ghislain Lefebvre

专题命中 机器人操作 :manipulation(abstract)

AI总结 本文利用透明胶带、枫糖浆和猫激光器构建光量子计算机模拟器,实现单量子比特门和双量子比特门,并在课堂上演示首个量子算法,成本低且易于操作。

Comments 29 pages, 43 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 具身导航 11 篇

2608.13923 2026-08-17 cs.CV cs.RO 新提交 81%

OpenBelief-Nav: Evidence-Preserving Object Memory for Open-Vocabulary Language-Guided Navigation

OpenBelief-Nav:面向开放词汇语言引导导航的证据保留型对象记忆

Dinh Tuan Nguyen, Anh Dao, Phuong Nam Dang, Quan-Dung Pham, Tuyen P. Le, Truong Nguyen, Quan Nguyen

机构 * VinMotion, Inc.(VinMotion公司) University of Southern California(南加利福尼亚大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对开放词汇语言引导导航的对象记忆缺陷,提出OpenBelief-Nav模型,保留多源证据并支持灵活读出,在多数据集导航任务中优于基线方法,修正策略可提升目标确认成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14466 2026-08-17 cs.RO cs.IT cs.LG 新提交 81%

Expected Free Energy-based Informative Path Planning for Robotic Mars Exploration

基于期望自由能的火星探测机器人信息路径规划

Ajith Anil Meera, Pablo Lanillos, Wouter Kouw

机构 * TU Eindhoven(埃因霍温理工大学) Cajal Centre for Neuroscience, Spanish National Research Council(西班牙国家研究委员会卡哈尔神经科学中心)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 该研究提出将主动推理的期望自由能作为统一准则,用于预算约束下的机器人信息路径规划,其规划方法在火星探测场景中可同时实现精准地图构建与高价值区域定位,性能优于信息论基准方法。

Comments accepted for IWAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16509 2026-08-17 cs.RO cs.LG 版本更新 81%

Learning-Guided Sparsification of Dynamic Graphs in Robotic Exploration

基于学习的动态图稀疏化在机器人探索算法中的应用

Adithya V. Sastry, Bibek Poudel, Weizi Li

机构 * Independent Researcher(独立研究者) University of Tennessee, Knoxville(田纳西大学,基洛尼尔) University of California, Riverside(加州大学河滨分校)

专题命中 具身导航 :robotic(title,abstract);分类 cs.RO、cs.LG

AI总结 本文提出基于Transformer的框架,利用PPO算法在机器人探索中稀疏化动态图,减少冗余信息,提升性能,实验表明该方法能有效降低图规模并提高探索一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13723 2026-08-17 cs.RO 新提交 80%

Graph-MambaNav: Spatial-Temporal Graph Mamba Leveraging Object-Relation Knowledge for Object-Goal Navigation

Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航

Leyuan Sun, Genxin Chen, Linwei Ye, Yan Zhang, Xi Kan, Yanfei Sun

机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO;robotics(comments)

AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。

Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14531 2026-08-17 cs.RO eess.SY 新提交 79%

Spatiotemporal Tube-Based Safety-Certificate for Autonomous Navigation of Articulated Vehicles

铰接式车辆自主导航的基于时空管的安全证书

Mohd. Faizuddin Faruqui, Ratnangshu Das, Ravi Kumar L, Pushpak Jagtap

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 针对铰接式车辆自主导航的狭窄路线机动挑战,提出基于时空管的规划方法,确保挂车处于道路走廊内,经仿真验证可提供路线安全证书。

Comments Accepted for presentation at the 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14160 2026-08-17 cs.RO 新提交 79%

OccPlanner: Goal-Aware Occupancy-Conditioned Diffusion Planner for Pixel-Goal Navigation

OccPlanner:面向像素目标导航的目标感知占用条件扩散规划器

Binling Huang, Nianjin Ye, Xi Yang, Liang Hu, Zhou Huang, Shuang Wei, Longrui Yang, Yanchi Chen, Lanpeng Jia

机构 * Changhong Intelligent Robot(长虹智能机器人) University of Electronic Science and Technology of China(电子科技大学)

专题命中 具身导航 :navigation(title,abstract);分类 cs.RO

AI总结 该研究针对像素目标导航的3D目标定位与无碰撞规划难题,提出OccPlanner模型,引入L3ROcc生成监督,在仿真中大幅提升导航成功率,还验证了其仿真到真实的迁移适配性。

Comments Technical report. 11 pages, 6 figures, and 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13611 2026-08-17 cs.IT 新提交 78%

SN-ASMO: Satellite-Navigation Array Spatial-Manifold Precise Observation Theory A Mathematical Foundation for Observation Formation, Unified U(1) Geometry, Intrinsic Information, and Preservation of the RTK Integer Structure

SN-ASMO:卫星导航阵列空间流形精确观测理论——观测形成、统一U(1)几何、本征信息及RTK整数结构保留的数学基础

Xianwei Meng

专题命中 具身导航 :navigation(title,abstract)

AI总结 SN-ASMO理论针对卫星导航的根本问题,构建了统一观测形成等多要素且可物理验证的数学框架,解决了抗干扰、高动态场景下RTK整数结构保留等关键问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13589 2026-08-17 cs.HC cs.AI 新提交 70%

Context Aware AI Assistant and AR Interface for Lunar Extravehicular Activity (EVA) Procedural Guidance

面向月球舱外活动(EVA)程序指导的上下文感知AI助手与AR界面

Rodrigo Gallardo, Qilmeg Doudatcz, Ganit Goldstein, Ilkyaz Sarimehmetoglu, Sergio Mutis, Alexander Htet Kyaw, Anita Lin, Clara Emmerling, Berfin Ataman, Skylar Tibbits

专题命中 具身导航 :navigation(abstract,abstract_cn);分类 cs.AI

AI总结 针对月球EVA中宇航员注意力分散导致的信息适配难题,提出GAIN-AI系统,通过两层架构结合大语言模型与AR界面,在111个合成EVA场景中取得良好表现。

Comments 4 pages, 4 figures, 1 table. Accepted to ACM SIGGRAPH 2026 Conference Posters, July 19-23, 2026, Los Angeles, California, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 62%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: this https URL (https://junwoonlee.github.io/projects/LatentAM/) Code: this https URL (https://github.com/UMich-SSI-Lab/latentam)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13921 2026-08-17 cs.AI 新提交 57%

When Personal Memory Has No Single Answer: Evaluating LLM Agents under Irreducible Conflict

当个人记忆没有唯一答案时:评估大语言模型智能体在不可约冲突下的表现

Lu Yang, Shusheng Xu, Zhuoran Li, Tongkai Yang, Longbo Huang

机构 * Ant Group(蚂蚁集团)

专题命中 具身导航 :navigation(abstract_cn);分类 cs.AI

AI总结 该研究针对大语言模型智能体的记忆冲突问题,提出了基准TANGLE并评估其表现,发现现有方法存在缺陷,进而提出冲突感知行动策略CAAP。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12122 2026-08-17 cs.RO 版本更新 57%

OctoSplat: Hybrid OctoMap-Gaussian Splatting for Active Semantic Mapping and Phenotyping with Horticultural Robots

利用高斯点云进行园艺环境的主动语义映射

Jose Cuaran, Naveen K. Uppalapati, Girish Chowdhary

机构 * the Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) the Department of Agricultural and Biological Engineering(农业与生物工程系) National Center for Supercomputing Applications at University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校国家超级计算中心)

专题命中 具身导航 :robotics(abstract);分类 cs.RO

AI总结 本文提出利用移动机械臂和高斯点云进行园艺环境主动3D重建,提升重建精度与效率,实现水果计数和体积估算。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 具身推理 8 篇

2608.13678 2026-08-17 cs.RO cs.LG 新提交 86%

hint$^2$: Hierarchical World Models for Inference-Time Temporal Logic Guidance

hint$^2$:用于推理时态逻辑引导的分层世界模型

Moritz Zoellner, Anastasios Manganaris, Ahmed H. Qureshi, Rohan Paleja

机构 * Purdue University(普渡大学)

专题命中 具身推理 :world model(title,abstract);robot learning(abstract);manipulation(abstract);分类 cs.RO、cs.LG

AI总结 本文提出hint$^2$,一种用分层世界模型引导策略满足LTL规范的方法,在CALVIN基准及真实UR5e机械臂实验中,其性能优于现有推理引导方法。

Comments Videos available on our project page: this https URL (https://anonymous-hint2.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28455 2026-08-17 cs.RO cs.AI cs.LG 版本更新 82%

Event-Conditioned Diagnostics of Kinematic, Contact, and Object-Permanence Fields in Passive Object-State World Models

被动对象状态世界模型中运动学、接触和物体恒存场的事件条件诊断

Yang Liu, Yuming Chen

机构 * College of Intelligent Robitcs and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院)

专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出一种诊断协议,测试被动对象状态世界模型中的隐式物理场是否按事件类型组织,并验证场对齐表示对预测的功能影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14022 2026-08-17 cs.CV cs.AI 新提交 81%

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM:面向少步骤动作条件视频世界模型的渐进式因果训练

Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

机构 * CUHK(香港中文大学) Tencent PCG(腾讯平台与内容事业群) FDU(复旦大学) Shanghai AI Laboratory(上海人工智能实验室) HKUST(香港科技大学)

专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV

AI总结 ForgeWM 是一种渐进式框架,通过多阶段技术将双向动作条件视频生成器转化为少步骤世界模型,在 Minecraft 和 FPS 游戏任务中实现了更优的可控少步骤视频生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13552 2026-08-17 cs.CV 版本更新 79%

PlayWorld: Benchmarking World Models with Agent Players over Long-Horizon Objectives

PlayWorld:基于智能体玩家的长程目标世界模型基准测试

Kaixin Ding, Xi Chen, Minghong Cai, Zhiyuan Xu, Yiyang Wang, Yuxiang Lu, Junyi Li, Shuyang Chen, Yuan Gao, Xin Tao, Pengfei Wan, Hengshuang Zhao

机构 * The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Kuaishou Technology(快手科技)

专题命中 具身推理 :world model(title,abstract);分类 cs.CV

AI总结 该研究针对现有世界模型跨模型公平比较的难题,推出含171个场景的PlayWorld基准,通过多模态智能体玩家从多维度评估9种先进世界模型,发现其长程交互式目标表现仍不可靠。

Comments project page: this https URL (https://kxding.github.io/project/PlayWorld/)

详情

展开后加载摘要…

URL PDF HTML 收藏