arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 238 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 238 篇

2505.15304 2025-06-02 cs.RO 70%

Saliency-Aware Quantized Imitation Learning for Efficient Robotic Control

Seongmin Park, Hyungmin Kim, Sangwoo Kim, Wonseok Jeon, Juyoung Yang, Byeongwook Jeon, Yoonseon Oh, Jungwook Choi

机构 * Hanyang University(翰阳大学) Hyundai Motor Company(现代汽车公司)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

Comments arXiv admin note: text overlap with arXiv:2412.01034

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15068 2025-02-06 cs.RO 70%

An Atomic Skill Library Construction Method for Data-Efficient Embodied Manipulation

Dongjiang Li, Bo Peng, Chang Li, Ning Qiao, Qi Zheng, Lei Sun, Yusen Qin, Bangguo Li, Yifeng Luan, Bo Wu, Yibing Zhan, Mingang Sun, Tong Xu, Lusong Li, Hui Shen, Xiaodong He

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06154 2026-08-07 cs.RO cs.AI cs.CV 新提交 67%

Visual Grounding in Zero-Shot Vision-Language Control

零样本视觉语言控制中的视觉 grounding

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文针对零样本视觉语言控制中VLMs决策是否基于视觉输入的问题,通过多组消融实验分析了多种VLMs的表现,提出对称共识守护者方法,验证了VLMs可作为有界的危险助手。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02578 2026-08-04 cs.RO cs.AI cs.LG 新提交 67%

CoWAM: Coordination Contracts for Selective Policy Intervention with WAMs

CoWAM:结合世界动作模型(WAMs)的选择性策略干预协调合约

Shuaijun Liu, Qifu Wen, Shuyang Hao, Qi Luo, Chenglong Zhang, Feiyang You, Chengyu Wu, Ningxin Su

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 该研究针对双机械臂机器人策略协调问题,提出结合世界动作模型(WAMs)的CoWAM协调合约选择性干预层,经8项模拟任务验证,其协调选择与闭环成功率均显著提升且有害干预极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25895 2026-07-29 cs.RO cs.CV cs.LG 新提交 67%

HiFi-UMI: Learning Deployable Manipulation Policies from High-Fidelity UMI Data Alone

HiFi-UMI:仅从高保真UMI数据中学习可部署的操作策略

Simple AI, :, Yuteng Wei, Jinming Ma, Jiawei Wang, Weitao Zhou, Yushen Zuo, Ke Rui, Minglei Li, Jinhao Zhang, Zhikang Pan, Xiang Wang, Haoran Jia, Huan Du, Zicheng Zeng, Jun Ma, Guiyu Qin, Di Zhang, Xiaofei Li

机构 * Simple AI(简单人工智能公司)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 研究如何从高保真UMI数据学习可部署操作策略,提出HiFi-UMI系统,其无需外部跟踪达3毫米精度。利用该系统数据实现零机器人训练后策略,预训练还能降误差提成功率,且开源了相关高保真资源。

Comments 33 pages, 15 figures, 4 tables. Project page: https://cloud.simpleai.tech/simple-world-lab/hifi-umi/ Dataset: https://huggingface.co/datasets/simple-world-lab/HiFi-UMI-2K

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21139 2026-06-23 cs.RO cs.AI cs.LG 新提交 67%

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

PoLAR:分解潜在动作中的程度和模式用于机器人策略学习

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。

Comments Project Page: https://joon-stack.github.io/PoLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07464 2026-06-08 cs.RO cs.AI cs.CV 新提交 67%

Planning-aligned Token Compression for Long-Context Autonomous Driving

面向长上下文自动驾驶的规划对齐令牌压缩

Zhixuan Liang, Yuxiao Chen, Yurong You, Peter Karkus, Wenhao Ding, Boyi Li, Alexander Popov, Yan Wang, Maximilian Igl, Yiming Li, Danfei Xu, Nikolai Smolyanskiy, Boris Ivanovic, Ping Luo, Marco Pavone

机构 * NVIDIA Research(NVIDIA研究) School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出COMPACT-VA框架,基于条件VQ-VAE将长上下文压缩为有界表示,通过规划对齐实现决策关键信息保留,在动态场景中成功率提升超6%,速度提升3.3倍。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03943 2026-06-04 cs.RO cs.CV cs.LG 67%

PointAction: 3D Points as Universal Action Representations for Robot Control

PointAction: 3D点作为机器人控制的通用动作表示

Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出PointAction框架,通过微调视频生成模型联合预测未来RGB帧和动态3D点图,将点动力学作为与具体本体无关的动作接口,再由扩散动作解码器映射为可执行动作,以减少RGB动作歧义并跨任务/本体迁移。

Comments Project page: https://oriontmt.github.io/pointaction/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06192 2026-05-08 cs.CV cs.AI cs.RO 67%

EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields

EA-WM:事件感知生成世界模型与结构运动-视觉动作场

Zhaoyang Yang, Yurun Jin, Lizhe Qi, Cong Huang, Kai Chen

机构 * Fudan University(复旦大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院) University of Science and Technology of China(中国科学技术大学) DeepCybo(深瞳)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 EA-WM通过结构化运动-视觉动作场闭环连接运动控制与视觉感知,提升机器人空间几何和细粒度交互动态的生成精度。

Comments Preprint. 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13644 2026-03-18 cs.RO cs.AI cs.CV 67%

World Models for Learning Dexterous Hand-Object Interactions from Human Videos

为从人类视频学习灵巧手-物体交互构建世界模型

Raktim Gautam Goswami, Amir Bar, David Fan, Tsung-Yen Yang, Gaoyue Zhou, Prashanth Krishnamurthy, Michael Rabbat, Farshad Khorrami, Yann LeCun

机构 * FAIR at Meta(Meta 的 FAIR 部门) New York University(纽约大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出DexWM模型,通过手部关键点提取实现对精细手部动作的建模,提升未来状态预测和零样本迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07648 2026-03-10 cs.RO cs.AI cs.CV 67%

AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

AtomicVLA:解锁机器人中原子技能学习的潜力

Likui Zhang, Tao Tang, Zhihao Zhan, Xiuwei Chen, Zisheng Chen, Jianhua Han, Jiangtong Zhu, Pei Xu, Hang Xu, Hefeng Wu, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Yinwang Intelligent Technology Co. Ltd.(云网智能技术有限公司)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 AtomicVLA通过原子技能抽象和动态专家组合提升机器人长周期任务的性能

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18733 2026-01-27 cs.RO cs.AI cs.CV 67%

Advances and Innovations in the Multi-Agent Robotic System (MARS) Challenge

多智能体机器人系统(MARS)挑战的进展与创新

Li Kang, Heng Zhou, Xiufeng Song, Rui Li, Bruno N. Y. Chen, Ziye Wang, Ximeng Meng, Stone Tao, Yiran Qin, Xiaohong Liu, Ruimao Zhang, Lei Bai, Yilun Du, Hao Su, Philip Torr, Zhenfei Yin, Ruihao Gong, Yejun Zeng, Fengjun Zhong, Shenghao Jin, Jinyang Guo, Xianglong Liu, Xiaojun Jia, Tianqi Shan, Wenqi Ren, Simeng Qin, Jialing Yang, Xiaoyu Ma, Tianxing Chen, Zixuan Li, Zijian Cai, Yan Qin, Yusen Qin, Qiangyu Chen, Kaixuan Wang, Zhaoming Han, Yao Mu, Ping Luo, Yuanqi Yao, Haoming Song, Jan-Nico Zaech, Fabien Despinoy, Danda Pani Paudel, Luc Van Gool

机构 * SJTU(上海交通大学) Oxford(牛津大学) USTC(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) CMU(卡内基梅隆大学) HKU(香港大学) Tongji(同济大学) UC San Diego(南加州大学) CUHK-SZ(香港中文大学(深圳)) SYSU(华南理工大学) Harvard(哈佛大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 MARS挑战通过多智能体具身规划与控制任务,推动多智能体协作AI系统的发展。

Comments MARS Challenge @ NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI. Challenge page: https://mars-eai.github.io/MARS-Challenge-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01924 2025-12-02 cs.RO cs.AI cs.LG 67%

Real-World Robot Control by Deep Active Inference With a Temporally Hierarchical World Model

通过时序分层世界模型的深度主动推断实现现实世界的机器人控制

Kentaro Fujii, Shingo Murata

机构 * Graduate School of Integrated Design Engineering, Keio University(Keio大学整合设计工程研究院)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种结合时序分层世界模型的深度主动推断框架,用于在不确定环境中实现机器人高成功率的操作与探索性动作切换。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10203 2025-11-14 cs.CV cs.AI cs.RO 67%

VISTA: A Vision and Intent-Aware Social Attention Framework for Multi-Agent Trajectory Prediction

Stephane Da Silva Martins, Emanuel Aldea, Sylvie Le Hégarat-Mascle

机构 * SATIE - CNRS UMR 8029 Paris-Saclay University, France(巴黎-萨克雷大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Paper accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20841 2025-09-26 cs.RO cs.AI cs.LG 67%

ImaginationPolicy: Towards Generalizable, Precise and Reliable End-to-End Policy for Robotic Manipulation

Dekun Lu, Wei Gao, Kui Jia

机构 * Dekun Lu ∗ , Wei Gao ∗ and Kui Jia ∗(作者)

专题命中 动作表示与策略 :VLA(abstract);分类 cs.RO、cs.AI、cs.LG

Comments First two authors contribute equally. Project page: https://sites.google.com/view/imaginationpolicy

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02792 2025-05-26 cs.RO cs.AI cs.LG 67%

Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets

Chuning Zhu, Raymond Yu, Siyuan Feng, Benjamin Burchfiel, Paarth Shah, Abhishek Gupta

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11682 2024-12-17 cs.RO cs.AI cs.LG 67%

NEST: A Neuromodulated Small-world Hypergraph Trajectory Prediction Model for Autonomous Driving

Chengyue Wang, Haicheng Liao, Bonan Wang, Yanchen Guan, Bin Rao, Ziyuan Pu, Zhiyong Cui, Chengzhong Xu, Zhenning Li

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Accepted by AAAI-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.07729 2024-08-27 cs.CV cs.AI cs.RO 67%

SSL-Interactions: Pretext Tasks for Interactive Trajectory Prediction

Prarthana Bhattacharyya, Chengjie Huang, Krzysztof Czarnecki

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Accepted at IV-2024. 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15019 2024-08-19 cs.RO cs.AI cs.LG 67%

Agentic Skill Discovery

Xufeng Zhao, Cornelius Weber, Stefan Wermter

专题命中 动作表示与策略 :language-conditioned robot(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Webpage see https://agentic-skill-discovery.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08065 2024-07-12 cs.RO cs.AI cs.LG 67%

Towards Interpretable Foundation Models of Robot Behavior: A Task Specific Policy Generation Approach

Isaac Sheidlower, Reuben Aronson, Elaine Schaertl Short

专题命中 动作表示与策略 :robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Short Paper accepted to RLC 2024 Workshop on Training Agents with Foundation Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01811 2023-12-05 cs.LG cs.AI cs.GT cs.MA cs.RO 67%

Energy-based Potential Games for Joint Motion Forecasting and Control

Christopher Diehl, Tobias Klosek, Martin Krüger, Nils Murzyn, Timo Osterburg, Torsten Bertram

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments Conference on Robot Learning, CoRL 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2002.06241 2020-02-19 cs.CV cs.LG cs.MA cs.RO 67%

Social-WaGDAT: Interaction-aware Trajectory Prediction via Wasserstein Graph Double-Attention Network

Jiachen Li, Hengbo Ma, Zhihao Zhang, Masayoshi Tomizuka

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07895 2026-08-11 cs.RO cs.LG 新提交 62%

Auditing Instruction-Trajectory Mismatches in Multimodal Robot Demonstrations

多模态机器人演示中指令-轨迹不匹配的审计

Simon Holk, Ryosuke Takanami, Tatsuya Matsushima, Yusuke Iwasawa, Yutaka Matsuo, Yueh-Hua Wu, Kei Ota

机构 * AI Robot Association (AIRoA)(人工智能机器人协会(AIRoA)) The University of Tokyo(东京大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对多模态机器人演示中指令-轨迹不匹配问题,提出无需训练的MMPF审计框架,在LIBERO基准及真实机器人数据上实现最优ITM检测与标签修正,可提升下游策略学习性能并展示过滤演示的权衡。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01397 2026-08-04 cs.RO cs.CV 新提交 62%

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

SG-WAM:几何感知策略空间中的自引导世界建模

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00625 2026-08-04 cs.RO cs.AI 新提交 62%

Learning-Based Motion Planning for Dynamic Environments: From Foundational Algorithms to Emerging Paradigms

动态环境下基于学习的运动规划:从基础算法到新兴范式

Zongyuan Shen, Shalabh Gupta, Shancheng Zhao, Dehua Zhou, Gao Wang, Rui Cheng, Yaming Ou, Zhongqiang Ren, Yikui Zhai, C. L. Philip Chen

机构 * College of Information Science and Technology, Jinan University(暨南大学信息科学技术学院) University of Connecticut(康涅狄格大学) Guangzhou Maritime University(广州海事大学) University of Chinese Academy of Sciences(中国科学院大学) Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Wuyi University(五邑大学) South China University of Technology(华南理工大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本综述回顾2015至2025年动态环境下基于学习的运动规划代表性研究,提出学习作用分类法,分析相关影响因素,探讨安全可验证规划等开放挑战与未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19919 2026-07-23 cs.RO cs.LG 新提交 62%

Diffusion ReRoll: Revisable Denoising for Robotic Sequential Prediction

扩散重滚动:用于机器人序列预测的可修正去噪

Seonsoo Kim, Seongil Hong, Jun-Gill Kang

机构 * Agency for Defense Development(国防发展局)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.LG

AI总结 研究提出扩散重滚动框架用于机器人序列预测,能选择性重新去噪局部稳定区域,实现跨视野迭代修正。通过与其他方法对比评估,在多任务基准测试中取得更好性能,支持结构化重新去噪是可修正机器人序列生成的有效机制。

Comments Project Page: https://seonsoo-p1.github.io/DiffusionReRoll/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08639 2026-07-17 cs.RO cs.CV 版本更新 62%

Native Video-Action Pretraining for Generalizable Robot Control

用于可泛化机器人控制的原生视频动作预训练

Qihang Zhang, Lin Li, Luyao Zhang, Shuai Yang, Yiming Luo, Shuaiting Li, Ruilin Wang, Junke Wang, Jiahao Shao, Gangwei Xu, Jiaming Zhou, Yishu Shen, Yudong Jin, Fangyi Xu, Shuailei Ma, Jiaqi Liao, Guanxing Lu, Zifan Shi, Yongkun Wen, Yujie Zhao, Weixuan Tang, Xinyang Wang, Chaojian Li, Jiapeng Zhu, Ka Leong Cheng, Nan Xue, Xing Zhu, Yujun Shen, Yinghao Xu

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.CV

AI总结 研究针对机器人控制中视频动作模型应用于物理环境的不足,提出LingBot-VA 2.0,通过语义视觉动作分词器等四个核心设计原则构建基础模型,经真实世界部署验证其在复杂操作任务中的少样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09741 2026-07-14 cs.RO cs.AI cs.MA 新提交 62%

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving

SWIFT:用于自动驾驶中流量感知轨迹预测的小世界交互框架

Chengyue Wang, Bin Rao, Haicheng Liao, Bonan Wang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Civil and Environmental Engineering, University of Macau(澳门大学土木与环境工程系)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 研究自动驾驶中轨迹预测问题,提出SWIFT框架,结合小世界网络与交通流理论,通过特定网络和模块引入结构偏差与增强推理,实验证明其在多方面优于基线,展现出结构感知设计的有效性。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16943 2026-07-09 cs.RO cs.AI 版本更新 62%

LHM-Humanoid: Long-Horizon Human Motion Control for Continuous Object Transport in Cluttered Scenes

LHM-Humanoid:学习一种统一的政策以在多样化的混乱环境中实现长视距人形全身体术操作

Haozhuo Zhang, Jingkai Sun, Michele Caprio, Angelo Cangelosi, Jian Tang, Shanghang Zhang, Qiang Zhang, Wei Pan

机构 * The University of Manchester(曼彻斯特大学) X-Humanoid Peking University(北京大学) University of Hong Kong(香港大学)

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO、cs.AI

AI总结 LHM-Humanoid通过统一政策实现人形在复杂环境中长视距全身体术操作,结合强化学习与知识蒸馏,提升跨场景泛化与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28804 2026-06-30 cs.CV cs.RO 62%

ViPSim: Collaborating Visual and Parameter Spaces for Consistent Long-Horizon Embodied World Models

ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型

Longyu Chen, Heng Li, Wei Yang, Manqi Zhao, Dongsheng Jiang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) Huazhong University of Science and Technology(华中科技大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。

Comments Accepted to Robotics: Science and Systems (RSS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏