arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-07 至 2026-07-07 共收录 59 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 52 篇

2607.05133 2026-07-07 cs.CV 新提交 79%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02640 2026-07-07 cs.SD cs.AI cs.NI 新提交 79%

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

Jiaying Meng, Bojie Li

机构 * Pine AI(松果人工智能公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02841 2026-07-07 cs.RO cs.CV 新提交 79%

CLEAR: Closed-Loop Reinforcement Learning at Scale for End-to-End Autonomous Driving

CLEAR:用于端到端自动驾驶的大规模闭环强化学习

Yunxiao Shi, Hong Cai, Mohammad Ghavamzadeh, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究中心)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 研究端到端自动驾驶,针对现有基于视觉语言动作模型的策略多采用模仿学习致闭环规划性能欠佳的问题,提出CLEAR系统,用强化学习进行闭环训练,设计异构管道增加并行模拟环境数量,性能优于先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29936 2026-07-07 cs.RO 版本更新 77%

OpenSPM: An Environment-Transferable Robotic Key Spatial Pose Memory and Closed-Loop High-Frequency Flow-Matching Action Generation Model

OpenSPM:一种环境可迁移的机器人关键空间位姿记忆与闭环高频流匹配动作生成模型

Iok Tong Lei, Qingchen Xie, Yifan Wang, Yap Ying Jie, Zhidong Deng

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出OpenSPM框架,通过空间位姿记忆和流匹配动作生成模型,实现开放环境桌面机器人操作的高频、精确控制,在LIBERO-GOAL任务中达到85.6%成功率和1033.3 Hz等效控制频率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04146 2026-07-07 cs.RO cs.AI cs.CL cs.CR cs.LG 新提交 75%

!Imperio, smolVLA: The Implications of Data Poisoning on Open Source Robotics

!帝国,小型甚大阵:数据投毒对开源机器人技术的影响

Stefan Bühler, Mark Schutera

机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。

Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21241 2026-07-07 cs.RO cs.AI 版本更新 73%

CorridorVLA: Explicit Spatial Constraints for Generative Action Heads via Sparse Anchors

CorridorVLA:通过稀疏锚点实现生成动作头的显式空间约束

Dachong Li, ZhuangZhuang Chen, Jin Zhang, Jianqiang Li

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 CorridorVLA通过稀疏锚点提供显式空间约束,提升动作生成性能,在LIBERO-Plus基准上改进成功率3.4%-12.4%。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03592 2026-07-07 astro-ph.GA 新提交 67%

From Atomic Gas to Star Formation

从原子气体到恒星形成

Erik Rosolowsky, Eric Koch, Sambit Roychowdhury, Luca Cortese, Filippo M. Maccagni, Barbara Catinella, Nushkia Chamba, Timothy A. Davis, Cosima Eibensteiner, Eric Murphy, Mamta Pandey-Pommier, Amidou Sorgho

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究星系中气体循环,此前因对占质量主导的冷原子相了解少而受限。利用SKA及其他设备高分辨率观测,可解决恒星形成星际介质演化的开放性问题,介绍了相关观测的近期结果。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Rosolowsky01

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03368 2026-07-07 astro-ph.CO 新提交 67%

The giant radio source 0917+75: Origin and properties

巨型射电源0917+75:起源与性质

G. Giovannini, N. Biava, M. Girardi, W. Boschin, R. Barrena, A. Bonafede, L. Feretti, C. Ferrari, F. Govoni, M. Iacobelli, M. Murgia, E. Orru', R. Pizzo, V. Vacca

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究巨型射电源GRS0917 + 75,通过光学观测、低频射电成像及多频段射电数据分析,将其分类为特定类型星系,探讨其性质、起源及与环境的联系。

Comments 12 pages, 13 figures, accepted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04648 2026-07-07 cs.LG cs.AI 新提交 62%

Machine Learning for Depression Screening and Intervention: an Original Circadian Rhythm Score-based Methodology

用于抑郁症筛查和干预的机器学习:一种基于昼夜节律评分的原创方法

Bin Wang, Shuo Lian, Yuanyuan Hou, Dexian Wang, Peilan He, Feng Hong, Yanwei Yu, Tianrui Li

机构 * Ocean University of China(中国海洋大学) The Affiliated Hospital of Qingdao University(青岛大学附属医院) Chengdu University of Traditional Chinese Medicine(成都中医药大学) Southwest Jiaotong University(西南交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模行为数据筛查抑郁症的挑战,提出昼夜节律评分(CRS),构建可解释筛查框架及干预推理方法,通过实验验证其有效性,为抑郁症筛查和干预提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09938 2026-07-07 cs.RO cs.LG 版本更新 62%

CableTract: A Co-Designed Cable-Driven Field Robot for Low-Compaction, Off-Grid Capable Agriculture

CableTract:一种低压实、离网能力的农业电缆驱动田间机器人

Ozgur Yilmaz

机构 * Adana Science and Technology University(阿达纳科学与技术大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出CableTract电缆驱动农业机器人,通过共设计电缆架构与实施库,实现低压实和离网作业,结合多种模型分析能量效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16809 2026-07-07 cs.RO cs.AI 版本更新 62%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 62%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 VLA模型 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 62%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03017 2026-07-07 cs.RO 新提交 57%

Beyond Heuristics: A Standardized Real2Sim Pipeline for Physical Human Robot Interaction in Human-in-the-Loop Simulation

超越启发式方法:用于人在回路仿真中物理人机交互的标准化真实到仿真管道

Chengyuan Yang, Yifan Wang, Chun Kwang Tan, Sherwin Stephen Chan, Youlong Wang, Xiaoyue Yan, Lei Li, Wei Tech Ang

机构 * School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院) Guangdong Zhongxin Intelligent Rehabilitation Research Institute(广东众鑫智能康复研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究针对人在回路仿真中交互模型阻抗参数靠启发式调整的问题,提出Real2Sim管道,用协方差矩阵自适应进化策略识别动力学参数,提高仿真保真度,支持人体数字双胞胎用于个性化控制器临床前验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00269 2026-07-07 cs.AI 新提交 57%

Mnemosyne: Agentic Transaction Processing for Validating and Repairing AI-generated Workflows

Mnemosyne: 用于验证和修复AI生成工作流的代理事务处理

Edward Y. Chang, Longling Geng, Emily J. Chang

机构 * Stanford University(斯坦福大学) QuadriumAI

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 提出代理事务处理(ATP)模型,将生成动作视为不可信提案,通过确定性约束集验证后才提交,并实现运行时修复,确保状态正确性独立于生成层。

Comments 41 pages, 25 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03313 2026-07-07 quant-ph physics.optics 新提交 50%

High Success Probability, Fidelity, and Purity Nonlinear Optical Two-Qubit Gates on Chip

芯片上具有高成功概率、保真度和纯度的非线性光学两比特门

Minghao Shang, Hua-Ying Liu, Ying Wei, Xiaoyi Liu, Qianhao Ning, Lijian Zhang, Shi-Ning Zhu, Zhenda Xie

专题命中 VLA模型 :action model(abstract)

AI总结 提出基于薄膜铌酸锂平台的两比特门方案,通过解耦光子相互作用与量子比特翻转操作及光谱相位预补偿,实现高成功概率、纯度及保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04460 2026-07-07 astro-ph.CO gr-qc 新提交 50%

Strong gravitational lensing constraints on interacting dark energy models

相互作用暗能量模型的强引力透镜约束

F. Villalobos, T. Verdugo, P. Troncoso-Iribarren, N. Piña, J. Magaña

专题命中 VLA模型 :action model(abstract)

AI总结 研究暗物质与暗能量相互作用,用强引力透镜数据估计宇宙学参数,结果支持加速宇宙,表明暗区相互作用或可缓解宇宙膨胀历史紧张关系及强引力透镜的潜力。

Comments Proceedings of the 67th Annual Meeting of the Asociación Argentina de Astronomía (AAA), accepted for the Boletín de la Asociación Argentina de Astronomía

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01475 2026-07-07 physics.plasm-ph math-ph math.MP 新提交 50%

Understanding Non-Gaussian Chorus Wave Statistics via the Benjamin-Feir Index

通过Benjamin-Feir指数理解非高斯哨声波统计

D. J. Ratliff, O. Allanson, D. Rasinskaite, J. Stawarz, C. E. J. Watt, S. Chakraborty, A. W. Smith

专题命中 VLA模型 :action model(abstract)

AI总结 通过推导扩展波作用模型,识别出Benjamin-Feir指数(BFI)作为非高斯哨声波统计的指标,发现BFI>0.5时出现非高斯谱,磁层夜间和黎明扇区为主要区域,模型能解释非高斯哨声的不对称频谱,建立了首个从第一原理区分高斯与非高斯波的波活动指数。

Comments 14 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29206 2026-07-07 astro-ph.EP 50%

Constraints on the Atmospheric Composition of 2002 XV$_{93}$ from JWST Spectroscopy

JWST光谱对2002 XV$_{93}$大气成分的约束

Ian Wong, Silvia Protopapa, Emmanuel Lellouch

专题命中 VLA模型 :action model(abstract)

AI总结 通过JWST/NIRSpec光谱观测,未检测到甲烷或一氧化碳气体,对2002 XV$_{93}$的大气成分给出了严格上限,挑战了掩星测量推断的大气压力解释。

Comments 6 pages, 3 figures, published in ApJL

Journal ref ApJL, 1005, L42 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16299 2026-07-07 cs.IR 版本更新 50%

MICE: Minimal Interaction Cross-Encoders for efficient Re-ranking

MICE:用于高效重排的最小交互交叉编码器

Mathias Vast, Victor Morand, Basile van Cooten, Laure Soulier, Josiane Mothe, Benjamin Piwowarski

专题命中 VLA模型 :action model(abstract)

AI总结 研究针对交叉编码器推理成本高的问题,提出MICE架构,通过去除有害或不必要交互,将加速交叉编码器推理与提升一级检索效果两种方法结合,评估显示其降低推理延迟四倍,效果良好。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03457 2026-07-07 quant-ph 版本更新 50%

Beyond Lindblad Dynamics: Rigorous Guarantees for Thermal and Ground State Preservation under System Bath Interactions

超越林德布拉德动力学:系统-浴相互作用下热态和基态保持的严格保证

Ke Wang, Zhiyan Ding

专题命中 VLA模型 :action model(abstract)

AI总结 研究系统-浴相互作用算法用于量子热态和基态制备的效率与鲁棒性。通过新理论结果表明,即便耦合强度与精度无关,诱导量子通道也能高精度逼近目标热态和基态,改进了复杂度分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01875 2026-07-07 cond-mat.soft physics.flu-dyn 版本更新 50%

Hydraulic resistance of channels obstructed by a dense array of elastic fibers

由密集排列的弹性纤维阻塞的通道的水力阻力

Etienne Jambon-Puillet

专题命中 VLA模型 :action model(abstract)

AI总结 研究压力驱动下弹性纤维阻塞层流通道的流动,通过将纤维床视为可变形多孔介质建模非线性水力阻力,确定关键无量纲参数,用于设计微流体网络的被动流动控制元件。

Journal ref J. Fluid Mech., 1028, A21 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 2 篇

2607.03283 2026-07-07 cs.AI 新提交 70%

Embodied Operators and Benchmarking: Toward Reusable and Deployable Embodied Intelligence Systems

具身算子与基准测试:迈向可复用和可部署的具身智能系统

Junwu Xiong, Jiaxuan Gao, Wei Chai, Renxing Chen, Yuzhen Li, Yu Guo, Yucheng Guo, Mingxi Luo, Wenyang Ma, Yiyun Mou, Yifei Zhang, Chen Zhou, Yongjian Guo

机构 * JDT Tsinghua University(清华大学) Tianjin University(天津大学) Beihang University(北京航空航天大学)

专题命中 动作表示与策略 :VLA(abstract);embodied foundation model(abstract);分类 cs.AI

AI总结 研究具身智能系统中可复用功能模块即具身算子,明确其定义边界、构建分类法,提出多维度基准框架,探讨加速及挑战,为具身智能系统提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02642 2026-07-07 cs.RO 新提交 70%

GigaWorld-1: A Roadmap to Build World Models for Robot Policy Evaluation

GigaWorld-1:构建用于机器人策略评估的世界模型路线图

GigaWorld Team, Angyuan Ma, Boyuan Wang, Bohan Li, Chaojun Ni, Guo Li, Guan Huang, Guosheng Zhao, Hao Li, Hengtao Li, Jingyu Liu, Jiwen Lu, Qiuping Deng, Tingdong Yu, Xuancheng Xu, Xinyu Zhou, Xiuwei Xu, Xinze Chen, Xiaofeng Wang, Xiaoyu Tian, Yang Wang, Yifan Chang, Yukun Zhou, Yun Ye, Zhenyu Wu, Zhanqian Wu, Zheng Zhu

机构 * GigaAI(巨元人工智能) Tsinghua University(清华大学)

专题命中 动作表示与策略 :robot foundation model(abstract);embodied foundation model(abstract);分类 cs.RO

AI总结 研究机器人策略评估中世界模型,介绍WMBench基准,通过分析多种模型、方案及大量模拟策略展开,得出评估器质量受长期动作忠实性影响等核心见解,推导出设计路线图并实现GigaWorld-1。

Comments Project page: https://open-gigaai.github.io/giga-world-1/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 2 篇

2607.03941 2026-07-07 cs.RO 新提交 83%

WSA$_1$: a 3D-Centric World-Spatial-Action Model for Generalizable Robot Control

WSA$_1$:用于可泛化机器人控制的以3D为中心的世界-空间-动作模型

Jiahao Jiang, Jianing Zhang, Zhenhan Yin, Ruidong Chen, Sen Wang, Zhaoshu Yu, Pengpeng Zeng, Xiaofeng Cao, Xuanhan Wang, Jingkuan Song, Heng Tao Shen

机构 * Tongji University(同济大学) Shanghai Innovation Institution(上海创新机构) Shanghai Magic(上海魔星) Koala Uran Project(考拉铀项目)

专题命中 机器人基础模型 :action model(title,abstract);robot foundation model(abstract);分类 cs.RO

AI总结 研究针对当前机器人基础模型缺乏物理动力学推理等问题,提出以3D为中心的世界-空间-动作建模范式构建WSA$_1$模型,能学习3D世界感知视觉思维并建模约束,提升泛化能力且数据高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04426 2026-07-07 cs.RO 新提交 57%

ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI

ACE-Brain-0.5:用于物理智能体人工智能的统一具身基础模型

Brain Team, Ziyang Gong, Haoming Gu, Zehang Luo, Tianyi Zhang, Tao Tao, Yixiao Chi, Zhe Liu, Lingsi Zhu, Jingyuan Liu, Anke Tang, Songze Li, Yilun Kong, Ningjing Liu, Tianyu Zhu, Yunpeng Qing, Shuang Luo, Xiang Liu, Shi Fu, Dawei Nie, Sixiang Liu, Zhexi Wen, Feng Pan, Xiaofeng Wang, Zhi Hou, Chunxiao Liu, Xue Yang, Junchi Yan, Hengshuang Zhao, Dacheng Tao, Xiaogang Wang

机构 * ACE-Brain Team(ACE-Brain团队)

专题命中 机器人基础模型 :embodied foundation model(abstract);分类 cs.RO

AI总结 研究针对具身人工智能从模块向物理智能体发展的问题,提出ACE-Brain-0.5统一基础模型,通过耦合的五个功能及SSR+等方法,提升空间感知等能力,在多基准测试中有进步。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 数据集与评测 1 篇

2607.04880 2026-07-07 cs.RO 新提交 70%

PRISM: Personalized Robotic Dataset Generation via Image-based Scene and Motion Synthesis

PRISM:通过基于图像的场景和运动合成生成个性化机器人数据集

Dogyu Ko, Haneul Kim, Chanyoung Yeo, Dowoon Lee, Taeho Park, Hyoseok Hwang

机构 * Kyung Hee University(庆熙大学)

专题命中 数据集与评测 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对大规模预训练模型在特定环境泛化有限的问题,提出PRISM端到端管道,从单张图像和自然语言指令生成个性化机器人数据集,构建场景并合成演示,实验表明其效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 部署与泛化 2 篇

2607.04265 2026-07-07 cs.RO cs.AI 新提交 76%

HALO-WA: Hybrid-Attention Latent-Guided Online Reinforcement Learning for World-Action Models

HALO-WA:用于世界-动作模型的混合注意力潜在引导在线强化学习

Angen Ye, Weijie Ke, Xiaofeng Wang, Xinze Chen, Chaojun Ni, Guosheng Zhao, Boyuan Wang, Zheng Zhu, Junjie Xie, Dapeng Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) GigaAI(字节跳动公司(推测,根据常见语境)) Tsinghua University(清华大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO、cs.AI

AI总结 针对世界-动作模型在现实精度任务中易受多种误差影响的问题,提出HALO-WA框架,利用潜在特征和动作先验,通过混合注意力结构实现快速在线适应,提升动作块精度,实验验证效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14891 2026-07-07 cs.CV 版本更新 57%

GaussianArt: Unified Modeling of Geometry and Motion for Articulated Objects

高斯艺术:关节物体几何与运动的统一建模

Licheng Shen, Saining Zhang, Honghan Li, Peilin Yang, Zihao Huang, Zongzheng Zhang, Hao Zhao

机构 * BAAI(百度人工智能研究院) AIR, THU(清华大学人工智能研究院) NTU(国立台湾大学) BIT(北京理工大学) HUST(华中科技大学)

专题命中 部署与泛化 :action model(abstract);分类 cs.CV

AI总结 研究关节物体重建,此前方法解耦几何与运动,本文用关节3D高斯联合建模,提升运动分解鲁棒性,支持多达20个部件的物体,还提出新基准测试,实验表明该方法在多任务中精度更优。

Comments 3DV 2026 Project Page: https://sainingzhang.github.io/project/gaussianart/

详情

展开后加载摘要…

URL PDF HTML 收藏