arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 544 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 544 篇

2607.03461 2026-07-07 cs.CV cs.LG 新提交 81%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16533 2026-07-07 cs.AI cs.CV 新提交 81%

Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI

Kairos: 面向物理AI的原生世界模型栈

Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu, Zeyu Liu, Cong Wan, Pu Li, Ruiqing Yang, Xiaoou Li, Wei Wang, Kangkang Zhu, Yuwei Zhang, Shi Fu, Zheng Zhang, Xiaoning Wu, Xuzeng Fan, Dacheng Tao, Xiaogang Wang

机构 * Kairos Team(Kairos团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。

Comments Kairos Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27374 2026-06-26 cs.RO cs.CV 新提交 81%

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

世界行动模型通过循环生成重放实现持续模仿学习

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出循环生成重放(REGEN)框架,利用世界行动模型(WAM)生成伪重放轨迹,使机器人策略在不存储原始演示的情况下复习先前任务,在仿真和真实实验中减少50%灾难性遗忘,接近真实重放性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 81%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31101 2026-07-01 cs.RO 新提交 80%

Efficient Sim-to-Real Transfer of World-Action Models from Synthetic Priors

基于合成先验的世界-动作模型的高效仿真到现实迁移

Zixing Wang, Kausik Sivakumar, Jinghuan Shang, Yafei Hu, Zhaoming Xie, Ran Gong, Xiaohan Zhang, Karl Schmeckpeper

机构 * Purdue University(普渡大学) Robotics and AI Institute(机器人与人工智能研究所)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文研究从合成先验训练世界-动作模型并零样本部署到真实机器人操作,通过域随机化和AnyTask运动规划生成演示,首次成功实现仿真到现实的迁移。

Comments This work is accepted by CVPR'26, Embodied AI Workshop. This paper represent a part of early result of our official world-action model zero-shot sim-to-real transfer work, which will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12186 2026-08-13 astro-ph.SR astro-ph.GA 新提交 80%

Nascent Embedded-protostar Survey in Taurus (NEST) I: Protostellar Multiplicity

金牛座新生原恒星嵌入巡天(NEST)I:原恒星多重性

Aislinn C. Plante, John J. Tobin, Patrick D. Sheehan, Noshin Yesmin, Nicholas P. Ballering, Tyler L. Bourke, Josh Eisner, Zhi-Yun Li

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究通过ALMA与VLA观测结合档案数据,统计金牛座原恒星多重性,发现其多重性显著高于猎户座、英仙座,暗示金牛座保留更多原始多重系统,且存在两种不同形成途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09896 2026-08-11 astro-ph.SR astro-ph.EP 新提交 80%

Nascent Embedded-protostar Survey in Taurus (NEST) II: Measuring Dust Mass, Disk Size, and Gas Mass

金牛座新生原恒星包层嵌入调查(NEST)II:测量尘埃质量、盘大小与气体质量

Noshin Yesmin, Patrick Sheehan, John Tobin, Aislinn Coleman-Plante, Nicholas P. Ballering, Tyler L. Bourke, Josh Eisner, Hauyu Baobab Liu, Zhi-Yun Li

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究针对金牛座26个原恒星盘系统,利用ALMA与VLA观测及CO同位素体建模,测量了不同波段下的尘埃、气体质量与盘尺寸,明确了金牛座原恒星盘的相关特性及气体尘埃比范围。

Comments 31 pages, 11 Figures, Figure 10 and 11 are figure sets with 28 figures and 58 figures respectively

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08275 2026-08-11 astro-ph.GA 新提交 80%

The Quasar Feedback Survey: Ionised Outflows in type 2 QSOs with MUSE data

类星体反馈巡天:利用MUSE数据研究2型类星体中的电离外流

M. Bianchin, C. M. Harrison, T. Costa, V. Mainieri, R. A. Riffel, G. Venturi, D. Kakkad, C. Ramos Almeida, P. H. Cezar, S. Ward, A. Girdhar, S. Molyneux, L. Ulivi, E. P. Farina, J. Mullaney, F. Arrigoni Battaia

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本研究利用VLT/MUSE及VLA数据,研究18个高光度2型类星体的电离外流,发现电子密度与外流速度正相关,强调准确电子密度测定对提升外流参数精度的重要性,为外流模拟提供参考。

Comments 23 pages, 23 figures (16 on the appendix), submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22169 2026-07-27 astro-ph.EP 新提交 80%

Dust characterization of the HD 163296 disk with high-resolution multi-wavelength ALMA observations

利用高分辨率多波长阿塔卡马大型毫米/亚毫米波阵列观测对HD 163296星系盘进行尘埃特征分析

Kiyoaki Doi, Myriam Benisty, Akimasa Kataoka, Haochang Jiang, Francesco Zagaria, Hauyu Baobab Liu, Carsten Dominik, Ryo Tazaki, Takahiro Ueda, Tomohiro Yoshida, Takashi Tsukagoshi, Yoshihide Yamato, Ryuta Orihara

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究通过对HD 163296星系盘多波长高分辨率观测做SED拟合,表征其尘埃特性。利用新的ALMA波段9观测及存档数据,结合VLA观测,探索多种尘埃模型,确定DSHARP Zubko模型为首选,分析了尘埃特性及各盘尘埃质量。

Comments first revision submitted to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06777 2026-07-09 astro-ph.HE 新提交 80%

Radio Observations of the Unusual Tidal Disruption Event AT 2022wtn: a Fast and Highly Energetic Outflow

对异常潮汐瓦解事件AT 2022wtn的射电观测:快速且高能的外流

Gavin Farley, Tanmoy Laskar, Noah Franz, Collin T. Christy, Coleman Rohde, A. J. Goodwin, Kate D. Alexander, Edo Berger, Yvette Cendes, Ryan Chornock, Tarraneh Eftekhari, Walter W. Golay, Wenbin Lu, Raffaella Margutti

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究通过VLA和GMRT对潮汐瓦解事件AT 2022wtn进行多时期多频率射电观测,利用均分分析框架建模并估计物理参数,对比不同几何模型,排除相对论性喷流,探讨外流起源,发现吸积盘状态转变外流符合结果,此TDE独特且强大。

Comments 20 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06712 2026-07-09 astro-ph.GA 新提交 80%

The nature of Cloud-9: a compact core embedded in a diffuse envelope

云九的本质:嵌入弥散包层的致密核心

Ruilei Zhou, Ming Zhu, Chuan-Peng Zhang, Jinlong Xu

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 该研究利用FAST和VLA数据观测云九,发现其HI有双组分结构,核心致密静止,包层延展且有速度梯度,不支持旋转,与环境相互作用有关,排除恒星组分后表明云九是暗物质主导系统,符合剥离的重子遗迹情景。

Comments 6 pages, 5 figures, Accepted by MNRAS Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05950 2026-07-08 astro-ph.HE 新提交 80%

Unveiling the Local Environment of FRB 20220912A: Sub-arcsecond $4-26$ GHz Radio Continuum Mapping

揭示快速射电暴20220912A的本地环境:亚角秒级4 - 26 GHz射电连续谱测绘

Yash Bhusare, Yogesh Maan, Mohit Bhardwaj, Thomas C. Abbott, Yuxin Dong, Danté M. Hewitt, Afrokk Khan

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究利用VLA对FRB 20220912A进行高分辨率多频率连续谱研究,发现未知射电源,确定其位置、直径等特征,具有特定谱指数和恒星形成率表面密度,为重复FRB起源于年轻磁星的假设提供观测支持。

Comments 16 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05500 2026-07-08 astro-ph.HE astro-ph.SR 新提交 80%

Radio and X-ray Observations of the Transitional Supernova 2019yvr: Insights into the Progenitor Mass-Loss History

过渡型超新星2019yvr的射电和X射线观测:对前身星质量损失历史的洞察

Raphael Baer-way, Poonam Chandra, Maryam Modjaz, A. J. Nayana, Keiichi Maeda, Katie Auchettl, Maria R. Drout, Charles D. Kilpatrick, Alak K. Ray, Stuart D. Ryder

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究超新星2019yvr前身星质量损失历史,通过射电(GMRT + VLA)和X射线(Swift + Chandra)观测,结合同步加速器自吸收模型等方法,得出质量损失率下降等结果,排除相关CSM密度跃升,为理解前身星提供新认识。

Comments 19 pages,9 Figures, submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05377 2026-07-07 cs.RO cs.AI cs.CV 新提交 80%

Cortex: A Bidirectionally Aligned Embodied Agent Framework for Long-horizon Manipulation

Cortex:一种用于长视距操作的双向对齐具身智能体框架

Jiaqi Peng, Xiqian Yu, Delin Feng, Yuqiang Yang, Wenzhe Cai, Jing Xiong, Ganlin Yang, Jinliang Zheng, Jiafei Cao, Xueyuan Wei, Jiangmiao Pang, Yuan Shen, Tai Wang

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) USTC(中国科学技术大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 针对现有VLA模型长视距任务短板及分层方法语义-运动鸿沟问题,提出双向对齐框架Cortex,标准化技能原语、优化数据与采样策略,提升长视距操作性能与零样本泛化能力。

Comments Project website: https://steinate.github.io/cortex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01045 2026-07-02 astro-ph.IM 新提交 80%

Studying Ionosphere Using SKA-Low and SKA-Mid

利用SKA-Low和SKA-Mid研究电离层

Abhirup Datta, Samit Kumar Pal, Sarvesh Mangla, Bhuvnesh Brawar, Sumanjit Chakraborty, Sudipta Sasmal, Anshuman Tripathi

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 本文通过对比uGMRT、VLA、MWA和LOFAR的观测,量化电离层相位波动、位置偏移和闪烁效应,评估对校准和成像的影响,并预测SKA-Low和SKA-Mid的电离层效应。

Comments Published in Advancing Astrophysics with the SKA II (AASKAII), 2026 (arXiv:2606.20366). Report-no:AASKAII/Datta01. Advancing Astrophysics with the SKA II (AASKAII) outlines the transformative scientific advances that will be enabled by the SKA telescopes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27414 2026-06-29 astro-ph.IM astro-ph.CO 新提交 80%

The Karl G. Jansky Very Large Array Sky Survey (VLASS). Data Products

卡尔·G·扬斯基甚大阵列巡天(VLASS)数据产品

Amy Kimball, Mark Lacy, Juergen Ott, John Tobin, Tierra Candelaria, Sergio Garza, Drew Medlin, Steven T. Myers

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 VLASS是VLA对全天(dec>-40°)进行的2-4 GHz无线电连续谱巡天,分辨率约2.5角秒,全偏振。数据处理和质控面临计算和人力限制,采用创新方法:快速成像、GPU和HTC处理w项、机器学习自动识别伪影,并解决存档分发挑战。

Comments Submitted to the SPIE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22764 2026-06-23 astro-ph.GA 新提交 80%

Highly filamentary H{\,\small I} gas in the circumgalactic medium and intragalactic medium around NGC 4631

NGC 4631周围星系周介质和星系际介质中的高度纤维状中性氢气体

C. Zhang, Tie Liu, Xiaofeng Mai, Jing Wang

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 利用FAST和VLA数据,首次探测到星系周/星系际介质中kpc尺度的纤维状中性氢结构,宽度0.5-3.3 kpc,长度6.1-49.8 kpc,并识别出三类纤维,支持多尺度气体耦合。

Comments Submitted to AAS journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20885 2026-06-23 astro-ph.HE gr-qc 新提交 80%

Radio Follow Up of a Sub-threshold GRB in the Sky Localization Area of GW241125

GW241125天空定位区域内亚阈值伽马射线暴的射电后续观测

Natalie Gottschlich, Alessandra Corsi, S. Bradley Cenko, Divyajyoti, James DeLaunay, Derek B. Fox, Tanner O'Dwyer, Samuele Ronchini

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 针对GW241125(BBH合并)与Swift BAT-GUANO亚阈值GRB的空间时间重合,利用VLA进行射电后续观测,约束相对论喷流的各向同性动能上限,并讨论BBH-GRB关联的诊断能力及未来多信使研究前景。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16355 2026-06-16 astro-ph.GA 新提交 80%

The gas kinematics in 70 μm dark molecular clumps with ammonia

70 μm暗分子团块中的氨气气体运动学

Chao Ou, Shanghuo Li, Junzhi Wang, Yuqiang Li, Shuting Lin, Ian W. Stephens, Qizhou Zhang, Bo Zhang

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 利用VLA和GBT的NH3谱线观测,研究四个红外暗云中致密核心的气体运动学,发现61个核心中23个具有多速度成分,部分核心非热速度弥散向内减小,暗示湍流耗散或引力坍缩。

Comments 15pages, 4 tables, 6 figures. Accepted for publication in A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13769 2026-06-16 cs.RO cs.CV cs.LG 新提交 80%

$μ_0$: A Scalable 3D Interaction-Trace World Model

$\mu_0$: 一种可扩展的3D交互轨迹世界模型

Seungjae Lee, Yoonkyo Jung, Jusuk Lee, Jonghun Shin, Amir Hossein Shahidzadeh, Yao-Chih Lee, H. Jin Kim, Jia-Bin Huang, Furong Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校) Seoul National University(首尔大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 提出基于3D轨迹的可扩展世界模型$\mu_0$,通过预测交互点轨迹实现跨本体机器人学习,无需动作标签,性能媲美有监督模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13393 2026-06-12 astro-ph.GA astro-ph.CO 新提交 80%

Direct detection of cool molecular gas in a star-forming galaxy at $z=7.31$

在 $z=7.31$ 的恒星形成星系中直接探测冷分子气体

Karin Cescon, Jacqueline A. Hodge, Leindert A. Boogaard, Hiddo S. B. Algera, Lucie E. Rowland, Dominik A. Riechers, Renske Smit, Ilse De Looze, Rychard Bouwens, Paul van der Werf, Manuel Aravena, Elisabete da Cunha, Pratika Dayal, Andrea Ferrara, Rebecca Fisher, Hanae Inami, Pavel E. Mancera Piña, Pascal A. Oesch, Andrea Pallottini, Matus Rybak, Sander Schouws, Laura Sommovigo, Mauro Stefanon, Livia Vallini

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 利用VLA和ALMA观测,在z=7.31星系REBELS-25中探测到CO(3-2)和CO(7-6)发射,直接证实大爆炸后约7亿年存在巨大气体储库,气体质量约10^11太阳质量,气体分数约0.95,并约束了星际介质条件。

Comments Accepted for publication in MNRAS. Main text: 17 pages, 6 figures

Journal ref MNRAS, Volume 549, Issue 3, July 2026, stag924

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08169 2026-06-09 cs.RO cs.AI cs.CL cs.HC cs.LG 新提交 80%

CLASP: Language-Driven Robot Skill Selection and Composition using Task-Parameterized Learning

CLASP: 基于语言驱动的机器人技能选择与组合,采用任务参数化学习

Markus Knauer, Valentin Gieraths, Tai Mai, Samuel Bustamante, Alin Albu-Schäffer, Freek Stulp, João Silvério

机构 * German Aerospace Center (DLR), Institute of Robotics and Mechatronics (RMC)(德国航空航天中心(DLR),机器人与机电一体化研究所(RMC)) Technical University of Munich (TUM)(慕尼黑工业大学(TUM))

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出CLASP架构,结合任务参数化核化运动基元(TP-KMP)与预训练视觉语言模型(VLM),通过自然语言命令实现技能选择、组合和主动学习,无需微调,在7自由度机械臂上达到73.3%-100%成功率。

Comments 23 pages, 11 figues, 4 tables, 1 listing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00725 2026-08-04 cs.RO 新提交 79%

SelfWAM: A Self-Grounded Unified World Action Model for Fast Robot Control

SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型

Bikang Pan, Fan Liu, Haotao Lu, Jingya Wang, Ye Shi

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00635 2026-08-04 cs.RO 新提交 79%

FlowPilot: Real-Time World-Action Modeling for Agile UAV Navigation

FlowPilot:面向敏捷无人机导航的实时世界-动作建模

Runqing Wang, Ding Yu, Pengyuan Min, Xinhong Zhang, Wei Xiao, Yu Hu, Jie Chen, Fu Zhang, Gang Wang

机构 * Beijing Institute of Technology(北京理工大学) Zhongguancun Academy(中关村学院) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。

Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00547 2026-08-04 cs.RO 新提交 79%

Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models

解耦视觉-触觉前瞻:面向世界动作模型的神谕引导式接口发现

Zihang Yao, Chaoyue Ding, Yingying Yu

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 针对接触丰富的操纵任务中视觉与触觉跨模态接口未被充分探索的问题,提出OVTF框架与AFM模型,在UniVTAC基准7项任务中,AFM平均成功率优于IFM与UniVTAC-ACT。

Comments 6 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28391 2026-07-31 cs.RO 新提交 79%

TacWAM: Anchor-Guided World Action Model with Mechanics-Aware Tactile Prediction

TacWAM:锚点引导的力学感知触觉世界动作模型

Lei Jin, Yiding Ma, Xin Zhang, Chen Gao, Wei Wu, Yong Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。

Comments 8 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25918 2026-07-29 cs.RO 新提交 79%

DC-WAM: Dynamic-Centric Visual Supervision and Reasoning for World-Action Models

DC-WAM:用于世界-动作模型的以动态为中心的视觉监督与推理

Haoyuan Ji, Lingxiang Fan, Shang Su, Yinqiao Lu, Mengkai Shi, Jun Gao, Shuo Feng

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究如何让基于RGB的世界-动作模型从外观主导的重建转向交互诱导的视觉动态,提出DC-WAM框架,通过重新分配监督和计算,结合时间差分流匹配等方法,提升策略性能,尤其在多种分布外扰动下表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23783 2026-07-28 cs.RO 新提交 79%

$N_0$-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展

NeoteAI Team, Fudan TEAI Team

机构 * NeoteAI Team(NeoteAI团队) Fudan TEAI Team(复旦大学TEAI团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20175 2026-07-23 cs.CV 新提交 79%

PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模

Yushan Liu, Tianxiong Lv, Bohua Wang, Hangqi Fan, Chenxu Zhao, He Zheng, Xuchang Zhong, Yifan Xie, Congyang Zhao, Zhihao Liao, Leigang Luo, Yang Cai, Xiao-Ping Zhang, Wenbo Ding

机构 * Tsinghua University(清华大学) AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏