arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-23 至 2026-06-23 共收录 48 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 48 篇

2606.21386 2026-06-23 cs.LG cs.CV 新提交 94%

VLA-FAIL: Efficient Task Failure Detection for Finetuned Vision-Language-Action Models

VLA-FAIL:面向微调视觉-语言-动作模型的高效任务失败检测

Florian Seligmann, Emiliyan Gospodinov, Enes Ulas Dincer, Gerhard Neumann

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title,abstract);分类 cs.CV、cs.LG

AI总结 提出轻量级失败检测框架VLA-FAIL,结合最后一层马氏距离(LLMD)和动作块一致性(ACC)两种无需失败数据的检测器,实现高效且通用的任务失败检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23623 2026-06-23 cs.RO 新提交 92%

dVLA-RL: Reinforcement Learning over Denoising Trajectories for Discrete Diffusion Vision-Language-Action Models

dVLA-RL:基于去噪轨迹的强化学习用于离散扩散视觉-语言-动作模型

Yuhao Wu, Yitian Liu, Weijie Shen, Mishuo Han, Wenjie Xu, Haotian Liang, Zhongshan Liu, Yinan Mao, Lei Xu, Xinping Guan, Ru Ying, Ran Zheng, Wei Sui, Xiaokang Yang, Wenbo Ding, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Baidu AI Cloud D-Robotics Shanghai AI Laboratory(百度AI云D-机器人上海人工智能实验室)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出dVLA-RL方法,将离散扩散VLA模型的强化学习目标从边缘动作概率转移到采样生成路径的联合概率,通过将去噪过程建模为马尔可夫决策过程,实现变步长调度,在LIBERO上达到99.7%成功率,在RoboTwin 2.0上相比SFT提升30.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21496 2026-06-23 cs.RO cs.AI cs.CV cs.LG 新提交 92%

Decoupling the Declarative from the Procedural in Vision-Language-Action Models

在视觉-语言-动作模型中解耦声明性知识与程序性知识

Nikolaos Tsagkas, Andreas Sochopoulos, Chris Xiaoxuan Lu, Oisin Mac Aodha, Alexandros Kouris

机构 * University of Edinburgh(爱丁堡大学) UCL(伦敦大学学院) Samsung AI Center - Cambridge, UK(三星人工智能中心 - 英国剑桥)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 针对现有VLA模型无法解耦声明性与程序性知识导致零样本技能迁移脆弱的问题,提出w$^{2}$VLA模型,通过重构信息流实现模块化、可解释的知识解耦,显著提升对未见物体的零样本技能迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23617 2026-06-23 cs.RO cs.AI cs.LG 新提交 92%

RECALL: Recovery Experience Collection for Active Lifelong Learning in Vision-Language-Action Models

RECALL: 面向视觉-语言-动作模型的主动终身学习的恢复经验收集

Ulas Berk Karli, Tesca Fitzgerald

机构 * Yale University(耶鲁大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出主动不确定性引导的数据收集方法,结合持续学习技术,解决VLA模型被动模仿学习中的效率低和灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20857 2026-06-23 cs.AI cs.LG cs.RO 新提交 92%

SignVLA: Real-Time Sign Language-Guided Robotic Manipulation via Attention LSTM and Vision-Language-Action Models

SignVLA: 通过注意力LSTM和视觉-语言-动作模型实现实时手语引导的机器人操作

Ningwei Bai, Xinyu Tan, Harry Gardner, Zhengyang Zhong, Liuhaichen Yang, Luoyu Zhang, Zhekai Duan, Monkgogi Galeitsiwe, Zezhi Tang

机构 * University College London(伦敦大学学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI、cs.LG

AI总结 提出SignVLA框架,通过注意力LSTM网络将手语手势实时转换为语义指令,驱动VLA模型执行机器人操作任务,为听障用户提供无障碍交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20246 2026-06-23 cs.RO cs.AI 新提交 91%

Finetuning Vision-Language-Action Models Requires Fewer Layers Than You Think

微调视觉-语言-动作模型所需的层数比你想象的少

Gia-Binh Nguyen, Trong-Bao Ho, Thien-Loc Ha, Khoa Vo, Philip Lund Møller, Quang T. Nguyen, Long Dinh, Tung M. Luu, Tuan Dam, Vu Duong, Trung Le, Nghi D. Q. Bui, Minh Vu, Tran Nguyen Le, An Thai Le, Ngan Le, Daniel Sonntag, James Zou, Jan Peters, Duy M. H. Nguyen, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity(VinUniversity人工智能研究中心) VinRobotics University of Arkansas(阿肯色大学) Technical University of Denmark(丹麦技术大学) Hanoi University of Science and Technology(河内科技大学) KAIST(韩国科学技术院) Monash University(莫纳什大学) Oldenburg University(奥尔登堡大学) DFKI(德国人工智能研究中心) University of Stuttgart(斯图加特大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院) Stanford University(斯坦福大学) Technische Universität Darmstadt(达姆施塔特工业大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文发现VLA模型存在层间表示冗余,提出无需训练的压缩方法,通过去除冗余层将模型深度减少50%,实现40-50%训练加速和30%推理加速,性能不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23147 2026-06-23 cs.RO 新提交 91%

Assistron: Bayesian Shared Autonomy with Off-the-shelf Vision-Language-Action Models

Assistron: 基于现成视觉-语言-动作模型的贝叶斯共享自主

Pinhao Song, Ze Fu, Yutong Hu, Renaud Detry

机构 * KU Leuven(鲁汶大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 提出Assistron共享自主模型,利用VLA模型自主执行宏观运动,仅在关键失败点请求人类干预,无需微调VLA,显著提升任务成功率并降低人类工作量。

Comments Using VLA in assistive robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23641 2026-06-23 cs.RO 新提交 91%

Flatness Preserves Instruction Following in Vision-Language-Action Models

平坦性保持视觉-语言-动作模型中的指令遵循能力

Haochen Zhang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 针对VLA模型微调后忽视语言指令的问题,提出平坦性保持优化(SAM),在不增加数据或修改架构的情况下,将指令遵循率提升60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21470 2026-06-23 cs.RO cs.CV cs.LG 新提交 90%

ASCII Art Turns LLMs into VLA Controllers

ASCII艺术将LLMs转化为VLA控制器

Yitao Jiang, Roy Xing, Luyang Zhao, Brian Plancher, Muhao Chen, Devin Balkcom

机构 * Dept. of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) Dept. of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系) Dept. of Mechanical and Aerospace Engineering, University of Houston(休斯顿大学机械与航空航天工程系)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO、cs.CV、cs.LG

AI总结 通过ASCII表示将视觉观察渲染为文本输入,仅使用文本LLM即可实现VLA式控制,在2D操作任务中表现良好,提供轻量级可解释的模态桥接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23574 2026-06-23 cs.CR cs.RO 新提交 90%

A Watermark for Vision-Language-Action and World Action Models

视觉-语言-动作与世界动作模型的水印技术

Yule Liu, Shuai Liu, Jiaheng Wei, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Wuhan University(武汉大学) Xi’an Jiao Tong University(西安交通大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出密钥潜在来源验证方法,通过替换高斯噪声种子为密钥种子为机器人策略模型添加水印,在保持任务性能的同时实现版权保护,并能抵抗输出移除和权重修改攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22794 2026-06-23 cs.RO 新提交 90%

UniFS: Unified Fast-to-Slow Hierarchical Architecture for Vision-Language-Action Models

UniFS:面向视觉-语言-动作模型的统一快慢层次架构

Lin Sun, Zhiwei Guan, Conglin Wang, Zihong Chen, Jianhai Yu, Zongsheng Li, Boyong He, Tao Sun, Jiale Cao, Lige Liu

机构 * Tianjin University(天津大学) Yiwu Research Institute of Fudan University(复旦大学义乌研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出UniFS统一快慢层次架构,通过分层更新频率、潜向量反转和多级监督策略,解决快慢双系统视觉-语言-动作模型中的频率困境和信息耦合问题,在LIBERO上实现98.3%成功率并提速2.1倍。

Comments Code is opensourced at https://github.com/linsun449/UniFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23589 2026-06-23 cs.RO 新提交 90%

KEMO: Event-Driven Keyframe Memory for Long-Horizon Robot Manipulation with VLA Policies

KEMO: 面向长程机器人操作的VLA策略事件驱动关键帧记忆

Yihan Zeng, Minghao Ye, Yiyuan Chen, Yide Shentu, Philipp Wu, Zike Yan, Zhongyu Li

机构 * Hong Kong Embodied AI Lab(香港具身智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Electronic Science and Technology of China(电子科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.RO

AI总结 提出KEMO,一种轻量级插件式记忆框架,通过事件驱动选择关键帧并编码为紧凑记忆令牌,结合交叉注意力和门控残差融合,提升VLA策略在长程操作中的任务成功率23.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21372 2026-06-23 cs.RO cs.LG 新提交 90%

NAC: Neural Action Codec for Vision-Language-Action Models

NAC: 面向视觉-语言-动作模型的神经动作编解码器

Ahad Jawaid, Yu Xiang

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 提出神经动作编解码器(NAC),采用多尺度RVQGAN架构将短动作轨迹视为多通道1D信号进行压缩,以替代现有离散动作分词器,在LIBERO-10等任务中实现更低重建误差和更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新 90%

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21493 2026-06-23 cs.CV cs.ET 新提交 89%

Semi-Supervised Vision-Language-Action Model

半监督视觉-语言-动作模型

Hongyang He, Jiuming Liu, Victor Sanchez

机构 * University of Warwick(华威大学) University of Cambridge(剑桥大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 提出SemiVLA框架,通过自蒸馏教师-学生网络利用伪动作标签适应新环境,在10%标注轨迹下提升LIBERO任务成功率8.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20754 2026-06-23 cs.RO 新提交 89%

Perturbation-Based Uncertainty for Failure Detection in Vision-Language-Action Models

基于扰动的视觉-语言-动作模型不确定性用于故障检测

Yousung Lee, Dongsoo Har

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种无标签、模型无关的扰动框架,通过注入高斯扰动到隐藏激活中估计认知不确定性,在分布偏移下提升故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20867 2026-06-23 cs.CV cs.AI 新提交 89%

FOCA: Future-Oriented Conditioning for Data-Efficient Vision-Language-Action Adaptation

FOCA: 面向未来的条件化用于数据高效的视觉-语言-动作适应

Duc Minh Nguyen, Nghiem Tuong Diep, Binh Gia Nguyen, Trong-Bao Ho, Doanh Le, Tan Q. Nguyen, Thien-Loc Ha, Nhiem Tran, Bao Thach, Nhat X. Tran, Tuan A. Tran, Artur Habuda, Philip Lund Møller, Tran Nguyen Le, Daniel Sonntag, Matthias Niepert, Khoa D. Doan, Vu Duong, Hung Ngo, Minh N. Vu, Duy M. H. Nguyen, An Thai Le, Ngo Anh Vien

机构 * Center for AI Research, VinUniversity, Vietnam University of Utah, USA German Research Center for Artificial Intelligence (DFKI) Technical University of Denmark, Denmark University of Oldenburg, Germany University of Stuttgart, Germany Max Planck Research School for Intelligent Systems (IMPRS-IS), Germany

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);分类 cs.CV、cs.AI

AI总结 提出FOCA框架,结合未来交互嵌入预测与目标观测隐式对齐,实现数据高效的VLA少样本适应,在LIBERO、RoboCasa和真实机器人上取得新最优结果。

Comments Accepted at ICML 2026. Project page: https://focavla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22836 2026-06-23 cs.RO 新提交 89%

Cloak: Zero-Shot Cross-Embodiment Manipulation by Masking the End-Effector from the VLA

Cloak: 通过遮蔽末端执行器实现零样本跨本体操作

Michael Piseno, Guy Tevet, C. Karen Liu

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(title,summary_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出Cloak训练方法,通过遮蔽腕部相机中的末端执行器,使VLA模型实现零样本跨本体迁移,无需新本体数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21445 2026-06-23 cs.RO 版本更新 89%

VLA Knows Its Limits: Adaptive Execution Horizons for Robot Policies

VLA 知道自己的极限:机器人策略的自适应执行视界

Haoxuan Wang, Gengyu Zhang, Yan Yan, Ramana Rao Kompella, Gaowen Liu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Cisco Research(思科研究)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对流式视觉-语言-动作模型中执行视界影响性能的问题,提出 AutoHorizon 方法,通过分析注意力权重动态估计每块动作的执行视界,提升机器人操作任务性能。

Comments ECCV 2026. Project page at https://hatchetproject.github.io/autohorizon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21501 2026-06-23 cs.RO 新提交 88%

UniviewVLA: A Unified Multiview Vision-Language-Action Model with World Modeling

UniviewVLA:统一的多视图视觉-语言-动作模型与世界建模

Tao Xu, Runhao Zhang, Zhijian Huang, Jiayi Guan, Jiaxin Wang, Yifan Ding, Yong-Lu Li, Long Chen, Guang Chen, Jinghui Lu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO

AI总结 提出UniviewVLA,利用世界模型生成多视图未来帧,从标准双摄像头观测中预测动作,解决遮挡问题,无需额外硬件或显式重建,并通过运动信息令牌压缩和动作熵视图选择提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20118 2026-06-23 cs.RO cs.LG 新提交 85%

Pose6DAug: Physically Plausible Multi-view Object Swapping for Robot Data Augmentation

Pose6DAug: 用于机器人数据增强的物理合理多视图物体替换

Jonghoon Lee, Seong Hyeon Park, Byungwoo Jeon, Minha Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院) Korea University(韩国大学) RLWRLD

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出Pose6DAug,一种基于失败驱动的数据增强框架,通过3D网格和6D姿态轨迹替换成功轨迹中的物体,生成多视图一致的物理合理演示,无需额外数据收集,在新型物体上提升VLA策略成功率16.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22174 2026-06-23 cs.RO 新提交 84%

OpenHLM: An Empirical Recipe for Whole-Body Humanoid Loco-Manipulation

OpenHLM:全身人形机器人移动操作的经验配方

Yingdong Hu, Haodong Zhu, Boyuan Zheng, Yihang Hu, Tong Zhang, Zunhao Chen, Junming Zhao, Ruiqian Nai, Yang Gao

机构 * Tsinghua University(清华大学) Shanghai Qi Zhi Institute(上海期智研究院) Spirit AI

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 提出OpenHLM,通过全身遥操作、VLA模型设计和异构协同训练三阶段实验,构建直接映射语言和像素到人形机器人全部自由度的原生视觉-语言-动作模型,在长时域任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20781 2026-06-23 cs.RO cs.CV 新提交 84%

World Action Models: A Survey

世界行动模型:综述

Qiuhong Shen, Shihua Zhang, Yue Liao, Qi Li, Zhenxiong Tan, Shizun Wang, Shuicheng Yan, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 本文综述世界行动模型(WAMs),通过两种互补视角组织现有工作,揭示其设计权衡与未来趋势。

Comments 57 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20698 2026-06-23 cs.RO 新提交 83%

SafeDojo: Safe Reinforcement Learning for VLA via Interactive World Model

SafeDojo:基于交互世界模型的安全强化学习用于视觉-语言-动作模型

Kai Tang, Peidong Jia, Zhong Chu, Jixian Wu, Rui Ma, Jiajun Cao, Fangyuan Zhao, Sixiang Chen, Yichen Guo, Xiaowei Chi, Chun-Kai Fan, Kevin Zhang, Jinchang Xu, Fubing Yang, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLA模型 :VLA(title);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出SafeDojo,首个基于模型的安全强化学习框架,通过交互式视频世界模型进行想象学习安全动作,结合解耦的任务奖励和安全代价信号,在SafeLIBERO和真实机器人上取得最佳安全成功率。

Comments 20 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22966 2026-06-23 cs.LG cs.AI cs.CR 新提交 82%

Attacking the Trusted Imagination: Oracle-Level Integrity Attacks on Imagine-then-Act World Models

攻击可信想象:对“先想象后行动”世界模型的预言机级完整性攻击

Linghan Chen, Kaiyan Ji, Minyu Guo

机构 * Adelaide University(阿德莱德大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.AI、cs.LG

AI总结 针对“先想象后行动”的视觉-语言-动作策略,发现世界模型中的想象轨迹是暴露的攻击面,通过有界观测扰动破坏想象,并设计无参数去噪检测器,实验显示非定向破坏效果显著,但定向控制受限。

Comments 13 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交 82%

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLA模型 :VLA(summary_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.LG

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22764 2026-06-23 astro-ph.GA 新提交 80%

Highly filamentary H{\,\small I} gas in the circumgalactic medium and intragalactic medium around NGC 4631

NGC 4631周围星系周介质和星系际介质中的高度纤维状中性氢气体

C. Zhang, Tie Liu, Xiaofeng Mai, Jing Wang

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 利用FAST和VLA数据,首次探测到星系周/星系际介质中kpc尺度的纤维状中性氢结构,宽度0.5-3.3 kpc,长度6.1-49.8 kpc,并识别出三类纤维,支持多尺度气体耦合。

Comments Submitted to AAS journals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20885 2026-06-23 astro-ph.HE gr-qc 新提交 80%

Radio Follow Up of a Sub-threshold GRB in the Sky Localization Area of GW241125

GW241125天空定位区域内亚阈值伽马射线暴的射电后续观测

Natalie Gottschlich, Alessandra Corsi, S. Bradley Cenko, Divyajyoti, James DeLaunay, Derek B. Fox, Tanner O'Dwyer, Samuele Ronchini

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 针对GW241125(BBH合并)与Swift BAT-GUANO亚阈值GRB的空间时间重合,利用VLA进行射电后续观测,约束相对论喷流的各向同性动能上限,并讨论BBH-GRB关联的诊断能力及未来多信使研究前景。

Comments 16 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 79%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22913 2026-06-23 cs.CV cs.AI 新提交 79%

Intend, Reflect, Refine: An Adaptive Multimodal Reflection Framework for Autonomous Driving

意图、反思、优化:一种用于自动驾驶的自适应多模态反思框架

Zisheng Chen, Yuping Qiu, Jianhua Han, Tao Tang, Xiuwei Chen, Likui Zhang, Ying-Cong Chen, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) HKUST(GZ)(香港科技大学(广州)) Yinwang Intelligent Technology Co. Ltd.(引望智能科技有限公司)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出IRR-Drive框架,通过生成初步文本意图并预测未来语义BEV表示,构建双模态反思空间,实现自适应轨迹修正,在NAVSIM基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏