arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-13 至 2026-04-13 共收录 7 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 7 篇

2604.02241 2026-04-13 cs.CV cs.RO 91%

UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models

UAV-Track VLA: 通过视觉-语言-动作模型实现具身空中跟踪

Qiyao Zhang, Shuhua Zheng, Jianli Sun, Chengxiang Li, Xianke Wu, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * Beijing Institute of Technology(北京理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Sanya(三亚学院) Beijing University of Posts and Telecommunications(北京邮电大学) Hunan University(湖南大学) Beihang University(北京航空航天大学) Flying Intelligence Team (Virtual Research Community)(飞行智能团队(虚拟研究社区))

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出UAV-Track VLA模型,通过视觉-语言-动作融合解决动态城市场景中的具身跟踪问题,提升UAV的实时控制性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04161 2026-04-13 cs.RO 88%

Adaptive Action Chunking at Inference-time for Vision-Language-Action Models

推理时的自适应动作分块

Yuanchang Liang, Xiaobo Wang, Kai Wang, Shuo Wang, Xiaojiang Peng, Haoyu Chen, David Kim Huat Chua, Prahlad Vadakkepat

机构 * National University of Singapore(新加坡国立大学) Shenzhen University of Advanced Technology(深圳理工大学) Sangfor Technologies Inc.(深信服科技股份有限公司) Mininglamp Technology(明略科技) Shenzhen Technology University(深圳技术大学) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出自适应动作分块策略,通过动作熵动态调整分块大小,提升机器人操作的反应与一致性。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09059 2026-04-13 cs.CV cs.AI 84%

Learning Vision-Language-Action World Models for Autonomous Driving

学习视觉-语言-动作世界模型以实现自动驾驶

Guoqing Wang, Pin Tang, Xiangxuan Ren, Guodongfang Zhao, Bailan Feng, Chao Ma

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能研究院教育部人工智能重点实验室) Central Research Institute, Huawei(华为中央研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VLA-World模型,通过结合预测想象与反思推理提升自动驾驶的前瞻性。该模型利用生成的轨迹引导图像生成,并通过反思优化轨迹预测,实验表明其在规划和未来场景生成任务中优于现有方法。

Comments Accepted by CVPR2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08685 2026-04-13 cs.AI 79%

RAMP: Hybrid DRL for Online Learning of Numeric Action Models

RAMP:用于在线学习数字动作模型的混合深度强化学习

Yarin Benyamin, Argaman Mordoch, Shahaf S. Shperberg, Roni Stern

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 RAMP通过环境交互在线学习数字规划动作模型,结合深度强化学习策略、动作模型学习和规划,形成正反馈循环提升求解能力和计划质量。

Comments Accepted as a workshop paper at the Adaptive and Learning Agents (ALA) Workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09036 2026-04-13 cs.RO 70%

V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation

V-CAGE:用于机器人操作的视觉闭环代理生成引擎

Yaru Liu, Ao-bo Wang, Nanyang Ye

机构 * University of Cambridge(剑桥大学) Wuhan University(武汉大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 V-CAGE通过闭环代理生成框架实现机器人数据合成,结合语义布局规划和视觉自验证,提升环境生成的语义结构和可达性,解决传统方法在场景生成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI 62%

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00230 2026-04-13 astro-ph.GA astro-ph.CO astro-ph.SR physics.space-ph 50%

The Baryon Budget of Galaxies across the First Billion Years

星系在第一十亿年中的重子预算

Umberto Maio, Céline Péroux

专题命中 VLA模型 :VLA(abstract)

AI总结 研究早期星系中气体和恒星的相态及其预算,探讨重子预算、耗尽时间及恒星回流比例随红移和恒星年龄的变化,利用冷模拟方法分析不同相态。

Comments Meminisse iuvabit - published in A&A

Journal ref A&A 708, A244 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏