arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-25 至 2026-03-25 共收录 10 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2603.22991 2026-03-25 cs.CV 91%

VLA-IAP: Training-Free Visual Token Pruning via Interaction Alignment for Vision-Language-Action Models

VLA-IAP: 通过交互对齐实现无训练视觉令牌剪枝用于视觉-语言-动作模型

Jintao Cheng, Haozhe Wang, Weibin Li, Gang Wang, Yipu Zhang, Xiaoyu Tang, Jin Wu, Xieyuanli Chen, Yunhui Liu, Wei Zhang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) South China Normal University(华南师范大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) National University of Defense Technology(国防科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.CV

AI总结 本文提出VLA-IAP方法,通过引入几何先验机制和动态调度策略,实现无训练的视觉令牌剪枝,提升VLA模型在资源受限平台上的推理效率和稳定性,实验显示在LIBERO基准上成功率达97.8%且速度提升1.25倍。

Comments 27 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 91%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 85%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(title,abstract);embodied foundation model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22899 2026-03-25 cs.RO 83%

Agile-VLA: Few-Shot Industrial Pose Rectification via Implicit Affordance Anchoring

Agile-VLA: 通过隐式 affordance 锚定实现少样本工业姿态校正

Teng Yan, Zhengyang Pei, Chengyu Shi, Yue Yu, Yikun Chen, Zilong Zhu, Zelin Fang, Kaile Guo, Zihang Wang, Peigen Tian, Bingzhuo Zhong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出Agile-VLA框架,通过隐式affordance锚定机制将几何视觉线索映射为参数化动作原语,减少对高延迟语义推理的依赖,实现边缘设备上的高频率动态操作控制。

Comments 8 pages. Submitted to IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 57%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23392 2026-03-25 cond-mat.mes-hall 50%

Strain-Engineered Deterministic Quantum Dots for Telecom O-Band Emission Using Buried Stressors

应变工程确定性量子点用于电信O波段发射的埋压应变器

Imad Limame, Ching-Wen Shih, Kartik Gaur, Martin Podhorský, Sarthak Tripathi, Setthanat Wijitpatima, Aris Koulas-Simos, Chirag C. Palekar, Petr Klenovský, Stephan Reitzenstein

专题命中 VLA模型 :action model(abstract)

AI总结 通过埋压应变器实现电信O波段发射,利用应变场调控量子点发射波长和位置选择性生长,实现高相干性量子光源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00321 2026-03-25 astro-ph.GA 50%

Investigating the origin of radio emission in candidate super-Eddington accreting black holes

研究候选超埃登顿吸积黑洞的射电发射起源

Marie-Lou Gendron-Marsolais, Paola Marziani, Marco Berton, Emilia Järvelä, Ascensión del Olmo, Mark Sargent, Mauro D'Onofrio, Luca Crepaldi, Ancor Damas-Segovia, Brian Punsly, Lourdes Verdes-Montenegro

专题命中 VLA模型 :VLA(abstract)

AI总结 研究18个超埃登顿候选黑洞的射电发射起源,结合多波段观测数据,发现7个主要来自恒星形成,6个来自恒星形成与活动星系核机制的组合,3个可能仅来自喷流。

Comments 27 pages, 14 figures, Accepted for publication in A&A

Journal ref A&A 707, A388 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22657 2026-03-25 astro-ph.GA 50%

The Two Component Circumgalactic Medium Emission around z~2 Radio-loud Quasars

z~2射电源周围双组分环状星系际介质发射

Sanchit Sabhlok, Shelley A. Wright, Andrey Vayner, Norman Murray, Lee Armus, Maren Cosens, James Wiley, Eileen Meyer, Karthik Reddy, Marie Wingyee Lau

专题命中 VLA模型 :VLA(abstract)

AI总结 研究z~2强辐射体周围环状星系际介质的Lyα、He II和C IV发射特征,发现内层介质亮度更高,推测其由类星体辐射激发,外层介质受湍流和环境影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22557 2026-03-25 hep-ex 50%

First search for sterile neutrino oscillation leading to $ν_μ$ disappearance in the Booster Neutrino Beam at ICARUS

首次探测到中微子振荡导致μ中微子消失的 Booster 中微子束流在 ICARUS 中

ICARUS Collaboration

专题命中 VLA模型 :action model(abstract)

AI总结 ICARUS探测器利用Booster中微子束流研究μ中微子消失,通过分析数据和模拟结果,未发现显著消失现象,首次提出中微子振荡分析。

Comments 35 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22417 2026-03-25 astro-ph.GA 50%

CHANG-ES. XXXVIII. A Thin Radio Halo Shaped by Slow Cosmic-Ray Transport in the Quiescent Galaxy NGC 4565

CHANG-ES. 第38篇. 由慢宇宙射线传输塑造的静止星系NGC 4565薄无线电晕

Jianghui Xu, Jiang-Tao Li, Guilin Liu, Luan Luan, Volker Heesen, Rainer Beck, Judith Irwin, Q. Daniel Wang, Michael Stein, Li-Yuan Lu, Yang Yang, Jeroen Stil, Jayanne English, Ralf-Jürgen Dettmar

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过VLA C阵S波段观测NGC 4565的无线电连续辐射,发现其垂直紧凑的无线电晕,由双峰高斯分布描述,磁场均弱且盘面平行,推测由慢宇宙射线传输导致无扩展无线电晕。

Comments 19 pages, 10 figures, 4 tables, accepted for publication in The Astrophysical Journal

详情

展开后加载摘要…

URL PDF HTML 收藏