arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-08 至 2026-04-08 共收录 19 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2604.05323 2026-04-08 cs.CV cs.RO 91%

VLA-InfoEntropy: A Training-Free Vision-Attention Information Entropy Approach for Vision-Language-Action Models Inference Acceleration and Success

VLA-InfoEntropy:一种无需训练的视觉-注意力信息熵方法,用于视觉-语言-动作模型的推理加速与成功

Chuhang Liu, Yayun He, Zuheng Kang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);action model(title);分类 cs.RO、cs.CV

AI总结 本文提出VLA-InfoEntropy方法,通过图像熵和注意力熵结合时间步信息,动态调整模型关注区域,减少冗余并提升推理效率。

Comments Accepted to the 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 89%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV、cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05595 2026-04-08 cs.RO cs.CV 88%

Uncovering Linguistic Fragility in Vision-Language-Action Models via Diversity-Aware Red Teaming

通过多样性感知的红队行动揭示视觉-语言-动作模型中的语言脆弱性

Baoshun Tong, Haoran He, Ling Pan, Yang Liu, Liang Lin

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出DAERT框架,通过评估统一策略生成多样化挑战性指令,揭示VLA模型在语言变化下的脆弱性,实验显示任务成功率从93.33%降至5.85%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23202 2026-04-08 cs.CV 88%

Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的目光正则化

Anupam Pani, Yanchao Yang

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.CV

AI总结 本文提出一种目光正则化框架,通过将目光热图转换为补丁分布,并利用KL散度正则化Transformer注意力,提升机器人操作任务的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05614 2026-04-08 cs.RO 88%

Grounding Hierarchical Vision-Language-Action Models Through Explicit Language-Action Alignment

通过显式语言-动作对齐实现层次化视觉-语言-动作模型的 grounding

Theodor Wulff, Federico Tavella, Rahul Singh Maharjan, Manith Adikari, Angelo Cangelosi

机构 * The University of Manchester(曼彻斯特大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出通过显式语言-动作对齐训练框架,提升视觉-语言-动作模型的 grounding 能力,基于 LanguageTable 数据集验证了多模态 grounding 表示的有效性,并建立强基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24935 2026-04-08 cs.RO 88%

SABER: A Stealthy Agentic Black-Box Attack Framework for Vision-Language-Action Models

SABER:一种针对视觉-语言-动作模型的隐秘代理黑盒攻击框架

Xiyang Wu, Guangyao Shi, Qingzi Wang, Zongxia Li, Amrit Singh Bedi, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Southern California(南加州大学) University of Central Florida(中佛罗里达大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 SABER通过生成最小有效指令修改,评估VLA模型的鲁棒性,展示小幅度指令扰动可显著降低机器人执行效果,且代理黑盒方法在红队测试中表现高效且可扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20309 2026-04-08 cs.LG 88%

QuantVLA: Scale-Calibrated Post-Training Quantization for Vision-Language-Action Models

QuantVLA: 用于视觉-语言-动作模型的可扩展后训练量化

Jingxuan Zhang, Yunta Hsieh, Zhongwei Wan, Haokun Lin, Xin Wang, Ziqi Wang, Yingtie Lei, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.LG

AI总结 QuantVLA是一种无需训练的后训练量化框架,首次应用于视觉-语言-动作系统,并成功量化了扩散变换器(DiT)动作头,通过三种可扩展组件实现了高效的低比特量化,显著提升任务成功率并降低内存消耗。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06748 2026-04-08 cs.RO 85%

On-the-Fly VLA Adaptation via Test-Time Reinforcement Learning

实时VLA适应 via 测试时强化学习

Changyu Liu, Yiyang Liu, Taowen Wang, Qiao Zhuang, James Chenhao Liang, Wenhao Yang, Renjing Xu, Qifan Wang, Dongfang Liu, Cheng Han

机构 * University of Missouri–Kansas City(密苏里大学堪萨斯城分校) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) U. S. Naval Research Laboratory(美国海军研究实验室) Lamar University(拉马尔大学) Meta AI Rochester Institute of Technology(罗彻斯特理工学院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 本文提出TT-VLA框架,通过测试时强化学习实现VLA模型的实时策略适应,提升机器人在动态环境中的适应性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16811 2026-04-08 cs.CV cs.RO 84%

GeoPredict: Leveraging Predictive Kinematics and 3D Gaussian Geometry for Precise VLA Manipulation

GeoPredict: 借助预测运动学和3D高斯几何实现精确VLA操作

Jingjing Qian, Boyao Han, Chen Shi, Lei Xiao, Long Yang, Shaoshuai Shi, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Voyager Research, Didi Chuxing(滴滴出行沃歌研究)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 GeoPredict通过引入轨迹级模块和预测3D高斯几何模块,提升VLA模型在3D空间推理中的精度,实验表明其在几何密集和空间要求高的任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05765 2026-04-08 cs.AI 83%

RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training

RL-VLA$^3$:一种灵活且异步的强化学习框架用于VLA训练

Haoran Sun, Yongjian Guo, Zhong Guan, Shuai Di, Xiaodong Bai, Jing Long, Tianyun Zhao, Mingxi Luo, Hongke Zhao, Likang Wu, Xiaotie Deng, Xu Chu, Xi Xiao, Sheng Wen, Yicheng Gong, Junwu Xiong

机构 * Peking University(北京大学) Tsinghua University(清华大学) Tianjin University(天津大学) JDT AI Infra(京东科技AI基础设施) Swinburne University of Technology(斯威本科技大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.AI

AI总结 本文提出RL-VLA$^3$,一种异步强化学习框架,通过动态批调度和灵活环境分片策略,提升VLA训练效率,实验显示其在8至256GPU上均取得85.2%的吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05525 2026-04-08 cs.GR 82%

CrowdVLA: Embodied Vision-Language-Action Agents for Context-Aware Crowd Simulation

CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理

Juyeong Hwang, Seong-Eun Hong, Jinhyun Kim, JaeYoung Seon, Giljoo Nam, Hanyoung Jang, HyeongYeop Kang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract)

AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25661 2026-04-08 cs.RO cs.CV 81%

Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance

Fast-dVLA:加速离散扩散VLA以实现实时性能

Wenxuan Song, Jiayi Chen, Shuai Chen, Jingbo Wang, Pengxiang Ding, Han Zhao, Yikai Qin, Xinhu Zheng, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ShanghaiTech University(上海科技大学) Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所) AIR, Tsinghua University(清华大学智能产业研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种方法,通过分离辅助任务训练目标,在参数空间中提升通用能力与任务特定动作分布,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05656 2026-04-08 cs.CV cs.AI 73%

SnapFlow: One-Step Action Generation for Flow-Matching VLAs via Progressive Self-Distillation

SnapFlow:通过渐进式自我蒸馏实现流匹配视觉-语言-动作模型的一步动作生成

Wuyang Luan, Junhui Li, Weiguang Zhao, Wenjian Zhang, Tieru Wu, Rui Ma

机构 * Jilin University(吉林大学) Chongqing University(重庆大学) University of Liverpool(利物浦大学) GenY

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV、cs.AI

AI总结 SnapFlow通过渐进式自我蒸馏将多步去噪压缩为单步前向传递,提升流匹配VLA模型的效率,减少延迟并提高成功率。

Comments 10 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04967 2026-04-08 cs.RO cs.LG 73%

Belief Dynamics for Detecting Behavioral Shifts in Safe Collaborative Manipulation

信念动力学在安全协作操作中检测行为转变

Devashri Naik, Divake Kumar, Nastaran Darabi, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.LG

AI总结 本文研究了在非平稳环境中通过信念跟踪模块检测行为转变,提出UA-TOM方法在协作操作中显著降低碰撞风险,同时在跨领域实验中验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV 57%

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04360 2026-04-08 stat.ME 50%

Generalized win fraction regression for composite survival endpoints

复合生存终点的广义胜利分数回归

Zhiqiang Cao, Xi Fang, Fan Li

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种广义胜利分数回归框架,用于优先考虑的复合生存终点。通过选择链接函数建模条件胜利分数,统一处理多组件时间到事件终点。采用逆概率删失加权估计方程处理右删失,建立了新的效应度量。通过模拟检验了方法的有限样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21676 2026-04-08 astro-ph.GA 50%

AVID: A Near-Major Post-Merger of Late-Type Dwarfs beneath a Regularly Rotating HI Disk (VCC 693)

AVID:一个近主次后并的晚型矮星系位于一个规律旋转的HI盘下(VCC 693)

Fujia Li, Hong-Xin Zhang, Elias Brinks, Se-Heon Oh, Rory Smith, Zesen Lin, Weibin Sun, Yu-Zhu Sun, Tie Li, Minsu Kim, Jaebeom Kim, Lijun Chen, Lanyue Zhang, Patrick Côté, Alessandro Boselli, Pierre-Alain Duc, Laura Ferrarese, Matteo Fossati, Stephen Gwyn, Xu Kong, Sanjaya Paudel, Eric W. Peng, Thomas H. Puzia, Rubén Sánchez-Janssen, Matthew Taylor, Yinghe Zhao

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过高分辨率观测和模拟分析VCC 693的并合遗迹,发现其由近主次并合形成,HI气体形成规律旋转盘,星系结构与普通矮星系相似。

Comments 19 pages (excluding appendices), 16 figures (excluding appendices), Accepted for publication in Astronomy & Astrophysics

Journal ref A&A 708, A233 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05512 2026-04-08 hep-ex 50%

Measurement of charged-particle production in $\sqrt{s_\text{NN}}=9.62$ TeV proton-oxygen collisions as a probe of cosmic-ray air showers with the ATLAS detector

在$\sqrt{s_\text{NN}}=9.62$ TeV质子-氧碰撞中测量带电粒子产生作为宇宙射线大气切片的探针

ATLAS Collaboration

专题命中 VLA模型 :action model(abstract)

AI总结 利用ATLAS探测器测量质子-氧碰撞中带电粒子产生,通过高精度测量改进宇宙射线大气切片模型,对高能物理研究具有重要意义。

Comments 36 pages in total, author list starting page 19, 2 figures, submitted to Phys. Rev. Lett. All figures including auxiliary figures are available at https://atlas.web.cern.ch/Atlas/GROUPS/PHYSICS/PAPERS/STDM-2025-08

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04242 2026-04-08 astro-ph.GA astro-ph.HE 50%

Active Galactic Nuclei-driven Metallicity Enrichment in the Interstellar Medium of Mrk 573

活动星系核驱动的金属丰度增强在Mrk 573的星际介质中

D. Ł. Król, P. Zhu, G. Fabbiano, M. Elvis, L. J. Kewley, N. Murray, R. Middei, A. Trindade-Falcão

专题命中 VLA模型 :VLA(abstract)

AI总结 研究通过空间分辨观测揭示Mrk 573中活动星系核驱动的金属丰度增强,利用不同金属丰度校准和N/O-O/H比例关系,发现金属分布与高Seyfert/LINER指数区域及射电喷流相关,表明金属来自核区的风、喷流或流出物。

Comments Accepted for publication in ApJ Letters

详情

展开后加载摘要…

URL PDF HTML 收藏