arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-10 至 2026-04-10 共收录 9 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9 篇

2512.09928 2026-04-10 cs.RO 91%

HiF-VLA: Hindsight, Insight and Foresight through Motion Representation for Vision-Language-Action Models

HiF-VLA:通过运动表示实现视觉-语言-动作模型的回顾、洞察与前瞻性

Minghui Lin, Pengxiang Ding, Shu Wang, Zifeng Zhuang, Yang Liu, Xinyang Tong, Wenxuan Song, Shangke Lyu, Siteng Huang, Donglin Wang

机构 * Westlake University(西湖大学) Zhejiang University(浙江大学) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学) Westlake Robotics(西湖机器人)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 HiF-VLA通过运动表示提升视觉-语言-动作模型的时序推理能力,采用回顾、洞察和前瞻性机制,在长时域任务中表现优异,且推理延迟低。

Comments CVPR 2026, Project page: https://hifvla.github.io, Github: https://github.com/OpenHelix-Team/HiF-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20231 2026-04-10 cs.RO cs.CV 89%

UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models

UniLACT:基于深度的RGB潜在动作学习用于视觉-语言-动作模型

Manish Kumar Govind, Dominick Reilly, Pu Wang, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,comments);分类 cs.RO、cs.CV

AI总结 UniLACT通过引入深度感知的潜在预训练,提升视觉-语言-动作模型的空间先验能力,实验表明其在模拟和现实任务中优于基于RGB的潜在动作方法。

Comments https://manishgovind.github.io/unilact-vla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25044 2026-04-10 cs.RO 88%

ThermoAct:Thermal-Aware Vision-Language-Action Models for Robotic Perception and Decision-Making

ThermoAct:面向机器人感知与决策的热感知视觉-语言-动作模型

Young-Chae Son, Dae-Kwan Ko, Yoon-Ji Choi, Soo-Chul Lim

机构 * Dongguk University(东国大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 本文提出一种融合热信息的视觉-语言-动作框架,通过高阶规划器解析自然语言指令并分解为子任务,提升机器人复杂操作的执行效率与安全性。

Comments 2026 RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12710 2026-04-10 cs.RO 83%

Reflection-Based Task Adaptation for Self-Improving VLA

基于反射的任务适应用于自我改进的VLA

Baicheng Li, Dong Wu, Zike Yan, Xinchen Liu, Lusong Li, Zecui Zeng, Hongbin Zha

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) JD Explore Academy(京东探索研究院) AIR, Tsinghua University(清华大学智能产业研究院)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出反射式自我适应框架,通过双路径架构实现快速自主任务适应,结合失败驱动的强化学习与成功驱动的质量引导微调,提升机器人在复杂任务中的适应效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08266 2026-04-10 cs.CV 70%

Orion-Lite: Distilling LLM Reasoning into Efficient Vision-Only Driving Models

Orion-Lite:将LLM推理能力蒸馏到高效视觉-only驾驶模型

Jing Gu, Niccolò Cavagnero, Gijs Dubbelman

机构 * Eindhoven University of Technology(埃因霍温理工大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

AI总结 本文提出Orion-Lite,通过潜特征蒸馏和真实轨迹监督,在闭环评估中实现高效视觉-only驾驶模型,超越大规模VLA模型ORION,达到Bench2Drive基准的80.6 Driving Score。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 57%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08259 2026-04-10 hep-ex 50%

Recent Neutrino Oscillation and Cross-Section Results from the T2K Experiment

T2K实验近期中微子振荡与截面结果

Nick Latham

专题命中 VLA模型 :action model(abstract)

AI总结 T2K实验通过近端探测器降低系统误差,提供高统计量的中微子-核相互作用截面测量,最新结果包含首个含钆远端探测器数据,展示相互作用建模与振荡分析在寻找电荷-宇称违反中的协同作用。

Comments This contribution was presented as a talk at the NuPhys2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07936 2026-04-10 astro-ph.HE 50%

The Type IIn SN 2025cbj coincidence with the high-energy neutrino IceCube-250421A

IC250421A与I型II超新星2025cbj的巧合

S. Garrappa, E. A. Zimmerman, T. Wasserman, E. O. Ofek, A. Gal-Yam, R. Konno, P. Chen, O. Yaron, S. Ben-Ami, C. M. Copperwheat, S. Fainer, A. Horowicz, A. Humpe, P. A. Mazzali, D. Polishook, E. Segre, S. A. Spitzer

专题命中 VLA模型 :action model(abstract)

AI总结 研究I型II超新星SN2025cbj与高能中微子IceCube-250421A的关联,评估其可能的中微子产量,并通过模拟分析其巧合概率。

Comments Published in A&A

Journal ref A&A 708, A223 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13933 2026-04-10 astro-ph.HE astro-ph.IM 50%

Prospects for Deep-Learning-Based Mass Reconstruction of Ultra-High-Energy Cosmic Rays using Simulated Air-Shower Profiles

基于深度学习的超高能宇宙射线质量重建的前景:利用模拟空气簇射剖面

Zhuoyi Wang, Eric Mayotte, Sonja Mayotte, Nathan Woo, Julia Burton-Heibges, Nicolas San Martin, Cailyn Smith

专题命中 VLA模型 :action model(abstract)

AI总结 本文利用深度学习方法从模拟的广泛空气簇射剖面中直接预测初级粒子的质量,通过训练和验证模型,展示了其在质量敏感性方面的改进,优于传统方法。

Comments 24 Pages, 8 Figures, 12 Tables, Prepared for Submission to JCAP. V2 typo fix in author names. V3 post feedback, added tables and plots. V4 post review. V5 post 2nd review, sigificant analysis added

详情

展开后加载摘要…

URL PDF HTML 收藏