arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2601.05241 2026-01-09 cs.CV cs.AI cs.RO 67%

RoboVIP: Multi-View Video Generation with Visual Identity Prompting Augments Robot Manipulation

RoboVIP: 多视角视频生成与视觉身份提示增强机器人操作

Boyang Wang, Haoran Zhang, Shujie Zhang, Jinkun Hao, Mingda Jia, Qi Lv, Yucheng Mao, Zhaoyang Lyu, Jia Zeng, Xudong Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Michigan(密歇根大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 RoboVIP通过引入视觉身份提示和可扩展的视觉身份池,提升机器人操控数据的质量与多样性,从而增强视觉语言-动作和视觉-运动政策模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26002 2025-10-01 cs.AI cs.HC cs.LG cs.MA cs.RO 67%

Towards Human Engagement with Realistic AI Combat Pilots

Ardian Selmonaj, Giacomo Del Rio, Adrian Schneider, Alessandro Antonucci

机构 * Istituto Dalle Molle di Studi sull’Intelligenza Artificiale(日内瓦智能研究 institute) Armasuisse Science+Technology(阿姆斯瓦尔科学与技术)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 13th International Conference on Human-Agent Interaction (HAI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11091 2025-09-03 cs.LG cs.AI cs.CV quant-ph 67%

Deep Tensor Network

Yifan Zhang

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00379 2025-06-13 cs.CV cs.AI cs.LG 67%

Latent Action Learning Requires Supervision in the Presence of Distractors

Alexander Nikulin, Ilya Zisman, Denis Tarasov, Nikita Lyubaykin, Andrei Polubarov, Igor Kiselev, Vladislav Kurenkov

机构 * Innopolis University(因诺波利斯大学) Research Center for Trusted Artificial Intelligence, ISP RAS(可信人工智能研究所以及ISP俄罗斯科学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments ICML 2025, Poster, Project Page: https://laom.dunnolab.ai/, Source code: https://github.com/dunnolab/laom

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15106 2025-05-07 cs.CV cs.AI cs.LG 67%

About Time: Advances, Challenges, and Outlooks of Action Understanding

Alexandros Stergiou, Ronald Poppe

机构 * University of Twente(特文特大学) Utrecht University(乌特雷赫大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted at the International Journal of Computer Vision (IJCV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15672 2025-02-24 cs.CV cs.AI cs.RO 67%

VaViM and VaVAM: Autonomous Driving through Video Generative Modeling

Florent Bartoccioni, Elias Ramzi, Victor Besnier, Shashanka Venkataramanan, Tuan-Hung Vu, Yihong Xu, Loick Chambon, Spyros Gidaris, Serkan Odabas, David Hurych, Renaud Marlet, Alexandre Boulch, Mickael Chen, Éloi Zablocki, Andrei Bursuc, Eduardo Valle, Matthieu Cord

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Code and model: https://github.com/valeoai/VideoActionModel, project page: https://valeoai.github.io/vavim-vavam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.17827 2024-11-12 cs.CV cs.AI cs.CL cs.LG 67%

Unified Lexical Representation for Interpretable Visual-Language Alignment

Yifan Li, Yikai Wang, Yanwei Fu, Dongyu Ru, Zheng Zhang, Tong He

专题命中 VLA模型 :VLA(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.11905 2024-07-09 cs.AI cs.LG cs.RO 67%

Grounded Relational Inference: Domain Knowledge Driven Explainable Autonomous Driving

Chen Tang, Nishan Srishankar, Sujitha Martin, Masayoshi Tomizuka

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

Comments 19 pages, 15 figures, IEEE Transactions on Intelligent Transportation Systems (T-ITS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15391 2024-02-26 cs.LG cs.AI cs.CV 67%

Genie: Generative Interactive Environments

Jake Bruce, Michael Dennis, Ashley Edwards, Jack Parker-Holder, Yuge Shi, Edward Hughes, Matthew Lai, Aditi Mavalankar, Richie Steigerwald, Chris Apps, Yusuf Aytar, Sarah Bechtle, Feryal Behbahani, Stephanie Chan, Nicolas Heess, Lucy Gonzalez, Simon Osindero, Sherjil Ozair, Scott Reed, Jingwei Zhang, Konrad Zolna, Jeff Clune, Nando de Freitas, Satinder Singh, Tim Rocktäschel

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments https://sites.google.com/corp/view/genie-2024/

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.10592 2022-08-24 cs.RO cs.AI cs.LG 67%

DIDER: Discovering Interpretable Dynamically Evolving Relations

Enna Sachdeva, Chiho Choi

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.04575 2022-06-10 cs.CV cs.AI cs.IR cs.LG 67%

Transformer based Urdu Handwritten Text Optical Character Reader

Mohammad Daniyal Shaiq, Musa Dildar Ahmed Cheema, Ali Kamal

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.04796 2022-05-04 cs.CV cs.AI cs.LG 67%

SOS! Self-supervised Learning Over Sets Of Handled Objects In Egocentric Action Recognition

Victor Escorcia, Ricardo Guerrero, Xiatian Zhu, Brais Martinez

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.10091 2021-09-10 cs.CV cs.AI cs.RO 67%

Label Efficient Visual Abstractions for Autonomous Driving

Aseem Behl, Kashyap Chitta, Aditya Prakash, Eshed Ohn-Bar, Andreas Geiger

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

Comments International Conference on Intelligent Robots and Systems (IROS), 2020. First two authors contributed equally, listed in alphabetical order

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.06704 2021-01-19 cs.AI cs.CR cs.CV cs.LG 67%

Adversarial Interaction Attack: Fooling AI to Misinterpret Human Intentions

Nodens Koren, Qiuhong Ke, Yisen Wang, James Bailey, Xingjun Ma

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2007.11668 2020-07-24 cs.CL cs.AI cs.CV cs.RO 67%

Analogical Reasoning for Visually Grounded Language Acquisition

Bo Wu, Haoyu Qin, Alireza Zareian, Carl Vondrick, Shih-Fu Chang

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
0806.0327 2009-12-01 astro-ph 67%

Predicting low-frequency radio fluxes of known extrasolar planets

J. -M. Grießmeier, P. Zarka, H. Spreeuw

专题命中 VLA模型 :VLA(abstract);action model(abstract)

Comments 4 figures; Table 1 is available in electronic form at the CDS via anonymous ftp to cdsarc.u-strasbg.fr (130.79.128.5) or via http://cdsweb.u-strasbg.fr/cgi-bin/qcat?J/A+A/475/359

Journal ref Astron.Astrophys.475:359-368,2007

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交 62%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: https://carldegio.github.io/latent_action.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18555 2026-08-20 cs.LG cs.AI 新提交 62%

Performance Drift Detection in Machine Learning as a Service (MLaaS) for IoT Environments

物联网环境下机器学习即服务(MLaaS)的性能漂移检测

Deepak Kanneganti, Sajib Mistry, Sheik Mohammad Mostakim Fattah, Erik Elmroth, Aneesh Krishna, Monowar Bhuyan

机构 * Curtin University(科廷大学) Umeå University(于默奥大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 针对物联网环境下MLaaS客户端为黑盒的漂移检测难题,提出MPDD模型与APDDM机制,实验显示二者可显著提升检测准确率、降低漏检率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14655 2026-08-18 cs.LG cs.CV 新提交 62%

Diagnosing and Mitigating Perception-Decision Misalignment in Omni-LLMs via Modality Subspace Activation

通过模态子空间激活诊断并缓解全模态大语言模型(Omni-LLMs)中的感知-决策失配问题

Hongbo Jiang, Jie Li, Yunhang Shen, Tianyu Xie, Pingyang Dai

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.LG

AI总结 针对Omni-LLMs存在的感知-决策失配问题,本文提出因果模态敏感性及对应诊断方法,构建CausalMSBench数据集,提出无需训练的MSA框架以恢复模型的因果模态敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05950 2026-08-18 cs.CV cs.AI 版本更新 62%

Reprojection-Guided 3D Gaussian Splatting Diffusion for Weakly Supervised Single-Image Normal Estimation

CLONE: 基于3DGS的闭环可微优化框架用于单图像法线估计

Yanxing Liang, Yinghui Wang, Wei Li, Tao Yan, Jiaxing Shen

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University, Wuxi, China(江南大学人工智能与计算机科学学院,中国无锡) School of Data Science, Lingnan University, Hong Kong, China(岭南大学数据科学学院,中国香港)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 提出CLONE框架,通过3D高斯泼溅参数化场景并利用协方差特征分解得到连续可微法线,结合可微光照模型和一步确定性扩散精化网络,在统一重投影目标下联合优化,实现无需真值法线监督的几何一致性单图像法线估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17017 2026-08-04 cs.IR cs.AI cs.LG 版本更新 62%

WHALE: A Scalable Unified Model for Recommendation with Wukong-HSTU Architecture

WHALE:一种采用悟空 - HSTU 架构的可扩展统一推荐模型

Renqin Cai, Dawei Sun, Yuanjun Yao, Zhiyong Wang, Velvin Fu, Maggie Zhuang, Yu Shi, Zhongnan Fang, Xuan Cao, Jing Qian, Rui Li

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究如何在推荐建模中统一非序列与序列特征。核心方法是基于悟空和 HSTU 架构构建 WHALE 模型,含特定模块与融合方式,并采用协同设计技术。主要贡献是在工业数据上离线实验有收益,在线也有积极效果且已用于生产系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21290 2026-07-24 cs.LG cs.AI 新提交 62%

Multi-Task Learning for Heterogeneous Prediction from Video Game State with Transfer Learning

基于迁移学习的视频游戏状态异构预测多任务学习

Jonas Peché, Aliaksei Tsishurou, Alexander Zap, Günter Wallner

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究视频游戏状态异构预测,通过适配多模态架构,采用跨任务联合训练共享模型,结合多种信息,经实验比较单多任务训练、评估策略及测试预训练等,还研究游戏内迁移,以降低成本并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00572 2026-07-16 cs.CV cs.AI 62%

Integrating Skeleton Based Representations for Robust Yoga Pose Classification Using Deep Learning Models

基于骨架表示的瑜伽姿势分类深度学习模型整合

Mohammed Mohiuddin, Syed Mohammod Minhaz Hossain, Sumaiya Khanam, Prionkar Barua, Aparup Barua, MD Tamim Hossain

机构 * Department of Computer Science and Engineering, Premier University(计算机科学与工程系,普里梅尔大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Yoga-16数据集,系统评估了三种深度学习模型,证明骨架表示在瑜伽姿势分类中优于原始图像,VGG16结合MediaPipe骨架输入达到96.09%的准确率。

Journal ref Article number: 22144 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04648 2026-07-07 cs.LG cs.AI 新提交 62%

Machine Learning for Depression Screening and Intervention: an Original Circadian Rhythm Score-based Methodology

用于抑郁症筛查和干预的机器学习:一种基于昼夜节律评分的原创方法

Bin Wang, Shuo Lian, Yuanyuan Hou, Dexian Wang, Peilan He, Feng Hong, Yanwei Yu, Tianrui Li

机构 * Ocean University of China(中国海洋大学) The Affiliated Hospital of Qingdao University(青岛大学附属医院) Chengdu University of Traditional Chinese Medicine(成都中医药大学) Southwest Jiaotong University(西南交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大规模行为数据筛查抑郁症的挑战,提出昼夜节律评分(CRS),构建可解释筛查框架及干预推理方法,通过实验验证其有效性,为抑郁症筛查和干预提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09938 2026-07-07 cs.RO cs.LG 版本更新 62%

CableTract: A Co-Designed Cable-Driven Field Robot for Low-Compaction, Off-Grid Capable Agriculture

CableTract:一种低压实、离网能力的农业电缆驱动田间机器人

Ozgur Yilmaz

机构 * Adana Science and Technology University(阿达纳科学与技术大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.LG

AI总结 本文提出CableTract电缆驱动农业机器人,通过共设计电缆架构与实施库,实现低压实和离网作业,结合多种模型分析能量效率与经济性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16809 2026-07-07 cs.RO cs.AI 版本更新 62%

CABTO: Context-Aware Behavior Tree Grounding for Robot Manipulation

CABTO:面向机器人操作的上下文感知行为树接地

Yishuai Cai, Xinglin Chen, Yunxin Mao, Kun Hu, Yaodong Yang, Yuanpei Chen, Wenjing Yang, Ji Wang, Minglong Li

机构 * National University of Defense Technology(国防科技大学) PsiBot Peking University(北京大学) PKU-Psibot Lab(北京大学-PsiBot实验室)

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出CABTO框架,通过预训练大模型和上下文反馈,自动构建完整且一致的行为树系统,解决机器人操作中行为树接地的复杂性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22054 2026-07-07 cs.CV cs.AI 版本更新 62%

MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources

MetricAnything:利用噪声异构源扩展度量深度预训练

Baorui Ma, Jiahui Yang, Donglin Di, Xuancheng Zhang, Jianxun Cui, Hao Li, Yan Xie, Wei Chen

机构 * Li Auto Inc(李自动公司)

专题命中 VLA模型 :VLA(abstract);分类 cs.CV、cs.AI

AI总结 研究针对度量深度估计扩展难题,提出MetricAnything框架,通过随机掩码创建稀疏度量提示解耦空间推理与偏差,用多样3D数据预训练,在多任务中表现出色,推动度量感知发展。

Comments Accepted to ECCV 2026. Project Page: https://metric-anything.github.io/metric-anything-io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15061 2026-07-07 cs.RO cs.CV 版本更新 62%

Ask-to-Clarify: Resolving Instruction Ambiguity through Multi-turn Dialogue

Ask-to-Clarify: 通过多轮对话解决指令歧义

Xingyao Lin, Xinghao Zhu, Tianyi Lu, Guojin Zhong, Sicheng Xie, Hui Zhang, Xipeng Qiu, Zuxuan Wu, Yu-Gang Jiang

机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院) Mechanical Systems Control Lab, UC Berkeley, California, USA(伯克利机械系统控制实验室)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO、cs.CV

AI总结 本文提出Ask-to-Clarify框架,通过多轮对话解决指令歧义问题,结合视觉语言模型和扩散模型,采用两阶段知识绝缘策略训练,实现多任务中更高效的协作式具身代理。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25434 2026-06-25 cs.LG cs.AI 新提交 62%

Interpretable Concept-Guided Polynomial Tabular Kolmogorov-Arnold Network for EEG-Based Mild Cognitive Impairment Detection

可解释概念引导的多项式表格Kolmogorov-Arnold网络用于基于EEG的轻度认知障碍检测

Yosef Bernardus Wirian, Qiang Cheng

机构 * Computer Science Department, University of Kentucky(肯塔基大学计算机科学系) Institute for Biomedical Informatics, University of Kentucky(肯塔基大学生物医学信息学研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出CPTabKAN模型,通过概念编码、二阶多项式交互和傅里叶参数化TabKAN分类器,在睡眠EEG数据上实现MCI检测,F1达0.9038。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25753 2026-06-25 cs.LG cs.AI math.OC physics.comp-ph physics.optics 新提交 62%

Gradient-based inverse lithography for EUV masks via the waveguide method and a physics-informed neural operator

基于梯度方法的EUV掩模逆光刻:波导方法与物理信息神经算子

Vasiliy A. Es'kin, Egor V. Ivanov

机构 * University of Nizhny Novgorod(下诺夫哥罗德大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于梯度方法的极紫外掩模逆光刻技术,利用可微波导方法和波导神经算子作为端到端物理引擎,通过自动微分恢复掩模吸收体介电常数,实验验证了在多种材料下实现所需晶圆场。

详情

展开后加载摘要…

URL PDF HTML 收藏