arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9819 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9146 篇

2604.02736 2026-04-14 cs.CV 57%

THOM: Generating Physically Plausible Hand-Object Meshes From Text

THOM:从文本生成物理合理的手-物体网格

Uyoung Jeong, Yihalem Yimolal Tiruneh, Hyung Jin Chang, Seungryul Baek, Kwang In Kim

机构 * UNIST(蔚山科学技术院) University of Birmingham(伯明翰大学) POSTECH(浦项科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 THOM通过两阶段流程从文本生成物理合理的手-物体网格,无需模板网格,结合物理优化和视觉语言模型提升交互合理性。

Comments accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08084 2026-04-10 cs.CV 57%

DiffVC: A Non-autoregressive Framework Based on Diffusion Model for Video Captioning

DiffVC: 一种基于扩散模型的非自回归框架用于视频描述生成

Junbo Wang, Liangyu Fu, Yuke Li, Yining Zhu, Ya Jing, Xuecheng Wu, Jiangbin Zheng

机构 * School of Software, Northwestern Polytechnical University(西北工业大学软件学院) School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Beijing University Of Technology(北京工业大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出DiffVC,一种基于扩散模型的非自回归框架,解决视频描述生成中自回归方法速度慢和累积误差问题,通过并行解码和判别性条件扩散模型提升生成质量,实验表明其在多个数据集上优于非自回归方法并接近自回归方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV 57%

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 57%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26433 2026-04-07 cs.LG 57%

Co-Evolving Latent Action World Models

共演潜在动作世界模型

Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, Jiang Bian

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出CoLA-World,通过关键预热阶段实现联合学习,解决世界模型与动作模型的协同问题,提升视频模拟质量和下游视觉规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03652 2026-04-07 cs.CV 57%

Motion-Adaptive Multi-Scale Temporal Modelling with Skeleton-Constrained Spatial Graphs for Efficient 3D Human Pose Estimation

具有骨骼约束空间图的运动自适应多尺度时间建模用于高效的3D人体姿态估计

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出MASC-Pose框架,通过自适应多尺度时间建模模块和骨骼约束自适应图卷积网络,实现高效3D人体姿态估计,实验验证了其在Human3.6M和MPI-INF-3DHP数据集上的有效性。

Comments Accepted to IJCNN 2026, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03524 2026-04-07 cs.AI 57%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06928 2026-04-06 cs.RO 57%

Failure Mechanisms and Risk Estimation for Legged Robot Locomotion on Granular Slopes

四足机器人在颗粒斜坡上运动的失效机制与风险估计

Xingjue Liao, Feifei Qian

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究四足机器人在颗粒斜坡上的运动失效机制,通过实验建立机器人-地形交互模型,预测锚定时机和步长,揭示斜坡导致性能下降的主要因素是延迟锚定和增加后滑,从而构建失效相图以量化风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22855 2026-04-03 cs.LG 57%

A Review of Neural Networks in Precipitation Prediction

神经网络在降水预测中的应用综述

Yugong Zeng, Jiayuan Wang, Jonathan Wu

机构 * University of Windsor(温莎大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文综述了传统降水预报方法及神经网络在降水预测中的发展,分析了各种模型的优缺点,并探讨了未来多源数据融合和混合物理-数据驱动模型的应用前景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27950 2026-03-31 cs.LG 57%

Scaling Atomistic Protein Binder Design with Generative Pretraining and Test-Time Compute

基于生成预训练和测试时计算的原子级蛋白质结合物设计扩展

Kieran Didi, Zuobai Zhang, Guoqing Zhou, Danny Reidenbach, Zhonglin Cao, Sooyoung Cha, Tomas Geffner, Christian Dallago, Jian Tang, Michael M. Bronstein, Martin Steinegger, Emine Kucukbenli, Arash Vahdat, Karsten Kreis

机构 * NVIDIA(英伟达) University of Oxford(牛津大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔高等商学院) CIFAR AI Chair(CIFAR人工智能主席) AITHYRA School of Biological Sciences, Seoul National University(首尔大学生物科学学院) Interdisciplinary Program in Bioinformatics, Seoul National University(首尔大学生物信息学跨学科项目) Institute of Molecular Biology and Genetics, Seoul National University(首尔大学分子生物学与遗传学研究所) Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出Proteina-Complexa方法,结合生成模型与结构预测,实现高精度蛋白质结合物设计,优于现有生成和幻觉方法,同时扩展至小分子和酶设计。

Comments ICLR 2026 Oral Presentation. Project page: https://research.nvidia.com/labs/genair/proteina-complexa/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27304 2026-03-31 cs.AI cs.MA 57%

EpochX: Building the Infrastructure for an Emergent Agent Civilization

EpochX:构建一个涌现代理文明的基础设施

Huacan Wang, Chaofa Yuan, Xialie Zhuang, Tu Hu, Shuo Zhang, Jun Han, Shi Wei, Daiqiang Li, Jingping Liu, Kunyi Wang, Zihan Yin, Zhenheng Tang, Andy Wang, Henry Peng Zou, Philip S. Yu, Sen Hu, Qizhen Lan, Ronghao Chen

机构 * QuantaAlpha

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 EpochX通过引入信用原生市场基础设施,重构代理AI为组织设计问题,实现可验证工作留下的持久可重用资产,支持可持续的人机协作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27103 2026-03-31 cs.CV 57%

LLM Enhanced Action Recognition via Hierarchical Global-Local Skeleton-Language Model

通过分层全局-局部骨架-语言模型增强动作识别

Ruosi Wang, Fangwei Zuo, Lei Li, Zhaoqiang Xia

机构 * Northwestern Polytechnical University(西北工业大学) Shandong University of Finance and Economics(山东财经大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出HocSLM模型,通过分层全局-局部网络和大视觉-语言模型融合骨架与文本信息,提升动作识别的语义表达和跨模态理解能力,实验表明在三个主流数据集上达到最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24454 2026-03-26 cs.CV 57%

Unleashing Vision-Language Semantics for Deepfake Video Detection

释放视觉-语言语义以进行深度伪造视频检测

Jiawen Zhu, Yunqi Miao, Xueyi Zhang, Jiankang Deng, Guansong Pang

机构 * Singapore Management University(新加坡管理学院) The University of Warwick(沃里克大学) Nanyang Technological University(南洋理工大学) Imperial College London(伦敦帝国理工学院)

专题命中 VLA模型 :VLA(abstract);分类 cs.CV

AI总结 本文提出VLAForge框架,通过ForgePerceiver增强视觉感知并引入身份感知VLA评分,利用跨模态语义提升深度伪造检测的判别能力。

Comments 14 pages, 7 figures, accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 57%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16963 2026-03-24 cs.RO cs.SY eess.SY 57%

A Tactile-based Interactive Motion Planner for Robots in Unknown Cluttered Environments

基于触觉的交互式运动规划器用于未知杂乱环境中的机器人

Chengjin Wang, Yanmin Zhou, Zheng Yan, Feng Luan, Runjie Shen, Hongrui Sang, Zhipeng Wang, Bin He

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出了一种基于触觉的交互式运动规划框架,通过多模态触觉感知实时构建接触模型,从而在未知杂乱环境中安全扩展自由运动空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21231 2026-03-24 cs.CR cs.AI 57%

When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agents

当便利成为风险:主机作用代理中的语义视角下的不足规范

Di Lu, Yongzhi Liao, Xutong Mu, Lele Zheng, Ke Cheng, Xuewen Dong, Yulong Shen, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文探讨主机作用代理中因目标规范不足导致的安全问题,提出语义威胁模型和风险完成模式分类,并通过案例研究分析如何通过明确执行边界来防御风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 57%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14115 2026-03-20 cs.HC cs.LG 57%

Visualization Tasks for Unlabeled Graphs

无标签图的可视化任务

Matt I. B. Oddo, Ryan Smith, Stephen Kobourov, Tamara Munzner

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) Department of Computer Science at the Technical University of Munich(慕尼黑技术大学计算机科学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种数据抽象模型,区分无标签与有标签、属性和增强的图情境,通过分析任务并建立分类体系,探讨无标签图的可视化任务及其评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15927 2026-03-18 cs.LG cs.NA math.DS math.NA 57%

Discovery of interaction and diffusion kernels in particle-to-mean-field multi-agent systems

粒子到均场多智能体系统中相互作用和扩散核的发现

Giacomo Albi, Alessandro Alla, Elisa Calzola

机构 * Department of Computer Science, University of Verona(威尼斯大学计算机科学系) Department of Mathematics, La Sapienza University of Rome(罗马拉维拉大学数学系)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出了一种数据驱动框架,通过轨迹数据直接学习多智能体系统中的非局部相互作用和扩散项,无需先验知识。通过随机批采样和均场近似策略,有效重建了相互作用和扩散核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14289 2026-03-17 cs.LG cs.NA math.NA 57%

Windowed Fourier Propagator: A Frequency-Local Neural Operator for Wave Equations in Inhomogeneous Media

窗口傅里叶传播器:一种频率局部的神经算子用于不均匀介质中的波动方程

Yiyang Cai, Zixuan Qiu, Yunlu Shu, Jiamao Wu, Yingzhou Li, Tianyu Wang, Xi Chen

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出窗口傅里叶传播器,一种频率局部神经算子,用于高效解决不均匀介质中波动方程的模拟问题,通过学习紧凑的局部传播器实现计算效率,保留叠加性以提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08938 2026-03-13 cs.AI 57%

AgentOS: From Application Silos to a Natural Language-Driven Data Ecosystem

AgentOS: 从应用孤岛到由自然语言驱动的数据生态系统

Rui Liu, Tao Zhe, Dongjie Wang, Zijun Yao, Kunpeng Liu, Yanjie Fu, Huan Liu, Jian Pei

机构 * University of Kansas(堪萨斯大学) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Duke University(杜克大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出AgentOS,通过自然语言驱动的数据生态系统,解决传统操作系统与智能代理的适配问题,构建持续的数据挖掘管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09778 2026-03-11 hep-ph cs.AI hep-ex physics.comp-ph 57%

First Estimation of Model Parameters for Neutrino-Induced Nucleon Knockout Using Simulation-Based Inference

利用基于模拟的推断对中微子诱导的核子击穿进行首次参数估计

Karla Tame-Narvaez, Steven Gardiner, Aleksandra Ćiprijanović, Giuseppe Cerati

机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) University of Chicago(芝加哥大学) NSF-Simons AI Institute for the Sky (SkAI)(国家科学基金会-Simon人工智能研究所(SkAI))

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文利用基于模拟的推断方法对中微子诱导核子击穿过程中的参数进行首次估计,并验证了该方法在提高模拟精度和适应复杂性增长方面的潜力。

Comments 13 pages, 10 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.17901 2026-03-11 q-bio.BM cs.LG 57%

Molecular Fingerprints Are Strong Models for Peptide Function Prediction

分子指纹是预测肽功能的强大模型

Jakub Adamczyk, Piotr Ludynia, Wojciech Czech

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本研究证明分子指纹在无需长程相互作用建模的情况下,能高效准确预测肽功能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06623 2026-03-10 cs.LG 57%

Advances in GRPO for Generation Models: A Survey

生成模型中GRPO的进展:综述

Zexiang Liu, Xianglong He, Yangguang Li

机构 * SJTU(上海交通大学) THU(清华大学) CUHK(香港大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.LG

AI总结 本文综述了流GRPO在生成模型中的应用与进展,探讨了方法论改进和跨模态扩展,强调其作为通用对齐框架的重要性及未来挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06601 2026-03-10 cs.LG 57%

Switchable Activation Networks

可切换激活网络

Laha Ale, Ning Zhang, Scott A. King, Pingzhi Fan

机构 * Southwest Jiaotong University(西南交通大学) University of Windsor(温莎大学) Texas A&M University-Corpus Christi(德克萨斯大学阿姆斯特朗分校)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 SWAN通过动态控制神经元激活,实现高效推理和紧凑模型部署,统一稀疏性、剪枝和自适应推理的优势。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06058 2026-03-09 cs.RO 57%

RODEO: RObotic DEcentralized Organization

Milan Groshev, Eduardo Castelló Ferrer

机构 * CyPhy Life, Robotics & AI Lab, School of Science & Technology, IE University(CyPhy生命、机器人与人工智能实验室,科学与技术学院,IE大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

Comments 8 pages, 6 figures, Accepted at IEEE International Conference on Robotics & Automation (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17034 2026-03-05 cs.RO cs.NE 57%

Evolution 6.0: Robot Evolution through Generative Design

进化6.0:通过生成设计实现机器人进化

Muhammad Haris Khan, Artyom Myshlyaev, Artem Lykov, Miguel Altamirano Cabrera, Dzmitry Tsetserukou

机构 * Skolkovo Institute of Science and Technology(斯克洛夫诺研究所)

专题命中 VLA模型 :VLA(abstract);分类 cs.RO

AI总结 进化6.0通过生成式AI实现机器人自主设计工具和执行任务,展示高成功率和泛化能力。

Comments Accepted to HRI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19570 2026-03-05 cs.HC cs.AI 57%

The Epistemological Consequences of Large Language Models: Rethinking collective intelligence and institutional knowledge

大型语言模型的知识论后果:重新思考集体智慧与制度知识

Angjelin Hila

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文探讨LLM对集体智慧和制度知识的影响,提出集体知识论理论,强调反思性知识的重要性,并提出三级规范计划以应对LLM带来的知识论风险。

Comments AI & Soc (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00719 2026-03-03 cs.RO 57%

Keyframe-Guided Structured Rewards for Reinforcement Learning in Long-Horizon Laboratory Robotics

关键帧引导的结构化奖励用于长周期实验室机器人强化学习

Yibo Qiu, Shu'ang Sun, Haoliang Ye, Ronald X Xu, Mingzhai Sun

机构 * Suzhou Institute for Advanced Research, University of Science and Technology of China(科学技术大学苏州市先进研究院)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 本文提出关键帧引导的结构化奖励方法,用于提升实验室机器人在长周期任务中的精确操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21546 2026-02-26 cs.LG 57%

Mamba Meets Scheduling: Learning to Solve Flexible Job Shop Scheduling with Efficient Sequence Modeling

Mamba 与调度相遇:学习解决灵活作业车间调度的高效序列建模

Zhi Cao, Cong Zhang, Yaoxin Wu, Yaqing Hou, Hongwei Ge

机构 * Dalian University of Technology(大连理工大学) Nanyang Technological University(南洋理工大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出基于Mamba的高效序列建模方法,用于解决灵活作业车间调度问题,实现更快的求解速度和更优的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏