arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-12 至 2026-05-12 共收录 36 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 36 篇

2603.10126 2026-05-12 cs.RO cs.AI 94%

AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models

AR-VLA:面向视觉-语言-动作模型的真自回归动作专家

Yutong Hu, Jan-Nico Zaech, Nikolay Nikolov, Yuanqi Yao, Sombit Dey, Giuliano Albanese, Renaud Detry, Luc Van Gool, Danda Paudel

机构 * KU Leuven, Dept. Mechanical Engineering, Research unit Robotics, Automation and Mechatronics(库勒恩大学,机械工程系,机器人、自动化与机电一体化研究单位) KU Leuven, Dept. Electrical Engineering, Research unit Processing Speech and Images(库勒恩大学,电气工程系,语音和图像处理研究单位)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 AR-VLA提出了一种自回归动作专家,通过长时记忆保持上下文,解决快控与慢思的频率不匹配问题,实现高效预训练和模块化集成,提升动作生成的时空一致性。

Comments RSS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09410 2026-05-12 cs.RO cs.AI 94%

RePO-VLA: Recovery-Driven Policy Optimization for Vision-Language-Action Models

RePO-VLA:面向视觉-语言-动作模型的恢复驱动策略优化

Weijia Liufu, Xiaoyu Guo, Ruiyi Chen, Jingzhi Liu, Kaidong Zhang, Xiwen Liang, Jianqi Lin, Dawei Sun, Yuze Wang, Rongtao Xu, Bingqian Lin, Bowen Yang, Tongtong Cao, Bowen Peng, Dongyu Zhang, Guangrun Wang, Min Wang, Liang Lin, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) South China University of Technology(华南理工大学) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology(哈尔滨工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 本文提出RePO-VLA框架,通过恢复驱动策略优化提升视觉-语言-动作模型在长时程接触丰富操作中的鲁棒性,通过恢复意识初始化、进度感知语义价值函数和价值条件细化等方法,提高对抗成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22003 2026-05-12 cs.RO 94%

VP-VLA: Visual Prompting as an Interface for Vision-Language-Action Models

VP-VLA:作为视觉语言动作模型接口的视觉提示

Zixuan Wang, Yuxin Chen, Yuqi Liu, Jinhui Ye, Pengguang Chen, Changsheng Lu, Shu Liu, Bei Yu, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港大学) SmartMore(SmartMore公司)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 VP-VLA通过结构化视觉提示接口解耦高层推理与低层执行,提升空间精度和鲁棒性,实验证明优于现有端到端基线。

Comments Project page: https://visualprompt-vla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08168 2026-05-12 cs.RO cs.AI cs.LG 90%

Understanding Asynchronous Inference Methods for Vision-Language-Action Models

理解面向视觉-语言-动作模型的异步推理方法

Ayoub Agouzoul

机构 * École polytechnique Systems Group, ETH Zürich(瑞士联邦理工学院系统组,苏黎世联邦理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文系统比较了四种异步推理方法,评估了其在不同延迟下的性能,发现A2C2在Kinetix上表现最佳,TT-RTC在LIBERO上最稳健,IT-RTC在低延迟下表现良好但高延迟下下降,VLASH在低延迟与高延迟之间存在权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09343 2026-05-12 cs.AI 90%

SKG-VLA: Scene Knowledge Graph Priors for Structured Scene Semantics and Multimodal Reasoning for Decision Making

SKG-VLA:用于结构化场景语义和决策制定多模态推理的场景知识图谱先验

Zeyu Li, Lei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.AI

AI总结 SKG-VLA通过构建场景知识图谱,提升多模态投诉决策的推理能力与准确性,采用三阶段训练策略注入结构化场景先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10925 2026-05-12 cs.RO 89%

PriorVLA: Prior-Preserving Adaptation for Vision-Language-Action Models

PriorVLA: 为视觉-语言-动作模型保留先验进行适应

Xinyu Guo, Bin Xie, Wei Chai, Xianchi Deng, Tiancai Wang, Zhengxing Wu, Xingyu Chen

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Dexmal University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 PriorVLA通过保留预训练先验和学习有效适应方法,在机器人操作任务中实现了比全微调和现有基线更好的性能,特别是在分布外和少样本情况下表现更优。

Comments 32 pages. Project page: https://priorvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10485 2026-05-12 cs.RO 89%

VEGA: Visual Encoder Grounding Alignment for Spatially-Aware Vision-Language-Action Models

VEGA:面向空间感知的视觉编码器对齐用于视觉-语言-动作模型

Hao Wang, Xiaobao Wei, Jingyang He, Chengyu Bai, Chun-Kai Fan, Jiajun Cao, Jintao Chen, Ying Li, Shanyu Rong, Ming Lu, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 VEGA通过直接对齐视觉编码器输出与空间感知特征,提升视觉-语言-动作模型的空间意识,实现更可解释的对齐目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08612 2026-05-12 cs.RO 89%

ATAAT: Adaptive Threat-Aware Adversarial Tuning Framework against Backdoor Attacks on Vision-Language-Action Models

ATAAT: 面向视觉-语言-动作模型后门攻击的自适应威胁感知对抗调制框架

Kewei Chen, Yayu Long, Shuai Li, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(重庆绿色智能技术研究院,中国科学院) Chongqing School, University of Chinese Academy of Sciences(重庆学校,中国科学院大学) Faculty of Information Technology and Electrical Engineering, University of Oulu, Finland(奥卢大学信息科技与电气工程学院,芬兰)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出ATAAT框架,解决视觉-语言-动作模型中后门攻击的梯度干扰问题,通过威胁-方法自适应映射机制实现高效攻击并保持隐蔽性,实验表明其在高成功率和低污染率下表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10903 2026-05-12 cs.CV cs.RO 88%

CapVector: Learning Transferable Capability Vectors in Parametric Space for Vision-Language-Action Models

CapVector:在参数空间中学习可转移的能力向量用于视觉-语言-动作模型

Wenxuan Song, Han Zhao, Fuhao Li, Ziyang Zhou, Xi Wang, Jing Lyu, Pengxiang Ding, Yan Wang, Donglin Wang, Haoang Li

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文提出一种方法,通过在参数空间中解耦辅助目标SFT的两个目标,提升通用能力与任务特定动作分布拟合,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09005 2026-05-12 cs.RO cs.AI 88%

Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models

面向视觉-语言-动作模型的后门基于所有权验证

Ming Sun, Rui Wang, Xingrui Yu, Lihua Jing, Hangyu Du, Zhenglin Wan, Xu Pan, Ivor Tsang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) A*STAR Institute of High Performance Computing (A*STAR IHPC)(新加坡A*STAR高性能计算研究所) A*STAR Centre for Frontier AI Research (A*STAR CFAR)(新加坡A*STAR前沿人工智能研究中心) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院) College of Design and Engineering, Nanyang Technological University(南洋理工大学设计与工程学院) Department of Computer Science, National University of Singapore(新加坡国立大学计算机科学系) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing (LIESMARS), Wuhan University(武汉大学测绘遥感信息工程国家重点实验室(LIESMARS))

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出GuardVLA,首个针对视觉-语言-动作模型的后门基于所有权验证框架,通过在训练中嵌入隐蔽无害的后门水印,实现可靠的模型所有权验证并保持正常任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09465 2026-05-12 cs.CV cs.AI 88%

EvoDriveVLA: Evolving Driving VLA Models via Collaborative Perception-Planning Distillation

EvoDriveVLA: 通过协作感知-规划蒸馏进化驾驶VLA模型

Jiajun Cao, Xiaoan Zhang, Xiaobao Wei, Liyuqiu Huang, Zijian Wang, Hanzhen Zhang, Zhengyu Jia, Wei Mao, Hao Wang, Xianming Liu, Shuchang Zhou, Yang Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) XPeng Motors(小鹏汽车)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出EvoDriveVLA框架,结合自我锚定感知约束和未来引导轨迹优化,解决自动驾驶中感知退化和长期规划不稳定问题,实现nuScenes和NAVSIM的SOTA性能。

Comments 19 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00884 2026-05-12 cs.CV 85%

LiteVLA-H: Dual-Rate Vision-Language-Action Inference for Onboard Aerial Guidance and Semantic Perception

LiteVLA-H: 双速率视觉-语言-动作推断用于机载空中引导与语义感知

Justin williams, Kishor Datta Gupta, Roy George, Mrinmoy Sarkar

机构 * Department of Cyber Physical Systems, Clark Atlanta University(克劳克阿特拉大学网络物理系统系)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV

AI总结 LiteVLA-H通过双速率操作在边缘设备上实现高效视觉-语言-动作推断,兼顾快速动作输出与语义理解,提升空中引导与场景感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22963 2026-05-12 cs.RO cs.AI 81%

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

通过自由形式语言控制人形机器人:一个统一动作词汇的大型语言动作模型

Zhirui Liu, Kaiyang Ji, Ke Yang, Yahao Fan, Jingyi Yu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Humanoid-LLA模型,通过统一的人形机器人动作词汇解决语言与动作数据稀缺及物理稳定性问题,实现自由语言指令到全身动作的直接转换,提升人形机器人在真实环境中的泛化能力和动作多样性。

Comments Project page: https://humanoidlla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06222 2026-05-12 cs.RO cs.AI 81%

When to Trust Imagination: Adaptive Action Execution for World Action Models

何时相信想象:为世界动作模型的自适应动作执行

Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出FFDC和混合时间 horizon训练,通过预测-观察一致性实现自适应动作执行,提升机器人在复杂场景中的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09412 2026-05-12 astro-ph.GA astro-ph.SR 80%

Physical characterization and modeling of candidate Hyper-Compact HII Regions

超致密HII区域的物理特性和建模

I. T. Rodríguez-Esnard, S. Kurtz, J. D. Pandian, J. Franco, A. Sánchez-Monge, M. A. Trinidad, V. Migenes

专题命中 VLA模型 :VLA(summary_cn,abstract)

AI总结 研究五种候选超致密HII区域,利用VLA观测数据,分析其大小和电子密度,发现大部分符合弱UC HII区域,但部分仍可能是HC HII区域,如G40.28-0.22。

Comments Accepted for publication in Revista Mexicana de Astronomía y Astrofísica (RMxAA), Vol. XX, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14125 2026-05-12 cs.CV cs.AI cs.RO 80%

HiVLA: A Visual-Grounded-Centric Hierarchical Embodied Manipulation System

HiVLA:一种以视觉为基础的分层具身操作系统

Tianshuo Yang, Guanyu Chen, Yutian Chen, Zhixuan Liang, Yitian Liu, Zanxin Chen, Chunpu Xu, Haotian Liang, Jiangmiao Pang, Yao Mu, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 HiVLA提出一种分层框架,将高层语义规划与底层动作控制解耦,通过视觉 grounding 和 Diffusion Transformer 专家提升机器人操作能力,实验证明其在长时序技能组合和精细操作中表现优异。

Comments Project Page: https://tianshuoy.github.io/HiVLA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14022 2026-05-12 cs.RO cs.AI 79%

Language Conditioned Multi-Finger Dexterous Manipulation Enabled by Physical Compliance and Switching of Controllers

通过物理合规性和控制器切换实现语言条件下的多指灵巧操作

Cheng Pan, Kai Junge, Benhui Dai, Qinghua Guan, Josie Hughes

机构 * Embodied AI(具身人工智能)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 本文提出一种结合高层视觉语言动作模型与小型控制模型的切换控制器,通过事件驱动机制实现多指灵巧操作的鲁棒控制,验证了硬件级合规性在提升接触稳定性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09055 2026-05-12 cs.RO cs.AI cs.MA 79%

Octopus Protocol: One-Shot Hardware Discovery and Control for AI Agents via Infrastructure-as-Prompts

Octopus Protocol:通过基础设施即提示实现AI代理的一次性硬件发现与控制

Quilee Simeon, Justin M. Wei, Yile Fan

机构 * MIT(麻省理工学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 Octopus Protocol通过五阶段流程实现硬件发现与控制,利用语言模型API生成MCP协议服务器,使AI代理能自主完成硬件集成与闭环视觉-运动控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09537 2026-05-12 cs.RO 77%

Drift is a Sampling Error: SNR-Aware Power Distributions for Long-Horizon Robotic Planning

漂移是一种采样误差:面向长时间 horizon 的机器人规划的 SNR 意识功率分布

Kewei Chen, Yayu Long, Mingsheng Shang

机构 * Chongqing Institute of Green and Intelligent Technology, Chinese Academy of Sciences(中国科学院重庆绿色智能技术研究院) Chongqing School, University of Chinese Academy of Sciences(中国科学院大学重庆学院)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 本文提出 CAPS 框架,通过功率分布增强全局轨迹概率,结合 SNR 机制实现动态切换,提升长horizon 机器人规划的鲁棒性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21971 2026-05-12 cs.RO cs.AI cs.LG 75%

Supervised Mixture-of-Experts for Surgical Grasping and Retraction

监督混合专家架构用于手术抓取与牵开

Lorenzo Mazza, Ariel Rodriguez, Rayan Younis, Martin Lelis, Ortrun Hellig, Chenpan Li, Sebastian Bodenstedt, Martin Wagner, Stefanie Speidel

机构 * Department of Translational Surgical Oncology, NCT/UCC Dresden, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Dresden, Germany(translational Surgical Oncology部门,NCT/UCC Dresden,医学院和Carl Gustav Carus大学医院,TUD,德累斯顿,德国) National Center for Tumor Diseases (NCT), NCT/UCC Dresden, a partnership between DKFZ, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, and HZDR, Dresden, Germany(肿瘤疾病国家中心(NCT),NCT/UCC德累斯顿,DKFZ、医学院和Carl Gustav Carus大学医院、TUD以及HZDR之间的合作,德累斯顿,德国) Faculty of Computer Science, TUD, Dresden, Germany(计算机科学系,TUD,德累斯顿,德国) The Center for Tactile Internet with Human-in-the-Loop (CeTI), TUD, Dresden, Germany(带有Human-in-the-Loop的触觉互联网中心(CeTI),TUD,德累斯顿,德国) Department of Visceral, Thoracic and Vascular Surgery, Faculty of Medicine and University Hospital Carl Gustav Carus, TUD, Dresden, Germany(visceral、胸腔和血管外科部门,医学院和Carl Gustav Carus大学医院,TUD,德累斯顿,德国)

专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出一种监督混合专家架构,用于结构化手术任务,通过轻量动作解码器政策实现复杂操作,展示了在少样本下优于传统方法的性能。

Comments Accepted at Robotics:Science and Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10388 2026-05-12 cs.CV cs.RO 73%

Temporal Sampling Frequency Matters: A Capacity-Aware Study of End-to-End Driving Trajectory Prediction

时间采样频率至关重要:一种容量感知的端到端驾驶轨迹预测研究

Yumao Liu, Tao Liu, Xiangyu Li, Jiaxiang Li, Ke Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 本文研究了时间采样频率对端到端驾驶轨迹预测性能的影响,发现较小模型在低或中等频率下表现最佳,而大模型在高频率下表现更优,表明需根据模型和数据集调整采样频率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08638 2026-05-12 cs.RO cs.AI 73%

Geometry Guided Self-Consistency for Physical AI

基于几何的自一致性物理AI

Yinwei Dai, Zhuofu Chen, Lijie Yang, Ravi Netravali

机构 * Princeton University(普林斯顿大学)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 本文提出KeyStone方法,通过并行生成动作片段并聚类,返回最大簇的质心,提升任务成功率13.3%且无额外延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18486 2026-05-12 cs.CV cs.CL cs.RO 73%

Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation

小米OneVL:基于视觉-语言解释的一步潜在推理与规划

Jinghui Lu, Jiayi Guan, Zhijian Huang, Jinlong Li, Guang Li, Lingdong Kong, Yingyan Li, Han Wang, Shaoqing Xu, Yuechen Luo, Fang Li, Chenxu Dang, Junli Wang, Tao Xu, Jing Wu, Jianhua Wu, Xiaoshuai Hao, Wen Zhang, Tianyi Jiang, Lingfeng Zhang, Lei Zhou, Yingbo Tang, Jie Wang, Yinfeng Gao, Xizhou Bu, Haochen Tian, Yihang Qiu, Feiyang Jia, Lin Liu, Yigu Ge, Hanbing Li, Yuannan Shen, Jianwei Cui, Hongwei Xie, Bing Wang, Haiyang Sun, Jingwei Zhao, Jiahui Huang, Pei Liu, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Hanchao Leng, Kun Ma, Naiyan Wang, Guang Chen, Kuiyuan Yang, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 OneVL通过双重辅助解码器监督的紧凑潜在标记,实现了视觉-语言解释的一步潜在推理与规划,首次在延迟条件下超越了显式推理方法。

Comments Technical Report; 49 pages, 22 figures, 10 tables; Project Page at https://xiaomi-embodied-intelligence.github.io/OneVL GitHub at https://github.com/xiaomi-research/onevl

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21232 2026-05-12 cs.AI 70%

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

ReCAPA:分层预测性修正以缓解级联故障

Xiyin Zeng, Yuyu Sun, Haoyang Li, Shouqiang Liu, Hao Wang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) South China Normal University(华南师范大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.AI

AI总结 ReCAPA通过分层预测修正和对齐架构,缓解多模态环境中多步骤任务执行中的级联故障问题,引入新的指标量化误差传播与恢复过程,实验表明其在多个代理基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10179 2026-05-12 cs.LG cs.AI 62%

One-Step Graph-Structured Neural Flows for Irregular Multivariate Time Series Classification

一步图结构神经流用于不规则多变量时间序列分类

Mengzhou Gao, Kaiwei Wang, Pengfei Jiao

机构 * School of Cyberspace, Hangzhou Dianzi University(杭州电子科技大学信息学院)

专题命中 VLA模型 :action model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出图结构神经流(GSNF),通过引入辅助轨迹自监督策略增强交互学习,实现在不规则多变量时间序列分类中的高效建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10117 2026-05-12 cs.CV cs.AI 62%

Think as Needed: Geometry-Driven Adaptive Perception for Autonomous Driving

按需思考:基于几何的自适应感知用于自动驾驶

Donghyun Kim, Jaehyoung Park

机构 * Stony Brook University(史蒂文尼森布鲁克大学)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Enhanced HOPE架构,通过几何复杂度估计动态调整LiDAR帧处理路径,减少计算资源浪费,提升复杂场景下的感知能力与遮挡物体追踪性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10108 2026-05-12 cs.CL cs.LG 57%

GLiNER-Relex: A Unified Framework for Joint Named Entity Recognition and Relation Extraction

GLiNER-Relex:联合命名实体识别与关系抽取的统一框架

Ihor Stepanov, Oleksandr Lukashov, Mykhailo Shtopko, Vivek Kalyanarangan

机构 * Knowledgator Engineering(Knowledgator工程公司) Baldor Technologies Pvt. Ltd. (IDfy)(Baldor技术私人有限公司(IDfy))

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 GLiNER-Relex通过统一架构实现命名实体识别与关系抽取,利用共享的双向Transformer编码器联合表示文本、实体类型和关系类型标签,支持零样本提取任意实体和关系类型,且在四个基准数据集上表现优异。

Comments 19 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09350 2026-05-12 cs.AI 57%

CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

CHAINTRIX:一个多管道LLM增强框架用于自动化智能合约安全审计

Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 CHAINTRIX通过结合LLM与确定性结构表示,提升智能合约审计效率,检测86/120高危漏洞,召回率71.7%,优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00623 2026-05-12 cs.RO 57%

Recovering Hidden Reward in Diffusion-Based Policies

从扩散策略中恢复隐藏奖励

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 本文提出EnergyFlow框架,通过参数化标量能量函数的梯度作为去噪场,统一生成动作建模与逆强化学习,证明在最大熵最优性下,去噪分数匹配学习的分数函数能恢复专家的软Q函数梯度,无需对抗训练即可提取奖励。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19923 2026-05-12 cs.CV 57%

UniCon3R: Unified Contact-aware 4D Human-Scene Reconstruction from Monocular Video

UniCon3R:基于单目视频的统一接触感知4D人体-场景重建

Tanuj Sur, Shashank Tripathi, Nikos Athanasiou, Ha Linh Nguyen, Kai Xu, Michael J. Black, Angela Yao

机构 * National University of Singapore(国立新加坡大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 UniCon3R通过建模人体与环境的接触关系,提升4D人体-场景重建的物理合理性与全局运动估计,同时保持高效的前馈推理速度。

Comments Project page: https://surtantheta.github.io/UniCon3R

详情

展开后加载摘要…

URL PDF HTML 收藏