arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-03-13 至 2026-03-13 共收录 11 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 10 篇

2603.12193 2026-03-13 cs.RO cs.CV 88%

SaPaVe: Towards Active Perception and Manipulation in Vision-Language-Action Models for Robotics

SaPaVe:迈向视觉-语言-动作模型中的主动感知与操作

Mengzhen Liu, Enshen Zhou, Cheng Chi, Yi Han, Shanyu Rong, Liming Chen, Pengwei Wang, Zhongyuan Wang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机科学学院,北京大学) School of Software, Beihang University(软件学院,北航) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title,abstract);分类 cs.RO、cs.CV

AI总结 SaPaVe通过解耦相机与操作动作,结合自下而上训练策略,实现高效且可推广的主动感知与操作,在现实任务中成功率达31.25%。

Comments Accepted to CVPR 2026. See project page at https://lmzpai.github.io/SaPaVe

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16667 2026-03-13 cs.RO cs.CV 88%

ReViP: Mitigating False Completion in Vision-Language-Action Models with Vision-Proprioception Rebalance

ReViP: 通过视觉-本体感知再平衡缓解视觉语言动作模型中的虚假完成

Zhuohao Li, Yinghao Li, Jian-Jian Jiang, Lang Zhou, Tianyu Zhang, Jiadong Yin, Mu Lin, Yi-Lin Wei, Wei-Shi Zheng

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 ReViP通过引入视觉-本体感知再平衡机制,缓解视觉语言动作模型中的虚假完成问题,提升模型在扰动下的鲁棒性和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11080 2026-03-13 cs.RO 88%

SELF-VLA: A Skill Enhanced Agentic Vision-Language-Action Framework for Contact-Rich Disassembly

SELF-VLA: 一种增强技能的代理视觉-语言-动作框架用于接触丰富的拆解

Chang Liu, Sibo Tian, Xiao Liang, Minghui Zheng

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.RO

AI总结 SELF-VLA是一种整合显式拆解技能的代理视觉-语言-动作框架,通过实验在接触丰富的拆解任务中优于现有端到端VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01928 2026-03-13 cs.CV 88%

LaST-VLA: Thinking in Latent Spatio-Temporal Space for Vision-Language-Action in Autonomous Driving

LaST-VLA: 在自动驾驶的视觉-语言-动作中思考于潜在的空间-时间空间

Yuechen Luo, Fang Li, Shaoqing Xu, Yang Ji, Zehan Zhang, Bing Wang, Yuannan Shen, Jianwei Cui, Long Chen, Guang Chen, Hangjun Ye, Zhi-Xin Yang, Fuxi Wen

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(title,abstract);分类 cs.CV

AI总结 LaST-VLA通过潜在空间-时间推理框架,结合双特征对齐机制和渐进式SFT训练策略,提升自动驾驶中的视觉-语言-动作处理能力,实现更安全的物理基础推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07949 2026-03-13 cs.DC cs.RO 83%

RAPID: Redundancy-Aware and Compatibility-Optimal Edge-Cloud Partitioned Inference for Diverse VLA Models

RAPID: 为多样化VLA模型设计的冗余感知且兼容最优的边缘-云分区推理

Zihao Zheng, Sicheng Tian, Hangyu Cao, Chenyue Li, Jiayu Chen, Maoliang Li, Xinhao Sun, Hailong Zou, Guojie Luo, Xiang Chen

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) School of Software Engineering, South China University of Technology(华南理工大学软件工程学院) School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院)

专题命中 VLA模型 :VLA(title,abstract);vision language action(abstract);分类 cs.RO

AI总结 RAPID框架通过优化边缘-云分区策略,有效解决VLA模型在边缘计算中的冗余问题和噪声干扰,实现高效推理与低开销的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11106 2026-03-13 cs.CV cs.RO 73%

RC-NF: Robot-Conditioned Normalizing Flow for Real-Time Anomaly Detection in Robotic Manipulation

RC-NF:基于机器人条件的归一化流用于机器人操作中的实时异常检测

Shijie Zhou, Bin Zhu, Jiarui Yang, Xiangyu Zhao, Jingjing Chen, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI(可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室) Singapore Management University(新加坡国立大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 RC-NF通过实时监控机器人状态和物体运动轨迹,提升VLA系统在动态环境中的鲁棒性和适应性,实现异常检测与干预。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08938 2026-03-13 cs.AI 57%

AgentOS: From Application Silos to a Natural Language-Driven Data Ecosystem

AgentOS: 从应用孤岛到由自然语言驱动的数据生态系统

Rui Liu, Tao Zhe, Dongjie Wang, Zijun Yao, Kunpeng Liu, Yanjie Fu, Huan Liu, Jian Pei

机构 * University of Kansas(堪萨斯大学) Clemson University(克莱姆森大学) Arizona State University(亚利桑那州立大学) Duke University(杜克大学)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出AgentOS,通过自然语言驱动的数据生态系统,解决传统操作系统与智能代理的适配问题,构建持续的数据挖掘管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11899 2026-03-13 astro-ph.GA 50%

\HI 21-cm Line Properties of the Nearby LIRG IRAS 04296+2923

IRAS 04296+2923 邻近高光度红外星系的 21 厘米 HI 线性质

Guixiang Feng, Zhongzu Wu, Chuanpeng Zhang, Ming Zhu

专题命中 VLA模型 :VLA(abstract)

AI总结 研究发现IRAS 04296+2923与HI 0432+2926形成引力束缚的绕行星系对,而非并合,其高光度红外性质由内部过程驱动。

Comments 22 pages, 19 figures, Accepted by A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11303 2026-03-13 cs.HC 50%

Bridging the Cognitive Gap: Co-Designing and Evaluating a Voice-Enabled Community Chatbot for Older Adults

弥合认知鸿沟:为老年人设计和评估一个语音启用的社区聊天机器人

Feng Chen, Luna Xingyu Li, Ray-Yuan Chung, Wenyu Zeng, Yein Jeon, Yizhou Hu, Oleg Zaslavsky

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出了一种语音启用的社区聊天机器人,通过共设计和教育工作坊,提升老年人对AI的认知和透明度,同时探索零触控导航对年龄包容性AI的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21133 2026-03-13 cond-mat.str-el 50%

Preformed Cooper pairing and the uncondensed normal-state component in phase-fluctuating monolayer cuprate superconductivity

预形成库珀配对与相波动单层铜基超导体中非凝聚正常态成分

F. Yang, Y. Shi, L. Q. Chen

专题命中 VLA模型 :action model(abstract)

AI总结 该研究提出了一种超越平均场理论的微观框架,用于分析单层铜基超导体中预形成库珀配对、非凝聚正常态成分及相波动的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2603.11110 2026-03-13 cs.RO cs.AI 62%

ResWM: Residual-Action World Model for Visual RL

ResWM:基于视觉强化学习的残差动作世界模型

Jseen Zhang, Gabriel Adineera, Jinzhou Tan, Jinoh Kim

机构 * University of California, San Diego(加州大学圣地亚哥分校) Texas A&M University-Commerce(德克萨斯A&M大学-科摩斯)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 ResWM通过将控制变量从绝对动作转换为残差动作,提升了视觉强化学习中世界模型的预测能力和稳定性,实现了更高效的样本利用和更平滑的控制策略。

Comments Submit KDD2026

详情

展开后加载摘要…

URL PDF HTML 收藏