arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-21 至 2026-07-21 共收录 14 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2607.18231 2026-07-21 cs.RO 新提交 94%

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA:用于接触丰富操作中视觉-语言-动作模型的基于力的记忆

Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Fudan University(复旦大学) USTC(中国科学技术大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO

AI总结 研究针对视觉-语言-动作模型在接触丰富操作中的时间上下文推理问题,提出FM-VLA模型,通过基于力的记忆编码及投影,利用累积接触事件历史指导操作,在相关任务上评估,轻量级力记忆表现出色,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16506 2026-07-21 cs.RO cs.LG 新提交 91%

Foresight Residual RL for Long-Horizon Robot Manipulation with Vision-Language-Action Models

用于基于视觉-语言-动作模型的长时机器人操作的前瞻性残差强化学习

Yuhan Liu, Xinyu Zhang, Litao Liu, Abdeslam Boularias

机构 * Department of Computer Science, Rutgers University(罗格斯大学计算机科学系)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 研究针对长时机器人操作中VLA策略的不足,提出前瞻性残差强化学习,通过离线估计前瞻性值优化交接质量,在螺母拧紧装配任务中,该方法全任务成功率高,优于标准方法和基线,强调塑造子任务成功状态对提升长时性能的重要性。

Comments Accepted at IROS2026. Project website: https://jaysparrow.github.io/foresight-residual-rl

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17157 2026-07-21 cs.CV cs.AI 新提交 90%

VLA-ReID: Video-Level Association for Re-Identification in Multi-Object Tracking with Highly Similar Objects

VLA-ReID:具有高度相似对象的多目标跟踪中用于重新识别的视频级关联

Yanrong Qin, Xiaoyan Cao, Yao Yao

机构 * Glasgow College, University of Electronic Science and Technology of China(电子科技大学格拉斯哥学院) Key Laboratory for Urban Habitat Environmental Science and Technology, School of Environment and Energy, Peking University Shenzhen Graduate School(北京大学深圳研究生院环境与能源学院城市人居环境科学与技术重点实验室) School of Management Science and Real Estate, Chongqing University(重庆大学管理科学与房地产学院)

专题命中 VLA模型 :VLA(title,title_cn);分类 cs.CV、cs.AI

AI总结 针对多目标跟踪中对象外观相似时身份保持难的问题,提出VLA-ReID方法,将重新识别建模为视频级关联,通过聚合历史轨迹特征等进行全局关联优化,实验显示该方法有效提升多项指标并减少身份切换。

Comments 11 pages, 8 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17786 2026-07-21 cs.RO cs.AI cs.CR cs.LG 新提交 90%

Reasoning as a Double-Edged Sword: Architecture and Cross-Stage Robustness in Vision-Language-Action Models

推理是一把双刃剑:视觉-语言-动作模型中的架构与跨阶段鲁棒性

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

机构 * University of Melbourne(墨尔本大学)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 研究视觉-语言-动作模型中添加推理步骤对模型鲁棒性的影响,通过在三个模型上进行实验,发现潜在迭代模型鲁棒性最差,推理输出监测在公平测试下失败,计划-行动一致性探测器在自适应攻击下效果不佳,为可行防御设定了前提条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 86%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16636 2026-07-21 cs.RO 新提交 81%

PhyAgentOS: A Self-Evolving Operating System for Embodied Agents with Decoupled Cognitive Planning and Physical Execution

PhyAgentOS:一种用于具身智能体的自进化操作系统,具有解耦的认知规划和物理执行

Yang Liu, Weixing Chen, Xinshuai Song, Tao Pu, Siwen Mo, Yongjie Bai, Zihao Chen, Qianran Sun, Liruo Zhong, Ying Shen, Liang Lin

机构 * X-Era Lab(X-Era实验室) HCP Lab, Sun Yat-sen University(中山大学HCP实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究为具身智能体提出PhyAgentOS操作系统,其以会话为最小调度单位,用文件系统解耦认知与物理执行,通过会话验证器区分执行与任务完成,经认知记忆整合结果,有分层安全约束,在多模型和实体上验证并优于其他系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17115 2026-07-21 math.AP 新提交 78%

Enhanced stability and asymptotic limits to the non-isentropic compressible fluid-particle interaction model with thermal effects

具有热效应的非等熵可压缩流体-粒子相互作用模型的增强稳定性和渐近极限

Fucai Li, Jinkai Ni, Zhouping Xin

专题命中 VLA模型 :action model(title,abstract)

AI总结 研究具有热效应的非等熵可压缩流体-粒子相互作用模型。通过建立先验估计并取极限,证明该模型存在全局经典解且有最优衰减率,改进前人结果,证实爱因斯坦预测,揭示粒子对模型产生新耗散效应,开发新思想技术克服相关障碍。

Comments 76 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17776 2026-07-21 astro-ph.GA 新提交 67%

Structural and dynamical properties of Tidal dwarf galaxies in the tails and bridge of the Guitar galaxy Arp 105

吉他星系Arp 105尾巴和桥中潮汐矮星系的结构与动力学性质

Jyoti Prakash, Kanak Saha

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 研究阿贝尔1185星系团中Arp 105系统内潮汐矮星系及潮汐桥,通过多波长分析其恒星形成、金属度等性质,利用光谱能量分布建模得恒星质量,还估计动力学质量比,发现暗物质不足,后续观测或增进对潮汐矮星系形成的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17867 2026-07-21 eess.AS 新提交 50%

The tttAI System for the TSA-ASR Task of the SmartGlasses Challenge 2026

用于2026年智能眼镜挑战赛TSA-ASR任务的tttAI系统

Xuanji He, Gaoyang Dong, Xiaoxiao Li, Minchuan Chen, Fengjie Zhu

专题命中 VLA模型 :action model(abstract)

AI总结 介绍用于2026年智能眼镜挑战赛TSA-ASR任务的tttAI系统,针对长音频、多说话人及语音重叠挑战,提出级联架构,含说话人日记化等模块,最终系统用特定模型和通道,在赛道2获34.04%的tcpCER并排名第二。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17092 2026-07-21 cs.IR 新提交 50%

Uncertainty as Remedy: Mitigating Satisfaction Label Bias in Short Video Multi-Objective Ensemble Ranking

不确定性作为补救措施:减轻短视频多目标集成排序中的满意度标签偏差

Zonghe Shao, Tiantian He, Xiaoxiao Xu, Jiaqi Yu, Minzhi Xie, Jinfang Gu, Yongqi Liu, Kaiqiao Zhan, Kun Gai

专题命中 VLA模型 :action model(abstract)

AI总结 研究短视频推荐中多目标集成排序模型因用户行为信号带来的满意度标签偏差问题,提出UAME框架,将模型预测表示为高斯评分变量,设计概率成对排序损失和加权方案减轻偏差,实验证明其能改进现有范式并与用户满意度更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17723 2026-07-21 math.NA cs.NA 新提交 50%

A domain decomposition online-learning-enhanced nonlinear elimination preconditioner

一种区域分解在线学习增强的非线性消除预条件器

Pai Zhang, Linyan Gu, Li Luo

专题命中 VLA模型 :action model(abstract)

AI总结 针对非线性消除预处理中识别收敛慢分量的挑战,提出在线学习增强的NE预条件器,从残差主导结构识别不良子集,集成到并行区域分解框架,实验表明该方法能产生可靠连贯的不良子集,收敛性优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17488 2026-07-21 astro-ph.SR astro-ph.HE astro-ph.IM 新提交 50%

Surrogate models for type II supernovae: Probing low-energy explosions and interaction-free regimes

II型超新星的替代模型:探索低能量爆炸和无相互作用状态

Zhengyang Zhang, Shuai Zha, Nikhil Sarin, Takashi J. Moriya, Chengyuan Wu, Bo Wang

专题命中 VLA模型 :action model(abstract)

AI总结 针对II型超新星样本分析的计算瓶颈,提出基于STELLA的两个神经网络替代模型,利用自动编码器、模拟器及正则化等技术,应用于多个超新星,能快速进行物理特征描述并大幅减少贝叶斯推断时间。

Comments 29 pages, 7 figures; accepted for publication in Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2607.18236 2026-07-21 cs.RO cs.LG 新提交 79%

Patch Policy: Efficient Embodied Control via Dense Visual Representations

补丁策略:通过密集视觉表示实现高效具身控制

Gaoyue Zhou, Zichen Jeff Cui, Ada Langford, Bowen Tan, Yann LeCun, Lerrel Pinto

机构 * Courant Institute, New York University(纽约大学柯朗数学科学研究所) Meta-FAIR(Meta FAIR) AMI Labs(AMI 实验室)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract_cn);action model(abstract);分类 cs.RO、cs.LG

AI总结 研究利用预训练密集视觉特征,提出补丁策略,通过块因果注意力掩码等实现高效具身控制。该策略轻量级、快速且高效,在模拟和真实环境中相比其他策略有显著提升,为机器人社区利用视觉表示学习提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏