arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-07 至 2026-04-07 共收录 15 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2603.12510 2026-04-07 cs.RO cs.AI cs.CL 88%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 83%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 VLA模型 :vision-language-action(title,abstract);action model(abstract);分类 cs.RO

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04716 2026-04-07 hep-ph hep-ex 78%

CP-violation effects in neutral meson oscillations in the left-right weak interaction model

中性介子振荡中的CP破坏效应在左右弱相互作用模型中

A. P. Serebrov, O. M. Zherebtsov, A. K. Fomin, R. M. Samoilov, N. S. Budanov

专题命中 VLA模型 :action model(title,abstract)

AI总结 本文研究了在左右弱相互作用模型中,通过引入右向量玻色子W_R的混合角ζ和质量比δ,探讨中性介子振荡中的CP破坏效应,并验证了实验结果。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 75%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04502 2026-04-07 cs.RO 70%

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act:前沿视频模型在通用机器人操作中能走多远?

Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。

Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03340 2026-04-07 cs.CV cs.AI 62%

Learning Additively Compositional Latent Actions for Embodied AI

学习可加性组合的潜在动作以实现具身AI

Hangxing Wei, Xiaoyu Chen, Chuheng Zhang, Tim Pearce, Jianyu Chen, Alex Lamb, Li Zhao, Jiang Bian

机构 * Wuhan University(武汉大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AC-LAM模型,通过强制潜在动作空间上的可加性组合结构,提升动作表示的结构性和准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 57%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26433 2026-04-07 cs.LG 57%

Co-Evolving Latent Action World Models

共演潜在动作世界模型

Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, Jiang Bian

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出CoLA-World,通过关键预热阶段实现联合学习,解决世界模型与动作模型的协同问题,提升视频模拟质量和下游视觉规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03652 2026-04-07 cs.CV 57%

Motion-Adaptive Multi-Scale Temporal Modelling with Skeleton-Constrained Spatial Graphs for Efficient 3D Human Pose Estimation

具有骨骼约束空间图的运动自适应多尺度时间建模用于高效的3D人体姿态估计

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出MASC-Pose框架,通过自适应多尺度时间建模模块和骨骼约束自适应图卷积网络,实现高效3D人体姿态估计,实验验证了其在Human3.6M和MPI-INF-3DHP数据集上的有效性。

Comments Accepted to IJCNN 2026, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03524 2026-04-07 cs.AI 57%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04577 2026-04-07 astro-ph.GA astro-ph.HE 50%

From NVSS to RACS: Identifying truly Compact and Steep spectrum Radio sources

从NVSS到RACS:识别真正紧凑且陡谱的射电源

Rajat Shinde, Yogesh Maan, Apurba Bera

专题命中 VLA模型 :VLA(abstract)

AI总结 本文利用RACS数据识别紧凑陡谱射电源,发现部分源在NVSS未被检测到,揭示了高红移射电星系等天体的研究价值。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03794 2026-04-07 q-bio.QM cs.SY eess.SY 50%

Bounding Transient Moments for a Class of Stochastic Reaction Networks Using Kolmogorov's Backward Equation

利用柯尔莫哥洛夫逆方程对一类随机反应网络的瞬态矩进行界分析

Takeyuki Iwasaki, Yutaka Hori

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于柯尔莫哥洛夫逆方程的方法,通过双表示法避免矩闭合问题,为随机反应网络的瞬态矩提供理论保证的上下界,同时通过线性时不变系统高效计算多初始条件下的矩界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03514 2026-04-07 physics.flu-dyn 50%

Surface-access limitation in catalytic porous monoliths: Performance diagnosis using pore-resolved CFD

催化多孔体中表面访问限制:基于孔隙解析CFD的性能诊断

Olivier Guévremont, Olivier Gazil, Federico Galli, Nick Virgilio, Bruno Blais

专题命中 VLA模型 :action model(abstract)

AI总结 研究通过孔隙解析CFD分析催化多孔体中表面访问限制问题,揭示结构依赖的表面可及性对反应性能的影响,验证了反应性CFD在真实操作条件下的应用价值。

Comments 31 pages, 12 figures, 12 appendix figures. Submitted to Chemical Engineering Journal

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 1 篇

2601.07060 2026-04-07 cs.RO 70%

PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation

PALM:通过具身理由推理进行长时间 horizon 肢体操作的进展感知策略学习

Yuanzhe Liu, Jingyuan Zhu, Yuchen Mo, Gen Li, Xu Cao, Jin Jin, Yifan Shen, Zhengyuan Li, Tianjiao Yu, Wenzhen Yuan, Fangqiang Ding, Ismini Lourentzou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nanyang Technological University(南洋理工大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 PALM通过具身理由推理和子任务进展线索,改进长horizon机器人操作的策略学习,实现91.8%的成功率和更长的任务长度。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 1 篇

2604.04664 2026-04-07 cs.RO cs.AI cs.MA 73%

ROSClaw: A Hierarchical Semantic-Physical Framework for Heterogeneous Multi-Agent Collaboration

ROSClaw:一种用于异构多智能体协作的分层语义-物理框架

Rongfeng Zhao, Xuanhao Zhang, Zhaochen Guo, Xiang Shao, Zhongpan Zhu, Bin He, Jie Chen

机构 * Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) National Key Laboratory of Autonomous Intelligent Unmanned Systems (Tongji University)(自主智能无人系统全国重点实验室(同济大学)) Frontiers Science Center for Intelligent Autonomous Systems(智能自主系统前沿科学中心) Tongji University(同济大学) College of Electronics and Information Engineering, Tongji University(同济大学电子与信息工程学院)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI

AI总结 ROSClaw通过统一视觉语言模型控制器整合策略学习与任务执行,构建仿真到现实的拓扑映射,实现多智能体协作中的语义连续性和动态任务分配,提升多策略执行的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏