arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-04-07 至 2026-04-07 共收录 13 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 13 篇

2603.12510 2026-04-07 cs.RO cs.AI cs.CL 88%

Red-Teaming Vision-Language-Action Models via Quality Diversity Prompt Generation for Robust Robot Policies

通过质量多样性提示生成实现视觉-语言-动作模型的红队测试以获得鲁棒的机器人策略

Siddharth Srikanth, Freddie Liang, Ya-Chuan Hsu, Varun Bhatt, Shihan Zhao, Henry Chen, Bryon Tjanaka, Minjune Hwang, Akanksha Saran, Daniel Seita, Aaquib Tabrez, Stefanos Nikolaidis

机构 * Thomas Lord Department of Computer Science, University of Southern California(南加州大学托马斯·洛德计算机科学系) Sony AI(索尼AI) Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西布利机械与航空航天工程学院)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI

AI总结 本文提出Q-DIG方法,通过生成多样化且相关的语言指令来发现VLA模型的漏洞,提升机器人策略的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13193 2026-04-07 cs.RO 83%

Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control

可调节的视觉-语言-动作策略用于具身推理和分层控制

William Chen, Jagdeep Singh Bhatia, Catherine Glossop, Nikhil Mathihalli, Ria Doshi, Andy Tang, Danny Driess, Karl Pertsch, Sergey Levine

专题命中 VLA模型 :vision-language-action(title,abstract);action model(abstract);分类 cs.RO

AI总结 本文提出可调节策略,通过训练在丰富合成命令上的视觉-语言-动作模型,提升低层可控性,解锁预训练VLM知识,改进任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04716 2026-04-07 hep-ph hep-ex 78%

CP-violation effects in neutral meson oscillations in the left-right weak interaction model

中性介子振荡中的CP破坏效应在左右弱相互作用模型中

A. P. Serebrov, O. M. Zherebtsov, A. K. Fomin, R. M. Samoilov, N. S. Budanov

专题命中 VLA模型 :action model(title,abstract)

AI总结 本文研究了在左右弱相互作用模型中,通过引入右向量玻色子W_R的混合角ζ和质量比δ,探讨中性介子振荡中的CP破坏效应,并验证了实验结果。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08548 2026-04-07 cs.RO cs.AI cs.LG 75%

From Seeing to Doing: Bridging Reasoning and Decision for Robotic Manipulation

从感知到行动:弥合推理与决策以实现机器人操作

Yifu Yuan, Haiqin Cui, Yibin Chen, Zibin Dong, Fei Ni, Longxin Kou, Jinyi Liu, Pengyi Li, Yan Zheng, Jianye Hao

机构 * Tianjin University(天津大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 本文提出FSD模型,通过空间关系推理生成中间表示,提升机器人操作的泛化能力,在8个基准测试中表现优异,且在零样本任务中实现显著性能提升。

Comments Published as a conference paper at ICLR 2026. Our project homepage: https://embodied-fsd.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04502 2026-04-07 cs.RO 70%

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation?

Veo-Act:前沿视频模型在通用机器人操作中能走多远?

Zhongru Zhang, Chenghan Yang, Qingzhou Lu, Yanjiang Guo, Jianke Zhang, Yucheng Hu, Jianyu Chen

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 本文探讨前沿视频模型如Veo-3在通用机器人操作中的应用,提出Veo-Act框架结合高阶运动规划与低阶执行器,提升指令跟随性能。

Comments 16 pages, 12 figures. Equal contribution by Zhongru Zhang, Chenghan Yang, Qingzhou Lu and Yanjiang Guo. Project lead: Yanjiang Guo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03340 2026-04-07 cs.CV cs.AI 62%

Learning Additively Compositional Latent Actions for Embodied AI

学习可加性组合的潜在动作以实现具身AI

Hangxing Wei, Xiaoyu Chen, Chuheng Zhang, Tim Pearce, Jianyu Chen, Alex Lamb, Li Zhao, Jiang Bian

机构 * Wuhan University(武汉大学) Tsinghua University(清华大学) Microsoft Research(微软研究院)

专题命中 VLA模型 :action model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AC-LAM模型,通过强制潜在动作空间上的可加性组合结构,提升动作表示的结构性和准确性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04207 2026-04-07 cs.AI 57%

Don't Blink: Evidence Collapse during Multimodal Reasoning

不要眨眼:多模态推理中的证据崩溃

Suresh Raghu, Satwik Pandey

机构 * Independent Researcher, New Delhi, India(独立研究者,印度新德里)

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 研究发现多模态推理过程中证据逐渐消失的现象,提出通过视觉-熵交互模型降低风险,提升模型在分布偏移下的安全性。

Comments 8 pages, 6 figures, 1 table, plus appendix. Submitted to UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26433 2026-04-07 cs.LG 57%

Co-Evolving Latent Action World Models

共演潜在动作世界模型

Yucen Wang, Fengming Zhang, De-Chuan Zhan, Li Zhao, Kaixin Wang, Jiang Bian

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 本文提出CoLA-World,通过关键预热阶段实现联合学习,解决世界模型与动作模型的协同问题,提升视频模拟质量和下游视觉规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03652 2026-04-07 cs.CV 57%

Motion-Adaptive Multi-Scale Temporal Modelling with Skeleton-Constrained Spatial Graphs for Efficient 3D Human Pose Estimation

具有骨骼约束空间图的运动自适应多尺度时间建模用于高效的3D人体姿态估计

Ruochen Li, Shuang Chen, Wenke E, Farshad Arvin, Amir Atapour-Abarghouei

专题命中 VLA模型 :action model(abstract);分类 cs.CV

AI总结 本文提出MASC-Pose框架,通过自适应多尺度时间建模模块和骨骼约束自适应图卷积网络,实现高效3D人体姿态估计,实验验证了其在Human3.6M和MPI-INF-3DHP数据集上的有效性。

Comments Accepted to IJCNN 2026, full paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03524 2026-04-07 cs.AI 57%

Structural Rigidity and the 57-Token Predictive Window: A Physical Framework for Inference-Layer Governability in Large Language Models

结构刚性和57个标记的预测窗口:一种用于大语言模型推理层可控性的物理框架

Gregory M. Ruddell

专题命中 VLA模型 :action model(abstract);分类 cs.AI

AI总结 本文提出一种物理框架,通过分析大语言模型的推理行为,揭示了预提交信号的存在条件,并展示了结构刚性在不同几何区域中的统一度量。

Comments Extends arXiv:2603.21415. 30 pages. Also available on Zenodo (10.5281/zenodo.19393882)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04577 2026-04-07 astro-ph.GA astro-ph.HE 50%

From NVSS to RACS: Identifying truly Compact and Steep spectrum Radio sources

从NVSS到RACS:识别真正紧凑且陡谱的射电源

Rajat Shinde, Yogesh Maan, Apurba Bera

专题命中 VLA模型 :VLA(abstract)

AI总结 本文利用RACS数据识别紧凑陡谱射电源,发现部分源在NVSS未被检测到,揭示了高红移射电星系等天体的研究价值。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03794 2026-04-07 q-bio.QM cs.SY eess.SY 50%

Bounding Transient Moments for a Class of Stochastic Reaction Networks Using Kolmogorov's Backward Equation

利用柯尔莫哥洛夫逆方程对一类随机反应网络的瞬态矩进行界分析

Takeyuki Iwasaki, Yutaka Hori

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于柯尔莫哥洛夫逆方程的方法,通过双表示法避免矩闭合问题,为随机反应网络的瞬态矩提供理论保证的上下界,同时通过线性时不变系统高效计算多初始条件下的矩界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03514 2026-04-07 physics.flu-dyn 50%

Surface-access limitation in catalytic porous monoliths: Performance diagnosis using pore-resolved CFD

催化多孔体中表面访问限制:基于孔隙解析CFD的性能诊断

Olivier Guévremont, Olivier Gazil, Federico Galli, Nick Virgilio, Bruno Blais

专题命中 VLA模型 :action model(abstract)

AI总结 研究通过孔隙解析CFD分析催化多孔体中表面访问限制问题,揭示结构依赖的表面可及性对反应性能的影响,验证了反应性CFD在真实操作条件下的应用价值。

Comments 31 pages, 12 figures, 12 appendix figures. Submitted to Chemical Engineering Journal

详情

展开后加载摘要…

URL PDF HTML 收藏