arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-05-12 至 2026-05-12 共收录 40 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 36 篇

2605.10527 2026-05-12 cs.IR 50%

UniRank: Unified List-wise Reranking via Confidence-Ordered Denoising

UniRank: 通过置信度有序去噪实现统一列表级重排序

Pengyue Jia, Hailan Yang, Shuchang Liu, Xiaobei Wang, Wanyu Wang, Xiang Li, Yongqi Liu, Kaiqiao Zhan, Kun Gai, Xiangyu Zhao

专题命中 VLA模型 :action model(abstract)

AI总结 UniRank通过结合自回归和非自回归方法,利用置信度有序去噪实现更高效的列表级重排序,实验显示其在多个数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09394 2026-05-12 physics.chem-ph cond-mat.mtrl-sci 50%

Systematic Fine-Tuning of MACE Interatomic Potentials for Catalysis

MACE相互作用势系统微调用于催化

Nima Karimitari, Jacob Clary, Derek Vigil-Fowler, Ravishankar Sundararaman, Gábor Csányi, Christopher Sutton

专题命中 VLA模型 :action model(abstract)

AI总结 本文比较了九种不同数据集和策略训练的MLIPs,发现微调模型在处理非分布反应时更稳健,且在催化反应建模中表现出更高的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.02111 2026-05-12 cond-mat.stat-mech q-bio.PE q-bio.QM 50%

A kinetic theory for age-structured stochastic birth-death processes

面向年龄结构随机出生死亡过程的动力学理论

Chris D. Greenman, Tom Chou

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出一种全新的完全随机动力学理论,用于描述相互作用的年龄结构种群。通过定义多粒子概率密度函数,推导出年龄依赖的出生死亡过程的动力学方程,同时提供直观高效的建模方法,适用于人口学、干细胞动力学和疾病演化的研究。

Comments 9 pages, 2 figures. Abridged version with supporting appendix submitted to Phys. Rev. Lett

Journal ref Phys. Rev. E 93, 012112 (2016)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08922 2026-05-12 cs.CR 50%

Toward Web 4.0: Bidirectional Trust between AI Agents and Blockchain

迈向Web 4.0:AI代理与区块链之间的双向信任

Yunfeng Xia, Chao Li, Lei Li, Chenhao Zhang, Li Duan, Runhua Xu, Wei Wang

专题命中 VLA模型 :action model(abstract)

AI总结 本文探讨AI代理与区块链之间的双向信任机制,分析区块链为代理提供的信任基础设施及AI代理在区块链核心机制中的参与,揭示现有标准生态的不足及未来研究方向。

Comments due to the limitation "The abstract field cannot be longer than 1,920 characters", the abstract appearing here is slightly shorter than that in the PDF file

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09933 2026-05-12 cs.IR 50%

A Voronoi Cell Formulation for Principled Token Pruning in Late-Interaction Retrieval Models

基于Voronoi单元的原理化令牌修剪方法:用于晚期交互检索模型

Yash Kankanampati, Yuxuan Zong, Nadi Tomeh, Benjamin Piwowarski, Joseph Le Roux

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于超空间几何的Voronoi单元方法,用于原理化修剪晚期交互检索模型中的令牌嵌入,通过保留检索质量的同时减少索引存储开销。

Comments Accepted at SIGIR 2026 Full Paper Track; 11 pages; 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05807 2026-05-12 hep-ex 50%

Measurement of $π^0$ Production in $\barν_μ$ Charged-Current Interactions in the NOvA Near Detector

μ子反中微子诱导的电荷电流中性π⁰产生测量:NOvA近探测器

The NOvA Collaboration

专题命中 VLA模型 :action model(abstract)

AI总结 利用NOvA近探测器对μ子反中微子与碳氢化合物靶的电荷电流中性π⁰产生进行高统计量测量,比较不同中微子相互作用模型预测,发现GENIE预测相符,其他模型在Δ(1232)共振区低估截面。

Comments Full author list included in the PDF. Accepted for publication in Physical Review D

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 数据集与评测 2 篇

2605.10921 2026-05-12 cs.RO 70%

RoboMemArena: A Comprehensive and Challenging Robotic Memory Benchmark

RoboMemArena:一个全面且具有挑战性的机器人记忆基准

Huashuo Lei, Wenxuan Song, Huarui Zhang, Jieyuan Pei, Jiayi Chen, Haodong Yan, Han Zhao, Pengxiang Ding, Zhipeng Zhang, Lida Huang, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) Westlake University(西湖大学) Tsinghua University(清华大学) Zhejiang University of Technology(浙江工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出RoboMemArena,一个包含26个任务的大型基准,通过多模态注释和真实世界评估,改进了现有机器人记忆基准的不足。PrediMem在基准测试中表现优异,为复杂记忆系统提供了新的见解。

Comments Project website: https://robomemarena.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11674 2026-05-12 cs.RO cs.AI 62%

AffordSim: A Scalable Data Generator and Benchmark for Affordance-Aware Robotic Manipulation

AffordSim:一种可扩展的数据生成器和基准,用于面向 affordance 的机器人操作

Mingyang Li, Haofan Xu, Haowen Sun, Xinzhe Chen, Sihua Ren, Liqi Huang, Xinyang Sui, Chenyang Miao, Jiawei Ye, Qiongjie Cui, Zeyang Liu, Xingyu Chen, Xuguang Lan

机构 * School of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 AffordSim 通过整合开放词汇 3D affordance 预测,解决了机器人操作中接触信息获取的挑战,实现了高成功率的轨迹生成和跨仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 部署与泛化 2 篇

2605.09613 2026-05-12 cs.RO cs.CV 86%

SABER: A Scalable Action-Based Embodied Dataset for Real-World VLA Adaptation

SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应

Narsimha Menga, Parikshit Sakurikar, Amirreza Rouhi, Satya Sai Reddy, Anirudh Govil, Sri Harsha Chittajallu, Rajat Aggarwal, Anoop Namboodiri, Sashi Reddi

机构 * DreamVu

专题命中 部署与泛化 :VLA(title,title_cn);robot foundation model(abstract);分类 cs.RO、cs.CV

AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03895 2026-05-12 cs.RO cs.CV 73%

NoTVLA: Semantics-Preserving Robot Adaptation via Narrative Action Interfaces

NoTVLA:通过叙事动作接口实现语义保留的机器人适应

Zheng Huang, Mingyu Liu, Xiaoyi Lin, Muzhi Zhu, Canyu Zhao, Zongze Du, Ye Lin, Xiaoman Li, Yiduo Jia, Hao Zhong, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);分类 cs.RO、cs.CV

AI总结 NoTVLA通过稀疏轨迹规划减少灾难性遗忘,提升多任务性能,以更低计算成本和无需腕部摄像头实现高精度与语言能力保留。

详情

展开后加载摘要…

URL PDF HTML 收藏