arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-07-14 至 2026-07-14 共收录 25 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 21 篇

2607.09818 2026-07-14 cs.RO cs.AI cs.CV 新提交 94%

TS-Mask VLA: 2D Temporal-Spatial Masking for Vision-Language-Action Model with Effective Bridging

TS-Mask VLA:用于视觉-语言-动作模型的具有有效桥接的二维时空掩码

Shengzhuo Yang, Ronghao Yu, Chuanjie Lv, Linpeng Peng, Hang Yu, Jie Ren, Jiajun Lv, Yong Liu

机构 * Institute of Cyber-Systems and Control, Zhejiang University(浙江大学网络系统与控制研究所) Tongji University(同济大学)

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型问题,提出TS-Mask VLA框架,基于离散扩散动作专家和时空二维掩码策略,在模拟基准和现实任务实验中表现出色,验证了设计有效性。

Comments 9 pages, 5 figures, accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05737 2026-07-14 cs.CV cs.AI cs.LG cs.RO 版本更新 92%

Let It Be Simple: One-Step Action Generation for Vision-Language-Action Models

让它简单:视觉-语言-动作模型的单步动作生成

Yitong Chen, Shiduo Zhang, Jingjing Gong, Xipeng Qiu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 针对视觉-语言-动作(VLA)模型,提出通过偏置训练时间分布至高频噪声状态,实现无需教师模型、蒸馏或辅助目标的单步动作生成,性能可匹配十步解码。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11498 2026-07-14 cs.RO cs.AI 新提交 91%

See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models

像机器人一样看:用于视觉-语言-动作模型的以机器人为中心的点图

Byungkun Lee, Dongyoon Hwang, Dongjin Kim, Hojoon Lee, Minho Park, Jaegul Choo

机构 * KAIST AI(韩国科学技术院人工智能研究所) Holiday Robotics(假日机器人公司)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.AI

AI总结 研究视觉-语言-动作模型中因观察与动作定义的帧不匹配问题,提出以机器人为中心的点图方法,该方法能保留2D VLA所需网格,以最小架构变化集成到现有模型,实验证明其在模拟和实际机器人实验中表现优于基线。

Comments Project page: https://davian-robotics.github.io/pointmap/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10172 2026-07-14 cs.RO cs.LG 新提交 91%

On the Efficiency of LoRA Fine-Tuning for Vision-Language-Action Models in Industrial Robotic Manipulation

工业机器人操作中视觉语言动作模型的LoRA微调效率研究

Finn Ferchau, Daniel Pommer, Cristian Axenie

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(纽伦堡乔治·西蒙·欧姆应用技术大学) Siemens AG(西门子股份公司) Fraunhofer Institute for Integrated Circuits (IIS)(弗劳恩霍夫集成电路研究所)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title,abstract);action model(title);分类 cs.RO、cs.LG

AI总结 研究工业机器人操作中VLA模型的LoRA微调效率,通过在四个精密装配任务上评估,发现特定LoRA配置不比FFT差,r = 32时性能饱和,均匀分配即可,冻结VLM等会降性能,该方法可减少VRAM且无性能损失。

Comments 12 pages, 5 figures, 3 tables. Accepted at the International Conference on Artificial Neural Networks (ICANN 2026); to appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11653 2026-07-14 cs.LG cs.RO 版本更新 90%

Simple Recipe Works: Vision-Language-Action Models are Natural Continual Learners with Reinforcement Learning

简单配方有效:视觉-语言-动作模型通过强化学习成为自然持续学习者

Jiaheng Hu, Jay Shim, Chen Tang, Yoonchang Sung, Bo Liu, Peter Stone, Roberto Martin-Martin

机构 * University of Southern California(南加州大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract,abstract_cn);分类 cs.RO、cs.LG

AI总结 本文通过系统研究发现,对于大型预训练视觉-语言-动作模型,简单的顺序微调结合低秩适配在持续强化学习中表现出高可塑性、几乎无遗忘和强零样本泛化,优于复杂方法。

Comments Accepted at RLC 2026; Best paper award at ICRA26 RL4IL Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11324 2026-07-14 cs.RO cs.AI cs.LG 版本更新 89%

Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models

Embodied-R1.5:通过具身基础模型演化物理智能

Yifu Yuan, Yaoting Huang, Xianze Yao, Yutong Li, Shuoheng Zhang, Linqi Han, Pengyi Li, Jiangeng Sun, Wenting Jia, Zhao Zhang, Yuhao Liu, Ruihao Liao, Yucheng Hu, Qiyu Wu, Yuxiao Li, Zibin Dong, Fei Ni, Yan Zheng, Shuyang Gu, Yi Ma, Hongyao Tang, Han Hu, Jianye Hao

机构 * Tianjin University(天津大学) Tencent Hunyuan(腾讯混元)

专题命中 VLA模型 :VLA(summary_cn,abstract);embodied foundation model(title,abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出统一具身基础模型Embodied-R1.5,通过自动化数据管道和多任务平衡强化学习,在8B参数下实现24项基准中16项最优,并支持微调为VLA模型。

Comments Embodied R1.5 technical report. Project page: https://embodied-r.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 88%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11689 2026-07-14 cs.RO cs.AI 新提交 84%

From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence

从世界行动模型到具身大脑:开放世界物理智能路线图

Yuanzhi Liang, Xufeng Zhan, Haibin Huang, Chi Zhang, Xuelong Li

机构 * IEEE

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究针对通用人工智能中物理世界推理行动的进展零散问题,提出以具身大脑为中心的物理智能协同进化路线图,利用世界行动模型等,通过物理框架、共享契约和闭环训练等构建模块化智能栈,推动物理智能发展。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14712 2026-07-14 cs.RO cs.AI cs.CL cs.CV 版本更新 83%

IntentVLA: Short-Horizon Intent Modeling for Aliased Robot Manipulation

IntentVLA:用于有歧义机器人操作的短周期意图建模

Shijie Lian, Bin Yu, Xiaopeng Lin, Zhaolong Shen, Laurence Tianruo Yang, Yurun Jin, Haishan Liu, Changti Wu, Hang Yuan, Cong Huang, Kai Chen

机构 * HUST(华中科技大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢智能科技有限公司) HIT(哈尔滨工业大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ZZU(浙江工业大学) ECNU(华东师范大学) USTC(中国科学技术大学) DeepCybo

专题命中 VLA模型 :VLA(summary_cn,abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 IntentVLA通过编码近期视觉观测为紧凑的短周期意图表示,提升机器人操作的执行稳定性,并在多个基准测试中优于现有VLA基线。

Comments Code can be found in https://github.com/ZGC-EmbodyAI/IntentVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11270 2026-07-14 cs.RO cs.AI 新提交 82%

Towards Predictive, Aligned, and Scalable Robot Learning

迈向可预测、对齐且可扩展的机器人学习

Peijun Tang, Shangjin Xie, Baifu Huang, Binyan Sun, Haotian Yang, Kuncheng Luo, Weiqi Jin, Shilin Fang, Jianan Wang

机构 * Astribot Team(Astribot团队)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究旨在实现可预测、对齐且可扩展的机器人学习。核心方法是引入Lumo - 2潜在世界 - 动作模型,提出多阶段模态预对齐策略。主要贡献是该模型在实证研究中表现出色,优于基线,验证了结构化多模态对齐和预测推理对具身智能的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27677 2026-07-14 cs.RO cs.CV 版本更新 81%

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

DIM-WAM:基于多样化历史事件记忆的世界-动作建模

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Jiabing Yang, Zhaowen Li, Yan Huang, Liang Wang, Peng Su

机构 * NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) Yinwang Intelligent Technology(银旺智能科技) FiveAges(五龄科技)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出DIM-WAM,一种记忆增强的世界-动作模型,通过多尺度历史上下文、局部未来动态和全局任务进度解决长期遗忘问题,在RMBench和真实机器人任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11119 2026-07-14 cs.RO cs.AI 新提交 79%

VIA: Visual Interface Agent for Robot Control

VIA:用于机器人控制的视觉接口代理

Hengyuan Hu, Priya Sundaresan, Jensen Gao, Dorsa Sadigh

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI

AI总结 研究探索能否用基础模型通过视觉接口控制机器人,提出 VIA 框架,将机器人控制转为代理任务,该框架无需特定微调及特权信息,能零样本解决多种桌面操作任务,凭借基础模型能力提升取得高成功率,证明前沿代理技能可借合适接口用于机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10504 2026-07-14 cs.RO 新提交 70%

SUREFlow: State-space Uncertainty-aware REsidual Flow Matching for Robust Robot Manipulation

SUREFlow:用于鲁棒机器人操作的状态空间不确定性感知残差流匹配

Md Tanvir Islam, Sai Navaneet Peddapalli, Sangmoon Lee, Sangtae Ahn

机构 * School of Electronic and Electrical Engineering, Kyungpook National University(庆尚国立大学电子与电气工程学院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract_cn);分类 cs.RO

AI总结 研究针对机器人操作策略在复杂条件下的不稳定性问题,提出SUREFlow框架,基于Mamba主干联合预测动作速度与残差不确定性,能选择性细化动作维度,在LIBERO等平台实验中取得良好效果,提升了机器人操作的鲁棒性与效率。

Comments Accepted at IEEE/RSJ International Conference on Intelligent Robots & Systems (IROS) 2026, Pittsburgh, PA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09701 2026-07-14 cs.RO 新提交 70%

EgoSteer: A Full-Stack System Towards Steerable Dexterous Manipulation from Egocentric Videos

EgoSteer:一个用于从第一人称视角视频实现可控灵巧操作的全栈系统

Yifan Zhong, Zhang Chen, Tianrui Guan, Fanlian Zeng, Yuyao Ye, Tianjia He, Ka Nam Lui, Jiayi Li, Tingrui Zhang, Ruilin Yan, Xinhao Ji, Guangyu Zhao, Wenjie Lou, Jiayuan Zhang, Yuanpei Chen, Yaodong Yang

机构 * Institute for AI, PKU(北京大学人工智能研究院) PKU-PsiBot Joint Lab(北大-灵犀机器人联合实验室) UPenn(宾夕法尼亚大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对灵巧手系统因缺乏数据而无可控性的问题,提出全栈系统EgoSteer,集成EgoSmith数据管道等,通过人类数据预训练赋予语言引导操作先验,经机器人后训练强化,能执行多样任务,还开源相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09725 2026-07-14 cs.RO 新提交 57%

Learning High-Level Decision Making with an Interaction-Aware Attention-Based Network in Autonomous Driving

在自动驾驶中使用基于交互感知注意力的网络学习高级决策

Marcelo Contreras, Willi Poh, Christoph Stiller, Ehsan Hashemi

机构 * NODE lab, University of Alberta(节点实验室,阿尔伯塔大学) MRT Institute, Karlsruhe Institute of Technology(MRT 研究所,卡尔斯鲁厄理工学院)

专题命中 VLA模型 :action model(abstract);分类 cs.RO

AI总结 研究自动驾驶中高级决策问题,提出DecisionPerceiver将动态代理特征投影到固定大小潜在空间,通过潜在查询数调节特征粒度,还细化动作集,经多场景评估有性能提升、泛化能力及可扩展性。

Comments 6 pages, 5 figures, 3 tables, submitted to 2026 IEEE Intelligent Transportation Systems Conference (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07206 2026-07-14 cs.LG math.OC 版本更新 57%

Causal Optimizer Interaction Calculus: Hidden Geometric Relaxation and Identifiable Interventions

几何-非几何优化器演算:一种用于可达梯度方法的模块化语言

Zavier Li

机构 * Xidian University(西安电子科技大学)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 研究提出几何-非几何优化器演算,用于审查可达梯度方法。核心方法是定义模块及相关机制,证明方向表达定理等。主要贡献是给出方向级诊断,将设计问题转为帕累托优化,还提升残差复杂性并提供诊断原型证据。

Comments 34 pages. Complete proofs, controlled real-data experiments, and reproducibility details are included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10313 2026-07-14 cs.GR cs.SD 新提交 50%

Learn2Chat: Rethinking Dyadic Talking Heads via Interaction-Modulated Monologic Priors

Learn2Chat:通过交互调制的单声道先验重新思考二元对话头像

Zikai Huang, Siyue Chen, Xuemiao Xu, Haoxin Yang, Cheng Xu, Yihong Lin, Shengfeng He

机构 * School of Computer Science and Engineering(计算机科学与工程学院) School of Design(设计学院) South China University of Technology(华南理工大学) Guangdong Engineering Center for Large Model and GenAI Technology(广东省大模型与生成式人工智能技术工程中心) State Key Laboratory of Subtropical Building and Urban Science, Ministry of Education Key Laboratory of Big Data and Intelligent Robot(亚热带建筑科学与城市科学国家重点实验室,教育部大数据与智能机器人重点实验室) School of Computing and Information Systems(计算与信息系统学院)

专题命中 VLA模型 :action model(abstract)

AI总结 研究二元对话运动生成问题,提出Learn2Chat框架,通过交互调制预训练单声道运动先验,引入单声道锚定运动分解等方案,能有效分离运动与交互效应,实验表明该框架性能领先且与模型无关,可有效实现可扩展对话运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10723 2026-07-14 math.DS math.AP math.PR 新提交 50%

Continuity and Discontinuity of McKean-Vlasov Phase Transitions via Bifurcation Theory

通过分岔理论研究麦克凯恩-弗拉索夫相变的连续性和不连续性

Junlang Hu, Zhenxin Liu

专题命中 VLA模型 :action model(abstract)

AI总结 研究由非凸限制势和合作相互作用驱动的相变类型,通过叉形分岔定理和鞍结分岔定理分别刻画连续与不连续相变,还将道森相变点准则扩展到\(n\)维空间,并应用于多种模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10644 2026-07-14 hep-ex 新提交 50%

Signal selection and model-independent extraction of pionless charged-current muon neutrino cross section using double-differential kinematic imbalance observables on carbon and oxygen with the T2K experiment

利用T2K实验中碳和氧上的双微分运动学不平衡可观测量进行无π介子带电流μ中微子截面的信号选择和与模型无关的提取

K. Abe, S. Abe, H. Adhikary, R. Akutsu, H. Alarakia-Charles, Y. I. Alj Hakim, S. Alonso Monsalve, L. Anthony, S. Aoki, K. A. Apte, T. Arai, T. Arihara, S. Arimoto, Y. Asami, Y. Asaoka, Y. Ashida, E. T. Atkin, N. Babu, V. Baranov, G. J. Barker, G. Barr, D. Barrow, P. Bates, L. Bathe-Peters, M. Batkiewicz-Kwasniak, N. Baudis, V. Berardi, L. Berns, S. Bhattacharjee, A. Blanchet, A. Blondel, L. Bøe, P. M. M. Boistier, S. Bolognesi, S. Bordoni, S. B. Boyd, C. Bronner, A. Bubak, M. Buizza Avanzini, J. A. Caballero, N. F. Calabria, D. Calvet, S. Cao, D. Carabadjac, S. L. Cartwright, M. P. Casado, M. G. Catanesi, J. Chakrani, A. Chalumeau, D. Cherdack, A. Chvirova, J. Coleman, G. Collazuol, F. Cormier, A. A. L. Craplet, A. Cudd, D. D'Ago, C. Dalmazzone, T. Daret, C. Davis, Yu. I. Davydov, P. de Perio, G. De Rosa, T. Dealtry, C. Densham, A. Dergacheva, R. Dharmapal Banerjee, F. Di Lodovico, G. Diaz Lopez, S. Dolan, T. A. Doyle, O. Drapier, K. E. Duffy, J. Dumarchez, P. Dunne, K. Dygnarowicz, M. El Baz, J. Elias, S. Emery-Schrenk, G. Erofeev, A. Ershova, G. Eurin, M. Fani, D. Fedorova, S. Fedotov, M. Feltre, L. Feng, D. Ferlewicz, A. J. Finch, M. D. Fitton, C. Forza, M. Friend, Y. Fujii, Y. Fukuda, N. Funayama, A. N. Gaciño Olmedo, J. García-Marcos, A. C. Germer, L. Giannessi, C. Giganti, M. Girgus, V. Glagolev, M. Gonin, R. Gonzalez Jimenez, J. González Rosa, K. Gorshanov, P. Govindaraj, M. Grassi, M. Guigue, F. Y. Guo, D. R. Hadley, S. Han, D. A. Harris, R. J. Harris, M. Hartz, T. Hasegawa, C. M. Hasnip, S. Hassani, N. C. Hastings, K. Hayashi, Y. Hayato, I. Heitkamp, D. Henaff, Y. Hino, K. Hiraide, J. Holeczek, A. Holin, N. T. Hong Van, T. Honjo, M. C. F. Hooft, R. Huang, J. Hu, A. K. Ichikawa, K. Ieki, M. Ikeda, T. H. Ishida, T. Ishida, M. Ishitsuka, H. Ito, S. Ito, A. Izmaylov, N. Jachowicz, B. Jargowsky, S. J. Jenkins, C. Jesús-Valls, J. Y. Ji, T. P. Jones, P. Jonsson, C. K. Jung, M. Kabirnezhad, A. C. Kaboth, K. Kadota, H. Kakuno, A. Kamata, J. Kameda, S. Karpova, V. S. Kasturi, Y. Kataoka, T. Katori, R. Kawabe, M. Kawaue, E. Kearns, M. Khabibullin, N. V. Khomutov, A. Khotjantsev, T. Kikawa, S. King, V. Kiseeva, J. Kisiel, A. Klustová, L. Kneale, H. Kobayashi, S. R. Kobayashi, T. Kobayashi, L. Koch, S. Kodama, M. Kolupanova, L. L. Kormos, Y. Koshio, K. Kowalik, R. Kralik, Y. Kudenko, A. Kumar Jha, R. Kurjata, V. Kurochka, T. Kutter, L. Labarga, M. Lachat, K. Lachner, J. Lagoda, S. M. Lakshmi, M. Lamers James, A. Langella, D. H. Langridge, J. -F. Laporte, D. Last, N. Latham, M. Laveder, L. Lavitola, M. Lawe, A. Leclerc, N. Lemaire, D. Leon Silverio, T. Leplumey, S. Levorato, S. V. Lewis, B. Li, C. Lin, R. P. Litchfield, W. Li, A. Longhin, L. Ludovici, X. Lu, T. Lux, L. N. Machado, L. Magaletti, K. Mahn, K. K. Mahtani, S. Manly, D. G. R. Martin, D. A. Martinez Caicedo, L. Martinez, M. Martini, N. Mashin, T. Matsubara, R. Matsumoto, C. Mauger, K. Mavrokoridis, N. McCauley, K. S. McFarland, C. McGrew, J. McKean, A. Mefodiev, G. D. Megias, L. Mellet, C. Metelko, M. Mezzetto, S. Miki, V. Mikola, E. W. Miller, A. Minamino, O. Mineev, S. Mine, J. Mirabito, M. Miura, S. Moriyama, P. Morrison, Th. A. Mueller, D. Munford, A. Muñoz, L. Munteanu, Y. Nagai, T. Nakadaira, K. Nakagiri, M. Nakahata, Y. Nakajima, K. D. Nakamura, A. Nakano, Y. Nakano, S. Nakayama, T. Nakaya, K. Nakayoshi, C. E. R. Naseby, D. T. Nguyen, V. Q. Nguyen, K. Niewczas, S. Nishimori, Y. Nishimura, Y. Noguchi, T. Nosek, F. Nova, J. C. Nugent, H. M. O'Keeffe, L. O'Sullivan, W. Okinaga, K. Okumura, T. Okusawa, N. Onda, N. Ospina, L. Osu, N. Otani, Y. Oyama, V. Paolone, J. Pasternak, D. Payne, T. P. D. Peacock, M. Pfaff, L. Pickering, J. -B. Plançon, P. Podlaski, B. Popov, A. J. Portocarrero Yrey, M. Posiadala-Zezula, Y. S. Prabhu, H. Prasad, F. Pupilli, B. Quilain, P. T. Quyen, E. Radicioni, M. A. Ramirez Delgado, R. Ramsden, P. N. Ratoff, M. Reh, G. Reina, L. Restrepo, C. Riccio, D. W. Riley, E. Rondio, D. Ross, S. Roth, N. Roy, A. Rubbia, L. Russo, A. Rychter, W. Saenz, K. Sakashita, S. Samani, F. Sánchez, E. M. Sandford, Y. Sato, T. Schefke, K. Scholberg, M. Scott, Y. Seiya, T. Sekiguchi, H. Sekiya, M. Sekiyama, T. Sekiya, D. Seppala, D. Sgalaberna, A. Shaikhiev, M. Shiozawa, Y. Shiraishi, N. Shvarev, A. Shvartsman, V. Siccardi, N. Skrobova, K. Skwarczynski, D. Smyczek, M. Smy, J. T. Sobczyk, H. Sobel, F. J. P. Soler, A. J. Speers, R. Spina, A. Srivastava, P. Stowell, Y. Stroke, I. A. Suslov, A. Suzuki, M. Suzuki, S. Y. Suzuki, M. Tada, A. Takeda, Y. Takeuchi, K. Takeya, H. K. Tanaka, H. Tanigawa, A. Teklu, V. V. Tereshchenko, N. Thamm, C. Touramanis, N. Tran, T. Tsukamoto, M. Tzanov, M. Vagins, M. Varghese, I. Vasilyev, G. Vasseur, E. Villa, U. Virginet, T. Vladisavljevic, T. Wachala, H. T. Wallace, J. G. Walsh, D. Wark, M. O. Wascko, A. Weber, R. Wendell, M. J. Wilking, C. Wilkinson, C. Winterstein, C. Wret, J. Xia, Z. Xie, K. Yamamoto, T. Yamamoto, T. Yamazumi, C. Yanagisawa, Y. Yang, T. Yano, N. Yershov, U. Yevarouskaya, M. Yokoyama, Y. Yoshimoto, N. Yoshimura, A. Zalewska, J. Zalipska, G. Zarnecki, J. Zhang, X. Y. Zhao, H. Zheng, H. Zhong, M. Ziembicki, M. Zito

专题命中 VLA模型 :action model(abstract)

AI总结 利用T2K实验,在碳和氧靶上对μ中微子CC$0\pi Np$相互作用首次进行联合测量,通过双微分运动学不平衡可观测量空间,详细描述测量过程,结果显示当前模型不足,凸显改进理论核建模对提高中微子振荡测量精度的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05421 2026-07-14 eess.SY cs.SY 版本更新 50%

Game Theory in Formula 1: From Physical to Strategic Interactions

一级方程式赛车中的博弈论:从物理交互到战略交互

Giona Fieni, Marc-Philippe Neumann, Francesca Furia, Alessandro Caucino, Alberto Cerofolini, Vittorio Ravaglioli, Christopher H. Onder

专题命中 VLA模型 :action model(abstract)

AI总结 研究多智能体赛车动力学,提出优化框架,纳入物理交互模型与智能体最优响应。将最短圈速问题描述为博弈,用卡罗需-库恩-塔克条件得非线性规划结构,引入算法细化解,通过案例研究分析策略,缩小理论与应用差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10923 2026-07-14 quant-ph cond-mat.mtrl-sci 50%

Scaling active spaces in simulations of surface reactions through sample-based quantum diagonalization

通过基于样本的量子对角化扩展活性空间以模拟表面反应

Marco Antonio Barroca, Tanvi Gujarati, Vidushi Sharma, Rodrigo Neumann Barros Ferreira, Young-Hye Na, Maxwell Giammona, Antonio Mezzacapo, Benjamin Wunsch, Mathias Steiner

专题命中 VLA模型 :action model(abstract)

AI总结 本文提出基于样本的量子对角化方法,用于高精度模拟表面化学反应,通过扩展活性空间提升计算准确性。

Comments 25 pages, 7 figures

Journal ref Scientific Reports (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 3 篇

2605.23568 2026-07-14 cs.RO cs.SY eess.SY 版本更新 70%

TactileReflex: Noise-Statistics-Driven Vision-Tactile Reflex Control for Force-Sensitive Manipulation

TactileReflex:基于噪声统计的视觉-触觉反射控制用于力敏感操作

Ziyan Feng, Yulong Fu, Zheng Li, Yuxin He, Jieji Ren, Yudong Zhong, Lujia Wang, Jinni Zhou, Qiang Nie

机构 * Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究所,香港科学与技术大学(广州)) School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院)

专题命中 动作表示与策略 :vision-language-action(abstract);VLA(abstract);分类 cs.RO

AI总结 针对易变形容器操作中的力控制难题,提出基于噪声统计的标定驱动反射控制范式,利用视觉触觉传感器提取图像级代理并实现约12Hz的优先反射通道,无需外部标定或手动调参。

Comments 8 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09741 2026-07-14 cs.RO cs.AI cs.MA 新提交 62%

SWIFT: A Small-World Interaction Framework for Flow-Aware Trajectory Prediction in Autonomous Driving

SWIFT:用于自动驾驶中流量感知轨迹预测的小世界交互框架

Chengyue Wang, Bin Rao, Haicheng Liao, Bonan Wang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) Department of Civil and Environmental Engineering, University of Macau(澳门大学土木与环境工程系)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO、cs.AI

AI总结 研究自动驾驶中轨迹预测问题,提出SWIFT框架,结合小世界网络与交通流理论,通过特定网络和模块引入结构偏差与增强推理,实验证明其在多方面优于基线,展现出结构感知设计的有效性。

Comments Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11397 2026-07-14 cs.RO 新提交 57%

WALA Learning Executable Latent Actions from Action-Labeled Demonstrations and Action-Free Videos

WALA:从带动作标签的演示和无动作视频中学习可执行的潜在动作

Jiahao Liu, Zhongpu Xia, Shuai Tian, Huangrui Li, Yuhang Zheng, Ning Ma, Xin Fu, Xiaotian Liu, Jing Li, Yixian Li, ShangQing Zhou, Zebin Xing, Linbo Wang, Chaoyue Li, Haoran Li, Dongbin Zhao

机构 * CASIA(中国科学院自动化所) Anyverse Dynamics(Anyverse动力学公司) UCAS(中国科学院大学) NUS(新加坡国立大学) XJYLU(西安交通大学利物浦大学)

专题命中 动作表示与策略 :action model(abstract);分类 cs.RO

AI总结 研究从带动作标签演示和无动作视频学习可执行潜在动作的问题,提出WALA框架,先预训练语义几何潜在动作模型,策略训练时编码器和解码器协同,由多方面联合监督潜在动作,实验证明其提升了机器人策略性能和泛化能力。

Comments Project page: https://liujiahao2077.github.io/WALA.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 机器人基础模型 1 篇

2607.10655 2026-07-14 cs.RO 新提交 70%

Artificial Foveated Perception for Mitigating Shortcut Learning in Robotic Foundation Models

用于减轻机器人基础模型中捷径学习的人工中央凹感知

Xiatao Sun, Yuan Zhuang, Mateo Sanchez Lopez Negrete, Matei-Victor Coldea, Chen Liang, Haoyang Zhang, Che Liu, Ziyao Zeng, Shawn Li, Qian Wang, Fei Miao, Daniel Rakita

机构 * Yale University(耶鲁大学) University of Connecticut(康涅狄格大学) Peking University(北京大学) Imperial College London(帝国理工学院) Digients

专题命中 机器人基础模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 研究机器人基础模型因捷径学习难以稳健部署的问题,提出人工中央凹感知模块AFP,通过预测任务条件掩码辅助微调,使策略关注任务相关区域,实验证明其能减少微调时间、抑制过拟合并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏