arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-06-23 至 2026-06-23 共收录 56 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 48 篇

2606.20679 2026-06-23 cs.RO cs.AI cs.CV 新提交 78%

MemoryVAM: Integrating Memory into Video Action Model for Robot Manipulation

MemoryVAM:将记忆融入视频动作模型以实现机器人操作

Yuxin Jiang, Chang Yu, Yunuo Chen, Xiang Feng, Yin Yang, Nishank Gite, Chenfanfu Jiang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Nirvana Robotics(涅槃机器人) University of California, San Diego(加州大学圣迭戈分校) University of Utah(犹他大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出MemoryVAM,通过Recap-Cue模块将情景记忆注入视频世界模型策略,解决长时域操作中的非马尔可夫性问题,在LIBERO-Mem和真实机器人任务上显著提升成功率。

Comments Project page: https://MemoryVAM.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21415 2026-06-23 astro-ph.HE 版本更新 78%

Impact of the EPOS.LHC-R hadronic interaction model on the Centaurus A ultrahigh-energy cosmic-ray scenario

EPOS.LHC-R强子相互作用模型对半人马座A超高能宇宙射线情景的影响

Silvia Mollerach, Esteban Roulet

专题命中 VLA模型 :action model(title,abstract)

AI总结 本文探讨了EPOS.LHC-R强子相互作用模型对邻近半人马座A射电星系作为能量>5 EeV宇宙线主要起源的情景的影响,发现该模型导致更重的成分组成,并引入了一种从大气簇射最大发展深度提取宇宙线质量信息的新方法。

Comments matches published version

Journal ref Phys.Rev.D 113 (2026) 10, 103019

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22860 2026-06-23 cs.RO 新提交 77%

HiL-ResRL: A Model-Agnostic Finetuning Adapter via Human-in-the-loop Residual Reinforcement Learning

HiL-ResRL: 通过人在回路残差强化学习的模型无关微调适配器

Jingyi Liu, Zhaohong Mai, ShunSen He, Hang Ren, Chao Wang, Shunbo Zhou, XiaoDong Wu, Heng Zhang

机构 * CloudRobo Lab, Huawei Cloud Computing Technologies Co., Ltd.(华为云计算技术有限公司云机器人实验室) South China University of Technology(华南理工大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出一种模型无关的即插即用微调流程,通过残差策略和人在回路指导,在1.5小时内使机器人操作成功率超过95%。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17055 2026-06-23 cs.RO 新提交 77%

T-Rex: Tactile-Reactive Dexterous Manipulation

T-Rex: 触觉反应灵巧操作

Dantong Niu, Zhuoyang Liu, Zekai Wang, Boning Shao, Zhao-Heng Yin, Anirudh Pai, Yuvan Sharma, Stefano Saravalle, Ruijie Zheng, Jing Wang, Ryan Punamiya, Mengda Xu, Yuqi Xie, Yunfan Jiang, Letian Fu, Konstantinos Kallidromitis, Matteo Gioia, Junyi Zhang, Jiaxin Ge, Haiwen Feng, Fabio Galasso, Wei Zhan, David M. Chan, Yutong Bai, Roei Herzig, Jiahui Lei, Li Fei-Fei, Ken Goldberg, Jitendra Malik, Pieter Abbeel, Yuke Zhu, Danfei Xu, Linxi Fan, Trevor Darrell

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达) Stanford(斯坦福大学) Panasonic(松下) La Sapienza University(罗马大学) ItalAI

专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。

Comments Project page: https://tactile-rex.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交 76%

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15757 2026-06-23 cs.RO cs.AI 版本更新 73%

You've Got a Golden Ticket: Improving Generative Robot Policies With A Single Noise Vector

你有一张金票:用单一噪声向量改进生成式机器人策略

Omkar Patil, Ondrej Biza, Thomas Weng, Karl Schmeckpeper, Wil Thomason, Xiaohan Zhang, Kausik Sivakumar, Robin Walters, Nakul Gopalan, Sebastian Castro, Stephen Hart, Eric Rosen

机构 * Robotics and AI Institute(机器人与人工智能研究所) Arizona State University(亚利桑那州立大学) Northeastern University(东北大学)

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出用固定初始噪声替换高斯采样,通过蒙特卡洛搜索找到“金票”,无需训练即可提升预训练扩散/流匹配策略在46/51个任务中的成功率,最高提升55%。

Comments 34 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10187 2026-06-23 astro-ph.SR astro-ph.HE gr-qc 版本更新 71%

Modern tidal interaction models for rapid binary population synthesis: I. Methods

现代潮汐相互作用模型用于快速双星族合成:I. 方法

Veome Kapil, Ilya Mandel, Evgeni Grishin, Jim Fuller, Jeff Riley, Emanuele Berti

专题命中 VLA模型 :action model(title)

AI总结 本文提出适用于快速双星族合成的现代潮汐耗散理论简化表达式,在COMPAS中实现并验证了潮汐与恒星演化及双星性质的自洽耦合,潮汐耗散效率可比常用模型高1-7个数量级。

Comments 24 pages, 11 figures, accepted for publication by ApJ

Journal ref ApJ 1002 200 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23685 2026-06-23 cs.RO 新提交 70%

LaST-HD: Learning Latent Physical Reasoning from Scalable Human Data for Robot Manipulation

LaST-HD:从可扩展人类数据中学习潜在物理推理以进行机器人操作

Jiaming Liu, Yinxi Wang, Chenyang Gu, Siyuan Qian, Xiangju Mi, Hao Chen, Jiawei Chen, Qingpo Wuwu, Xiaoqi Li, Nuowei Han, Yiming Zhang, Xuheng Zhang, Yang Yue, Yeqing Yang, Lei Wang, Peng Jia, Hao Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) The Chinese University of Hong Kong(香港中文大学) Simplexity Robotics Aether Tech

专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出LaST-HD框架,通过将人手与机器人演示在共享潜在推理空间中对齐,利用未配对轨迹训练世界模型合成统一潜在目标,实现跨形态物理动力学内化,并开发低成本数据手套OOL Glove,结合混合训练策略,仅用少量人类数据即可达到高泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23420 2026-06-23 cs.RO 新提交 70%

Flowing With Purpose: Latent Action Guided Flow Matching Policies For Robotic Manipulation

有目的的流动:潜在动作引导的流匹配策略用于机器人操作

Bruno Machado, Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * École Centrale de Lyon(里昂中央理工学院) LIRIS, UMR5205(LIRIS实验室,UMR5205)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出潜在动作引导流匹配(LAFM)框架,通过自适应先验分布库替代固定高斯分布,利用潜在动作模型选择结构对齐的初始化,解决流匹配策略中向量场纠缠问题,在真实机器人部署中成功率提升23.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21188 2026-06-23 cs.RO 新提交 70%

Remember what you did?: Learning Behavioral Memories for Partially Observable Object Manipulation

记住你做了什么?:学习部分可观察物体操作的行为记忆

Kuancheng Wang, Seungho Yeom, Jinglin Cao, Yuheng Zhi, Nikhil Shinde, Michael Yip

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 针对长时域、接触式操作中的部分可观测问题,提出压缩动作记忆策略(CAMP),通过自监督学习动作历史压缩表示,隐式追踪任务进度并从失败中学习,在多个真实和仿真任务上超越现有方法。

Comments Project website: robo-camp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20980 2026-06-23 cs.CV cs.AI cs.RO 新提交 67%

Robusto-2: Benchmarking Humans & VLMs for Autonomous Driving in Lima & New York City

Robusto-2: 在利马与纽约市对自动驾驶中人类与VLM的基准测试

Adrian Cespedes, Marcelo Chincha, Dunant Cusipuma, Victor Flores-Benites, David Ortega, Arturo Deza

机构 * Artificio Lima, Peru

专题命中 VLA模型 :action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本研究通过视觉问答范式,比较人类驾驶员(来自利马和纽约)与视觉语言模型在利马和纽约的驾驶场景中的表现,发现人类与模型在回答事实、评级、反事实和推理四类问题时存在差异,但地理因素影响不显著。

Comments 11 pages main body. 42 pages total. Data publicly available online

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22845 2026-06-23 astro-ph.GA 新提交 67%

Observations of a Possible Transient Magnetically Arrested Accretion State in a Nearby Quasar: OQ208

邻近类星体OQ208中可能的瞬态磁捕获吸积态的观测

Brian Punsly, Cormac Reynolds, Paola Marziani, Gary J. Hill, Alexander B. Pushkarev, Carlo Stanghellini, Frank Schinzel, Christopher O'Dea, Gregory R. Zeimann, Andrew Biggs, Jian-Min Wang, Pu Du, Alberto Floris, Mauro D'Onofrio, Levi Malmstrom

专题命中 VLA模型 :VLA(abstract,abstract_cn)

AI总结 基于39年多波段数据,发现OQ208在1997-2001年间Hα发射线减弱与射电耀斑同步,支持瞬态磁捕获吸积态模型。

Comments To appear in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 62%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.CV、cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23085 2026-06-23 cs.RO 新提交 57%

Foresight: Failure Detection for Long-Horizon Robotic Manipulation with Action-Conditioned World Model Latents

Foresight: 基于动作条件世界模型潜在变量的长时程机器人操作故障检测

Haoran Zhang, Yifu Lu, Boyang Wang, Xuhui Kang, Yen-Ling Kuo, Zezhou Cheng, Mengdi Wang, Odest Chadwicke Jenkins

机构 * University of Michigan(密歇根大学) Princeton University(普林斯顿大学) University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :vision-language-action(abstract);分类 cs.RO

AI总结 提出Foresight框架,利用动作条件世界模型的潜在表征监测操作轨迹,仅用最终任务级标签训练,结合函数共形预测自适应校准阈值,在仿真和真实机器人长时程任务中实现高效故障检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22823 2026-06-23 cs.LG q-bio.QM 新提交 57%

Retrieval-Augmented Multimodal Learning for Enzyme-Substrate Interaction Prediction Under Low-Homology Shift

检索增强的多模态学习用于低同源性偏移下的酶-底物相互作用预测

Chen Liu, Bingxin Zhou, Xinyuan Wang, Ming Li, Guisheng Fan, Liang Hong

机构 * School of Information Science and Engineering, East China University of Science and Technology(华东理工大学信息科学与工程学院) Institute of Natural Sciences and Zhangjiang Institute for Advanced Study, Shanghai Jiao Tong University(上海交通大学自然科学研究院和张江高等研究院) School of Life Sciences and Biotechnology, Shanghai Jiao Tong University(上海交通大学生命科学技术学院)

专题命中 VLA模型 :action model(abstract);分类 cs.LG

AI总结 提出RAMMESI框架,通过跨模态交互建模、自适应融合和检索增强,解决酶-底物相互作用预测中稀疏正监督和低同源性分布偏移问题,在低序列一致性场景下表现优异。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23223 2026-06-23 physics.optics physics.med-ph 新提交 50%

A unified perspective on wavelength selection for molecular composition inference from diffuse spectroscopy

漫反射光谱中用于分子组成推断的波长选择的统一视角

Kevin Scibilia, Marcel Rosier, Luca Giannoni, Pietro Ricci, Frédéric Lange, Francesco S. Pavone, Ilias Tachtsidis, Daniel Rueckert, Ivan Ezhov

专题命中 VLA模型 :action model(abstract)

AI总结 提出统一框架整合现有波长选择方法,并引入基于投影的新方法预选波长范围,通过猪仔缺氧缺血模型验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23559 2026-06-23 hep-ex 新提交 50%

Probing Nuclear Effects with Transverse Kinematic Imbalance in Muon-neutrino Induced Charged-Current $π^0$ Production on Argon with the MicroBooNE Detector

用MicroBooNE探测器研究μ子中微子诱导的氩上带电电流π⁰产生中的横向运动学不平衡与核效应

MicroBooNE collaboration, P. Abratenko, D. Andrade Aldana, J. Asaadi, A. Ashkenazi, S. Balasubramanian, B. Baller, A. Barnard, G. Barr, D. Barrow, J. Barrow, V. Basque, J. Bateman, B. Behera, O. Benevides Rodrigues, S. Berkman, A. Bhat, V. Bhelande, M. Bhattacharya, A. Binau, M. Bishai, A. Blake, B. Bogart, T. Bolton, M. B. Brunetti, L. Camilleri, D. Caratelli, F. Cavanna, G. Cerati, A. Chappell, Y. Chen, J. M. Conrad, M. Convery, L. Cooper-Troendle, J. I. Crespo-Anadon, R. Cross, M. Del Tutto, S. R. Dennis, P. Detje, R. Diurba, Z. Djurcic, K. Duffy, S. Dytman, B. Eberly, P. Englezos, A. Ereditato, J. J. Evans, C. Fang, W. Foreman, B. T. Fleming, D. Franco, A. P. Furmanski, F. Gao, D. Garcia-Gamez, S. Gardiner, G. Ge, S. Gollapinni, E. Gramellini, P. Green, H. Greenlee, L. Gu, W. Gu, R. Guenette, L. Hagaman, M. D. Handley, M. Harrison, S. Hawkins, A. Hergenhan, O. Hen, C. Hilgenberg, G. A. Horton-Smith, A. Hussain, B. Irwin, M. S. Ismail, C. James, X. Ji, J. H. Jo, A. Johnson, R. A. Johnson, D. Kalra, G. Karagiorgi, A. Kelly, W. Ketchum, M. Kirby, T. Kobilarcik, K. Kumar, N. Lane, J. -Y. Li, Y. Li, K. Lin, B. R. Littlejohn, L. Liu, S. Liu, W. C. Louis, X. Luo, T. Mahmud, N. Majeed, C. Mariani, J. Marshall, F. Martinez Lopez, D. A. Martinez Caicedo, M. G. Manuel Alves, S. Martynenko, A. Mastbaum, I. Mawby, N. McConkey, B. McConnell, L. Mellet, J. Mendez, J. Micallef, A. Mogan, T. Mohayai, M. Mooney, A. F. Moor, C. D. Moore, L. Mora Lepin, M. A. Hernandez Morquecho, M. M. Moudgalya, S. Mulleriababu, D. Naples, A. Navrer-Agasson, D. Nawarathne, N. Nayak, M. Nebot-Guinot, C. Nguyen, L. Nguyen, J. Nowak, N. Oza, O. Palamara, N. Pallat, V. Paolone, A. Papadopoulou, V. Papavassiliou, H. B. Parkinson, S. F. Pate, N. Patel, Z. Pavlovic, E. Piasetzky, K. Pletcher, I. Pophale, X. Qian, J. L. Raaf, V. Radeka, A. Rafique, M. Reggiani-Guzzo, J. Rodriguez Rondon, M. Rosenberg, M. Ross-Lonergan, I. Safa, C. Sauer, D. W. Schmitz, A. Schukraft, W. Seligman, M. H. Shaevitz, R. Sharankova, J. Shi, L. Silva, E. L. Snider, S. Soldner-Rembold, J. Spitz, M. Stancari, J. St. John, T. Strauss, A. M. Szelc, N. Taniuchi, K. Terao, C. Thorpe, D. Torbunov, D. Totani, M. Toups, A. Trettin, Y. -T. Tsai, J. Tyler, M. A. Uchida, T. Usher, B. Viren, M. L. Velazquez Fernandez, J. Wang, L. Wang, M. Weber, H. Wei, A. J. White, S. Wolbers, T. Wongjirad, K. Wresilo, W. Wu, E. Yandel, T. Yang, L. E. Yates, H. W. Yu, G. P. Zeller, J. Zennamo, S. Zhai, C. Zhang, Y. Zhang

专题命中 VLA模型 :action model(abstract)

AI总结 利用MicroBooNE探测器首次测量氩上μ子中微子带电电流共振类相互作用的横向运动学不平衡变量,揭示末态相互作用模型无法同时再现所有观测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20836 2026-06-23 astro-ph.HE 新提交 50%

Old and Bright: The Remarkable Radio Brightening of the Engine-driven SN 2012au Several Years After Explosion Signals the Birth of a PWN

古老而明亮:引擎驱动的SN 2012au在爆炸数年后显著的射电增亮标志着脉冲星风云的诞生

Eli Wiston, Raffaella Margutti, A. J. Nayana, Brian D. Metzger, Kohta Murase, Dan Milisavljevic, Itai Sfaradi, Ryan Chornock, Deanne L. Coppejans, Joe Bright, Garrett K. Keating, Giacomo Terreran, Mattias Lazda, Maria R. Drout, Michael Stroh, Lauren Rhodes, Ben Margalit, Jonathan Granot, Fabio De Colle, Michael Bietenholz, Daichi Tsuna, Samantha Wu, Tanmoy Laskar, Edo Berger, Daniel Patnaude, Collin T. Christy

专题命中 VLA模型 :action model(abstract)

AI总结 本研究通过多波段观测发现,引擎驱动的Ib型超新星SN 2012au在爆炸约6.7年后出现显著的射电再增亮,其光谱和演化特征与新生脉冲星风云(PWN)的绝热膨胀模型一致,而非传统的激波-星周介质相互作用。

Comments 39 pages, 20 figures, 4 tables, Submitted to ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 动作表示与策略 5 篇

2606.20871 2026-06-23 cs.RO 新提交 70%

Geometric Entropy: When Trajectory Diversity Helps and Hurts in Imitation Learning

几何熵:轨迹多样性在模仿学习中的利弊

Qian Luo, Ruizhe Liu, Pei Zhou, Xunzhe Zhou, Yanchao Yang

机构 * InfoBodied AI Lab, The University of Hong Kong(香港大学信息体人工智能实验室) Transcengram

专题命中 动作表示与策略 :vision-language-action(abstract);action model(abstract);分类 cs.RO

AI总结 提出几何熵(H_G)量化演示轨迹的几何多样性,发现成功率与H_G呈倒U型关系,且最优熵随任务掌握度增加而降低,可用于数据集审计与校准。

Comments Accepted to IROS 2026. Project page: https://geometric-entropy.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19340 2026-06-23 cs.RO 新提交 70%

ZeroDex: Zero-Shot Long-Horizon Dexterous Manipulation via Multi-View 3D-Grounded VLM Reasoning

零样本长时程灵巧操作:基于多视图3D接地VLM推理

Jisoo Kim, Sangwon Baik, Taeksoo Kim, Sungjoo Kim, Junyoung Lee, Mingi Choi, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 动作表示与策略 :VLA(abstract,abstract_cn);分类 cs.RO

AI总结 提出零样本框架,利用多视图RGB图像通过VLM生成3D任务规划,结合三角测量和射线投票实现精确3D接地,支持抓取和工具使用,在真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21139 2026-06-23 cs.RO cs.AI cs.LG 新提交 67%

PoLAR: Factorizing Extent and Mode in Latent Actions for Robot Policy Learning

PoLAR:分解潜在动作中的程度和模式用于机器人策略学习

Youngjoon Jeong, Jihwan Yu, Minsoo Jo, Junha Chun, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 动作表示与策略 :VLA(abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 提出PoLAR方法,通过径向方向结构分解潜在动作中的程度和模式,利用时间偏移作为程度代理,在双曲空间中实现,提升下游策略性能。

Comments Project Page: https://joon-stack.github.io/PoLAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23537 2026-06-23 cs.DB cs.AI cs.LG 新提交 62%

SQLConductor: Search-to-Policy Learning for Step-wise Text-to-SQL Orchestration

SQLConductor:面向逐步文本到SQL编排的搜索到策略学习

Yizhang Zhu, Zhangyang Peng, Boyan Li, Yuyu Luo

机构 * HKUST(GZ)(香港科技大学(广州))

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI、cs.LG

AI总结 提出SQLConductor框架,通过搜索到策略学习将文本到SQL任务分解为动作序列,用蒙特卡洛树搜索探索工作流并训练策略模型逐步编排,在BIRD-Dev上达73.2%执行准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21144 2026-06-23 cs.CL cs.AI 新提交 57%

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

AdaMem: 学习为个性化长时程LLM代理记住什么

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

专题命中 动作表示与策略 :action model(abstract);分类 cs.AI

AI总结 针对长时程LLM代理中记忆膨胀导致QA准确率下降的问题,提出AdaMem方法,通过角色特定的记忆策略和基于反馈的轻量级自反思步骤,学习为每个用户记住重要信息,在减少9%记忆量的同时提升QA准确率最高9%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 2 篇

2606.04825 2026-06-23 cs.RO 版本更新 77%

HapTile: A Haptic-Informed Vision-Tactile-Language-Action Dataset for Contact-Rich Imitation Learning

HapTile: 用于接触丰富模仿学习的触觉感知视觉-触觉-语言-动作数据集

Amirhosein Alian, Yongqiang Zhao, Shiyi Gu, Xuyang Zhang, Zhuo Chen, Christopher E. Mower, Haitham Bou-Ammar, Shan Luo

机构 * King’s College London, UK(伦敦国王学院) Huawei, Noah’s Ark Lab, UK(华为、诺亚实验室) University College London, UK(伦敦大学学院)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 提出HapTile数据集,通过集成指尖触觉反馈和操作员触觉感知,为接触丰富的机器人操作任务提供视觉-触觉-语言-动作联合数据,并验证其在策略学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19358 2026-06-23 cs.RO 新提交 57%

WorkBenchMark: A LEGO-Based Assembly Benchmark with an Assembly-by-Disassembly Baseline for the Smart Manufacturing League

WorkBenchMark:面向智能制造联盟的基于乐高积木的装配基准与通过拆卸进行装配的基线方法

Wenbo Ma, Daniel Swoboda, Matteo Tschesche, Till Hofmann

机构 * Chair of Machine Learning and Reasoning (i6), RWTH Aachen University(亚琛工业大学机器学习与推理教席(i6)) MASCOR Institute, FH Aachen University of Applied Science(亚琛应用技术大学MASCOR研究所)

专题命中 数据集与评测 :vision-language-action(abstract);分类 cs.RO

AI总结 提出一个基于乐高Duplo的机器人装配基准,包含400个任务和四个复杂度层级,并提供一个基于规划的基线方法,在所有层级上优于现代视觉-语言-动作方法。

Comments RoboCup Symposium 2026 accepted paper

Journal ref RoboCup 2026: Robot World Cup XXIX

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 部署与泛化 1 篇

2606.16917 2026-06-23 cs.RO 新提交 74%

Unified Motion-Action Modeling for Heterogeneous Robot Learning

统一运动-动作建模用于异构机器人学习

Yunhao Cao, Shitong Liu, Chao Feng, Meryl Zhang, Xuanchen Lu, Andrew Owens, Kuan Fang

机构 * Cornell University(康奈尔大学)

专题命中 部署与泛化 :action model(title);分类 cs.RO

AI总结 提出UMA模型,利用3D物体运动轨迹作为共享接口,通过掩码生成目标统一视觉运动控制和动力学建模,实现跨异构数据源的多任务预训练,并在部署时支持多种推理模式。

Comments https://uma-manipulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏