arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

共收录 2237
2605.29174 2026-05-29 cs.AI cs.CR

Paper Agents, Paper Gains: An Empirical Analysis of DeFi Investment Agents

Paper Agents, Paper Gains: DeFi投资代理的实证分析

Jay Yu, Amy Zhao, Danning Sui

机构 * Pantera Capital(Pantera资本) Stanford University(斯坦福大学) IC3 Ava Labs(Ava实验室)

AI总结 通过分析1900多个AI加密项目、10个代表性代理和11个Solana代理金库,发现当前DeFi投资代理仍处于早期阶段,存在自主执行证据不足、代币持有者集体亏损、估值与基本面脱节等问题,并提出成熟度框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17176 2026-05-29 eess.SY cs.AI cs.SY math.OC

Intent-aligned Autonomous Spacecraft Guidance via Reasoning Models

通过推理模型实现意图对齐的自主航天器制导

Yuji Takubo, Simone D'Amico

机构 * Stanford University(斯坦福大学)

AI总结 提出一种通过行为序列和航点约束将高层推理与安全轨迹优化相结合的意图对齐航天器制导框架,在近距离操作场景中实现了超过90%的SCP收敛率,并比启发式决策高出1.5倍的满足顶级意图优先性能标准的轨迹生成率。

Comments Accepted for Computer Vision and Pattern Recognition Conference (CVPR) 2026, AI4Space Workshop (4-page Short paper). 9 pages, 3 figures (including supplementary materials)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23971 2026-05-29 cs.CL cs.AI cs.GT cs.LG cs.MA

The Price Reversal Phenomenon: When Cheaper Reasoning Models Cost More

价格反转现象:当更便宜的推理模型成本更高时

Lingjiao Chen, Chi Zhang, Yeye He, Ion Stoica, Matei Zaharia, James Zou

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Microsoft Research(微软研究院)

AI总结 本文首次系统研究推理模型标价与实际成本的偏差,发现32%的模型对比较中存在价格反转现象,并基于Shapley值建立成本归因框架,揭示思考令牌消耗和交互轮次的高度异质性是主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00283 2026-05-29 cs.LG cs.AI q-bio.QM

BioArc: Discovering Optimal Neural Architectures for Biological Foundation Models

BioArc:发现生物学基础模型的最优神经架构

Yi Fang, Haoran Xu, Jiaxin Han, Sirui Ding, Yizhi Wang, Yue Wang, Xuan Wang

机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机科学系) Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院电气与计算机工程系) Department of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学计算机科学系) Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)

AI总结 针对现有基础模型架构直接迁移至生物学领域时忽视生物数据独特性质的问题,提出BioArc框架,利用神经架构搜索系统探索架构设计空间,发现高性能架构并提炼设计原则,同时提出架构预测方法以高效预测新任务的最优架构。

Comments Accepted at the 43nd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16658 2026-05-29 cs.AI cs.CE

Large-Scale AI and Foundation Models for Neuroscience: A Comprehensive Review

大规模人工智能与基础模型在神经科学中的应用:综合综述

Shihao Yang, Xiying Huang, Danilo Bernardo, Jun-En Ding, Andrew Michael, Guoan Wang, Jingmei Yang, Alison Anderson, Dinesh Giritharan, Patrick Kwan, Ashish Raj, Yu Zhang, Feng Liu

机构 * Department of Systems Engineering, Stevens Institute of Technology(系统工程系,史蒂文斯理工学院) Department of Neurology and Weill Institute for Neurosciences, University of California San Francisco(神经病学系和Weill神经科学研究所,旧金山大学) Duke Institute for Brain Sciences, Duke University(杜克大学脑科学研究所) Division of Systems Engineering, Department of Electrical and Computer Engineering, Boston University(系统工程 division,电气与计算机工程系,波士顿大学) Department of Neuroscience, School of Translational Medicine, Monash University(神经科学系,转化医学学院,莫纳什大学) Department of Neurology, Alfred Hospital, Melbourne, Victoria, Australia(神经病学系,阿尔弗雷德医院,墨尔本,维多利亚州,澳大利亚) Department of Radiology and Biomedical Imaging, University of California, San Francisco, CA, USA(放射学与生物医学成像系,旧金山大学,加州,美国) Department of Psychiatry and Behavioral Sciences, School of Medicine, Stanford University(精神病学与行为科学系,医学院,斯坦福大学) Wu Tsai Neurosciences Institute, Stanford University(吴氏神经科学研究所,斯坦福大学) Stanford Institute for Human-Centered AI, Stanford University(斯坦福大学人本人工智能研究所)

AI总结 本文综述了大规模AI模型在神经科学四个主要领域(神经影像与数据处理、脑机接口与神经解码、临床决策支持与转化框架、神经系统与精神疾病特定应用)的应用,展示了其在多模态数据整合、时空模式解释和临床转化方面的潜力,并强调了严格评估、领域知识整合、临床验证和伦理指南的重要性。

Comments Accepted for publication in Meta-Radiology

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10020 2026-05-29 stat.ML cs.LG q-bio.BM

Calibrating Generative Models to Distributional Constraints

生成模型的分布约束校准

Henry D. Smith, Nathaniel L. Diamant, Brian L. Trippe

机构 * Stanford University, Palo Alto, CA USA(斯坦福大学)

AI总结 针对生成模型采样分布统计量偏离期望的校准问题,提出将校准形式化为受约束优化问题,并通过松弛损失和奖励损失两种替代目标进行微调,在蛋白质设计、图像生成和语言建模等应用中显著降低了数百个同时约束下的校准误差。

Comments To appear at the International Conference on Machine Learning (ICML), 2026. Codebase accompanying the paper is available at: https://github.com/smithhenryd/cgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09976 2026-05-29 cs.RO

Masquerade: Learning from In-the-wild Human Videos using Data-Editing

Masquerade: 利用数据编辑从真实世界人类视频中学习

Marion Lepert, Jiaying Fang, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

AI总结 提出Masquerade方法,通过编辑真实世界第一人称人类视频(估计3D手部姿态、修复手臂、叠加渲染双臂机器人)弥合视觉具身差距,并利用编辑后的视频预训练视觉编码器、微调扩散策略头,在三个长时程双臂厨房任务中实现比基线高5-6倍的泛化性能。

Comments Project website at https://masquerade-robot.github.io/

Journal ref 2026 IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21429 2026-05-29 stat.ML cs.LG

From Sublinear to Linear: Local Convergence in Finite-Width Networks via Locally Polyak-Lojasiewicz Regions

从次线性到线性:通过局部Polyak-Lojasiewicz区域在有限宽度网络中的局部收敛

Agnideep Aich, Ashit Baran Aich, Bruce Wade

机构 * Stanford University(斯坦福大学) University of Louisiana at Lafayette(路易斯安那州立大学拉法叶分校) Presidency College Kolkata, India(印度科利切斯特 Presidency 学院)

AI总结 本文研究有限宽度前馈网络在平方经验损失下梯度下降的局部线性收敛,通过局部Polyak-Lojasiewicz不等式和NTK正定性条件,证明了在局部拟凸区域内可实现线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00779 2026-05-29 cs.RO

Phantom: Training Robots Without Robots Using Only Human Videos

Phantom: 仅使用人类视频训练机器人,无需机器人

Marion Lepert, Jiaying Fang, Jeannette Bohg

机构 * Stanford University(斯坦福大学)

AI总结 提出一种仅从人类视频演示中训练机器人操作策略的框架,通过手部姿态估计和视觉数据编辑将人类演示转化为机器人兼容的观察-动作对,实现零样本部署并达到最高92%的成功率。

Comments Project website at https://phantom-human-videos.github.io

Journal ref The 9th Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28763 2026-05-28 cs.AI

CubePart: An Open-Vocabulary Part-Controllable 3D Generator

CubePart: 一种开放词汇、部件可控的3D生成器

Yiheng Zhu, Kangle Deng, Jean-Philippe Fauconnier, Inaki Navarro, Daiqing Li, Ava Pun, Yinan Zhang, Peiye Zhuang, Xiaoxia Sun, Maneesh Agrawala, Kiran Bhat, Tinghui Zhou

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 提出CubePart框架,通过开放词汇的部件模式实现用户定义的部件级3D网格生成,无需后处理即可直接用于游戏引擎。

Comments SIGGRAPH 2026. Project Page: https://cubepart.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28253 2026-05-28 cs.CL cs.DB cs.HC

Building Community-Centred NLP Resources for Puno Quechua

构建以社区为中心的普诺克丘亚语自然语言处理资源

Elwin Huaman, Adrian Gamarra Lafuente, Johanna Cordova, Anna Korhonen

机构 * University of Cambridge (UK)(剑桥大学(英国)) Stanford University (USA)(斯坦福大学(美国)) ERTIM - Inalco (France)(ERTIM - Inalco(法国))

AI总结 通过参与式设计收集66小时语音数据,微调Whisper-base等模型,首次为普诺克丘亚语建立ASR基准并开源所有资源。

Comments Sixth Workshop on NLP for Indigenous Languages of the Americas (AmericasNLP 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28158 2026-05-28 cs.AI

OR-Space: A Full-Lifecycle Workspace Benchmark for Industrial Optimization Agents

OR-Space:面向工业优化智能体的全生命周期工作空间基准

Chenyu Zhou, Xinyun Lu, Jiangyue Zhao, Jianghao Lin, Dongdong Ge, Yinyu Ye

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai University of Finance and Economics(上海财经大学) Stanford University(斯坦福大学)

AI总结 提出OR-Space基准,通过构建、修订和解释三种任务模式,评估大语言模型智能体在工业优化工作流中的可靠性。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27946 2026-05-28 stat.ML cs.LG

Is Backpropagation Optimal? When Synthetic Gradients Improve Sample Efficiency

反向传播是最优的吗?合成梯度何时提高样本效率

Yibo Jacky Zhang, Zeyu Tang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

AI总结 本文通过理论分析,提出合成梯度作为反向传播的替代方案,并证明在某些条件下合成梯度能实现更低的梯度估计均方误差,从而显著提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27932 2026-05-28 cs.CV cs.AI cs.CL cs.CR cs.LG

When Think-with-Image Meets Safety: What Determines Multimodal Jailbreak Robustness?

当图文推理遇上安全:什么决定了多模态越狱鲁棒性?

Yuan Tian, Bing Hu, Fang Wu, Xiaomin Li, Binghang Lu, Neil Zhenqiang Gong

机构 * Independent Researcher(独立研究者) Stanford University(斯坦福大学) Harvard University(哈佛大学) Purdue University(普渡大学) Duke University(杜克大学)

AI总结 本文研究多模态大语言模型中不同图文推理范式对越狱鲁棒性的影响,发现显式图像工具交互能显著降低攻击成功率,并通过引入图像工具安全向量框架从表征层面解释其机制。

Comments 17 pages, 6 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26391 2026-05-28 cs.GR cs.CV

Garment Particles: A 2D--3D Symmetric Garment Representation for Generation and Editing

Garment Particles: 一种用于生成和编辑的2D-3D对称服装表示

Kiyohiro Nakayama, I-Chao Shen, Ruofan Liu, Yiming Wang, Gordon Wetzstein, Takeo Igarashi

机构 * Stanford University USA(斯坦福大学) The University of Tokyo Japan(东京大学) Institute of Science Tokyo Japan(东京科学研究所) ETH Zurich Switzerland(苏黎世联邦理工学院)

AI总结 提出Garment Particles,一种5D点云表示,联合编码2D裁剪图和3D几何,通过Garment Particles Flow框架支持从高级输入生成和多种编辑操作,实现最先进的服装生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16578 2026-05-28 cs.SD cs.AI cs.HC cs.LG

Voice "Cloning" is Style Transfer

语音“克隆”是风格迁移

Kaitlyn Zhou, Federico Bianchi, Martijn Bartelds, Anna Pot, Yongchan Kwon, James Zou

机构 * Cornell University(康奈尔大学) TogetherAI Stanford University(斯坦福大学)

AI总结 研究发现语音克隆并非忠实复制原声,而是系统性地应用风格迁移,使克隆语音更权威、温暖、客服化且更人性化,导致说话者特征同质化,并影响人类信任与行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11755 2026-05-28 cs.LG cs.CV stat.ML

One-Step Generative Modeling via Wasserstein Gradient Flows

通过Wasserstein梯度流的一步生成建模

Jiaqi Han, Puheng Li, Qiushan Guo, Renyuan Xu, Stefano Ermon, Emmanuel J. Candès

机构 * Stanford University(斯坦福大学) ByteDance(字节跳动)

AI总结 提出W-Flow框架,通过Wasserstein梯度流将参考分布到目标分布的演化压缩为一步生成,结合Sinkhorn散度实现高效最优传输,在ImageNet 256×256上达到1.29 FID且采样速度提升约100倍。

Comments 40 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06915 2026-05-28 cs.LG

LLMs are not (consistently) Bayesian: Quantifying internal (in)consistencies of LLMs' probabilistic beliefs

LLMs 并非(一致地)贝叶斯:量化 LLMs 概率信念的内部(不)一致性

Chacha Chen, Matthew Jörke, Adam Goliński, Masha Fedzechkina, Guillermo Sapiro, Sinead Williamson, Nicholas Foti

机构 * Apple(苹果公司) Stanford University(斯坦福大学) Princeton University(普林斯顿大学)

AI总结 本文引入信息处理差距来研究 LLMs 在更新概率信念时的内部不一致性,发现非贝叶斯启发式更新在下游任务中常优于精确贝叶斯计算,表明 LLMs 的世界概率模型存在错误设定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21890 2026-05-28 cs.LG cs.AI cs.GR

The Principles of Diffusion Models

扩散模型的原理

Chieh-Hsin Lai, Yang Song, Dongjun Kim, Yuki Mitsufuji, Stefano Ermon

机构 * MIT Press(MIT出版社) Sony AI(索尼人工智能) OpenAI(开放人工智能) Stanford University(斯坦福大学) Sony Group Corporation(索尼集团)

AI总结 本文从变分、基于分数和基于流三种视角统一阐述扩散模型的数学原理,并讨论可控生成、高效求解器和流映射模型等扩展。

Comments Supplementary materials for the book are available at the book website: https://the-principles-of-diffusion-models.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08695 2026-05-28 stat.ML cs.LG

A Bayesian Nonparametric Perspective on Mahalanobis Distance for Out of Distribution Detection

马氏距离用于分布外检测的贝叶斯非参数视角

Randolph W. Linderman, Noah Cowan, Yiran Chen, Scott W. Linderman

机构 * Electrical and Computer Engineering Department(电气与计算机工程系) Duke University(杜克大学) Statistics Department(统计学系) Stanford University(斯坦福大学) Wu Tsai Neurosciences Institute(吴泰教授神经科学研究所)

AI总结 本文通过建立贝叶斯非参数模型与相对马氏距离评分(RMDS)之间的形式关系,提出具有分层先验的贝叶斯非参数混合模型来推广RMDS,并在OpenOOD基准上证明其在训练类协方差结构不同且每类数据点较少时优于现有方法。

Comments 32 pages, 5 figures, code is available at https://github.com/rwl93/bnp4ood

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08052 2026-05-28 cs.LG stat.ML

CANDOR: Counterfactual ANnotated DOubly Robust Off-Policy Evaluation

CANDOR: 反事实注释的双重稳健离策略评估

Aishwarya Mandyam, Shengpu Tang, Jiayu Yao, Jenna Wiens, Barbara E. Engelhardt

机构 * Stanford University(斯坦福大学) Emory University(埃默里大学) Columbia University(哥伦比亚大学) University of Michigan(密歇根大学) The Gladstone Institutes(加利福尼亚大学旧金山分校格罗斯曼研究所)

AI总结 提出基于双重稳健框架的离策略评估方法,通过仅在奖励模型组件中融入反事实注释,在理论保证和实验上优于其他策略。

Comments 11 pages, published in the conference proceedings of the Conference on Health Inference and Learning (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27371 2026-05-27 cs.CY cs.AI

Algorithmic Monocultures in Hiring

招聘中的算法同质化

Rishi Bommasani, Sarah H. Bana, Kathleen A. Creel, Dan Jurafsky, Percy Liang

机构 * Stanford University(斯坦福大学) Chapman University(查普曼大学) Northeastern University(东北大学)

AI总结 研究招聘算法同质化导致相同个体和种族群体被拒绝的问题,通过分析300万求职者的400万份申请数据,发现明显的种族差异和结果同质性。

Comments Published at FAccT 2026. Website: https://algorithmichiring.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27194 2026-05-27 cs.CL cs.CV cs.LG

Not All Tokens Matter Equally: Dynamic In-context Vector Distillation with Decisive-Token Supervision for Long-form Medical Report Generation

并非所有标记都同等重要:基于关键标记监督的动态上下文向量蒸馏用于长医学报告生成

Ning Wu, Rui Liu, Xinkun Lin, Weixing Chen, Jinxi Xiang, Tao Wei, Lina Yao, Mingjie Li

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Technology Sydney(技术大学悉尼分校) School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 提出DIVE框架,通过关键标记监督和状态条件动态引导,解决长文本生成中标记级蒸馏忽略关键标记的问题,在医学报告生成任务上取得最佳性能。

Comments Preprint. 20 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26491 2026-05-27 cs.LG cs.CV

Beyond Pairwise Preferences: Listwise Reward-Aware Alignment for Diffusion Models

超越成对偏好:扩散模型的列表级奖励感知对齐

Austin Wang, Jiaqi Han, Stefano Ermon, Yisong Yue

机构 * Caltech(加州理工学院) Stanford University(斯坦福大学)

AI总结 提出Diffusion LAIR方法,通过列表级奖励感知优化,利用连续奖励分数和所有候选图像同时优化扩散模型,在文本到图像生成等任务上超越成对偏好基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26329 2026-05-27 cs.AI

JobBench: Aligning Agent Work With Human Will

JobBench:使智能体工作符合人类意愿

Yuetai Li, Yichen Feng, Zhangchen Xu, Zixian Ma, Kaiyuan Zheng, Fengqing Jiang, Xinghua Sun, Rulin Shao, Zichen Chen, Yue Huang, Xinyang Han, Brian Lee, Kayla Xu, Shenglai Zeng, Hang Hua, Xiangliang Zhang, Basel Alomair, Ranjay Krishna, Luke Zettlemoyer, Pang Wei Koh, Bhaskar Ramasubramanian, Luyao Niu, Xiang Yue, Radha Poovendran

机构 * University of Washington(华盛顿大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学) Northwestern University(西北大学) University of Notre Dame(圣母大学) University of California, Berkeley(加州大学伯克利分校) Michigan State University(密歇根州立大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Bake AI King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科技城) Western Washington University(西雅图华盛顿大学) University of Chicago(芝加哥大学)

AI总结 提出JobBench基准,通过专家识别的高优先级工作流程评估AI智能体,以人类需求为中心而非经济价值,覆盖35个职业的130个任务,使用事实锚定的评分链评估,最强模型仅达45.9%,旨在推动从替代到增强的劳动力市场影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26241 2026-05-27 cs.CV

RoMo: A Large-Scale, Richly Organized Dataset and Semantic Taxonomy for Human Motion Generation

RoMo:用于人体运动生成的大规模、丰富组织的数据集和语义分类体系

Jiahao Zhang, Joseph Liu, Young-Yoon Lee, Seonghyeon Moon, Victor Zordan, Guy Tevet, Karen Liu, Stephen Gould, Oren Jacob, Haomiao Jiang, Mubbasir Kapadia, Yizhak Ben-Shabat

机构 * Australian National University(澳大利亚国立大学) Roblox Stanford University(斯坦福大学) Rutgers University(罗格斯大学)

AI总结 提出RoMo数据集,通过分类感知过滤流水线确保质量,并采用三级语义分类体系组织数据,使训练模型在保真度和多样性上达到最优,同时提升对复杂文本提示的理解。

Comments Accepted to CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26132 2026-05-27 cs.CL cs.LG

Self-Verified Distillation: Your Language Model Is Secretly Its Own Synthetic Data Pipeline

自验证蒸馏:你的语言模型秘密地就是它自己的合成数据管道

Tony Lee, Percy Liang

机构 * Stanford University(斯坦福大学)

AI总结 提出自验证蒸馏算法,让大语言模型仅用无标注种子问题,通过自生成、自验证和自训练提升推理能力,在数学、科学和编程任务上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26079 2026-05-27 cs.CL

Automated Benchmark Auditing for AI Agents and Large Language Models

AI智能体与大语言模型的自动化基准审计

Junlin Wang, Federico Bianchi, Shang Zhu, Fan Nie, Yongchan Kwon, Bhuwan Dhingra, James Zou

机构 * Duke University(杜克大学) Together AI Stanford University(斯坦福大学)

AI总结 提出自动化基准审计框架ABA,系统审计基准任务中的隐藏环境依赖、规范缺失和评分逻辑问题,在168个基准中发现25.7%的任务存在关键问题,过滤后模型排名变化且性能提升约10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04639 2026-05-27 cs.RO cs.AI

RoboMME: Benchmarking and Understanding Memory for Robotic Generalist Policies

RoboMME:机器人通用策略的记忆基准与理解

Yinpei Dai, Hongze Fu, Jayjun Lee, Yuejiang Liu, Haoran Zhang, Jianing Yang, Chelsea Finn, Nima Fazeli, Joyce Chai

机构 * University of Michigan(密歇根大学) Stanford University(斯坦福大学) Figure AI

AI总结 提出RoboMME基准,通过16个操作任务评估VLA模型在长时程和历史依赖场景中的记忆能力,并基于π0.5骨干网络探索14种记忆增强变体,发现记忆表示的有效性高度依赖于任务。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02230 2026-05-27 cs.OS cs.AI cs.NI

Continuum: Efficient and Robust Multi-Turn LLM Agent Scheduling with KV Cache Time-to-Live

Continuum: 基于KV缓存生存时间的高效鲁棒多轮LLM智能体调度

Hanchen Li, Runyuan He, Qiuyang Mang, Qizheng Zhang, Huanzhi Mao, Xiaokun Chen, Hangrui Zhou, Alvin Cheung, Joseph Gonzalez, Ion Stoica

机构 * UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Tensormesh(Tensormesh公司) Tsinghua University(清华大学)

AI总结 针对多轮智能体工作负载中工具调用导致KV缓存无法跨轮重用的问题,提出Continuum系统,通过引入KV缓存的生存时间(TTL)机制,在GPU内存中选择性固定缓存,权衡重算/重载成本与排队延迟,实现作业完成时间平均提升8倍以上。

详情

展开后加载摘要…

URL PDF HTML 收藏