arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

California Institute of Technology(加州理工学院)

2026-05-19 至 2026-05-19 共收录 4
2605.17829 2026-05-19 cs.AI

Interactive Evaluation Requires a Design Science

交互评估需要一种设计科学

Keyang Xuan, Peiyang Song, Pan Lu, Pengrui Han, Wenkai Li, Zhenyu Zhang, Zexue He, Wenyue Hua, Manling Li, Jiaxuan You, Adrian Weller, Yizhong Wang, Jiaxin Pei

机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Northwestern University(西北大学) University of Cambridge(剑桥大学)

AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07333 2026-05-19 cs.LG

Beyond Linear Attention: Softmax Transformers Implement In-Context Reinforcement Learning

超越线性注意:Softmax变换器实现上下文强化学习

Zixuan Xie, Xinyu Liu, Claire Chen, Shuze Daniel Liu, Rohan Chandra, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学) California Institute of Technology(加州理工学院) Purdue University(普渡大学)

AI总结 本文研究了在预训练后通过上下文适应新任务的强化学习代理,通过softmax注意力机制证明了Transformer层前向传递等价于加权softmax时序差分算法的迭代更新,并证明了参数在预训练损失中的全局极小性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11895 2026-05-19 cs.LG cs.AI cs.SE

DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models

DevBench:一个现实的、面向开发者的代码生成模型基准测试

Adarsh Kumarappan, Pareesa Ameneh Golnari, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

机构 * California Institute of Technology(加州理工学院) Microsoft(微软公司)

AI总结 DevBench通过真实开发者数据和生成模型合成,构建了包含六种编程语言和任务的1800个实例,评估大语言模型在代码补全任务中的表现,揭示模型在语法精度、语义推理和实用价值上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16341 2026-05-19 cs.LG

Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization

Orth-Dion:消除分布式低秩谱优化中的几何不匹配

Tatsuhiro Nakamori, Laura Gomezjurado Gonzalez, Ganesh Talluri, Ansh Tiwari, Hideyuki Kawashima, Ioannis Mitliagkas, Guillaume Rabusseau, Hiroki Naganuma

机构 * Keio University(庆应大学) Stanford University(斯坦福大学) Midwestern University(中西部大学) California Institute of Technology(加州理工学院) Mila Université de Montréal(蒙特利尔大学)

AI总结 Orth-Dion通过替换列归一化为右因子的QR正交化,解决分布式低秩谱优化中的几何不匹配问题,实现与Dion相同通信成本下的最优收敛率。

Comments 24 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏