arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Stanford University(斯坦福大学)

2026-08-14 至 2026-08-14 共收录 7
2608.13522 2026-08-14 cs.LG cs.AI cs.LO cs.PL cs.SE 新提交

Vero: Can AI Agents Build Formally Verified Software Repositories?

Vero:AI智能体能否构建形式化验证的软件仓库?

Zhe Ye, Hantao Lou, Yuechun Sun, Peiyang Song, Zhengxu Yan, Timothe Kasriel, Qingyang Zhang, Kaiyu Yang, Soonho Kong, Jingxuan He, Dawn Song

机构 * University of Chicago(芝加哥大学) California Institute of Technology(加州理工学院) Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Amazon Web Services(亚马逊云计算服务) Apodex

AI总结 研究推出首个仓库级验证软件综合基准Vero,含43个多模块实例,评估发现前沿智能体仅解决27个实例,为相关研究提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12894 2026-08-14 cs.CL 新提交

BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

BavGround:巴伐利亚区域文化接地与方言能力基准

Jophin John, Michael Hoffmann, Jan Fillies, Michael A. Hedderich, Barbara Plank

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)

AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12875 2026-08-14 cs.CL 新提交

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?

Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12841 2026-08-14 cs.CL cs.AI 新提交

AQuA: Recursively Self-Improving Quantitative Trading Research Agents

AQuA:递归自我改进的量化交易研究智能体

Jiacheng Guo, Suozhi Huang, Yunlong Gao, Zihao Li, Jian Ge, Xu Kuang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Ant Group(蚂蚁集团) Stanford University(斯坦福大学)

AI总结 本研究提出AQuA系统,包含符号因子发现与可训练模型开发两个独立研究智能体,实现研究层面的递归自我改进,其构建的量化策略在美股等市场表现优异且连续五年收益为正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00367 2026-08-14 cs.LG cs.AI 版本更新

Reinforcement Learning with Pairwise Preferences in Long-Term Decision Problems

长期决策问题中基于成对偏好的强化学习

Jonathan Colaço Carr, Prakash Panangaden, Doina Precup, Benjamin Van Roy

机构 * School of Computer Science, McGill University, Montreal, Quebec, Canada(麦吉尔大学计算机科学学院) Mila - Quebec AI Institute, Montreal, Quebec, Canada(魁北克人工智能研究所) Department of Electrical Engineering, Stanford University, Stanford, California, USA(斯坦福大学电气工程系)

AI总结 针对长期决策问题中基于成对偏好的强化学习效率低且缺乏马尔可夫策略最优性保证的问题,提出马尔可夫决策竞赛模型,证明平稳马尔可夫策略最优性、求解复杂度为P,并给出亚线性收敛算法,在高维长期问题中显著提升学习效率。

Comments Accepted for ICML 2026. v2 has an updated abstract and introduction. Results and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31034 2026-08-14 cs.LG cs.AI 版本更新

Annealed Softmax Greedy in Many-Armed Bayesian Bandits

多臂贝叶斯老虎机中的退火Softmax贪婪算法

William Overman, Mohsen Bayati

机构 * Stanford University(斯坦福大学)

AI总结 本文研究退火Softmax贪婪算法在多臂贝叶斯伯努利老虎机中的贝叶斯遗憾,证明在先验满足线性上尾条件(β=1的β正则性)时,算法达到接近最优的贝叶斯遗憾率,并与RLVR方法形成结构类比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24749 2026-08-14 cs.LG stat.ML 版本更新

The Optimal Sample Complexity of Multiclass and List Learning

多类和列表学习的最优样本复杂性

Chirag Pabbaraju

机构 * Stanford University(斯坦福大学)

AI总结 研究确定多类和列表学习的最优样本复杂性依赖于DS维度,证明了DS维度上限与最大超图密度的关系,解决了长期存在的猜想。

Comments tightened realizable list learning results

详情

展开后加载摘要…

URL PDF HTML 收藏