arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Texas at Austin(得克萨斯大学奥斯汀分校)

2026-05-15 至 2026-05-15 共收录 4
2605.12484 2026-05-15 cs.LG cs.AI

Learning, Fast and Slow: Towards LLMs That Adapt Continually

学习,快速与缓慢:迈向能够持续适应的LLM

Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei Zaharia, Kurt Keutzer, Inderjit S Dhillon, Rishabh Agarwal, Devvrit Khatri

机构 * UC Berkeley(加州大学伯克利分校) Mila(蒙特利尔大学人工智能研究所) UT Austin(得克萨斯大学奥斯汀分校) Eragon Periodic Labs Mirendil Video

AI总结 本文提出一种快速-缓慢学习框架,通过将模型参数作为缓慢权重和优化上下文作为快速权重,提升LLM在连续学习中的样本效率和性能,减少灾难性遗忘。

Comments 29 pages, 14 figures, including appendix; Blog post: https://gepa-ai.github.io/gepa/blog/2026/05/11/learning-fast-and-slow/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12529 2026-05-15 cs.LG cs.AI cs.CL

TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning

TERMINATOR: 在链式推理中学习最优退出点以实现早期停止

Alliot Nagle, Jakhongir Saydaliev, Dhia Garbaya, Michael Gastpar, Ashok Vardhan Makkuva, Hyeji Kim

机构 * UT Austin(得克萨斯大学) EPFL(苏黎世联邦理工学院) ENS Paris-Saclay(巴黎-萨克雷大学) Télécom Paris (IP Paris)(巴黎理工学院)

AI总结 本文提出TERMINATOR方法,通过预测模型最终答案的首次出现位置,学习最优推理长度,从而减少链式推理的计算量,提升推理效率。

Comments Updated and reorganized results. Added new results

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08715 2026-05-15 cs.CL cs.AI cs.MA

AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems

AgentForesight:多智能体系统中在线审计的早期故障预测

Boxuan Zhang, Jianing Zhu, Zeru Shi, Dongfang Liu, Ruixiang Tang

机构 * Rutgers University(新泽西罗格拉大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Purdue University(普渡大学)

AI总结 本文提出AgentForesight框架,通过在线审计实现多智能体系统中早期故障预测,利用AFTraj-2K数据集训练出AgentForesight-7B模型,在性能和定位精度上优于GPT-4.1等模型。

Comments 33 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11186 2026-05-15 cs.MA cs.AI math.OC

Sequential Resource Trading Using Comparison-Based Gradient Estimation

基于比较的梯度估计的顺序资源交易

Surya Murthy, Mustafa O. Karabag, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文研究了两个贪心理性代理在有限资源类别中进行顺序多议题交易的问题,提出基于比较的算法通过接受/拒绝反馈估计对方梯度,确保交易互惠并最终收敛到帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏