arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Harvard University(哈佛大学)

2026-03-17 至 2026-03-17 共收录 7
2603.15617 2026-03-17 cs.LG

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12248 2026-03-17 cs.LG

Matching Features, Not Tokens: Energy-Based Fine-Tuning of Language Models

匹配特征而非标记:基于能量的语言模型微调

Samy Jelassi, Mujin Kwun, Rosie Zhao, Yuanzhi Li, Nicolo Fusi, Yilun Du, Sham M. Kakade, Carles Domingo-Enrich

机构 * Harvard University, Kempner Institute(哈佛大学凯普纳研究所) Microsoft Research New England(微软研究院新英格兰分部)

AI总结 本文提出基于能量的语言模型微调方法,通过匹配序列级统计信息提升模型表现,无需任务特定验证器或偏好模型,在多个任务中优于传统微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13605 2026-03-17 cs.AI

Orla: A Library for Serving LLM-Based Multi-Agent Systems

Orla:一个用于服务基于LLM的多智能体系统的库

Rana Shahout, Hayder Tirmazi, Minlan Yu, Michael Mitzenmacher

机构 * Harvard University(哈佛大学) Boston University(波士顿大学)

AI总结 Orla提供了一种通用抽象,将请求执行与工作流级策略分离,通过阶段映射器、工作流编排器和内存管理器实现智能体级控制,展示了在客户支持工作流中的应用,并通过两个数据集验证了其在延迟和成本上的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13562 2026-03-17 cs.LG

Scalable Classification of Course Information Sheets Using Large Language Models: A Reusable Institutional Method for Academic Quality Assurance

利用大语言模型实现课程信息表的可扩展分类:一种用于学术质量保证的可重用机构方法

Brecht Verbeken, Joke Van den Broeck, Inge De Cleyn, Steven Van Luchene, Nadine Engels, Andres Algaba, Vincent Ginis

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Harvard University(哈佛大学)

AI总结 本文提出一种利用大语言模型对课程信息表进行大规模分类的方法,通过迭代优化和多模型比较,实现了对课程评估风险的识别与验证,为学术质量保证提供了可重用的机构方法。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13444 2026-03-17 cs.CR cs.AI

Technical Case Study of Privacy-Enhancing Technologies (PETs) for Public Health

公共健康中隐私增强技术(PETs)的技术案例研究

Avinash Laddha, Danil Mikhailov, Uyi Stewart

机构 * Mastercard Harvard University(哈佛大学) OpenDP Javeriana University(贾维里亚大学) Sloan Foundation(斯隆基金会)

AI总结 本文通过技术案例研究展示如何利用差分隐私技术生成隐私保护的合成财务交易数据,结合公共卫生和移动性数据,开发六个可重用工具,提升流行病学决策能力。

Comments Estimated 20 pages, 0 figures. The work is a technical case study of the PETs for Public Health Challenge. Author Avinash Laddha contributed to this final report and interpreted insights. For more information on the organizing non-profit, see http://data.org

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13299 2026-03-17 cs.LG cs.AI

DreamReader: An Interpretability Toolkit for Text-to-Image Models

DreamReader: 一种用于文本到图像模型的可解释性工具包

Nirmalendu Prakash, Narmeen Oozeer, Michael Lan, Luka Samkharadze, Phillip Howard, Roy Ka-Wei Lee, Dhruv Nathawani, Shivam Raval, Amirali Abdullah

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Martian Thoughtworks NVIDIA Harvard University(哈佛大学)

AI总结 DreamReader提出了一种统一框架,通过可组合的表示操作分析扩散模型的可解释性,引入三种新干预机制,通过实验展示其在文本到图像模型中的应用,推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02225 2026-03-17 cs.LG

Scaling Reward Modeling without Human Supervision

无需人类监督的奖励建模扩展

Jingxuan Fan, Yueying Li, Zhenting Qi, Dinghuai Zhang, Kianté Brantley, Sham M. Kakade, Hanlin Zhang

机构 * Harvard University(哈佛大学) Cornell University(康奈尔大学) Microsoft Research(微软研究院) Kempner Institute(凯普纳研究所)

AI总结 本文提出无需人类标注的奖励建模方法,通过大规模网络语料学习文档前后缀偏好,提升RewardBench性能,实现跨模型家族和规模的稳定改进。

详情

展开后加载摘要…

URL PDF HTML 收藏