arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Oxford(牛津大学)

2026-03-17 至 2026-03-17 共收录 4
2603.15617 2026-03-17 cs.LG

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14833 2026-03-17 cs.LG cs.AI

Ablate and Rescue: A Causal Analysis of Residual Stream Hyper-Connections

消除与救援:残差流超连接的因果分析

William Peng, Josheev Rai, Kevin Tseng, Siwei Wang, Sean Wu

机构 * Stanford University(斯坦福大学) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Independent(独立) University of Oxford(牛津大学)

AI总结 本文提出首个开源mHC语言模型,通过代表层面指标和因果干预分析多流架构,揭示并行流的信息编码与利用机制,引入系统性的流消除-救援框架进行因果比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23329 2026-03-17 cs.AI cs.CL cs.CR cs.CY cs.HC

LLM Novice Uplift on Dual-Use, In Silico Biology Tasks

大语言模型在双用途生物任务中的新手提升

Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael

机构 * Scale AI SecureBio University of Oxford(牛津大学) UC Berkeley(加州大学伯克利分校)

AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。

Comments 59 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏