arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

EPFL(洛桑联邦理工学院)

2026-05-11 至 2026-05-11 共收录 4
2605.07631 2026-05-11 cs.AI

Inference Time Causal Probing in LLMs

大语言模型中的推断时间因果探测

Sadegh Khorasani, Saber Salehkaleybar, Negar Kiyavash, Matthias Grossglauser

机构 * School of Computer and Communication Sciences, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院计算机与通信科学系) Leiden Institute of Advanced Computer Science (LIACS), Leiden University, Leiden, The Netherlands(莱顿大学高级计算机科学研究所) College of Management of Technology, EPFL, Lausanne, Switzerland(苏黎世联邦理工学院技术管理学院)

AI总结 本文提出HDMI方法,通过梯度优化直接操控隐藏状态,提升因果探测的可靠性,实验显示其在多个基准测试中表现优于现有方法。

Comments 16 pages, 4 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14868 2026-05-11 cs.LG cs.AI

Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning

Goldilocks RL: 调整任务难度以摆脱稀疏奖励进行推理

Ilia Mahrooghi, Aryo Lotfi, Emmanuel Abbe

机构 * EPFL(苏黎世联邦理工学院) Apple(苹果公司)

AI总结 Goldilocks RL通过预测学生模型的难度来优化数据采样,利用GRPO训练提升模型性能,克服稀疏奖励带来的样本效率低问题。

Comments 28 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14951 2026-05-11 cs.LG cs.AI cs.NE

Flat Channels to Infinity in Neural Loss Landscapes

神经损失景观中的无限平坦通道

Flavio Martinelli, Alexander Van Meegen, Berfin Şimşek, Wulfram Gerstner, Johanni Brea

机构 * EPFL(苏黎世联邦理工学院) Flatiron Institute(Flatiron研究所)

AI总结 研究揭示神经网络损失景观中存在无限平坦通道结构,其中损失缓慢下降而输出权重趋于无穷大,通过梯度动力学和几何分析揭示其特性及计算能力。

Comments Accepted to NeurIPS'25 (fixed resolution of equations in figs.1,2,3)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15567 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph

Evaluating Large Language Models in Scientific Discovery

评估大型语言模型在科学发现中的表现

Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan

机构 * Deep Principle(深原则) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) QuEra Computing Inc.(QuEra计算公司) Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) Harvard Law School(哈佛法学院) Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) Department of Physics, Tsinghua University(物理系,清华大学) Institute for Advanced Study, Tsinghua University(清华大学高级研究所) Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)

AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏