Compute Where it Counts: Self Optimizing Language Models
在需要的地方计算:自优化语言模型
机构 * Cornell University(康奈尔大学)
AI总结 本文提出自优化语言模型(SOL),通过轻量策略网络动态分配计算预算,提升解码效率与生成质量,在不同模型和计算条件下优于静态分配和随机搜索。
Comments Accepted at ICML'26 Code: https://github.com/akhauriyash/SOL
高校专区
在需要的地方计算:自优化语言模型
机构 * Cornell University(康奈尔大学)
AI总结 本文提出自优化语言模型(SOL),通过轻量策略网络动态分配计算预算,提升解码效率与生成质量,在不同模型和计算条件下优于静态分配和随机搜索。
Comments Accepted at ICML'26 Code: https://github.com/akhauriyash/SOL
适应测量的本征任务表示用于光子受限的光学读取
机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, NJ 08544, USA(普林斯顿大学电气工程与计算机工程系) ; School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) ; USRA Research Institute for Advanced Computer Science, Mountain View, CA 94035, USA(美国研究机构高级计算机科学研究所) ; Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学学院)
AI总结 本文提出了一种适应测量的本征任务表示方法,用于提升光子受限条件下光学读取的性能,通过优化特征可分辨性,提高了低样本量下的分类效果。
Comments 15+14 pages, 4+9 figures, 55 references
CALYREX:跨注意力层扩展变换器用于系统提示锚定
机构 * Cornell University(康奈尔大学)
AI总结 CALYREX通过跨注意力机制在系统提示和输入之间建立结构隔离,提升模型在指令遵循和多轮指令遵守任务中的性能,同时降低 jailbreaking 攻击成功率。
Comments Preprint. 25 pages, 4 figures, 9 tables
你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码
机构 * Cornell University(康奈尔大学) ; Columbia University(哥伦比亚大学) ; Harvard University(哈佛大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。
Comments Preprint
没有平均特征:为上下文压缩提供简单且强大的基线
机构 * Department of Computer Science and Cornell Tech(计算机科学系和康奈尔科技)
AI总结 本文提出BenchPress评估套件和简单高效基线,用于上下文压缩,通过双向注意力和均值池化方法提升性能。
Comments Code available at https://github.com/lil-lab/benchpress
基于大语言模型的化学合成与设计决策程序
机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士联邦理工学院洛桑校区) ; National Centre of Competence in Research (NCCR) Catalysis(催化领域竞争力研究国立中心) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学)
AI总结 本文提出利用大语言模型增强的 retrosynthesis 规划方法,通过高效编码反应路径和新的路线搜索策略,提升多步合成规划与可合成分子设计能力。
Comments ICML 2025
切片内积Gromov-Wasserstein距离
机构 * Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) ; Department of Mathematics, Imperial College London(伦敦帝国理工学院数学系) ; School of Electrical and Computer Engineering, Cornell University(康奈尔大学电气与计算机工程学院)
AI总结 本文提出切片内积Gromov-Wasserstein距离,解决高维问题的统计和计算扩展性问题,通过旋转不变性性质进行结构和计算性质研究,并在文本聚类和语言模型比较中验证。
Comments 49 pages, 8 figures
序列模型的连续性法则
机构 * Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心) ; University of California, Berkeley(加州大学伯克利分校) ; Lawrence Berkeley National Laboratory(伯克利国家实验室) ; International Computer Science Institute(国际计算机科学研究所)
AI总结 本文研究序列模型中未被探索的连续性诱导偏差,通过时间连续性分析S4和S6模型的连续行为,发现连续性与任务连续性及性能相关,提出时间连续性度量方法提升效率和性能。
Turbo-GS: 加速3D高斯拟合以实现高质量辐射场
机构 * Indian Institute of Science(印度科学研究院) ; Brown University(布朗大学) ; Cornell University(康奈尔大学) ; Samsung R&D Institute India - Bangalore(三星印度研发中心-班加罗尔)
AI总结 本文提出Turbo-GS方法,通过减少计算开销和提升学习效率加速3D高斯拟合,实现4K分辨率快速拟合并保持高质量视图渲染。
Comments Accepted to CVPR 2026. Project page: https://ivl.cs.brown.edu/research/turbo-gs
DUET:基于可验证奖励的强化学习中优化令牌预算分配
机构 * Cornell University(康奈尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学)
AI总结 DUET通过联合调整令牌预算分配的两个维度,提升强化学习的推理质量和训练效率,同时在多个基准测试中表现优异,且在预算减少时性能优势扩大。
DARE:扩散语言模型激活重用以提高推理效率
机构 * Chandra Family Department of Electrical and Computer Engineering(查德拉家族电子与计算机工程系) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cornell University(康奈尔大学)
AI总结 DARE通过利用扩散语言模型中token级冗余性,提高推理效率,减少计算量,同时保持生成质量。
面向现实代理系统的正式政策执行
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Cornell University(康奈尔大学) ; Langroid
AI总结 本文提出基于面向切面编程的框架,通过Datalog语言实现跨代理系统的政策执行,解决传统方法无法保证正式执行的问题。