Learning When to Trust LLM Priors: A Validated Framework for Semantic Prior Integration
学习何时信任LLM先验:一种经过验证的语义先验整合框架
机构 * Stanford University School of Engineering(斯坦福大学工程学院)
AI总结 Statsformer框架通过验证LLM生成的语义先验,提升监督统计学习的可靠性,有效整合不同模型的先验信息,自动降低不可靠先验的影响。
高校专区
学习何时信任LLM先验:一种经过验证的语义先验整合框架
机构 * Stanford University School of Engineering(斯坦福大学工程学院)
AI总结 Statsformer框架通过验证LLM生成的语义先验,提升监督统计学习的可靠性,有效整合不同模型的先验信息,自动降低不可靠先验的影响。
专家评估与心理健康AI安全测试中人类反馈的局限性
机构 * Stanford University(斯坦福大学) ; University College London(伦敦大学学院) ; Microsoft(微软)
AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。
Comments 17 pages, 7 pages of appendix, 21 tables
有效解释支持在不确定性下的规划
机构 * University of Tübingen(图宾根大学) ; Technical University Darmstadt(达姆施塔特技术大学) ; Max Planck Institute for Biological Cybernetics(生物 cybernetics 最大平面研究所) ; University of Cambridge(剑桥大学) ; Stanford University(斯坦福大学)
AI总结 本文提出一种计算模型,将解释转化为行动计划,通过大规模语言模型生成策略先验和价值图,结合规划代理在部分可观测条件下执行,验证了高质量解释能提升导航效率。
Comments CogSci 2026
SecureForge:通过提示优化发现并防止LLM生成代码中的漏洞
机构 * Stanford University(斯坦福大学)
AI总结 本文提出SecureForge框架,通过自动化流程发现并减少LLM生成代码中的安全漏洞,提升代码安全性的同时保持单元测试性能,实验显示漏洞减少达48%。
队列训练的INR编码了什么以及在哪里冻结它们
机构 * Chair of AI in Healthcare and Medicine(人工智能在医疗与医学中的主任) ; Technical University of Munich(慕尼黑技术大学) ; TUM University Hospital(TUM大学医院) ; Imperial College London(伦敦帝国学院) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Stanford Center for Artificial Intelligence in Medicine and Imaging(斯坦福大学人工智能在医学与成像中的中心) ; Stanford University(斯坦福大学) ; Department of Radiology(放射科部门)
AI总结 研究通过冻结队列训练INR的不同层,发现最优冻结点与权重稳定秩最高层一致,并展示了稀疏自编码器对INR激活的分解,揭示了不同架构的编码差异。
Comments 9 content pages plus appendix
NoiseRater: 用于扩散模型训练的元学习噪声估值
机构 * Stanford University(斯坦福大学) ; UNSW(新南威尔士大学) ; UCL(伦敦大学学院) ; The University of Chicago(芝加哥大学) ; CUHK(香港中文大学) ; Nanjing University(南京大学) ; Brown University(布朗大学) ; Yale University(耶鲁大学) ; University of Notre Dame(Notre Dame 大学) ; University of Waterloo(滑铁卢大学) ; UCB(加州大学伯克利分校) ; Georgia Technology(佐治亚理工学院) ; Amazon(亚马逊)
AI总结 本文提出NoiseRater,通过元学习实现实例级噪声估值,提升扩散模型训练效率和生成质量。
关于非负L1逼近多项式的一个注记
机构 * Yale University(耶鲁大学) ; Stanford University(斯坦福大学)
AI总结 研究了在高斯分布下非负L1逼近多项式的存在性,证明了有限高斯表面面积的集合可通过特定次数的非负多项式实现L1逼近,结果与当前最佳的高斯L1逼近次数界相符。
快速字节潜在变换器
机构 * FAIR at Meta(Meta的FAIR) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。
通过不确定性分解实现灵活路由
机构 * Stanford University(斯坦福大学) ; University of Southern California(南加州大学) ; Apple(苹果公司)
AI总结 本文提出一种不确定性感知的路由方法,通过分解总不确定性为不可约和可约成分,实现灵活的模型路由和退避策略,理论上有强保障,并在合成和现实数据集上验证了其有效性。
通过模拟搜索LLM代理中的隐私风险
机构 * Georgia Tech(佐治亚理工学院) ; Stanford University(斯坦福大学)
AI总结 本文提出通过模拟搜索改进攻击与防御策略,发现攻击策略从直接请求演变为伪装和伪造同意等复杂手段,防御策略从规则约束升级为身份验证状态机,为隐私安全代理发展提供洞察。
Comments ICLR 2026
基于流匹配的生成建模
机构 * Department of Computer Science, Stanford University(斯坦福大学计算机科学系)
AI总结 本文提出流匹配方法,扩展了基于分数的模型,允许非保守向量场。该方法通过更弱的条件生成更灵活的模型,适用于高维图像数据,并开启生成建模的新方向。
更随机,更隐私:DP-SGD中最优的子采样方案是什么?
机构 * Stanford University(斯坦福大学)
AI总结 本文研究了DP-SGD中子采样方案的最优选择,证明了平衡迭代子采样(BIS)在隐私放大方面优于泊松子采样,并在噪声谱两端最优。
Comments 17 pages, 1 table. Submitted to NeurIPS 2026
具有任何时间有效保证的AI系统自适应审计
机构 * University of California, San Francisco(加州大学旧金山分校) ; Stanford University(斯坦福大学)
AI总结 本文提出一种自适应审计框架,通过双视角假设检验方法,在有限样本下实现统计严谨的AI系统鲁棒性验证,证明在严格审计下系统可被认证为全局鲁棒。
Echo:无KV缓存的关联回忆与谱Koopman算子
机构 * Stanford University(斯坦福大学)
AI总结 Echo通过谱Koopman算子实现无KV缓存的关联回忆,解决了传统Transformer的内存瓶颈问题,在多个基准测试中展现出卓越的检索性能。
在LLM服务中调节分支并行度
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达)
AI总结 本文提出TAPER,一种按步骤的准入控制器,通过预测分支外部性来调节分支并行度,提升吞吐量并保持服务级别目标。
人类中心大语言模型的反思与新方向
机构 * Stanford University(斯坦福大学)
AI总结 本文提出人类中心大语言模型框架,整合NLP、HCI和负责任的AI视角,强调在模型开发全流程中关注人类需求与价值观,通过案例研究探讨HCLLMs的未来工作影响。
信息论学习与估计的极限
机构 * Stanford University(斯坦福大学) ; UIUC(伊利诺伊大学香槟分校)
AI总结 本文探讨信息论在学习与估计算法极限中的作用,介绍集中不等式、度量空间覆盖与包合、度量熵等工具,并推导了泛化误差上界及最小最大风险下界。
难民匹配收益对离线评估选择的鲁棒性
机构 * Immigration Policy Lab, Stanford University(斯坦福大学移民政策实验室) ; Department of Political Science, University of California, Berkeley(加州大学伯克利分校政治学系) ; Technology and Operations Management Unit, Harvard Business School(哈佛商学院技术与运营管理单位) ; Department of Statistics, Stanford University(斯坦福大学统计学系) ; Department of Government, Dartmouth College(达特茅斯学院政府系) ; Department of Political Science, Stanford University(斯坦福大学政治学系)
AI总结 本文研究难民匹配对难民结果的提升潜力,通过多种离线评估方法验证了因果影响评估结果的稳定性,发现估计值在多数情况下具有统计显著性且与Bansak等(2018)结果一致。
Comments 13 pages, 2 figures, 10 tables
语义感知混合格式量化:用于视频扩散变换器的混合格式量化
机构 * Stanford University(斯坦福大学)
AI总结 本文提出SemanticDialect,通过块级混合格式量化和语义感知方言分配,提升视频扩散变换器的量化效果,实验表明其在Open-Sora 2.0上接近FP16质量。
评估大型语言模型在科学发现中的表现
机构 * Deep Principle(深原则) ; Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) ; Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) ; Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) ; Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) ; QuEra Computing Inc.(QuEra计算公司) ; Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) ; Harvard Law School(哈佛法学院) ; Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) ; School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) ; Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) ; Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) ; Department of Physics, Tsinghua University(物理系,清华大学) ; Institute for Advanced Study, Tsinghua University(清华大学高级研究所) ; Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)
AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。
算法语言:隐藏在开放中的平衡:可理解性与检测规避之间的权衡
机构 * Stanford University(斯坦福大学) ; Freie Universität Berlin(柏林自由大学)
AI总结 本文研究了算法语言在内容生成和审核中的平衡问题,提出了多数可理解调制概念,并通过实验验证了可理解性与检测规避之间的关系。
Comments Under Review
专家联邦:用于大型语言模型的通信高效的分布式推理
机构 * Stanford University(斯坦福大学)
AI总结 本文提出FedEx架构,通过将MoE块分为多个集群,减少专家间通信开销,提升单节点和多节点下的推理吞吐量和延迟,同时保持生成质量。
一种基于波场相关的方法用于改进超声自聚焦中的声速估计
机构 * Department of Electrical Engineering, Stanford University(电气工程系,斯坦福大学) ; Department of Radiology, School of Medicine, Stanford University(放射学系,医学院,斯坦福大学) ; Department of Applied Physics, Stanford University(应用物理学系,斯坦福大学) ; Department of Biomedical Engineering, Columbia University(生物医学工程系,哥伦比亚大学)
AI总结 本文提出利用波场相关技术优化声速估计,以提高超声自聚焦中图像质量,通过改进的波场相关成像方法减少杂波干扰,提升成像分辨率和对比度。
多接触运动中摆动结构的出现
机构 * School of Engineering and Applied Science, University of Pennsylvania(宾夕法尼亚大学工程与应用科学学院) ; Department of Aeronautics & Astronautics, Stanford University(斯坦福大学航空航天系)
AI总结 本文探讨了多接触运动中摆动结构的形成机制,通过分析角动量变化率的优化问题,揭示了足部几何和摩擦锥对运动模式的影响,并验证了在点质量四足机器人和Unitree Go1上实验结果。
BALAR:主动推理的贝叶斯代理循环
机构 * Department of Statistics, Stanford University(统计学系,斯坦福大学) ; Department of Computer Science, Stanford University(计算机科学系,斯坦福大学)
AI总结 BALAR是一种无需微调的任务无关外环算法,通过维护潜在状态的结构信念,选择澄清问题以最大化预期互信息,并动态扩展状态表示,从而在三个基准测试中显著提升性能。
ViTok-v2:将原生分辨率自编码器扩展到50亿参数
机构 * University of Texas, Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学) ; Spellbrush ; Meta Superintelligence Labs(Meta超智能实验室) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 ViTok-v2通过NaFlex实现跨分辨率和宽高比泛化,引入新的DINOv3感知损失,提升重建性能并稳定训练,达到当前最佳水平。
超越语义相似性:通过直接语料交互重新思考代理搜索的检索
机构 * Texas A&M University(德克萨斯A&M大学) ; University of Waterloo(滑铁卢大学) ; UC San Diego(圣地亚哥大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Verdent AI ; Lambda
AI总结 本文提出直接语料交互(DCI)方法,通过通用终端工具直接搜索原始语料,无需嵌入模型或检索接口,有效提升代理搜索性能。
动态藤Copula:检测和量化时间变化的高阶相互作用
机构 * Kempner Institute at Harvard University(哈佛大学凯普勒研究所) ; Stanford University(斯坦福大学)
AI总结 本文提出动态藤Copula模型,用于估计和诊断序列中非高斯依赖关系,通过比较完整藤与1截断版本区分灵活的首树成对依赖与更高树条件项的证据。
通过强化LLM进化搜索获得Zarankiewicz数的新界
机构 * Massachusetts Institute of Technology(麻省理工学院) ; ETH Zürich(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 本文首次确定三个Zarankiewicz数的精确值,并通过强化LLM进化搜索方法为41个数建立下界,展示了LLM引导的进化搜索在数学研究中的潜力。
Comments *Jay Bhan and Nicole Nobili contributed equally to this work as first authors, and their order was determined via coin flip
双语婴儿语言模型的培养:利用小型模型研究多语言语言习得
机构 * Stanford University(斯坦福大学)
AI总结 本文通过训练小型语言模型,研究多语言习得机制,发现双语模型在两种语言上均表现良好,表明多语言输入对统计学习者无实质挑战。
Comments Code and data at https://github.com/lindazeng979/bilingual-babyLM