How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals
大语言模型如何检测并纠正自身错误:内部置信信号的作用
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。
高校专区
大语言模型如何检测并纠正自身错误:内部置信信号的作用
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学)
AI总结 研究通过第二阶置信模型探讨大语言模型如何通过内部置信信号检测并纠正自身错误,发现PANL信号在误差检测和自我修正中起关键作用。
大语言模型与人类偏好的统计不可能性与可能性:从康德斯悖论到纳什均衡
机构 * Massachusetts Institute of Technology(麻省理工学院) ; University of Pennsylvania(宾夕法尼亚大学) ; Princeton University(普林斯顿大学)
AI总结 本文探讨了对齐大语言模型与人类偏好的统计限制,证明在一般概率偏好模型下,康德斯循环几乎必然存在,从而表明基于奖励的方法无法完全对齐偏好。同时,研究了非奖励方法下LLM采用混合策略的条件,证明在Luce模型下,少数群体偏好得以保留的统计可能性。
Comments Accepted for publication in the Annals of Statistics
METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化
机构 * Virginia Tech(弗吉尼亚理工大学) ; Meta AI ; University of California Los Angeles(加州大学洛杉矶分校) ; Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。
使逻辑成为生成ML在网络中的第一公民
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出NetNomos框架,通过整合显式网络知识规则提升生成模型在网络任务中的可靠性与可控制性,展示了其在 telemetry imputation、traffic forecasting 和 synthetic data generation 中的优越性能。
Comments Published at NSDI '26; Code available at https://github.com/HongyuHe/NetNomos and https://github.com/HongyuHe/LeJIT
ProcFunc:面向Python的基于Blender的程序化3D生成函数抽象
机构 * Princeton University(普林斯顿大学)
AI总结 ProcFunc通过提供易用的Python函数库,简化了程序化3D生成的创建、组合、分析和执行过程,支持大规模多样化训练数据生成,并减少VLMs在编辑和生成程序化代码时的错误。
2025感知测试挑战:挑战总结及统一视觉问答扩展
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; University of Bristol(布里斯托大学) ; University of Oxford(牛津大学)
AI总结 2025年感知测试挑战旨在评估最新视频模型并衡量多模态感知的进步,通过统一任务测试揭示现有模型在统一接口下处理多样化感知任务的困难。
以最后一层为中心的特征重组:在DINOv3中释放3D几何知识以进行单目深度估计
机构 * Princeton University(普林斯顿大学) ; Springer Heidelberg(斯普林格海德堡) ; ABC Institute(ABC研究所) ; Aerospace Information Research Institute Chinese Academy of Sciences(中国科学院航天信息研究所)
AI总结 本文提出LFR模块,通过以最后一层为中心重组特征,提升单目深度估计的几何表达能力,实验表明其在密集3D任务中表现优异。
Comments 18page, 6 figure, 6 table
NeuralEmu:基于测量驱动的机器学习高保真5G网络仿真
机构 * Princeton University(普林斯顿大学) ; University at Buffalo, SUNY(布法罗大学)
AI总结 NeuralEmu通过高精度网络 telemetry 数据学习5G调度器资源分配行为,提升网络算法评估的准确性,减少仿真误差达51%。
KinDER:机器人学习与规划的运动学与动力学推理基准
机构 * Princeton University(普林斯顿大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Tech(佐治亚理工学院) ; University of Cambridge(剑桥大学) ; NVIDIA(英伟达) ; MIT(麻省理工学院)
AI总结 KinDER基准针对机器人学习与规划中的物理推理挑战,包含25个生成环境、Python库和评估套件,旨在通过系统比较不同方法提升机器人物理推理能力。
Comments Project website: https://prpl-group.com/kinder-site/. 21 pages, 8 figures. Accepted to Robotics Science and Systems (RSS), 2026
自动化对抗协作促进认知科学理论构建
机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) ; Department of Psychology, Stanford University(斯坦福大学心理学系) ; Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)
AI总结 本文提出自动化对抗协作框架,通过闭环模拟验证认知科学理论 adjudication,展示了在噪声环境下恢复真实理论的可行性。
Comments 2 pages
谱优化器在关联记忆学习中的容量扩展分析
机构 * UC Berkeley(加州大学伯克利分校) ; Princeton University(普林斯顿大学) ; New York University(纽约大学) ; Flatiron Institute(Flatiron研究所)
AI总结 本文研究了谱优化器在关联记忆问题中的性能,发现Muon的存储容量显著超过SGD,且在仅使用一阶信息时可与牛顿法匹配。通过实验验证了预测的扩展规律,为更实际的语言建模任务提供了理论基础。
Comments 84 pages, 9 figures
流形数据的扩散模型:分数分解、曲率与统计复杂性
机构 * Georgia Tech(佐治亚理工学院) ; Princeton University(普林斯顿大学) ; Northwestern University(西北大学)
AI总结 本文研究扩散模型如何学习流形数据,通过分析分数函数的分解和曲率影响,提出高效的神经网络近似方法,并推导出基于数据内在维度和曲率的统计学习率。
建筑中材料再利用的计算设计与协作机器人制造
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出整合数据驱动设计与反馈驱动协作机器人制造的框架,用于实现非标准结构的再利用木材加工,通过Timbrelyn案例展示木材再利用如何提升建筑表达。
Comments Accepted for publication in Proceedings of the 45th Annual Conference of the Association for Computer Aided Design in Architecture (ACADIA 2025)
MIMIC:一种生成式多模态基础模型用于生物分子
机构 * Polymathic AI Center for Data Science, New York University(多学科人工智能数据科学中心,纽约大学) ; Polymathic AI Department of Applied Physics, Yale University(多学科人工智能应用物理系,耶鲁大学) ; Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) ; Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) ; Princeton Precision Health, Princeton University(普林斯顿精准健康,普林斯顿大学) ; Department of Chemistry, New York University(化学系,纽约大学) ; Department of Computer Science, Princeton University(计算机科学系,普林斯顿大学) ; Lewis-Sigler Institute for Integrative Genomics, Princeton University(刘易斯-西格尔整合基因组学研究所,普林斯顿大学) ; Center for Computational Astrophysics, Flatiron Institute(计算天文学中心,Flatiron研究所) ; Department of Astrophysical Sciences, Princeton University(天体物理科学系,普林斯顿大学) ; Department of Physics, New York University(物理学系,纽约大学)
AI总结 MIMIC通过多模态生成模型统一生物分子的表示学习、条件预测和受限设计,实现对RNA和蛋白质的先进预测与设计。
生成控制作为优化:用于自适应和鲁棒机器人控制的时间无条件流匹配
机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University, Beijing, China(清华大学交叉信息研究院) ; Department of Computer Science, Princeton University, New Jersey, US(普林斯顿大学计算机科学系) ; Galaxea Inc., Beijing, China(Galaxea公司)
AI总结 GeCO通过将动作合成转化为迭代优化,解决了传统流匹配在状态复杂度上计算效率低的问题,实现了自适应的计算分配和无监督的安全检测。
Comments 18 pages, 6 figures
UMAP中吸引形状的探索:在降维中的嵌入力分析
机构 * Media Lab, MIT(MIT媒体实验室) ; Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
AI总结 本文分析UMAP中吸引与排斥力对聚类形成和可视化的影响,比较UMAP与其他方法,揭示学习率退火的必要性及不同处理方式。
Comments 13 page + appendix
Journal ref Transactions on Machine Learning Research, 2026
PoseX:人工智能击败物理方法在蛋白质-配体交叉对接
机构 * Microcyto ; Purdue University(普渡大学) ; State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) ; Anew Therapeutics ; Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Peking University(北京大学) ; Virginia Tech(弗吉尼亚理工大学) ; Imperial College London(伦敦帝国理工学院)
AI总结 PoseX设计了一个开放源代码的基准测试,评估自我对接和交叉对接,通过23种方法和718/1312个数据集,发现AI方法在对接成功率上优于物理方法,并通过放松方法和结合口袋信息提升性能。
未实现的期望:比较AI方法与经典算法在最大独立集问题上的表现
机构 * Department of Computer Science & Princeton Language and Intelligence (PLI)(计算机科学系及普林斯顿语言与智能中心) ; Princeton University(普林斯顿大学)
AI总结 本文比较了AI方法与经典算法在最大独立集问题上的性能,发现经典算法在随机图上表现更优,AI方法存在系统性不足,需重新审视AI在组合优化中的应用。
Comments Published on TMLR 04/2026. 28 pages, 6 figures, 98 tables
Journal ref Transactions on Machine Learning Research (2026)
伙伴建模在循环智能体中出现(但只有在重要时)
机构 * University of Edinburgh(爱丁堡大学) ; Princeton University(普林斯顿大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究探讨了智能体在开放合作中自发形成伙伴建模的能力,发现其在任务分配能影响伙伴行为时自发产生结构化表示。
Journal ref Advances in Neural Information Processing Systems 39 (NeurIPS 2025)
BioMiner:一种用于从文献中自动挖掘蛋白质-配体生物活性数据的多模态系统
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室) ; Princeton University(普林斯顿大学) ; Huazhong University of Science and Technology(华中科技大学) ; Infinite Intelligence Pharma(无限智能制药)
AI总结 BioMiner通过多模态框架提取生物活性数据,解决手动整理与文献增长不匹配的问题,其核心方法结合直接推理和化学结构解析,实现生物活性三元组的高准确率提取。
Comments 20 pages, 5 figures, 1 table
利用校准神经分位数估计和近似模拟器的宇宙学分析
机构 * Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理科学系)
AI总结 本文提出校准神经分位数估计方法,通过大量近似模拟训练和少量高保真模拟校准,实现高效且无偏的后验推断,用于从暗物质密度图推断宇宙学参数。
Comments 5+5 pages, 5+4 figures, published in PRL
Journal ref Phys. Rev. Lett. 136, 161001 (2026)
时扩展专家混合模型
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出时扩展混合专家层,通过引入控制器学习专家切换时机,降低切换率并保持模型精度,为高效服务和持续学习提供新方法。
幸运高动态范围智能手机成像
机构 * Princeton University(普林斯顿大学) ; Adobe(Adobe公司)
AI总结 本文提出一种基于轻量级网络的智能手机成像方法,通过线性RAW像素间接捕捉高动态范围,避免幻觉伪影,验证了其在合成和真实图像上的泛化能力。
Comments 13 pages, 12 figures
弱到强知识蒸馏加速视觉学习
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出一种通用知识蒸馏方法,通过冻结弱教师模型并在早期训练中应用蒸馏,加速强学生模型训练,实验表明在ImageNet和CIFAR分类中提升训练效率达4.8倍。
Comments 18 pages, 7 figures
在AI系统中进行日志分析的七步法
机构 * UK AI Security Institute (AISI)(英国人工智能安全研究所) ; US Center for AI Standards and Innovation (CAISI)(美国人工智能标准与创新中心) ; Model Evaluation and Threat Research (METR)(模型评估与威胁研究) ; Princeton University(普林斯顿大学) ; RAND Corporation(RAND公司) ; Meridian Labs(Meridian实验室) ; University of Cambridge(剑桥大学)
AI总结 本文提出了一种基于最佳实践的日志分析流程,通过Inspect Scout库中的代码示例,详细指导每一步并指出常见问题,为严谨可重复的日志分析提供框架。
局部扩散模型与数据分布的相
机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, NJ 08544, USA(电气与计算机工程系,普林斯顿大学,普林斯顿,新泽西州08544,美国) ; QuEra Computing Inc., 1284 Soldiers Field Road, Boston, MA 02135, USA(QuEra计算公司,1284士兵场路,波士顿,马萨诸塞州02135,美国) ; Department of Physics, University of Colorado Boulder, Boulder, CO 80309, USA(物理系,科罗拉多大学博尔德分校,博尔德,科罗拉多州80309,美国)
AI总结 本文提出局部扩散模型的相分析框架,揭示局部去噪器在相变中的作用,通过空间马尔可夫性评估相变,并验证了局部神经网络在相变区域外的高效性。
Comments 11+23 pages, 4+4 figures
光学和近红外是相连的
机构 * Department of Astrophysical Sciences, Princeton University(普林斯顿大学天体物理系) ; Center for Statistics and Machine Learning, Princeton University(普林斯顿大学统计与机器学习中心) ; Center for Computational Astrophysics, Flatiron Institute(Flatiron研究所计算天文学中心) ; Columbia University, Columbia Astrophysics Lab(哥伦比亚大学哥伦比亚天文学实验室)
AI总结 本文提出一种数据驱动模型,利用光学SDSS光谱的神经摘要准确预测红外WISE光度,改进了AGN和尘埃参数的约束,并发现现有SED拟合方法存在偏差。
Comments Accepted to ApJ. 18 pages, 14 figures. 11 pages of Appendix
Stream-CQSA:通过灵活的工作负载调度避免注意力计算中的内存不足
机构 * Lewis-Sigler Institute of Integrative Genomics(刘易斯-西格勒整合基因组学研究所) ; Princeton University(普林斯顿大学)
AI总结 本文提出Stream-CQSA框架,通过分解注意力计算为可调度的子任务,实现内存适应性调度,使单GPU可处理十亿token序列的精确注意力计算。
占用奖励塑造:改进离线目标导向强化学习中的信用分配
机构 * Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学) ; INFIFORCE Intelligent Technology(INFIFORCE智能技术) ; Princeton University(普林斯顿大学)
AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。
Comments ICLR 2026
以生态目标为中心的个体动物自动识别
机构 * University of West Bohemia in Pilsen(西波西米亚大学) ; Massachusetts Institute of Technology(麻省理工学院) ; LUT University(卢特大学) ; Conservation X Labs(保护X实验室) ; Queen Mary University of London(伦敦玛丽女王大学) ; The Ohio State University(俄亥俄州立大学) ; Giraffe Conservation Foundation(犀牛保护基金会) ; University of Bristol(布里斯托大学) ; Czech Technical University in Prague(布拉格捷克技术大学) ; Cornell Lab of Ornithology(哥伦布鸟类实验室) ; University of Pittsburgh(匹兹堡大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Princeton University(普林斯顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Rensselaer Polytechnic Institute(伦斯勒理工学院) ; CNR(意大利国家研究委员会)
AI总结 本文探讨了自动识别个体动物在生态研究中的应用,指出当前方法与实际生态数据处理存在不匹配,强调需以生态问题为导向提升识别的实用性与可信度。