AI Alignment via Incentives and Correction
通过激励与修正实现AI对齐
机构 * Princeton University(普林斯顿大学)
AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。
高校专区
通过激励与修正实现AI对齐
机构 * Princeton University(普林斯顿大学)
AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。
适应测量的本征任务表示用于光子受限的光学读取
机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, NJ 08544, USA(普林斯顿大学电气工程与计算机工程系) ; School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) ; USRA Research Institute for Advanced Computer Science, Mountain View, CA 94035, USA(美国研究机构高级计算机科学研究所) ; Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学学院)
AI总结 本文提出了一种适应测量的本征任务表示方法,用于提升光子受限条件下光学读取的性能,通过优化特征可分辨性,提高了低样本量下的分类效果。
Comments 15+14 pages, 4+9 figures, 55 references
持续Harness:面向自我改进基础代理的在线适应
机构 * Princeton University(普林斯顿大学) ; ARISE Foundation(ARISE基金会) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出持续Harness,一种无需人工干预的自我改进机制,通过在线适应提升具身代理在长视界部分可观察决策中的表现,实验证明其在Pokémon游戏中显著降低操作成本并接近专家水平。
Comments 28 pages, 19 figures, 5 tables
医学模型合成架构:一种案例研究
机构 * MIT(麻省理工学院) ; University of Cambridge(剑桥大学) ; Princeton University(普林斯顿大学) ; Duke University(杜克大学) ; The Alan Turing Institute(艾伦·图灵研究所) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。
Comments Working paper
GraphMERT:从非结构化数据中高效可扩展地蒸馏可靠知识图谱
机构 * Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系)
AI总结 本文提出GraphMERT,一种高效的图神经网络模型,通过蒸馏高质量知识图谱提升领域知识的可靠性与有效性。
Comments Camera-ready version. Published in Transactions on Machine Learning Research (TMLR), 2026. Reviewed on OpenReview: https://openreview.net/forum?id=tnXSdDhvqc
Journal ref Transactions on Machine Learning Research, 2026
差分隐私谱图聚类:在隐私、精度和效率之间平衡
机构 * Nokia Bell Labs(诺基亚贝尔实验室) ; Department of Electrical and Computer Engineering, Princeton University(普林斯顿大学电气与计算机工程系) ; Stony Brook University(石溪大学)
AI总结 本文研究了在边差分隐私下谱图聚类,提出了一种结合随机边翻转和邻接矩阵随机排列的矩阵洗牌机制,通过理论分析框架证明其在隐私预算、特征间隙和社区数下的误分类率显著优于传统方法。
基于 compositional Q-learning 的电解质补充与不平衡患者亚群
机构 * Stanford University(斯坦福大学) ; Princeton University(普林斯顿大学) ; Gladstone Institutes(加利福尼亚大学旧金山分校 Gladstone 实验室) ; University of Pennsylvania(宾夕法尼亚大学) ; Gladstone Institutes, Stanford University(加利福尼亚大学旧金山分校 Gladstone 实验室,斯坦福大学)
AI总结 本文提出 Compositional Fitted Q-iteration 方法,用于处理医疗场景中患者治疗反应的异质性问题,通过分层任务结构实现高效决策,验证了其在电解质补充任务中的有效性。
Journal ref Proceedings of the 3rd Machine Learning for Health Symposium 2023
利用扩散模型和马尔可夫链蒙特卡罗进行多目标间接低推力轨迹的迁移学习
机构 * Department of Mechanical and Aerospace Engineering, Princeton University(普林斯顿大学机械与航空航天工程系)
AI总结 本文提出一种结合同伦与马尔可夫链蒙特卡罗的迁移学习框架,用于高效生成训练数据,改进多目标优化问题的求解,提升间接轨迹优化的性能。
Muon 不收敛于凸 Lipschitz 函数
机构 * Center for Computational Mathematics, Flatiron Institute, Simons Foundation(计算数学中心,Flatiron研究所,Simons基金会) ; Princeton University, Google DeepMind(普林斯顿大学,谷歌DeepMind) ; George Mason University(乔治·梅森大学) ; Université Paris Cité and Sorbonne Université, CNRS, Laboratoire de Probabilités, Statistique et Modélisation(巴黎cité大学和索邦大学,CNRS,概率、统计和建模实验室)
AI总结 本文指出 Muon 在凸 Lipschitz 函数上不收敛,尽管误差反馈可恢复其收敛性,但性能在图像分类和语言模型任务中下降,表明 Muon 的成功可能源于该模型未包含的结构。
基于几何的自一致性物理AI
机构 * Princeton University(普林斯顿大学)
AI总结 本文提出KeyStone方法,通过并行生成动作片段并聚类,返回最大簇的质心,提升任务成功率13.3%且无额外延迟。
网络上的大语言模型:在资源限制下的协作智能
机构 * Purdue University(普渡大学) ; University of Exeter(埃克塞特大学) ; Princeton University(普林斯顿大学)
AI总结 本文探讨了在资源受限环境下,通过设备与云端协同以及多智能体协作提升大语言模型性能的方法,提出了协同推理的两种维度,并讨论了协作学习与开放研究挑战。
Slipstream: 长时间跨度智能体的轨迹引导压缩验证
机构 * Princeton University(普林斯顿大学)
AI总结 Slipstream通过异步压缩验证提升长时间跨度智能体的任务准确性,减少端到端延迟,适用于代码编写和网页浏览任务。
Comments 9 pages (16 pages counting references, appendix), 6 figures, 2 tables
对AI代理的可信评估需要日志分析
机构 * Princeton University(普林斯顿大学) ; Independent(独立) ; UK AISI(英国AISI) ; Meridian Labs(梅里登实验室) ; Transluce ; Apollo Research(Apollo研究) ; UC Berkeley(伯克利大学)
AI总结 本文提出通过日志分析解决AI代理评估中的可信问题,揭示了日志分析在识别评估威胁和指导原则中的作用,并展示了tau-Bench Airline中日志分析发现的性能缺陷和部署失败模式。
独立采样优于代理推理
机构 * Princeton University(普林斯顿大学)
AI总结 本文研究在固定预算下如何分配推理时间计算以提高编程竞赛表现,发现独立采样在准确率与成本、查询数的权衡上优于代理推理,且在资源受限条件下独立探索更有效。
RubiConv -- 高效的边界尊重卷积
机构 * Google Deepmind(谷歌DeepMind) ; UC Berkeley(伯克利大学) ; Princeton University(普林斯顿大学)
AI总结 RubiConv通过高效处理打包序列中的边界尊重卷积,提升了长序列模型的理论效率,实验显示其在注意力和标准FFT基线上的显著加速。
Comments 19 pages, 12 figures
过程比输出更能区分人类与机器
机构 * Roundtable Technologies Inc.(Roundtable技术公司) ; Princeton University(普林斯顿大学)
AI总结 本文提出CogCAPTCHA30测试人类与机器的行为过程差异,发现过程特征比性能指标更有效区分两者,但任务特定过程监督在跨任务迁移时效果下降,凸显过程定义的瓶颈。
记忆 inception:用于引导 LLMs 的潜在空间 KV 缓存操作
机构 * Yale University(耶鲁大学) ; Princeton University(普林斯顿大学) ; Jump Trading
AI总结 本文提出 memory inception 方法,通过在选定层插入文本衍生的键值对(KV)银行,在潜在注意力空间中引导 LLMs,实现更高效的控制与更少的存储消耗。
SLayerGen:一种适用于所有空间群和层群的晶格生成模型
机构 * Department of Materials Science & Engineering, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校材料科学与工程系) ; Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) ; Materials Research Laboratory, University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校材料研究实验室)
AI总结 本文提出SLayerGen,一种能生成符合空间群或层群对称性的晶格生成模型,解决了现有模型未考虑层群影响的问题,通过改进扩散组件和构建新数据集,提升了对非周期材料的生成能力。