arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

共收录 737
2605.17698 2026-05-19 cs.LG cs.MA

Agent Bazaar: Enabling Economic Alignment in Multi-Agent Marketplaces

Agent Bazaar: 使多智能体市场场所具备经济对齐能力

Seth Karten, Cameron Crow, Chi Jin

机构 * Princeton University(普林斯顿大学)

AI总结 该研究提出Agent Bazaar框架,用于评估多智能体系统的经济对齐能力,通过分析两种失败模式(算法不稳定和Sybil欺骗)发现模型难以自我调节,并提出经济对齐的训练方法和EAS评分标准。

Comments 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15177 2026-05-19 cs.AI

OpenDeepThink: Parallel Reasoning via Bradley-Terry Aggregation

OpenDeepThink: 通过布拉德利-蒂尔利聚合实现并行推理

Shang Zhou, Wenhao Chai, Kaiyuan Liu, Huanzhi Mao, Qiuyang Mang, Jingbo Shang

机构 * UC San Diego(UC圣地亚哥大学) Princeton University(普林斯顿大学) University of Washington(华盛顿大学) UC Berkeley(伯克利大学)

AI总结 该研究提出OpenDeepThink框架,通过布拉德利-蒂尔利聚合方法在测试时扩展计算资源,以提高大语言模型的推理能力,通过并行选择候选方案并消除选择瓶颈,从而提升模型在Codeforces等领域的表现。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06398 2026-05-19 physics.ao-ph cs.LG physics.comp-ph

Calibration of a neural network ocean closure for improved mean state and variability

神经网络海洋闭合的校准以提高均值状态和变异性

Pavel Perezhogin, Alistair Adcroft, Laure Zanna

机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University, New York, NY, USA(科朗学院数学、计算与数据科学学院,纽约大学,纽约,纽约州,美国) Program in Atmospheric and Oceanic Sciences, Princeton University, Princeton, NJ, USA(大气与海洋科学项目,普林斯顿大学,普林斯顿,新泽西州,美国)

AI总结 本文提出利用集合卡尔曼反演方法对神经网络参数进行校准,以改进粗分辨率海洋模型的均值状态和变异性,通过校准减少了约1.7至3.3倍的误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12145 2026-05-19 cs.LG cs.AI cs.SE

Automatic Generation of High-Performance RL Environments

自动生成高性能强化学习环境

Seth Karten, Rahul Dev Appapogu, Chi Jin

机构 * Princeton University(普林斯顿大学) Independent Researcher(独立研究者)

AI总结 本文提出了一种闭环方法,通过最小的计算成本生成等效的高性能强化学习环境,展示了三种不同的工作流程,并在五个环境中验证了无仿真到仿真的差距,同时展示了新的环境创建方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17093 2026-05-19 cs.CV cs.CL

HEED: Density-Weighted Residual Alignment for Hybrid Vision-Language Model Distillation

HEED:基于密度加权残差对齐的混合视觉-语言模型蒸馏

Yihao Liang, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

AI总结 本文提出HEED方法,通过密度加权残差对齐改进混合视觉-语言模型蒸馏,提升在OCR和文档任务中的性能,同时在不同教师模型和混合架构上实现高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16645 2026-05-19 math.ST cs.IT cs.LG math.IT stat.ML stat.TH

Statistical Unlearning of Distributions: A Hypothesis Testing Approach

分布统计遗忘:一种假设检验方法

Aaradhya Pandey, Sanjeev Kulkarni

机构 * Princeton University(普林斯顿大学)

AI总结 本文提出一种分布统计遗忘框架,通过假设检验选择样本以减少不需要的分布影响,同时保持所需分布的性能,并分析了允许的编辑数据分布区域和帕累托前沿。

Comments Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04737 2026-05-19 cs.AI cs.CL cs.LG

Interactive Benchmarks

交互式基准测试

Baoqing Yue, Zihan Zhu, Yutong Han, Brian Fan, Qian Sun, Jichen Feng, Hufei Yang, Yifan Zhang, Mengdi Wang

机构 * InteractiveBench Princeton University(普林斯顿大学)

AI总结 本文提出交互式基准测试,通过预算化的多轮交互评估模型推理能力,改进传统基准和偏好评估的局限性,揭示模型在交互场景中的改进空间。

Comments Project Page: https://github.com/interactivebench/interactivebench

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15692 2026-05-18 cs.CL cs.LG

TemplateRL: Structured Template-Guided Reinforcement Learning for LLM Reasoning

TemplateRL: 结构化模板引导的强化学习用于大语言模型推理

Jinyang Wu, Chonghua Liao, Mingkuan Feng, Shuai Zhang, Zhengqi Wen, Haoran Luo, Ling Yang, Huazhe Xu, Jianhua Tao

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Princeton University(普林斯顿大学) Shanghai AI Lab(上海人工智能实验室) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

AI总结 TemplateRL通过结构化模板引导强化学习提升大语言模型推理能力,通过MCTS构建问题解决模板库并整合到RL训练中,提高轨迹命中率并减少无效探索,实验显示在AIME和AMC上表现优于GRPO。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15384 2026-05-18 cs.LG cs.AI

Is One Score Enough? Rethinking the Evaluation of Sequentially Evolving LLM Memory

一个评分够吗?重新思考序列演进LLM记忆的评估

Songwei Dong, Zihan Chen, Chengshuai Shi, Peng Wang, Jundong Li, Cong Shen

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学)

AI总结 本文提出SeqMem-Eval框架,通过评估记忆状态的演变、泛化、经验巩固和信息保留,揭示传统指标无法捕捉的记忆质量差异。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18134 2026-05-18 cs.AI cs.CL cs.CV

VideoGameBench: Can Vision-Language Models complete popular video games?

VideoGameBench: 能否让视觉-语言模型完成流行视频游戏?

Alex L. Zhang, Thomas L. Griffiths, Karthik R. Narasimhan, Ofir Press

机构 * Princeton University(普林斯顿大学)

AI总结 VideoGameBench通过10款经典游戏测试视觉-语言模型在无辅助信息下的实时游戏完成能力,发现前沿模型受推理延迟限制,仅能完成极少量游戏内容。

Comments 10 pages, 38 pages including supplementary

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21850 2026-05-18 cs.CV

Visual Compositional Tuning

视觉组合调谐

Xindi Wu, Hee Seung Hwang, Polina Kirichenko, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Meta AI

AI总结 本文提出COMPACT方法,通过组合多个基本视觉能力提升视觉指令调谐数据效率,减少训练样本数量并提升多模态任务性能。

Comments See the project website at this [URL](https://princetonvisualai.github.io/compact/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14553 2026-05-15 cs.LG cs.AI

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

通过纯探索老虎机实现高效的多目标提示优化

Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang

机构 * University of Virginia(弗吉尼亚大学) Princeton University(普林斯顿大学) Southern University of Science and Technology(南方科技大学)

AI总结 本文研究多目标提示选择问题,提出基于纯探索老虎机框架的高效方法,通过理论保证和实验验证,改进了提示优化的效率和效果。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14445 2026-05-15 cs.LG

FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale

FrontierSmith: 批量合成开放性编程问题

Runyuan He, Qiuyang Mang, Shang Zhou, Kaiyuan Liu, Hanchen Li, Huanzhi Mao, Qizheng Zhang, Zerui Li, Bo Peng, Lufeng Cheng, Tianfu Fu, Yichuan Wang, Wenhao Chai, Jingbo Shang, Alex Dimakis, Joseph E. Gonzalez, Alvin Cheung

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) Bespoke Labs(Bespoke实验室)

AI总结 本文提出FrontierSmith系统,通过迭代演化现有封闭性编程任务生成开放性问题,提升LLM编程能力,在两个基准测试中显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14360 2026-05-15 cs.LG cs.AI

M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling

M$^2$RNN:基于矩阵值状态的非线性RNN用于可扩展的语言建模

Mayank Mishra, Shawn Tan, Ion Stoica, Joseph Gonzalez, Tri Dao

机构 * MIT-IBM Watson Lab(MIT-IBM沃森实验室) Princeton University(普林斯顿大学) Together AI

AI总结 本文提出M$^2$RNN,通过矩阵值状态和非线性状态转移提升语言建模性能,实验证明其在长序列泛化和大规模语言建模中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13997 2026-05-15 cs.LG cs.AI cs.CL

HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts

HodgeCover:高阶拓扑覆盖驱动稀疏混合专家的压缩

Tao Zhong, Dongzhe Zheng, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学)

AI总结 HodgeCover通过高阶拓扑覆盖技术,在不重新训练的情况下压缩稀疏混合专家层,通过识别谐波核来优化专家合并过程,实现高效压缩。

Comments 34 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13988 2026-05-15 cs.LG quant-ph

Neural Fields for NV-Center Inverse Sensing

神经场用于NV中心反向传感

Zhixuan Zhao, Tao Zhong, Yixun Hu, Nathalie P. de Leon, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

AI总结 本文研究了基于钻石中氮-空位中心的噪声传感反向问题,提出NeTMY神经场方法,通过改进的正则化和优化策略提升反向传感性能。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11045 2026-05-15 cs.LG cond-mat.mtrl-sci cs.AI cs.CV physics.ins-det

Neural Field Thermal Tomography: A Differentiable Physics Framework for Non-Destructive Evaluation

神经场热成像:一种无标签的非破坏性评价可微物理框架

Tao Zhong, Yixun Hu, Dongzhe Zheng, Aditya Sood, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学)

AI总结 本文提出NeFTY框架,通过可微隐式欧拉热求解器精确满足偏微分方程,实现无标签三维逆热传导问题的高精度恢复,优于传统PINN和体素网格基线。

Comments 37 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07805 2026-05-15 cs.LG cs.AI cs.CL

Group Representational Position Encoding

群表示位置编码

Yifan Zhang, Zixiang Chen, Yifeng Liu, Zhen Qin, Huizhuo Yuan, Kangping Xu, Yang Yuan, Quanquan Gu, Andrew Chi-Chih Yao

机构 * Princeton University(普林斯顿大学) University of California, Los Angeles(加州大学洛杉矶分校) IIIS, Tsinghua University(清华大学人工智能研究院)

AI总结 GRAPE提出了一种基于群作用的位置编码框架,结合乘法旋转和加法logit偏置机制,扩展了RoPE和ALiBi的应用范围,适用于长上下文模型的位置几何设计。

Comments Published in ICLR 2026. Project Page: https://github.com/model-architectures/GRAPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13687 2026-05-14 cs.LG cs.AI stat.ML

A Hierarchical Language Model with Predictable Scaling Laws and Provable Benefits of Reasoning

具有可预测扩展规律和推理证明益处的分层语言模型

Jason Gaitonde, Frederic Koehler, Elchanan Mossel, Joonhyung Shin, Allan Sly

机构 * Duke University(杜克大学) University of Chicago(芝加哥大学) Massachusetts Institute of Technology(麻省理工学院) Princeton University(普林斯顿大学)

AI总结 本文提出了一种合成语言家族,通过树上的广播过程生成,分析上下文长度和推理在自回归生成中的作用。通过精确k-gram假设,证明了在特定条件下,上下文深度与序列生成的方差和峰度关系,展示了推理模型在有限内存下能精确生成真实语言。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15854 2026-05-14 cs.LG cs.AI cs.CL

FlashSampling: Fast and Memory-Efficient Exact Sampling

FlashSampling:快速且内存高效的精确采样

Tomas Ruiz, Zhen Qin, Yifan Zhang, Xuyang Shen, Yiran Zhong, Mengdi Wang

机构 * LMU Munich(慕尼黑大学) Princeton University(普林斯顿大学)

AI总结 本文提出FlashSampling,一种将采样融合到LM-head矩阵乘法中的精确采样方法,通过芯片内计算和减少内存访问,提升解码效率并降低内存带宽压力。

Comments Project Page: https://github.com/FlashSampling/FlashSampling

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00839 2026-05-14 cs.SE cs.AI

CodeClash: Benchmarking Goal-Oriented Software Engineering

CodeClash:面向目标导向软件工程的基准测试

John Yang, Kilian Lieret, Joyce Yang, Carlos E. Jimenez, Muhtasham Oblokulov, Aryan Siddiqui, Ofir Press, Ludwig Schmidt, Diyi Yang

机构 * Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Cornell University(康奈尔大学) Technical University of Munich(慕尼黑技术大学)

AI总结 CodeClash通过多轮竞赛评估语言模型在无明确指导下迭代开发代码以实现开放性目标的能力,揭示了模型在战略推理和长期代码维护方面的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19247 2026-05-14 cs.LG cs.AI cs.CL

A Markov Categorical Framework for Language Modeling

一个马尔可夫范畴框架用于语言建模

Yifan Zhang

机构 * Princeton University(普林斯顿大学)

AI总结 本文提出一个马尔可夫范畴框架,从信息处理阶段分析语言模型的生成过程,解释训练如何塑造表示,并揭示表示如何支持复杂行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11381 2026-05-13 cs.RO cs.DC

Kairos: A Scalable Serving System for Physical AI

Kairos:面向物理AI的可扩展服务系统

Yinwei Dai, Ganesh Ananthanarayanan, Landon Cox, Xenofon Foukas, Bozidar Radunovic, Ravi Netravali

机构 * Princeton University(普林斯顿大学) Microsoft(微软公司)

AI总结 Kairos是首个支持生成-执行循环的多机器人服务系统,通过主动参与执行阶段,显著降低任务延迟,适用于广泛物理AI模型和机器人。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08902 2026-05-13 cs.LG cs.AI

Intention-Conditioned Flow Occupancy Models

意图条件流占用模型

Chongyi Zheng, Seohong Park, Sergey Levine, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出意图条件流占用模型(InFOM),通过引入用户意图的隐变量,提升模型对长期依赖的建模能力,在36个状态基和4个图像基基准任务中实现回报提升1.8倍和成功率提升36%。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01643 2026-05-12 cs.LG cs.AI

AI Alignment via Incentives and Correction

通过激励与修正实现AI对齐

Rohit Agarwal, Joshua Lin, Mark Braverman, Elad Hazan

机构 * Princeton University(普林斯顿大学)

AI总结 本文从法律经济学威慑模型视角探讨AI对齐问题,提出通过激励机制和修正过程解决AI行为与对齐目标的平衡问题,构建双代理模型分析奖励设计对求解器和审计器行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10008 2026-05-12 physics.optics cs.CV cs.ET

Measurement-Adapted Eigentask Representations for Photon-Limited Optical Readout

适应测量的本征任务表示用于光子受限的光学读取

Tianyang Chen, Mandar M. Sohoni, Saeed A. Khan, Jérémie Laydevant, Shi-Yuan Ma, Tianyu Wang, Peter L. McMahon, Hakan E. Türeci

机构 * Department of Electrical and Computer Engineering, Princeton University, Princeton, NJ 08544, USA(普林斯顿大学电气工程与计算机工程系) School of Applied and Engineering Physics, Cornell University, Ithaca, NY 14853, USA(康奈尔大学应用与工程物理学院) USRA Research Institute for Advanced Computer Science, Mountain View, CA 94035, USA(美国研究机构高级计算机科学研究所) Kavli Institute at Cornell for Nanoscale Science, Cornell University, Ithaca, NY 14853, USA(康奈尔大学纳米科学学院)

AI总结 本文提出了一种适应测量的本征任务表示方法,用于提升光子受限条件下光学读取的性能,通过优化特征可分辨性,提高了低样本量下的分类效果。

Comments 15+14 pages, 4+9 figures, 55 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09998 2026-05-12 cs.LG cs.AI

Continual Harness: Online Adaptation for Self-Improving Foundation Agents

持续Harness:面向自我改进基础代理的在线适应

Seth Karten, Joel Zhang, Tersoo Upaa, Ruirong Feng, Wenzhe Li, Chengshuai Shi, Chi Jin, Kiran Vodrahalli

机构 * Princeton University(普林斯顿大学) ARISE Foundation(ARISE基金会) Google DeepMind(谷歌DeepMind)

AI总结 本文提出持续Harness,一种无需人工干预的自我改进机制,通过在线适应提升具身代理在长视界部分可观察决策中的表现,实验证明其在Pokémon游戏中显著降低操作成本并接近专家水平。

Comments 28 pages, 19 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09716 2026-05-12 cs.AI

Medical Model Synthesis Architectures: A Case Study

医学模型合成架构:一种案例研究

Katherine M. Collins, Marlene Berke, Ilia Sucholutsky, Ayman Ali, Adrian Weller, Timothy J. O'Donnell, Tyler Brooke-Wilson, Lionel Wong, Joshua B. Tenenbaum

机构 * MIT(麻省理工学院) University of Cambridge(剑桥大学) Princeton University(普林斯顿大学) Duke University(杜克大学) The Alan Turing Institute(艾伦·图灵研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

AI总结 本文提出一种框架,使AI系统能在不确定性下进行实用且形式透明的临床预测。通过语言模型检索知识并构建概率模型,实现校准和可验证的推理,用于鉴别诊断并讨论未来应用方向。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏