arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Princeton University(普林斯顿大学)

2026-05-29 至 2026-05-29 共收录 10
2605.30326 2026-05-29 cs.RO cs.AI

RoboWits: Unexpected Challenges for Robotic Creative Problem Solving

RoboWits:机器人创造性问题解决中的意外挑战

Chunru Lin, Hongxin Zhang, Fenghao Yu, Zhehuan Chen, Thomas L. Griffiths, Yejin Choi, David Held, Chuang Gan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Princeton University(普林斯顿大学) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出RoboWits双臂机器人基准,通过多智能体协作的自动化任务生成流水线评估机器人在几何、材料和装配推理中的认知推理、创造性工具使用及鲁棒性,发现预训练VLA在突变任务中表现脆弱。

Comments The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30315 2026-05-29 cs.CL cs.LG

Resolution Diagnostics for Paired LLM Evaluation

配对LLM评估的分辨率诊断

Anany Kotawala

机构 * Princeton University(普林斯顿大学)

AI总结 针对公开LLM排行榜中配对排名未达到常规配对检验分辨率目标的问题,提出基于假设检验的配对评估框架,并引入分辨率比q=N/N*作为主要诊断指标,揭示了常用非配对Cohen-h-plus-(1-rho)捷径在接近比较区域存在约两倍的偏差。

Comments 16 pages, 7 figures, 12 tables. Accepted to the ICML 2026 Workshop on Hypothesis Testing, Seoul, South Korea, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10520 2026-05-29 cs.LG

Prioritize the Process, Not Just the Outcome: Rewarding Latent Thought Trajectories Improves Reasoning in Looped Language Models

优先过程而非结果:奖励潜在思维轨迹改善循环语言模型的推理能力

Jonathan Williams, Esin Tureci

机构 * Department of Computer Science, Princeton University, Princeton NJ, U.S.A(普林斯顿大学计算机科学系)

AI总结 针对循环语言模型(LoopLM)中标准强化学习(如GRPO)仅奖励最终潜在状态导致推理改进失败的问题,提出RLTT框架,通过在整个潜在推理轨迹上分配奖励实现密集的轨迹级信用分配,显著提升数学推理性能并泛化至非数学任务。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03253 2026-05-29 cs.GT cs.AI cs.MA

Approximate Proportionality in Online Fair Division

在线公平分配中的近似比例性

Davin Choo, Winston Fu, Derek Khu, Tzeh Yuan Neoh, Tze-Yang Poon, Nicholas Teh

机构 * Harvard University, USA(哈佛大学) University of Oxford, UK(牛津大学) Centre for Frontier AI Research (CFAR), Agency for Science, Technology and Research (A*STAR), Singapore(前沿人工智能研究中心(CFAR)) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC)) Princeton University, New Jersey, USA(普林斯顿大学) Institute for Infocomm Research (I2R), Agency for Science, Technology and Research (A*STAR), Singapore(信息与通信研究所以(I2R))

AI总结 研究在线公平分配问题中比例性(PROP1)的可近似性,通过非自适应对手和最大物品价值预测两种松弛方法,设计了具有鲁棒保证的在线算法。

Comments Appears in the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29351 2026-05-29 cs.LG math.DS stat.ML

Attention as In-Context Empirical Bayes: A Two-Stage View via Particle Dynamics

注意力作为上下文经验贝叶斯:通过粒子动力学的两阶段视角

Matthew Smart, Soumya Ganguly, Nilava Metya, Alexandre V. Morozov, Anirvan M. Sengupta

机构 * Lewis-Sigler Institute for Integrative Genomics(利斯-西格尔整合基因组研究所) Princeton University(普林斯顿大学) Department of Mathematics(数学系) Rutgers University(罗格斯大学) Department of Physics and Astronomy(物理与天文学系) Center for Computational Quantum Physics and Center for Computational Mathematics(计算量子物理中心和计算数学中心) Flatiron Institute(Flatiron研究所) Simons Foundation(西蒙斯基金会)

AI总结 本文通过粒子动力学将最小注意力仅变换器解释为两阶段经验贝叶斯过程,揭示了深度和注意力残差的统计角色,并证明无需显式噪声调度即可实现有效去噪。

Comments 52 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29307 2026-05-29 cs.CL cs.AI cs.IR cs.LG

GrepSeek: Training Search Agents for Direct Corpus Interaction

GrepSeek:训练用于直接语料库交互的搜索代理

Alireza Salemi, Chang Zeng, Atharva Nijasure, Jui-Hui Chung, Razieh Rahimi, Fernando Diaz, Hamed Zamani

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Princeton University(普林斯顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出GrepSeek,一种通过两阶段训练(冷启动数据集+GRPO优化)和语义保持的分片并行执行引擎,训练紧凑型搜索代理直接与文本语料库交互(通过shell命令),在开放域问答中取得最优F1和精确匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29158 2026-05-29 cs.LG cs.IR q-bio.BM

PROTOCOL: Late Interaction Retrieval for Protein Homolog Search

PROTOCOL: 用于蛋白质同源搜索的延迟交互检索

Gabrielle Cohn, Rohan Gumaste, Minh Hoang, Vihan Lakshman

机构 * MIT(麻省理工学院) Princeton University(普林斯顿大学)

AI总结 提出ProtoCol模型,利用ColBERT风格的延迟交互机制对残基嵌入进行最大相似度评分,以提升远程同源搜索的灵敏度,在SCOPe超家族和Pfam clan基准上优于多种基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29025 2026-05-29 cs.AI cs.CY cs.HC

When Models Disagree: Rethinking LLM Evaluation for Public Comment Analysis

当模型存在分歧:重新思考用于公众评论分析的LLM评估

Aisha Najera, Alvin Moon, Vedant Srinivasan, Rajesh Veeraraghavan

机构 * AI Lab, Princeton University Engineering and Applied Sciences(普林斯顿大学人工智能实验室、工程与应用科学学院) RAND Corporation(RAND公司) Engineering and Applied Sciences(工程与应用科学) Science, Technology, and International Affairs(科学、技术与国际事务) Georgetown University(乔治·华盛顿大学)

AI总结 提出一种解释性审计流程,利用多模型分歧检测解释复杂性,引导人工审查关注真正模糊的公众意见,以补充传统基于准确率的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17200 2026-05-29 cs.CV

GASS: Geometry-Aware Spherical Sampling for Disentangled Diversity Enhancement in Text-to-Image Generation

GASS: 几何感知球面采样用于文本到图像生成中解耦多样性增强

Ye Zhu, Kaleb S. Newman, Johannes F. Lutzeyer, Adriana Romero-Soriano, Michal Drozdzal, Olga Russakovsky

机构 * Laboratoire d'Informatique (LIX), CNRS, École Polytechnique, IPP, France(信息实验室(LIX),法国国家科学研究中心,巴黎高等技术学院,IPP,法国) Department of Computer Science, Princeton University, USA(计算机科学系,普林斯顿大学,美国) FAIR at Meta - Montreal, Canada(Meta FAIR - 加拿大蒙特利尔) McGill University, Canada(麦吉尔大学,加拿大) Mila, Quebec AI Institute, Canada(魁北克人工智能研究所,加拿大) Canada CIFAR AI chair(加拿大CIFAR人工智能主席)

AI总结 提出几何感知球面采样(GASS),通过正交分解CLIP嵌入中的提示相关与无关变异方向,沿两轴扩展投影分布以引导采样,在保持图像保真度和语义对齐的同时增强生成多样性。

Comments ICML 2026 Camera-ready. Code available at https://github.com/L-YeZhu/GASS_T2I

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21996 2026-05-29 cs.CV cs.AI

VRAG: Learning World Models for Interactive Video Generation

VRAG:面向交互式视频生成的世界模型学习

Taiye Chen, Xun Hu, Zihan Ding, Chi Jin

机构 * Peking University(北京大学) University of Oxford(牛津大学) Princeton University(普林斯顿大学)

AI总结 针对自回归视频生成中累积误差和记忆机制不足的问题,提出视频检索增强生成(VRAG)方法,通过显式全局状态条件降低长期累积误差并提升时空一致性。

Comments Published at NeurIPS 2025. Project page: https://sites.google.com/view/vrag

详情

展开后加载摘要…

URL PDF HTML 收藏