arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Pennsylvania(宾夕法尼亚大学)

2026-05-20 至 2026-05-20 共收录 9
2605.20151 2026-05-20 cs.LG math.ST stat.TH

When Does Model Collapse Occur in Structured Interactive Learning?

在结构互动学习中模型崩溃何时发生?

Yuchen Wu, Kangjie Zhou, Weijie Su

机构 * School of Operations Research and Information Engineering, Cornell University(卡内基梅隆大学运营管理与信息工程学院) Department of Statistics, Columbia University(哥伦比亚大学统计系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系)

AI总结 研究探讨了在结构互动学习环境中,生成模型性能下降(模型崩溃)的发生条件,通过分析交互图拓扑结构,推导出模型崩溃的必要和充分条件,并通过数值实验验证理论结果。

Comments 57 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19779 2026-05-20 cs.AI cs.LG

Distribution-Free Uncertainty Quantification for Continuous AI Agent Evaluation

无分布不确定性量化用于连续AI代理评估

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学)

AI总结 本文提出了一种无分布的不确定性量化方法,用于连续AI代理评估,通过适应性符合推断(ACI)提供预测质量分数的覆盖保证,并开发了多代理管道的组合不确定性界限、成对排名的符合回避规则以及领奖台规模多重检验的FDR校正回避方法。

Comments 6 pages, 7 figures, 2 tables. Accepted at the ICML 2026 Workshop on Agentic Uncertainty Quantification (AgenticUQ) - Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18718 2026-05-20 stat.ML cs.LG math.OC stat.CO

Stochastic Gradient Variational Inference with Price's Gradient Estimator from Bures-Wasserstein to Parameter Space

基于Bures-沃斯特斯坦空间到参数空间的随机梯度变分推断与Price梯度估计

Kyurae Kim, Qiang Fu, Yi-An Ma, Jacob R. Gardner, Trevor Campbell

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学) University of British Columbia(不列颠哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了在仅给定目标分布无规范化的对数密度时,利用随机梯度的变分推断方法。通过比较Wasserstein VI和Black-Box VI,发现WVI在使用Price梯度估计时具有更优的收敛性,本文进一步证明两者在迭代复杂度上可以达到一致的最优结果。

Comments Accepted to ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19147 2026-05-20 cs.CR cs.AI cs.LG

Be Kind, Rewrite: Benign Projections via Rewriting Defend Against LLM Data Poisoning Attacks

仁者重写:通过重写实现良性投影以防御大语言模型数据中毒攻击

John T. Halloran, Noopur S. Bhatt

机构 * Leidos University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出了一种基于重写的良性投影方法(OBBR),通过利用开放书本的良性样本来提高大语言模型对数据中毒攻击的防御能力,实验表明OBBR在多种已知攻击模式中表现出更高的安全性能,并且在计算效率和模型性能方面具有优势。

Comments 15 pages, 2 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19099 2026-05-20 cs.AI cs.CL cs.MA

DecisionBench: A Benchmark for Emergent Delegation in Long-Horizon Agentic Workflows

DecisionBench: 一个用于长周期代理工作流中涌现委托的基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu, Zijian Carl Ma, Ao Qu

机构 * OpenMesh AI University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) MIT(麻省理工学院)

AI总结 本文提出DecisionBench基准测试,用于评估长周期代理工作流中涌现的委托机制,通过五个条件参考扫描发现委托质量、路由保真度和潜在性能上限等核心发现。

Comments 28 pages, 9 figures, 11 tables. Code and data: https://huggingface.co/decisionbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18993 2026-05-20 cs.CV cs.AI cs.GR

FreeOrbit4D: Training-Free Arbitrary Camera Redirection for Monocular Videos via Foreground-Complete 4D Reconstruction

FreeOrbit4D: 通过前景完整4D重建实现免训练的任意相机重定向

Wei Cao, Hao Zhang, Fengrui Tian, Yulun Wu, Yingying Li, Shenlong Wang, Ning Yu, Yaoyao Liu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Pennsylvania(宾夕法尼亚大学) Eyeline Labs(Eyeline实验室)

AI总结 本文提出FreeOrbit4D,一种无需训练的框架,通过恢复完整的前景4D代理来解决大角度重定向中的几何模糊问题,从而生成更真实且时间一致的视频。

Comments 12 pages, 10 figures. Accepted to SIGGRAPH Conference Papers 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12707 2026-05-20 cs.LG stat.ML

Decoding Rewards in Competitive Games: Inverse Game Theory with Entropy Regularization

在竞争性游戏中解码奖励:带有熵正则化的逆向博弈论

Junyi Liao, Zihan Zhu, Ethan Fang, Zhuoran Yang, Vahid Tarokh

机构 * Department of Electrical and Computer Engineering, Duke University(杜克大学电气与计算机工程系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Department of Biostatistics and Bioinformatics, Duke University(杜克大学生物统计与生物信息学系) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

AI总结 本文研究了在竞争性游戏中通过逆向博弈论和熵正则化来恢复未知奖励函数的问题,提出了一种统一的框架,能够在静态和动态设置中学习奖励函数,并通过理论保证和数值实验验证了其有效性。

Comments Extended journal version of ICML 2025 paper. Submitted to Operations Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10891 2026-05-20 cs.RO cs.LG

Iterative Compositional Data Generation for Robot Control

迭代组合数据生成用于机器人控制

Anh-Quan Pham, Marcel Hussing, Shubhankar P. Patankar, Dani S. Bassett, Jorge Mendez-Mendez, Eric Eaton

机构 * University of Pennsylvania(宾夕法尼亚大学) Stony Brook University(石溪大学)

AI总结 本文提出了一种语义组合扩散变换器,通过注意力机制学习机器人、物体、障碍物和目标特定组件的交互,从而在有限任务集上训练后,能够零样本生成高质量过渡,进而学习未见任务组合的控制策略,并通过迭代自我改进过程提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01126 2026-05-20 cs.LG cs.NA math.NA math.OC math.ST stat.TH

Stochastic Regret Guarantees for Online Zeroth- and First-Order Bilevel Optimization

在线零阶和一阶双层优化的随机遗憾保证

Parvin Nazari, Bojian Hou, Davoud Ataee Tarzanagh, Li Shen, George Michailidis

机构 * Amirkabir University of Technology(阿姆斯泰尔大学) University of Pennsylvania(宾夕法尼亚大学) Samsung SDS Research America(三星SDS美国研究部) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出了一种新的搜索方向,证明了利用该方向的零阶和一阶随机在线双层优化算法能够在不使用窗口平滑的情况下实现亚线性随机双层遗憾。此外,该框架通过减少超梯度估计中的oracle依赖、同时更新内层和外层变量以及使用基于零阶的Hessian、雅可比和梯度估计来提高效率。

Comments Published at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏