arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

University of Pennsylvania(宾夕法尼亚大学)

2026-04-03 至 2026-04-03 共收录 7
2604.01007 2026-04-03 cs.AI

Omni-SimpleMem: Autoresearch-Guided Discovery of Lifelong Multimodal Agent Memory

Omni-SimpleMem:自主研究引导的终身多模态代理记忆发现

Jiaqi Liu, Zipeng Ling, Shi Qiu, Yanqing Liu, Siwei Han, Peng Xia, Haoqin Tu, Zeyu Zheng, Cihang Xie, Charles Fleming, Mingyu Ding, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) University of Pennsylvania(宾夕法尼亚大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of California Berkeley(加州大学伯克利分校) Cisco(思科)

AI总结 本文提出Omni-SimpleMem,通过自主研究流程发现多模态记忆框架,提升AI代理的长期记忆能力,其核心贡献在于通过自动实验发现架构改进、数据管道修复等关键突破,超越传统AutoML。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01657 2026-04-03 cs.CL

What Do Claim Verification Datasets Actually Test? A Reasoning Trace Analysis

声明验证数据集实际上测试什么?一种推理跟踪分析

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 研究通过分析24K个验证案例的推理轨迹,发现数据集主要测试直接证据提取,而多句综合和数值推理不足,不同领域存在显著偏差,提出改进评估体系的建议。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01652 2026-04-03 cs.AI cs.CL

ThinknCheck: Grounded Claim Verification with Compact, Reasoning-Driven, and Interpretable Models

ThinknCheck:基于紧凑、推理驱动和可解释模型的 grounded claim 验证

Delip Rao, Feijiang Han, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 ThinknCheck 通过生成结构化推理和二元判断实现 grounded claim 验证,其在 LLMAggreFact 上达到 78.1% 的平衡准确率,优于 MiniCheck-7B,且在 SciFact 上提升 14.7 个百分点。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01472 2026-04-03 math.OC cs.AI cs.LG

The Newton-Muon Optimizer

牛顿-穆恩优化器

Zhehang Du, Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出牛顿-穆恩优化器,通过引入替代模型揭示穆恩设计原理并提出新优化方法,通过矩阵-梯度正交化实现闭式更新规则,实验证明其在训练GPT-2时效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01441 2026-04-03 eess.SY cs.LG cs.OS cs.SY eess.SP stat.ML

Generative Profiling for Soft Real-Time Systems and its Applications to Resource Allocation

生成性轮廓用于软实时系统及其在资源分配中的应用

Georgiy A. Bondar, Abigail Eisenklam, Yifan Cai, Robert Gifford, Tushar Sial, Linh Thi Xuan Phan, Abhishek Halder

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Pennsylvania(宾夕法尼亚大学) Iowa State University(爱荷华州立大学)

AI总结 本文提出生成性轮廓方法,用于生成实时任务的细粒度时间轮廓,以提高资源利用率,通过非参数条件多边际施瓦茨桥公式生成准确执行轮廓,并在实际基准中验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05500 2026-04-03 cs.AI

The Illusion of AI Expertise Under Uncertainty: Navigating Elusive Ground Truth via a Probabilistic Paradigm

人工智能专家能力的幻觉:通过概率范式导航 elusive 的真实地面真相

Aparna Elangovan, Lei Xu, Mahsa Elyasi, Ismail Akdulum, Mehmet Aksakal, Enes Gurun, Brian Hur, Saab Mansour, Ravid Shwartz Ziv, Karin Verspoor, Dan Roth

机构 * Independent Researcher(独立研究员) Amazon(亚马逊) Gazi University(加齐大学) University of Colorado(科罗拉多大学) Samsun University(萨姆松大学) The University Of Melbourne(墨尔本大学) New York University(纽约大学) RMIT University(皇家墨尔本理工大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文提出概率范式,揭示高置信度真实答案对专家高分的必要性,指出在真实答案变化大的数据集中,随机标注者与专家表现差异不大,强调在低专家表现时,按真实答案概率分层评估至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14708 2026-04-03 econ.TH cs.AI cs.GT

Human Misperception of Generative-AI Alignment: A Laboratory Experiment

人类对生成式人工智能对齐的误判:一项实验室实验

Kevin He, Ran Shorrer, Mengjia Xia

机构 * University of Pennsylvania(宾夕法尼亚大学) The Pennsylvania State University(宾夕法尼亚州立大学)

AI总结 研究通过激励性实验室实验探讨人们在经济决策中对生成式人工智能对齐的感知,发现人们高估了生成式人工智能与人类选择的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏