arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Pennsylvania(宾夕法尼亚大学)

2026-08-11 至 2026-08-11 共收录 4
2604.21916 2026-08-11 cs.CL cs.SE 版本更新

MathDuels: A Self-Play Benchmark That Grows

MathDuels:评估大语言模型作为问题提出者和解决者

Zhiqiu Xu, Shibo Jin, Shreya Arya, Mayur Naik

机构 * Department of Computer and Information Science, University of Pennsylvania(宾夕法尼亚大学计算机与信息科学系) Department of Mathematics, University of Pennsylvania(宾夕法尼亚大学数学系)

AI总结 MathDuels通过让模型同时扮演问题提出者和解决者角色,揭示了模型在两者能力上的差异,展示了评估方法在区分模型能力上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00077 2026-08-11 cs.CL cs.AI 版本更新

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Autorubric:统一基于评分标准的LLM评估

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 Autorubric通过整合多种评分标准评估技术,提供统一的评分框架和默认设置,提升LLM评估的可靠性与一致性,并在多个基准测试中展示了其有效性。

Comments 60 pages; COLM 2026 camera ready copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03159 2026-08-11 cs.DL cs.CL 版本更新

BibTeX Citation Errors in Scientific Publishing Agents: Evaluation and Mitigation

科学出版代理中的BibTeX引用幻觉:评估与缓解

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 本文评估并缓解了科学出版代理中BibTeX引用的字段级错误,通过构建包含931篇论文的基准测试,发现模型依赖参数记忆,提出clibib工具提升准确性。

Comments 35 pages; COLM 2026 camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Houine, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏