arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-08 至 2026-05-08 共收录 413 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 97 篇

2605.05403 2026-05-08 cs.AI 84%

When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

当有益变成谄媚:谄媚是大型语言模型中社会契合与认知完整性之间的边界失败

Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent

机构 * Duke University(杜克大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 本文探讨大型语言模型中谄媚现象作为社会契合与认知完整性之间边界失败的问题,提出三条件框架以界定谄媚,并讨论其分类、评估及缓解策略。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01400 2026-05-08 cs.CL 84%

EternalMath: A Living Benchmark of Frontier Mathematics that Evolves with Human Discovery

EternalMath: 一个与人类发现同步演化的前沿数学基准

Jicheng Ma, Guohua Wang, Xinhua Feng, Yiming Liu, Zhichao Hu, Yuhong Liu

机构 * School of Mathematics, Renmin University of China(中国人民大学数学学院) Tencent(腾讯)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个自动化数学推理评估框架,通过将最新数学文献转化为可执行任务,构建可扩展的EternalMath基准,揭示LLM在前沿数学上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06490 2026-05-08 cs.AI cs.CY 83%

Instrumental Choices: Measuring the Propensity of LLM Agents to Pursue Instrumental Behaviors

工具选择:测量LLM代理追求工具性行为的倾向

Jonas Wiedermann-Möller, Leonard Dung, Maksym Andriushchenko

机构 * Universität Bielefeld(比勒菲尔德大学) Ruhr-Universität Bochum(波鸿鲁尔大学) ELLIS Institute(ELLIS研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出一个基准测试,用于衡量终端基于代理的模型在追求工具性收敛行为的倾向,通过七个操作任务评估十种模型,发现工具性行为集中且系统性,但低提示环境下的危险行为表现较少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06457 2026-05-08 cs.AI 83%

Beyond Task Success: Measuring Workflow Fidelity in LLM-Based Agentic Payment Systems

超越任务成功:衡量基于大语言模型的代理支付系统的工作流保真度

Donghao Huang, Joon Kiat Chua, Zhaoxia Wang

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理学院) School of Computing(计算学院) Research and Development, Mastercard(Mastercard研发)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出Agentic Success Rate(ASR)指标,用于评估代理系统执行序列的保真度,发现18个模型中有10个在支付流程中跳过确认检查点,而GPT-4.1虽任务成功率为完美但存在隐藏的快捷方式,ASR诊断指导的提示优化显著提升了任务成功率。

Comments 6 pages, 2 tables. Accept at AI and Data Science for Digital Finance (AIDS4DF) Workshop, PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21464 2026-05-08 cs.CL cs.AI 82%

Conversation for Non-verifiable Learning: Self-Evolving LLMs through Meta-Evaluation

对话式非验证学习:通过元评估自我进化的大型语言模型

Yuan Sui, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoNL框架,通过多智能体自我对弈实现生成、评估与元评估的统一,利用批评质量提升解决方案来改进模型,无需外部评委或真实标签。

Comments Accepted by ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06434 2026-05-08 cs.AI 81%

Knowledge Graphs, the Missing Link in Agentic AI-based Formal Verification

知识图谱:代理AI形式验证中的缺失链接

Vaisakh Naduvodi Viswambharan, Keerthan Kopparam Radhakrishna, Deepak Narayan Gadde, Aman Kumar

机构 * 1 Infineon Technologies Dresden AG \& Co. KG, Germany 2 Infineon Technologies Semiconductor India Private Limited, India

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于知识图谱的验证方法,通过结构化中间表示提取规范、RTL和工具反馈,提升形式验证中规范到RTL的关联性,并通过多代理工作流生成SVAs及三种修正循环。

Comments To appear at the IEEE International Conference on IC Design and Technology 2026 (ICICDT), June 22 - 24, 2026, Dresden, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06219 2026-05-08 cs.AI 81%

Joint Consistency: A Unified Test-Time Aggregation Framework via Energy Minimization

联合一致性:通过能量最小化实现的统一测试时间聚合框架

Yunzhen Yao, Hongye Wang, Yahong Wang, Michael C. Gastpar, Bo Jiang, Lie He

机构 * EPFL(苏黎世联邦理工学院) SUFE(上海财经大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出联合一致性框架,通过能量最小化统一测试时间聚合,整合现有投票和加权聚合方法,利用LLM作为裁判进行交互矩阵构建,并在大规模测试中实现高效近似策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03962 2026-05-08 cs.CL cs.IR 81%

How Does A Text Preprocessing Pipeline Affect Ontology Matching?

文本预处理流程如何影响本体匹配?

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang

机构 * Australian National University(澳大利亚国立大学) Monash University(莫纳什大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了文本预处理流程对本体匹配的影响,发现阶段1的分词和标准化比阶段2的停用词去除和词干提取更有效,并提出两种修复虚假映射的新方法。

Comments 14 pages, 16 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05700 2026-05-08 cs.SE cs.AI 81%

An Empirical Study of Proactive Coding Assistants in Real-World Software Development

对现实软件开发中主动编码助手的实证研究

Lehui Li, Ruixuan Jia, Guo-Ye Yang, Jia Li

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Fitten Tech Co., Ltd.(Fitten科技有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过大规模实证研究,分析了模拟与现实数据在主动意图预测中的差异,提出ProCodeBench基准,并指出模拟数据无法替代真实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05657 2026-05-08 cs.AI cs.MA 81%

Retrieval-Conditioned Topology Selection with Provable Budget Conservation for Multi-Agent Code Generation

基于可证明预算保守的检索条件拓扑选择多智能体代码生成

Abhijit Talluri, Pujith Anne, Bhagavan Choudary Pendiyala, Raghavendra Chilukuri

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出RGAO架构,通过提取代码结构复杂度向量实现多智能体代码生成系统的拓扑选择,结合复杂度条件LLM路由与形式资源代数,实现可证明的预算保守性,降低误路由率并提升代码检索效率。

Comments 30 pages, 9 figures. NeurIPS 2026 Evaluations and Datasets Track Submission Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 81%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05460 2026-05-08 cs.AI physics.chem-ph 81%

Agentic Discovery of Exchange-Correlation Density Functionals

代理发现交换关联泛函

Titouan Duston, Jiashu Liang, Yuanheng Wang, Weihao Gao, Xuelan Wen, Nan Sheng, Weiluo Ren, Yang Sun, Yixiao Chen

机构 * Princeton University(普林斯顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于代理的自动搜索系统,通过迭代计划-执行-总结循环改进泛函性能,发现的SAFS26-a泛函在基准测试中提升了约9%,并强调了领域专业知识对确保科学严谨性的重要性。

Comments 20 pages, 2 figues, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05282 2026-05-08 cs.PL cs.CL 81%

Beyond BLEU: A Semantic Evaluation Method for Code Translation

超越BLEU:代码翻译的语义评估方法

Julius Näumann, Sven Keidel, Amir Molzam Sharifloo, Mira Mezini

机构 * TU Darmstadt(图宾根大学) Hessian Center for Artificial Intelligence(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出一种基于语义等价的代码翻译评估方法,通过编译器测试方法评估LLM的二进制提升任务性能,发现语义正确性得分与BLEU得分无显著相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16309 2026-05-08 cs.CL 81%

Omnilingual MT: Machine Translation for 1,600 Languages

多语言机器翻译:支持1600种语言的机器翻译

Omnilingual MT Team, Belen Alastruey, Niyati Bafna, Andrea Caciolai, Kevin Heffernan, Artyom Kozhevnikov, Christophe Ropers, Eduardo Sánchez, Charles-Eric Saint-James, Ioannis Tsiamas, Xiang "Tony" Cao, Chierh Cheng, Joe Chuang, Paul-Ambroise Duquenne, Mark Duppenthaler, Nate Ekberg, Cynthia Gao, Pere Lluís Huguet Cabot, João Maria Janeiro, Jean Maillard, Gabriel Mejia Gonzalez, Holger Schwenk, Edan Toledo, Arina Turkatenko, Albert Ventayol-Boada, Rashel Moritz, Alexandre Mourachko, Surya Parimi, Mary Williamson, Shireen Yates, David Dale, Marta R. Costa-jussà

机构 * FAIR at Meta(Meta的FAIR)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Omnilingual Machine Translation (OMT),首次实现支持超过1600种语言的机器翻译系统,通过综合大数据策略和新创建的数据集,展示了大规模多语言翻译的性能提升和跨语言迁移的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14594 2026-05-08 cs.AI 81%

SynBench: A Benchmark for Differentially Private Text Generation

SynBench:差分隐私文本生成的基准测试

Yidan Sun, Viktor Schlegel, Srinivasan Nandakumar, Iqra Zahid, Yuping Wu, Yulong Wu, Hao Li, Jie Zhang, Warren Del-Pinto, Goran Nenadic, Siew Kei Lam, Anil Anthony Bharath

机构 * Imperial College London, Imperial Global Singapore(帝国学院伦敦,帝国全球新加坡) University of Manchester, United Kingdom(曼彻斯特大学,英国) CFAR and IHPC, Agency for Science, Technology and Research (A*STAR), Singapore(CFAR和IHPC,科技研究局(A*STAR),新加坡) Nanyang Technological University, Singapore(南洋理工大学,新加坡) Imperial College London, United Kingdom(帝国学院伦敦,英国)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出SynBench基准测试,通过标准化评估框架和隐私审计,评估不同规模的LLM生成模型在差分隐私下的性能,揭示隐私数据生成与预训练数据的关联性对生成质量的影响。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11563 2026-05-08 cs.LG cs.AI 81%

A Survey of Personalized Federated Foundation Models for Privacy-Preserving Recommendation

面向隐私保护推荐的个性化联邦基础模型综述

Zhiwei Li, Guodong Long, Chunxu Zhang, Honglei Zhang, Jing Jiang, Chengqi Zhang

机构 * Australian Artificial Intelligence Institute, University of Technology Sydney(澳大利亚人工智能研究所,悉尼技术大学) College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(香港理工大学数据科学与人工智能系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文综述了面向隐私保护推荐的个性化联邦基础模型,分析了联邦环境下有效的个性化技术,并讨论了基础模型在联邦架构中的适应性,以平衡泛化能力与用户特定需求。

Comments 10 pages, 6 figures, conference, position paper

Journal ref IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05902 2026-05-08 cs.SE 80%

Evaluating Non-English Developer Support in Machine Learning for Software Engineering

评估机器学习软件工程中非英语开发者支持

Jonathan Katzy, Yongcheng Huang, Gopal-Raj Panchu, Maksym Ziemlewski, Paris Loizides, Sander Vermeulen, Arie van Deursen, Maliheh Izadi

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究评估非英语代码注释生成及现有评估方法的可靠性,发现非英语环境下生成性能显著下降,自动评估方法无法可靠区分正确与错误注释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06239 2026-05-08 cs.LG 79%

When Graph Language Models Go Beyond Memorization

图语言模型超越记忆

Masatsugu Yamada, Mahito Sugiyama

机构 * National Institute of Informatics(日本信息处理研究所) SOKENDAI

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 研究通过诊断协议区分图语言模型的记忆与结构对齐,发现大规模下模型能学习超越记忆的结构规律,但稀有模式仍存在覆盖不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00106 2026-05-08 cs.SE cs.AI 79%

LicenseGPT: A Fine-tuned Foundation Model for Publicly Available Dataset License Compliance

LicenseGPT:一种针对公开数据集许可合规的微调基础模型

Jingwen Tan, Gopi Krishnan Rajbahadur, Zi Li, Xiangfu Song, Jianshan Lin, Dan Li, Zibin Zheng, Ahmed E. Hassan

机构 * Sun Yat-Sen University(中山大学) Huawei(华为) Queen's University(女王大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出LicenseGPT,一种专门用于数据集许可合规分析的微调基础模型,通过提升预测准确率和减少分析时间,为法律从业者提供高效工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03331 2026-05-08 cs.CL cs.AI 79%

PulseLM: A Foundation Dataset and Benchmark for PPG-Text Learning

PulseLM:PPG-文本学习的基础数据集和基准

Hung Manh Pham, Jinyang Wu, Xiao Ma, Yiming Zhang, Yixin Xu, Aaqib Saeed, Bin Zhu, Zhou Pan, Dong Ma

机构 * Singapore Management University(新加坡管理大学) Queen Mary University of London(伦敦玛丽女王大学) Eindhoven University of Technology(埃因霍温理工大学) University of Cambridge(剑桥大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 PulseLM通过统一的问答框架连接原始PPG波形与自然语言,包含100万标准化PPG片段及250万问题-答案对,为研究语言基础生理推断和多模态模型基准提供标准化基础。

Comments PulseLM v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20822 2026-05-08 cs.CL cs.AI 79%

MediEval: A Unified Medical Benchmark for Patient-Contextual and Knowledge-Grounded Reasoning in LLMs

MediEval: 一个统一的医疗基准,用于评估大语言模型在患者上下文和知识引导推理中的表现

Zhan Qu, Michael Färber

机构 * TU Dresden and ScaDS.AI(德累斯顿理工大学和ScaDS.AI)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MediEval通过整合MIMIC-IV电子健康记录与统一的知识库,系统评估医疗模型的知识基础和上下文一致性,识别关键失败模式并提出CoRFu方法提升准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05818 2026-05-08 cs.CR cs.AI cs.CL 79%

LeakDojo: Decoding the Leakage Threats of RAG Systems

LeakDojo:解码RAG系统的泄漏威胁

Maosen Zhang, Jianshuo Dong, Boting Lu, Wenyue Li, Xiaoping Zhang, Tianwei Zhang, Han Qiu

机构 * Tsinghua University, China(清华大学, 中国) Ant International, China(蚂蚁集团, 中国) Nanyang Technological University, Singapore(南洋理工大学, 新加坡)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LeakDojo通过可控评估揭示RAG系统泄漏风险,发现查询生成和对抗指令独立影响泄漏,且指令能力越强泄漏风险越高,RAG可信度提升可能增加泄漏风险。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05632 2026-05-08 cs.CR cs.CL cs.LG 79%

Architecture Matters: Comparing RAG Systems under Knowledge Base Poisoning

架构至关重要:在知识库中毒情况下比较RAG系统

Samuel Korn

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了在知识库中毒情况下不同RAG架构的鲁棒性,发现架构设计对攻击成功率影响显著,MADAM-RAG在矛盾检测上表现最佳但仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06656 2026-05-08 cs.LG cs.DM cs.ET math.OC 74%

Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

为何全球大语言模型排行榜具有误导性:异质监督学习的小微投资组合

Jai Moondra, Ayela Chughtai, Bhargavi Lanka, Swati Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

专题命中 评测与基准 :LLM(title);分类 cs.LG

AI总结 本文分析了全球大语言模型排行榜的误导性,指出语言异质性导致传统排名方法失效,并提出(λ,ν)投资组合框架以解决异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05835 2026-05-08 cs.CL cs.CY 74%

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

语言模型中的评估意识对行为影响有限

Amelie Knecht, Lucas Florin, Thilo Hagendorff

机构 * University of Stuttgart(斯图加特大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 研究通过测试不同语言模型和基准测试,发现评估意识(VEA)对模型行为影响有限,注入或移除VEA对答案分布影响较小,提示高VEA率不能简单视为策略性行为或对齐篡改的证据。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06066 2026-05-08 cs.LG cs.AI 73%

Causal Reinforcement Learning for Complex Card Games: A Magic The Gathering Benchmark

因果强化学习在复杂卡牌游戏中的应用:《魔法:英雄冒险》基准测试

Cristiano da Costa Cunha, Ajmal Mian, Tim French, Wei Liu

机构 * Department of Computer Science and Software Engineering, University of Western Australia(西澳大学计算机科学与软件工程系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出MTG-Causal-RL基准测试,通过Magic: The Gathering游戏中的复杂环境,结合因果结构和掩码动作空间,评估因果信用分配、跨 archetype 转移和策略可审计性等核心问题。

Comments 21 pages, 8 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06641 2026-05-08 cs.AI cs.CV 70%

GlazyBench: A Benchmark for Ceramic Glaze Property Prediction and Image Generation

GlazyBench:陶瓷釉料属性预测与图像生成的基准测试

Ziyu Zhai, Siyou Li, Juexi Shao, Juntao Yu

机构 * Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GlazyBench,首个用于AI辅助釉料设计的基准数据集,包含23148种真实釉料配方,支持釉料属性预测与图像生成任务,通过传统机器学习和大语言模型建立基线,展示出有前景但具挑战性的实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06599 2026-05-08 cs.LG eess.AS 70%

Weight-Decay Turns Transformer Loss Landscapes Villani: Functional-Analytic Foundations for Optimization and Generalization

权重衰减使Transformer损失景观变得Villani:优化和泛化的功能-分析基础

Abhijit Das, Sayantan Dutta

机构 * Science and Technology Organization, GE HealthCare(科技组织,GE医疗)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过功能-分析方法研究权重衰减对Transformer损失景观的影响,证明其满足Villani的 coercive 能量函数条件,并推导出与正则化强度和模型维度相关的收敛保证和泛化界限。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06283 2026-05-08 cs.CL 70%

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

量化评分标准修改对人类与自动评分者一致性的统计效应

Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究探讨评分标准修改对人类与自动评分者一致性的影响,发现提供代表性示例和减少位置偏见可提高一致性,而高复杂度和保守聚合方法则降低一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06201 2026-05-08 cs.AI 70%

Towards Annotation-Free Validation of MLLMs: A Vision-Language Logical Consistency Metric

迈向无标注验证的MLLMs:一种视觉-语言逻辑一致性度量

Ying Gu, Mei Chee Leong, Hui Li Tan, Shangbo Mao, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I 2 R), Agency for Science, Technology and Research (A*STAR), Singapore(信息通信研究所(I2R),科技研究局(A*STAR),新加坡)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种无需标注的视觉-语言逻辑一致性度量,用于评估大语言模型在因果关系上的逻辑一致性,发现尽管准确率提升,但逻辑一致性仍显著滞后。

详情

展开后加载摘要…

URL PDF HTML 收藏