arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

Annual Meeting of the Association for Computational Linguistics · 会议 · Natural Language Processing

共收录 10305
2604.05355 2026-04-08 cs.AI cs.CL

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning

ETR:熵趋势奖励用于高效推理链推理

Xuan Xiong, Huan Liu, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang

机构 * University of Toronto(多伦多大学) McMaster University(麦克马斯特大学) Concordia University(康考迪亚大学) University of Ottawa(渥太华大学)

AI总结 本文提出ETR,通过轨迹感知的目标促进逐步不确定性降低,提升推理效率与准确性,实验表明在多个基准上显著提升性能。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05343 2026-04-08 cs.SD cs.AI

Anchored Cyclic Generation: A Novel Paradigm for Long-Sequence Symbolic Music Generation

锚定循环生成:一种长序列符号音乐生成的新范式

Boyu Cao, Lekai Qian, Dehan Li, Haoyu Gu, Mingda Xu, Qi Liu

机构 * South China University of Technology, School of Future Technology(华南理工大学未来技术学院)

AI总结 本文提出锚定循环生成范式,通过已识别音乐的锚点特征指导自回归生成,减少误差累积,提升长序列符号音乐生成的质量与结构完整性。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05074 2026-04-08 cs.CL

Memory Dial: A Training Framework for Controllable Memorization in Language Models

Memory Dial: 一种用于语言模型可控记忆的训练框架

Xiangbo Zhang, Ali Emami

机构 * Georgia Institute of Technology(佐治亚理工学院) Emory University(埃默里大学)

AI总结 Memory Dial通过调节记忆压力参数α,控制语言模型的记忆行为,实验显示α能有效调节记忆压力,大模型更敏感,常见序列更易记忆。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19297 2026-04-08 cs.LG

CLaRE-ty Amid Chaos: Quantifying Representational Entanglement to Predict Ripple Effects in LLM Editing

在混乱中保持清晰:量化表征纠缠以预测LLM编辑中的涟漪效应

Manit Baser, Alperen Yildiz, Dinil Mon Divakaran, Mohan Gurusamy

机构 * National University of Singapore(新加坡国立大学) A*STAR Institute for Infocomm Research (A*STAR I2 R)(新加坡科技研究局资讯通信研究院)

AI总结 本文提出CLaRE技术,通过量化事实间的纠缠关系,识别LLM编辑中的潜在涟漪效应,提升模型编辑的稳定性和效率。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09365 2026-04-08 cs.CL cs.AI

Frame of Reference: Addressing the Challenges of Common Ground Representation in Situational Dialogs

参考框架:解决情境对话中共同地面表示的挑战

Biswesh Mohapatra, Théo Charlot, Giovanni Duca, Mayank Palan, Laurent Romary, Justine Cassell

机构 * Inria(法国国家信息与自动化研究所) Nantes Université(南特大学) University of Trento(特伦托大学) VJTI Mumbai(孟买维杰扬特理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究情境对话中共同地面表示的挑战,通过动态共享环境中的关系参考建立共同地面,并提出基于强化学习改进表示方法的策略。

Comments Work accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05930 2026-04-08 cs.CL cs.AI cs.LG cs.MA

Can We Predict Before Executing Machine Learning Agents?

在执行机器学习代理之前,我们能否进行预测?

Jingsheng Zheng, Jintian Zhang, Yujie Luo, Yuren Mao, Yunjun Gao, Lun Du, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

AI总结 本文提出通过内部化执行先验来预测数据驱动的解决方案偏好,利用预验证的数据分析报告提升LLM的预测能力,并在FOREAGENT中实现预测-验证循环,加速收敛并超越基于执行的基线。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05905 2026-04-08 cs.CL cs.AI cs.HC cs.LG cs.MA

Illusions of Confidence? Diagnosing LLM Truthfulness via Neighborhood Consistency

自信的幻觉?通过邻域一致性诊断LLM的真实性

Haoming Xu, Ningyuan Zhao, Yunzhi Yao, Weihong Xu, Hongru Wang, Xinle Deng, Shumin Deng, Jeff Z. Pan, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) University of Edinburgh(爱丁堡大学)

AI总结 本文提出邻域一致性信念(NCB)来评估LLM在上下文干扰下的信念鲁棒性,通过结构化测量提升模型在真实场景中的可靠性,并引入结构感知训练(SAT)减少知识脆性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19457 2026-04-08 cs.CL

MINED: Probing and Updating with Multimodal Time-Sensitive Knowledge for Large Multimodal Models

MINED:利用多模态时间敏感知识进行探测与更新以提升大多模态模型

Kailin Jiang, Ning Jiang, Yuntao Du, Yuchen Ren, Yuchen Li, Yifan Gao, Jinhe Bi, Yunpu Ma, Bin Li, Lei Liu, Qing Li

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,北京通用人工智能研究院) Northeast Forestry University(东北林业大学) C-FAIR&school of software, Shandong University(山东大学软件学院C-FAIR) State Key Lab. for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) The University of Sydney(悉尼大学) Anhui Polytechnic University(安徽工程大学) Ludwig Maximilian University of Munich(慕尼黑大学)

AI总结 本文提出MINED基准,评估LMMs在时间敏感知识上的认知、意识、可信度等六个维度,发现Gemini-2.5-Pro在时间理解上表现最佳,而多数开源模型仍缺乏此能力,且在体育知识上表现最差。

Comments ACL 2026, Project Page: https://mined-lmm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05026 2026-04-08 cs.CL

Idiom Understanding as a Tool to Measure the Dialect Gap

成语理解作为衡量方言差距的工具

David Beauchemin, Yan Tremblay, Mohamed Amine Youssef, Richard Khoury

机构 * Group for Research in Artificial Intelligence of Laval University (GRAIL)(拉瓦尔大学人工智能研究组(GRAIL)) Université Laval(拉瓦尔大学)

AI总结 本文提出结合成语理解和方言理解任务,构建三个新的法语方言基准数据集,发现模型在魁北克成语上表现显著逊色,证实了基准测试在量化方言差距中的有效性。

Comments Accepted to ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20546 2026-04-08 cs.CL cs.AI

Enhancing Hallucination Detection via Future Context

通过未来上下文增强幻觉检测

Joosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo

机构 * NAVER CLOUD(NAVER云) NAVER AI Lab(NAVER人工智能实验室) KAIST(韩国科学技术院) University of Richmond(里士满大学)

AI总结 本文提出通过采样未来上下文来增强幻觉检测,结合多种采样方法提升检测性能。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06556 2026-04-08 cs.SE cs.CL

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04300 2026-04-07 cs.CL cs.LG

High-Stakes Personalization: Rethinking LLM Customization for Individual Investor Decision-Making

高风险个性化:重新思考面向个人投资者决策的LLM定制

Yash Ganpat Sawant

AI总结 本文探讨了在高风险、长期决策领域中,LLM个性化面临的核心挑战,包括行为记忆复杂性、主题一致性、风格信号张力及无地面真相的对齐问题,并提出相应的架构改进方向。

Comments 4 pages + 1 page references. Submitted to CustomNLP4U Workshop @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05656 2026-04-07 cs.AI

HAG: Hierarchical Demographic Tree-based Agent Generation for Topic-Adaptive Simulation

HAG:基于主题自适应的分层人口树状代理生成

Rongxin Chen, Tianyu Wu, Bingbing Xu, Jiatang Luo, Xiucheng Xu, Huawei Shen

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院)

AI总结 本文提出HAG框架,通过分层决策过程生成符合主题需求的代理群体,提升宏观分布与微观一致性。实验表明HAG在减少群体对齐误差和增强社会一致性方面表现优异。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00263 2026-04-07 cs.CL cs.AI

Parallel Universes, Parallel Languages: A Comprehensive Study on LLM-based Multilingual Counterfactual Example Generation

平行宇宙,平行语言:对基于大语言模型的多语言反事实示例生成的全面研究

Qianli Wang, Van Bach Nguyen, Yihong Liu, Fedor Splitt, Nils Feldhus, Christin Seifert, Hinrich Schütze, Sebastian Möller, Vera Schmitt

机构 * Technische Universität Berlin(柏林工业大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) University of Marburg(马尔堡大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所(BIFOLD))

AI总结 本文研究了大语言模型在多语言反事实示例生成中的有效性,发现翻译生成的反事实示例在有效性上优于直接生成,但质量仍不如英文反事实示例,并揭示了多语言反事实数据增强对模型性能的提升效果。

Comments ACL 2026 main conference; camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13851 2026-04-07 cs.CL cs.LG

EvoEdit: Evolving Null-space Alignment for Robust and Efficient Knowledge Editing

EvoEdit:基于空域对齐的鲁棒高效知识编辑

Sicheng Lyu, Yu Gu, Xinyu Wang, Jerry Huang, Sitao Luan, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * Institute for Clarity in Documentation(文档清晰度研究所) Inria Paris-Rocquencourt(法国国家信息与自动化研究所巴黎-罗康库尔中心) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕默研究实验室)

AI总结 EvoEdit通过序列空域对齐缓解知识编辑中的灾难性干扰,实现稳定高效的模型更新,实验显示其性能优于现有方法且速度提升达3.53倍。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24428 2026-04-07 cs.SE

CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases

CodeWiki: 评估AI生成大规模代码库整体文档的能力

Anh Nguyen Hoang, Minh Le-Anh, Bach Le, Nghi D. Q. Bui

AI总结 CodeWiki提出一个统一框架,用于生成多语言代码库的自动化文档,通过层级分解、递归多代理处理和多模态合成,提升文档质量,实验显示其在高脚本语言上的改进显著。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01622 2026-04-07 cs.CL

DOVE: A Large-Scale Multi-Dimensional Predictions Dataset Towards Meaningful LLM Evaluation

DOVE:一个大规模多维预测数据集,用于有意义的LLM评估

Eliya Habba, Ofir Arviv, Itay Itzhak, Yotam Perlitz, Elron Bandel, Leshem Choshen, Michal Shmueli-Scheuer, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) IBM Research AI(IBM研究院人工智能) MIT(麻省理工学院) Technion - Israel Institute of Technology(以色列理工学院) Allen Institute for AI(艾伦人工智能研究所)

AI总结 DOVE通过大规模多维提示扰动评估LLM对不同维度的敏感性,揭示了提示设计对模型性能的影响,提供高效选择高性能提示的方法及鲁棒评估框架。

Journal ref Findings of ACL 2025, pp. 11744-11763

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.08150 2026-04-06 cs.CL cs.AI

Reanalyzing L2 Preposition Learning with Bayesian Mixed Effects and a Pretrained Language Model

用贝叶斯混合效应模型和预训练语言模型重新分析L2介词学习

Jakob Prange, Man Ho Ivy Wong

机构 * Hong Kong Polytechnic University(香港理工大学) Hong Kong Shue Yan University(香港树仁大学)

AI总结 本文利用贝叶斯和神经模型分析中文学习者在两项测试中的介词理解表现,发现学生能力、任务类型和刺激句子间存在关键交互作用。

Comments To appear at ACL 2023, Toronto

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01671 2026-04-03 cs.CL

PRCCF: A Persona-guided Retrieval and Causal-aware Cognitive Filtering Framework for Emotional Support Conversation

PRCCF: 一种基于人格的检索与因果感知认知过滤框架用于情感支持对话

Yanxin Luo, Xiaoyu Zhang, Jing Li, Yan Gao, Donghong Han

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, Liaoning, China(东北大学计算机科学与工程学院,沈阳,辽宁,中国) Oracle Cloud Infrastructure, Oracle, Santa Clara, CA, United States(甲骨文云基础设施,甲骨文公司,圣克拉拉,加利福尼亚州,美国)

AI总结 PRCCF通过结合语义兼容性和人格对齐的检索机制,以及因果感知的认知过滤模块,提升情感支持对话中上下文认知理解能力,在ESConv数据集上优于现有方法。

Comments 14 pages, 6 figures, 5 tables. Submitted to Transactions of the Association for Computational Linguistics (TACL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01058 2026-04-03 cs.CL cs.AI

Speaking at the Right Level: Literacy-Controlled Counterspeech Generation with RAG-RL

在合适水平上发言:基于RAG-RL的识字率控制反驳生成

Xiaoying Song, Anirban Saha Anik, Dibakar Barua, Pengcheng Luo, Junhua Ding, Lingzi Hong

机构 * University of North Texas(北德克萨斯大学) Peking University(北京大学)

AI总结 本文提出基于RAG-RL的识字率控制框架,生成适应不同健康识字水平的定制化反驳内容,提升信息可及性和有效性。

Comments Accepted at Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01053 2026-04-03 cs.CL cs.AI

A Dynamic Fusion Model for Consistent Crisis Response

一致危机响应的动态融合模型

Xiaoying Song, Anirban Saha Anik, Eduardo Blanco, Vanessa Frias-Martinez, Lingzi Hong

机构 * University of North Texas(北德克萨斯大学) University of Arizona(亚利桑那大学) University of Maryland(马里兰大学)

AI总结 本文提出动态融合模型,通过评估和整合生成响应的风格,提升危机沟通中响应的一致性和质量。

Comments Accepted at Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-04-02 cs.CL cs.AI

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments Revised submission in review for ACL ARR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19146 2026-04-01 cs.CV cs.CL

VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval

VIGiA:通过对话推理和检索进行教学视频指导

Diogo Glória-Silva, David Semedo, João Maglhães

机构 * NOVA LINCS, NOVA School of Science and Technology, Portugal(新大学信息学与计算机科学研究中心,新大学科技学院,葡萄牙)

AI总结 VIGiA是一种多模态对话模型,通过对话推理和检索处理复杂的教学视频行动计划,实现基于视觉输入和计划的对话理解,优于现有方法,在计划感知的VQA任务中达到90%以上准确率。

Comments Published at EACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29467 2026-04-01 cs.CL cs.AI

M-MiniGPT4: Multilingual VLLM Alignment via Translated Data

M-MiniGPT4:通过翻译数据实现多语言VLLM对齐

Seung Hun Han, Youssef Mohamed, Mohamed Elhoseiny

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) KAUST(阿卜杜拉国王科技大学)

AI总结 本文提出M-MiniGPT4多语言视觉大语言模型,通过混合原生多语言和翻译数据提升MiniGPT4的多语言视觉理解能力,并引入多语言对齐训练阶段,使模型在多语言MMMU基准测试中达到36%的准确率。

Comments 6 pages, ACL 2026, Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27877 2026-03-31 cs.CL cs.SD

HumMusQA: A Human-written Music Understanding QA Benchmark Dataset

HumMusQA:一个人类撰写的音乐理解问答基准数据集

Benno Weck, Pablo Puentes, Andrea Poltronieri, Satyajeet Prabhu, Dmitry Bogdanov

机构 * Universitat Pompeu Fabra(庞培法布拉大学) Universitat Autònoma de Barcelona(巴塞罗那自治大学)

AI总结 本文提出HumMusQA数据集,通过专家手工构建320个问题,评估大型音频-语言模型对音乐的理解能力,并测试其对单模态捷径的鲁棒性。

Comments Dataset available at https://doi.org/10.5281/zenodo.18462523

Journal ref Proceedings of the 4th Workshop on NLP for Music and Audio (NLP4MusA 2026), pages 58-67, Rabat, Morocco. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21652 2026-03-31 cs.CL

UnsafeChain: Enhancing Reasoning Model Safety via Hard Cases

UnsafeChain: 通过困难案例增强推理模型安全性

Raj Vardhan Tomar, Preslav Nakov, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Cluster Innovation Centre, University of Delhi(德里大学集群创新中心) INSAIT

AI总结 UnsafeChain通过构建包含困难提示的对齐数据集,提升模型安全性并保持推理能力,实验显示其在多个基准测试中表现优异。

Journal ref The Asian Federation of Natural Language Processing and The Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12616 2026-03-31 cs.CL

Improving Chain-of-Thought Reasoning via Quasi-Symbolic Abstractions

通过准符号抽象改进链式推理

Leonardo Ranaldi, Marco Valentino, Andrè Freitas

机构 * Idiap Research Institute(Idiap 研究所) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre (NBC), CRUK Manchester Institute(英国癌症研究中心曼彻斯特研究所国家生物标志物中心)

AI总结 本文提出QuaSAR方法,通过准符号解释引导LLM在更高抽象层面推理,提升小模型的推理能力,实验显示在自然语言和符号推理任务中准确率提升8%。

Journal ref 2025.acl-long.843

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26671 2026-03-31 cs.LG math.OC

Mitigating Forgetting in Continual Learning with Selective Gradient Projection

通过选择性梯度投影缓解持续学习中的遗忘

Anika Singh, Aayush Dhaulakhandi, Varun Chopade, Likhith Malipati, David Martinez, Kevin Zhu

机构 * Algoverse AI Research(Algoverse AI 研究)

AI总结 本文提出SFAO方法,通过余弦相似度和分层门控调节梯度方向,实现受控遗忘并平衡可塑性与稳定性,实验显示其在持续学习基准上表现优异,内存成本降低90%。

Comments 15 pages, 2 figures, Accepted to the Student Research Workshop at International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25092 2026-03-27 cs.IR

AuthorityBench: Benchmarking LLM Authority Perception for Reliable Retrieval-Augmented Generation

AuthorityBench: 评估LLM权威感知以实现可靠的检索增强生成

Zhihui Yao, Hengran Zhang, Keping Bi

AI总结 本文提出AuthorityBench基准,通过三个数据集评估LLM权威感知能力,发现ListJudge和PairJudge方法与真实权威最相关,且权威感知对检索增强生成的准确性有显著提升。

Comments 11 pages, 4 figures. Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏