arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-17 至 2026-08-17 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 68 篇

2402.01591 2026-08-17 eess.AS cs.AI cs.CL cs.SD 版本更新 92%

BAT: Learning to Reason about Spatial Sounds with Large Language Models

BAT:基于大语言模型的空间声音推理学习

Zhisheng Zheng, Puyuan Peng, Ziyang Ma, Xie Chen, Eunsol Choi, David Harwath

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出结合Spatial-AST与LLaMA-2 7B的BAT模型,通过合成数据集训练,实现了超越SELD任务的空间声音感知与推理,展现了LLM在空间音频领域的应用潜力。

Comments Accepted to ICML 2024. Our demo, dataset, code and model weights are available at: this https URL (https://zhishengzheng.com/bat)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14370 2026-08-17 cs.CR cs.AI cs.SE 新提交 92%

A Hybrid LLM-Based Framework for Automated Security Annotation Generation in Business Process Models

一种基于混合大语言模型(LLM)的业务流程模型自动安全标注生成框架

Md Kamrul Islam, Tiphaine Henry, Mattia Salnitri, Julius Köpke, Sami Souihi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种混合LLM与规则的框架,输入BPMN模型和安全需求文档,自动生成符合SecBPMN2规范的安全标注,在27个流程模型数据集上验证,其准确率优于人工分析师,提升效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 91%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14329 2026-08-17 cs.CR cs.AI cs.CL cs.CY cs.LG 新提交 91%

A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation

面向基于原则的监管的LLM作为评判者的四轴可信度基准

Dipankar Sarkar

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG;large language model(comments);language model(comments)

AI总结 本文提出面向基于原则监管的LLM评判者的四轴可信度基准,发布Principle-Bench并引入Ceca评估器,发现无方法在所有四轴占优,部署级LLM评判者需报告对抗性欺骗与事后校准等指标。

Comments 7 pages, 3 figures. Accepted at the KDD 2026 Workshop on Secure and Trustworthy Large Language Models (SeT-LLM), poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14179 2026-08-17 cs.AI 新提交 90%

Can Language Models Understand mmWave Data? Benchmarking Large Language Models for mmWave Radar-Based Human Understanding

语言模型能否理解毫米波数据?基于毫米波雷达的人类理解任务对大语言模型进行基准测试

Jeongwan Shin, Jaehyeon Kim, Donguk Ko, Jaeho Choi

机构 * DGIST(大邱庆北科学技术院) KAIST(韩国科学技术院) InnoCORE LLM

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对毫米波数据与大语言模型融合的研究空白,构建首个毫米波人类感知基准mmWave-QA,评估LLMs在该任务上的零样本推理潜力与视觉退化下的鲁棒性,为相关研究奠定基础。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05246 2026-08-17 cs.AI 版本更新 90%

LUNAR: Benchmarking Personalized Large Language Models on UNiversal User BehAvioR Logs

LUNAR:基于通用用户行为日志的个性化大语言模型基准测试

Jiahao Zhang, Yongzhi Tong, Zelin Fu, Pengde Zhao, Yanmei Jiang, Feng Jiang, Min Yang

机构 * Shenzhen University of Advanced Technology(深圳理工大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 该研究推出首个基于衣食住行等通用领域用户行为日志的LUNAR基准,经实验揭示LLM个性化的关键影响因素,为个性化LLM的发展指明了方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 90%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 90%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14425 2026-08-17 cs.AI 新提交 90%

Knowing When to Stop: Bayesian Optimal Stopping for LLM Evaluations

何时停止:LLM评估的贝叶斯最优停止

Toby D. Pilditch

机构 * UK AI Security Institute(英国人工智能安全研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本研究提出optstop框架,将LLM评估视为序贯测量问题,基于分层贝叶斯推理实现自适应停止,可减少评估试验量且不影响结论,为LLM评估计算资源分配提供新方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14380 2026-08-17 cs.AI 新提交 90%

AgentRewind: Recoverable Execution for Long-Horizon LLM Agents

AgentRewind:面向长 horizon LLM 智能体的可恢复执行框架

Yu Zhuang, Kefei Chen, Yitong Duan, Shuxin Zheng, Jian Li, Xu-Yao Zhang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 AgentRewind 是面向长周期 LLM 智能体的运行时恢复框架,通过记录检查点支持状态回退,结合自建基准 MettleBench 实验,可提升智能体任务成功率与清单进度。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26460 2026-08-17 cs.CL 版本更新 90%

Theory-Grounded Evaluation Exposes the Authorship Gap in LLM Personalization

基于理论的评估揭示了LLM个性化中的作者身份差距

Yash Ganpat Sawant

机构 * April 2026(2026年4月)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过理论指导的评估方法,揭示了LLM个性化中作者身份差距的问题,采用三种测量传统评估四种个性化方法,发现理论指导的指标能提供更准确的基准。

Comments Accepted at CTB Workshop, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01793 2026-08-17 cs.CL 版本更新 89%

Research-Oriented Human-Centric Evaluation for Foundation Models

面向研究的基础模型以人为中心的评估

Yijin Guo, Kaiyuan Ji, Xiaorong Zhu, Junying Wang, Farong Wen, Chunyi Li, Zicheng Zhang, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) East China Normal University(华东师范大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(title,abstract);分类 cs.CL

AI总结 针对现有基础模型评估忽视用户主观体验的问题,提出Human-Centric Evaluation框架,通过604次人类评估会话及LLM-as-a-judge实验,证实人类主观评估不可替代,为基础模型研究提供新评估方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13835 2026-08-17 cs.CL 新提交 87%

When Lexical Change Misleads: Rethinking Dynamic Topic Model Evaluation with Traditional and LLM-Based Metrics

当词汇变化产生误导时:结合传统指标与基于大语言模型的指标重新思考动态主题模型评估

Charu Karakkaparambil James

机构 * RPTU University Kaiserslautern-Landau(莱茵兰-普法尔茨州立大学凯撒斯劳滕-兰道分校)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究针对动态主题模型评估中词汇变化误导的问题,对比传统指标与基于LLM的语义相似性指标,发现后者在CoNTM上与人工判断一致性更高,提出应结合两类指标开展感知词汇变化的评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13563 2026-08-17 cs.HC cs.AI cs.SE 新提交 87%

Proxy-Validated LLM UX Micro-Simulations: An Artifact-First Protocol for Early-Stage Decision Support

代理验证的大语言用户体验微模拟:一种用于早期决策支持的工件优先协议

Alexandre Cristovão Maiorano

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出代理验证的LLM驱动UX微模拟流程,通过代理语料库验证模拟结果,结合多指标对比基线、消融实验分析智能体策略,提供可复现的早期UX决策支持方案。

Comments 27 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13404 2026-08-17 cs.SE cs.CR 版本更新 87%

Does Fixing Break Security? An Empirical Study of Security Degradation in Iterative LLM-Driven Infrastructure-as-Code Repair

修复会破坏安全性吗?对迭代式大语言模型驱动的基础设施即代码修复中安全性退化的实证研究

Benjamin Agyekum, Fabio Santos

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究通过分析IaC-Eval基准的5968个场景,发现迭代式LLM驱动的IaC修复会引入约3.3%场景的安全退化,主要由资源重构导致,第3次迭代是最优停止点,为安全反馈设计提供指导。

Comments 20 pages, 3 figures, 5 tables. Accepted at the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026). To appear in LIPIcs Vol. 394. v2: corrected the bibliographic record of one reference (preprint, not a journal article) and added the related-version link to the published LIPIcs article

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 86%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25420 2026-08-17 cs.CL cs.AI cs.CY 版本更新 84%

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

SomaliBench Eval:衡量开源语言模型中英语到索马里语的拒绝差距

Khalid Yusuf Dahir

机构 * Independent researcher(独立研究人员)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

AI总结 通过构建索马里语有害意图基准并评估四个开源模型,发现英语到索马里语的拒绝率存在显著差距,且多数非拒绝输出为不流畅的无效内容。

Comments v2: prose rewritten; classification-pipeline correction (34 judge-declined rows manually labeled); paired bootstrap and McNemar statistics; LLM-use disclosure added

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14303 2026-08-17 cs.LG 新提交 84%

Detecting Contaminated Code-Generation Prompt Batches via Influence Functions

利用影响函数检测受污染的代码生成提示批次

Francesco Quinzan, Noor Munir, Yishun Lu, Stephen Roberts

机构 * The University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出与威胁模型无关的CodeSIFT方法,利用影响函数检测受污染的代码生成提示批次,在3B至7B参数的三个代码LLM上,中高注入率下AUROC达0.98,性能优于静态分析基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13624 2026-08-17 cs.CL cs.AI cs.SD 新提交 84%

Measuring Fairness in Large Audio Language Models via Semantic-Aware Bias Estimation

基于语义感知偏差估计的大音频语言模型公平性测量

Zhe Liu

机构 * Meta Platforms, Inc.(元平台公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大音频语言模型公平性评估中语义与说话人混淆因素的问题,提出语义感知混合效应回归框架,经实验验证可减少虚假结论,得到更稳健的子群体性能差异估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25577 2026-08-17 eess.AS cs.AI cs.CL 版本更新 84%

Lost in Phonation: Voice Quality Variation as an Evaluation Dimension for Speech Foundation Models

语音迷失在发声中:语音质量变化作为语音基础模型的评估维度

Harm Lameris, Shree Harsha Bokkahalli Satish, Joakim Gustafson, Éva Székely

机构 * Department of Speech, Music and Hearing(语音、音乐与听觉系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VQ-Bench评估套件,发现语音基础模型(SFMs)对发声类型的解释存在性能差距,还会反映或放大人类社会偏见,为确保基于语音的AI的副语言解释责任性建立了可复现框架。

Comments 5 pages, 2 figures, 3 tables, accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14016 2026-08-17 cs.CV cs.AI cs.GR 新提交 83%

Content Based Video Narration of Gameplay with Vision Language Models

基于内容的游戏玩法视频旁白:利用视觉语言模型

Mathew Varghese

机构 * University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 该研究提出一种基于内容的游戏玩法视频旁白系统,利用视觉语言模型等技术生成电竞风格解说,无需游戏专用工具,支持本地化语音,还发布了可复现基线。

Comments this https URL (https://mathewvarghese.space/ai-powered-game-commentary-auto-narrating-gameplay-videos-with-gpt-4o/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14975 2026-08-17 cs.AI 版本更新 83%

CFM-Bench: A Unified Multi-Domain, Multi-Task Benchmark for Channel Foundation Models

CFM-Bench:用于信道基础模型的统一多域、多任务基准测试

Yuan Gao, Wenjun Yu, Jun Jiang, Yunfan Li, Xinyu Guo, Shugong Xu

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 研究针对信道基础模型评估缺乏统一基准的问题,发布CFM-Bench,涵盖多种信道配置、官方分区,规定数据使用规则,组织六个任务组,为比较信道表示跨模型、域和任务的可迁移性提供通用平台。

Comments CFM-Bench dataset download: this https URL (https://www.chaspark.com/) \#/s/CFM-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14533 2026-08-17 cs.CR 新提交 82%

Finding Vulnerabilities via LLM-Augmented Semantics-Aware Type-Checking

基于大语言模型增强的语义感知类型检查的漏洞发现

Ruizhe Wang, Meng Xu, N. Asokan

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract)

AI总结 本文提出语义感知类型系统SETYPE,由LLMs执行类型推断与检查,构建PYSETYPE原型,在真实Python Web应用中实现87%精度、88%准确率,识别出15个潜在零日漏洞,9个获开发者确认。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14270 2026-08-17 cs.AI 新提交 81%

TimeSage-EV: A Live Benchmark for Agentic Time Series Analysis in Evolving Environments

TimeSage-EV:面向动态环境下智能体时间序列分析的实时基准测试集

Qingren Yao, Yaxuan Kong, Yuqi Nie, Yichen Li, Stefan Zohren, Anna Vettoruzzo, Qingsong Wen, Ming Jin, Joaquin Vanschoren

机构 * Eindhoven University of Technology(埃因霍温理工大学) University of Oxford(牛津大学) VulpiVox Intelligence(VulpiVox智能公司) Squirrel Ai Learning(Squirrel AI学习公司) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有时间序列基准未评估时间有效性等问题,推出动态环境智能体时间序列分析基准TimeSage-EV,含多领域真实场景,实验揭示模型性能差距及失败模式,提供研究资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14465 2026-08-17 cs.CL cs.LG 新提交 81%

You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)

Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。

Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14227 2026-08-17 cs.AI cs.CE cs.LG 新提交 81%

Attributing Preprocessing Invariance in Spectral Foundation Models

归因于光谱基础模型中的预处理不变性

Dongjun Wei, Hongyi Wu, Yinuo Zou

机构 * ESCP Business School(ESCP商学院) OpluxCare Co., Ltd.(欧普乐康护理有限公司) The University of Hong Kong(香港大学) Nanjing University(南京大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究以拉曼光谱基础模型为例,指出其声称的预处理不变性多源于归一化而非学习,多数系统的归一化已消除相关变换,训练编码器未带来显著增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14106 2026-08-17 cs.LG cs.AI cs.CE stat.AP stat.ML 新提交 81%

Forecast Collapse in Time-Series Foundation Models

时间序列基础模型中的预测崩溃现象

Shu Wan, Miles Ma, Hank Zhu, Guangqi Liu, Stephen Wang, Qingsong Wen, Huan Liu

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对1000只美股每小时收益预测出现的预测崩溃现象,本文分析其成因,提出CalibRank目标函数平衡校准与排名,在Finance1K上提升了截面相关性。

Comments 27 pages, 3 figures, 5 tables. Dataset: this https URL (https://huggingface.co/datasets/abel-lab/finance1k)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24519 2026-08-17 cs.LG cs.AI cs.NE 版本更新 81%

A Negative-Control Protocol for Clinical EEG Foundation-Model Benchmarks: Dataset Identity and External-Cohort Stress Testing

用于临床解码的脑电图基础模型压力测试:数据集标识和目标阴性对照

Marzieh Zare

机构 * Université Laval(拉瓦尔大学) NeuroGenis Inc.(NeuroGenis公司)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究预训练脑电图基础模型在临床解码中的表现,通过多种方法在多数据集多任务上对六个模型进行基准测试,发现模型结论依赖评估单元、数据集偏移等因素,如在韩国痴呆症等任务中不同模型和方法表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09992 2026-08-17 cs.CL cs.AI 版本更新 81%

A Unified Assessment of the Poverty of the Stimulus Argument for Neural Language Models

对神经语言模型中贫乏刺激论的统一评估

Xiulin Yang, Arianna Bisazza, Nathan Schneider, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) University of Groningen(格罗宁根大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过poshbench评估了神经语言模型在贫乏刺激论中的表现,发现其泛化能力弱于儿童,但引入认知动机归纳偏置后提升语法能力,挑战了内在句法是唯一泛化途径的观点。

Comments TACL under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13956 2026-08-17 cs.IR 新提交 80%

How retriever redundancy and diversity impact RAG effectiveness

检索器冗余性与多样性如何影响检索增强生成(RAG)的有效性

Jonathan J Ross, Bevan Koopman, Anton van der Vegt, Guido Zuccon

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本研究探究RAG中检索文档的冗余性与多样性对答案正确性的影响,发现重复冗余与LLM转述无显著增益,而多样文档可将正确性提升17%-47%,并揭示其提升源于体裁多样性,为RAG检索方法优化提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏