arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-12 至 2026-08-12 共收录 359 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 85 篇

2608.09988 2026-08-12 cs.CE cs.CL 新提交 92%

OpenPM: Auditable Point-in-Time Evaluation for LLM Portfolio-Management Agents

OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架

Xinying Cai, Minghao Guo, Jiahe Liu, Jiaojiao Han, Bangwei Guo, Yitao Long, Yuxuan Chen, Bohan Wu, Dimitris N. Metaxas, Raymond Li

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。

Comments 14 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05061 2026-08-12 cs.CL 版本更新 92%

No Free Labels: Limitations of LLM-as-a-Judge Without Human Grounding

无免费标签:缺乏人类基准的LLM作为评判的局限性

Michael Krumdick, Charles Lovering, Varshini Reddy, Seth Ebner, Chris Tanner

机构 * Kensho Technologies MIT(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出BFF-Bench基准测试,通过专家评估LLM响应的正确性,揭示LLM作为评判在无人类基准时的局限性,显示当无正确参考时,LLM评判与人类专家的高一致性仅限于LLM能正确回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15817 2026-08-12 cs.SE 91%

A Causal Perspective on Measuring, Explaining and Mitigating Smells in LLM-Generated Code

从因果视角测量、解释和缓解LLM生成代码中的代码异味

Alejandro Velasco, Daniel Rodriguez-Cardenas, Dipin Khati, David N. Palacio, Luftar Rahman Alif, Denys Poshyvanyk

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文从因果视角研究LLM生成代码中的代码异味问题,提出PSC指标用于测量和缓解异味倾向,通过实验揭示生成策略和架构对代码结构的影响,并推动质量感知评估在代码生成中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10621 2026-08-12 cs.LG 新提交 91%

ProbGuard: Calibrated Safety Risk Estimation from LLM Output Distributions

ProbGuard:基于大语言模型输出分布的校准安全风险估计

Xinzhe Huang, Biwu Yao, Kedong Xiu, Mengnan Zhao, Di Wang, Puning Zhao, Tianhang Zheng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究针对现有LLM安全防护的确定性范式局限,提出概率架构无关防护框架ProbGuard,利用早期输出分布信号校准安全风险,实现提前终止不安全输出,在9种组合设置及6种越狱攻击中均表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09740 2026-08-12 cs.SE 版本更新 90%

Security Tests as Executable Specifications for LLM Code Generation: Benefits, Trade-offs, and Coverage Limits

安全测试作为LLM代码生成的可执行规范:益处、权衡与覆盖范围限制

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出将安全测试作为LLM代码生成的可执行规范,开发SecTDD框架,通过多维度评估发现预先展示可见测试可提升联合成功率,结构化反馈修复效果更优但益处受多因素影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10970 2026-08-12 cs.CL cs.AI 新提交 90%

ReLTEx: Reliable LLM-based Taxonomy Expansion

ReLTEx:基于大语言模型的可靠分类体系扩展

Zeinab Ghamlouch, Mehwish Alam

机构 * Télécom Paris(巴黎电信学院) Institut Polytechnique de Paris(巴黎综合理工学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ReLTEx是结合LLM候选生成、结构感知验证与递归扩展控制的框架,可减少幻觉,在基准分类体系的掩码扩展任务中,能生成更可靠、语义连贯的分类体系扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10698 2026-08-12 cs.CL 新提交 90%

EVIL-Detect for NLPCC 2026 Shared Task 6: LLM-Generated Text Detection

面向NLPCC 2026共享任务6的EVIL-Detect:大语言模型生成文本检测

Hongrui Bao, Hangyu Rong, Zhuoshang Wang, Yubing Ren, Yanan Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对中文场景下LLM生成文本检测需求,提出带冲突感知融合的多信号集成框架EVIL-Detect,整合多类信号并校准决策边界,在NLPCC 2026共享任务6中获宏F1 0.8888且排名第一。

Comments Accepted by NLPCC 2026 Shared Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10885 2026-08-12 cs.CV 新提交 89%

ConfTriage: A Calibration-Aware LLM Triage Framework for Pulmonary Nodule Malignancy with Selective Specialist Deferral

ConfTriage:用于肺结节恶性程度分级的校准感知大语言模型分级框架,结合选择性专家模型转诊机制

Md Rabiul Islam, Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出ConfTriage框架,以校准感知LLM为核心结合专家DL后备模型,通过肺结节属性的自然语言表述实现分级,在LIDC-IDRI数据集上取得88.22%的F1分数与0.92的AUC,可高效处理多数病例并仅转诊不确定病例,为医疗决策支持提供了新路径。

Comments 14 pages, 8 figures. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06227 2026-08-12 cs.CL cs.LG 版本更新 88%

Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety

基于开源LLM的自信意识细粒度辩论用于心理健康和在线安全的自动化数据增强

Junyu Mao, Anthony Hills, Talia Tseriotou, Maria Liakata, Aya Shamir, Dan Sayda, Dana Atzil-Slonim, Natalie Djohari, Pamela Ugwudike, Mahesan Niranjan, Stuart E. Middleton

机构 * University of Southampton, UK(英国南安普顿大学) Queen Mary University of London, UK(伦敦大学玛丽女王学院) The Alan Turing Institute, UK(阿兰·图灵研究所) Bar Ilan University, Israel(巴伊兰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出CFD框架,利用开源LLM的细粒度辩论实现心理健康和在线安全领域的自动化数据增强,通过实验验证其在多标签增强任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10213 2026-08-12 cs.CE 新提交 88%

VeriFin: A Neurosymbolic Framework for Verifying LLM-Generated Financial Claims

VeriFin:用于验证大语言模型生成的财务声明的神经符号框架

Bethel Hall, Sachi Shome, William Eiers

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成财务声明易出错的问题,提出神经符号框架VeriFin,基于XBRL事实与Z3验证,在XBRLFiling和FinanceBench基准上实现零错误接受,还可通过求解器反馈提升修复效果。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15441 2026-08-12 cs.SE cs.AI cs.FL cs.PL 88%

On the Effectiveness of Large Language Models in Writing Alloy Formulas

Yang Hong, Shan Jiang, Yulei Fu, Sarfraz Khurshid

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16706 2026-08-12 cs.AI cs.CL cs.MA 版本更新 88%

Auditing Automated Evaluation, Error Propagation, and Runtime Mitigation in Tool-Using Language Agents

评估工具使用语言代理:裁判可靠性、错误传播和运行时缓解在AgentProp-Bench中

Bhaskar Gurram

机构 * Zasti Inc.(Zasti公司)

专题命中 评测与基准 :language agent(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过AgentProp-Bench评估工具使用语言代理的可靠性,发现基于子字符串的裁判与人类标注一致性较低,但三模型集成能提高一致性,同时发现参数注入导致错误传播的概率较高,运行时拦截器在GPT-4o-mini上有效减少幻觉,但对Gemini-2.0-Flash无显著影响。

Comments 11 pages, 4 figures, 8 tables. Code and data: https://github.com/bhaskargurram-ai/agenthallu-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11149 2026-08-12 cs.CV 新提交 88%

PRMU: A Corpus-Free Benchmark for Person-Centric Knowledge Unlearning in Multimodal Large Language Models

PRMU:面向多模态大语言模型中以人为中心的知识遗忘的无语料基准

Huafeng Chen, Yueming Lyu, Ziyuan Chen, Wenda Tan, Chenyang Si, Liucheng Guo, Caifeng Shan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 针对现有多模态大语言模型(MLLMs)遗忘方法依赖语料的局限,提出无语料基准PRMU及基线SGPE,实验显示SGPE在目标遗忘、局部性保留等方面权衡更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10503 2026-08-12 cs.CL 新提交 87%

Every Token Counts: Exact Likert-Scale Distributions for Measuring LLM Attitudes and Biases

每个词元都重要:用于测量大语言模型态度与偏差的精确李克特量表分布

Davood Wadi, Mohsen Ghodrat, Matthew Philp

机构 * McGill University(麦吉尔大学) University Canada West(加拿大西部大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究提出结合人类心理测量学与LLMs机制的精确框架,通过因子实验、词元级PMFs及对应分析方法,分离LLMs的系统性原产国偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10385 2026-08-12 cs.IR cs.AI 新提交 87%

Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation

角色设定作为基于大语言模型的信息检索评估的评估者敏感性探测工具

Samaneh Mohtadi, Pietro Bernardelle, Joel Mackenzie, Gianluca Demartini

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究以角色设定为探测工具,分析基于大语言模型的IR评估中评估者敏感性,发现高容量模型能保持系统排序一致性,角色来源影响小于评估者角色和模型容量。

Comments Accepted at CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09946 2026-08-12 cs.HC cs.AI 新提交 87%

HoosierHelp: Benchmarking LLM Agents for Social Service Navigation

HoosierHelp:面向社会服务导航的大语言模型智能体基准测试

Yiyang Li, Weixiang Sun, Tianyi Ma, Kaiwen Shi, Zheyuan Zhang, Yanfang Ye

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究推出基于印第安纳州3971项公共社会服务资源的交互式基准HoosierHelp,测试发现现有LLM智能体在社会服务导航中对复杂非理想用户交互鲁棒性不足,需更可靠的智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20907 2026-08-12 cs.CL 版本更新 87%

The Hidden Puppet Master: Predicting Human Belief Change in Manipulative LLM Dialogues

隐藏的提线人:预测操纵性大语言模型对话中的人类信念变化

Jocelyn Shen, Amina Luvsanchultem, Jessica Kim, Kynnedy Smith, Valdemar Danry, Kantwon Rogers, Hae Won Park, Maarten Sap, Cynthia Breazeal

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 本文提出PUPPET框架,通过分析1035个人类与LLM交互数据,揭示当前安全范式在检测操纵策略与信念变化幅度之间的关键断层,证明先进LLM对人类信念易感性的系统低估。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 87%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10875 2026-08-12 cs.CL cs.AI 新提交 87%

VibeLifeBench: Can Your Life Agent Be Proactive and Persistent in a Living World?

VibeLifeBench:你的生命智能体能在真实生活环境中保持主动与持续性吗?

Xiaohongshu Inc

机构 * Xiaohongshu Dots Studio(小红书Dots工作室) Evolvent AI(Evolvent AI公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VibeLifeBench基准,评估7个前沿LLM智能体在200项长周期日常生活任务中的表现,发现其主动与持续性不足,将开源相关任务、环境与评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11022 2026-08-12 cs.DC cs.AI 新提交 86%

Workflow Cards: Structured Summaries of Workflow Executions Using Provenance Data

工作流卡片:利用溯源数据生成工作流执行的结构化摘要

Nicola Giuseppe Marchioro, Gabriele Padovani, Amal Gueroudji, Rafael Ferreira da Silva, Wesley Brewer, Valentine Anantharaj, Sandro Fiore, Renan Souza

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出工作流卡片,将工作流执行的溯源数据转化为可读的结构化摘要,填补了现有模型、数据卡片缺失执行级信息的空白,使LLM回答质量较传统查询提升近一倍。

Comments Accepted at eScience2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10699 2026-08-12 cs.LG cs.AI 新提交 86%

ProTAGAD: A Foundation Model for TAG Anomaly Detection with Decoupled Topological and Textual Prototypes

ProTAGAD:一种用于文本属性图异常检测的基础模型,具有解耦的拓扑和文本原型

Ziyan Wang, Liwen Wu, Cheng Xie, Song Gao, Zhenli He, Xin Jin

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ProTAGAD基础模型,通过解耦拓扑与文本原型构建双原型库,缓解传统方法的异常边界模糊问题,在14个基准数据集的跨域场景中实现最先进TAG异常检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02621 2026-08-12 cs.CL cs.LG 版本更新 86%

Reinforcement Learning-based Semi-supervised Knowledge Distillation with LLM-as-a-Judge

基于强化学习的知识蒸馏与大语言模型作为评判者

Yiyang Shen, Lifu Tu, Weiran Wang

机构 * University of Iowa(爱荷华大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种基于强化学习的知识蒸馏方法,利用大语言模型作为评判者在无标签数据上生成奖励,实现无需真实标签的蒸馏,提升数学推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 86%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05353 2026-08-12 cs.CL 版本更新 85%

Evidence Lock Before Commitment: A Frozen Interface Degrades LLM-as-Judge Evaluation

提交前的证据锁定:冻结界面会降低“大模型作为评判者”的评估效果

Divyansh Singh

机构 * University of Florida(佛罗里达大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL

AI总结 该研究测试了证据锁定等不同LLM-as-Judge评估方案,发现证据锁定会降低与人类偏好的一致性、增加答案顺序不一致性,而结构化证据引出效果接近标准评判,持久化证据可支持审计但不应替代源答案。

Comments Withdrawn due to an error identified in the code during debugging. The error affects the reported results

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 85%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 评测与基准 :LLM(summary_cn,abstract);language agent(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 84%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09937 2026-08-12 cs.CL cs.CY 新提交 83%

Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory

仔细考量文化:利用文化共识理论分析单文化与多文化场景下的大语言模型对齐

Krishna Pothugunta, John P. Lalor

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究利用文化共识理论,分析大语言模型在单/多文化场景下的对齐情况,发现模型存在文化结构误表征问题,该理论可用于区分模型反映人类多样性与算法同质化的情况。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05224 2026-08-12 cs.AI cs.CY 版本更新 83%

Small Foundation Models of Human Cognition and Behaviour

人类认知与行为的小型基础模型

Nick Oh, Fernand Gobet

专题命中 评测与基准 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究训练不同规模的小型认知微调模型,发现其在分布内表现稳定、分布外泛化需更大模型,且可作为心理学实验噪声上限估计器。

Comments published as a conference paper at COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17162 2026-08-12 cs.AI q-bio.GN 版本更新 83%

JEPA-DNA: Grounding Genomic Foundation Models through Joint-Embedding Predictive Architectures

JEPA-DNA:通过联合嵌入预测架构夯实基因组基础模型

Ariel Larey, Elay Dahan, Amit Bleiweiss, Raizy Kellerman, Guy Leib, Omri Nayshool, Dan Ofer, Tal Zinger, Dan Dominissini, Gideon Rechavi, Nicole Bussola, Simon Lee, Shane O'Connell, Dung Hoang, Marissa Wirth, Alexander W. Charney, Nati Daniel, Yoli Shavit

机构 * Applied AI Architecture, NVIDIA, Israel(NVIDIA应用人工智能架构,以色列) Worldwide Field Ops, NVIDIA, Israel(NVIDIA全球现场运营,以色列) Developer Programs, NVIDIA, Israel(NVIDIA开发者计划,以色列) Cancer Research Center and Wohl Institute of Translational Medicine, Sheba Medical Center, Tel Hashomer, Israel(癌症研究中心和Wohl转化医学研究所,Sheba医疗中心,Tel Hashomer,以色列) Windreich Department of AI and Human Health, Icahn School of Medicine at Mount Sinai, New York, USA(AI与人类健康风reich部门,Mount Sinai医学中心,纽约,美国)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.AI

AI总结 提出JEPA-DNA框架,将联合嵌入预测架构与生成式目标结合,通过潜在空间监督全局序列嵌入,实现从令牌恢复到语义对齐的转变,在17项基因组基准任务上提升线性探测和零样本性能,达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10176 2026-08-12 cs.AI 新提交 81%

TRACE: Trustworthy Retrieval-Augmented Conversational Engine

TRACE:可信赖的检索增强对话引擎

Touseef Hasan, Laila Cure, Souvika Sarkar

机构 * Wichita State University(威奇托州立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员提出TRACE框架,通过强化检索提升公共服务对话系统的约束满足度、减少幻觉,降低对模型规模的依赖,证实检索质量是系统稳健性的关键。

详情

展开后加载摘要…

URL PDF HTML 收藏