Faithful by Design: Evaluating and Improving LLM-Generated Clinical Trial Summaries for Multi-Stakeholder Audiences
设计忠实性:评估和改进面向多利益相关方受众的大语言模型生成的临床试验摘要
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究针对大语言模型生成的临床试验摘要的忠实性问题,引入基准评估框架,用特定数据库试验、提示模板和注释模式评估,对比多个模型的基线测量,开发知识图谱增强检索系统,结果显示该系统改进显著,且不同模型改进途径有别。
Comments 8 pages, 8 figures