arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 415 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 102 篇

2605.02215 2026-05-11 cs.SE 91%

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

HEJ-Robust:基于LLM的自动程序修复的鲁棒性基准

Fazle Rabbi, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HEJ-Robust基准,通过八种语义保持的代码转换生成1450个实例,评估五种微调LLM,在多种转换下模型性能下降超50%,揭示当前LLM修复模型缺乏对细微语法变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 91%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07046 2026-05-11 stat.ML cs.AI cs.LG 91%

An Interpretable and Scalable Framework for Evaluating Large Language Models

用于评估大语言模型的可解释且可扩展的框架

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu

机构 * Department of Statistics, University of California, Riverside(加州大学河滨分校统计学系) School of Statistics and Data Science, Southeast University(东南大学统计与数据科学学院) Department of Statistics and Data Science, Southern University of Science and Technology(南方科技大学统计与数据科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于最大化最小化原理的可解释且可扩展框架,用于评估大语言模型,通过约束矩阵分解子问题实现稳定高效的参数估计,实验表明方法在可扩展性和可解释性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 90%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06937 2026-05-11 cs.LG 90%

A Reproducible Optimisation Protocol for Calibrating Prompt-Based Large Language Model Workflows in Evidence Synthesis

一种可重复的优化协议用于校准基于提示的大型语言模型在证据综合中的工作流程

Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种可重复的校准流程,用于基于提示的大型语言模型在结构化证据综合任务中的优化。方法将定义科学任务的规则与可变的提示框架分离,并通过标记或参考示例及显式任务指标优化框架,最终保存校准的工作流程作为可检查的制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16928 2026-05-11 cs.GT cs.AI cs.MA 90%

Discovering Multiagent Learning Algorithms with Large Language Models

用大型语言模型发现多智能体学习算法

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

机构 * Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用AlphaEvolve框架自动发现CFR和PSRO算法,提出VAD-CFR和SHOR-PSRO,通过简化核心机制获得更高效的WOP-CFR和PM-PSRO,提升泛化能力。

Comments More experiments and analysis on algorithmic distilliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07342 2026-05-11 cs.LG cs.AI cs.SE 90%

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

Mage:多轴评估LLM生成的可执行游戏场景超越编译通过率

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚尔姆斯理工大学和哥德堡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Mage多轴评估框架,通过编译通过率、运行通过率、结构保真度和机制符合度四个维度评估LLM生成的游戏场景,发现编译通过率与功能正确性反相关,证明多轴评估对检测领域差异的必要性。

Comments Main Content: 10 pages, 1 figure. In total 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07102 2026-05-11 cs.CL 90%

SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions

SAGE:基于本体的层级LLM文学评价

Tianyu Wang, Nianjun Zhou

机构 * Mercy University, Math & Computer Science Department(梅里大学数学与计算机科学系) IBM T.J. Watson Research Center(IBM 托马斯·贾维斯·沃森研究中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过本体引导的解释性维度对文学质量进行分层评估,利用结构化大语言模型评估和多轮迭代反思,实现98.8%的评分收敛和94%的评分者一致性,揭示了文学质量的层次结构和影响因素。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23478 2026-05-11 cs.CL 90%

JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

JudgeSense: 一个用于评估LLM作为裁判系统提示敏感性的基准

Rohith Reddy Bellibatlu, Edward Raff, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) CrowdStrike University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeSense基准,用于评估LLM作为裁判系统在提示重述下的稳定性,分析不同任务和架构的决策稳定性,并发现一致性不依赖模型规模。

Comments 20 pages, 2 figures, 1 table. Code: https://github.com/rohithreddybc/judgeSense. Dataset (JudgeSense Benchmark): https://huggingface.co/datasets/Rohithreddybc/judgesense-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07293 2026-05-11 cs.CR 89%

When the Ruler is Broken: Parsing-Induced Suppression in LLM-Based Security Log Evaluation

当尺子破损时:基于LLM的安全日志评估中的解析诱导抑制

Chaitanya Vilas Garware, Sharif Noor Zisad

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文揭示了基于LLM的安全日志分类器评估中因严格正则表达式解析导致的系统性误差,通过OpenSOC-AI案例显示,修正后的模糊解析可将威胁准确性从0%提升至76%,并提出SOC-Bench v0基准框架以避免解析偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 89%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA 88%

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07635 2026-05-11 cs.CL 88%

Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

大维度评估用于语法纠错的LLM

Adnan Labib, Qiao Wang, Yixuan Huang, Zheng Yuan

机构 * King's College London(伦敦国王学院) Hosei University(Hosei大学) Waseda University(早稻田大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估最新LLM在语法纠错中的表现,发现微调后的GPT-4o在编辑精度、流畅度保持和意义保留上表现最佳,同时揭示参考基度量低估GEC性能的问题。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 88%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07709 2026-05-11 cs.SE 88%

SafeTune: Search-based Harmfulness Minimisation for Large Language Models

SafeTune: 基于搜索的大型语言模型有害性最小化

Giordano d'Aloisio, David Williams, Giusy Annunziata, Zhiwei Fei, Antinisca Di Marco, Federica Sarro

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SafeTune方法,通过超参数调优和系统提示工程降低大型语言模型的有害性并提升响应相关性。

Comments Accepted at SSBSE 2026 Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 87%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 87%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00780 2026-05-11 cs.SE 87%

Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems

语言模型能否超越编程?评估语言模型构建现实系统的能力

Chenyu Zhao, Shenglin Zhang, Zeshun Huang, Weilin Jin, Yongqian Sun, Dan Pei, Chaoyun Zhang, Qingwei Lin, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出Build-bench基准,评估语言模型在跨指令集架构迁移中修复构建失败的能力,发现当前模型最大成功率为63.19%,并揭示了不同模型在工具使用上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07208 2026-05-11 cs.LG 86%

FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution

FAME:通过连续时间流形演变进行学术影响预测

Jianrong Ding, Jianyuan Zhong, Zhengyan Shi, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FAME框架,通过动态流形演变模型预测科研论文的学术影响,实验显示其在多维影响预测上优于现有LLM评估器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06919 2026-05-11 cs.CL 86%

Can LLMs Take Retrieved Information with a Grain of Salt?

大语言模型能否对获取的信息持谨慎态度?

Behzad Shayegh, Mohamed Osama Ahmed, Fred Tung, Leo Feng

机构 * RBC Borealis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了八种LLM在上下文确定性服从方面的表现,发现其在不确定上下文中回忆先验知识、解释确定性表达和信任复杂上下文方面存在系统性限制,并提出结合先验提示、确定性重校准和上下文简化的方法,将服从误差降低了25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06707 2026-05-11 cs.SE cs.AI 85%

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

单文件测试:一项纵向的公共接口评估,评估首次输出LLM网页生成与社交传播跟踪

Diego Cabezas Palacios

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过8周的观察比较,评估了17项公共实验中收集的68个单文件HTML生成,比较了GPT、Gemini、Grok和Claude四种推理模型家族在固定公共接口协议下的表现,发现Claude在性能和一致性上表现最佳,但模型家族对代码冗余的影响大于提示词内容。

Comments 23 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06897 2026-05-11 cs.CL cs.AI cs.HC cs.MM cs.SD eess.AS 85%

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

MIST:面向智能家居的多模态交互语音工具调用对话助手

Maximillian Chen, Xuanming Zhang, Michael Peng, Zhou Yu, Alexandros Papangelis, Yohan Jo

机构 * Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MIST数据集,用于研究具备物理世界约束推理能力的多模态语音助手,发现开放和闭源多模态LLM在该任务上存在显著差距。

Comments Project Page: https://billyzhang24kobe.github.io/mist-smarthome/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24946 2026-05-11 cs.SE cs.LG 84%

MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development

MobileDev-Bench: 一个用于移动应用开发中问题解决的基准

Moshood A. Fakorede, Krishna Upadhyay, A. B. Siddique, Umar Farooq

机构 * Louisiana State University(路易斯安那州立大学) University of Kentucky(肯塔基大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MobileDev-Bench,包含407个真实世界问题解决任务,涵盖Android Native、React Native和Flutter框架。通过验证的开发人员报告问题与可执行测试补丁配对,评估四个前沿LLM在移动构建环境中的端到端解决率。

Comments 30 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11512 2026-05-11 cs.LG cs.AI 84%

From Time Series Analysis to Question Answering: A Survey in the LLM Era

从时间序列分析到问答:在大语言模型时代的一次综述

Wei Li, Zhe Xie, Yuxuan Liang, Xinli Hao, Yunyao Cheng, Dan Pei, Xiaofeng Meng

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Aalborg University(奥胡斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大语言模型时代时间序列分析向时间序列问答的转变,探讨了TSQA在灵活性、经济性和通用性方面的选择指导及未来研究方向。

Comments Accepted by IJCAI 2026 Survey Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06832 2026-05-11 cs.CL cs.AI cs.LG 83%

IntentGrasp: A Comprehensive Benchmark for Intent Understanding

IntentGrasp:意图理解的综合基准

Yuwei Yin, Chuyuan Li, Giuseppe Carenini

机构 * Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出IntentGrasp基准,用于评估大语言模型的意图理解能力,通过训练集和测试集评估20种模型,发现其表现不佳,提出Intentional Fine-Tuning方法提升性能。

Comments IntentGrasp data is available on [Hugging Face](https://huggingface.co/datasets/yuweiyin/IntentGrasp), and the code is released on [GitHub](https://github.com/YuweiYin/IntentGrasp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06939 2026-05-11 cs.LG stat.ME stat.ML 83%

Bias and Uncertainty in LLM-as-a-Judge Estimation

大语言模型作为裁判的偏差与不确定性估计

James Fiedler

机构 * Indeed Inc.(Indeed公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.LG

AI总结 研究大语言模型作为裁判评估中偏差和不确定性的系统性问题,提出J和ΔJ作为诊断工具,分析共享校准比较的可靠性及报告指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16571 2026-05-11 cs.AI cs.IR cs.MA 83%

LLM-Based Agents for Competitive Landscape Mapping in Drug Asset Due Diligence

基于大语言模型的竞品映射 agent 在药物资产尽调中的应用

Vlad Vinogradov, Alisa Vinogradova, Dmitrii Radkevich, Ilya Yasny, Dmitry Kobyzev, Ivan Izmailov, Katsiaryna Yanchanka, Roman Doronin, Andrey Doronichev

机构 * LanceBio Ventures AI Expert

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种基于大语言模型的竞品发现 agent,通过结构化数据处理提升药物资产尽调效率,实现竞品检索与属性标准化,实验结果显示其召回率优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07675 2026-05-11 cs.AI cs.LG 82%

FactoryBench: Evaluating Industrial Machine Understanding

FactoryBench:评估工业机器理解的基准测试

Yanis Merzouki, Coral Izquierdo, Matei Ignuta-Ciuncanu, Marcos Gomez-Bracamonte, Riccardo Maggioni, Alessandro Lombardi, Camilla Mazzoleni, Federico Martelli, Balazs Gunther, Jonas Petersen, Philipp Petersen

机构 * ETH Zurich(苏黎世联邦理工学院) Forgis UC3M Imperial College London(帝国理工学院伦敦分校) University of Berkeley(伯克利大学) KTH Royal Institute of Technology(皇家理工学院) University of Vienna(维也纳大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FactoryBench基准测试,用于评估时间序列模型和LLM在工业机器人 telemetry 中的机器理解能力,通过四个因果层次和五种答案格式评估,包含70k问题-答案对,揭示当前模型与实际操作理解之间的差距。

Comments 9 pages, 4 figures, 14 tables; appendix with 24 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07488 2026-05-11 cs.AI cs.LG 82%

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

通过增量优化效用实现多模态模型的数据选择效率

Jinhao Jing, Qiannian Zhao, Chao Huang, Zhan Su

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出OST框架,将数据选择转化为增量优化效用排名问题,通过轻量代理模拟单步更新估算样本边际效用,实验证明在减少训练成本的同时提升性能,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07305 2026-05-11 cs.CL cs.AI 82%

MedAction: Towards Active Multi-turn Clinical Diagnostic LLMs

MedAction:迈向主动多轮临床诊断LLMs

Hsin-Ling Hsu, Zizheng Wang, Donghua Zhang, Nai-Chia Chen, Jerry Wang, Jun-En Ding, Chia-Hsuan Hsu, Guoan Wang, Feng Liu, Fang-Ming Hung, Chenwei Wu, Liyue Shen

机构 * National Chengchi University(国立中正大学) Georgetown University(乔治城大学) University of Michigan(密歇根大学) Stevens Institute of Technology(史蒂文斯理工学院) National Taiwan University of Science and Technology(台湾科技大学) Far Eastern Memorial Hospital(东方纪念医院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedAction,通过LLM与环境交互生成高质量多轮诊断轨迹,解决现有模型在动态证据下推理不足的问题,提升开源医疗LLMs性能。

详情

展开后加载摘要…

URL PDF HTML 收藏