arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2603.21362 2026-05-12 cs.AI cs.CL 90%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08448 2026-05-12 cs.AI cs.CL 90%

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

基于大语言模型的半监督方法用于社交媒体危机数据分类

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型引导的半监督学习在社交媒体危机数据分类中的应用,比较了VerifyMatch和LLM引导的协同训练方法,发现LLM引导的协同训练在低资源环境下表现优异,同时验证了知识迁移的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06047 2026-05-12 cs.AI cs.CL 90%

DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments

DSGBench:一种多样化的战略游戏基准,用于评估基于大语言模型的代理在复杂决策环境中的能力

Wenjie Tang, Yuan Zhou, Erqiang Xu, Keyan Cheng, Minne Li, Liquan Xiao

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能博弈与决策实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DSGBench通过六个复杂战略游戏评估LLM代理在复杂决策环境中的能力,采用细粒度评分系统和自动决策追踪机制,揭示不同LLM模型的优劣与系统限制。

Comments 43 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08321 2026-05-12 cs.LG cs.AI cs.CY cs.HC cs.MA 90%

LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

LLM卫士:通过第三方对话监督缓解对抗说服

Lennart Wachowiak, Scott D. Blain, David Williams-King, Samuele Marro

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过引入第三方LLM卫士模型,降低对抗性LLM对用户的操纵成功率,实验显示卫士模型使对手成功率从65.4%降至30.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 90%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10405 2026-05-12 cs.LG 90%

Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

通过低秩分解实现LLM评估中的最佳模型识别

Elad Tolochinsky, Yaniv Tenzer, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出结合多臂老虎机与低成本预测评分的框架,通过低秩分解减少方差,构建有效的置信区间,实现实验结果的准确识别与计算成本的降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04956 2026-05-12 cs.LG cs.PF 90%

KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels

KernelBenchX: 一个全面的评估LLM生成GPU内核的基准测试

Han Wang, Jintao Zhang, Kai Jiang, Haoxu Wang, Jianfei Chen, Jun Zhu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出KernelBenchX基准测试,通过176个任务的分类评估,揭示LLM生成GPU内核在正确性和硬件效率上的表现,发现任务结构比方法设计更重要,迭代优化提升正确性但不改善性能,正确性不等于效率,量化问题仍未解决。

Comments minor textual revision; no changes to technical content or results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 90%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 90%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10419 2026-05-12 cs.CL cs.AI 90%

Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets

语言模型能分析数据吗?评估大型语言模型在数据集上的问答性能

Andreas Xenofontos, Pavlos Fafalios

机构 * School of Production Engineering and Management, Technical University of Crete(生产工程与管理学院,希腊克里特技术大学) Institute of Computer Science, Foundation for Research and Technology - Hellas(计算机科学研究所,希腊基础研究与技术研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了大型语言模型在数据集上回答问题的能力,通过两种场景测试其性能,并探讨不同提示策略的影响。

Comments Accepted for publication in CARMA 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 90%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09011 2026-05-12 cs.LG cs.AI 90%

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

对大语言模型中下一个token预测的几何视角:三个新兴阶段

Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

机构 * Department of Engineering and Architecture(工程与建筑系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过几何方法分析大语言模型中预测信息的分布与演变,发现三个几何阶段:Seeding Multiplexing、Hoisting Overriding和Focal Convergence,揭示了模型深度对有效秩的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10853 2026-05-12 cs.CL cs.AI 90%

Bring Your Own Prompts: Use-Case-Specific Bias and Fairness Evaluation for LLMs

自带提示词:面向LLM的用例特定偏见和公平性评估

Dylan Bouchard

机构 * CVS Health(CVS健康公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种决策框架,通过映射LLM用例到相关偏见和公平性指标,考虑任务类型、提示中是否包含受保护属性提及及利益相关者优先级,引入新型指标并开源库langfair进行实践验证。

Comments v6: Updated title; LangFair repository: https://github.com/cvs-health/langfair

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09961 2026-05-12 cs.CR 89%

Towards LLM-Based Analysis of Virtualization-Obfuscated Code through Automated Data Generation

基于LLM的虚拟化混淆代码分析方法通过自动化数据生成

Sangjun An, Hyeyeon Park, Yejin Son, Seoksu Lee, Eun-Sun Cho

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过自动化数据生成方法,针对虚拟化混淆代码的结构分析,提出了一种基于LLM的分析方法,解决了输入规模限制和大规模标注数据需求的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27629 2026-05-12 cs.AI 89%

WaferSAGE: Large Language Model-Powered Wafer Defect Analysis via Synthetic Data Generation and Rubric-Guided Reinforcement Learning

WaferSAGE:基于大语言模型的晶圆缺陷分析:通过合成数据生成与评分引导的强化学习

Ke Xu, Zhongyuan Lian

机构 * Shanghai Huahong Grace Semiconductor Manufacturing Corporation(上海华虹格瑞半导体制造有限公司) Dept. of Automation, School of Information Science and Engineering, East China University of Science and Technology(自动化系,信息科学与工程学院,东华大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出WaferSAGE框架,利用小规模视觉-语言模型进行晶圆缺陷视觉问答。通过合成数据生成和评分引导强化学习,解决半导体制造中的数据稀缺问题,展示小型模型在特定工业视觉理解中的优势。

Comments 16 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09152 2026-05-12 cs.CL q-bio.NC 89%

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Meow-Omni 1:用于猫类行为学的多模态大语言模型

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL

AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02372 2026-05-12 cs.CR cs.AI cs.SE 89%

Scam2Prompt: A Scalable Framework for Auditing Malicious Scam Endpoints in Production LLMs

Scam2Prompt: 一种可扩展的框架,用于审计生产LLM中的恶意诈骗端点

Zhiyang Chen, Tara Saba, Xun Deng, Xujie Si, Fan Long

机构 * OpenAI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Scam2Prompt通过生成开发者风格提示来测试LLM生成恶意代码的能力,发现4.24%的LLM会生成恶意URL,且在2025年发布的七种LLM中,恶意代码生成率高达12.9%-47.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08556 2026-05-12 cs.LG 89%

Can Revealed Preferences Clarify LLM Alignment and Steering?

揭示偏好能否澄清大语言模型对齐与引导?

Khurram Yamin, Jingjing Tang, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出一种经验方法,通过估计LLM在决策任务中的隐含偏好,评估模型是否一致地追求目标,是否能描述其目标,以及提示是否能可靠引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06658 2026-05-12 cs.CL cs.AI 88%

Elite Polarization in European Parliamentary Speeches: a Novel Measurement Approach Using Large Language Models

欧洲议会演讲中的精英极化:一种利用大语言模型进行新型测量的方法

Gennadii Iakovlev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出精英极化指数,利用大语言模型分析议会演讲中的跨党派评价,验证了其在英国、匈牙利和意大利议会数据中的有效性,区分了极化与其他相关概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15977 2026-05-12 cs.CV 88%

Are vision-language models ready to zero-shot replace supervised classification models in agriculture?

视觉语言模型是否准备好在农业中零样本取代监督分类模型?

Earl Ranario, Mason J. Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);foundation model(abstract);prompting(abstract)

AI总结 本文评估了视觉语言模型在农业图像分类中的性能,发现零样本模型在多数任务中表现逊于监督模型,但通过提示策略可提升效果,表明需结合特定接口和评估策略以提升应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03511 2026-05-12 cs.CL cs.AI cs.LG 88%

IntroLM: Introspective Language Models via Prefilling-Time Self-Evaluation

IntroLM:通过预填充阶段自我评估实现反思语言模型

Hossein Hosseini Kasnavieh, Gholamreza Haffari, Chris Leckie, Adel N. Toosi

机构 * DisNet Lab, School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院DisNet实验室) School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Department of Data Science & AI, Monash University, Australia(墨尔本大学数据科学与人工智能系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IntroLM通过在预填充阶段引入自我评估机制,使语言模型能预测自身输出质量,无需外部评估器,提升了生成效率和准确性。

Comments Accepted for publication in Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02623 2026-05-12 cs.CL 88%

The Realignment Problem: When Right becomes Wrong in LLMs

重排问题:当正确变为错误时在大语言模型中

Aakash Sen Sharma, Debdeep Sanyal, Manodeep Ray, Vivek Srivastava, Shirish Karande, Murari Mandal

机构 * Birla AI Labs(比拉人工智能实验室) TCS Research(塔塔咨询服务研究) Kalinga Institute of Industrial Technology, Bhubaneswar(比拉工业技术学院,巴布尔萨瓦尔)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出TRACE框架,通过结构化优化解决LLM在动态标注政策下的重排问题,无需新标注即可提升对齐效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08942 2026-05-12 cs.CL 88%

Decomposing and Steering Functional Metacognition in Large Language Models

分解与引导大型语言模型中的功能元认知

Yanshi Li, Xueru Bai, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee Shanghai China(Shopee上海中国) Shopee Beijing China(Shopee北京中国) Shopee Singapore Singapore(Shopee新加坡新加坡)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究通过分析大型语言模型的内部激活,揭示功能元认知状态的可分解性,并展示如何通过引导激活方向来调控推理行为。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10606 2026-05-12 cs.CL cs.AI 88%

Measuring Embedding Sensitivity to Authorial Style in French: Comparing Literary Texts with Language Model Rewritings

测量法语中嵌入对作者风格的敏感性:比较文学文本与语言模型重写文本

Benjamin Icard, Lila Sainero, Alice Breton, Evangelia Zve, Jean-Gabriel Ganascia

机构 * LIP6, Sorbonne University, CNRS, France(LIP6,索邦大学,国家科学研究中心,法国)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过控制文学数据集量化风格变化对嵌入分散性的影响,发现嵌入可靠捕捉作者风格特征,且重写后仍保持。

Comments To appear in the Proceedings of the 6th International Conference on Natural Language Processing for the Digital Humanities (NLP4DH 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09225 2026-05-12 cs.CR cs.AI cs.LG 88%

The Art of the Jailbreak: Formulating Jailbreak Attacks for LLM Security Beyond Binary Scoring

Jailbreak攻击的艺术:为LLM安全制定超越二进制评分的Jailbreak攻击

Ismail Hossain, Tanzim Ahad, Md Jahangir Alam, Sai Puppala, Syed Bahauddin Alam, Sajedul Talukder

机构 * Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系) School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出大规模组合式Jailbreak数据集、自动化生成方法及OPTIMUS评估器,系统性解决Jailbreak攻击的生成、分类与评估问题,揭示了安全与隐蔽最优区域。

Comments This paper is under review on of top security venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 88%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06969 2026-05-12 cs.CV 88%

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08943 2026-05-12 cs.CL cs.AI cs.LG 88%

Beyond the Singular: Revealing the Value of Multiple Generations in Benchmark Evaluation

超越单极:在基准评估中揭示多代的价值

Wenbo Zhang, Hengrui Cai, Wenyu Chen

机构 * University of California Irvine(加州大学尔湾分校) Meta Central Applied Science(Meta中央应用科学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分层统计模型,通过整合基准特征和LLM随机性,提升基准评估准确性并减少方差,同时定义提示级难度分数并可视化提示难度与语义。

Comments 11 pages, 5 figures, accepted at the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09518 2026-05-12 cs.LG 87%

LLM-Driven Performance-Space Augmentation for Meta-Learning-Based Algorithm Selection

基于大语言模型的性能空间增强用于基于元学习的算法选择

Darren Zhu, Daren Ler

机构 * Department of Statistics and Data Science(统计与数据科学系) National University of Singapore(新加坡国立大学) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出通过大语言模型生成合成回归数据来增强元数据集,以提升元学习在算法选择中的性能,发现均匀采样策略在多个指标上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08533 2026-05-12 cs.AI 87%

Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care

人类与大语言模型对话提高急诊护理的诊断准确性

Burcu Sayin, Ngoc Vo Hong, Ipek Baris Schlicht, Jacopo Staiano, Pasquale Minervini, Sara Allievi, Nicola Susca, Nicola Osti, Alberto Maino, Vito Racanelli, Andrea Passerini

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Department of Medicine, Azienda Sanitaria Universitaria Integrata del Trentino (ASUIT)(特伦托大学整合卫生机构医学部) Center for Medical Sciences (CISMed), University of Trento(特伦托大学医学科学中心) Universitat Politècnica de València(瓦伦西亚理工大学) The University of Edinburgh(爱丁堡大学)

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.AI

AI总结 本研究探讨人类与大语言模型对话在急诊护理中的应用,通过对比基线和AI辅助会话,发现住院医师在复杂病例中的诊断准确性显著提升,且交互式LLM支持显著增强了诊断推理能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏