arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-01 至 2026-06-01 共收录 26 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 26 篇

2605.30604 2026-06-01 cs.CR cs.AI cs.CL cs.IR 92%

An Organization-Scoped LLM Agent Runtime Architecture for Regulated Cybersecurity Operations

面向受监管网络安全运营的组织范围LLM代理运行时架构

George Fatouros, Georgios Makridis, George Kousiouris, John Soldatos, Dimosthenis Kyriazis

机构 * Innov-Acts Ltd(Innov-Acts有限公司) Dept. of Digital Systems University of Piraeus(数字系统系希腊比雷埃克斯大学) Harokopio University(哈罗基奥大学) Dept. of Informatics and Telematics(信息学与电信系)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种组织范围的LLM代理运行时架构,通过类型化安全上下文、运行时核心、专业子代理、受控工具适配层和分层人机回环,实现检索、工具调用、内存、发现、报告和审计的全局强制,并保持模型无关和本地部署。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31287 2026-06-01 cs.CY cs.AI cs.HC 92%

Neither Replacement nor Panacea: Comparing LLM-Based Conversational and Graphical Decision Support in Industrial Tasks

既非替代品也非万能药:比较基于LLM的对话式与图形化决策支持在工业任务中的应用

Roberto Figliè, Simone Caputo, Alan Serrano, Daria Mikhaylova, Tommaso Turchi, Daniele Mazzei

机构 * Department of Computer Science, University of Pisa(比萨大学计算机科学系) Department of Computer Science, Brunel University of London(伦敦布鲁内尔大学计算机科学系)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过混合因子实验,比较基于LLM的对话式界面与仪表盘在工业决策支持中的效果,发现对话界面在低复杂度任务中降低认知负荷和加快完成时间,但优势随任务复杂度增加而消失,且未提高决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 91%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30670 2026-06-01 cs.CY 90%

Reinforcement Learning for Special Education: Aligning LLM Tutors to Diverse Learners through Disability-Adaptive Training

特殊教育的强化学习:通过残疾适应性训练使LLM导师适应多样化学习者

Unggi Lee, Jihoi Na, Yeil Jeong, Haeun Park, Yeonju Jang

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Special-R1框架,通过二维自适应系统提示和基于残疾特征的思维奖励,将强化学习扩展到特殊教育,显著提升对残疾学习者的适配性和帮助性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30628 2026-06-01 cs.CL cs.AI cs.LG 90%

The Architecture of Errors: From Universal Impossibility to Patch-Local LLM Reliability

错误的架构:从普遍不可能到局部补丁的LLM可靠性

Mikhail L. Arbuzov, Lee Mosbacker, Sisong Bei, Ziwei Dong, Dmitri Kalaev, Alexey Shvets

机构 * Independent Researcher(独立研究者) Palo Alto Networks(帕洛阿尔托网络)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过两个命题和一个推论,形式化地论证了通用LLM可靠性在无限域上不可实现,但在操作有界的局部补丁中可通过目录发现和干预覆盖实现可靠性。

Comments 25 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31458 2026-06-01 cs.SE cs.SY eess.SY 90%

Ladder Logic Translation using Large Language Models in Industrial Automation

工业自动化中使用大语言模型的梯形图逻辑翻译

Oluwatosin Ogundare, Promise Ekpo, Nathanial Wiggins

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 针对PLC厂商切换中梯形图翻译的语义不一致问题,提出基于LLM的数学建模与工程化流水线,实现Rockwell到Siemens S7的高语义一致性自动翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31224 2026-06-01 cs.CY cs.AI cs.HC 90%

Comparing LLM-Based Conversational and Graphical Interfaces for Industrial Decision Tasks: An Exploratory Mixed-Methods Study

基于LLM的对话式与图形化界面在工业决策任务中的比较:一项探索性混合方法研究

Roberto Figliè, Simone Caputo, Alan Serrano, Tommaso Turchi, Daniele Mazzei

机构 * Department of Computer Science(计算机科学系) University of Pisa(比萨大学) Department(部门) San Matteo Hospital(圣玛泰奥医院) Brunel University of London(伦敦布鲁内尔大学)

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.AI

AI总结 通过混合方法研究,比较了基于LLM的对话式界面与图形化仪表盘在工业决策任务中的表现,发现对话式界面可减少交互努力,但仪表盘在概览和验证方面仍有价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30889 2026-06-01 physics.chem-ph cs.LG 90%

MLIPilot: LLM-Driven Auto-Research for Machine-Learned Interatomic Potentials

MLIPilot:面向机器学习原子间势的LLM驱动自动研究

Etinosa Osaro, Santosh Adhikari, Stamatia Zavitsanou, Kelsey Parker, Dario Rocca

机构 * PsiQuantum

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MLIPilot框架,利用大语言模型自动提出假设、编辑训练代码并基于物理约束评分卡优化机器学习原子间势,在QM7和Cu EMT数据集上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16922 2026-06-01 cs.AI 90%

ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis

ClimAgent:基于大语言模型的自主开放式气候科学分析智能体

Hao Wang, Jindong Han, Wei Fan, Hao Liu

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出ClimAgent框架,通过统一工具使用环境和严格推理协议,实现端到端建模与分析,在ClimaBench基准上相比原始LLM方案提升40.21%。

Comments It was submitted without the full consent of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28175 2026-06-01 cs.IR 89%

Mixture-of-Experts Knowledge Graph Retrieval-Augmented Generation for Multi-Agent LLM-based Recommendation

基于混合专家知识图谱检索增强生成的多智能体LLM推荐系统

Shijie Wang, Chengyi Liu, Yujuan Ding, Shanru Lin, See-Kiong Ng, Xu Xin, Wenqi Fan

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出MixRAGRec框架,通过混合专家检索、知识偏好对齐和对比学习增强推荐,解决KG-RAG中检索粒度单一、结构信息丢失和端到端学习困难问题。

Comments Accepted by KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30961 2026-06-01 cs.CL 84%

EvoGens: A Population-Based Heuristic Search Framework for Scientific Idea Generation

EvoGens:一种基于种群的启发式搜索框架用于科学思想生成

Xu Li, Hanzhe Tu, Xinyi Li, Kuncheng Zhao, Xun Han, Zhonghui Liu

机构 * Southwest Petroleum University(西南石油大学) Sichuan Police College(四川警察学院)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有LLM方法生成科学思想时语义趋同、多样性和新颖性不足的问题,提出EvoGens框架,通过进化搜索(变异、交叉、选择)增强思想探索,显著提升新颖性和多样性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30529 2026-06-01 cs.CL cs.AI cs.LG 83%

Generalistic or Specific Embeddings, Which is Better? An Empirical Study on Search for Clinical Coding in Non-English Languages

通用嵌入还是特定嵌入,哪个更好?非英语语言临床编码搜索的实证研究

David Rey-Blanco, Roberto Cruz

机构 * TietAI

专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过使用大型生成语言模型生成的合成数据微调双语编码器,构建两阶段检索器,解决了非英语语言临床编码检索中召回率下降的问题,并在多语言基准上取得了优于BioBERT-ST的性能。

Comments 24 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31099 2026-06-01 cs.CL cs.AI 82%

KnowledgeGain: Evaluating and Optimizing Science News Generation for Reader Learning

KnowledgeGain: 评估和优化面向读者学习的科学新闻生成

Dominik Soós, Meng Jiang, Jian Wu

机构 * Old Dominion University(旧 Dominion 大学) University of Notre Dame(诺特大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 提出KnowledgeGain指标,通过测量读者知识增益来评估科学新闻质量,并利用LLM模拟器优化生成,提升读者学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30646 2026-06-01 cs.CL cs.AI 82%

Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs

同一患者,不同措辞,不同诊断?评估临床大语言模型中的语义稳定性

Mahdi Alkaeed, Adnan Qayyum, Nabeel Abo Kashreef, Muhammad Bilal, Junaid Qadir

机构 * Department of Computer Science and Engineering, College of Engineering, Qatar University(卡塔尔大学计算机科学与工程系) College of Science and Engineering, Hamad Bin Khalifa University (HBKU)(哈马德·本·卡伊夫大学(HBKU)理学院) Primary Health Care Corporation (PHCC)(初级卫生保健公司) Birmingham City University(伯明翰城市大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对临床大语言模型对语义等价但措辞不同的提示敏感的问题,提出基于自然语言推理的语义验证框架和三个量化指标,评估16个开源通用与医学模型,发现领域专业化并不一致地提升或降低鲁棒性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16215 2026-06-01 cs.AI cs.CL 82%

Fully Open Meditron: An Auditable Pipeline for Clinical LLMs

完全开放的Meditron:临床大语言模型的可审计流水线

Xavier Theimer-Lienhard, Mushtaha El-Amin, Fay Elhassan, Sahaj Vaidya, Victor Cartier-Negadi, David Sasu, Lars Klein, Mary-Anne Hartley

机构 * EPFL(苏黎世联邦理工学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个完全开放的临床大语言模型构建流水线Fully Open Meditron,通过可审计的数据集、可复现的训练框架和对齐评估协议,在不牺牲可审计性和可复现性的前提下实现了领域最新性能。

Comments Preprint. 31 pages, 10 figures. Code, models, and data: https://github.com/EPFLiGHT/FullyOpenMeditron

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13433 2026-06-01 cs.CL cs.LG 81%

Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models

谁背书了它?测量语言模型中跨专业水平的权威偏差

Priyanka Mary Mammen, Emil Joswin, Shankar Venkitachalam

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) Independent Research(独立研究)

专题命中 领域大模型 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型在推理任务中是否因背书来源的专业水平而产生系统性偏差,发现模型对高权威来源的错误背书更易受影响,导致准确率下降和错误答案置信度增加,但可通过机制干预减轻偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29146 2026-06-01 cs.CL cs.AI 73%

SafeRx-Agent: A Knowledge-Grounded Multi-Agent Framework for Safe and Explainable Medication Recommendation

SafeRx-Agent: 基于知识的多智能体框架用于安全且可解释的药物推荐

Xinyu Wang, Hanwei Wu, Zhenghan Tai, Sicheng Lyu, Qincheng Lu, Ziyu Zhao, Jijun Chi, Jingrui Tian, Xiao-Wen Chang, Ziyang Song

机构 * McGill University(麦吉尔大学) McMaster University(麦马斯特大学) University of Toronto(多伦多大学) Ohio University(俄亥俄大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出SafeRx-Agent,一种基于知识的多智能体框架,通过患者上下文、外部临床知识和安全验证来推荐可追溯的药物集合,在MIMIC-III和MIMIC-IV数据集上提高了细粒度药物预测准确性,同时控制了药物相互作用、禁忌症和药物集合大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19806 2026-06-01 cs.CL cs.AI 73%

Chunking German Legal Code

德国法律文本的分块处理

Max Prior, Natalia Milanova, Andreas Schultz

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究针对德国成文法,以德国民法典为基准语料库,比较多种分块策略在检索增强生成中的性能,发现基于法律固有结构(如章节、小节)的分块方法在召回率和计算效率上优于语义增强方法。

Comments Accepted at the Eigth Workshop on Automated Semantic Analysis of Information in Legal Texts co-located with the 21th International Conference on Artificial Intelligence and Law (ICAIL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17101 2026-06-01 cs.CL cs.AI 73%

SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical Reasoning

SEMA-RAG: 面向医学推理的自演化多智能体检索增强生成框架

Yongfeng Huang, Ruiying Chen, James Cheng

机构 * CSE, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Wuhan University of Technology(武汉理工大学)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对医学问答中单轮静态检索与临床推理多阶段过程不匹配的问题,提出SEMA-RAG框架,通过任务解耦和动态多轮探索,由三个专业智能体分别负责临床解释、自演化检索和证据裁决,在多个基准上平均提升准确率6.46个百分点。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31512 2026-06-01 cs.CL 70%

Reliable Multilingual Orthopedic Decision Support from Clinical Narratives: Language-Aware Adaptation and Verification-Guided Deferral

来自临床叙述的可靠多语言骨科决策支持:语言感知适应与验证引导的延迟

Danish Ali, Li Xiaojian, Sundas Iqbal, Farrukh Zaidi

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Software, Nanjing University of Information Science and Technology (NUIST)(南京信息工程大学软件学院) Department of Orthopedic, Bahawal Victoria Hospital(巴哈瓦尔维多利亚医院骨科部门)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对低资源医疗环境中的多语言骨科决策支持,提出结合语言感知适配编码器IndicBERT-HPA和确定性选择性验证层的可靠性框架,在英语、印地语和旁遮普语临床文本分类中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30039 2026-06-01 cs.AI 70%

Domain-Specific Data Synthesis for LLMs via Minimal Sufficient Representation Learning

基于最小充分表示学习的大语言模型领域特定数据合成

Tong Ye, Hang Yu, Tengfei Ma, Xuhong Zhang, Jianguo Li, Peng Di, Peiyu Liu, Jianwei Yin, Wenhai Wang

机构 * vivo AI Lab(vivo人工智能实验室) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DOMINO框架,通过对比解耦学习最小充分领域表示,指导生成领域对齐的合成数据,在隐式领域定义下提升微调性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12060 2026-06-01 cs.CR cs.AI cs.CY 70%

Organizational Adaptation to Generative AI in Cybersecurity

组织对生成式人工智能在网络安全中的适应

Christopher Nott

机构 * Independent Researcher, United States(美国独立研究者)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究通过分析2022至2025年的25项研究,采用定性方法探讨组织如何通过修改框架和混合操作流程适应生成式AI,发现成熟基础设施、监管压力和人力资本投资是成功的关键,同时指出攻防能力不平衡等挑战。

Comments 38 pages, 1 table, 1 figure Revised title, abstract, and formatting for journal submission, corrected heading numbers, no substantive changes in content

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01959 2026-06-01 cs.HC 67%

Boosting metacognition in entangled human-AI interaction to navigate cognitive-behavioral drift

在纠缠的人机交互中提升元认知以应对认知行为漂移

Ezequiel Lopez-Lopez, Christoph M. Abels, Philipp Lorenz-Spreen, Stephan Lewandowsky, Stefan M. Herzog

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 提出一个基于人类认知不变特征和元认知的框架,通过识别纠缠、漂移和元认知干预点,解决AI对话代理引发的认知行为漂移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30984 2026-06-01 cs.CV cs.AI cs.CL 62%

Generating Reports or Repeating Templates? Measuring and Mitigating Template Collapse in 3D CT Report Generation

生成报告还是重复模板?测量和缓解三维CT报告生成中的模板崩溃

Tom Maye-Lasserre, Yitong Li, Bailiang Jian, Morteza Ghahremani, Benedikt Wiestler, Christian Wachinger

机构 * Technical University of Munich (TUM)(慕尼黑技术大学) TUM Hospital(TUM医院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 领域大模型 :language model(abstract);分类 cs.CL、cs.AI

AI总结 针对三维CT报告生成中模型输出多样性低、病理检测能力差的模板崩溃问题,提出解耦框架CLarGen,通过分离临床检测与语言合成,显著提升临床准确性并保持报告流畅性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 57%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20941 2026-06-01 cs.CV 50%

Decoding the Surgical Scene: A Scoping Review of Scene Graphs in Surgery

解码手术场景:手术中场景图的范围综述

Angelo Henriques, Korab Hoxha, Daniel Zapp, Peter C. Issa, Nassir Navab, M. Ali Nasseri

机构 * School of Computation, Information and Technology, Technical University of Munich(计算信息学院,慕尼黑技术大学) Klinik und Poliklinik für Augenheilkunde, TUM University Hospital(眼科诊所,TUM大学医院) Computer Aided Medical Procedures, Technical University of Munich(医学辅助程序,慕尼黑技术大学) Department of Biomedical Engineering, University of Alberta(生物医学工程系,阿尔伯塔大学)

专题命中 领域大模型 :foundation model(abstract)

AI总结 本文通过PRISMA-ScR指导的范围综述,系统梳理了手术中场景图(SG)的研究现状,分析了52项研究,揭示了从图神经网络向基础模型和生成式AI的方法论转变,并提出了“验证三位一体”评估框架以弥合临床转化差距。

Comments Submitted and accepted to Medical Image Analysis (DOI: 10.1016/j.media.2026.104083). An interactive version of the summary tables is available at: osf.io/fruq8

Journal ref Medical Image Analysis (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏