arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12554 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12554 篇

2603.00029 2026-06-03 cs.CL 88%

Embracing Anisotropy: Turning Massive Activations into Interpretable Control Knobs for Large Language Models

拥抱各向异性:将大规模激活转化为大型语言模型的可解释控制旋钮

Youngji Roh, Hyunjin Cho, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种基于幅度的无训练方法识别领域关键维度,将其作为可解释的语义检测器,并通过仅对这些维度进行激活引导,在领域适应和越狱场景中优于传统全维度引导方法。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17670 2026-05-29 cs.PL cs.AI 88%

Grammar-Aware Literate Generative Mathematical Programming with Compiler-in-the-Loop

语法感知的 literate 生成式数学编程与编译器在环

Roberto Rossi, Steven D. Prestwich

机构 * Business School, University of Edinburgh(爱丁堡大学商学院) Insight Centre for Data Analytics, University College Cork(科克大学数据分析研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出 SyntAGM 系统,通过迭代生成-编译-评估-修正循环,利用编译器反馈和 LLM 对齐判断,生成可读的代数建模语言优化模型,实现成本与质量的更优权衡。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28338 2026-05-28 cs.AI 88%

SafeMed-R1: Clinician-Audited Safety and Ethics Alignment for Medical Large Language Models

SafeMed-R1: 临床医生审计的安全与伦理对齐用于医疗大语言模型

Chao Ding, Mouxiao Bian, Tianbin Li, Minjia Yuan, Yidong Jiang, Yankai Jiang, Jinru Ding, Jiayuan Chen, Zhuangzhi Gao, Pengcheng Chen, Zhao He, Rongzhao Zhang, Meiling Liu, Luyi Jiang, Jie Xu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Joint Laboratory of Biomedical Artificial Intelligence(生物医学人工智能联合实验室) Shanghai Institute of Infectious Disease and Biosecurity(上海传染病与生物安全研究院) Shanghai Health Development Research Center (Shanghai Medical Information Center)(上海健康发展战略研究中心(上海医疗信息中心)) University of Washington(华盛顿大学) Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科与视觉科学系) Liverpool Centre for Cardiovascular Science, University of Liverpool(利物浦大学心血管科学中心) School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出SafeMed-R1模型,通过可追溯的临床信任信号管道和红队压力测试实现安全与伦理对齐,在临床基准上达到79.6%的宏平均准确率,并将不安全输出减少约3-5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26567 2026-05-27 cs.AI 88%

MedGuideX: Internalizing Decision Logic from Executable Guidelines into Large Language Models for Clinical Reasoning

MedGuideX: 将可执行指南中的决策逻辑内化到大型语言模型中以进行临床推理

Yuhao Shen, Lang Cao, Simo Du, Yuqing Wang, Juexiao Zhou, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Albert Einstein College of Medicine(爱因斯坦医学院)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract);post-training(abstract)

AI总结 提出一种将临床实践指南转化为可执行决策逻辑并生成事实与反事实问答数据的训练流程,通过微调医学大语言模型得到MedGuideX,在四个临床推理基准上平均准确率相对提升10.28%,且医生评估显示其推理步骤更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18907 2026-05-27 cs.LG cs.CV cs.CY 88%

DeepInterestGR: Mining Deep Multi-Interest Using Multi-Modal LLMs for Generative Recommendation

DeepInterestGR: 利用多模态大语言模型挖掘深度多兴趣用于生成式推荐

Yangchen Zeng, Zhenyu Yu, Zhiyuan Hu, Wenxin Zhang, Jinze Wang, Rongfeng Guo

机构 * Southeast University(东南大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 提出DeepInterestGR框架,通过多LLM兴趣挖掘、奖励标记深度兴趣和兴趣增强物品离散化,解决生成式推荐中的浅层兴趣问题,在三个Amazon数据集上显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22971 2026-05-25 cs.CL cs.HC 88%

Can AI Guess What You Know? Performance Comparison of Large Language Models for Human Domain Knowledge Estimation From Communication Logs

AI 能猜出你知道什么吗?从通信日志中估计人类领域知识的大型语言模型性能比较

Ko Watanabe, Shoya Ishimaru

机构 * Osaka Metropolitan University(大阪 metropolitan 大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过分析 Slack 日志,比较了七种大型语言模型在零样本设置下估计用户领域知识的能力,发现 Gemini 2.5 Flash 误差最低(MAE 21.13%),且估计精度与消息量弱相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21076 2026-05-21 cs.CL 88%

GradeLegal: Automated Grading for German Legal Cases

GradeLegal: 自动化评分德国法律案例

Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

机构 * University of Passau(帕绍大学) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型能否用于自动化评分德国刑事和公法案例解决方案,通过系统评估27个专有和开源LLM,发现基于样本解决方案和评分标准的提示策略能有效模拟专家评分,尤其在公法领域达到0.91的QWK值,而在刑事法律领域仅为0.60,表明刑事法律评分任务更难。此外,集成方法能进一步提高评分一致性,并为更强的闭源单模型提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17228 2026-05-19 cs.CL 88%

Artificial Intolerance: Stigmatizing Language in Clinical Documentation Skews Large Language Model Decision-Making

人工不耐受:临床文档中的污名化语言扭曲大型语言模型决策

Jen-tse Huang, Didi Zhou, Faith Kamau, Amy Oh, Anne R. Links, Mark Dredze, Mary Catherine Beach, Somnath Saha

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨了大型语言模型在处理包含污名化语言的临床文档时是否继承并传播人类偏见,发现所有模型在决策上都存在显著偏见,且对语言框架敏感,需加强算法防护以确保公平性和鲁棒性。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03761 2026-05-12 cs.CR cs.AI 88%

You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models

你已被LaTeXpOsEd:利用大语言模型对预印本档案中的信息泄露进行系统分析

Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi

机构 * Eötvös Loránd University(埃奥瓦大学) University of Oslo(奥斯陆大学) Sztaki Technology Innovation Institute(技术创新研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过分析10万份arXiv提交的1.2TB源数据,揭示了预印本档案中存在大量敏感信息泄露问题,提出LaTeXpOsEd框架结合模式匹配、逻辑过滤和大语言模型检测隐藏披露,揭露了PII泄露、GPS标记文件等风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07051 2026-05-11 cs.CL 88%

NSMQ Riddles: A Benchmark of Scientific and Mathematical Riddles for Quizzing Large Language Models

NSMQ谜题:一个科学和数学谜题的基准,用于评估大型语言模型

George Boateng, Naafi Ibrahim, Samuel John, Philemon Badu, Patrick Agyeman-Budu, Jonathan Mensah, Kevin Yeboah, William Edor, Andrew Mensa-Onumah, Nana Yeboah, Victor Wumbor-Apin Kumbol

机构 * ETH Zurich(苏黎世联邦理工学院) Charité - Universitätsmedizin Berlin(柏林夏里特医学院) Kwame AI Inc.(夸梅人工智能公司) Ashesi University(阿什西大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出NSMQ谜题基准,基于加纳国家科学与数学竞赛的谜题,评估大型语言模型的科学和数学推理能力,发现即使是最先进的模型也难以应对。

Comments 15 pages. Accepted at the 27th International Conference on Artificial Intelligence in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27470 2026-05-01 cs.CL 88%

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

HealthBench Professional: 评估大型语言模型在真实临床对话中的表现

Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharman, Chi Tong, Kavin Karthik, Arnav Dugar, Akshay Jagadeesh, Khaled Saab, Johannes Heidecke, Ashley Alexander, Nate Gross, Karan Singhal

机构 * OpenAI

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出HealthBench Professional基准,用于评估大型语言模型在临床实践中真实任务的表现,包含三个核心用例,通过医师评分系统评估模型性能,提供医疗AI领域跟踪前沿模型进展的测量工具。

Comments Data link in paper; Blog: https://openai.com/index/making-chatgpt-better-for-clinicians/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25639 2026-04-29 cs.CY cs.AI 88%

Large language models eroding science understanding: an experimental study

大语言模型侵蚀科学理解:一项实验研究

Harry Collins, Hartmut Grote, Paul Newbury, Patrick Sutton, Simon Thorne

机构 * Springer Nature

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究大语言模型是否能可靠回答科学问题,并展示其易受边缘科学材料影响。通过修改模型优先考虑特定边缘论文,发现其回答与专家和标准模型相比存在矛盾,凸显模型易受操控的风险。

Comments Under review in AI and Ethics

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13021 2026-04-28 cs.CR cs.AI 88%

xOffense: An Autonomous Multi-Agent Framework for Penetration Testing with Domain-Adapted Large Language Models

xOffense:一种基于领域适应大语言模型的自主多智能体渗透测试框架

Phung Duc Luong, Le Tran Gia Bao, Nguyen Vu Khai Tam, Dong Huu Nguyen Khoa, Nguyen Huu Quyen, Van-Hau Pham, Phan The Duy

机构 * Information Security Lab, University of Information Technology(信息安全实验室,信息科技大学) Vietnam National University Ho Chi Minh City(越南胡志明市国家大学)

专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出xOffense框架,利用领域适应的大语言模型实现自动化渗透测试,通过多智能体协作提升效率,实验表明其在多个基准测试中表现优异。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23347 2026-04-28 cs.CL 88%

Evaluating Large Language Models on Computer Science University Exams in Data Structures

评估大型语言模型在数据结构大学考试中的表现

Edan Gabay, Yael Maoz, Jonathan Stahl, Naama Maoz, Abdo Amer, Orr Eilat, Hanoch Levy, Michal Kleinbort, Amir Rubinstein, Adi Haviv

机构 * Blavatnik School of Computer Science and AI(Blavatnik计算机科学与人工智能学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文评估了大型语言模型在数据结构考试中的表现,引入了一个包含特拉维夫大学考试题目的新基准数据集,测试了GPT 4o、Claude 3.5、Mathstral 7B和LLaMA 3 8B等模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00081 2026-04-28 cs.CR cs.AI 88%

Enabling Transparent Cyber Threat Intelligence Combining Large Language Models and Domain Ontologies

结合大语言模型和领域本体的透明网络威胁情报赋能

Luca Cotti, Anisa Rula, Devis Bianchini, Federico Cerutti

机构 * Department of Information Engineering, University of Brescia, Italy(布雷西亚大学信息工程系) School of Computer Science and Informatics, Cardiff University, United Kingdom(卡迪夫大学计算机科学与信息学学院) Department of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出结合本体驱动的结构化输出与大语言模型,构建提升网络安全日志信息提取准确性和可解释性的AI代理,通过领域本体和SHACL约束提高语义有效性。

Comments 14 pages, 3 figures, 6 tables, presented at the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), October 25-30, 2025, Bologna, Italy

Journal ref Joint Proceedings of the 1st workshops on eXplainable AI, Knowledge Representation and Knowledge Graphs (XAI-KRKG) and User-Centered Explanations in XAI Workshop (UCEX-XAI), 2025, CEUR Workshop proceedings, volume 4172, pages 95-108

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21950 2026-04-20 cs.CL 88%

MEDSYN: Benchmarking Multi-EviDence SYNthesis in Complex Clinical Cases for Multimodal Large Language Models

MEDSYN:多证据合成在复杂临床病例中的基准测试用于多模态大语言模型

Boqi Chen, Xudong Liu, Jiachuan Peng, Marianne Frey-Marti, Bang Zheng, Kyle Lam, Lin Li, Jianing Qiu

机构 * ETH Zurich(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Amazon(亚马逊) University of Oxford(牛津大学) University of Bern(伯尔尼大学) Imperial College London(伦敦帝国理工学院) Peking University(北京大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MEDSYN是一个多语言、多模态的复杂临床病例基准测试,用于评估多模态大语言模型在差分诊断和最终诊断中的表现,揭示模型在异质临床证据合成中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10316 2026-04-14 cs.CL 88%

Comparative Analysis of Large Language Models in Healthcare

医疗领域大型语言模型的比较分析

Subin Santhosh, Farwa Abbas, Hussain Ahmad, Claudia Szabo

机构 * Adelaide University(阿德莱德大学) South Australian Health and Medical Research Institute(南澳大利亚健康与医学研究所)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过评估多个医疗任务,比较了ChatDoctor等领域模型与Grok等通用模型的性能,发现领域模型在医疗文本生成中更准确,而通用模型在问答任务中表现更优,强调了任务特定评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10233 2026-04-14 cs.CV cs.AI 88%

Adapting 2D Multi-Modal Large Language Model for 3D CT Image Analysis

将2D多模态大语言模型适应于3DCT图像分析

Yang Yu, Dunyuan Xu, Yaoqian Li, Xiaomeng Li, Jinpeng Li, Pheng-Ann Heng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(香港科技大学电子及计算机工程学系) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程学系) Institute of Medical Intelligence and XR, The Chinese University of Hong Kong(香港中文大学医学智能与扩展现实研究所) Center for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出将2D多模态大语言模型适应于3DCT图像分析,设计Text-Guided Hierarchical MoE框架,采用两阶段训练策略提升医学报告生成和视觉问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06101 2026-04-03 cs.CL 88%

Detecting Reference Errors in Scientific Literature with Large Language Models

利用大型语言模型检测科学文献中的参考错误

Tianmai M. Zhang, Neil F. Abernethy

机构 * University of Washington(华盛顿大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在检测科学论文中引用错误的能力,通过专家标注的数据集验证了模型在有限上下文和无微调情况下的检测效果,为人工智能辅助科学写作提供了新思路。

Journal ref AMIA Annu Symp Proc. 2025 May 22;2024:1549-1556. PMID: 41726520; PMCID: PMC12919499

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26434 2026-03-30 cs.CL 88%

Automating Clinical Information Retrieval from Finnish Electronic Health Records Using Large Language Models

使用大语言模型自动化从芬兰电子健康记录中检索临床信息

Mikko Saukkoriipi, Nicole Hernandez, Jaakko Sahlsten, Kimmo Kaski, Otso Arponen

机构 * Aalto University School of Science(阿尔托大学理学院) Tampere University(坦佩雷大学) Tampere University Hospital(坦佩雷大学医院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种本地部署的临床上下文问答框架,通过EHR直接回答临床问题,验证了开源大语言模型在无外部数据传输情况下检索患者特定信息的准确性与可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23543 2026-03-26 physics.soc-ph cs.AI 88%

Large Language Models and Scientific Discourse: Where's the Intelligence?

大语言模型与科学 discourse:智能在哪里?

Harry Collins, Simon Thorne

机构 * Institute of Education, UCL(伦敦大学教育学院) School of Technologies, Cardiff Metropolitan University(卡迪夫 metropolitan 大学技术学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨大语言模型如何通过与人类知识构建方式的比较,分析科学知识的形成过程及其与LLM的差异,指出LLM在处理早期科学知识时的局限性,并通过蒙提·霍尔问题和 overshadowing 现象说明人类在知识构建中的主导作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22642 2026-03-25 cs.CL 88%

Multi-Method Validation of Large Language Model Medical Translation Across High- and Low-Resource Languages

多方法验证大语言模型在高资源和低资源语言上的医学翻译

Chukwuebuka Anyaegbuna, Eduardo Juan Perez Guerrero, Jerry Liu, Timothy Keyes, April Liang, Natasha Steele, Stephen Ma, Jonathan Chen, Kevin Schulman

机构 * Porter Drive, Palo Alto, CA 94304(3180 Porter Drive, Palo Alto, CA 94304) PhD(哲学博士) MD, MPH(医学博士,公共卫生硕士) MD, PhD(医学博士,哲学博士) MD, MBA(医学博士,工商管理硕士)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究评估四种前沿大语言模型在不同资源语言中翻译医学文档的性能,发现高资源与低资源语言翻译效果无显著差异,且跨模型一致性高,表明大语言模型在医学翻译中能保持语义。

Comments 32 references, 5 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04188 2026-03-25 cs.SE cs.AI 88%

Automated Microservice Pattern Instance Detection Using Infrastructure-as-Code Artifacts and Large Language Models

利用基础设施即代码 artifacts 和大语言模型自动化微服务模式实例检测

Carlos Eduardo Duarte

机构 * FEUP, INESC TEC(FEUP,INESC TEC) Utah Valley University(犹他山谷大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出利用IaC artifacts和大语言模型自动化检测微服务模式实例,通过实验验证该方法在GitHub项目中的有效性,降低检测成本并扩大可检测模式范围。

Comments ICSA 2025 - International Conference on Software Architecture. 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10985 2026-03-23 cs.CL 88%

Taking a Deep Breath: Enhancing Language Modeling of Large Language Models with Sentinel Tokens

深呼吸:通过哨兵令牌增强大语言模型的语言建模

Weiyao Luo, Suncong Zheng, Heming Xia, Weikang Wang, Yan Lei, Tianyu Liu, Shuang Chen, Zhifang Sui

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,北京大学计算机学院) School of Software & Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Hunyuan(腾讯文言) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Alibaba Group(阿里巴巴集团)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出通过插入哨兵令牌使大语言模型能够总结离散文本块信息,提升长文本建模能力,实验验证了方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19303 2026-03-23 cs.DL cs.AI 88%

Agreement Between Large Language Models, Human Reviewers, and Authors in Evaluating STROBE Checklists for Observational Studies in Rheumatology

大型语言模型、人类评审员和作者在评估风湿病学观察性研究的STROBE检查表中的一致性

Emre Bilgin, Ebru Ozturk, Meera Shah, Lisa Traboco, Rebecca Everitt, Ai Lyn Tan, Marwan Bukhari, Vincenzo Venerito, Latika Gupta

机构 * Sakarya University, Faculty of Medicine, Department of Internal Medicine, Division of Rheumatology(萨克森大学医学院内科学系风湿病科) St Luke’s Medical Center (Global City), Philippines(菲律宾St Luke’s医疗中心(全球城)) New Cross Hospital, The Royal Wolverhampton Trust, Wolverhampton, United Kingdom(英国伍尔弗汉普顿皇家信托新交叉医院) Lancaster University Medical School, Lancaster University, Lancaster, United Kingdom(英国兰卡斯特大学医学学院,兰卡斯特大学,兰卡斯特,英国) Department of Rheumatology, Royal Lancaster Infirmary, Lancaster, United Kingdom(英国兰卡斯特皇家医院风湿病科,兰卡斯特,英国) Department of Rheumatology, Royal Wolverhampton Hospitals NHS Trust, Wolverhampton, UK(英国伍尔弗汉普顿皇家医院 NHS信托风湿病科,伍尔弗汉普顿,英国)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究比较了大型语言模型、人类评审员和作者在评估风湿病学观察性研究的STROBE检查表中的一致性,发现模型在基本格式上与人类评审员一致,但在复杂方法学问题上表现较差。

Comments 19 pages, 2 figures, 2 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14265 2026-03-17 cs.CL cs.MA 88%

MedPriv-Bench: Benchmarking the Privacy-Utility Trade-off of Large Language Models in Medical Open-End Question Answering

MedPriv-Bench:医疗开放问答中大语言模型隐私-效用权衡的基准测试

Shaowei Guan, Yu Zhai, Hin Chi Kwok, Jiawei Du, Xinyu Feng, Jing Li, Harry Qin, Vivian Hui

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MedPriv-Bench首次提出医疗开放问答中评估隐私保护与临床效用的基准,通过多代理人机协同流程生成敏感医疗情境,利用预训练RoBERTa-NLI模型量化数据泄露,揭示大语言模型在隐私与效用间的普遍权衡。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05772 2026-03-16 cs.CR cs.AI 88%

Depth Charge: Jailbreak Large Language Models from Deep Safety Attention Heads

深度安全攻击:从深度安全注意力头中劫持大语言模型

Jinman Wu, Yi Xie, Shiqian Zhao, Xiaofeng Chen

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出SAHA攻击框架,通过深入分析注意力头的漏洞,提升对抗样本生成的鲁棒性,实验显示其在ASR指标上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI 88%

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10729 2026-03-11 cs.CV cs.AI 88%

EgoCross: Benchmarking Multimodal Large Language Models for Cross-Domain Egocentric Video Question Answering

EgoCross:多模态大语言模型跨领域眼动视频问答基准测试

Yanjun Li, Yuqian Fu, Tianwen Qian, Qi'ao Xu, Silong Dai, Danda Pani Paudel, Luc Van Gool, Xiaoling Wang

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 EgoCross提出一个跨领域眼动视频问答基准,评估多模态大语言模型在不同领域中的泛化能力,揭示现有模型在非日常领域任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07572 2026-03-10 cs.LG 88%

TS-MLLM: A Multi-Modal Large Language Model-based Framework for Industrial Time-Series Big Data Analysis

TS-MLLM:一种基于多模态大语言模型的工业时间序列大数据分析框架

Haiteng Wang, Yikang Li, Yunfei Zhu, Jingheng Yan, Lei Ren, Laurence T. Yang

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) School of Software, Beihang University(北京航空航天大学软件学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer and Artificial Intelligence, Zhengzhou University(郑州大学计算机与人工智能学院) Department of Computer Science, St. Francis Xavier University(圣弗朗西斯科大学计算机科学系)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 TS-MLLM通过多模态大语言模型联合建模时序信号、频域图像和文本知识,提升工业时间序列预测的鲁棒性、效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏