arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 17 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 17 篇

2605.20591 2026-05-21 cs.CL cs.CY 92%

Do No Harm? Hallucination and Actor-Level Abuse in Web-Deployed Medical Large Language Models

有害吗?网络部署医疗大语言模型中的幻觉与作用层面滥用

Sunday Oyinlola Ogundoyin, Muhammad Ikram, Rahat Masood

机构 * The University of New South Wales, Sydney, Australia(新南威尔士大学,悉尼,澳大利亚)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了网络部署的医疗大语言模型中的幻觉和作用层面滥用问题,通过评估6233个MedGPT和10个开源LLM,发现25-30%的MedGPT事实准确性较低,33.6-54.3%违反操作阈值,57.06%的Action-enabled模型缺乏充分的隐私披露,揭示了系统性漏洞,强调了多指标评估和更强的安全保障的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20734 2026-05-21 cs.CR cs.AI 92%

An Application-Layer Multi-Modal Covert-Channel Reference Monitor for LLM Agent Egress

面向LLM代理出站的应用层多模态隐通道参考监控器应用

Alfredo Metere

机构 * Enclawed, LLC(Enclawed公司)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种应用层多模态隐通道参考监控器,用于检测和防止LLM代理在消息中泄露数据,通过多阶段文本管道、媒体加密器和残余容量测量来实现对隐通道的监控和管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00086 2026-05-21 cs.CL cs.AI cs.SD eess.AS 91%

Iterative LLM-based improvement for French Clinical Interview Transcription and Speaker Diarization

基于迭代的LLM改进法用于法语临床访谈的转录与说话人识别

Ambre Marie, Thomas Bertin, Guillaume Dardenne, Gwenolé Quellec

机构 * LaTIM UMR 1101 INSERM(INSERM拉蒂姆UMR1101) University of Western Brittany(西布列塔尼大学) University of Rouen Normandy(诺曼底大学)

专题命中 领域大模型 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种多轮LLM后处理架构,通过交替进行说话人识别和词识别流程,提高法语医疗对话的转录准确性和说话人归属,通过两个法语临床数据集的消融研究验证了四种设计选择的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21076 2026-05-21 cs.CL 88%

GradeLegal: Automated Grading for German Legal Cases

GradeLegal: 自动化评分德国法律案例

Abdullah Al Zubaer, Lorenz Wendlinger, Simon Alexander Nonn, Michael Granitzer, Jelena Mitrovic

机构 * University of Passau(帕绍大学) Deggendorf Institute of Technology(德格多夫技术学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究探讨了大型语言模型能否用于自动化评分德国刑事和公法案例解决方案,通过系统评估27个专有和开源LLM,发现基于样本解决方案和评分标准的提示策略能有效模拟专家评分,尤其在公法领域达到0.91的QWK值,而在刑事法律领域仅为0.60,表明刑事法律评分任务更难。此外,集成方法能进一步提高评分一致性,并为更强的闭源单模型提供替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22693 2026-05-21 q-fin.ST cs.AI cs.CL 88%

Bridging Language Models and Financial Analysis

连接语言模型与金融分析

Alejandro Lopez-Lira, Jihoon Kwon, Sangwoon Yoon, Jy-yong Sohn, Chanyeol Choi

机构 * University of Florida(佛罗里达大学) Ministry of Justice, Republic of Korea(韩国司法部) Yonsei University(延世大学) LinqAlpha

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文旨在通过概述最近的语言模型研究进展,探讨其在金融领域中的应用潜力,填补语言模型在金融行业中的实际应用与研究进展之间的差距。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20469 2026-05-21 cs.CV 85%

HalluCXR: Benchmarking and Mitigating Hallucinations in Medical Vision-Language Models for Chest Radiograph Interpretation

HalluCXR: 评估和缓解医疗视觉-语言模型在胸部X光解读中的幻觉

Haoyu Wang, Zitong Li

机构 * Department of Biostatistics & Health Informatics, Institute of Psychiatry, Psychology & Neuroscience, King’s College London(生物统计学与健康信息学系,精神病学、心理学与神经科学研究所,伦敦国王学院)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出HalluCXR基准,评估六种不同架构的视觉-语言模型在856例分层MIMIC-CXR胸部X光图像上的表现,发现61.9%-82.3%的输出存在幻觉,其中80.2%存在临床危险错误,通过引入幻觉分类学、检测管道和模型集成方法,提出了缓解幻觉的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09724 2026-05-21 cs.SE cs.AI 84%

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

InteractScience: 交互式科学演示代码生成的程序化与视觉导向评估

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan

机构 * State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室,南京大学,中国南京) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,中国上海) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学,美国匹兹堡)

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InteractScience基准,用于评估大语言模型在生成交互式科学演示代码时结合科学知识与前端交互能力的综合表现,通过程序化测试和视觉测试相结合的方法,评估30种开源和闭源LLM的表现,揭示了在整合领域知识与交互前端编码方面的持续不足。

Comments 27 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10673 2026-05-21 cs.IR 80%

Breaking User-Centric Agency: A Tri-Party Framework for Agent-Based Recommendation

打破以用户为中心的代理:一个三方框架用于基于代理的推荐

Yaxin Gong, Chongming Gao, Chenxiao Fan, Haoyan Liu, Wenjie Wang, Jianshan Sun, Yangyang Li, Fuli Feng, Xiangnan He

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一个三方框架TriRec,用于基于代理的推荐系统,旨在协调用户效用、物品曝光和平台层面的公平性,从而提高推荐系统的准确性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21180 2026-05-21 cs.LG cs.SE 77%

Domain-Adaptable Reinforcement Learning for Code Generation with Dense Rewards

用于密集奖励的领域可适应强化学习代码生成

Erfan Aghadavoodi Jolfaei, Daniel Maninger, Abhinav Anand, Mert Tiftikci, Mira Mezini

机构 * Hessian Center for Artificial Intelligence (hessian.AI)(海斯曼人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出了一种领域可适应的强化学习框架,用于改进代码生成的正确性、质量和安全性,通过定制化的执行感知奖励公式和令牌级奖励映射机制,提高了代码生成在不同领域中的适应性和执行效率。

Comments 10 pages, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08292 2026-05-21 cs.CL cs.AI 73%

Do LLMs Triage Like Clinicians? A Dynamic Study of Outpatient Referral

大语言模型像医生一样分诊吗?对外科会诊的动态研究

Xiaoxiao Liu, Qingying Xiao, Bingquan Zhang, Junying Chen, Xiangyi Feng, Ziniu Li, Xiang Wan, Jian Chang, Guangjun Yu, Yan Hu, Benyou Wang

机构 * Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Bournemouth University(伯恩茅斯大学) National Health Data Institute, Shenzhen(深圳国家健康数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在动态分诊过程中的表现,发现其在动态场景中通过有效提问减少不确定性,优于传统分类器,但静态场景下优势有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20284 2026-05-21 cs.CV cs.AI cs.LG 73%

JUDO: A Juxtaposed Domain-Oriented Multimodal Reasoner for Industrial Anomaly QA

JUDO: 一种面向工业异常问答的多模态推理框架

Hyunju Kang, Woohyun Lee, Jaewon Kim, Hogun Park

机构 * Sungkyunkwan University(成均馆大学) Seoul National University(首尔国立大学)

专题命中 领域大模型 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出JUDO框架,通过结合领域知识和上下文提升多模态推理能力,以解决工业异常检测中模型缺乏领域知识的问题,实验表明其在MMAD基准上优于Qwen2.5-VL-7B和GPT-4o。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20682 2026-05-21 cs.CV 67%

IndusAgent: Reinforcing Open-Vocabulary Industrial Anomaly Detection with Agentic Tools

IndusAgent: 通过智能工具增强开放词汇工业异常检测

Rongbin Tan, Fangfang Lin, Zhenlong Yuan, Min Qiu, Kejin Cui, Mengmeng Wang, Yi Wang, Zijian Song, Zhiyuan Wang, Jiyuan Wang, Yue Wang, Shuhan Song§, Huawei Cao

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Santa Clara University(圣克拉拉大学) LongCat Team(LongCat团队) Independent Researcher(独立研究者) New York University(纽约大学) Sun Yat-sen University(孙中山大学) Nanyang Technological University(南洋理工大学) Stanford University(斯坦福大学) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文提出IndusAgent框架,通过整合视觉观测、高分辨率局部片段和专家正常性先验,提升开放词汇工业异常检测的零样本性能,验证了方法的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20548 2026-05-21 cs.MA 67%

What Do Agents Communicate? Characterizing Information Exchange in Multi-Agent Systems

智能体通信什么?多智能体系统中信息交换的特征化

Yong Jin Chun, Iftekhar Ahmed

专题命中 领域大模型 :large language model(abstract);language model(abstract)

AI总结 本文研究了多智能体系统中信息交换的核心问题,发现缺乏推理和验证的信息会显著降低性能,并提出了一种增强技术来恢复通信中的关键信息,从而提高了系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20457 2026-05-21 cs.SI 67%

The Structure and Dynamics of the Online MAHA-sphere

在线MAHA球体的结构与动态

Sabit Ahmed, Subigya Nepal, Henry Kautz

专题命中 领域大模型 :LLM(abstract,abstract_cn)

AI总结 本研究探讨了MAHA运动在线社区中意识形态的结构和动态,通过分析Reddit数据揭示了MAHA相关思想的交集、网络结构、参与模式、意见动态和语言差异,并发现疫苗怀疑可能成为更广泛反科学参与的入口。

Comments Submitted to [TBA]

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17618 2026-05-21 cs.AI 57%

Prediction of Challenging Behaviors Associated with Profound Autism in a Classroom Setting Using Wearable Sensors

使用可穿戴传感器预测课堂环境中与深度自闭症相关的行为问题

Yadhu Kartha, Conor Anderson, Jenny Foster, Theresa Hamlin, Johanna Lantz, Ryan Lay, Juergen Hahn, Gari D. Clifford, Hyeokhyen Kwon

机构 * Georgia Institute of Technology(佐治亚理工学院) The Center For Discovery(发现中心) Rensselaer Polytechnic Institute(伦斯勒理工学院) Georgia Institute of Technology, Emory University(佐治亚理工学院与埃默里大学)

专题命中 领域大模型 :foundation model(abstract);分类 cs.AI

AI总结 本研究通过可穿戴传感器和机器学习方法,在真实课堂环境中预测自闭症深度患者的行为问题,展示了在教育环境中提前10分钟预测行为问题的可行性,并实现了AUC-ROC为0.78的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22080 2026-05-21 cs.AI 57%

Sound Agentic Science Requires Adversarial Experiments

声音代理科学需要对抗性实验

Dionizije Fa, Marko Culjak

专题命中 领域大模型 :LLM(abstract);分类 cs.AI

AI总结 该研究探讨了代理辅助科学中对抗性实验的重要性,指出传统方法在科学发现中的局限性,并提出应以证伪优先的标准来评估代理生成的科学主张。

Comments Published at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01053 2026-05-21 cs.IR cs.AI cs.DB 57%

M3: Conversational LLMs Simplify Secure Clinical Data Access, Understanding, and Analysis

M3: 对话式大语言模型简化安全的临床数据访问、理解与分析

Rafi Al Attrach, Pedro Moreira, Rajna Fani, Renato Umeton, Amelia Fiske, Leo Anthony Celi

机构 * Massachusetts Institute of Technology(麻省理工学院) Technical University of Munich(慕尼黑技术大学) Universitat Pompeu Fabra(庞培法华大学) St. Jude Children’s Research Hospital(圣犹大儿童研究医院) Beth Israel Deaconess Medical Center(贝斯以色列医疗中心) Harvard T.H. Chan School of Public Health(哈佛大学T.H. Chan公共卫生学院)

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 本文提出M3系统,通过模型上下文协议实现对MIMIC-IV数据库的自然语言查询,降低了临床数据访问和分析的技术门槛,并展示了其在安全性和性能上的优势。

Comments 18 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏