arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12496 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12496 篇

2402.07023 2024-02-13 cs.CL cs.AI cs.CV cs.HC cs.LG 91%

Gemini Goes to Med School: Exploring the Capabilities of Multimodal Large Language Models on Medical Challenge Problems & Hallucinations

Ankit Pal, Malaikannan Sankarasubbu

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments Preprint version, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.07396 2023-06-30 cs.LG cs.AI cs.CL 91%

Improving Patient Pre-screening for Clinical Trials: Assisting Physicians with Large Language Models

Danny M. den Hamer, Perry Schoor, Tobias B. Polak, Daniel Kapitan

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 11 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09617 2023-05-17 cs.CL cs.AI cs.LG 91%

Towards Expert-Level Medical Question Answering with Large Language Models

Karan Singhal, Tao Tu, Juraj Gottweis, Rory Sayres, Ellery Wulczyn, Le Hou, Kevin Clark, Stephen Pfohl, Heather Cole-Lewis, Darlene Neal, Mike Schaekermann, Amy Wang, Mohamed Amin, Sami Lachgar, Philip Mansfield, Sushant Prakash, Bradley Green, Ewa Dominowska, Blaise Aguera y Arcas, Nenad Tomasev, Yun Liu, Renee Wong, Christopher Semturs, S. Sara Mahdavi, Joelle Barral, Dale Webster, Greg S. Corrado, Yossi Matias, Shekoofeh Azizi, Alan Karthikesalingam, Vivek Natarajan

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12025 2026-08-13 cs.SE cs.AI 新提交 91%

From Safety Documentation to Safety Knowledge Support: An Evidence-Grounded LLM Framework for Medical Devices

从安全文档到安全知识支持:面向医疗器械的基于证据的大语言模型框架

Tuhinangshu Gangopadhyay, Rasmus Adler, Peter Liggesmeyer, Jan Reich

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有LLM在医疗器械安全工程中源链接等支持不足的问题,本文提出基于证据的LLM框架,用于安全知识支持,不做安全判定,还给出对应评估策略。

Comments ISSRE 2026, AISQ, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01763 2026-08-04 cs.CR cs.AI cs.LO cs.SE 新提交 91%

EntailLLM: Verifying LLM-Generated Vulnerability Discovery Paths with Domain Knowledge via Logic Programming

EntailLLM:通过逻辑编程结合领域知识验证大语言模型生成的漏洞发现路径

Kaustuv Mukherji, Jaikrishna Manojkumar Patil, Colton Payne, Paulo Shakarian, Dana Warmsley, Nigel Stepp, Evelyn Kim

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 EntailLLM通过逻辑编程结合领域知识验证LLM生成的漏洞发现路径,在三类CWE、四个LLM等多组实验中,将合并蕴含率从78%提升至98%,可端到端部署且无需逐设备调优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28384 2026-07-31 cs.AI 新提交 91%

When Specifications Conflict: A Symmetry-Based Framework for Measuring LLM Preferences

当规范冲突时:一种基于对称性的测量大语言模型(LLM)偏好的框架

Tairan Wang, Liang Zhou, Zikang Zhan, Pingchuan Yan

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于对称性的框架,通过含550个实例的数学基准等评估,发现LLM在冲突规范下有系统性偏好,排序为形式类>纯自然语言>输入-输出示例,可跨领域应用。

Comments Submitted to AAAI 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 91%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23032 2026-07-01 cs.AI q-fin.GN 新提交 91%

IPO Finance Agent: Benchmark of LLM Financial Analysts Beyond Finance Agent v2, with Automated Rubric Generation, on the SpaceX (SPCX) IPO

IPO金融分析师:超越Finance Agent v2的LLM金融分析师评估,带自动评分标准生成——以SpaceX (SPCX) IPO为例

Mostapha Benhenda

机构 * Vals AI

专题命中 领域大模型 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 针对IPO尽职调查中长文档检索的挑战,提出IPO Finance Agent框架,通过上下文检索和自动评分标准生成,在SpaceX S-1文件上评估多个LLM,最佳模型Qwen 3.7 Max准确率79.4%,成本$0.30/查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01982 2026-06-02 cs.AI 91%

An NLP-Driven Framework for Curriculum-Labor Market Alignment: Schema-Constrained LLM Extraction, ESCO-Anchored Semantic Matching, and Multi-Dimensional Gap Quantification

一种基于NLP的课程-劳动力市场对齐框架:模式约束的LLM抽取、ESCO锚定的语义匹配和多维差距量化

Sherzod Turaev, Mary John, Mamoun Awad, Nazar Zaki, Khaled Shuaib

专题命中 领域大模型 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 提出一个四阶段NLP框架,通过模式约束的LLM抽取、ESCO语义匹配、仲裁协议和验证机制,实现课程与劳动力市场的对齐,并量化多维供需差距。

Comments 53 pages, 9 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10808 2026-05-12 cs.CR cs.AI 91%

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

基于领域适应语言模型的威胁建模:实证评估与洞察

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy

机构 * Department of Systems(系统部) School of Information Technology(信息技术学院)

专题命中 领域大模型 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract);small language model(abstract)

AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-05-12 cs.AI 91%

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

专题命中 领域大模型 :LLM(title,title_cn);foundation model(abstract);分类 cs.AI

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27321 2026-05-01 cs.CR cs.AI cs.IR 91%

Toward Autonomous SOC Operations: End-to-End LLM Framework for Threat Detection, Query Generation, and Resolution in Security Operations

迈向自主SOC操作:面向安全操作中威胁检测、查询生成与解决的端到端LLM框架

Md Hasan Saju, Akramul Azim

机构 * Ontario Tech University(安大略技术大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出端到端威胁管理框架,通过集成基于集成的检测、语法约束查询生成和检索增强的解决支持,自动化安全操作流程,提升效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05824 2023-10-10 cs.CL 91%

Terminology-Aware Translation with Constrained Decoding and Large Language Model Prompting

Nikolay Bogoychev, Pinzhen Chen

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

Comments WMT 2023 Terminology Translation Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19598 2026-07-23 cs.CL cs.AI 91%

Cross-Model Consistency of AI-Generated Exercise Prescriptions: A Repeated Generation Study Across Three Large Language Models

跨模型一致性分析:AI生成运动处方的重复生成研究:在三个大型语言模型间

Kihyuk Lee

机构 * Data Convergence Team, Office of Hospital Information, Seoul National University Bundang Hospital(数据融合团队,医院信息办公室,首尔国立大学医院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究比较了三种大型语言模型在重复生成运动处方时的一致性,发现GPT-4.1在语义相似度上最高,而Gemini 2.5 Flash表现出重复性,揭示了生成行为的差异,强调模型选择应作为临床决策。

Comments 24 Pages, 2 Figures, 6 Tables and 2 Supplementary Materials. v2: Removed personal contact information

Journal ref International Journal of Medical Informatics, 220 (2026) 106594

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07521 2026-06-09 cs.CL cs.AI 新提交 91%

Evaluating Hallucinations in Domain-Adapted Large Language Models

评估领域自适应大语言模型中的幻觉现象

Sanchita Porwal, Sai Prasath S, Xingjian Bi, Madelyn Scandlen

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究通过微调Llama-2模型,测试其记忆、回忆和推理能力,发现领域自适应大语言模型在生成新领域特定信息时存在幻觉问题,表明仅靠微调难以有效缓解幻觉。

Comments 13 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00027 2026-06-02 cs.CL cs.AI 91%

A Multi-Domain Red Teaming Framework for Safety, Robustness, and Fairness Evaluation of Medical Large Language Models

医疗大语言模型安全性、鲁棒性和公平性评估的多领域红队框架

Andrei Marian Feier, Veysel Kocaman, Yigit Gul, Ahmet Korkmaz, Alexander Thomas, Aleksei Zakharov, Jay Gil, Mehmet Butgul, David Talby

机构 * John Snow Labs Inc.(约翰·索克斯实验室公司)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一个多领域红队框架,通过690个临床场景评估11个当代大语言模型,发现平均准确率掩盖了临床意义上的风险,性能方差和最坏情况失败比平均准确率更能反映可靠性,混合评估方法对可信安全评估至关重要。

Comments 10 pages, 4 figures. To be presented at the Text2Story 2026 Workshop (Delft, The Netherlands, 29 March 2026); CEUR Workshop Proceedings (forthcoming). Affiliation: John Snow Labs Inc

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01627 2026-05-28 cs.CL cs.AI 91%

JMedEthicBench: A Multi-Turn Conversational Benchmark for Evaluating Medical Safety in Japanese Large Language Models

JMedEthicBench:用于评估日语大语言模型医疗安全性的多轮对话基准

Junyu Liu, Zirui Li, Qian Niu, Zequn Zhang, Yue Xun, Wenlong Hou, Shujun Wang, Yusuke Iwasawa, Yutaka Matsuo, Kan Hatakeyama-Sato

机构 * Kyoto University(京都大学) Hohai University(河海大学) The University of Tokyo(东京大学) University of Science and Technology of China(中国科学技术大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个多轮对话基准JMedEthicBench,基于日本医学会67条指南和7种自动越狱策略生成5万+对抗对话,评估27个模型发现医疗专用模型安全性脆弱,且多轮交互中安全性显著下降。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26895 2026-05-27 cs.LG cs.AI stat.ML 91%

Negligible in Size, Significant in Effect: On Scale Vectors in Large Language Models

微不足道的大小,显著的效果:大型语言模型中的尺度向量

Mingze Wang, Shuchen Zhu, Yuxin Fang, Binghui Li, Kai Shen, Shu Zhong

机构 * Peking University(北京大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文系统研究了大型语言模型中的尺度向量,发现其虽参数占比极小但对预训练至关重要,通过自放大预条件效应优化优化过程,并提出了三种轻量级改进策略,在多种模型规模上一致提升性能。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16307 2026-05-19 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 91%

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

钙钛矿-R1:一个专门领域的大型语言模型,用于智能发现前驱体添加剂和实验设计

Xin-De Wang, Zhi-Rui Chen, Peng-Jie Guo, Ze-Feng Gao, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本研究提出Perovskite-R1,一个专门用于发现钙钛矿太阳能电池前驱体添加剂和实验设计的大型语言模型,通过系统挖掘和整理1232篇高质量科学文献,并整合33269种候选材料,构建了领域特定的指令微调数据集,从而提升材料发现的效率。

Comments 24 pages; 5 figures

Journal ref Communications Materials 7, 86 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08671 2026-05-12 cs.CL cs.AI 91%

Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups

大语言模型中的解释公平性:对LLMs在不同人口群体中解释决策差异的实证分析

Gautam Veldanda

机构 * Independent Researcher(独立研究者)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);prompting(abstract)

AI总结 本文提出解释公平性分类法,分析大语言模型在不同群体中解释决策的差异,发现模型选择与差异幅度密切相关,提出两种提示方法减少解释差异。

Comments 10 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15567 2026-05-11 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph 91%

Evaluating Large Language Models in Scientific Discovery

评估大型语言模型在科学发现中的表现

Zhangde Song, Jieyu Lu, Yuanqi Du, Botao Yu, Thomas M. Pruyn, Yue Huang, Kehan Guo, Xiuzhe Luo, Yuanhao Qu, Yi Qu, Yinkai Wang, Haorui Wang, Jeff Guo, Jingru Gan, Parshin Shojaee, Di Luo, Andres M Bran, Gen Li, Qiyuan Zhao, Shao-Xiong Lennon Luo, Yuxuan Zhang, Xiang Zou, Wanru Zhao, Yifan F. Zhang, Wucheng Zhang, Shunan Zheng, Saiyang Zhang, Sartaaj Takrim Khan, Mahyar Rajabi-Kochi, Samantha Paradi-Maropakis, Tony Baltoiu, Fengyu Xie, Tianyang Chen, Kexin Huang, Weiliang Luo, Meijing Fang, Xin Yang, Lixue Cheng, Jiajun He, Soha Hassoun, Xiangliang Zhang, Wei Wang, Chandan K. Reddy, Chao Zhang, Zhiling Zheng, Mengdi Wang, Le Cong, Carla P. Gomes, Chang-Yu Hsieh, Aditya Nandy, Philippe Schwaller, Heather J. Kulik, Haojun Jia, Huan Sun, Seyed Mohamad Moosavi, Chenru Duan

机构 * Deep Principle(深原则) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学) Department of Computer Science and Engineering, The Ohio State University(计算机科学与工程系,俄亥俄州立大学) Department of Chemical Engineering & Applied Chemistry, University of Toronto(化学工程与应用化学系,多伦多大学) Department of Computer Science and Engineering, University of Notre Dame(计算机科学与工程系,圣母大学) QuEra Computing Inc.(QuEra计算公司) Department of Pathology, Department of Genetics, Cancer Biology Program, Stanford University School of Medicine(病理学系、遗传学系、癌症生物学项目,斯坦福大学医学院) Harvard Law School(哈佛法学院) Department of Computer Science, Tufts University(计算机科学系,塔夫茨大学) School of Computational Science and Engineering, Georgia Institute of Technology(计算科学与工程学院,佐治亚理工学院) Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校) Department of Computer Science, Virginia Tech(计算机科学系,弗吉尼亚理工大学) Department of Physics, Tsinghua University(物理系,清华大学) Institute for Advanced Study, Tsinghua University(清华大学高级研究所) Laboratory of Artificial Chemical Intelligence, Ecole Polytechnique Federale de Lausanne(人工化学智能实验室,瑞士联邦理工学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 本文提出一个基于场景的基准测试,评估LLM在生物学、化学、材料科学和物理学中的科学发现能力,揭示了模型在科学发现任务中的性能差距和改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19776 2026-04-23 cs.CL cs.LG 91%

Development and Preliminary Evaluation of a Domain-Specific Large Language Model for Tuberculosis Care in South Africa

针对南非结核病护理的领域专用大型语言模型的开发与初步评估

Thokozile Khosa, Olawande Daramola

机构 * University of Pretoria(南非大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种专门用于南非结核病护理的大型语言模型,通过量化低秩适应算法和图检索生成技术,提升了模型在结核病领域的上下文对齐能力。

Comments 12 pages, 2 figures, ICICT 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20556 2026-04-23 cs.CL cs.AI 91%

LayerTracer: A Joint Task-Particle and Vulnerable-Layer Analysis framework for Arbitrary Large Language Model Architectures

LayerTracer:一种用于任意大语言模型架构的联合任务-粒子和脆弱层分析框架

Yuhang Wu, Qinyuan Liu, Qiuyang Zhao, Qingwei Chong

机构 * China Electronic Technology Nanhu Research Institute(中国电子科技纳湖研究院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出LayerTracer框架,通过逐层提取隐藏状态并映射到词汇概率分布,实现任务粒子定位与层脆弱性量化分析,为混合架构设计和模型优化提供科学依据。

Comments 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18786 2026-04-22 cs.CL cs.AI 91%

Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models

实验还是结果?在大型语言模型中探测科学可行性

Seyedali Mohammadi, Manas Gaur, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文探讨了在大型语言模型中科学可行性的评估,发现提供结果证据比实验描述更可靠,结果能提升准确性,而实验文本可能因上下文不完整而退化。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE 91%

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07717 2026-04-14 cs.CL cs.AI 91%

Detecting HIV-Related Stigma in Clinical Narratives Using Large Language Models

利用大语言模型检测临床叙述中的HIV相关污名化

Ziyi Chen, Yasir Khan, Mengyuan Zhang, Cheng Peng, Mengxian Lyu, Yiyang Liu, Krishna Vaddiparti, Robert L Cook, Mattia Prosperi, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics, College of Medicine, University of Florida(佛罗里达大学医学院健康结果与生物医学信息学系) Department of Epidemiology, College of Public Health and Health Professions, University of Florida(佛罗里达大学公共卫生与健康专业学院流行病学系) Preston A. Wells, Jr. Center for Brain Tumor Therapy, Lillian S. Wells Department of Neurosurgery, University of Florida(佛罗里达大学莉莉安·S·威尔斯神经外科系普雷斯顿·A·威尔斯脑肿瘤治疗中心)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出利用大语言模型开发首个能识别临床笔记中HIV污名化的NLP工具,通过专家关键词和临床词嵌入提取污名化内容,并在不同污名化子量表上评估模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12476 2026-03-27 cs.CL cs.LG 91%

Retrieval-Reasoning Large Language Model-based Synthetic Clinical Trial Generation

基于检索-推理的大型语言模型合成临床试验生成

Zerui Xu, Fang Wu, Yingzhou Lu, Yuanyuan Zhang, Yue Zhao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒实验室) University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Purdue University(普渡大学) University of Southern California(南加州大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文提出基于检索-推理框架的合成临床试验生成方法,利用LLM生成标注二元结果的合成试验报告,通过检索模块和推理模块提升生成质量,实验证明合成数据可有效增强真实数据集并提升临床试验预测性能。

Comments Published in ACM BCB 2025. 9 pages, 4 figures, 5 tables (Main paper + Supplementary Materials)

Journal ref Proceedings of the 16th ACM International Conference on Bioinformatics, Computational Biology, and Health Informatics (ACM BCB 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21101 2025-12-10 cs.CL cs.LG 91%

Mortgage Language Model: Domain-Adaptive Pretraining with Residual Instruction, Alignment Tuning, and Task-Specific Routing

抵押贷款语言模型:带有残差指令、对齐微调和任务特定路由的领域自适应预训练

Manish Jain, Satheesh Kumar Ponnambalam, Salman Faroz, Chandrakanth Lns, Vinay Sharma

机构 * Firstsource

专题命中 领域大模型 :language model(title,abstract);pretraining(title);LLM(abstract);large language model(abstract)

AI总结 MortgageLLM通过双专家架构和残差指令技术,在抵押贷款领域实现领域自适应预训练,提升对话问答和结构化任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21748 2025-12-01 cs.CL cs.AI 91%

Building Domain-Specific Small Language Models via Guided Data Generation

通过引导数据生成构建领域专用小型语言模型

Aman Kumar, Ekant Muljibhai Amin, Xian Yeow Lee, Lasitha Vidyaratne, Ahmed K. Farahat, Dipanjan D. Ghosh, Yuta Koreeda, Chetan Gupta

专题命中 领域大模型 :language model(title,abstract);small language model(title);large language model(abstract);pretraining(abstract)

AI总结 本文提出一种通过引导数据生成构建领域专用小型语言模型的方法,结合领域适应预训练、监督微调和偏好优化,展示了在工业诊断任务中优于开源模型的性能。

Comments Accepted at Thirty-Eighth Annual Conference on Innovative Applications of Artificial Intelligence (IAAI-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14268 2025-11-25 cs.CL cs.AI cs.SI 91%

Can Large Language Models Detect Misinformation in Scientific News Reporting?

大型语言模型能否在科学新闻报道中检测虚假信息?

Yupeng Cao, Aishwarya Muralidharan Nair, Nastaran Jamalipour Soofi, Elyon Eyimife, K. P. Subbalakshmi

机构 * Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文探讨了使用大型语言模型检测科学新闻中虚假信息的可能性,并提出了SciNews数据集及多种基线架构进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏