arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12581 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12581 篇

2607.08731 2026-07-21 cs.CL cs.AI cs.CY 版本更新 84%

Trusting sovereign language models as scientific instruments: evidence from Portugal's AMALIA

大语言模型作为数据标注器的有效性:关于权威的AMALIA研究

Manuel Pita

机构 * CICANT, Universidade Lusófona(坎特交互计算与技术研究中心,卢索福纳大学)

专题命中 领域大模型 :language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究葡萄牙AMALIA大语言模型作为数据标注器标注权威道德基础的有效性,通过恢复差距测试其能否遵循理论,发现校准的英语工具不能转移到该模型,其依赖表面关联,虽能筛选预编码但不能独立衡量,强调基准测试应考察一致性证据路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11292 2026-07-14 cs.CY cs.AI cs.CL 新提交 84%

The Paternalistic Filter: Epistemic Injustice and Differential Refusal in LLM-Mediated History Education for Marginalized Romanian Students

家长式过滤器:大语言模型介导的罗马尼亚边缘化学生历史教育中的认知不公正与差异拒绝

Alexis Popovici, Andrei Ionascu, Adrian-Marius Dumitran

机构 * Universitatea din București(布加勒斯特大学)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型用于罗马尼亚边缘化学生历史教育时的问题,通过API审计四个模型的1800条回复,发现认知家长式作风的四种模式,指出当前安全对齐成家长式过滤器,致叙事隔离,需教学审计。

Comments 8th International Workshop on Culturally-Aware Tutoring Systems (HAL precedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15684 2026-07-07 cs.LG cs.AI cs.CE 版本更新 84%

Walrus: A Cross-Domain Foundation Model for Continuum Dynamics

海象:用于连续介质动力学的跨域基础模型

Michael McCabe, Payel Mukhopadhyay, Tanya Marwah, Bruno Regaldo-Saint Blancard, Francois Rozet, Cristiana Diaconu, Lucas Meyer, Kaze W. K. Wong, Hadi Sotoudeh, Alberto Bietti, Irina Espejo, Rio Fear, Siavash Golkar, Tom Hehir, Keiya Hirashima, Geraud Krawezik, Francois Lanusse, Rudy Morel, Ruben Ohana, Liam Parker, Mariel Pettee, Jeff Shen, Kyunghyun Cho, Miles Cranmer, Shirley Ho

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对物理模拟中机器学习的挑战,通过新方法如谐波分析稳定、负载均衡训练策略等,开发基于Transformer的基础模型Walrus,在多场景预训练,实验表明其性能优于现有模型。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02175 2026-07-03 cs.AI cs.LG 新提交 84%

A rubric-based controlled comparison of frontier language models on expert-authored clinical reasoning tasks

基于评分量表的专家级临床推理任务中前沿语言模型的受控比较

Samiha A. Ismail, Fan X. Chen, Ali Merali

机构 * Prime Analytics Consulting Limited(普林特分析咨询有限公司) Talbert House(塔尔伯特大楼;托马斯·莫尔大学) Thomas More University(MAKZ) MAKZ

专题命中 领域大模型 :language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 通过5个专家编写的临床场景和加权评分量表,评估GPT、Claude和Gemini三个前沿模型,发现关键标准通过率低(32-42%),而低权重标准通过率高(80-90%),52%的关键标准无模型通过。

Comments 13 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 84%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 领域大模型 :language model(title,abstract);SFT(abstract);分类 cs.CL、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24459 2026-06-24 cs.LG cs.CL 新提交 84%

An LLM-based Two-Stage Transformer Framework for Cross-Domain Bearing Fault Diagnosis with Limited Data

基于LLM的两阶段Transformer框架用于跨域轴承故障诊断与有限数据

Jinghan Wang, Feng Cheng, Wentao Wu, Hang Li, Gaoliang Peng, Tianchen Liu

专题命中 领域大模型 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出知识引导的两阶段迁移学习框架,使用轻量级GPT-2风格Transformer提取振动信号层次特征,通过原型知识调制和分类自适应实现跨域故障诊断,在仅10%标注数据下达到92.61%准确率。

Comments Accepted as a conference article of AIM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27277 2026-06-12 cs.LG cs.AI cs.CV 版本更新 84%

BrainDINO: A Brain MRI Foundation Model for Generalizable Clinical Representation Learning

BrainDINO:一种用于通用临床表征学习的脑MRI基础模型

Yizhou Wu, Shansong Wang, Yuheng Li, Mojtaba Safari, Mingzhe Hu, Chih-Wei Chang, Harini Veeraraghavan, Xiaofeng Yang

机构 * Department of Radiation Oncology and Winship Cancer Institute, Emory University(放射肿瘤科和Winship癌症研究所,埃默里大学) Department of Radiation and Cellular Oncology, The University of Chicago(放射肿瘤学与细胞肿瘤学部,芝加哥大学) Department of Electrical and Computer Engineering, Georgia Institute of Technology(电气与计算机工程系,佐治亚理工学院) Department of Biomedical Engineering, Georgia Institute of Technology(生物医学工程系,佐治亚理工学院) Department of Biomedical Informatics, Emory University(生物医学信息学系,埃默里大学) Department of Medical Physics, Memorial Sloan Kettering Cancer Center(医学物理系,纪念斯隆凯特琳癌症中心)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出BrainDINO,一种基于自蒸馏的基础模型,在约660万张未标记轴向切片上训练,通过冻结编码器加轻量任务头,在多种脑MRI任务上达到或超越基线,尤其在小样本场景下优势显著。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10066 2026-06-10 cs.CV cs.AI cs.LG 新提交 84%

A Controlled Audit of Pretraining Contamination in Public Medical Vision-Language Benchmarks

公共医学视觉语言基准中预训练污染的受控审计

Bruce Changlong Xu, Lan Wu, Alexander Ryu

机构 * Stanford University(斯坦福大学) University of California, Berkeley(加州大学伯克利分校) Mayo Clinic(梅奥诊所)

专题命中 领域大模型 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 审计发现公共医学VLM基准存在图像源重叠和文本规范顺序交换性信号,但确认的像素级重复罕见,且现有成员推理检测器在小规模医学VLM队列中不可靠。

Comments 30 pages, 7 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07853 2026-06-09 cs.CL cs.AI 新提交 84%

Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

超越英语基准:巴西葡萄牙语临床大语言模型评估

Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima, Daniel Schneider

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个双语临床基准ClinicalBr,基于巴西病例报告构建,评估四个模型发现葡萄牙语-英语性能差距具有任务依赖性,诊断检索英语优势明显,其他任务差距消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23292 2026-06-08 cs.AI cs.LG 版本更新 84%

Agentic Physical AI toward a Domain-Specific Foundation Model for Energy Systems: A Case Study on Nuclear Reactor Control

面向能源系统的领域特定基础模型的具身物理人工智能:以核反应堆控制为例

Yoon Pyo Lee, Samrendra Roy, Kazuma Kobayashi, Sajedul Talukder, Diab Abueidda, Seid Koric, Souvik Chakraborty, Syed Bahauddin Alam

机构 * The Grainger College of Engineering, Nuclear, Plasma & Radiological Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格雷格学院工程学院、核等工程学院) Department of Nuclear Engineering, Hanyang University(汉阳大学核工程系) University of Texas - El Paso(德克萨斯大学埃尔帕索分校) National Center for Supercomputing Applications(国家超级计算应用中心) Department of Applied Mechanics, Indian Institute of Technology Delhi(印度德里理工学院应用力学系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度德里理工学院亚里人工智能学院)

专题命中 领域大模型 :foundation model(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出通过紧凑语言模型作为具身物理人工智能,利用基于物理模拟器验证的策略优化替代感知推理,在核反应堆控制任务中实现领域特定基础模型,并展示了规模扩展带来的可靠性提升和策略集中化行为。

Comments Accepted for publication in npj Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02914 2026-06-04 cs.AI cs.CL 84%

Large AI Models in Dental Healthcare: From General-Purpose Systems to Domain-Specific Foundation Models

牙科医疗中的大型AI模型:从通用系统到领域特定基础模型

Sema Helali, Lina Abu Nada, Sausan Al Kawas, Alaa Abd-Alrazaq, Faleh Tamimi, Rafat Damseh

机构 * University of Al Ain, UAE(阿联酋阿恩大学) Sharjah University, UAE(阿联酋谢尔杰大学) Cornell University, Qatar(卡塔尔康奈尔大学) McGill University(麦吉尔大学)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过系统综述,提出二维分类框架,比较语言生成模型、判别视觉基础模型和牙科特定基础模型在牙科任务中的表现,发现集成管道优于单一模型,并指出数据不对称、幻觉和缺乏标准化基准等障碍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00065 2026-06-02 cs.IR cond-mat.mtrl-sci cs.AI cs.CL 84%

Beyond Text and Tables: Vision-Language Model Integration in ComProScanner for Extracting Materials Data from Scientific Figures with High Accuracy

超越文本与表格:ComProScanner中视觉-语言模型集成实现从科学图表中高精度提取材料数据

Aritra Roy, Enrico Grisan, Chiara Gattinoni, John Buckeridge

机构 * Energy, Materials and Environment Research Centre, London South Bank University, London SE1 0AA, UK(能源、材料与环境研究中心,伦敦南银行大学) School of Engineering and Design, London South Bank University, London SE1 0AA, UK(工程与设计学院,伦敦南银行大学) Bioscience and Bioengineering Research Centre, London South Bank University, London SE1 0AA, UK(生物科学与生物工程研究中心,伦敦南银行大学) Department of Physics, Kings College London, London WC2R 2LS, UK(物理系,伦敦国王学院)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过集成视觉-语言模型扩展ComProScanner框架,实现了从科学图表中自动提取成分-性能数据,在压电陶瓷数据集上达到0.97的组成准确率和归一化F1分数,并引入基于范围的误差阈值评估方法。

Comments 18 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14890 2026-05-26 cs.CL cs.AI 84%

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study

分词器生育率与基础模型在乌克兰法律文本上的零样本性能:一项比较研究

Volodymyr Ovcharov

机构 * LEX AI Platform(LEX AI平台) legal.org.ua Kyiv, Ukraine(基辅,乌克兰)

专题命中 领域大模型 :foundation model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究比较了七种基础模型在乌克兰法律文本上的分词器生育率和零样本性能,发现分词器生育率差异达1.6倍,Qwen 3模型比Llama系列多消耗60%的token,而NVIDIA Nemotron Super 3 (120B)以更低的成本取得最佳性能,同时揭示了少样本提示在形态丰富语言上的退化以及战时法律语言对模型泛化的影响。

Comments 25 pages, 13 tables, 5 figures; v2 adds cross-temporal generalization experiment and classical baseline

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13540 2026-05-14 cs.LG cs.AI 84%

Decoupled and Divergence-Conditioned Prompt for Multi-domain Dynamic Graph Foundation Models

解耦与发散条件化的提示用于多领域动态图基础模型

Haonan Yuan, Qingyun Sun, Junhua Shi, Xingcheng Fu, Jianxin Li, Philip S. Yu

机构 * School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Key Lab of Education Blockchain and Intelligent Technology, Ministry of Education, Guangxi Normal University(教育部教育区块链与智能技术重点实验室,广西师范大学) Department of Computer Science, University of Illinois at Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 领域大模型 :foundation model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DyGFM,通过解耦和发散条件化提示策略,解决多领域动态图建模中的语义与时间不一致问题,提升跨域适应和下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00906 2026-05-05 cs.CV cs.AI cs.LG 84%

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

在域偏移下进行广义类别发现:从视觉模型到视觉-语言模型

Hongjun Wang, Po Hu, Kai Han

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 领域大模型 :language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究在域偏移下的广义类别发现问题,提出三种适应基础模型的框架,从自监督视觉模型到视觉-语言模型,通过多级特征提取和互信息最小化等方法提升性能。

Comments Submission to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15593 2026-04-20 cs.CL cs.AI 84%

DALM: A Domain-Algebraic Language Model via Three-Phase Structured Generation

DALM:通过三阶段结构生成的领域代数语言模型

Chao Li

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 DALM通过三阶段结构生成框架,利用领域格子进行约束生成,解决领域不确定性、关系不确定性和概念不确定性,实现跨领域污染控制和多视角回答空间生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17872 2026-03-26 cs.CL cs.AI 84%

Mitigating LLM Hallucinations through Domain-Grounded Tiered Retrieval

通过领域导向的分层检索缓解大语言模型的幻觉

Md. Asraful Haque, Aasar Mehdi, Maaz Mahboob, Tamkeen Fatima

机构 * Computational Unit, Z.H. College of Engineering & Technology, Aligarh Muslim University, India(计算单元,Z.H. 工程技术学院,阿利加尔穆斯林大学,印度) Interdisciplinary Center for Artificial Intelligence, Aligarh Muslim University, India(跨学科人工智能中心,阿利加尔穆斯林大学,印度) Department of Computer Engineering, Aligarh Muslim University, India(计算机工程系,阿利加尔穆斯林大学,印度)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种领域导向的分层检索与验证架构,通过将LLM从随机模式匹配者转变为验证真理寻求者,系统拦截事实性不准确内容。在六个基准测试中,该框架在时间精度和数值准确性要求高的领域表现出色,但发现存在'假前提过度断言'的持续失败模式。

Comments 14 Pages, 5 Figures, 4 Tables; v2: Updated Table 3 and Figure 4 to address minor data inconsistencies and revised the relevant content

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23136 2026-03-25 cs.CL cs.LG 84%

HGNet: Scalable Foundation Model for Automated Knowledge Graph Generation from Scientific Literature

HGNet:可扩展的基础模型用于从科学文献自动生成知识图谱

Devvrat Joshi, Islem Rekik

机构 * BASIRA Lab, Imperial-X (I-X) and Department of Computing(BASIRA实验室、Imperial-X(I-X)和计算系) Imperial College London, London, United Kingdom(伦敦帝国理工学院,伦敦,英国)

专题命中 领域大模型 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出HGNet框架,通过两阶段方法实现零样本科学知识图谱构建,引入OSD和TCQK机制提升实体识别与关系提取,结合可微分层次损失和CAF损失确保全局一致性,提升NER和RE性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18873 2026-03-24 cs.CL cs.AI cs.HC 84%

Evaluating LLM-Generated Lessons from the Language Learning Students' Perspective: A Short Case Study on Duolingo

从语言学习学生视角评估LLM生成的课程:Duolingo的简短案例研究

Carlos Rafael Catalan, Patricia Nicole Monderin, Lheane Marie Dizon, Gap Estrella, Raymund John Sarmimento, Marie Antoinette Patalagsa

机构 * Samsung R\&D Institute Philippines Manila Philippines Samsung R\&D Institute Philippines

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过调查菲律宾跨国公司员工,发现Duolingo课程中通用场景更受欢迎,而专业场景有助于提升专业流利度,建议语言学习应用应根据个人需求生成定制化课程。

Comments 5 pages,3 figures,presented at the 3rd HEAL Workshop at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20042 2026-03-23 cs.CL cs.AI 84%

LoASR-Bench: Evaluating Large Speech Language Models on Low-Resource Automatic Speech Recognition Across Language Families

LoASR-Bench:评估大型语音语言模型在跨语言家族低资源自动语音识别中的表现

Jianan Chen, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University(京都大学) Institute for Infocomm Research, Agency for Science, Technology and Research(信息通信研究机构,科技研究局)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LoASR-Bench,评估最新SpeechLM在低资源语言上的ASR性能,涵盖25种语言9个语系,揭示最新SpeechLM在低资源语言处理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18688 2026-03-20 cs.LG cs.CL 84%

STEP: Scientific Time-Series Encoder Pretraining via Cross-Domain Distillation

STEP: 通过跨领域知识蒸馏实现科学时间序列的编码器预训练

Chen Zhang, Liwei Liu, Jun Tao, Xiaoyu Yang, Xuenan Xu, Kai Chen, Bowen Zhou, Wen Wu, Chao Zhang

机构 * Shanghai Aritificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) Sichuan University(四川大学) University of Cambridge(剑桥大学)

专题命中 领域大模型 :pretraining(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出STEP框架,通过跨领域知识蒸馏整合多领域基础模型,构建统一的科学时间序列编码器,提升科学时间序列的表示学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12226 2026-03-13 cs.CL cs.AI 84%

Sparking Scientific Creativity via LLM-Driven Interdisciplinary Inspiration

通过LLM驱动的跨学科灵感激发科学创造力

Priyanka Kargupta, Shuhaib Mehri, Dilek Hakkani-Tur, Jiawei Han

机构 * Siebel School of Computing and Data Science(计算机与数据科学学院)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Idea-Catalyst通过系统识别跨学科见解,支持人类和大语言模型的创造性推理,提升科学发现的创新性和洞察力。

Comments Code and dataset provided at https://github.com/pkargupta/idea_catalyst

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02268 2026-03-04 cs.LG cs.AI 84%

PRISM: Exploring Heterogeneous Pretrained EEG Foundation Model Transfer to Clinical Differential Diagnosis

PRISM:探索异构预训练EEG基础模型迁移至临床鉴别诊断

Jeet Bandhu Lahiri, Parshva Runwal, Arvasu Kulkarni, Mahir Jain, Aditya Ray Mishra, Siddharth Panwar, Sandeep Singh

机构 * Indian Institute of Technology Mandi, India(印度理工学院曼迪分校) NeuroDx, India(NeuroDx)

专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PRISM通过异构预训练EEG模型在临床鉴别诊断中表现优异,证明多样性优于规模,揭示评估因素对模型排名的影响。

Comments 14 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06596 2026-03-02 cs.HC cs.AI cs.CL 84%

Personality as Relational Infrastructure: User Perceptions of Personality-Trait-Infused LLM Messaging

性格作为关系基础设施:用户对融入人格特质的LLM消息的感知

Dominik P. Hofer, David Haag, Rania Islambouli, Jan D. Smeddinck

专题命中 领域大模型 :LLM(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了基于人格特质的LLM消息对用户感知的影响,发现人格信息通过整体暴露而非单条信息优化提升个性化和适当性评价。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22483 2026-02-27 cs.CL cs.AI 84%

Importance of Prompt Optimisation for Error Detection in Medical Notes Using Language Models

提示优化在使用语言模型进行医疗笔记错误检测中的重要性

Craig Myles, Patrick Schrempf, David Harris-Birtill

机构 * University of St Andrews(圣安德鲁大学) Canon Medical Research Europe Ltd.(日本Canon医疗研究欧洲有限公司)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示优化提升语言模型在医疗笔记错误检测中的准确性,达到接近医生水平并超越MEDEC基准数据集表现。

Comments Accepted at EACL HeaLing 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05517 2026-02-13 cs.CL cs.AI 84%

Empowering Healthcare Practitioners with Language Models: Structuring Speech Transcripts in Two Real-World Clinical Applications

通过语言模型赋能医疗从业者:在两个真实临床应用中结构化语音转录

Jean-Philippe Corbeil, Asma Ben Abacha, George Michalopoulos, Phillip Swazinna, Miguel Del-Agua, Jerome Tremblay, Akila Jeeson Daniel, Cari Bader, Yu-Cheng Cho, Pooja Krishnan, Nathan Bodenstab, Thomas Lin, Wenxuan Teng, Francois Beaulieu, Paul Vozila

机构 * Microsoft Healthcare & Life Sciences(微软医疗与生命科学)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过语言模型在两个临床应用中结构化语音转录,提出代理流程生成非敏感数据,并发布首个开源数据集以支持进一步研究。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing: Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11165 2026-02-13 cs.CL cs.AI 84%

Assessing LLM Reliability on Temporally Recent Open-Domain Questions

评估LLM在近期开放领域问题上的可靠性

Pushwitha Krishnappa, Amit Das, Vinija Jain, Tathagata Mukherjee, Aman Chadha

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Google(谷歌) Apple(苹果公司)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03802 2026-02-10 cs.LG cs.AI cs.MA 84%

RiskAgent: Synergizing Language Models with Validated Tools for Evidence-Based Risk Prediction

RiskAgent: 语言模型与验证工具协同以基于证据的风险预测

Fenglin Liu, Jinge Wu, Hongjian Zhou, Xiao Gu, Jiayuan Zhu, Jiazhen Pan, Junde Wu, Soheila Molaei, Anshul Thakur, Lei Clifton, Honghan Wu, David A. Clifton

机构 * University of Oxford(牛津大学) University College London(伦敦大学学院) Technical University of Munich(慕尼黑技术大学) University of Glasgow(格拉斯哥大学) Oxford-Suzhou Centre for Advanced Research(牛津-苏浙高级研究中心)

专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 RiskAgent通过整合语言模型与验证的临床决策工具,实现基于证据的风险预测,展现优越的性能和泛化能力。

Comments Code and Data are available at https://github.com/AI-in-Health/RiskAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05289 2026-02-06 cs.CL cs.AI cs.MA 84%

Towards a Science of Collective AI: LLM-based Multi-Agent Systems Need a Transition from Blind Trial-and-Error to Rigorous Science

迈向集体人工智能的科学:基于LLM的多智能体系统需要从盲目试错转向严谨的科学

Jingru Fan, Dewen Liu, Yufan Dang, Huatao Li, Yuheng Wang, Wei Liu, Feiyu Duan, Xuanwen Ding, Shu Yao, Lin Wu, Ruijie Shi, Wai-Shing Leung, Yuan Cheng, Zhongyu Wei, Cheng Yang, Chen Qian, Zhiyuan Liu, Maosong Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tsinghua University(清华大学) King’s College London(伦敦大学国王学院) Peng Cheng Laboratory(鹏城实验室)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过建立协作收益度量(Γ)和因素归因范式,推动多智能体系统从盲目试错向严谨科学转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23471 2026-01-30 cs.CL cs.AI 84%

Discovering Multi-Scale Semantic Structure in Text Corpora Using Density-Based Trees and LLM Embeddings

利用基于密度的树和大语言模型嵌入发现文本语料库的多尺度语义结构

Thomas Haschka, Joseph Bakarji

机构 * E020-04 Service Unit of High Performance Computing, DataLab, Campus IT, Technische Universität Wien(技术大学维也纳高性能计算服务单元,数据实验室,校园IT) Department of Mechanical Engineering, American University of Beirut(贝鲁特美国大学机械工程系)

专题命中 领域大模型 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于密度的树和大语言模型嵌入的方法,用于发现文本语料库的多尺度语义结构,通过层次密度建模揭示主题之间的结构关系。

Comments 23 pages, 10 figures, further interactive visualizations available on https:// genealogy.sematlas.com/

详情

展开后加载摘要…

URL PDF HTML 收藏