arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12565 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 12565 篇

2401.15328 2024-01-31 cs.CL 87%

Equipping Language Models with Tool Use Capability for Tabular Data Analysis in Finance

Adrian Theuma, Ehsan Shareghi

专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

Comments Accepted to EACL2024; code, model and dataset are available at https://raven-lm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.08939 2023-09-19 cs.IR cs.AI 87%

An Unified Search and Recommendation Foundation Model for Cold-Start Scenario

Yuqi Gong, Xichen Ding, Yehui Su, Kaiming Shen, Zhongyi Liu, Guannan Zhang

专题命中 领域大模型 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments CIKM 2023,6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03333 2023-08-21 cs.IR cs.AI 87%

Heterogeneous Knowledge Fusion: A Novel Approach for Personalized Recommendation via LLM

Bin Yin, Junjie Xie, Yu Qin, Zixiang Ding, Zhichao Feng, Xiang Li, Wei Lin

专题命中 领域大模型 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments Accepted at RecSys 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04811 2023-06-09 cs.CV cs.AI 87%

Generative Text-Guided 3D Vision-Language Pretraining for Unified Medical Image Segmentation

Yinda Chen, Che Liu, Wei Huang, Sibo Cheng, Rossella Arcucci, Zhiwei Xiong

专题命中 领域大模型 :pretraining(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03153 2023-04-07 cs.IR cs.CL 87%

Zero-Shot Next-Item Recommendation using Large Pretrained Language Models

Lei Wang, Ee-Peng Lim

专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09839 2025-07-24 eess.SP cs.IT math.IT 87%

AI and Deep Learning for Terahertz Ultra-Massive MIMO: From Model-Driven Approaches to Foundation Models

Wentao Yu, Hengtao He, Shenghui Song, Jun Zhang, Linglong Dai, Lizhong Zheng, Khaled B. Letaief

专题命中 领域大模型 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 30 pages, 8 figures, 1 table, accepted by Engineering. Model-driven deep learning, CSI foundation models, and applications of LLMs are presented as three systematic research roadmaps for AI-enabled THz ultra-massive MIMO systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13786 2026-08-17 cs.IR cs.AI cs.CL 新提交 87%

Do AI chatbots find what experts would? Effects of model, user role, and sample size on study retrieval for medical questions

AI聊天机器人能否找到专家会选择的研究?模型、用户角色和样本量对医学问题研究检索的影响

Qingfang Liu, Qiao Jin, Joe D. Menke, Thorsten Kahnt, Zhiyong Lu

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究评估Claude Sonnet 5、Gemini 3.1 Pro、ChatGPT GPT-5.5三款LLM聊天机器人在模拟三种用户角色下的医学研究检索表现,发现其召回率因模型、角色差异显著,且存在偏向大样本临床试验的偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05375 2026-08-07 cs.AI cs.LG cs.MA 新提交 87%

DoctorAgents: an agentic framework to iteratively refine AutoML pipeline for small clinical temporal data

DoctorAgents:用于针对小型临床时序数据迭代优化自动机器学习流水线的智能体框架

Ruilin Wang, Bo-Hong Wang, Elizabeth Kourbatski, Jun Bai, Hegang Chen, Ziyang Song, Gilles Boire, Marie Hudson, Yue Li

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) CIUSSSE-CHUS(谢布鲁克大学医学中心综合大学健康和社会服务中心) University of Sherbrooke(谢布鲁克大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DoctorAgents是一种用于小型临床时序数据的智能体框架,通过LLM智能体以推理驱动方式迭代优化AutoML流水线,在多种临床任务上性能优于现有AutoML基线且可解释性更强。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05151 2026-08-07 cs.CL cs.AI 新提交 87%

Simulator-Grounded Large Language Models for Industrial Causal Reasoning: Tool-Use, Structured Injection, and Plant-Portable Retrieval for Wastewater Treatment Decision Support

面向工业因果推理的模拟器驱动大语言模型:用于污水处理决策支持的工具使用、结构化注入及工厂可迁移检索

Gary Simethy, Daniel Ortiz Arroyo, Petar Durdevic

机构 * Aalborg University(奥尔堡大学)

专题命中 领域大模型 :large language model(title);language model(title);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 该研究对比三种适配Qwen2.5-32B-Instruct模型的方法,在污水处理因果问答任务中,DRR检索器兼具高准确率、跨工厂迁移能力及训练高效性,优于其他方法与基线。

Comments 20 pages, 2 figures, 8 tables. Preprint submitted to Elsevier

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21084 2026-08-06 cs.CL cs.AI 版本更新 87%

MediRec: Enhancing Chinese Medication Recommendation with Explainable Clinical Reasoning

代谢性疾病出院药物推荐中的大型语言模型应用

Juntao Li, Haobin Yuan, Ling Luo, Yuanyuan Sun, Jian Wang, Hongfei Lin

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在中文代谢性疾病出院药物推荐中的应用,评估了多种LLM家族的性能,发现监督微调虽提升效果,但仍有改进空间。

Comments Accepted by NLPCC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28692 2026-08-03 cs.AI cs.CL 新提交 87%

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

SciToolAgent-Evo:一种面向开放世界科学工具获取的本体感知自进化智能体

Yuqi Tang, Chenyi Zhou, Libin Wang, Keyan Ding, Qiang Zhang, Huajun Chen

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体依赖静态工具空间难以适配开放世界科学工作流的问题,提出SciToolAgent-Evo本体感知自进化智能体,结合进化记忆与本体化工具图,利用LinUCB平衡探索利用,推出OpenSciToolBench基准并取得最优性能。

Comments 19 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24817 2026-07-29 cs.IR cs.AI cs.CL 新提交 87%

Retrieval-Augmented Generation in LLMs for Mental Health: Quantifying the Incremental Contribution of Retrieval Within a Layered Safety Architecture

大语言模型在心理健康领域的检索增强生成:量化分层安全架构中检索的增量贡献

Anand Gupta, Akshat Surolia, Shubham Mishra, Shakil Imtiaz, Chaitali Sinha

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究数字心理健康干预中,通过在名为Wysa的DMHI里对比启用和禁用检索增强生成(RAG)模式,评估六个大语言模型,计算相关指标并测试差异,发现RAG虽致误报增加,但符合安全原则,是提升LLM驱动的DMHIs相关性能的有前景方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15380 2026-07-20 cs.CL cs.AI 新提交 87%

Large Language Models as Unified Multimodal Learners for Clinical Prediction

作为临床预测统一多模态学习者的大语言模型

Ajay Madhavan Ravichandran, Bilgin Osmandoja, Klemens Budde, Klaus Netter, Tobias Strapatsas, Aljoscha Burchardt, Sebastian Möller, Roland Roller

机构 * German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Charité Universitätsmedizin Berlin(柏林夏里特大学医学中心) DNC Information Management GmbH(DNC信息管理有限公司) Klinik für Akut- und Notfallmedizin, Asklepios Klinikum Harburg(哈堡阿斯克勒庇俄斯医院急性与急诊医学科) Technical University Berlin(柏林工业大学)

专题命中 领域大模型 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨利用大语言模型进行临床预测,提出将不同模态患者数据转为自然语言序列,端到端微调预训练语言模型的方法,经三个临床任务评估,该方法匹配或超越多模态基线,优于临床梯度提升系统,降低系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29540 2026-06-30 cs.DL cs.AI cs.CL 87%

Em-ergence of the em-dash: a population-level rise in em-dash frequency in medRxiv preprints at the dawn of the large-language-model era

Em-破折号的涌现:大型语言模型时代初期 medRxiv 预印本中 em-dash 频率的群体水平上升

Przemysław Czuma

机构 * Polish Association for Artificial Intelligence in Medicine(波兰人工智能与医学协会)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析 medRxiv 预印本讨论部分,发现 ChatGPT 发布后 em-dash 使用率从 4.23% 升至 11.58%,表明 LLM 时代科学写作风格发生了显著变化。

Comments 22 pages, 5 figures. Pre-registered on OSF (osf.io/HFT8C). Companion to a pre-registered audit of Unicode fidelity in biomedical bibliographic APIs (arXiv:2606.24897)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19710 2026-06-19 cs.CL cs.AI 新提交 87%

FineREX: Fine-Tuned NER-RE for Human Smuggling Knowledge Graphs

FineREX: 面向人口走私知识图谱的微调NER-RE

Elijah Feldman, Dipak Meher, Carlotta Domeniconi

机构 * Thomas Jefferson High School for Science and Technology(托马斯·杰斐逊科技高中)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出FineREX,一个基于微调LLM的流水线,用于从法律文档中提取实体和关系构建知识图谱,在F1分数上分别提升15.50%和31.46%,并减少50%处理时间。

Comments Code available at https://github.com/ElijahFeldman7/FineREX

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19640 2026-06-19 cs.CL cs.AI cs.HC 新提交 87%

Creating Multilingual Mental Health Dialogue Datasets: Limits of Persona-Based Localization via Nationality and Language

创建多语言心理健康对话数据集:基于国籍和语言的人物角色本地化方法的局限性

Yunkai Xu, Saeed Abdullah

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过修改人物角色中的国籍和语言参数生成中文、孟加拉语和印地语临床对话,发现仅添加这些参数会导致跨语言临床不一致,且LLM评估非英语文本的抑郁严重度时存在不准确性。

Comments 15 pages, 4 figures. Accepted to the 2026 Workshop on Computational Linguistics and Clinical Psychology (CLPsych 2026), co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18699 2026-06-18 cs.CL cs.AI cs.IR 新提交 87%

TW-LegalBench: Measuring Taiwanese Legal Understanding

TW-LegalBench: 衡量台湾法律理解

Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

机构 * University of Rochester(罗切斯特大学) National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TW-LegalBench基准,包含多项选择、开放式问答和法律判决预测任务,评估13个LLM在台湾法律上的表现,发现顶尖模型通过律师考试但未达到法官检察官标准,且法律条文引用困难。

Comments 10 pages, 2 figures, To appear in ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20275 2026-06-18 cs.LG cs.CL q-bio.QM 87%

A Systematic Review on the Generative AI Applications in Human Medical Genomics

关于生成式AI在人类医学基因组学中的应用系统综述

Anton Changalidis, Yury Barbitoff, Yulia Nasykhova, Andrey Glotov

机构 * Dpt. of Genomic Medicine(基因组医学系) D.O. Ott Research Institute of Obstetrics, Gynaecology, and Reproductology(D.O. Ott妇产科与生殖医学研究所)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文系统综述了生成式AI在罕见和常见疾病遗传研究与诊断中的应用,分析了LLM在基因组变异识别、注释及医学影像中的作用,指出其在多模态数据整合和临床应用中的挑战。

Comments 31 pages, 5 figures

Journal ref Frontiers in Genetics 16 (2026) 1694070

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09962 2026-06-10 cs.LG cs.AI cs.SD 新提交 87%

Optimality of FSQ Tokens for Continuous Diffusion for Categorical Data with Application to Text-to-Speech

FSQ 令牌在分类数据连续扩散中的最优性及其在文本到语音中的应用

Vadim Popov, Wenju Gu, Tasnima Sadekova, Georgii Aparin, Assel Yermekova

机构 * Huawei Noah's Ark Lab(华为诺亚实验室) National Research University Higher School of Economics(俄罗斯国家研究大学高等经济学院) National University of Science and Technology MISIS(俄罗斯科学与技术国立大学MISIS)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究连续扩散模型中离散令牌的潜在空间结构,通过理论分析和实验证明 FSQ 令牌化方案在分类数据连续扩散中最优,并在文本到语音任务中验证其优于基于 LLM 的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02221 2026-06-10 cs.LG cs.AI 版本更新 87%

MedFeat: Model-Aware and Explainability-Driven Feature Engineering with LLMs for Clinical Tabular Prediction

MedFeat: 基于模型感知与可解释性驱动的LLM特征工程用于临床表格预测

Zizheng Zhang, Yiming Li, Justin Xu, Jinyu Wang, Rui Wang, Lei Song, Jiang Bian, David W Eyre, Jingjing Fu

机构 * Microsoft Research(微软研究院) University of Oxford(牛津大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.AI、cs.LG

AI总结 提出MedFeat框架,利用模型感知和特征重要性信号迭代引导LLM生成针对性特征,在临床表格预测中平均提升超10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08969 2026-06-09 cs.CL cs.AI 新提交 87%

CARE: A Conformal Safety Layer for Medical Summarization

CARE:面向医学摘要的保形安全层

Suhana Bedi, Bridget Lin, Anson Y. Zhou, Chloe O. Stanwyck, Jenelle A. Jindal, Sanmi Koyejo, David Stutz, Nigam H. Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CARE方法,通过保形风险控制为LLM医学摘要提供校准的遗漏和幻觉标记,在保证安全性的同时减少审查负担。

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06823 2026-06-08 cs.LG cs.AI q-fin.ST 新提交 87%

PandaAI: A Practical Agent CQ2 for Neuro-symbolic Data Analysis And Integrated Decision-Making in Quantitative Finance

PandaAI: 一种用于量化金融中神经符号数据分析与集成决策的实用智能体CQ2

Yuqi Li, Siyuan Liu, Bingjun Liu

机构 * Panda AI

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对金融数据低信噪比和非平稳性,提出PandaAI,一种结合市场状态建模与约束alpha生成的闭环神经符号LLM智能体,通过领域微调和模块化架构实现风险感知决策,在沪深300数据上Rank IC提升18.2%,最大回撤降低25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06473 2026-06-05 cs.AI cs.CL 87%

MLEvolve: A Self-Evolving Framework for Automated Machine Learning Algorithm Discovery

MLEvolve:一种用于自动化机器学习算法发现的自我进化框架

Shangheng Du, Xiangchao Yan, Jinxin Shi, Zongsheng Cao, Shiyang Feng, Zichen Liang, Boyuan Sun, Tianshuo Peng, Yifan Zhou, Xin Li, Jie Zhou, Liang He, Bo Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) East China Normal University(东华大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出MLEvolve框架,通过渐进式MCGS、回溯记忆和分层控制解决LLM智能体在长期任务中的信息隔离、无记忆搜索和缺乏分层控制问题,在MLE-Bench和数学算法优化任务上取得最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02632 2026-06-03 stat.ML cs.AI cs.CY cs.LG econ.EM stat.AP 87%

Position: Prioritize Identifying Structure, Not Complex Models, for Scientific Discovery

立场:优先识别结构,而非复杂模型,以促进科学发现

Tyler H. McCormick

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文论证现代机器学习在高维代理机制下存在通用欠定性,提出“机制性机器学习”的具体标准,以确保以LLM为中心的工作流真正支持科学而非模拟科学。

Comments Will appear as a position paper in ICML

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22109 2026-04-28 cs.HC cs.AI cs.CL 87%

Spontaneous Persuasion: An Audit of Model Persuasiveness in Everyday Conversations

自发说服:日常对话中模型说服力的审计

Nalin Poungpeth, Nicholas Clark, Tanu Mitra

机构 * University of Washington(华盛顿大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了日常对话中模型说服力的自发性,通过审计五种LLM发现其在多轮对话中频繁使用信息类说服策略,而在心理健康话题中更倾向情感类策略,与人类回应的社交影响策略形成对比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07963 2026-04-23 cs.CL cs.AI 87%

Caught in the Web of Words: Do LLMs Fall for Spin in Medical Literature?

陷入词语的网络:大型语言模型是否在医学文献中受偏见影响?

Hye Sun Yun, Karen Y. C. Zhang, Ramez Kouzy, Iain J. Marshall, Junyi Jessy Li, Byron C. Wallace

机构 * Northeastern University, Boston, MA, USA(东北大学,波士顿,马萨诸塞州,美国) The University of Texas MD Anderson Cancer Center, Houston, Texas, USA(德克萨斯大学MD安德森癌症中心,休斯顿,德克萨斯州,美国) King’s College London, London, UK(伦敦国王学院,伦敦,英国) The University of Texas at Austin, Austin, Texas, USA(德克萨斯大学奥斯汀分校,奥斯汀,德克萨斯州,美国)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型(LLM)在处理医学文献时是否受作者偏见影响,发现LLM比人类更容易受偏见影响,但可通过提示减少其影响。

Comments 26 pages, 17 figures, 4 tables, Conference on Health, Inference, and Learning (CHIL) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20548 2026-04-23 cs.CL cs.AI cs.DL cs.IR 87%

Enhancing Research Idea Generation through Combinatorial Innovation and Multi-Agent Iterative Search Strategies

通过组合创新和多智能体迭代搜索策略增强研究想法生成

Shuai Chen, Chengzhi Zhang

机构 * Department of Information Management, Nanjing University of Science and Technology(南京理工大学信息管理学院)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合迭代知识搜索与LLM多智能体系统的框架,通过反复交互生成、评估和优化研究想法,提升多样性与新颖性,在自然语言处理领域实验表明优于现有基线方法。

Comments Scientometrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02368 2026-04-22 cs.AI cs.CL 87%

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Xpertbench:基于评分标准的专家级任务

Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xinyu Chen, Yida Ding, Tianci He, Jiani Hou, Liang Hu, Ziyun Huang, Yongzhe Hui, Jianpeng Jiao, Chennan Ju, Yingru Kong, Yiran Li, Jiashuo Liu, Mengyun Liu, Luyao Ma, Fei Ni, Yiqing Ni, Pengbo Niu, Yueyan Qiu, Yanle Ren, Xinyu Shen, Zilin Shi, Zaiyuan Wang, Wenjie Yue, Chun Zhang, Shiyu Zhang, Xinyi Zhang, Kaiwen Zhao, Zhenwei Zhu, Shanshan Wu, Qi Zhao, Wenhao Huang

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 XpertBench通过精心设计的高保真任务评估LLM在专业领域的能力,揭示了当前AI系统在专家级任务上的性能瓶颈,展示了模型在不同领域中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04740 2026-04-21 cs.CL cs.AI 87%

StealthGraph: Exposing Domain-Specific Risks in LLMs through Knowledge-Graph-Guided Harmful Prompt Generation

StealthGraph:通过知识图谱引导的有害提示生成暴露领域特定风险

Huawei Zheng, Xinqi Jiang, Sen Yang, Shouling Ji, Yingcai Wu, Dazhen Deng

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出StealthGraph框架,通过知识图谱生成领域相关的隐式有害提示,解决领域知识转化为约束和提升提示隐式的挑战,推动LLM安全研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13285 2026-04-16 cs.CL cs.AI 87%

L2D-Clinical: Learning to Defer for Adaptive Model Selection in Clinical Text Classification

L2D-Clinical:在临床文本分类中学习延迟以实现自适应模型选择

Rishik Kondadadi, John E. Ortega

机构 * University of Minnesota, Northeastern University Minneapolis, Boston, USA(明尼苏达大学、东北大学)

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出L2D-Clinical框架,通过不确定性信号和文本特征决定在BERT和LLM之间延迟决策,提升临床文本分类的准确率,实验表明在ADE检测和治疗结果分类任务中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏