Toxicity in ChatGPT: Analyzing Persona-assigned Language Models
专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
MEDLAYXPLAIN: 医学视觉语言模型中的专家-外行差距基准测试
机构 * Seoul National University(首尔大学) ; Seoul National University Hospital(首尔大学医院) ; Seoul National University College of Medicine(首尔大学医学院) ; Sungkyunkwan University School of Medicine(成均馆大学医学院)
专题命中 领域大模型 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 提出首个大规模医学外行语言生成基准MedLayXPlain,包含12万+区域级样本和三层UMLS本体,通过HOVER管道构建外行描述,并引入轻量级评估器MedLayEval,揭示当前医学VLM在外行可读性与临床精度间的系统性差距。
Comments 40 pages (10 pages main text, 30 pages appendix), 4 main figures, 33 vision-language models benchmarked
机构 * King AI Labs, Microsoft Gaming(King AI实验室,微软游戏) ; KTH Royal Institute of Technology(皇家理工学院) ; Kreditz AB(Kreditz公司) ; Fever Energy(Fever能源)
专题命中 领域大模型 :foundation model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI、cs.LG
Comments Accepted and presented at NeurIPS 2025 Workshop on Recent Advances in Time Series Foundation Models (BERT2S)
专题命中 领域大模型 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI
Comments 5 pages, 1 figure. Accepted by the Workshop on Long-Context Foundation Models (LCFM) at ICML 2024
MITRE-SAGE:一种多智能体网络安全问答模型
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对网络安全领域LLM的不足,研究提出多智能体框架MITRE-SAGE,结合MITRE-QA基准验证其在多项网络安全问答任务中优于基线方法,轻量级配置表现突出。
合成特征提取器:一种用于算法选择的智能体方法
机构 * TU Wien(维也纳技术大学) ; University of Lleida(莱里达大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究提出一种基于LLM的智能体方法,通过检查-修复-验证循环合成可解释的特定问题特征提取器,在三类组合问题上的算法选择性能优于现有专家设计特征与Transformer变体。
LSem2Vec:一种简单且有效的源代码嵌入两阶段方法
机构 * Macau University of Science and Technology(澳门科学技术大学) ; Macau University of Science and Technology Zhuhai MUST Science and Technology Research Institute(澳门科学技术大学珠海 MUST 科技研究院) ; Nanjing University(南京大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 LSem2Vec是结合LLM与句子嵌入模型的两阶段源代码嵌入方法,无需特定任务训练,在三个多语言数据集上优于五种无监督基线,可推进软件工程领域发展。
Comments To be published in Frontiers of Computer Science
生成式上下文与受控状态:可问责纵向临床推理的功能条件
机构 * MyndwareMed(迈恩德韦尔医疗)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文区分生成式上下文与受控状态,定义可问责临床AI的审计标准与信息要求,提出六级成熟度框架,将当前LLM临床实践定位于高能力低成熟度,为可问责临床AI提供概念与审计工具。
流程图表工程中的大语言模型:从最优工艺流程图到经验证的管道及仪表流程图
机构 * Skoltech(斯科尔科沃科技学院) ; AIRI(人工智能研究院(AIRI))
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究提出P&ID Pilot端到端AI流水线,结合GA与LLM生成最优PFD,再通过基于LLM的智能体将其转换为100%执行成功的合规P&ID,实现工艺设计自动化并减少人工工作量。
优化不平衡设置下的延迟策略
机构 * Google Research(谷歌研究) ; Courant Institute of Mathematical Sciences(Courant数学科学研究所)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文研究了在专家不平衡情况下两阶段学习延迟方法,提出新的成本敏感学习算法MILD,通过改进损失函数和保障机制,提升了图像分类和LLM路由任务的性能。
Comments ICML 2026
AquiLLM:支持研究群体中隐性知识捕获的架构
机构 * Southern Oregon University(南俄勒冈大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AquiLLM是一款采用开放权重模型的开源模块化RAG-LLM框架,经领域专家反馈优化了架构与功能,可支持研究群体捕获隐性知识,助力AI贴合科研实践。
Comments Accepted for publication in the NGEN-AI 2026 proceedings
EmoPatient:用于姑息治疗沟通训练的情绪导向患者模拟器
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对现有LLM患者模拟器无法捕捉动态情绪变化的问题,提出情绪导向的EmoPatient模拟器,引入情绪指导代理生成动态情绪控制信号,经评估其在情绪真实性指标和稳健性上均优于基线,可提升姑息治疗沟通训练的真实性。
AutoRefine: 从轨迹到可重用的专业知识为连续LLM代理优化
机构 * alibaba(阿里巴巴集团)
专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AutoRefine通过提取和维护双重形式的经验模式,提升连续LLM代理的知识积累与维护效率,实现98.4%的准确率提升。
Comments 7 pages, 2 figures, 3 tables
刻画门诊病历与结构化电子健康记录(EHR)药物史中的治疗情境药物证据
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究针对门诊病历与结构化EHR药物史的药物信息差异,开发结合LLM、人工审核等的标准化方法,通过患者级测试集验证,明确不匹配原因并提升了药物信息一致性。
Comments 9 pages, 3 figures. Submitted to IEEE BIBM 2026
Drawing-Recode:基于栅格2D CAD图纸的参数化CAD代码生成的标注定位方法
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI
AI总结 Drawing-Recode是一种从栅格2D CAD图纸生成参数化CAD代码的框架,通过图像编码器、文本识别模块、交叉注意力与AGL实现标注定位,性能优于基线且对工业扫描图纸鲁棒,可助力制造自动化。
TRWH:用于语义感知稀疏推荐的文本驱动随机游走异构图神经网络
机构 * The University of Sydney(悉尼大学) ; Nankai University(南开大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对稀疏推荐中整合GNN与LLM优势的挑战,提出TRWH框架,通过随机游走增强融合文本概要与异构图结构,含嵌入创建、异构图神经网络、随机游走路径构建三组件,实验表明其在时尚和美妆数据集上性能远超现有方法。
用于乳腺癌治疗建议的智能体系统
机构 * Spesia(斯佩西亚) ; Faculdade de Medicina, Universidade de São Paulo(圣保罗大学医学院) ; Laboratory of Artificial Intelligence Applied to Bioinformatics, SEPT, Universidade Federal do Paraná (UFPR)(巴拉那联邦大学人工智能应用于生物信息学实验室,SEPT) ; Pontifícia Universidade Católica do Paraná (PUCPR)(巴拉那天主大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究评估用于乳腺癌治疗建议的智能体LLM系统,用72个真实临床病例和1147个特定病例量表,比较七种流程,最佳配置全局得分为0.594±0.025,工具使用和智能体自主性影响各异,虽能生成相关建议,但用于无监督临床使用仍不足。
Comments Under peer review. Source code available at: https://github.com/GRUPOMED4U/breast_cancer_agents_paper
首先,不伤害:迈向临床安全的大语言模型
机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) ; Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) ; Harvard Medical School(哈佛医学院) ; Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) ; Stanford University(斯坦福大学) ; Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) ; Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) ; Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) ; Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) ; Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) ; Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) ; Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) ; Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) ; Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) ; Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) ; Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) ; Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) ; Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。
用于法律信息处理的跨架构大语言模型集成、基于特征的重新排序和检索增强提示
机构 * Durham University(杜伦大学) ; Jazan University(吉赞大学)
专题命中 领域大模型 :prompting(title,abstract);LLM(title);分类 cs.CL
AI总结 该研究参与COLIEE 2026五项法律信息处理任务,采用开放权重系统。核心方法包括跨架构模型集成、基于特征重新排序及检索增强提示。在多任务中取得不同成果,如法规蕴含任务准确率高,展示了不同方法在不同任务设置下的有效性。
Comments 10 pages. Team DU participation in all five tasks of COLIEE 2026
AI辅助计算可复现性在FABRIC试验台上的研究
机构 * RENCI, University of North Carolina at Chapel Hill, NC, USA(RENCI,北卡罗来纳大学教堂山分校) ; University of Massachusetts Amherst, MA, USA(马萨诸塞大学阿姆赫斯特分校)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 利用FABRIC试验台和LLM编码助手LoomAI,通过三个跨领域案例研究,展示了AI辅助工作流将复现实验的工作量减少约4-6倍,但在分析阶段仍需人工指导。
通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性
机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) ; Radiology, Massachusetts General Hospital(麻省总医院放射科) ; Harvard Medical School(哈佛医学院) ; Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) ; Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) ; Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) ; Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) ; Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) ; Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) ; Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) ; Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) ; Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) ; Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。
Comments MICCAI 2026
LLMs在刑事法律语境中被提示为法律上下文对象:小型本地LLM的过度拒绝
机构 * IEM, HEG, HES-SO Valais-Wallis(瓦莱州-瓦利斯高等专业学院,管理与工程学院,经济与酒店管理学院)
专题命中 领域大模型 :LLM(title_cn,summary_cn);分类 cs.AI
AI总结 研究小型本地LLM在法律提示中的过度拒绝现象,发现权威性前缀(如“国家最高法院助理”)使拒绝率提高2-20倍,而角色扮演前缀效果不一,表明模型在真实机构用户可能引入的上下文框架下不稳定。
一种基于LLMs的新型分层多智能体系统用于支付
机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息学院) ; Research and Development, Mastercard(万事达卡研发部)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出HMASP系统,通过分层多智能体架构实现端到端支付流程自动化,采用模块化设计和协调协议,首次实现基于LLM的支付智能体全流程。
Comments 12 pages, 1 figure, 3 tables. Accepted at PAKDD 2026
Journal ref In: Wong, R.CW., et al. Advances in Knowledge Discovery and Data Mining. PAKDD 2026. Lecture Notes in Computer Science(), vol 16598. Springer, Singapore
AIR:通过事件响应提升智能体安全性
机构 * Tianjin University(天津大学) ; Singapore Management University(新加坡国立管理学院)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出首个面向LLM智能体系统的事件响应框架AIR,通过语义检测、自动遏制恢复和规则合成,在三个典型智能体上实现超90%的检测、修复和根除成功率。
Comments Accepted at ICML 2026
ProfiLLM: 面向工业网约车调度的效用对齐智能用户画像
机构 * Didichuxing Co. Ltd(滴滴出行科技有限公司)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出ProfiLLM,一种通过工具增强全局知识挖掘和效用对齐画像探索的智能LLM数据管道,解决工业网约车调度中大规模行为日志的用户画像问题,在滴滴生产系统中实现AUC提升6.14%、GMV提升4.35%。
SciText2Eq: 评估大语言模型在科学创造力中的可解释方程生成
机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) ; Wageningen University & Research(瓦赫宁根大学及研究中心)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究大语言模型从科学文本生成数学方程的能力,构建AI论文数据集,提出可解释方程生成流程,并设计结合自动指标、LLM评估和人工判断的评估协议,发现LLM在语义准确性上表现不足。
Comments Accepted by findings of ACL 2026
法律领域推理中大语言模型的神经元级分析
机构 * Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; AIST(产业技术综合研究所)
专题命中 领域大模型 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL
AI总结 通过神经元归因分数识别并抑制关键神经元,发现存在任务特异性神经元和跨任务通用神经元,法律领域神经元重叠度高且分布受输入格式影响。
面向法律AI-TRISM的神经符号AI:可信、可靠、可解释、安全模型
机构 * Department of Computer Science, AI Institute, University of South Carolina(南卡罗来纳大学计算机科学系,人工智能研究所) ; Department of Computer Science and Electrical Engineering, University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校计算机科学与电气工程系) ; Department of Computer Science and Engineering, The Ohio State University(俄亥俄州立大学计算机科学与工程系)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对法律领域LLM缺乏可解释推理和易产生幻觉的问题,提出TRISM框架,融合神经符号AI与LLM,通过结构化法律知识集成和RAG验证机制提升模型可信度。
桥接被动与主动:通过主动表达建模增强对话启动推荐
机构 * Bytedance Beijing China(字节跳动北京中国)
专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对LLM驱动的对话搜索中被动推荐陷入回声室的问题,提出PA-Bridge框架,通过对抗分布对齐器桥接被动推荐与主动表达之间的分布差异,并引入语义离散化器实现流行度去偏,在线实验显著提升特征渗透率和用户活跃天数。
Comments Accepted by SIGIR 2026