CTP-LLM: Clinical Trial Phase Transition Prediction Using Large Language Models
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL
Comments preprint
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL
Comments Nineteenth International Conference on Artificial Intelligence and Law (ICAIL 2023)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)
专题命中 领域大模型 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments Technical Report for RETA-LLM
我们希望人工智能有多敏感?医疗领域大型语言模型的社会交际能力
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL、cs.AI
AI总结 本研究通过分析HELP-Med数据集的1800条对话,评估GPT 4o、Llama 3和Command R+三种LLM的医疗领域社会交际能力,发现其结构化表现差,需调整评估框架以适配人机差异。
使用开源小型语言模型进行临床术语提取
机构 * Informatics and Data Science Institute(信息学与数据科学研究所) ; Biomedical Informatics, Biostatistics and Medical Epidemiology Department(生物医学信息学、生物统计学与医学流行病学系) ; Department of Occupational Therapy(职业治疗系) ; University of Missouri, Columbia, Missouri, USA(密苏里大学哥伦比亚分校)
专题命中 领域大模型 :language model(title,abstract);small language model(title,abstract);SLM(abstract,abstract_cn);prompting(abstract)
AI总结 研究评估开源小型语言模型在无需训练数据的情况下,通过少样本提示从非结构化临床笔记中提取肌萎缩侧索硬化症相关术语,发现混合提取工作流优于单一模型。
MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试
机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI
AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。
Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026
M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用
机构 * DEEPNOID Inc.(DEEPNOID公司)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。
Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025
机构 * Sony Research India(索尼印度研究)
专题命中 领域大模型 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments 15 pages, 3 figures
机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(国家新型软件技术实验室,南京大学,中国) ; School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学,中国)
专题命中 领域大模型 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
Comments 21 pages, 4 figures, 8 tables
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract);foundation model(abstract)
专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);instruction tuning(abstract)
Comments Technical report. 13 pages. Demo: https://speechtranslation.github.io/llm-st/
通过差分故障注入验证大语言模型(LLM)现代化的科学软件
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究提出差分故障注入验证方法,以GAMESS为对象测试LLM现代化科学软件的正确性,发现转换后积分核与原始核一致,还暴露了精度降低时的并行死锁等问题。
KBSpec:基于演化领域知识库的LLM驱动形式化规约生成
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出KBSpec方法,利用外部官方文档和内部验证器反馈的双源知识增强LLM,通过自演化知识库持续更新成功轨迹,无需调参或标注数据,在JML规约生成上验证通过率提升10-25%。
声望胜过能力:对同行评审中大型语言模型(LLM)偏差的适应性审计
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究开发多角色LLM模拟系统,审计发现LLM在同行评审中存在偏差,机构声望是核心影响因素,低声望作者的论文更易被拒,训练数据的领域规范与声望先验是关键成因。
GenRec:Netflix 一款基于大语言模型的推荐排序器
专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 Netflix 提出基于 LLM 的推荐排序器 GenRec,通过两阶段后训练实现,在大规模 A/B 测试中,其用更少标注数据即可取得显著指标提升,推动推荐范式转变并总结了部署经验。
Comments 9 pages
一种用于检测人类偏见的反事实LLM框架:急诊分诊中性/性别案例研究
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出一种基于LLM的反事实框架,用于检测急诊分诊中性别偏见,发现女性比男性更可能获得较低严重程度评分,揭示了性别在医疗决策中的影响。
Comments Accepted for publication in npj Digital Medicine. This version incorporates revisions made during peer review. In Press
DriveCode: 针对基于LLM的自动驾驶的领域特定数值编码
机构 * School of Information Science and Engineering, Lanzhou University(兰州大学信息科学与工程学院) ; The School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动性学院) ; The Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) ; DiDi, Beijing, China(滴滴出行) ; State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(清华大学智能绿色车辆与移动性国家重点实验室)
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文提出DriveCode,一种将数字表示为专用嵌入而非离散文本标记的新型数值编码方法,提升LLM在自动驾驶中的数值推理与解码效率。
Comments The project page is available at https://shiftwilliam.github.io/DriveCode
当用户是LLM智能体时推荐算法是否有效?基于Moltbook的案例研究
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究LLM智能体作为用户时推荐算法的有效性,在Moltbook平台上评估八种方法,发现基于流行度和物品协同过滤的方法优于用户表示学习,表明推荐从个性化退化为结构模式匹配。
Comments 11 pages, 3 figures, 4 tables
SCALEFeedback:用于LLM生成教育反馈研究的大规模合成计算机科学作业数据集
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SCALEFeedback数据集,包含10,000份合成学生作业,覆盖59门大学计算机科学课程,用于开发基于LLM的可泛化自动教育反馈方法。
一种用于工业应用中基于LLM的Petri网可达性问题求解的两阶段反思与重提示框架
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种结合两阶段反思与重提示机制的LLM框架,用于解决工业制造系统中Petri网可达性问题,通过反思和重新澄清提高可行序列生成的准确性,实验表明该方法在多个LLM上均提升了可靠性和稳定性。
Comments Accepted to the 2026 IEEE Conference on Control Technology and Applications (CCTA). N pages, 2 figures, 3 tables
人类与LLM协作正在改变科学文本中的复杂性度量
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 研究利用2010-2025年arXiv摘要,发现2023年后LLM使用激增导致词汇更替率上升,且LLM风格指数与复杂性度量(词汇量、Heap定律和Zipf定律指数)的正相关关系变平缓,表明人机混合语言生态系统的涌现特性发生变化。
Comments 8 pages, 5 figures
用LLM和MCP集成教学软件工程:从课堂到工业实践
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究将LLM和MCP集成到软件工程协作教学模式中,通过嵌入驱动工具到教学、代码辅助和工程模拟,弥合传统教学与工业流程的差距,提升学生编程、问题解决和智能工具使用能力。
Comments Aceept by International Symposium on Educational Technology (ISET) 2026
基于LLM的聊天机器人是否足以支持计算机科学学生完成多项选择题练习?
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本研究评估了多种LLM聊天机器人在大学计算机科学多项选择题中的表现,并探讨其对学生学习的影响,发现GPT-4o和GPT-5表现最佳,但提供答案和解释并未普遍提升学生成绩。
Comments 13 pages (excluding references), 6 tables, 1 figure, 1 equation
EviRank: 基于证据的LLM排序置信度估计
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出EviRank方法,通过单次前向传播提取三种互补证据并聚合,结合位置感知校准,实现LLM排序的置信度估计与优化。
ACE: 面向LLM增强序列推荐的可控各向异性嵌入
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 针对LLM生成嵌入的强各向异性问题,提出ACE方法,通过线性自编码器结合L2正则化与重构损失控制嵌入分布,平衡几何均匀性与语义保持,在序列推荐中提升性能。
Comments Accepted by SIGIR 2026. 5 pages
超越静态响应:多智能体LLM系统作为社会科学研究的新范式
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文探讨了LLM系统从静态工具向完全智能体系统转变的潜力,提出了一种结构化框架来理解LLM智能体在社会科学研究中的多样化应用,从简单的数据处理器到复杂的多智能体系统,能够模拟涌现的社会动态,并指出在技术边界、方法论和伦理责任方面面临的挑战。
HSUGA:基于层次语义理解与群体感知对齐的LLM增强推荐
专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 HSUGA通过引入层次语义理解和群体感知对齐模块,解决LLM增强推荐中用户语义嵌入提取与利用的可靠性与适应性问题,提升推荐性能。
Comments Accepted by ACL 2026 Findings