Towards Ontology Construction with Language Models
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.AI
Comments KBC-LM'23: Knowledge Base Construction from Pre-trained Language Models workshop at ISWC 2023
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 领域大模型 :language model(title,abstract);large language model(abstract);分类 cs.AI
Comments KBC-LM'23: Knowledge Base Construction from Pre-trained Language Models workshop at ISWC 2023
基准测试用于小样本医学图像分割的基础模型与大语言模型
专题命中 领域大模型 :large language model(title);language model(title)
AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。
Cleo:一款用于会话式商务的透明且可控制的聊天机器人
专题命中 领域大模型 :LLM(summary_cn,abstract);prompting(abstract)
AI总结 Cleo是一款用于会话式商务的透明可控制聊天机器人,通过混合架构、可审计排序机制等解决LLM的不透明性等问题,为产品搜索决策提供支持。
DeepImagine: 通过连续反事实想象学习生物医学推理
机构 * Laboratory for Emerging Intelligence, University of California, San Diego(新兴智能实验室,加州大学圣地亚哥分校) ; Department of Dermatology, University of California, San Diego(皮肤科系,加州大学圣地亚哥分校) ; University of Chicago(芝加哥大学) ; Elsevier(艾尔斯特出版社)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出DeepImagine框架,通过连续反事实想象训练语言模型进行生物医学推理,利用反事实对偶和强化学习提升临床试验预测性能,展示模型在生物医学领域的可解释性改进。
Comments Preprint
EMBL AI Librarian:面向AI智能体的生命科学知识层
专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究推出EMBL AI Librarian,为AI智能体升级Europe PMC接口,通过LLM统筹检索,在多基准任务中提升性能,代码已公开。
猜猜你要去哪里:高德地图中的生成式下一个兴趣点推荐
专题命中 领域大模型 :LLM(summary_cn,abstract);pretraining(abstract)
AI总结 该研究提出Gwhere框架,结合SID生成与LLM生成式下一个POI推荐,经实验验证其在高德地图中可提升P-CTR和U-CTR,已部署应用且效果显著。
Comments 10 pages, 4 figures
说什么?审视计算教育中基于提示的编程的文本和语音输入方式
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 探索编程入门学生用文本或语音输入解决提示问题的情况,发现输入文本提示的学生更易首次尝试成功,多数学生偏好文本,定性分析揭示学生对两种输入方式的看法及优缺点,为计算教育多模态工具和教学设计提供启示。
Comments ITiCSE'26 paper
将跨领域动作序列抽象为可解释的工作流
机构 * Microsoft Corporation(微软公司)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出WorkflowView框架,利用大语言模型将低层动作序列抽象为高层活动,在三个不同任务中验证了有效性和泛化能力,实现高语义相似度和预测性能。
Comments preprint; 9 pages, 5 figures
MDForge:稀疏模拟器反馈下的智能分子动力学流水线设计
机构 * University of Notre Dame(圣母大学) ; University of Connecticut(康涅狄格大学)
专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出MDForge,利用LLM智能体通过多智能体辩论将稀疏奖励稠密化,自动设计分子动力学流水线,在SAMPL基准上达到专家水平,并发现新型高亲和力CB[7]结合剂。
DynaMate2:使代理AI民主化,用于专家设计的定制工作流
专题命中 领域大模型 :LLM(summary_cn,abstract);foundation model(abstract)
AI总结 本文提出DynaMate2,一种分层代理框架和开源模板,旨在降低研究人员将现有专家定义的Python函数转换为AI可调用工具的门槛,通过让LLM负责任务路由和工具选择,而非生成科学代码,从而实现自动化科学工作流的民主化。
TRIAGE: 基于辩证推理的不规则采样医学时间序列风险可解释预测方法
机构 * KAIST(韩国科学技术院) ; AITRICS ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出TRIAGE框架,利用大语言模型对竞争性临床结果生成辩证推理,缓解风险极化,实现连续风险评分与可解释推理,在三个基准上AUPRC提升3.3%,校准误差降低81%。
Comments Code is available at https://github.com/HyeongWon-Jang/TRIAGE
TRACER: 面向生成式推荐中概念擦除的令牌重分配
机构 * Stony Brook University(石英布鲁克大学) ; University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) ; Columbia University(哥伦比亚大学) ; Institute of Science and Technology Austria(奥地利科学技术研究院) ; Sapienza University of Rome(罗马大学 sapienza) ; National University of Singapore(新加坡国立大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对生成式推荐中概念遗忘与推荐效用冲突的问题,提出基于令牌重分配的概念遗忘框架TRACER,通过将概念相关物品重分配给替代令牌并引入一致性正则化,有效移除目标概念同时保持推荐效用。
超越知识到能动性:用CNFinBench评估金融领域的专业知识、自主性和完整性
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出CNFinBench基准,通过专业知识、自主性和完整性三维度评估LLM在金融领域的代理能力,并引入HICS指标量化多轮对抗攻击下的安全退化。
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
正确的推理策略即是一切:面向EgoCross挑战的近乎无需训练的领域感知推理
机构 * HKUST(GZ)(香港科技大学(广州)) ; HKUST(香港科技大学) ; Knowin
专题命中 领域大模型 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 针对EgoCross挑战中源受限场景下多模态大模型在领域偏移严重的自我中心视频问答任务上表现不佳的问题,提出一种领域感知推理策略,通过为四个目标领域分别设计不同的输入、提示和答案映射流程,在不进行额外训练的情况下显著提升基线模型性能。
通用嵌入还是特定嵌入,哪个更好?非英语语言临床编码搜索的实证研究
机构 * TietAI
专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本研究通过使用大型生成语言模型生成的合成数据微调双语编码器,构建两阶段检索器,解决了非英语语言临床编码检索中召回率下降的问题,并在多语言基准上取得了优于BioBERT-ST的性能。
Comments 24 pages, 12 figures, 6 tables
SAMD:一种识别AI/ML医疗设备中虚假数据注入场景的工具
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出SAMD工具,基于STPA-Sec和LLM自动化识别AI/ML医疗设备设计阶段的虚假数据注入漏洞与攻击场景,在五个FDA批准设备上验证了高精度与效率。
Comments 10 pages, 6 figures, 3 tables
压力测试LLM中的欺骗探针:扩展性、鲁棒性与欺骗表示的几何结构
机构 * LexisNexis(LexisNexis公司)
专题命中 领域大模型 :LLM(title_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文通过系统压力测试,诊断线性探针在分布偏移下失效的原因,发现风格增强可恢复近完美检测,并证明欺骗编码非单一线性方向或熵代理,而是分布式亚阈值特征。
Comments Accepted at the GEM Workshop @ ACL 2026
optimize_anything: 一个用于优化任何文本参数的通用API
机构 * MIT(麻省理工学院)
专题命中 领域大模型 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种基于LLM的通用优化系统,能够跨不同领域实现文本参数的优化,展示了其在六个多样化任务中的state-of-the-art性能,通过多任务搜索和跨问题迁移实现了高效的优化。
Comments 16 pages, 11 figures; Blog: https://gepa-ai.github.io/gepa/blog/2026/02/18/introducing-optimize-anything/
Journal ref Proceedings of the ACM Conference on AI and Agentic Systems (CAIS 26), May 26-29, 2026, San Jose, CA, USA
从用户数字痕迹中可解释地检测抑郁状态转变
机构 * DIMES, University of Calabria(DIMES,卡塔尔大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出一个可解释框架,通过结合多个BERT模型提取多维信号,构建用户轨迹以识别抑郁状态转变,利用大语言模型生成可读报告,提升解释性。
TabDLM:通过联合数值-语言扩散生成自由形式表格数据
机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) ; Peking University(北京大学) ; Ant Group(蚂蚁集团)
专题命中 领域大模型 :LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出TabDLM,通过联合数值-语言扩散模型生成包含文本、分类和数值特征的自由形式表格数据,有效解决多模态数据生成难题。
Comments Preprint
守护暗物质:一种语义增强的神经符号框架用于opaque工业软件的供应链分析
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出一种语义增强的神经符号框架,通过直接从opaque二进制中重建行为语义,实现可扩展的全局风险推理,提升供应链分析的准确性和语义映射精度。
Comments 33 pages, 13 figures
ViLegalNLI:越南法律文本的自然语言推理
机构 * University of Information Technology(信息技术大学) ; Vietnam National University(越南国家大学)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出ViLegalNLI,首个针对法律领域构建的越南语自然语言推理数据集,包含42,012个前提-假设对,涵盖多种法律领域,用于评估法律推理的结构逻辑与术语一致性。
Comments 33 pages, 17 figures
学习隐藏风险:面向金融领域的可控多轮红队测试框架
机构 * Bloomberg(彭博社) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Florida International University(佛罗里达国际大学) ; Boise State University(博伊西州立大学)
专题命中 领域大模型 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出CoRT框架,通过可控的多轮红队测试方法,针对金融领域潜在风险进行隐蔽攻击,提升LLM在监管合规方面的安全性。
Comments Accepted for ACL'26 (Main). TL;DR: We propose a controllable multi-turn risk-concealed red-teaming framework, CoRT, that progressively conceals surface-level risk while exploiting regulatory-violating behaviors on a proposed new benchmark, FinRisk-Bench
面向所有人的代码:Vibe Coding黑客松在编程教育中的应用
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文通过为期一个月的在线黑客松活动,探讨了Vibe Coding在不同技能水平编程教育中的教育价值,评估了AI生成代码对学习效果和项目质量的影响。
Comments 15 pages, 14 figures
MedProbeBench: 在深度证据整合中的系统性基准测试用于专家级医疗指南
机构 * Fudan University(复旦大学) ; Nanjing University(南京大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; University of Hong Kong(香港大学)
专题命中 领域大模型 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出MedProbeBench,首个利用高质量临床指南作为专家级参考的基准,通过1200+任务自适应评估标准和5130+原子性声明验证,评估17种LLM和深度研究代理在证据整合和指南生成中的能力差距。
什么使AI研究可重复?可执行知识图谱作为科学知识表示
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(知识图谱联合实验室)
专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出可执行知识图谱(xKG),通过整合文献中的代码片段和技术洞察,提升AI研究的可重复性,实验显示其在PaperBench上性能提升显著。
Comments ACL 2026
弥合可访问性测试中的解释鸿沟:通过大语言模型生成共情且法律意识的缺陷报告
专题命中 领域大模型 :large language model(title);language model(title)
AI总结 本文提出HEAR框架,通过语义切片和视觉定位重建UI上下文,注入残疾导向的人设并多层推理,生成共情且法律意识的缺陷报告,提升非专业人士对用户伤害和合规风险的认知。
SciNav:一种通用的科学编码任务代理框架
机构 * The Ohio State University(俄亥俄州立大学)
专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 本文提出SciNav框架,用于科学编码任务,通过相对判断指导的top-K搜索提升解决方案探索效率,优于直接提示和现有代理。
Comments Accepted by ICLR 2026
LLMDR:基于大型语言模型的混合数据在低资源环境下缺失数据恢复框架
专题命中 领域大模型 :large language model(title);language model(title)
AI总结 LLMDR通过两阶段框架结合DBSCAN聚类和多LLMs实现混合数据低资源环境下的缺失数据恢复,提升数据完整性和准确性。
行动者、框架和论点:利用大语言模型对金融新闻中气候话语的多十年计算分析
专题命中 领域大模型 :large language model(title);language model(title)
AI总结 利用大语言模型分析金融新闻中气候话语的演变,揭示了从风险与监管负担到经济机会与创新的转变,以及金融机构在其中的主导作用。