Auditing Semantic Gains in Sequential Recommendation: A Lightweight Recovery Test
审计序列推荐中的语义增益:一种轻量级恢复测试
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
审计序列推荐中的语义增益:一种轻量级恢复测试
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 本研究提出轻量级可审计恢复测试LIME-Rec,结合三类专家模型在三个Amazon数据集上验证语义推荐增益源于真实物品-文本对应,为序列推荐的语义增益归因提供了透明方法。
分布偏移下预测模型帕累托前沿的学习
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 领域大模型 :foundation model(abstract);分类 cs.LG
AI总结 本研究提出Frontier Learning框架,将预训练模型库视为互补信息源,通过拼接白盒内部表示与黑盒预测输出构建特征,在分布偏移场景中提升预测性能,表现优于或相当于最强的单个复用策略。
Comments 28 pages, 4 figures, 3 tables
一种用于阿尔茨海默病可解释早期诊断的神经符号方法
专题命中 领域大模型 :foundation model(abstract);分类 cs.LG
AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。
LSR-Synth中的库可达性:反记忆化设计如何改变符号发现的测量
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 该研究在LSR-Synth基准下,对比语言模型先验与常规算子搜索的效果,发现固定词汇表已覆盖多数任务,语言模型候选仅在词汇表覆盖受扰时贡献显著,且严格分布外评估不改变该关系。
PlantBGC:基于无标签领域自适应与弱监督的植物生物合成基因簇发现Transformer
专题命中 领域大模型 :language model(abstract);分类 cs.LG
AI总结 该研究针对植物BGC标签稀缺问题,提出PlantBGC模型,通过无标签领域自适应与弱监督实现植物BGC的精准发现,提升了已知BGC的恢复率并缩短了基因座长度。
AWARE-FX:一种可审计的知识引导型AI系统,用于衡量企业外汇套期保值披露情况
机构 * University of Nottingham(诺丁汉大学)
专题命中 领域大模型 :LLM(abstract);分类 cs.CL
AI总结 本研究开发可审计的AWARE-FX系统,将企业年报文本转换为可追溯的套期保值披露指标,通过多维度实验验证其可靠性,为外汇风险管理提供可单独审计的决策支持架构。
Comments 40 pages, 4 figures, 12 tables. Preprint; not peer reviewed
重新思考医学影像中的人工智能:假设、现实与重构
专题命中 领域大模型 :foundation model(abstract);分类 cs.AI
AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。
Comments 10 pages, 2 figures
TREA-Net:用于登革热发病率预测的可迁移残差流行病学适配网络
专题命中 领域大模型 :foundation model(abstract);分类 cs.LG
AI总结 针对新监测系统数据不足的登革热预测问题,提出TREA-Net模型,结合环境时间序列SIR模型与轻量门控残差修正,跨区域迁移知识,在多数据集上提升预测性能,是适用于数据有限机构的预警框架。
SecDrift:测量人工智能生成代码中特定领域条件下的安全漂移
专题命中 领域大模型 :prompting(abstract);分类 cs.LG
AI总结 研究大语言模型在关键基础设施代码生成中特定领域提示的安全效果,提出SecDrift基准,通过多模型多领域评估发现行业提示安全优势不显著,模型选择影响大,强调模型选择是更可靠的安全杠杆并开源相关内容。
Comments 11 pages, 3 figures
基于共识,紧跟新兴科学:用于长期新冠的共识锚定多语料临床聊天机器人
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 针对长期新冠临床决策支持证据分散的问题,提出整合多来源的面向临床医生的聊天机器人,在检索增强流程中组织四个来源,经探索性自动评估,其平均评分与OpenEvidence相当,得分更高且变异性更低。
通过自我协商合同实现合作承诺
机构 * University of Washington(华盛顿大学)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 研究人工智能代理在多智能体世界中的合作问题,借鉴法律制度和契约,通过在时空博弈\CT中研究基于大型语言模型的代理使用不同合同表示,发现自我协商合同可改善合作结果。
基础模型引导的放射基因组学发现:将癌症基因组与癌症扫描联系起来
机构 * University Hospital RWTH Aachen(RWTH亚琛大学医院) ; TU Dresden(德累斯顿技术大学) ; TUD Dresden University of Technology(德累斯顿技术大学) ; Heidelberg University Hospital(海德堡大学医院)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 研究将基于Evo~2的基因组分析与临床成像结合,全基因组识别基因-表型关联。对TCGA队列体细胞突变用Evo~2预测严重程度评分,与放射组学特征关联。在TCGA-cRCC中恢复已知驱动基因,发现新的显著基因,证明该方法可发现传统方法难以察觉的基因-成像关联。
评估和保障智能科学合成中的引用忠实性
机构 * Seoul National University(首尔国立大学) ; BioNexus(生物 Nexus)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。
Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included
核磁共振解析作为一个智能体搜索问题,而非建模问题
专题命中 领域大模型 :LLM(abstract);分类 cs.LG
AI总结 研究针对NMR数据结构解析这一化学等领域的瓶颈,构建由冻结语言模型支持的自主智能体,将其解析过程视为受限搜索而非建模任务,在多个数据集上取得良好结果,为自动化光谱分析的多步骤编排框架提供了方向。
基于随机卷积特征的上下文时间序列分类
专题命中 领域大模型 :foundation model(abstract);分类 cs.LG
AI总结 研究时间序列分类,提出MASHT方法,结合MultiRocket和Hydra特征与预训练表格基础模型,绕过特定任务模型训练,在单变量任务中匹配最先进基线,多变量数据集上竞争力强。
在信息缺失情况下评估医疗人工智能:同提供者评判者和人类评分者会改变表面安全性
机构 * Kinvectum AB(金维图姆公司)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 研究在信息缺失下评估医疗人工智能,通过删除对话部分对四个模型压力测试,发现评判者选择影响表面安全性,语言模型评判者更宽松,安全差距在于校准,还发布了相关测试工具等。
Comments GitHub https://github.com/KAVentures/health-ai-readiness-robustness
现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; University College London(伦敦大学学院) ; Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。
Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG
蛋白质接触图上的离散Ricci曲率用于轻量级折叠分类
专题命中 领域大模型 :language model(abstract);分类 cs.LG
AI总结 研究蛋白质折叠分类,将α碳接触图上的离散Ricci曲率作为轻量级结构描述符,与多种基线比较。结果显示其性能优于平均池化的ESM-2嵌入,与持久同调结合性能最强,为预训练蛋白质语言模型嵌入提供实用替代方案。
Comments Accepted at IEEE International Conference on Future Machine Learning and Data Science (FMLDS)
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
机构 * ScienceOne AI(科学一号人工智能) ; Wenge AI(文阁人工智能)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。
用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习
机构 * University of Toronto(多伦多大学) ; The Hospital for Sick Children(病童医院) ; Vector Institute(向量研究所) ; University Hospital Augsburg(奥格斯堡大学医院)
专题命中 领域大模型 :pretraining(abstract);分类 cs.LG
AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。
用于减轻疾病分类器偏差和检测偏差的人口统计学条件合成医学图像
机构 * Institute of Data Science, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院数据科学研究所) ; Department of Advanced Computing Sciences, Faculty of Science and Engineering, Maastricht University(马斯特里赫特大学科学与工程学院高级计算科学系) ; VITO(比利时弗拉芒技术研究所)
专题命中 领域大模型 :pretraining(abstract);分类 cs.AI
AI总结 研究医学图像分类器亚组公平性审计的样本量问题,提出用人口统计学条件合成生成器减轻训练偏差、检测评估偏差。以COVID-19胸部CT分类为例,发现其在偏差减轻和检测上的作用,如预训练效果好、能再现亚组排名等。
通过成对验证器实现无奖励进化智能体
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 研究提出用成对验证器取代标量奖励设计,集成到三个自我进化引擎中,有自适应焦点和软Elo两种变体。该方法在多智能体和两种工件基质上多数设置下达到或超全奖励基线,无需标记成本,是替代每步奖励设计的有效方案。
CIPHER:用于数据科学智能体测试时扩展的解耦探索-选择框架
机构 * Amazon Web Services(亚马逊网络服务公司)
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 研究针对数据科学任务自动化挑战,提出CIPHER智能体,通过生成和选择多初始状态实现测试时扩展,解耦生成与选择过程。经实验验证其性能超越现有技术,刻画DES框架设计空间并给出设计建议。
XCT-SAM:用于工业XCT缺陷分割的SAM顺序参数高效域适应
专题命中 领域大模型 :foundation model(abstract);分类 cs.LG
AI总结 针对增材制造X射线计算机断层扫描图像缺陷分割难题,提出XCT-SAM框架,先在合金微观结构数据集微调Conv-LoRA适配器,再转移到XCT图像,参数高效且冻结超99%模型,实验表明其性能优于基线,有效实现工业XCT缺陷分割。
Comments 10 pages, 7 figures, 3 tables. Accepted to the IAPR Workshop on Machine Vision for Industrial Inspection (MVI2), in conjunction with ICPR 2026. Code: https://github.com/Mahedi-61/XCT-SAM
用于自动神经算子发现的智能体人工智能科学社区
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 领域大模型 :LLM(abstract);分类 cs.LG
AI总结 该研究基于人工智能科学社区提出智能体方法用于自动神经算子发现,通过虚拟实验室中三个智能体协作,共享通用词汇表,在五个问题上评估,能发现高精度低参数架构,揭示语言模型智能体对保持多样性的作用及神经算子无免费午餐定理。
迈向可信自主科学:两年社区路线图
机构 * U.S. Department of Energy, Office of Science, Office of Advanced Scientific Computing Research(美国能源部科学办公室高级科学计算研究办公室)
专题命中 领域大模型 :foundation model(abstract);分类 cs.AI
AI总结 该研究针对自主科学领域发展现状及问题,更新路线图围绕七个维度,评估原有里程碑并新增四个,规划两年发展路径,第一年聚焦接口等搭建验证框架,第二年针对联盟等,强调基层网络的互操作性。
Claude Fable 5在生物医学挑战问题上的能力
机构 * School of Computing, University of Georgia(佐治亚大学计算学院) ; Department of Chemistry, University of Illinois(伊利诺伊大学化学系) ; Institute of Bioinformatics, University of Georgia(佐治亚大学生物信息学研究所)
专题命中 领域大模型 :language model(abstract);分类 cs.CL
AI总结 研究评估Claude Fable 5在八个生物医学基准上的能力,以确定性评分针对固定答案键评估,含两个Claude前身和GPT-5作基线。发现Fable 5拒绝率因基准而异,排除拒绝项后准确率超其他模型,还识别出两种拒绝模式,其生物医学应用主要受限在参与意愿。
Comments 15 pages, 6 tables, 4 figures, appendix with qualitative examples
法律判决预测中的捷径学习:来自英国就业法庭的实证证据
机构 * Faculty of Law, University of Cambridge(剑桥大学法学院) ; The Psychometrics Centre, Cambridge Judge Business School, University of Cambridge(剑桥大学心理学测量中心,剑桥Judge商学院) ; Faculty of English, University of Cambridge(剑桥大学英语学院) ; Department of Statistics, Uppsala University(乌普萨拉大学统计系) ; Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) ; Department of Engineering, University of Cambridge(剑桥大学工程系)
专题命中 领域大模型 :LLM(abstract);分类 cs.AI
AI总结 研究英国就业法庭判决中索赔结果预测的捷径学习,用33158条索赔语料库预测结果,发现基于事后司法文本训练的法律判决预测系统性能或被夸大,去除泄漏特征后模型仍能提取有用信号。
3D掩码自编码器是显微镜体积和多模态细胞表示的鲁棒学习器
机构 * Institute of AI for Health & Helmholtz AI, Computational Health Center, Helmholtz Munich – German Research Center for Environmental Health(亥姆霍兹慕尼黑中心 - 德国环境健康研究中心,计算健康中心,健康人工智能研究所与亥姆霍兹人工智能) ; Department of Medicine III, Ludwig-Maximilian-University Hospital(路德维希-马克西米利安大学医院第三内科) ; Department of Physics, Ludwig-Maximilian-University(路德维希-马克西米利安大学物理系) ; German Cancer Consortium (DKTK), partner site Munich(德国癌症联盟(DKTK)慕尼黑合作站点) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))
专题命中 领域大模型 :language model(abstract);分类 cs.LG
AI总结 系统比较2D和3D掩码自编码器在体积显微镜数据上的表现,发现3D模型在下游任务中更优,并通过跨模态对齐和频域正则化进一步提升性能,在蛋白质相互作用和定位任务上达到最先进水平。
Comments Code is available at: https://github.com/marrlab/mae3d-opencell
尼日利亚机械:一个具有领域基础推理层的低资源工业数据集
专题命中 领域大模型 :language model(abstract);分类 cs.AI
AI总结 针对非洲经济体工业机械数据缺乏问题,发布尼日利亚机械数据集及构建思维链推理示例的方法,解决语言模型构建数据集时领域不明确问题,提升领域基础提示比例,虽有局限性,但为相关研究提供参考。
Comments 10pages, 2 tables