Native Hierarchical and Compositional Representations with Subspace Embeddings
原生层次与组合表示:基于子空间嵌入
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出用线性子空间替代向量表示概念,通过子空间维度与包含关系自然建模层次与组合性,并引入可微软投影矩阵实现端到端训练,在层次推理和自然语言推理任务上达到最优性能。
Comments KDD 2026
期刊&会议
ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining
原生层次与组合表示:基于子空间嵌入
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出用线性子空间替代向量表示概念,通过子空间维度与包含关系自然建模层次与组合性,并引入可微软投影矩阵实现端到端训练,在层次推理和自然语言推理任务上达到最优性能。
Comments KDD 2026
打破信息茧房:推荐系统中平衡探索与利用的双曲框架
机构 * University of California, Davis(加州大学戴维斯分校) ; The Hong Kong University of Science(香港科学大学) ; Snap Inc.(Snap公司) ; Yale University(耶鲁大学)
AI总结 提出双曲框架HERec,通过语义增强的层次机制和自动层次聚类,在推荐系统中平衡探索与利用,有效缓解信息茧房。
Comments Accepted to KDD 2026. Code: https://github.com/Martin-qyma/HERec
OOD-GraphLLM:面向分布外泛化的药物协同预测图大语言模型
机构 * DCST, BNRist, Tsinghua University(国防科技大学、北京理工大学、清华大学) ; DCST, Tsinghua University(国防科技大学、清华大学)
AI总结 针对药物协同预测中因新化合物导致的分布外偏移问题,提出OOD-GraphLLM框架,通过联合优化分子图表示与生物医学语义语言表示实现准确预测。
Comments 12 pages, 9 figures, ACM KDD 2026
DocRetriever:面向多模态文档检索的即插即用框架与综合基准
机构 * Zhejiang University(浙江大学) ; Huawei Technologies Co., Ltd(华为技术有限公司)
AI总结 提出DocRetriever即插即用框架,通过布局感知的稀疏嵌入和推理增强的重排序器解决多模态文档检索中语义模糊和泛化瓶颈问题,并构建MultiDocR基准实现更严格评估。
Comments Accepted at KDD 2026 Research Track
CompilerDream: 学习编译器世界模型以实现通用代码优化
机构 * School of Software, BNRist Tsinghua University Beijing China(软件学院、北师大清华大学北京中国) ; Tsinghua University(清华大学)
AI总结 提出基于模型的强化学习方法CompilerDream,通过编译器世界模型模拟优化pass属性并训练智能体,实现跨应用场景和语言的通用代码优化,在零样本泛化上超越LLVM内置优化。
Comments KDD 2025 camera-ready version with extended appendix. Code is available at https://github.com/thuml/CompilerDream. This update additionally fixes an issue in Table 6 where the dataset names in three rows were ordered incorrectly
桥接分类与重建:协同时间序列异常检测
机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(信息系统工程国家重点实验室,国防科技大学) ; College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) ; Zhejiang University(浙江大学) ; Zhejiang Key Laboratory of Space Information Sensing and Transmission, Hangzhou Dianzi University(空间信息感知与传输浙江大学重点实验室,杭州电子科技大学)
AI总结 提出CoAD框架,通过分类模块生成概率软掩码指导重建模块,协同利用分类与重建范式的互补优势,有效检测细微复杂异常,并在基准数据集上显著优于现有方法。
Comments 15 pages, submitted to KDD 2026
DLT-Corpus:面向分布式账本技术领域的大规模文本集合
机构 * Centre for Blockchain Technologies, University College London(区块链技术中心,伦敦大学学院) ; School of Informatics, University of Edinburgh(信息学院,爱丁堡大学) ; Exponential Science Foundation(指数科学基金会)
AI总结 本文构建了DLT-Corpus,一个包含29.8亿词元、覆盖科学文献、专利和社交媒体的大规模领域语料库,并基于此分析了技术涌现模式与市场创新关联,同时发布了领域预训练模型LedgerBERT、情感分析数据集等资源。
Comments Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26)
PipeMFL-240K:管道磁通量泄漏成像中目标检测的大规模数据集与基准
机构 * SINOMACH Sensing Technology \ ., Ltd Shenyang Liaoning China ; Institute of Science Tokyo Tokyo Japan ; Hokkaido University Sapporo Hokkaido Japan ; SINOMACH Sensing Technology \ ., Ltd ; Institute of Science Tokyo ; Hokkaido University
AI总结 为解决管道磁通量泄漏检测中缺乏大规模公开数据集和基准的问题,构建了包含249,320张图像和200,020个边界框标注的PipeMFL-240K数据集,并评估了现有目标检测器,揭示了其在长尾分布、小目标和类内变异等挑战下的性能不足。
Comments Accepted by ACM KDD 2026 Datasets and Benchmarks Track
E2E:通过自适应终止实现高效的过滤AKNN搜索
AI总结 针对带属性约束的近似k近邻搜索,提出基于早期探测阶段信息的轻量级模型实现自适应终止,在保证95%召回率下获得1.1-3.7倍加速。
Comments Accepted at KDD 2026
FORGE:面向工业数据集中生成式检索的语义标识符构建
AI总结 提出FORGE基准,通过多视角分类和离线实验研究语义标识符构建策略,并设计无需完整GR训练的新评估指标,在淘宝线上A/B测试中实现交易量提升0.35%。
Comments Accepted by KDD 2026
大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化
机构 * Tsinghua University(清华大学) ; Department of Psychological and Cognitive Sciences(心理与认知科学系) ; College AI(人工智能学院) ; School of Management(管理学院) ; Fudan University(复旦大学) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Northwestern University(西北大学) ; University of Oxford(牛津大学)
AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。
Comments KDD 2026 Oral
从彩色配置模型中采样随机图
AI总结 提出彩色配置模型(CCM)作为顶点着色多重图的新零模型,通过保留彩色度矩阵(CDM)来固定节点的颜色同质性,并开发Sirius算法实现更快的混合采样,用于统计上合理的社交网络分析。
Comments Accepted to KDD 2026
在线不规则多变量时间序列预测:基于不确定性驱动的双专家校准
机构 * Key Laboratory of Big Data \& Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education School of Computer Science ; Technology, Beijing Jiaotong University Beijing China ; School of Computer Science ; Tangshan Research Institute, Beijing Jiaotong University Tangshan China ; Key Laboratory of Big Data \& Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education ; Technology, Beijing Jiaotong University ; Tangshan Research Institute, Beijing Jiaotong University
AI总结 针对在线不规则多变量时间序列预测中数据分布动态变化导致性能下降的问题,提出不确定性驱动的双专家校准框架Under-Cali,通过不确定性估计、双专家校准和自适应路由模块实现稳定高效的在线学习。
Comments Accepted by KDD 2026
几何优先的生成式空间单细胞重建
机构 * University of Central Florida(佛罗里达大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Arizona State University(亚利桑那州立大学)
AI总结 提出GEARS框架,通过几何优先方法结合扩散模型和置换等变生成器,从单细胞RNA测序数据重建空间几何,无需细胞类型标签或组织学图像。
Comments 32nd SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
基于Shapley值的社交网络高效影响力归因
AI总结 针对社交网络中种子节点的事前影响力公平估计问题,提出基于Shapley值的归因框架,设计多项式时间算法(单步激活)和近似算法(IC模型及时间约束变体),并证明多步传播的#P-难性。
Comments 28 pages. Accepted at SIGKDD 2026. Full version with appendix
SilentRetrieval:通过语义保持的对抗性数据投毒劫持检索增强生成
机构 * City University of Hong Kong(香港城市大学)
AI总结 提出SilentRetrieval两阶段数据投毒攻击,通过协调束搜索和上下文自适应触发生成,在保持文档流畅性的同时实现高检索命中率和攻击成功率,并评估了防御措施的有效性。
Comments 12 pages, 4 figures, KDD '26 camera-ready version
Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea
NUCLEUS-MoE:池沸腾液冷统一模型
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; University of California, Irvine(加州大学 Irvine 分校)
AI总结 提出混合专家模型NUCLEUS,通过邻域注意力、符号距离场重初始化与专家路由,统一建模不同流体和工况下的池沸腾,实现零样本与小样本泛化。
Comments 12 pages, 9 figurs, KDD AI for Science
ClinicalAgents:具有双记忆的临床决策多智能体编排
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学)
AI总结 提出ClinicalAgents多智能体框架,通过蒙特卡洛树搜索动态编排和双记忆架构模拟临床推理,显著提升诊断准确性和可解释性。
Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
通过蒸馏将归纳偏置整合到Transformer中用于金融时间序列预测
机构 * National Chengchi University(中华大学)
AI总结 提出TIPS框架,通过知识蒸馏将因果性、局部性和周期性等归纳偏置整合到统一Transformer中,在四个主要股票市场实现年化收益、夏普比率和卡尔玛比率分别提升55%、9%和16%,且推理计算量仅为38%。
Comments KDD 2026
FinTexTS: 基于语义和多层级配对的金融文本-时间序列数据集
机构 * LG AI Research(LG人工智能研究所) ; Ulsan National Institute of Science and Technology(乌山国立科学技术研究院)
AI总结 提出基于语义和多层级配对的框架,从SEC文件和新闻中提取并匹配多层级文本信息,构建大规模文本配对的股票价格数据集FinTexTS,提升股价预测性能。
Comments 12 pages, KDD 2026, Datasets and Benchmarks Track
矩重要:从异方差观测数据中发现均值和方差因果图
机构 * Communication Science Laboratories NTT, Inc. Kyoto Japan(通信科学实验室 东京电讯株式会社 京都 日本) ; NTT, Inc.(东京电讯株式会社)
AI总结 提出贝叶斯矩驱动因果发现框架,从异方差观测数据中分别推断均值和方差因果图,并实现结构特征的不确定性量化。
Comments Accepted at KDD 2026. This is the full version of the accepted paper. 17 pages, 6 figures
重新审视图自编码器作为隐式对比学习器
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Coupang Shanghai China(Coupang上海) ; Sun Yat-sen University(中山大学) ; Nanyang Technological University(南洋理工大学)
AI总结 本文通过对比学习视角重新审视图自编码器,揭示其隐式对比学习本质,并强调对比视图设计的关键作用,提出非对称子图视图作为重要设计维度。
Comments KDD 2026 research track. Code available at https://github.com/EdisonLeeeee/lrGAE
工业搜索中基于大语言模型的查询驱动事件时间线摘要
机构 * Baidu Inc.(百度公司)
AI总结 提出QDET系统,通过多任务微调和强化学习实现查询驱动的事件时间线摘要,在百度搜索中显著提升用户参与度。
Comments Accepted at KDD 2026
超越整体模型:深度多变量时间序列预测的系统性组件级基准测试
机构 * Shanghai University of Finance and Economics(上海财经大学) ; Key Laboratory of Interdisciplinary Research of Computation and Economics(交叉计算与经济学交叉学科实验室)
AI总结 提出TSCOMP基准,通过正交实验分解深度预测方法的核心组件,揭示其有效性并构建性能语料库,实现零样本模型构建,优于手工复杂架构。
Comments accepted by KDD 2026 Datasets and Benchmarks Track
广义范围过滤近似最近邻搜索:包含与重叠 [技术报告]
AI总结 针对带有数值范围属性的向量,提出多段树图方法,支持任意范围-范围谓词(包含、重叠等)的近似最近邻搜索,在保持索引大小和构建时间与现有方法相当的同时,实现了高达12.5倍的加速。
Comments The paper has been accepted by KDD 2026
基于推送的异步联邦学习:一种偏差校正聚合方法
机构 * School of Computer Technologies, RMIT University(RMIT大学计算机技术学院) ; School of Science, Computing and Engineering Technologies, Swinburne University of Technology(斯威丁大学科学与工程技术学院)
AI总结 提出PushCen-ADFL框架,通过中心表示空间中的平均保持推-求和混合与轻量级中心正则化,解决异步去中心化联邦学习中的通信开销、聚合偏差和模型漂移问题。
Comments Accepted at the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). This is the extended version with full appendix
PhyGHT:面向HL-LHC信号净化的物理引导超图Transformer
机构 * Department of Computer Science(计算机科学系) ; Department of Physics(物理系)
AI总结 提出PhyGHT混合架构,结合距离感知局部图注意力和全局自注意力,并引入可解释的物理约束堆叠抑制门(PSG),以在极端堆积碰撞噪声下准确重建顶夸克对信号的能量和质量修正因子。
Comments Accepted by KDD 2026
Hi-SAM: 一种面向大规模推荐的分层结构感知多模态框架
机构 * Netease Cloud Music(网易云音乐)
AI总结 针对多模态推荐中语义ID离散化存在的次优分词和架构-数据不匹配问题,提出Hi-SAM框架,通过解耦语义分词器和分层记忆-锚点Transformer,在冷启动场景下显著提升推荐性能。
Comments Accepted at ACM KDD 2026 ADS
LLM时代的作者身份归属:问题、方法与挑战
AI总结 本文系统综述了LLM时代作者身份归属的四个代表性问题和挑战,包括人类文本归属、LLM生成文本检测、LLM生成文本归属以及人机合著文本归属,并探讨了泛化性和可解释性等关键问题。
Comments ACM SIGKDD Exploration. 12 pages. Additional resources, including a regularly updated list of related papers, and LLM-generated text detectors, are available at https://llm-authorship.github.io
因果方法在LLM开发与评估中的应用
机构 * Imperial College London(帝国理工学院伦敦分校) ; University of Toronto(多伦多大学)
AI总结 本文提出因果方法可解决LLM开发与评估中的关键因果问题,并系统梳理其在预训练、对齐、路由等环节的应用机会。
Comments Published in KDD 2026