arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

ACM SIGKDD Conference on Knowledge Discovery and Data Mining · 会议 · Data Mining

2026-06-09 至 2026-06-09 共收录 11
2605.03058 2026-06-09 cs.LG cs.AI 版本更新

Neuron-Anchored Rule Extraction for Large Language Models via Contrastive Hierarchical Ablation

基于对比分层消融的大语言模型神经元锚定规则提取

Francesco Sovrano, Gabriele Dominici, Marc Langheinrich

机构 * Università della Svizzera italiana(瑞士意大利大学)

AI总结 提出MechaRule方法,通过定位稀疏激动剂激活将规则提取锚定在LLM电路中,利用自适应组测试和置信引导剪枝,以极低代价高召回率识别关键神经元,并在算术和越狱任务中验证其有效性。

Comments Accepted for publication at KDD'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01304 2026-06-09 cs.LG 版本更新

When Hard Negatives Hurt: Bridging the Generative-Discriminative Gap in Hard Negative Synthesis for Retrieval

当硬负例有害时:弥合检索中硬负例生成的生成-判别鸿沟

Zhicheng Zhang, Jiwei Tang, Kuicai Dong, Xiaopeng Li, Jieming Zhu, Jingyu Li, Qianhui Zhu, Fengyuan Lu, Wang Jiaheng, Gang Wang, Hai-Tao Zheng, Zhaocheng Du

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Huawei Technologies Co., Ltd.(华为技术有限公司) City University of Hong Kong(香港城市大学) School of Cyber Science and Technology, Sun Yat-sen University(中山大学信息科学与技术学院) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) The Hong Kong University of Science and Technology(香港科学与技术大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 针对检索中硬负例生成存在的生成-判别鸿沟问题,提出CausalNeg方法,通过CoT引导的反事实扰动和查询视角熵最大化来提升检索性能。

Comments Accepted at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27441 2026-06-09 cs.IR cs.LG 版本更新

A Unified Structured Query Understanding Framework for Industrial Semantic Search

面向工业语义搜索的统一结构化查询理解框架

Ping Liu, Qianqi Shen, Jianqiang Shen, Chunnan Yao, Kevin Kao, Rajat Arora, Dan Xu, Baofen Zheng, Yunxiang Ren, Benjamin Le, Ali Hooshmand, Igor Lapchuk, Juan Bottaro, Raghavan Muthuregunathan, Caleb Johnson, Liangjie Hong, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

AI总结 提出一个统一的结构化查询理解系统,将多个异构功能整合到单个小语言模型(SLM)中,并引入Query Illuminator框架用于自动标注和评估,在LinkedIn的职位搜索和人员搜索中验证了效果。

Comments Accepted by KDD-ADS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23595 2026-06-09 cs.LG cs.AI cs.CV cs.ET cs.PF 版本更新

Learning to Evaluate: Cost-Effective Model Evaluation on Unlabeled Data with Meta-Learning

基于元学习的成本效益模型评估

Trinh Pham, Viet Huynh, Hongzhi Yin, Quoc Viet Hung Nguyen, Thanh Tam Nguyen

机构 * Griffith University(格里菲斯大学) Edith Cowan University(埃迪斯科文大学) The University of Queensland(昆士兰大学)

AI总结 提出MetaEvaluator,一种基于元学习的模型无关框架,通过参考模型池实现无标签数据上的快速、准确且成本效益高的新模型评估。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19579 2026-06-09 q-bio.QM 版本更新

TACK: A Statistical Evaluation of Degradation Activity on a Novel TArgeting Chimeras Knowledge Dataset

TACK: 对新型靶向融合体知识数据集上降解活性的统计评估

Stefano Ribes, Nils Dunlop, Rocío Mercado

AI总结 本文提出TACK,通过统计方法评估新型靶向融合体知识数据集上3514种PROTACs和6561个降解终点的降解活性,比较了三种机器学习方法在预测PROTAC降解活性方面的性能,发现特征工程比架构复杂性更重要,并提出了基于集成的不确定性量化方法以指导实验优先级。

Comments 12 pages, 6 figures, accepted to Knowledge Discovery and Data Mining - KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07445 2026-06-09 cs.CL cs.LG 版本更新

Few Tokens, Big Leverage: Preserving Safety Alignment by Constraining Safety Tokens during Fine-tuning

少令牌,大杠杆:在微调期间通过约束安全令牌保持安全对齐

Guoli Wang, Haonan Shi, Tu Ouyang, An Wang

机构 * Case Western Reserve University(凯斯西储大学)

AI总结 提出PACT框架,通过约束安全相关令牌的置信度来防止微调导致的安全对齐漂移,同时保持下游任务性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10172 2026-06-09 astro-ph.IM cs.AI 版本更新

Cosmo3DFlow: Wavelet Flow Matching for Spatial-to-Spectral Compression in Reconstructing the Early Universe

Cosmo3DFlow:用于重建早期宇宙的空间到光谱压缩的小波流匹配

Md. Khairul Islam, Zeyu Xia, Ryan Goudjil, Jialu Wang, Arya Farahi, Judy Fox

机构 * Department of Computer Science University of Virginia(计算机科学系弗吉尼亚大学) Department of Statistics and Data Sciences The University of Texas at Austin(统计与数据科学系德克萨斯大学奥斯汀分校) School of Data Science(数据科学学院)

AI总结 提出Cosmo3DFlow框架,结合3D离散小波变换与流匹配,通过空间到光谱压缩解决高维宇宙结构重建中的维度和稀疏性瓶颈,实现比扩散模型快46倍的采样速度。

Journal ref KDD '26: Proc. 32nd ACM SIGKDD Conf. on Knowledge Discovery and Data Mining V.2, 11153-11164 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09285 2026-06-09 cs.LG cond-mat.mtrl-sci 版本更新

Enhancing Spatial Reasoning in Large Language Models for Metal-Organic Frameworks Structure Prediction

增强大型语言模型在金属有机框架结构预测中的空间推理能力

Mianzhi Pan, JianFei Li, Peishuo Liu, Botian Wang, Yawen Ouyang, Yiming Rong, Hao Zhou, Jianbing Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学) Institute of AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) ChemBIC(化学信息学中心)

AI总结 针对MOF结构预测中原子数量多、复杂度高的问题,提出MOF-LLM框架,通过空间感知持续预训练、结构监督微调和匹配驱动强化学习,增强Qwen-3 8B模型的空间推理能力,实现35.78%匹配率和0.04秒/结构的采样效率。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03877 2026-06-09 cs.LG 版本更新

Benchmark Datasets for Lead-Lag Forecasting on Social Platforms

社交平台领先滞后预测的基准数据集

Kimia Kazemian, Zhenzhen Liu, Yangfanyu Yang, Katie Luo, Shuhan Gu, Audrey Du, Xinyu Yang, Jack Jansons, Kilian Q. Weinberger, John Thickstun, Yian Yin, Sarah Dean

机构 * Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

AI总结 本文提出领先滞后预测(LLF)问题,并发布arXiv和GitHub两个大规模基准数据集,通过统计检验验证领先滞后动态,为社交平台时间序列预测提供标准化测试平台。

Comments 11 pages, 8 figures, includes supplementary material (6 pages, 5 figures). Accepted at ACM SIGKDD 2026 (KDD '26). Code and data: https://lead-lag-forecasting.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11189 2026-06-09 cs.AI cs.LG 版本更新

Can Global XAI Methods Reveal Injected Behaviours in LLMs? SHAP vs Rule Extraction vs RuleSHAP

全局XAI方法能否揭示LLM中的注入行为?SHAP vs 规则提取 vs RuleSHAP

Francesco Sovrano

机构 * Collegium Helveticum at ETH Zurich(苏黎世联邦理工学院霍夫曼学院) Università della Svizzera italiana(瑞士联邦理工学院)

AI总结 研究通过统计验证的抽象将全局LLM信念映射为数值分数,提出RuleSHAP算法,结合全局SHAP与规则归纳,以更好地捕捉非单变量触发因素,平均MRR@1比RuleFit提升82%。

Comments Accepted for publication at KDD'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06469 2026-06-09 cs.CL 版本更新

ClinicalBench: Can LLMs Beat Traditional ML Models in Clinical Prediction?

ClinicalBench: 大型语言模型能在临床预测中击败传统机器学习模型吗?

Canyu Chen, Jian Yu, Shan Chen, Che Liu, Zhongwei Wan, Shuang Zhou, Yuan Luo, Rui Zhang, Danielle Bitterman, Fei Wang, Kai Shu

机构 * Department of Computer Science Northwestern University Evanston USA(计算机科学系西北大学艾文斯顿美国) Department of Computer Science University of Texas at Austin Austin USA(计算机科学系德克萨斯大学奥斯汀美国) Boston Children's Hospital, Harvard Medical School Boston USA(波士顿儿童医院哈佛医学院波士顿美国) Department of Computer Science Imperial College London London UK(计算机科学系伦敦帝国学院伦敦英国) Department of Computer Science Ohio State University Columbus USA(计算机科学系俄亥俄州立大学哥伦布美国) Massachusetts General Hospital, Harvard Medical School Boston USA(麻省总医院哈佛医学院波士顿美国) Department of Preventive Medicine, Feinberg School of Medicine Northwestern University Chicago USA(预防医学系费因伯格医学院西北大学芝加哥美国) Division of Computational Health Sciences, Department of Surgery University of Minnesota Minneapolis USA(计算健康科学部外科部明尼苏达大学明尼阿波利斯美国) Department of Population Health Sciences, Weill Cornell Medicine Cornell University New York USA(流行病学与公共卫生系韦尔·科恩医学中心康奈尔大学纽约美国) Department of Computer Science Emory University Atlanta USA(计算机科学系埃默里大学亚特兰大美国) Northwestern University(西北大学) University of Texas at Austin(德克萨斯大学奥斯汀) Boston Children's Hospital, Harvard Medical School(波士顿儿童医院哈佛医学院) Imperial College London(伦敦帝国学院) Ohio State University(俄亥俄州立大学) Massachusetts General Hospital, Harvard Medical School(麻省总医院哈佛医学院) University of Minnesota(明尼苏达大学) Cornell University(康奈尔大学) Emory University(埃默里大学)

AI总结 构建ClinicalBench基准,通过三个临床预测任务比较14个通用和8个医学LLM与11个传统ML模型,发现LLM在临床预测上仍无法超越传统ML模型。

Comments Accepted to Proceedings of KDD 2026. The first two authors contributed equally. 12 pages for main paper, 62 pages including appendix. Project website: https://clinicalbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏