Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models
在大型语言模型上进行深度数据研究:评估深度数据研究
AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。
Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
在大型语言模型上进行深度数据研究:评估深度数据研究
AI总结 本文提出深度数据研究(DDR)任务和DDR-Bench基准,评估大型语言模型的探索智能,发现有效探索需要内在策略而非单纯扩展。
Comments 14 pages, 7 tables, 8 figures, accepted by ICML 2026
大型视觉-语言模型在视觉标记压缩下的对抗鲁棒性研究
机构 * The Hong Kong Polytechnic University, Hong Kong(香港理工大学) ; Nanyang Technological University, Singapore(南洋理工大学) ; Chongqing University, Chongqing, China(重庆大学) ; Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心)
AI总结 本文研究了视觉标记压缩对大型视觉-语言模型对抗鲁棒性的影响,提出CAGE攻击方法,通过优化与压缩推理对齐,揭示压缩机制下的鲁棒性漏洞。
Comments Accepted by ICML 2026
稀疏自编码器是否在语言模型中识别推理特征?
机构 * UC Berkeley(加州大学伯克利分校) ; UCSF(旧金山大学)
AI总结 研究稀疏自编码器在大语言模型中识别推理相关内部特征的可靠性,提出基于因果token注入的评估框架,发现许多候选特征对token级干预敏感,需通过反证法验证其推理相关性。
Comments In Forty-Third International Conference on Machine Learning (2026)
少监督,多观察:基于原型引导的提示方法实现无训练核实例分割
机构 * Stony Brook University(石溪大学) ; Johns Hopkins University(约翰霍普金斯大学)
AI总结 本文提出SPROUT框架,通过组织学先验知识构建滑片特定参考原型,利用部分最优传输方案指导特征对齐,使SAM模型无需训练即可实现精准核分割。
Comments ICML 2026; 44 pages, 25 figures, 26 tables; Code at https://github.com/Y-Research-SBU/SPROUT
EvolveR:通过经验驱动的生命周期实现自进化大语言模型代理
机构 * Zhejiang University(浙江大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Fudan University(复旦大学) ; Central South University(中南大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 EvolveR通过闭环经验生命周期实现LLM代理的自进化,结合离线自蒸馏和在线交互,利用策略强化机制迭代优化,提升多跳问答任务性能。
Comments Accepted by ICML 2026
位置:AI评估应基于能力理论
机构 * MIT EECS, Cambridge, USA(麻省理工学院电子工程与计算机科学系,剑桥,美国)
AI总结 本文提出AI评估应基于明确的能力理论,通过实验证明评估结果受建模假设影响显著,提出Evaluation Card促进透明化评估实践。
Comments ICML 2026 Position Paper Track
大语言模型代理是封闭生态系统的解药
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Institute for Decentralized AI(去中心化人工智能研究所)
AI总结 本文提出通过大语言模型代理实现通用互操作性,打破封闭平台垄断,促进数据端到端迁移,同时探讨其带来的安全与法律挑战。
Comments Published at the ICML 2026 Position Paper track
反学习不是删除:调查机器反学习在大语言模型中的可逆性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Cruz(加州大学圣克ruz分校) ; Huawei Technologies(华为技术有限公司) ; Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)
AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。
Comments ICML 2026, accepted to appear
自动无监督集成异常检测模型选择——扩展版
机构 * Department of Software Engineering, FPT University, Vietnam(FPT大学软件工程系) ; Department of Information Technology, Can Tho University of Technology, Vietnam(胡志明市技术大学信息科技系) ; School of Business, RMIT University, Vietnam(RMIT大学商学院) ; Department of Computer Science, Aalborg University, Denmark(阿阿尔堡大学计算机科学系) ; School of Data Science and Engineering, East China Normal University, China(华东师范大学数据科学与工程学院)
AI总结 本文提出MetaEns框架,通过学习预测边际增益模型,自动选择高质异常检测模型集成,无需标注数据,实验显示其在39个真实数据集上表现优异。
Comments 25 pages. An extended version of "Automatic Unsupervised Ensemble Outlier Model Selection" accepted at ICML 2026
一种信息论准则用于高效数据合成
机构 * CFCS, School of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国) ; Department of Information Management, Peking University, Beijing, China(信息管理系,北京大学,北京,中国)
AI总结 本文提出信息开放循环的准则,指出合成数据的有效性取决于外部信号注入任务相关信息,从而提升模型效率与泛化能力。
Comments 12 pages. Camera-ready version for ICML 2026
专家反击:在专家层面解读混合专家语言模型
机构 * Department of Informatics, University of Hamburg, Hamburg, Germany(汉堡大学信息学院)
AI总结 研究通过k稀疏探测比较MoE专家与密集FFN,发现专家神经元更单语义,提出以专家为分析单位,揭示专家是细粒度任务专家,而非领域专家或token处理者。
Comments 8 pages, 7 Figures. Accepted at ICML 2026. Improved writing, changed author order, updated citations
仅在自我合成管道确保可学习信息增益时,自我博弈才会进化
机构 * King's College London(伦敦国王学院) ; The Alan Turing Institute(艾伦·图灵研究所)
AI总结 本文通过实验揭示可持续自我进化需要可学习信息递增的自我合成数据管道,提出自我进化LLM的三重角色及系统设计,解决自我博弈停滞问题。
Comments 10 pages, 6 figures, 7 formulas, accepted by ICML 2026 position paper track
AdaEraser:通过自适应注意力抑制实现无训练对象去除
机构 * School of Computer Science, Peking University(北京大学计算机科学学院)
AI总结 本文提出AdaEraser框架,通过动态调节注意力机制实现对象去除,解决无训练方法中盲目抑制注意力导致生成质量下降的问题,实验表明其在对象去除任务中表现优异。
Comments Accepted by ICML 2026
Shapley神经元值用于持续学习:哪些神经元最为关键?
机构 * Department of Electrical and Computer Engineering, Aarhus University, Denmark(电气与计算机工程系,奥胡斯大学,丹麦)
AI总结 本文提出Shapley神经元估值框架,通过量化持续学习中神经元重要性,实现无缓冲的持续学习,实验显示其在类别增量学习和任务增量学习中分别提升准确率2.88%和6.46%。
Comments This paper has been accepted to ICML 2026
嵌入扰动探索偏好优化用于流模型
机构 * Tsinghua University(清华大学) ; AMAP, Alibaba Group(阿里集团AMAP)
AI总结 本文提出E²PO框架,通过嵌入层面扰动维持优化稳定性,提升生成模型对人类偏好的对齐效果。
Comments Accepted by ICML 2026
持续学习领域不变表示
机构 * Bosch Center for Artificial Intelligence(博世人工智能中心) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Albstadt-Sigmaringen University(阿尔布斯塔德-西格马林根大学)
AI总结 本文提出持续学习领域不变表示方法,通过结合回放训练和定制的序列不变性对齐,提升模型在未见目标领域上的泛化能力。
Comments ICML 2026
CG-MLLM:通过多模态大语言模型实现图像描述与3D内容生成
机构 * Zhejiang University, China(浙江大学)
AI总结 本文提出CG-MLLM,一种能实现3D描述和高分辨率3D生成的多模态大语言模型,通过混合Transformer架构分离不同建模需求,结合预训练视觉语言模型与专用3D VAE潜在空间,提升3D生成质量与感知能力。
Comments ICML 2026
DGS-Net:基于知识蒸馏的梯度手术用于AI生成图像检测中的CLIP微调
机构 * School of Computer Science, Nanjing University of Information Science(南京信息工程大学计算机学院) ; University of Macau(澳门大学)
AI总结 本文提出DGS-Net,通过梯度空间分解分离有害和有益的下降方向,提升CLIP在AI生成图像检测中的微调效果,实验表明其在检测性能和泛化能力上优于现有方法。
Comments Accepted by ICML 2026 Spotlight
如何训练你的导师:通过导师模型引导黑盒大语言模型
机构 * University of California, Berkeley(加州大学伯克利分校) ; Bespoke Labs(Bespoke实验室)
AI总结 本文提出Advisor Models,通过训练小型开放权重模型生成动态个性化建议,提升黑盒前沿模型性能,实验显示在多个任务中效果显著,且具有良好的迁移性和鲁棒性。
Comments International Conference on Machine Learning (ICML) 2026
精度降低可能更可靠:对VLMs量化影响的系统评估
机构 * Computer Vision Center(计算机视觉中心)
AI总结 本文系统评估了量化对VLMs可靠性的影响,发现量化能提升准确率、校准、异常检测和抗噪能力,但不改善协变量偏移或虚假相关性。
Comments Accepted at ICML 2026
在结构化Stackelberg游戏中学习
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California(加州大学)
AI总结 本文研究了结构化Stackelberg游戏,提出Stackelberg-Littlestone维度以优化在线学习算法,并在分布设定中提供样本复杂度的上下界。
Comments Accepted as a spotlight paper to ICML 2026
Rule2DRC:用于DRC脚本合成的LLM代理基准测试
机构 * Department of Computer Science and Engineering, Seoul National University(首尔国立大学计算机科学与工程系) ; Neural Processing Research Center(神经处理研究所以) ; Samsung Electronics Co., Ltd(三星电子公司)
AI总结 Rule2DRC是一个大规模基准,用于评估DRC脚本生成代理,包含1000个规则到脚本任务和13921个用于执行评分的评估芯片布局。它提供了一种通过DRC执行结果衡量功能正确性的评估流程,并引入SplitTester生成区分性测试用例以提升Best-of-N选择性能。
Comments ICML 2026
视觉-语言模型的中性参考提示
机构 * Beijing Jiaotong University(北京交通大学)
AI总结 本文提出NeRP策略,通过中性提示和参考图像提升模型对未知类别的判别能力,同时保持对已知类别的准确性。
Comments Accepted at ICML 2026
离线强化学习中的通用时间 horizon 模型
机构 * Interdisciplinary Program in Artificial Intelligence and ASRI, Seoul National University(人工智能交叉学科项目及首尔国立大学ASRI) ; Department of Electrical and Computer Engineering, Seoul National University(电气与计算机工程系,首尔国立大学)
AI总结 本文提出通用时间 horizon 模型,通过灵活预测任意时间 horizon 的未来状态,改进了传统几何时间 horizon 模型在远期状态建模上的不足,并在100个OGBench任务中验证了其有效性。
Comments ICML 2026
位置:人工智能需要元智能——元认知AI的案例
机构 * University of Texas Rio Grande Valley, Edinburg, TX, USA(德克萨斯大学里奥格兰德谷分校) ; Rochester Institute of Technology, Rochester, NY, USA(罗切斯特理工学院) ; Syracuse University, Syracuse, NY, USA(锡拉库萨大学)
AI总结 本文主张将元认知作为设计更准确、安全和高效AI的通用原则,通过联邦学习案例展示元认知提升学习效率和安全性的方法,提出新的软件框架用于实现元认知AI。
Comments This is a preliminary version accepted for presentation and publication at the 43rd International Conference on Machine Learning (ICML26). The modified final version will be available in the conference proceedings
从LLM生成的猜想到Lean形式化:通过求和平方证书实现自动多项式不等式证明
机构 * School of Software Engineering, East China Normal University, Shanghai, China(东华大学软件工程学院) ; College of Computer Science and Technology, National University of Defense Technology, Changsha, China(国防科技大学计算机科学与技术学院) ; School of Computer and Information Engineering, Henan University, Kaifeng, China(河南大学计算机与信息工程学院)
AI总结 本文提出NSPI框架,结合LLM和符号计算,通过求和平方证书实现多项式不等式证明,展示其在10变量多项式上的有效性与可扩展性。
Comments Accepted to ICML 2026. Preprint version
$f$-轨迹平衡:一种用于调整GFlowNets、生成模型和LLMs的损失家族,结合on-policy和off-policy数据
机构 * Department of Statistics, University College London, UK(伦敦大学学院统计学系) ; Valence Labs, London, UK(伦敦Valence实验室)
AI总结 本文提出一种基于$f$-散度的损失家族,通过on-policy和off-policy数据调整生成模型,提升模型覆盖性和泛化能力。
Comments Published at ICML 2026
PACER:从大规模干预数据中进行无环因果发现
机构 * Swiss Federal Technology Institute of Lausanne (EPFL), Switzerland(瑞士联邦理工学院洛桑分校) ; Cornell University, USA(康奈尔大学) ; ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院)
AI总结 PACER通过构建无环性保证的因果发现框架,在大规模高维干预数据中实现高效且准确的因果结构推断,优于现有方法。
Comments Accepted at the 43rd International Conference on Machine Learning (2026)
视觉语言模型的深度预对齐
机构 * Tsinghua University ; Shanghai Qi Zhi Institute ; Taobao \& Tmall Group of Alibaba
AI总结 本文提出深度预对齐(DPA),通过替换传统ViT编码器为小型VLM作为感知器,实现视觉特征与目标大语言模型文本空间的深度对齐,提升了多模态基准性能,并降低了语言能力遗忘。
Comments Accepted by ICML 2026. Project Website: https://github.com/THUMAI-Lab/Deep-Pre-Alignment
位置:想法应是机器学习研究的中心
机构 * Department of Mathematics and Statistics(数学与统计学系) ; York University(约克大学) ; Toronto M3J 1P3, Canada(多伦多M3J 1P3, 加拿大)
AI总结 本文主张机器学习研究应以想法为核心,通过行为签名测试促进理论与实践的结合,并消除复杂性溢价,使更多研究人员能做出严谨贡献。
Comments Accepted into ICML 2026 https://icml.cc/virtual/2026/poster/67144