A Low-Rank Subspace Analysis of LLM Interventions
LLM干预的低秩子空间分析
机构 * University of Cambridge(剑桥大学)
AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。
Comments Mechanistic Interpretability Workshop @ ICML 2026
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
LLM干预的低秩子空间分析
机构 * University of Cambridge(剑桥大学)
AI总结 提出诊断框架,将行为建模为激活空间中的低秩子空间,发现干预一个行为会不对称地影响其他行为,效果与子空间重叠和决策子空间角度相关。
Comments Mechanistic Interpretability Workshop @ ICML 2026
ForceForget: 通过强化概念移除增强文本到图像模型的安全性
机构 * Dong Han(董汉) ; Yong Li(李勇)
AI总结 针对文本到图像模型生成不安全内容的问题,提出基于强化学习优化概念擦除奖励的方法,通过安全适配器调节文本嵌入,在消除不安全内容的同时保持模型对安全语义的生成能力。
Comments Accepted to ICML 2026
当语言表示交互时:LLM中的可分离性与跨语言效应
机构 * University of Oxford(牛津大学) ; Imperial College London(帝国理工学院) ; University of York(约克大学)
AI总结 通过因果几何分析,研究多语言LLM中语言表示的线性可分离性及跨语言结构依赖,发现语言概念在协方差调整内积下可分离,同语系语言呈现单纯形几何结构。
Comments Trustworthy AI for Good (AI4Good) Workshop @ ICML 2026
“AI对齐”包含相互竞争的技术优先级
AI总结 本文指出AI对齐概念存在多种定义,不同研究项目下的对齐干预可能相互冲突,并建议研究者区分政策与科学范围、明确方法分歧、区分理想与代理指标、细化危害/收益来源、承认概念多样性。
Comments 9 pages, 0 figures, 2 tables, ICML 2026
层次化常微分方程:学习连续时间物理原型用于早期链路故障检测
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出层次化常微分方程聚类网络,利用神经ODE建模连续潜状态演化,解耦随机噪声与动态趋势,自适应确定原型数量,在不规则采样时间序列的早期链路故障检测中有效提取物理原型。
Comments International Conference on Machine Learning 2026
HiST:用于跨模态空间转录组建模的分层稀疏Transformer
机构 * New Jersey Institute of Technology(新泽西理工学院) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Karolinska Institutet(卡罗林斯卡学院) ; Dartmouth College(达特茅斯学院)
AI总结 提出HiST,一种分层稀疏Transformer,通过稀疏窗口注意力和分辨率变换算子实现高效的多尺度空间转录组推断,显著降低计算开销并提升预测性能。
Journal ref ICML 2026
从提示到响应:分割大语言模型中的双面数据泄露与防御
AI总结 提出PIDI攻击方法,同时泄露分割LLM中的输入提示和输出响应;并设计ADMI防御机制,通过适配器热身和互信息正则化有效抵御攻击。
Comments 18 pages, Accepted at ICML 2026
DRIVE:基于分布与检索增强的价值评估竞价方法
机构 * Machine Learning, ICML(机器学习,ICML)
AI总结 提出DRIVE框架,通过解耦候选动作生成与决策,结合分布建模、检索增强和价值评估,提升离线自动竞价性能。
Comments Accepted to ICML 2026
朴素视觉记忆不足:GUI代理的失败模式研究
机构 * KAIST(韩国科学技术院)
AI总结 本文提出动作锚定视觉记忆(AGMem),通过存储与成功动作相关的局部GUI区域图像而非全屏截图,减少GUI代理中的动作级错误,在OSWorld上将任务成功率提升33.3%。
Comments 9 pages, 5 figures, ICML 2026 WORKSHOP
Minim: 通过可信本地净化实现代理的隐私感知最小化视图
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对LLM代理传输完整UI状态导致隐私泄露的问题,提出MINIM框架,在客户端基于上下文完整性学习双重分数(敏感性和必要性),通过三元披露策略实现隐私感知的最小化视图,在减少敏感泄露的同时保留任务关键信息。
Comments Accepted at ICML 2026 (43rd International Conference on Machine Learning, Seoul, South Korea). Code available at https://github.com/yyyyhx/MINIM
Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析
机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) ; Raeth AI
AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。
Comments 33 pages, ICML Workshop
电子表格中下一步动作预测的基准测试与框架
机构 * University of Waterloo(多伦多大学)
AI总结 针对电子表格缺乏自动补全功能的问题,提出一个基准测试,通过人工整理动作序列和在线评估方法,比较多种预测模型,分析动作保存、误报、效率等特性。
Comments Accepted at ICML 2026. Code and benchmark: https://github.com/Tej-55/NAPE
立场:AI 必须转向以行星为中心,而非仅以人为中心
AI总结 本文提出以行星为中心的AI(PCAI)设计哲学,通过系统思维重新定位AI以应对全球性社会-生态系统挑战,并强调与全球议程对齐、系统感知基础、轨迹导向评估和可监测性。
Journal ref International Conference on Machine Learning (ICML 2026)
黎曼度量匹配:面向分布的可扩展几何建模
机构 * University of Cambridge(剑桥大学)
AI总结 提出黎曼度量匹配框架,通过神经网络学习数据的黎曼几何,利用carré du champ算子的条件期望形式实现样本级训练和恒定成本推理,在精度相当或更优下速度提升400倍。
Comments ICML 2026 (Oral)
TWLA:通过训练后量化实现大语言模型的三值权重和低位激活
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出TWLA框架,通过后训练量化实现1.58位权重和4位激活,解决激活分布长尾问题,加速推理。
Comments Accepted by ICML 2026
在AI生成音乐检测中生成器偏移下的Token空间探测
机构 * KAIST(韩国科学技术院)
AI总结 针对AI音乐检测器在生成器偏移下性能下降的问题,提出CoMoE紧凑分类器比较不同音频Token空间,发现编码器风格离散Token空间应作为主要实验变量。
Comments Accepted to ICML 2026 ML4Audio workshop
具有瞬时效应和指数族的可识别马尔可夫切换模型
机构 * University of Amsterdam(阿姆斯特丹大学)
AI总结 针对非平稳时间序列,提出在指数族噪声下具有瞬时效应的马尔可夫切换模型的可识别性理论,并开发FlowMSM框架用于检测隐状态和恢复因果结构。
Comments International Conference on Machine Learning (ICML) 2026
通过三阶SO(3)表示耦合的旋转不变球面水印
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 针对全景图像在任意3D旋转下水印鲁棒性不足的问题,提出利用三阶SO(3)表示耦合构造旋转不变的球面双谱,将水印嵌入高阶球谐系数并从不变标量中提取,实现理论保证的旋转不变性和高视觉保真度。
Comments ICML 2026
知道何时退出:LLM推理中动态弃权的原则性框架
机构 * Hebrew University of Jerusalem(特拉维夫大学)
AI总结 本文提出一个基于正则化强化学习框架的动态弃权原则,通过价值函数与弃权奖励的比较来决定是否提前终止推理,在数学推理和毒性避免任务上优于现有方法。
Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)
通过极端比例思维链压缩实现高效大型语言推理模型
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出Extra-CoT框架,通过极端比例压缩思维链、混合比例监督微调和约束层次化比率策略优化,在显著减少推理令牌的同时保持甚至提升推理准确率。
Comments Accepted to ICML 2026. 15 pages, 7 figures
Manga109-v2026: 重新审视Manga109标注以适应现代漫画理解
机构 * University of Tokyo(东京大学)
AI总结 本文重新审视Manga109的对话文本标注,识别出五类标注问题,包括转录错误、缺失文本区域、对话与拟声词重叠以及未分割的对话气泡,并通过结合OCR基于的问题检测和人工修订构建Manga109-v2026,修订了约29,000个对话标注,使Manga109更好地适应现代OCR和多模态漫画理解系统,同时保留漫画特有的表达结构。
Comments Accepted to the Culture x AI Workshop at ICML 2026. Project page: https://manga109.github.io/manga109-project-website/en/
扮演魔鬼的代言人:现成的人格向量在顺从性上与针对性引导相媲美
机构 * University of Toronto(多伦多大学) ; Princeton University(普林斯顿大学) ; Purdue University(普渡大学) ; EPFL(瑞士联邦理工学院) ; Algoverse ; Independent(独立)
AI总结 本文研究了不同人格对顺从性的影响,发现现成的人格引导向量在减少顺从性方面与针对性引导相当,且在用户正确时保持准确性。
Journal ref ICML, Pluralistic Alignment Workshop, 2026
FedRot-LoRA: 缓解联邦LoRA中的旋转偏移
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 本文提出FedRot-LoRA框架,通过正交变换对齐客户端更新以减少子空间不匹配,提升联邦LoRA在异质数据下的性能。
Comments ICML 2026
计划在哪里?通过轻量级机制干预定位语言模型中的潜在规划
机构 * University of California, Berkeley(加州大学伯克利分校)
AI总结 通过押韵对句补全任务,使用线性探针和激活修补方法,研究语言模型在生成过程中是否形成并因果依赖未来约束的潜在规划,发现仅Gemma-3-27B模型存在因果依赖,并定位到五个注意力头。
Comments 13 pages, 20 figures, 3 tables. Accepted to Workshop on Mechanistic Interpretability @ ICML 2026
无牺牲的引导:面向仅提示干预的引导向量的原则性训练
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出联合训练引导因子和方向的方法,消除后验因子选择;引入仅提示引导向量(PrOSV),仅干预少量提示词,在AxBench上优于传统全序列引导向量,并实现更好的通用模型效用与对抗鲁棒性权衡。
Comments 63 pages, 50 figures; accepted by ICML 2026
3D-RFT:基于视频的3D场景理解的强化微调
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出3D-RFT框架,将可验证奖励的强化学习(RLVR)扩展到视频3D感知与推理,通过直接优化评估指标(如3D IoU和F1分数)提升性能,4B模型超越8B模型。
Comments Accepted at ICML 2026. Project page: https://3d-rft.github.io/
通过合成语义信息增益奖励优化基于检索的智能推理
机构 * Hong Kong JC STEM Lab of Smart City.(香港JC STEM实验室) ; City University of Hong Kong.(香港城市大学) ; Lingnan University(岭南大学) ; Fudan University.(复旦大学) ; Huazhong University of Science and Technology.(华中科技大学)
AI总结 提出InfoReasoner框架,利用合成语义信息增益奖励优化检索过程,通过GRPO训练策略,在七个问答基准上平均准确率提升5.4%。
Comments Accepted by ICML'26
大型语言模型代理并非总是忠实的自我进化者
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本研究首次系统调查自我进化LLM代理的经验忠实性,通过因果干预发现代理依赖原始经验但常忽略或误解浓缩经验,并分析其成因。
Comments ICML 2026
MET-Bench:用于评估视觉语言与推理模型局限性的多模态实体追踪
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出MET-Bench多模态实体追踪基准,发现视觉语言模型在图像实体追踪上显著弱于文本,主要源于视觉推理缺陷,强化学习可提升模态内性能但跨模态迁移不足。
Comments ICML 2026
HyperPotter: 在音频深度伪造检测中施展高阶交互的魔力
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出基于超图的HyperPotter框架,通过聚类超边和类感知原型初始化捕获高阶交互,在13个测试集上平均EER降低12.68%。
Comments 20 pages, 8 figures, accepted to ICML 2026