Large Language Model Agents Are Not Always Faithful Self-Evolvers
大型语言模型代理并非总是忠实的自我进化者
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本研究首次系统调查自我进化LLM代理的经验忠实性,通过因果干预发现代理依赖原始经验但常忽略或误解浓缩经验,并分析其成因。
Comments ICML 2026
高校专区
大型语言模型代理并非总是忠实的自我进化者
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本研究首次系统调查自我进化LLM代理的经验忠实性,通过因果干预发现代理依赖原始经验但常忽略或误解浓缩经验,并分析其成因。
Comments ICML 2026
HyperPotter: 在音频深度伪造检测中施展高阶交互的魔力
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出基于超图的HyperPotter框架,通过聚类超边和类感知原型初始化捕获高阶交互,在13个测试集上平均EER降低12.68%。
Comments 20 pages, 8 figures, accepted to ICML 2026
Sentinel: 通过注意力探测解码上下文利用以实现高效LLM上下文压缩
机构 * Ping An Technology (Shenzhen) Co., Ltd., China(平安科技(深圳)有限公司,中国) ; University of Science and Technology of China(中国科学技术大学) ; University of Electronic Science and Technology of China(电子科技大学)
AI总结 提出Sentinel,一种轻量级句子级压缩框架,通过冻结LLM的头部注意力模式解码推理时上下文利用行为,使用单次非自回归前向传递实现压缩,在LongBench上以0.5B代理模型达到5倍压缩且性能与7B模型方法相当。
Comments Preprint
PocketLLM: 通过元网络实现大语言模型的终极压缩
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出PocketLLM,通过元网络在潜在空间压缩大语言模型,利用编码器和解码器实现高效压缩,实验表明在高压缩比下仍保持高精度。
Comments AAAI 2026 camera ready
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(39), 33250-33258 (2026)
ChatGPT 在推荐中是否公平?评估大语言模型推荐的公平性
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 针对大语言模型推荐(RecLLM)可能存在的偏见,提出公平性基准 FaiRLLM,包含精心设计的指标和涵盖8个敏感属性的数据集,评估发现 ChatGPT 在推荐中仍存在不公平现象。
Comments Accepted by Recsys 2023 (Short). Typo corrections
EvTexture++: 事件驱动的视频超分辨率纹理增强
机构 * MOE Key Laboratory of Brain-Inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,脑启发智能感知与认知教育部重点实验室) ; Midea Group(美的集团)
AI总结 提出首个事件驱动的视频超分辨率纹理增强框架EvTexture++,利用事件的高频时空细节逐步恢复纹理,并通过时间纹理对齐模块增强帧间一致性,在多个数据集上达到最优性能。
Comments IEEE TPAMI 2026. Extended version of arXiv:2406.13457 (ICML 2024). Project page: https://dachunkai.github.io/evtexture-project-page/
Journal ref IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 48, no. 6, pp. 6642-6659, June 2026
OmniDirector: 无需配对数据的通用多镜头相机克隆
机构 * Kuaishou Technology(快手科技) ; Tsinghua University(清华大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出OmniDirector框架,通过将相机参数编码为网格运动视频,并利用百万级配对数据训练,实现无需交叉配对数据的多镜头相机运动克隆,具备卓越的控制性能。
Comments 12 pages, 8 figures
PolyFlow: 安全高效的多面体约束流匹配,具有约束嵌入和无投影更新
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出PolyFlow,一种将约束直接嵌入模型和流动力学的多面体约束流匹配框架,通过离散时间流公式和无投影架构消除离散化误差并严格满足任意多面体约束,在规划与控制任务中实现零约束违反并降低推理延迟。
Comments 30 pages, 12 figures, Accepted to ICML 2026
跨模态掩码组合概念建模以增强视觉-语言组合性
机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(中国科学技术大学,教育部脑启发智能感知与认知重点实验室) ; Independent Researcher(独立研究员)
AI总结 提出MACCO框架,通过掩码一个模态的组合概念并从另一模态完整上下文重建,增强视觉-语言模型的组合理解能力,在五个基准上显著提升。
Comments Accepted to ACL 2026 Main Conference, 25 pages
ARMOR-MAD:大语言模型推理中异构多智能体辩论的自适应路由
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院)
AI总结 提出ARMOR-MAD框架,通过辩论前协议路由、早期一致停止评估和语义异常检测,自适应控制异构多智能体辩论,提升推理准确性和效率。
Reddit生物伦理争议中立场检测的上下文感知数据集
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) ; School of Urban Planning and Design, Peking University(北京大学城市规划与设计学院)
AI总结 提出BioStance数据集,包含39,600个Reddit生物伦理讨论中的评论-回复对,覆盖六类争议话题,通过三层立场标注实现高可靠性,支持上下文感知的立场检测研究。
自引导:通过解码器流形对齐增强神经编解码器
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出自引导方法,通过轻量特征映射损失对齐解码器内部流形,在不改变推理过程下提升VQ-VAE神经语音编解码器重建质量,实现低比特率SOTA性能并支持4倍码本缩减。
Comments 20 pages, 9 figures, accepted to ICML 2026, demo website available at https://sgvqvae.github.io/sgvqvae-demo
虚假相关性去除是否总是可学习的?
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 研究不变学习在统计可识别时的计算障碍,证明存在一维不变子空间的可采样多环境实例,多项式时间算法无法达到常数精度,并量化环境多样性对可识别性和风险的影响。
Comments poster paper in ICML-2026
基于贝叶斯条件先验的多标签测试时自适应
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出贝叶斯条件先验估计(BCP),一种无梯度的测试时自适应方法,通过在线估计锚定条件先验注入标签依赖性,提升冻结视觉语言模型在多标签识别中的分布偏移鲁棒性。
Comments accepted by ICML2026
LongSpike:用于高效长序列学习的分数阶脉冲状态空间模型
机构 * Wuhan University(武汉大学) ; University of Science and Technology of China(中国科学技术大学) ; Anhui University(安徽大学)
AI总结 提出LongSpike框架,将分数阶状态空间模型(f-SSM)引入脉冲神经网络,通过长记忆核实现高效长序列学习,在多个基准上超越现有SNN。
DailyReport: 一个用于评估搜索代理在日常搜索任务上的开放式基准
机构 * University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 提出DailyReport基准,包含150个开放式日常搜索任务和3546个级联评分标准,通过分解子任务和维度评估,揭示当前搜索代理系统仍未能满足用户期望。
超越问题求解:用于评估竞赛编程中代码生成、攻击和修复的UOJ-Bench基准
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出UOJ-Bench基准,通过代码生成、攻击和修复三项任务评估LLM在竞赛编程中的问题求解与人类代码错误识别能力,发现最强模型在一次性评估中无法识别超过50%的错误提交,但测试时扩展可提升至90%以上,且能发现约5%的满分提交中的错误。
TimeROME-DLM:掩码扩散语言模型的时间因果追踪与低秩推理时知识编辑
机构 * Shanghai Jiao Tong University(上海交通大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 提出TimeROME-DLM,首个无需训练和梯度的推理时知识编辑框架,通过时间因果追踪定位关键坐标并应用低秩残差编辑,在保持模型性能的同时高效删除事实。
MLUBench: 多模态大语言模型终身遗忘评估基准
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出MLUBench基准,评估多模态大模型在连续遗忘请求下的性能,发现现有方法存在累积退化,并揭示多模态对齐保持的挑战,提出LUMoE方法缓解退化。
Comments 36 pages, accepted to the ICML 2026
ECA:面向开放图像到文本生成的高效持续对齐
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)
通过候选感知因果推理增强教学视频中的时间答案定位
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出候选感知因果推理框架,通过视觉-语言预训练候选选择和基于GRPO的时序逻辑推理,解决教学视频中复杂问题理解和长视频片段定位挑战,在六个基准上取得最优mIoU。
Select to Think: 利用局部充分性解锁小语言模型潜力
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出Select to Think (S2T)方法,通过将大语言模型角色从生成转为选择,并蒸馏选择逻辑到小语言模型,使其在推理时无需依赖大模型,显著提升性能。
Comments Accepted to ICML 2026. Code is available at https://github.com/YeRona/Select-to-Think
解码多模态迷宫:多模态注意力模型中可解释性采纳的系统综述
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 本文系统综述了2020年至2024年初多模态模型可解释性研究,发现多数工作集中于视觉-语言和纯语言模型,注意力机制是主要解释方法,但评估缺乏系统性和鲁棒性,并提出了改进建议。
面向表格数据的通用异常检测
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出OFA-TAD框架,通过多视图邻居距离表示和混合专家评分网络,实现跨领域表格异常检测的通用化,一次训练即可泛化到未见数据集。
Comments Accepted by ICML 2026
CMI-RewardBench: 基于组合多模态指令评估音乐奖励模型
机构 * National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
AI总结 针对音乐生成模型缺乏有效评估机制的问题,提出CMI-RewardBench基准,包含大规模偏好数据集和参数高效奖励模型,实现多模态指令下的音乐质量评估。
Comments Accepted by ICML 2026
InnoEval:将研究思路评估视为基于知识的多视角推理问题
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出InnoEval框架,通过异构深度知识检索和多视角评审委员会,实现基于知识的多维度解耦评估,在点对点、成对和分组评估任务中优于基线方法。
Comments ICML 2026
轻量级可解释Transformer:基于混合图算法展开的交通预测
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出一种通过展开混合图优化算法构建的轻量级可解释类Transformer网络,用于时空交通预测,在保持竞争性能的同时大幅减少参数。
Comments 24 pages, 7 figures, 11 tables
生成式AI模型在学生软件编程学习活动中的使用研究
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 通过对比生成式AI与传统在线资源对编程学习的影响,发现AI能提升任务表现但未必带来知识增益,初学者过度依赖而中级生选择性使用,呼吁将AI作为学习工具而非解题工具。
Comments 9 pages, 4 figures, published at AIWARE 2025
OmniBioTwin:用于健康数字孪生的孪生系统之系统框架
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出OmniBioTwin框架,通过多层级网络架构中的模块化孪生体和交互算子,实现跨尺度健康数字孪生的系统级集成,并在阿尔茨海默病GLP-1信号通路中验证。
从二维网格到一维标记:重塑多模态图像融合的共享表示
机构 * University of Science and Technology of China(中国科学技术大学)
AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)