Notes to Self: Can LLMs Benefit from Experiential Abstractions?
给自己的笔记:大语言模型能从经验抽象中受益吗?
机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)
AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。
高校专区
给自己的笔记:大语言模型能从经验抽象中受益吗?
机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)
AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。
媒体偏见检测中可解释性的多维评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Indiana University(印第安纳大学) ; Georgia State University(佐治亚州立大学)
AI总结 研究媒体偏见检测中可解释性,以BABE数据集对BERT和RoBERTa沿预测性能、解释合理性、机制忠实性三个轴评估,还研究注意力监督微调,发现不同架构在这些方面有差异,三者应分别评估。
Comments 12 pages, 6 figures, under review
ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击
机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) ; Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) ; Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)
AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。
重新思考大语言模型中的不确定性评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta
AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。
Comments 19 pages, 11 figures, ICML 2026 EIML Workshop
不要愚弄我两次:通过经验驱动推理在野外适应逆境
机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。
Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
基于高斯过程的后验采样强化学习用于连续控制:无界状态空间的次线性遗憾界
机构 * University of Oxford(牛津大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Technical University of Darmstadt(达姆施塔特技术大学) ; Robotics Institute Germany(德国机器人研究所)
AI总结 本文通过递归应用Borell-Tsirelson-Ibragimov-Sudakov不等式和链式方法,在弱平滑条件下证明了GP-PSRL算法的贝叶斯遗憾界为$\widetilde{\mathcal{O}}(H\sqrt{\gamma_TT})$,解决了先前理论工作的局限性。
Comments Accepted at ICML 2026. 45 pages, 8 figures
针对未见类别的成员推理攻击
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。
Comments Published at ICML 2026