arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-07-23 至 2026-07-23 共收录 7
2607.20372 2026-07-23 cs.CL 新提交

Notes to Self: Can LLMs Benefit from Experiential Abstractions?

给自己的笔记:大语言模型能从经验抽象中受益吗?

Chang Liu, Xinyu Li, Artur Dubrawski

机构 * Auton Lab, Carnegie Mellon University(卡内基梅隆大学自动实验室)

AI总结 研究大语言模型能否从经验抽象中受益,通过从其在MATH训练集的痕迹提取抽象存入可检索库,探索推理时检索和强化学习两种使用模式,发现能提高模型在数学和逻辑推理基准上的性能,且框架可转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19954 2026-07-23 cs.CL 新提交

A Multi-Dimensional Evaluation of Explainability in Media Bias Detection

媒体偏见检测中可解释性的多维评估

Ting Chen, Raina Zhang, Benjamin M. Ampel, Sagar Samtani

机构 * Carnegie Mellon University(卡内基梅隆大学) Indiana University(印第安纳大学) Georgia State University(佐治亚州立大学)

AI总结 研究媒体偏见检测中可解释性,以BABE数据集对BERT和RoBERTa沿预测性能、解释合理性、机制忠实性三个轴评估,还研究注意力监督微调,发现不同架构在这些方面有差异,三者应分别评估。

Comments 12 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19432 2026-07-23 cs.CR cs.AI 新提交

ChainWatch: A Kill Chain-Aligned Sequential Detection Framework for Multi-Step Attacks in MCP-Based AI Agent Systems

ChainWatch:基于杀伤链的顺序检测框架,用于基于MCP的人工智能代理系统中的多步攻击

Om Narayan, Rashmi Jyoti, Ramkinker Singh

机构 * Computer Science New York University New York, USA(计算机科学 新 York 大学 新 York 美国) Cybersecurity University of Maryland, College Park MD, USA(网络安全 美国马里兰大学College Park分校 MD 美国) Carnegie Mellon University Pittsburgh, USA(卡内基梅隆大学 彭博 美国)

AI总结 针对基于MCP的人工智能代理系统中现有防御无法可靠检测多步攻击的问题,提出ChainWatch框架,用六阶段杀伤链建模攻击进展,结合隐马尔可夫模型分类工具调用序列,能检测逃避传统机制的攻击链。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19367 2026-07-23 cs.AI 新提交

Rethinking Uncertainty Evaluation in Large Language Models

重新思考大语言模型中的不确定性评估

Krish Matta, Atharv Naphade, Andy Zou

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 研究大语言模型中置信度评估问题,指出校准标准不充分。沿结构连贯性、忠实性和有用性三个轴形式化条件为C1指标,发现常用估计器违反条件,RLHF等未恢复连贯性,框架可测度与弥合差距。

Comments 19 pages, 11 figures, ICML 2026 EIML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31119 2026-07-23 cs.RO cs.LG 版本更新

Don't Fool Me Twice: Adapting to Adversity in the Wild with Experience-Driven Reasoning

不要愚弄我两次:通过经验驱动推理在野外适应逆境

Navin Sriram Ravie, Andrew Jong, Krrish Jain, John Liu, Omar Alama, Bijo Sebastian, Sebastian Scherer

机构 * Department of Engineering Design, Indian Institute of Technology, Madras(印度理工学院工程设计系,马德拉斯) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出一种持续学习框架,使移动机器人能够在线从干扰中学习,通过语义将异常行为归因于原因,从而更好地预测和规划未来。

Comments Accepted at 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08287 2026-07-23 stat.ML cs.LG 版本更新

Posterior Sampling Reinforcement Learning with Gaussian Processes for Continuous Control: Sublinear Regret Bounds for Unbounded State Spaces

基于高斯过程的后验采样强化学习用于连续控制:无界状态空间的次线性遗憾界

Hamish Flynn, Joe Watson, Ingmar Posner, Jan Peters

机构 * University of Oxford(牛津大学) Carnegie Mellon University(卡内基梅隆大学) Technical University of Darmstadt(达姆施塔特技术大学) Robotics Institute Germany(德国机器人研究所)

AI总结 本文通过递归应用Borell-Tsirelson-Ibragimov-Sudakov不等式和链式方法,在弱平滑条件下证明了GP-PSRL算法的贝叶斯遗憾界为$\widetilde{\mathcal{O}}(H\sqrt{\gamma_TT})$,解决了先前理论工作的局限性。

Comments Accepted at ICML 2026. 45 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06488 2026-07-23 cs.LG cs.CR stat.ML 版本更新

Membership Inference Attacks for Unseen Classes

针对未见类别的成员推理攻击

Pratiksha Thaker, Neil Kale, Zhiwei Steven Wu, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究针对未见类别的成员推理攻击,指出多数现有攻击因无法访问完整目标分布而失败,提出“未见类”设置,证明分位数回归攻击在此设置下优于其他方法,从实证和理论上展示其优势并给出成功所需泛化属性模型。

Comments Published at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏