arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-07-08 至 2026-07-08 共收录 12
2607.06407 2026-07-08 cs.AI 新提交

ExplAIner: A Declarative Query Language for Explaining Classification Models

ExplAIner:一种用于解释分类模型的声明式查询语言

Marcelo Arenas, Pablo Barceló, Diego Bustamante, Jose Caraball, María Alejandra Schild, Bernardo Subercaseaux

机构 * Pontificia Universidad Católica de Chile(智利天主教大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究为解释分类模型开发声明式查询语言框架,先指出FOIL局限性,再引入ExplAIner可表达多种解释概念,其查询评估属布尔层次结构,还介绍Opt-FOIL,证明相关评估问题复杂度,得出可通过调用SAT求解器评估的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05711 2026-07-08 cs.LG cs.CV 新提交

FourTune: Towards Fully 4-Bit Efficient Post-Training for Diffusion Models

FourTune:迈向扩散模型的全4位高效训练后优化

Bowen Xue, Zihan Min, Xingyang Li, Zhekai Zhang, Haocheng Xi, Lvmin Zhang, Maneesh Agrawala, Jun-Yan Zhu, Song Han, Yujun Lin, Muyang Li

机构 * Nunchux AI MIT(麻省理工学院) CMU(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校)

AI总结 针对大型扩散模型训练后优化的挑战,提出FourTune框架,基于端到端W4A4G4范式,引入三分支混合管道、硬件高效量化等,在多任务中质量与全精度微调相当,在特定数据集上降低内存开销、提高训练吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05407 2026-07-08 cs.CY cs.AI 新提交

Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety

立场:防止人工智能生成的儿童性虐待材料需要新的人工智能安全方法

Neil Kale, Rebecca Portnoff, Pratiksha Thaker, Michael Simpson, Robertson Wang, Kevin Kuo, Chhavi Yadav, Virginia Smith

机构 * Carnegie Mellon University(卡内基梅隆大学) Thorn

AI总结 研究人工智能给儿童安全带来的新风险,指出保护儿童免受其助长的性虐待需新安全方法。探讨现有技术与相关约束的不兼容及带来的挑战,概述15个开放性问题并给出针对性建议,推动将负责任AI原则转化为儿童保护措施。

Comments Accepted (spotlight) in ICML 2026, Position Paper Track. The first two authors contributed equally and may list their names interchangeably

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05405 2026-07-08 cs.CY cs.AI cs.CL 新提交

CCBENCH: Assessing LLM Cultural Competence via Implicitly Signaled Norms using Health Queries

CCBENCH:通过健康查询使用隐式信号规范评估大语言模型的文化能力

Vasudha Varadarajan, Akhila Yerukola, Mona T. Diab, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 该研究引入CCBENCH框架,以健康领域为案例创建CCBENCH-Health评估大语言模型文化能力。通过60个角色、3120次互动对五个领先模型进行基准测试,发现模型文化恰当回应比例低,提示关注文化线索能适度提升性能,还揭示了模型与文化线索互动的一些特点。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05132 2026-07-08 cs.CY cs.CL 新提交

When Agents Lie: Premeditation, Persistence, and Exploitation in Repeated Games

智能体何时撒谎:重复博弈中的预谋、持续性与可利用性研究

Jerick Shi, Terry Jingcheng Zhang, Bernhard Schölkopf, Vincent Conitzer, Zhijing Jin

机构 * Carnegie Mellon University(卡内基梅隆大学) Vector Institute(向量研究所) University of Toronto(多伦多大学) EuroSafeAI

AI总结 本文针对大语言模型智能体行动前公示意图的诚信问题,设计三阶段n人重复博弈协议,评测前沿模型,发现其偏离公示行为多属预谋,不同模型对公示的语义理解不兼容。

Comments Best Paper Award at ICML NExT-Game Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13757 2026-07-08 cs.CR cs.AI 新提交

SEVRA-BENCH: Social Engineering of Vulnerabilities in Review Agents

SEVRA-BENCH:审查智能体中的社会工程漏洞

Rui Melo, Riccardo Fogliato, Sean Zhou, Pratiksha Thaker, Zhiwei Steven Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能) Amazon AWS(亚马逊AWS) Databricks

AI总结 提出SEVRA-BENCH基准,通过社会工程攻击框架评估LLM代码审查智能体拒绝恶意PR的能力,发现闭源与开源模型间存在显著安全差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01256 2026-07-08 stat.ML cs.LG stat.ME 版本更新

Distribution-free changepoint localization after sequential change detection

顺序变化检测后的无分布变化点定位

Aytijhya Saha, Aaditya Ramdas

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种无分布框架,在停止顺序变化检测程序后构建变化点的后检测置信集,无需任何分布假设,并保证了有限样本覆盖率和渐近有界期望大小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02537 2026-07-08 cs.CL cond-mat.mtrl-sci 版本更新

PolyJarvis: An LLM-Orchestrated Agent for Automated All-Atom Molecular Dynamics of Amorphous Homopolymers

PolyJarvis:用于自主聚合物分子动力学模拟的LLM代理

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 PolyJarvis结合大语言模型与RadonPy平台,通过MCP服务器实现从自然语言输入自主执行聚合物分子动力学模拟,预测密度、体积模量和玻璃化温度等性质,验证结果在不同聚合物中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28553 2026-07-08 cs.HC cs.CY cs.LG 版本更新

Multimodal Analytics of Cybersecurity Crisis Preparation Exercises: What Predicts Success?

多模态分析网络安全危机准备演习:什么预测成功?

Conrad Borchers, Valdemar Švábenský, Sandesh K. Kafle, Kevin K. Tang, Jan Vykopal

机构 * Carnegie Mellon University(卡内基梅隆大学) Masaryk University, Faculty of Informatics(马萨里克大学信息学院)

AI总结 研究通过多模态追踪分析网络安全演习中的教学对齐,发现对齐度预测成功,而单纯Bloom分类无效。

Comments Accepted as full paper to the 27th International Conference on Artificial Intelligence in Education (AIED 2026), see https://doi.org/10.1007/978-3-032-29760-0_47

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15275 2026-07-08 cs.CV cs.LG 版本更新

RayRoPE: Projective Ray Positional Encoding for Multi-view Attention

RayRoPE: 多视角注意力的投影位置编码

Yu Wu, Minsik Jeon, Jen-Hao Rick Chang, Oncel Tuzel, Shubham Tulsiani

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司)

AI总结 本文提出RayRoPE,一种基于投影坐标的位置编码方法,用于多视角Transformer,实现SE(3)不变的注意力机制,并能适应3D场景几何。

Comments Project page: https://rayrope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10954 2026-07-08 cs.SE cs.AI 版本更新

Empirical Computation: Prompting versus Programming

经验计算:提示与编程

Eric Tang, Jing Liu, Marcel Böhme

机构 * CMU(卡内基梅隆大学) MPI-SP(马克斯·普朗克研究所)

AI总结 探讨经验计算(用提示让大语言模型解决问题而非编程)的挑战与机遇,呼吁软件工程界分析其特性,如正确性、属性及极限等,以将经验计算确立为软件工程领域。

Comments Accepted at ACM/IEEE ASE'26 (New Ideas and Emerging Results; NIER), 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏