What Must Generalist Agents Remember?
通用型智能体必须记住什么?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文形式化论证了通用型智能体为在多个环境和目标下近似最优行动,必须存储领域相关信息以区分观察瓶颈处的不兼容最优动作,并证明记忆可用于重构局部转移动态。
高校专区
通用型智能体必须记住什么?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文形式化论证了通用型智能体为在多个环境和目标下近似最优行动,必须存储领域相关信息以区分观察瓶颈处的不兼容最优动作,并证明记忆可用于重构局部转移动态。
AI驱动的人类导师评估:将培训表现与实际教学实践联系起来
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Vanderbilt University(范德比大学)
AI总结 提出一种AI系统,利用生成式AI分析真实辅导转录,评估导师技能迁移,发现培训表现显著预测实际教学得分(效应量0.25 SD),并贡献开放数据集和评分标准。
Comments Full research paper accepted at EC-TEL 2026
人脸呈现攻击检测中的架构偏差:视觉Transformer与卷积神经网络的比较研究
机构 * College of Engineering, Carnegie Mellon University(卡内基梅隆大学工程学院)
AI总结 通过比较ViT和CNN在人脸呈现攻击检测中的表现,发现预训练ViT(DeiT-S)在准确率、公平性和跨种族泛化上优于CNN,将种族间ACER差距降低83%。
Comments 8 Pages, 4 Figures, 5 Tables
概念调制模型:可识别性与外推的统一框架
机构 * Department of Statistics and Data Science, Carnegie Mellon University(卡内基梅隆大学统计与数据科学系) ; Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系)
AI总结 提出概念调制模型(CMMs),通过属性势统一条件潜变量模型的可识别性与外推分析,将基于转移的可识别性提升至条件设置,并导出代数外推准则。
恢复、发现、规划:从机器人失败中学习技能与概念
机构 * CMU(卡内基梅隆大学) ; Princeton(普林斯顿大学) ; AI2(艾伦人工智能研究所) ; MIT(麻省理工学院) ; Centaur AI ; Bosch Center for AI(博世人工智能中心)
AI总结 提出ReSYNC方法,通过技能学习与概念发现的交替过程,从失败恢复经验中逐步构建抽象谓词,实现全局失败避免和长期规划,性能提升超50%。
Comments 9 pages, 6 figures. Website: https://jaraxxus-me.github.io/ReSYNC/
带移动障碍物的移动目标旅行商问题的两阶段双层搜索
机构 * Texas A&M University(德克萨斯A&M大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对带移动障碍物的移动目标旅行商问题,提出混合整数锥规划公式和两阶段双层搜索算法,显著优于基线方法。
钱德拉-盖亚对应体星表:利用机器学习解决钱德拉源星表中X射线源与盖亚源的多重匹配歧义
机构 * Center for Astrophysics Harvard \& Smithsonian, 60 Garden St, Cambridge MA 02138, USA ; Harvard John A. Paulson School of Engineering ; Universidad del Rosario, School of Engineering, Science ; The NSF AI Institute for Artificial Intelligence ; New York University, Courant Institute, 60 5th Avenue, New York NY, USA ; Carnegie Mellon University, 5000 Forbes Avenue, Pittsburgh, PA 15213 ; New College of Florida, 5800 Bayshore Road, Sarasota, FL 34243, USA ; Astrophysics Laboratory, 3251 Hanover St, Palo Alto, CA 94304, USA
AI总结 提出结合源属性(星等、颜色、距离)的机器学习框架,解决钱德拉源星表与盖亚源星表的交叉匹配歧义,为约11.3万个X射线源找到对应体,并识别约2万个假匹配。
Comments Accepted to The Astrophysical Journal. Website: https://www.samuelperezdi.com/chandragaia/
SpecAlign: 通过合成数据实现高效的大语言模型规范对齐
机构 * University of Notre Dame(圣母大学) ; Carnegie Mellon University(卡内基梅隆大学) ; LMU Munich(慕尼黑大学) ; University of Southern California(南加州大学)
AI总结 提出规范对齐新范式,通过从规范文档合成数据(SpecAlign框架),结合结构化规则标注、可控规范实例化和多智能体对抗数据合成,生成细粒度偏好对,提升规则遵守度且不损害通用能力。
Comments 58 pages
$\texttt{WEAVER}$:更好、更快、更长——一种有效的机器人操作世界模型
机构 * Mila - Québec AI Institute(Mila - 魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Carnegie Mellon University(卡内基梅隆大学) ; McGill University(麦吉尔大学)
AI总结 提出WEAVER世界模型架构,通过流匹配损失训练多视图潜在预测,同时实现高保真度、长程一致性和高效推理,在机器人操作任务中显著提升策略评估、改进和测试时规划性能。
通过组合伴随匹配实现组合优化的无监督扩散求解器
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 提出组合伴随匹配(CAM)框架,利用离散伴随动力学和随机控制公式,实现无监督训练离散扩散求解器,在多种组合优化问题上达到与监督方法竞争的性能。
Comments ICML26
LALM-as-a-Judge:用于多轮口语对话安全评估的大型音频语言模型基准测试
机构 * Computer Engineering, Technion--Israel Institute of Technology, Haifa, Israel(技术学院电子工程系,技术离子技术研究所,以色列海法) ; Language Technologies Institute, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,卡内基梅隆大学,美国匹兹堡)
AI总结 针对口语对话中社会不安全内容评估仍以文本为中心、忽略韵律和转录失败的问题,提出包含24000个多轮口语对话的开放基准,评估6种大型音频语言模型在文本、音频和多模态设置下的敏感性、严重性顺序特异性和轮次位置偏差,发现音频提供非词汇证据,多模态增益非普遍且存在多种模式。
Comments Accepted to ICML 2026
博弈中的递归联合模拟
机构 * Foundations of Cooperative AI Lab (FOCAL), Computer Science Department(合作人工智能基础实验室(FOCAL),计算机科学系) ; Carnegie Mellon University(卡内基梅隆大学) ; AI Center(人工智能中心) ; Czech Technical University(捷克技术大学) ; Center for Theoretical Study(理论研究中心) ; Charles University(查理大学)
AI总结 研究AI智能体通过递归联合模拟实现合作,证明该过程等价于原博弈的无限重复版本,从而可直接应用民间定理等现有结论。
ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计
机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) ; Datadog
AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。
现实中的安全与隐私提示:用户向LLM提问及LLM如何回应
机构 * Carnegie Mellon University(卡内基梅隆大学) ; RSAC Labs(RSAC实验室)
AI总结 基于WildChat数据集,分析用户向大语言模型提出的安全与隐私问题,分类并评估模型回答质量与一致性。
AIGS-Net: 基于2D高斯泼溅的紧凑光照场建模用于快速低光图像增强
机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) ; Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院) ; School of Mathematics and Statistics, Qingdao University(青岛大学数学与统计学院) ; National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) ; School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)
AI总结 提出AIGS-Net,通过输入自适应的2D高斯泼溅光照场和零参数多尺度上下文编码,以约40个可学习参数实现低光图像增强,在LOL和LSRW基准上平衡了增强质量与推理效率。
高斯光场溅射:一种物理先验驱动的视觉Transformer用于无监督低光图像增强
机构 * College of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) ; Herbert Wertheim College of Engineering, University of Florida(佛罗里达大学赫伯特·韦特海姆工程学院) ; Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) ; National Innovation Center of Intelligent and Connected Vehicles(国家智能网联汽车创新中心) ; School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)
AI总结 提出GLFS模型,将高斯溅射的连续物理光照建模引入Transformer,通过各向异性高斯函数表示场景光照并引入物理引导偏置到自注意力中,配合颜色向量角损失和亮度边缘损失,实现非均匀光照下的曝光均衡和色彩校正,达到最先进性能。
评估大型语言模型在会议中的收话人、话轮转换和下一说话人预测能力
机构 * NTT, Inc., Japan(日本电信电话公司) ; Language Technologies Institute, Carnegie Mellon University, USA(卡内基梅隆大学语言技术研究所)
AI总结 利用大型语言模型(LLMs)研究多模态多人对话中的话轮转换,构建了收话人检测、话轮转换预测和下一说话人预测三个任务的评估框架,实验表明LLMs在下一说话人预测上优于监督模型和人类,但多模态LLM在收话人检测和话轮转换预测上仍低于人类水平。
Comments Accepted to INTERSPEECH 2026
基于偏好的离线轨迹评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。
基于流形感知经验回放的外骨骼控制持续在线个性化
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出流形感知经验回放框架,通过回放缓冲区保留用户特定表征,避免在线适应中的灾难性遗忘,在模拟偏瘫步态中扭矩和步态相位跟踪精度分别提升40%和60%。
超越并行采样:面向智能搜索的多样化查询初始化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Instituto Superior Técnico and INESC-ID, University of Lisbon(里斯本大学高等技术学院和INESC-ID) ; NOVA LINCS, NOVA School of Science and Technology(新里斯本大学科学与技术学院NOVA LINCS)
AI总结 针对智能搜索中的广度缩放,提出DivInit方法,通过在第一轮生成多样化查询而非独立采样,缓解查询冗余问题,在多跳问答任务中平均提升5-7个点。
Comments 15 pages, 8 figures; under review at EMNLP 2026
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
AIMER: 免校准任务无关的MoE专家剪枝
机构 * Zhejiang University(浙江大学) ; Westlake University(西湖大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出AIMER方法,通过专家权重的集中度模式识别独特专家,实现免校准的任务无关MoE专家剪枝,在7B至47B模型上优于现有方法。
OmniRetarget:面向人形全身运动操控与场景交互的交互保持数据生成
机构 * Amazon FAR (Frontier AI & Robotics)(亚马逊前沿人工智能与机器人实验室) ; MIT(麻省理工学院) ; UC Berkeley(伯克利大学) ; Stanford University(斯坦福大学) ; CMU(卡内基梅隆大学)
AI总结 提出OmniRetarget引擎,通过交互网格显式建模并保持智能体、地形和物体间的空间与接触关系,将人类运动重定向为机器人运动,生成高质量轨迹以训练强化学习策略,实现长时间跑酷和操控技能。
Comments Project website: https://omniretarget.github.io
FedMLAC:基于互学习的异构联邦音频分类
机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学学院) ; Mila - Quebec AI Institute(魁北克AI研究所) ; School of Mathematics, Physics and Computing, University of Southern Queensland(南方昆士兰大学数学、物理与计算学院) ; Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; School of Science, Engineering and Environment, University of Salford(萨尔福德大学科学、工程与环境学院)
AI总结 FedMLAC通过双向知识蒸馏解决联邦音频分类中的数据和模型异质性问题,并引入分层剪枝聚合策略对抗数据污染,实验表明其在分类准确性和抗噪声能力上优于现有方法。
Comments updated version for the first submission
Journal ref Pattern Recognition, vol. 180, Article 114250, 2026
面向多样化类人团队协作与通信的算法化提示生成与大型语言模型
机构 * Thomas Lord Department of Computer Science, University of Southern California(美国南加州大学汤姆·劳德计算机科学系) ; School of Computing and Information, University of Pittsburgh(美国匹兹堡大学计算与信息学院) ; Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Sibley School of Mechanical and Aerospace Engineering, Cornell University(康奈尔大学西伯利机械与航空航天工程学院)
AI总结 结合质量多样性优化与LLM代理,自动搜索生成多样化团队行为的提示,捕获人类协作与通信策略,并通过用户研究验证其类人性。
ExpRL: 用于LLM中期训练的探索性强化学习
机构 * Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学) ; OpenAI ; Rogo
AI总结 提出ExpRL方法,利用人类编写的问答数据作为奖励支架,通过密集奖励强化推理过程中的部分进展和有用行为,在数学推理任务上优于SFT、稀疏奖励GRPO和自蒸馏,并为后续稀疏奖励RL提供更好的初始化。
TuneJury: 一种改进音乐生成偏好对齐的开放指标
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Sony AI(索尼AI) ; Georgia Tech(佐治亚理工学院) ; KAIST(韩国科学技术院) ; Peking University(北京大学) ; QMUL(伦敦玛丽女王大学)
AI总结 提出TuneJury,一个开放、实例级别的成对奖励模型,用于文本到音乐生成,通过预测偏好分数支持数据筛选、后处理校准,并在推理、优化和训练中提升对齐效果。
Comments 32 pages, 9 figures
探测神经音频编解码器中的低帧率退化
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区)
AI总结 通过控制帧率消融实验,发现低帧率质量悬崖源于训练配置缺陷而非根本性障碍,修正后帧率可降至3.1Hz和1.6Hz。
Comments Accepted at Interspeech 2026
MyPCBench: 个人智能计算机使用代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出MyPCBench基准,在模拟真实桌面环境(含17个Web应用)中测试个人计算机使用代理,发现最佳模型Claude Opus 4.6仅解决55.4%任务,失败集中在多应用和长轨迹任务。
ART-Glove:用于接触接地灵巧交互捕获的关节式触觉手套
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出ART-Glove关节式触觉手套,通过16个刚性功能表面和22个解剖对齐关节,同步捕获22自由度关节运动和2048触觉点接触信息,支持下游灵巧机器人学习。