ReNikud: Audio-Supervised Hebrew Grapheme-to-Phoneme Conversion
ReNikud:音频监督的希伯来语字素到音素转换
机构 * Reichman University(雷奇曼大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出ReNikud方法,利用音频监督和伪元音化架构,通过无标注音频的ASR伪标签和字符级对齐,解决希伯来语G2P转换中的元音缺失和发音歧义问题,在多个基准上达到最优。
高校专区
ReNikud:音频监督的希伯来语字素到音素转换
机构 * Reichman University(雷奇曼大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出ReNikud方法,利用音频监督和伪元音化架构,通过无标注音频的ASR伪标签和字符级对齐,解决希伯来语G2P转换中的元音缺失和发音歧义问题,在多个基准上达到最优。
ENPIRE: 现实世界中智能体机器人策略的自我改进
机构 * NVIDIA(英伟达) ; CMU(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校)
AI总结 提出ENPIRE框架,通过环境重置、策略执行、结果验证和迭代优化的闭环反馈,使编码智能体自主改进机器人操作策略,在灵巧操作任务上达到99%成功率。
多智能体交互记忆
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校)
AI总结 提出MATM框架,通过共享存储和检索智能体轨迹,实现异构智能体群体间的知识复用,提升下游任务性能并减少交互步骤。
知识工作者问答论坛中的最优调度
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对知识工作者问答论坛,提出基于专家专业水平的请求调度模型,计算系统容量并设计达到容量的调度器,同时探讨专家协作对容量的提升。
Comments 14 pages, 4 figures
通过演化程序瓶颈解释神经组合优化
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出演化程序瓶颈(EPB)框架,通过将黑盒神经组合优化模型蒸馏为可读程序组合,利用LLM和混合梯度下降实现可解释性,揭示模型行为与经典启发式变体的关系。
Comments Under Review
CacheWeaver:面向高效接地RAG推理的缓存感知证据排序
机构 * Heinz College of Information Systems and Public Policy, Carnegie Mellon University(卡内基梅隆大学海因茨信息系统与公共政策学院)
AI总结 提出CacheWeaver,一种轻量级提示层方法,通过缓存感知的证据排序降低RAG推理的首令牌延迟,无需修改服务引擎或证据集。
RIVET: 鲁棒的幂等语音属性编辑
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出RIVET训练框架,通过幂等性正则化提升语音属性编辑模型对标签噪声的鲁棒性,在合成噪声和真实噪声数据集上均优于标准训练。
3D-DLP:自监督3D物体中心场景表示学习
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出3D-DLP模型,通过自监督学习将场景级RGB-D或体素观测分解为3D潜在粒子,每个粒子编码解耦属性,实现可解释的逐粒子分割图,并支持场景操控和下游机器人操作。
Comments ICML 2026. Project webpage: https://eubooks3003.github.io/3d-dlp
S-JEPA:用于自监督语音表示学习的软聚类锚点
机构 * Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; James Silberrad Brown Center for AI(詹姆斯·西尔伯拉德·布朗人工智能中心) ; Columbia University(哥伦比亚大学) ; Northeastern University(东北大学) ; Stanford University(斯坦福大学) ; Amazon GenAI(亚马逊生成式人工智能)
AI总结 提出S-JEPA,通过KL散度匹配高斯混合模型的软后验概率训练编码器-预测器对,无需离线重聚类或教师蒸馏,在SUPERB协议下以低于90M参数取得最低WER,并建立新的帕累托前沿。
LLM招聘决策中的性别偏见:来自日本语境的证据及缓解策略评估
机构 * Shibaura Institute of Technology, Tokyo, Japan(Shibaura技术学院,东京,日本) ; Amsterdam University of Applied Sciences, Amsterdam, Netherlands(阿姆斯特丹应用科学大学,阿姆斯特丹,荷兰) ; University of Pennsylvania, Philadelphia, USA(宾夕法尼亚大学,费城,美国) ; Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,匹兹堡,美国) ; Keio University, Tokyo, Japan(庆应大学,东京,日本)
AI总结 本研究通过60份日本履历书格式的简历和5个先进LLM,发现所有模型均存在显著的亲女性偏见,且简单的提示指令无法缓解,而移除姓名几乎完全消除该偏见。
ACUTE协议:操作语言模型激活以实现更好的校准、效用和信任
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google(谷歌) ; Scale AI
AI总结 提出ACUTE协议,通过操作语言模型激活来估计置信度,平衡校准与信息性,在多项选择问答、工具调用和科学文档摘要等任务上优于强基线,提升校准、效用和可信度。
Comments ICML 2026
MixSD: 混合上下文自蒸馏用于知识注入
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学及向量研究所) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Princeton University(普林斯顿大学) ; Cornell University(康奈尔大学) ; The University of Tokyo(东京大学) ; RIKEN AIP(日本理化学研究所AIP) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(德国图宾根最大计划智能系统研究所) ; EuroSafeAI
AI总结 本文提出MixSD方法,通过混合模型自身条件下的token来实现与模型生成分布对齐的知识注入,从而在保持预训练能力的同时提升事实记忆和推理能力。
PTLD: 从仿真到现实的触觉潜在知识蒸馏用于灵巧操作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Washington(华盛顿大学) ; FAIR at Meta(Meta的FAIR团队) ; UC Berkeley(伯克利大学)
AI总结 提出PTLD方法,通过真实世界触觉策略数据蒸馏鲁棒状态估计器,解决触觉仿真困难问题,在灵巧操作任务中相比纯本体感策略提升182%和57%。
从我们所拥有的学习:在线推理过去交互的历史感知验证器
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)
AI总结 提出历史感知验证器HAVE,通过解耦动作生成与验证,利用历史交互在线消除歧义,理论证明其提升期望动作质量,在多个模拟和真实环境中验证有效性。
Comments CoRL 2025
世界模型批判:一种用于世界建模的生成式潜在预测架构
机构 * Institute of Foundation Models(基础模型研究院) ; Mohamed bin Zayed University of Artificial Intelligence(莫莫德 bin Zayed 人工智能大学) ; School of Computer Science Carnegie Mellon University(计算机科学学院卡内基梅隆大学)
AI总结 本文从心理学“假设性思维”出发,提出世界模型的核心目标是模拟真实世界的所有可行动可能性,并设计了一种基于状态化、分层、多级、混合连续/离散表示的生成式潜在预测(GLP)架构。