Flatness Preserves Instruction Following in Vision-Language-Action Models
平坦性保持视觉-语言-动作模型中的指令遵循能力
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对VLA模型微调后忽视语言指令的问题,提出平坦性保持优化(SAM),在不增加数据或修改架构的情况下,将指令遵循率提升60%以上。
高校专区
平坦性保持视觉-语言-动作模型中的指令遵循能力
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对VLA模型微调后忽视语言指令的问题,提出平坦性保持优化(SAM),在不增加数据或修改架构的情况下,将指令遵循率提升60%以上。
智能体时代的因果发现
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出智能体应辅助因果发现流程而非提供因果结论,通过causal-learn+平台实现数据驱动、算法支撑的因果发现,避免语言模型不可靠性转化为因果证据。
Comments Platform is available at causallearn.com
合成Lombard效应:TTS中语音清晰度和发声努力的多级控制
机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Carnegie Mellon University (CMU)(卡内基梅隆大学) ; KIT Campus Transfer (KCT)(KIT校园转移中心)
AI总结 提出基于流匹配的TTS模型,利用发声努力和发音伪标签实现连续解耦控制及词级强调,模拟Lombard效应,提升嘈杂环境下的语音清晰度。
Comments Accepted to Interspeech 2026
Bagpiper-TTS: 自然语言引导的通用语音合成
机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) ; LY Corporation ; NVIDIA Research(英伟达研究院)
AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。
超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素
机构 * Independent Researcher(独立研究者) ; Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。
Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)
从投诉叙述到金钱救济:面向CFPB消费者投诉的混合机器学习框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; North Carolina State University(北卡罗来纳州立大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出混合机器学习框架,利用投诉文本、主题表示和结构化特征预测消费者金融保护局投诉中的金钱救济结果,AUC-ROC从0.69提升至0.78。
RL提升LLM推理能力的关键更新因素是什么?
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; Microsoft Research(微软研究院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。
好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为
机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) ; Human-Computer Interaction Institute, Carnegie Mellon University(卡内基梅隆大学人机交互研究所)
AI总结 提出CURIOBOT框架,通过LLM对话中的语言干预(新奇性、复杂性、冲突、不确定性)激发探索性学习行为,实验显示对话轮次增加2.4倍。
Comments Submitted to EMNLP 2026
用于幂等生成的编码器-解码器流形对齐
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。
FlowDPG:面向真实世界操作的流匹配策略上的确定性策略梯度
机构 * Skild AI ; Carnegie Mellon University(卡内基梅隆大学) ; University of Pennsylvania(宾夕法尼亚大学)
AI总结 提出FlowDPG方法,通过将评论家梯度蒸馏到速度场中,避免反向传播时间,实现流匹配策略的稳定策略改进,并在真实世界双机械臂AirPods组装任务中达到92%成功率。
从语音到文本语料库:评估基于ASR的低资源Fongbe和豪萨语数据采集
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) ; North-West University(北开普大学)
AI总结 研究利用ASR管道为低资源非洲语言Fongbe(声调语言)和豪萨语(非声调语言)扩展文本语料,通过微调MMS-300M和Whisper-Small模型,在Fongbe上实现9.48%的词错误率(相对降低78%),并评估转录质量,发现豪萨语接近可用而Fongbe需后处理。
Comments 10 pages, 1 figure, 4 tables
评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准、失败与指标可靠性
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) ; North-West University(西北大学)
AI总结 本研究评估了四种大语言模型在英语到豪萨语和丰贝语(两种西非低资源语言)的翻译质量,发现质量因语言而异,模型排名不一致,且自动指标与人类判断的相关性波动大,建议采用多指标评估并注意神经指标的局限性。
Comments 19 pages, 10 tables
DeformX: 一种用于可变形线性物体的多功能协同仿真框架
机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) ; School of Ocean and Civil Engineering, Shanghai Jiao Tong University(上海交通大学海洋与土木工程学院) ; Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) ; John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院)
AI总结 提出DeformX框架,集成Cosserat杆物理引擎与NVIDIA Isaac Sim,实现可变形线性物体的物理精确与视觉真实仿真,支持机器人学习,在真实线缆分割和绳索摆动任务中验证了仿真到现实的迁移能力。
Comments 11 pages, 11 figures, 5 tables, IROS 2026. Website: https://deformx.github.io/
为高性能多语言ASR添加鲁棒的代码切换能力
机构 * Interactive Systems Lab, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院交互系统实验室) ; InterACT, Carnegie Mellon University (CMU)(卡内基梅隆大学InterACT实验室)
AI总结 针对多语言ASR系统中代码切换的挑战,提出贝叶斯因子化适应方法,在不降低单语性能的前提下,通过少量合成数据将切换相关知识高效集成到预训练模型中,使代码切换词转录错误降低32.87%,整体WER改善5.31%。
Comments Accepted to INTERSPEECH 2026
零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan, Ann Arbor(密歇根大学安娜堡分校) ; Magna International(麦格纳国际)
AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。
Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026
CNnotator: LLM引导的内存安全注释合成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Galois, Inc.(Galois公司)
AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。
Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version
Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages
引导而非求解:为大型代码智能体训练小型评论模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。
智能体代码比人类代码更不易维护吗?
机构 * New York University(纽约大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。
离散化奖励模型
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Meta Superintelligence Labs(Meta超级智能实验室)
AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。
利用人类偏好奖励改进文本到音乐生成
机构 * Georgia Tech(佐治亚理工学院) ; KAIST(韩国科学技术院) ; Peking University(北京大学) ; Queen Mary University of London(伦敦玛丽女王大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出结合人类偏好奖励(TuneJury)的文本到音乐生成方法,通过训练时奖励条件化、专家迭代、偏好微调等五项工程决策,在ATTM挑战中提升FAD-CLAP和CLAP分数。
Comments ICME 2026 Grand Challenge on Academic Text-to-Music Generation
评估文档调优的Transformer表示用于个体级心理健康评估
机构 * Vanderbilt University(范德堡大学) ; Lund University(隆德大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 比较基础Transformer和文档调优Transformer在个体级心理健康评估中的表现,发现文档调优模型在预测准确性和鲁棒性上显著优于基础模型。
不要盲目信任:不可靠反馈如何破坏使用工具的LLM智能体
机构 * Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; CFAR Agency for Science Technology and Research(新加坡科技研究局计算与推理中心) ; IHPC Agency for Science Technology and Research(新加坡科技研究局高性能计算研究所) ; Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究不可靠反馈对工具增强型LLM智能体的影响,通过匹配循环对比实验发现,误导性反馈会导致价值反转,使智能体表现低于无反馈基线,并强调无反馈回退控制对评估的必要性。
Comments 16 pages
在线预测编码用于双模式自监督语音模型
机构 * LY Corporation ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出在线预测编码(OPC)和双模式层归一化,通过多步未来预测正则化寄存器,缩小流式与非流式语音识别的性能差距。
Comments Accepted to Interspeech 2026
Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑
机构 * Auditory Cognition and Computational Acoustics Lab, Shanghai Jiao Tong University(上海交通大学听觉认知与计算声学实验室) ; Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)
AI总结 提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。
Comments Accepted by InterSpeech 2026, For the original codes, see https://github.com/HsunGong/espnet/blob/master/egs2/opuslm_v2/speechlm1, we are submitting a PR to espnet master branch
机器人操作的归纳泛化
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。
异构策略网络用于复合机器人团队的通信与协调
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; Sandia National Laboratories(桑迪亚国家实验室)
AI总结 提出异构策略网络(HetNet),利用异构图注意力网络学习异构机器人团队的高效协作与通信策略,实现端到端训练的二值化消息传递,在多个领域性能提升5.84%至707.65%,通信带宽降低200倍。
Comments IEEE Transactions on Robotics (T-RO)
BARD-MARL:多智能体强化学习中学习通信的拜占庭智能体检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Carnegie Mellon University Department of Electrical(卡内基梅隆大学电气与计算机工程系)
AI总结 针对多智能体强化学习中的通信信任问题,提出BARD-MARL方法,结合策略图特征和贝叶斯信任统计,在自适应交通信号控制中有效检测拜占庭攻击。
Comments 8 pages, 4 figures; arXiv preprint; ancillary reproducibility/code bundle included
陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败
机构 * Salesforce AI Research(Salesforce AI 研究院) ; University of Cambridge(剑桥大学) ; University of Colorado Boulder(科罗拉多大学博尔德分校) ; Carnegie Mellon University(卡内基梅隆大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。
Comments Under Review
人-智能体交互的设计原则
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出14条设计原则,涵盖初始、交互、长期和故障四个阶段,以指导设计可用、可信且有效的人-智能体交互系统。
特征相关下的人类与AI辅助决策
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究特征相关时AI如何推荐测试以平衡短期决策质量与长期人类学习,证明最优策略需先探索后承诺,并给出算法与近似方法。