arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2606.23641 2026-06-23 cs.RO 新提交

Flatness Preserves Instruction Following in Vision-Language-Action Models

平坦性保持视觉-语言-动作模型中的指令遵循能力

Haochen Zhang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对VLA模型微调后忽视语言指令的问题,提出平坦性保持优化(SAM),在不增加数据或修改架构的情况下,将指令遵循率提升60%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23608 2026-06-23 cs.AI cs.LG cs.SE stat.AP 新提交

Causal Discovery in the Era of Agents

智能体时代的因果发现

Yujia Zheng, Vishal Verma, Mantej Gill, Haoyue Dai, Peter Spirtes, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 提出智能体应辅助因果发现流程而非提供因果结论,通过causal-learn+平台实现数据驱动、算法支撑的因果发现,避免语言模型不可靠性转化为因果证据。

Comments Platform is available at causallearn.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23176 2026-06-23 cs.SD cs.CL 新提交

Synthesizing the Lombard Effect: Multi-Level Control of Speech Clarity and Vocal Effort in TTS

合成Lombard效应:TTS中语音清晰度和发声努力的多级控制

Seymanur Akti, Alexander Waibel

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Carnegie Mellon University (CMU)(卡内基梅隆大学) KIT Campus Transfer (KCT)(KIT校园转移中心)

AI总结 提出基于流匹配的TTS模型,利用发声努力和发音伪标签实现连续解耦控制及词级强调,模拟Lombard效应,提升嘈杂环境下的语音清晰度。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22811 2026-06-23 cs.CL cs.AI 新提交

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

Bagpiper-TTS: 自然语言引导的通用语音合成

Jinchuan Tian, Haoran Wang, Siddhant Arora, Takashi Maekaku, Keita Goto, Jin Sakuma, Yusuke Shinohara, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation NVIDIA Research(英伟达研究院)

AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22711 2026-06-23 cs.SE cs.AI 新提交

Beyond Simpson's Paradox: A Cascade of Confounders in AI Agent Pull-Request Co-Authorship

超越辛普森悖论:AI 智能体拉取请求合著中的级联混杂因素

Haoran Yu, Xiaochong Jiang, Lifei Liu, Su Wang, Pin Qian, Yihang Chen

机构 * Independent Researcher(独立研究者) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本研究通过分层分析和多级控制,揭示了AI编码智能体拉取请求合著与合并率之间的关联主要由智能体组成、仓库选择和PR结构等混杂因素驱动,而非因果关系。

Comments 5 pages. Accepted at the KDD 2026 Workshop on Agentic Software Engineering (SE 3.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22664 2026-06-23 cs.CE cs.LG 新提交

From Complaint Narratives to Monetary Relief: A Hybrid Machine Learning Framework for CFPB Consumer Complaints

从投诉叙述到金钱救济:面向CFPB消费者投诉的混合机器学习框架

Zhuoer Wang, Sizhen Zhu, Xiongyu Chen

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) North Carolina State University(北卡罗来纳州立大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出混合机器学习框架,利用投诉文本、主题表示和结构化特征预测消费者金融保护局投诉中的金钱救济结果,AUC-ROC从0.69提升至0.78。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22349 2026-06-23 cs.CL cs.HC 新提交

Curiosity as Linguistic Intervention: Using LLM Tutoring Dialogues to Influence Exploratory Learning Behavior

好奇心作为语言干预:利用LLM辅导对话影响探索性学习行为

Gevindu Ganganath, Pasindu Bolonghege, Qianru Lyu, Pradeep Varakantham, Thivya Kandappu

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算与信息系统学院) Human-Computer Interaction Institute, Carnegie Mellon University(卡内基梅隆大学人机交互研究所)

AI总结 提出CURIOBOT框架,通过LLM对话中的语言干预(新奇性、复杂性、冲突、不确定性)激发探索性学习行为,实验显示对话轮次增加2.4倍。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22304 2026-06-23 cs.LG 新提交

Encoder-Decoder Manifold Alignment for Idempotent Generation

用于幂等生成的编码器-解码器流形对齐

Dareen Alharthi, Abdul Waheed, Bhiksha Raj

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对生成模型中幂等性不足导致的重复应用不稳定问题,提出通过对齐编码器和解码器学习的流形来训练模型,显著降低幂等误差并提升生成稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22303 2026-06-23 cs.RO 新提交

FlowDPG: Deterministic Policy Gradient on Flow Matching Policies for Real-World Manipulation

FlowDPG:面向真实世界操作的流匹配策略上的确定性策略梯度

Kexin Shi, Junyao Shi, Poorvi Hebbar, Zhuolun Zhao, Tarun Amarnath, Yifan Su, Shikhar Bahl, Deepak Pathak

机构 * Skild AI Carnegie Mellon University(卡内基梅隆大学) University of Pennsylvania(宾夕法尼亚大学)

AI总结 提出FlowDPG方法,通过将评论家梯度蒸馏到速度场中,避免反向传播时间,实现流匹配策略的稳定策略改进,并在真实世界双机械臂AirPods组装任务中达到92%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22274 2026-06-23 cs.CL cs.AI cs.LG 新提交

From Speech to Text Corpora: Evaluating ASR-Based Data Acquisition for Low-Resource Fongbe and Hausa

从语音到文本语料库:评估基于ASR的低资源Fongbe和豪萨语数据采集

Mahounan Pericles Adjovi, Victor Olufemi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校) North-West University(北开普大学)

AI总结 研究利用ASR管道为低资源非洲语言Fongbe(声调语言)和豪萨语(非声调语言)扩展文本语料,通过微调MMS-300M和Whisper-Small模型,在Fongbe上实现9.48%的词错误率(相对降低78%),并评估转录质量,发现豪萨语接近可用而Fongbe需后处理。

Comments 10 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22269 2026-06-23 cs.CL cs.AI cs.LG 新提交

Evaluating Large Language Models for Hausa and Fongbe Machine Translation: Benchmarks, Failures, and Metric Reliability

评估大语言模型在豪萨语和丰贝语机器翻译中的表现:基准、失败与指标可靠性

Mahounan Pericles Adjovi, Roald Eiselen, Prasenjit Mitra

机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲校区) North-West University(西北大学)

AI总结 本研究评估了四种大语言模型在英语到豪萨语和丰贝语(两种西非低资源语言)的翻译质量,发现质量因语言而异,模型排名不一致,且自动指标与人类判断的相关性波动大,建议采用多指标评估并注意神经指标的局限性。

Comments 19 pages, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22116 2026-06-23 cs.RO 新提交

DeformX: A Versatile Co-Simulation Framework for Deformable Linear Objects

DeformX: 一种用于可变形线性物体的多功能协同仿真框架

Yi Yang, Xiang Fei, Lehong Wang, Chenhao Li, Zilin Dai, Henry Kou, Lu Li, Howie Choset

机构 * The Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Mechanical Engineering, Carnegie Mellon University(卡内基梅隆大学机械工程系) School of Ocean and Civil Engineering, Shanghai Jiao Tong University(上海交通大学海洋与土木工程学院) Zhiyuan College, Shanghai Jiao Tong University(上海交通大学致远学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院)

AI总结 提出DeformX框架,集成Cosserat杆物理引擎与NVIDIA Isaac Sim,实现可变形线性物体的物理精确与视觉真实仿真,支持机器人学习,在真实线缆分割和绳索摆动任务中验证了仿真到现实的迁移能力。

Comments 11 pages, 11 figures, 5 tables, IROS 2026. Website: https://deformx.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21990 2026-06-23 cs.CL eess.AS 新提交

Adding Robust Code-Switching Capabilities to High Performance Multilingual ASR

为高性能多语言ASR添加鲁棒的代码切换能力

Enes Yavuz Ugan, Alexander Waibel

机构 * Interactive Systems Lab, Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院交互系统实验室) InterACT, Carnegie Mellon University (CMU)(卡内基梅隆大学InterACT实验室)

AI总结 针对多语言ASR系统中代码切换的挑战,提出贝叶斯因子化适应方法,在不降低单语性能的前提下,通过少量合成数据将切换相关知识高效集成到预训练模型中,使代码切换词转录错误降低32.87%,整体WER改善5.31%。

Comments Accepted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21822 2026-06-23 cs.PL cs.AI cs.SE 新提交

CNnotator: LLM-Guided Memory Safety Annotation Synthesis

CNnotator: LLM引导的内存安全注释合成

Twain Byrnes, Mike Dodds

机构 * Carnegie Mellon University(卡内基梅隆大学) Galois, Inc.(Galois公司)

AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。

Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version

Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21811 2026-06-23 cs.SE cs.AI cs.LG 新提交

Steer, Don't Solve: Training Small Critic Models for Large Code Agents

引导而非求解:为大型代码智能体训练小型评论模型

Shubham Gandhi, Yiqing Xie, Atharva Naik, Ruichen Zhu, Carolyn Rose

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对代码智能体策略推理不足的问题,提出冻结智能体并训练小型评论模型提供轨迹内反馈,在SWE-bench Verified上提升准确率并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21804 2026-06-23 cs.SE cs.AI cs.CL 新提交

Is Agent Code Less Maintainable Than Human Code?

智能体代码比人类代码更不易维护吗?

Shaswat Patel, Betty Li Hou, Arun Purohit, Kai Xu, Jane Pan, He He, Valerie Chen

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过CodeThread框架对比智能体与人类代码在维护场景下的表现,发现基于智能体代码解决任务的成功率下降高达13.1%,传统可维护性指标无法解释差异,而输入验证、错误处理等行为差异是关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21795 2026-06-23 cs.LG 新提交

Discretizing Reward Models

离散化奖励模型

Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika, Chirag Nagpal, Tongshuang Wu, Graham Neubig, Yuning Mao

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Superintelligence Labs(Meta超级智能实验室)

AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21670 2026-06-23 cs.SD cs.AI cs.LG 新提交

Improving Text-to-Music Generation with Human Preference Rewards

利用人类偏好奖励改进文本到音乐生成

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Chris Donahue

机构 * Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) Queen Mary University of London(伦敦玛丽女王大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出结合人类偏好奖励(TuneJury)的文本到音乐生成方法,通过训练时奖励条件化、专家迭代、偏好微调等五项工程决策,在ATTM挑战中提升FAD-CLAP和CLAP分数。

Comments ICME 2026 Grand Challenge on Academic Text-to-Music Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21622 2026-06-23 cs.CL cs.LG 新提交

Evaluating Document-Tuned Transformer Representations for Person-level Mental Health Assessment

评估文档调优的Transformer表示用于个体级心理健康评估

Aaron Marker, Oscar Kjell, Vasudha Varadarajan, H. Andrew Schwartz

机构 * Vanderbilt University(范德堡大学) Lund University(隆德大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 比较基础Transformer和文档调优Transformer在个体级心理健康评估中的表现,发现文档调优模型在预测准确性和鲁棒性上显著优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21409 2026-06-23 cs.AI 新提交

Don't Blindly Trust It: How Unreliable Feedback Breaks Tool-Using LLM Agents

不要盲目信任:不可靠反馈如何破坏使用工具的LLM智能体

Chubin Zhang, Zhenglin Wan, Xingrui Yu, Pengfei Zhou, Wangbo Zhao, Jingxuan Wu, Yaxin Zhou, Ivor Tsang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) CFAR Agency for Science Technology and Research(新加坡科技研究局计算与推理中心) IHPC Agency for Science Technology and Research(新加坡科技研究局高性能计算研究所) Department of Statistics and Operations Research UNC-Chapel Hill(北卡罗来纳大学教堂山分校统计与运筹学系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究不可靠反馈对工具增强型LLM智能体的影响,通过匹配循环对比实验发现,误导性反馈会导致价值反转,使智能体表现低于无反馈基线,并强调无反馈回退控制对评估的必要性。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21268 2026-06-23 cs.SD 新提交

Online Predictive Coding for Dual-Mode Self-Supervised Speech Model

在线预测编码用于双模式自监督语音模型

Keita Goto, Takashi Maekaku, Jin Sakuma, Jinchuan Tian, Yusuke Shinohara, Shinji Watanabe

机构 * LY Corporation Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出在线预测编码(OPC)和双模式层归一化,通过多步未来预测正则化寄存器,缩小流式与非流式语音识别的性能差距。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21227 2026-06-23 cs.SD 新提交

Bagpiper-Edit: Zero-Shot Open-Ended Audio Editing via Rich-Caption

Bagpiper-Edit: 基于丰富描述的零样本开放式音频编辑

Xun Gong, Jinchuan Tian, Haoran Wang, William Chen, Shinji Watanabe, Yanmin Qian

机构 * Auditory Cognition and Computational Acoustics Lab, Shanghai Jiao Tong University(上海交通大学听觉认知与计算声学实验室) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所)

AI总结 提出Bagpiper-Edit,通过将音频编辑转化为丰富描述重写任务,实现零样本、自由形式的开放式音频编辑,无需配对训练数据,在语音、音乐和声音上均表现良好。

Comments Accepted by InterSpeech 2026, For the original codes, see https://github.com/HsunGong/espnet/blob/master/egs2/opuslm_v2/speechlm1, we are submitting a PR to espnet master branch

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20999 2026-06-23 cs.RO cs.LG 新提交

Inductive Generalization for Robotic Manipulation

机器人操作的归纳泛化

Annabella Macaluso, Haochen Zhang, Ishaan Masilamony, Yingshan Chang, Yonatan Bisk

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出归纳泛化概念,通过轴基评估测试策略在分布外任务变体上的泛化能力,发现现有范式(如VLA模型)失败,揭示了与数据规模正交的学习挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20962 2026-06-23 cs.RO cs.MA 新提交

Heterogeneous Policy Networks for Composite Robot Team Communication and Coordination

异构策略网络用于复合机器人团队的通信与协调

Esmaeil Seraj, Rohan Paleja, Luis Pimentel, Kin Man Lee, Zheyuan Wang, Daniel Martin, Matthew Sklar, John Zhang, Zahi Kakish, Matthew Gombolay

机构 * Georgia Institute of Technology(佐治亚理工学院) Carnegie Mellon University(卡内基梅隆大学) Sandia National Laboratories(桑迪亚国家实验室)

AI总结 提出异构策略网络(HetNet),利用异构图注意力网络学习异构机器人团队的高效协作与通信策略,实现端到端训练的二值化消息传递,在多个领域性能提升5.84%至707.65%,通信带宽降低200倍。

Comments IEEE Transactions on Robotics (T-RO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20701 2026-06-23 cs.MA cs.DC cs.LG 新提交

BARD-MARL: Byzantine-Agent Detection for Learned Communication in Multi-Agent Reinforcement Learning

BARD-MARL:多智能体强化学习中学习通信的拜占庭智能体检测

Almond Kiruthu Murimi

机构 * Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University Department of Electrical(卡内基梅隆大学电气与计算机工程系)

AI总结 针对多智能体强化学习中的通信信任问题,提出BARD-MARL方法,结合策略图特征和贝叶斯信任统计,在自适应交通信号控制中有效检测拜占庭攻击。

Comments 8 pages, 4 figures; arXiv preprint; ancillary reproducibility/code bundle included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20676 2026-06-23 cs.CV cs.AI cs.CL 新提交

Jury Duty: Calibration and Orientation Failures in MLLM-as-a-Judge Under Cultural Ambiguity

陪审团职责:文化模糊性下MLLM作为评判者的校准与定向失败

Daniel Lee, Harsh Sharma, Eunkyu Park, Pranav Narayanan Venkit, Jeonghwan Kim, Kah Mun Chia, Andreas Vlachos, Shafiq Joty

机构 * Salesforce AI Research(Salesforce AI 研究院) University of Cambridge(剑桥大学) University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学) UIUC(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对MLLM作为评判者在跨文化场景中的偏差问题,提出VOIR DIRE基准,通过分析校准失败(压缩尺度)和定向失败(默认一种文化规范),揭示模型偏向于更宽容的文化解读。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20630 2026-06-23 cs.HC cs.AI cs.CY 新提交

Design Principles for Human-Agent Interaction

人-智能体交互的设计原则

Haiyi Zhu, Canwen Wang, Qing Xiao, Hong Shen

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出14条设计原则,涵盖初始、交互、长期和故障四个阶段,以指导设计可用、可信且有效的人-智能体交互系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20628 2026-06-23 cs.AI cs.CY cs.GT 新提交

Human Decision-Making with AI Assistance under Correlated Features

特征相关下的人类与AI辅助决策

Yanru Guan, Naveen Raman, Fei Fang

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究特征相关时AI如何推荐测试以平衡短期决策质量与长期人类学习,证明最优策略需先探索后承诺,并给出算法与近似方法。

详情

展开后加载摘要…

URL PDF HTML 收藏