arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2342
2601.15286 2026-01-22 cs.CV cs.AI cs.LG cs.RO

Iterative Refinement Improves Compositional Image Generation

迭代细化改进组合图像生成

Shantanu Jaiswal, Mihir Prabhudesai, Nikash Bhardwaj, Zheyang Qin, Amir Zadeh, Chuan Li, Katerina Fragkiadaki, Deepak Pathak

机构 * Carnegie Mellon University(卡内基梅隆大学) Lambda AI

AI总结 本文提出了一种迭代细化策略,通过视觉-语言模型反馈提升组合图像生成质量,实验显示在多个基准上均优于并行采样方法。

Comments Project webpage: https://iterative-img-gen.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15250 2026-01-22 cs.CV cs.RO

FlowSSC: Universal Generative Monocular Semantic Scene Completion via One-Step Latent Diffusion

FlowSSC: 通过一步潜在扩散实现通用生成单目语义场景补全

Zichen Xi, Hao-Xiang Chen, Nan Xue, Hongyu Yan, Qi-Yuan Feng, Levent Burak Kara, Joaquim Jorge, Qun-Ce Xu

机构 * Ant Group(蚂蚁集团) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico(里斯本大学理工学院)

AI总结 FlowSSC通过一步潜在扩散模型实现高效单目语义场景补全,显著提升性能并适用于自动驾驶系统。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15056 2026-01-22 cs.RO

Systematic Evaluation of Hip Exoskeleton Assistance Parameters for Enhancing Gait Stability During Ground Slip Perturbations

系统评估髋外骨骼辅助参数以增强地面滑动扰动期间的步态稳定性

Maria T. Tagliaferri, Inseung Kang

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

AI总结 本研究系统评估了髋外骨骼辅助参数,发现优化稳定性需考虑时间参数和用户个性化,减少跌倒风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.08189 2026-01-22 cs.LG cs.CY physics.soc-ph

Learning from Discriminatory Training Data

从歧视性训练数据中学习

Przemyslaw A. Grabowicz, Nicholas Perello, Kenta Takatsu

机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种方法,通过在受歧视污染的数据集上训练,确保在公平测试数据集上表现良好,以解决公平学习中的歧视问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14209 2026-01-21 cs.LG cs.AI cs.CL

InT: Self-Proposed Interventions Enable Credit Assignment in LLM Reasoning

InT:自我提出干预使LLM推理中的信用分配成为可能

Matthew Y. R. Yang, Hao Bai, Ian Wu, Gene Yang, Amrith Setlur, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 InT通过自我提出干预实现LLM推理中的细粒度信用分配,提升模型在数学推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14101 2026-01-21 cs.CV

Curriculum-Based Strategies for Efficient Cross-Domain Action Recognition

基于课程学习的跨领域动作识别高效策略

Emily Kim, Allen Wu, Jessica Hodgins

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基于课程学习的跨领域动作识别方法,通过合成和真实数据结合提升模型泛化能力,显著减少训练迭代次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13642 2026-01-21 stat.ML cs.LG

Sample Complexity of Average-Reward Q-Learning: From Single-agent to Federated Reinforcement Learning

平均奖励Q学习的样本复杂度:从单智能体到联邦强化学习

Yuchen Jiao, Jiin Woo, Gen Li, Gauri Joshi, Yuejie Chi

机构 * CUHK Department of Statistics and Data Science, Chinese University of Hong Kong(中国香港中文大学统计与数据科学系) CMU Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) CUHK(中国香港中文大学) CMU(卡内基梅隆大学) Yale Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系)

AI总结 本文提出了一种针对平均奖励MDPs的Q学习算法,通过单智能体和联邦场景的样本复杂度分析,证明了在弱通信假设下,联邦设置能有效降低样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13531 2026-01-21 eess.AS cs.SD

ICASSP 2026 URGENT Speech Enhancement Challenge

ICASSP 2026 URGENT语音增强挑战

Chenda Li, Wei Wang, Marvin Sach, Wangyou Zhang, Kohei Saijo, Samuele Cornell, Yihui Fu, Zhaoheng Ni, Tim Fingscheidt, Shinji Watanabe, Yanmin Qian

机构 * Shanghai Jiao Tong University(上海交通大学) Technische Universität Braunschweig(Braunschweig技术大学) Waseda University(早稻田大学) Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 ICASSP 2026 URGENT挑战通过两个赛道推动通用语音增强系统的发展,吸引80多支队伍参与,展示对鲁棒语音增强技术的广泛兴趣。

Comments The overview paper of the ICASSP 2026 URGENT Speech Enhancement Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14675 2026-01-21 cs.SD eess.AS eess.SP

How Does Instrumental Music Help SingFake Detection?

乐器音乐如何帮助检测 SingFake?

Xuanjun Chen, Chia-Yu Hu, I-Ming Lin, Yi-Cheng Lin, I-Hsiang Chiu, You Zhang, Sung-Feng Huang, Yi-Hsuan Yang, Haibin Wu, Hung-yi Lee, Jyh-Shing Roger Jang

机构 * National Taiwan University(国立台湾大学) Carnegie Mellon University(卡内基梅隆大学) University of Rochester(罗切斯特大学) NVIDIA(NVIDIA公司) Independent Researcher(独立研究者)

AI总结 本研究探讨了乐器音乐对SingFake检测的影响,发现伴奏主要作为数据增强,微调会增强对说话人特征的依赖并降低对内容信息的敏感性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12636 2026-01-21 cs.RO

A0: An Affordance-Aware Hierarchical Model for General Robotic Manipulation

A0:一种面向通用机器人操作的感知意识分层模型

Rongtao Xu, Jian Zhang, Minghao Guo, Youpeng Wen, Haoting Yang, Min Lin, Jianzheng Huang, Zhe Li, Kaidong Zhang, Liqiong Wang, Yuxuan Kuang, Meng Cao, Feng Zheng, Xiaodan Liang

机构 * MBZUAI SYSU(南方科技大学) SUSTech(华南理工大学) Spatialtemporal AI(时空人工智能) CMU(卡内基梅隆大学)

AI总结 A0提出了一种分层的可及性感知扩散模型,通过分解操作任务为高层空间可及性理解和低层动作执行,提升机器人操作的效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12966 2026-01-21 cs.SD cs.CL

Lombard Speech Synthesis for Any Voice with Controllable Style Embeddings

为任何声音生成可控制风格嵌入的 Lombard 语音合成

Seymanur Akti, Alexander Waibel

机构 * KIT Campus Transfer GmbH (KCT)(KIT校园转移公司) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) Carnegie Mellon University (CMU)(卡内基梅隆大学)

AI总结 本文提出了一种可控的 Lombard 语音合成系统,通过风格嵌入和 PCA 调整实现对任何说话者语音的可控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12701 2026-01-21 cs.RO cs.CG

RPT*: Global Planning with Probabilistic Terminals for Target Search in Complex Environments

RPT*: 带概率终端的全局规划用于复杂环境中的目标搜索

Yunpeng Lyu, Chao Cao, Ji Zhang, Howie Choset, Zhongqiang Ren

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 RPT*通过动态规划和新启发式方法解决复杂环境中的目标搜索问题,实现最优路径规划与高效探索的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12618 2026-01-21 cs.CL

Disagreement as Data: Reasoning Trace Analytics in Multi-Agent Systems

分歧作为数据:多智能体系统中的推理轨迹分析

Elham Tajik, Conrad Borchers, Bahar Shahrokhian, Sebastian Simon, Ali Keramati, Sonika Pal, Sreecharan Sankaranarayanan

机构 * University at Albany(纽约州立大学阿尔巴尼分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学) Le Mans University(勒曼大学) University of California, Irvine(加州大学尔湾分校) Indian Institute of Technology Bombay(印度班加罗尔理工学院) Extuitive Inc. (Flagship Pioneering)(Extuitive公司(Flagship Pioneering))

AI总结 本研究提出利用LLM代理生成的推理轨迹分析分歧,通过余弦相似度检测和量化代理间的分歧,提升定性编码的解释实践和方法论严谨性。

Comments LAK 2026 conference paper, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12600 2026-01-21 cs.SD cs.CL cs.LG eess.AS

SSVD-O: Parameter-Efficient Fine-Tuning with Structured SVD for Speech Recognition

SSVD-O:基于结构SVD的参数高效微调用于语音识别

Pu Wang, Shinji Watanabe, Hugo Van hamme

机构 * KU Leuven(卢森堡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 SSVD-O通过结合输入和输出特征空间的结构SVD引导微调,实现高效语音识别模型的参数高效微调,提升泛化能力和减少灾难性遗忘。

Comments Accepted by IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12518 2026-01-21 cs.LG cs.AI stat.ML

Cooperative Multi-agent RL with Communication Constraints

具有通信约束的协作多智能体强化学习

Nuoya Xiong, Aarti Singh

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基策略预测技术,通过预测基础策略更新减少通信轮次,提升多智能体协作学习效率。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20941 2026-01-21 cs.CL cs.AI

Do LLMs Truly Understand When a Precedent Is Overruled?

大型语言模型真的能理解当先例被推翻时的情况吗?

Li Zhang, Jaromir Savelka, Kevin Ashley

机构 * University of Pittsburgh(匹兹堡大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过评估LLMs在识别美国最高法院案件中推翻关系的能力,揭示了模型在时间敏感性、推理深度和上下文依赖性方面的局限性,并提出了一种更贴近真实法律推理任务的长上下文基准。

Comments 12 pages, 2 figures, JURIX 2025

Journal ref Proceedings of the 2025 Conference on Legal Knowledge and Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09895 2026-01-21 cs.LG cs.AI stat.ML

Chain-of-Influence: Tracing Interdependencies Across Time and Features in Clinical Predictive Modelings

链式影响:在时间和特征间追溯临床预测模型中的相互依赖关系

Yubo Li, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 Chain-of-Influence提出了一种可解释的深度学习框架,通过构建特征相互作用的显式时间展开图,实现了对临床预测模型中时间与特征间相互依赖关系的追溯,提升了模型的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08930 2026-01-21 eess.SP cs.CV cs.RO

Acoustic Neural 3D Reconstruction Under Pose Drift

基于姿态漂移的声学神经3D重建

Tianxiang Lin, Mohamad Qadri, Kevin Zhang, Adithya Pediredla, Christopher A. Metzler, Michael Kaess

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出了一种联合优化神经场景表示和声纳姿态的算法,以提升在姿态漂移下的声学3D重建精度。

Comments 8 pages, 8 figures. This paper is accepted by 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15325 2026-01-21 cs.LG stat.ML

On the Identification of Temporally Causal Representation with Instantaneous Dependence

关于具有瞬时依赖性的时序因果表示识别

Zijian Li, Yifan Shen, Kaitao Zheng, Ruichu Cai, Xiangchen Song, Mingming Gong, Guangyi Chen, Kun Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Guangdong University of Technology(广东技术大学) The University of Melbourne(墨尔本大学)

AI总结 本文提出IDOL框架,通过稀疏影响约束识别具有瞬时依赖性的时序因果过程,实验验证其在模拟数据和现实场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12205 2026-01-21 cs.SD cs.AI eess.AS

Do Neural Codecs Generalize? A Controlled Study Across Unseen Languages and Non-Speech Tasks

神经编码器能否泛化?跨未见语言和非语音任务的受控研究

Shih-Heng Wang, Jiatong Shi, Jinchuan Tian, Haibin Wu, Shinji Watanabe

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Meta

AI总结 本文研究了神经音频编码器在未见语言和非语音任务上的泛化能力,发现预训练中引入非语音数据能提升非语音任务性能,但语音预训练的NACs在非语音任务上表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11664 2026-01-21 cs.CR cs.AI

Serverless AI Security: Attack Surface Analysis and Runtime Protection Mechanisms for FaaS-Based Machine Learning

无服务器AI安全:基于FaaS的机器学习的攻击面分析与运行时保护机制

Chetan Pathade, Vinod Dhimam, Sheheryar Ahmad, Ilsa Lareb

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Serverless AI Shield框架,通过多层防护机制提升无服务器环境中机器学习的安全性,实现高检测率与低性能开销。

Comments 17 Pages, 2 Figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11586 2026-01-21 cs.CY cs.AI cs.LG

Let Me Try Again: Examining Replay Behavior by Tracing Students' Latent Problem-Solving Pathways

让我再试一次:通过追踪学生的潜在问题解决路径来研究重播行为

Shan Zhang, Siddhartha Pradhan, Ji-Eun Lee, Ashish Gurung, Anthony F. Botelho

机构 * University of Florida(佛罗里达大学) Worcester Polytechnic Institute(沃思黑普理工学院) Singapore University of Technology and Design(新加坡科技与设计大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究利用HMMs分析学生在游戏化学习平台中的问题解决路径,发现即时重播有助于提升学习效果,而延迟重播则与学习结果呈负相关。

Comments 16 pages, 7 figures, LAK2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21046 2026-01-21 cs.AI

A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence

自我进化代理的综述:何时、何地、如何进化以实现人工超级智能

Huan-ang Gao, Jiayi Geng, Wenyue Hua, Mengkang Hu, Xinzhe Juan, Hongzhang Liu, Shilong Liu, Jiahao Qiu, Xuan Qi, Yiran Wu, Hongru Wang, Han Xiao, Yuhang Zhou, Shaokun Zhang, Jiayi Zhang, Jinyu Xiang, Yixiong Fang, Qiwen Zhao, Dongrui Liu, Qihan Ren, Cheng Qian, Zhenhailong Wang, Minda Hu, Huazheng Wang, Qingyun Wu, Heng Ji, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室) Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) University of Sydney(悉尼大学) Shanghai Jiao Tong University(上海交通大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Michigan(密歇根大学) Oregon State University(俄勒冈州立大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The University of Hong Kong(香港大学) University of California, Santa Barbara(加州大学圣芭芭拉分校) University of California San Diego(加州大学圣地亚哥分校) University of Edinburgh(爱丁堡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文综述了自我进化代理的现状,探讨了进化机制、适应方法及挑战,为实现人工超级智能提供路线图。

Comments 77 pages, 9 figures, Transactions on Machine Learning Research (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10110 2026-01-19 cs.CL cs.HC

Generate-Then-Validate: A Novel Question Generation Approach Using Small Language Models

生成后再验证:一种利用小语言模型的新型问题生成方法

Yumou Wei, John Stamper, Paulo F. Carvalho

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出了一种利用小语言模型的新型问题生成方法,通过生成后再验证策略生成高质量问题,验证了其在学习分析中的有效性。

Comments Accepted as a full research paper for the 16th International Conference on Learning Analytics and Knowledge (LAK'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24992 2026-01-19 cs.CL eess.AS

POWSM: A Phonetic Open Whisper-Style Speech Foundation Model

POWSM:一种基于语音的开放式耳语风格语音基础模型

Chin-Jou Li, Kalvin Chang, Shikhar Bharadwaj, Eunjung Yeo, Kwanghee Choi, Jian Zhu, David Mortensen, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Texas, Austin(德克萨斯大学奥斯汀分校) University of British Columbia(不列颠哥伦比亚大学)

AI总结 POWSM是一种能够联合执行多种语音任务的统一框架,实现了音频、文本和音素之间的无缝转换,并在低资源条件下提升了语音处理性能。

Comments 18 pages, under review. Model available at https://huggingface.co/espnet/powsm

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15512 2026-01-19 cs.HC cs.AI cs.LG

Policy alone is probably not the solution: A large-scale experiment on how developers struggle to design meaningful end-user explanations

仅靠政策可能不是解决办法:一项大规模实验,探讨开发者在设计有意义的终端用户解释时的困难

Nadia Nahar, Zahra Abba Omar, Jacob Tjaden, Inès M. Gilles, Fikir Mekonnen, Erica Okeh, Jane Hsieh, Christian Kästner, Alka Menon

机构 * Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) Colby College(科尔比学院) Howard University(霍华德大学) Department of Sociology, Yale University(社会学系,耶鲁大学)

AI总结 研究发现,仅靠政策无法有效提升开发者设计面向终端用户的解释能力,需结合培训、工具和支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11255 2026-01-19 cs.CL cs.LG

Reasoning in Trees: Improving Retrieval-Augmented Generation for Multi-Hop Question Answering

树状推理:改进多跳问题回答的检索增强生成

Yuling Shi, Maolin Sun, Zijun Liu, Mo Yang, Yixiong Fang, Tianran Sun, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Shandong University(山东大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 RT-RAG通过构建推理树来提升多跳问题回答的准确性和一致性,实验结果显示其在F1和EM指标上均优于现有方法。

Comments Accepted to GLOW@WWW2026. Code available at https://github.com/sakura20221/RT-RAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10827 2026-01-19 cs.RO cs.AI cs.SY eess.SY

Approximately Optimal Global Planning for Contact-Rich SE(2) Manipulation on a Graph of Reachable Sets

近似最优的接触丰富SE(2)操作在可达集图上的全局规划

Simin Liu, Tong Zhao, Bernhard Paus Graesdal, Peter Werner, Jiuguang Wang, John Dolan, Changliu Liu, Tao Pang

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人学院) Robotics and AI Institute(机器人与人工智能研究所) CSAIL, Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)

AI总结 本文提出了一种近似最优的接触丰富SE(2)操作全局规划方法,通过构建可达集图实现高效运动规划,显著提升了任务效率和成功率。

Comments 17 pages, 14 figures; under submission to IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10796 2026-01-19 cs.RO

Bidirectional Human-Robot Communication for Physical Human-Robot Interaction

双向人机通信用于物理人机交互

Junxiang Wang, Cindy Wang, Rana Soltani Zarrin, Zackory Erickson

机构 * Carnegie Mellon University(卡内基梅隆大学) Honda Research Institute USA(本田研究院美国)

AI总结 本文提出BRIDGE系统,通过自然语言实现双向人机通信,提升物理交互中的互动性和透明性。

Comments 12 pages, 8 figures. To be published in 2026 ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10639 2026-01-16 cs.LG

STEM: Scaling Transformers with Embedding Modules

STEM:通过嵌入模块扩展变换器

Ranajoy Sadhukhan, Sheng Cao, Harry Dong, Changsheng Zhao, Attiano Purpura-Pontoniere, Yuandong Tian, Zechun Liu, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta AI

AI总结 STEM通过嵌入模块实现变换器扩展,提升性能与可解释性

详情

展开后加载摘要…

URL PDF HTML 收藏