arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-05-18 至 2026-05-18 共收录 15
2605.16054 2026-05-18 cs.LG cs.AI

Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making

Ada-Diffuser: 面向决策制定的潜在意识自适应扩散模型

Fan Feng, Selena Ge, Minghao Fu, Zijian Li, Yujia Zheng, Zeyu Tang, Yingyao Hu, Biwei Huang, Kun Zhang

机构 * University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出Ada-Diffuser,通过显式建模潜在动态过程,提升决策制定的精度与适应性,实验验证其在模拟控制与机器人基准中的有效性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23678 2026-05-18 cs.CV

Grounded Reinforcement Learning for Visual Reasoning

基于视觉的强化学习用于视觉推理

Gabriel Sarch, Snigdha Saha, Naitik Khandelwal, Ayush Jain, Michael J. Tarr, Aviral Kumar, Katerina Fragkiadaki

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ViGoRL,通过强化学习实现视觉推理,通过空间坐标锚定推理步骤,提升视觉定位和搜索性能,优于传统方法。

Comments Project website: https://visually-grounded-rl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09006 2026-05-18 cs.GT cs.LG

Learning in Structured Stackelberg Games

在结构化Stackelberg游戏中学习

Maria-Florina Balcan, Kiriaki Fragkia, Keegan Harris

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California(加州大学)

AI总结 本文研究了结构化Stackelberg游戏,提出Stackelberg-Littlestone维度以优化在线学习算法,并在分布设定中提供样本复杂度的上下界。

Comments Accepted as a spotlight paper to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15565 2026-05-18 cs.LG cs.AI

AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs

AstraFlow:面向代理大语言模型的数据流强化学习

Haizhong Zheng, Yizhuo Di, Jiahui Wang, Shuowei Jin, Xueshen Liu, Yongji Wu, Z. Morley Mao, Ion Stoica, Jiawei Zhao, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) UC Berkeley(加州大学伯克利分校) Meta

AI总结 AstraFlow通过数据流导向的强化学习系统,实现复杂多策略协作训练和高效利用异构计算资源,提升代理LLM的推理与工具使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15559 2026-05-18 cs.RO

NavRL++: A System-Level Framework for Improving Sim-to-Real Transfer in Reinforcement Learning-Based Robot Navigation

NavRL++: 一种提升基于强化学习的机器人导航仿真到现实迁移的系统级框架

Zhefan Xu, Hanyu Jin, Kenji Shimada

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

AI总结 本文提出NavRL++框架,通过系统性研究仿真到现实迁移的关键因素,引入感知鲁棒性增强策略和基于Transformer的时序推理策略,提升机器人导航性能。

Comments 18 pages, 18 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15543 2026-05-18 cs.GT cs.AI

Domain-Independent Game Abstraction using Word Embedding Techniques

基于词嵌入技术的领域无关游戏抽象

Juho Kim, Tuomas Sandholm

机构 * CMU Strategic Machine, Inc.(CMU战略机器公司) Strategy Robot, Inc.(策略机器人公司) Optimized Markets, Inc.(优化市场公司)

AI总结 本文提出一种基于自然语言处理的词嵌入技术进行游戏抽象的方法,通过将动作视为词,利用词向量表示和聚类实现领域无关的游戏抽象,实验表明该方法有效但不如专用算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15290 2026-05-18 cs.LG cs.AI

GQA-μP: The maximal parameterization update for grouped query attention

GQA-μP:组查询注意力的最大参数更新

Kyle R. Chickering, Huijuan Wang, Mengxi Wu, Alexander Moreno, Muhao Chen, Xuezhe Ma, Daria Soboleva, Joel Hestness, Zhengzhong Liu, Eric Xing

机构 * UC Davis(加州大学戴维斯分校) MBZUAI IFM(脑科学与人工智能研究院(MBZUAI IFM)) USC(南加州大学) Cerebras(Cerebras公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文基于谱特征学习观点,提出组查询注意力的最大参数更新方法,通过数学分析实现参数转移,解决了新模型架构下的参数更新难题。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15241 2026-05-18 eess.IV cs.CV cs.LG

From Full and Partial Intraoral Scans to Crown Proposal: A Classification-Guided Restoration Assistance Pipeline

从完整和部分口内扫描到牙冠提案:一种基于分类的修复辅助流程

Rabin Kunwar, Dikshya Parajuli, Rujal Acharya, Romik Gosai, Prince Panta, Kundan Siwakoti, Shuvangi Adhikari, Saugat Kafley, Louis Digiorgio, Amit Regmi, Akio Tanaka, Masahiko Inada, Yuriko Komagamine, Kennta Kashiwazaki, Manabu Kanazawa

机构 * Accelerated Komputing Pvt. Ltd.(加速计算私人有限公司) University of Pittsburgh(匹兹堡大学) Institute of Science Tokyo(东京科学研究所) Emium Co. Ltd.(Emium公司) GodelBlock Inc.(GodelBlock公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于分类的牙冠辅助流程,通过口内扫描和目标FDI牙齿编号输入,生成患者特异性的牙冠提案。流程包括数据准备、分割和牙冠生成三个阶段,采用分类-对齐策略提升部分扫描分割精度,最终生成高精度的牙冠模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15220 2026-05-18 cs.CL cs.AI cs.LG

Always Learning, Always Mixing: Efficient and Simple Data Mixing All The Time

始终学习,始终混合:始终高效且简单的数据混合

Michael Y. Hu, Apurva Gandhi, Kyunghyun Cho, Tal Linzen, Pratyusha Sharma

机构 * New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软公司)

AI总结 本文提出OP-Mix算法,通过低秩适配器插值实现数据混合,提升预训练和持续学习性能,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11485 2026-05-18 cs.RO

Coordinated Diffusion: Generating Multi-Agent Behavior Without Multi-Agent Demonstrations

协同扩散:无需多智能体演示生成多智能体行为

Lasse Peters, Laura Ferranti, Andrea Bajcsy, Javier Alonso-Mora

机构 * University of California, Berkeley(加州大学伯克利分校) Delft University of Technology(代尔夫特理工大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Coordinated Diffusion框架,通过用户定义的多智能体成本函数将独立训练的单智能体扩散策略耦合,无需多智能体演示数据,实现多智能体行为协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09869 2026-05-18 cs.RO cs.CV

ConsistNav: Closing the Action Consistency Gap in Zero-Shot Object Navigation with Semantic Executive Control

ConsistNav:通过语义执行控制关闭零样本物体导航中的动作一致性差距

Haosen Wang, Zhenyang Li, Yinqiang Zhang, Zongqi He, Lutao Jiang, Kai Li, Yizhou Zhao, Liaoyuan Fan, Wenjian Hou, Tingbang Liang, Yibin Wen, Defeng Gu

机构 * Sun Yat-sen University(中山大学) The University of Hong Kong(香港大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) City University of Hong Kong(香港城市大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ConsistNav框架,通过语义执行控制模块解决零样本物体导航中动作一致性问题,提升导航精度与鲁棒性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03812 2026-05-18 cs.LG cs.AI cs.CL

Antidistillation Fingerprinting

对抗蒸馏指纹

Yixuan Even Xu, John Kirchenbauer, Yash Savani, Asher Trockman, Alexander Robey, Tom Goldstein, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学) University of Maryland, College Park, MD, USA(马里兰大学学院市分校)

AI总结 本文提出对抗蒸馏指纹方法,通过代理模型识别并采样最大化指纹检测性的token,提升检测效果同时减少对模型性能的影响。

Comments 28 pages, 13 figures, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19399 2026-05-18 cs.CL cs.AI cs.LG

DR Tulu: Reinforcement Learning with Evolving Rubrics for Deep Research

DR Tulu:基于演进标准的深度研究强化学习

Rulin Shao, Akari Asai, Shannon Zejiang Shen, Hamish Ivison, Varsha Kishore, Jingming Zhuo, Xinran Zhao, Molly Park, Samuel G. Finlayson, David Sontag, Tyler Murray, Sewon Min, Pradeep Dasigi, Luca Soldaini, Faeze Brahman, Wen-tau Yih, Tongshuang Wu, Luke Zettlemoyer, Yoon Kim, Hannaneh Hajishirzi, Pang Wei Koh

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Seattle Children's Hospital(西雅图儿童医院) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文提出RLER方法,通过演进标准与策略模型共进化,开发出首个开源深度研究模型DR Tulu,其在多个长文深度研究基准上表现优异,且成本显著低于现有模型。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03606 2026-05-18 stat.ML cs.LG math.ST stat.TH

Vector-valued self-normalized concentration inequalities beyond sub-Gaussianity

向量值自归一化集中不等式超越子高斯性

Diego Martinez-Taboada, Tomas Gonzalez, Aaditya Ramdas

机构 * Department of Statistics & Data Science(统计与数据科学系) Machine Learning Department(机器学习系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文研究了超越子高斯性的向量值自归一化过程的集中不等式,提出适用于轻尾分布(如Bennett或Bernstein界)的界,并在在线线性回归中应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02271 2026-05-18 cs.CL

The MediaSpin Dataset: Post-Publication News Headline Edits Annotated for Media Bias

媒体旋风数据集:标注媒体偏见的发布后新闻标题修改

Preetika Verma, Kokil Jaidka

机构 * Carnegie Mellon University(卡内基梅隆大学) National University of Singapore(新加坡国立大学) NUS Centre for Trusted Internet and Community(新加坡国立大学可信互联网与社区中心)

AI总结 MediaSpin数据集通过标注13种媒体偏见类型,研究新闻标题修改对语言框架和偏见的影响,展示跨国家的标题修改分析、变压器偏见分类及社交媒体行为分析。

Comments 8 pages, 3 figures, 8 tables Accepted at AAAI ICWSM 2026 We updated the paper title from "MediaSpin: Exploring Media Bias Through Fine-Grained Analysis of News Headlines " to "The MediaSpin Dataset: Post-Publication News Headline Edits Annotated for Media Bias"

详情

展开后加载摘要…

URL PDF HTML 收藏