arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-05-08 至 2026-05-08 共收录 14
2605.06656 2026-05-08 cs.LG cs.DM cs.ET math.OC

Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

为何全球大语言模型排行榜具有误导性:异质监督学习的小微投资组合

Jai Moondra, Ayela Chughtai, Bhargavi Lanka, Swati Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

AI总结 本文分析了全球大语言模型排行榜的误导性,指出语言异质性导致传统排名方法失效,并提出(λ,ν)投资组合框架以解决异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06640 2026-05-08 cs.LG cs.AI

Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

基于概念的归纳与对比解释用于视觉模型的行为

Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu, Ravi Mangal

机构 * Colorado State University(科罗拉多州立大学) KBR Inc.(KBR公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基于概念的归纳与对比解释方法,用于解释视觉模型的行为,通过概念擦除过程建立因果关系,实现对单张图像和图像集合的预测理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06530 2026-05-08 cs.AI

SpatialEpiBench: Benchmarking Spatial Information and Epidemic Priors in Forecasting

SpatialEpiBench:在真实公共卫生环境中评估空间信息和流行病先验的基准测试

Ruiqi Lyu, Alistair Turcan, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出SpatialEpiBench基准测试,评估空间信息和流行病先验在预测中的应用,发现多数模型在预测中表现不佳,识别出三大失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06283 2026-05-08 cs.CL

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

量化评分标准修改对人类与自动评分者一致性的统计效应

Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

AI总结 研究探讨评分标准修改对人类与自动评分者一致性的影响,发现提供代表性示例和减少位置偏见可提高一致性,而高复杂度和保守聚合方法则降低一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06014 2026-05-08 cs.LG cs.AI cs.DS cs.NI

Quantizing With Randomized Hadamard Transforms: Efficient Heuristic Now Proven

使用随机哈达玛变换进行量化:一种高效的启发式方法已被证明

Ran Ben-Basat, William Kuszmaul, Michael Mitzenmacher, Amit Portnoy, Shay Vargaftik

机构 * UCL and Broadcom(UCL和Broadcom) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Microsoft(微软) VMware Research by Broadcom(Broadcom的VMware研究)

AI总结 本文研究了随机哈达玛变换在量化中的应用,证明了使用两个变换可近似均匀随机旋转的效果,并展示了三个变换在向量量化中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24768 2026-05-08 cs.AI

Supervising Ralph Wiggum: Exploring a Metacognitive Co-Regulation Agentic AI Loop for Engineering Design

监督拉尔夫·维格姆:探索一种元认知共调节智能体循环用于工程设计

Zeda Xu, Nikolas Martelaro, Christopher McComb

机构 * Department of Mechanical Engineering(机械工程系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种自我调节循环和共调节设计智能体循环,通过元认知共调节缓解设计固定问题,提升工程设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05724 2026-05-08 cs.MA cs.AI

Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes

通过专家代理的自动化研究开发出有效的非琐碎的训练配方

Jingjie Ning, Xiaochuan Li, Ji Zeng, Hao Kang, Chenyan Xiong

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 本文研究了由外部测量驱动的自动化研究闭环,通过专家代理划分配方表面并共享测量 lineage,实现了自主的代码编写、实验提交和反馈吸收,提升了多个任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05609 2026-05-08 cs.LG econ.EM stat.ML

Optimal Contextual Pricing under Agnostic Non-Lipschitz Demand

在无偏非利普希茨需求下的最优上下文定价

Jianyu Xu, Yu-Xiang Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了具有线性估值和有界支持无偏噪声的上下文动态定价问题,提出了一种多项式时间算法,通过随机参数估计、保守残差网格探测和基于置信度的一步重定向,实现了最优的 regret,改进了之前的上界。

Comments 30 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05524 2026-05-08 cs.LG cs.AI

MOSAIC: Module Discovery via Sparse Additive Identifiable Causal Learning for Scientific Time Series

MOSAIC:通过稀疏加法可识别因果学习进行模块发现

Shicheng Fan, Nour Elhendawy, Jianle Sun, Ke Fang, Kun Zhang, Yihang Wang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Case Western Reserve University(凯斯西储大学) Carnegie Mellon University(卡内基梅隆大学) MBZUAI

AI总结 MOSAIC通过稀疏加法可识别因果学习,在科学时间序列中发现模块结构,通过稀疏解码器恢复观测变量支持,实现可解释的潜在机制发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05485 2026-05-08 cs.CL cs.AI

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效的程序合成

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 通过编译推理轨迹生成符号求解器,提升程序合成效率与准确性,同时减少对LLM的依赖,适用于多个基准测试任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03125 2026-05-08 cs.LG

Taming the Curses of Multiagency in Robust Markov Games with Large State Space through Linear Function Approximation

通过线性函数近似缓解大规模马尔可夫游戏中多智能体的诅咒

Jingchu Gai, Laixi Shi

机构 * CMU Machine Learning Department(卡内基梅隆大学机器学习系) Machine Learning Department, Carnegie Mellon University(机器学习系,卡内基梅隆大学) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

AI总结 本文提出通过线性函数近似解决大规模马尔可夫游戏中多智能体的样本复杂度诅咒,开发了在生成模型和新提出的在线交互设置中具有证明数据效率的算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15827 2026-05-08 cs.RO cs.AI cs.LG cs.SY eess.SY

Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching

感知型人形扑动:通过动作匹配链式动态人类技能

Zhen Wu, Xiaoyu Huang, Lujie Yang, Yuanhang Zhang, Xi Chen, Pieter Abbeel, Rocky Duan, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, C. Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 本文提出感知型人形扑动框架,通过动作匹配和强化学习实现人形机器人在复杂环境中自主执行长时程视觉扑动任务,展示高动态扑动技能和多障碍物穿越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏