arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2605.07986 2026-05-11 cs.HC cs.AI cs.CY

Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios

迈向公平的AI评估:从现实使用案例到评估场景

Yee-Yin Choong, Kristen Greene, Alice Qian, Meryem Marasli, Ziqi Yang, Sophia Chen, Laura Dabbish, Anand Rao, Hong Shen

机构 * National Institute of Standards and Technollogy(国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种可重复的流程,通过结构化AI使用案例工作表将高层使用案例转化为详细场景,结合LLM提示和人工审查,生成107个场景,确保评估场景的现实性和人类需求。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07979 2026-05-11 cs.AI

The Limits of AI-Driven Allocation: Optimal Screening under Aleatoric Uncertainty

AI驱动分配的局限:在aleatoric不确定性下的最优筛查

Santiago Cortes-Gomez, Mateo Dulce Rubio, Carlos Patino, Bryan Wilder

机构 * University of Amsterdam(阿姆斯特丹大学) CMU(卡内基梅隆大学)

AI总结 本文研究在aleatoric不确定性下,如何将筛查与算法性分配最优结合,通过两阶段分配框架,展示最优策略在算法分配边缘筛查单位,并直接针对高风险单位,同时分析筛查与算法性分配的互补与替代关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07605 2026-05-11 cs.RO

BrickCraft: Visuomotor Skill Composition with Situated Manual Guidance for Long-Horizon Interlocking Brick Assembly

BrickCraft: 基于情境手动指导的长视界互锁积木组装技能组合

Jichuan Yu, Bowei Li, Zhenran Tang, Guanxing Lu, Chuxiong Hu, Ruixuan Liu, Changliu Liu

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 BrickCraft通过情境手册将高层装配计划与物理执行连接,利用相对公式分解复杂任务为可重用的原始技能,实现长视界互锁积木组装。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22766 2026-05-11 cs.LG

Sparse Attention as Compact Kernel Regression

稀疏注意力作为紧凑核回归

Saul Santos, Nuno Gonçalves, Daniel C. McNamee, Marcos Treviso, André F. T Martins

机构 * Instituto Superior Técnico & Instituto de Telecomunicações, Universidade de Lisboa, Portugal(里斯本大学理工学院及电信研究所,葡萄牙) Champalimaud Research, Lisbon, Portugal(Champalimaud研究,葡萄牙里斯本) TransPerfect, Lisbon, Portugal(TransPerfect,葡萄牙里斯本) Carnegie Mellon University, Pittsburgh, USA(卡内基梅隆大学,美国匹兹堡)

AI总结 本文通过核理论将稀疏注意力与紧凑核回归联系起来,揭示了ReLU和sparsemax注意力与Epanechnikov核回归的关系,并展示了核方法在注意力设计中的应用。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18149 2026-05-11 cs.RO cs.SY eess.SY math.OC

Code Generation and Conic Constraints for Model-Predictive Control on Microcontrollers with Conic-TinyMPC

基于锥约束的模型预测控制与代码生成:适用于微控制器的Conic-TinyMPC

Ishaan Mahajan, Khai Nguyen, Sam Schoedel, Elakhya Nedumaran, Moises Mata, Brian Plancher, Zachary Manchester

机构 * School of Engineering and Applied Science, Columbia University(哥伦比亚大学工程与应用科学学院) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Barnard College, Columbia University and Dartmouth College(哥伦比亚大学巴纳德学院和达特茅斯学院)

AI总结 本文提出一种适用于微控制器的模型预测控制方法,通过支持二次锥约束和自动生成C++代码,显著提升了嵌入式系统的求解速度和问题规模。

Comments Accepted to ICRA 2026. 4 Figures. 2 Tables. First three authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.05551 2026-05-11 math.OC cs.LG cs.SY eess.SY math.DS

Near-Optimal Distributed Linear-Quadratic Regulator for Networked Systems

网络化系统近最优分布式线性二次调节器

Sungho Shin, Yiheng Lin, Guannan Qu, Adam Wierman, Mihai Anitescu

机构 * Mathematics and Computer Science Division, Argonne National Laboratory(阿贡国家实验室数学与计算机科学部) California Institute of Technology(加州理工学院) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系) Department of Statistics, University of Chicago(芝加哥大学统计系)

AI总结 本文研究了在线性二次控制设置中,去中心化程度与控制器性能之间的权衡。通过分析图上相互关联的智能体系统及一种称为κ-分布式控制的控制器,展示了在温和假设下,κ-分布式控制与集中最优控制的性能差异随κ指数级减小,表明适度去中心化可实现近最优性能。

Journal ref SIAM Journal on Control and Optimization, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07251 2026-05-11 cs.AI

Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning

智能体能否定价反应?评估大语言模型在化学成本推理上的能力

Yuyang Wu, Yue Huang, Shuaike Shen, Xujian Wang, Shuhao Zhang, Qiyao Xue, Weichen Liu, Runtian Gao, Jian Ma, Xiangliang Zhang, Olexandr Isayev

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(Notre Dame 大学) University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校) University of Pittsburgh(匹兹堡大学)

AI总结 本文提出ChemCost基准,评估大语言模型在化学成本推理任务中的能力,发现工具访问并非解决问题的充分条件,且在噪声环境下表现下降。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07040 2026-05-11 cs.CL cs.AI cs.CY

Cognitive Agent Compilation for Explicit Problem Solver Modeling

认知代理编译用于显式问题求解器建模

Hyeongdon Moon, Carolyn Rosé, John Stamper

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出Cognitive Agent Compilation框架,利用强教师LLM将问题解决知识编译为显式目标代理,旨在提高教育场景中问题解决的可检查性和可编辑性。

Comments Accepted to AIED 2026 Blue Sky

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06988 2026-05-11 cs.MA cs.IT cs.RO math.IT

The Cost of Consensus: Malignant Epistemic Herding and Adaptive Gating in Distributed Multi-Agent Search

共识的成本:恶意认知从众与自适应门控在分布式多智能体搜索中的问题

David Farr, Iain Cruickshank, Kate Starbird, Jevin West

机构 * Information School, University of Washington(华盛顿大学信息学院) Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学系) Human Centered Design Engineering, University of Washington(华盛顿大学人本设计工程系)

AI总结 研究探讨了在分布式多智能体搜索中,通信频率和内容如何共同影响集体信念状态,提出认知对齐的概念,分析了通信设计对集体推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06726 2026-05-11 cs.LG

Transformer-Based Wildlife Species Classification from Daily Movement Trajectories

基于Transformer的野生动物物种分类:从每日移动轨迹中推断物种身份

Obed Irakoze, Prasenjit Mitra

机构 * Department of Electrical \& Computer Engineering Carnegie Mellon University Africa Kigali, Rwanda

AI总结 本文通过训练序列模型对大规模GPS轨迹进行分类,发现Transformer在物种分类中表现优于LSTM、CNN等模型,尤其在数据有限时提升显著,且统一1小时分辨率能提升整体性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06656 2026-05-08 cs.LG cs.DM cs.ET math.OC

Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML

为何全球大语言模型排行榜具有误导性:异质监督学习的小微投资组合

Jai Moondra, Ayela Chughtai, Bhargavi Lanka, Swati Gupta

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT Sloan School of Management(麻省理工学院斯隆管理学院)

AI总结 本文分析了全球大语言模型排行榜的误导性,指出语言异质性导致传统排名方法失效,并提出(λ,ν)投资组合框架以解决异质性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06640 2026-05-08 cs.LG cs.AI

Concept-Based Abductive and Contrastive Explanations for Behaviors of Vision Models

基于概念的归纳与对比解释用于视觉模型的行为

Ronaldo Canizales, Divya Gopinath, Corina Păsăreanu, Ravi Mangal

机构 * Colorado State University(科罗拉多州立大学) KBR Inc.(KBR公司) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出基于概念的归纳与对比解释方法,用于解释视觉模型的行为,通过概念擦除过程建立因果关系,实现对单张图像和图像集合的预测理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06530 2026-05-08 cs.AI

SpatialEpiBench: Benchmarking Spatial Information and Epidemic Priors in Forecasting

SpatialEpiBench:在真实公共卫生环境中评估空间信息和流行病先验的基准测试

Ruiqi Lyu, Alistair Turcan, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出SpatialEpiBench基准测试,评估空间信息和流行病先验在预测中的应用,发现多数模型在预测中表现不佳,识别出三大失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06283 2026-05-08 cs.CL

Quantifying the Statistical Effect of Rubric Modifications on Human-Autorater Agreement

量化评分标准修改对人类与自动评分者一致性的统计效应

Jessica Huynh, Alfredo Gomez, Athiya Deviyani, Renee Shelby, Jeffrey P. Bigham, Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

AI总结 研究探讨评分标准修改对人类与自动评分者一致性的影响,发现提供代表性示例和减少位置偏见可提高一致性,而高复杂度和保守聚合方法则降低一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06014 2026-05-08 cs.LG cs.AI cs.DS cs.NI

Quantizing With Randomized Hadamard Transforms: Efficient Heuristic Now Proven

使用随机哈达玛变换进行量化:一种高效的启发式方法已被证明

Ran Ben-Basat, William Kuszmaul, Michael Mitzenmacher, Amit Portnoy, Shay Vargaftik

机构 * UCL and Broadcom(UCL和Broadcom) Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) Microsoft(微软) VMware Research by Broadcom(Broadcom的VMware研究)

AI总结 本文研究了随机哈达玛变换在量化中的应用,证明了使用两个变换可近似均匀随机旋转的效果,并展示了三个变换在向量量化中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24768 2026-05-08 cs.AI

Supervising Ralph Wiggum: Exploring a Metacognitive Co-Regulation Agentic AI Loop for Engineering Design

监督拉尔夫·维格姆:探索一种元认知共调节智能体循环用于工程设计

Zeda Xu, Nikolas Martelaro, Christopher McComb

机构 * Department of Mechanical Engineering(机械工程系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种自我调节循环和共调节设计智能体循环,通过元认知共调节缓解设计固定问题,提升工程设计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05724 2026-05-08 cs.MA cs.AI

Auto Research with Specialist Agents Develops Effective and Non-Trivial Training Recipes

通过专家代理的自动化研究开发出有效的非琐碎的训练配方

Jingjie Ning, Xiaochuan Li, Ji Zeng, Hao Kang, Chenyan Xiong

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)

AI总结 本文研究了由外部测量驱动的自动化研究闭环,通过专家代理划分配方表面并共享测量 lineage,实现了自主的代码编写、实验提交和反馈吸收,提升了多个任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05609 2026-05-08 cs.LG econ.EM stat.ML

Optimal Contextual Pricing under Agnostic Non-Lipschitz Demand

在无偏非利普希茨需求下的最优上下文定价

Jianyu Xu, Yu-Xiang Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文研究了具有线性估值和有界支持无偏噪声的上下文动态定价问题,提出了一种多项式时间算法,通过随机参数估计、保守残差网格探测和基于置信度的一步重定向,实现了最优的 regret,改进了之前的上界。

Comments 30 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05524 2026-05-08 cs.LG cs.AI

MOSAIC: Module Discovery via Sparse Additive Identifiable Causal Learning for Scientific Time Series

MOSAIC:通过稀疏加法可识别因果学习进行模块发现

Shicheng Fan, Nour Elhendawy, Jianle Sun, Ke Fang, Kun Zhang, Yihang Wang, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学香槟分校) Case Western Reserve University(凯斯西储大学) Carnegie Mellon University(卡内基梅隆大学) MBZUAI

AI总结 MOSAIC通过稀疏加法可识别因果学习,在科学时间序列中发现模块结构,通过稀疏解码器恢复观测变量支持,实现可解释的潜在机制发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05485 2026-05-08 cs.CL cs.AI

ReaComp: Compiling LLM Reasoning into Symbolic Solvers for Efficient Program Synthesis

ReaComp:将LLM推理编译为符号求解器以实现高效的程序合成

Atharva Naik, Yash Mathur, Prakam, Carolyn Rose, David Mortensen

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 通过编译推理轨迹生成符号求解器,提升程序合成效率与准确性,同时减少对LLM的依赖,适用于多个基准测试任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03125 2026-05-08 cs.LG

Taming the Curses of Multiagency in Robust Markov Games with Large State Space through Linear Function Approximation

通过线性函数近似缓解大规模马尔可夫游戏中多智能体的诅咒

Jingchu Gai, Laixi Shi

机构 * CMU Machine Learning Department(卡内基梅隆大学机器学习系) Machine Learning Department, Carnegie Mellon University(机器学习系,卡内基梅隆大学) Department of Electrical and Computer Engineering, Johns Hopkins University(约翰霍普金斯大学电气与计算机工程系)

AI总结 本文提出通过线性函数近似解决大规模马尔可夫游戏中多智能体的样本复杂度诅咒,开发了在生成模型和新提出的在线交互设置中具有证明数据效率的算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15827 2026-05-08 cs.RO cs.AI cs.LG cs.SY eess.SY

Perceptive Humanoid Parkour: Chaining Dynamic Human Skills via Motion Matching

感知型人形扑动:通过动作匹配链式动态人类技能

Zhen Wu, Xiaoyu Huang, Lujie Yang, Yuanhang Zhang, Xi Chen, Pieter Abbeel, Rocky Duan, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, C. Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 本文提出感知型人形扑动框架,通过动作匹配和强化学习实现人形机器人在复杂环境中自主执行长时程视觉扑动任务,展示高动态扑动技能和多障碍物穿越能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01662 2026-05-05 cs.CV

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01657 2026-05-05 cs.CV

Act2See: Emergent Active Visual Perception for Video Reasoning

Act2See:面向视频推理的涌现式主动视觉感知

Martin Q. Ma, Yuxiao Qu, Aditya Agrawal, Willis Guo, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

AI总结 本文提出Act2See框架,通过使VLMs在文本推理中主动交错视频帧,实现视频推理中的主动视觉感知,提升了推理质量并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01104 2026-05-05 cs.SE cs.CL cs.HC

RECAP: An End-to-End Platform for Capturing, Replaying, and Analyzing AI-Assisted Programming Interactions

RECAP:一个端到端的平台,用于捕捉、回放和分析AI辅助编程交互

Keyu He, Qianou Ma, Valerie Chen, Wayne Chi, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 RECAP通过记录和回放开发者与AI编程助手的交互,分析其行为模式和策略演变,为软件工程教育提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01069 2026-05-05 cs.RO

Online Safety Filter for Deformable Object Manipulation with Horizon Agnostic Neural Operators

面向可变形物体操作的在线安全过滤器:无时间 horizon 神经算子

Jiaxing Li, Hanjiang Hu, Zhuoyuan Wang, Yorie Nakahira, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种基于约束的在线安全过滤器,通过最小修改控制策略,实时强制任务级安全约束,结合无时间 horizon 神经算子和边界控制屏障函数,提升柔体操作的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00977 2026-05-05 cs.CV cs.AI cs.CL

Democratizing the medieval English legal tradition

让中世纪英国法律传统民主化

Michael Zhang, Elise Wang, Charlotte Whatley, Seth Strickland, Dylan Bannon

机构 * University of Chicago(芝加哥大学) California State University(加州州立大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Unaffiliated(无隶属机构)

AI总结 本文通过构建包含193个中世纪案件的文本数据集,训练端到端转录管道,利用神经网络和后处理技术提升手写文本识别准确率,最终展示TrOCR与CNN+LSTM的性能对比。

Comments Submitted to International Conference on Document Analysis and Recognition (ICDAR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏