arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

共收录 2338
2606.31018 2026-07-01 cs.CV 新提交

WarpI2I: Image Warping for Image-to-Image Translation

WarpI2I:用于图像到图像翻译的图像扭曲

Shen Zheng, Anurag Ghosh, Gaurav Parmar, Srinivasa Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30949 2026-07-01 cs.AI cs.AR 新提交

AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

AgRefactor:面向HLS兼容性与性能的自进化智能体工作流

Yang Zou, Zijian Ding, Yizhou Sun, Jason Cong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30801 2026-07-01 cs.CL cs.CY cs.LG cs.SI 新提交

Using AI Agents to Automate Black-Box Audits of Personalization Algorithms at Scale

使用AI代理自动化大规模黑盒审计个性化算法

Alessandro Morosini, Sarah H. Cen, Andrew Ilyas, Hedi Driss, Aleksander Mądry, Chara Podimata

机构 * Massachusetts Institute of Technology(麻省理工学院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。

Comments 43 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30749 2026-07-01 cs.RO 新提交

From Grasps to Dexterity: Large-Scale Grasp Pretraining for Dexterous Manipulation

从抓取到灵巧:大规模抓取预训练用于灵巧操作

Ying Yuan, Xinyu Liu, Sriram Krishna, David Held

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。

Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25354 2026-07-01 cs.CL 新提交

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

通过局部分支路由实现高效且可训练的语言模型测试时扩展

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

机构 * Northwestern University(西北大学) Rutgers University(罗格斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织) Tilde Research(Tilde研究) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) University of California, San Diego(加州大学圣迭戈分校)

AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23455 2026-07-01 cs.CV 版本更新

DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection

DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测

Gautam Rajendrakumar Gare, Neehar Peri, Matvei Popov, Shruti Jain, John Galeotti, Deva Ramanan

机构 * Carnegie Mellon University(卡内基梅隆大学) Roboflow

AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。

Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16807 2026-07-01 cs.AI cs.DM math.CO 版本更新

Improved Upper Bounds for Slicing the Hypercube

切割超立方体的改进上界

Duncan Soiffer, Nathaniel Itty, Christopher D. Rosin, Blake Bruell, Mason DiCicco, Gábor N. Sárközy, Ryan Offstein, Daniel Reichman

机构 * Carnegie Mellon University(卡内基梅隆大学) Worcester Polytechnic Institute(伍斯特理工学院) Constructive Codes

AI总结 研究用最少超平面切割n维超立方体所有边的问题,通过构造8个超平面切割Q_{10},将上界从⌈5n/6⌉改进为⌈4n/5⌉(n为5的奇数倍时加1)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30645 2026-06-30 cs.RO cs.AI cs.GR cs.SY eess.SY

VLK: Learning Humanoid Loco-Manipulation from Synthetic Interactions in Reconstructed Scenes

VLK:从重建场景中的合成交互学习人形机器人全身操控

Yen-Jen Wang, Jiaman Li, Sirui Chen, Takara E. Truong, Pei Xu, Pieter Abbeel, Rocky Duan, Koushil Sreenath, Angjoo Kanazawa, Carmelo Sferrazza, Guanya Shi, Karen Liu

机构 * Amazon FAR(亚马逊FAR) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出VLK方法,通过3D高斯泼溅重建室内场景并合成视觉-语言-运动学数据,训练人形机器人全身操控策略,实现从仿真到真实的迁移。

Comments 19 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30574 2026-06-30 cs.LG math.ST stat.ML stat.TH

The Fundamental Limits of Valid Transport Map Estimation

有效传输映射估计的基本极限

Sivaraman Balakrishnan

机构 * Department of Statistics and Data Science(统计与数据科学系) Machine Learning Department(机器学习系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文在极小极大框架下形式化估计任意有效传输映射的任务,证明在标准稳定性假设下估计任意有效传输映射与估计最优传输映射统计难度相同,并给出当假设不成立时替代映射可更准确学习的例子。

Comments 25 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30445 2026-06-30 cs.LG

When Does Online Imitation Learning Help in LLM Post-Training? The Role of (Non-)Realizability Beyond Horizon

在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用

Huaqing Zhang, Jingchu Gai, Juno Kim, Bingbin Liu, Andrej Risteski

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) UC Berkeley(加州大学伯克利分校) Harvard University(哈佛大学)

AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29600 2026-06-30 cs.CV cs.AI

One Scene, Two Depths: Probing Geometric Ambiguity in Monocular Foundation Models

一场景,两深度:探究单目基础模型中的几何歧义性

Xiaohao Xu, Feng Xue, Xiang Li, Haowei Li, Shusheng Yang, Tianyi Zhang, Matthew Johnson-Roberson, Xiaonan Huang

机构 * University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Vanderbilt University(范德比大学)

AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。

Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29082 2026-06-30 cs.CL cs.LG

Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks

进化微调:在371个优化任务中学习发现

Young-Jun Lee, Seungone Kim, Minki Kang, Alistair Cheong Liang Chuen, Zerui Chen, Seungho Han, Taehee Jung, Dongyeop Kang

机构 * University of Minnesota(明尼苏达大学) Carnegie Mellon University(卡内基梅隆大学) KAIST(韩国科学技术院) University of Cambridge(剑桥大学) Hanyang University(翰阳大学) Amazon(亚马逊)

AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。

Comments Project page: https://open-galapagos.github.io/evolution_finetuning/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28725 2026-06-30 cs.CL

DriftGuard: Safety-Aware Multi-Monitor Detection and Selective Adaptation for Evolving Toxicity Moderation

DriftGuard:面向演化毒性审核的安全感知多监测器检测与选择性适应

Yuting Xin, Hanyu Cai, Binqi Shen, Lier Jin, Lan Hu

机构 * Department of Information and Decision Sciences(信息与决策科学系) University of Minnesota(明尼苏达大学) Department of Industrial Engineering and Management Sciences(工业工程与管理科学系) Northwestern University(西北大学) Fuqua School of Business(福卡商学院) Duke University(杜克大学) Department of Engineering(工程系) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出DriftGuard框架,结合多监测器漂移检测与选择性模型更新,针对毒性演化中的安全相关漂移,通过硬混合适应集提升毒性召回率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23071 2026-06-30 cs.CL

The Efficiency Frontier: A Unified Framework for Cost-Performance Optimization in LLM Context Management

效率前沿:LLM上下文管理中成本-性能优化的统一框架

Binqi Shen, Lier Jin, Hanyu Cai, Lan Hu, Yuting Xin

机构 * Northwestern University(西北大学) Duke University(杜克大学) Carnegie Mellon University(卡内基梅隆大学) University of Minnesota(明尼苏达大学)

AI总结 提出效率前沿框架,通过部署感知优化联合考虑任务性能、token成本和预处理重用,实现LLM上下文管理中的成本-性能权衡。

Comments Accepted to LMIAT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02327 2026-06-30 cs.CV cs.AI

Steerable Visual Representations

可操控的视觉表示

Jona Ruthardt, Manu Gaur, Deva Ramanan, Makarand Tapaswi, Yuki M. Asano

机构 * University of Technology Nuremberg(纽伦堡工业大学) Carnegie Mellon University(卡内基梅隆大学) International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)

AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02491 2026-06-30 cs.LG cs.AI cs.RO q-bio.NC stat.ML

What Capable Agents Must Know: Selection Theorems for Robust Decision-Making under Uncertainty

什么是有能力的智能体必须知道:在不确定性下鲁棒决策制定的选取定理

Aran Nayebi

机构 * Machine Learning Department and Neuroscience & Robotics Institutes, Carnegie Mellon University(机器学习系和神经科学与机器人研究院,卡内基梅隆大学)

AI总结 本文探讨了在不确定性下智能体必需的内部结构,证明了强任务表现迫使世界模型、信念记忆及持久变量的必要性,提出了选取定理以解决部分可观测性和任务分布下的决策问题。

Comments 23 pages, 1 figure. To appear in Uncertainty in Artificial Intelligence (UAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08775 2026-06-30 cs.HC cs.AI

What Should We Engineer in Prompts? Training Humans in Requirement-Driven LLM Use

提示中应工程什么?基于需求驱动的LLM使用训练

Qianou Ma, Weirui Peng, Chenyang Yang, Hua Shen, Kenneth Koedinger, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

AI总结 本文提出ROPE框架,通过评估和训练套件帮助用户生成清晰需求,提升LLM应用构建效果。

Comments 15 pages; TOCHI 2025

Journal ref TOCHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07971 2026-06-30 cs.HC cs.AI

SPHERE: An Evaluation Card for Human-AI Systems

SPHERE:人类-人工智能系统评估卡

Qianou Ma, Dora Zhao, Xinran Zhao, Chenglei Si, Chenyang Yang, Ryan Louie, Ehud Reiter, Diyi Yang, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Aberdeen(阿伯丁大学)

AI总结 本文提出SPHERE评估卡,从五个维度评估人类-人工智能系统,通过审查39个系统揭示当前评估实践及改进方向,并提出三项提升评估有效性和严谨性的建议。

Journal ref ACL Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28228 2026-06-29 cs.LG stat.ML 新提交

Disentangling Continuous-Time Latent Dynamics: Identifiability of Latent SDEs via Diffusion Shifts

解缠连续时间潜在动力学:通过扩散偏移实现潜在SDE的可辨识性

Yuanyuan Wang, Wenjie Wang, Haoxuan Li, Mingming Gong, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The University of Melbourne(墨尔本大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对连续时间潜在随机微分方程模型的可辨识性问题,利用环境引起的扩散协方差偏移,证明在漂移无稀疏性假设下,对角扩散机制可识别潜在坐标至置换和缩放,并估计潜在解缠与因果图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27687 2026-06-29 cs.CL cs.AI cs.DL 新提交

Mitigating LLM-based p-Hacking by Preregistering for the Next LLM

通过预注册下一个LLM来缓解基于LLM的p-hacking

Maria Thomas, Kristina Gligoric, Nihar B. Shah

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出一种协议,通过预注册实验和合格模型,并在预注册后发布的第一个合格LLM上运行,以缓解LLM研究中的p-hacking问题。实验表明该协议能有效阻止73.9%和72.7%的p-hack转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27581 2026-06-29 cs.RO cs.AI 新提交

SceneBot: Contact-Prompted General Humanoid Whole Body Tracking with Scene-Interaction

SceneBot: 接触提示的通用人形全身跟踪与环境交互

Sirui Chen, Shibo Zhao, Zhen Wu, Jiaman Li, Guanya Shi, C. Karen Liu

机构 * Stanford(斯坦福大学) Amazon FAR(亚马逊 FAR) CMU(卡内基梅隆大学)

AI总结 提出SceneBot框架,通过接触标签和事后场景重建,统一处理自由空间运动、地形穿越和全身操作,实现复杂长时任务。

Comments 15 pages 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11229 2026-06-29 stat.ML cs.LG 版本更新

Trustworthy Predictive Distributions for Tail Events with Semiparametric Diagnostic Transport Maps

面向尾部事件的可信预测分布:基于半参数诊断传输图

Elizabeth Cucuzzella, Rafael Izbicki, Ann B. Lee

机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)

AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。

Comments 29 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05517 2026-06-29 cs.CV cs.LG cs.RO 版本更新

Web2Grasp: Learning Functional Grasps from Web Images of Hand-Object Interactions

Web2Grasp:从网络手物交互图像中学习功能性抓取

Hongyi Chen, Yunchao Yao, Yufei Ye, Zhixuan Xu, Homanga Bharadhwaj, Jiashun Wang, Arthur Jakobsson, Ruihan Zhao, Shubham Tulsiani, Zackory Erickson, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Nvidia(英伟达) National University of Singapore(新加坡国立大学) UT Austin(德克萨斯大学奥斯汀分校)

AI总结 提出从网络图像中提取人手抓取信息,利用3D重建和交互中心模型学习功能性抓取,在仿真和真实实验中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27344 2026-06-26 cs.RO 新提交

VibeAct: Vibration to Actions for Contact-Rich Reactive Robot Dexterity

VibeAct: 振动到动作——用于接触丰富反应性机器人灵巧性的方法

Yuemin Mao, Uksang Yoo, Jean Oh, Jonathan Francis, Jeffrey Ichnowski

机构 * Carnegie Mellon University(卡内基梅隆大学) Bosch Center for Artificial Intelligence(博世人工智能中心)

AI总结 提出VibeAct框架,通过共享接触和滑移的物理表示,桥接真实振动触觉感知与基于模拟的强化学习,在灵巧手操作任务中优于基线方法,并成功迁移到真实平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26603 2026-06-26 cs.RO 新提交

Bridging Handheld and Teleoperated Supervision for Contact-Rich Manipulation via State-Gated Experts

通过状态门控专家弥合手持与遥操作监督在接触丰富操作中的差距

Vidullan Surendran, Neehar Peri, David Watkins

机构 * RAI Institute(RAI研究所) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对接触丰富操作任务,提出BRIDGE方法,通过状态门控混合扩散策略专家,融合手持数据与少量遥操作演示,在接触敏感阶段利用期望动作,提升成功率最高36.7%。

Comments Project Page: https://nperi-rai.github.io/bridge-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26588 2026-06-26 cs.RO 新提交

Inference-Time Robot Behavior Steering through Physically-Aware Reconfiguration of Task-Structure

推理时通过物理感知的任务结构重配置实现机器人行为引导

Yiyuan Pan, Hanjiang Hu, Shangtao Li, Xusheng Luo, Changliu Liu

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

AI总结 提出ReStruct方法,利用神经自动机策略将视觉运动策略分解为高层状态机骨架和低层残差控制器,通过同步乘积将用户偏好融入骨架以重配置任务结构,实现无需重训练的推理时行为引导,在仿真和真实实验中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26488 2026-06-26 cs.LG 新提交

What Survives When You Compress a Recursive Reasoner for the Edge?

当压缩边缘端递归推理器时,什么得以幸存?

Pearse Jim, Steven Kolawole, Opegbemi Matthias Busoye, Glory Bagai, Virginia Smith

机构 * ML Collective Carnegie Mellon University(卡内基梅隆大学)

AI总结 研究递归推理模型在边缘设备压缩中的表现,发现激进压缩破坏全局推理但保留局部预测,提出每通道校准INT4和轨迹保真度指标实现无损部署。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26472 2026-06-26 cs.LG cs.CL 新提交

Epiphany-Aware KV Cache Eviction Without the Attention Matrix

无需注意力矩阵的顿悟感知KV缓存淘汰

Steven Kolawole, Virginia Smith

机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学) Machine Learning Department Carnegie Mellon University(机器学习系卡内基梅隆大学)

AI总结 提出EpiKV方法,通过模型内部表示变化(顿悟分数)而非注意力权重来淘汰KV缓存,无需训练或自定义内核,支持FlashAttention,在MATH-500上达到72%准确率,速度提升2.8倍。

Comments Preprint; in review

详情

展开后加载摘要…

URL PDF HTML 收藏