WarpI2I: Image Warping for Image-to-Image Translation
WarpI2I:用于图像到图像翻译的图像扭曲
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。
Comments ECCV 2026
高校专区
WarpI2I:用于图像到图像翻译的图像扭曲
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出一种基于显著性的扭曲-反扭曲框架,通过重新分配空间表示至显著区域,在不增加潜在分辨率的情况下保留图像细节,适用于人体重光照、驾驶场景翻译等任务。
Comments ECCV 2026
AgRefactor:面向HLS兼容性与性能的自进化智能体工作流
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
AI总结 提出基于LLM的多智能体工作流AgRefactor,通过自进化记忆系统和自动化重构工具,将软件代码重构为HLS兼容程序,在11个基准测试中9个超越现有方法,并实现6.51x几何平均加速。
使用AI代理自动化大规模黑盒审计个性化算法
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出用生成式AI代理作为行为引擎进行黑盒审计,通过固定人设和反事实扰动解耦用户属性与行为,在X平台部署1120个代理发现算法推荐放大有毒、极化内容且效果因用户意识形态而异。
Comments 43 pages, 10 figures
从抓取到灵巧:大规模抓取预训练用于灵巧操作
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 本文提出一种层次化模仿学习框架,利用大规模灵巧抓取数据集预训练低级控制器,再微调于下游工具使用任务,在仿真和真实实验中显著提升成功率。
Comments Project page: https://yingyuan0414.github.io/grasp2dexterity/
通过局部分支路由实现高效且可训练的语言模型测试时扩展
机构 * Northwestern University(西北大学) ; Rutgers University(罗格斯大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Carnegie Mellon University(卡内基梅隆大学) ; LMSYS Org(LMSYS组织) ; Tilde Research(Tilde研究) ; University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of California, San Diego(加州大学圣迭戈分校)
AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。
DetPO:基于多模态大语言模型的上下文学习用于少样本目标检测
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Roboflow
AI总结 提出DetPO,一种无需梯度的测试时优化方法,通过最大化少样本视觉训练示例上的检测精度并校准预测置信度,优化文本提示,提升多模态大语言模型在少样本目标检测中的性能。
Comments This work has been accepted to the European Conference on Computer Vision (ECCV) 2026. Project Page: https://ggare-cmu.github.io/DetPO/
切割超立方体的改进上界
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Worcester Polytechnic Institute(伍斯特理工学院) ; Constructive Codes
AI总结 研究用最少超平面切割n维超立方体所有边的问题,通过构造8个超平面切割Q_{10},将上界从⌈5n/6⌉改进为⌈4n/5⌉(n为5的奇数倍时加1)。
VLK:从重建场景中的合成交互学习人形机器人全身操控
机构 * Amazon FAR(亚马逊FAR) ; UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出VLK方法,通过3D高斯泼溅重建室内场景并合成视觉-语言-运动学数据,训练人形机器人全身操控策略,实现从仿真到真实的迁移。
Comments 19 pages, 7 figures, 4 tables
有效传输映射估计的基本极限
机构 * Department of Statistics and Data Science(统计与数据科学系) ; Machine Learning Department(机器学习系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文在极小极大框架下形式化估计任意有效传输映射的任务,证明在标准稳定性假设下估计任意有效传输映射与估计最优传输映射统计难度相同,并给出当假设不成立时替代映射可更准确学习的例子。
Comments 25 pages, 2 figures
在线模仿学习何时有助于LLM后训练?(非)可实现性超越视界的作用
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; UC Berkeley(加州大学伯克利分校) ; Harvard University(哈佛大学)
AI总结 本文挑战误差累积是在线模仿学习优势主要来源的观点,证明在线交互的收益关键取决于设置是否可实现,并在非可实现情况下提出奖励相关的结构特征,使在线学习仍能取得高性能。
一场景,两深度:探究单目基础模型中的几何歧义性
机构 * University of Michigan(密歇根大学) ; Carnegie Mellon University(卡内基梅隆大学) ; New York University(纽约大学) ; Vanderbilt University(范德比大学)
AI总结 本文提出稀疏双层序数基准MD-3k,用于测量单目深度基础模型的深度层偏好和多层空间关系准确性,发现不同模型对同一分层几何结构有不同解析,且拉普拉斯视觉提示可改变冻结模型的输出层。
Comments 49 pages, 25 figures; Accepted by European Conference on Computer Vision (ECCV) 2026
进化微调:在371个优化任务中学习发现
机构 * University of Minnesota(明尼苏达大学) ; Carnegie Mellon University(卡内基梅隆大学) ; KAIST(韩国科学技术院) ; University of Cambridge(剑桥大学) ; Hanyang University(翰阳大学) ; Amazon(亚马逊)
AI总结 提出进化微调(EFT)方法,通过将进化搜索轨迹转化为监督信号,教会大语言模型跨任务迭代优化解决方案,在22个保留任务上平均提升10.22%。
Comments Project page: https://open-galapagos.github.io/evolution_finetuning/
MOSAIC: 通过层次语义对齐编排协作知识追踪
机构 * Columbia University(哥伦比亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) ; Department of Mathematics, University of Southern California(数学系,南加州大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Computer Science Department, UC San Diego(计算机科学系,UCSD)
AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。
DriftGuard:面向演化毒性审核的安全感知多监测器检测与选择性适应
机构 * Department of Information and Decision Sciences(信息与决策科学系) ; University of Minnesota(明尼苏达大学) ; Department of Industrial Engineering and Management Sciences(工业工程与管理科学系) ; Northwestern University(西北大学) ; Fuqua School of Business(福卡商学院) ; Duke University(杜克大学) ; Department of Engineering(工程系) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出DriftGuard框架,结合多监测器漂移检测与选择性模型更新,针对毒性演化中的安全相关漂移,通过硬混合适应集提升毒性召回率与准确性。
效率前沿:LLM上下文管理中成本-性能优化的统一框架
机构 * Northwestern University(西北大学) ; Duke University(杜克大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Minnesota(明尼苏达大学)
AI总结 提出效率前沿框架,通过部署感知优化联合考虑任务性能、token成本和预处理重用,实现LLM上下文管理中的成本-性能权衡。
Comments Accepted to LMIAT 2026
可操控的视觉表示
机构 * University of Technology Nuremberg(纽伦堡工业大学) ; Carnegie Mellon University(卡内基梅隆大学) ; International Institute of Information Technology, Hyderabad(海得拉巴国际信息技术学院)
AI总结 本文提出可操控的视觉表示,通过自然语言指导视觉特征,提升视觉任务的灵活性和泛化能力。
Comments Accepted to ECCV 2026
什么是有能力的智能体必须知道:在不确定性下鲁棒决策制定的选取定理
机构 * Machine Learning Department and Neuroscience & Robotics Institutes, Carnegie Mellon University(机器学习系和神经科学与机器人研究院,卡内基梅隆大学)
AI总结 本文探讨了在不确定性下智能体必需的内部结构,证明了强任务表现迫使世界模型、信念记忆及持久变量的必要性,提出了选取定理以解决部分可观测性和任务分布下的决策问题。
Comments 23 pages, 1 figure. To appear in Uncertainty in Artificial Intelligence (UAI) 2026
压缩感知在大语言模型能力定位中的应用
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。
提示中应工程什么?基于需求驱动的LLM使用训练
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Columbia University(哥伦比亚大学) ; University of Washington(华盛顿大学)
AI总结 本文提出ROPE框架,通过评估和训练套件帮助用户生成清晰需求,提升LLM应用构建效果。
Comments 15 pages; TOCHI 2025
Journal ref TOCHI 2025
SPHERE:人类-人工智能系统评估卡
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学) ; University of Aberdeen(阿伯丁大学)
AI总结 本文提出SPHERE评估卡,从五个维度评估人类-人工智能系统,通过审查39个系统揭示当前评估实践及改进方向,并提出三项提升评估有效性和严谨性的建议。
Journal ref ACL Findings 2025
解缠连续时间潜在动力学:通过扩散偏移实现潜在SDE的可辨识性
机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The University of Melbourne(墨尔本大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对连续时间潜在随机微分方程模型的可辨识性问题,利用环境引起的扩散协方差偏移,证明在漂移无稀疏性假设下,对角扩散机制可识别潜在坐标至置换和缩放,并估计潜在解缠与因果图。
通过预注册下一个LLM来缓解基于LLM的p-hacking
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出一种协议,通过预注册实验和合格模型,并在预注册后发布的第一个合格LLM上运行,以缓解LLM研究中的p-hacking问题。实验表明该协议能有效阻止73.9%和72.7%的p-hack转移。
SceneBot: 接触提示的通用人形全身跟踪与环境交互
机构 * Stanford(斯坦福大学) ; Amazon FAR(亚马逊 FAR) ; CMU(卡内基梅隆大学)
AI总结 提出SceneBot框架,通过接触标签和事后场景重建,统一处理自由空间运动、地形穿越和全身操作,实现复杂长时任务。
Comments 15 pages 10 figures
面向尾部事件的可信预测分布:基于半参数诊断传输图
机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) ; Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)
AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。
Comments 29 pages, 5 figures, 2 tables
Web2Grasp:从网络手物交互图像中学习功能性抓取
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nvidia(英伟达) ; National University of Singapore(新加坡国立大学) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 提出从网络图像中提取人手抓取信息,利用3D重建和交互中心模型学习功能性抓取,在仿真和真实实验中优于基线方法。
VibeAct: 振动到动作——用于接触丰富反应性机器人灵巧性的方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Bosch Center for Artificial Intelligence(博世人工智能中心)
AI总结 提出VibeAct框架,通过共享接触和滑移的物理表示,桥接真实振动触觉感知与基于模拟的强化学习,在灵巧手操作任务中优于基线方法,并成功迁移到真实平台。
通过状态门控专家弥合手持与遥操作监督在接触丰富操作中的差距
机构 * RAI Institute(RAI研究所) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 针对接触丰富操作任务,提出BRIDGE方法,通过状态门控混合扩散策略专家,融合手持数据与少量遥操作演示,在接触敏感阶段利用期望动作,提升成功率最高36.7%。
Comments Project Page: https://nperi-rai.github.io/bridge-project/
推理时通过物理感知的任务结构重配置实现机器人行为引导
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
AI总结 提出ReStruct方法,利用神经自动机策略将视觉运动策略分解为高层状态机骨架和低层残差控制器,通过同步乘积将用户偏好融入骨架以重配置任务结构,实现无需重训练的推理时行为引导,在仿真和真实实验中优于现有方法。
当压缩边缘端递归推理器时,什么得以幸存?
机构 * ML Collective ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 研究递归推理模型在边缘设备压缩中的表现,发现激进压缩破坏全局推理但保留局部预测,提出每通道校准INT4和轨迹保真度指标实现无损部署。
Comments Preprint; in review
无需注意力矩阵的顿悟感知KV缓存淘汰
机构 * Language Technologies Institute Carnegie Mellon University(语言技术研究所卡内基梅隆大学) ; Machine Learning Department Carnegie Mellon University(机器学习系卡内基梅隆大学)
AI总结 提出EpiKV方法,通过模型内部表示变化(顿悟分数)而非注意力权重来淘汰KV缓存,无需训练或自定义内核,支持FlashAttention,在MATH-500上达到72%准确率,速度提升2.8倍。
Comments Preprint; in review