Lightweight Complementary-Cue Fusion for Robust Video Face Forgery Detection
轻量级互补线索融合用于鲁棒视频人脸伪造检测
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出轻量级融合模块,结合手工特征(小波去噪特征与相位谱或局部二值模式),在极小参数增加下显著提升视频人脸伪造检测的鲁棒性。
Comments 13 pages, 6 figures, 3 tables
高校专区
轻量级互补线索融合用于鲁棒视频人脸伪造检测
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出轻量级融合模块,结合手工特征(小波去噪特征与相位谱或局部二值模式),在极小参数增加下显著提升视频人脸伪造检测的鲁棒性。
Comments 13 pages, 6 figures, 3 tables
链条保持,答案翻转:对抗压力下推理模型中的痕迹-答案分离
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本研究通过2×2潜在-行为框架发现推理模型在持续对抗压力下出现“不忠实屈服”故障模式,即思维链保持正确但答案错误,并验证了推理通道对此的影响。
同一问题,不同来源,不同答案:审计医学多源RAG中的来源依赖性
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出来源依赖性作为NLP评估缺失的维度,通过构建移植患者教育基准TransplantQA、分层检索策略HERO-QA和结构化输出评判器,审计多源RAG系统中同一问题因检索来源不同而给出不同答案的失败模式。
谱引导:灵活高效的扩散模型控制方法
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Institute for Systems and Robotics(系统与机器人研究所)
AI总结 提出谱引导框架,通过条件期望算子的奇异函数学习生成过程的固有几何结构,实现无需重训练或反向传播的稳定高保真控制,在CIFAR-10上条件准确率提升37个百分点且采样加速4倍。
Comments ICML 2026
CausaLab:面向AI科学家的交互式因果发现可扩展环境
机构 * Tsinghua University(清华大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Chicago(芝加哥大学) ; Adobe
AI总结 提出CausaLab环境,通过合成实验室任务评估LLM代理在因果发现中的预测准确性与因果机制恢复能力,发现两者存在显著差距。
PrecisionCUA:代码编辑器中像素级光标定位的迭代视觉细化
机构 * Microsoft(微软公司) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出PrecisionCUA方法,通过迭代视觉反馈细化机制实现代码编辑器中像素级光标定位,显著提升点击精度和任务成功率。
HumorGen: 基于角色蒸馏的大语言模型幽默生成的认知协同
机构 * Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)
AI总结 针对大语言模型标准训练目标与幽默所需意外性之间的矛盾,提出认知协同框架,利用六种认知角色合成多样化喜剧视角数据,微调7B参数学生模型,实验表明认知驱动的数据策展比对齐算法或模型规模更关键。
价格反转现象:当更便宜的推理模型成本更高时
机构 * Stanford University(斯坦福大学) ; UC Berkeley(加州大学伯克利分校) ; CMU(卡内基梅隆大学) ; Microsoft Research(微软研究院)
AI总结 本文首次系统研究推理模型标价与实际成本的偏差,发现32%的模型对比较中存在价格反转现象,并基于Shapley值建立成本归因框架,揭示思考令牌消耗和交互轮次的高度异质性是主要原因。
机器人何时应该思考?基于强化学习的资源感知推理在具身机器人决策中的应用
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) ; Northeastern University(东北大学) ; Harvard University(哈佛大学) ; Cornell University(康奈尔大学) ; MIT(麻省理工学院) ; Fujitsu Research of America(美国富士通研究) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学) ; EmbodyX Inc(EmbodyX公司) ; Cisco Systems(思科系统)
AI总结 提出RARRL框架,通过强化学习学习高层编排策略,使具身代理能自适应决定是否调用LLM推理、选择推理角色及分配计算预算,以平衡推理开销与任务成功率。
BioArc:发现生物学基础模型的最优神经架构
机构 * Department of Computer Science, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院计算机科学系) ; Department of Electrical and Computer Engineering, Virginia Tech, Blacksburg, VA, USA(弗吉尼亚理工学院电气与计算机工程系) ; Department of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学计算机科学系) ; Department of Biomedical Data Science, Stanford University, Stanford, CA, USA(斯坦福大学生物医学数据科学系)
AI总结 针对现有基础模型架构直接迁移至生物学领域时忽视生物数据独特性质的问题,提出BioArc框架,利用神经架构搜索系统探索架构设计空间,发现高性能架构并提炼设计原则,同时提出架构预测方法以高效预测新任务的最优架构。
Comments Accepted at the 43nd International Conference on Machine Learning (ICML 2026)
歌唱声音转换挑战2025评估结果的深入分析
机构 * Graduate School of Informatics, Nagoya University, Japan(名古屋大学信息学研究科,日本) ; Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) ; Carnegie Mellon University, USA(卡内基梅隆大学,美国) ; National Institute of Informatics, Japan(日本信息处理学会) ; Information Technology Center, Nagoya University, Japan(名古屋大学信息技术中心,日本)
AI总结 本文对2025年歌唱声音转换挑战赛的评估结果进行了深入分析,通过新数据库、两个任务、开源基线和大规模众包测试,比较了33个系统在歌手身份和歌唱风格转换上的表现,发现顶级系统在身份相似性上接近真实样本,但风格建模(如气息、滑音、颤音)仍具挑战,且现有客观指标无法完全替代主观评分。
Comments Submitted to IEEE TASLP
用可解释的特征归因解释概念漂移
机构 * Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出SGShift方法,通过将概念漂移建模为特征选择任务,利用广义加性模型、敲除和吸收等统计工具识别导致源域与目标域模型性能差异的稀疏漂移特征。
多混合器模型:基于共享表示的灵活序列建模
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Google Research(谷歌研究)
AI总结 提出Oryx混合模型,通过序列轴上的灵活切换(注意力与线性递归)实现高效长上下文处理,在1.4B规模下平均语言建模任务提升0.7个百分点。
CubePart: 一种开放词汇、部件可控的3D生成器
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Stanford University(斯坦福大学)
AI总结 提出CubePart框架,通过开放词汇的部件模式实现用户定义的部件级3D网格生成,无需后处理即可直接用于游戏引擎。
Comments SIGGRAPH 2026. Project Page: https://cubepart.github.io/
用于合成数据生成的激活引导:多样性在下游安全检测中的作用
机构 * UMass Lowell(马萨诸塞大学洛厄尔分校) ; Amazon(亚马逊公司) ; CMU(卡内基梅隆大学)
AI总结 研究激活引导(AS)生成高质量训练数据用于下游安全检测分类器,发现多样性是关键但被忽视的轴,且AS在窄参数范围内优于提示生成。
面向混合专家模型中多语言下游任务的路由对齐微调
机构 * City University of Hong Kong(香港城市大学) ; Carnegie Mellon University(卡内基梅隆大学) ; The University of Hong Kong(香港大学)
AI总结 针对混合专家模型在多语言下游任务中的路由结构异构问题,提出RA-MoE三阶段框架,通过中间层语言通用对齐区识别任务相关专家,并引入路由对齐损失增强目标语言路由,实验表明该方法优于标准微调和强基线。
相关并不保证:引用RAG的证据力度校准
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Dartmouth College(达特茅斯学院) ; Cornell University(康奈尔大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Glasgow(格拉斯哥大学)
AI总结 针对引用RAG中证据力度不足的问题,提出FORCEBENCH基准测试,通过对比证据校准声明与力度增强变体,评估模型在五个操作轴上的单调性,发现标准支持提示不足以校准证据力度。
过度思考的形状:长推理轨迹中的回溯爆发
机构 * University of California, Irvine(加州大学尔湾分校) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 通过分析长推理轨迹中的回溯动态,发现早期孤立修复通常与正确推理兼容,而错误轨迹更常出现持续且聚集的晚期中度至重度回溯,并基于此提出爆发感知过滤策略以区分可恢复修复与潜在不稳定。
将视频模型转化为通用机器人策略
机构 * MIT(麻省理工学院) ; CMU(卡内基梅隆大学) ; Amazon FAR(亚马逊公司)
AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。
Comments project page: https://vera.csail.mit.edu
城市交叉口异构移动体的可微分模型预测安全
机构 * School of Business(商学院) ; Department of Mechanical Engineering(机械工程系) ; Stevens Institute of Technology(史蒂文斯理工学院) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 提出可微分模型预测安全(DMPS)框架,将模型预测控制的前瞻性嵌入数据驱动的端到端强化学习架构,通过可微分安全评价器实现精确在线安全校正,在高密度混合交通仿真中将碰撞率降至5.6%以下。
Comments 6 pages. Published in IEEE IARCE 2025
Journal ref 2025 IEEE 5th International Conference on Industrial Automation, Robotics and Control Engineering (IARCE), Chongqing, China, 2025, pp. 1-6
VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉
机构 * University of Southern California(南加州大学) ; University of California San Diego(加州大学圣地亚哥分校) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。
Comments ICML 2026 Oral
技能图谱:面向大规模智能体技能的依赖感知结构检索
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of Maryland(马里兰大学) ; Brown University(布朗大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Lehigh University(莱斯大学)
AI总结 提出技能图谱(GoS),一种推理时的结构检索层,通过构建可执行技能图并利用混合语义-词汇种子、反向感知个性化PageRank和上下文预算水合,实现依赖感知的技能束检索,在SkillsBench和ALFWorld上显著提升奖励并节省令牌。
Comments 11 pages of main text, 12 pages of appendix. Core contribution by Dawei Liu and Zongxia Li. Project page: https://github.com/davidliuk/graph-of-skills
大型语言模型的结构化智能体蒸馏
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Harvard University(哈佛大学) ; MIT(麻省理工学院) ; Northeastern University(东北大学) ; Adobe Research(Adobe研究) ; National University of Singapore(新加坡国立大学) ; University of Georgia(佐治亚大学) ; Florida International University(佛罗里达国际大学)
AI总结 提出结构化智能体蒸馏框架,通过分段对齐推理和动作跨度,将大型语言模型智能体压缩为小型学生模型,在保持决策性能的同时降低推理成本。
Journal ref The 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
重新评估不完美信息博弈的策略梯度方法
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Berkeley(加州大学伯克利分校) ; Massachusetts Institute of Technology(麻省理工学院) ; Carnegie Mellon University(卡内基梅隆大学) ; NYU Tandon School of Engineering(纽约大学坦顿工程学院)
AI总结 通过实现五种大型博弈的精确可剥削性计算,对比发现基于虚构博弈、双预言机和反事实遗憾最小化的深度强化学习算法未能超越通用策略梯度方法(如PPO)。
Comments International Conference on Learning Representations (ICLR) 2026
COOP$^2$: 定义、观察和修复LLM多智能体系统中的合作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Southern California(南加州大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; University of Arizona(亚利桑那大学)
AI总结 提出COOP$^2$框架,通过将高层合作动态与任务进度关联,定义可验证的合作任务,并开发COOP$^2$-Repair方法预测约束失败并引导修复,提升LLM多智能体系统的任务成功率和约束满足度。
DIG to Heal: 通过可解释的动态决策路径扩展通用智能体协作
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Arizona(亚利桑那大学) ; Zoom ; Salesforce ; Amazon(亚马逊)
AI总结 提出动态交互图(DIG)框架,将通用LLM智能体的涌现协作建模为时变因果网络,首次实现协作过程的可观察、可解释与实时纠错。
论口语语言模型评估中全局令牌困惑度的谬误
机构 * Carnegie Mellon University(卡内基梅隆大学) ; National Taiwan University(国立台湾大学) ; Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 针对口语语言模型评估中直接使用文本困惑度公式计算语音令牌困惑度的问题,提出基于似然和生成的新型评估方法,更忠实反映生成质量,并缩小了最佳模型与人类基线之间的差距。
实现统一流体-机器人多物理场的水下机器人游泳
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 提出一个可微分的统一流体-机器人多物理场仿真框架,通过最小作用量原理联合推导耦合的机械臂和不可压缩Navier-Stokes方程,并利用离散变分力学和隐函数定理实现稳定、准确的联合仿真与梯度计算,成功优化仿生鳗鱼机器人的波动游泳和高动态C形逃逸动作,并验证了从仿真到实物的迁移。
Comments 9 pages, 10 figures, accepted to Robotics: Science and Systems 2026
从随机插值中学习基于能量的模型:利用时空差异
机构 * University of Helsinki(赫尔辛基大学) ; University of Cambridge(剑桥大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出时空噪声对比估计(stNCE)框架,通过联合时空差异从随机插值中学习能量函数,统一现有方法并实现与最先进密度估计方法竞争的性能。
开源权重大语言模型微调防御易受简单攻击
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Simons Institute, UC Berkeley(Simons研究所,伯克利大学)
AI总结 本文发现针对开源权重大语言模型的防御措施易受abliteration和prefilling等低成本攻击,并提出abliteration-resistant tuning (ART) 方法将攻击成功率降低10%-20%。
Comments main body: 9 pages, 3 figures