Momentum Guidance: Plug-and-Play Guidance for Flow Models
动量引导:用于流模型的即插即用引导
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出动量引导方法,通过扩展当前速度远离过去速度的指数移动平均,提升样本质量并保持成本,优于现有引导技术,实验显示在ImageNet-256上FID显著降低。
高校专区
动量引导:用于流模型的即插即用引导
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出动量引导方法,通过扩展当前速度远离过去速度的指数移动平均,提升样本质量并保持成本,优于现有引导技术,实验显示在ImageNet-256上FID显著降低。
通过边界条件改进校正流
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Google(谷歌)
AI总结 本文提出边界约束校正流模型,通过强制边界条件提升生成模型性能,在ImageNet上使用ODE和SDE采样分别提升FID分数8.01%和8.98%。
Comments ICCV 2025
Journal ref Proc. IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 18177-18186
非负变分自编码器:广义伽玛信念网络
机构 * Xidian University(西安电子科技大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出广义伽玛信念网络,通过扩展线性生成模型为非线性模型,解决原有GBN的表达能力限制,并采用Weibull推理网络近似后验分布,实验验证其在表达性和解耦表示学习中的性能。
超越谱分解:通过因子分析的贝叶斯对比学习及其非负形式
机构 * Xidian University(西安电子科技大学) ; MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出对比因子分析框架,结合因子分析和对比学习的优势,通过非负因子分析提升可解释性,验证了其在表达能力、鲁棒性、可解释性和不确定性估计上的有效性。
视觉默认,先验覆盖:视觉-语言模型中感知-知识冲突的因果机制
机构 * University of Tübingen(图宾根大学) ; Harvard University(哈佛大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 通过激活修补和消融实验,发现VLM中视觉默认激活,而先验知识依赖少量因果注意力头(2.5-4.8%),形成不对称因果结构。
Comments 14 pages, 11 figures, 8 tables
地质碳封存中井底压力与CO2羽流预测的边界条件保真度
机构 * Department of Earth and Planetary Sciences, Jackson School of Geosciences, The University of Texas at Austin(德克萨斯大学奥斯汀分校杰克逊地球科学学院地球与行星科学系) ; Bureau of Economic Geology, The University of Texas at Austin(德克萨斯大学奥斯汀分校经济地质局) ; Hildebrand Department of Petroleum and Geosystems Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校希尔德布兰德石油与地质系统工程系)
AI总结 研究通过对比十种截断域边界处理方法与全域参考模拟,评估边界条件保真度对井底压力和CO2羽流预测的影响,发现保留角点孔隙体积是关键,而透射率修正并非普遍有益,渐进修正结合透射率修正效果最佳。
最强的教师并不总是最好的教师:以学生为中心的答案选择
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Southern California(南加州大学) ; Independent Researcher(独立研究者) ; National University of Singapore(新加坡国立大学) ; Microsoft(微软) ; Google(谷歌) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Northwestern University(西北大学) ; Allen Institute for AI (AI2)(人工智能研究院(AI2))
AI总结 提出以学生为中心的答案采样(SCAS)框架,通过估计学生中心的学习成本选择教师生成的答案,从而提升学生模型性能。
QuantV2X:一种用于协同感知的全量化多智能体系统
机构 * UCLA(加州大学洛杉矶分校) ; UW-Madison(威斯康星大学麦迪逊分校) ; NCSU(北卡罗来纳州立大学) ; Purdue University(普渡大学) ; UC Berkeley(加州大学伯克利分校) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 提出首个全量化多智能体系统QuantV2X,通过端到端量化策略同时降低计算负载和传输带宽,在低比特约束下达到与全精度相当的精度,并显著降低延迟、提升mAP30。
Comments ECCV 2026
Web2Grasp:从网络手物交互图像中学习功能性抓取
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Nvidia(英伟达) ; National University of Singapore(新加坡国立大学) ; UT Austin(德克萨斯大学奥斯汀分校)
AI总结 提出从网络图像中提取人手抓取信息,利用3D重建和交互中心模型学习功能性抓取,在仿真和真实实验中优于基线方法。
我们在多模态大语言模型评估中缺失了什么?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文分析现有多模态大语言模型评估基准的不足,识别出时空连贯性、物理世界理解、多模态一致性和选择性注意等关键缺失,强调填补这些空白对衡量多模态智能真实进展的重要性。
从自我未来学习:面向扩散LLM的在线自蒸馏
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑工业大学) ; Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; ELLIS Institute Tubingen(ELLIS蒂宾根研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tubingen AI Center(蒂宾根人工智能中心)
AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。
Comments Preprint
玻色子高斯酉算子的高效学习
机构 * Inria(法国国家信息与自动化技术研究所) ; Télécom Paris - LTCI(巴黎电信学院 - LTCI) ; Institut Polytechnique de Paris(巴黎理工学院) ; Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) ; Institute of Computer Technology, Seoul National University(首尔国立大学计算机技术研究所) ; Dahlem Center for Complex Quantum Systems, Freie Universitat Berlin(柏林自由大学复杂量子系统中心) ; NEST, Scuola Normale Superiore and Istituto Nanoscienze(NEST、巴黎高等科学研究所和纳米科学研究所)
AI总结 提出首个高效算法学习玻色子高斯酉算子,使用相干和压缩探针、被动线性光学及外差/零差检测,通过辛正则化后处理实现多项式时间复杂度和高精度。
GO: 大户外多模态数据集
机构 * Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX, USA(迈克·沃克66机械工程系,德克萨斯A&M大学,学院站,德克萨斯州,美国) ; DEVCOM Army Research Laboratory, Adelphi, MD, USA(陆军研究实验室,阿德菲,马里兰州,美国) ; University of Texas at Austin Center for Autonomy, Austin, TX, USA(德克萨斯大学奥斯汀分校自主性中心,奥斯汀,德克萨斯州,美国)
AI总结 针对非结构化环境中地面机器人研究,提出包含六种互补传感器模态的大规模多模态越野数据集,支持语义分割、目标检测和SLAM等任务,以提升退化条件下的鲁棒性。
Comments 7 pages, 7 figures, accepted at IV 2026
Causal-rCM:一种用于流式视频生成和交互式世界模型中自回归扩散蒸馏的统一教师强制与自我强制开放配方
机构 * Tsinghua University(清华大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; NVIDIA(英伟达)
AI总结 提出Causal-rCM框架,将扩散蒸馏扩展到自回归视频扩散,通过教师强制(前向散度)与自我强制(反向散度)互补,实现流式视频生成和交互式世界模型,在帧级和块级设置中达到最先进性能。
Comments Technical Report
物理问题场景图:文本到视频生成中物理合理性的细粒度评估
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; AI2(艾伦人工智能研究所) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出物理问题场景图(PQSG),一种基于层次化问题的评估流程,通过图结构问题检查视频在对象、动作和物理规律上的忠实度,实现细粒度评估。
Comments ECCV 2026. Code and data: https://github.com/atinpothiraj/pqsg
视觉运动策略中的记忆检索用于长期机器人控制
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。
Comments 16 pages, 5 tables, 8 figures
RGB: 强化学习引导的全身MPPI用于人形机器人控制
机构 * Center for Humanoid Research, Korea Institute of Science and Technology (KIST)(韩国科学技术研究院(KIST)仿人机器人研究中心) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Department of Mechanical Engineering, Yonsei University(延世大学机械工程系) ; School of Electrical Engineering, Korea University(高丽大学电气工程学院)
AI总结 提出RL引导的全身MPPI框架,利用预训练RL策略作为采样先验,通过MPPI成本项在线修正,无需重新训练即可实现鲁棒精确的全身控制。
Comments 7pages
自适应自监督语音表示用于帕金森病跨语言构音障碍检测
机构 * FAU Erlangen-Nürnberg(埃尔朗根-纽伦堡大学) ; UT Austin(奥斯汀大学) ; CMU(卡内基梅隆大学) ; Czech Technical University in Prague(布拉格技术大学) ; Idiap Research Institute(Idiap研究机构) ; Universidad de Antioquia(安提奥基亚大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Fortemedia(Fortemedia公司)
AI总结 针对构音障碍数据稀缺导致跨语言检测困难,提出基于质心的表示级语言迁移方法,对齐自监督语音表示,在捷克语、德语和西班牙语帕金森病语音数据集上显著提升跨语言检测敏感性和F1值。
Comments Submitted to Interspeech 2026
OpenThoughts-Agent: 智能体模型的数据配方
机构 * UC Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; JSC(于利希超级计算中心) ; LAION ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Bespoke Labs ; Laude Institute ; UCLA(加州大学洛杉矶分校) ; Harvard University & Harvard Medical School(哈佛大学与哈佛医学院) ; TU Munich & Munich Center for Machine Learning(慕尼黑工业大学与慕尼黑机器学习中心) ; New York University(纽约大学) ; Medical University of South Carolina(南卡罗来纳医科大学) ; The LLM Data Company ; BenchFlow ; Independent Researcher(独立研究员) ; Northeastern University(东北大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of Washington(华盛顿大学) ; TU Darmstadt(达姆施塔特工业大学) ; University of Southern California(南加州大学) ; UC San Diego(加州大学圣地亚哥分校) ; Amazon(亚马逊) ; Microsoft(微软) ; Korea University(高丽大学) ; Cornell Tech(康奈尔科技) ; University of Michigan(密歇根大学)
AI总结 提出全开放数据筛选流水线,通过100多次消融实验研究任务来源与多样性,构建10万样本训练集,在7个智能体基准上平均44.8%准确率,较最强开源模型提升3.9个百分点。
评估人类活动识别中的分布偏移以进行域泛化
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 系统评估设备类型、传感器位置、采样率和用户行为四种分布偏移对HAR模型的影响,建立统一基准并评估28种域泛化方法,发现现有方法泛化能力有限。
Comments 22 pages with references
FedSteer: 通过校正投影和缓存驯服联邦学习中的极端梯度陈旧性
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Avignon(阿维尼昂大学) ; Singapore University of Technology and Design(新加坡科技与设计大学) ; University of Washington(华盛顿大学)
AI总结 针对联邦学习中客户端参与不均导致的梯度陈旧问题,提出FedSteer方法,利用客户端梯度缓存构建子空间,通过投影和缓存策略校正陈旧梯度,显著提升训练稳定性与精度。
Comments UAI 2026
区分变量选择中的遗忘模型与自适应模型
机构 * University of Washington(华盛顿大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文研究ℓ∞稀疏恢复的统计与计算复杂性,证明遗忘模型下最优误差可在近线性时间内以约k log d样本达到,而自适应模型至少需要k²样本,与ℓ₂设置形成对比。
Comments 40 pages, Extended abstract accepted for presentation at COLT 2026
通过图上的随机游走理解掩码扩散中的并行采样器
机构 * UT Austin SDS(德克萨斯大学奥斯汀分校统计与数据科学系) ; UT Austin CS(德克萨斯大学奥斯汀分校计算机科学系) ; UT Austin ECE(德克萨斯大学奥斯汀分校电气与计算机工程系)
AI总结 提出以图上随机游走为可验证沙盒,研究掩码扩散模型中的并行采样策略,理论上证明最低熵等并行采样并非普遍优于随机采样,并开发了二分采样器,实验表明不同图适用不同采样器。
CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。
Comments Code: https://github.com/ashwinn-v/CalVerT
基于能量的组合扩散规划
机构 * Stanford University(斯坦福大学) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出能量基组合扩散器(ECD),将全局轨迹建模为局部桥势之和的最小化,通过保守修正场和边界反应项改进启发式拼接,实现线性时间复杂度的马尔可夫分数近似,在OGBench任务中达到最优成功率。
Comments ICML 2026
超越“一种语言,一种文字”:用PuMVR量化多语言视觉语言模型中的正字法偏差
机构 * RediMinds Inc.(RediMinds公司) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 提出PuMVR基准,通过旁遮普语三种文字的图像推理任务,量化多语言视觉语言模型中的文字依赖偏差,发现文字一致性率低至24.8%,视觉输入无法消除偏差。
Comments 22 pages, 4 figures. Accepted to the 4th Workshop on Cross-Cultural Considerations in NLP (C3NLP) @ ACL 2026
FirstPass: 在多轮编辑结果中奠定AI科学判断的基础
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; RediMinds Inc.(RediMinds公司) ; Disaster Science Operations Center, Western Kentucky University(西肯塔基大学灾害科学运营中心)
AI总结 针对同行评审AI在领域覆盖、对话建模和评估标准上的不足,提出FirstPass数据集和微调模型,利用Nature Communications多轮评审对话,通过响应损失掩码实现80.5%的编辑结果预测准确率,并生成接近人类长度的评审意见。
Comments Accepted at the AI for Science Workshop at the 43rd International Conference on Machine Learning (ICML 2026). 9 pages, 2 figures, 6 tables
真正的协调增益有多大?多智能体LLM基准测试的配对噪声底线协议
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 针对多智能体LLM协调基准测试中微小增量不可靠的问题,提出配对噪声底线协议,通过配置等价对比发现典型效应量低于观测噪声包络,并定义协调活跃pass^k作为最低报告标准。
Comments 11 pages, 4 figures
私有稀疏协方差估计与PCA中的维度灾难
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究差分隐私下稀疏协方差矩阵估计和PCA的样本复杂度,发现当特征向量稀疏时,poly(k, log d)样本足够,否则需poly(d)样本,揭示了私有与非私有版本间的指数差距。
ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型
机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) ; Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)
AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。
Comments Interspeech 2026