Training LLMs with Reinforcement Learning for Intent-Aware Personalized Question Answering
通过强化学习训练LLMs进行意图感知的个性化问答
机构 * University of Washington(华盛顿大学)
AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。
高校专区
通过强化学习训练LLMs进行意图感知的个性化问答
机构 * University of Washington(华盛顿大学)
AI总结 本文提出IAP框架,通过强化学习直接从单轮问题推断用户意图并生成意图感知的回答,实验表明其在LaMP-QA基准上优于所有基线,平均宏得分提升约7.5%。
OceanCBM:一种用于海洋预报机制可解释性的概念瓶颈模型
机构 * University of California, Davis(加州大学戴维斯分校) ; University of Washington(华盛顿大学) ; NOAA Geophysical Fluid Dynamics Laboratory(国家海洋大气管理局流体动力学实验室)
AI总结 本文提出OceanCBM,一种用于时空预测和海洋动力机制解释的概念瓶颈模型,通过混合监督预测混合层热含量,实现可解释且物理基础的表示。
Comments 17 pages, 9 figures, 4 tables
更快的通用两阶段近似Top-K算法
机构 * University of Washington, Seattle(华盛顿大学) ; New York University(纽约大学) ; Google DeepMind(谷歌DeepMind)
AI总结 本文提出一种改进的两阶段近似Top-K算法,通过调整第一阶段的分区策略,减少第二阶段输入规模并提升效率,同时保持相同预期召回率。
Comments Accepted at TMLR May 2026
SocialLM:利用LLMs和上下文聚合进行患者-提供者沟通的社会信号处理
机构 * University of Washington(华盛顿大学) ; UC San Diego(圣地亚哥大学)
AI总结 本文探讨了LLMs在无需微调的情况下能否有效跟踪临床转录中的20种社会行为,并通过群体一致性模式提升检测准确性与稳定性。
Comments To be presented at CHIL 2026
模拟蒸馏:在模拟中预训练世界模型以实现快速真实世界适应
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学) ; FieldAI
AI总结 本文提出SimDist框架,利用物理模拟器生成大量动作条件机器人经验,通过蒸馏结构先验提升世界模型性能,实现高效真实世界适应。
Comments Robotics: Science and Systems 2026
切片与切割:配置最优专家混合物
机构 * Paul G Allen School of Computer Science(保罗·G·艾伦计算机科学学院) ; University of Washington(华盛顿大学) ; New York University(纽约大学) ; Courant School of Data Science(科廷数据科学学院)
AI总结 本文研究了混合专家架构中专家数量、粒度等核心参数的优化问题,发现专家数量和粒度对性能影响显著,其他参数影响较小。
通过结构化元认知实现通用代理中的深度推理
机构 * University of Washington(华盛顿大学)
AI总结 本文提出深度推理方法,通过结构化元认知构建任务特定框架,提升复杂任务处理能力,在四个基准测试中超越现有方法,减少早终止和幻觉。
Comments Preprint under review
DeconDTN-Toolkit:一个用于评估和增强对溯源转移鲁棒性的工具包
机构 * University of Washington(华盛顿大学) ; University of Minnesota(明尼苏达大学)
AI总结 本文提出DeconDTN-Toolkit,通过模拟不同程度的溯源转移,评估和增强模型对溯源转移的鲁棒性,揭示经验风险最小化方法的脆弱性,并提供理论和实用工具以应对溯源混淆问题。
Comments Accepted to CHIL 2026
DisagMoE:通过解耦的AF-Pipe并行性实现计算-通信重叠的MoE训练
机构 * University of Washington(华盛顿大学) ; Cornell University(康奈尔大学)
AI总结 DisagMoE通过解耦注意力与FFN层,优化模型放置与调度,提升MoE训练效率,实验显示在16节点8xH800集群上实现1.8倍加速。
组合威胁采样在睡眠半带it中的最坏情况后悔界
机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学) ; Department of Computer Science, University of British Columbia(不列颠哥伦比亚大学计算机科学系) ; Department of Computer Science, University of Victoria(维多利亚大学计算机科学系)
AI总结 本文研究了睡眠半带it中组合威胁采样(CTS)的最坏情况后悔界,解决了CTS在半带it设置中缺乏最坏情况后悔保证、对抗性可用性变化缺乏理论支持以及CTS-G的实验证性能较弱的问题,提出CL-SG算法并证明其改进的后悔界。
Comments Accepted by INFOCOM 26 on Dec 2025
AI搜索摘要对网站流量的影响:来自谷歌AI概览和维基百科的证据
机构 * University of Washington(华盛顿大学)
AI总结 研究通过对比谷歌AI概览与维基百科多语言版本流量变化,发现AI摘要导致英文维基百科文章日均流量下降15%,且对文化类内容影响更大,揭示搜索引擎生成答案对信息类出版物注意力的再分配。
理解偏好学习中的性能差距:RLHF和DPO的二元性
机构 * University of Washington(华盛顿大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Amazon Inc.(亚马逊公司)
AI总结 本文分析RLHF和DPO性能差距的来源,揭示模型规格误差对方法选择的影响,指出在线DPO在特定条件下优于其他方法,揭示两阶段学习的统计优势。
Comments ICML accepted version
块g先验的狄利克雷过程混合用于线性模型中的模型选择和预测
机构 * Google Inc.(谷歌公司) ; Department of Statistics, University of Washington(华盛顿大学统计学系)
AI总结 本文提出块g先验的狄利克雷过程混合用于线性模型中的模型选择和预测,通过允许不同参数块的差异收缩并考虑预测变量的相关结构,实现了模型选择与连续收缩先验的桥梁。
PhyGround:用于生成世界模型中物理推理的基准测试
机构 * Northeastern University(东北大学) ; Tulane University(路易斯安那州立大学) ; University of Washington(华盛顿大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。
Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/
时序相关性的益处:SGD 通过随机游走高效学习 k-联合
机构 * Bocconi University(博科尼大学) ; University of Washington(华盛顿大学) ; Massachusetts Institute of Technology(麻省理工学院)
AI总结 研究时序相关性如何使稀疏学习问题更高效地被梯度方法解决,展示在超立方体上懒惰随机游走生成样本时,两层ReLU网络能高效学习k-联合。
Comments 10 pages main body, 3 figures
任意到任意的3D扩散模型与知识转移:放射治疗计划研究
机构 * UC Santa Cruz(加州大学圣克ruz分校) ; Siemens Healthineers(西门子医疗) ; University of Washington(华盛顿大学)
AI总结 本文提出DiffKT3D,一种利用预训练视频扩散模型知识的统一Any2Any 3D扩散框架,通过模态特定嵌入实现多临床模态灵活条件化,结合临床导向的强化学习机制,提升放射治疗计划中的剂量预测精度与图像质量。
Comments Accepted by CVPR 2026 main conference. Compare to CVPR version, minor updates here are included (e.g., combine main text and appendix; clarify the timing scenario in appendix)
将多模态大语言模型引入红外-可见图像融合质量评估
机构 * Northwestern University(西北大学) ; Northeastern University(东北大学) ; University of Washington(华盛顿大学) ; Hong Kong Baptist University(香港 Baptist大学) ; Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)
AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。
因果发现应拥抱大众智慧
机构 * Department of Industrial and Systems Engineering, University of Washington(华盛顿大学工业与系统工程系) ; Department of Applied Mathematics, Illinois Institute of Technology(伊利诺伊理工学院应用数学系) ; Department of Electrical & Computer Engineering, Texas A&M University(德克萨斯阿灵顿大学电气与计算机工程系)
AI总结 本文探讨了因果学习中大众智慧范式的发展,提出通过分布式和基于群体的方法整合分散的因果知识,构建全局因果结构,并呼吁跨学科合作。
生成对抗式后训练缓解实时人机音乐交互中的奖励黑客
机构 * Mila, Quebec Artificial Intelligence Institute, Université de Montréal(蒙特利尔大学人工智能研究所,魁北克机器学习研究院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ; Massachusetts Institute of Technology(麻省理工学院) ; Georgia Institute of Technology(佐治亚理工学院) ; University of Washington(华盛顿大学) ; McGill University(麦吉尔大学) ; Independent Researcher(独立研究者)
AI总结 本文提出一种对抗训练方法,通过政策生成轨迹缓解生成序列模型后训练中的奖励黑客问题,提升音乐伴奏的多样性与和谐性。
Comments v3: fix the Figure numbering bugs
一条轨迹,一个标记:通过全景子对象轨迹实现的 grounded 视频标记化
机构 * University of Washington(华盛顿大学) ; Allen Institute for Artificial Intelligence(人工智能艾伦研究所) ; Woven by Toyota, Inc(丰田公司)
AI总结 本文提出 grounded 视频标记化方法,通过全景子对象轨迹组织标记,减少冗余并保持时间一致性,TrajViT 在多个视频理解基准上优于空间-时间 ViT,具有更高的效率和性能。
Comments ICCV 2025
WavesFM:纵向可穿戴传感器波形的分层表示学习
机构 * Google Research(谷歌研究) ; MIT(麻省理工学院) ; University of Washington(华盛顿大学)
AI总结 WavesFM通过分层自监督学习框架,解决长序列生理数据处理中的高采样频率、多模态依赖和长序列长度问题,实现对局部信号语义和复杂昼夜及跨日变化的建模。
个性化对齐再审视:用户多样性必要性和充分性
机构 * Foster School of Business, University of Washington, Seattle, Washington, USA(华盛顿大学福斯特商学院)
AI总结 本文研究了个性化对齐的理论条件,证明用户多样性是实现高效个性化识别的关键,提出用户多样性条件决定在线 regrets 和离线样本复杂度的最优速率。
全局经验NTK:自参考偏差与梯度下降学习的维度性
机构 * Applied Mathematics, University of Washington(应用数学,华盛顿大学;艾伦研究所) ; Allen Institute(艾伦研究所;神经生物学与生物物理学,华盛顿大学) ; Allen Institute(应用数学,电气与计算机工程,华盛顿大学) ; Neurobiology & Biophysics, University of Washington(应用数学,神经生物学与生物物理学,华盛顿大学;艾伦研究所) ; Applied Mathematics, Electrical & Computer Engineering, University of Washington ; Applied Mathematics, Neurobiology & Biophysics, University of Washington ; Allen Institute
AI总结 本文研究了全局经验NTK的结构,揭示其受制于有效秩并产生自参考偏差,通过Kronecker-core定理证明了广泛模型的NTK可计算性,并展示了自注意力变换器的NTK结构受限于低秩性。
Comments Submitted to TMLR
MicroDiffuse3D:一种用于3D显微成像修复的预训练基础模型
机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington, Seattle, WA, USA(保罗·G·艾伦计算机科学与工程学院,华盛顿大学,西雅图,华盛顿州,美国) ; Department of Chemistry, University of Washington, Seattle, WA, USA(化学系,华盛顿大学,西雅图,华盛顿州,美国)
AI总结 本文提出MicroDiffuse3D,一种预训练的3D显微成像修复模型,通过高通量数据提升3D化学成像的分辨率和信噪比,实现高质量体体积结构重建。
NARRA-Gym用于评估交互叙事代理
机构 * University of Notre Dame(诺丁汉大学) ; LMU Munich(慕尼黑大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; University of Pennsylvania(宾夕法尼亚大学) ; Lehigh University(莱恩大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) ; University of Washington(华盛顿大学)
AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。
Sinkhorn治疗效应:一种因果最优传输度量
机构 * Department of Statistics, University of Washington, Seattle, WA, USA(华盛顿大学统计学系) ; Department of Health Care Policy, Harvard Medical School, Boston, MA, USA(哈佛医学院医疗政策系)
AI总结 本文提出Sinkhorn治疗效应,作为因果分布差异的熵最优传输度量,通过核方法构建去偏估计器,并提出聚合检验方法以提高测试效力。
Comments 55 pages, 6 figures
有意违背:自动检测代理轨迹中的故障
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
AI总结 本文提出AgentPex工具,通过提取规则自动评估代理轨迹,发现传统仅关注结果的评估方法无法检测到关键流程故障,如错误的工作流路由、不安全的工具使用或违反提示规则的情况。
Comments Accepted at ACM CAIS 2026
具有噪声语言模型先验的顺序因果发现
机构 * ELLIS Institute Finland and Aalto University(芬兰ELLIS研究所和阿尔托大学) ; Adobe Research(Adobe研究) ; University of Washington, Seattle(华盛顿大学(西雅图))
AI总结 本文提出一种混合框架,通过适应性整合顺序批次数据与噪声专家知识,提升因果发现的准确性,并扩展到参数估计,展示了对语言模型噪声的鲁棒性。
Comments 32 pages, Transactions on Machine Learning Research - TMLR (04/2026)
快速字节潜在变换器
机构 * FAIR at Meta(Meta的FAIR) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学)
AI总结 本文提出BLT Diffusion和BLT Self-speculation等方法,通过并行生成和验证步骤提升字节级语言模型的生成速度和质量,降低内存带宽消耗。
如果人工智能系统不是聊天机器人呢?
机构 * University of Washington Seattle(华盛顿大学(西雅图)) ; Salesforce Research(Salesforce研究) ; Microsoft(微软) ; Hugging Face and University of Connecticut(Hugging Face与康涅狄格大学)
AI总结 本文探讨了将AI主要作为对话助手的聊天机器人范式带来的结构性弊端,分析其对社会、经济、法律和环境系统的影响,并提出替代的AI发展方向。
Comments Accepted at The 2026 ACM Conference on Fairness, Accountability, and Transparency, June 25--28, 2026, Montreal, QC, Canada