Agile Deliberation: Concept Deliberation for Subjective Visual Classification
敏捷协商:主观视觉分类的概念协商
机构 * Google Research(谷歌研究院) ; University of Washington(华盛顿大学)
AI总结 本文提出敏捷协商框架,通过迭代协商提升视觉分类的主观概念理解,实验表明其在F1得分和认知效率上优于传统方法。
Journal ref CVPR 2026
高校专区
敏捷协商:主观视觉分类的概念协商
机构 * Google Research(谷歌研究院) ; University of Washington(华盛顿大学)
AI总结 本文提出敏捷协商框架,通过迭代协商提升视觉分类的主观概念理解,实验表明其在F1得分和认知效率上优于传统方法。
Journal ref CVPR 2026
SoSBench:在六个科学领域中对安全对齐进行基准测试
机构 * University of Washington(华盛顿大学) ; University of Georgia(佐治亚大学) ; WWU(西华盛顿大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校)
AI总结 SoSBench针对高风险科学领域设计,通过3000个基于真实法规的提示评估大模型的安全性,揭示了先进模型在处理危险场景时存在严重的安全对齐缺陷。
Comments Project Page: https://sosbench.github.io/; ICLR 2026
基于黑盒视觉提示的模型鲁棒适应
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; University of Seoul(首尔市立大学) ; Yonsei University(延世大学) ; University of Washington(华盛顿大学)
AI总结 本文提出BlackVIP方法,通过协调器和SPSA-GC组件实现无需模型参数的PTM适应,通过实验展示其在不同领域和任务中的鲁棒性,同时提供理论分析支持视觉提示方法的鲁棒性。
Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI) 2026
基于Wasserstein自编码器和三角传输的条件采样
机构 * Department of Aeronautics & Astronautics, University of Washington, Seattle(华盛顿大学西雅图分校航空与航天系) ; Department of Applied Mathematics, University of Washington, Seattle(华盛顿大学西雅图分校应用数学系) ; Department of Mathematics, University of Washington, Seattle(华盛顿大学西雅图分校数学系)
AI总结 本文提出条件Wasserstein自编码器(CWAEs),通过利用条件和条件变量中的低维结构进行条件模拟。核心思想是修改Wasserstein自编码器以使用三角形解码器并施加适当的潜在变量独立性假设。
Comments 8 pages, 5 figures
会听、会说、会玩的玩具:理解儿童对AI玩具的感知与互动
机构 * University of Washington(华盛顿大学) ; Rutgers University(罗格斯大学)
AI总结 研究探讨儿童与AI玩具互动时对边界、自主性与关系的理解,通过参与式设计发现儿童对玩具充满好奇,但频繁互动失败和智能与玩具形式的不匹配导致对抗性游戏,提出透明、适龄、负责任的设计建议。
AgenticRed:为红队测试设计的进化系统
机构 * University of Washington(华盛顿大学) ; Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)
AI总结 AgenticRed通过进化算法自动设计红队系统,无需人工干预,显著提升攻击成功率,达到96%-100%的ASR。
Comments Website: https://yuanjiayiy.github.io/AgenticRed/
CQA-Eval: 设计在资源受限情况下多段临床问答系统可靠评估
机构 * Cornell University(康奈尔大学) ; University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学)
AI总结 本文提出CQA-Eval框架,通过医生标注300个真实患者问题,比较粗粒度答案级与细粒度句子级评估在正确性、相关性和风险披露维度上的效果,发现细粒度标注提升正确性一致性,粗粒度提升相关性一致性,而风险披露判断仍不一致,且少量标注可提供与粗标注相当的可靠性。
ARMOR:通过自适应矩阵分解实现高性能半结构化剪枝
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; University of Washington(华盛顿大学) ; Princeton University(普林斯顿大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 ARMOR通过自适应矩阵分解技术,实现高效的半结构化剪枝,保留模型质量的同时提升压缩效率和任务准确性。
Comments ICLR 2026, code: https://github.com/LawrenceRLiu/ARMOR
Molmo2:具有视频理解和 grounding 的开放权重和数据的视觉语言模型
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
AI总结 Molmo2 是一种开放源代码的视频语言模型,通过7个新视频数据集和2个多图像数据集,实现了单图像、多图像和视频任务中的点驱动 grounding 能力,其8B模型在短视频计数和描述任务中表现优异,在视频 grounding 任务中超越了现有开源和专有模型。
Comments Updated first authors
基于角色的LLM框架用于从健康食品政策中提取结构化信息
机构 * University of Washington(华盛顿大学) ; Shanghai University(上海大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出基于角色的LLM框架,通过分配专门角色提升健康食品政策信息提取的准确性与透明度,对比零样本、少样本和推理链基线,展现更优的复杂推理能力。
因果最优耦合用于高斯输入输出分布数据
机构 * University of Washington(华盛顿大学)
AI总结 本文研究了在因果动力系统生成的分布数据中寻找最优耦合问题,通过Schrödinger Bridge方法结合Kullback-Leibler散度约束和因果约束,提出高斯边际下二次成本函数的可计算解法。
通过多样重置和大规模强化学习实现涌现的灵巧性
机构 * University of Washington(华盛顿大学) ; NVIDIA(英伟达) ; Microsoft Research(微软研究院)
AI总结 本文提出OmniReset框架,通过模拟器重置和固定超参数,实现单奖励函数解决广泛灵巧操作任务,提升鲁棒性和扩展性。
RPNT:鲁棒预训练神经变换器——通用运动解码的路径
机构 * University of Washington(华盛顿大学) ; Washington National Primate Research Center(华盛顿国家灵长类研究中心)
AI总结 本文提出RPNT模型,通过预训练实现鲁棒泛化,提升多任务、多主体和多会话的运动解码性能。
利用推理LLM审查科学论文中的关键问题:基线方法与自动评估
机构 * University of Washington(华盛顿大学)
AI总结 本文提出利用推理LLM作为论文质量检查器,介绍基线方法和自动评估框架,通过arXiv论文验证方法,并评估其在识别科学论文关键错误中的性能。
Comments Accepted and presented at NeurIPS 2025 AI for Science Workshop
用单调效用函数建模多目标权衡
机构 * Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Arizona State University(亚利桑那州立大学)
AI总结 本文提出一种两步方法,通过单调效用函数生成符合用户偏好的紧凑帕累托最优解集,验证了其在多个领域中的有效性。
Comments The 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)
利用大型语言模型检测科学文献中的参考错误
机构 * University of Washington(华盛顿大学)
AI总结 本文研究了大型语言模型在检测科学论文中引用错误的能力,通过专家标注的数据集验证了模型在有限上下文和无微调情况下的检测效果,为人工智能辅助科学写作提供了新思路。
Journal ref AMIA Annu Symp Proc. 2025 May 22;2024:1549-1556. PMID: 41726520; PMCID: PMC12919499
从短时间序列中利用浅层递归解码器进行潜在相位推断(LAPIS-SHRED)
机构 * University of Washington(华盛顿大学) ; Autodesk Research(欧特克研究院)
AI总结 本文提出LAPIS-SHRED,通过三阶段流程从稀疏传感器观测中重建和预测完整的时空动态,支持双向推断和多尺度重建,适用于观测受限的运营环境。
ProTPS:基于原型的文本提示选择用于持续学习
机构 * University of Washington(华盛顿大学) ; Alaska Pacific University(阿拉斯加太平洋大学)
AI总结 ProTPS通过学习类特定的视觉原型和文本提示,减少新旧类别的语义重叠,从而缓解灾难性遗忘问题,在连续学习任务中表现出色。
主动代理研究环境:模拟活跃用户以评估主动助手
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; Apple, USA(苹果公司(美国)) ; University of Washington(华盛顿大学) ; Independent Researcher, USA(独立研究员(美国))
AI总结 本文提出Pare框架,通过状态机模拟用户交互,构建并评估主动代理,同时引入Pare-Bench基准测试143种不同任务,测试上下文感知、目标推理和多应用协调能力。
Comments 34 pages, 8 figures, 5 tables
Agent Q-Mix: 通过强化学习选择LLM多智能体系统的合适动作
机构 * University of California Los Angeles(加州大学洛杉矶分校) ; University of Washington(华盛顿大学) ; Northwestern University(西北大学)
AI总结 本文提出Agent Q-Mix框架,通过强化学习解决多智能体系统中拓扑选择问题,实现去中心化通信决策,提升任务准确率与token效率。
CayleyPy增长:高效增长计算和数百个关于Cayley图的新猜想(简版)
机构 * Institut Curie, CNRS UMR168, Paris, France(居里研究所,法国国家科学研究中心UMR168,法国巴黎) ; University of Washington(华盛顿大学) ; Three Gorges Mathematical Research Center, China Three Gorges University(三峡数学研究中心,三峡大学) ; Sobolev Institute of Mathematics(索博列夫数学研究所) ; Novosibirsk State University(新西伯利亚国立大学) ; Independent Researcher(独立研究员) ; Moscow State University(莫斯科国立大学) ; Kazakh-British Technical University(哈萨克-英国技术大学) ; Neapolis University Pafos, Cyprus(尼阿波利斯大学帕福斯校区,塞浦路斯) ; City St George's, University of London(伦敦大学城市圣乔治学院) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; ITMO University(ITMO大学) ; Moscow Center for Advanced Studies(莫斯科高等研究中心) ; National Research University Higher School of Economics(国立研究大学高等经济学院) ; Ariel University(阿里埃勒大学) ; Saint-Petersburg Pasteur Institute(圣彼得堡巴斯德研究所) ; Criteo AI Lab, Berlin, Germany(Criteo人工智能实验室,德国柏林) ; University of Bologna(博洛尼亚大学) ; Faculty of Bioengineering and Bioinformatics, Lomonosov Moscow State University(莫斯科国立大学生物工程与生物信息学系) ; Researcher at Banner Stat(Banner Stat研究员) ; MIREA — Russian Technological University(MIREA — 俄罗斯技术大学) ; Research Center of the Artificial Intelligence Institute, Innopolis University(因诺波利斯大学人工智能研究所研究中心) ; Inpdependent Researcher(独立研究员) ; LIX, Ecole Polytechnique/CNRS, IP Paris(LIX,巴黎综合理工学院/法国国家科学研究中心,巴黎理工学院)
AI总结 CayleyPy项目利用人工智能解决群论问题,实现了高效Cayley图和Schreier图计算,并提出200多个新猜想,包括直径和增长的多项式公式及改进的Babai猜想。
Comments 46 pages, 30 figures; v2: typos fixed
密集动态感知奖励合成:整合先验经验与演示
机构 * University of Texas at Austin, USA(德克萨斯大学奥斯汀分校) ; University of Washington, USA(华盛顿大学)
AI总结 本文提出一种系统化的奖励塑造框架,结合先验数据集和少量专家演示,生成密集动态感知奖励,加速连续控制任务的学习。
半自动化的Vlasov-Maxwell-Landau平衡形式化
机构 * University of Washington(华盛顿大学)
AI总结 本文展示了一个完整的Lean 4形式化,用于Vlasov-Maxwell-Landau系统中的平衡特性描述,通过AI辅助数学研究流程,结合AI推理模型、编码工具和专业证明器,实现了高效的形式化验证。
Comments 11 figures
Science-T2I: 解决图像合成中的科学幻觉
机构 * New York University(纽约大学) ; University of Washington(华盛顿大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of California, San Diego(加利福尼亚大学圣迭戈分校)
AI总结 本文提出ScienceT2I数据集,评估18种图像生成模型,发现科学提示能显著提升生成效果,提出SciScore奖励模型和两阶段对齐框架提升科学推理能力。
Comments Accepted to CVPR 2025. Code, docs, weight, benchmark and training data are all avaliable at https://jialuo-li.github.io/Science-T2I-Web
自适应延迟更新循环算法用于变分不等式
机构 * Paul G. Allen School of Computer Science and Engineering, University of Washington(华盛顿大学保罗·G·艾伦计算机科学与工程学院) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系)
AI总结 本文提出自适应延迟更新循环算法(ADUCA),用于求解广义Minty变分不等式,无需全局或块级Lipschitz常数,具有近最优全局Oracle复杂度。
语言模型中理论思维与自我归因的意识能力是可分离的
机构 * Google, Paradigms of Intelligence Team(Google,智能范式团队) ; Knowledge Lab, University of Chicago(芝加哥大学知识实验室) ; Institute of Philosophy, School of Advanced Study, University of London(伦敦大学高等研究院哲学研究所) ; Department of Biomedical Informatics and Medical Education and Department of Bioethics and Humanities, School of Medicine, University of Washington(华盛顿大学医学院生物医学信息学与医学教育系及生物伦理学与人文学系) ; Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) ; Santa Fe Institute(圣塔菲研究所)
AI总结 研究发现,抑制语言模型的意识归因倾向不会影响其理论思维能力,但会降低其对非人类动物的归因和精神信念。
MindCube:从有限视角构建空间心理模型
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学) ; University of Washington(华盛顿大学)
AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。
Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results
生成式AI在金属有机框架设计与合成中的崛起
机构 * Deep Principle, Inc.(Deep Principle公司) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Washington University(华盛顿大学) ; Institute of Materials Science & Engineering, Washington University(华盛顿大学材料科学与工程研究所) ; Massachusetts Institute of Technology(麻省理工学院) ; Cornell University(康奈尔大学) ; University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Acceleration Consortium, University of Toronto(多伦多大学加速联盟) ; University of Washington(华盛顿大学) ; University of North Texas(北德克萨斯大学) ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Canadian Institute for Advanced Research(加拿大高等研究院) ; NVIDIA(英伟达)
AI总结 生成式AI推动金属有机框架设计方法革新,通过自主提出并合成新型多孔结构,结合高通量计算筛选和自动化实验,形成加速发现闭环流程,提升清洁空气和能源应用材料性能。
Comments 10 pages, 5 figures
Journal ref Matter (2026)
FeDMRA: 联邦增量学习中的动态记忆回放分配
机构 * Huazhong University of Science and Technology(华中科技大学) ; University of Washington(华盛顿大学)
AI总结 本文提出动态内存分配策略,以应对联邦医疗系统中非独立同分布数据带来的挑战,通过合理分配存储资源提升模型性能。
MolmoPoint:通过接地标记提升VLMs的指针能力
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学)
AI总结 本文提出MolmoPoint,通过直接选择包含目标概念的视觉标记来改进VLMs的指针机制,提升图像、GUI和视频指针任务性能,并提高样本效率。