Revisiting Greedy Decoding for Visual Question Answering: A Calibration Perspective
重新审视视觉问答中的贪婪解码:一种校准视角
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; MBZUAI(穆桑比克人工智能研究所)
AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。
高校专区
重新审视视觉问答中的贪婪解码:一种校准视角
机构 * ETH Zurich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学) ; MBZUAI(穆桑比克人工智能研究所)
AI总结 针对视觉问答任务,从校准角度理论证明贪婪解码优于随机采样,并提出适用于推理模型的贪婪解码方法,实验验证其有效性。
基于词典的跨语言语义投影生成概念词汇化
机构 * University of Toronto(多伦多大学)
AI总结 提出一种通过语义投影将英语WordNet概念扩展到新语言的方法,利用双语词典增强对齐并过滤错误投影,在多个语言上提升了精度且保持可解释性和资源效率。
Comments Paper presented at Canadian AI 2026
通过具有丰富化学先验的软约束GFlowNets生成可合成分子
机构 * University of Toronto(多伦多大学) ; DeepMind(深度思维) ; University of Montreal(蒙特利尔大学)
AI总结 提出S3-GFN方法,通过软正则化序列GFlowNet,利用大规模SMILES语料库的化学先验,生成高奖励且可合成的分子,实验表明可合成率≥95%。
梯度引导的最远点采样用于鲁棒训练集选择
机构 * Berlin Institute for the Foundations of Learning(柏林学习与数据基础研究院) ; Chemical Physics Theory Group, Department of Chemistry, University of Toronto, St. George Campus, Toronto, ON, Canada(化学物理理论组,化学系,多伦多大学圣乔治校区,多伦多,ON,加拿大) ; Department of Materials Science and Engineering, University of Toronto, St. George Campus, Toronto, ON, Canada(材料科学与工程系,多伦多大学圣乔治校区,多伦多,ON,加拿大) ; Vector Institute for Artificial Intelligence, Toronto, ON, Canada(人工智能研究所,多伦多,ON,加拿大) ; Department of Physics, University of Toronto, St. George Campus, Toronto, ON, Canada(物理系,多伦多大学圣乔治校区,多伦多,ON,加拿大) ; Acceleration Consortium, University of Toronto, Toronto, ON, Canada(加速联盟,多伦多大学,多伦多,ON,加拿大)
AI总结 提出梯度引导最远点采样(GGFPS),利用分子力范数指导构型空间采样,在MD17数据集上相比FPS和随机采样显著提升数据效率和模型鲁棒性。
Comments 41 pages, 43 figures, 2 algorithms; journal article with supplementary information appended
Journal ref Machine Learning: Science and Technology 7, 035047 (2026)
学习承诺:通过学习异步解码扩展语言模型解码并行性
机构 * DeepMind, London, UK(深度思维公司,伦敦,英国) ; Google Research, New York, NY, USA(谷歌研究院,纽约,纽约州,美国) ; Stanford University, Stanford, CA, USA(斯坦福大学,斯坦福,加利福尼亚州,美国) ; University of Toronto, Toronto, Ontario, Canada(多伦多大学,多伦多,安大略省,加拿大) ; University of Washington, Seattle, WA, USA(华盛顿大学,西雅图,华盛顿州,美国)
AI总结 本文提出PASTA系统,通过学习使语言模型识别语义独立性,提升解码并行性,实验证明在解码速度和响应质量上优于现有方法。
Comments 15 pages
Journal ref Proceedings of the 42nd International Conference on Machine Learning (ICML), PMLR 267:27941-27956, 2025
PaperMentor:面向Overleaf的AI研究论文写作人本多智能体辅导系统
机构 * CMU(卡内基梅隆大学) ; Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) ; EuroSafeAI ; ETHZ(苏黎世联邦理工学院) ; EPFL(洛桑联邦理工学院) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所,德国图宾根)
AI总结 提出PaperMentor,一种在Overleaf中提供内联建议的人本写作助手,通过专家技能库和12个专业智能体提供可操作反馈,用户研究中90.6%建议被认为可操作。
Comments Accepted to the ACL 2026 Demo Track
测试黑箱:面向消费者的健康大语言模型独立评估的结构性障碍
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Johns Hopkins University(约翰霍普金斯大学) ; University of California, Berkeley(加州大学伯克利分校) ; Toronto General Hospital, University Health Network(多伦多综合医院,大学健康网络) ; McGill University(麦吉尔大学) ; University of Toronto(多伦多大学) ; Independent Researcher(独立研究者) ; Rutgers University(罗格斯大学) ; Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心) ; Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院)
AI总结 本研究通过模拟用户档案,测试面向消费者的健康大语言模型在响应变异和谄媚行为方面的表现,发现五大结构性障碍阻碍独立评估。
Comments 6 pages, 1 figure. Preprint submitted for review
张量化Engram:在N-gram嵌入中共享潜在变量对大型语言模型有益
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
AI总结 提出张量化Engram(TN-gram),通过CP分解共享因子压缩n-gram嵌入,减少参数并避免哈希冲突,在多个任务上匹配或超越现有方法。
基于Token级光学性质预条件的从头分子生成
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所) ; Universidad Autónoma de Madrid(马德里自治大学) ; Canadian Institute for Advanced Research (CIFAR)(加拿大高等研究院) ; NVIDIA(英伟达)
AI总结 针对OLED分子光学性质可控生成中数据稀缺和条件控制可靠性有限的问题,提出基于GPT2的Token条件自回归语言模型,通过离散属性Token和多任务优化实现垂直吸收能和振子强度的定向生成,并在TDDFT级别评估分布保真度和可控性。
CIFAR合成证据语料库:用于检测AI生成证据
机构 * University of Toronto(多伦多大学) ; University of Waterloo(滑铁卢大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Vector Institute(向量研究所) ; University of Ottawa(渥太华大学)
AI总结 针对司法系统中证据真实性检测缺乏合适数据集的问题,构建了包含多种文档类型和篡改策略的CIFAR合成证据语料库,支持在受控条件下评估证据验证系统。
物理约束生成的正确度量:后验一致PDE逆问题的共面积修正
机构 * University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
AI总结 针对扩散模型和流匹配在硬约束PDE逆问题中采样后验分布错误的问题,提出共面积修正因子和CoCoS采样器,实现正确的后验采样。
Crazyflow: 基于JAX的精确、GPU加速、可微分的无人机模拟器
机构 * Technical University of Munich(慕尼黑技术大学) ; University of Toronto(多伦多大学) ; Simon Fraser University(西蒙弗雷泽大学)
AI总结 提出Crazyflow模拟器,通过GPU加速和可微分设计,实现单机超高速仿真、数千架无人机集群模拟,并支持基于解析梯度的策略学习与采样避障,甚至能在0.38秒内从零训练飞行恢复策略。
Comments Fix minor metadata mistakes
面向目标的推理用于基于RAG的记忆在对话型代理LLM系统中
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所)
AI总结 本文提出Goal-Mem框架,通过目标导向的推理提升RAG记忆在复杂任务中的表现,尤其在多跳推理和隐含推理中效果显著。
扩散模型何时学会生成多个物体?
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 研究探讨了扩散模型在多物体生成中的局限性,发现场景复杂度比概念不平衡更关键,且低数据条件下计数任务更难学习。
Comments ICML2026
人工智能单一群体下的超竞争定价
机构 * Rotman School of Management, University of Toronto(多伦多大学罗特曼管理学院)
AI总结 本文研究了在共享AI模型下,竞争卖家委托定价时可能产生的超竞争定价问题,通过双寡头模型分析发现,AI模型的鲁棒性和可重复性配置可能导致超竞争定价现象,且市场结果取决于初始定价倾向。
Comments 46 pages
通过任务复杂度操作化浅层对齐假设
机构 * University of Maryland(马里兰大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Edinburgh(爱丁堡大学)
AI总结 提出任务复杂度指标(达到目标性能的最短程序长度)来量化浅层对齐假设,实验表明预训练大幅降低任务复杂度,而微调可将复杂度降低数个数量级。
Comments ICML 2026
GimmBO: 基于贝叶斯优化的交互式生成图像模型合并
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
AI总结 针对扩散模型适配器合并中权重选择困难的问题,提出GimmBO框架,利用偏好贝叶斯优化实现交互式探索,通过两阶段BO后端提升高维空间采样效率与收敛性。
Comments Accepted at SIGGRAPH NA 2026
从语言反馈中学习的形式化与可证明保证
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学)
AI总结 本文形式化语言反馈学习问题,提出转移埃尔泽维度刻画学习难度,并开发无遗憾算法HELiX,证明其性能保证,展示丰富语言反馈可指数级加速学习。
Comments ICML 2026
一种通用的3D框架和模型用于医学影像中的自监督学习
机构 * Department of Medical Biophysics, University of Toronto(多伦多大学医学生物物理学系) ; Department of Computer Science, University of Toronto(多伦多大学计算机科学系) ; Institute for Aerospace Studies, University of Toronto(多伦多大学航空航天研究所) ; Physical Sciences Platform, Sunnybrook Research Institute(圣母医院研究学院物理科学平台) ; Vector Institute, Toronto(多伦多向量研究所) ; Department of Laboratory Medicine and Pathobiology, University of Toronto(多伦多大学实验室医学与病理学系) ; Hurvitz Brain Sciences, Sunnybrook Health Sciences Centre(圣母医院健康科学中心Hurvitz脑科学) ; Harquail Centre for Neuromodulation, Sunnybrook Health Sciences Centre(圣母医院健康科学中心Harquail神经调制中心)
AI总结 本文提出3DINO方法,基于大规模多模态数据集预训练出通用医学影像模型3DINO-ViT,验证其在多种医学影像分割和分类任务中的泛化能力,优于现有方法。
Comments Published in npj Digital Medicine
训练任务多样性对上下文学习的影响:基于低维子空间的视角
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
AI总结 本文通过低秩高斯混合模型分析训练任务多样性(由子空间非重叠列数定义)如何提升线性注意力上下文学习的泛化与优化,解释训练多样性缩短学习平台期及实现分布外泛化的现象,并扩展至非线性场景。
量化25年警务相关死亡新闻报道中的媒体表征动态
机构 * University of Toronto(多伦多大学) ; University of British Columbia(不列颠哥伦比亚大学)
AI总结 通过分析25年间4000篇加拿大新闻报道,提出PerspectiveGap模型,发现国家官僚视角出现频率是公众视角的近三倍,且近年来平民代表有所增加。
Comments 9 pages, 6 figures. Websci'26
Journal ref Proceedings of the 18th ACM Web Science Conference 2026 (pp. 421-429)
Symb-xMIL: 数字病理学中多实例学习的符号解释
机构 * Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院) ; Machine Learning Group, Technische Universität Berlin(柏林技术大学机器学习组) ; Institute of Pathology, Charité Universitätsmedizin(查理研究所病理学部) ; Berlin Institute of Health at Charité – Universitätsmedizin Berlin, BIH Biomedical Innovation Academy, BIH Charité Digital Clinician Scientist Program(柏林查理医学研究院健康研究所、BIH生物医学创新学院、BIH查理数字临床科学家项目) ; Institute of Pathology, Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学病理学部) ; Division of Translational Medical Oncology, DKFZ(转化医学肿瘤学部,德国有机化学研究所) ; German Cancer Consortium (DKTK), partner site Munich, a partnership between DKFZ and Ludwig-Maximilians-Universität München (LMU)(德国癌症联盟(DKTK),慕尼黑合作伙伴站点,由DKFZ和路德维希-马克西米利安-慕尼黑大学(LMU)组成) ; Department of Artificial Intelligence, Korea University(韩国大学人工智能系) ; Max-Planck Institute for Informatics, Saarbrücken, Germany(马克斯·普朗克信息学院,萨尔布吕肯,德国) ; Department of Chemistry, Chemical Physics Theory Group, University of Toronto(多伦多大学化学系,化学物理理论组) ; Vector Institute for Artificial Intelligence, Toronto, Canada(多伦多人工智能矢量研究所) ; Acceleration Consortium, University of Toronto(多伦多大学加速联盟)
AI总结 提出Symb-xMIL框架,通过量化模型行为与可读决策规则(逻辑关系)的对齐程度,为多实例学习提供结构化的符号解释,并在合成和真实病理数据上验证其有效性。
Comments 23 pages, 18 figures
基于结构化步态-语言表示的LLM条件病理步态合成
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学) ; MIT Media Lab(麻省理工学院媒体实验室)
AI总结 提出一种多模态LLM引导框架,通过结构化文本描述合成病理步态3D数据,利用运动标记化、病理感知语言条件、LLM语义增强和语言到步态生成,改善下游分类性能。
Comments Accepted at CVPR MOMA Workshop 2026 and selected for spotlight presentation at the workshop
宽带高光谱3D成像:使用色散结构光
机构 * POSTECH South Korea(POSTECH韩国) ; University of Hyogo Japan(日本广岛大学) ; University of Toronto Canada(加拿大多伦多大学)
AI总结 提出一种基于单光谱仪的宽带高光谱3D成像方法,通过可见光和SWIR相机立体设置,利用色散结构光同时重建密集宽带高光谱反射率和精确3D几何,解决了传统方法光谱范围窄、系统复杂的问题。
因果关系是理解和平衡可信机器学习与基础模型中多个目标的关键
机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) ; Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所(图宾根)) ; Google Research(谷歌研究) ; ETH Zürich(苏黎世联邦理工学院) ; University of Toronto(多伦多大学)
AI总结 本文主张将因果方法集成到机器学习中,以平衡公平性、隐私、鲁棒性、准确性和可解释性等可信原则之间的权衡,并探讨其在基础模型中的实际应用。
增强视频表示中的时空语义残差以缓解视频大型多模态模型中的幻觉
机构 * Zhejiang University(浙江大学) ; University of Toronto(多伦多大学) ; Dalian University of Technology(大连理工大学) ; Sun Yat-sen University(中山大学)
AI总结 提出ViSSRes方法,通过轻量级MLP网络学习视频表示的残差,从时空和语义一致性优化,在推理时仅需单次前向传播,有效降低幻觉率并提升视频理解性能。
Comments Preprint
寻找隐式推理的最小参数预算:一种基于数据复杂度的语言模型缩放定律
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学) ; University of Toronto(多伦多大学) ; University of Tokyo(东京大学)
AI总结 本文通过控制合成环境中的预训练实验,发现语言模型隐式推理所需的最小参数预算与图搜索熵之间存在缩放定律,并确定了每参数最多可处理约0.008比特信息的容量上限。
Comments Accepted to ICML 2026
Goedel-Architect: 通过蓝图生成与精炼简化形式定理证明
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Toronto(多伦多大学) ; National University of Singapore(新加坡国立大学) ; University of Tokyo(东京大学) ; University of Washington(华盛顿大学)
AI总结 提出Goedel-Architect框架,通过生成和精炼依赖图蓝图,结合Lean 4证明器并行证明引理,在多个基准测试上达到开源最优性能。
TAM: 用于鲁棒操作运动传递的扭矩自适应模块
机构 * KAIST(韩国科学技术院) ; Allen Institute for AI(人工智能研究院) ; University of Toronto(多伦多大学) ; University of Washington(华盛顿大学)
AI总结 提出扭矩自适应模块(TAM),通过历史编码器和扭矩适配器修正扭矩指令,实现不同机器人或负载间的运动传递,无需领域随机化或重新收集数据。
学习流形与伊藤动力学:分支神经粗糙微分方程
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Toronto(多伦多大学)
AI总结 提出分支神经粗糙微分方程(B-NRDE),通过Hopf代数框架统一处理欧几里得伊藤动力学、流形上的有序协变导数及经典Stratonovich情形,实现精确的粗步流形约束动力学和伊藤一致律匹配。
Comments Accepted at ICML 2026