When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion
当可验证奖励的强化学习缩小推理边界时:诊断Pass@k反转
机构 * Harvard University(哈佛大学)
AI总结 研究RLVR中的Pass@k反转问题,提出双模式解释和PBA方法,通过实验表明PBA能提升\PassK{1}和覆盖率,诊断出普通GRPO丢失基础可解决提示,而PBA保留罕见阳性轨迹,强调训练后推理要兼顾优化强度与提示安全性。
高校专区
当可验证奖励的强化学习缩小推理边界时:诊断Pass@k反转
机构 * Harvard University(哈佛大学)
AI总结 研究RLVR中的Pass@k反转问题,提出双模式解释和PBA方法,通过实验表明PBA能提升\PassK{1}和覆盖率,诊断出普通GRPO丢失基础可解决提示,而PBA保留罕见阳性轨迹,强调训练后推理要兼顾优化强度与提示安全性。
JAXBench:自主TPU内核优化基准测试
机构 * Harvard University(哈佛大学) ; Google(谷歌公司) ; UC Berkeley(加州大学伯克利分校) ; Google DeepMind(谷歌DeepMind)
AI总结 该研究针对TPU缺乏内核优化基准测试的问题,提出JAXBench套件,包含多个工作负载和算子。通过评估四种反馈驱动方法,发现特定上下文对优化更关键,条件设定和搜索结构能提升性能,最后发布相关基准测试等支持开源。
SIINR:用于临床质量扩散MRI数据集超分辨率及不确定性量化的结构信息隐式神经表示
机构 * Eindhoven University of Technology(埃因霍温理工大学) ; University of South Carolina(南卡罗来纳大学) ; Brigham and Women’s Hospital, Harvard Medical School(布莱根妇女医院,哈佛医学院)
AI总结 针对临床dMRI数据集平面外分辨率低的问题,提出SIINR框架,利用监督3D U-net和自监督INR结合,实现超分辨率及不确定性量化,在多数据集和临床病例实验中表现优异,为临床dMRI增强及指标解释提供方法。
Comments 27 pages, 8 figures, 2 tables
用于统一世界建模的掩码视觉动作
机构 * Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; Harvard University(哈佛大学)
AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。
Comments Project webpage: https://masked-visual-actions.github.io
通过活动和误差几何实现条件直接反馈对齐
机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学坎普纳自然与人工智能研究所) ; Howard Hughes Medical Institute, Harvard Medical School(哈佛医学院霍华德·休斯医学研究所)
AI总结 研究直接反馈对齐(DFA)训练失败模式,通过分析各向异性进入局部权重更新的方式,提出条件DFA,经实验验证其在不同模型上有效,还介绍了归一化DFA家族及相关计算动机,强调是对局部外积规则失败的因子级研究。
可学习新奇性中的智能
机构 * Allen Discovery Center at Tufts University(塔夫茨大学艾伦发现中心) ; Wyss Institute for Biologically Inspired Engineering at Harvard University(哈佛大学威斯生物启发工程研究所)
AI总结 研究表明可学习新奇性产生智能不同投影,基于廉价可微储层计算机给出闭式估计器。此估计器无监督可恢复复杂度分类,作目标能推动神经细胞自动机发展,作奖励可提升强化学习智能体表现,让智能相关研究有了共同定量基础。
Comments 24 pages, 10 figures, 4 tables
CORAL:通过协同结合奖励学习淀粉样纤维配体对接
机构 * Center of Excellence for Generative AI, KAUST(沙特阿卜杜拉国王科技大学生成式人工智能卓越中心) ; MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室) ; Stern Laboratory, Brigham and Women’s Hospital, Harvard University(哈佛大学布莱根妇女医院斯特恩实验室)
AI总结 研究针对淀粉样纤维配体对接面临的挑战,提出CORAL强化学习框架,通过纳入协同配体 - 配体堆叠能量及蛋白质 - 配体对接亲和力训练模型,引入评估集,实验证明其在姿态质量和结合亲和力相关性上优于现有基线。
Comments 25 pages
限制前沿人工智能的国际协议:目标与退出
机构 * ETH Zürich, Zurich, Switzerland(苏黎世联邦理工学院) ; Harvard University, Cambridge, United States(哈佛大学) ; MATS Research, Berkeley, United States(MATS研究)
AI总结 研究限制人工智能发展的国际协议,通过调查现有协议,明确适当条件属性并列出可能条件,建议设定固定时间段,由新组织规定发展条件,特殊情况可退出,以此说明相关协议的考虑因素。
多任务学习中的容量与冗余权衡
机构 * Harvard Medical School(哈佛医学院)
AI总结 研究多任务学习中负迁移与容量、冗余的关系,通过容量 - 冗余恒等式及相关结果,如聚类差距分解和梯度 - TC 桥梁,证明聚类 LoRA 可降低残余耦合,优于随机划分,有显著收益。
Comments Accepted in 42nd Conference on Uncertainty in Artificial Intelligence (UAI) 2026
通过ATLAS揭示异构环境中的不变和可转移潜在因素
机构 * Harvard University(哈佛大学)
AI总结 研究异构环境下多环境因素模型,提出ATLAS方法,利用不变性原理和辅助标签监督,分离不变与异构因素,用于潜在因素回归,在新环境中实现可转移预测,还建立了相关非渐近误差界。
Comments 47 pages, 3 figures
DINE:距离并不够——学习用于鲁棒软组织点云配准的全局变形先验
机构 * Mannheim Institute for Intelligent Systems in Medicine (MIISM), Medical Faculty Mannheim, Heidelberg University(曼海姆医学智能系统研究所(MIISM),海德堡大学曼海姆医学院) ; Department of Radiation Oncology, Brigham and Women’s Hospital, Dana-Farber Cancer Institute, Harvard Medical School(布莱根妇女医院放射肿瘤学系,达纳-法伯癌症研究所,哈佛医学院) ; Department of Otorhinolaryngology, Head and Neck Surgery, University Medical Center Mannheim, Medical Faculty Mannheim, Heidelberg University(海德堡大学曼海姆医学院曼海姆大学医学中心耳鼻咽喉头颈外科) ; Department of Otolaryngology, Head and Neck Surgery, Campus Klinikum Bielefeld Mitte, University Hospital OWL of Bielefeld University(比勒费尔德大学OWL大学医院比勒费尔德市中心校区耳鼻咽喉头颈外科) ; Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University(海德堡大学跨学科科学计算中心(IWR)) ; Central Institute for Computer Engineering (ZITI), Heidelberg University(海德堡大学中央计算机工程研究所(ZITI)) ; CZS Heidelberg Center for Model-Based AI, Heidelberg University(海德堡大学CZS基于模型的人工智能中心)
AI总结 研究针对软组织点云配准中对应估计难题,提出DINE框架,通过学习统计先验增强基于距离的配准,应用于两个主干并采用两阶段策略,实验表明其能降低平均倒角距离,提高对变形和噪声的鲁棒性,凸显全局变形合理性的重要性。
诱导情绪会影响大语言模型在序列决策中的行为吗?
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Texas A&M University(德州农工大学) ; National University of Singapore(新加坡国立大学) ; UCLA(加州大学洛杉矶分校) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mass General Hospital(麻省总医院) ; Harvard Medical School(哈佛医学院)
AI总结 研究探讨诱导情绪对大语言模型在序列决策中行为的影响,采用爱荷华赌博任务结合情绪诱导程序,发现诱导情绪平均不显著影响其决策动态,但愤怒有条件地影响决策,揭示了与人类行为的差异,为相关研究提供工具。
领域感知缩放定律揭示数据协同效应
机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) ; Microsoft Research(微软研究院) ; Harvard University(哈佛大学)
AI总结 研究语言模型预训练中的数据协同效应,利用开放权重语言模型的观测变化估计领域间协同效应,其框架提高预测精度,恢复稳定估计,经训练模型验证能正确预测性能排名。
用于多任务块推的单扩散策略控制器,具有零样本模拟到现实转移
机构 * Harvard University(哈佛大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究旨在用强化学习从零训练单扩散策略用于多任务块推,提出含简单策略损失函数的框架,结合反向课程生成等应对探索挑战,评估其在不同条件下零样本从模拟到现实的转移能力,证明该流程有效。
Comments 8 pages, 7 figures
MAC-Splat:用于高保真稀疏视图重建的多属性一致性
机构 * Xidian University(西安电子科技大学) ; Harvard University(哈佛大学) ; Nanyang Technological University(南洋理工大学) ; City University of Hong Kong(香港城市大学) ; Xi’an Jiaotong University(西安交通大学)
AI总结 针对稀疏视图重建中现有方法存在几何伪影的问题,提出MAC-Splat训练框架,利用MASt3R和DINOv3获取2D对应关系并定义MAC损失,联合正则化3D属性,实验证明该方法能有效解决不适定的稀疏视图重建问题,性能优于基线。
Comments Accepted to the European Conference on Computer Vision (ECCV 2026)
检测人工智能生成的视频:视觉-语言双视角综述
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) ; Harvard University(哈佛大学)
AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。
Comments 51 pages, accepted by ACL 2026
Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255
有状态世界,无状态弹性:交互式世界模型的精确状态服务
机构 * Harvard University(哈佛大学) ; Independent Researcher(独立研究者)
AI总结 研究交互式世界模型精确状态服务中的调度问题,提出 WorldMove 方法,能快速迁移缓存且保证位相同,通过可接受性条件等解决调度难题,实现跨传输和验证的联合调度,提升集群可调度性。
Comments 20 pages. Extended version
我们准备好迎接人工智能驱动的发现了吗?在下一次基础物理学突破之前进行人工智能验证
机构 * NSF AI Institute for Artificial Intelligence and Fundamental Interactions(NSF人工智能与基本相互作用研究院) ; MIT Laboratory for Nuclear Science(MIT核科学实验室) ; School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) ; Nagoya University(名古屋大学) ; Technical University Munich(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
AI总结 探讨在基础物理学中,随着机器学习日益自主,确保其可靠性至关重要。通过VERaiPHY计划框架,结合统计发现工作流程确定验证时机,强调归纳偏差等局限,思考物理学家角色,以实现机器学习在物理学中负责任的整合。
DETRAM:人类网格的端到端检测、跟踪与恢复
机构 * Harvard University(哈佛大学) ; NVIDIA(英伟达) ; Nanyang Technological University(南洋理工大学)
AI总结 研究针对多人场景下人类网格恢复难题,提出DETRAM统一框架,利用单个变压器解码器及可学习查询嵌入,能自动和依用户提示检测、重建与跟踪人类,在多数据集上取得领先跟踪结果及有竞争力的重建精度,实现端到端可训练的用户导向人体分析。
用于开放词汇量内镜组合式指称分割的属性检索
机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) ; King’s College London(伦敦国王学院) ; University at Buffalo(纽约州立大学布法罗分校) ; Harvard Medical School(哈佛医学院)
AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。
理解模型大小插值中的层修补
机构 * Harvard University(哈佛大学) ; Kempner Institute(肯普纳研究所) ; IST Austria(奥地利科学技术研究所)
AI总结 研究零样本模型大小插值中如何选择学生层,将其转化为优化问题并证明可看作无环图最短路径问题。通过实验揭示修补对插值行为的影响,介绍KLPatch算法,为模型大小插值提供理解与实用指导。
Comments 10 pages, 5 figures
非对称焦点损失改进药物-药物相互作用的图神经网络预测
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Harvard Medical School(哈佛医学院)
AI总结 研究针对图神经网络预测药物-药物相互作用时标准训练方法的不足,提出将临床焦点损失集成到关系感知图卷积网络中,显著提升了预测的准确率、F1分数等指标,证明损失函数设计对改进基于图的DDI预测有重要作用。
序列相关性改变上下文学习:有效上下文长度与架构失配
机构 * John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) ; Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究所) ; Society of Fellows and Center for Brain Science, Harvard University(哈佛大学 fellows 会与脑科学中心)
AI总结 针对现有ICL理论多聚焦独立样本提示的局限,研究序列关联数据下的ICL特性,基于线性注意力构建可解模型,发现关联提示会改变ICL有效样本量及最优适配注意力架构。
TREK:蒸馏以探索,强化以优化
机构 * LinkedIn Corporation(领英公司) ; Harvard University(哈佛大学) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 针对GRPO在学生策略覆盖外的难提示样本上失效问题,提出TREK方法,通过蒸馏扩展探索空间再结合GRPO优化,在多推理与智能体任务上大幅提升模型性能。
Comments 18 pages, 3 figures, 6 tables
形式化迪斯科:可扩展的形式化验证程序的开放式生成
机构 * Kempner Institute, Harvard University(坎普纳研究所,哈佛大学) ; School of Engineering and Applied Sciences, Harvard University(工程与应用科学学院,哈佛大学)
AI总结 针对生成程序质量保证落后及形式验证数据稀缺问题,提出Formal Disco分布式系统,协调三类工人,记录痕迹用于改进,提出最大熵原则,发布数据集并微调模型,为形式推理领域大规模创建合成数据。
Comments Code: https://github.com/metareflection/formal-disco Datasets: https://huggingface.co/collections/metareflection/formal-disco
DynaVieW:用于理解分层视觉动态的模式引导世界建模
机构 * EPFL, Switzerland(瑞士联邦理工学院) ; Harvard University(哈佛大学) ; Sony Group Corporation(索尼集团) ; ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)
AI总结 针对多模态语言模型难以系统建模视频视觉场景时间演变的问题,提出DynaVieW模型,通过学习交错状态转换序列理解视觉动态,在多架构下联合建模,提升下游视觉叙事创作等任务表现。
Comments ICML 2026
解读点之间的信息:解码跨填充令牌的隐藏计算
机构 * Harvard University(哈佛大学) ; Cambridge Boston Alignment Initiative(剑桥波士顿对齐计划) ; Massachusetts Institute of Technology(麻省理工学院) ; Anthropic
AI总结 研究前沿语言模型对无内容填充令牌的隐藏计算,通过分析两个前沿模型在四个任务家族中的表现,介绍无监督解码管道,能从隐藏状态恢复中间值,证明隐藏计算可从残差流读取。
Comments Accepted to ICML 2026 Mech Interp Workshop, 10 main paper pages, 20 appendix pages
MLSYSIM:用于机器学习系统的第一性原理基础设施建模
机构 * Harvard University(哈佛大学)
AI总结 研究机器学习系统基础设施建模问题,提出MLSYSIM框架,基于供需抽象,通过可组合模型和求解器,实现亚秒级设计空间探索,确定约束并合成硬件规格。
人工智能时代美国超大规模数据中心隐藏的水地理情况
机构 * Harvard University(哈佛大学)
AI总结 研究美国超大规模数据中心用水路径,通过关联设施位置与电力区域等数据绘制472个设施的两种用水路径图,明确不同路径热点地理分布及占比,指出决策重点。
用语言模型稀疏特征解释大脑对语言的响应
机构 * Brown University(布朗大学) ; University of Minnesota(明尼苏达大学) ; Harvard University(哈佛大学)
AI总结 提出增强稀疏编码模型,用分层稀疏自编码器特征替代密集LM隐状态,并加入惊奇度预测器,解释大脑语言皮层响应,发现前颞叶语言网络由共同特征预测,且大脑响应与LM中最通用的特征对应。