Trust Region On-Policy Distillation
信任区域在线策略蒸馏
机构 * Samsung Research(三星研究院) ; University of Oxford(牛津大学) ; Peking University(北京大学)
AI总结 提出信任区域在线策略蒸馏(TrOPD),通过信用分配策略和信任区域学习解决师生分布差异导致的训练不稳定问题,在数学推理、代码生成和通用基准上超越现有方法。
高校专区
信任区域在线策略蒸馏
机构 * Samsung Research(三星研究院) ; University of Oxford(牛津大学) ; Peking University(北京大学)
AI总结 提出信任区域在线策略蒸馏(TrOPD),通过信用分配策略和信任区域学习解决师生分布差异导致的训练不稳定问题,在数学推理、代码生成和通用基准上超越现有方法。
面向CT视野扩展的高效图像到图像薛定谔桥
机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) ; Shanghai Cancer Center, Fudan University(复旦大学上海癌症中心) ; Department of Electrical and Computer Engineering, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校电气与计算机工程系) ; Beijing Key Laboratory of Intelligent Neuromodulation and Brain Disorder Treatment(北京智能神经调控与脑疾病治疗重点实验室)
AI总结 提出基于图像到图像薛定谔桥(I²SB)扩散模型的CT视野扩展框架,通过直接学习有限视野与扩展视野图像间的随机映射,实现单步快速推理,在精度和速度上均超越现有扩散模型。
Comments 12 pages
Journal ref IEEE Transactions on Radiation and Plasma Medical Sciences 2026
InfoPO:面向用户智能体的信息驱动策略优化
机构 * Peking University(北京大学) ; The Hong Kong University of Science(香港科学大学)
AI总结 针对多轮交互中信用分配和优势信号不足的问题,提出信息增益奖励与自适应方差门控融合的InfoPO方法,在意图澄清、协作编码等任务上优于现有基线。
UniECG: 在一个统一模型中理解与生成心电图
机构 * Peking University(北京大学) ; Shanghai Ocean University(上海海洋大学) ; the Second Hospital of Tianjin Medical University(天津医科大学第二医院) ; National University of Singapore(新加坡国立大学)
AI总结 提出UniECG模型,通过两阶段设计实现心电图信号/图像生成解释性文本及根据文本目标生成对应心电图信号,支持交互式心电图教育。