Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning
通过Harness训练:面向复杂推理的在线策略Harness自蒸馏
机构 * Peking University(北京大学)
AI总结 本文提出OPHSD方法,通过将增强的模型作为教师进行自蒸馏,提升模型在复杂推理任务中的泛化能力和独立表现。
高校专区
通过Harness训练:面向复杂推理的在线策略Harness自蒸馏
机构 * Peking University(北京大学)
AI总结 本文提出OPHSD方法,通过将增强的模型作为教师进行自蒸馏,提升模型在复杂推理任务中的泛化能力和独立表现。
HULK:大规模层次协调在连续和不确定的时间任务中
机构 * Department of Mechanics and Engineering Science, College of Engineering, Peking University(力学与工程科学系,工程学院,北京大学) ; National University of Defense Technology(国防科学技术大学)
AI总结 本文提出HULK框架,解决连续和不确定时间任务下的大规模协调问题,通过分层结构提升计算效率和鲁棒性。
Comments Accepted to the IEEE International Conference on Robotics and Automation. 7 pages, 4 figures
ReLibra:基于路由回放的MoE训练负载均衡
机构 * School of Computer Science, Peking University(北京大学计算机学院)
AI总结 ReLibra通过利用强化学习的回放训练流程中的路由回放机制,在微批次粒度上实现细粒度负载均衡,提升MoE训练效率。
句式转换导致的输出模式崩溃:当LLMs在语义等价输入下失衡
机构 * Peking University(北京大学) ; University of Chicago(芝加哥大学)
AI总结 研究发现,当请求内容被重写时,大语言模型往往无法保持原任务格式,提出了提示变体输出模式崩溃现象,并通过PARACONSIST基准测试评估模型鲁棒性。
Comments Added a footnote; author order is alphabetical by last name
VL-SAM-v3:基于记忆的开放世界目标检测视觉先验
机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)
AI总结 VL-SAM-v3通过引入检索驱动的外部视觉记忆,提升开放世界目标检测的性能,尤其在稀有类别和复杂场景中表现优异。
SayNext-Bench:为什么LLMs在下一句预测中挣扎?
机构 * University of Oulu(奥卢大学) ; College of William and Mary(威廉与玛丽学院) ; Tongji University(同济大学) ; Peking University(北京大学)
AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。
生成巨人,检索弱者:为何多模态大语言模型在多模态检索中表现不佳?
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学) ; Tencent Inc(腾讯公司) ; Zhongguancun Academy(中关村学院)
AI总结 研究揭示多模态大语言模型在多模态检索中表现不佳的原因,通过稀疏自编码器分析发现其表示空间主要由文本语义构成,视觉语义不足,导致检索性能下降,提出ReAlign方法提升检索效果。
PLD: 一种基于选择理论的列表级知识蒸馏
机构 * School of Computer Science, Peking University(北京大学计算机科学学院)
AI总结 本文提出PLD,一种基于Plackett-Luce模型的列表级知识蒸馏方法,通过将教师logits视为'价值'评分,直接优化教师最优排名,实现凸且平移不变的替代目标,涵盖加权交叉熵。
Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025), 136090--136112 (2026)
TAH-QUANT: 在慢速网络下的流水线并行中有效的激活量化
机构 * HKUST(香港科技大学) ; Peking University(北京大学)
AI总结 本文提出TAH-Quant框架,通过细粒度切片量化、熵引导的自适应位分配和Hadamard变换,减少量化误差并提升训练效率,实验证明其在保持收敛性的同时提升了吞吐量和速度。
MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)
AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。
BenchHAR: 用于通用传感器活动识别的自监督学习基准测试
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Peking University(北京大学) ; Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)
AI总结 BenchHAR针对传感器活动识别中数据异质性和标注数据稀缺问题,系统比较了自监督学习方法的泛化性能,发现混合范式和CNN编码器在性能上表现最佳,且增加预训练数据量能提升泛化能力。
Comments 25 pages
为何DiT编辑器会漂移?VAE潜在空间中的插件式低频对齐
机构 * Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Peking University(北京大学) ; CASIA ; University of Electronic Science and Technology of China(电子科技大学) ; Guangming Laboratory(光明实验室)
AI总结 本文从潜在空间频率角度研究DiT编辑器漂移问题,提出无需训练的VAE-LFA方法,通过低频对齐抑制语义漂移并保持高频细节,适用于白盒和黑盒DiT编辑器。
Comments 9 pages main paper, 12 figures, 25 pages in total
迈向定制化的多模态角色扮演
机构 * Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; Zhejiang University(浙江大学)
AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。
Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/