Rethinking Vector Field Learning for Generative Segmentation
重新思考生成分割中的向量场学习
机构 * Peking University(北京大学) ; Baidu(百度)
AI总结 本文从向量场学习角度重新审视扩散分割,解决梯度消失和轨迹遍历问题,提出改进的向量场重塑策略和高效类别编码方案,提升分割性能。
高校专区
重新思考生成分割中的向量场学习
机构 * Peking University(北京大学) ; Baidu(百度)
AI总结 本文从向量场学习角度重新审视扩散分割,解决梯度消失和轨迹遍历问题,提出改进的向量场重塑策略和高效类别编码方案,提升分割性能。
CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF
机构 * Peking University(北京大学) ; Xiaohongshu Inc.(小红书公司) ; Zhejiang University(浙江大学)
AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。
Holter-to-Sleep: 基于单导联ECG的AI赋能睡眠表型分析
机构 * National Institute of Health Data Science, Peking University, Beijing, China(北京大学国家健康数据科学研究院) ; Department of Computer Science, Tianjin University of Technology, Tianjin, China(天津理工大学计算机学院) ; Department of Respiratory and Critical Care Medicine, Binzhou Medical University Hospital, Binzhou, China(滨州医学院附属医院呼吸与危重症医学科) ; Heart Voice Medical Technology, Hefei, Anhui(合肥心声医疗科技) ; School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) ; Institute of Medical Technology, Peking University Health Science Center, Beijing, China(北京大学医学部医学技术研究院) ; Department of Respiratory, The Second Hospital of Tianjin Medical University, Tianjin, China(天津医科大学第二医院呼吸科) ; Interdisciplinary Center of Sleep Medicine, Charité - Universitätsmedizin Berlin, Berlin, Germany(柏林夏里特大学医学院睡眠医学跨学科中心) ; Institute for Artificial Intelligence(人工智能研究院)
AI总结 本文提出一种利用单导联ECG进行睡眠表型和心脏表型联合分析的框架,通过AI技术实现家庭场景下的睡眠与心脏监测,为大规模研究提供可行方案。
重新审视垂直联邦学习中的标签推断攻击:为什么它们易受攻击以及如何防御
机构 * Key Laboratory of High Confidence Software Technologies (Peking University), Ministry of Education(高可信软件技术重点实验室(北京大学)) ; School of Computer Science, Peking University(北京大学计算机学院) ; Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国)
AI总结 本文研究垂直联邦学习中标签推断攻击的脆弱性,揭示模型补偿现象,提出任务重新分配和层调整防御方法,提升对抗性能。
通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; School of ECE, Peking University(北京大学电子工程学院) ; School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Tencent Youtu Lab(腾讯优图实验室)
AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。
Time-o1: 时间序列预测需要转换标签对齐
机构 * Xiaohongshu Inc(小红书公司) ; Zhejiang University(浙江大学) ; Renmin University of China(中国人民大学) ; Peking University(北京大学) ; State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室,智能科学与技术学院) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) ; Department of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) ; Center for Data Science, Peking University(北京大学数据科学中心) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(广州黄埔实验室(华南))
AI总结 本文提出Time-o1,通过转换标签对齐缓解时间序列预测中的标签自相关和任务过多问题,提升模型性能。
Comments Accepted as poster in NeurIPS 2025
Journal ref NeurIPS 2025
政治传记提取的代理框架
机构 * Department of Politics and Public Administration, The University of Hong Kong(政治与公共行政系,香港大学) ; School of International Studies, Peking University(国际关系学院,北京大学) ; Department of Political Science, Columbia University(政治学系,哥伦比亚大学)
AI总结 本文提出一种两阶段的合成-编码框架,利用大语言模型自动化提取多维精英传记,提升政治科学研究的效率和准确性。
Comments 70 pages, 14 figures
千GPU大规模训练与优化方案用于AI原生云具身智能基础设施
机构 * AI Infra Team at JDT(JDT人工智能基础设施团队) ; Tsinghua University(清华大学) ; Peking University(北京大学) ; Tianjin University(天津大学) ; Beihang University(北洋大学) ; University of Science and Technology of China(中国科学技术大学)
AI总结 本文提出一种基于LeRobot框架的千GPU分布式训练平台,通过优化数据流程、训练效率和基础设施,实现具身智能模型训练速度提升40倍,推动下一代自主智能机器人发展。
AdaptPNP: 集成抓取与非抓取技能以实现适应性机器人操控
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; RoboScience(机器人科学) ; East China Normal University(华东师范大学) ; Peking University(北京大学) ; Nanjing University(南京大学)
AI总结 本文提出AdaptPNP框架,通过视觉-语言模型整合抓取与非抓取技能,实现复杂机器人操控任务的规划与执行。
Journal ref ICRA 2026
二次直接预报用于训练多步时间序列预测模型
机构 * Xiaohongshu Inc.(小红书公司) ; State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(人工智能国家重点实验室,北京大学智能科学与技术学院) ; College of Engineering, Purdue University(普渡大学工程学院) ; School of Computing and Artificial Intelligence, Shanghai University of Finance and Economics(上海财经大学计算机与人工智能学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) ; Squirrel AI ; Center for Data Science, Peking University(北京大学数据科学中心) ; Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) ; Pazhou Laboratory (Huangpu), Guangzhou, Guangdong, China(琶洲实验室(黄埔),广州,广东,中国)
AI总结 本文提出二次加权训练目标,解决多步时间序列预测中标签自相关和任务权重不均的问题,通过Quadratic Direct Forecast算法提升模型性能。
Journal ref ICLR 2026
Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; University of Toronto(多伦多大学) ; Zhejiang University(浙江大学) ; Peking University(北京大学)
AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。
Journal ref ICRA2026
MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测
机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) ; Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) ; The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))
AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。
Comments Project page: https://robotic-mla.github.io/
GenCompositor:基于扩散变换器的生成视频合成
机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) ; ARC Lab, Tencent PCG(腾讯PCG ARC实验室) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; GVC Lab, Great Bay University(Great Bay大学GVC实验室) ; The Chinese University of Hong Kong(香港中文大学)
AI总结 本文提出GenCompositor,通过扩散变换器实现自动化视频合成,解决传统方法劳动强度大、成本高的问题,提出轻量背景保存分支、动态元素融合块和ERoPE位置嵌入等创新方法,构建VideoComp数据集并验证方法有效性。
Comments Accepted by ICLR 2026
FoldNet:通过关键点驱动的资产和演示合成学习通用的闭环策略用于服装折叠
机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)
AI总结 本文提出一种合成服装数据集,通过关键点驱动的资产和演示合成,学习通用的服装折叠闭环策略,提升现实世界成功率25%。
Comments Project: https://pku-epic.github.io/FoldNet/