Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies
偏好目标微调:冻结策略的后训练作为潜在控制
机构 * Peking University(北京大学) ; Tencent AI Lab(腾讯AI实验室)
AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。
高校专区
偏好目标微调:冻结策略的后训练作为潜在控制
机构 * Peking University(北京大学) ; Tencent AI Lab(腾讯AI实验室)
AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。
PPLLaVA:通过提示引导的视频序列理解
机构 * Peng Cheng Laboratory(鹏城实验室) ; Peking University(北京大学) ; XPeng Inc.(小鹏汽车有限公司) ; Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)
AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。
Comments Accepted to ICLR' 26
近优且高效的多任务学习共享线性表示一阶算法
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University, China(人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) ; School of Mathematical Sciences, Peking University, China(数学科学学院,北京大学,中国) ; Institute for Artificial Intelligence, Peking University, China(人工智能研究院,北京大学,中国)
AI总结 本文提出一种高效一阶算法,用于多任务学习中的共享线性表示学习,保证在$\widetilde{\mathcal{O}}(1)$次迭代内收敛,并达到近最优的估计误差。
LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理
机构 * Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室) ; Intelligent Information Processing, College of Computer(智能信息处理学院) ; Data Science, Fuzhou University(数据科学,福州大学) ; Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部) ; Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)
AI总结 本文提出LIMSSR框架,通过提示引导的上下文感知模态补全和多维表示融合,解决训练时不完整多模态数据下的序列到评分推理问题,并在三个动作质量评估数据集上验证了其有效性。
Comments ICML 2026 [Spotlight]
SiriusHelper:一种基于LLM代理的大数据平台操作助手
机构 * TEG, Tencent Inc.(腾讯科技(TEG)) ; School of Computer Science, Peking University(北京大学计算机学院)
AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。
Intern-Atlas:一种方法论进化图作为人工智能科学家的研究基础设施
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Xi'an Jiaotong University(西安交通大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Hunan University(湖南大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shanghai University(上海大学) ; University of Chinese Academy of Sciences(中国科学院大学)
AI总结 Intern-Atlas通过构建方法论进化图,自动识别方法实体,推断方法间的关系,并捕捉驱动创新过渡的瓶颈,为AI研究提供因果网络支持。
Comments 25 pages, 5 figures, 8 tables
Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准
机构 * The Chinese University of Hong Kong(香港中文大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; South China University of Technology(华南理工大学) ; Xiamen University(厦门大学) ; Peking University(北京大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; The University of Hong Kong(香港大学)
AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。
Comments Project page: https://claw-eval-live.github.io
将拼图碎片放在关键位置:一种用于强化学习的问题增强框架
机构 * Tsinghua University(清华大学) ; Fudan University(复旦大学) ; Peking University(北京大学)
AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。