arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-05-04 至 2026-05-04 共收录 8
2412.02125 2026-05-04 cs.AI cs.LG

Preference Goal Tuning: Post-Training as Latent Control for Frozen Policies

偏好目标微调:冻结策略的后训练作为潜在控制

Guangyu Zhao, Kewei Lian, Haoxuan Ru, Borong Zhang, Haowei Lin, Zhancun Mu, Haobo Fu, Qiang Fu, Shaofei Cai, Zihao Wang, Yitao Liang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯AI实验室)

AI总结 本文提出偏好目标微调(PGT),通过冻结策略并优化潜在目标,使策略在无监督下适应任务偏好,实现在Minecraft SkillForge基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02327 2026-05-04 cs.CV

PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance

PPLLaVA:通过提示引导的视频序列理解

Shangkun Sun, Ruyang Liu, Haoran Tang, Yixiao Ge, Haibo Lu, Wei Gao, Jiankun Yang, Chen Li

机构 * Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) XPeng Inc.(小鹏汽车有限公司) Ministry of Industry and Information Technology of the People’s Republic of China, China Electronics Standardization Institute, Beijing, China(中华人民共和国工业和信息化部,中国电子标准化研究院,北京,中国)

AI总结 PPLLaVA通过提示引导的池化策略实现视频序列高效理解,减少18倍token,提升推理效率并在多种视频理解任务中取得最佳性能。

Comments Accepted to ICLR' 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00473 2026-05-04 cs.LG math.OC

Near-optimal and Efficient First-Order Algorithm for Multi-Task Learning with Shared Linear Representation

近优且高效的多任务学习共享线性表示一阶算法

Shihong Ding, Fangyu Du, Cong Fang

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University, China(人工智能国家重点实验室,智能科学与技术学院,北京大学,中国) School of Mathematical Sciences, Peking University, China(数学科学学院,北京大学,中国) Institute for Artificial Intelligence, Peking University, China(人工智能研究院,北京大学,中国)

AI总结 本文提出一种高效一阶算法,用于多任务学习中的共享线性表示学习,保证在$\widetilde{\mathcal{O}}(1)$次迭代内收敛,并达到近最优的估计误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00434 2026-05-04 cs.CV

LIMSSR: LLM-Driven Sequence-to-Score Reasoning under Training-Time Incomplete Multimodal Observations

LIMSSR:基于大语言模型的训练时不完整多模态观察下的序列到评分推理

Huangbiao Xu, Huanqi Wu, Xiao Ke, Yuxin Peng

机构 * Fujian Provincial Key Laboratory of Networking Computing(网络计算与智能信息处理福建省重点实验室) Intelligent Information Processing, College of Computer(智能信息处理学院) Data Science, Fuzhou University(数据科学,福州大学) Engineering Research Center of Big Data Intelligence, Ministry of Education(大数据智能工程研究中心,教育部) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学)

AI总结 本文提出LIMSSR框架,通过提示引导的上下文感知模态补全和多维表示融合,解决训练时不完整多模态数据下的序列到评分推理问题,并在三个动作质量评估数据集上验证了其有效性。

Comments ICML 2026 [Spotlight]

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00043 2026-05-04 cs.DB cs.AI cs.MA

SiriusHelper: An LLM Agent-Based Operations Assistant for Big Data Platforms

SiriusHelper:一种基于LLM代理的大数据平台操作助手

Yu Shen, Shiyang Liu, Qihang He, Yihang Cheng, Haining Xie, Zhiming He, Huahua Fan, Xianzhi Tan, Teng Ma, Shaoquan Zhang, Danqing Huang, Fan Jiang, Yang Li, Chongqing Zhao, Peng Chen, Jie Jiang, Bin Cui

机构 * TEG, Tencent Inc.(腾讯科技(TEG)) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 SiriusHelper通过统一在线助手自动识别用户意图并路由查询,结合深度搜索机制和优先级知识库,提升回答可靠性与响应速度,减少专家负担,实测降低20.8%的在线工单量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28158 2026-05-04 cs.AI

Intern-Atlas: A Methodological Evolution Graph as Research Infrastructure for AI Scientists

Intern-Atlas:一种方法论进化图作为人工智能科学家的研究基础设施

Yujun Wu, Dongxu Zhang, Xinchen Li, Jinhang Xu, Yiling Duan, Yumou Liu, Jiabao Pan, Qiyuan Zhu, Xuanhe Zhou, Jingxuan Wei, Siyuan Li, Jintao Chen, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Peking University(北京大学) Xi'an Jiaotong University(西安交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Hunan University(湖南大学) Shanghai Jiao Tong University(上海交通大学) Shanghai University(上海大学) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 Intern-Atlas通过构建方法论进化图,自动识别方法实体,推断方法间的关系,并捕捉驱动创新过渡的瓶颈,为AI研究提供因果网络支持。

Comments 25 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15830 2026-05-04 cs.LG

Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning

将拼图碎片放在关键位置:一种用于强化学习的问题增强框架

Yangyi Fang, Jiaye Lin, Xiaoliang Fu, Cong Qin, Haolin Shi

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Peking University(北京大学)

AI总结 本文提出PieceHint框架,通过战略性提供关键推理步骤,解决强化学习中训练易问题过拟合和训练难问题奖励稀疏的问题,实验表明其在数学推理基准上性能优异且保持pass@k多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏