arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-03-12 至 2026-03-12 共收录 13
2506.07527 2026-03-12 cs.AI cs.LG

Learning What Reinforcement Learning Can't: Interleaved Online Fine-Tuning for Hardest Questions

学习强化学习无法做到的:用于最难问题的交错在线微调

Lu Ma, Hao Liang, Meiyi Qiang, Lexiang Tang, Xiaochen Ma, Zhen Hao Wong, Junbo Niu, Chengyu Shen, Runming He, Yanhao Li, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学)) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京软件与硬件协同人工智能系统重点实验室)

AI总结 ReLIFT通过结合强化学习和在线微调,提升模型在复杂问题上的推理能力,实现超过5.2分的性能提升。

Comments 12 pages, 5 figures

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10677 2026-03-12 cs.AI cs.CL

Emulating Clinician Cognition via Self-Evolving Deep Clinical Research

通过自演化深度临床研究模拟医生认知

Ruiyang Ren, Yuhao Wang, Yunsen Liang, Lan Luo, Jing Liu, Haifeng Wang, Cong Feng, Yinan Zhang, Chunyan Miao, Ji-Rong Wen, Wayne Xin Zhao

机构 * Gaoling School of Artificial Intelligence(首都经济贸易大学人工智能学院) Renmin University of China(中国人民大学) Peking University Third Hospital(北京大学第三医院) Baidu Inc.(百度公司) Chinese PLA General Hospital(中国人民解放军总医院) Joint NTU-UBC Research Centre of Excellence in Active Living for the Elderly(联合NTU-UBC老年积极生活方式卓越研究中心) Nanyang Technological University(南洋理工大学)

AI总结 DxEvolve通过自演化深度临床研究工作流,提升临床诊断准确性,实现可追溯的AI持续改进

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10588 2026-03-12 cs.AI cs.CL cs.LG

Does LLM Alignment Really Need Diversity? An Empirical Study of Adapting RLVR Methods for Moral Reasoning

LLM对齐真的需要多样性吗?对道德推理适应RLVR方法的实证研究

Zhaowei Zhang, Xiaohan Liu, Xuekai Zhu, Junchao Huang, Ceyao Zhang, Zhiyuan Feng, Yaodong Yang, Xiaoyuan Yi, Xing Xie

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Microsoft Research(微软研究院) University of Michigan(密歇根大学) Shanghai Jiao Tong University(上海交通大学) CUHKSZ(香港中文大学(深圳)) THU(清华大学)

AI总结 本文通过实证研究发现,LLM对齐任务并不需要多样性算法,标准奖励最大化RLVR方法在道德推理中同样有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10397 2026-03-12 cs.LG cs.AI

On the Learning Dynamics of Two-layer Linear Networks with Label Noise SGD

关于带有标签噪声的两层线性网络学习动态的研究

Tongcheng Zhang, Zhanpeng Zhou, Mingze Wang, Andi Han, Wei Huang, Taiji Suzuki, Junchi Yan

机构 * Sch. of Computer Science and Zhiyuan College, Shanghai Jiao Tong University(上海交通大学计算机科学学院和智远学院) Peking University(北京大学) University of Sydney(悉尼大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The Institute of Statistical Mathematics(统计数学研究所) The University of Tokyo(东京大学)

AI总结 研究揭示了带有标签噪声的两层线性网络学习动态的两阶段行为,展示了标签噪声在促进模型从懒惰范式向丰富范式过渡中的关键作用,并扩展至更广泛的优化算法。

Comments Accepted to AAAI 2026(oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19442 2026-03-12 cs.CV

UrbanAlign: Post-hoc Semantic Calibration for VLM-Human Preference Alignment

UrbanAlign: 域内任务中VLM与人类偏好对齐的后处理语义校准

Yecheng Zhang, Rong Zhao, Zhizhou Sha, Yong Li, Lei Wang, Ce Hou, Wen Ji, Hao Huang, Yunshan Wan, Jian Yu, Junhao Xia, Yuru Zhang, Chunlei Shi

机构 * Tsinghua University(清华大学) University College London(伦敦大学学院) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) Southwest Jiaotong University(西南交通大学) Zhejiang University(浙江大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Renmin University of China(中国人民大学) Southeast University(东南大学)

AI总结 UrbanAlign通过后处理方法实现VLM与人类偏好的对齐,无需修改模型权重,提升领域任务的准确性和可解释性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12566 2026-03-12 cs.AI

To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models

混合还是合并:为大语言模型的多领域强化学习而努力

Haoqing Wang, Xiang Long, Ziheng Li, Yilong Xu, Tingguang Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

AI总结 本研究提出M2RL框架,通过混合多任务训练或模型合并策略,提升大语言模型在多领域任务中的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04472 2026-03-12 math.ST cs.LG math.PR stat.ML stat.TH

Universality of General Spiked Tensor Models

一般尖峰张量模型的普遍性

Yanjin Xiang, Zhihua Zhang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文研究了高维不对称尖峰张量模型的普遍性,证明了在非高斯噪声下,最大似然平稳点的谱行为和统计极限的稳健性。

Comments 115pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13043 2026-03-12 cs.CV cs.AI

GTR-Turbo: Merged Checkpoint is Secretly a Free Teacher for Agentic VLM Training

GTR-Turbo:合并的检查点实际上是为代理VLM训练提供免费的教师

Tong Wei, Yijun Yang, Changhao Zhang, Junliang Xing, Yuanchun Shi, Zongqing Lu, Deheng Ye

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文生) Peking University(北京大学)

AI总结 GTR-Turbo通过合并检查点作为免费教师,提升了多模态代理训练的效率和效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20034 2026-03-12 cs.CV

Clair Obscur: an Illumination-Aware Method for Real-World Image Vectorization

Clair Obscur: 一种面向现实图像矢量化的照明感知方法

Xingyue Lin, Shuai Peng, Xiangyu Xie, Jianhua Zhu, Yuxuan Zhou, Liangcai Gao

机构 * Wangxuan Institute of Computer Technology, Peking University, Beijing, China(王轩计算机技术研究所,北京大学,北京,中国)

AI总结 COVec通过引入内在图像分解和光照感知,提升现实图像矢量化在视觉保真度和编辑性上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19498 2026-03-12 cs.LG cs.AI cs.CR

Hierarchical Dual-Strategy Unlearning for Biomedical and Healthcare Intelligence Using Imperfect and Privacy-Sensitive Medical Data

层次化双策略去学习用于生物医学与医疗智能的不完美和隐私敏感医疗数据

Yi Zhang, Chao Zhang, Zijian Li, Tianxiang Xu, Kunyu Zhang, Zhan Gao, Meinuo Li, Xiaohan Zhang, Qichao Qi, Bing Chen

机构 * Department of Neurosurgery, Qilu Hospital of Shandong University and Institute of Brain and Brain-Inspired Science(齐鲁医院山东大学神经外科和脑科学与脑启发科学研究院) Department of Neurosurgery, The Affiliated Hospital of Qingdao University(青岛大学附属医院神经外科) Department of Neurosurgery, Peking Union Medical College Hospital(北京地坛医院神经外科) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) College of Artificial Intelligence, Dalian Maritime University(大连海事大学人工智能学院) University of Colorado Boulder(科罗拉多大学波尔德分校) Zhengzhou University(郑州大学) The University of Hong Kong(香港大学) Georgia Institute of Technology(佐治亚理工学院)

AI总结 本文提出层次化双策略去学习框架,用于在医疗数据中精确移除专业性知识并保留基本医疗能力,同时保障隐私并满足合规要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16410 2026-03-12 cs.CV

REALM: An MLLM-Agent Framework for Open World 3D Reasoning Segmentation and Editing on Gaussian Splatting

REALM:一种用于高斯点划法上开放世界3D推理分割和编辑的MLLM-代理框架

Changyue Shi, Minghao Chen, Yiping Mao, Chuxiao Yang, Xinyuan Hu, Jiajun Ding, Zhou Yu

机构 * Hangzhou Dianzi University(杭州电子科技大学) Peking University(北京大学)

AI总结 REALM通过MLLM-代理框架实现开放世界3D推理分割和编辑,支持多种3D交互任务。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08245 2026-03-12 cs.CL cs.AI cs.HC

Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement

大语言模型心理测量学:评估、验证与增强的系统综述

Haoran Ye, Jing Jin, Yuhang Xie, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学)

AI总结 本文系统综述了大语言模型的心理测量学,通过整合心理测量工具和理论,提升LLM的评估、理解和增强能力,推动以人类为中心的AI发展。

Comments 400+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12918 2026-03-12 cs.CL

ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs

ThinkPatterns-21k: 对LLMs中思维模式影响的系统研究

Pengcheng Wen, Jiaming Ji, Chi-Min Chan, Juntao Dai, Donghai Hong, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 ThinkPatterns-21k研究了LLMs中思维模式的影响,通过系统分析发现结构化思维对小模型有益,而大模型使用结构化思维会降低性能,独白思维在各类模型中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏