arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-04-06 至 2026-04-06 共收录 7
2604.03098 2026-04-06 cs.LG cs.AI cs.CL

Co-Evolution of Policy and Internal Reward for Language Agents

语言代理中策略与内部奖励的共演化

Xinyu Wang, Hanwei Wu, Jingwei Song, Shuyuan Zhang, Jiayi Zhang, Fanqi Kong, Tung Sum Thomas Kwok, Xiao-Wen Chang, Yuyu Luo, Chenglin Wu, Bang Liu

机构 * McGill University(麦吉尔大学) McMaster University(麦克马斯特大学) The University of Hong Kong(香港大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Peking University(北京大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) DeepWisdom(深度智慧) Université de Montréal(蒙特利尔大学) Mila(米拉研究所)

AI总结 本文提出Self-Guide方法,通过自动生成内部奖励实现推理和训练时的协同优化,提升语言代理性能。

Comments 20 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02972 2026-04-06 cs.CL

NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons

NeuReasoner:通过混合神经元实现可解释、可控和统一的推理

Haonan Dong, Kehan Jiang, Haoran Ye, Wenhao Zhu, Zhaolu Kang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

AI总结 本文提出NeuReasoner框架,通过混合神经元解决推理中的内在错误、跨步震荡和实例适配问题,提升可解释性和可控性,实验显示在六个基准测试中性能提升达27.0%,token消耗降低19.6%-63.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02967 2026-04-06 cs.AI cs.CL

FoE: Forest of Errors Makes the First Solution the Best in Large Reasoning Models

FoE:错误森林使大推理模型中的首个解成为最佳解

Kehan Jiang, Haonan Dong, Zhaolu Kang, Zhengzhou Zhu, Guojie Song

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室)

AI总结 本文发现大推理模型中首个解往往最优,提出RED框架通过抑制错误增长和修剪后续错误提升性能,实验显示在多个基准上性能提升达19.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02912 2026-04-06 cs.CY cs.AI

Corporations Constitute Intelligence

企业构成智能

Gilad Abiri

机构 * Peking University School of Transnational Law(北京大学国际法学院)

AI总结 本文分析了Anthropic发布的Claude AI模型宪法,指出其在伦理约束和民主参与方面的缺陷,强调AI治理缺乏民主主体。

Journal ref California Law Review Online (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02816 2026-04-06 cs.CV cs.AI

QAPruner: Quantization-Aware Vision Token Pruning for Multimodal Large Language Models

QAPruner: 量化感知的多模态大语言模型视觉标记剪枝

Xinhao Wang, Zhonyu Xia, Zhiwei Lin, Zhe Li, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

AI总结 本文提出QAPruner框架,通过结合量化误差模拟与异常强度指标,实现多模态大语言模型的视觉标记剪枝与后训练量化联合优化,提升低比特下的推理精度。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02345 2026-04-06 cs.LG cs.AI

UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics

UI-Oceanus:通过合成环境动态扩展GUI代理

Mengzhou Wu, Yuzhe Guo, Yuan Cao, Haochuan Lu, Songhe Zhu, Pingzhe Qu, Xin Chen, Kang Qin, Zhongpu Wang, Xiaode Zhang, Xinyi Wang, Wei Dai, Gang Cao, Yuetang Deng, Zhi Gong, Dezhi Ran, Linyi Li, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学);北京大学计算机学院) School of Computer Science, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center(腾讯微信) WeChat, Tencent Inc.(西蒙菲莎大学) Simon Fraser University(德克萨斯大学达拉斯分校) University of Texas at Dallas(复旦大学系统与先进计算研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

AI总结 本文提出UI-Oceanus框架,通过地面真实环境反馈掌握交互物理,解决GUI代理扩展中的数据瓶颈问题,实验表明其在离线和在线导航中均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17938 2026-04-06 math.OC cs.AI cs.LG

LMask: Learn to Solve Constrained Routing Problems with Lazy Masking

LMask: 通过惰性掩码学习解决受约束的路由问题

Tianyou Li, Haijun Zou, Jiayuan Wu, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系)

AI总结 LMask通过动态掩码生成高质量可行解,解决受约束的路由问题,采用惰性掩码解码方法和强化强度嵌入,提升解的质量和效率。

Comments Accepted to the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏