arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-05-08 至 2026-05-08 共收录 25
2605.06660 2026-05-08 cs.LG cs.AI cs.CL

Verifier-Backed Hard Problem Generation for Mathematical Reasoning

基于验证器的数学推理硬问题生成

Yuhang Lai, Jiazhan Feng, Yee Whye Teh, Ning Miao

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Hong Kong Institute of AI for Science, City University of Hong Kong(香港城市大学人工智能科学研究所) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Department of Statistics, University of Oxford(牛津大学统计系)

AI总结 本文提出VHG框架,通过引入独立验证器约束问题生成器的奖励,提升生成问题的有效性和难度,实验显示其在不定积分和数学推理任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06548 2026-05-08 cs.CL cs.AI cs.CV

Continuous Latent Diffusion Language Model

连续潜在扩散语言模型

Hongcan Guo, Qinyu Zhao, Yian Zhao, Shen Nie, Rui Zhu, Qiushan Guo, Feng Wang, Tao Yang, Hengshuang Zhao, Guoqiang Wei, Yan Zeng

机构 * The University of Hong Kong(香港大学) The Australian National University(澳大利亚国立大学) Peking University(北京大学) Renmin University of China(中国人民大学)

AI总结 本文提出Cola DLM,通过层次化信息分解实现文本生成,结合文本到潜在空间的映射、连续潜在空间中的全局语义先验建模及条件解码,提升生成效率和语义建模能力。

Comments 99 pages, 31 figures, 9 tables. Project page: https://hongcanguo.github.io/Cola-DLM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06487 2026-05-08 cs.CV cs.AI

3D MRI Image Pretraining via Controllable 2D Slice Navigation Task

通过可控的2D切片导航任务进行3D MRI图像预训练

Yu Wang, Qingchao Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

AI总结 本文提出通过可控2D切片导航任务预训练3D MRI图像,利用动作轨迹控制生成视频动作序列,提升解剖和空间表示学习能力。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06407 2026-05-08 eess.AS cs.AI cs.CL

WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling

WavCube:通过语义-声音联合建模统一语音表示以实现理解和生成

Guanrou Yang, Tian Tan, Qian Chen, Zhikang Niu, Yakun Song, Ziyang Ma, Yushen Chen, Zeyu Xie, Tianrui Wang, Yifan Yang, Wenxi Chen, Qi Chen, Wenrui Liu, Shan Yang, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Tencent(腾讯) Independent Researcher(独立研究员) Peking University(北京大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

AI总结 WavCube通过语义-声音联合建模统一语音表示,解决语音理解和生成的表示兼容问题,实现压缩后的高性能语音任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06326 2026-05-08 cs.CL

Teaching Thinking Models to Reason with Tools: A Full-Pipeline Recipe for Tool-Integrated Reasoning

教授思考模型进行工具推理:一种完整的全管道配方用于工具集成推理

Qianjia Cheng, Yuchen Zhang, Zhilin Wang, Yuxin Zuo, Shunkai Zhang, Yuchen Fan, Yu Qiao, Bowen Zhou, Ning Ding, Yu Cheng, Yun Luo, Ganqu Cui

机构 * Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出一种全管道配方,通过注入自然工具使用行为提升强思考模型的工具集成推理能力,同时保持文本推理能力,展示在Qwen3模型上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06112 2026-05-08 cs.CV cs.AI

Dynamic Pondering Sparsity-aware Mixture-of-Experts Transformer for Event Stream based Visual Object Tracking

动态考虑稀疏性的事件混合专家变换器用于基于事件流的视觉目标跟踪

Shiao Wang, Xiao Wang, Duoqing Yang, Wenhao Zhang, Bo Jiang, Lin Zhu, Yonghong Tian, Bin Luo

机构 * School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院) Beijing Institute of Technology(北京理工大学) Peng Cheng Laboratory(鹏城实验室) National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室) School of Electronic and Computer Engineering, Shenzhen Graduate School, Peking University(北京大学深圳研究生院电子与计算机工程学院)

AI总结 本文提出一种动态稀疏性考虑的事件混合专家变换器,用于基于事件流的视觉目标跟踪,通过多时间尺度建模事件密度变化,提升跟踪精度与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06104 2026-05-08 cs.LG cs.AI

Beyond Autoregressive RTG: Conditioning via Injection Outside Sequential Modeling in Decision Transformer

超越自回归RTG:通过在序列建模外注入条件进行决策变换

Yongyi Wang, Hanyu Liu, Lingfeng Li, Bozhou Chen, Ang Li, Qirui Zheng, Xionghui Yang, Chucai Wang, Wenxin Li

机构 * School of Computer Science Peking University(计算机科学学院,北京大学)

AI总结 本文提出SlimDT,通过在序列建模前将RTG信息注入状态表示,减少序列长度并提升效率,在D4RL基准上优于标准DT并达到现有最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05980 2026-05-08 cs.AI

TACT: Mitigating Overthinking and Overacting in Coding Agents via Activation Steering

TACT: 通过激活引导缓解编码代理中的过度思考与过度行动

Yuan Sui, Yulin Chen, Yibo Li, Xue Jiang, Yufei He, Yihong Dong, Xiaoxin He, Tianyu Gao, Bryan Hooi

机构 * National University of Singapore(新加坡国立大学) Peking University(北京大学) Meta

AI总结 本文提出TACT方法,通过激活引导检测并缓解编码代理中的过度思考和过度行动问题,提升任务解决效率和准确性。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28192 2026-05-08 cs.RO cs.CV

LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning

LaST-R1:通过自适应物理潜在推理强化机器人操作

Hao Chen, Jiaming Liu, Zhonghao Yan, Nuowei Han, Renrui Zhang, Chenyang Gu, Jialin Gao, Ziyu Guo, Siyuan Qian, Yinxi Wang, Peng Jia, Shanghang Zhang, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院) Simplexity Robotics Project(Simplexity机器人项目)

AI总结 本文提出LaST-R1,一种基于强化学习的后训练框架,通过联合优化潜在推理过程和动作生成,提升机器人在动态环境中的适应性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26694 2026-05-08 cs.RO cs.AI cs.CV

Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising

从视频先验构建统一的4D世界动作模型

Jun Guo, Qiwei Li, Peiyan Li, Zilong Chen, Nan Sun, Yifei Su, Heyun Wang, Yuan Zhang, Xinghang Li, Huaping Liu

机构 * Tsinghua University(清华大学) Xiaomi Robotics(小米机器人) Peking University(北京大学) CASIA

AI总结 本文提出X-WAM,统一了实时机器人动作执行与高保真的4D世界合成,在单一框架中解决传统统一世界模型仅建模2D像素空间且无法平衡动作效率与世界建模质量的问题。

Comments Project website: https://sharinka0715.github.io/X-WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17739 2026-05-08 cs.LG cs.CL

Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model

用免费的8B语言模型完全模拟环境来民主化工具学习

Chenming Tang, Hsiu-Yuan Huang, Weijie Liu, Junqiang Zheng, Saiyong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University(北京大学多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院) LLM Department, Tencent(腾讯LLM部门)

AI总结 本文提出TRUSTEE方法,利用免费开源的8B语言模型模拟动态环境,结合自适应课程学习机制,有效训练工具调用代理,实验证明其在多数情况下优于需额外资源的基线方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06132 2026-05-08 cs.AI

Claw-Eval: Towards Trustworthy Evaluation of Autonomous Agents

Claw-Eval: 向可信的自主代理评估迈进

Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, Qi Liu, Zhifang Sui, Tong Yang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) The University of Hong Kong(香港大学)

AI总结 Claw-Eval通过300人验证任务覆盖9类任务,采用轨迹感知评分体系,揭示自主代理在安全、鲁棒性及一致性上的多维特性,验证传统评估方法的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05630 2026-05-08 cs.CV cs.LG

Making Reconstruction FID Predictive of Diffusion Generation FID

使重建FID成为扩散生成FID的预测指标

Tongda Xu, Mingwei He, Shady Abu-Hussein, Jose Miguel Hernandez-Lobato, Chunhang Zheng, Kai Zhao, Chao Zhou, Ya-Qin Zhang, Yan Wang

机构 * Tsinghua University(清华大学) University of Cambridge(剑桥大学) Peking University(北京大学) Kuaishou Technology(快手科技)

AI总结 本文提出插值FID(iFID),通过在潜在空间中检索最近邻并插值其潜在表示,解码后计算与原数据集的FID,从而与生成FID强相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22859 2026-05-08 cs.CV

From Blind Spots to Gains: Diagnostic-Driven Iterative Training for Large Multimodal Models

从盲点到收益:面向大型多模态模型的诊断驱动迭代训练

Hongrui Jia, Chaoya Jiang, Yongrui Heng, Shikun Zhang, Wei Ye

机构 * Peking University(北京大学) Shandong University(山东大学)

AI总结 本文提出DPE方法,通过诊断驱动的数据生成和强化学习,实现大型多模态模型的持续改进,实验表明在多个基准测试中取得稳定收益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05833 2026-05-08 cs.AI

On the Role of Language Representations in Auto-Bidding: Findings and Implications

语言表示在自动出价中的作用:发现与启示

Guanyu Zhu, Jining Luan, Hanwen Du, Xinyu Fang, Sibo Xu, Ersheng Ni, Hongji Li, Jincheng Fang, Ronghao Chen, Huacan Wang, Xuanqi Lan, Yongxin Ni, Yiqi Sun, Youhua Li

机构 * City University of Hong Kong(香港城市大学) South China Agricultural University(华南农业大学) University of Electronic Science and Technology of China(电子科技大学) The Ohio State University, Columbus(俄亥俄州立大学) Hefei University of Technology(合肥工业大学) School of Economics and Management, Wuhan University(武汉大学经济管理学院) Faculty of Engineering, The University of Queensland(昆士兰大学工程学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong University of Science and Technology(香港科学大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Santa Clara University(圣克拉拉大学) Boston University(波士顿大学) The University of Hong Kong(香港大学)

AI总结 本文研究语言表示在自动出价中的作用,提出SemBid框架,通过整合语义与数值信息提升出价可控性和泛化能力,实验表明其在多种场景下优于现有方法。

Comments 19 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05832 2026-05-08 cs.AI

MolRecBench-Wild: A Real-World Benchmark for Optical Chemical Structure Recognition

MolRecBench-Wild:光学化学结构识别的现实世界基准

Haote Yang, Hui Wang, Chen Zhu, Jingchao Wang, Linye Li, Hongbin Lai, Huijie Ao, Yongxuan Lyu, Jiang Wu, Jiaxing Sun, Lua Chen, Yuanyuan Cao, Ruijie Zhang, Shengxin Lu, Lijun Wu, Bin Wang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) King’s College London(伦敦国王学院) East China University of Science and Technology(东华大学) East China Normal University(东华师范大学) Tongji University(同济大学) Peking University(北京大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出MolRecBench-Wild基准,包含5029个化学结构,覆盖真实出版物中的难度范围,通过CARBON表示语言和双轨评估协议提升语义评估能力,揭示现有专利基准与现实学术场景间的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05826 2026-05-08 cs.AI

AGPO: Asymmetric Group Policy Optimization for Verifiable Reasoning and Search Ads Relevance at JD

AGPO:面向京东可验证推理和搜索广告相关性的非对称分组策略优化

Yang Xu, Kun Yao, Yiming Deng, Zheng Fang, Kai Ming Ting, Ming Pang

机构 * Nanjing University, Nanjing, China(南京大学) Peking University, Beijing, China(北京大学)

AI总结 本文提出AGPO方法,通过非对称分组策略优化,抑制错误推理路径,提升模型探索能力,并在数学基准和工业应用中实现高准确率和性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05544 2026-05-08 cs.LG cs.RO

Adaptive Q-Chunking for Offline-to-Online Reinforcement Learning

自适应Q分块用于离线到在线强化学习

Nandiraju Gireesh, Yuanliang Ju, He Wang

机构 * Peking University(北京大学) Galbot University of Toronto(多伦多大学)

AI总结 本文提出自适应Q分块方法,通过动态选择不同分块大小的 critic 来解决离线到在线强化学习中的偏置问题,提升在 OGBench 和 Robomimic 上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19675 2026-05-08 cs.CV

MedFlowSeg: Flow Matching for Medical Image Segmentation with Frequency-Aware Attention

MedFlowSeg: 基于频率感知注意力的医学图像分割中的流匹配

Zhi Chen, Runze Hu, Le Zhang

机构 * School of Engineering, University of Birmingham(伯明翰大学工程学院) School of Public Health, Peking University(北京大学公共卫生学院)

AI总结 本文提出MedFlowSeg,通过流匹配框架将医学图像分割建模为学习时间依赖的向量场,以更高效地推断并保持生成模型的灵活性。引入双条件机制和频率感知注意力模块,提升结构一致性与边界定义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02493 2026-05-08 cs.CV cs.AI

PixelGen: Improving Pixel Diffusion with Perceptual Supervision

PixelGen: 通过感知监督改进像素扩散

Zehong Ma, Ruihan Xu, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

AI总结 PixelGen通过引入LPIPS和P-DINO损失增强x预测,采用噪声门控策略提升图像质量,在ImageNet-256上取得5.11的FID分数,且在文本到图像生成中表现优异。

Comments Project Pages: https://zehong-ma.github.io/PixelGen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01150 2026-05-08 cs.LG cs.AI cs.CR cs.CV math.OC

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

SMI: 统计成员推断用于可靠未学习模型审计

Jialong Sun, Zeming Wei, Jiaxuan Zou, Jiacheng Gong, Jie Fu, Chengyang Dong, Heng Xu, Jialong Li, Bo Liu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Heilongjiang University(黑龙江大学) Stevens Institute of Technology(斯蒂文斯理工学院)

AI总结 本文提出SMI方法,通过统计成员混合比例评估未学习模型的遗忘率,无需训练影子模型,有效解决传统成员推断攻击的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12355 2026-05-08 cs.LG

Tree-Structured Synergy of Large Language Models and Bayesian Optimization for Efficient CASH

树状结构下大语言模型与贝叶斯优化的协同作用:高效CASH问题

Beicheng Xu, Weitong Qian, Lingching Tung, Yupeng Lu, Bin Cui

机构 * School of Computer Science, Peking University(北京大学计算机科学系)

AI总结 本文提出LB-MCTS框架,通过树状结构整合大语言模型与贝叶斯优化,解决高维CASH问题中的冷启动问题,实验表明其优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13281 2026-05-08 cs.CV

VideoASMR-Bench: Can AI-Generated ASMR Videos Fool VLMs and Humans?

VideoASMR-Bench: AI生成的ASMR视频能否欺骗视觉语言模型和人类?

Jiaqi Wang, Weijia Wu, Yi Zhan, Rui Zhao, Ming Hu, James Cheng, Wei Liu, Philip Torr, Kevin Qinghong Lin

机构 * The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学) Peking University(北京大学) Monash University(墨尔本大学) Video Rebirth University of Oxford(牛津大学)

AI总结 VideoASMR-Bench通过细粒度音频视觉感知和感官沉浸性评估AI生成ASMR视频的检测能力,揭示了当前VLMs在识别AI生成ASMR视频上的不足以及VGMs生成逼真ASMR视频的能力。

Comments Code is at https://github.com/video-reality-test/video-reality-test, page is at https://video-reality-test.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏