arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3020
2606.19407 2026-06-19 cs.SE cs.AI 新提交

JustDiag!: A Diagnostic Justification Engine for Accountable Root Cause Analysis

JustDiag!:用于可问责根本原因分析的诊断论证引擎

Tingzhu Bi, Xinrui Jiang, Xun Zhang, Pengcheng Su, Congjie He, Jinglin Li, Ping Wang, Meng Ma

机构 * Peking University(北京大学) University of Edinburgh(爱丁堡大学) Beijing University of Posts and Telecommunications(北京邮电大学)

AI总结 提出JustDiag诊断论证引擎,通过维护显式的过程状态(证据、发现、竞争假设、冲突和下一步检查)来支持可问责的根本原因分析,在66个真实事件上评估显示其优于仅提供流畅最终答案的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04101 2026-06-19 cs.DC cs.LG 版本更新

UltraEP: Unleash MoE Training and Inference on Rack-Scale Nodes with Near-Optimal Load Balancing

UltraEP:在机架级节点上以近最优负载均衡释放MoE训练与推理

Xinming Wei, Chao Jin, Tuo Dai, Yinmin Zhong, Shan Yu, Chengxu Yang, Bingyang Wu, Zili Zhang, Jing Mai, Qianchao Zhu, Zhouyang Li, Yuliang Liu, Guojie Luo

机构 * School of Computer Science, Peking University(北京大学计算机学院) Xiaohongshu Inc.(小红书公司) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 提出UltraEP,首个基于精确负载的实时均衡器,通过协同设计规划求解与专家复制通信,在机架级节点上实现MoE训练和推理的微批次与逐层重均衡,达到94.3%的力均衡理想吞吐量。

Comments The authors have identified issues related to information disclosure in the current version of the manuscript and therefore request its withdrawal. A revised version may be prepared at a later date

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29924 2026-06-19 cs.CV 版本更新

Abstraction in Style: Beyond Texture and Color

风格中的抽象:超越纹理与色彩

Min Lu, Yuanfeng He, Anthony Chen, Jianhuang He, Pu Wang, Daniel Cohen-Or, Hui Huang

机构 * Shenzhen University(深圳大学) Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE)(视觉计算研究中心(VCC),计算机科学与软件工程学院) Peking University(北京大学)

AI总结 提出Abstraction in Style (AiS)框架,将结构抽象与视觉风格分离,通过中间抽象代理实现几何保真度放松,从而支持更广泛的非真实感风格迁移。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04037 2026-06-19 cs.LG cs.RO 版本更新

DADP: Domain Adaptive Diffusion Policy

DADP: 领域自适应扩散策略

Pengcheng Wang, Qinghang Liu, Haotian Lin, Yiheng Li, Guojian Zhan, Masayoshi Tomizuka, Yixiao Wang

机构 * University of California, Berkeley, California, USA(加州大学伯克利分校) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

AI总结 提出DADP,通过无监督解耦和领域感知扩散注入,实现跨动态环境的鲁棒零样本适应,在运动与操控任务上超越先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19257 2026-06-18 cs.CL 新提交

DreamReasoner-8B: Block-Size Curriculum Learning for Diffusion Reasoning Models

DreamReasoner-8B:面向扩散推理模型的块大小课程学习

Zirui Wu, Lin Zheng, Jiacheng Ye, Shansan Gong, Xueliang Zhao, Yansong Feng, Wei Bi, Lingpeng Kong

机构 * The University of Hong Kong(香港大学) Peking University(北京大学)

AI总结 提出块大小课程学习,通过从细粒度到粗粒度的渐进训练,解决块扩散语言模型在长链推理中性能差距问题,DreamReasoner-8B在数学和代码推理上达到与Qwen3-8B相当的水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19215 2026-06-18 cs.CV 新提交

GUMP-Net: An interpretable model-data-driven intelligent algorithm for multi-class pelvic segmentation

GUMP-Net: 一种用于多类盆腔分割的可解释模型-数据驱动智能算法

Liheng Wang, Yinghui Zhang, Licheng Zhang, Hailin Xu, Qiyong Cao, Chong Chen

机构 * State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Orthopedics, The Fourth Medical Center of Chinese PLA General Hospital(中国人民解放军第四医学中心骨科部) National Clinical Research Center for Orthopedics, Sports Medicine and Rehabilitation(骨科、运动医学与康复临床研究中心) Department of Trauma and Orthopedics, People’s Hospital Peking University(北京大学人民医院创伤与骨科部) Department of Orthopedics and Traumatology, Beijing Jishuitan Hospital, Capital Medical University(首都医科大学北京积水潭医院骨科与创伤科)

AI总结 提出GUMP-Net,结合改进测地线活动轮廓模型与深度神经网络,实现多类盆腔分割,在小训练数据下表现更优,并提供可解释几何视角。

Comments 26 pages, 8 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19053 2026-06-18 cs.CV 新提交

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: From Evaluation to Diagnosis

大规模视觉-语言模型在细粒度图像任务上的基准测试:从评估到诊断

Hong-Tao Yu, Chen-Wei Xie, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Alibaba Group(阿里巴巴集团) School of Computer Science and Engineering, School of Intelligence Science and Engineering, and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院以及新一代人工智能技术及其交叉应用关键实验室,中国) Wangxuan Institute of Computer Technology, National Key Laboratory for Multimedia Information Processing, Peking University, China(北京大学王轩计算机技术研究所、多媒体信息处理国家重点实验室,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

AI总结 提出FG-BMK基准,含101万问题和28万图像,通过人机双范式评估LVLM的细粒度语义识别与视觉判别能力,诊断失败原因,发现视觉表示、语义对齐等瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18844 2026-06-18 cs.LG 新提交

Learning from Your Own Mistakes: Constructing Learnable Micro-Reflective Trajectories for Self-Distillation

从自身错误中学习:为自蒸馏构建可学习的微反思轨迹

Zhilin Huang, Hang Gao, Ziqiang Dong, Yuan Chen, Yifeng Luo, Chujun Qin, Jingyi Wang, Yang Yang, Guanjun Jiang

机构 * Qwen Business Unit of Alibaba(阿里巴巴通义千问事业部) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 提出TAPO方法,通过对比正确与错误轨迹构建微反思修正,实现从隐式分布对齐到显式轨迹构建的自蒸馏改进,在多个数学推理基准上优于GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18765 2026-06-18 cs.CV 新提交

SpectralDiT: Timestep-Conditioned Spectral Residual Correction for Flow-Matching DiTs

SpectralDiT:流匹配DiT的时间步条件谱残差校正

Jiayu Tian

机构 * Peking University(北京大学)

AI总结 提出SpectralDiT,通过时间步条件谱残差校正模块,在CIFAR-10和ImageNet-100上以极少额外计算和参数提升流匹配DiT的生成质量,FID分别降低5.1%和8.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18356 2026-06-18 cs.CR cs.AI 新提交

SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents

SafeClawBench: 区分工具使用LLM代理中的语义、审计证据和沙箱危害

Yuchuan Tian, Mengyu Zheng, Haocheng Mei, Ye Yuan, Chao Xu, Xinghao Chen, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Beijing Jiaotong University(北京交通大学) SUIBE(上海外国语大学) Huawei(华为) Tsinghua University(清华大学)

AI总结 提出SafeClawBench基准,通过三个独立端点(语义攻击接受、审计可见危害证据、沙箱观察危害)评估工具使用LLM代理的安全性,揭示不同失败模式并支持可复现比较。

Comments 32 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18308 2026-06-18 cs.LG cs.AI 新提交

TRIDENT: Breaking the Hybrid-Safety-Physics Coupling for Provably Safe Multi-Agent Reinforcement Learning

TRIDENT: 打破混合安全-物理耦合以实现可证明安全的多智能体强化学习

Zijie Meng, Ziwei Li, Yufei Liu, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) National Taiwan University(国立台湾大学) WHU(武汉大学) THU / Jimei University(清华大学 / 集美大学)

AI总结 针对混合离散-连续动作、训练时安全约束和物理动力学形成的耦合问题,提出TRIDENT框架,通过Richardson-Romberg梯度校正、Lyapunov约束序列信任域更新和物理信息残差评论家,实现可证明的安全收敛,显著降低训练违规并提升奖励。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01249 2026-06-18 cs.LG cs.CL 版本更新

Trust Region On-Policy Distillation

信任区域在线策略蒸馏

Xingrun Xing, Haoqing Wang, Boyan Gao, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) University of Oxford(牛津大学) Peking University(北京大学)

AI总结 提出信任区域在线策略蒸馏(TrOPD),通过信用分配策略和信任区域学习解决师生分布差异导致的训练不稳定问题,在数学推理、代码生成和通用基准上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11211 2026-06-18 eess.IV cs.CV 版本更新

Efficient Image-to-Image Schrödinger Bridge for CT Field of View Extension

面向CT视野扩展的高效图像到图像薛定谔桥

Zhenhao Li, Song Ni, Long Yang, Xiaojie Yin, Haijun Yu, Jiazhou Wang, Hongbin Han, Weigang Hu, Yixing Huang

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学人民医院医学技术研究所) Shanghai Cancer Center, Fudan University(复旦大学上海癌症中心) Department of Electrical and Computer Engineering, University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校电气与计算机工程系) Beijing Key Laboratory of Intelligent Neuromodulation and Brain Disorder Treatment(北京智能神经调控与脑疾病治疗重点实验室)

AI总结 提出基于图像到图像薛定谔桥(I²SB)扩散模型的CT视野扩展框架,通过直接学习有限视野与扩展视野图像间的随机映射,实现单步快速推理,在精度和速度上均超越现有扩散模型。

Comments 12 pages

Journal ref IEEE Transactions on Radiation and Plasma Medical Sciences 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00656 2026-06-18 cs.AI 版本更新

InfoPO: Information-Driven Policy Optimization for User-Centric Agents

InfoPO:面向用户智能体的信息驱动策略优化

Fanqi Kong, Jiayi Zhang, Mingyi Deng, Chenglin Wu, Yuyu Luo, Bang Liu

机构 * Peking University(北京大学) The Hong Kong University of Science(香港科学大学)

AI总结 针对多轮交互中信用分配和优势信号不足的问题,提出信息增益奖励与自适应方差门控融合的InfoPO方法,在意图澄清、协作编码等任务上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18588 2026-06-18 cs.CL 版本更新

UniECG: Understanding and Generating ECG in One Unified Model

UniECG: 在一个统一模型中理解与生成心电图

Jiarui Jin, Haoyu Wang, Xiang Lan, Jun Li, Hongyan Li, Shenda Hong

机构 * Peking University(北京大学) Shanghai Ocean University(上海海洋大学) the Second Hospital of Tianjin Medical University(天津医科大学第二医院) National University of Singapore(新加坡国立大学)

AI总结 提出UniECG模型,通过两阶段设计实现心电图信号/图像生成解释性文本及根据文本目标生成对应心电图信号,支持交互式心电图教育。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17935 2026-06-17 cs.CV 新提交

MoonSplat: Monocular Online Gaussian Splatting with Sim(3) Global Optimization

MoonSplat: 基于Sim(3)全局优化的单目在线高斯泼溅

Guo Pu, Yixuan Han, Haofeng Li, Yao Zhang, Hui Zhou, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所) Beijing Hydrogen Intelligent Tech. Co., Ltd.(北京氢元智能科技有限公司)

AI总结 提出一种结合Sim(3)全局优化的在线体素化3DGS框架,通过颜色残差学习策略加速收敛,实现鲁棒的相机跟踪和全局闭环,在室内外数据集上达到SOTA性能。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17888 2026-06-17 cs.AI 新提交

MathVis-Fine: Aligning Visual Supervision with Necessity via Progressive Dependency-Guided Training for Multimodal Mathematical Reasoning

MathVis-Fine:通过渐进式依赖引导训练将视觉监督与必要性对齐的多模态数学推理

Wanshi Xu, Haokun Zhao, Haidong Yuan, Songjun Cao, Long Ma

机构 * School of ECE, Peking University(北京大学电子与计算机工程学院) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

AI总结 提出MathVis-Fine框架,通过构建细粒度视觉标注数据集和两阶段渐进式训练,根据样本的视觉依赖程度平衡答案正确性和视觉基础奖励,提升多模态数学推理的监督精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17836 2026-06-17 cs.CV cs.AI cs.CG cs.GR 新提交

High-Fidelity 3D Geometric Reconstruction of Pelvic Organs from MRI: A Hybrid Deep Learning and Iterative Optimization Approach

高保真盆腔器官MRI三维几何重建:一种混合深度学习与迭代优化方法

Hui Wang, Xiaowei Li, Chenxin Zhang, Yifan Feng, Jianwei Zuo, Yumeng Tang, Xiuli Sun, Jianliu Wang, Bing Xie, Jiajia Luo

机构 * Institute of Medical Technology, Peking University Health Science Center, Peking University(北京大学医学部医学技术研究院,北京大学) Biomedical Engineering Department, Institute of Advanced Clinical Medicine, Peking University(北京大学先进临床医学研究院生物医学工程系) Department of Obstetrics and Gynecology, Peking University People’s Hospital(北京大学人民医院妇产科部)

AI总结 提出混合可变形形状建模框架,结合深度学习预测与迭代优化,实现膀胱、子宫和直肠的高保真三维几何重建,在几何保真度和网格质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17536 2026-06-17 cs.CV cs.AI 新提交

OmniDrive: An LLM-Choreographed Multi-Agent World Model with Unified Latent Co-Compression for Multi-View Driving Video Generation

OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩

Zijie Meng, Yufei Liu, Chengqian Ma, Zhiyu Li, Jiyuan Liu, Wenhua Nie, Bingcai Wei, Shuqin Chen, Weichen Xu, Jiquan Yuan, Miao Zhang

机构 * Peking University(北京大学) Xiamen University(厦门大学) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) National Taiwan University(国立台湾大学) Wuhan University(武汉大学) Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Jimei University(集美大学)

AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。

Comments 24 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17511 2026-06-17 cs.RO cs.AI cs.CV 新提交

MagicSim: A Unified Infrastructure for Executable Embodied Interaction

MagicSim: 可执行具身交互的统一基础设施

Haoran Lu, Songling Liu, Yue Chen, Guo Ye, Mutian Shen, Shuyang Yu, Yu Xiao, Jihai Zhao, Shang Wu, Jianshu Zhang, Xiangtian Gui, Chuye Hong, Yuran Wang, Maojiang Su, Jiayi Wang, Ruihai Wu, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学) University of California, Berkeley(加州大学伯克利分校) ShanghaiTech University(上海科技大学)

AI总结 提出MagicSim,一个基于确定性批处理运行时和共享MDP的具身交互基础设施,通过YAML规范解耦内容、放置、行为和智能体暴露,统一世界构建、执行、评估和自动生成轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17480 2026-06-17 cs.CV cs.RO 新提交

GeneralVLA-2: Geometry-Aware Reconstruction and Governed Memory for Robot Planning

GeneralVLA-2: 几何感知重建与受控记忆用于机器人规划

Haoyu Wang, Guoqing Ma, Zeyu Zhang, Yandong Guo, Boxin Shi, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) CASIA(中国科学院自动化研究所) AI 2 Robotics

AI总结 针对机器人规划中3D物体重建幻觉和记忆质量不可控的问题,提出GeoFuse-MV3D几何先验引导重建分支和受控长期记忆系统,在GSO-30和Terminal-Bench等基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17446 2026-06-17 cs.RO cs.CV 新提交

AnnotateAnything: Automatic Annotation of 3D Assets for Robot Manipulation

AnnotateAnything:面向机器人操作的3D资产自动标注

Haoran Lu, Mutian Shen, Shuyang Yu, Yu Xiao, Songling Liu, Jianshu Zhang, Shang Wu, Yue Chen, Guo Ye, Jiayi Wang, Zhaoran Wang, Han Liu

机构 * Northwestern University(西北大学) Peking University(北京大学)

AI总结 提出AnnotateAnything框架,通过视觉-语言标注和物理标注双流水线,自动为3D资产生成可执行操作标签,提升仿真数据收集效率和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17530 2026-06-17 physics.soc-ph cs.LG econ.GN q-fin.EC stat.AP 新提交

Public transit gains and spatially uneven travel demand changes after NYC congestion pricing

纽约市拥堵收费后公共交通增益与空间不均的出行需求变化

Donghang Li, Dingyi Zhuang, Yunlin Li, Chenan Shen, Nina Cao, Yunhan Zheng, Shenhao Wang, Jinhua Zhao

机构 * Department of Civil and Environmental Engineering, Massachusetts Institute of Technology(麻省理工学院土木与环境工程系) Department of Urban Studies and Planning, Massachusetts Institute of Technology(麻省理工学院城市研究与规划系) Mathematical Institute, University of Oxford(牛津大学数学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(麻省理工学院机械工程系) College of Urban and Environmental Sciences, Peking University(北京大学城市与环境科学学院) Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系) Center for Computational Science and Engineering, Massachusetts Institute of Technology(麻省理工学院计算科学与工程中心)

AI总结 利用时间序列基础模型生成概率反事实预测,评估纽约市2025年实施的拥堵收费政策,发现公交和地铁客流量显著增加,但总体出行需求略有下降,且影响存在空间异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04990 2026-06-17 cs.CR cs.AI 版本更新

From Agent Traces to Trust: A Survey of Evidence Tracing and Execution Provenance in LLM Agents

从智能体痕迹到信任:LLM智能体中的证据追踪与执行溯源

Yiqi Wang, Jiaqi Zhang, Taotao Cai, Zirui Liu, Qingqiang Sun, Zequn Sun, Zhangkai Wu, Manqing Dong, Mingkai Zheng, Xuefei Yin, Yanming Zhu

机构 * Griffith University(格里菲斯大学) Jiangsu University(江苏大学) University of Southern Queensland(南方昆士兰大学) Peking University(北京大学) Great Bay University(大湾大学) Nanjing University(南京大学) Macquarie University(麦觉瑞大学) Southern University of Science and Technology(南方科学与技术大学)

AI总结 本文系统综述了LLM智能体中的证据追踪与执行溯源方法,通过统一溯源视角连接检索、工具使用、记忆等环节,提出分类体系并讨论开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22159 2026-06-17 cs.CV 版本更新

CASR: A Robust Cyclic Framework for Arbitrary Large-Scale Super-Resolution with Distribution Alignment and Self-Similarity Awareness

CASR:一种鲁棒的循环框架,用于任意大尺度超分辨率,具有分布对齐和自相似性意识

Wenhao Guo, Zhaoran Zhao, Peng Lu, Sheng Li, Qian Qiao, DeRui Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学)

AI总结 CASR通过分布对齐和自相似性意识,解决大尺度超分辨率中的分布漂移和扩散不一致问题,实现稳定推理和高效单模型处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06014 2026-06-17 cs.LG cs.AI math.OC math.ST stat.ML stat.TH 版本更新

Optimism Stabilizes Thompson Sampling for Adaptive Inference

乐观主义稳定自适应推断的汤普森采样

Shunxing Yan, Han Zhong

机构 * Peking University(北京大学)

AI总结 本文通过引入乐观机制(如方差膨胀或均值奖励)稳定汤普森采样,使得各臂拉取次数收敛于确定性尺度,从而在K臂随机bandit中实现渐近有效的Wald推断,并解决了多最优臂的扩展问题。

Comments Accepted in part to COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10962 2026-06-17 cs.LG cond-mat.dis-nn 版本更新

Noise-Driven Exploration and Transient Freezing Select Flat Minima in Stochastic Gradient Descent

噪声驱动的探索与瞬态冻结在随机梯度下降中选择平坦极小值

Ning Yang, Yikuan Zhang, Qi Ouyang, Chao Tang, Yuhai Tu

机构 * Peking University Chengdu Academy for Advanced Interdisciplinary Biotechnologies, Chengdu 610213, China School of Physics, Peking University, Beijing 100871, China Institute for Advanced Study in Physics, Zhejiang University, Hangzhou 310058, China Center for Quantitative Biology, Peking University, Beijing 100871, China Center for Computational Biology \& Center for Computational Neuroscience, Flatiron Institute, New York, NY 10010, USA

AI总结 通过分析SGD学习动力学,发现非平衡机制驱动解选择:瞬态探索阶段逃离尖锐谷,噪声重塑势能稳定平坦解,冻结延迟增强泛化。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17006 2026-06-16 cs.SD cs.AI cs.LG cs.MM eess.AS 新提交

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

TuneJury: 一种改进音乐生成偏好对齐的开放指标

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼AI) Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) QMUL(伦敦玛丽女王大学)

AI总结 提出TuneJury,一个开放、实例级别的成对奖励模型,用于文本到音乐生成,通过预测偏好分数支持数据筛选、后处理校准,并在推理、优化和训练中提升对齐效果。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16846 2026-06-16 cs.LG cs.AI 新提交

Deep Q-Learning on Hölder Spaces

Hölder空间上的深度Q学习

Qian Qi

机构 * Peking University(北京大学)

AI总结 研究连续时间随机控制中Q学习的算子核心,通过分析扩散设置下Bellman最优性目标的正则性和逼近复杂度,提出适应混合正则性的张量积DeepONet架构,并给出显式逼近和资源界限。

详情

展开后加载摘要…

URL PDF HTML 收藏