arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-05-12 至 2026-05-12 共收录 43
2605.08741 2026-05-12 cs.CL

Training with Harnesses: On-Policy Harness Self-Distillation for Complex Reasoning

通过Harness训练:面向复杂推理的在线策略Harness自蒸馏

Zhengyang Zhao, Lu Ma, Wentao Zhang

机构 * Peking University(北京大学)

AI总结 本文提出OPHSD方法,通过将增强的模型作为教师进行自蒸馏,提升模型在复杂推理任务中的泛化能力和独立表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08722 2026-05-12 cs.RO cs.MA

HULK: Large-scale Hierarchical Coordination under Continual and Uncertain Temporal Tasks

HULK:大规模层次协调在连续和不确定的时间任务中

Qingyuan Luo, Jie Li, Meng Guo

机构 * Department of Mechanics and Engineering Science, College of Engineering, Peking University(力学与工程科学系,工程学院,北京大学) National University of Defense Technology(国防科学技术大学)

AI总结 本文提出HULK框架,解决连续和不确定时间任务下的大规模协调问题,通过分层结构提升计算效率和鲁棒性。

Comments Accepted to the IEEE International Conference on Robotics and Automation. 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08639 2026-05-12 cs.LG

ReLibra: Routing-Replay-Guided Load Balancing for MoE Training in Reinforcement Learning

ReLibra:基于路由回放的MoE训练负载均衡

Chao Jin, Xinming Wei, Yinmin Zhong, Chengxu Yang, Bingyang Wu, Ruidong Zhu, Zili Zhang, Yuliang Liu, Xin Jin

机构 * School of Computer Science, Peking University(北京大学计算机学院)

AI总结 ReLibra通过利用强化学习的回放训练流程中的路由回放机制,在微批次粒度上实现细粒度负载均衡,提升MoE训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04665 2026-05-12 cs.CL

Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs

句式转换导致的输出模式崩溃:当LLMs在语义等价输入下失衡

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

AI总结 研究发现,当请求内容被重写时,大语言模型往往无法保持原任务格式,提出了提示变体输出模式崩溃现象,并通过PARACONSIST基准测试评估模型鲁棒性。

Comments Added a footnote; author order is alphabetical by last name

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03456 2026-05-12 cs.CV

VL-SAM-v3: Memory-Guided Visual Priors for Open-World Object Detection

VL-SAM-v3:基于记忆的开放世界目标检测视觉先验

Chih-Chung Liu, Zhiwei Lin, Yongtao Wang

机构 * Wangxuan Institute of Computer Technology, Peking University, China(北京大学计算机科学技术研究院)

AI总结 VL-SAM-v3通过引入检索驱动的外部视觉记忆,提升开放世界目标检测的性能,尤其在稀有类别和复杂场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00327 2026-05-12 cs.AI cs.HC

SayNext-Bench: Why Do LLMs Struggle with Next-Utterance Anticipation?

SayNext-Bench:为什么LLMs在下一句预测中挣扎?

Yueyi Yang, Haotian Liu, Fang Kang, Mengqi Zhang, Zheng Lian, Hao Tang, Haoyu Chen

机构 * University of Oulu(奥卢大学) College of William and Mary(威廉与玛丽学院) Tongji University(同济大学) Peking University(北京大学)

AI总结 研究探讨LLM在人类对话中的下一句预测能力,指出人类可通过多模态线索预测,而LLM表现不足。提出SayNext-Bench基准,结合多模态数据集和评估框架,开发SayNext-Chat模型,证明其在多层面优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19115 2026-05-12 cs.CV

Generative Giants, Retrieval Weaklings: Why do Multimodal Large Language Models Fail at Multimodal Retrieval?

生成巨人,检索弱者:为何多模态大语言模型在多模态检索中表现不佳?

Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) Tencent Inc(腾讯公司) Zhongguancun Academy(中关村学院)

AI总结 研究揭示多模态大语言模型在多模态检索中表现不佳的原因,通过稀疏自编码器分析发现其表示空间主要由文本语义构成,视觉语义不足,导致检索性能下降,提出ReAlign方法提升检索效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12542 2026-05-12 cs.LG cs.AI cs.CV stat.ML

PLD: A Choice-Theoretic List-Wise Knowledge Distillation

PLD: 一种基于选择理论的列表级知识蒸馏

Ejafa Bassam, Dawei Zhu, Kaigui Bian

机构 * School of Computer Science, Peking University(北京大学计算机科学学院)

AI总结 本文提出PLD,一种基于Plackett-Luce模型的列表级知识蒸馏方法,通过将教师logits视为'价值'评分,直接优化教师最优排名,实现凸且平移不变的替代目标,涵盖加权交叉熵。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025), 136090--136112 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01352 2026-05-12 cs.LG

TAH-QUANT: Effective Activation Quantization in Pipeline Parallelism over Slow Network

TAH-QUANT: 在慢速网络下的流水线并行中有效的激活量化

Guangxin He, Yuan Cao, Yutong He, Tianyi Bai, Kai Chen, Kun Yuan, Binhang Yuan

机构 * HKUST(香港科技大学) Peking University(北京大学)

AI总结 本文提出TAH-Quant框架,通过细粒度切片量化、熵引导的自适应位分配和Hadamard变换,减少量化误差并提升训练效率,实验证明其在保持收敛性的同时提升了吞吐量和速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13451 2026-05-12 cs.RO

MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation

MapNav: 一种通过标注语义地图的新型记忆表示方法用于视觉-语言导航

Lingfeng Zhang, Xiaoshuai Hao, Qinwen Xu, Qiang Zhang, Xinyao Zhang, Pengwei Wang, Jing Zhang, Zhongyuan Wang, Shanghang Zhang, Renjing Xu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Beijing Innovation Center of Humanoid Robotics Co., Ltd.(北京人形机器人创新中心有限公司) School of Computer Science, Wuhan University(武汉大学计算机学院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室,计算机学院)

AI总结 本文提出MapNav,通过标注语义地图替代传统历史帧,提升视觉-语言导航任务的性能,实验表明其在模拟和现实环境中均达到SOTA水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08296 2026-05-12 cs.CV eess.SP

BenchHAR: Benchmarking Self-Supervised Learning for Generalizable Sensor-based Activity Recognition

BenchHAR: 用于通用传感器活动识别的自监督学习基准测试

Yize Cai, Rui Feng, Anlan Yu, Baoshen Guo, Zhiqing Hong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Peking University(北京大学) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

AI总结 BenchHAR针对传感器活动识别中数据异质性和标注数据稀缺问题,系统比较了自监督学习方法的泛化性能,发现混合范式和CNN编码器在性能上表现最佳,且增加预训练数据量能提升泛化能力。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08250 2026-05-12 cs.CV cs.AI

Why Do DiT Editors Drift? Plug-and-Play Low Frequency Alignment in VAE Latent Space

为何DiT编辑器会漂移?VAE潜在空间中的插件式低频对齐

Xiaoce Wang, Sifan Zhou, Kaifei Wang, Leli Xu, Xuerui Qiu, Tao He, Ming Li

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学) Peking University(北京大学) CASIA University of Electronic Science and Technology of China(电子科技大学) Guangming Laboratory(光明实验室)

AI总结 本文从潜在空间频率角度研究DiT编辑器漂移问题,提出无需训练的VAE-LFA方法,通过低频对齐抑制语义漂移并保持高频细节,适用于白盒和黑盒DiT编辑器。

Comments 9 pages main paper, 12 figures, 25 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08129 2026-05-12 cs.LG

Towards Customized Multimodal Role-Play

迈向定制化的多模态角色扮演

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang, Jiangning Zhang, Yunhai Tong

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

AI总结 本文提出定制化多模态角色扮演任务,通过统一模型和两阶段训练框架实现角色个性化,实验表明方法在角色扮演任务中优于现有方法。

Comments Code available at https://github.com/Tangc03/UniCharacter Project page available at https://tangc03.github.io/UniCharacter.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏