arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-07-03 至 2026-07-03 共收录 10
2607.02266 2026-07-03 cs.LG cs.AI cs.CL 新提交

HERMES: A Multi-Granularity Labeling Substrate for Pre-training Data Mixtures

HERMES:一种用于预训练数据混合的多粒度标注基底

Ziyun Qiao, Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant Peking University(北京大学) University of Science and Technology of China(中国科学技术大学)

AI总结 提出HERMES层次化标注基底,通过语义变换和三级残差向量量化实现从粗到细的数据编码,支持多粒度混合策略,在1B参数、25B token预训练中揭示固定粒度无法检测的交互效应,提升16任务宏平均+0.0253。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01978 2026-07-03 cs.AI cs.CL cs.CV 新提交

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

多模态知识编辑范围泛化用于在线递归MLLM编辑

Siyuan Li, Youyuan Zhang, Ruitong Liu, Junxi Wang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Peking University(北京大学) Fudan University(复旦大学)

AI总结 针对在线多模态知识编辑中编辑范围难以控制的问题,提出ScopeEdit方法,通过模态局部吸收分支和证据门控共享泛化分支实现范围分离的在线编辑,在保持可靠性的同时提升跨模态泛化与无关输入隔离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01810 2026-07-03 cs.SE cs.AI 新提交

Decoupling Code Complexity from Newcomer Participation: A Causal Study of AI Coding Agent Adoption in OSS

解耦代码复杂度与新参与者参与度:AI编码代理在开源软件中采纳的因果研究

Weiwei Xu, Xuanning Cui, Hengzhi Ye, Minghui Zhou

机构 * School of Computer Science, Peking University(北京大学计算机学院) Key Laboratory of High Confidence Software Technologies, Ministry of Education, China(教育部高可信软件技术重点实验室)

AI总结 通过因果推断方法,研究AI编码代理(如Cursor和Claude Code)在开源项目中的采纳是否会导致新参与者减少,发现采纳后新参与者流入未显著下降,代码复杂度虽有增加但未影响新人参与。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01729 2026-07-03 cs.AI cs.SD 新提交

DRL-CLBA: A Clean Label Backdoor Attack for Speech Classification via DDPG Reinforcement Learning

DRL-CLBA:基于DDPG强化学习的语音分类干净标签后门攻击

Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen

机构 * Xiangtan University(湘潭大学) Peking University(北京大学)

AI总结 提出DRL-CLBA,一种利用深度确定性策略梯度(DDPG)强化学习和深度音频隐写术的干净标签后门攻击方法,无需标签迁移即可污染目标样本,在多个数据集和模型上实现高攻击成功率并绕过多种防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01702 2026-07-03 cs.CR cs.AI cs.SD 新提交

Pmeta-TLA: Backdoor Attacks for Speech Classification Models via Meta-Learning with Timbre Leakage Attack

Pmeta-TLA:通过元学习与音色泄露攻击的语音分类模型后门攻击

Yueming Huang, Wenhan Yao, Fen Xiao, Xiarun Chen, Weiping Wen

机构 * Xiangtan University(湘潭大学) Peking University(北京大学)

AI总结 提出音色泄露攻击(TLA)和Pmeta-TLA训练机制,利用元学习和投影冲突梯度实现多后门注入,在关键词识别任务中达到高攻击成功率、隐蔽性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01651 2026-07-03 cs.RO 新提交

One Demonstration Is Enough for Real-World Robotic Reinforcement Learning

一个演示足以实现真实世界机器人强化学习

Yuwan Liu, Hongze Yu, Song Liu, Yuhan Wang, Junge Zhang, Yaodong Yang, Yuanpei Chen, Ceyao Zhang

机构 * National Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institution of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统认知与决策智能国家重点实验室) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) PKU-PsiBot Joint Lab(北大-鹏城实验室联合实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 提出AutoSERL框架,仅需一个演示即可自动化真实世界机器人强化学习,通过滑动窗口干预、安全恢复和自动终止机制,在六个接触密集型任务上超越基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01628 2026-07-03 cs.CV 新提交

Online Segment 3D Gaussians via Launching Virtual Drones

通过发射虚拟无人机在线分割3D高斯体

Liwei Liao, Rongjie Wang, Ronggang Wang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东省超高清沉浸式媒体技术重点实验室,北京大学深圳研究生院) Pengcheng Laboratory(鹏城实验室) Peking University(北京大学)

AI总结 提出SAGO框架,通过虚拟无人机将3D分割转化为在线最佳视角规划任务,无需预设置即可在亚秒内从3D高斯体中提取干净3D资产。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02206 2026-07-03 stat.ML cs.LG math.ST stat.TH 新提交

Prediction Sets for Counterfactual Decisions: Coverage, Optimality, and Conformal Prediction

反事实决策的预测集:覆盖性、最优性与共形预测

Yurui Zheng, Ying Jin

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系)

AI总结 提出决策理论框架,通过策略耦合覆盖性将不确定性量化与反事实决策最优结合,并开发两阶段共形预测方法PC-RACP,在保证覆盖的同时提升效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01232 2026-07-03 cs.LG cs.CL 新提交

Is One Layer Enough? Training A Single Transformer Layer Can Match Full-Parameter RL Training

一层就够了吗?训练单个Transformer层可以匹配全参数RL训练

Zijian Zhang, Rizhen Hu, Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Hongzhou Lin, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学) Peking University(北京大学) Amazon(亚马逊)

AI总结 发现RL训练收益高度集中在少数Transformer层,仅训练单层即可恢复大部分全参数RL收益,且高贡献层集中在模型中部。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28016 2026-07-03 cs.CV 新提交

TempAct: Advancing Temporal Plausibility in Autoregressive Video Generation via Planner-Executor RL

TempAct: 通过规划器-执行器强化学习推进自回归视频生成中的时间合理性

Jing Wang, Xiangxin Zhou, Jiajun Liang, Kaiqi Liu, Wanyuan Pang, Zhenyu Xie, Tianyu Pang, Xiaodan Liang

机构 * Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区) Tencent Hunyuan(腾讯混元) Tsinghua University(清华大学) Peking University(北京大学) USTB(北京科技大学)

AI总结 提出TempAct框架,利用规划器-执行器强化学习联合优化时间分解与步骤条件执行,解决自回归视频生成中时间指令模糊、延迟反应和错误传播问题,提升时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏