arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-04-29 至 2026-04-29 共收录 9
2604.25819 2026-04-29 cs.CV cs.SD

Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation

相互推动:双模式自我进化用于快速自回归音频视频生成

Yupeng Zhou, Lianghua Huang, Zhifan Wu, Jiabao Wang, Yupeng Shi, Biao Jiang, Daquan Zhou, Yu Liu, Ming-Ming Cheng, Qibin Hou

机构 * VCIP, School of Computer Science, Nankai University(南开大学计算机科学学院VCIP实验室) Tongyi Lab(通义实验室) Peking University(北京大学)

AI总结 本文提出Mutual Forcing框架,通过双阶段训练策略解决音频视频联合建模与快速自回归生成问题,通过共享参数实现自蒸馏,提升训练推理一致性,相比传统方法更高效且质量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25467 2026-04-29 cs.LG math.OC

Subspace Optimization for Efficient Federated Learning under Heterogeneous Data

子空间优化用于异构数据下的高效联邦学习

Shuchen Zhu, Zhengyang Huang, Yuqi Xu, Peijin Li

机构 * Peking University(北京大学) Beihang University(北航)

AI总结 本文提出子空间优化方法SSF,通过低维子空间进行异构性校正优化,降低通信和内存开销,实现非渐近收敛率和异构数据下的高效联邦学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25427 2026-04-29 cs.CV

A Systematic Post-Train Framework for Video Generation

视频生成的系统性后训练框架

Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li, Xiaoxuan He, Mengzhao Chen, Haoyang Huang, Nan Duan, Ping Luo

机构 * The University of Hong Kong(香港大学) JD Explore Academy(京东探索研究院) Tsinghua University(清华大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出系统性后训练框架,通过四个协同阶段提升视频生成的视觉质量、时间一致性和指令遵循性,同时保持预训练阶段的可控性。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25255 2026-04-29 cs.CV

Personalized Cross-Modal Emotional Correlation Learning for Speech-Preserving Facial Expression Manipulation

面向语音保留的面部表情操控的个性化跨模态情感相关学习

Tianshui Chen, Yujie Zhu, Jianman Lin, Zhijing Yang, Chunmei Qing, Feng Gao, Liang Lin

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Peking University(北京大学) Sun Yat-Sen University(中山大学)

AI总结 本文提出PCMECL算法,通过个性化提示和特征差分提升跨模态对齐,解决面部表情操控中情感操控的监督问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25244 2026-04-29 q-bio.BM cs.LG

Learning Structure, Energy, and Dynamics: A Survey of Artificial Intelligence for Protein Dynamics

学习结构、能量和动力学:人工智能在蛋白质动力学中的综述

Haocheng Tang, Liang Shi, Ya-Shi Zhang, Xixian Liu, Jian Tang, Jiarui Lu

机构 * Mila – Quebec AI Institute(魁北克AI研究所) University of Pittsburgh(匹兹堡大学) Peking University(北京大学) Université de Montréal(蒙特利尔大学) HEC Montréal(蒙特利尔HEC学院) CIFAR AI Chair(CIFAR人工智能主席)

AI总结 本文综述了人工智能在蛋白质动力学中的最新进展,从结构集合和轨迹学习、物理能量信号学习以及加速分子模拟三个方面探讨了核心方法与主要贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23712 2026-04-29 cs.LG cs.AI

OptProver: Bridging Olympiad and Optimization through Continual Training in Formal Theorem Proving

OptProver:通过持续训练在形式定理证明中弥合竞赛与优化的鸿沟

Chenyi Li, Yanchen Nie, Zhenyu Ming, Gong Zhang, Kun Yuan, Zaiwen Wen

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Huawei Technologies(华为技术有限公司) Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心)

AI总结 OptProver通过持续训练实现从竞赛数学到本科优化的高效迁移,结合大规模优化数据筛选与偏好学习目标,提升证明效率与鲁棒性,同时在Lean 4上建立新基准并取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07348 2026-04-29 cs.CV

MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

MICo-150K:一个多图像合成的综合数据集

Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Kai Cui, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出MICo-150K数据集,通过系统研究多图像合成任务,构建高质量图像和多样提示,结合人类反馈生成平衡的合成图像,同时建立评估基准和新指标,验证了数据集对模型提升的有效性。

Comments Project Page: https://MICo-150K.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏