Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations
从下一帧预测学习:自回归视频建模编码有效表示
机构 * Peking University(北京大学)
AI总结 NExT-Vid通过掩码下一帧预测提出自回归视频预训练框架,提升视频生成质量和语义表示能力。
高校专区
从下一帧预测学习:自回归视频建模编码有效表示
机构 * Peking University(北京大学)
AI总结 NExT-Vid通过掩码下一帧预测提出自回归视频预训练框架,提升视频生成质量和语义表示能力。
超越伪影:面向真实世界的环境建模用于可靠的AI生成图像检测
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉信息学科研究中心) ; Southwest University(西南大学) ; Shanghai Second Polytechnic University(上海第二工业大学) ; Peking University(北京大学) ; The University of Sydney(悉尼大学) ; Tsinghua University(清华大学)
AI总结 本文提出REM方法,通过建模真实图像分布来提升AI生成图像检测的可靠性,并构建RealChain基准以评估模型在真实世界退化下的性能。
物理信息推理时间缩放:通过缺陷修正求解高维PDE
机构 * Peking University(北京大学) ; Visa Inc.(Visa公司) ; Georgia Institute of Technology(佐治亚理工学院) ; Northwestern University(西北大学)
AI总结 SCaSML通过缺陷修正方法提高高维PDE求解的精度和效率,减少替代模型误差20-80%
SHRP:用于高效编码器压缩的专用头部路由和剪枝
机构 * Minzu University of China(民族大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学)
AI总结 SHRP通过专用头部路由和剪枝技术,实现高效编码器压缩,减少参数并提升计算效率,适用于大规模和低延迟网络部署。
UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成
机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) ; State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)
AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。
Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper
Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统
机构 * DP Technology Beijing China(北京DP技术有限公司) ; AI for Science Institute Beijing China(北京AI for Science研究院) ; Shanghai Jiao Tong University Shanghai China(上海交通大学) ; Beihang University Beijing China(北京航空航天大学) ; Peking University Beijing China(北京大学) ; Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) ; Shanghai Innovation Institute Shanghai China(上海创新研究院) ; East China Normal University Shanghai China(华东师范大学) ; Zhongguancun Academy Beijing China(中关村学院) ; University of Science and Technology of China Hefei China(中国科学技术大学) ; Tongji University Shanghai China(同济大学) ; The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)
AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。
SynCraft: 引导大语言模型预测编辑序列以优化分子合成可行性
机构 * BNLMS, College of Chemistry and Molecular Engineering, Peking University, Beijing 100871, China(BNLMS,化学与分子工程学院,北京大学,北京100871,中国)
AI总结 SynCraft通过引导大语言模型预测编辑序列,优化分子合成可行性,提升生成分子的结构保真度和合成可行性。
Comments 28 pages, 4 figures, 1 table
注意力距离:一种用于大型语言模型定向模糊测试的新度量
机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,北京大学深圳研究生院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; China Mobile Internet CO(中国移动互联网公司)
AI总结 本文提出注意力距离度量,利用大型语言模型分析代码元素间的注意力分数,提升定向模糊测试效率,实验显示在38个漏洞复现实验中测试效率提升3.43倍,优于DAFL和WindRanger。
Comments Accepted to ICSE 2026 Research Track
细粒度指令引导的图推理用于视觉-语言导航
机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) ; Department of Computer Science, Emory University(埃默里大学计算机科学系) ; Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) ; Tsinghua University(清华大学) ; Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) ; School of Mathematics, Peking University(北京大学数学学院)
AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。
Comments 10 pages, 4 figures
TwinAligner: 视觉-动态对齐赋能物理感知的实境到仿真到现实的机器人操控
机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学CFCS) ; PKU-AgiBot Lab(北京大学AgiBot实验室) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)
AI总结 TwinAligner通过视觉和动态对齐技术,解决仿真与现实之间的差距,提升机器人操控的可扩展学习能力。
异质主体宏观经济学的结构强化学习
机构 * University of Zurich and SFI(苏黎世大学和SFI) ; Peking University, School of Computer Science and BIGAI(北京大学计算机学院和BIGAI) ; UC Berkeley(加州大学伯克利分校) ; London School of Economics(伦敦经济学院)
AI总结 本文提出结构强化学习方法,用于高效求解异质主体宏观经济学模型,克服传统方法限制,实现快速全局求解。
面向高分辨率PCBA的像素级异常定位方法:基于自监督图像重建
机构 * Huazhong University of Science and Technology(华中科技大学) ; Siemens AG(西门子股份公司) ; University of Electronic Science and Technology of China(电子科技大学) ; Peking University(北京大学)
AI总结 本文提出HiSIR-Net,通过自监督图像重建实现高分辨率PCBA的像素级异常定位,结合SIR-Gate和ROPS方案,提升定位精度与效率。
InterMT:基于人类反馈的多轮交错偏好对齐
机构 * Institute for AI, Peking University(人工智能研究院,北京大学) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) ; Hong Kong University of Science and Technology(香港科技大学)
AI总结 InterMT通过多轮多模态交互的偏好数据集探索,旨在提升多模态大模型的交互能力,结合人类反馈和专家注释,揭示多轮扩展规律。
AdaCtrl: 通过难度感知预算分配实现适应性与可控性推理
机构 * Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学)
AI总结 AdaCtrl通过难度感知预算分配实现自适应推理控制,提升模型在不同任务中的效率与效果。
Comp-Attn: 为组合视频生成的呈现与对齐注意力
机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) ; Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) ; Tsinghua University, Beijing, China(清华大学)
AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。
语义检索增强对比学习用于序列推荐
机构 * City University of Hong Kong(香港城市大学) ; Huazhong University of Science and Technology(华中科技大学) ; Tencent(腾讯) ; Shenzhen Technology University(深圳技术大学) ; Peking University(北京大学) ; Shenzhen University(深圳大学)
AI总结 SRA-CL通过利用LLMs的语义能力生成高质量对比对,提升序列推荐模型的性能。
Comments Accepted by NeurIPS 2025. Code is available at: https://github.com/ziqiangcui/SRA-CL
AI 代码在现实世界中的应用:衡量 AI 生成代码在现代软件中的安全风险和生态系统变化
机构 * Peking University(北京大学) ; Tencent(腾讯)
AI总结 本文研究了AI生成代码在现实世界中的安全风险和生态系统变化,通过大规模实证分析揭示了AI代码在软件开发中的分布、安全影响及人类与AI协作中的安全机制。
Comments https://mp.weixin.qq.com/s/sI_LKPnA-BeCVYr9Ko4sqg https://github.com/Narwhal-Lab/aicode-in-the-wild-security-risk-report
MeniMV:一种多视图的半月板损伤严重程度分级基准
机构 * Queen's University Belfast(女王大学贝尔法斯特分校) ; Nantong University(南通大学) ; China University of Mining and Technology(中国矿业大学) ; Heidelberg University(海德堡大学) ; Peking University(北京大学)
AI总结 MeniMV是一种多视图基准数据集,用于半月板horn损伤严重程度分级,通过提供丰富的标注数据和双视图诊断上下文,推动自动化MRI分析的发展。
Comments 5 pages, 2 figures
通过树状路由、自适应剪枝和依赖感知的预填解码重叠实现高效的混合代理服务
机构 * Georgia Institute of Technology(佐治亚理工学院) ; Peking University(北京大学) ; Samsung Semiconductors, Inc.(三星半导体公司)
AI总结 本文提出一种高效的混合代理服务方法,通过树状路由、自适应剪枝和依赖感知的预填解码重叠,显著降低推理延迟并保持准确性。
Comments 13 pages, 4 figures, submitted to Design Automation Conference (DAC) 2026
AI是否会交易?对无交易定理的计算反向分析
机构 * Peking University(北京大学) ; School of Computer Science(计算机科学学院) ; CFCS(计算机科学与技术系)
AI总结 本文研究了在共同信念下,AI代理由于计算限制可能导致无法达到均衡,从而产生更活跃的交易环境。
Comments Accepted in WINE 2025
基于大语言模型的Vibe编码调研
机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) ; Duke University(杜克大学) ; University of California Merced(加州大学默塞德分校) ; Peking University(北京大学) ; University of Queensland(昆士兰大学)
AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。
通过混合差异和矩进行密度估计
机构 * School of Mathematical Sciences, Peking University, Beijing 100871, China(北京大学数学科学学院) ; School of Mathematical Sciences, Beijing Normal University, Beijing 100875, China(北京师范大学数学科学学院)
AI总结 本文提出基于混合差异和矩的密度估计方法,通过替代星形偏差来提升计算效率和不变性,验证了在不同维度下的性能表现。
Comments Accepted by Numerical Mathematics: Theory, Methods and Applications on 2025/12/18
从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Tsinghua University(清华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学)
AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。
DataFlow:面向数据导向AI时代的统一数据准备与工作流自动化框架
机构 * Peking University(北京大学) ; Institute for Advanced Algorithms Research(先进算法研究所) ; OriginHub Technology(OriginHub技术) ; OpenDataLab(OpenData实验室) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; LLaMA-Factory Team(LLaMA-Factory团队)
AI总结 DataFlow通过统一的数据准备框架和自动化工作流,提升LLM性能,实现高效、可靠的数据处理。
PPO-Clip算法的非渐近全局收敛性
机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) ; School of Mathematical Sciences, Peking University(北京大学数学学院) ; Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) ; Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)
AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。
PoseMoE:用于单目3D人体姿态估计的专家混合网络
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) ; College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) ; Department of Computer Science and Engineering, University at Buffalo, State University of New York(计算机科学与工程系,布法罗大学,纽约州立大学)
AI总结 PoseMoE通过专家混合网络提升单目3D人体姿态估计精度,通过解耦2D姿态与深度特征编码,优化深度特征学习与跨专家知识聚合。
Comments IEEE Transactions on Image Processing (T-IP)
通过现实-ready技能空间释放人形机器人的抓取潜力
机构 * IIIS, Tsinghua University(清华大学人工智能研究院) ; Peking University(北京大学) ; Galbot ; Shanghai AI Laboratory(上海人工智能实验室) ; Shanghai Qi Zhi Institute(上海智院) ; Nanjing University(南京大学) ; Tongji University(同济大学)
AI总结 本研究提出R2S2方法,通过现实-ready技能空间提升人形机器人在现实环境中的抓取能力,实现高效且鲁棒的仿真到现实转移。
UGC视频压缩的三动态预处理框架
机构 * School of Computer Science, Peking University(北京大学计算机学院) ; Bytedance(字节跳动)
AI总结 本文提出一种三动态预处理框架,通过自适应调节预处理强度、量化级别和率失真损失函数,提升UGC视频压缩效果。
Comments Accepted as a POSTER and for publication in the ICASSP 2024 proceedings
MAIN:互斥对齐是指令微调的必要条件
机构 * Peking University(北京大学) ; Microsoft Corporation(微软公司)
AI总结 本文提出MAIN框架,通过互斥约束增强指令与响应的一致性,提升LLM在多种基准上的性能。
Comments Accepted by EMNLP 2025
PMMD: 一种基于姿态的多视角多模态扩散用于人物生成
机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) ; City University of Hong Kong, Hong Kong, China(香港城市大学) ; Peking University, Beijing, China(北京大学) ; Tsinghua University, Beijing, China(清华大学)
AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。