arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3042
2512.21004 2025-12-25 cs.CV

Learning from Next-Frame Prediction: Autoregressive Video Modeling Encodes Effective Representations

从下一帧预测学习:自回归视频建模编码有效表示

Jinghan Li, Yang Jin, Hao Jiang, Yadong Mu, Yang Song, Kun Xu

机构 * Peking University(北京大学)

AI总结 NExT-Vid通过掩码下一帧预测提出自回归视频预训练框架,提升视频生成质量和语义表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20937 2025-12-25 cs.CV

Beyond Artifacts: Real-Centric Envelope Modeling for Reliable AI-Generated Image Detection

超越伪影:面向真实世界的环境建模用于可靠的AI生成图像检测

Ruiqi Liu, Yi Han, Zhengbo Zhang, Liwei Yao, Zhiyuan Yan, Jialiang Shen, ZhiJin Chen, Boyi Sun, Lubin Weng, Jing Dong, Yan Wang, Shu Wu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Advanced Interdisciplinary Sciences, UCAS(北京大学交叉信息学科研究中心) Southwest University(西南大学) Shanghai Second Polytechnic University(上海第二工业大学) Peking University(北京大学) The University of Sydney(悉尼大学) Tsinghua University(清华大学)

AI总结 本文提出REM方法,通过建模真实图像分布来提升AI生成图像检测的可靠性,并构建RealChain基准以评估模型在真实世界退化下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16172 2025-12-25 math.NA cs.AI cs.LG cs.NA math.PR stat.ML

Physics-Informed Inference Time Scaling for Solving High-Dimensional PDE via Defect Correction

物理信息推理时间缩放:通过缺陷修正求解高维PDE

Zexi Fan, Yan Sun, Shihao Yang, Yiping Lu

机构 * Peking University(北京大学) Visa Inc.(Visa公司) Georgia Institute of Technology(佐治亚理工学院) Northwestern University(西北大学)

AI总结 SCaSML通过缺陷修正方法提高高维PDE求解的精度和效率,减少替代模型误差20-80%

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20635 2025-12-25 cs.LG

SHRP: Specialized Head Routing and Pruning for Efficient Encoder Compression

SHRP:用于高效编码器压缩的专用头部路由和剪枝

Zeli Su, Ziyin Zhang, Wenzheng Zhang, Zhou Liu, Guixian Xu, Wentao Zhang

机构 * Minzu University of China(民族大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 SHRP通过专用头部路由和剪枝技术,实现高效编码器压缩,减少参数并提升计算效率,适用于大规模和低延迟网络部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20479 2025-12-24 cs.CV

UTDesign: A Unified Framework for Stylized Text Editing and Generation in Graphic Design Images

UTDesign: 一种统一框架,用于图形设计图像中的风格化文本编辑与生成

Yiming Zhao, Yuanpeng Gao, Yuxuan Luo, Jiwei Duan, Shisong Lin, Longfei Xiong, Zhouhui Lian

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

AI总结 UTDesign提出了一种统一框架,实现高精度风格化文本编辑与生成,支持中英文文本,通过多模态编码器和DiT模型提升设计图像中的文本生成与编辑能力。

Comments 22 pages, 25 figures, SIGGRAPH Asia 2025, Conference Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20469 2025-12-24 cs.AI

Bohrium + SciMaster: Building the Infrastructure and Ecosystem for Agentic Science at Scale

Bohrium + SciMaster: 构建大规模智能科学的基础设施和生态系统

Linfeng Zhang, Siheng Chen, Yuzhu Cai, Jingyi Chai, Junhan Chang, Kun Chen, Zhi X. Chen, Zhaohan Ding, Yuwen Du, Yuanpeng Gao, Yuan Gao, Jing Gao, Zhifeng Gao, Qiangqiang Gu, Yanhui Hong, Yuan Huang, Xi Fang, Xiaohong Ji, Guolin Ke, Zixing Lei, Xinyu Li, Yongge Li, Ruoxue Liao, Hang Lin, Xiaolu Lin, Yuxiang Liu, Xinzijian Liu, Zexi Liu, Jintan Lu, Tingjia Miao, Haohui Que, Weijie Sun, Yanfeng Wang, Bingyang Wu, Tianju Xue, Rui Ye, Jinzhe Zeng, Duo Zhang, Jiahui Zhang, Linfeng Zhang, Tianhan Zhang, Wenchang Zhang, Yuzhi Zhang, Zezhong Zhang, Hang Zheng, Hui Zhou, Tong Zhu, Xinyu Zhu, Qingguo Zhou, Weinan E

机构 * DP Technology Beijing China(北京DP技术有限公司) AI for Science Institute Beijing China(北京AI for Science研究院) Shanghai Jiao Tong University Shanghai China(上海交通大学) Beihang University Beijing China(北京航空航天大学) Peking University Beijing China(北京大学) Institute of Theoretical Physics Chinese Academy of Sciences Beijing China(中国科学院理论物理研究所) Shanghai Innovation Institute Shanghai China(上海创新研究院) East China Normal University Shanghai China(华东师范大学) Zhongguancun Academy Beijing China(中关村学院) University of Science and Technology of China Hefei China(中国科学技术大学) Tongji University Shanghai China(同济大学) The Hong Kong University of Science and Technology Hong Kong China(香港科技大学)

AI总结 Bohrium+SciMaster通过构建基础设施和生态系统,实现大规模智能科学的高效工作流编排与执行,显著提升科学产出效率和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20333 2025-12-24 cs.AI q-bio.QM

SynCraft: Guiding Large Language Models to Predict Edit Sequences for Molecular Synthesizability Optimization

SynCraft: 引导大语言模型预测编辑序列以优化分子合成可行性

Junren Li, Luhua Lai

机构 * BNLMS, College of Chemistry and Molecular Engineering, Peking University, Beijing 100871, China(BNLMS,化学与分子工程学院,北京大学,北京100871,中国)

AI总结 SynCraft通过引导大语言模型预测编辑序列,优化分子合成可行性,提升生成分子的结构保真度和合成可行性。

Comments 28 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19758 2025-12-24 cs.SE cs.AI

Attention Distance: A Novel Metric for Directed Fuzzing with Large Language Models

注意力距离:一种用于大型语言模型定向模糊测试的新度量

Wang Bin, Ao Yang, Kedan Li, Aofan Liu, Hui Li, Guibo Luo, Weixiang Huang, Yan Zhuang

机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(广东超高清沉浸媒体技术省重点实验室,北京大学深圳研究生院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) China Mobile Internet CO(中国移动互联网公司)

AI总结 本文提出注意力距离度量,利用大型语言模型分析代码元素间的注意力分数,提升定向模糊测试效率,实验显示在38个漏洞复现实验中测试效率提升3.43倍,优于DAFL和WindRanger。

Comments Accepted to ICSE 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11006 2025-12-24 cs.CV cs.AI

Fine-Grained Instruction-Guided Graph Reasoning for Vision-and-Language Navigation

细粒度指令引导的图推理用于视觉-语言导航

Yaohua Liu, Xinyuan Song, Yunfu Deng, Yifan Xie, Binkai Ou, Yan Zhong

机构 * Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Department of Computer Science, Emory University(埃默里大学计算机科学系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Tsinghua University(清华大学) Innovation and Research and Development Department, BoardWare Information System Company(BoardWare信息系统公司创新与研发部) School of Mathematics, Peking University(北京大学数学学院)

AI总结 本文提出细粒度指令引导的图推理框架OIKG,通过解耦角度与视觉提示并增强空间表示,提升视觉-语言导航中指令理解和跨模态对齐能力。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19390 2025-12-23 cs.RO cs.CV cs.GR

TwinAligner: Visual-Dynamic Alignment Empowers Physics-aware Real2Sim2Real for Robotic Manipulation

TwinAligner: 视觉-动态对齐赋能物理感知的实境到仿真到现实的机器人操控

Hongwei Fan, Hang Dai, Jiyao Zhang, Jinzhou Li, Qiyang Yan, Yujie Zhao, Mingju Gao, Jinghang Wu, Hao Tang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学CFCS) PKU-AgiBot Lab(北京大学AgiBot实验室) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学)

AI总结 TwinAligner通过视觉和动态对齐技术,解决仿真与现实之间的差距,提升机器人操控的可扩展学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18892 2025-12-23 econ.TH cs.AI cs.LG

Structural Reinforcement Learning for Heterogeneous Agent Macroeconomics

异质主体宏观经济学的结构强化学习

Yucheng Yang, Chiyuan Wang, Andreas Schaab, Benjamin Moll

机构 * University of Zurich and SFI(苏黎世大学和SFI) Peking University, School of Computer Science and BIGAI(北京大学计算机学院和BIGAI) UC Berkeley(加州大学伯克利分校) London School of Economics(伦敦经济学院)

AI总结 本文提出结构强化学习方法,用于高效求解异质主体宏观经济学模型,克服传统方法限制,实现快速全局求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17296 2025-12-23 cs.CV

Towards Pixel-Wise Anomaly Location for High-Resolution PCBA via Self-Supervised Image Reconstruction

面向高分辨率PCBA的像素级异常定位方法:基于自监督图像重建

Wuyi Liu, Le Jin, Junxian Yang, Yuanchao Yu, Zishuo Peng, Jinfeng Xu, Xianzhi Li, Jun Zhou

机构 * Huazhong University of Science and Technology(华中科技大学) Siemens AG(西门子股份公司) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

AI总结 本文提出HiSIR-Net,通过自监督图像重建实现高分辨率PCBA的像素级异常定位,结合SIR-Gate和ROPS方案,提升定位精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23950 2025-12-23 cs.AI

InterMT: Multi-Turn Interleaved Preference Alignment with Human Feedback

InterMT:基于人类反馈的多轮交错偏好对齐

Boyuan Chen, Donghai Hong, Jiaming Ji, Jiacheng Zheng, Bowen Dong, Jiayi Zhou, Kaile Wang, Juntao Dai, Xuyao Wang, Wenqi Chen, Qirui Zheng, Wenxin Li, Sirui Han, Yike Guo, Yaodong Yang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 InterMT通过多轮多模态交互的偏好数据集探索,旨在提升多模态大模型的交互能力,结合人类反馈和专家注释,揭示多轮扩展规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18822 2025-12-23 cs.AI cs.CL

AdaCtrl: Towards Adaptive and Controllable Reasoning via Difficulty-Aware Budgeting

AdaCtrl: 通过难度感知预算分配实现适应性与可控性推理

Shijue Huang, Hongru Wang, Wanjun Zhong, Zhaochen Su, Jiazhan Feng, Bowen Cao, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

AI总结 AdaCtrl通过难度感知预算分配实现自适应推理控制,提升模型在不同任务中的效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14428 2025-12-23 cs.CV cs.AI

Comp-Attn: Present-and-Align Attention for Compositional Video Generation

Comp-Attn: 为组合视频生成的呈现与对齐注意力

Hongyu Zhang, Yufan Deng, Shenghai Yuan, Yian Zhao, Peng Jin, Xuehan Hou, Chang Liu, Jie Chen

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室) Tsinghua University, Beijing, China(清华大学)

AI总结 Comp-Attn通过呈现与对齐范式解决T2V生成中主体存在与关系对齐问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04162 2025-12-23 cs.IR cs.AI

Semantic Retrieval Augmented Contrastive Learning for Sequential Recommendation

语义检索增强对比学习用于序列推荐

Ziqiang Cui, Yunpeng Weng, Xing Tang, Xiaokun Zhang, Shiwei Li, Peiyang Liu, Bowei He, Dugang Liu, Weihong Luo, Xiuqiang He, Chen Ma

机构 * City University of Hong Kong(香港城市大学) Huazhong University of Science and Technology(华中科技大学) Tencent(腾讯) Shenzhen Technology University(深圳技术大学) Peking University(北京大学) Shenzhen University(深圳大学)

AI总结 SRA-CL通过利用LLMs的语义能力生成高质量对比对,提升序列推荐模型的性能。

Comments Accepted by NeurIPS 2025. Code is available at: https://github.com/ziqiangcui/SRA-CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18567 2025-12-23 cs.SE cs.AI

AI Code in the Wild: Measuring Security Risks and Ecosystem Shifts of AI-Generated Code in Modern Software

AI 代码在现实世界中的应用:衡量 AI 生成代码在现代软件中的安全风险和生态系统变化

Bin Wang, Wenjie Yu, Yilu Zhong, Hao Yu, Keke Lian, Chaohua Lu, Hongfang Zheng, Dong Zhang, Hui Li

机构 * Peking University(北京大学) Tencent(腾讯)

AI总结 本文研究了AI生成代码在现实世界中的安全风险和生态系统变化,通过大规模实证分析揭示了AI代码在软件开发中的分布、安全影响及人类与AI协作中的安全机制。

Comments https://mp.weixin.qq.com/s/sI_LKPnA-BeCVYr9Ko4sqg https://github.com/Narwhal-Lab/aicode-in-the-wild-security-risk-report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18437 2025-12-23 cs.CV cs.AI

MeniMV: A Multi-view Benchmark for Meniscus Injury Severity Grading

MeniMV:一种多视图的半月板损伤严重程度分级基准

Shurui Xu, Siqi Yang, Jiapin Ren, Zhong Cao, Hongwei Yang, Mengzhen Fan, Yuyu Sun, Shuyan Li

机构 * Queen's University Belfast(女王大学贝尔法斯特分校) Nantong University(南通大学) China University of Mining and Technology(中国矿业大学) Heidelberg University(海德堡大学) Peking University(北京大学)

AI总结 MeniMV是一种多视图基准数据集,用于半月板horn损伤严重程度分级,通过提供丰富的标注数据和双视图诊断上下文,推动自动化MRI分析的发展。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18126 2025-12-23 cs.AI cs.MA

Efficient Mixture-of-Agents Serving via Tree-Structured Routing, Adaptive Pruning, and Dependency-Aware Prefill-Decode Overlap

通过树状路由、自适应剪枝和依赖感知的预填解码重叠实现高效的混合代理服务

Zijun Wang, Yijiahao Qi, Hanqiu Chen, Zishen Wan, Gongjin Sun, Dongyang Li, Shuyi Pei, Cong Hao

机构 * Georgia Institute of Technology(佐治亚理工学院) Peking University(北京大学) Samsung Semiconductors, Inc.(三星半导体公司)

AI总结 本文提出一种高效的混合代理服务方法,通过树状路由、自适应剪枝和依赖感知的预填解码重叠,显著降低推理延迟并保持准确性。

Comments 13 pages, 4 figures, submitted to Design Automation Conference (DAC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17952 2025-12-23 cs.GT cs.AI econ.TH

Will AI Trade? A Computational Inversion of the No-Trade Theorem

AI是否会交易?对无交易定理的计算反向分析

Hanyu Li, Xiaotie Deng

机构 * Peking University(北京大学) School of Computer Science(计算机科学学院) CFCS(计算机科学与技术系)

AI总结 本文研究了在共同信念下,AI代理由于计算限制可能导致无法达到均衡,从而产生更活跃的交易环境。

Comments Accepted in WINE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12399 2025-12-23 cs.AI

A Survey of Vibe Coding with Large Language Models

基于大语言模型的Vibe编码调研

Yuyao Ge, Lingrui Mei, Zenghao Duan, Tianhao Li, Yujia Zheng, Yiwei Wang, Lexin Wang, Jiayu Yao, Tianyu Liu, Yujun Cai, Baolong Bi, Fangda Guo, Jiafeng Guo, Shenghua Liu, Xueqi Cheng

机构 * Institute of Computing Technology Chinese Academy of Sciences(中国科学院计算技术研究所) Duke University(杜克大学) University of California Merced(加州大学默塞德分校) Peking University(北京大学) University of Queensland(昆士兰大学)

AI总结 本文调研了基于大语言模型的Vibe编码方法,系统分析了其理论基础和五个开发模型,揭示了上下文工程与协作模式对成功的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01570 2025-12-23 stat.ML cs.LG physics.comp-ph stat.ME

Density estimation via mixture discrepancy and moments

通过混合差异和矩进行密度估计

Zhengyang Lei, Lirong Qu, Sihong Shao, Yunfeng Xiong

机构 * School of Mathematical Sciences, Peking University, Beijing 100871, China(北京大学数学科学学院) School of Mathematical Sciences, Beijing Normal University, Beijing 100875, China(北京师范大学数学科学学院)

AI总结 本文提出基于混合差异和矩的密度估计方法,通过替代星形偏差来提升计算效率和不变性,验证了在不同维度下的性能表现。

Comments Accepted by Numerical Mathematics: Theory, Methods and Applications on 2025/12/18

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25123 2025-12-22 cs.AI cs.CL

From $f(x)$ and $g(x)$ to $f(g(x))$: LLMs Learn New Skills in RL by Composing Old Ones

从f(x)和g(x)到f(g(x)):通过组合已有技能,LLMs在强化学习中学习新技能

Lifan Yuan, Weize Chen, Yuchen Zhang, Ganqu Cui, Hanbin Wang, Ziming You, Ning Ding, Zhiyuan Liu, Maosong Sun, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学)

AI总结 本研究通过强化学习使LLMs组合已有技能学习新能力,揭示强化学习在提升模型复杂任务处理能力中的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16676 2025-12-19 cs.LG cs.CL

DataFlow: An LLM-Driven Framework for Unified Data Preparation and Workflow Automation in the Era of Data-Centric AI

DataFlow:面向数据导向AI时代的统一数据准备与工作流自动化框架

Hao Liang, Xiaochen Ma, Zhou Liu, Zhen Hao Wong, Zhengyang Zhao, Zimo Meng, Runming He, Chengyu Shen, Qifeng Cai, Zhaoyang Han, Meiyi Qiang, Yalin Feng, Tianyi Bai, Zewei Pan, Ziyi Guo, Yizhen Jiang, Jingwen Deng, Qijie You, Peichao Lai, Tianyu Guo, Chi Hsu Tsai, Hengyi Feng, Rui Hu, Wenkai Yu, Junbo Niu, Bohan Zeng, Ruichuan An, Lu Ma, Jihao Huang, Yaowei Zheng, Conghui He, Linpeng Tang, Bin Cui, Weinan E, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究所) OriginHub Technology(OriginHub技术) OpenDataLab(OpenData实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) LLaMA-Factory Team(LLaMA-Factory团队)

AI总结 DataFlow通过统一的数据准备框架和自动化工作流,提升LLM性能,实现高效、可靠的数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16565 2025-12-19 math.OC cs.LG

Non-Asymptotic Global Convergence of PPO-Clip

PPO-Clip算法的非渐近全局收敛性

Yin Liu, Qiming Dai, Junyu Zhang, Zaiwen Wen

机构 * Beijing International Center for Mathematical Research, Peking University(北京国际数学研究中心,北京大学) School of Mathematical Sciences, Peking University(北京大学数学学院) Department of Industrial Systems Engineering and Management, National University of Singapore(新加坡国立大学工业系统工程与管理系) Beijing International Center for Mathematical Research and Center for Machine Learning Research, Peking University(北京国际数学研究中心和机器学习研究中心,北京大学)

AI总结 本文研究了PPO-Clip算法的非渐近全局收敛性,通过理论分析建立了前向KL正则化器的线性收敛率及反向KL正则化器的静止收敛与局部线性收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16494 2025-12-19 cs.CV cs.AI

PoseMoE: Mixture-of-Experts Network for Monocular 3D Human Pose Estimation

PoseMoE:用于单目3D人体姿态估计的专家混合网络

Mengyuan Liu, Jiajie Liu, Jinyan Zhang, Wenhao Li, Junsong Yuan

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家通用人工智能重点实验室,北京大学深圳研究生院) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) Department of Computer Science and Engineering, University at Buffalo, State University of New York(计算机科学与工程系,布法罗大学,纽约州立大学)

AI总结 PoseMoE通过专家混合网络提升单目3D人体姿态估计精度,通过解耦2D姿态与深度特征编码,优化深度特征学习与跨专家知识聚合。

Comments IEEE Transactions on Image Processing (T-IP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10918 2025-12-19 cs.RO

Unleashing Humanoid Reaching Potential via Real-world-Ready Skill Space

通过现实-ready技能空间释放人形机器人的抓取潜力

Zhikai Zhang, Chao Chen, Han Xue, Jilong Wang, Sikai Liang, Yun Liu, Zongzhang Zhang, He Wang, Li Yi

机构 * IIIS, Tsinghua University(清华大学人工智能研究院) Peking University(北京大学) Galbot Shanghai AI Laboratory(上海人工智能实验室) Shanghai Qi Zhi Institute(上海智院) Nanjing University(南京大学) Tongji University(同济大学)

AI总结 本研究提出R2S2方法,通过现实-ready技能空间提升人形机器人在现实环境中的抓取能力,实现高效且鲁棒的仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16101 2025-12-19 cs.MM cs.CV

A Tri-Dynamic Preprocessing Framework for UGC Video Compression

UGC视频压缩的三动态预处理框架

Fei Zhao, Mengxi Guo, Shijie Zhao, Junlin Li, Li Zhang, Xiaodong Xie

机构 * School of Computer Science, Peking University(北京大学计算机学院) Bytedance(字节跳动)

AI总结 本文提出一种三动态预处理框架,通过自适应调节预处理强度、量化级别和率失真损失函数,提升UGC视频压缩效果。

Comments Accepted as a POSTER and for publication in the ICASSP 2024 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12913 2025-12-19 cs.CL

MAIN: Mutual Alignment Is Necessary for instruction tuning

MAIN:互斥对齐是指令微调的必要条件

Fanyi Yang, Jianfeng Liu, Xin Zhang, Haoyu Liu, Xixin Cao, Yuefeng Zhan, Hao Sun, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

AI总结 本文提出MAIN框架,通过互斥约束增强指令与响应的一致性,提升LLM在多种基准上的性能。

Comments Accepted by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15069 2025-12-18 cs.CV cs.AI

PMMD: A pose-guided multi-view multi-modal diffusion for person generation

PMMD: 一种基于姿态的多视角多模态扩散用于人物生成

Ziyu Shang, Haoran Liu, Rongchao Zhang, Zhiqian Wei, Tongtong Feng

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Hong Kong, Hong Kong, China(香港城市大学) Peking University, Beijing, China(北京大学) Tsinghua University, Beijing, China(清华大学)

AI总结 PMMD通过多视角多模态扩散框架,实现可控姿态和外观的人像生成,提升一致性、细节保留和可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏