arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-08-10 至 2026-08-10 共收录 12
2608.07019 2026-08-10 cs.AI 新提交

ReQuant: Fixed-Grid Discrete Refinement for Post-Training Quantization

ReQuant:用于训练后量化的固定网格离散细化

Yongge Ma, Guoan Wang, Feiyu Wang, Yaoming Li, Qian Zhang, Zihan Yan, Yinjun Han, Tong Yang

机构 * School of Computer Science, Peking University(北京大学计算机学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Physics, Peking University(北京大学物理学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Central Research Institute, ZTE Corporation(中兴公司中央研究院)

AI总结 ReQuant是用于训练后量化(PTQ)的无反向传播固定网格细化方法,可作为即插即用后处理阶段,提升各类PTQ初始化器生成的量化模型性能,在低位宽下增益显著。

Comments 10 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07015 2026-08-10 cs.CV 新提交

Understand Before Detect: Vision--Language Learning for Omni-Domain Infrared Small Target Detection

先理解再检测:用于全域红外小目标检测的视觉-语言学习

Haoyang Yuan, Boyang Li, Yingqian Wang, Yimian Dai, Nuo Chen, Xinfei Huang, Shuqi Yi, Zaiping Lin, Weidong Sheng, Wei An

机构 * National University of Defense Technology(国防科技大学) College of Computer Science, Nankai University(南开大学计算机学院) Peking University(北京大学)

AI总结 针对全域红外小目标检测的域偏移问题,提出“先理解再检测”范式及JinSight方法,构建视觉-语言数据集OmniIRST-VL,实现跨异构红外域的泛化检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06930 2026-08-10 cs.CV 新提交

AVCap: Reinforcing Audio-Video Joint Caption with Detail-Aware Reward

AVCap:用细节感知奖励强化音视频联合字幕

Mingyang Wu, Kaituo Feng, Bohao Li, Kaixiong Gong, Zihao Yin, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Peking University(北京大学)

AI总结 针对音视频联合字幕的数据集、奖励信号、评估基准的局限,提出AVCap-100K数据集、AVCap模型及专用基准指标,通过Da-GRPO优化的AVCap模型性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06794 2026-08-10 cs.CV 新提交

PAST: Prompt-Adaptive Sampling Termination for Efficient Diffusion Model

PAST:用于高效扩散模型的提示自适应采样终止

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 PAST是一种提示自适应采样终止方法,通过双自适应协调机制提升扩散模型RL微调的计算效率与偏好优化质量,效率最高提升66.7%,质量最高提升29.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06768 2026-08-10 cs.CV 新提交

Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models

探索还是收敛?面向扩散模型的阶段引导式逐步优化方法

Renye Yan, Jikang Cheng, You Wu, Wei Peng, Zongwei Wang, Ling Liang, Yimao Cai

机构 * Peking University(北京大学) Nanjing University(南京大学) Stanford University(斯坦福大学)

AI总结 针对扩散模型RL偏好对齐的奖励不匹配问题,提出SGPO方法,通过分阶段分配目标,使生成质量提升26.7%、收敛速度提高36.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06745 2026-08-10 cs.AI 新提交

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

MemPrism:面向长程智能体的任务条件关系记忆视图

Zhisheng Chen, Bingfan Zeng, Bangde Cao, Zhengwei Xie, Yuxuan Li, Jinhan Li, Zheng Lu, Xiangchen Guan, Zikai Xiao, Rui Qian, Jingwei Song

机构 * Nanyang Technological University(南洋理工大学) South China University of Technology(华南理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对长程智能体记忆系统的表示不匹配问题,提出MemPrism任务条件关系记忆框架,经实验验证可提升长程任务性能、减少记忆消耗且视图策略可跨VLM迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06404 2026-08-10 cs.CV cs.LG 新提交

UAV3DCrop: Benchmarking 3D Reconstruction in Repeated Multi-Angle UAV Crop Surveys

UAV3DCrop:面向重复多视角无人机作物调查的三维重建基准测试

Junxiong Zhou, Xuechen Li, Chonghao Qiu, Lang Qiao, Xiaowei Jia, Qi Yang, Chishan Zhang, Leikun Yin, Nanshan You, Vipin Kumar, David Mulla, Ce Yang, Zhenong Jin, Licheng Liu

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城校区) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Pittsburgh(匹兹堡大学) Max Planck Institute for Biogeochemistry(马克斯·普朗克生物地球化学研究所) Boston University(波士顿大学) Peking University(北京大学)

AI总结 本文提出UAV3DCrop基准,评估NeRF、3DGS等场景优化方法及预训练前馈模型在作物三维重建任务的表现,发现无单一方法适配所有农艺需求,仅一种前馈模型可恢复可用度量尺度。

Comments 22 pages, 7 figures. Dataset and project page: https://link-dev.github.io/UAV3DCrop/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04111 2026-08-10 cs.CV cs.CL cs.LO 版本更新

GEB-Bench: Abstract Structures Told in Many Voices

GEB-Bench:多视角呈现的抽象结构

Tong Zhang, Zhiyuan Shi, Yun Peng, Tao Xie

机构 * Fudan University(复旦大学) Peking University(北京大学)

AI总结 本研究推出GEB-Bench基准,评估12种模型发现其在结构识别与跨视角映射间存在差距,仅前沿模型能缩小该差距,且表面复杂性会增加模型负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25001 2026-08-10 cs.LG 版本更新

Mitigating Gradient Pathology in PINNs through Aligned Constraint

通过对齐约束缓解PINN中的梯度病理

Yichen Luo, Peiyu Zhu, Dongxiao Hu, Jia Wang, Tailin Wu, Dapeng Lan, Yu Liu, Zhibo Pang

机构 * Department of Information Science and Engineering, KTH Royal Institute of Technology, Stockholm, Sweden(信息科学与工程系,皇家理工学院,斯德哥尔摩,瑞典) School of Advanced Manufacturing and Robotics, Peking University, Beijing, China(先进制造与机器人学院,北京大学,北京,中国) School of Advanced Technology, Xi’an Jiaotong-Liverpool University, Suzhou, China(先进技术学院,西安交通大学利物浦大学,苏州,中国) Department of AI, School of Engineering, Westlake University, Hangzhou, China(人工智能系,工程学院,西湖大学,杭州,中国)

AI总结 针对物理信息神经网络训练中梯度冲突导致的局部最优问题,提出约束对齐损失与流形提升方法,通过重新表述零阶项为对齐约束并引入延迟因子,显著提升数值稳定性和效率。

Comments Accepted by ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07327 2026-08-10 cs.CV 版本更新

Teacher-Feature Drifting: One-Step Diffusion Distillation with Pretrained Diffusion Representations

教师特征漂移:基于预训练扩散表示的一步扩散蒸馏

Yuan Zhang, Chenyi Li, Haodong Yu, Guoqing Ma, Jiajun Zha, Yuanming Yang, Bo Wang, Wei Tang, Wenbo Li, Haoyang Huang, Nan Duan

机构 * JD Explore Academy(京东探索研究院) Peking University(北京大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出通过单步扩散蒸馏简化模型,利用预训练扩散教师自身的特征空间,无需额外网络即可实现语义特征几何的漂移,同时引入轻量模式覆盖损失以提升生成质量和多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17889 2026-08-10 cs.CV 版本更新

Identity as Presence: Towards Appearance and Voice Personalized Joint Audio-Video Generation

身份作为存在:迈向基于外观和声音的联合音频视频生成

Qin Chen, Yingjie Chen, Shilun Lin, Cai Xing, Binxin Yang, Long Zhou, Qixin Yan, Wenjing Wang, Dingming Liu, Hao Liu, Chen Li, Jing Lyu

机构 * Tencent Inc.(腾讯公司) Peking University(北京大学)

AI总结 本文提出一个统一的框架,实现身份感知的音频视频生成,通过数据整理管道和灵活的身份注入机制,提升生成内容的高保真度和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06769 2026-08-10 cs.CV cs.AI

Stitch and Tell: A Structured Multimodal Data Augmentation Method for Spatial Understanding

拼接与讲述:一种结构化多模态数据增强方法用于空间理解

Hang Yin, Xiaomin He, PeiWen Yuan, Yiwei Li, Jiayi Shi, Wenxiao Fan, Shaoxiong Feng, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Xiaohongshu Inc(小红书公司)

AI总结 Stitch and Tell通过结构化空间监督提升视觉-语言模型的空间理解能力,有效缓解空间幻觉并提高相关任务性能。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏