arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-03-09 至 2026-03-09 共收录 10
2510.13669 2026-03-09 cs.CV cs.AI cs.LG

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23138 2026-03-09 cs.CV

VisualPrompter: Semantic-Aware Prompt Optimization with Visual Feedback for Text-to-Image Synthesis

VisualPrompter: 基于视觉反馈的语义感知提示优化用于文本到图像合成

Shiyu Wu, Mingzhen Sun, Weining Wang, Yequan Wang, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 VisualPrompter通过语义感知的提示优化机制,提升文本到图像合成的对齐性能和内容质量。

Comments ICLR2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06366 2026-03-09 cs.CV

OralGPT-Plus: Learning to Use Visual Tools via Reinforcement Learning for Panoramic X-ray Analysis

OralGPT-Plus:通过强化学习学习使用视觉工具进行全景X射线分析

Yuxuan Fan, Jing Hao, Hong Chen, Jiahao Bao, Yihua Shao, Yuci Liang, Kuo Feng Hung, Hao Tang

机构 * The Hong Kong University of Science and Technology (GZ)(香港科学与技术大学) Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) School of Computer Science, Peking University(北京大学计算机学院) Shanghai Jiao Tong University(上海交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)

AI总结 OralGPT-Plus通过强化学习实现全景X射线分析中的交互式对称推理,提升诊断可靠性。

Comments 34 pages, 24 figures, conference

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06357 2026-03-09 cs.CV

LATO: 3D Mesh Flow Matching with Structured TOpology Preserving LAtents

LATO:基于结构拓扑保持的3D网格流匹配

Tianhao Zhao, Youjia Zhang, Hang Long, Jinshen Zhang, Wenbing Li, Yang Yang, Gongbo Zhang, Jozef Hladký, Matthias Nießner, Wei Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Technical University of Munich(慕尼黑技术大学) Independent Researcher(独立研究者) Peking University(北京大学)

AI总结 LATO通过拓扑保持的潜在表示实现高效3D网格生成,结合流匹配技术生成复杂几何且拓扑结构良好的网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01288 2026-03-09 cs.LG

EDIS: Diagnosing LLM Reasoning via Entropy Dynamics

EDIS: 通过熵动力学诊断LLM推理

Chenghua Zhu, Siyan Wu, Xiangkang Zeng, Zishan Xu, Zhaolu Kang, Yifu Guo, Yuquan Lu, Junduan Huang, Guojing Zhou

机构 * South China Normal University(华南师范大学) Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

AI总结 EDIS通过分析LLM推理过程中的熵动态变化,识别错误推理的特征模式,提供有效的诊断信号以提升推理准确性。

Comments 16 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12436 2026-03-09 eess.AS cs.AI cs.LG cs.MM cs.SD

Purification Before Fusion: Toward Mask-Free Speech Enhancement for Robust Audio-Visual Speech Recognition

在融合前净化:迈向无掩码的语音增强以实现鲁棒的音频-视觉语音识别

Linzhi Wu, Xingyu Zhang, Hao Yuan, Yakun Zhang, Changyan Zheng, Liang Xie, Tiejun Liu, Erwei Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Defense Innovation Institute, Academy of Military Sciences(国防科技创新研究院) Peking University(北京大学) High-tech Institute(高新技术研究所)

AI总结 本文提出了一种端到端的噪声鲁棒音频-视觉语音识别框架,结合语音增强技术,在无需显式生成噪声掩码的情况下提升鲁棒性。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19674 2026-03-09 cs.LG cs.CV

C^2Prompt: Class-aware Client Knowledge Interaction for Federated Continual Learning

C²Prompt:面向联邦持续学习的类感知客户端知识交互

Kunlun Xu, Yibo Feng, Jiangmeng Li, Yongsheng Qi, Jiahuan Zhou

机构 * Wangxuan Institute of Computer Technology Peking University(北京大学王轩计算机技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Inner Mongolia University of Technology(内蒙古科技大学)

AI总结 C²Prompt通过增强类层面知识一致性,解决联邦持续学习中的时间与空间遗忘问题,实现最先进的性能。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2201.07798 2026-03-09 cs.LG cs.AI

A Cognitive Explainer for Fetal ultrasound images classifier Based on Medical Concepts

基于医学概念的胎儿超声图像分类器认知解释器

Yingni Wanga, Yunxiao Liua, Licong Dongc, Xuzhou Wua, Huabin Zhangb, Qiongyu Yed, Desheng Sunc, Xiaobo Zhoue, Kehong Yuan

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) University Town of Shenzhen, Nanshan District, Shenzhen(深圳大学城南山区深圳校区) Beijing Tsinghua Changgung Hospital(北京清华大学长庚医院) Peking University Shenzhen Hospital(北京大学深圳医院) Shenzhen Baoan District Maternal and Child Health Hospital(深圳宝安区妇幼保健医院)

AI总结 本文提出基于医学概念的可解释框架,通过图卷积神经网络构建概念关系,提升胎儿超声图像分类器的透明性和临床可解释性。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏