arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

高校专区

Peking University(北京大学)

2026-03-25 至 2026-03-25 共收录 13
2506.11167 2026-03-25 cs.CV cs.LG

Towards a general-purpose foundation model for fMRI analysis

面向fMRI分析的通用基础模型

Cheng Wang, Yu Jiang, Zhihao Peng, Chenxin Li, Changbae Bang, Lin Zhao, Wanyi Fu, Jinglei Lv, Jorge Sepulcre, Carl Yang, Lifang He, Tianming Liu, Xue-Jun Kong, Quanzheng Li, Daniel S. Barron, Anqi Qiu, Randy Hirschtick, Byung-Hoon Kim, Hongbin Han, Xiang Li, Yixuan Yuan

机构 * The Chinese University of Hong Kong, Hong Kong(香港中文大学) Yonsei University, Seoul, South Korea(延世大学) University of Georgia, Athens, GA(佐治亚大学) Peking University Health Science Center, Beijing, China(北京大学医学部) University of Sydney, Sydney, Australia(悉尼大学) Yale School of Medicine, New Haven, CT(耶鲁医学院) Emory University, Atlanta, GA(埃默里大学) Lehigh University, Bethlehem, PA(莱斯利大学) Boston Children’s Hospital, Boston, MA(波士顿儿童医院) Massachusetts General Hospital, Boston, MA(麻省总医院) Brigham and Women’s Hospital, Boston, MA(布里奇沃特医院) Hong Kong Polytechnic University, Hong Kong(香港理工大学) Kempner Institute for Natural and Artificial Intelligence, Cambridge, MA(Kempner自然与人工智能研究所)

AI总结 本文提出NeuroSTORM模型,通过直接学习4D fMRI数据的通用表示,实现跨任务高效迁移,优于现有方法在五类下游任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22998 2026-03-25 cs.CV

VQ-Jarvis: Retrieval-Augmented Video Restoration Agent with Sharp Vision and Fast Thought

VQ-Jarvis:具备锐利视觉与快速思考的检索增强视频修复代理

Xuanyu Zhang, Weiqi Li, Qunliang Xing, Jingfen Xie, Bin Chen, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, Shenzhen, China(北京大学电子与计算机工程学院,深圳,中国) ByteDance Inc., Shenzhen, China(字节跳动公司,深圳,中国)

AI总结 本文提出VQ-Jarvis,一种具备锐利视觉与快速思考的视频修复代理,通过构建大规模视频配对增强数据集和分层操作调度策略,提升视频修复的准确性和效率。

Comments Video restoration, Agent-based restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22935 2026-03-25 cs.AI cs.HC

Ran Score: a LLM-based Evaluation Score for Radiology Report Generation

Ran Score:一种基于大语言模型的放射学报告生成评估分数

Ran Zhang, Yucong Lin, Zhaoli Su, Bowen Liu, Danni Ai, Tianyu Fu, Deqiang Xiao, Jingfan Fan, Yuanyuan Wang, Mingwei Gao, Yuwan Hu, Shuya Gao, Jingtao Li, Jian Yang, Hong Song, Hongliang Sun

机构 * School of Optics and Photonics, Beijing Institute of Technology(光学与光子学学院,北京理工大学) School of Medical Technology, Beijing Institute of Technology(医学技术学院,北京理工大学) Department of Radiology, China-Japan Friendship Hospital (Institute of Clinical Medical Sciences), Beijing 100029, China(日本友谊医院放射科(临床医学科学院),北京100029,中国) Chinese Academy of Medical Science & Peking Union Medical College, Beijing 100730, China(中国医学科学院 & 首都医科大学,北京100730,中国) Department of Radiology, Peking University China-Japan Friendship School of Clinical Medicine, Beijing 100029, China(北京大学日本友谊学校临床医学系放射科,北京100029,中国) Department of Gastroenterology, China-Japan Friendship Hospital, Beijing 100029, China(日本友谊医院消化内科,北京100029,中国) NHC Key Laboratory of Clinical Big Data Standardization & Integration, Beijing 100029, China(国家卫生健康委员会临床大数据标准化与整合关键实验室,北京100029,中国)

AI总结 本文提出Ran Score,一种基于大语言模型的放射学报告生成评估指标,通过结合人类专业知识和大型语言模型,改进多标签发现提取,并在多个数据集中验证其有效性。

Comments 4 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22824 2026-03-25 cs.LG math.OC stat.ML

Towards The Implicit Bias on Multiclass Separable Data Under Norm Constraints

多类可分数据下范数约束下的隐式偏置研究

Shengping Xie, Zekun Wu, Quan Chen, Kaixu Tang

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

AI总结 本文通过NSD框架探讨了优化几何对多类可分数据解的影响,提出NucGD优化器以核范数约束 enforcing 低秩结构,并连接低秩投影方法,通过异步幂迭代实现高效SVD-free更新,分析了随机优化动态对收敛的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22648 2026-03-25 cs.HC cs.AI

AwesomeLit: Towards Hypothesis Generation with Agent-Supported Literature Research

AwesomeLit: 向基于代理支持的文献研究进行假设生成

Zefei Xie, Yuhan Guo, Kai Xu

机构 * School of Computer Science, University of Nottingham, UK(诺丁汉大学计算机科学学院) School of Intelligence Science and Technology, Peking University, China(北京大学智能科学与技术学院)

AI总结 本文提出AwesomeLit系统,通过可视化工具帮助用户探索未知领域,识别研究方向并提升信心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01047 2026-03-25 cs.CV cs.AI

Residual Decoding: Mitigating Hallucinations in Large Vision-Language Models via History-Aware Residual Guidance

残差解码:通过历史感知残差引导减轻大视觉-语言模型中的幻觉

Xinrong Chen, Xu Chu, Yingmin Qiu, Hengyuan Zhang, Jing Xiong, Shiyu Tang, Shuai Liu, Shaokang Yang, Cheng Yang, Hayden Kwok-Hay So, Ngai Wong

机构 * Peking University(北京大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Hong Kong(香港大学) ByteDance Inc.(字节跳动公司)

AI总结 本文提出残差解码方法,通过利用历史信息辅助解码,纠正大视觉-语言模型中的语言先验偏差,有效抑制幻觉并提升视觉接地能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23265 2026-03-25 cs.CL cs.CV

PaperBanana: Automating Academic Illustration for AI Scientists

PaperBanana:为AI科学家自动化学术插图

Dawei Zhu, Rui Meng, Yale Song, Xiyu Wei, Sujian Li, Tomas Pfister, Jinsung Yoon

机构 * Peking University(北京大学) Google Cloud AI Research(谷歌云AI研究)

AI总结 PaperBanana通过整合先进视觉语言模型和图像生成模型,自动化生成出版级学术插图,提升了科研流程中插图制作的效率与质量。

Comments Add Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19703 2026-03-25 eess.AS cs.IR cs.LG cs.MM cs.SD

ASK: Adaptive Self-improving Knowledge Framework for Audio Text Retrieval

ASK:适应性自改进知识框架用于音频文本检索

Siyuan Fu, Xuchen Guo, Mingjun Liu, Hongxiang Li, Boyin Tan, Gongxi Zhu, Xianwei Zhuang, Jinghan Ru, Yuxin Xie, Yuguo Yin

机构 * University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology(香港科技大学) Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) Peking University(北京大学) Tsinghua University(清华大学)

AI总结 ASK框架通过多粒度知识注入和动态精修策略解决音频文本检索中的梯度局部瓶颈和表示漂移不匹配问题,提升稀有长尾概念学习能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03044 2026-03-25 cs.RO

Video2Act: A Dual-System Video Diffusion Policy with Robotic Spatio-Motional Modeling

Video2Act:一种双系统视频扩散策略,具有机器人空间-运动建模

Yueru Jia, Jiaming Liu, Shengbang Liu, Rui Zhou, Wanhe Yu, Yuyang Yan, Xiaowei Chi, Yandong Guo, Boxin Shi, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,北京大学计算机学院) AI 2 Robotics(AI与机器人) Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 Video2Act通过整合空间和运动感知表示,提升机器人动作学习效率,其双系统设计在仿真和现实任务中均取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21732 2026-03-25 cs.CL cs.AI

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN: 基于理论的多阶段推理用于可解释的多模态幽默生成

Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su

机构 * Peking University(北京大学) Ocean University of China(海洋大学)

AI总结 本文提出HUMORCHAIN框架,通过整合视觉语义解析、基于幽默和心理学的推理及细调判别器,实现可解释的多模态幽默生成,实验表明其在人类幽默偏好、Elo/BT评分和语义多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏