arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-05-15 至 2026-05-15 共收录 11
2605.15055 2026-05-15 cs.LG cs.CV

DiffusionOPD: A Unified Perspective of On-Policy Distillation in Diffusion Models

DiffusionOPD:扩散模型中在线策略蒸馏的统一视角

Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li, Ruihang Chu, Shiwei Zhang, Yu Liu, Zuxuan Wu

机构 * Fudan University(复旦大学) Wan Team, Alibaba Group(阿里集团万团队)

AI总结 本文提出DiffusionOPD,通过在线策略蒸馏统一多任务训练,解决多任务优化中的交叉干扰和不平衡问题,理论推导出连续状态马尔可夫过程的KL目标,实验显示其在训练效率和性能上优于多奖励RL和级联RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14880 2026-05-15 cs.CV cs.GR cs.LG

Denoising-GS: Gaussian Splatting with Spatial-aware Denoising

去噪-GS:具有空间感知去噪的高斯点云

Qingyuan Zhou, Xinyi Liu, Weidong Yang, Ning Wang, Shuquan Ye, Ben Fei, Ying He, Wanli Ouyang

机构 * School of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Software of Engineering(软件工程系) Dalian University of Technology(大连理工大学) Department of Information Engineering(信息工程系) The Chinese University of Hong Kong(香港中文大学) College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Denoising-GS,通过空间感知去噪框架改进3D高斯点云的优化过程,提升视点合成的保真度并保持表示紧凑性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14654 2026-05-15 cs.CV

Beyond Instance-Level Self-Supervision in 3D Multi-Modal Medical Imaging

超越实例级自监督在3D多模态医学影像中的应用

Tan Pan, Shuhao Mei, Yixuan Sun, Kaiyu Guo, Chen Jiang, Zhaorui Tan, Mengzhu Li, Limei Han, Xiang Zou, Yuan Cheng, Mahsa Baktashmotlagh

机构 * Fudan University, China(复旦大学) University of Queensland, Australia(昆士兰大学) Shanghai Academy of AI for Science, China(上海人工智能科学研究院) Huashan Hospital, National Center for Neurological Disorders, Fudan University, China(华山医院,国家神经系统疾病中心,复旦大学) Bioinformatics Institute (BII), Agency for Science, Technology and Research (A*STAR), Singapore(生物信息研究所(BII),科技研究局(A*STAR),新加坡)

AI总结 本文提出利用跨实例拓扑一致性作为监督信号,通过实例内和实例间对齐机制提升多模态医学影像的表征学习,实验显示在7个下游任务中实现了分割和分类任务的平均提升,并在模态缺失时表现出更强的鲁棒性。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14619 2026-05-15 cs.AI

SliceGraph: Mapping Process Isomers in Multi-Run Chain-of-Thought Reasoning

SliceGraph:多运行链式推理中映射过程异构体

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出SliceGraph,通过kNN方法构建问题-模型-单元图,揭示链式推理过程的几何结构,发现正确答案但过程异构的轨迹,并通过实验验证其鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14569 2026-05-15 cs.CV

Bridging Brain and Semantics: A Hierarchical Framework for Semantically Enhanced fMRI-to-Video Reconstruction

连接大脑与语义:一种用于语义增强的fMRI到视频重建的分层框架

Yujie Wei, Chenglong Ma, Jianxiong Gao, Chenhui Wang, Shiwei Zhang, Biao Gong, Shuai Tan, Hangjie Yuan, Hongming Shan

机构 * Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Ant Group(蚂蚁集团)

AI总结 本文提出CineNeuron框架,通过分层结构解决fMRI信号与视频内容间的语义鸿沟问题,结合底部向上语义丰富和顶部向下记忆整合,提升视频重建效果。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14231 2026-05-15 cs.LG cs.AI cs.SD

AudioMosaic: Contrastive Masked Audio Representation Learning

AudioMosaic:基于对比学习的音频表示学习

Hanxun Huang, Qizhou Wang, Xingjun Ma, Cihang Xie, Christopher Leckie, Sarah Erfani

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) Baskin School of Engineering, University of California, Santa Cruz, USA(加州大学圣克鲁兹分校工程学院) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

AI总结 AudioMosaic通过结构化时频掩码构建正样本对,提升音频表示学习效果,实现跨数据集和声学条件的强迁移能力,优于生成方法。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11410 2026-05-15 cs.AI

What Do EEG Foundation Models Capture from Human Brain Signals?

EEG基础模型从人类大脑信号中捕捉了什么?

Ling Tang, Qian Chen, Jilin Mei, Houshi Xu, Quanshi Zhang, Jing Shao, Na Zou, Xia Hu, Dongrui Liu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Tongji University(同济大学) University of Houston(休斯顿大学)

AI总结 研究探讨EEG基础模型如何从原始信号中学习,并通过实验验证其表示与特征工程基线的对齐情况,揭示了模型学习、使用及解释性方面的关键发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26100 2026-05-15 cs.AI

AgenticEval: Toward Agentic and Self-Evolving Safety Evaluation of Large Language Models

AgenticEval: 向大型语言模型的代理和自演化安全评估迈进

Yixu Wang, Xin Wang, Yang Yao, Xinyuan Li, Xibang Yang, Yan Teng, Xingjun Ma, Yingchun Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) The University of Hong Kong(香港大学) East China Normal University(华东师范大学)

AI总结 本文提出AgenticEval框架,通过自演化评估流程动态检测LLM安全风险,实验显示模型安全评分随评估强化而下降,揭示静态评估的局限性。

Comments Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22746 2026-05-15 cs.AI cs.CV

Mixture-of-Visual-Thoughts: Exploring Context-Adaptive Reasoning Mode Selection for General Visual Reasoning

视觉思维混合:探索上下文自适应推理模式选择用于通用视觉推理

Zejun Li, Yingxiu Zhao, Jiwen Zhang, Siyuan Wang, Yang Yao, Runzhou Zhao, Jun Song, Bo Zheng, Zhongyu Wei

机构 * Fudan University(复旦大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室) University of Southern California(南加州大学) Shanghai Innovation Institute(上海创新研究院)

AI总结 本文提出MoVT框架,通过AdaVaR实现多模式统一学习与上下文自适应选择,提升通用视觉推理能力。

Comments 27 pages, 11 figures, 5 tables, accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02179 2026-05-15 cs.CL

Confidence Estimation for LLMs in Multi-turn Interactions

在多轮交互中对大语言模型的置信度估计

Caiqi Zhang, Ruihan Yang, Xiaochen Zhu, Chengzu Li, Tiancheng Hu, Yijiang River Dong, Deqing Yang, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学)

AI总结 本文研究了多轮对话中大语言模型置信度估计的问题,提出了一种评估框架和新指标,发现传统方法在多轮对话中表现不佳,而新方法更有效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23477 2026-05-15 cs.CL

MMTutorBench: The First Multimodal Benchmark for AI Math Tutoring

MMTutorBench:首个多模态AI数学辅导基准

Tengchao Yang, Sichen Guo, Mengzhao Jia, Jiaming Su, Yuanyang Liu, Zhihan Zhang, Meng Jiang

机构 * Tongji University(同济大学) Fudan University(复旦大学) University of Notre Dame(圣母大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

AI总结 MMTutorBench首次提出多模态AI数学辅导基准,包含685个围绕教学关键步骤构建的问题,通过六维度细粒度评估和三个任务(洞察发现、操作构建、操作执行)评估12个顶级MLLMs,揭示了专有与开源系统间的性能差异及OCR、少样本提示等对辅导质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏