ROSE: Retrieval-Oriented Segmentation Enhancement
ROSE:基于检索的分割增强
机构 * Fudan University(复旦大学)
AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。
Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/
高校专区
ROSE:基于检索的分割增强
机构 * Fudan University(复旦大学)
AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。
Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/
MUSE:通过自演化档案和评分引导对齐实现多领域中文用户模拟
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Meituan(美团)
AI总结 MUSE通过自演化档案和评分引导对齐,生成逼真且行为一致的中文用户响应,优于现有方法。
从锚点到监督:基于记忆图的无语料去学习框架
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Shanghai University of Electric Power(上海电力大学) ; School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院)
AI总结 本文提出MAGE框架,通过用户提供的轻量锚点识别目标实体,利用记忆图恢复相关记忆并生成监督,实现无语料的去学习,有效提升隐私保护和审计能力。
Comments 15 pages, appendix included
MedRCube:面向医学影像中多模态大语言模型细粒度与深入评估的多维框架
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; School of Integrated Circuits, Zhejiang University(浙江大学集成电路学院) ; School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) ; School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)
AI总结 本文提出MedRCube框架,通过两阶段构建流程对33个MLLM进行细粒度评估,揭示先前方法无法获取的洞察,并引入可信度评估子集,发现快捷行为与诊断性能的显著正相关,引发临床部署的担忧。
MM-Doc-R1: 通过多轮强化学习训练代理进行长文档视觉问答
机构 * Fudan University(复旦大学) ; Shanghai Qiji Zhifeng Co., Ltd(上海启智锋科技有限公司)
AI总结 MM-Doc-R1通过多轮强化学习训练代理,利用相似性基于策略优化提升长文档视觉问答性能,实验表明其优于现有方法。
ZoomSpec: 一种基于物理的粗到细框架用于宽带频谱感知
机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学重点实验室(MoE),复旦大学)
AI总结 本文提出ZoomSpec框架,结合信号处理先验知识与深度学习,通过Log-Space STFT提升窄带结构清晰度,利用轻量级CPN快速筛选全频带,并通过AHLP模块消除带外干扰,最终实现高精度频谱感知。
Comments 14 pages, 8 figures, 5 tables
高斯混合反向核在条件扩散中的普遍性
机构 * Center for Mathematics and Interdisciplinary Sciences, Fudan University(复旦大学数学与交叉科学中心) ; Shanghai Institute for Mathematics and Interdisciplinary Sciences (SIMIS)(上海数学与交叉科学研究院(SIMIS)) ; Northeastern University(东北大学) ; Infectious Diseases Division, icddr,b(icddr,b传染病部门) ; Rutgers University(罗格斯大学)
AI总结 研究证明,具有ReLU网络对数的有限高斯混合反向核的条件扩散模型可近似任意正则目标分布,误差随扩散时间增加而减小。
Comments 10+19 pages
从顺序到分布:对持续学习中遗忘的谱特征分析
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) ; Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)
AI总结 本文研究持续学习中遗忘现象,通过分析任务分布的谱结构,推导遗忘量的精确算子恒等式,并建立无条件上界,揭示遗忘率与任务分布几何性质的关系。
基于空间、时间与具身推理的统一框架的空域视觉-语言导航
机构 * Key Laboratory for Information Science of Electromagnetic Waves (Ministry of Education)(电磁波信息科学重点实验室(教育部)) ; School of Information Science and Technology(信息科学与技术学院) ; Fudan University(复旦大学)
AI总结 本文提出一种统一框架,利用单目RGB视角和自然语言指令实现空域视觉-语言导航,通过多任务学习优化空间感知、轨迹推理和动作预测,提升轻量化无人机在复杂环境中的导航能力。
Comments Under Review, 16 pages, 12 figures. Our code is publicly available at https://github.com/return-sleep/AeroAct
通过自动化构建环境提升大语言模型的反馈驱动工具使用
机构 * Fudan University(复旦大学)
AI总结 本文提出自动化环境构建流程和可验证奖励机制,提升大语言模型的工具使用能力,实验表明在不降低通用能力的情况下显著增强工具使用性能。
Comments Accepted by ACL 2026
MulDimIF:一种多维约束框架用于评估和改进大语言模型的指令遵循能力
机构 * Fudan University(复旦大学) ; Lenovo Research(联想研究院) ; Tencent(腾讯) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理重点实验室)
AI总结 本文提出MulDimIF框架,通过多维约束模式、类别和难度等级,设计可控指令生成流程,生成9106个可验证样本,评估18个LLM模型,发现不同约束设置下性能差异显著,并通过训练提升指令遵循能力而不影响通用性能。
Comments Accepted by ACL 2026