Modeling Behavioral Intensity and Transitions for Generative Recommendation
生成推荐中的行为强度和转换建模
机构 * Ant Group(蚂蚁集团) ; Fudan University(复旦大学)
AI总结 本文提出BITRec框架,通过选择性依赖激活和转换关系编码,解决多行为推荐中行为强度差异和转换模式捕捉问题,实验表明在多个数据集上提升15-23%。
高校专区
生成推荐中的行为强度和转换建模
机构 * Ant Group(蚂蚁集团) ; Fudan University(复旦大学)
AI总结 本文提出BITRec框架,通过选择性依赖激活和转换关系编码,解决多行为推荐中行为强度差异和转换模式捕捉问题,实验表明在多个数据集上提升15-23%。
PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Rice University(里奇大学) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学)
AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。
Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning
CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(沪幻实验室) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。
Comments Accepted by ACL 2026 Main
Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏
机构 * Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Baidu(百度)
AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。
重新审视在线策略蒸馏:经验性失败模式及简单修复
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中科院自动化所) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Fudan University(复旦大学) ; Independent Researcher(独立研究者)
AI总结 本文研究了在线策略蒸馏的失败模式,提出改进方法提升训练稳定性,实验显示改进方法在多个任务中提升性能19.8%。
通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成
机构 * Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。
Comments preprint
OKG-LLM:通过LLMs对齐海洋知识图谱与观测数据以实现全球海表温度预测
机构 * Department of Computer Science and Technology, Tongji University(同济大学计算机科学与技术系) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系) ; Department of Computing, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算系) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
AI总结 本文提出OKG-LLM框架,通过构建海洋知识图谱并融合数值数据,利用预训练LLM提升全球海表温度预测的准确性与鲁棒性。
通过正则化随机梯度下降学习算子
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; Fudan University(复旦大学) ; Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)
AI总结 本文研究了从波兰空间到可分希尔伯特空间的回归算子估计问题,通过正则化随机梯度下降算法在在线和有限时间 horizon 设置下分析 ill-posed 性问题,建立与维度无关的预测和估计误差界,并提供结构预测和参数 PDEs 的应用示例。
Comments 68 pages, 3 figures
在大型视觉语言模型中检测和评估医学幻觉
机构 * Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) ; Tencent Youtu Lab(腾讯优图实验室) ; Cognition and Intelligent Technology Laboratory(认知与智能技术实验室)
AI总结 本文提出Med-HallMark基准,用于医疗多模态领域中的幻觉检测与评估,引入MediHall Score和MediHallDetector,通过多任务训练提升模型可靠性,实验表明其在医疗应用中更有效。
海洋科学中的时空数据挖掘:数据、方法与机遇
机构 * Tongji University(同济大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Fudan University(复旦大学)
AI总结 本文综述了海洋科学中时空数据挖掘的研究现状,分析了时空海洋数据的特点,探讨了数据增强技术及四种主要任务类型,并讨论了未来研究方向。
为设计而可逆:流式LLM代理执行的理论
机构 * Fudan University(复旦大学) ; Guangming Lab(光明实验室)
AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。
AdaMamba:适应性频率门控Mamba用于长期时间序列预测
机构 * Tongji University(同济大学) ; Fudan University(复旦大学)
AI总结 AdaMamba通过引入交互补丁编码模块和自适应频率门控状态空间模块,有效整合频率域分析与时间依赖学习,提升长期时间序列预测的准确性和效率。
多模态大语言模型真的能理解小物体吗?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。
Comments Under Peer Review (26 pages, 9 figures, 6 tables)
DVPO:基于分布价值建模的策略优化用于大语言模型后训练
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Honor Device Co., Ltd(荣誉设备有限公司)
AI总结 DVPO通过结合条件风险理论与分布价值建模,在噪声监督下提升大语言模型后训练的鲁棒性和泛化能力,优于PPO、GRPO等方法。
ImmerIris:用于沉浸式应用中非轴向和无约束虹膜识别的大型数据集和基准
机构 * Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理关键实验室) ; Fudan University(复旦大学) ; Huaiyin Normal University(淮阴师范学院) ; Zhengzhou University of Light Industry(郑州轻工业学院) ; Tongji University(同济大学)
AI总结 本文提出ImmerIris数据集,包含546名受试者499,791张虹膜图像,是目前最大的公开虹膜数据集,用于评估沉浸式应用中的虹膜识别系统,提出无预处理的虹膜识别方法,提升了识别鲁棒性。
Comments CVPR 2026 Oral
截断核随机梯度下降与通用损失及球面径向基函数
机构 * School of Mathematical Sciences, Fudan University, Shanghai 200433, China(复旦大学数学学院,上海200433,中国) ; Department of Mathematics, University of Bayreuth, Bayreuth 95440, Germany(拜鲁特大学数学系,拜鲁特95440,德国) ; Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University, Shanghai 200433, China(复旦大学当代应用数学上海重点实验室,上海200433,中国) ; Center for Applied Mathematics, Fudan University, Shanghai 200433, China(复旦大学应用数学中心,上海200433,中国)
AI总结 本文提出了一种新的核随机梯度下降算法,通过创新的正则化策略提升效率和可扩展性,利用球面径向基函数的无穷级数展开将随机梯度投影到有限维假设空间,从而提升泛化性能。
Comments 54 pages, 20 figures
迈向通过算子合并的扩散轨迹蒸馏的理论洞察
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; Shanghai Key Laboratory of Contemporary Applied Mathematics(上海当代应用数学重点实验室)
AI总结 本文通过算子合并问题重新诠释扩散轨迹蒸馏,揭示线性高斯和非线性高斯混合两种 regime 中的理论机制,提出理论最优合并策略及计算方法。
Comments 25 pages, 23 figures
Journal ref Neural Networks 202 (2026) 109023