Modeling Behavioral Intensity and Transitions for Generative Recommendation
生成推荐中的行为强度和转换建模
机构 * Ant Group(蚂蚁集团) ; Fudan University(复旦大学)
AI总结 本文提出BITRec框架,通过选择性依赖激活和转换关系编码,解决多行为推荐中行为强度差异和转换模式捕捉问题,实验表明在多个数据集上提升15-23%。
高校专区
生成推荐中的行为强度和转换建模
机构 * Ant Group(蚂蚁集团) ; Fudan University(复旦大学)
AI总结 本文提出BITRec框架,通过选择性依赖激活和转换关系编码,解决多行为推荐中行为强度差异和转换模式捕捉问题,实验表明在多个数据集上提升15-23%。
PhysNote: 为视觉-语言模型中的可进化物理推理提供自我知识笔记
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Rice University(里奇大学) ; City University of Hong Kong(香港城市大学) ; Fudan University(复旦大学)
AI总结 本文提出PhysNote框架,通过自我生成的知识笔记提升视觉-语言模型在动态物理推理中的表现,实验显示其在PhysBench上达到56.68%的准确率,优于多智能体基线。
Comments 11 pages. Accepted by ICLR 2026 Workshop ES-Reasoning
CT-FineBench:用于CT报告生成细粒度评估的诊断可信度基准
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(沪幻实验室) ; Fudan University(复旦大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 CT-FineBench通过基于问题回答的流程构建,评估CT报告的细粒度事实一致性,优于传统指标,能更敏感地捕捉临床细节错误。
Comments Accepted by ACL 2026 Main
Hallo-Live: 实时流式联合音频-视频虚拟形象生成与异步双流及以人类为中心的偏好蒸馏
机构 * Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; Nanjing University(南京大学) ; Baidu(百度)
AI总结 本文提出Hallo-Live框架,通过异步双流扩散与人类中心偏好蒸馏实现高保真实时音频视频虚拟形象生成,达到高吞吐量与低延迟,优于现有模型。
重新审视在线策略蒸馏:经验性失败模式及简单修复
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(多模态人工智能系统国家重点实验室,中科院自动化所) ; School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) ; Fudan University(复旦大学) ; Independent Researcher(独立研究者)
AI总结 本文研究了在线策略蒸馏的失败模式,提出改进方法提升训练稳定性,实验显示改进方法在多个任务中提升性能19.8%。
通过LLM驱动的程序生成和基于文本的B-Rep基础构建实现高保真的CAD生成
机构 * Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出FutureCAD框架,利用LLM和BRepGround变压器生成高保真的CAD模型,通过自然语言指定几何选择并训练数据集提升生成性能。
Comments preprint
OKG-LLM:通过LLMs对齐海洋知识图谱与观测数据以实现全球海表温度预测
机构 * Department of Computer Science and Technology, Tongji University(同济大学计算机科学与技术系) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算系) ; Department of Computing, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算系) ; School of Computer Science, Fudan University(复旦大学计算机科学学院)
AI总结 本文提出OKG-LLM框架,通过构建海洋知识图谱并融合数值数据,利用预训练LLM提升全球海表温度预测的准确性与鲁棒性。
通过正则化随机梯度下降学习算子
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; Fudan University(复旦大学) ; Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University(复旦大学当代应用数学重点实验室)
AI总结 本文研究了从波兰空间到可分希尔伯特空间的回归算子估计问题,通过正则化随机梯度下降算法在在线和有限时间 horizon 设置下分析 ill-posed 性问题,建立与维度无关的预测和估计误差界,并提供结构预测和参数 PDEs 的应用示例。
Comments 68 pages, 3 figures
在大型视觉语言模型中检测和评估医学幻觉
机构 * Academy for Engineering and Technology, Fudan University(复旦大学工程与技术学院) ; Tencent Youtu Lab(腾讯优图实验室) ; Cognition and Intelligent Technology Laboratory(认知与智能技术实验室)
AI总结 本文提出Med-HallMark基准,用于医疗多模态领域中的幻觉检测与评估,引入MediHall Score和MediHallDetector,通过多任务训练提升模型可靠性,实验表明其在医疗应用中更有效。
海洋科学中的时空数据挖掘:数据、方法与机遇
机构 * Tongji University(同济大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Fudan University(复旦大学)
AI总结 本文综述了海洋科学中时空数据挖掘的研究现状,分析了时空海洋数据的特点,探讨了数据增强技术及四种主要任务类型,并讨论了未来研究方向。
为设计而可逆:流式LLM代理执行的理论
机构 * Fudan University(复旦大学) ; Guangming Lab(光明实验室)
AI总结 本文提出流式LLM代理执行的可逆性理论,通过定义可逆性分类,证明冲突可逆动作导致不可满足性,提出修订吸收器算法提升执行灵活性。
AdaMamba:适应性频率门控Mamba用于长期时间序列预测
机构 * Tongji University(同济大学) ; Fudan University(复旦大学)
AI总结 AdaMamba通过引入交互补丁编码模块和自适应频率门控状态空间模块,有效整合频率域分析与时间依赖学习,提升长期时间序列预测的准确性和效率。
多模态大语言模型真的能理解小物体吗?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Science and Technology of China(中国科学技术大学) ; Fudan University(复旦大学) ; MMLab, The Chinese University of Hong Kong(香港中文大学MMLab)
AI总结 本文提出SOUBench基准,评估现有多模态大语言模型对小物体的理解能力,发现其能力有限,并通过SOU-Train数据集提升模型表现。
Comments Under Peer Review (26 pages, 9 figures, 6 tables)
DVPO:基于分布价值建模的策略优化用于大语言模型后训练
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; Honor Device Co., Ltd(荣誉设备有限公司)
AI总结 DVPO通过结合条件风险理论与分布价值建模,在噪声监督下提升大语言模型后训练的鲁棒性和泛化能力,优于PPO、GRPO等方法。
ImmerIris:用于沉浸式应用中非轴向和无约束虹膜识别的大型数据集和基准
机构 * Shanghai Key Lab of Intelligent Information Processing(上海智能信息处理关键实验室) ; Fudan University(复旦大学) ; Huaiyin Normal University(淮阴师范学院) ; Zhengzhou University of Light Industry(郑州轻工业学院) ; Tongji University(同济大学)
AI总结 本文提出ImmerIris数据集,包含546名受试者499,791张虹膜图像,是目前最大的公开虹膜数据集,用于评估沉浸式应用中的虹膜识别系统,提出无预处理的虹膜识别方法,提升了识别鲁棒性。
Comments CVPR 2026 Oral
截断核随机梯度下降与通用损失及球面径向基函数
机构 * School of Mathematical Sciences, Fudan University, Shanghai 200433, China(复旦大学数学学院,上海200433,中国) ; Department of Mathematics, University of Bayreuth, Bayreuth 95440, Germany(拜鲁特大学数学系,拜鲁特95440,德国) ; Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University, Shanghai 200433, China(复旦大学当代应用数学上海重点实验室,上海200433,中国) ; Center for Applied Mathematics, Fudan University, Shanghai 200433, China(复旦大学应用数学中心,上海200433,中国)
AI总结 本文提出了一种新的核随机梯度下降算法,通过创新的正则化策略提升效率和可扩展性,利用球面径向基函数的无穷级数展开将随机梯度投影到有限维假设空间,从而提升泛化性能。
Comments 54 pages, 20 figures
迈向通过算子合并的扩散轨迹蒸馏的理论洞察
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学科学学院) ; Shanghai Key Laboratory of Contemporary Applied Mathematics(上海当代应用数学重点实验室)
AI总结 本文通过算子合并问题重新诠释扩散轨迹蒸馏,揭示线性高斯和非线性高斯混合两种 regime 中的理论机制,提出理论最优合并策略及计算方法。
Comments 25 pages, 23 figures
Journal ref Neural Networks 202 (2026) 109023
PokeVLA:通过全面的世界知识指导赋能便携式视觉-语言-动作模型
机构 * CASIA(中国科学院自动化研究所) ; TARS Robotics(TARS机器人实验室) ; Tsinghua University(清华大学) ; Fudan University(复旦大学) ; National University of Singapore(新加坡国立大学) ; Tongji University(同济大学)
AI总结 本文提出PokeVLA,一种轻量但强大的具身体验模型,通过预训练视觉语言模型和多视角目标感知学习提升机器人操作效率与空间认知能力。
可控的口语对话生成:一种基于LLM的评分系统用于K-12非母语英语学习者
机构 * Peking University(北京大学) ; Tencent(腾讯) ; China University of Political Science and Law(中国政法大学) ; Independent Researcher(独立研究者) ; Fudan University(复旦大学)
AI总结 本文提出一种基于LLM的评分系统,通过四级分级系统控制词汇复杂度,提升非母语K-12英语学习者的口语对话质量与教学价值。
ICPR 2026 关于低分辨率车牌识别的比赛
机构 * Federal University of Paraná, Brazil(巴西南里奥格兰德联邦大学) ; Pontifical Catholic University of Paraná, Brazil(巴西帕尔米拉天主教大学) ; Korea University, Republic of Korea(韩国釜山大学) ; University of Information Technology, Vietnam(越南信息科技大学) ; Ho Chi Minh University of Technology, Vietnam(越南胡志明技术大学) ; Vietnam National University, Vietnam(越南国家大学) ; Fudan University, China(复旦大学) ; Shanghai Key Laboratory of Multimodal Embodied AI, China(上海多模态具身人工智能重点实验室) ; Handong Global University, Republic of Korea(韩国韩东全球大学)
AI总结 本文介绍了ICPR 2026低分辨率车牌识别比赛,通过LRLPR-26数据集评估了269支队伍的性能,揭示了该任务的挑战性和研究趋势。
Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026
等变异步扩散:一种适应性去噪时间表用于加速分子构象生成
机构 * Shanghai Academy of Artificial Intelligence for Science, SAIS(上海人工智能科学研究院,SAIS) ; College of Chemistry and Chemical Engineering, Xiamen University(厦门大学化学与化工学院) ; Artificial Intelligence Innovation and Incubation (AI 3 ) Institute, Fudan University(复旦大学人工智能创新与孵化(AI 3)研究院)
AI总结 本文提出等变异步扩散模型,结合异步去噪时间表与分子级时间表,有效捕捉分子层次结构,提升3D分子生成性能。
图到视觉:利用视觉-语言模型进行多图理解与推理
机构 * Nanyang Technological University(南洋理工大学) ; Shandong University(山东大学) ; Fudan University(复旦大学) ; Shanghai Jiao Tong University(上海交通大学)
AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。
Comments 26 pages, 23 figures
ADS-POI: 基于代理的时空状态分解用于下一步兴趣点推荐
机构 * Fudan University(复旦大学) ; Southeast University(东南大学) ; University of Malaya(马来亚大学)
AI总结 ADS-POI通过分解用户行为为多个时空感知状态,提升兴趣点推荐的准确性和鲁棒性,实验显示其优于现有最先进基线。
CaST-POI:基于候选人的空间时间建模用于下一步POI推荐
机构 * Fudan University(复旦大学) ; Southeast University(东南大学) ; University of Malaya(马来亚大学)
AI总结 本文提出CaST-POI模型,通过候选条件化序列阅读器动态关注用户历史,引入候选相对时间空间偏置,提升POI推荐性能。
StreamMeCo:用于高效流视频理解的长期智能体内存压缩
机构 * Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)技术有限公司)
AI总结 StreamMeCo通过内存图连通性引入边自由minmax采样和边感知权重剪枝,有效压缩内存并保持精度,实验表明在70%压缩下实现1.87倍检索速度提升和1.0%的准确率提升。
Comments 2026ACL Findings
Kernel-Smith:一种统一的进化核优化配方
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; MetaX
AI总结 Kernel-Smith结合稳定评估驱动的进化代理与进化导向的后训练配方,通过GPU核与运算符生成实现高性能优化,其在KernelBench上取得最佳速度提升,超越多个前沿模型。
FGAS:基于固定解码器网络的音频隐写术与对抗扰动生成
机构 * School of Communication & Electronic Engineering, East China Normal University(东华大学通信与电子工程学院) ; Shanghai Innovation Institute(上海创新研究院) ; School of Computer Science, Fudan University(复旦大学计算机科学学院) ; School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)
AI总结 本文提出FGAS,一种基于固定解码器网络的音频隐写术,通过生成对抗扰动提升音频质量与抗隐写分析性能,实验显示其在PSNR和抗攻击方面优于现有方法。
MLG-Stereo: 基于ViT的立体匹配方法与多阶段局部-全局增强
机构 * Embedded Deep Learning and Visual Analysis Laboratory, College of Future Information Technology, Fudan University(嵌入式深度学习与视觉分析实验室,未来信息技术学院,复旦大学) ; Key Laboratory for Information Science of Electromagnetic Waves, Ministry of Education, Fudan University(电磁波信息科学重点实验室,教育部,复旦大学)
AI总结 本文提出MLG-Stereo,通过多粒度特征网络、局部-全局成本体积和局部-全局引导递归单元,提升ViT在处理任意分辨率图像时的细节预测能力,实验表明其在Middlebury和KITTI-2015等基准上表现优异。
高 Yao 基准:评估大型语言模型多语言和多文化能力的综合框架
机构 * Huawei, China(华为,中国) ; Fudan University, China(复旦大学,中国)
AI总结 本文提出GaoYao基准,通过182300个样本、26种语言和51个地区,评估大型语言模型的多语言和多文化能力,揭示地理性能差异和任务间差距。
Comments Accepted by ACL 2026 main
超越评分:AI评论的全面评估与基准
机构 * College of Computer Science and Artificial Intelligence, Fudan University, Shanghai, China(复旦大学计算机科学与人工智能学院) ; Shanghai Innovation Institute, Shanghai, China(上海创新研究院)
AI总结 本文提出Beyond Rating框架,通过五个维度评估AI评论,引入Max-Recall策略和高质量数据集,证明文本中心指标与评分准确性的强相关性。
Comments 38 pages,8 figures,4 tables