Measuring Over-smoothing beyond Dirichlet energy
超越狄利克雷能量的过度平滑测量
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院)
AI总结 本文提出了一种基于更高阶特征导数能量的节点相似性度量,揭示了过度平滑衰减率与图拉普拉西昂谱隙的内在联系,并展示了基于注意力的GNN在该指标下的过度平滑问题。
Comments 17 pages, 1 figure
高校专区
超越狄利克雷能量的过度平滑测量
机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院)
AI总结 本文提出了一种基于更高阶特征导数能量的节点相似性度量,揭示了过度平滑衰减率与图拉普拉西昂谱隙的内在联系,并展示了基于注意力的GNN在该指标下的过度平滑问题。
Comments 17 pages, 1 figure
熵在视觉定位中的作用:分析与优化
机构 * Fudan University(复旦大学) ; Hikvision Research Institute(海康威视研究院)
AI总结 本文提出ECVGPO算法,通过熵控制优化视觉定位任务,提升探索与利用的平衡,实现多基准的性能提升。
时间序列和时空数据扩散模型综述
机构 * University of Oxford(牛津大学) ; Griffith University(格里菲斯大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Zhejiang Normal University(浙江师范大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The University of Hong Kong(香港大学) ; Salesforce Research(Salesforce研究) ; East China Normal University(东华大学) ; Fudan University(复旦大学)
AI总结 本文综述了扩散模型在时间序列和时空数据中的应用,系统梳理了模型类别、任务类型及实际应用场景,为后续研究提供基础。
Comments Accepted by ACM Computing Surveys; 37 pages; Github Repo: https://github.com/yyysjz1997/Awesome-TimeSeries-SpatioTemporal-Diffusion-Model
SCMM:基于文本的人脸搜索的跨模态表示校准
机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) ; Department of Electrical and Computer Engineering, The University of British Columbia(不列颠哥伦比亚大学电气与计算机工程系) ; College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; MEGVII Technology(MEGVII技术) ; School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院) ; School of AI and CS, Nantong University(南通大学人工智能与计算机科学学院) ; Academy of Artificial Intelligence, SMBU(SMBU人工智能学院) ; College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院)
AI总结 SCMM通过缝校准和掩码建模方法,提升跨模态表示学习在文本驱动的人脸搜索中的性能。
Comments 11 pages, 7 figures, 7 tables
GTM: 为AI代理模拟工具世界
机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; School of Computer Science, Fudan University, Shanghai, China(计算机学院,复旦大学,上海,中国)
AI总结 GTM通过模拟工具提升AI代理训练效率,实现快速且低成本的工具交互模拟。
基于条件生成建模的供应链金融增强信用风险管理
机构 * School of Management, Fudan University(复旦大学管理学院) ; Department of Decision Analytics and Operations, College of Business, City University of Hong Kong(城市大学商学院决策分析与运作部门) ; Department of Industrial and Systems Engineering, University of Minnesota(明尼苏达大学工业与系统工程系) ; The Laboratory for AI-Powered Financial Technologies(人工智能金融技术实验室)
AI总结 本文提出基于条件生成建模的供应链金融信用风险管理框架,利用QRGMM和DeepFM整合销售数据,提升中小卖家的信用评估与融资能力。
Comments Accepted for publication in Naval Research Logistics (NRL)
ARM-Thinker: 通过智能工具使用和视觉推理强化多模态生成奖励模型
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 ARM-Thinker通过智能工具使用和视觉推理提升多模态奖励模型的准确性与可解释性。
利用非透明物体的深度获取进行透明物体深度补全的自监督学习
机构 * Changchun Institute of Optics, Fine Mechanics and Physics, Chinese Academy of Sciences(长春光学精密机械与物理研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Fudan University(复旦大学)
AI总结 本文提出了一种自监督学习方法,通过模拟非透明区域的深度缺失来提升透明物体深度补全的性能。
Comments conference
GeoPE:一种统一的几何位置嵌入用于结构化张量
机构 * University of Electronic Science and Technology of China(电子科技大学) ; Fudan University(复旦大学)
AI总结 GeoPE通过引入几何位置嵌入,有效恢复2D空间流形,提升图像分类、目标检测和3D语义分割任务的性能。
DeRA: 解耦表示对齐用于视频标记化
机构 * Xi’an Jiaotong University(西安交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院)
AI总结 DeRA通过解耦时空表示学习,提升视频标记化效率和性能,并在视频生成任务中取得新突破。
EVE:基于视觉-语言模型的端到端视频字幕提取
机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) ; ByteDance Inc.(字节跳动公司) ; College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) ; School of Computing and Communications, Lancaster University(兰卡斯特大学计算机与通讯学院)
AI总结 EVE提出了一种基于视觉-语言模型的端到端视频字幕提取框架,通过双分支模块高效提取字幕及时间戳,并构建了首个大规模视频字幕数据集。
迈向基于端到端人工智能的全球天气预报系统
机构 * Fudan University(复旦大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Nanjing University of Information Science and Technology(南京信息工程大学)
AI总结 本文提出基于人工智能的数据同化模型Adas,并结合FengWu构建端到端全球天气预报系统,实现高精度长期天气预报。
CSMapping: 可扩展的众包语义制图与拓扑推断用于自动驾驶
机构 * the Department of Electronic and Computer Engineering, the Hong Kong University of Science and Technology, Hong Kong, China(电子与计算机工程系,香港科技大学,香港,中国) ; the Academy for Engineering and Technology, Fudan University, Shanghai, China(工程与技术学院,复旦大学,上海,中国) ; Zhuoyu Technology Co., Ltd., Shenzhen, China(珠海优创科技有限公司,深圳,中国)
AI总结 CSMapping通过潜在扩散模型和拓扑优化方法,实现高质量的语义地图和道路中心线生成,适用于自动驾驶场景。
STCTS: 通过显式文本-语调-音色分解实现超低比特率语音的生成语义压缩
机构 * Fudan University(复旦大学) ; Tsinghua University(清华大学)
AI总结 STCTS通过显式分解语音为语言内容、语调和音色,实现80bps下的高质量超低比特率语音压缩,兼顾效率与质量。
Comments The complete source code and online speech reconstruction demo is publicly available at https://github.com/dywsy21/STCTS
ReVSeg:通过强化学习激励视频分割的推理链
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; LIGHTSPEED
AI总结 ReVSeg通过强化学习优化视频分割的多步推理链,实现可解释的推理轨迹和先进的性能。
迈向大型语言模型中幻觉检测与事实验证的统一
机构 * DCST, Tsinghua University(清华大学数据科学研究院) ; Fudan University(复旦大学)
AI总结 本文提出UniFact框架,通过统一评估方法揭示幻觉检测与事实验证的互补性,并证明混合方法在LLM中的优越性。
UAUTrack:迈向统一的多模态反无人机视觉跟踪
机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) ; Fudan University(复旦大学) ; School of Computer Science and Technology(计算机科学与技术学院) ; Zhejiang Normal University(浙江师范大学) ; Department of Mechanical Engineering(机械工程系) ; The Hong Kong Polytechnic University(香港理工大学)
AI总结 UAUTrack通过统一多模态框架实现反无人机跟踪,结合文本先验提示策略提升跨模态信息整合效率,取得优异性能与效率平衡。
从检测到关联:学习多目标跟踪的判别性对象嵌入
机构 * East China University of Science and Technology(东华大学) ; Shanghai AI Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Sun Yat-sen University(中山大学)
AI总结 FDTA通过引入三个适配器提升多目标跟踪中对象嵌入的判别性,实现更准确的关联性能。
OmniGuard:统一的多模态防护机制与刻意推理
机构 * Fudan University(复旦大学) ; University of California, Davis(加州大学戴维斯分校)
AI总结 OmniGuard通过统一的多模态防护机制与刻意推理能力,有效提升多模态安全防护的鲁棒性和泛化能力。
TempoMaster: 通过下一帧速率预测实现高效的长视频生成
机构 * Fudan University(复旦大学) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信)
AI总结 TempoMaster通过下一帧速率预测实现高效长视频生成,结合双向注意力和自回归机制,提升视觉和时间质量。
Comments for more information, see https://scottykma.github.io/tempomaster-gitpage/
在野外检测任意3D对象
机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学) ; Stanford University(斯坦福大学) ; CUHK MMLab(香港大学多模态实验室) ; Tsinghua University(清华大学) ; GAC R&D Center(广汽研发中心)
AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。
DualCamCtrl: 基于双分支扩散模型的几何感知摄像机控制视频生成
机构 * HKUST (GZ)(香港科技大学) ; HKUST(香港科技大学) ; Fudan University(复旦大学) ; Shenzhen University(深圳大学)
AI总结 DualCamCtrl通过双分支扩散模型实现几何感知的摄像机控制视频生成,有效提升视频生成的一致性和准确性。
OmniSVG: 一种统一的可扩展矢量图形生成模型
机构 * Fudan University(复旦大学) ; StepFun Project(StepFun项目)
AI总结 OmniSVG通过统一框架和预训练视觉-语言模型,实现高效多模态SVG生成,提升复杂结构的表达能力,并引入大规模数据集推动SVG合成发展。
Comments 20 pages; Project Page: https://omnisvg.github.io/
重新思考颅内动脉瘤血管分割:来自计算流体动力学应用的视角
机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) ; Shanghai Academy of Artificial Intelligence for Science(上海人工智能科学研究院) ; Department of Civil and Environmental Engineering, Hong Kong Polytechnic University(香港理工大学土木与环境工程系) ; Huashan Hospital, Fudan University(复旦大学华山医院)
AI总结 本文提出首个颅内动脉瘤血管分割数据集,结合血流动力学分析,开发两阶段框架提升分割精度与CFD应用有效性。
Comments 18 pages, 5 figures
IVCR-200K: 一个大规模多轮对话基准数据集用于交互视频语料检索
机构 * Xiangtan University(湘潭大学) ; Hunan University(湖南大学) ; Zhejiang Gongshang University(浙江工商大学) ; Fudan University(复旦大学)
AI总结 本文提出IVCR-200K数据集及基于多模态大语言模型的框架,用于交互视频语料检索,提升多轮对话式交互效果。
Comments Accepted by SIGIR2025
大语言模型无法可靠地检测JavaScript中的漏洞:首个系统性基准和评估
机构 * Lanzhou University(兰州大学) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Technology Support Center of the Cyberspace Administration of China(国家互联网信息办公室技术支撑中心) ; Fudan University(复旦大学) ; Beijing University of Posts(北京邮电大学)
AI总结 本文首次提出FORGEJS框架,构建首个系统性JavaScript漏洞检测基准ARENAJS,并揭示LLM在漏洞检测中的局限性。
SRPO:用于视觉-语言-动作模型的自指政策优化
机构 * Fudan University(复旦大学) ; Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院)
AI总结 SRPO通过自指政策优化方法,利用模型自身生成的成功轨迹作为参考,有效解决VLA-RL中的奖励稀疏问题,实现高成功率和鲁棒性。
鲁棒、可观测和可进化的代理系统工程:一种经过Fairy GUI代理验证的原则性框架
机构 * Fudan University(复旦大学)
AI总结 本文提出了一种原则性框架,通过Fairy GUI代理验证,解决了代理系统在鲁棒性、可观测性和可进化性方面的不足,提供了可维护和可扩展的代理AI系统设计方法。
Comments 50 pages, 14 figures
Hallo4: 通过直接偏好优化实现高保真的动态肖像动画
机构 * Fudan University(复旦大学) ; Baidu Inc.(百度公司) ; Shanghai Innovative Institute(上海创新研究院) ; Nanjing University(南京大学) ; Alibaba Group(阿里巴巴集团)
AI总结 Hallo4通过直接偏好优化和时空运动调制,实现高保真的动态肖像动画生成,提升唇部同步、表情自然性和身体运动一致性。
SPIRAL: 基于语义的渐进式LiDAR场景生成与理解
机构 * Technical University of Munich(慕尼黑技术大学) ; Fudan University(复旦大学) ; National University of Singapore(新加坡国立大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心)
AI总结 Spiral提出了一种基于范围视图的LiDAR扩散模型,能够同时生成深度、反射图像和语义地图,实现高效的3D场景生成与理解。
Comments NeurIPS 2025; 24 pages, 10 figures, 9 tables; Code at https://github.com/worldbench/SPIRAL