ROSE: Retrieval-Oriented Segmentation Enhancement
ROSE:基于检索的分割增强
机构 * Fudan University(复旦大学)
AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。
Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
ROSE:基于检索的分割增强
机构 * Fudan University(复旦大学)
AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。
Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/
基于元数据引导扩散模型的盲视流损坏视频恢复
机构 * The University of Queensland(昆士兰大学) ; Data61, CSIRO, Australia(澳大利亚CSIRO数据61实验室)
AI总结 本文提出元数据引导扩散模型,用于在无预定义损坏区域掩码的情况下恢复损坏视频,通过双流元数据编码器提取运动向量和帧类型,结合交叉注意力机制与后处理模块提升恢复效果。
Comments CVPR 2025
用于3D单目标跟踪的时序一致长期记忆
机构 * Sungkyunkwan University(成均馆大学)
AI总结 本文提出ChronoTrack框架,通过长期记忆和双重损失函数提升3D单目标跟踪的时序一致性与效率,实现新的SOTA性能。
Comments Accepted to CVPR 2026 Findings
LongVideo-R1: 低成本长视频理解的智能导航
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Huawei Consumer Business Group(华为消费者业务集团)
AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。
Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026
GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位
机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; School of Computer Science, Wuhan University(武汉大学计算机学院) ; Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) ; State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)
AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。
Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge
IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; The University of Hong Kong(香港大学) ; Beijing University of Chemical Technology(北京化工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Shenzhen University of Infomation Technology(深圳信息大学)
AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。
Comments 8 pages, 8 figures; Accepted to CVPR 2026
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
基于CNN语义分割的稀疏混合专家层的设计与行为
机构 * FZI Research Center for Information Technology(弗劳恩霍夫信息技术研究中心) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
AI总结 本文研究了在CNN中集成稀疏混合专家层的粗粒度分块方法,通过实验验证了架构选择对路由动态和专家专业化的影响,实现了性能提升。
Comments Accepted for publication at the SAIAD workshop at CVPR 2026
ClipGStream: 用于任意长度和任意运动多视角动态场景重建的Clip-Stream高斯点云法
机构 * Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东超高清沉浸式媒体技术省重点实验室) ; Shenzhen Graduate School, Peking University(北京大学深圳研究生院) ; Pengcheng Laboratory(鹏城实验室) ; Peking University(北京大学) ; MIGU Video Co., Ltd.(MIGU视频有限公司)
AI总结 本文提出ClipGStream框架,通过clip级流优化实现长动态视频的高斯点云重建,兼顾可扩展性和时间一致性。
Comments CVPR 2026, Project pages: https://liangjie1999.github.io/ClipGStreamWeb/
ReConText3D: 基于重放的持续文本到3D生成
机构 * DFKI(德累斯顿自由大学) ; RPTU Kaiserslautern-Landau(科布伦茨-劳恩堡大学)
AI总结 本文提出ReConText3D框架,解决文本到3D生成中的持续学习问题,通过文本嵌入k-Center选择构建紧凑多样回放记忆,实现增量学习新3D类别并保持旧类生成能力。
Comments Accepted at CVPR Findings 2026
MyoVision:一种移动研究工具和NEATBoost-Attention集成框架用于实时鸡胸肌病检测
机构 * Department of Biological and Agricultural Engineering, University of Arkansas(亚拉巴马大学生物与农业工程系) ; Department of Food Science, University of Arkansas(亚拉巴马大学食品科学系)
AI总结 本文提出MyoVision移动透光成像框架,结合NEATBoost-Attention模型实现低成本多类肌病检测,测试准确率达82.4%,优于传统方法并匹配高成本高光谱成像系统性能。
Comments Accepted at CVPR 2026 MetaFoods Workshop. 11 pages, 5 figures
两阶段人-物交互检测中故障模式的研究
机构 * The Ohio State University(俄亥俄州立大学) ; National University of Singapore(新加坡国立大学) ; Boston University(波士顿大学) ; Independent Researcher(独立研究者) ; University of Mississippi(密西西比大学)
AI总结 本文研究两阶段人-物交互检测模型的故障模式,通过分解检测任务为多个可解释视角,分析模型行为以识别不同失败模式,揭示高基准性能不等于 robust 视觉推理的结论。
Comments Accepted to SAUAFG Workshop at CVPR 2026
MaMe & MaRe:基于矩阵的令牌合并与恢复用于高效的视觉感知与合成
AI总结 本文提出MaMe和MaRe,通过矩阵运算实现免训练的令牌合并与恢复,提升视觉模型效率,实验显示在ViT-B上吞吐量提升2%且精度下降1.0%,在图像合成中减少Stable Diffusion v2.1生成延迟31%。
Comments 20 pages. Extended version of CVPR 2026 Findings paper. Neurocomputing (Elsevier) under review
UniBlendNet:统一的全局、多尺度和区域自适应建模用于环境光照归一化
机构 * McMaster University(麦斯特大学) ; University of Manitoba(曼尼托巴大学)
AI总结 UniBlendNet通过统一建模全局光照、多尺度结构和区域自适应细化,提升复杂光照条件下的图像恢复性能,实验表明其优于IFBlend。
Comments Accepted to CVPR 2026 NTIRE Workshop on New Trends in Image Restoration and Enhancement. 8 pages, 4 figures
评分末尾的偏见
机构 * Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
AI总结 研究揭示奖励模型在文本到图像生成中因编码人口偏见导致性别和种族刻板印象强化及多样性崩溃的问题。
Comments Accepted to The IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
第四届海上计算机视觉研讨会(MaCVi):挑战概述
机构 * LOOKOUT ; Helmut Schmidt University(海姆·施密特大学) ; catskill GmbH(catskill公司) ; University of Ljubljana(卢布尔雅那大学) ; Virginia Tech(弗吉尼亚理工大学) ; Shield AI ; Queensland University of Technology(昆士兰理工大学) ; Dartmouth College(达特茅斯学院) ; LinkedIn ; University of Tuebingen(图宾根大学) ; Konya Technical University(科尼亚技术大学) ; Schneider Electric Taiwan Co., Ltd.(施耐德电气台湾有限公司) ; University of Taipei(台北大学) ; National Yang Ming Chiao Tung University(阳明交通大学) ; University at Albany, SUNY(阿尔巴尼大学,SUNY) ; Inventec Corporation(Inventec公司) ; HD Korea Shipbuilding & Offshore Engineering Co., Ltd.(韩国海事造船与海洋工程公司) ; Seoul National University(首尔国立大学) ; Xidian University(西安电子科技大学) ; Indian Institute of Technology, Tirupati(印度泰浦蒂理工学院) ; Centre for Artificial Intelligence and Robotics (CAIR), Bangalore, India(人工智能与机器人中心(CAIR),印度班加罗尔) ; Gwangju Institute of Science and Technology(全州科学技术院) ; Fraunhofer IOSB(弗劳恩霍夫 IOSB研究所) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Kansas State University(堪萨斯州立大学) ; Colorado School of Mines(科罗拉多矿业学院) ; Arquimea Research Center(Arquimea研究中心) ; Independent Researcher(独立研究员)
AI总结 本文概述了第四届海上计算机视觉研讨会(MaCVi)2026版的挑战设置、评估协议、数据集及基准赛道,分析了方法趋势和优秀团队的技术报告。
Comments Accepted to CVPR 2026 Workshop Proceeding; Maritime Computer Vision Workshop
PatchPoison:污染多视图数据集以降质3D重建
机构 * International Institute of Information Technology(国际信息科技研究所)
AI总结 PatchPoison通过在多视图数据集边缘注入高频率对抗性补丁,干扰SfM管线的特征匹配阶段,从而降低3D重建精度,提供一种无需修改流程的实用预处理方法。
Comments CVPR Workshop on Security, Privacy, and Adversarial Robustness in 3D Generative Vision Models (SPAR-3D), 2026
C$^2$T:基于图像描述与大语言模型对齐的常识奖励学习用于交通-车辆协调
机构 * The State Key Laboratory of Internet of Things for Smart City, University of Macau(物联网智能城市国家重点实验室,澳门大学) ; Wuhan University(武汉大学) ; Hong Kong Polytechnic University(香港理工大学) ; Computer and Information Science, University of Macau(澳门大学计算机与信息科学)
AI总结 本文提出C2T框架,通过从交通-车辆动态中学习常识协调模型,结合大语言模型的常识知识,提升交通协调系统的效率、安全性和舒适性。
Comments Accepted to CVPR 2026 Findings Track
PersonaVLM:长期个性化多模态大语言模型
机构 * Nanjing University(南京大学) ; ByteDance(字节跳动)
AI总结 本文提出PersonaVLM,一种支持长期个性化多模态大语言模型框架,通过记忆、推理和响应对齐三大能力,提升个性化交互效果,并在Persona-MME基准测试中取得显著提升。
Comments Accepted by CVPR 2026. Project page: https://PersonaVLM.github.io
NTIRE 2026 实际世界面部修复挑战赛的第二次挑战:方法与结果
机构 * NTIRE 2026
AI总结 本文回顾了NTIRE 2026实际世界面部修复挑战赛,探讨了提出的解决方案和成果,旨在提升感知质量和真实感,采用加权图像质量评估分数和AdaFace模型进行评估。
Comments NTIRE 26: https://cvlai.net/ntire/2026 . NTIRE Real-World Face Restoration: https://ntire-face.github.io/2026/ . CVPR 2026 Workshop
GUIDE:用于LLM驱动航天任务中上下文决策演化的引导更新
机构 * Massachusetts Institute of Technology(麻省理工学院) ; Universidad Politecnica de Madrid(马德里理工大学)
AI总结 GUIDE通过非参数策略改进框架实现跨回合适应,利用结构化决策规则提升航天任务性能,实验表明其在对抗性轨道拦截任务中优于静态基线。
Comments Accepted to AI4Space@CVPR Workshop in CVPR 2026
ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; IBM Research(IBM研究院) ; Abaka AI & 2077AI(Abaka AI及2077AI)
AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。
Comments Accepted at CVPR 2026
时间回声:解锁视频到音频生成模型中的长度泛化
机构 * Sony Group Corporation(索尼集团公司) ; Sony AI(索尼人工智能)
AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。
Comments Accepted to CVPR 2026
ViBES:一个具有行为智能的3D虚拟身体对话代理
机构 * Stanford University(斯坦福大学) ; ByteDance(字节跳动)
AI总结 ViBES通过联合规划语言和运动,实现对话条件下的身体动作生成,提升了多轮对话中的社会交互能力。
Comments Project page: https://ai.stanford.edu/~juze/ViBES/. Accepted by CVPR 2026
Lite Any Stereo: 高效的零样本立体匹配
机构 * Imperial College London(伦敦帝国学院)
AI总结 本文提出Lite Any Stereo框架,通过紧凑且表达能力强的主干网络和混合成本聚合模块,实现高效零样本立体匹配,达到四个广泛使用的现实基准的第一名。
Comments CVPR 2026