Do Audio-Visual Large Language Models Really See and Hear?
音频视觉大语言模型真的能看见和听见吗?
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。
Comments CVPR Findings
期刊&会议
Conference on Computer Vision and Pattern Recognition · 会议 · Computer Vision
音频视觉大语言模型真的能看见和听见吗?
机构 * University of Maryland, College Park(马里兰大学帕克分校)
AI总结 研究探讨了音频视觉大语言模型中音频与视觉特征的融合机制,发现当音频与视觉冲突时,最终文本生成中音频信息无法有效表露,揭示了多模态LLM在整合音频和视觉时的模态偏见。
Comments CVPR Findings
Rascene:利用毫米波通信信号实现高保真3D场景成像
机构 * Department of Computer Science and Engineering, Michigan State University(密歇根州立大学计算机科学与工程系)
AI总结 本文提出Rascene框架,利用毫米波通信信号实现高精度3D场景成像,克服了传统传感器在恶劣环境下的局限性,提供了一种低成本、可扩展的3D感知新途径。
Comments Accepted to CVPR 2026
特征归因稳定性套件:后验归因的稳定性如何?
机构 * The George Washington University(乔治华盛顿大学)
AI总结 本文提出FASS基准,通过预测不变过滤分解稳定性为结构相似度、排名相关性和top-k Jaccard重叠,评估四种归因方法在不同扰动下的稳定性,发现几何扰动比光度扰动更具不稳定性。
Comments Accepted in the proceedings track of XAI4CV Workshop at CVPR 2026. It has 2 images, 5 tables, 6 equations, and 35 references in the main paper and 12 figures, 15 tables, and 3 references in the supplementary material
野外场景的场景定位
机构 * Tel Aviv University(特拉维夫大学) ; Cornell University(康奈尔大学)
AI总结 本文提出一种框架,通过将部分重建与完整的参考模型对齐,提升无视觉重叠时的大尺度场景重建一致性。方法基于伪合成渲染,利用3D高斯点云和逆特征优化,引入WikiEarth数据集验证效果。
Comments CVPR 2026. Project page at https://tau-vailab.github.io/SceneGround/
基于基础模型对齐的生成事件预训练
机构 * Robotics and Perception Group, University of Zurich(苏黎世大学机器人感知组)
AI总结 本文提出GEP框架,通过将互联网级图像数据集中的语义知识迁移到事件数据,并学习事件特有的时间动态,提升事件视觉基础模型在跨任务迁移学习中的性能。
Journal ref CVPR 2026 Findings
当否定是在视觉-语言模型中一个几何问题
机构 * ETRO Department, Vrije Universiteit Brussel(布鲁塞尔自由大学ETRO系) ; imec ; Independent Researcher(独立研究员)
AI总结 本文探讨了视觉-语言模型中否定理解的几何问题,提出基于多模态大语言模型的评估框架,并通过表示工程操控CLIP模型实现否定意识。
Comments Accepted to CVPR (Multimodal Algorithmic Reasoning Workshop) 2026
DiFlowDubber:通过跨模态对齐与同步实现的离散流匹配自动化视频配音
机构 * FPT Software AI Center, Vietnam(FPT软件人工智能中心,越南) ; KAIST, South Korea(韩国科学技术院) ; University of Alabama at Birmingham, USA(阿拉巴马大学伯明翰分校)
AI总结 本文提出DiFlowDubber框架,通过离散流匹配和两阶段训练策略,解决视频配音中内容准确性、表达语气、高质量音频和精确唇同步的问题。
Comments Accepted at CVPR 2026 Findings
带有双先验的文本-相位协同网络用于无监督跨域图像检索
机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学))
AI总结 本文提出TPSNet,通过结合文本先验和相位先验,提升无监督跨域图像检索性能。
Comments Accepted by CVPR 2026
ReWeaver:面向仿真准备和拓扑准确的服装重建
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学) ; Fudan University(复旦大学) ; Adobe ; Xidian University(西安电子科技大学)
AI总结 ReWeaver通过稀疏多视角图像实现拓扑准确的3D服装和缝纫图案重建,提升仿真和机器人应用的精度与一致性。
Comments Accepted to CVPR 2026
保留源视频真实性:面向电影质量的高保真面部交换
机构 * Zhejiang University, State Key Laboratory of CAD & CG(浙江大学,计算机辅助设计与图形学国家重点实验室) ; Zhejiang University of Technology(浙江工业大学) ; Ant Group(蚂蚁集团)
AI总结 本文提出LivingSwap模型,通过关键帧和视频参考引导实现高保真面部交换,提升视频真实感与时间一致性,减少生产流程中的手动工作量。
Comments Accepted to CVPR 2026. Project webpage: https://aim-uofa.github.io/LivingSwap
通过视频扩散模型实现目标驱动的奖励用于强化学习
机构 * Shanghai Jiao Tong University(上海交通大学) ; Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波市空间智能与数字衍生重点实验室,东方理工高等研究院宁波数字孪生研究院,宁波) ; Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江省工业智能与数字孪生重点实验室) ; Zhongguancun Academy(中关村学院) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) ; Department of Mechanical Engineering, Yale University(耶鲁大学机械工程系)
AI总结 本文提出利用预训练的视频扩散模型为强化学习代理提供目标驱动的奖励信号,通过视频级和帧级目标提升轨迹的连贯性和目标导向性。
Comments Accepted by CVPR 2026. Project page: https://qiwang067.github.io/genreward
FACT-GS:频率对齐的复杂度感知纹理重参数化用于2D高斯点划法
机构 * Concordia University(康考迪亚大学) ; Mila–Quebec AI Institute(Mila-魁北克人工智能研究所)
AI总结 FACT-GS通过根据局部视觉频率分配纹理采样密度,提高2D高斯点划法的纹理空间利用效率,实现更清晰的高频细节表现。
Comments 11 pages, 6 figures, CVPR 2026 Findings track. Project page: https://tianhaoxie.github.io/project/FACT-GS/
更多更好:用于高阶多模态对齐的对比融合
机构 * Foundation for Research and Technology-Hellas(希腊研究与技术基金会) ; University of Crete(克里特大学) ; KU Leuven(鲁汶大学)
AI总结 本文提出对比融合框架,通过联合嵌入个体模态及其融合组合,捕捉高阶依赖关系,提升多模态对齐效果。
Comments Accepted to CVPR 2026
视觉-语言模型能计数吗?一个合成基准和基于注意力的干预分析
机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院)
AI总结 本文通过合成基准和注意力干预分析,探讨了视觉-语言模型在计数任务中的表现,揭示了视觉和语言复杂性对计数准确率的影响,并展示了针对性的注意力重加权对计数行为的改进。
Comments Accepted at COGVL Workshop at CVPR 2026
基于神经场的多探测器信号扫描电子显微镜微结构三维表面重建
机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) ; Alibaba Group(阿里巴巴集团) ; Analysis Center of Agriculture, Life and Environment Sciences, Zhejiang University(浙江大学农业、生命与环境科学分析中心)
AI总结 本文提出NFH-SEM框架,利用神经场整合多视图几何与探测器信号光度立体线索,实现高保真三维表面重建,展示了在不同材料上的精确恢复能力。
Comments CVPR 2026
EventHub:无需主动传感器的通用事件基立体网络数据工厂
机构 * Advanced Research Center on Electronic System (ARCES)(电子系统高级研究中心 (ARCES)) ; TU Berlin, Robotics Institute Germany(柏林工业大学德国机器人研究所) ; Einstein Center Digital Future(爱因斯坦数字未来中心) ; SCIoI Excellence Cluster(SCIoI卓越集群)
AI总结 EventHub利用标准彩色图像生成代理标注和事件,无需主动传感器的地面真实标注,重新利用先进RGB立体模型处理事件数据,提升立体网络的泛化能力。
Comments CVPR 2026. Project Page: https://bartn8.github.io/eventhub/ Code: https://github.com/bartn8/eventhub
调制与映射:用于3D异常检测的跨模态特征映射与跨视图调制
机构 * CVLab, University of Bologna(博洛尼亚大学CVLab) ; Ca’ Foscari University of Venice(威尼斯大学)
AI总结 ModMap提出一种多视图多模态框架,通过跨模态特征映射和视图依赖关系建模,实现3D异常检测与分割,采用跨视图训练策略提升异常评分。
Comments Accepted at CVPR Findings 2026
SPAR:单次通过任意分辨率ViT用于开放词汇分割
AI总结 SPAR通过单次通过任意分辨率ViT实现高效高分辨率推理,提升开放词汇分割的mIoU性能,无需架构改动或像素级监督。
Comments Accepted to CVPR 2026
超越折叠:量化分层噪声及留一数据集-out AU评估的案例
机构 * CGI Technologies and Solutions Inc(CGI技术与解决方案公司) ; University of Pittsburgh(匹兹堡大学) ; University of South Florida(南佛罗里达大学)
AI总结 本文探讨了交叉验证中分层噪声的影响,发现其引入了可测量的随机方差,并通过留一数据集-out方法验证了跨数据集鲁棒性,指出交叉折叠验证的提升可能源于协议方差。
Comments CVPR 2026
GroundVTS:多模态大语言模型中的视频时间定位视觉标记采样
机构 * Newcapec AI Research(新开普人工智能研究院) ; Fudan University(复旦大学) ; Tongji University(同济大学)
AI总结 本文提出GroundVTS,通过细粒度查询引导机制筛选视觉标记,提升视频时间定位的时空信息保留与时间连贯性,实验表明其在三个标准基准上优于现有方法。
Comments Published as a conference paper at CVPR 2026
PAM:一种用于仿真到现实手-物体互动视频生成的姿态-外观-运动引擎
机构 * Peking University(北京大学) ; Tsinghua University(清华大学) ; BAAI(北京智源人工智能研究院) ; SJTU(上海交通大学) ; Eastern Institute of Technology(东方理工高等研究院) ; University of Cambridge(剑桥大学)
AI总结 本文提出PAM引擎,整合姿态、外观和运动生成可控的HOI视频,通过实验验证其在DexYCB和OAKINK2数据集上的性能优势。
Comments Accepted to CVPR 2026 Code: https://github.com/GasaiYU/PAM
HERBench:视频问答中多证据整合的基准
机构 * INSIGHT Lab, Ben-Gurion University of the Negev(本-古里安大学 INSIGHT 实验室) ; Ben-Gurion University of the Negev(本-古里安大学)
AI总结 HERBench通过要求至少三个非重叠视频片段线索,推动视频问答中多证据整合的研究,评估13种最新视频大语言模型,发现其准确率仅31-42%,揭示检索与融合两大瓶颈。
Comments Accepted to CVPR 2026
DeDelayed:通过设备端校正删除远程推断延迟
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; InterDigital
AI总结 本文提出DeDelayed系统,通过设备端与远程模型协同推断,降低视频处理延迟,提升实时视频分割性能。
Comments CVPR 2026
挖掘实例导向的视觉-语言上下文以实现人-物交互检测
机构 * Seoul National University(首尔国立大学) ; Hanyang University(汉阳大学)
AI总结 本文提出InCoM-Net框架,通过整合VLM提取的语义知识与实例特征,提升人-物交互检测的交互推理能力,实验表明其在HICO-DET和V-COCO基准上达到最优性能。
Comments Accepted to CVPR 2026. Code: https://github.com/nowuss/InCoM-Net
IndoorCrowd: 一个用于人体检测、分割和跟踪的多场景数据集及自动化标注流水线
机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国家科学技术大学) ; Expleo
AI总结 IndoorCrowd数据集通过多场景采集,提供人体检测、实例分割和多目标跟踪的基准,包含31个视频和自动化标注工具的评估结果,揭示了人群密度、尺度和遮挡对任务的影响。
Comments Accepted at Conference on Computer Vision and Pattern Recognition Workshops 2026
面向第一视角视频的个性化问答中的自我定位
机构 * University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出MyEgo数据集,用于评估多模态大语言模型在需要自我定位的个性化问答中的能力,发现现有模型在自我记忆和推理方面存在显著不足。
Comments To appear at CVPR'26
低努力对抗攻击针对文本到图像安全过滤器
机构 * University of Nottingham(诺丁汉大学) ; Xi’an Jiaotong-Liverpool University(西交利物浦大学) ; Xiamen University(厦门大学)
AI总结 研究揭示文本到图像模型易受低努力对抗攻击影响,通过提示策略绕过安全过滤,展示多种视觉对抗技术,揭示表面提示过滤与深层语义理解的差距,攻击成功率高达74.47%。
Comments Text-to-Image version of the Anyone can Jailbreak paper. Accepted in CVPR-W AIMS 2026
PTC-Depth:基于姿态优化的单目深度估计与时间一致性
机构 * Ajou University(亚洲大学) ; Sony Creative AI Lab(索尼创意AI实验室)
AI总结 本文提出PTC-Depth框架,通过轮式里程计实现稳定深度估计,结合光流三角化估计相机姿态和稀疏深度,利用递归贝叶斯估计修正尺度,提升深度预测的准确性和一致性。
Comments Accepted at CVPR 2026
GardenDesigner: 通过一系列智能体编码美学原则以指导江南园林建设
机构 * Shanghai University(上海大学) ; Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
AI总结 本文提出GardenDesigner框架,通过智能体链编码江南园林建设的美学原则,结合地形分布和道路生成代理,实现快速生成多样化且美观的江南园林。
Comments CVPR 2026, Project page: https://monad-cube.github.io/GardenDesigner
超声-CLIP:面向超声图像-文本理解的语义感知对比预训练
机构 * Hangzhou City University(杭州城市大学) ; Hong Kong Baptist University(香港浸会大学) ; Zhejiang University(浙江大学) ; The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院) ; City University of Hong Kong(香港城市大学)
AI总结 本文提出超声-CLIP,通过构建US-365K数据集和UDT知识框架,引入语义软标签和损失函数,提升超声图像与文本的语义对比学习效果,实现分类和检索的SOTA性能。
Comments Accepted by CVPR 2026