Fine-Grained Food Image Understanding via Target-Aware Data Alignment
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 音视频/视觉语言融合 :decision-level fusion(abstract);分类 cs.CV
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 音视频/视觉语言融合 :decision-level fusion(abstract);分类 cs.CV
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型
机构 * Soochow University(苏州大学) ; Tsinghua University(清华大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。
DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整
机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。
Comments accepted to IJCB2026
通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别
机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ; ResoSight, Montreal, Canada(ResoSight公司)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP
AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。
Comments 15 pages, 4 figures
基于稀疏注意力的自适应跨模态融合用于行人过街意图预测
机构 * Faculty of Information Science & Technology, Multimedia University(信息科学与技术学院,马来西亚多媒体大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 研究针对自动驾驶中行人过街意图预测问题,提出ADAPT多模态框架,通过五个模块联合建模视觉和运动信息,实验证明该方法优于现有技术,在准确率和实时性上取得平衡,为智能交通等应用提供有效方案。
Comments 17 pages, 5 figures, 4 tables. Under review at PeerJ Computer Science
VSRo-200:用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集
机构 * University of Bucharest(布加勒斯特大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文介绍罗马尼亚语视觉语音识别数据集VSRo-200,通过伪标签和人工转录注释样本,建立低资源视觉语音识别基准。研究监督质量影响,评估域转移鲁棒性及噪声下视听语音识别,证明其表示可转移至其他基准,为相关研究提供新测试平台。
SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合
机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。
$C^3$ASD:多层次一致性驱动的表示学习
机构 * Chung-Ang University(中央大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。
Comments ECCV 2026
Q-TriM:用于视听问答的问题引导三模态注意力
机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。
Comments Accepted at ECCV 2026
学习何时倾听:用于人体运动预测的门控情感融合
机构 * University of Oxford(牛津大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出门控情感变换器(GAT)动态调节跨模态信息流,解决无约束视频中情感特征与姿态融合的噪声问题,证明面部情感仅在短中期(如30帧)提供有限预测线索。
CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。
Comments 15 pages
CrossWeaver:跨模态编织用于任意模态语义分割
机构 * The University of Sydney(悉尼大学) ; University of Technology Sydney(悉尼科技大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出CrossWeaver框架,通过Modality Interaction Block和Seam-Aligned Fusion模块实现高效跨模态融合,在多模态语义分割中取得最佳性能。
LaVPR:语言与视觉用于位置识别的基准测试
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。
Comments Accepted to ECCV
一种物理知情、行为感知的数字孪生方法,用于精准畜牧业中核心体温的鲁棒多模态预测
机构 * Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) ; Department of Computer Science and Engineering(计算机科学与工程系) ; Department of Data Science and Artificial Intelligence(数据科学与人工智能系) ; Department of Software Systems & Cybersecurity(软件系统与网络安全系) ; Energy and Resources Institute, Faculty of Science and Technology(能源与资源研究所,科学与技术学院) ; Faculty of Science and Technology(科学与技术学院) ; School of Engineering and Energy(工程与能源学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出物理知情数字孪生框架,结合不确定性感知的专家加权堆叠集成,利用ODE热调节模型、高斯过程、卡尔曼滤波和行为马尔可夫链,融合多模态数据实现奶牛核心体温的2小时提前预测,R²达0.783。
EmoZone-Talker: 基于面部动作单元的音频驱动3DGS说话人头部的区域语义控制
机构 * China University of Petroleum (East China)(中国石油大学(华东))
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出EmoZone-Talker框架,通过区域解耦和时序建模解决音频与表情信号的冲突,实现精细、可解释的面部表情控制。
特质更深:面向人格评估的特质特异性非对称融合
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) ; Jianghuai Advanced Technology Center(江淮前沿技术中心) ; Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。
用于音视频事件识别的稳定混合交叉注意力融合
专题命中 音视频/视觉语言融合 :hybrid fusion(abstract);分类 eess.SP
AI总结 提出一种结合VideoMAE和AST的混合交叉注意力融合框架,通过FiLM音频条件、双向交叉注意力融合和多模态Transformer编码,在AVE数据集上达到91.74%的验证准确率和83.85%的测试准确率。
Comments 6 pages, 4 Figures
SMAC: 空间-模态联合建模与自适应表示崩溃的多模态目标跟踪
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.IV
AI总结 针对复杂光照下多模态多目标跟踪中空间与模态特征联合建模不足及固定融合策略适应性有限的问题,提出基于空间-模态卷积融合和蒸馏提示的多模态跟踪框架,通过解耦3D卷积、幅相分解和表示崩溃网络实现自适应融合,在UniRTL数据集上取得领先性能。
Comments 12 pages, 16 figures. Code and pretrained models are available at https://github.com/QitaiSun/SMAC
特征对齐决定融合策略:多模态学习中交叉注意力与拼接的比较研究
机构 * Hunan Chemical Industry Vocational and Technical College(湖南化学工业职业技术学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 通过实验和理论分析,证明特征对齐质量而非数据规模是决定多模态融合策略优劣的关键因素,当特征预对齐时拼接优于交叉注意力。
Comments 8 pages,6 figures,4 tables
使用LLMs的多模态音乐推荐系统
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) ; Dolby Laboratories(Dolby实验室) ; Adobe Research(Adobe研究) ; Cisco Research(Cisco研究)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 提出一个多模态框架,通过融合音频、歌词、LLM生成的语义元数据和收听完成率,在基于会话的音乐推荐中显著提升Recall和NDCG。
LoMo: 局部模态替换以实现更深的视觉-语言融合
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对视觉-语言模型在模态替换时性能下降的“载体敏感性”问题,提出局部模态替换(LoMo)数据策展范式,通过将文本片段动态渲染为图像来训练跨模态表示不变性,显著提升多模态推理与融合效果。
基于Mamba的第一人称视频跨模态动作识别:通过CLS令牌融合策略整合RGB和手部骨架流
机构 * Univ. of Buenos Aires. Faculty of Exact and Natural Sciences. Dept. of Computer Science (DC)(布宜诺斯艾利斯大学。精确与自然科学学院。计算机科学系) ; CONICET-Univ. of Buenos Aires. Institute of Computer Sciences (ICC)(布宜诺斯艾利斯大学CONICET联合体。计算机科学研究所)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出一种基于Mamba的跨模态架构,通过四种CLS令牌融合策略(朴素、平均、加权和基于上下文)整合RGB视频和手部骨架数据,在H2O数据集上平均策略达到最佳性能,Top-1准确率在Tiny配置下提升超10%。
Comments 4 pages , 2 figures , Egovis2026 , CVPR2026
AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力
机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) ; Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) ; Stanford University(斯坦福大学) ; University of Central Florida(佛罗里达中央大学) ; University of Surrey(萨里大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。
Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026
GraphFusion3D: 动态图注意力卷积与自适应跨模态Transformer用于3D目标检测
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 本文提出GraphFusion3D框架,结合多模态融合与先进特征学习,通过自适应跨模态Transformer增强几何与语义信息,并引入图推理模块捕捉局部结构与全局语义,实验在SUN RGB-D和ScanNetV2上均取得显著提升。
具有内存库的多模态扩散变换器用于可扩展的长时谈话视频生成
机构 * South China University of Technology(南方科技大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Beijing National Research Center for Information Science and Technology, Tsinghua University(北京信息科学研究中心,清华大学) ; Department of Automation, BNRist, Tsinghua University(清华大学自动化系,北京信息科学研究中心)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出 LetsTalk 框架,通过多模态指导和内存库机制解决长时谈话视频生成中的质量、一致性、时间连贯性和计算效率问题,实验表明其在生成质量和效率上达到新水平。
Comments 16 pages, 25 figures
OmniVLA-RL:具备空间理解与在线强化学习的视觉-语言-动作模型
机构 * AI Lab, Country Garden Services(国家花园服务人工智能实验室) ; Omni AI(奥米尼人工智能) ; VBot ; East China Normal University(东华大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.RO
AI总结 本文提出OmniVLA-RL模型,通过混合Transformer架构整合推理、空间和动作专家,结合Flow-GSPO提升动作精度与训练稳定性,在LIBERO和LIBERO-Plus基准上表现优异,克服了现有VLA模型的局限。
基于感知增强的视觉-语言模型的物体指称引导的注视路径预测
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学)
专题命中 音视频/视觉语言融合 :information fusion(abstract);分类 cs.CV
AI总结 本文提出ScanVLA模型,通过融合视觉和语言特征提升物体指称引导的注视路径预测性能,引入历史增强解码器和冻结分割LoRA辅助定位,提升预测精度且不增加计算成本。
Comments ICMR 2026
从多模态信号到自适应XR体验的降级训练
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.MM
AI总结 本文提出了一种多模态实时通信分析系统,用于自适应VR训练的基础交互层,整合了语音、手势、情感分析、脑电波和生理信号,通过同步技术实现用户意识和无意识沟通线索的连续评估,结合社会符号学和象征互动理论,构建了连接低层信号到冲突缓解的解释层。
Comments 16 pages, 5 figures, ACM Intelligent User Interfaces (IUI) Workshops 2026
渐进多模态交互网络用于水产养殖中鱼摄食强度的可靠量化
机构 * National Innovation Center for Digital Fishery(国家数字渔业创新中心) ; Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock, Ministry of Agriculture and Rural Affairs(农业农村部水产动物与畜禽智慧养殖技术重点实验室) ; State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业水资源高效利用全国重点实验室) ; Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(北京市农业物联网工程技术研究中心) ; Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) ; College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出渐进多模态交互网络PMIN,通过整合图像、音频和水波数据,有效解决多模态数据不一致性和决策冲突问题,提升鱼摄食强度量化可靠性,实验表明其在精度、参数和计算成本上均优于现有方法。
迈向社交平台可问责的AI生成内容:隐写术溯源与多模态危害检测
机构 * Kean University(基恩大学) ; North Dakota State University(北达科他州立大学) ; McGill University(麦吉尔大学) ; Villanova University(维拉诺瓦大学) ; University of Notre Dame(圣母大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文提出一种隐写术溯源框架,结合多模态危害检测,用于追踪AI生成图像的有害部署,提升合成媒体环境中的问责能力。
Comments 12 pages, 31 figures