Fine-Grained Food Image Understanding via Target-Aware Data Alignment
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 音视频/视觉语言融合 :decision-level fusion(abstract);分类 cs.CV
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
视觉与机器人
面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。
通过目标感知数据对齐实现细粒度食品图像理解
专题命中 音视频/视觉语言融合 :decision-level fusion(abstract);分类 cs.CV
AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。
DINO-VPT:用于联合物理-数字人脸反欺骗的分层视觉提示调整
机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 研究针对人脸反欺骗需求,提出DINO-VPT轻量级仅视觉框架,利用分层视觉提示调整,通过提示路由网络动态注入提示,无需多模态融合,在基准测试中比现有方法准确率更高,证明合理架构能达最优性能。
Comments accepted to IJCB2026
通过混合交叉注意力网络的知识蒸馏和动态 INT8 量化实现高效视听事件识别
机构 * University of Porto, Porto, Portugal(葡萄牙波尔图大学) ; ResoSight, Montreal, Canada(ResoSight公司)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 eess.SP
AI总结 研究针对视听事件识别模型在边缘设备部署的难题,提出结合架构压缩、知识蒸馏和动态 INT8 量化的框架。构建教师与学生模型,经知识蒸馏训练学生模型,再用动态量化减小模型大小。实验表明该框架有效平衡准确率与效率,利于在资源受限平台部署。
Comments 15 pages, 4 figures
基于稀疏注意力的自适应跨模态融合用于行人过街意图预测
机构 * Faculty of Information Science & Technology, Multimedia University(信息科学与技术学院,马来西亚多媒体大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 研究针对自动驾驶中行人过街意图预测问题,提出ADAPT多模态框架,通过五个模块联合建模视觉和运动信息,实验证明该方法优于现有技术,在准确率和实时性上取得平衡,为智能交通等应用提供有效方案。
Comments 17 pages, 5 figures, 4 tables. Under review at PeerJ Computer Science
VSRo-200:用于研究监督和多模态鲁棒性的罗马尼亚语视觉语音识别数据集
机构 * University of Bucharest(布加勒斯特大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 本文介绍罗马尼亚语视觉语音识别数据集VSRo-200,通过伪标签和人工转录注释样本,建立低资源视觉语音识别基准。研究监督质量影响,评估域转移鲁棒性及噪声下视听语音识别,证明其表示可转移至其他基准,为相关研究提供新测试平台。
SAC$^2$-Net:面向多模态微表情识别的语义锚定与互补共识融合
机构 * College of Electronic and Information Engineering, Southwest University(西南大学电子信息工程学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 针对微表情识别中光流与运动放大模态的不对称失效问题,提出SAC$^2$-Net,通过语义锚定软对齐减少跨模态异质性,并设计互补共识融合机制实现可靠性感知融合,在五个基准上取得最优或竞争力强的性能。
$C^3$ASD:多层次一致性驱动的表示学习
机构 * Chung-Ang University(中央大学)
专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV
AI总结 研究视频中活跃说话者检测问题,提出$C^3$ASD框架,含嵌入级、序列级和预测级一致性约束,提升跨模态表示鲁棒性,在多种损坏下有显著改进。
Comments ECCV 2026
Q-TriM:用于视听问答的问题引导三模态注意力
机构 * Dept. of Computer Science and Engineering(计算机科学与工程系)
专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV
AI总结 研究视听问答问题,提出Q-TriM以浅并行方式进行多模态融合,引入基于文本的视频和音频注意力操作框架,避免深度堆叠融合的问题,在三个基准测试中达最优性能。
Comments Accepted at ECCV 2026
学习何时倾听:用于人体运动预测的门控情感融合
机构 * University of Oxford(牛津大学)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出门控情感变换器(GAT)动态调节跨模态信息流,解决无约束视频中情感特征与姿态融合的噪声问题,证明面部情感仅在短中期(如30帧)提供有限预测线索。
EmoZone-Talker: 基于面部动作单元的音频驱动3DGS说话人头部的区域语义控制
机构 * China University of Petroleum (East China)(中国石油大学(华东))
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出EmoZone-Talker框架,通过区域解耦和时序建模解决音频与表情信号的冲突,实现精细、可解释的面部表情控制。
特质更深:面向人格评估的特质特异性非对称融合
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) ; Jianghuai Advanced Technology Center(江淮前沿技术中心) ; Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV
AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。
视频介导对话中不同伙伴可见性条件下的多模态信息性研究
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本研究针对视频介导对话,构建基于语音、手势或两者的模型识别指称对象,发现手势可单独预测指称,融合模型在转录模型不确定时效果最佳,还揭示了伙伴可见性对互动的语用效应。
DoubleHelix:结合大语言模型的视听语音识别结构化跨模态融合方法
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 该研究针对视听语音识别跨模态融合缺乏结构化迭代优化的问题,提出DoubleHelix融合框架,通过三个组件实现迭代交互与退化感知增强,在LRS3数据集上大幅降低词错误率并提升噪声鲁棒性。
Comments ACM MM2026 ACCEPTED
用于抑郁症检测的多模态域泛化:基于注意力的双向长短期记忆网络与域对抗训练
机构 * University of Milan(米兰大学) ; Gran Sasso Science Institute (GSSI)(大萨索科学研究所)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究针对深度学习抑郁症检测泛化受限问题,提出含域泛化的多模态检测框架,集成BiLSTM与注意力机制,用梯度反转层增强泛化,实验表明该方法提升了准确率和F1分数,超越现有基准,消融研究突出各因素贡献。
Comments 12 pages, 8 figures, 6 tables. Accepted for publication in IEEE Transactions on Neural Networks and Learning Systems (TNNLS)
用于情感和情绪识别的SHAP加权跨模态专家融合:证据与局限
机构 * Faculty of Science, University of Sarajevo(萨拉热窝大学理学院)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 研究多模态情感和情绪识别,重新审视XAI引导的自适应融合\xgaf,分析专家特征维度不等时SHAP归因减少的影响,通过实验对比不同融合方法在情感识别任务中的表现,揭示SHAP减少、专家维度和跨模态专家设计对模块化多模态融合的作用。
弦外之音:ASR嵌入与LLM增强语言学联合学习用于痴呆检测
机构 * Division of Communication and Media, Ewha Womans University, South Korea(韩国梨花女子大学传播与媒体学院) ; NAVER Cloud, South Korea(韩国NAVER Cloud)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出多模态框架,结合Whisper的声学表示与LLM提取的语言特征,通过门控融合网络实现痴呆检测,在ADReSS和ADReSSo上F1分别达89.47%和90.14%。
Comments Accepted at INTERSPEECH 2026
ASR无关的多模态谱时建模用于早期痴呆检测
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出一种不依赖语音识别的框架,直接从梅尔频谱图中提取谱时位移场作为数字生物标志物,结合CNN-ConvGRU声学嵌入和交叉注意力融合,在三种语言语料库上验证了多模态融合的语料依赖性。
协同零样本跨语言阿尔茨海默检测与语言不变多模态双几何对抗学习
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 提出ORBIT框架,通过跨注意力融合、多语言对抗和球面-双曲几何学习实现零样本跨语言阿尔茨海默病检测,多模态融合优于单模态基线。
Comments Accepted to INTERSPEECH 2026
基于数据驱动的Russell情感环状模型解码
机构 * Alten ; CentraleSupélec IETR UMR CNRS 6164(中央理工-高等电力学院 IETR CNRS 6164 联合研究单位) ; Inria at Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化研究所,格勒诺布尔阿尔卑斯大学,CNRS,LJK)
专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)
AI总结 本文研究Transformer嵌入是否恢复Russell环状模型的几何规律,通过文本和语音模型实验,发现多模态融合完美对齐情感排序,零样本下细粒度情感词接近人类映射坐标。
Comments This work has been submitted to the IEEE for possible publication
基于空间掩码与通道融合的深度多模态融合检测
机构 * KTH Royal Institute of Technology(KTH皇家理工学院) ; University of Maryland, College Park(马里兰大学帕克分校)
专题命中 融合架构与评测 :multimodal fusion(title,abstract);feature-level fusion(abstract);分类 cs.CV、cs.MM
AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。
信息融合背景下基于密度的模糊测度生成方法的表征
专题命中 融合架构与评测 :information fusion(title,abstract);decision-level fusion(abstract)
AI总结 研究信息融合中基于密度的FM生成方法,指出常用方法不足以唯一确定离散FM,展示如何确定区间值FM及相关置信区间,通过实验表明基于此FM的Choquet FI输出可视为‘理想’融合结果置信区间,为表征FI融合结果提供新途径。
Paths:面向RGB-Event视频行人重识别的感知提示的时空Transformer与分层多模态融合
机构 * Dalian University of Technology(大连理工大学)
专题命中 融合架构与评测 :multi-modal fusion(title,abstract);分类 cs.CV
AI总结 针对现有RE-VReID方法时空建模解耦、多模态融合不足的问题,提出含MAB、PST、HMF模块的Paths框架,在三个基准上验证了有效性。
Comments Accepted by ACM MM2026. More modifications may be performed
基于LoRA的级联多模态融合在医学训练环境中的动作识别
专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV
AI总结 研究面向医疗训练环境的动作识别,提出基于LoRA的级联多模态融合框架,结合特定模态适应与顺序融合,无需重新训练组件,在两个数据集上评估,结果显示该策略优于单模态模型且性能有竞争力。
男性不育症精液分析深度学习技术:计算机视觉、多模态融合与临床转化
机构 * Department of Gynaecology and Obstetrics, The Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院妇产科) ; Department of Oncology, the Affiliated Jiangyin Hospital of Nantong University(南通大学附属江阴医院肿瘤科) ; Thrust of AI, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)人工智能推力实验室) ; FertiTech AI(生殖科技人工智能公司) ; Department of Oncology, Suzhou Xiangcheng People’s Hospital(苏州市相城区人民医院肿瘤科) ; Department of Biological Sciences and Bioinformatics, School of Science, Xi’an Jiaotong-Liverpool University(西交利物浦大学理学院生物科学与生物信息学系) ; School of Artificial Intelligence and Computer Science, Nantong University(南通大学人工智能与计算机科学学院)
专题命中 融合架构与评测 :multimodal fusion(title,abstract);分类 cs.CV
AI总结 针对传统精液分析的主观性强等缺陷,综述聚焦计算机视觉与深度学习驱动的精子分析技术,梳理方法、数据集与落地障碍,提出分阶段临床转化路线。
Comments 46 pages, 14 figures
用于可信多组学多模态融合的自适应置信加权扩展
机构 * Faculty of Engineering, University of Ottawa(渥太华大学工程学院) ; RIV Lab, Department of Computer Engineering, Bu-Ali Sina University(布阿里·西纳大学计算机工程系RIV实验室) ; School of Computing and Communications, Lancaster University(兰卡斯特大学计算与通信学院)
专题命中 融合架构与评测 :multimodal fusion(title,abstract)
AI总结 针对多模态学习模型在噪声或无信息数据流下性能不佳及缺乏数据质量评估机制的问题,提出自适应置信加权扩展(ACE)框架,通过生成互补模态和双层置信机制提升性能,在多组学数据集评估中显著优于现有算法。
Comments Accepted for publication in the proceedings of the International Conference on Pattern Recognition (ICPR 2026)
用于鸟类骨骼分类的视觉与形态计量特征多模态融合
专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV
AI总结 本研究提出结合卷积神经网络图像分析与骨计量测量的多模态框架,用于鸟类骨骼分类,在骨骼类型分类准确率达86%,科级分类Top-1准确率51%、Top-3准确率75%,为AI辅助动物考古识别建立了方法学基线。
基于大语言模型衍生成分标签和多模态融合的食品图像分割
机构 * National Cheng Kung University(国立成功大学)
专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV
AI总结 针对现有食品图像分割模型在相似成分和罕见类别上表现不佳的问题,提出两个多模态模块LIM-F和LIM-Q,利用大语言模型衍生标签提升分割性能,在FoodSeg103基准测试中取得领先,且内存消耗增加适度,为细粒度食品理解提供实用方案。
DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合
专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.MM
AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。
质量感知多模态融合揭示效价-唤醒特征中的隐含身份
机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校)
专题命中 融合架构与评测 :multimodal fusion(title);分类 cs.CV
AI总结 研究针对传统人脸识别在无约束环境中表现不佳的问题,提出质量感知自适应融合方法 QAAF 用于多模态效价-唤醒估计,在 VA 估计任务中取得良好效果,且经 VA 训练的特征在编码身份上表现出色,确立了多模态 VA 估计为传统人脸识别的互补软生物特征模态。
Comments 10 pages, 3 figures, 6 tables. Accepted for publication at IEEE International Joint Conference on Biometrics (IJCB), 2026
深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合
机构 * Technion–Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 融合架构与评测 :multi-modal fusion(title);分类 cs.RO
AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。
Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)