arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1406 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1406 篇

2606.26379 2026-06-26 cs.CV 新提交 57%

Layer-Specific Prompt Fusion Discovery via Differentiable Search in Vision Foundation Models

基于可微搜索的视觉基础模型层特定提示融合发现

Xi Xiao, Xingjian Li, Yunbei Zhang, Cheng Han, Tianming Liu, Tianyang Wang, Runmin Jiang, Jihun Hamm, Xiao Wang, Min Xu

机构 * UAB(阿拉巴马大学伯明翰分校) CMU(卡内基梅隆大学) Tulane(杜兰大学) UMKC(密苏里大学堪萨斯分校) UGA(佐治亚大学) ORNL(橡树岭国家实验室)

专题命中 融合架构与评测 :hybrid fusion(abstract);分类 cs.CV

AI总结 研究视觉提示微调中提示与图像令牌的融合方案,提出可微架构搜索方法联合优化可学习提示及其融合方式,在34个数据集上取得一致提升。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20390 2026-06-26 cs.CV 新提交 57%

Geometry-Aware Superpixel Graph Transformer with Metadata for Skin Lesion Classification

几何感知超像素图变换器结合元数据用于皮肤病变分类

Muhammad Azeem, Tanveer Hussain, Amr Ahmed, Ardhendu Behera

机构 * Edge Hill University(埃奇希尔大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出一种基于区域的图学习框架,将病变建模为超像素图,利用几何边属性和元数据上下文节点,通过边缘感知图变换器实现多模态融合,在四个公开数据集上取得优于现有方法的分类性能。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25278 2026-06-25 cs.CV cs.AI 新提交 57%

Heterogeneous and Adept Snapshot Distillation for 3D Semantic Segmentation

异构与专长快照蒸馏用于3D语义分割

Xiaopei Wu, Yuenan Hou, Junkai Xu, Wenxiao Wang, Binbin Lin, Yu Li, Ping Li, Haifeng Liu, Deng Cai, Wanli Ouyang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Zhejiang University(浙江大学) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 提出异构和专长快照知识蒸馏(HAS-KD),通过信息导向异构蒸馏(IHD)和专长快照蒸馏(ASD)将多模态模型和多个模型专家的知识高效迁移到点云网络,在ScanNetV2和S3DIS上取得最先进结果。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-06-23 eess.IV 新提交 57%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Xiangqian Wu

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21174 2026-06-23 cs.CV q-bio.GN 新提交 57%

HERO: Hypothesis-Driven Evidence Retrieval from Omics for Multi-Task Breast Cancer Analysis

HERO:基于假设驱动的组学证据检索用于多任务乳腺癌分析

Xiangyu Li, Ran Su

机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出HERO框架,将组学数据作为形态学假设进行显式检索,通过稀疏通路先验和TF-IDF检索实现可审计的多模态乳腺癌分析,在TCGA-BRCA上取得多项预测任务的最优结果。

Comments 11 pages, 3 figures, Early accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20738 2026-06-23 cs.CV cs.AI 新提交 57%

An approach with Visual and Tabular Mamba to multimodal medical data using Mixed Fusion

一种基于视觉和表格Mamba的混合融合多模态医疗数据方法

Matheus B. Rocha, Gustavo B. Dettogni, Renato A. Krohling

机构 * Labcin - Nature Inspired Computing Lab, Federal University of Esp\'irito Santo, Vit\'oria, Brazil PPGI - Graduate Program in Computer Science, Federal University of Esp\'irito Santo, Vit\'oria, Brazil

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出基于Mamba架构的混合融合方法,通过视觉和表格两种Mamba变体处理图像与临床数据,在癌症分类中实现可解释性,在NDB-UFES数据集上表现优于Transformer。

Comments 15 pages. accepted to 36th Brazilian Conference on Intelligent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17921 2026-06-17 cs.MM 新提交 57%

OlfactProfile: Profile-Conditioned Odor Prediction from Audiovisual Content

OlfactProfile: 基于用户嗅觉特征从视听内容预测气味

Zhengyu Lou, Bosheng Qin, Yanan Wang, Duanduan Yin, Wentao Ye, Yu Xin

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 提出OlfactProfile框架,通过结构化场级用户嗅觉特征调制,实现从视听内容预测气味,优于基线模型和通用多模态大模型,在背景气味和情感气味预测上提升显著。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17437 2026-06-17 cs.CV cs.AI 新提交 57%

Spatio-Temporal Fusion Model for Standard View Classification of Echocardiographic Videos

超声心动图视频标准视图分类的时空融合模型

Bo Gou, Jicheng Zhang, Jianlong Xiong, Tao He, Bentian Liu, Hai Wu, Yijiao Wang, Yu Zhang, Yujia Yang, Yun Dai, Jian Liu, Jie Wang

机构 * Department of Ultrasound, The First Affiliated Hospital of Chengdu Medical College, School of Clinical Medicine, Chengdu Medical College(成都医学院第一附属医院超声科,临床医学院) College of Computer Science, Sichuan University(四川大学计算机学院) Department of Medical Ultrasound, West China Hospital of Sichuan University(四川大学华西医院超声科) Cancer Hospital, Chinese Academy of Medical Sciences and Peking Union Medical College(中国医学科学院北京协和医学院肿瘤医院)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 针对超声心动图视图分类中数据稀缺、时空特征难以融合的问题,提出基于不确定性感知的CNN-LSTM双流融合模型,在最大公开数据集EV9V上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14722 2026-06-16 q-bio.OT eess.IV 新提交 57%

A Comparative and Hybrid Study of CNN and Transformer Models for Multi-Class Virus Classification in Transmission Electron Microscopy

CNN与Transformer模型在透射电子显微镜多类病毒分类中的比较与混合研究

Md Mahmudul Hoque, Md Kawser Islam, Md. Mamunur Rahman Moon, Abdullah Rakib Akand, Md. Hadi Al-amin, H. M. Azrof

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.IV

AI总结 本研究比较了CNN和Transformer模型在TEM图像中22类病毒分类的性能,通过加权交叉熵缓解类别不平衡,Swin Transformer表现最佳,混合策略进一步提升了宏F1分数。

Comments 10 pages, 10 figures. Accepted on Springer LNCS Conference ICTIS 2026, Thailand

Journal ref Springer LNCS Conference ICTIS 2026, Thailand

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05888 2026-06-16 cs.CV 版本更新 57%

BioAutoML-NAS: An End-to-End AutoML Framework for Multimodal Insect Classification via Neural Architecture Search on Large-Scale Biodiversity Data

BioAutoML-NAS:基于大规模生物多样性数据通过神经架构搜索进行多模态昆虫分类的端到端AutoML框架

Arefin Ittesafun Abian, Debopom Sutradhar, Md Rafi Ur Rashid, Reem E. Mohamed, Md Rafiqul Islam, Asif Karim, Kheng Cher Yeo, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka, Bangladesh(乌姆国际大学计算机科学与工程系,达卡,孟加拉国) Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory, 1217, Dhaka, Bangladesh(应用人工智能与智能系统实验室(AAIINS),1217号,达卡,孟加拉国) Department of Computer Science and Engineering, Penn State University, University Park, PA, USA(宾夕法尼亚州立大学计算机科学与工程系,University Park,PA,美国) Faculty of Science and Information Technology, Charles Darwin University, Sydney, NSW, Australia(查尔斯达尔文大学科学与信息技术学院,悉尼,新南威尔士州,澳大利亚) Faculty of Science and Technology, Charles Darwin University, Casuarina, 0909, NT, Australia(查尔斯达尔文大学科学与技术学院,Casuarina,0909,北领地,澳大利亚)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出首个多模态BioAutoML模型BioAutoML-NAS,利用神经架构搜索自动学习图像操作,结合元数据融合与交替双层优化,在BIOSCAN-5M数据集上以96.81%准确率超越现有方法。

Comments Accepted in IEEE Transactions on Big Data

Journal ref IEEE Transactions on Big Data (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27343 2026-06-05 cs.CV 57%

JI-ADF: Joint-Individual Learning with Adaptive Decision Fusion for Multimodal Skin Lesion Classification

JI-ADF:联合-个体学习与自适应决策融合用于多模态皮肤病变分类

Phan Nguyen, Dat Cao, Hien Kha, Hien Chu, Minh Le, Trang Pham, Nguyen Quoc Khanh Le

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出JI-ADF框架,通过整合皮肤镜图像、临床照片和结构化患者数据,实现基于临床的皮肤病变分类,采用多模态表示学习和自适应决策融合机制,提升跨模态推理能力,并在MILK10k数据集上验证了其在实际临床场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04836 2026-06-04 cs.CV 57%

3D Temporal Analysis for Autism Spectrum Disorder Screening During Attention Tasks

注意力任务期间自闭症谱系障碍筛查的3D时间分析

Inam Qadir, Elizabeth B Varghese, Dena Al-Thani, Marwa Qaraqe

机构 * College of Science and Engineering, Hamad Bin Khalifa University, Qatar Foundation, Doha, Qatar(科学与工程学院,哈马德·本·哈利法大学,卡塔尔基金会,多哈,卡塔尔)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出基于DECA的3D时间分析框架,提取头部姿态和面部表情特征,利用LSTM/GRU分类器在VR-CPT任务中实现ASD筛查,多模态融合达到84.6%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26255 2026-05-29 eess.IV cs.AI cs.LG 57%

Prospective evaluation of multimodal respiratory failure prediction: Do chest X-rays improve performance beyond EHR signals?

多模式呼吸衰竭预测的前瞻性评估:胸部X光片能否在电子健康记录信号之外提升性能?

Xiaolei Lu, Shamim Nemati

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.IV

AI总结 本研究提出一种门控多模态框架,集成结构化电子健康记录时间序列数据和胸部X光片基础模型表示,用于前瞻性预测ICU患者24小时内是否需要有创机械通气,结果显示相比仅使用电子健康记录的模型和医生预测,多模态融合提高了区分度、敏感性和阳性预测值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26513 2026-05-27 cs.CV 57%

Re-M3Dr: Rebalanced MultiModal Mean Deviation Regression

Re-M3Dr:重新平衡的多模态均值偏差回归

Haojie Yin, Chengcheng Feng, Tianyi Liu, Tianqi Zhang, Kaizhu Huang

机构 * Duke Kunshan University, China(杜克大学昆山学院) Xi'an Jiaotong-Liverpool University, China(西安交通大学利物浦大学) Soochow University(苏州大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对多模态医学图像融合性能反不如单模态的问题,提出Re-M3Dr框架,通过自适应边界的监督对比学习和锐度感知梯度调制,实现多模态均值偏差回归,在临床数据集上均方误差降低29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25595 2026-05-26 cs.CV 57%

How Far Has AI Come in Liver Fibrosis Staging? A Large-Scale Real-World Dataset and Benchmark

AI在肝纤维化分期中取得了多大进展?大规模真实世界数据集与基准

Yuanye Liu, Nannan Shi, Zhejia Zhang, Hanxiao Zhang, Boya Wang, Derong Yu, Nao Wang, Yuxin Jin, Yang Zhou, Kunhao Yuan, Siqi Wang, Lida Yang, Xu Qiao, Wentao Liu, Xuelei He, Xin Hong, Guoyan Zheng, Xin Chen, Guang-Zhong Yang, Le Zhang, Lei Li, Yuxin Shi, Xiahai Zhuang

机构 * School of Data Science, Fudan University, Shanghai, China(复旦大学数据科学学院) Department of Radiology, Shanghai Public Health Clinical Center, Fudan University, Shanghai, China(复旦大学上海公共卫生临床中心放射科) Department of Electrical and Computer Engineering, Northwestern University, Evanston, USA(西北大学电气与计算机工程系) Shanghai Key Laboratory of Flexible Medical Robotics, Tongren Hospital, Institute of Medical Robotics, Shanghai Jiao Tong University, Shanghai, China(上海柔性医疗机器人重点实验室) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院) School of Computer Science, University of Nottingham, Nottingham, UK(诺丁汉大学计算机科学学院) Institute of Medical Robotics, School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China(上海交通大学生物医学工程学院医疗机器人研究所) College of Computer Science and Technology, Huaqiao University, Xiamen, China(华侨大学计算机科学与技术学院) School of Electronic Information (School of Artificial Intelligence), Northwest University, Xi'an, China(西北大学电子信息学院(人工智能学院)) Department of Mechanical Engineering, University College London, London, UK(伦敦大学学院机械工程系) Institute of Neuroscience and Cardiovascular Research, University of Edinburgh, Edinburgh, UK(爱丁堡大学神经科学与心血管研究学院) CAS Center for Excellence in Nanoscience, National Center for Nanoscience and Technology, Beijing, China(中国科学院纳米科学卓越中心) School of Control Science and Engineering, Shandong University, Jinan, China(山东大学控制科学与工程学院) School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(伯明翰大学工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 基于多中心、多序列MRI的大规模真实世界数据集LiFS,系统评估了9种AI方法在肝纤维化分期中的表现,发现最佳AI与资深放射科医生相当,但跨中心异质性和标签不平衡仍是主要挑战。

Comments Submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25288 2026-05-26 cs.IT cs.AI cs.ET cs.LG eess.SP math.IT 57%

CSI-tuples-based 3D Channel Fingerprints Construction Assisted by MultiModal Learning

基于CSI元组的多模态学习辅助3D信道指纹构建

Chenjie Xie, Li You, Ruirong Chen, Gaoning He, Xiqi Gao

机构 * National Mobile Communications Research Laboratory, Southeast University(东南大学国家移动通信研究中心) Purple Mountain Laboratories(紫金山实验室) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 针对低空通信中的3D信道指纹构建问题,提出一种基于CSI元组的多模态回归框架,通过融合位置、通信测量和地理环境地图,实现高效高精度的信道状态信息估计。

Comments 14 pages, 9 figures

Journal ref IEEE Transactions on Wireless Communications, vol. 25, pp. 17369-17383, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16923 2026-05-22 cs.CV 57%

Neuroscience-inspired Staged Representation Learning with Disentangled Coarse- and Fine-Grained Semantics for EEG Visual Decoding

受神经科学启发的分阶段表征学习:解纠缠的粗粒度和细粒度语义用于EEG视觉解码

Xiang Gao, Hui Tian, Yanming Zhu, Xuefei Yin, Alan Wee-Chung Liew

机构 * School of Information and Communication Technology, Griffith University(信息与通信技术学院,格里菲斯大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文提出了一种受神经科学启发的分阶段表征学习框架,通过解纠缠的粗粒度和细粒度语义来改进EEG视觉解码,解决了现有方法在人类视觉处理分阶段和层次特性方面的不足。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20713 2026-05-21 cs.CV cs.AI cs.LG 57%

SAVER: Selective As-Needed Vision Evidence for Multimodal Information Extraction

SAVER:选择性所需视觉证据用于多模态信息提取

Miaobo Hu, Shuhao Hu, Bokun Wang, Rui Chen, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 该研究提出SAVER框架,通过选择性视觉证据提升多模态命名实体识别和关系抽取的性能,减少计算开销并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08235 2026-05-21 cs.CV cs.AI 57%

Exploring Deep Learning and Ultra-Widefield Imaging for Diabetic Retinopathy and Macular Edema

探索深度学习与超宽场成像用于糖尿病视网膜病变和黄斑水肿

Pablo Jimenez-Lizcano, Sergio Romero-Tapiador, Ruben Tolosana, Aythami Morales, Guillermo González de Rivera, Ruben Vera-Rodriguez, Julian Fierrez

机构 * BiometricsAI, Universidad Autónoma de Madrid, Madrid, Spain(生物度量AI,马德里自治大学,马德里,西班牙) Department of Mathematics, Universidad de Las Palmas de Gran Canaria, Spain(数学系,拉斯帕尔马斯大Canaria大学,西班牙) HCTLab Research Group, Universidad Autónoma de Madrid, Madrid, Spain(HCTLab研究组,马德里自治大学,马德里,西班牙)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.CV

AI总结 本文研究了深度学习和超宽场成像在糖尿病视网膜病变和黄斑水肿检测中的应用,通过公开数据集评估了多种深度学习模型,并探讨了特征融合和频域表示的潜力。

Comments 6 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12031 2026-05-13 cs.LG cs.CV 57%

Resilient Vision-Tabular Multimodal Learning under Modality Missingness

在模态缺失下的视觉-表格多模态学习的鲁棒性

Camillo Maria Caruso, Valerio Guarrasi, Paolo Soda

机构 * Research Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统研究单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与干预系,辐射物理,生物医学工程,乌梅大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种多模态Transformer框架,用于在普遍存在模态缺失的情况下进行视觉-表格联合学习,通过可学习的模态标记和中间融合实现鲁棒的多模态推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07149 2026-05-11 cs.CV 57%

Real-IAD MVN: A Multi-View Normal Vector Dataset and Benchmark for High-Fidelity Industrial Anomaly Detection

Real-IAD MVN:一种多视角法向量数据集和基准,用于高保真工业异常检测

Wenbing Zhu, Jianing Liang, Linjie Cheng, Yurui Pan, Zhuhao Chen, Qingwang Yan, Yudong Cheng, Jianghui Zhang, Mingmin Chi, Bo Peng

机构 * Fudan University(复旦大学) Shanghai Ocean University(上海海洋大学) Donghua University(东华大学) Rongcheer Co., Ltd.(荣驰科技有限公司)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出Real-IAD-MVN数据集,通过多视角法向量捕捉微细几何缺陷,验证密集多视角伪3D数据在工业异常检测中的优越性能。

Comments Accepted to CVPR 2025. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05912 2026-05-08 cs.LG cs.CV 57%

From Drops to Grid: Noise-Aware Spatio-Temporal Neural Process for Rainfall Estimation

从水滴到网格:面向噪声的时空神经过程用于降雨估计

Rafael Pablos Sarabia, Joachim Nyborg, Morten Birk, Ira Assent

机构 * Dept. Comp. Sc., Aarhus University(计算机科学系,奥胡斯大学) Cordulus

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出DropsToGrid方法,通过融合噪声天气站的时间序列与雷达空间信息,生成高分辨率降雨场,有效处理降雨的偏态、局部性和噪声问题,提升不确定性量化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15311 2026-05-05 cs.CV cs.ET 57%

A Comprehensive Review of Fish Feeding Behavior Analysis in Aquaculture: Tasks, Techniques, and Applications

水产养殖中鱼类摄食行为分析的全面综述:任务、技术与应用

Shulong Zhang, Daoliang Li, Jiayin Zhao, Mingyuan Yao, Yingyi Chen, Haihua Wang

机构 * National Innovation Center for Digital Fishery(数字渔业国家创新中心) Key Laboratory of Smart Farming Technologies for Aquatic Animal and Livestock(水产动植物智能养殖技术重点实验室) State Key Laboratory of Efficient Utilization of Agricultural Water Resources(农业用水高效利用国家重点实验室) Beijing Engineering and Technology Research Center for Internet of Things in Agriculture(农业物联网工程技术研究中心) Key Laboratory of Digital Fisheries of Shandong Province(山东省数字渔业重点实验室) College of Information and Electrical Engineering, China Agricultural University(中国农业大学信息与电气工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文综述了水产养殖中鱼类摄食行为分析的任务定义、技术支撑及应用现状,探讨了计算机视觉、声学、传感器及多模态融合技术的发展,分析了其在智能投喂和养殖管理中的应用价值及未来研究方向。

Comments 37 pages, 8 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27259 2026-05-01 cs.CV cs.LG 57%

VTBench: A Multimodal Framework for Time-Series Classification with Chart-Based Representations

VTBench: 一种基于图表表示的多模态时间序列分类框架

Madhumitha Venkatesan, Xuyang Chen, Dongyu Liu

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VTBench,通过融合原始序列和图表可视化,系统评估了时间序列分类中图表类型、视觉编码和数据集的影响,展示了图表模型在特定领域的竞争力及多模态融合的优势。

Comments 8 pages main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23532 2026-04-28 cs.CV cs.AI 57%

Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model

基于轻量预测世界模型的情感条件短周期人体姿态预测

Jingni Huang, Peter Bloodsworth

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03248 2026-04-27 cs.LG cs.AI cs.CV physics.med-ph 57%

Multimodal Neural Operators for Real-Time Biomechanical Modelling of Traumatic Brain Injury

多模态神经算子用于创伤性脑损伤的实时生物力学建模

Anusha Agarwal, Dibakar Roy Sarkar, Somdatta Goswami

机构 * Johns Hopkins Whiting School of Engineering(约翰霍普金斯大学惠廷工程学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出多模态神经算子架构用于创伤性脑损伤的生物力学建模,通过融合体积解剖影像、人口特征和采集参数,预测全字段脑位移,验证了DeepONet在准确性、速度和参数量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03476 2026-04-24 cs.CV 57%

Anatomy-Aware Text-Visual Fusion with Dual-Perspective Prompts for Fine-Grained Lumbar Spine Segmentation

具有双视角提示的解剖感知文本-视觉融合用于细粒度腰椎分割

Sheng Lian, Jianlong Cai, Dengfeng Pan, Guang-Yong Chen, Hao Xu, Fan Zhang, Guodong Fan, Shuo Li

机构 * College of Computer and Data Science(计算机与数据科学学院) Shandong Technology and Business University(山东科技商务大学) Engineering Research Center of Big Data Intelligence (Fuzhou University)(大数据智能工程研究中心(福州大学)) The Chinese University of Hong Kong(香港中文大学) Case Western Reserve University(凯斯西储大学)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出ATM-Net框架,通过解剖感知文本引导的多模态融合机制,提升腰椎细粒度分割精度,实验表明其在MRSpineSeg和SPIDER数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14574 2026-04-17 cs.CV 57%

M3D-Net: Multi-Modal 3D Facial Feature Reconstruction Network for Deepfake Detection

M3D-Net:面向深度伪造检测的多模态3D面部特征重建网络

Haotian Wu, Yue Cheng, Shan Bian

机构 * College of Mathematics and Informatics(数学与信息学院) South China Agricultural University(华南农业大学) Wushan Road, Tianhe District(天河南路) Guangzhou(广州) China(中国)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-Net,通过多模态特征融合和3D重建模块提升深度伪造检测的准确性和鲁棒性,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14520 2026-04-17 cs.CV 57%

Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs

模态链:从静态融合到动态编排在多模态大语言模型中

Ziyang Luo, Nian Liu, Junwei Han

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出CoM框架,通过动态编排解决多模态融合的静态融合问题,提升模型在不同任务中的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14025 2026-04-16 cs.CV cs.AI cs.GR 57%

Feed-Forward 3D Scene Modeling: A Problem-Driven Perspective

前馈3D场景建模:以问题为导向的视角

Weijie Wang, Qihang Cao, Sensen Gao, Donny Y. Chen, Haofei Xu, Wenjing Bian, Songyou Peng, Tat-Jen Cham, Chuanxia Zheng, Andreas Geiger, Jianfei Cai, Jia-Wang Bian, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Monash University(墨尔本大学) ETH Zurich(苏黎世联邦理工学院) University of Tübingen(图宾根大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文探讨了前馈3D重建的通用方法,提出以模型设计为核心的分类体系,涵盖特征增强、几何意识、模型效率等五个核心问题,旨在推动3D场景建模的标准化与可扩展性。

Comments 67 pages, 395 references. Project page: https://ff3d-survey.github.io. Code: https://github.com/ziplab/Awesome-Feed-Forward-3D. This work has been submitted to Springer for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏