arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 1406 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 融合架构与评测 1406 篇

2604.10000 2026-04-14 cs.CV 57%

SwinTextUNet: Integrating CLIP-Based Text Guidance into Swin Transformer U-Nets for Medical Image Segmentation

SwinTextUNet:将基于CLIP的文本引导整合到Swin Transformer U-Nets中用于医学图像分割

Ashfak Yeafi, Parthaw Goswami, Md Khairul Islam, Ashifa Islam Shamme

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出SwinTextUNet,结合CLIP文本嵌入与Swin Transformer U-Net,提升医学图像分割的鲁棒性和准确性,在QaTaCOV19数据集上取得86.47%的Dice和78.2%的IoU成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09932 2026-04-14 cs.LG cs.AI eess.SP 57%

A Hybrid Intelligent Framework for Uncertainty-Aware Condition Monitoring of Industrial Systems

一种用于工业系统不确定性感知条件监测的混合智能框架

Maryam Ahang, Todd Charter, Masoud Jalayer, Homayoun Najjaran

机构 * University of Victoria(维多利亚大学) Aalto University(阿尔托大学)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 eess.SP

AI总结 本文提出一种结合数据驱动学习与物理模型的混合框架,通过残差和时间特征提升诊断准确率,实验显示混合方法在非线性工业系统中提高了准确性和决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15198 2026-04-14 eess.SP 57%

Space-Time-Frequency Synthetic Integrated Sensing and Communication Networks

时空频合成集成感知与通信网络

Henglin Pu, Xuefeng Wang, Lu Su, Husheng Li

专题命中 融合架构与评测 :information fusion(abstract);分类 eess.SP

AI总结 本文提出一种时空频合成ISAC架构,融合分布式发射机和接收机的观测,推导CRLB并比较MLE与TSIF方法的性能,证明全合成网络处理对低SNR下估计精度至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 57%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05873 2026-04-08 cs.MM 57%

Learning Shared Sentiment Prototypes for Adaptive Multimodal Sentiment Analysis

学习共享情感原型以实现自适应多模态情感分析

Chen Su, Yuanhe Tian, Yan Song

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.MM

AI总结 本文提出PRISM框架,通过共享原型空间实现多模态证据的结构化比较与自适应融合,动态调整模态权重以提升多模态情感分析性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06338 2026-04-07 cs.AI cs.CV cs.LG 57%

Circuit Mechanisms for Spatial Relation Generation in Diffusion Transformers

扩散变换器中空间关系生成的电路机制

Binxu Wang, Jingxuan Fan, Xu Pan

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Harvard University(哈佛大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 研究通过机械可解释性方法探讨扩散变换器如何生成正确空间关系,发现不同文本编码器影响电路机制,随机嵌入通过双阶段电路生成,预训练编码器则通过信息融合生成,两种方法在领域内表现相似但抗扰性不同。

Comments 45 pages, 30 figures, accepted in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02759 2026-04-06 cs.RO 57%

OMNI-PoseX: A Fast Vision Model for 6D Object Pose Estimation in Embodied Tasks

OMNI-PoseX:一种用于具身任务中6D物体姿态估计的高效视觉模型

Michael Zhang, Wei Ying, Fangwen Chen, Shifeng Bai, Hanwen Kang

机构 * KernalMind Tech Co., Ltd.(KernalMind科技有限公司)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.RO

AI总结 本文提出OMNI-PoseX,一种结合开放词汇感知与SO(3)感知的高效视觉模型,通过轻量级多模态融合策略实现稳定且高效的6D姿态估计,并在多个基准测试中展示了SOTA的精度和实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02397 2026-04-06 cs.CV cs.AI 57%

Variational Encoder--Multi-Decoder (VE-MD) for Privacy-by-functional-design (Group) Emotion Recognition

变分编码器-多解码器(VE-MD)用于隐私-by-功能设计(群体)情绪识别

Anderson Augusma, Dominique Vaufreydaz, Fédérique Letué

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 信息学实验室) Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK(格勒诺布尔阿尔卑斯大学, 法国国家科学研究中心, 格勒诺布尔国立理工学院, 让·库尔坦研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出VE-MD框架,通过约束模型仅预测群体层面情绪,避免个体监控,提升群体情绪识别性能,实验显示其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01667 2026-04-03 cs.AI cs.CV 57%

M3D-BFS: a Multi-stage Dynamic Fusion Strategy for Sample-Adaptive Multi-Modal Brain Network Analysis

M3D-BFS:一种多阶段动态融合策略用于样本自适应的多模态脑网络分析

Rui Dong, Xiaotong Zhang, Jiaxing Li, Yueying Li, Jiayin Wei, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出M3D-BFS,通过多阶段动态融合策略提升多模态脑网络分析的样本适应性,设计了不同专家模块以适应输入样本变化,并引入多模态解耦损失提升表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29291 2026-04-01 cs.CV cs.AI 57%

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

MELT:通过修改频繁性-稀有性平衡网络改进组合图像检索

Guozhi Qiu, Zhiwei Chen, Zixu Li, Qinlei Huang, Zhiheng Fu, Xuemeng Song, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院) Southern University of Science and Technology(南方科技大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MELT通过解决罕见语义定位不对称和硬负样本下的鲁棒相似性估计问题,改进组合图像检索的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29029 2026-04-01 cs.CV cs.AI 57%

MMFace-DiT: A Dual-Stream Diffusion Transformer for High-Fidelity Multimodal Face Generation

MMFace-DiT:一种双流扩散变换器用于高保真多模态人脸生成

Bharath Krishnamurthy, Ajita Rattani

机构 * University of North Texas(北德克萨斯大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 MMFace-DiT通过双流Transformer实现多模态人脸生成,融合空间和语义信息,提升生成质量与控制能力,相比现有方法提升40%的视觉保真度和提示对齐度。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026. 22 pages (Main Text + Supplementary), 14 figures, 5 tables, 4 algorithms. Project page: https://vcbsl.github.io/MMFace-DiT/ and Code Repository: https://github.com/Bharath-K3/MMFace-DiT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27781 2026-03-31 cs.CV 57%

GS3LAM: Gaussian Semantic Splatting SLAM

GS3LAM: 基于高斯语义散射的SLAM

Linfei Li, Lin Zhang, Zhong Wang, Ying Shen

机构 * School of Software Engineering, Tongji University(同济大学软件工程学院) Department of Automation, Shanghai Jiaotong University(上海交通大学自动化系)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 GS3LAM通过多模态数据融合实现实时一致的语义密集地图,采用语义高斯场和多模态误差约束联合优化,引入深度自适应尺度正则化和随机采样关键帧映射策略,提升跟踪鲁棒性和渲染质量。

Comments Accepted by ACM MM 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27181 2026-03-31 cs.RO cs.AI 57%

An End-to-end Flight Control Network for High-speed UAV Obstacle Avoidance based on Event-Depth Fusion

面向高速无人机障碍避让的端到端飞行控制系统:基于事件深度融合

Dikai Shang, Jingyue Zhao, Shi Xu, Nanyang Ye, Lei Wang

机构 * Shanghai jiaotong University(上海交通大学) Defense Innovation Institute, AMS(军事科学院国防科技创新研究院)

专题命中 融合架构与评测 :feature-level fusion(abstract);分类 cs.RO

AI总结 本文提出端到端飞行控制网络,通过双向交叉注意力模块融合深度图像和事件数据,利用模仿学习训练,结合球面主搜索算法设计高效专家规划器,在高速环境下实现更可靠的障碍避让。

Comments 7 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12378 2026-03-31 cs.CV 57%

M4Human: A Large-Scale Multimodal mmWave Radar Benchmark for Human Mesh Reconstruction

M4Human: 一种大规模多模态毫米波雷达基准用于人体网格重建

Junqiao Fan, Yunjiao Zhou, Yizhuo Yang, Xinyuan Cui, Jiarui Zhang, Lihua Xie, Jianfei Yang, Chris Xiaoxuan Lu, Fangqiang Ding

机构 * NTU(南洋理工大学) University of Edinburgh(爱丁堡大学) UPenn(宾夕法尼亚大学) UCL(伦敦大学学院) MIT(麻省理工学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出M4Human,首个大规模多模态毫米波雷达基准,提供高分辨率雷达、RGB和深度数据,用于解决传统视觉传感的遮挡、光照和隐私问题,推动人体建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26746 2026-03-31 cs.CV cs.LG 57%

TDEC: Deep Embedded Image Clustering with Transformer and Distribution Information

TDEC:基于Transformer和分布信息的深度嵌入图像聚类

Ruilin Zhang, Haiyang Zheng, Hongpeng Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文提出TDEC,通过结合Transformer和分布信息,改进图像聚类中的特征表示和维度偏好,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25799 2026-03-30 eess.SP 57%

Occlusion-Aware Multimodal Beam Prediction and Pose Estimation for mmWave V2I

面向毫米波V2I的遮挡感知多模态波束预测与姿态估计

Abidemi Orimogunje, Hyunwoo Park, Kyeong-Ju Cha, Igbafe Orikumhi, Sunwoo Kim, Dejan Vukobratovic

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 eess.SP

AI总结 本文提出一种受SLAM启发的多模态学习框架,用于动态遮挡下的毫米波V2I波束管理,通过融合RGB图像、LiDAR点云、雷达范围-角度图、GNSS和短时毫米波功率历史,实现波束索引、遮挡概率和2D位置的联合预测,验证了感知与通信结合在6G V2I系统中的价值。

Comments IEEE VTC

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21660 2026-03-24 cs.CV 57%

OmniFM: Toward Modality-Robust and Task-Agnostic Federated Learning for Heterogeneous Medical Imaging

OmniFM:迈向模态鲁棒且任务无关的联邦学习 for 异质医学影像

Meilin Liu, Jiaying Wang, Jing Shan

机构 * School of Software, Shenyang University of Technology(沈阳理工大学软件学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 OmniFM提出一种统一训练分类、分割、超分辨率、视觉问答和多模态融合的联邦学习框架,通过频域洞察提升跨模态一致性,实现任务无关和模态鲁棒的联邦学习。

Comments Accepted by CVPR 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13876 2026-03-24 cs.CV 57%

Scene Prior Filtering for Depth Super-Resolution

场景先验过滤用于深度超分辨率

Zhengxue Wang, Zhiqiang Yan, Ming-Hsuan Yang, Jinshan Pan, Guangwei Gao, Ying Tai, Jian Yang

机构 * PCA Lab, Nanjing University of Science and Technology, China(南京理工大学科学与工程学院实验室) National University of Singapore(新加坡国立大学) University of California, USA, and Yonsei University, South Korea(美国加州大学和韩国延世大学) PCA Lab, Nanjing University, China(南京大学实验室)

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 本文提出SPFNet网络,利用大尺度模型的表面法线和语义图作为先验信息,通过多模态先验传播和一对一先验嵌入减少纹理干扰并提升边缘表示,实现在真实和合成数据集上的超分辨率性能。

Comments Accepted to IJCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18062 2026-03-23 cs.CV cs.AI 57%

S3T-Former: A Purely Spike-Driven State-Space Topology Transformer for Skeleton Action Recognition

S3T-Former:一种纯粹由脉冲驱动的状态空间拓扑变换器用于骨骼动作识别

Naichuan Zheng, Hailun Xia, Zepeng Sun, Weiyi Li, Yujia Wang

机构 * School of Information and Communication Engineering(信息与通信工程学院) Beijing University of Posts and Telecommunications(北京邮电大学) International School(国际学校) School of Economics and Management(经济管理学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出S3T-Former,一种专为高效骨骼动作识别设计的脉冲驱动变换器,通过多流解剖脉冲嵌入和横向脉冲拓扑路由实现稀疏事件流,提升能效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16671 2026-03-18 cs.CV 57%

$x^2$-Fusion: Cross-Modality and Cross-Dimension Flow Estimation in Event Edge Space

$x^2$-Fusion:事件边缘空间中的跨模态和跨维度流估计

Ruishan Guo, Ciyu Ruan, Haoyang Wang, Zihang Gong, Jingao Xu, Xinlei Chen

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Harbin Institute of Technology(哈尔滨工业大学) The University of Hong Kong(香港大学)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出$x^2$-Fusion方法,通过事件边缘空间实现跨模态和跨维度流的统一表示,提升动态场景理解的准确性和鲁棒性。

Comments This version is the camera-ready version accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13000 2026-03-18 cs.CV 57%

Omni Survey for Multimodality Analysis in Visual Object Tracking

多模态分析在视觉目标跟踪中的全方位调研

Zhangyong Tang, Tianyang Xu, Xuefeng Zhu, Hui Li, Shaochuan Zhao, Tao Zhou, Chunyang Cheng, Xiaojun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) School of Computer Science and Technology, China University of Mining and Technology(中国矿业大学计算机科学与技术学院) School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey 大学视觉、语音与信号处理中心)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 本文从多模态分析角度调研了多模态视觉目标跟踪(MMVOT)的关键问题,涵盖数据收集、模态对齐、标注、模型设计与评估,分析了现有方法的分类及挑战,并首次探讨了多模态跟踪的适用性及数据集中的类别分布。

Comments The first comprehensive survey for multi-modal visual object tracking; 6 multi-modal tasks; 338 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12848 2026-03-16 cs.CV cs.AI 57%

Team LEYA in 10th ABAW Competition: Multimodal Ambivalence/Hesitancy Recognition Approach

团队LEYA在第10届ABAW竞赛中的多模态矛盾/犹豫识别方法

Elena Ryumina, Alexandr Axyonov, Dmitry Sysoev, Timur Abdulkadirov, Kirill Almetov, Yulia Morozova, Dmitry Ryumin

机构 * St. Petersburg Federal Research Center of the Russian Academy of Sciences(俄罗斯科学院圣彼得堡联邦科研中心) HSE University(俄罗斯高等经济学院)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态方法用于视频级矛盾/犹豫识别,结合场景、面部、音频和文本四种模态,通过融合模型提升识别性能,实验显示多模态融合优于单一模态方法。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 57%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13172 2026-03-10 cs.CV 57%

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

WHU-STree: 一个用于街道树盘点的多模态基准数据集

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang

专题命中 融合架构与评测 :multi-modal fusion(abstract);分类 cs.CV

AI总结 WHU-STree是一个多模态的街道树盘点数据集,包含丰富的标注和多任务支持,用于提升城市街道树管理的自动化和智能化水平。

Journal ref ISPRS Journal of Photogrammetry and Remote Sensing, 2026, 233: 519-542

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15625 2026-03-09 cs.CV 57%

EarthScape: A Multimodal Dataset for Surficial Geologic Mapping and Earth Surface Analysis

EarthScape:一种用于地表地质制图和地表分析的多模态数据集

Matthew Massey, Nusrat Munia, Abdullah-Al-Zubaer Imran

机构 * Kentucky Geological Survey(肯塔基地质调查局) University of Kentucky(肯塔基大学) Department of Computer Science(计算机科学系)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 EarthScape是一种用于地表地质制图和地表分析的多模态数据集,通过整合多种数据源提供统一的基准测试平台,提升多模态融合和领域适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07080 2026-03-06 cs.CV 57%

FLAIR-HUB: Large-scale Multimodal Dataset for Land Cover and Crop Mapping

FLAIR-HUB:大规模多模态数据集用于土地覆盖和作物制图

Anatol Garioud, Sébastien Giordano, Nicolas David, Nicolas Gonthier

机构 * Institut national de l’information géographique et forestière (IGN), France(法国国家地理与森林信息研究所)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 FLAIR-HUB是一个大规模多模态数据集,用于提升土地覆盖和作物制图的准确性,通过多模态融合和深度学习模型实现高精度分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04887 2026-03-06 cs.CV 57%

Federated Modality-specific Encoders and Partially Personalized Fusion Decoder for Multimodal Brain Tumor Segmentation

联邦模态特定编码器和部分个性化融合解码器用于多模态脑肿瘤分割

Hong Liu, Dong Wei, Qian Dai, Xian Wu, Yefeng Zheng, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine(国家医学数据科学研究院) Department of Computer Science at School of Informatics(信息学院计算机科学系) Jarvis Research Center(Jarvis研究中心) Medical Artificial Intelligence Lab(医学人工智能实验室)

专题命中 融合架构与评测 :multimodal fusion(abstract);分类 cs.CV

AI总结 本文提出FedMEPD框架,通过联邦模态特定编码器和部分个性化融合解码器,解决多模态医学图像分析中的模态间异质性和个性化需求问题。

Comments Medical Image Analysis 2025. arXiv admin note: substantial text overlap with arXiv:2403.11803

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03615 2026-03-05 cs.CV 57%

Parallax to Align Them All: An OmniParallax Attention Mechanism for Distributed Multi-View Image Compression

视差对齐所有内容:一种用于分布式多视图图像压缩的 OmniParallax 注意机制

Haotian Zhang, Feiyue Long, Yixin Yu, Jian Xue, Haocheng Tang, Tongda Xu, Zhenning Shi, Yan Wang, Siwei Ma, Jiaqi Zhang

机构 * The National Engineering Laboratory for Video Technology, School of Computer Science, Peking University(国家视频技术工程实验室,计算机科学学院,北京大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.CV

AI总结 ParaHydra通过OmniParallax注意机制和多信息融合模块,实现了分布式多视图图像压缩的高效编码与解码,显著提升压缩效率并降低计算开销

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03544 2026-03-05 cs.CV 57%

PinCLIP: Large-scale Foundational Multimodal Representation at Pinterest

PinCLIP:Pinterest的规模化多模态基础表示

Josh Beal, Eric Kim, Jinfeng Rao, Rex Wu, Dmitry Kislyuk, Charles Rosenberg

机构 * Pinterest Inc.(Pinterest公司)

专题命中 融合架构与评测 :hybrid fusion(abstract);分类 cs.CV

AI总结 PinCLIP通过多模态表示学习提升Pinterest的检索和排序模型,解决冷启动问题并提高用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01404 2026-03-04 cs.RO 57%

D-GVIO: A Buffer-Driven and Efficient Decentralized GNSS-Visual-Inertial State Estimator for Multi-Agent Systems

D-GVIO: 一种基于缓冲的高效分布式GNSS-视觉-惯性状态估计器用于多智能体系统

Yarong Luo, Wentao Lu, Chi Guo, Ming Li

机构 * School of Robotics, Wuhan University(机器人学院,武汉大学) School of Electronic Information of Wuhan University, Hubei Luojia Laboratory(武汉大学电子信息学院,湖北珞珈实验室)

专题命中 融合架构与评测 :information fusion(abstract);分类 cs.RO

AI总结 D-GVIO通过基于缓冲的分布式框架和L-IEKF实现高效鲁棒的GNSS-视觉-惯性状态估计,适用于多智能体系统的协同定位任务。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏