arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

多模态信息融合

面向图像、视频、多传感器和跨模态感知的信息融合,包括 Image Fusion、红外可见光、遥感、医学影像、LiDAR/雷达/相机和音视频融合。

共收录 87 信号源:cs.CV, eess.IV, eess.SP, cs.RO, cs.MM

1. 机器人多传感器融合 19 篇

2508.11485 2026-07-24 cs.RO 版本更新 88%

i2Nav-Robot: A Large-Scale Indoor-Outdoor Robot Dataset for Multi-Sensor Fusion Navigation

i2Nav-Robot:用于多传感器融合导航的大规模室内外机器人数据集

Hailiang Tang, Tisheng Zhang, Liqiang Wang, Xin Ding, Man Yuan, Zhiyu Xiang, Jujin Chen, Yuhan Bian, Shuangyan Liu, Yuqing Wang, Guan Wang, Xiaoji Niu

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract);分类 cs.RO

AI总结 针对无人地面车辆导航数据集不足,提出i2Nav-Robot数据集,集成多模态传感器,经在线硬件同步和离线校准获取精确时间戳,含十个大规模序列,经评估数据质量高,对推进车辆导航研究实用。

Comments 13 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.15277 2026-07-07 cs.CV 版本更新 88%

EPMF: Efficient Perception-aware Multi-sensor Fusion for 3D Semantic Segmentation

EPMF: 高效感知感知多传感器融合用于3D语义分割

Mingkui Tan, Zhuangwei Zhuang, Sitao Chen, Rong Li, Kui Jia, Qicheng Wang, Yuanqing Li

机构 * School of Software Engineering, South China University of Technology(南方科技大学软件工程学院) Pazhou Laboratory, Guangzhou, China(广州帕佐实验室) School of Electronic and Information Engineering, South China University of Technology(南方科技大学电子与信息工程学院) Minieye, Shenzhen, Guangdong, China(深圳Minieye公司)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);multi-sensor fusion(title,abstract);分类 cs.CV

AI总结 提出一种高效感知多传感器融合方法EPMF,通过透视投影对齐点云与RGB图像,利用残差融合模块和感知损失提升3D语义分割性能,在nuScenes上mIoU超越RangeFormer 0.9%。

Comments 16 pages, 12 figures, 14 tables, IEEE TPAMI 2024, extended version of the ICCV2021 paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16089 2026-06-16 cs.AI eess.SP 版本更新 84%

Multi-Sensor Fusion for UAV Classification Based on Feature Maps of Image and Radar Data

基于图像和雷达数据特征图的多传感器融合无人机分类

Nikos Sakellariou, Antonios Lalas, Konstantinos Votis, Dimitrios Tzovaras

机构 * Information Technologies Institute(信息科技研究所) Centre for Research & Technology – Hellas(希腊研究中心) Thessaloniki, Greece(塞萨洛尼基,希腊)

专题命中 机器人多传感器融合 :sensor fusion(title);multi-sensor fusion(title);分类 eess.SP

AI总结 提出一种融合热成像、光电和雷达数据特征的多传感器深度学习网络,通过堆叠图像特征提高无人机分类精度。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22259 2026-08-04 cs.LG cs.CV cs.RO 版本更新 82%

An Evidence Hierarchy for Bayesian Object Classification via OSINT-Aided Heterogeneous Sensor Fusion

基于OSINT辅助异质传感器融合的贝叶斯目标分类证据层级

Jan Nausner, Michael Hubner

机构 * Center for Digital Safety & Security, Austrian Institute of Technology GmbH (AIT)(数字安全与安全研究所,奥地利技术研究院(AIT))

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 cs.CV、cs.RO

AI总结 本文提出了一种基于OSINT辅助的异质传感器融合方法,通过建立新的证据层级模型,结合上下文信息和领域知识,提升对CBRNE威胁的分类准确率,实验结果表明该方法在抗干扰和先验不匹配方面具有优势,分类准确率高达95%。

Comments 6 pages, 1 figure; \c{opyright} 2026 IEEE. Accepted for the 2026 IEEE International Conference on Multisensor Fusion and Integration (MFI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16108 2026-08-12 eess.SP 版本更新 79%

Advancing Industry 4.0: Multimodal Sensor Fusion for AI-Based Fault Detection in 3D Printing

推进工业4.0:面向基于3D打印的AI故障检测的多模态传感器融合

Muhammad Fasih Waheed, Shonda Bernadin, Ali Hassan

专题命中 机器人多传感器融合 :sensor fusion(title,abstract);分类 eess.SP

AI总结 本研究提出了一种低成本、便携的多模态传感器融合AI系统,用于实时监测FDM 3D打印过程中的故障,提升制造可靠性和可持续性。

Comments International Journal of Engineering Research and Innovation | v17, n2, Fall/Winter 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21639 2026-06-11 cs.CY cs.LG 版本更新 78%

A Multi-Modal Sensor Fusion Instrument for Measuring Regional Human Mobility: The Distributed Human Data Engine (DHDE)

多模态传感器融合仪器用于测量区域人类流动性:分布式人类数据引擎(DHDE)

Amil Khanzada, Takuji Takemoto

机构 * Headquarters for Regional Revitalization, University of Fukui, Japan(复兴地区总部,福井大学,日本)

专题命中 机器人多传感器融合 :sensor fusion(title,abstract)

AI总结 提出分布式人类数据引擎(DHDE),通过融合边缘AI相机、数字意图信号、行为记录和气象数据,解决外围区域人类流动性测量中传感器稀疏和行为异质性问题,验证了稀疏传感器补偿方法,并发现“低活力悖论”。

Comments 32 pages, 4 figures, 3 tables. Pre-print of a manuscript submitted for peer review (v2)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19785 2026-06-29 eess.SP 版本更新 74%

Radar and Acoustic Sensor Fusion using a Transformer Encoder for Robust Drone Detection and Classification

基于Transformer编码器的雷达与声学传感器融合用于鲁棒的无人机检测与分类

Gevindu Ganganath, Pasindu Sankalpa, Samal Punsara, Demitha Pasindu, Chamira U. S. Edussooriya, Ranga Rodrigo, Udaya S. K. P. Miriya Thanthrige

专题命中 机器人多传感器融合 :sensor fusion(title);分类 eess.SP

AI总结 针对无人机入侵安全问题,提出雷达与声学传感器融合的Transformer编码器方法,利用原始声学信号减少参数,在户外实验中优于现有技术。

Comments Accepted at IEEE 12$^{\text{th}}$~Moratuwa Engineering Research Conference 2026 (MERCon 2026)

Journal ref IEEE 12th Moratuwa Engineering Research Conference 2026 (MERCon 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08457 2026-07-07 cs.RO cs.LG cs.SY eess.SP eess.SY physics.data-an 版本更新 73%

Adaptive Entropy-Driven Sensor Selection in a Camera-LiDAR Particle Filter for Single-Vessel Tracking

相机-激光雷达粒子滤波器中用于单船跟踪的自适应熵驱动传感器选择

Andrei Starodubov, Yaqub Aris Prabowo, Andreas Hadjipieris, Ioannis Kyriakides, Roberto Galeazzi

机构 * Cyprus Marine and Maritime Institute(塞浦路斯海洋与航海研究所) Technical University of Denmark(丹麦技术大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 eess.SP、cs.RO

AI总结 研究单船跟踪问题,提出含相机-激光雷达融合的粒子滤波器及信息增益自适应传感策略,在实际海事部署中验证,该策略能依信息增益切换模态,实现精度与连续性平衡,提供实用基线。

Comments 10 pages, 5 figures, submitted and accepted FUSION 2026 conference proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12346 2026-07-30 cs.RO 版本更新 70%

PolygMap: A Perceptive Locomotion Framework for Humanoid Robot Stair Climbing

PolygMap:用于人形机器人爬楼梯的感知式运动框架

Bingquan Li, Ning Wang, Zhicheng He, Yucong Wu, Tianwei Zhang

机构 * The Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人社会研究院) Electronic science and technology, Guangdong University of Technology(广东技术大学电子科学与技术学院) Leju robotics(乐居机器人)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.RO

AI总结 本文提出PolygMap框架,通过多传感器融合构建多边形楼梯平面语义地图,在NVIDIA Orin上实现20-30Hz全身运动规划,经真实场景实验验证可高效鲁棒地完成人形机器人爬楼梯任务。

Comments Accepted by ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21400 2026-07-16 cs.CV 版本更新 70%

You Only Gaussian Once: Controllable 3D Gaussian Splatting for Ultra-Densely Sampled Scenes

你只需一次高斯:用于超密集采样场景的可控3D高斯点划法

Jinrang Jia, Zhenjia Li, Yifeng Shi

机构 * Ke Holdings Inc.(凯控股有限公司)

专题命中 机器人多传感器融合 :sensor fusion(abstract);multi-sensor fusion(abstract);分类 cs.CV

AI总结 本文提出YOGO框架,通过确定性预算均衡解决3DGS在工业应用中的资源消耗问题,并引入Immersion v1.0数据集提升重建精度。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17598 2026-08-13 cs.RO cs.CV 版本更新 62%

MuseVLA: An Adaptive Multimodal Sensing Vision-Language-Action Model for Robotic Manipulation

MuseVLA: 一种用于机器人操作的自适应多模态感知视觉-语言-动作模型

Xingyuming Liu, Ruichun Ma, Heyu Guo, Qixiu Li, Qingwen Yang, Lin Luo, Shiqi Jiang, Chenren Xu, Jiaolong Yang, Baining Guo

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) Microsoft Research Asia(微软亚洲研究院) Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV、cs.RO

AI总结 提出MuseVLA模型,通过将传感器作为按需工具集成,实现自适应多模态感知;设计传感器图像统一表示,并引入数据合成流水线,在灵巧手操作任务中平均成功率80.6%,显著优于RGB-only和多模态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06479 2026-07-20 cs.RO cs.CV cs.SY eess.SY 版本更新 62%

Holistic Fusion: Task- and Setup-Agnostic Robot Localization and State Estimation with Factor Graphs

整体融合:基于因子图的与任务和设置无关的机器人定位与状态估计

Julian Nubert, Turcan Tuna, Jonas Frey, Cesar Cadena, Katherine J. Kuchenbecker, Shehryar Khattak, Marco Hutter

机构 * ETH Zürich(苏黎世联邦理工学院) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) NASA Jet Propulsion Laboratory(美国国家航空航天局喷气推进实验室)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.CV、cs.RO

AI总结 研究针对移动机器人定位与状态估计问题,提出整体融合方法,通过因子图公式融合多类型测量,注重局部平滑性与一致性,能在典型硬件上实现低延迟、平滑在线估计及低漂移全局定位,在多场景验证了框架有效性。

Comments 21 pages, 25 figures, 9 tables, Transactions on Robotics, accepted

Journal ref Transactions on Robotics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01414 2026-08-11 cs.RO 版本更新 57%

Learning When to See and When to Feel: Adaptive Vision-Torque Fusion for Contact-Aware Manipulation

学习何时视觉何时触觉:适应性视觉-扭矩融合用于接触感知操控

Jiuzhou Lei, Chang Liu, Yu She, Xiao Liang, Minghui Zheng

机构 * Edwardson School of Industrial Engineering, Purdue University(普渡大学爱德华森工业工程学院) Zachry Department of Civil and Environmental Engineering, Texas A&M University(德州农工大学扎克里土木与环境工程系)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.RO

AI总结 本文提出适应性视觉-扭矩融合策略,通过比较不同融合方法提升机器人操控性能,实验显示方法在成功率上优于基线14%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16898 2026-08-04 cs.CV cs.CL cs.CR 版本更新 57%

Cross-Branch Conflict as a Shield: Safeguarding Facial Identities in Unified Multimodal Image Editing

跨分支冲突作为一种保护手段:在统一多模态图像编辑中保护面部身份

Weiwei Tan, Junxian Li, Rui Wang, Zhenhua Xu, Yanjun Zhang, Yu Leo Zhang

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 研究统一多模态模型中个人肖像编辑的安全问题,提出CCS统一对抗保护框架,通过联合驱动ViT和VAE表示及破坏跨分支兼容性,防止模型恢复身份信息,在抑制身份保留编辑上表现优于现有方法。

Comments 14 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13732 2026-07-31 cs.RO 版本更新 57%

SUNSET - A Sensor-fUsioN based semantic SegmEnTation exemplar for ROS-based self-adaptation

SUNSET -- 一种基于传感器融合的语义分割示例,用于基于ROS的自适应系统

Andreas Wiedholz, Rafael Paintner, Alwin Hoffmann, Carlos Hernandez, Tobias Huber

机构 * XITASO GmbH(XITASO公司) German Aerospace Center (DLR) Institute of Flight Systems(德国航空航天中心(DLR)飞行系统研究所)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 SUNSET是一种基于ROS2的自适应系统示例,通过传感器融合语义分割流水线和训练好的机器学习模型,实现对动态环境中的不确定性进行严格评估和自适应处理。

Comments Accepted at RoSE Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13715 2026-07-22 cs.CV 版本更新 57%

MVGD-Net: A Novel Motion-aware Video Glass Surface Detection Method

MVGD-Net: 一种新颖的运动感知视频玻璃表面检测网络

Yiwei Lu, Hao Huang, Tao Yan

机构 * Tao Yan(谭燕)

专题命中 机器人多传感器融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 MVGD-Net通过利用视频中运动不一致特性,提出新颖网络检测玻璃表面,结合多模块融合与大规模数据集提升检测性能。

Comments This paper has been accepted by the 40th AAAI Conference on Artificial Intelligence (AAAI-26). It contians 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18164 2026-07-09 cs.RO 版本更新 57%

GrandTour: A Legged Robotics Dataset in the Wild for Multi-Modal Perception and State Estimation

GrandTour: 一种用于多模态感知与状态估计的野外腿式机器人数据集

Turcan Tuna, Jonas Frey, Frank Fu, Katharine Patterson, Tianao Xu, Maurice Fallon, Cesar Cadena, Marco Hutter

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Oxford University(牛津大学)

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 GrandTour数据集为多模态感知与状态估计提供了大规模野外腿式机器人数据,支持SLAM和高精度状态估计的研究与开发。

Comments Turcan Tuna, and Jonas Frey contributed equally. Submitted to Sage The International Journal of Robotics Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14427 2026-06-11 cs.RO cs.LG 版本更新 57%

Self-Supervised Multisensory Pretraining for Contact-Rich Robot Reinforcement Learning

面向接触丰富机器人强化学习的自监督多感官预训练

Rickmer Krohn, Vignesh Prasad, Gabriele Tiboni, Georgia Chalvatzaki

机构 * Interactive Robot Perception & Learning (PEARL) Lab, TU Darmstadt, Germany(图腾机器人感知与学习实验室,图腾施塔德大学,德国) Hessian.AI(海斯堡人工智能) Robotics Institute Germany (RIG)(德国机器人研究所(RIG))

专题命中 机器人多传感器融合 :sensor fusion(abstract);分类 cs.RO

AI总结 提出MSDP框架,通过掩码自编码和跨模态预测学习多感官表示,并采用非对称架构(评论家使用交叉注意力提取动态特征,演员使用稳定池化表示)加速策略学习,在模拟和真实机器人任务中展现出鲁棒性和高效性。

Comments 8 pages, 11 figures

Journal ref IEEE Robotics and Automation Letters, 2026, Vol. 11, No. 6, pp. 6799-6806

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21411 2026-06-08 cs.DC 版本更新 50%

General Convex Agreement with Near-Optimal Communication

通用凸协议与近最优通信

Marc Dufay, Diana Ghinea, Anton Paramonov

专题命中 机器人多传感器融合 :sensor fusion(abstract)

AI总结 本文研究了通用凸协议在长消息场景下的通信复杂度,提出确定性同步协议,实现近最优通信,适用于鲁棒学习和传感器融合等聚合任务。

Comments Working paper

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音视频/视觉语言融合 16 篇

2601.07565 2026-08-11 cs.CL cs.AI 版本更新 78%

Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis

通过专家引导的多模态融合与大语言模型的统一框架实现情绪识别与情感分析

Jiaqi Qiao, Xinran Li, Yifan Lyu, Xiujuan Xu, Liu Yu

机构 * School of Software, Dalian University of Technology, China(软件学院,大连理工大学,中国)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 本文提出EGMF框架,通过专家引导的多模态融合与大语言模型结合,实现情绪识别与情感分析的统一处理,提升跨语言鲁棒性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26629 2026-06-29 cs.LG 版本更新 78%

Context-specific Credibility-aware Multimodal Fusion with Conditional Probabilistic Circuits

基于条件概率电路的上下文特定可信感知多模态融合

Pranuthi Tenali, Sahil Sidheekh, Saurabh Mathur, Erik Blasch, Kristian Kersting, Sriraam Natarajan

机构 * Department of Computer Science , TU Darmstadt(德累斯顿技术大学计算机科学系) Air Force Research Lab(空军研究实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(title,abstract)

AI总结 提出C$^2$MF框架,利用条件概率电路建模实例级源可靠性,通过KL散度度量上下文特定信息可信度,在跨模态冲突下提升预测准确率高达29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12715 2026-08-05 cs.CV 版本更新 74%

VLC Fusion: Vision-Language Conditioned Sensor Fusion for Robust Object Detection

VLC Fusion:面向鲁棒目标检测的视觉-语言条件传感器融合

Aditya Taparia, Noel Ngu, Mario Leiva, Joshua Shay Kricheli, John Corcoran, Nathaniel D. Bastian, Gerardo Simari, Paulo Shakarian, Ransalu Senanayake

机构 * Arizona State University(亚利桑那州立大学) Department of Computer Science and Engineering, Universidad Nacional del Sur and Institute for Computer Science and Engineering(计算机科学与工程系,国家南方大学和计算机科学与工程研究所) U.S. Department of Defense(美国国防部) United States Military Academy(美国军事学院) Syracuse University(雪城大学)

专题命中 音视频/视觉语言融合 :sensor fusion(title);分类 cs.CV

AI总结 本文提出VLC Fusion视觉-语言条件传感器融合框架,利用VLM捕捉环境线索动态调整模态权重,在多传感器融合目标检测任务中,于自动驾驶与军事目标数据集上较传统方法实现更优性能。

Comments 27 pages, 20 figures, Accepted for presentation at ECML PKDD 2026, Shortlisted for the Best Research Track Student Paper Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25538 2026-08-04 cs.LG cs.SE 版本更新 71%

ARMOR: A Robust Self-Supervised Framework for Root Cause Analysis in Microservices under Missing Modality

面向缺失数据的多模态融合用于统一微服务故障管理

Wenzhuo Qian, Hailiang Zhao, Ziqi Wang, Zhipeng Gao, Jiayi Chen, Zhiwei Ling, Shuiguang Deng

机构 * Zhejiang University(浙江大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(title)

AI总结 本文提出ARMOR框架,通过自监督学习解决微服务故障管理中多模态数据缺失问题,提升异常检测、故障分类和根本原因定位的性能。

Comments Accepted by the Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), 2026. This is the authors' version of the work; the definitive Version of Record is forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22372 2026-07-16 cs.LG cs.AI 版本更新 71%

Rethinking Multimodal Fusion for Time Series: Text Modalities Need Constrained Fusion

重新思考时间序列的多模态融合:文本模态需要受约束的融合

Seunghan Lee, Jun Seo, Jaehoon Lee, Sungdong Yoo, Minjae Kim, Tae Yoon Lim, Dongwan Kang, Hwanil Choi, SoonYoung Lee, Wonbin Ahn

机构 * LG AI Research(LG人工智能研究)

专题命中 音视频/视觉语言融合 :multimodal fusion(title)

AI总结 针对多模态时间序列预测中朴素融合方法效果不佳的问题,提出受约束融合方法及受控融合适配器(CFA),通过低秩适配器过滤无关文本信息,在多种数据集和模型上验证了有效性。

Comments KDD Workshop on Mining and Learning from Time Series 2026 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15779 2026-08-12 cs.CV 版本更新 57%

Multimodal Ambivalence and Hesitancy Recognition via Cross-Attention and Gated Fusion

通过交叉注意力和门控融合进行多模态矛盾与犹豫识别

Oussama Berhili, Yassine Ouzar, Larbi Boubchir

机构 * University of Paris 8(巴黎第八大学) LIASD Laboratory(LIASD实验室)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 为ECCV 2026的ABAW11挑战赛开发多模态框架,用预训练编码器提取多模态特征,建立单模态基线,在此基础上提出含交叉注意力和门控融合的多模态架构,验证集宏F1达0.7394,提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23957 2026-08-11 cs.CV 版本更新 57%

LAVA: Layered Audio-Visual Anti-tampering Watermarking for Robust Deepfake Detection and Localization

LAVA:分层音频视觉抗篡改水印用于鲁棒深度伪造检测与定位

Bokang Zeng, Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang

机构 * School of Computer Science and Engineering(计算机科学与工程学院) UNSW Sydney(新南威尔士大学悉尼分校) School of Information and Communication Technology(信息与通信技术学院) Griffith University(格里菲斯大学)

专题命中 音视频/视觉语言融合 :audio-visual fusion(abstract);分类 cs.CV

AI总结 LAVA通过跨模态水印融合与校准感知对齐,提升深度伪造篡改检测与定位的鲁棒性,实验表明其检测性能接近完美,抗压缩与多模态错位能力强。

Comments Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16609 2026-08-11 cs.CV 版本更新 57%

Describe-to-Score: A text-guided framework for image complexity assessment

描述到评分:一种用于图像复杂度评估的文本引导框架

Shipeng Liu, Liang Zhao, Dengfeng Chen, Zhonglin Zhang

机构 * Xi’an University of Architecture and Technology(西安建筑科技大学)

专题命中 音视频/视觉语言融合 :multi-modal fusion(abstract);分类 cs.CV

AI总结 该研究针对现有图像复杂度评估方法无法捕捉高级语义的问题,提出文本引导框架D2S,仅训练阶段引入描述语义正则化,在IC9600基准达SOTA,跨任务也具竞争力。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04498 2026-07-28 cs.CV cs.SD 版本更新 57%

UniSkip-Mamba: A Frequency-Aware State Space Model for Audio-Visual Temporal Forgery Localization

UniSkip-Mamba:用于视听时间伪造定位的频率感知状态空间模型

Cangjin Yu, Quan Zhang, Dan Jiang, Ke Zhang

机构 * Soochow University(苏州大学) Tsinghua University(清华大学)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 针对视听时间伪造定位,通过频域分析发现伪造特征集中在低中频,提出融合多模态序列与新颖扫描机制的UniSkip-Mamba框架,实现性能提升和推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04098 2026-06-23 cs.CV 版本更新 57%

A Physics-Informed, Behavior-Aware Digital Twin for Robust Multimodal Forecasting of Core Body Temperature in Precision Livestock Farming

一种物理知情、行为感知的数字孪生方法,用于精准畜牧业中核心体温的鲁棒多模态预测

Riasad Alvi, Mohaimenul Azam Khan Raiaan, Sadia Sultana Chowa, Arefin Ittesafun Abian, Reem E Mohamed, Md Rafiqul Islam, Yakub Sebastian, Sheikh Izzal Azid, Sami Azam

机构 * Applied Artificial Intelligence and Intelligent Systems (AAIINS) Laboratory(应用人工智能与智能系统实验室) Department of Computer Science and Engineering(计算机科学与工程系) Department of Data Science and Artificial Intelligence(数据科学与人工智能系) Department of Software Systems & Cybersecurity(软件系统与网络安全系) Energy and Resources Institute, Faculty of Science and Technology(能源与资源研究所,科学与技术学院) Faculty of Science and Technology(科学与技术学院) School of Engineering and Energy(工程与能源学院)

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract);分类 cs.CV

AI总结 提出物理知情数字孪生框架,结合不确定性感知的专家加权堆叠集成,利用ODE热调节模型、高斯过程、卡尔曼滤波和行为马尔可夫链,融合多模态数据实现奶牛核心体温的2小时提前预测,R²达0.783。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09001 2026-08-14 cs.SD eess.AS 版本更新 50%

Optimal Transport-based Semantic Alignment for LLM-based Audio-Visual Speech Recognition

基于最优传输的基于大语言模型的视听语音识别语义对齐

Xugang Lu, Peng Shen, Yu Tsao, Hisashi Kawai

专题命中 音视频/视觉语言融合 :multimodal fusion(abstract)

AI总结 研究基于大语言模型的视听语音识别,提出基于最优传输的语义对齐框架,通过在多模态融合前对齐声学和视觉表征弥合模态差距,经实验验证该方法能有效提升性能,在多种条件下达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏