arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-17 至 2026-04-17 共收录 73 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2604.14656 2026-04-17 cs.AI cs.CL cs.CV 85%

Rethinking Patient Education as Multi-turn Multi-modal Interaction

重新思考患者教育作为多轮多模态交互

Zonghai Yao, Zhipeng Tang, Chengtao Lin, Xiong Luo, Benlu Wang, Juncheng Huang, Chin Siang Ong, Hong Yu

机构 * VA Bedford Health Care(VA贝德福德医疗中心) UMass Amherst(马萨诸塞大学阿默斯特分校) UMass Lowell(马萨诸塞大学洛厄尔分校) Yale University(耶鲁大学) National University of Singapore(新加坡国立大学) Yale School of Medicine(耶鲁医学院)

专题命中 图文多模态 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MedImageEdu基准,通过多轮多模态交互提升患者教育效果,评估咨询过程和最终响应质量,发现多模态模型在视觉 grounding、安全性和情绪互动方面存在不足。

Comments Equal contribution for the first two authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14198 2026-04-17 cs.LG cs.AI cs.CL 81%

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

MixAtlas: 多模态大语言模型中训练过程中的数据混合优化方法

Bingbing Wen, Sirajul Salekin, Feiyang Kang, Bill Howe, Lucy Lu Wang, Javier Movellan, Manjot Bilkhu

机构 * Apple(苹果公司) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 MixAtlas通过双轴分解训练语料,结合小代理模型与高斯过程代理,优化多模态大语言模型的训练混合策略,提升性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14629 2026-04-17 cs.CV 70%

Switch-KD: Visual-Switch Knowledge Distillation for Vision-Language Models

Switch-KD:视觉切换知识蒸馏用于视觉-语言模型

Haoyi Sun, Xiaoxiao Wang, Ning Mao, Qian Wang, Lifu Mu, Wen Zheng, Tao Wei, Wei Chen

机构 * Li Auto Inc(利-auto公司)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Switch-KD通过统一视觉-语言知识转移,解决多模态对齐问题,使小模型高效蒸馏大模型的多模态知识。

Comments 11 pages, 3 figures

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11176 2026-04-17 cs.CV 70%

Precision Synthesis of Multi-Tracer PET via VLM-Modulated Rectified Flow for Stratifying Mild Cognitive Impairment

多示踪PET的高精度合成通过VLM调制的校正流用于区分轻度认知障碍

Tuo Liu, Shuijin Lin, Shaozhen Yan, Haifeng Wang, Jie Lu, Jianhua Ma, Chunfeng Lian

机构 * School of Mathematics and Statistics, Xi'an Jiaotong University(西安交通大学数学与统计学学院) Key Laboratory of Biomedical Information Engineering of Ministry of Education, School of Life Science and Technology, Xi'an Jiaotong University(教育部生物医学信息工程重点实验室,西安交通大学生命科学与技术学院) Department of Radiology and Nuclear Medicine, Xuanwu Hospital, Capital Medical University(首都医科大学宣武医院放射科与核医学科) Research Center for Intelligent Medical Equipment and Devices (IMED), Xi'an Jiaotong University(智能医疗设备与器件研究中心(IMED),西安交通大学)

专题命中 图文多模态 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出DIReCT$++$模型,结合MRI和临床信息,通过校正流和视觉语言模型生成高保真多示踪PET图像,实现轻度认知障碍的精准分层。

Comments Added supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18129 2026-04-17 cs.CV cs.CL 62%

One RL to See Them All: Visual Triple Unified Reinforcement Learning

一个RL看尽一切:视觉三合一强化学习

Yan Ma, Linge Du, Xuyang Shen, Shaoxiang Chen, Pengfei Li, Qibing Ren, Lizhuang Ma, Yuchao Dai, Pengfei Liu, Junjie Yan

机构 * Qwen Team(通义实验室)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出V-Triune方法,通过三个协调抽象提升多模态RL性能,开发Orsta模型在多个任务中表现优异,展示统一RL在视觉语言模型中的优势。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04585 2026-04-17 cs.CV 57%

SAM3-I: Segment Anything with Instructions

SAM3-I: 基于指令的分割

Jingjing Li, Yue Feng, Yuchen Guo, Jincai Huang, Wei Ji, Qi Bi, Yongri Piao, Miao Zhang, Xiaoqi Zhao, Qiang Chen, Shihao Zou, Huchuan Lu, Li Cheng

机构 * University of Alberta(阿尔伯塔大学) Tencent WeChat(腾讯微信) Northwestern University(西北大学) SUSTech(四川大学) Yale University(耶鲁大学) Utrecht University(乌得勒支大学) Dalian University of Technology(大连理工大学) SIAT, Chinese Academy of Sciences(中科院深圳先进技术研究院)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SAM3-I通过整合概念级 grounding 和指令级推理,提升分割性能,支持复杂自然语言指令。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14474 2026-04-17 cs.LG 50%

Scouting By Reward: VLM-TO-IRL-Driven Player Selection For Esports

通过奖励进行 scouting:由 VLM-TO-IRL 驱动的电子竞技玩家选拔

Qing Yan, Wenyu Yang, Yufei Wang, Wenhao Ma, Linchong Hu, Yifei Jin, Anton Dahbura

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) Cornell University(康奈尔大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出一种基于逆强化学习的电子竞技玩家选拔框架,通过学习专业选手的奖励函数,利用多模态双分支架构和 GAIL 目标实现玩家风格匹配评估,提升人才发现效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2507.11812 2026-04-17 cs.SD eess.AS eess.SP 83%

A Multimodal Data Fusion Generative Adversarial Network for Real Time Underwater Sound Speed Field Construction

一种多模态数据融合生成对抗网络用于实时水下声速场构建

Wei Huang, Yuqiang Huang, Jixuan Zhou, Fang Ji, Hao Zhang, Tianhe Xu

机构 * Faculty of Information Science and Engineering, Ocean University of China(中国海洋大学信息科学与工程学院) Hanjiang National Laboratory(汉江国家实验室) School of Space Science and Technology, Shandong University (Weihai)(山东大学(威海)空间科学与技术学院) China Waterborne Transport Research Institute(中国水上运输研究院) China Ship Research and Development Academy(中国船舶研究与发展院)

专题命中 音频语音多模态 :multimodal(title);multi-modal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出MDF-RAGAN模型,通过多源融合和跨模态注意力机制提升水下声速场构建精度,实验显示其在误差小于0.3m/s的情况下优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03416 2026-04-17 cs.CV 79%

GAMBIT: A Gamified Jailbreak Framework for Multimodal Large Language Models

GAMBIT:一种用于多模态大语言模型的游戏化突破框架

Xiangdong Hu, Yangyang Jiang, Qin Hu, Xiaojun Jia

机构 * Georgia State University(佐治亚州立大学) Shandong University(山东大学) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GAMBIT框架,通过分解重组有害视觉语义并构建游戏化场景,使模型在探索和重建意图中主动完成突破,提升攻击成功率。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24470 2026-04-17 cs.CV cs.AI cs.CL cs.SI 67%

Counting Without Numbers and Finding Without Words

不使用数字进行计数和不使用词语进行寻找

Badri Narayana Patro

机构 * Microsoft(微软)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出首个多模态重聚系统,整合视觉和声学生物特征,通过处理不同频率的动物声音和容忍压力导致的外观变化,实现基于生物通信原理的AI应用,帮助无语言能力的弱势群体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14619 2026-04-17 cs.SD cs.LG eess.AS q-fin.CP q-fin.ST 57%

The Acoustic Camouflage Phenomenon: Re-evaluating Speech Features for Financial Risk Prediction

声音伪装现象:重新评估语音特征用于金融风险预测

Dhruvin Dungrani, Disha Dungrani

机构 * Department of Information Systems(信息系统系)

专题命中 音频语音多模态 :multimodal(abstract);分类 eess.AS

AI总结 本文研究了在真实会议环境中,高训练度演讲者使用语音特征(音高、抖动和犹豫)进行金融风险预测的局限性,发现融合声音特征会降低性能,提出声音伪装现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07222 2026-04-17 cs.LG cs.CL 57%

Pay Less Attention to Function Words for Free Robustness of Vision-Language Models

减少对功能词的关注以实现视觉语言模型的自由鲁棒性

Qiwei Tian, Chenhao Lin, Zhengyu Zhao, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an 710049, China(西安交通大学计算机科学与工程学院,西安 710049,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL

AI总结 本文提出FDA方法,通过减少功能词的注意力影响,提升视觉语言模型在跨模态对抗攻击下的鲁棒性,实验显示在检索任务中ASR下降18%/13%/53%,性能损失极小。

Comments The paper has been accepted by ICLR26

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 12 篇

2604.15312 2026-04-17 cs.CV 79%

Bidirectional Cross-Modal Prompting for Event-Frame Asymmetric Stereo

双向跨模态提示用于事件-帧不对称立体

Ninghui Xu, Fabio Tosi, Lihui Wang, Jiawei Han, Luca Bartolomei, Zhiting Yao, Matteo Poggi, Stefano Mattoccia

机构 * School of Instrument Science and Engineering, Southeast University, State Key Lab of Comprehensive PNT Network and Equipment Technology, Key Lab of Micro-Inertial Instrument and Advanced Navigation Technology, MOE(仪器科学与工程学院,东南大学,综合PNT网络与设备技术国家重点实验室,微惯性仪器与先进导航技术重点实验室,教育部) Department of Computer Science and Engineering, University of Bologna(计算机科学与工程系,博洛尼亚大学) College of Computer Science and Software Engineering, Hohai University(计算机科学与软件工程学院,河海大学) Beijing Institute of Technology(北京理工大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Bi-CMPStereo框架,通过双向跨模态提示利用语义和结构特征实现稳健匹配,提升高速运动和复杂光照下的3D感知性能。

Comments CVPR 2026. Code URL: https://github.com/xnh97/Bi-CMPStereo

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14766 2026-04-17 eess.SP cs.AI 79%

Temporal Cross-Modal Knowledge-Distillation-Based Transfer-Learning for Gas Turbine Vibration Fault Detection

基于时间跨模态知识蒸馏的转移学习用于燃气轮机振动故障检测

Ali Bagheri Nejad, Mahdi Aliyari-Shoorehdeli, Abolfazl Hasanzadeh

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.AI

AI总结 本文提出基于时间跨模态知识蒸馏的转移学习框架,解决燃气轮机振动故障检测中时间上下文不足和数据稀缺问题,提升特征分离度和诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 79%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05418 2026-04-17 cs.CV cs.AI 79%

VideoStir: Understanding Long Videos via Spatio-Temporally Structured and Intent-Aware RAG

VideoStir:通过时空结构化和意图感知的RAG理解长视频

Honghao Fu, Miao Xu, Yiwei Wang, Dailing Zhang, Jun Liu, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校) Institute of Automation, CAS(中国科学院自动化研究所) Lancaster University(兰卡斯特大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoStir通过构建时空图和意图相关性评分器,改进长视频RAG框架,实现基于意图的结构化推理,无需辅助信息即可竞争现有最佳基线。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04567 2026-04-17 cs.CV 77%

All Changes May Have Invariant Principles: Improving Ever-Shifting Harmful Meme Detection via Design Concept Reproduction

所有变化可能都有不变原则:通过设计概念再现改进永动有害迷因检测

Ziyou Jiang, Mingyang Li, Junjie Wang, Yuekai Huang, Jie Huang, Zhiyuan Chang, Zhaoyang Li, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory Institute of Software Chinese Academy of Sciences(软件研究所信息集成系统技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出RepMD方法,通过设计概念再现检测不断变化的有害迷因,利用攻击树定义设计概念图,并指导多模态大语言模型提高检测准确率。

Comments 19 pages, 11 figures, 9 tables accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14630 2026-04-17 cs.CV cs.LG 74%

CMTM: Cross-Modal Token Modulation for Unsupervised Video Object Segmentation

CMTM:跨模态令牌调制用于无监督视频对象分割

Inseok Jeon, Suhwan Cho, Minhyeok Lee, Seunghoon Lee, Minseok Kang, Jungho Lee, Chaewon Park, Donghyeong Kim, Sangyoun Lee

机构 * Yonsei University, Republic of Korea(延世大学,韩国)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 本文提出CMTM方法,通过跨模态令牌调制增强外观与运动提示的交互,实现高效的多模态信息传播,取得最佳性能。

Comments 6 pages, 5 figures. Accepted to IEEE ICIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13426 2026-04-17 cs.CV cs.AI 73%

Event-Adaptive State Transition and Gated Fusion for RGB-Event Object Tracking

事件自适应状态转移与门控融合用于RGB-事件对象跟踪

Jinlin You, Muyu Li, Xudong Zhao

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MambaTrack框架,通过动态状态空间模型解决RGB-事件跟踪中静态状态转移矩阵导致的跨模态融合鲁棒性下降问题,引入事件自适应状态转移和门控投影融合模块,提升稀疏与密集事件流的建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15308 2026-04-17 cs.CV 57%

RAD-2: Scaling Reinforcement Learning in a Generator-Discriminator Framework

RAD-2: 在生成器-判别器框架中扩展强化学习

Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 RAD-2提出了一种生成器-判别器框架,通过扩散生成器生成轨迹候选并利用RL优化判别器评估长期驾驶质量,从而提升闭环规划的稳定性与安全性,实验显示碰撞率降低56%。

Comments Project page: https://hgao-cv.github.io/RAD-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19130 2026-04-17 cs.MM 57%

Dual-Stream Decoupled Learning for Temporal Consistency and Speaker Interaction in AVSD

双流解耦学习用于AVSD中的时间一致性和说话人交互

Junhao Xiao, Shun Feng, Zhiyu Wu, Jinghan Yu, Haibiao Yao, Zhiyuan Ma, Jianjun Li, Youjun Bao, Yi Chen

专题命中 视频多模态 :audio-visual(abstract);分类 cs.MM

AI总结 本文提出D$^2$Stream双流框架,通过解耦时间连续性和人际交互任务,提升AVSD性能,实现95.6%的mAP和更广的泛化能力。

Comments Submitted to ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00998 2026-04-17 cs.CV 57%

Large Vision Model-Guided Masked Low-Rank Approximation for Ground-Roll Attenuation

大视觉模型引导的掩码低秩近似用于地面滚动生成消减

Jiacheng Liao, Feng Qian, Ziyin Fan, Yongjian Guo

机构 * School of Information and Communication Engineering, Center for Information Geoscience, University of Electronic Science and Technology of China(信息与通信工程学院,信息科学研究院,电子科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于大视觉模型引导的掩码低秩近似框架,通过多模态提示生成精细掩码,结合全局和局部低秩约束,有效消减地面滚动生成并抑制信号泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17493 2026-04-17 physics.plasm-ph 50%

DustNET: enabling machine learning and AI models of dusty plasmas

DustNET: 使尘埃等离子体的机器学习和人工智能模型成为可能

Zhehui Wang, Justin C. Burton, Niklas Dormagen, Cheng-Ran Du, Yan Feng, John E. Foster, Susan S. Glenn, Max Klein, Christina A. Knapek, Lorin Matthews, André Melzer, Edward Thomas, Chuji Wang, Jalaan Avritte, Shan Chang, Neeraj Chaubey, Pubuduni Ekanayaka, John A. Goree, Truell Hyde, Chen Liang, Zhuang Liu, Zhuang Ma, Ilya Nemenman, Elon Price, A. S. Schmitz, Mike Schwarz, Saikat C. Thakur, M. H. Thoma, Hubertus M. Thomas, L. Wimmer, Wei Yang, Zimu Yang, Xiaoman Zhang

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文探讨了DustNET框架,通过整合实验、模拟和合成数据,利用机器学习和人工智能方法,实现尘埃等离子体的多尺度预测和不确定性量化。

Comments 61 pages, 35 figures, 490+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01728 2026-04-17 cs.RO cs.LG cs.LO 50%

Constrained Decoding for Safe Robot Navigation Foundation Models

安全机器人导航基础模型的约束解码

Parv Kapoor, Akila Ganlath, Michael Clifford, Changliu Liu, Sebastian Scherer, Eunsuk Kang

机构 * Carnegie Mellon University(卡内基梅隆大学) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出SafeDec框架,通过约束解码确保机器人导航基础模型满足信号时间逻辑规范,提升安全性和行动生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2604.15233 2026-04-17 cs.AI cs.DB 83%

Blue Data Intelligence Layer: Streaming Data and Agents for Multi-source Multi-modal Data-Centric Applications

蓝色数据智能层:面向多源多模态数据导向应用的流数据与智能体

Moin Aminnaseri, Farima Fatahi Bayat, Nikita Bhutani, Jean-Flavien Bussotti, Kevin Chan, Rafael Li Chen, Yanlin Feng, Jackson Hassell, Estevam Hruschka, Eser Kandogan, Hannah Kim, James Levine, Seiji Maekawa, Jalal Mahmud, Kushan Mitra, Naoki Otani, Pouya Pezeshkpour, Nima Shahbazi, Chen Shen, Dan Zhang

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出Blue数据智能层,通过整合异构数据源、多模态信息及上下文数据,解决多源多模态数据导向应用中的复杂查询需求,结合智能体与数据处理实现自然语言到SQL的扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15210 2026-04-17 cs.AI cs.CL 81%

Learning to Think Like a Cartoon Captionist: Incongruity-Resolution Supervision for Multimodal Humor Understanding

学习像卡通标题作家一样思考:用于多模态幽默理解的不一致-解决监督

Hatice Merve Vural, Doga Kukul, Ege Erdem Ozlu, Demir Ekin Arikan, Bob Mankoff, Erkut Erdem, Aykut Erdem

机构 * Koç University(科克大学) KUIS AI Center(KUIS人工智能中心) Air Mail and Cartoon Collections(Air Mail和卡通收藏) Hacettepe University(哈恰特佩大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出IRS框架,通过分解幽默理解为不一致建模、解决建模和偏好对齐,提升多模态幽默理解能力,在NYCC基准上优于现有模型,且在零样本迁移中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15946 2026-04-17 cs.LG cs.AI cs.CR 77%

Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval

跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测

Wenshuo Wang, Ziyou Jiang, Junjie Wang, Mingyang Li, Jie Huang, Yuekai Huang, Zhiyuan Chang, Feiyan Duan, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14204 2026-04-17 cs.SD cs.AI eess.AS 73%

Disentangled Dual-Branch Graph Learning for Conversational Emotion Recognition

解耦双分支图学习用于对话情感识别

Chengling Guo, Yuntao Shou, Tao Meng, Wei Ai, Yun Tan, Keqin Li

机构 * College of Computer and Mathematics(计算机与数学学院) Central South University of Forestry and Technology(林业科技大学) Changsha Hospital for Maternal and Child Health Care(长沙妇幼保健医院) Department of Computer Science, State University of New York(纽约州立大学计算机科学系)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI、eess.AS

AI总结 本文提出解耦双分支图学习框架,通过分离模态不变和特定特征,结合傅里叶图神经网络和说话人感知超图,提升对话情感识别性能。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14710 2026-04-17 cs.CV 70%

G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval

G-MIXER:基于测地混合的隐式语义扩展和显式语义重新排序用于零样本复合图像检索

Jiyoung Lim, Heejae Yang, Jee-Hyong Lee

机构 * Sungkyunkwan University(顺天大学)

专题命中 跨模态检索 :multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 G-MIXER通过测地混合生成隐式语义特征并重新排序显式语义,提升零样本复合图像检索的多样性和准确性,实现跨多个基准的最优性能。

Comments CVPR 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 57%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 跨模态检索 :multimodal(abstract);分类 cs.MM

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏