arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-21 至 2026-08-21 共收录 70 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2608.19207 2026-08-21 cs.CL 新提交 83%

Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages

合规性、能力与冲突:基于系统消息的多模态大语言模型基准测试

Juan Yeo, Geewook Kim

机构 * NAVER Cloud(NAVER云) KAIST AI(韩国科学技术院人工智能)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究构建基准VSysBench测试多模态大语言模型在系统消息下的合规性,发现施加系统消息会降低任务准确率,开放权重模型易受用户冲突影响,视觉约束最难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11907 2026-08-21 cs.CV cs.AI 版本更新 81%

A Model-Internal Protocol for Assessing Multimodal Models as Integrated Systems

你能看到你所绘制的内容吗?面向统一多模态模型整体评估的语义闭环框架

Hao Zhang, Jiaxin Qi, Zhijiang Tang, Jianqiang Huang

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学) Computer Network Information Center(计算机网络信息中心) Chinese Academy of Sciences(中国科学院)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本研究针对统一多模态模型的系统级评估缺口,提出无标注的SGU语义闭环框架,通过感知-生成-推理流程评估模型综合能力,发现高性能模型存在自生成上下文推理局限,为下一代模型开发提供基准基础。

Comments 21 pages, 8 figures, 12 tables. Title updated; author contribution and corresponding-author notes added. Hao Zhang and Jiaxin Qi contributed equally; Jianqiang Huang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09276 2026-08-21 cs.CL cs.LG 版本更新 57%

Verifiably grounded machine interpretation of lunar geology

月球地质学的可验证机器解释

Tom Sander, Kay Wohlfarth, Christian Wöhler

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究将地质知识推理方法嵌入多模态视觉-语言架构,构建可验证的月球地质学机器解释模型,结合开卷检索解决数值年龄定年依赖记忆先验的问题,明确自动地质推理的必要架构。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2608.19523 2026-08-21 eess.AS 新提交 85%

DAVSS: Distilled Audio-Visual State Space Models

DAVSS:蒸馏视听状态空间模型

Saurabhchand Bhati, Mrudula Athi, Amit S. Chhetri, James Glass

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本研究提出14M参数的DAVSS模型,通过小patch提升输入分辨率、30%参数用于联合建模,在体积远小于CAV-MAE等Transformer视听模型的同时,性能仍优于后者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19527 2026-08-21 cs.HC cs.CL cs.SD 新提交 61%

Does Listening Matter? Backchanneling and Nodding in AI Clone

倾听重要吗?AI克隆中的反馈式回应与点头动作

Koji Inoue, Kazushi Kato, Tatsuya Kawahara, Shunichi Kasahara

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.CL

AI总结 本研究将口头反馈式回应与头部点头整合到配备语音克隆及LLM响应的AI克隆中,经35人被试内研究证实,添加互动倾听行为可提升AI克隆的感知专注度、真实感与共同在场感,其保真度需涵盖倾听行为。

Comments This paper has been accepted to the Late-Breaking Results (LBR) track of the 28th International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2606.19161 2026-08-21 cs.RO 版本更新 67%

HT-Bench: Benchmarking and Learning Dexterous Full-Hand Tactile Representations with Egocentric Vision

HT-Bench:基于自我中心视觉的灵巧全手触觉表示基准与学习

Yuzhe Huang, Jiaping Wu, Jiaming Jiang, Hezhe Lin, Aikebaier Aierken, Yunlong Wang, Kun Cheng, Wanlin Li, Chenxi Xiao, Ziyuan Jiao, Yuanxin Zhong

机构 * Beihang University(北航) Rimbot BUPT(北邮) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) CAS(中国科学院)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract)

AI总结 提出HT-Bench多任务基准和HandTouch编码器,通过大规模自我中心视觉与全手触觉数据,在触觉相似性检索、掩码修复、视觉到触觉合成等任务上验证了触觉表示的有效性。

Comments 9pages, 4figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20127 2026-08-21 cs.CV 新提交 57%

ID-VTG: Image-Disambiguated Video Temporal Grounding

ID-VTG:基于图像消歧的视频时间定位

Minghang Zheng, Jingli Wei, Hongyi Yang, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频时间定位中视觉相似实体的消歧难题,本文提出ID-VTG任务与VGD-Agg框架,构建两个基准数据集,实现了该任务的当前最优性能。

Comments ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11322 2026-08-21 cs.HC cs.AI 版本更新 57%

Socioduality: A Relational Process Framework for Human-AI Interaction

社会对偶性:用于人机交互的关系过程框架

Mehmed Zahid Çögenli

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出社会对偶性这一关系过程框架,通过嵌套单元定义人机交互过程,经实验验证其可用于分析人机交互中贡献的形成及路径信息。

Comments 50 pages, 4 figures, 12 tables. Revised version adds a Supplementary Exploratory Analysis comparing Sociodual pathways with blind developmental/task-process segmentation, with granularity and record-format checks and an unseen-case extension. Main construct specification unchanged; minor editorial and terminology refinements

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07932 2026-08-21 cs.CV 版本更新 57%

SportsGrounder: Proposal-Aided Interleaved Grounding for Dense Sports Video Reasoning

SportsGrounder:用于密集体育视频推理的提案辅助交错定位框架

Yizhi Li, Jiawei Jiang, Guanhong Wang, Yingcai Wu, Gaoang Wang

机构 * Zhejiang University(浙江大学) Beijing Jiaotong University(北京交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对LMMs难以处理密集体育视频细粒度推理的问题,提出SportsGrounder框架,结合IGF机制与AAS模块,在SoccerNet等数据集上实现最优准确率。

Comments ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09261 2026-08-21 cs.CV 版本更新 57%

Self-supervised Learning Matters: A Simple Ensemble Solution for Micro-Gesture Recognition

自监督学习至关重要:一种用于微手势识别的简单集成方案

Tingyi Liu, Kun Li, Fei Wang, Junjie Chen, Zhiliang Wu, Jihao Gu, Haixu Liu, Dan Guo

机构 * Hefei University of Technology(合肥工业大学) United Arab Emirates University(阿拉伯联合酋长国大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui Evolution Technology Co., Ltd.(安徽进化科技有限公司) Nanyang Technological University(南洋理工大学) University College London(伦敦大学学院) The University of Sydney(悉尼大学) Beijing QBoson Quantum Technology Co., Ltd.(北京量子芯科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出一种集成自监督RGB模型与监督多流模型的框架,在MiGA挑战赛微手势分类赛道取得第一名,通过自监督预训练提升性能,在iMiGUE测试集上达到74.419%的top-1准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24856 2026-08-21 cs.LG cs.AI 版本更新 57%

The Concept Allocation Zone: Tracking How Concepts Form Across Transformer Depth

概念分配区:追踪概念如何跨越Transformer深度形成

James Henry

机构 * Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出概念分配区(CAZ)框架,通过层间度量(分离度、概念一致性、概念速度)检测概念在残差流中逐渐形成的深度区间,并在34个模型上验证了分离曲线的多模态性及温和CAZ的因果活性。

Comments v2: substantial revision. Cross-architecture ordering statistic and MHA/GQA cohort-split claim retracted per recomputation; corpus and companion-paper citations refreshed. See paper's "Changes from Version 1" section for the full list of superseded values

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23078 2026-08-21 eess.IV 版本更新 50%

A Systematic Survey on Event Camera Representation Learning

事件相机表示学习系统综述

Hongwei Ren, Youxin Jiang, Tuopusen Huang, Lei Yu, Xiao Wang, Min Liu, Lin Wang, Xiangqian Wu

专题命中 视频多模态 :multimodal(abstract)

AI总结 综述从原始事件流转换为可学习表示的角度,分类梳理了基于密集和稀疏表示的方法,分析其在结构规则性、时间保真度、稀疏保持和架构兼容性上的权衡,并总结基准与未来方向。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2608.19218 2026-08-21 cs.CL cs.AI cs.LG 新提交 86%

Time-Series Retrieval for Grounding Multimodal Language Models in Remaining Useful Life

用于将多模态语言模型与剩余使用寿命关联的时间序列检索

Valeriu Dimidov, Raphaël Frank

机构 * University of Luxembourg(卢森堡大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出时间序列检索关联的多模态大语言模型框架,在C-MAPSS基准FD001分区实验显示,该方法可提升RUL预测的误差与稳定性,且效果随模型容量变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22547 2026-08-21 cs.CV cs.AI 版本更新 84%

MKG-CARE: Case-Aware Reasoning with Multimodal Knowledge Graphs for Explainable Medical Image Diagnosis

基于多模态知识图谱和可靠性引导精化的病例感知医学图像分类

Yiming Xu, Yixuan Liu, Yuhang Zhang, Ling Zheng, Yihan Wang, Qi Song

机构 * University of Science and Technology of China(科学技术大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于多模态知识图谱的病例感知推理框架,通过构建结构化诊断记忆、自适应检索相似病例、知识传播与注入机制以及置信度校准的决策精化方案,提升医学图像分类的性能和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20019 2026-08-21 cs.AI 新提交 83%

Contrastive Mixed Prompt Learning for Incomplete Multimodal Sentiment Analysis with Unseen Modality Combination

针对未见模态组合的不完整多模态情感分析的对比混合提示学习

Kaixin Xu, NaiJin Liu, Yulin Kang, Tangyue Jin, Zixuan Yu, Wenxi Zhao, Yibei Liu, Qianle Zhang, Yangyang Wu, Mengying Zhu, Meng Xi

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对未见模态组合下的不完整多模态情感分析问题,提出CMPL模型,通过标签引导对比学习、带软路由的模态组合提示及三种提示对比策略,在三类数据集上较SOTA准确率提升超5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16106 2026-08-21 cs.CL 版本更新 79%

Explainable Multimodal Depression Recognition in Clinical Interviews via PHQ-Aligned Symptom Summarization

基于PHQ对齐症状总结的临床访谈中可解释多模态抑郁识别

Wenjie Zheng, Qiming Xie, Jianfei Yu, Yang Wang, Lei Cao, Fei Wang, Shijin Wang, Rui Xia, Chengqing Zong

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 该研究针对临床访谈多模态抑郁识别的可解释性不足问题,提出Explain-MDRC框架,构建含PHQ-8对齐注释的Explain-DAIC数据集,开发PhqCML模型,提升识别性能并提供可解释中间证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19536 2026-08-21 cs.CV cs.AI cs.RO 新提交 76%

CVSD-Reg: Cross-Modal Visual Semantic Prior Distillation for Robust LiDAR Registration

CVSD-Reg:用于鲁棒激光雷达配准的跨模态视觉语义先验蒸馏

Eunsoo Im, Junghun Suh, Gyeonggwan Lee, Seunghwan Hong

专题命中 跨模态检索 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出CVSD-Reg框架,通过蒸馏视觉基础模型的语义先验提升激光雷达配准的鲁棒性,在多数据集上的成功率优于现有方法,且无需相机输入或事后ICP精修。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-21 cs.AI cs.LG 版本更新 57%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22073 2026-08-21 cs.IR 版本更新 50%

BRIDGE: Behavior-Guided Residual Integration with Dual-Frequency Graph Evidence

基于行为的候选校准用于多模态推荐

Zesheng Li, Chengchang Pan, Honggang Qi

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出了一种基于行为的候选校准方法,通过将训练-only的共用户重叠转换为带符号的候选证据,并仅应用于多模态骨干网络生成的短名单,以提高多模态推荐系统的性能。

Comments 12 pages, 3 figures. Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026). Project page: this https URL (https://lizesheng13.github.io/bridge/)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2506.18779 2026-08-21 cs.RO 版本更新 78%

DiffDef: A Diffusion Model for Generating Multimodal Goal Shapes From Demonstrations for Deformable Object Manipulation

DiffDef:一种用于从演示中生成可变形物体操纵的多模态目标形状的扩散模型

Bao Thach, Tanner Watts, Siyeon Kim, Britton Jordan, Mohanraj Shanthi, Shing-Hei Ho, James M. Ferguson, Tucker Hermans, Alan Kuntz

机构 * Robotics Center and Kahlert School of Computing, University of Utah(大学计算机学院和机器人中心,犹他大学) NVIDIA Corporation(英伟达公司)

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对现有可变形物体操纵方法依赖不切实际的目标获取方式、无法处理多模态目标的问题,提出DiffDef扩散模型,学习可行目标形状分布,在仿真和两种物理机器人平台上验证其可提升任务性能。

Comments Published and presented at ICRA 2026. 8 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20331 2026-08-21 cs.CL cs.AI cs.CV 新提交 67%

G-CARL: Grounded Checklist-Aligned Reward Learning for Patient-Oriented Medical Report Interpretation

G-CARL:面向患者的医学报告解读的基于 grounded 核对清单对齐的奖励学习

Shiao Xie, Siyu Chen, Jianwei Lv, Bo Yuan, Yujin Wang, Xiandong Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文针对现有医学视觉-语言任务无法兼顾医学事实性与患者语境沟通的问题,提出PMRI任务及G-CARL框架,构建MMedReport基准,实验证实其解读更贴合患者需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00140 2026-08-21 cs.LG cs.AI 版本更新 57%

GEM: Geometric Erasure by Contrastive Velocity Matching in Rectified Flows

整流流中对比速度匹配的几何擦除

Jonas Henry Grebe, Tobias Braun, Anna Rohrbach, Marcus Rohrbach

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出GEM框架,通过对比速度匹配实现整流流模型中的概念擦除,结合生成流网络与教师引导的流匹配,有效抑制有害内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05853 2026-08-21 cs.CV 版本更新 57%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18400 2026-08-21 eess.IV cs.CV 版本更新 57%

Exploiting Completeness Perception with Diffusion Transformer for Unified 3D MRI Synthesis

利用扩散变换器的完整性感知实现统一的3D MRI合成

Junkai Liu, Nay Aung, Theodoros N. Arvanitis, Joao A. C. Lima, Steffen E. Petersen, Le Zhang

机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。

Comments Accepted to TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15648 2026-08-21 cs.LG cs.CE cs.CV 版本更新 57%

Guided Diffusion by Optimized Loss Functions on Relaxed Parameters for Inverse Material Design

通过放松参数优化损失函数引导扩散用于逆材料设计

Jens U. Kreber, Christian Weißenfels, Joerg Stueckler

机构 * Intelligent Perception in Technical Systems Group, University of Augsburg, Germany(技术系统智能感知组,乌尔姆大学,德国) Faculty of Mathematics, Natural Science and Engineering, University of Augsburg, Germany(数学、自然科学与工程学院,乌尔姆大学,德国) Centre for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(高级分析与预测科学中心,乌尔姆大学,德国)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 通过优化损失函数引导扩散模型,用于逆材料设计,实现高效且多样化的设计生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19590 2026-08-21 eess.IV 新提交 50%

Loss-Resilient Semantic Communication over Packet-Loss Networks at Extreme-Low Bandwidth

极端低带宽丢包网络下的抗丢包语义通信

Shengshi Yao, Jincheng Dai, Sixian Wang, Guo Lu, Kai Niu, Wenjun Xu, Wenjun Zhang, Ping Zhang

专题命中 多模态生成 :multi-modal(abstract)

AI总结 针对极端低带宽丢包网络的语义通信问题,提出ResiGLC框架,结合语言模型上下文预测与掩码学习,通过渐进式解码提升抗丢包性,可在低带宽下改善通信的感知质量。

Comments Accepted to appear in IEEE TMC. 14 pages, 15 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19809 2026-08-21 cs.SI 新提交 50%

From Latent Influence to Language: Diffusion-Oriented Content Generation via Audience-Susceptible Features

从潜在影响到语言:面向扩散的受众易感特征内容生成

Jiaying Lei, Shengqi Dang, Runqian Bai, Ziqing Qian, Nan Cao

专题命中 多模态生成 :multimodal(abstract)

AI总结 针对现有面向扩散的内容生成方法难以转化扩散影响信号的问题,提出三阶段框架DOCG-AS,实验显示其在预测扩散影响上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19709 2026-08-21 cs.NI 新提交 50%

RFWM: Physics-Guided World Model for Dynamic Wireless Radiance Field Generation

RFWM:用于生成动态无线辐射场的物理引导世界模型

Zijiu Yang, Qianqian Yang

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究针对动态未知环境下RF场建模泛化难的问题,提出物理引导的RF世界模型RFWM,采用两阶段训练策略,在新构建的基准上实现了优于现有最优方法的RF场生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22950 2026-08-21 stat.ML cs.LG math.ST stat.ME 版本更新 50%

Diffusion-based Denoising Beats Vanilla Score Matching in Parameter Estimation: A Theoretical Explanation

基于扩散的去噪在参数估计中优于普通得分匹配:一个理论解释

Benedikt Lütke Schwienhorst, Nadja Klein, Johannes Lederer

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过理论分析证明,对于具有分离模态的多峰分布,基于扩散的去噪得分匹配估计器(DDSME)相比普通得分匹配估计器(SME)具有更优的误差界,并解释了扩散方法优越性的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 12 篇

2608.19208 2026-08-21 cs.CL cs.CV 新提交 84%

When Irrelevant Text Matters: Affine Margin Shifts in Multimodal Large Language Models

当无关文本起作用时:多模态大语言模型中的仿射间隔偏移

Yinfeng Wang, Zhiyuan Yao, Zheren Fu, Lei Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文研究多模态大语言模型(MLLMs)中任务无关文本对视觉判断任务的影响,发现其会使模型决策间隔发生可预测的仿射变换,为提升模型对噪声上下文的鲁棒性提供了诊断基础。

详情

展开后加载摘要…

URL PDF HTML 收藏