arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-05 至 2026-08-05 共收录 102 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 9 篇

2505.17674 2026-08-05 cs.CV 版本更新 57%

SVL: Empowering Spiking Neural Networks for Efficient 3D Open-World Understanding

SVL:基于脉冲的视觉-语言预训练用于高效的3D开放世界理解

Xuerui Qiu, Peixi Wu, Yaozhi Wen, Shaowei Gu, Yuqi Pan, Xinhao Luo, Bo XU, Guoqi Li

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SVL提出基于脉冲的视觉-语言预训练框架,通过多尺度三元组对齐和可重参数化的视觉-语言整合,提升SNN在3D开放世界理解中的性能,实现高效零样本3D分类和多模态问答。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24804 2026-08-05 cs.IR cs.LG 版本更新 50%

Bumblebee: Interleaved Mixed-Layer Building Blocks for Large-Scale Recommendation Systems

大黄蜂:用于大规模推荐系统的交错混合层构建块

David Bauer, Cancan Zhang, Wenshun Liu, Xiaoyi Zhang, Weijia Liu, Wanli Ma, Yue Weng, Wei Li, Rui Li, Jing Qian, Huayu Li, Xiaoyi Liu, Linhong Zhu, Jerry Fu

专题命中 视频多模态 :cross-modal(abstract)

AI总结 研究针对推荐系统发展的两条轨道缺乏交互的问题,提出大黄蜂架构,通过交错可堆叠块设计,结合多种技术,实现模态混合与信息丰富,经实验验证该方法优于基线模型,证明交错异构单元是有前途的推荐架构范式。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 11 篇

2608.02791 2026-08-05 cs.CV 新提交 91%

Better, Stronger, Faster, and Broader: Structured All-Mask Prediction for MLLM-Based Segmentation

更好、更强、更快、更广泛:基于多模态大型语言模型(MLLM)的结构化全掩码预测分割

Jiazhen Liu, Mingkuan Feng, Long Chen

机构 * The Hong Kong University of Science and Technology (HKUST)(香港科技大学)

专题命中 跨模态检索 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 STAMPlus通过结构化全掩码预测解耦自回归对话与非自回归掩码预测,解决了MLLM分割的三难问题,在提升性能的同时降低延迟,实现多类开放词汇等分割任务的SOTA表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03358 2026-08-05 cs.CL cs.CV 新提交 81%

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29440 2026-08-05 cs.AI 版本更新 79%

Beyond Retrieval: Analytic Memory for Multimodal Agents

超越检索:多模态智能体的分析记忆

Zhoujin Tian, Hao Zhang, Yao Tian, Cheng Chen, Yakun Li, Lei Zhang, Xiaofang Zhou

机构 * HKUST(香港科技大学) ByteDance(字节跳动)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出支持检索与分析记忆的AdaMM框架,在MemEye、MemGallery基准上分别提升多模态智能体长期记忆性能11.3%、7.3%,拓展了多模态记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00955 2026-08-05 cs.LG cs.AI cs.IR 版本更新 79%

From Generator to Embedder: Harnessing Innate Abilities of Multimodal LLMs via Building Zero-Shot Discriminative Embedding Model

从生成器到嵌入器:通过构建零样本判别嵌入模型来利用多模态大语言模型的固有能力

Yeong-Joon Ju, Seong-Whan Lee

机构 * Department of Artificial Intelligence(人工智能系)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出一种高效框架,通过构建零样本判别嵌入模型,利用多模态大语言模型的固有能力,提升多模态表示空间的鲁棒性和零样本嵌入能力。

Comments Accepted to IEEE Transactions on Multimedia (T-MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02907 2026-08-05 cs.LG 新提交 78%

Bayesian Data Reweighting Improves Multimodal Retrieval for Knowledge-Based Visual Question Answering

贝叶斯数据重加权改进基于知识的视觉问答的多模态检索

Jingchen Sun, Shaobo Han, Ruiyi Zhang, Naresh Kumar Devulapally, Ming Liu, Yitao Long, Vishnu Suresh Lokhande, Changyou Chen

机构 * University at Buffalo(布法罗大学) NEC Laboratories America(美国 NEC 实验室) Adobe Research(奥多比研究院) Iowa State University(爱荷华州立大学) New York University(纽约大学)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 针对基于知识的视觉问答中多模态检索的负样本处理问题,提出贝叶斯数据重加权框架,通过概率建模与随机EM优化,在三个检索器和七个基准上提升了检索准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03292 2026-08-05 cs.AI 新提交 70%

DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

DocTrace:面向可追溯的长文档视觉问答的分层证据图推理方法

Le Xiang, Zhicheng Guan, Hong Chen, Xiaocong Lin, Zhenghua Lei, Teng Hu, Bolei He, Long Zeng

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract_cn);分类 cs.AI

AI总结 本文提出DocTrace分层框架,将长文档视觉问答建模为显式证据图推理问题,经两阶段训练优化后,在三个基准上优于现有模型,且推理可追溯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02688 2026-08-05 cs.LG cs.AI 新提交 70%

Learning Molecular Representations from Cellular Phenotypes with Structure Preservation

基于结构保留的细胞表型分子表示学习

Xuan Lin, Jingyu Sheng, Tengfei Ma, Li Sun, Dapeng Xiong

机构 * Xiangtan University(湘潭大学) Hunan University(湖南大学) Beijing University of Posts and Telecommunications(北京邮电大学) Southeast University(东南大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出结构保留的PhenMol框架,通过解耦分子与细胞表示实现表型引导对齐,在多类任务上提升性能,为药物发现整合细胞表型与化学知识提供了有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03524 2026-08-05 cs.AI 新提交 57%

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

Dr. AGENTONOMICS:AGENTONOMICS的教学实验

Fengjunjie Pan, Alois Knoll

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。

Comments Technical report, Technical University of Munich

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03150 2026-08-05 cs.AI 新提交 57%

UniGD: A Unified Generative-Discriminative Framework for Industrial Retrieval

UniGD:面向工业检索的统一生成-判别框架

Shujie Ji, Yawei Kong, Yilin Zhao, Li Wang, Xialong Liu, Peng Jiang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 UniGD是整合检索与相关性评分的统一框架,通过CAGE、CAM、HAM解决工业检索问题,在快手平台及NQ320K、MS300K数据集上均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03120 2026-08-05 cs.CV 新提交 57%

SeCo-SBIR: Semantically Consistent Prompt Learning for Zero-Shot Sketch-Based Image Retrieval

SeCo-SBIR:用于零样本草图-图像检索的语义一致提示学习

Long Hoang Dang, Tuan Nguyen Huu, Nguyen Minh Hieu, Tu Minh Phuong

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 SeCo-SBIR是解决CLIP适配ZS-SBIR时域适配与泛化矛盾的语义一致提示学习框架,结合多模态提示、一致性约束与多目标损失,在三类ZS-SBIR基准上达最优性能。

Comments ACMMM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22850 2026-08-05 cs.CV 版本更新 57%

What is the Right Embedding Space for Contrastive Learning in REC?

REC中对比学习的合适嵌入空间是什么?

Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(斯通布鲁克大学) EPFL(苏黎世联邦理工学院)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 9 篇

2608.00076 2026-08-05 cs.CV cs.AI 版本更新 88%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03691 2026-08-05 cs.SE cs.AI cs.CV 新提交 86%

Pattern over Pixels: Measuring Pattern Completion Bias in Multimodal Code Generation

像素上的模式:测量多模态代码生成中的模式完成偏差

Khai-Nguyen Nguyen, Oscar Chaparro, Antonio Mastropaolo

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究针对多模态代码生成中存在的模式完成偏差问题,构建了首个视觉模式完成偏差基准,评估发现前沿MLLMs均存在严重偏差,且偏差与视觉显著性密切相关。

Comments 41st IEEE/ACM International Conference on Automated Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23586 2026-08-05 cs.CV cs.CL cs.MM cs.SD eess.AS 版本更新 70%

Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling

Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成

Zhen Ye, Xu Tan, Aoxiong Yin, Hongzhan Lin, Guangyan Zhang, Peiwen Sun, Yiming Li, Chi-Min Chan, Wei Ye, Shikun Zhang, Wei Xue

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) Independent Researcher(独立研究者)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 67%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03464 2026-08-05 cs.AI cs.CL cs.HC 新提交 62%

ChartAnno: Evaluating MLLMs for Chart Annotation Generation

ChartAnno:评估多模态大语言模型的图表标注生成能力

Zhenghan Chen, Zekai Shao, Lidan Tan, Xin Lin, Xingchen Zeng, Yi Shan, Ziyue Lin, Xiaoliang Fu, Xinyuan Liu, Yuetong Guo, Fen Wang, Bongshin Lee, Siming Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ChartAnno基准评估MLLMs的图表标注生成能力,实验显示专有模型表现更优,大规模开源模型正缩小差距,更具体指令可提升标注质量,图表图像仅在设计相关指标上有有限提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03079 2026-08-05 cs.CV cs.AI cs.LG stat.AP 新提交 62%

CorePath: A Breast-Specialized Pathology Foundation Model for Core Needle Biopsy Diagnosis and Risk-Controlled Report Generation

CorePath:用于核心针活检诊断和风险可控报告生成的乳腺专用病理基础模型

Ting Yin, Danning Li, Chen Shu, Xiaoxia Yao, Boyu Fu, Yujing Chang, Tianyu Shi, Mengna Feng, Jie Chen, Jing Fu, Xiuli Xiao, Tianlin Li, Mumin Shao, Jiaxin Bi, Wenchuan Zhang, Xiaoyan Wu, Xiao Han, Zhang Zhang, Yuhao Yi, Hong Bu

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究开发乳腺专用病理基础模型CorePath,经7901对数据微调后,在多队列及基准上的CNB诊断任务中性能优于现有模型,结合风险控制模块实现低幻觉的可靠报告生成。

Comments The code will be made publicly available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03971 2026-08-05 cs.CV 新提交 57%

UniWorld-Design: From Pixel Generation to Layer-Native Design

UniWorld-Design:从像素生成到层原生设计

Zongjian Li, Zhiyuan Yan, Chenxu Bai, Chen Chen, Haoxiang Sun, Shaodong Wang, Feize Wu, Shenghai Yuan, Bin Lin, Zheyuan Liu, Yuwei Niu, Li Yuan

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 UniWorld-Design是一种以语义RGBA层为原子单元的图像生成框架,含T2RGBA和I2L两个模型,在Crello基准测试中I2L和T2RGBA均优于现有相关模型。

Comments Project page: https://rabbitvis.rabbitpre.com/blog

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03103 2026-08-05 cs.RO cs.AI 新提交 57%

A Hierarchical Approach to Imitation Learning for Manipulation Tasks Requiring Time Varying Forces

针对需要时变力的操作任务的模仿学习的分层方法

Rishabh Shukla, Adithya Santhosh, Shaili Gandhi, Samrudh Moode, Satyandra K. Gupta

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对接触密集拆卸任务中扩散策略的延迟问题,提出DPA-FTG分层方法,解耦高低频控制,在双手电池拆卸任务上性能优于RDP等基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03036 2026-08-05 cs.SE cs.AI cs.LG 新提交 57%

LLM Serving in the Wild: An Empirical Study of Frameworks, Methods, and System Designs

野外环境下的大语言模型服务:框架、方法与系统设计的实证研究

Forough Majidi, Mohammad Mehdi Morovati, Foutse Khomh, Heng Li

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本研究通过实证分析开源软件系统中5种LLM服务框架的应用情况,明确了框架使用特点、常用服务方法及应用场景,为相关人员提供了实践见解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态评测 16 篇

2608.03078 2026-08-05 cs.CV 新提交 87%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 多模态评测 :multimodal(title,abstract);MLLM(summary_cn);分类 cs.CV

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03791 2026-08-05 cs.AI 新提交 83%

Does Forgetting Transfer Across Modalities? A Real-World Benchmark for Cross-Modal Knowledge Unlearning Evaluation

遗忘能否跨模态迁移?面向跨模态知识遗忘评估的真实世界基准

Chunlin Liu, Junnian Chen, Haitong Jiang, Jianyu Zhao, Yingsen Pang, Jingchen Li, Jiabiao He, Youming Lu, Jinhe Bi, Yuntao Du

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文针对跨模态知识遗忘迁移研究缺口,推出UNLINK-VL基准,实验发现跨模态遗忘存在不对称性,纯文本遗忘迁移效果差,凸显跨模态遗忘与评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03782 2026-08-05 cs.AI 新提交 79%

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation

KnowHal:用于全面多模态幻觉评估的知识驱动基准

Ruihan Li, Jiyang Tan, Kailin Jiang, Huining Li, Hengyang Lu, Yu Huang, Qian Li, Yuntao Du

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLMs)的幻觉评估缺口,提出知识驱动的KnowHal基准,涵盖四个幻觉维度,经评估发现知识维度是模型最大挑战,多数模型对错误前提鲁棒性有限。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03187 2026-08-05 cs.NE 新提交 78%

NeuroMosaic: Anatomically Grounded Multimodal Large Language Modeling for Molecularly Aware Glioma Reasoning from 3D MRI and Clinical Narratives

NeuroMosaic:基于解剖学的多模态大语言模型,用于从3D MRI和临床叙事中进行分子感知的胶质瘤推理

Yantong Liu, Zheyu Zhang, Runpeng Liu, Mu Xitang, Seong-Yoon Shin, Hyun-Ae Lee

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 该研究针对多模态医疗大语言模型在神经肿瘤学中的结构缺陷,提出NeuroMosaic模型,通过多模块架构实现胶质瘤的准确推理,在多个数据集上取得优异性能,验证了解剖学索引路由机制的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07916 2026-08-05 cs.CV 版本更新 77%

Tarot-SAM3: Training-free SAM3 for Any Referring Expression Segmentation

Tarot-SAM3: 无需训练的SAM3用于任意指称表达分割

Weiming Zhang, Dingwen Xiao, Songyue Guo, Guangyu Xiang, Shiqi Wen, Minwei Zhao, Lei Chen, Lin Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学)

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 Tarot-SAM3通过引入推理辅助提示和自修复机制,实现对任意指称表达的高效分割,有效解决传统方法对长或隐含表达的处理难题。

Comments We need to make a huge revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03649 2026-08-05 cs.CV 新提交 74%

When Do Fewer Visual Tokens Accelerate Multimodal Inference? A Break-Even Study Across Decision Locations and Hardware

更少的视觉令牌何时能加速多模态推理?跨决策位置与硬件的盈亏平衡点研究

Hao Dou, Ruiwen Tian

专题命中 多模态评测 :multimodal(title);分类 cs.CV

AI总结 该研究通过可复现协议分析视觉令牌数量与多模态推理延迟的盈亏平衡点,发现视觉前路由在A100上的延迟优势超过视觉后策略的下游令牌减少量,且视觉后预测器的效果经校正后仍显著。

Comments 16 pages, 3 figures, 13 tables. Experiments use Qwen2.5-VL-3B-Instruct on RTX 3090 and A100 PCIe GPUs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02615 2026-08-05 cs.CL cs.AI 新提交 73%

OncoTriad-QA: A Patient-Level Radiology-Pathology-Genomics Benchmark for Pan-Cancer Reasoning

OncoTriad-QA:用于泛癌推理的患者级放射学-病理学-基因组学基准

Ahnaf Munir, Dannong Wang, Michael W. McDonald, Mubarak Shah, Pegah Khosravi, Yu Tian

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OncoTriad-QA多模态癌症问答基准及OncoVLM模型,实验显示OncoVLM经微调后在泛癌问答任务上优于现有模型,该基准可用于相关模型的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03817 2026-08-05 cs.CV cs.AI 新提交 62%

UHP Detection: LVLMs have their Unique Hallucination Pattern in the Consistency Space

UHP检测:大型视觉语言模型(LVLMs)在一致性空间中具有独特的幻觉模式

Amir Mohammad Ezzati, Kiyan Rezaee, Bardiya Kariminia, Mohamad Amin Yousefi, Asal Mohammadjafari Mamaqani, Behrad Samimi, Mohammad Hossein Rohban

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对LVLMs的幻觉问题,提出UHP检测框架,通过图像与文本扰动模态、陈述与否定逻辑极性构建四组一致性特征,训练分类器,在AMBER和PhD数据集上显著优于现有基线。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏