arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-20 至 2026-08-20 共收录 70 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2510.09764 2026-08-20 cs.LG 版本更新 85%

Prototype-based Self-Supervised Multimodal Learning for PPG and Accelerometry Signals

基于原型的PPG与加速度计信号自监督多模态学习

Wanting Mao, Maxwell A Xu, Harish Haresamudram, Mithun Saha, Santosh Kumar, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Memphis(密苏里大学孟菲斯分校)

专题命中 图文多模态 :multimodal(title,abstract);multi-modal(abstract);cross-modal(abstract)

AI总结 针对PPG与加速度计等生物信号的多模态学习局限,提出基于原型的SSL框架ProtoMM,开发Pulse-Motion基础模型,性能优于现有对比式及多模态SSL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18465 2026-08-20 cs.HC cs.ET cs.IR 新提交 78%

Reducing Technician Search Burden: A Multimodal RAG for Cessna 172 Maintenance Manual

减轻技术人员的检索负担:面向赛斯纳172维护手册的多模态检索增强生成

Seongjun Ha, Md Rashedul Islam, Gaurav Nanda, Damon Lercel

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 本研究针对赛斯纳172维护手册,开发多模态检索增强生成流程,其多模态手册检索器召回率达93.37%,生成响应与基准答案语义相似度87.20%,可减轻技术人员检索负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18322 2026-08-20 cs.IR 新提交 78%

Multimedia Asset Personalization via Multimodal Embeddings at Netflix

Netflix 中通过多模态嵌入实现多媒体资产个性化

Emma Yanyang Kong, Aditya Deshpande, Bowei Yan, Asad Abbasi, Santiago Castro, Avneesh Saluja, David Fagnan, Ashish Rastogi

专题命中 图文多模态 :multimodal(title,abstract)

AI总结 Netflix 采用多模态嵌入技术,通过双塔模型结合 CLIP 嵌入、三模态基础模型 MediaFM 及离线代理任务,优化了美术图像和视频预览的个性化推荐,提升了冷启动性能与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18339 2026-08-20 cs.CV cs.AI cs.CL cs.LG 新提交 75%

From Inference to Adaptation: A Unified Optimal Transport View of Vision Language Model

从推理到适应:视觉语言模型的统一最优传输视角

Qi Yu, Zhichen Zeng, Katherine Tieu, Xiyuan Yang, Ruizhong Qiu, Yuchen Yan, Lihui Liu, Yanjun Zhao, Lingjie Chen, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Wayne State University(韦恩州立大学)

专题命中 图文多模态 :cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究提出名为algname的VLM测试时适应方法,通过Wasserstein最优传输统一VLM的推理与适应目标,实验显示其性能较最优方法提升7%且效率先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-08-20 cs.CV cs.MM 版本更新 73%

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18628 2026-08-20 cs.CV cs.CL 新提交 62%

When Safety Overrides Vision: Exploring Dynamics between Vision Influence and Safety Alignment in Vision-Language Models

当安全覆盖视觉时:探索视觉语言模型中视觉影响与安全对齐之间的动态关系

Mehak Gupta, Tanmoy Chakraborty

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究探究对齐视觉语言模型中安全诱导弃权的内部解码动态,发现安全对齐未抑制感知接地,抑制拒绝相关表征可恢复接地回答,揭示了其一种新的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 62%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09253 2026-08-20 cs.CV cs.LG cs.MM 版本更新 62%

On the Robustness of Vision-Language Models in Zero-shot Privacy Classification

零样本隐私分类中视觉语言模型的鲁棒性研究

Alina Elena Baia, Alessio Xompero, Andrea Cavallaro

机构 * Idiap Research Institute(Idiap研究机构) Queen Mary University of London(伦敦女王学院) EPFL(瑞士联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本研究分析零样本设置下视觉语言模型(VLMs)用于图像隐私分类的可靠性,对比三类开源VLMs与专用模型的性能,发现VLMs鲁棒但精度低、速度慢,凸显专用隐私分类模型的优势。

Comments 15 pages, 6 figures, 3 tables. Paper accepted at the TrustDOC Workshop at ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 6 篇

2604.09110 2026-08-20 cs.MM 版本更新 83%

Generalizing Video DeepFake Detection by Self-generated Audio-Visual Pseudo-Fakes

通过自动生成的音频视觉伪假来泛化视频深度伪造检测

Zihe Wei, Yuezun Li

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出AVPF方法,通过自动生成多样化的音频视觉伪假样本提升模型泛化能力,实验显示在多个标准数据集上平均性能提升达7.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18401 2026-08-20 cs.HC cs.CL cs.RO 新提交 80%

Multimodal Rapport Estimation in Real-World HRI

现实世界人机交互(HRI)中的多模态融洽度估计

Akihiro Sakuramoto, Takato Hayashi, Ryo Miyoshi, Yuki Okafuji, Shogo Okada

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 本研究针对现实世界人机交互的融洽度估计问题,采用日本药店的62个多模态会话,对比零样本LLMs等模型,发现Gemini融合模型表现最优,且性能随互动时长、群体规模变化。

Comments 9 pages, 4 figures, 3 tables. Accepted at the 28th ACM International Conference on Multimodal Interaction (ICMI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00735 2026-08-20 cs.CR cs.AI cs.SE 版本更新 79%

`From Prompt to Perturbation': An Adaptive Framework for Voice-Based Jailbreaks on Audio LLMs

从提示到扰动:针对音频大语言模型的自适应语音越狱框架

Linghan Huang, Bo Li, Huaming Chen, Kim-Kwang Raymond Choo

机构 * School of Electrical and Computer Engineering, The University of Sydney(悉尼大学电气与计算机工程学院) University of Chicago(芝加哥大学) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 针对现有音频越狱攻击研究仅聚焦单一范式的不足,提出自适应越狱框架,可在统一设置下评估级联流水线和LALM,实验显示其攻击成功率优于现有方法。

Comments Accepted at the IEEE International Conference on Data Mining (ICDM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02782 2026-08-20 cs.AI cs.CL eess.AS 版本更新 78%

When Audio-Language Models Fail to Leverage Multimodal Context for Dysarthric Speech Recognition

音频-语言模型在利用多模态上下文进行构音障碍语音识别时的失效问题

Pehuén Moure, Niclas Pokel, Bilal Bounajma, Yingqiang Gao, Roman Boehringer, Longbiao Cheng, Shih-Chii Liu

专题命中 音频语音多模态 :multimodal(title);分类 cs.CL、cs.AI、eess.AS

AI总结 该研究构建基于SAP数据集的基准,发现现有音频-语言模型无法有效利用构音障碍语音的临床上下文,而LoRA适配方法可将WER降低52%,为包容性ASR提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18080 2026-08-20 cs.AI 新提交 61%

Large Language Models in Mental Health: A Systematic Review of Applications, Innovations, and Ethical Challenges

心理健康领域的大语言模型:应用、创新与伦理挑战的系统综述

Yisong Chen, Yifan Gao, Sijing Yu, Chuqing Zhao, Yang Lu

专题命中 音频语音多模态 :multimodal(abstract,comments);分类 cs.AI

AI总结 该系统综述梳理了大语言模型在心理健康领域的多类应用、技术创新,同时探讨了其面临的伦理与监管挑战,并倡导建立保障其安全公平部署的框架。

Comments Systematic review. Published in Journal of Industrial Integration and Management (2025). Applications of large language models in mental health, including social media analysis, clinical conversational agents, therapy support tools, multimodal learning, and ethical considerations

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18226 2026-08-20 cs.SD 新提交 50%

FM Synthesizer Audio-Parameter Shared Embeddings

FM合成器音频参数共享嵌入

David Braun, Adam Finkelstein

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 针对合成器预设检索问题,本文设计模仿FM信号处理的图神经网络学习含信号路由的参数表征,结合SLAP多模态目标学习音频与FM合成器参数的联合嵌入,在Yamaha DX7数据集上验证了方法的有效性与泛化性。

Comments Accepted to DAFx 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 4 篇

2608.15905 2026-08-20 cs.CV cs.MM 版本更新 81%

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

CLARA:基于VLM衍生理由的片段级多模态对齐用于仇恨视频检测

Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

机构 * Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所) University of Exeter(埃克塞特大学) Queen Mary University of London(伦敦大学玛丽皇后学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本研究提出CLARA框架,以片段级多模态对齐结合VLM衍生理由,在三个仇恨视频数据集上实现了优于现有最优方法的仇恨视频检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18671 2026-08-20 cs.CV 新提交 70%

Vision-Language Models for Egocentric Video: From Hand-Object Interaction to Embodied AI

用于第一人称视角视频的视觉-语言模型:从手-物交互到具身智能

Mohammad Zamani, Fatemeh Ziaeetabar

机构 * University of Tehran(德黑兰大学)

专题命中 视频多模态 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本综述梳理了用于第一人称视角视频理解的视觉-语言模型的发展,分析其挑战、研究方向与局限,明确了可部署具身智能的关键优先方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09874 2026-08-20 cs.CV cs.AI cs.CL 版本更新 67%

EgoMemReason: A Memory-Driven Reasoning Benchmark for Long-Horizon Egocentric Video Understanding

EgoMemReason:一种基于记忆的推理基准,用于长时间的以自身为中心的视频理解

Ziyang Wang, Yue Zhang, Shoubin Yu, Ce Zhang, Zengqi Zhao, Jaehong Yoon, Hyunji Lee, Gedas Bertasius, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 EgoMemReason通过记忆驱动推理评估一周的自身中心视频理解,包含500个问题和六个核心挑战,揭示长时间记忆仍面临挑战。

Comments Accepted by COLM2026. The first two authors contributed equally. Project website: this https URL (https://egomemreason.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18386 2026-08-20 cs.CV cs.AI 新提交 62%

TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs

TTSD-FAR:用于大视频语言模型中缺失模态情感识别的带Fisher锚定恢复的测试时自蒸馏

Muhammad Haseeb Aslam, Alessandro Koerich, Marco Pedersoli, Ali Etemad, Eric Granger

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对大视频语言模型测试时的模态缺失问题,提出带Fisher锚定恢复的测试时自蒸馏框架,在多数据集模态缺失场景下性能优于基线方法且保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 5 篇

2608.18504 2026-08-20 cs.AI 新提交 85%

UMER: Unifying Embedding and Ranking via Pair-Aware Discriminative Reasoning for Universal Multimodal Retrieval

UMER:通过感知对的判别推理统一嵌入与排序以实现通用多模态检索

Libiao Chen, Xiyang Liu, Yanheng Wei, Tao Wang, Zhenyu Tang

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对通用多模态检索的需求,提出UMER框架,通过感知对的判别推理联合学习对比式嵌入与判别式排序,在MMEB-V2基准上实现最优性能且支持可调整预算的推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18895 2026-08-20 cs.DL cs.MM 新提交 79%

MediaGraph: A Content-Aware Data Model and Query Framework for Multimodal Knowledge Graphs

MediaGraph:面向多模态知识图谱的内容感知数据模型与查询框架

Florian Ruosch, Luca Rossetto

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 该研究提出MediaGraph数据模型及开源原型MeGraS,将多媒体内容作为图谱节点,扩展SPARQL实现多模态数据的存储、查询,推动内容感知多模态知识图谱发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12627 2026-08-20 cs.CV cs.AI cs.CL cs.HC 版本更新 67%

EgoCITE: Context-Augmented Indexing and Time-Aware Retrieval for Long-Horizon Egocentric Memory

EgoCITE:面向长时程自我中心记忆的上下文增强索引与时序感知检索

Le Zhang, Hao Chen, Vlad Roznyatovskiy, Jianzhong Zhang, Ke Sun

机构 * University of Michigan(密歇根大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本研究针对长时程自我中心记忆系统的索引不可靠、忽略时序意图的问题,提出EgoCITE框架,经多数据集评估,其准确率优于基线且成本显著低于长上下文LLM智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12746 2026-08-20 cs.CV cs.CL 版本更新 62%

Dual-Stream Cross-Anchor Correction Grounding Long-Form Captions and the Domain Limits of Object-Level Anchors

双流跨锚校正:接地长文本描述与对象级锚点的域限制

Lingkai Bu, Qian Gao, Jun Fan, Guohui Ding, Zhenyu Yang, Yuteng Xiao, Jinyi Liang

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型的长文本描述对象幻觉问题,本文提出双流跨锚校正方法,通过耦合感知流与认知流提升精度,在长文本场景下实现最优性能,且存在域条件性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18521 2026-08-20 cs.AI cs.LG 新提交 57%

Which Negatives Matter? Ask Your Text Encoder: Adaptive Similarity Margins for Dense-Caption Retrieval

哪些负样本重要?询问你的文本编码器:用于密集字幕检索的自适应相似度间隔

Haoyue Liu, Ye Chen, Zhichao Wang, Xiaoying Tang

机构 * Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.AI

AI总结 该研究针对密集字幕检索中InfoNCE目标函数过早饱和的问题,提出HN-CLIP方法,通过文本编码器的文本-文本几何构建自适应相似度间隔,在四个基准上提升R@1,且训练速度更快,仅用20%数据即可达最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 6 篇

2608.18937 2026-08-20 cs.CL cs.AI 新提交 81%

MedUAG: Unified Understanding and Generation for Medical Multimodal Models

MedUAG:面向医学多模态模型的统一理解与生成框架

Zijie Meng, Yuncheng Zhang, Hualiang Wang, Yitian Tang, Xiaotang Gai, Chen Shen, Songtao Jiang, Shaosheng Cao, Jian Wu, Xian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) Tencent Jarvis Lab(腾讯Jarvis实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 针对医学多模态领域缺乏统一理解生成框架的问题,本文构建了MedUAGCorpus数据集与MedUAGBench基准,开发了MedUAG模型,其在医学理解与生成任务中表现出色,为下一代医学多模态系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19116 2026-08-20 cond-mat.mtrl-sci 新提交 78%

JANUS: A Multi-modal Foundation Neural Sampler for Disordered Materials

JANUS:面向无序材料的多模态基础神经采样器

Denis Blessing, Mouyang Cheng, Maximilian Schebek, Jutta Rogal, Mingda Li, Carles Domingo-Enrich, Yuanqi Du

专题命中 多模态生成 :multi-modal(title);multimodal(abstract)

AI总结 研究人员开发JANUS多模态神经采样器,用于无序材料的热力学采样,其以远少于传统方法的能量评估次数重现平衡性质,可用于合金逆设计及半导体缺陷探索,为相关研究提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06722 2026-08-20 cs.HC 版本更新 75%

CustomDance: Customized 3D Dance Generation with Coarse-to-Fine Human-Centered Interactive Control

CustomDance:基于以人为中心的粗到细交互式控制的定制化3D舞蹈生成

Xulong Tang, Kaixing Yang, Xiaohu Guo, Prabhakaran Balakrishnan, Rawan Alghofaili

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract)

AI总结 CustomDance是基于粗到细交互式控制的定制化3D舞蹈生成系统,通过三阶段流程实现AI辅助编舞,在定量和定性比较中优于基线,为用户提供全面控制。

Comments Accepted to SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18279 2026-08-20 physics.optics cs.LG 新提交 67%

A Comprehensive Review of Large Language Models for Nanophotonics: From Surrogate Modeling to Autonomous Design

面向纳米光子学的大语言模型综合综述:从代理建模到自主设计

Huanshu Zhang, Kegeng Tang, Lei Kang, Sawyer D. Campbell, Zihao Wang, Douglas H. Werner

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。

Comments Accepted for publication in Advanced Photonics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19013 2026-08-20 cs.LG cs.AI 新提交 57%

Harness Continual Learning: Continual Adaptation Beyond Model Parameters

利用工具链持续学习:超越模型参数的持续适应

Borui Kang, Jinrui Gu, Junhan Lv, Wenbin Li, Lei Wang, Yang Gao

机构 * University of Wollongong(卧龙岗大学) Nanjing University(南京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19067 2026-08-20 stat.ML cs.LG math.ST 新提交 50%

Diffusion Models for High-Dimensional Clustered Data: Intrinsic-Dimension Adaptivity via Bayesian Classification

用于高维聚类数据的扩散模型:通过贝叶斯分类实现本征维度适应性

Yuga Iguchi, Paul Fearnhead

专题命中 多模态生成 :multimodal(abstract)

AI总结 该研究将扩散模型理论与多模态高维聚类数据几何结合,通过K混合高斯框架证明其去噪可作为动态贝叶斯分类器,KL误差界线性依赖聚类最大本征维度,实现了本征维度适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 19 篇

2608.04759 2026-08-20 cs.CV cs.CL 版本更新 86%

Trace, Verify, and Correct: A Training-Free Framework for Spatial Reasoning in Multimodal LLMs

追踪、验证与修正:一种用于多模态大语言模型空间推理的无训练框架

Yang Yang, Jiawei Chen, Tairan Chen, Zhaoxia Yin

机构 * East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 多模态评测 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型空间推理的错误传播问题,提出无训练的追踪-验证-修正框架,构建空间证据图并评估证据可靠性,在15种模型-数据集设置下平均准确率达68.94%,优于基线。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏