arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 13 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 13 篇

2608.16690 2026-08-18 cs.CV 新提交 91%

AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty

AnchorScore:一种基于CLIP的多模态大语言模型(MLLM)标注难度诊断方法

Yan Ma, Lizhuo Zhang

机构 * School of Foreign Studies, Changsha University of Science and Technology(长沙理工大学外国语学院) School of Education, Hunan Agricultural University(湖南农业大学教育学院) School of Information and Intelligence, Hunan Agricultural University(湖南农业大学信息与智能科学学院)

专题命中 图文多模态 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出基于CLIP的AnchorScore,可低成本预先对类别按MLLM标注难度排名,在课堂行为、动作识别等数据上与MLLM准确率相关性高,可用于混合路由、提示消歧等场景。

Comments 37 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15802 2026-08-18 cs.CV cs.LG 新提交 81%

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

PWLR:用于边界感知分布外检测的成对见证局部拒绝

Chengyao Jia, Ruixuan Wang

机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)

专题命中 图文多模态 :MLLM(summary_cn,abstract);分类 cs.CV

AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15056 2026-08-18 cs.AI 新提交 79%

GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG

GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由

Zafar Ali, Asad Khan, Aalia Malik, Pavlos Kefalas

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Aristotle University(亚里士多德大学) Dashub(达舒布)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 73%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.00971 2026-08-18 cs.CV cs.AI 版本更新 62%

MiniGPT-Reverse-Designing: Predicting Image Adjustments Utilizing MiniGPT-4

MiniGPT-反向设计:利用MiniGPT-4预测图像调整

Vahid Azizi, Fatemeh Koochaki

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过扩展和微调MiniGPT-4,使其可应用于给定源图像、编辑后图像及可选文本描述来预测图像编辑操作与参数的反向设计任务,验证了现成VLMs在复杂多模态任务中的可扩展性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17678 2026-08-18 cs.CV cs.AI 版本更新 62%

TIMA: Text-Image Mutual Awareness for Balancing Zero-Shot Adversarial Robustness and Generalization Ability

TIMA:用于平衡零样本对抗鲁棒性与泛化能力的文本-图像互感知框架

Fengji Ma, Hei Victor Cheng, Chenxing Li, Li Liu

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对CLIP等基础模型在零样本场景下难平衡对抗鲁棒性与泛化能力的问题,提出TIMA框架,通过TAI与IAT两个模块校准Logit间距、保留语义一致性,实验显示其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16263 2026-08-18 cs.CV 新提交 57%

Seeing Before Answering: Training-Free Visual Layer Profiling for Vision-Language Models

先见后答:面向视觉语言模型的无训练视觉层分析

Ruchen Liu, Yi Yang, Yiming Xu, Michael Ying Yang, Monika Sester, Bodo Rosenhahn

机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) University of Bath(巴斯大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。

Comments ECCVW'26 eXCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 57%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04484 2026-08-18 cs.CV 版本更新 57%

TrustCLIP: Learning Private Visual Features via Adversarial Reconstruction

TrustCLIP:通过对抗性重建学习隐私视觉特征

Nikos Athanasiou, Ilya A. Petrov, Angela Yao, Shugao Ma, Eric Sauser, Edoardo Remelli, Shreyas Hampali, Johannes Schönberger, Fadime Sener, Bugra Tekin

机构 * Meta Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) National University of Singapore(新加坡国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。

Comments this https URL (https://atnikos.github.io/trustclip/) Update affiliations

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12381 2026-08-18 cs.CV 版本更新 57%

Synthetic Image Detection with CLIP: Understanding and Assessing Predictive Cues

使用CLIP进行合成图像检测:理解和评估预测线索

Marco Willi, Melanie Mathys, Michael Graber

机构 * Institute for Data Science I4DS(数据科学研究所) University of Applied Sciences FHNW(应用科学大学) FHNW Brugg-Windisch AG(FHNW布吕克-温迪施公司)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出SynthCLIC数据集,通过分析CLIP-based检测器的学习机制,揭示其在合成图像检测中依赖于高级摄影属性而非生成器特定伪影,并强调了持续更新和广泛训练的重要性。

Comments 10 figures; 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15042 2026-08-18 cs.CV cs.LG 版本更新 57%

Comprehensive language-image pre-training for 3D medical image understanding

全面的语言-图像预训练用于3D医学图像理解

Tassilo Wald, Ibrahim Ethem Hamamci, Yuan Gao, Sam Bond-Taylor, Harshita Sharma, Maximilian Ilse, Cynthia Lo, Olesya Melnichenko, Anton Schwaighofer, Noel C. F. Codella, Maria Teodora Wetscherek, Klaus H. Maier-Hein, Panagiotis Korfiatis, Valentina Salvatelli, Javier Alvarez-Valle, Fernando Pérez-García

机构 * Microsoft(微软公司) German Cancer Research Center (DKFZ)(德国癌症研究中心) Department of Radiology, University of Cambridge and Cambridge University Hospitals NHS Foundation Trust(剑桥大学放射科及剑桥大学医院国家健康服务体系基金会信托) Pattern Analysis and Learning Group, Heidelberg University Hospital(海德堡大学医院模式分析与学习组) Department of Radiology, Mayo Clinic(梅奥诊所放射科)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 本文提出COLIPRI编码器,通过结合报告生成目标和视觉-only预训练,提升3D医学图像的语义理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16885 2026-08-18 cs.RO 新提交 50%

$τ_0$-VLA: a Hierarchical Robot Foundation Model with World-Model-Guided Test-Time Computation

$τ_0$-VLA:一种具有世界模型引导测试时计算能力的分层机器人基础模型

Xiaowei Cai, Yunuo Cai, Bingao Chen, Jingxiao Chen, Zhi Chen, Siyuan Feng, Tengyu Hou, Jingshun Huang, Han Jiang, Runkun Ju, Dong Li, Mingxiang Li, Shaowei Li, Xinchen Li, Yifan Li, Yi Liu, Zhongyuan Liu, Jianlan Luo, Junwen Miao, Ruiqi Ni, Buqing Nie, Mingjie Pan, Xinlin Ren, Jianheng Song, Jiaxu Wang, Peiqi Wang, Sen Wang, Xiaoyan Wang, Dafeng Wei, Dongming Wu, Pengwei Xie, Pu Yang, Hangjian Ye, Xiangyu Yue, Jinyu Zhang, Qinglin Zhang, Xueyong Zhao, Pengfei Zhou, Yue Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) Agibot Finch(智元 Finch(智元鹦鹉)) The Chinese University of Hong Kong(香港中文大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 $τ_0$-VLA是一种分层机器人基础模型,通过世界模型引导的测试时计算分配额外资源优化子任务生成,经40115小时异构真实数据训练后,可提升长时程机器人操作的闭环成功率。

Comments 18 pages, 5 figures. Project page: this https URL (https://tau0-vla.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15601 2026-08-18 cs.LG 新提交 50%

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

用于组合概念泛化的多阶段训练量子模型

Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

机构 * University College London(伦敦大学学院) University of Amsterdam(阿姆斯特丹大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 该研究针对多模态学习的组合概念泛化挑战,提出带多阶段训练的量子模型,在CLEVR数据集上验证其可提升分布外关系泛化能力且参数远少于经典基准。

详情

展开后加载摘要…

URL PDF HTML 收藏