arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 165 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态评测 33 篇

2604.07413 2026-04-14 cs.CV cs.AI cs.LG 81%

FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios

FORGE:面向制造场景的细粒度多模态评估

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang, Xikun Zhang, Chao Zhang, Guanzhi Deng, Alex Xue, Juan Du, Tianshu Yu, Garth Tarr, Linqi Song, Qiuzhuang Sun, Dacheng Tao

机构 * University of Waterloo(滑铁卢大学) University of Sydney(悉尼大学) Singapore Management University(新加坡管理大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hunan University(湖南大学) Nanyang Technological University(南洋理工大学) Royal Melbourne Institute of Technology(皇家墨尔本理工大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) City University of Hong Kong Shenzhen Research Institute(香港城市大学深圳研究院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FORGE,构建高质量多模态数据集并评估18种先进MLLM在制造任务中的表现,揭示领域知识不足是主要瓶颈,展示结构化标注可提升模型精度。

Comments Project Page:https://ai4manufacturing.github.io/forge-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14629 2026-04-14 cs.CV cs.CL 81%

VisText-Mosquito: A Unified Multimodal Dataset for Visual Detection, Segmentation, and Textual Explanation on Mosquito Breeding Sites

VisText-Mosquito:一种统一的多模态数据集,用于蚊虫繁殖地的视觉检测、分割和文本解释

Md. Adnanul Islam, Md. Faiyaz Abdullah Sayeedi, Md. Asaduzzaman Shuvo, Shahanur Rahman Bappy, Md Asiful Islam, Swakkhar Shatabda

机构 * United International University, Bangladesh(孟加拉国联合国际大学) University of Arizona, USA(美国亚利桑那大学) BRAC University, Bangladesh(孟加拉国布拉卡大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出VisText-Mosquito数据集,整合视觉和文本数据以支持自动化检测、分割和解释,通过YOLOv9s和YOLOv11n-Seg模型实现高精度检测与分割,并利用大视觉语言模型生成文本解释,强调预防胜于治疗的主题。

Comments Accepted at CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11709 2026-04-14 cs.AI 79%

A Mamba-Based Multimodal Network for Multiscale Blast-Induced Rapid Structural Damage Assessment

基于Mamba的多模态网络用于多尺度爆炸诱导快速结构损伤评估

Wanli Ma, Sivasakthy Selvakumaran, Dain G. Farrimond, Adam A. Dennis, Samuel E. Rigby

机构 * School of Mechanical, Aerospace

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出基于Mamba的多模态网络,整合多尺度爆炸载荷信息与光学遥感图像,提升爆炸后结构损伤评估的准确性和速度,通过2020年贝鲁特爆炸案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11307 2026-04-14 cs.AI 79%

PaperScope: A Multi-Modal Multi-Document Benchmark for Agentic Deep Research Across Massive Scientific Papers

PaperScope:一种多模态多文档基准,用于跨大规模科学论文的智能深度研究

Lei Xiong, Huaying Yuan, Zheng Liu, Zhao Cao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.AI

AI总结 PaperScope提出一个多模态多文档基准,用于评估智能深度研究能力,包含2000多个跨领域问题,验证了现有系统在长上下文检索和多源推理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09249 2026-04-14 cs.CV cs.IR 79%

FashionStylist: An Expert Knowledge-enhanced Multimodal Dataset for Fashion Understanding

FashionStylist: 一个增强专家知识的多模态数据集用于时尚理解

Kaidong Feng, Zhuoxuan Huang, Huizhong Guo, Yuting Jin, Xinyu Chen, Yue Liang, Yifei Gai, Li Zhou, Yunshan Ma, Zhu Sun

机构 * Yanshan University(燕山大学) Central South University(中南大学) Zhejiang University(浙江大学) Southwest University(西南大学) Singapore Management University(新加坡管理大学) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 多模态评测 :multimodal(title);MLLM(abstract);分类 cs.CV

AI总结 本文提出FashionStylist,一个专家标注的多任务时尚理解基准,支持服装到物品定位、服装补全和评估任务,提升多模态时尚系统的语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18073 2026-04-14 cs.CV 79%

FPBench: A Comprehensive Benchmark of Multimodal Large Language Models for Fingerprint Analysis

FPBench: 多模态大语言模型在指纹分析中的综合基准测试

Ekta Gavas, Sudipta Banerjee, Chinmay Hegde, Nasir Memon

机构 * New York University(纽约大学) University of Wyoming(怀俄明大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出FPBench基准测试,评估20种多模态大语言模型在7个真实和合成数据集上的8项生物识别任务,发现微调视觉和语言编码器可提升性能7%-39%。

Comments Revised version with additional experiments and code release

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21998 2026-04-14 cs.CV 79%

Can Multi-Modal LLMs Provide Live Step-by-Step Task Guidance?

多模态大语言模型能否提供实时逐步任务指导?

Apratim Bhattacharyya, Bicheng Xu, Sanjay Haresh, Reza Pourreza, Litian Liu, Sunny Panchal, Pulkit Madan, Leonid Sigal, Roland Memisevic

机构 * Qualcomm AI Research(高通人工智能研究院) University of British Columbia(不列颠哥伦比亚大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Qualcomm Interactive Cooking基准和数据集,用于评估多模态大语言模型在实时任务指导中的能力,引入LiveMamba作为新的基线模型。

Comments Accepted to NeurIPS 2025 (Project page: https://apratimbh.github.io/livecook)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09596 2026-04-14 cs.AI cs.MA 79%

DERM-3R: A Resource-Efficient Multimodal Agents Framework for Dermatologic Diagnosis and Treatment in Real-World Clinical Settings

DERM-3R:一种资源高效的多模态代理框架,用于皮肤病诊断和治疗的现实世界临床应用

Ziwen Chen, Zhendong Wang, Chongjing Wang, Yurui Dong, Luozhijie Jin, Jihao Gu, Kui Chen, Jiaxi Yang, Bingjie Lu, Zhou Zhang, Jirui Dai, Changyong Luo, Xiameng Gai, Haibing Lan, Zhi Liu

机构 * School of Pharmacy, Nanjing University of Chinese Medicine(南京中医药大学药学院) Department of Dermatology, the Gulou Hospital of Traditional Chinese Medicine of Beijing(北京鼓楼中医医院皮肤科) Infectious disease department, Dongfang Hospital, Beijing University of Chinese Medicine(北京中医药大学东方医院感染科) College of Art and Science, university of Washington(华盛顿大学文理学院) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Fudan Unversity(复旦大学) Zhejiang Lab(之江实验室) University College London(伦敦大学学院) Department of Dermatology, Inner Mongolia Hospital of Traditional Chinese Medicine(内蒙古自治区中医医院皮肤科) International Campus of Zhejiang University(浙江大学国际校区)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出DERM-3R框架,通过三个协作代理解决皮肤病诊断中的细粒度病变识别、多视角病变表示和综合推理问题,展示了其在资源受限下的高效性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05005 2026-04-14 cs.CY cs.AI cs.CL 76%

EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content

EduIllustrate:迈向可扩展的自动多模态教育内容生成

Shuzhen Bi, Mingzi Zhang, Zhuoxuan Li, Xiaolong Wang, Keqian Li, Aimin Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CL、cs.AI

AI总结 本文提出EduIllustrate基准,用于评估LLM在K-12 STEM问题中生成图文结合解释的能力,通过230道题和8维度评估标准,揭示LLM在视觉一致性与成本效率上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09569 2026-04-14 cs.HC 71%

Automatic Mind Wandering Detection in Educational Settings: A Systematic Review and Multimodal Benchmarking

教育场景中的自动思维游离检测:系统综述与多模态基准评估

Anna Bodonhelyi, Augustin Curinier, Babette Bühler, Gerrit Anders, Lisa Rausch, Markus Huff, Ulrich Trautwein, Ralph Ewerth, Peter Gerjets, Enkelejda Kasneci

专题命中 多模态评测 :multimodal(title)

AI总结 本文通过系统综述和多模态基准评估,探讨教育环境中思维游离检测的方法与挑战,评估14种数据集中的EEG、面部视频、眼动追踪和生理信号等多模态数据的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07765 2026-04-14 cs.CV 70%

RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs

RemoteAgent: 通过基于强化学习的代理多模态大语言模型弥合模糊人类意图与遥感观测之间的鸿沟

Liang Yao, Shengxiang Xu, Fan Liu, Chuanyi Zhang, Bishun Yao, Rui Min, Yongjun Li, Chaoqian Ouyang, Shimin Di, Min-Ling Zhang

机构 * Hohai University(河海大学) Southeast University(东南大学) Sun Yat-sen University(中山大学)

专题命中 多模态评测 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出RemoteAgent框架,通过VagueEO数据集和强化学习微调,使多模态大语言模型能直接解决图像和稀疏区域任务,并通过模型上下文协议智能协调专用工具进行密集预测,提升遥感任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09649 2026-04-14 cs.HC cs.AI eess.SP 70%

WearBCI Dataset: Understanding and Benchmarking Real-World Wearable Brain-Computer Interfaces Signals

WearBCI 数据集:理解和评估真实世界可穿戴脑机接口信号

Haoxian Liu, Hengle Jiang, Lanxuan Hong, Xiaomin Ouyang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出WearBCI数据集,通过同步多模态记录和系统性评估,研究运动伪影对可穿戴BCI信号的影响,并探索跨模态信号增强和多维行为理解的新应用。

Comments Accepted by Sensys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17012 2026-04-14 cs.CV cs.AI 62%

SpatialScore: Towards Comprehensive Evaluation for Spatial Intelligence

SpatialScore:迈向空间智能的综合评估

Haoning Wu, Xiao Huang, Yaohui Chen, Ya Zhang, Yanfeng Wang, Weidi Xie

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialScore,首个全面评估多模态空间智能的基准,评估49个模型发现其在空间理解上存在显著差距,并构建了SpatialCorpus和SpatialAgent提升模型性能。

Comments Accepted by CVPR 2026 (Highlight); Project Page: https://haoningwu3639.github.io/SpatialScore

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11004 2026-04-14 cs.CV cs.AI cs.LG 62%

Panoptic Pairwise Distortion Graph

全景成对失真图

Muhammad Kamran Janjua, Abdul Wahab, Bahador Rashidi

机构 * Huawei Technologies(华为技术有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出全景成对失真图任务,通过区域结构化组成图像对,改进现有方法对整体图像分析的局限性,构建PandaSet数据集、PandaBench基准和Panda架构,揭示多模态大语言模型在区域级失真理解上的不足。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10666 2026-04-14 cs.CV cs.CL cs.LG 62%

Omnimodal Dataset Distillation via High-order Proxy Alignment

通过高阶代理对齐实现多模态数据集蒸馏

Yuxuan Gao, Xiaohao Liu, Xiaobo Xia, Tongliang Liu

机构 * University of Science and Technology of China(中国科学技术大学) Xidian University(西安电子科技大学) National University of Singapore(新加坡国立大学) The University of Sydney(悉尼大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出HoPA方法,通过紧凑代理捕捉高阶跨模态对齐,解决多模态数据集蒸馏中的异质性和复杂跨模态交互问题,实现可扩展的联合蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10485 2026-04-14 cs.CV cs.AI 62%

UDAPose: Unsupervised Domain Adaptation for Low-Light Human Pose Estimation

UDAPose:无监督领域适应用于低光人类姿态估计

Haopeng Chen, Yihao Ai, Kabeen Kim, Robby T. Tan, Yixin Chen, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Duksung Women’s University(德成女子大学) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UDAPose提出了一种新的框架,通过合成低光图像并动态融合视觉线索与姿态先验,提升低光环境下的人体姿态估计性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09876 2026-04-14 cs.LG cs.AI cs.CV cs.HC 62%

Efficient Personalization of Generative User Interfaces

高效生成用户界面的个性化

Yi-Hao Peng, Samarth Das, Jeffrey P. Bigham, Jason Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Purdue University(普渡大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了生成用户界面个性化难题,提出基于历史设计师偏好样本的高效方法,在技术评估中优于预训练模型,并能生成更多用户偏好界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11653 2026-04-14 cs.CV 57%

GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays

GazeVaLM:一个多观察者眼动基准测试,用于评估AI生成X光片的临床真实性

David Wong, Zeynep Isik, Bin Wang, Marouane Tliba, Gorkem Durak, Elif Keles, Halil Ertugrul Aktas, Aladine Chetouani, Cagdas Topel, Nicolo Gennaro, Camila Lopes Vendrami, Tugce Agirlar Trabzonlu, Amir Ali Rahsepar, Laetitia Perronne, Matthew Antalek, Onural Ozturk, Gokcan Okur, Andrew C. Gordon, Ayis Pyrros, Frank H. Miller, Amir Borhani, Hatice Savas, Eric Hart, Elizabeth Krupinski, Ulas Bagci

机构 * Northwestern University(西北大学) Loyola University Chicago(洛约拉大学芝加哥分校) DuPage Medical Group(杜佩奇医疗集团) Emory University(埃默里大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 GazeVaLM通过眼动数据和临床标签,评估AI生成X光片的临床真实性,对比人类专家与LLM的诊断准确性。

Comments This work appears in ACM ETRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11579 2026-04-14 cs.CV 57%

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

透过触觉:基于触觉驱动的材料区域视觉定位

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Hankuk University of Foreign Studies(韩国外国语大学) Ulsan National Institute of Science and Technology(蔚山科学技术院)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出通过密集跨模态特征交互学习局部视觉-触觉对齐,生成触觉条件下的材料分割热图,提升材料区域视觉定位的鲁棒性和多样性。

Comments CVPR 2026. Project page: https://mm.kaist.ac.kr/projects/SeeingThroughTouch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11258 2026-04-14 cs.CL 57%

Dialectic-Med: Mitigating Diagnostic Hallucinations via Counterfactual Adversarial Multi-Agent Debate

辩证-调解:通过反事实对抗多智能体辩论缓解诊断幻觉

Zhixiang Lu, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Dialectic-Med框架,通过多智能体对抗辩论机制缓解医疗多模态大语言模型的诊断幻觉问题,提升推理可信度和解释忠实度。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03926 2026-04-14 cs.CL 57%

Doc-PP: Document Policy Preservation Benchmark for Large Vision-Language Models

Doc-PP:大型视觉-语言模型文档政策保护基准

Haeun Jang, Hwan Chang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Doc-PP基准,用于评估大型视觉-语言模型在严格非披露政策下对文档的理解能力,揭示了推理诱导的安全差距,并提出DVA框架提升政策合规性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10787 2026-04-14 cs.CL 57%

When Meaning Isn't Literal: Exploring Idiomatic Meaning Across Languages and Modalities

当意义不再字面化:探索跨语言和模态的隐喻意义

Sarmistha Das, Shreyas Guha, Suvrayan Bandyopadhyay, Salisa Phosit, Kitsuchart Pasupa, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院巴特那分校) King Mongkut's Institute of Technology Ladkrabang(国王科技大学拉卡邦分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本文提出Mediom多语言多模态隐喻语料库及HIDE框架,通过系统性测试揭示语言模型在隐喻理解上的缺陷,并为下一代AI系统提供文化根基的隐喻理解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10039 2026-04-14 cs.CV 57%

Counting to Four is still a Chore for VLMs

为VLMs计数仍是一项苦差事

Duy Le Dinh Anh, Patrick Amadeus Irawan, Tuan Van Vo

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过行为和机制分析研究VLMs的计数行为,提出COUNTINGTRICKS评估套件,揭示模型在不同布局和对抗提示下的漏洞,并验证Modality Attention Share方法能缓解计数失败问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10009 2026-04-14 cs.LG cs.CV cs.RO 57%

Towards Multi-Source Domain Generalization for Sleep Staging with Noisy Labels

面向噪声标签的多源领域泛化睡眠分期研究

Kening Wang, Di Wen, Yufan Chen, Ruiping Liu, Junwei Zheng, Jiale Wei, Kailun Yang, Rainer Stiefelhagen, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ETH Zurich(苏黎世联邦理工学院) Hunan University(湖南大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FF-TRUST框架,通过联合时间-频率早期学习正则化提升噪声标签下的睡眠分期鲁棒性,实验显示在多个数据集上取得最佳性能。

Comments The benchmark and code will be made publicly available at https://github.com/KNWang970918/FF-TRUST.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06993 2026-04-14 cs.CV 57%

Can Textual Reasoning Improve the Performance of MLLMs on Fine-grained Visual Classification?

文本推理能否提升多模态大语言模型在细粒度视觉分类中的性能?

Jie Zhu, Yiyang Su, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文研究了文本推理对细粒度视觉分类任务的影响,发现推理长度过长会降低分类准确率,提出MRN和ReFine-RFT方法提升性能。

Comments CVPR Finding, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11178 2026-04-14 q-bio.NC cs.LG 50%

Probabilistic Prediction of Neural Dynamics via Autoregressive Flow Matching

通过自回归流匹配进行神经动态的概率预测

Nicole Rogalla, Yuzhen Qin, Mario Senden, Ahmed El-Gazzar, Marcel van Gerven

机构 * Department of Machine Learning and Neural Computing, Donders Institute for Brain, Cognition and Behaviour, Radboud University, Nijmegen, the Netherlands(荷兰奈梅亨拉德堡德大学唐德斯脑、认知与行为研究所机器学习和神经计算系) Department of Cognitive Neuroscience, Maastricht University, Maastricht, the Netherlands(荷兰马斯特里赫特大学认知神经科学系) Maastricht Brain Imaging Center, Maastricht University, Maastricht, the Netherlands(荷兰马斯特里赫特大学马斯特里赫特脑成像中心)

专题命中 多模态评测 :multimodal(abstract)

AI总结 本文提出基于自回归流匹配的生成预测框架,用于建模神经动态,通过多模态感觉输入预测短期血氧水平依赖(BOLD)活动,展示出改进的泛化能力和广泛皮层预测性能。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态Agent 11 篇

2504.07148 2026-04-14 eess.IV 82%

Q-Agent: Quality-Driven Chain-of-Thought Image Restoration Agent through Robust Multimodal Large Language Model

Q-Agent:通过鲁棒多模态大语言模型实现质量驱动的推理图像修复代理

Yingjie Zhou, Jiezhang Cao, Farong Wen, Zicheng Zhang, Yu Zhou, Yue Shi, Xiaohong Liu, Radu Timofte, Luc Van Gool, Guangtao Zhai

专题命中 多模态Agent :multimodal(title,abstract);MLLM(abstract)

AI总结 本文提出Q-Agent,通过Chain-of-Thought方法提升图像修复性能,结合鲁棒多模态大语言模型和客观图像质量评估,实现更高效的多退化处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09712 2026-04-14 cs.CV cs.AI 81%

LAST: Leveraging Tools as Hints to Enhance Spatial Reasoning for Multimodal Large Language Models

LAST:利用工具作为提示以增强多模态大语言模型的空间推理能力

Shi-Yu Tian, Zhi Zhou, Kun-Yang Yu, Ming Yang, Yang Chen, Ziqiao Shang, Lan-Zhe Guo, Yu-Feng Li

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 LAST通过整合专用视觉模型,解决多模态大语言模型在复杂几何布局解析中的幻觉和不精确问题,提出统一框架提升空间推理能力。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10501 2026-04-14 cs.CR 78%

MuSimA: A Tool with Multi-modal Input for Generating Bespoke ABAC Datasets

MuSimA:一种支持多模输入的生成定制ABAC数据集的工具

Saket Jha, Karthikeya S. M. Yelisetty, Singabattu Sathya, Shamik Sural

专题命中 多模态Agent :multi-modal(title,abstract)

AI总结 本文提出MuSimA工具,支持多模输入生成定制ABAC数据集,利用大语言模型自动提取分布参数,用于测试ABAC系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17188 2026-04-14 cs.AI 74%

PosterGen: Aesthetic-Aware Multi-Modal Paper-to-Poster Generation via Multi-Agent LLMs

PosterGen:基于多智能体LLM的美观化论文到海报生成

Zhilin Zhang, Xiang Zhang, Jiaqi Wei, Yiwei Xu, Chenyu You

机构 * Stony Brook University(石溪大学) New York University(纽约大学) University of British Columbia(不列颠哥伦比亚大学) Zhejiang University(浙江大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 多模态Agent :multi-modal(title);分类 cs.AI

AI总结 PosterGen通过多智能体LLM实现论文到海报的美观化生成,包含四个协作专业代理,提升设计质量和视觉吸引力。

Comments Project Website: https://Y-Research-SBU.github.io/PosterGen

详情

展开后加载摘要…

URL PDF HTML 收藏