arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-04 至 2026-05-04 共收录 47 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2605.00733 2026-05-04 cs.NI cs.AI cs.LG cs.MM 86%

EASE: Federated Multimodal Unlearning via Entanglement-Aware Anchor Closure

EASE: 通过纠缠感知锚闭合实现联邦多模态去学习

Zihao Ding, Beining Wu, Jun Huang

机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI、cs.MM

AI总结 本文提出EASE框架,通过闭合三个锚通道解决联邦多模态学习中的遗忘知识纠缠问题,采用余弦-正弦分解和方向选择性遗忘锁等方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00326 2026-05-04 cs.CL cs.CV 62%

Prompt-Induced Score Variance in Zero-Shot Binary Vision-Language Safety Classification

零样本二元视觉语言安全分类中的提示诱导分数方差

Charles Weng, Dingwen Li, Alexander Martin

机构 * Johns Hopkins University(约翰霍普金斯大学) Independent(独立)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 研究发现零样本视觉语言模型安全分类器的单提示首词概率在语义等价提示改写下不可靠,提出训练自由的均值集成方法提升模型性能,推荐提示家族评估与均值聚合作为标准无标签可靠性基准。

Comments Preprint. 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00824 2026-05-04 cs.MM 57%

CustomDancer: Customized Dance Recommendation by Text-Dance Retrieval

CustomDancer:通过文本-舞蹈检索实现定制化舞蹈推荐

Yawen Qin, Ke Qiu, Qin Zhang

专题命中 图文多模态 :multimodal(abstract);分类 cs.MM

AI总结 本文提出CustomDancer框架,通过CLIP文本编码器、音乐与运动编码器及音乐-运动融合模块,实现文本与舞蹈的多模态检索,提升舞蹈推荐的个性化与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00323 2026-05-04 cs.CV cs.LG 57%

Online Self-Calibration Against Hallucination in Vision-Language Models

在线对抗幻觉的视觉-语言模型自我校准

Minghui Chen, Chenxu Yang, Hengjie Zhu, Dayan Wu, Zheng Lin, Qingyi Si

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OSCAR框架,通过蒙特卡洛树搜索和双粒度奖励机制在线校准视觉-语言模型,减少幻觉并提升多模态能力。

Comments IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2605.00371 2026-05-04 cs.SD cs.AI 83%

GaMMA: Towards Joint Global-Temporal Music Understanding in Large Multimodal Models

GaMMA:迈向大规模多模态模型中的联合全局-时间音乐理解

Zuyao You, Zhesong Yu, Mingyu Liu, Bilei Zhu, Yuan Wan, Zuxuan Wu

机构 * Fudan University(复旦大学)

专题命中 音频语音多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 GaMMA通过融合音频编码器和跨模态学习,实现音乐内容的全面理解,并在MusicBench基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 11 篇

2605.00630 2026-05-04 cs.CV cs.MM eess.IV 81%

CMTA: Leveraging Cross-Modal Temporal Artifacts for Generalizable AI-Generated Video Detection

CMTA:利用跨模态时间特征进行通用的AI生成视频检测

Hang Wang, Chao Shen, Chenhao Lin, Minghui Yang, Lei Zhang, Cong Wang

机构 * Xi’an Jiaotong University(西安交通大学) The Hong Kong Polytechnic University(香港理工大学) Guangdong OPPO Mobile Communications Co., Ltd.(广东OPPO移动通信有限公司) City University of Hong Kong(香港城市大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文提出CMTA框架,通过联合跨模态嵌入和多粒度时间建模,识别AI生成视频中的跨模态时间特征,验证了其在四个大规模数据集上的新状态和跨生成器泛化能力。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01116 2026-05-04 cs.CV 79%

Structural Prognostic Event Modeling for Multimodal Cancer Survival Analysis

多模态癌症生存分析中的结构预后事件建模

Yilan Zhang, Li Nanbo, Changchun Yang, Jürgen Schmidhuber, Xin Gao

机构 * King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SlotSPE框架,通过槽注意力机制压缩多模态数据为结构化槽,有效建模癌症生存分析中的复杂交互,提升预后相关性与可解释性。

Comments 37 pages, 14 Figures

Journal ref The Fourteenth International Conference on Learning Representations (ICLR2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00351 2026-05-04 cs.LG cs.AI 79%

Hypergraph and Latent ODE Learning for Multimodal Root Cause Localization in Microservices

超图与潜在ODE学习用于微服务多模态根本原因定位

Xin Liu, Yuhang He, Sichen Zhao, Kejian Tong, Xingyu Zhang

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HyperODE RCA框架,结合超图注意力学习、潜在ODE和多模态交叉注意力融合,用于微服务系统中精细的根本原因分析,通过可微超边构建学习高阶服务交互,利用ODE RNN编码捕捉异常演变,采用上下文感知模态路由融合多种数据,提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00347 2026-05-04 cs.LG cs.AI cs.CL 62%

Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning

Odysseus:通过强化学习扩展VLMs以实现游戏中的100+回合决策

Chengshuai Shi, Wenzhe Li, Xinran Liang, Yizhou Lu, Wenjia Yang, Ruirong Feng, Seth Karten, Ziran Yang, Zihan Ding, Gabriel Sarch, Danqi Chen, Karthik Narasimhan, Chi Jin

机构 * Princeton Language and Intelligence(普林斯顿语言与智能实验室) Princeton University(普林斯顿大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了通过强化学习训练VLMs进行长回合决策,提出轻量级回合级批评机改进训练稳定性,利用预训练VLMs提升样本效率,引入Odysseus框架在多个游戏层级取得显著进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00495 2026-05-04 cs.SD cs.CV 57%

MMAudio-LABEL: Audio Event Labeling via Audio Generation for Silent Video

MMAudio-LABEL: 通过音频生成实现静音视频的音频事件标注

Kazuya Tateishi, Akira Takahashi, Atsuo Hiroe, Hirofumi Takeda, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MMAudio-LABEL框架,通过联合生成音频和帧对齐的声学事件预测,提升静音视频的音频事件标注精度,实验显示在起始点检测和材料分类任务中性能显著提升。

Comments Accepted to the CVPR 2026 Sight and Sound Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00444 2026-05-04 cs.CV 57%

Scaling Video Understanding via Compact Latent Multi-Agent Collaboration

通过紧凑潜在多智能体协作实现视频理解的扩展

Kerui Chen, Jinglu Wang, Jianrong Zhang, Ming Li, Yan Lu, Hehe Fan

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学) Guanming Lab(冠明实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出MACF框架,通过解耦智能体感知预算与全局视频复杂度,实现可扩展的视频理解,保持视觉保真度,并在多种视频理解基准上优于现有方法。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00078 2026-05-04 cs.RO cs.CV cs.LG 57%

Being-H0.7: A Latent World-Action Model from Egocentric Videos

Being-H0.7: 一种从第一人称视频中学习的潜在世界-动作模型

Hao Luo, Wanpeng Zhang, Yicheng Feng, Sipeng Zheng, Haiweng Xu, Chaoyi Xu, Ziheng Xi, Yuhui Fu, Zongqing Lu

机构 * BeingBeyond Team(BeingBeyond团队)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Being-H0.7,通过在感知与动作之间插入可学习的潜在查询,实现未来感知的VLA策略,无需生成未来帧,提升预测效率与部署性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00050 2026-05-04 cs.LG cs.CV 57%

Learning physically grounded traffic accident reconstruction from public accident reports

从公共事故报告中学习物理基础的交通事故重建

Yanchen Guan, Haicheng Liao, Chengyue Wang, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City(物联网智能城市国家重点实验室) Department of Civil Engineering(土木工程系) Department of Computer and Information Science(计算机与信息科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于公共报告和现场测量的参数化多模态学习框架,构建了6217个真实事故案例数据集CISS-REC,实现了交通事故重建的高保真度,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16345 2026-05-04 cs.HC cs.AI 57%

Bridging the Experimental Last Mile: Digitizing Laboratory Know-How for Safe AI-Assisted Support

弥合实验最后一公里:数字化实验室知识以实现安全的人工智能辅助支持

Akira Miura, Yuki Sasahara, Momoka Demura, Yuji Masubuchi, Tetsuya Asai, Chikahiko Mitsui

机构 * Division of Applied Chemistry, Faculty of Engineering, Hokkaido University(北海道大学工学部应用化学科) Graduate School of Chemical Sciences and Engineering, Hokkaido University(北海道大学研究生院化学科学和工程学系) Graduate School of Information Science and Technology, Hokkaido University(北海道大学研究生院信息科学和技术学系) Quantum Nexus, Inc.

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种结合视频、多模态AI和检索增强生成的AI助手,通过提取实验室特定知识来提升实验安全性,经评估显示其在指导和安全方面具有实用性。

Comments 32 pages in total (main 13 pages, appendix 19 pages), 2 main figures, 1 main table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16243 2026-05-04 cs.CV 57%

Find, Fix, Reason: Context Repair for Video Reasoning

寻找、修复、推理:视频推理中的上下文修复

Haojian Huang, Chuanyu Qin, Yinchuan Li, Yingcong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种上下文修复方法,通过冻结的教师模型提供最小证据补丁,帮助学生模型在保持问题不变的情况下快速定位目标区域,提升视频推理的准确性和泛化能力。

Comments 22 pages, 7 figures, 17 tables. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22285 2026-05-04 cs.CV 57%

VideoDetective: Clue Hunting via both Extrinsic Query and Intrinsic Relevance for Long Video Understanding

VideoDetective:通过外在查询和内在相关性进行长视频理解的线索搜索

Ruoliu Yang, Chu Wu, Caifeng Shan, Ran He, Chaoyou Fu

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出VideoDetective框架,通过结合查询与片段的相关性及片段间亲和力,有效定位长视频问答中的关键片段,提升多模态大语言模型在长视频理解中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2605.00670 2026-05-04 cs.IR cs.SI 78%

Robust Multimodal Recommendation via Graph Retrieval-Enhanced Modality Completion

通过图检索增强的模态完成实现鲁棒的多模态推荐

Yuan Li, Jun Hu, Jiaxin Jiang, Bryan Hooi, Bingsheng He

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出GRE-MC框架,通过图检索增强模态完成,解决多模态数据不完整问题,提升推荐系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13511 2026-05-04 cs.CV cs.IR 77%

Adapting MLLMs for Nuanced Video Retrieval

为精细化视频检索适应大语言模型

Piyush Bagad, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组)

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种统一嵌入模型,通过对比损失微调文本训练的多模态大语言模型,以处理视频检索中的时间、否定和多模态细微差别,实现最先进的检索性能。

Comments 38 Pages. Project page at http://bpiyush.github.io/tara-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00632 2026-05-04 cs.CV cs.AI cs.GR cs.HC cs.LG 62%

BlenderRAG: High-Fidelity 3D Object Generation via Retrieval-Augmented Code Synthesis

BlenderRAG: 通过检索增强的代码合成实现高保真的3D物体生成

Massimo Rondelli, Francesco Pivi, Maurizio Gabbrielli

机构 * University of Bologna(博洛尼亚大学) Ferrari S.p.A.(法拉利公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 BlenderRAG通过检索增强的代码合成方法,利用500个专家验证的多模态数据集提升Blender代码生成的准确性和一致性,无需微调或专用硬件。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2507.01955 2026-05-04 cs.CV cs.AI cs.LG 90%

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

GPT-4o对视觉的理解有多好?在标准计算机视觉任务上评估多模态基础模型

Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了GPT-4o等多模态基础模型在标准计算机视觉任务上的表现,发现其在语义任务上优于几何任务,GPT-4o在非推理模型中表现最佳,推理模型在几何任务中有所提升。

Comments ICLR 2026. Project page at https://fm-vision-evals.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV 83%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00526 2026-05-04 cs.CV 79%

IdentiFace: Multi-Modal Iterative Diffusion Framework for Identifiable Suspect Face Generation in Crime Investigations

IdentiFace:面向犯罪调查的可识别嫌疑人面部生成多模态迭代扩散框架

Weichen Liu, Yixin Yang, Changsheng Chen, Alex Kot

机构 * Southeast University(东南大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出IdentiFace框架,通过多模态输入设计和迭代生成流程提升可识别嫌疑人面部生成的条件控制与特征调整能力,贡献了面部身份损失函数和两个专用数据集,实验证明其在身份检索上的优越性能。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00244 2026-05-04 cs.RO cs.CV 57%

Lucid-XR: An Extended-Reality Data Engine for Robotic Manipulation

Lucid-XR:一种用于机器人操控的扩展现实数据引擎

Yajvan Ravan, Adam Rashid, Alan Yu, Kai McClennen, Gio Huh, Kevin Yang, Zhutian Yang, Qinxi Yu, Xiaolong Wang, Phillip Isola, Ge Yang

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) FortyFive Labs(FortyFive实验室) Caltech(加州理工学院) Harvard University(哈佛大学) UC San Diego(南加州大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 Lucid-XR通过XR头显直接运行的物理模拟环境生成多模态数据,实现零样本迁移至复杂环境,支持软材料、松散颗粒和刚体接触的精细操控任务。

Comments Project website: https://lucidxr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18064 2026-05-04 cs.CV 57%

Adapting Large VLMs with Iterative and Manual Instructions for Generative Low-light Enhancement

适配大型视觉语言模型以生成低光照增强

Xiaoran Sun, Liyan Wang, Yeying Jin, Kin-man Lam, Zhixun Su, Yang Yang, Jinshan Pan, Cong Wang

机构 * Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学) University of California, San Francisco(加州大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出VLM-IMI框架,通过迭代和手动指令适配大型视觉语言模型,用于生成低光照增强。该框架包含正常光照指令先验生成和指令感知光照增强扩散两个分支,通过融合模块整合跨模态先验,提升生成效果。

Comments 11 papers,8 figures, CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 10 篇

2605.00156 2026-05-04 cs.MM cs.CR 83%

RoboKA: KAN Informed Multimodal Learning for RoboCall Surveillance System

RoboKA:基于KAN的多模态学习用于RoboCall监控系统

Nitin Choudhury, Nikhil Kumar, Aditya Kumar Sinha, Abhijeet Anand, Hossein Salemi, Orchid Chetia Phukan, Hemant Purohit, Arun Balaji Buduru

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出RoboKA,一种基于KAN的多模态融合框架,用于建模音频和语言线索之间的非线性交互,以提高RoboCall监控的召回率和F1分数。

Comments Accepted to the International Conference on Multimedia & Expo (ICME) 2026, 7th International Workshop on Surveillance Data Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00184 2026-05-04 cs.LG cs.HC 78%

Introducing WARM-VR: Benchmark Dataset for Multimodal Wearable Affect Recognition in Virtual Reality

引入WARM-VR:多模态可穿戴情感识别基准数据集

Karim Alghoul, Faisal Mohd, Fedwa Laamarti, Hussein Al Osman, Abdulmotaleb El Saddik

机构 * School of Electrical Engineering and Computer Science, University of Ottawa(Ottawa 大学电气工程与计算机科学学院) Computer Science, University of Ottawa(Ottawa 大学计算机科学系) Computer Vision Department, Mohamed bin Zayed University of Artificial Intelligence(摩根·bin·扎耶德人工智能大学计算机视觉部门)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出WARM-VR数据集,用于多感官沉浸环境中可穿戴设备的情感识别,通过生理信号和多模态刺激评估情感状态,并利用CNN和Transformer模型验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21199 2026-05-04 cs.LG cs.CV 70%

ARFBench: Benchmarking Time Series Question Answering Ability for Software Incident Response

ARFBench: 用于软件事件响应的时间序列问题回答能力基准测试

Stephan Xie, Ben Cohen, Mononito Goswami, Junhong Shen, Emaad Khwaja, Chenghao Liu, David Asker, Othmane Abou-Amal, Ameet Talwalkar

机构 * Machine Learning Department, Carnegie Mellon University(卡内基梅隆大学机器学习系) Datadog AI Research(Datadog AI研究) Amazon Web Services(亚马逊网络服务)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出ARFBench基准测试,评估多模态基础模型对软件事件数据中时间序列异常的理解能力,发现前沿VLM表现优异,提出混合模型并建立模型-专家 oracle,达到超人类水平。

Comments Updated author affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07630 2026-05-04 cs.CL cs.AI cs.CV 67%

InterChart: Benchmarking Visual Reasoning Across Decomposed and Distributed Chart Information

InterChart:跨分解与分布式图表信息的基准测试

Anirudh Iyengar Kaniyar Narayana Iyengar, Srija Mukhopadhyay, Adnan Qidwai, Shubhankar Singh, Dan Roth, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) IIIT, Hyderabad(海得拉巴印度理工学院) Mercer Mettl University(梅森-梅特尔大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 InterChart通过评估视觉语言模型在多图表间推理的能力,揭示了模型在复杂图表集成中的局限性,推动多模态推理的发展。

Comments 22 pages, 8 figures, 14 tables. Accepted at IJCNLP-AACL 2025

Journal ref Proceedings of the 14th International Joint Conference on Natural Language Processing and the 4th Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics 2025, 2046-2067

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13305 2026-05-04 cs.CV cs.AI 62%

WildfireVLM: AI-powered Analysis for Early Wildfire Detection and Risk Assessment Using Satellite Imagery

WildfireVLM:基于卫星影像的AI分析用于早期野火检测与风险评估

Aydin Ayanzadeh, Prakhar Dixit, Sadia Kamal, Milton Halem

机构 * Department of Computer Science and Electrical Engineering(计算机科学与电气工程系) University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 WildfireVLM结合卫星影像检测与语言驱动的风险评估,利用YOLOv12检测火区与烟雾,并通过多模态大语言模型生成风险评估和应急响应建议,验证其有效性并实现实时处理与长期追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00070 2026-05-04 eess.IV cs.AI cs.CV 62%

Brain MR Image Synthesis with 3D Multi-Contrast Self-Attention GAN

利用3D多对比自注意GAN进行脑部MRI图像合成

Zaid A. Abod, Furqan Aziz

机构 * School of Computing and Mathematical Sciences, University of Leicester(利兹大学计算与数学科学学院)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出3D-MC-SAGAN框架,通过单张T2w图像生成高保真多对比MRI图像,保留肿瘤特征,结合多种损失函数提升全局真实感和肿瘤结构保真度。

Comments Note: This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏