arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-19 至 2026-05-19 共收录 177 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 25 篇

2604.24763 2026-05-19 cs.CV 79%

Tuna-2: Pixel Embeddings Beat Vision Encoders for Multimodal Understanding and Generation

Tuna-2:像素嵌入在多模态理解和生成中优于视觉编码器

Zhiheng Liu, Weiming Ren, Xiaoke Huang, Shoufa Chen, Tianhong Li, Mengzhao Chen, Yatai Ji, Sen He, Jonas Schult, Belinda Zeng, Tao Xiang, Wenhu Chen, Ping Luo, Luke Zettlemoyer, Yuren Cong

机构 * Meta AI The University of Hong Kong(香港大学) University of Waterloo(滑铁卢大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Tuna-2,一种基于像素嵌入的统一多模态模型,通过直接使用像素嵌入进行多模态理解和生成,展示了统一像素空间建模在高质量图像生成中可以与潜在空间方法竞争,并证明了预训练视觉编码器在多模态建模中并非必要。

Comments Project page: https://tuna-ai.org/tuna-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16842 2026-05-19 cs.AI 79%

Sketch Then Paint: Hierarchical Reinforcement Learning for Diffusion Multi-Modal Large Language Models

草图然后绘画:用于扩散多模态大语言模型的分层强化学习

Siqi Luo, Jianghan Shen, Yi Xin, Huayu Zheng, Haoxing Chen, Yan Tai, Yue Li, Junjun He, Yihao Liu, Guangtao Zhai, Yuewen Cao, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Peking University(北京大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI

AI总结 本文提出了一种分层强化学习方法HT-GRPO,通过Sketch-Then-Paint训练方案和分层信用分配机制,解决扩散多模态大语言模型在强化学习优化中的关键问题,提升图像质量和审美效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 79%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16745 2026-05-19 cs.CV 77%

EVA01: Unified Native 3D Understanding and Generation via Mixture-of-Transformers

EVA01: 通过混合变换器实现统一的原生3D理解和生成

Zongyuan Yang, Mingjing Yi, Wanli Ma, Chenzhuo Fan, Bocheng Li, Baolin Liu, Yuke Lou, Yingde Song, Yongping Xiong, Zhengdong Guo, Shimu Wang

机构 * SeeleAI Team(SeeleAI团队)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 本文提出EVA01框架,通过混合变换器架构扩展多模态大语言模型的模态边界,实现原生的3D网格理解和生成以及上下文感知编辑,提升文本到3D生成的保真度和多轮几何编辑能力。

Comments 28 pages, 10 figures, 6 tables. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16473 2026-05-19 stat.ML cs.LG cs.NA math.NA math.PR 71%

Dimension-Uniform Discretization Analysis of Preconditioned Annealed Langevin Dynamics for Multimodal Gaussian Mixtures

预处理退火 Langevin 动力学在多模高斯混合中的维度均匀离散化分析

Lorenzo Baldassari, Josselin Garnier, Knut Solna, Maarten V. de Hoop

机构 * University of Basel(巴塞尔大学) Ecole Polytechnique, IP Paris(巴黎高等理工学院) University of California Irvine(加州大学尔湾分校) Rice University(里德大学)

专题命中 多模态生成 :multimodal(title)

AI总结 本文研究了预处理退火 Langevin 动力学在高斯混合中的稳定性问题,通过 Euler-Maruyama 离散化和指数积分方案,证明了在满足特定谱条件时,KL 散度具有维度均匀的上界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17042 2026-05-19 cs.CV 70%

Thermal-Only Crowd Counting with Deployment-Time Privacy Protection

仅热成像的人群计数与部署时隐私保护

Yifei Qian, Zhongliang Guo, Chun Tong Lei, Bowen Deng, Chun Pong Lau, Xiaopeng Hong, Michael P. Pound

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science, University of St Andrews(斯特灵大学计算机科学学院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出了一种仅使用热成像数据的人群计数框架,通过消除RGB数据依赖,减少公共监控中隐私暴露风险,并利用深度到RGB扩散模型来缓解热成像的模糊性,提升计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16603 2026-05-19 cs.CV 70%

Controlla: Learning Controllability via Graph-Constrained Latent Geometry

Controlla:通过图约束潜在几何学习可控性

Jamuna S. Murthy, Amin Karimi Monsefi, Rajiv Ramnath

机构 * Ramaiah Institute of Technology(拉马亚院技术学院) The Ohio State University(俄亥俄州立大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Controlla通过图约束潜在几何学习可控性,结合图约束最优传输对多模态输入的语义属性和身份因子进行对齐,提升可控性、身份保持和跨模态对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16295 2026-05-19 cs.CY cs.AI cs.CL cs.GR cs.HC cs.MM 67%

ANVIL: Analogies and Videos for Lecturers

ANVIL:为讲师提供类比和视频

Yuri Noviello, Anastasiia Birillo, Gosia Migut

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 ANVIL是一种多模态生成系统,可自动生成基于类比的计算机科学教学动画。通过生成文本类比、结构化视觉剧本和可执行代码,提升教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16961 2026-05-19 cs.CV cs.AI 62%

Latent Action Control for Reasoning-Guided Unified Image Generation

潜在动作控制用于推理引导的统一图像生成

Fuxiang Zhai, Sixiang Chen, Yingjin Li, Shuaibo Li, Jianyu Lai, Tengjun Huang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Latent Action Control (LAC),通过将推理表示为隐藏的连续动作,使推理过程可操作,从而在统一生成器中实现推理引导的图像生成。LAC通过角色结构化的潜在轨迹进行规划、内部视觉草图、诊断和细化,并将这些动作注入到条件流生成的隐藏流中,从而提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18733 2026-05-19 cs.CV 57%

Advancing Narrative Long Video Generation via Training-Free Identity-Aware Memory

通过无训练的身份感知记忆推进叙事长视频生成

Jinzhuo Liu, Jiangning Zhang, Wencan Jiang, Yabiao Wang, Dingkang Liang, Zhucun Xue, Ran Yi, Yong Liu

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯云智实验室) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种无训练的身份感知记忆框架IAMFlow,通过显式建模和跟踪持久实体身份,实现一致的生成,同时引入NarraStream-Bench基准测试,在叙事流视频生成中取得最佳性能。

Comments Project page: https://eddie0521.github.io/projects/iamflow/ Code: https://github.com/Eddie0521/IAMFlow

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18641 2026-05-19 cs.CV 57%

Leveraging Latent Visual Reasoning in Silence

利用沉默中的潜在视觉推理

Dongyao Zhu, Zhen Wang, Xi Xiao, Han Jiang, Saeed Vahidian, Wei-Lun Chao, Tanya Berger-Wolf, Yu Su, Raju Vatsavai, Jianyang Gu

机构 * North Carolina State University(北卡罗来纳州立大学) UC, San Diego(加州大学圣地亚哥分校) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Johns Hopkins University(约翰霍普金斯大学) Duke University(杜克大学) Boston University(波士顿大学) The Ohio State University(俄亥俄州立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了在推理过程中是否需要持续的潜在令牌,发现即使移除这些令牌或用随机噪声替代,性能影响较小,提出了一种基于注意力的奖励机制以促进潜在令牌与后续文本令牌的交互,从而提升视觉感知和视觉推理任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17527 2026-05-19 cs.CV 57%

Designing streetscapes from street-view imagery using diffusion models

利用扩散模型从街景图像中设计街道景观

Yuzhou Chen, Yuebing Liang, Lingqian Hu, Kailai Sun, Qingqi Song, Chang Zhao, Shenhao Wang

机构 * Department of Urban and Regional Planning, University of Florida(城市与区域规划系,佛罗里达大学) Singapore-MIT Alliance for Research and Technology Centre (SMART)(新加坡-麻省理工联合研究中心(SMART)) Department of Landscape Architecture and Urban Planning, Texas A&M University(景观建筑与城市规划系,德克萨斯大学安德森分校) Department of Agronomy, University of Florida(农业系,佛罗里达大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种生成多模态AI框架,通过目标视觉指标生成替代的街道景观,提升了城市规划和设计中的视觉探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01030 2026-05-19 cs.CV 57%

Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model

Lotus-2: 通过强大的图像生成模型推进几何密集预测

Jing He, Haodong Li, Mingzhi Sheng, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 本文提出Lotus-2,一种两阶段确定性框架,用于稳定、准确和精细的几何密集预测,通过充分利用预训练生成先验,实现了单目深度估计和表面法线预测的新状态-of-the-art结果。

Comments v3: Fixed some typos. Project page: https://lotus-2.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17357 2026-05-19 cs.IR cs.MM 57%

Dual-Diffusional Generative Fashion Recommendation

双扩散生成式时尚推荐

Mingzhe Yu, Lei Wu, Qianru Sun, Yunshan Ma

专题命中 多模态生成 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出DualFashion,一种联合建模图像和文本模态的双扩散生成式时尚推荐架构,通过结构化属性级描述和视觉装扮信息共同作为条件信号,实现个性化和可解释的推荐,同时引入文本增强微调策略提升生成多样性与跨模态知识迁移能力。

Comments Accepted by SIGIR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17294 2026-05-19 cs.CV 57%

HierEdit: Region-Aware Hierarchical Diffusion for Efficient High-Resolution Editing

HierEdit: 基于区域的分层扩散用于高效的高分辨率编辑

Yuyao Zhang, Alexander Huang-Menders, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出HierEdit,一种区域感知的分层扩散框架,用于高效可扩展的高分辨率图像编辑。通过低分辨率代理生成参考并定位修改区域,结合分层局部窗口扩散模型和推理加速机制,实现无需高分辨率训练数据的快速高保真编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06037 2026-05-19 cs.CV 57%

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

基于几何的思考:用于空间推理的主动几何整合

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, JiaWang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yet-sen University(中山大学深圳校区) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司) Shanghai Jiao Tong University(上海交通大学) Shanghai innovation institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出GeoThinker框架,通过主动感知机制改进空间推理,通过空间接地融合和重要性门控实现几何与语义的精准整合,提升空间智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01705 2026-05-19 cs.LG cs.AI 57%

LaDi-RL: Latent Diffusion Reasoning Prevents Entropy Collapse in Reinforcement Learning

LaDi-RL:潜在扩散推理防止强化学习中的熵崩溃

Haoqiang Kang, Yizhe Zhang, Nikki Lijing Kuang, Yi-An Ma, Lianhui Qin

机构 * UC San Diego(斯克利普斯海洋研究所) Apple(苹果公司)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出LaDi-RL方法,通过潜在扩散模型生成潜在推理轨迹,解决强化学习中熵崩溃问题,提升代码生成和数学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16469 2026-05-19 eess.IV cs.CV 57%

Flow Matching with Optimized Subclass Priors for Medical Image Augmentation

利用优化子类先验的流匹配用于医学图像增强

Felix Nützel, Mischa Dombrowski, Bernhard Kainz

机构 * Department of Artificial Intelligence in Biomedical Engineering, Friedrich-Alexander-Universität Erlangen-Nürnberg, 91052 Erlangen, Germany(生物医学工程人工智能系,弗里德里希-亚历山大-厄林根-纽伦堡大学) Department of Computing, Imperial College London, London SW7 2AZ, UK(计算系,帝国理工学院伦敦分校)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出通过优化子类先验来提升医学图像增强中罕见疾病的生成质量,通过生成模型的潜在空间进行子类模式划分,并学习子类条件源分布以提高生成效果和多样性。

Comments 11 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16429 2026-05-19 cs.LG cs.AI 57%

QuantFPFlow: Quantum Amplitude Estimation for Fokker--Planck Policy Optimisation in Continuous Reinforcement Learning

QuantFPFlow:用于连续强化学习中Fokker-Planck策略优化的量子振幅估计

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 QuantFPFlow通过量子振幅估计提升连续强化学习中Fokker-Planck策略优化的效率,实现算法复杂度从O(1/ε²)到O(1/ε)的平方加速,并在多模态奖励景观中发现全局最优解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17352 2026-05-19 cs.CV 57%

Alignment and Safety of Diffusion Models via Reinforcement Learning and Reward Modeling: A Survey

通过强化学习和奖励建模对扩散模型的对齐与安全性:综述

Preeti Lamba, Kiran Ravish, Ankita Kushwaha, Pawan Kumar

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文综述了通过强化学习、奖励建模等方法对文本到图像扩散模型进行对齐和安全性的最新进展,探讨了反馈来源、奖励信号形式、优化机制等五个维度,并提出了多目标对齐、反馈高效偏好学习等开放性挑战。

Comments 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14757 2026-05-19 eess.SP 50%

ChannelAgent-Empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

ChannelAgent-empowered Electromagnetic Space World Model: A Case Study on Agent-Driven Channel Generation for 6G AI-Native Air Interface

Mingyue Li, Li Yu, Yuxiang Zhang, Heng Wang, Jianhua Zhang, Ping Zhang, Guangyi Liu

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出了一种基于ChannelAgent的电磁空间世界模型,用于6G AI原生空气接口中的智能体驱动信道生成,通过多模感知、ChannelAgent智能核心和反馈更新的闭环过程,实现任务感知决策和自主适应。

Comments 6 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 50%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 38 篇

2605.16909 2026-05-19 cs.AI 83%

TOBench: A Task-Oriented Omni-Modal Benchmark for Real-World Tool-Using Agents

TOBench:面向真实世界工具使用代理的任务导向多模态基准

Zhiqiang Liu, Wenhui Dong, Yilang Tan, Yuwen Qu, Haochen Yin, Chenyang Si

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) Southwest Jiaotong University(西南交通大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态评测 :omni-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出TOBench,一个面向真实世界工具使用代理的多模态基准,通过闭环多模态验证设计,评估和推动下一代多模态工具使用代理的发展。

Comments Github: https://github.com/Pi3AI/TOBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16375 2026-05-19 cs.LG cs.NI 82%

M$^2$FedAQI: Multimodal Federated Learning for Air Quality Prediction on Heterogeneous Edge Devices

M$^2$FedAQI: 多模态联邦学习用于异构边缘设备上的空气质量预测

Manjil Nepal, Kimsie Phan, Tamoghna Ojha, Aritra Dutta, M Krishna Siva Prasad

机构 * Department of Computer Science and Engineering, SRM University-AP, India(印度SRM大学-AP计算机科学与工程系) Department of Mathematics and Computing, IIT (ISM) Dhanbad, India(印度德汉巴德IIT(ISM)数学与计算系) Department of Mathematics and the Department of Computer Science, University of Central Florida, USA(美国中央佛罗里达大学数学系和计算机科学系)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出M$^2$FedAQI框架,通过多模态融合机制实现异构边缘设备上的空气质量预测,实验表明其在准确率、AUC、F1-score和R²等指标上均优于现有方法,同时降低MAE和RMSE,提升通信安全性和资源利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16371 2026-05-19 cs.CV cs.AI 81%

GeoSym127K: Scalable Symbolically-verifiable Synthesis for Multimodal Geometric Reasoning

GeoSym127K:可扩展的符号验证合成用于多模态几何推理

Jinhao Jing, Zheng Ma, Jinwei Liang, Qiannian Zhao, Shawn Chen, Jing Yang, Por Lip Yee, Prayag Tiwari, Jingjing Bai, Benyou Wang, Lewei Lu, Zhan Su

机构 * School of Information Technology, Halmstad University(哈姆斯塔德大学信息科技学院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoSym引擎,通过类型条件语法和分析SymGT求解器生成精确符号地面真实值,构建了包含51K高清图像、127K问题和55K答案验证CoT QA对的GeoSym127K数据集,并展示了其在几何推理任务中的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18130 2026-05-19 cs.CV 79%

Rad-VLSM: A Cross-Modal Framework with Semantics-Assisted Prompting for Medical Segmentation and Diagnosis

Rad-VLSM:一种结合语义辅助提示的跨模态框架用于医学分割与诊断

Fengyi Zhang, Xujie Zeng, Mohan Liu, Zengyi Wang, Yalong Jiang

机构 * Student Member, IEEE(IEEE学生会员) Member, IEEE(IEEE会员)

专题命中 多模态评测 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出Rad-VLSM框架,通过语义引导的提示机制,提升医学图像分割与诊断的准确性,解决现有模型易受背景组织和无关视觉相关性干扰的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17669 2026-05-19 cs.AI 79%

Multimodal Cultural Heritage Knowledge Graph Extension with Language and Vision Models

多模态文化遗产品知图扩展与语言和视觉模型

Yang Zhang, Nada Mimouni, Jean-Claude Moissinac, Fayçal Hamdi

机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)

专题命中 多模态评测 :multimodal(title);multi-modal(abstract);分类 cs.AI

AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17198 2026-05-19 q-bio.NC cs.CV 79%

MIRAGE: Robust multi-modal architectures translate fMRI-to-image models from vision to mental imagery

MIRAGE:鲁棒的多模态架构将fMRI到图像模型从视觉扩展到心理意象

Reese Kneeland, Cesar Kadir Torrico Villanueva, Jordyn Ojeda, Shuhb Khanna, Jonathan Xu, Paul S. Scotti, Thomas Naselaris

机构 * University of Minnesota(明尼苏达大学) Medical AI Research Center (MedARC)(医学人工智能研究中心 (MedARC)) University of Sydney(悉尼大学) Stanford University(斯坦福大学) Alljoined Sophont Princeton Neuroscience Institute(普林斯顿神经科学研究所)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出MIRAGE方法,通过多模态文本和图像特征训练,实现从脑活动解码心理意象,展示了在NSD-Imagery基准上SOTA的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17115 2026-05-19 cs.AI 79%

F2IND-IT! -- Multimodal Fuzzy Fake Indian News Detection using Images and Text

F2IND-IT! -- 多模态模糊假新闻检测:结合图像和文本

Kushal Trivedi, Murtuza Shaikh, Khushi Singh, Jeevaraj S.

机构 * ABV - Indian Institute of Information Technology, Gwalior(ABV-印度信息技术学院,加尔瓦里)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出了一种多模态模糊框架,结合图像和文本进行印度媒体虚假新闻检测,通过ResNet-50提取图像特征,DistilBERT获取文本语义嵌入,ANFIS生成模糊可靠性评分,并通过轻量级注意力融合模块进行分类,实验结果显示在准确率、精确率、召回率和F1分数上均优于现有方法。

Comments 10 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01993 2026-05-19 cs.CV 79%

Cultivating Forensic Reasoning for Generalizable Multimodal Manipulation Detection

培养可推广的多模态操纵检测的推理能力

Yuchen Zhang, Yaxiong Wang, Kecheng Han, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出REFORM框架,通过推理驱动的方法改进多模态操纵检测,提升泛化能力,在多个数据集上取得新高准确率。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏