arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-27 至 2026-03-27 共收录 84 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2603.05181 2026-03-27 cs.CV 85%

Mario: Multimodal Graph Reasoning with Large Language Models

Mario:基于大语言模型的多模态图推理

Yuanfu Sun, Kang Li, Pengkang Guo, Jiajin Liu, Qiaoyu Tan

机构 * New York University Shanghai(上海纽约大学) New York University(纽约大学) Tsinghua University(清华大学) EPFL(瑞士联邦理工学院洛桑)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 Mario通过多模态图推理框架解决跨模态一致性与异构模态偏好问题,实现对多模态图的有效推理,优于现有图模型。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23159 2026-03-27 cs.CV cs.LG 83%

Conformal Cross-Modal Active Learning

符合性跨模态主动学习

Huy Hoang Nguyen, Cédric Jung, Shirin Salehi, Tobias Glück, Anke Schmeink, Andreas Kugi

机构 * AIT Austrian Institute of Technology(奥地利理工学院) Automation & Control Institute, Technical University of Vienna(维也纳技术大学自动化与控制研究所) Chair of Information Theory and Data Analytics (INDA), RWTH Aachen University(亚琛工业大学信息理论与数据分析教席)

专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出CCMA框架,通过教师-学生架构融合视觉与语言模态,利用多模态符合评分与多样性意识选择策略,提升数据效率。

Comments 20 pages, 14 figures

Journal ref CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 57%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25533 2026-03-27 cs.CV 57%

BFMD: A Full-Match Badminton Dense Dataset for Dense Shot Captioning

BFMD:一款完整的羽毛球密集数据集用于密集击球标注

Ning Ding, Keisuke Fujii, Toru Tamaki

机构 * Nagoya Institute of Technology(名古屋工业大学) Nagoya University(名古屋大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出BFMD数据集,包含19场完整比赛,提供密集多模态标注,采用VideoMAE框架结合语义反馈机制提升击球标注质量。

Comments CVSports2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25075 2026-03-27 cs.AI 57%

Sparse Visual Thought Circuits in Vision-Language Models

视觉语言模型中的稀疏视觉思维电路

Yunpeng Zhou

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究探讨了稀疏自编码器特征在推理中的模块化假设,发现干预任务选择性特征集能小幅提升推理准确率,但联合干预则导致预测漂移和精度下降,揭示了SAE特征组合的边界。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2603.25140 2026-03-27 cs.CV cs.AI cs.LG cs.MM cs.SD 87%

SAVe: Self-Supervised Audio-visual Deepfake Detection Exploiting Visual Artifacts and Audio-visual Misalignment

SAVe:利用视觉伪影和音视频不一致的自监督音频视觉深度伪造检测

Sahibzada Adil Shahzad, Ammarah Hashmi, Junichi Yamagishi, Yusuke Yasuda, Yu Tsao, Chia-Wen Lin, Yan-Tsung Peng, Hsin-Min Wang

机构 * Social Networks and Human-Centered Computing Program, Taiwan International Graduate Program, Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所台湾国际研究生计划社交网络与人本计算项目) Department of Computer Science, National Chengchi University(国立政治大学资讯科学系) Institute of Information Systems and Applications, National Tsing Hua University(国立清华大学资讯系统与应用研究所) National Institute of Informatics(国立情报学研究所) Department of Electrical Engineering and the Institute of Communications Engineering, National Tsing Hua University(国立清华大学电机工程学系与通讯工程研究所) Research Center for Information Technology Innovation, Academia Sinica(中央研究院资讯科技创新研究中心) Institute of Information Science, Academia Sinica(中央研究院资讯科学研究所)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 SAVe通过自监督学习在真实视频上训练,生成伪篡改以学习互补的视觉线索,并通过音视频对齐组件捕捉跨模态证据,实现对深度伪造的高效检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24793 2026-03-27 cs.CV cs.MM cs.SD 81%

AVControl: Efficient Framework for Training Audio-Visual Controls

AVControl: 用于音频-视觉控制训练的高效框架

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel Cain, Asaf Joseph, Anthony Chen, Urska Jelercic, Ofir Bibi

机构 * Lightricks

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV、cs.MM

AI总结 AVControl通过轻量级框架实现多模态控制,无需架构改动,支持多种独立训练的模态,如深度、姿态、边缘、相机轨迹等,并在多个基准测试中表现优异。

Comments Project page: https://matanby.github.io/AVControl/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25107 2026-03-27 cs.CV 79%

Label What Matters: Modality-Balanced and Difficulty-Aware Multimodal Active Learning

关键性标注:模态平衡与难度意识的多模态主动学习

Yuqiao Zeng, Xu Wang, Tengfei Liang, Yiqing Hao, Yi Jin, Hui Yu

机构 * Key Laboratory of Big Data and Artificial Intelligence in Transportation, Ministry of Education(北京交通大学计算机与信息技术学院;轨道交通控制与安全国家重点实验室;交通大数据与人工智能教育部重点实验室) State Key Laboratory of Advanced Rail Autonomous Operation(格拉斯哥大学心理与神经科学学院) School of Computer and Information Technology, Beijing Jiaotong University School of Psychology & Neuroscience, University of Glasgow

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RL-MBA框架,通过强化学习实现多模态主动学习的模态平衡与难度意识,提升分类准确率和模态公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2512.14698 2026-03-27 cs.CV cs.AI cs.CL cs.MM 83%

TimeLens: Rethinking Video Temporal Grounding with Multimodal LLMs

TimeLens:重新思考视频时间接地与多模态大语言模型

Jun Zhang, Teng Wang, Yuying Ge, Yixiao Ge, Xinhao Li, Ying Shan, Limin Wang

机构 * Nanjing University(南京大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出TimeLens,通过数据质量和算法设计两个维度系统研究多模态大语言模型的视频时间接地能力,构建高质量数据集并提出有效训练方法,实现开源模型在视频时间接地任务上的领先性能。

Comments CVPR 2026. Website: https://timelens-arc-lab.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25420 2026-03-27 cs.CV 79%

VideoWeaver: Multimodal Multi-View Video-to-Video Transfer for Embodied Agents

VideoWeaver:多模态多视角视频到视频转换用于具身智能体

George Eskandar, Fengyi Shen, Mohammad Altillawi, Dong Chen, Yang Bai, Liudi Yang, Ziyuan Liu

机构 * Huawei Heisenberg Research Center(华为海森堡研究中心) Ludwig Maximilian University of Munich(慕尼黑大学) University of Freiburg(弗莱堡大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 VideoWeaver是首个多视角视频到视频转换框架,通过共享4D潜在空间实现多视角一致性,支持动态相机运动和不同视角的自回归合成,提升具身智能体在真实环境中的迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24636 2026-03-27 cs.LG cs.AI 79%

DyMRL: Dynamic Multispace Representation Learning for Multimodal Event Forecasting in Knowledge Graph

DyMRL: 动态多空间表征学习用于知识图谱中的多模态事件预测

Feng Zhao, Kangzheng Liu, Teng Peng, Yu Yang, Guandong Xu

机构 * Huazhong University of Science and Technology(华中科技大学) Centre for Learning, Teaching and Technology(学习、教学与技术中心) The Education University of Hong Kong(香港教育大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 DyMRL通过动态多空间表征学习,解决多模态知识动态获取与融合问题,提升事件预测性能。

Comments Accepted to The ACM Web Conference 2026 (WWW '26). This version is published under a CC BY license

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13315 2026-03-27 cs.RO 78%

Bi-HIL: Bilateral Control-Based Multimodal Hierarchical Imitation Learning via Subtask-Level Progress Rate and Keyframe Memory for Long-Horizon Contact-Rich Robotic Manipulation

双侧控制基于多模态分层模仿学习的长时程接触丰富机械臂操作

Thanpimon Buamanee, Masato Kobayashi, Yuki Uranishi

机构 * The University of Osaka(大阪大学) Kobe University(神户大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出Bi-HIL框架,通过子任务级进度率和关键帧记忆实现长时程接触丰富机械臂操作的稳定分层协调,验证了显式建模子任务进展与力感知控制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25733 2026-03-27 cs.CV 57%

SlotVTG: Object-Centric Adapter for Generalizable Video Temporal Grounding

SlotVTG: 用于通用视频时间定位的对象中心适配器

Jiwook Han, Geo Ahn, Youngrae Kim, Jinwoo Choi

机构 * Kyung Hee University(庆熙大学) University of Southern California(南加州大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SlotVTG通过引入轻量级槽适配器,使MLLMs在最小成本下实现对象中心的输入关联视觉推理,提升跨域鲁棒性的同时保持领域内性能。

Comments Accepted to GRAIL-V workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25423 2026-03-27 cs.SI cs.AI 57%

From Manipulation to Mistrust: Explaining Diverse Micro-Video Misinformation for Robust Debunking in the Wild

从操控到怀疑:为野外鲁棒驳斥解释多样化的微视频虚假信息

Zhi Zeng, Yifei Yang, Jiaying Wu, Xulang Zhang, Xiangzheng Kong, Herun Wan, Zihan Ma, Minnan Luo

机构 * School of Computer Science and Technology, MOEKLINNS Lab, Xi'an Jiaotong University(西安交通大学计算机科学与技术学院、教育部机器学习与智能决策网络实验室) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出WildFakeBench基准和FakeAgent框架,通过多模态理解和外部证据分析,提升微视频虚假信息检测的可解释性和鲁棒性。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25054 2026-03-27 cs.CV 57%

Synergistic Event-SVE Imaging for Quantitative Propellant Combustion Diagnostics

协同事件-SVE成像用于定量推进剂燃烧诊断

Jing Tao, Taihang Lei, Banglei Guan, Ying Qu, Xudong Na, Likun Ma, Yang Shang, Qifeng Yu

机构 * College of Aerospace Science and Engineering, National University of Defense Technology(国防科技大学航天科学与工程学院) Hunan Provincial Key Laboratory of Image Measurement and Vision Navigation, National University of Defense Technology(国防科技大学湖南省图像测量与视觉导航重点实验室) Hypersonic Technology Laboratory, National University of Defense Technology(国防科技大学高超声速技术实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种闭环事件-SVE测量系统,结合空间变曝光相机与双目神经形态事件相机,通过烟雾感知融合策略生成HDR图像,用于烟雾遮挡下的高精度推进剂燃烧诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25353 2026-03-27 cs.RO 50%

SafeGuard ASF: SR Agentic Humanoid Robot System for Autonomous Industrial Safety

SafeGuard ASF:基于SR代理的人形机器人自主工业安全系统

Thanh Nguyen Canh, Thang Tran Viet, Thanh Tuan Tran, Ben Wei Lim

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SafeGuard ASF系统,利用人形机器人结合多模态感知与ReAct代理推理框架,实现工业环境中的火灾烟雾、管道异常温度及禁区入侵检测,通过训练多种运动策略实现自主巡逻与避障。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2208.09843 2026-03-27 cs.CV 83%

CODER: Coupled Diversity-Sensitive Momentum Contrastive Learning for Image-Text Retrieval

CODER: 耦合多样性敏感动量对比学习用于图像-文本检索

Haoran Wang, Dongliang He, Wenhao Wu, Boyang Xia, Min Yang, Fu Li, Yunlong Yu, Zhong Ji, Errui Ding, Jingdong Wang

机构 * Department of Computer Vision Technology (VIS), Baidu Inc., Beijing, China(百度公司计算机视觉技术部(VIS),北京,中国) Key Lab of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, Beijing, China(中国科学院智能信息处理重点实验室,中国科学院计算技术研究所,北京,中国) College of Information Science & Electronic Engineering, Zhejiang University, Hangzhou, China(浙江大学信息与电子工程学院,杭州,中国) School of Electrical & Information Engineering, Tianjin University, Tianjin, China(天津大学电气与信息工程学院,天津,中国) The University of Sydney, Sydney, Australia(悉尼大学,悉尼,澳大利亚)

专题命中 跨模态检索 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CODER,通过耦合多样性敏感动量对比学习提升跨模态表示,引入动态字典扩大图像-文本对规模,结合常识知识图谱生成概念级描述,实验表明在MSCOCO和Flickr30K上优于现有方法。

Comments Accepted by ECCV 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24736 2026-03-27 cs.AI cs.LG 79%

AutoSAM: an Agentic Framework for Automating Input File Generation for the SAM Code with Multi-Modal Retrieval-Augmented Generation

AutoSAM:一种用于自动化生成SAM代码输入文件的代理框架,结合多模态检索增强生成

Zaid Abulawi, Zavier Ndum Ndum, Eric Cervi, Rui Hu, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University. Engineering Division, Argonne National Laboratory

专题命中 跨模态检索 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 AutoSAM通过多模态检索增强生成技术,自动化生成SAM代码输入文件,解决异构工程文档中提取设计数据并转换为求解器语法的难题,实现100%结构化输入利用和88%PDF文本提取。

Comments 34 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14961 2026-03-27 cs.LG cs.CV 70%

Graph Memory: A Structured and Interpretable Framework for Modality-Agnostic Embedding-Based Inference

图记忆:一种结构化且可解释的多模态嵌入推理框架

Artur A. Oliveira, Mateus Espadoto, Roberto M. Cesar, Roberto Hirata

机构 * Institute of Mathematics and Statistics, University of São Paulo(数学统计研究所,圣保罗大学)

专题命中 跨模态检索 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 图记忆通过紧凑的可靠性标注原型区域图表示嵌入空间,结合原型关系编码局部几何和区域模糊性,实现查询证据扩散推理,统一实例检索、原型推理和图扩散,提供更准确和可解释的多模态推理。

Comments This version expands the published conference paper (VISAPP 2026) with additional methodological details, experiments, and analysis that were omitted due to page limits. The final published version is available via DOI: 10.5220/0014578800004084

Journal ref Proc. 21st Int. Conf. Comput. Vision Theory Appl. (VISAPP 2026), Vol. 1, pp. 652-659 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25216 2026-03-27 cs.NI cs.AI eess.SP 57%

A Wireless World Model for AI-Native 6G Networks

面向AI原生6G网络的无线世界模型

Ziqi Chen, Yi Ren, Yixuan Huang, Qi Sun, Nan Li, Yuhong Huang, Chih-Lin I, Yifan Li, Liang Xia

机构 * China Mobile Research Institute(中国移动研究院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出无线世界模型(WWM),通过内化三维几何与信号动态的因果关系,预测无线信道的时空演化,实现跨动态环境的泛化能力,优于现有单模基础模型和任务专用模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22013 2026-03-27 cs.CV 57%

RobustVisRAG: Causality-Aware Vision-Based Retrieval-Augmented Generation under Visual Degradations

RobustVisRAG: 基于因果性的视觉增强检索增强生成方法在视觉退化下的鲁棒性

I-Hsiang Chen, Yu-Wei Liu, Tse-Yu Wu, Yu-Chien Chiang, Jen-Chien Yang, Wei-Ting Chen

机构 * National Taiwan University(国立台湾大学) Microsoft(微软)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RobustVisRAG,通过双路径框架分离语义与退化因素,提升在视觉退化下的检索生成性能,实验显示在真实退化条件下性能提升显著。

Comments Accepted by CVPR2026; Project Page: https://robustvisrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05631 2026-03-27 cs.CV 57%

OFFSET: Segmentation-based Focus Shift Revision for Composed Image Retrieval

OFFSET: 基于分割的聚焦偏移修正用于复合图像检索

Zhiwei Chen, Yupeng Hu, Zixu Li, Zhiheng Fu, Xuemeng Song, Liqiang Nie

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出OFFSET网络,通过分割模块和双聚焦映射模块修正复合图像检索中的视觉和文本焦点偏差,提升检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24744 2026-03-27 cs.LG 50%

Contrastive Learning Boosts Deterministic and Generative Models for Weather Data

对比学习提升确定性和生成性模型用于天气数据

Nathan Bailey

机构 * Imperial College London(帝国理工学院伦敦分校) The Grantham Institute for Climate Change(格兰塔姆气候变化研究所)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文研究对比学习在天气数据压缩中的应用,提出SPARTA模型,通过对比损失和图神经网络融合提升稀疏数据的嵌入质量,提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 15 篇

2603.25108 2026-03-27 cs.CV 83%

MSRL: Scaling Generative Multimodal Reward Modeling via Multi-Stage Reinforcement Learning

MSRL: 通过多阶段强化学习扩展生成多模态奖励建模

Chenglong Wang, Yifu Huo, Yang Gan, Qiaozhi He, Qi Meng, Bei Li, Yan Wang, Junfu Liu, Tianhua Zhou, Jingbo Zhu, Tong Xiao

机构 * Northeastern University, Shenyang, China(东北大学(沈阳)) ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MSRL方法,通过多阶段强化学习在有限多模态数据下扩展生成多模态奖励模型,提升视觉理解和生成任务性能,无需额外标注数据。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24821 2026-03-27 cs.CV cs.AI 81%

Ming-Flash-Omni: A Sparse, Unified Architecture for Multimodal Perception and Generation

明闪奥米:一种稀疏、统一的多模态感知与生成架构

Inclusion AI, :, Bowen Ma, Cheng Zou, ChengKun Du, Canxiang Yan, Chunxiang Jin, Chunjie Shen, Chenyu Lian, Chengxiang Fan, Dandan Zheng, Fudong Wang, Furong Xu, Guangming Yao, Haohao Liu, Han Peng, Jun Zhou, Junluan Xia, Jingdong Chen, Jianing Li, Jianxin Sun, Jianjiang Zhu, Jianping Jiang, Jinpeng Ou, Jun Peng, Jin Peng, Kaixiang Ji, Li Tang, Libin Wang, Lixiang Ru, Longhua Tan, Lu Ma, Lan Wang, Mochen Bai, Minghong Cai, Mingxue Yang, Ning Gao, Qingpei Guo, Qinglong Zhang, Qiang Xu, Qin Zhao, Rui Liu, Ruijie Xiong, Ruobing Zheng, Sirui Gao, Shaoxiong Lin, Tao Zhang, Tianqi Li, Tinghao Liu, Tongli Wang, Taoye Huang, Weilong Chai, Xiaomei Wang, Xiaolong Wang, Xiaojian Liu, Xiao Lu, Xiaoyu Li, Xingning Dong, Xuzheng Yu, Xuezhi Wang, Yi Yuan, Yuting Gao, Yuting Xiao, Yunxiao Sun, Yipeng Chen, Yifan Mao, Yifei Wu, Yongjie Lyu, Yingying Zhang, YuQian Li, Ziping Ma, Zhiqiang Fang, Zhihao Qiu, Ziyuan Huang, Zizheng Yang, Zhengyu He

机构 * Inclusion AI Ant Group(Inclusion AI蚂蚁集团)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 Ming-Flash-Omni基于稀疏的MoE变体Ling-Flash-2.0,实现高效扩展和多模态统一智能,展现强多模态理解与生成能力,接近AGI水平。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15780 2026-03-27 cs.AI cs.CL 81%

TrustGeoGen: Formal-Verified Data Engine for Trustworthy Multi-modal Geometric Problem Solving

TrustGeoGen: 用于可信多模态几何问题求解的正式验证数据引擎

Daocheng Fu, Jianlong Chen, Renqiu Xia, Zijun Chen, Qi Liu, Yuan Feng, Hongbin Zhou, Renrui Zhang, Shiyang Feng, Peng Gao, Hongyuan Zha, Junchi Yan, Botian Shi, Yu Qiao, Bo Zhang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrustGeoGen,通过正式验证生成多模态几何数据,提升模型深度几何推理能力,在GeoQA等基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25565 2026-03-27 cs.CV 79%

GeoHeight-Bench: Towards Height-Aware Multimodal Reasoning in Remote Sensing

GeoHeight-Bench:迈向遥感中基于高度的多模态推理

Xuran Hu, Zhitong Xiong, Zhongcheng Hong, Yifang Ban, Xiaoxiang Zhu, Wufan Zhao

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University of Munich(慕尼黑工业大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出GeoHeight-Bench,通过构建高度感知的遥感理解评估框架,解决现有多模态模型在复杂遥感几何和灾害场景中忽略垂直维度的问题,提出数据生成管道和基准测试,并验证高度感知的重要性。

Comments 18 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11827 2026-03-27 cs.CV 79%

Multimodal classification of Radiation-Induced Contrast Enhancements and tumor recurrence using deep learning

基于深度学习的多模态放射性对比增强和肿瘤复发分类

Robin Peretzke, Marlin Hanstein, Maximilian Fischer, Lars Badhi Wessel, Obada Alhalabi, Sebastian Regnery, Andreas Kudak, Maximilian Deng, Tanja Eichkorn, Philipp Hoegen Saßmannshausen, Fabian Allmendinger, Jan-Hendrik Bolten, Philipp Schröter, Christine Jungk, Jürgen Peter Debus, Peter Neher, Laila König, Klaus Maier-Hein

机构 * Deutsches Krebsforschungszentrum (DKFZ)(德国癌症研究中心) Heidelberg University(海德堡大学) Heidelberg University Hospital(海德堡大学医院) Research Campus M2OLIE(M2OLIE研究园区) German Cancer Consortium (DKTK)(德国癌症联盟) Universitätsklinikum Heidelberg(海德堡大学医院) Heidelberger Institut für Radioonkologie (HIRO)(海德堡放射肿瘤学研究所) National Center for Tumor Diseases (NCT)(国家肿瘤疾病中心) Heidelberger Ionenstrahl-Therapiezentrum (HIT)(海德堡离子束治疗中心) Universitätsklinikum Heidelberg, Neurochirurgie(海德堡大学医院神经外科)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出RICE-NET模型,利用纵向MRI数据与放疗剂量分布,通过常规T1加权MRI实现自动病变分类,实验显示在92名患者中达到0.92的F1分数,证明多模态深度学习在神经肿瘤学中的诊断潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20060 2026-03-27 cs.CV cs.RO 74%

MeanFuser: Fast One-Step Multi-Modal Trajectory Generation and Adaptive Reconstruction via MeanFlow for End-to-End Autonomous Driving

MeanFuser: 一种基于MeanFlow的高效多模态轨迹生成与自适应重构方法用于端到端自动驾驶

Junli Wang, Yinan Zheng, Xueyi Liu, Zebin Xing, Pengfei Li, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Zhongpu Xia, Long Chen, Qichao Zhang

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Xiaomi EV(小米汽车) Institute for AI Industry Research (AIR), Tsinghua University(清华大学智能产业研究院)

专题命中 多模态生成 :multi-modal(title);分类 cs.CV

AI总结 本文提出MeanFuser,通过引入Gaussian Mixture Noise、MeanFlow Identity和轻量级ARM模块,实现了高效且鲁棒的多模态轨迹生成与自适应重构,提升了端到端自动驾驶的性能和效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13303 2026-03-27 cs.CV 70%

ShowTable: Unlocking Creative Table Visualization with Collaborative Reflection and Refinement

ShowTable:通过协作反思与精炼解锁创意表格可视化

Zhihang Liu, Xiaoyi Bao, Pandeng Li, Junjie Zhou, Zhaohe Liao, Yefei He, Kaixun Jiang, Chen-Wei Xie, Yun Zheng, Hongtao Xie

机构 * USTC(中国科学技术大学) CASIA(中国科学院自动化研究所) NJU(南京大学) SJTU(上海交通大学) ZJU(浙江大学) FDU(福建师范大学) Tongyi Lab(通义实验室)

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ShowTable框架,结合大语言模型与扩散模型,通过逐步自我纠正过程实现创意表格可视化,引入TableVisBench基准测试,展示其在多模态推理、生成和纠错方面的优势。

Comments Accepted to CVPR 2026, project page: https://lntzm.github.io/showtable-page/

详情

展开后加载摘要…

URL PDF HTML 收藏