arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-20 至 2026-03-20 共收录 76 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2603.19029 2026-03-20 cs.RO 50%

ATG-MoE: Autoregressive trajectory generation with mixture-of-experts for assembly skill learning

ATG-MoE:基于混合专家的自主轨迹生成用于装配技能学习

Weihang Huang, Chaoran Zhang, Xiaoxin Deng, Hao Zhou, Zhaobo Xu, Shubo Cui, Long Zeng

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Faculty of Engineering, Imperial College London(伦敦帝国理工学院工程学院)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出ATG-MoE,通过混合专家架构实现多技能整合,解决传统方法在多阶段设计和多技能整合能力上的不足,实验显示其在模拟和实际应用中均表现优异。

Comments 32 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18771 2026-03-20 cs.RO 50%

Empathetic Motion Generation for Humanoid Educational Robots via Reasoning-Guided Vision--Language--Motion Diffusion Architecture

通过推理引导的视觉-语言-运动扩散架构生成 empathetic 动作 for 人类教育机器人

Fuze Sun, Lingyu Li, Lekan Dai, Xinyu Fan

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 多模态生成 :multi-modal(abstract)

AI总结 本文提出RG-VLMD框架,通过多模态情感估计、教学推理和教学-动作条件运动合成,生成适应性且语义一致的机器人行为。实验表明,推理引导的指令条件生成提升了教育人机交互中的动作可控性和教学表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18755 2026-03-20 math.AP 50%

Spreading of pathological proteins through brain networks: a case study for Alzheimers disease

病理蛋白通过脑网络的传播:阿尔茨海默病的案例研究

G. Landi, A. Scaravelli, M. C. Tesi, C. Testa

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文通过数学建模研究阿尔茨海默病中tau蛋白的传播,探讨不同网络框架对蛋白质动态的影响,并验证模型与临床数据的一致性。

Comments 23 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 20 篇

2603.18611 2026-03-20 cs.CL cs.CV 84%

Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media

跨模态推理迁移用于社交媒体上可解释的人道主义分类

Thi Huyen Nguyen, Koustav Rudra, Wolfgang Nejdl

机构 * L3S Research Center \ University Hannover Hannover Germany Indian Institute of Technology Kharagpur Kharagpur India L3S Research Center\ University Hannover Hannover Germany L3S Research Center \ University Hannover Indian Institute of Technology Kharagpur L3S Research Center\ University Hannover

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种跨模态推理迁移框架,通过文本和图像联合表示提取文本和图像推理,提升人道主义分类的可解释性,实验表明在CrisisMMD数据集上宏F1提升2-35%,并在零样本模式下达到80%的准确率。

Comments Accepted at WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19077 2026-03-20 cs.CV 83%

Multi-Modal Building Change Detection for Large-Scale Small Changes: Benchmark and Baseline

多模态大规模小变化建筑物变化检测:基准与基线

Ye Wang, Wei Lu, Zhihui You, Keyan Chen, Tongfei Liu, Kaiyu Li, Hongruixuan Chen, Qingling Shu, Sibao Chen

机构 * MOE Key Lab of ICSP, Anhui Provincial Key Lab of Multimodal Cognitive Computation, IMIS Lab of Anhui Province, School of Computer Science and Technology, Anhui University, Hefei, China(教育部信息与通信领域重点实验室、安徽省多模态认知计算重点实验室、安徽省IMIS实验室、计算机科学与技术学院、安徽大学、合肥,中国) School of Public Safety and Emergency Management, Anhui University of Science and Technology, Hefei 231131, China(公共安全与应急管理学院、安徽理工大学、合肥231131,中国) College of Computing and Data Science, Nanyang Technological University, Singapore 639798(计算与数据科学学院、南洋理工大学、新加坡639798) Shaanxi Joint Laboratory of Artificial Intelligence, Shaanxi University of Science and Technology, Xi’an 710021, China(人工智能联合实验室、陕西科技大学、西安710021,中国) School of Software Engineering, Xi’an Jiaotong University, Xi’an 710049, China(软件工程学院、西安交通大学、西安710049,中国) Graduate School of Frontier Sciences, The University of Tokyo, Chiba, 277-8561, Japan(前沿科学研究生院、东京大学、千叶,日本)

专题命中 多模态评测 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出LSMD多模态数据集和MSCNet网络,通过融合RGB和NIR信息提升小变化检测精度,验证了多模态特征融合的有效性。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21475 2026-03-20 cs.AI 83%

MMSearch-Plus: Benchmarking Provenance-Aware Search for Multimodal Browsing Agents

MMSearch-Plus:面向多模态浏览代理的溯源感知基准测试

Xijia Tao, Yihua Teng, Xinxing Su, Xinyu Fu, Jihao Wu, Chaofan Tao, Ziru Liu, Haoli Bai, Rui Liu, Lingpeng Kong

机构 * The University of Hong Kong (HKU)(香港大学) Huawei Inc(华为公司)

专题命中 多模态评测 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 MMSearch-Plus是一个包含311个任务的基准测试,通过迭代图像-文本检索和交叉验证在噪声下强制多模态理解,提供模型无关的代理框架和集中标记模块,提升多步推理的鲁棒性。

Comments Project Page: https://mmsearch-plus.github.io

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00204 2026-03-20 cs.MM cs.SI 83%

MSM-BD: Multimodal Social Media Bot Detection Using Heterogeneous Information

MSM-BD:基于异构信息的多模态社交媒体机器人检测

Tingxuan Wu, Zhaorui Ma, Yanjun Cui, Ziyi Zhou, Eric Wang

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出MSM-BD方法,通过异构信息融合技术提升社交媒体机器人检测精度,利用TwiBot-22数据集验证了模型有效性。

Comments Springer Nature in Studies in Computational Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00030 2026-03-20 cs.LG 82%

Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement

模态均衡至关重要:面向跨模态记忆增强的次要模态感知自适应交替方法

Xiang Shi, Rui Zhang, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院)

专题命中 多模态评测 :cross-modal(title,abstract);multimodal(abstract)

AI总结 本文提出一种基于Shapley值的自适应交替训练框架,通过优先考虑次要模态平衡融合,引入记忆模块和跨模态映射机制,提升多模态学习性能,在四个基准数据集上取得SOTA结果。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17759 2026-03-20 cs.CL cs.AI 81%

Harm or Humor: A Multimodal, Multilingual Benchmark for Overt and Covert Harmful Humor

有害或幽默:一个多模态、多语言的基准测试用于显性与隐性有害幽默

Ahmed Sharshar, Hosam Elgendy, Saad El Dine Ahmed, Yasser Rohaim, Yuxia Wang

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学) INSAIT

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个多模态、多语言基准测试,用于检测和理解有害和冒犯性幽默,通过对比不同模型在英语和阿拉伯语中的表现,强调文化背景和推理能力的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18425 2026-03-20 cs.CL 79%

Multimodal Task Interference: A Benchmark and Analysis of History-Target Mismatch in Multimodal LLMs

多模态任务干扰:多模态大语言模型中历史-目标不匹配的基准与分析

Masayuki Kawarada, Tatsuya Ishigaki, Hiroya Takamura

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 研究多模态大语言模型中任务切换导致的性能下降问题,通过六个任务的基准测试发现,从纯文本切换到图像目标会导致严重性能下降,而反向切换则影响较小,且多模态差异是主要干扰因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05751 2026-03-20 cs.CV 79%

SenseShift6D: Multimodal RGB-D Benchmarking for Robust 6D Pose Estimation across Environment and Sensor Variations

SenseShift6D:多模态RGB-D基准测试用于在环境和传感器变化下的鲁棒6D位姿估计

Yegyu Han, Taegyoon Yoon, Dayeon Woo, Sojeong Kim, Hyung-Sin Kim

机构 * Graduate School of Data Science(数据科学研究生院)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 SenseShift6D通过多样的光照和传感器设置,评估了6D位姿估计在真实环境中的鲁棒性,揭示了传感器和环境变化对性能的影响,推动了多模态传感器选择的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18344 2026-03-20 cs.RO cs.HC cs.LG cs.MA 78%

HRI-SA: A Multimodal Dataset for Online Assessment of Human Situational Awareness during Remote Human-Robot Teaming

HRI-SA:一种用于远程人机协同中在线人类情境意识评估的多模态数据集

Hashini Senaratne, Richard Attfield, Samith Widhanapathirana, David Howard, Cecile Paris, Dana Kulic, Leimin Tian

机构 * CSIRO Robotics(CSIRO机器人实验室) Monash Robotics(莫纳什大学机器人实验室)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出HRI-SA数据集,用于评估远程人机协同中的人类情境意识,通过眼动、瞳孔直径等多模态数据,验证了通用眼动特征在检测感知情境意识延迟中的有效性。

Comments This work is currently under peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18032 2026-03-20 cs.LG cond-mat.mtrl-sci 78%

Multimodal Machine Learning for Soft High-k Elastomers under Data Scarcity

多模态学习用于数据稀缺下的软高k电弹性体

Brijesh FNU, Viet Thanh Duy Nguyen, Ashima Sharma, Md Harun Rashid Molla, Chengyi Xu, Truong-Son Hy

机构 * Department of Mechanical and Materials Engineering, School of Engineering, The University of Alabama at Birmingham (UAB)(机械与材料工程系,工程学院,阿拉巴马大学伯明翰分校) Department of Computer Science, College of Arts and Sciences, The University of Alabama at Birmingham (UAB)(计算机科学系,文理学院,阿拉巴马大学伯明翰分校)

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 本文提出多模态学习框架,通过聚合实验数据构建高质量电弹性体数据库,利用预训练聚合表示实现少样本预测,加速发现高k电弹性体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19217 2026-03-20 cs.CV 77%

LVOmniBench: Pioneering Long Audio-Video Understanding Evaluation for Omnimodal LLMs

LVOmniBench:开创性长音频视频理解评估用于多模态大语言模型

Keda Tao, Yuhua Zheng, Jia Xu, Wenjie Du, Kele Shao, Hesong Wang, Xueyi Chen, Xin Jin, Junhan Zhu, Bohan Yu, Weiqiang Wang, Jian Liu, Can Qin, Yulun Zhang, Ming-Hsuan Yang, Huan Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Shanghai Jiao Tong University(上海交通大学) University of California Merced(加州大学默塞德分校)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 LVOmniBench旨在评估多模态大语言模型在长音频视频中的跨模态理解能力,通过275个10至90分钟的高质量视频和1014个问题-答案对,揭示当前模型在处理长形式输入时的挑战。

Comments Project page: https://kd-tao.github.io/LVOmniBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18418 2026-03-20 cs.CV cs.AI 73%

Mind the Rarities: Can Rare Skin Diseases Be Reliably Diagnosed via Diagnostic Reasoning?

注意罕见病:罕见皮肤疾病能否通过诊断推理可靠诊断?

Yang Liu, Jiyao Yang, Hongjin Zhao, Xiaoyong Li, Yanzhe Ji, Xingjian Li, Runmin Jiang, Tianyang Wang, Saeed Anwar, Dongwoo Kim, Yue Yao, Zhenyue Qin, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Australian National University(澳大利亚国立大学) University of Western Australia(西澳大学) POSTECH Yale University(耶鲁大学)

专题命中 多模态评测 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DermCase基准,通过多模态数据评估罕见皮肤疾病诊断推理能力,揭示现有模型在诊断准确性和临床推理中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18741 2026-03-20 cs.CY cs.SE 71%

Beyond the Code: A Multi-Modal Assessment Strategy for Fostering Professional Competencies via Introductory Programming Projects

超越代码:一种多模态评估策略,通过入门编程项目培养专业能力

Santiago Berrezueta-Guzman, Vanesa Metaj, Stefan Wagner

专题命中 多模态评测 :multi-modal(title)

AI总结 本文通过项目式学习框架开发2D迷宫跑游戏,提出四维评估模型提升编程基础和沟通能力,为现代软件工程教育提供可扩展的课程改革方案。

Comments Article submitted to IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18712 2026-03-20 cs.AI 70%

Accurate and Efficient Multi-Channel Time Series Forecasting via Sparse Attention Mechanism

通过稀疏注意力机制实现准确且高效的多通道时间序列预测

Lei Gao, Hengda Bao, Jingfei Fang, Guangzheng Wu, Weihua Zhou, Yun Zhou

机构 * Department of Machine Learning(机器学习系) SF Express(顺丰快递) Department of Management(管理系) Zhejiang University of Technology(浙江工业大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 本文提出Li-Net架构,通过稀疏Top-K Softmax注意力机制和多尺度投影框架,有效捕捉多通道时间序列的线性和非线性依赖,提升预测精度与效率。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18508 2026-03-20 cs.CV cs.AI 62%

Foundations and Architectures of Artificial Intelligence for Motor Insurance

人工智能在机动车保险中的基础与架构

Teerapong Panboonyuen

机构 * Thaivivat Insurance Public Company Limited(泰维瓦特保险公共公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文系统阐述了机动车保险中人工智能的基础与架构,结合大规模实际应用,提出统一的垂直整合AI范式,整合感知、多模态推理和生产基础设施,实现汽车风险评估和理赔流程的端到端自动化。

Comments 173 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19059 2026-03-20 cs.CV 57%

SignAgent: Agentic LLMs for Linguistically-Grounded Sign Language Annotation and Dataset Curation

SignAgent:用于语言学基础的手语标注和数据集整理的代理LLM

Oliver Cory, Ozge Mercanoglu Sincan, Richard Bowden

机构 * Centre for Vision, Speech and Signal Processing(视觉、语音和信号处理中心)

专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出SignAgent,一种利用大语言模型进行可扩展、语言学基础的手语标注和数据集整理的新框架。通过SignAgent协调器和SignGraph,解决传统方法和手动标注的瓶颈,实现大规模语言感知数据标注。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18662 2026-03-20 cs.AI 57%

Thinking with Constructions: A Benchmark and Policy Optimization for Visual-Text Interleaved Geometric Reasoning

通过构造进行思考:一种用于视觉-文本交错几何推理的基准和策略优化

Haokun Zhao, Wanshi Xu, Haidong Yuan, Songjun Cao, Long Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of ECE, Peking University(北京大学电子工程学院) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GeoAux-Bench基准和A2PO策略优化框架,通过交错视觉-文本辅助工具提升几何推理性能,实验表明有效构造能降低推理困惑度,使MLLMs在选择性辅助构造上获得3.51%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04095 2026-03-20 cs.CV 57%

Multi-Scale Distillation for RGB-D Anomaly Detection on the PD-REAL Dataset

多尺度蒸馏用于PD-REAL数据集上的RGB-D异常检测

Jianjian Qin, Chao Zhang, Chunzhi Gu, Zi Wang, Jun Yu, Yijin Wei, Hui Xiao, Xin Yu

机构 * Ningbotech University(Ningbotech大学) University of Toyama(东洋大学) University of Fukui(福井大学) Niigata University(北九州大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出PD-REAL数据集,用于无监督3D域异常检测,通过多尺度教师-学生框架提升多模态异常检测性能,实验表明方法在检测精度上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18496 2026-03-20 cs.CV 57%

NymeriaPlus: Enriching Nymeria Dataset with Additional Annotations and Data

NymeriaPlus:通过额外标注和数据丰富Nymeria数据集

Daniel DeTone, Federica Bogo, Eric-Tuan Le, Duncan Frost, Julian Straub, Yawar Siddiqui, Yuting Ye, Jakob Engel, Richard Newcombe, Lingni Ma

机构 * Meta Reality Labs Research(Meta现实实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文通过改进人体动作标注、添加密集3D标注和多模态数据,提升Nymeria数据集的综合性能,为野外观测数据研究提供更强大的支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18465 2026-03-20 cs.CV 57%

MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling

MedQ-UNI: 向通过视觉-语言建模实现医学图像质量评估与修复的统一迈进

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MedQ-UNI,一种统一的视觉-语言模型,通过先评估再修复的范式,利用医学图像质量评估指导医学图像修复,实现了跨模态和降质类型的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 2 篇

2603.15030 2026-03-20 cs.AI 79%

VTC-Bench: Evaluating Agentic Multimodal Models via Compositional Visual Tool Chaining

VTC-Bench:通过组合视觉工具链评估代理多模态模型

Xuanyu Zhu, Yuhao Dong, Rundong Wang, Yang Shi, Zhipeng Wu, Yinlun Peng, YiFan Zhang, Yihang Lou, Yuanxing Zhang, Ziwei Liu, Yan Bai, Yuan Zhou

机构 * PKU(北京大学) NTU(国立台湾大学) USTC(中国科学技术大学) CQU(重庆大学) NUDT(南京理工大学) CASIA(中国科学院自动化研究所) Meituan(美团)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 VTC-Bench通过组合视觉工具链评估多模态大语言模型的工具使用能力,揭示了当前模型在复杂任务中适应性和多工具组合方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09909 2026-03-20 cs.AI 79%

MedMASLab: A Unified Orchestration Framework for Benchmarking Multimodal Medical Multi-Agent Systems

MedMASLab:多模态医疗多智能体系统的统一协调框架

Yunhang Qian, Xiaobin Hu, Jiaquan Yu, Siyang Xin, Xiaokun Chen, Jiangning Zhang, Peng-Tao Jiang, Jiawei Liu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学) vivo Stanford University(斯坦福大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出MedMASLab框架,解决医疗多智能体系统中多模态整合碎片化问题,通过标准化通信协议、自动化评估器和大规模基准测试,揭示领域特定性能差距,为未来自主临床系统建立新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 12 篇

2603.18462 2026-03-20 cs.AI 85%

AlignMamba-2: Enhancing Multimodal Fusion and Sentiment Analysis with Modality-Aware Mamba

AlignMamba-2:通过模态感知Mamba增强多模态融合与情感分析

Yan Li, Yifei Xing, Xiangyuan Lan, Xin Li, Haifeng Chen, Dongmei Jiang

机构 * Pengcheng Laboratory(鹏城实验室) Shaanxi University of Science & Technology(陕西科技大学) School of Computer Science(计算机科学学院) Northwestern Polytechnical University(西北工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.AI

AI总结 本文提出AlignMamba-2框架,通过双对齐策略和模态感知Mamba层,提升多模态融合与情感分析的效率与效果,实验表明其在动态时间序列和静态图像任务中均达到新水平。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19026 2026-03-20 cs.CV 83%

Rethinking MLLM Itself as a Segmenter with a Single Segmentation Token

重新思考MLLM本身作为分割器:仅用一个分割标记

Anqi Zhang, Xiaokang Ji, Guangyu Gao, Jianbo Jiao, Chi Harold Liu, Yunchao Wei

机构 * Beijing Institute of Technology(北京理工大学) University of Birmingham(伯明翰大学) Beijing Jiaotong University(北京交通大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文提出SELF1E方法,通过保留原始图像分辨率并利用残差特征提升分割精度,无需外部解码器即可实现与专业解码器相当的分割性能。

Comments Paper is accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16861 2026-03-20 cs.CV cs.AI 81%

Look Before You Fuse: 2D-Guided Cross-Modal Alignment for Robust 3D Detection

先看再融合:基于2D引导的跨模态对齐用于鲁棒的3D检测

Xiang Li, Zhangchi Hu, Xiao Xu, Bin Kong

机构 * Institute of Intelligent Machines, Hefei Institutes of Physical Science, Chinese Academy of Sciences(智能机器研究所,合肥物理科学研究院,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出利用2D对象先验进行跨模态特征预对齐,解决LiDAR与相机特征的空间错位问题,提升3D检测鲁棒性。

Comments accepted to cvpr 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18660 2026-03-20 cs.CV 79%

Multimodal Model for Computational Pathology:Representation Learning and Image Compression

多模态模型用于计算病理学:表示学习与图像压缩

Peihang Wu, Zehong Chen, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳大学先进技术学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文探讨了多模态计算病理学中的表示学习和图像压缩技术,分析了自监督学习、多模态数据生成、参数高效适应及多代理协作推理等方向,旨在提升病理诊断的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV 79%

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏