arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-03-11 至 2026-03-11 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 14 篇

2603.01479 2026-03-11 cs.RO 78%

Multimodal Adversarial Quality Policy for Safe Grasping

多模态对抗质量策略用于安全抓取

Kunlin Xie, Chenghao Li, Haolan Zhang, Nak Young Chong

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 本文提出多模态对抗质量策略,通过双补丁优化和梯度平衡策略实现安全抓取,提升多模态环境下机器人抓取的安全性和鲁棒性。

Comments submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08998 2026-03-11 cs.CV 74%

Diffusion-Based Authentication of Copy Detection Patterns: A Multimodal Framework with Printer Signature Conditioning

基于扩散的复制检测模式认证:一种多模态框架与打印机签名条件化

Bolutife Atoki, Iuliia Tkachenko, Bertrand Kerautret, Carlos Crispim-Junior

机构 * Université Lumière Lyon 2, CNRS, INSA Lyon, Universite Claude Bernard Lyon 1, LIRIS UMR5205(里摩日大学里昂2分校、法国国家科学研究中心、里昂国立应用科学学院、里昂大学克莱尔-贝尔纳分校、LIRIS UMR5205)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 本文提出基于扩散的多模态认证框架,利用打印机签名条件化技术,实现对复制检测模式的高效认证,优于传统方法和深度学习方法。

Comments Accepted at WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09125 2026-03-11 cs.CV cs.AI 73%

QUSR: Quality-Aware and Uncertainty-Guided Image Super-Resolution Diffusion Model

QUSR: 一种基于质量感知和不确定性引导的图像超分辨率扩散模型

Junjie Yin, Jiaju Li, Hanfa Xing

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 QUSR通过引入质量感知先验和不确定性引导噪声生成模块,提升图像超分辨率在复杂场景下的真实感和细节还原能力。

Comments This paper has been accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13756 2026-03-11 cs.CV cs.AI cs.LG 62%

RECODE: Reasoning Through Code Generation for Visual Question Answering

RECODE: 通过代码生成进行视觉问答的推理

Junhong Shen, Mu Cai, Bo Hu, Ameet Talwalkar, David A Ross, Cordelia Schmid, Alireza Fathi

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 RECODE通过代码生成实现视觉问答的可验证推理,优于传统方法。

Comments The authors are withdrawing this manuscript temporarily to conduct additional checks of the experimental setup and implementation. We plan to post an updated version after completing these checks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09759 2026-03-11 cs.CV 57%

LogoDiffuser: Training-Free Multilingual Logo Generation and Stylization via Letter-Aware Attention Control

LogoDiffuser: 无需训练的多语言标志生成与风格化通过字母感知注意力控制

Mingyu Kang, Hyein Seo, Yuna Jeong, Junhyeong Park, Yong Suk Choi

机构 * Department of Artificial Intelligence, Hanyang University(翰阳大学人工智能系) Department of Computer Science, Hanyang University(翰阳大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 LogoDiffuser通过字母感知注意力控制,无需训练实现多语言标志生成与风格化,通过多模态扩散变换器整合字符结构与视觉设计,提升多语言标志生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24417 2026-03-11 cs.CV 57%

EasyText: Controllable Diffusion Transformer for Multilingual Text Rendering

EasyText: 用于多语言文本渲染的可控扩散变换器

Runnan Lu, Yuxuan Zhang, Jiaming Liu, Haofan Wang, Yiren Song

专题命中 多模态生成 :image-text(abstract);分类 cs.CV

AI总结 EasyText提出了一种基于DiT的可控扩散变换器,用于多语言文本渲染,通过字符位置编码和插值技术实现精确生成,并利用大规模数据集提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08387 2026-03-11 cs.CV 57%

Recognition-Synergistic Scene Text Editing

识别协同场景文本编辑

Zhengyao Fang, Pengyuan Lyu, Jingjing Wu, Chengquan Zhang, Jun Yu, Guangming Lu, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Tencent(腾讯) Department of Computer Vision Technology, Baidu Inc.(百度公司计算机视觉技术部门)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 RS-STE通过整合文本识别与编辑的协同效应,提出了一种统一框架,实现高效且一致的场景文本编辑,提升了复杂场景下的性能。

Comments accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09075 2026-03-11 eess.IV 50%

M2Diff: Multi-Modality Multi-Task Enhanced Diffusion Model for MRI-Guided Low-Dose PET Enhancement

M2Diff:多模态多任务增强扩散模型用于MRI引导的低剂量PET增强

Ghulam Nabi Ahmad Hassan Yar, Himashi Peiris, Victoria Mar, Cameron Dennis Pain, Zhaolin Chen

专题命中 多模态生成 :multi-modal(abstract)

AI总结 M2Diff通过多模态多任务扩散模型,利用MRI和低剂量PET扫描分别学习模态特定特征,并通过层次化特征融合重建标准剂量PET,从而提升重建保真度。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 11 篇

2603.09478 2026-03-11 cs.MM 83%

MORE-R1: Guiding LVLM for Multimodal Object-Entity Relation Extraction via Stepwise Reasoning with Reinforcement Learning

MORE-R1: 通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取的分步推理

Xiang Yuan, Xu Chu, Xinrong Chen, Haochen Li, Zonghong Dai, Hongcheng Fan, Xiaoyue Yuan, Weiping Li, Tong Mo

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 MORE-R1通过强化学习引导大视觉-语言模型进行多模态对象-实体关系提取,提升推理能力与模型性能。

Comments Accepted by the 31st International Conference on Database Systems for Advanced Applications. This is the Accepted Manuscript (AM) version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09320 2026-03-11 cs.CV cs.AI 81%

SpaceSense-Bench: A Large-Scale Multi-Modal Benchmark for Spacecraft Perception and Pose Estimation

SpaceSense-Bench: 一个大规模多模态基准用于航天器感知与姿态估计

Aodi Wu, Jianhong Zuo, Zeyuan Zhao, Xubo Luo, Ruisuo Wang, Xue Wan

机构 * University of Chinese Academy of Sciences(中国科学院大学) Technology and Engineering Center for Space Utilization, Chinese Academy of Sciences(中国科学院空间利用技术与工程中心) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 SpaceSense-Bench通过大规模多模态数据集提升航天器感知与姿态估计的鲁棒性与准确性。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 81%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 多模态评测 :MLLM(title);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09874 2026-03-11 cs.CV 79%

MissBench: Benchmarking Multimodal Affective Analysis under Imbalanced Missing Modalities

MissBench:在不平衡缺失模态下的多模态情感分析基准测试

Tien Anh Pham, Phuong-Anh Nguyen, Duc-Trong Le, Cam-Van Thi Nguyen

机构 * VNU University of Engineering and Technology(越南工程技术大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 MissBench通过标准化不平衡缺失模态协议和定义诊断指标,为多模态情感分析提供实用工具,揭示模型在不完整模态下的公平性和优化问题

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09940 2026-03-11 cs.LG 78%

SignalMC-MED: A Multimodal Benchmark for Evaluating Biosignal Foundation Models on Single-Lead ECG and PPG

SignalMC-MED: 一种用于评估单导联ECG和PPG上生物信号基础模型的多模态基准

Fredrik K. Gustafsson, Xiao Gu, Mattia Carletti, Patitapaban Palo, David W. Eyre, David A. Clifton

专题命中 多模态评测 :multimodal(title,abstract)

AI总结 SignalMC-MED是一个用于评估单导联ECG和PPG上生物信号基础模型的多模态基准,展示了多模态融合和长时信号在提升模型性能上的优势。

Comments Code is available at https://github.com/fregu856/SignalMC-MED

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08008 2026-03-11 cs.CV 77%

A Survey on Wi-Fi Sensing Generalizability: Taxonomy, Techniques, Datasets, and Future Research Prospects

关于Wi-Fi感知通用性的综述:分类、技术、数据集与未来研究前景

Fei Wang, Tingting Zhang, Wei Xi, Han Ding, Ge Wang, Di Zhang, Yuanhao Cui, Fan Liu, Jinsong Han, Jie Xu, Tony Xiao Han

机构 * School of Software Engineering and the State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Xi’an Jiaotong University(软件工程学院和人机混合增强智能国家重点实验室,西安交通大学) School of Computer Science and Technology, Xi’an Jiaotong University(计算机科学与技术学院,西安交通大学) Information and Communication Engineering,Beijing University of Posts and Telecommunications(信息与通信工程,北京邮电大学) School of Information Science and Engineering, Southeast University(信息科学与工程学院,东南大学)

专题命中 多模态评测 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文综述了Wi-Fi感知通用性研究,涵盖技术分类、数据集及未来方向,旨在提升系统在不同环境下的适应能力。

Comments Accepted for publication in IEEE Communications Surveys & Tutorials 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09774 2026-03-11 cs.AI 70%

World2Mind: Cognition Toolkit for Allocentric Spatial Reasoning in Foundation Models

World2Mind: 用于基础模型的方位认知工具包

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Hang Su, Yubin Wang

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) Dept. of Comp. Sci. and Tech., Institute for AI, Tsinghua-Bosch Joint ML Center, THBI Lab, BNRist Center, Tsinghua University(清华大学人工智能院计算机科学与技术系、清华大学-博世联合机器学习中心、THBI实验室、BNRist中心、清华大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.AI

AI总结 World2Mind通过构建空间认知地图和三阶段推理链,提升基础模型的空间推理能力,使纯文本模型也能实现复杂3D空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 67%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09392 2026-03-11 cs.CV cs.AI 62%

ICDAR 2025 Competition on End-to-End Document Image Machine Translation Towards Complex Layouts

ICDAR 2025竞赛:面向复杂布局的端到端文档图像机器翻译

Yaping Zhang, Yupu Liang, Zhiyang Zhang, Zhiyuan Chen, Lu Xiang, Yang Zhao, Yu Zhou, Chengqing Zong

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Fanyu AI Laboratory, Zhongke Fanyu Technology Company Ltd.(中科泛宇人工智能实验室,中科泛宇科技有限公司)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 ICDAR 2025竞赛聚焦于复杂布局文档图像的端到端机器翻译,通过OCR-free和OCR-based两个赛道推动多模态文档理解领域的发展。

Comments accepted by ICDAR 2025

Journal ref ICDAR 2025. Lecture Notes in Computer Science, vol 16027

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21609 2026-03-11 cs.CV cs.LG 57%

VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment

VLCE:一种用于灾害评估图像描述的知识增强框架

Md. Mahfuzur Rahman, Kishor Datta Gupta, Marufa Kamal, Fahad Rahman, Sunzida Siddique, Ahmed Rafi Hasan, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) BRAC University(布拉克大学) United International University(国际联合大学) Daffodil International University(花王国际大学)

专题命中 多模态评测 :cross-modal(abstract);分类 cs.CV

AI总结 VLCE通过整合知识图谱提升灾害影像描述的准确性和领域相关性,其在RescueNet上优于QwenVL基线。

Comments 28 pages, 30 figures, 1 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08880 2026-03-11 cs.DB 50%

OptBench: An Interactive Workbench for AI/ML-SQL Co-Optimization[Extended Demonstration Proposal]

OptBench: 一个用于AI/ML-SQL联合优化的交互式工作台[扩展演示提案]

Jaykumar Tandel, Douglas Oscarson, Jia Zou

专题命中 多模态评测 :multimodal(abstract)

AI总结 OptBench是一个交互式工作台,用于构建和评估混合SQL+AI/ML查询的查询优化器,通过统一后端和交互式界面实现透明公平的比较。

Comments 12 pages. Extended version of accepted SIGMOD 2026 demonstration paper

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 7 篇

2508.18722 2026-03-11 cs.AI 83%

VistaWise: Building Cost-Effective Agent with Cross-Modal Knowledge Graph for Minecraft

VistaWise: 构建低成本代理的跨模态知识图谱用于Minecraft

Honghao Fu, Junlong Ren, Qi Chai, Deheng Ye, Yujun Cai, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Queensland(昆士兰大学) Tencent(腾讯)

专题命中 多模态Agent :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 VistaWise通过整合跨模态知识图谱和专用模型,实现低成本、高效率的Minecraft代理构建。

Comments Accepted by EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09415 2026-03-11 cs.RO cs.AI 79%

From Flow to One Step: Real-Time Multi-Modal Trajectory Policies via Implicit Maximum Likelihood Estimation-based Distribution Distillation

从流到一步:通过隐式最大似然估计基于的分布蒸馏实现实时多模轨迹策略

Ju Dong, Liding Zhang, Lei Zhang, Yu Fu, Kaixin Bai, Zoltan-Csaba Marton, Zhenshan Bing, Zhaopeng Chen, Alois Christian Knoll, Jianwei Zhang

机构 * TAMS (Technical Aspects of Multimodal Systems), Department of Informatics, University of Hamburg(汉堡大学信息学院TAMS(多模态系统技术方面)) Technical University of Munich(慕尼黑技术大学) Agile Robots SE(敏捷机器人公司)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 通过隐式最大似然估计基于的分布蒸馏,实现实时多模轨迹策略,提升机器人操作的高频闭环控制与鲁棒性。

Comments https://sites.google.com/view/flow2one, 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09018 2026-03-11 cs.AI 79%

Meissa: Multi-modal Medical Agentic Intelligence

Meissa:多模态医疗代理智能

Yixiong Chen, Xinyi Bai, Yue Pan, Zongwei Zhou, Alan Yuille

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.AI

AI总结 Meissa是一种轻量级多模态医疗代理智能模型,通过离线学习策略选择与执行,实现高效医疗决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20503 2026-03-11 cs.RO cs.AI cs.CL cs.CV cs.LG 67%

Embodied AI with Foundation Models for Mobile Service Robots: A Systematic Review

基于基础模型的具身AI在移动服务机器人中的应用:系统综述

Matthew Lisondra, Beno Benhabib, Goldie Nejat

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文系统综述了基础模型在移动服务机器人中的应用,探讨了其在具身AI中的整合、核心挑战及未来研究方向。

Comments v2: Expanded systematic review; resubmitted to Robotics

Journal ref Robotics 2026, 15(3), 55

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09733 2026-03-11 cs.CV cs.MA 57%

FetalAgents: A Multi-Agent System for Fetal Ultrasound Image and Video Analysis

FetalAgents:一种用于胎儿超声图像和视频分析的多智能体系统

Xiaotian Hu, Junwei Huang, Mingxuan Liu, Kasidit Anmahapong, Yifei Chen, Yitong Luo, Yiming Huang, Xuguang Bai, Zihan Li, Yi Liao, Haibo Qu, Qiyuan Tian

机构 * Tsinghua University(清华大学) University of California San Diego(加州大学圣地亚哥分校) West China Second University Hospital, Sichuan University(四川大学华西第二医院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV

AI总结 FetalAgents是一种多智能体系统,通过动态协调视觉专家,实现胎儿超声图像和视频的端到端分析与报告,提供高准确性和流程对齐的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08817 2026-03-11 cs.RO 50%

HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare

HMR-1: 基于视觉-语言模型的分层按摩机器人用于具身医疗

Rongtao Xu, Mingming Yu, Xiaofeng Han, Yu Zhang, Kaiyi Hu, Zhe Feng, Zenghuang Fu, Changwei Wang, Weiliang Meng, Xiaopeng Zhang

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Spatiotemporal AI, China(时空人工智能,中国) Hangzhou International Innovation Institute, Beihang University, China(杭州国际创新研究院,北航,中国) Georgia Institute of Technology, China(佐治亚理工学院,中国) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(计算功率网络与信息安全重点实验室,教育部;山东省计算机科学中心,齐鲁工业大学(山东省科学院),中国) Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences), China

专题命中 多模态Agent :multimodal(abstract)

AI总结 HMR-1提出基于视觉-语言模型的分层按摩机器人框架,通过构建多模态数据集和微调Qwen-VL模型,实现了具身医疗任务的评估与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06959 2026-03-11 physics.soc-ph nlin.CD 50%

Discerning media bias within a network of political allies: an analytic condition for disruption by partisans

在政治盟友网络中辨别媒体偏见:一种用于党派破坏的分析条件

Jarra Horstman, Andrew Melatos, Farhad Farokhi

专题命中 多模态Agent :multimodal(abstract)

AI总结 研究在政治盟友网络中辨别媒体偏见的条件,通过概率框架分析党派分子对代理体观点的影响,推导出湍流非收敛与渐近学习的区分条件。

Comments 37 pages, 8 figures

Journal ref Physica A: Statistical Mechanics and its Applications Volume 673, 1 September 2025, 130679

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 16 篇

2603.09173 2026-03-11 cs.CV 83%

Point Cloud as a Foreign Language for Multi-modal Large Language Model

点云作为多模态大语言模型的外语

Sneha Paul, Zachary Patterson, Nizar Bouguila

机构 * Concordia University(康科迪亚大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 SAGE是首个端到端3D多模态大语言模型,通过轻量级3D分词器直接处理点云,提升3D任务的推理能力与鲁棒性。

Comments Accepted in The IEEE/CVF Conference on Computer Vision and Pattern Recognition 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09111 2026-03-11 cs.CV 83%

Progressive Representation Learning for Multimodal Sentiment Analysis with Incomplete Modalities

逐步表示学习用于不完整模态的多模态情感分析

Jindi Bao, Jianjun Qian, Mengkai Yan, Jian Yang

机构 * Nanjing University of Science and Technology(南京理工大学) Hohai University(河海大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 PRLF通过逐步表示学习框架,在不完整模态条件下提升多模态情感分析的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08800 2026-03-11 cs.CV 83%

Granulon: Awakening Pixel-Level Visual Encoders with Adaptive Multi-Granularity Semantics for MLLM

Granulon: 通过自适应多粒度语义唤醒像素级视觉编码器以实现MLLM

Junyuan Mao, Qiankun Li, Linghao Meng, Zhicheng He, Xinliang Zhou, Kun Wang, Yang Liu, Yueming Jin

机构 * National University of Singapore(国立新加坡大学) Nanyang Technological University(南洋理工大学)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 Granulon通过自适应多粒度语义增强,提升多模态大语言模型的像素级视觉理解和多粒度推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09706 2026-03-11 cs.AI 79%

OOD-MMSafe: Advancing MLLM Safety from Harmful Intent to Hidden Consequences

OOD-MMSafe: 推进多模态大语言模型安全性从有害意图到隐藏后果

Ming Wen, Kun Yang, Jingyu Zhang, Yuxuan Liu, shiwen cui, Shouling Ji, Xingjun Ma

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.AI

AI总结 OOD-MMSafe通过CASPO框架提升多模态大语言模型对隐藏后果的识别能力,显著降低风险识别失败率。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏