arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-01 至 2026-04-01 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2603.29258 2026-04-01 cs.CV cs.AI 73%

Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding

Omni-NegCLIP:通过前层对比微调增强CLIP以实现全面否定理解

Jingqi Xu

机构 * University of Southern California(南加州大学)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Omni-NegCLIP,通过修改CLIP的InfoNCE损失函数,改进其对存在性和缺失性否定表达的理解能力,实验显示在否定任务中性能提升显著,且不牺牲图像-文本检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21482 2026-04-01 cs.CV 70%

ALADIN:Attribute-Language Distillation Network for Person Re-Identification

ALADIN:基于属性-语言的知识蒸馏网络用于人重识别

Wang Zhou, Boran Duan, Haojun Ai, Ruiqi Lan, Ziyue Zhou

机构 * Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 ALADIN通过属性-语言知识蒸馏网络,提升人重识别中细粒度属性特征的捕捉能力,增强鲁棒性与泛化性。

Comments 14pages, 3figures, 7charts

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 62%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08829 2026-04-01 cs.CV cs.AI 62%

InfiniteVL: Synergizing Linear and Sparse Attention for Highly-Efficient, Unlimited-Input Vision-Language Models

InfiniteVL: 融合线性与稀疏注意力以实现高效率、无限输入的视觉-语言模型

Hongyuan Tao, Bencheng Liao, Shaoyu Chen, Haoran Yin, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Horizon Robotics(地平线机器人)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 InfiniteVL通过融合线性与稀疏注意力机制,实现高效率和无限输入的视觉-语言模型,提升解码速度和长上下文处理能力。

Comments 20 pages, 8 figures, conference or other essential info

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29405 2026-04-01 cs.CV cs.AI 62%

Hallucination-aware intermediate representation edit in large vision-language models

具有幻觉意识的中间表示编辑在大视觉-语言模型中

Wei Suo, Hanzu Zhang, Lijun Zhang, Ji Ma, Peng Wang, Yanning Zhang

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种动态检测和消除幻觉表示的框架,通过最小额外计算成本在现有基准上实现最先进的性能,展示了高效且稳健的幻觉消除能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26984 2026-04-01 cs.CV 57%

A Provable Energy-Guided Test-Time Defense Boosting Adversarial Robustness of Large Vision-Language Models

一种可证明的能量引导测试时间防御提升大视觉-语言模型的对抗鲁棒性

Mujtaba Hussain Mirza, Antonio D'Orazio, Odelia Melamed, Iacopo Masi

机构 * OmnAI Lab, Computer Science Department, Sapienza University of Rome, Italy(罗马大学计算机科学系OmnAI实验室,意大利) Weizmann Institute of Science, Israel(魏茨曼科学研究所,以色列)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出ET3,一种轻量且无需训练的防御方法,通过最小化输入样本的能量提升模型鲁棒性,实验显示其在分类和提升大视觉-语言模型鲁棒性方面表现优异。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026, Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29474 2026-04-01 eess.SY cs.LG cs.SY 50%

From Big Data to Fast Data: Towards High-Quality Datasets for Machine Learning Applications from Closed-Loop Data Collection

从大数据到快数据:面向机器学习应用的高质量数据集设计:从闭环数据收集

Philipp Reis, Jacqueline Henle, Stefan Otten, Eric Sax

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出快数据概念,通过车辆实时决策优化数据采集,提升数据集相关性与信息密度,降低冗余数据成本,为现代机器学习算法提供高效数据采集基础。

Comments Submitted to IEEE ISSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2511.06686 2026-04-01 cs.LG 78%

Balancing Multi-modal Sensor Learning via Multi-objective Optimization

通过多目标优化平衡多模态传感器学习

Heshan Fernando, Quan Xiao, Parikshit Ram, Yi Zhou, Horst Samulowitz, Nathalie Baracaldo, Tianyi Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院) Cornell University(康奈尔大学)

专题命中 音频语音多模态 :multi-modal(title,abstract)

AI总结 本文提出MIMO方法,通过多目标优化平衡多模态传感器学习,提升系统可靠性并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00702 2026-04-01 cs.CV 70%

JoyStreamer: Unlocking Highly Expressive Avatars via Harmonized Text-Audio Conditioning

JoyStreamer: 通过和谐的文本-音频条件化解锁高度表达性的化身

Ruikui Wang, Jinheng Feng, Lang Tian, Huaishao Luo, Chaochao Li, Liangbo Zhou, Huan Zhang, Youzheng Wu, Xiaodong He

机构 * JD Technology(京东科技)

专题命中 音频语音多模态 :multi-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出JoyAvatar框架,通过双教师增强训练算法和动态调节多模态条件,提升视频化身生成的自然性和时序一致性,优于现有模型并在多人群对话等复杂应用中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29820 2026-04-01 cs.SD 50%

SIREN: Spatially-Informed Reconstruction of Binaural Audio with Vision

SIREN:基于视觉的双耳音频重建

Mingyeong Song, Seoyeon Ko, Junhyug Noh

机构 * Ewha Womans University, Seoul, Korea(韩国首尔梨花女子大学)

专题命中 音频语音多模态 :audio-visual(abstract)

AI总结 SIREN通过视觉引导将单声道音频转换为双耳音频,利用双头自注意力机制生成场景图,并通过两阶段波形域融合抑制混响,提升时间频率和相位敏感度指标。

Comments 5 pages, 1 figure, to appear in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 12 篇

2603.28610 2026-04-01 cs.CV cs.AI cs.CL 85%

ResAdapt: Adaptive Resolution for Efficient Multimodal Reasoning

ResAdapt:面向高效多模态推理的自适应分辨率

Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Ben Wang, Jun Zhao, Kun Xu, Kang Liu

专题命中 视频多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 ResAdapt通过自适应输入分辨率框架,在保持高空间分辨率的同时提升多模态推理效率,尤其在压缩条件下显著提升性能。

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 81%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29903 2026-04-01 q-bio.NC eess.SP 78%

Multimodal Higher-Order Brain Networks: A Topological Signal Processing Perspective

多模态高阶脑网络:拓扑信号处理视角

Breno C. Bispo, Stefania Sardellitti, Juliano B. Lima, Fernando A. N. Santos

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出基于拓扑信号处理的多模态框架,通过高阶拓扑域建模脑部,利用扩散MRI和静息态fMRI学习个体化脑细胞复合体,揭示高阶相互作用的拓扑特征及其与行为的关联。

Comments This paper has been sumbmitted to IEEE Transactions on Medical Imaging (TMI), March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29624 2026-04-01 cs.SE 78%

EcoScratch: Cost-Effective Multimodal Repair for Scratch Using Execution Feedback

EcoScratch: 低成本多模态修复用于刮痕使用执行反馈

Yuan Si, Ming Wang, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 EcoScratch通过轻量级运行时信号决定是否保持纯文本修复或升级到多模态提示,结合JSON补丁预算和验证努力,提升Scratch修复效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19146 2026-04-01 cs.CV cs.CL 62%

VIGiA: Instructional Video Guidance via Dialogue Reasoning and Retrieval

VIGiA:通过对话推理和检索进行教学视频指导

Diogo Glória-Silva, David Semedo, João Maglhães

机构 * NOVA LINCS, NOVA School of Science and Technology, Portugal(新大学信息学与计算机科学研究中心,新大学科技学院,葡萄牙)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 VIGiA是一种多模态对话模型,通过对话推理和检索处理复杂的教学视频行动计划,实现基于视觉输入和计划的对话理解,优于现有方法,在计划感知的VQA任务中达到90%以上准确率。

Comments Published at EACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29741 2026-04-01 cs.SI cs.AI cs.MA 57%

BotVerse: Real-Time Event-Driven Simulation of Social Agents

BotVerse: 基于事件驱动的实时社会代理高保真模拟

Edoardo Allegrini, Edoardo Di Paolo, Angelo Spognardi, Marinella Petrocchi

机构 * Computer Science Dept., Sapienza University of Rome(罗马大学计算机科学系)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 BotVerse通过LLM代理实现高保真社会模拟,提供安全实验环境用于红队测试和计算社会科学研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29692 2026-04-01 cs.CV 57%

SkeletonContext: Skeleton-side Context Prompt Learning for Zero-Shot Skeleton-based Action Recognition

SkeletonContext:基于骨架的零样本动作识别中的骨架侧上下文提示学习

Ning Wang, Tieyue Wu, Naeha Sharif, Farid Boussaid, Guangming Zhu, Lin Mei, Mohammed Bennamoun, zhang liang

机构 * Xidian University(西安电子科技大学) University of Western Australia(西澳大利亚大学) Donghai Lab(东海实验室)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SkeletonContext框架,通过引入跨模态上下文提示模块和关键部位解耦模块,提升骨架动作识别中上下文信息的利用,实现零样本场景下的高精度动作区分。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29664 2026-04-01 cs.CV 57%

CutClaw: Agentic Hours-Long Video Editing via Music Synchronization

CutClaw:通过音乐同步实现代理长时间视频编辑

Shifang Zhao, Yihan Hu, Ying Shan, Yunchao Wei, Xiaodong Cun

机构 * Beijing Jiaotong University(北京交通大学) GVC Lab, Great Bay University(大湾区大学GVC实验室) ARC Lab, Tencent(腾讯ARC实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出CutClaw,一种多代理框架,利用多模态语言模型自动编辑长时间原始素材为有意义的短视频,通过音乐同步和视觉优化提升视频质量。

Comments Project Code: https://github.com/GVCLab/CutClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24176 2026-04-01 eess.IV cs.CV q-bio.NC 57%

Modeling Spatiotemporal Neural Frames for High Resolution Brain Dynamic

时空神经帧建模用于高分辨率脑动态研究

Wanying Qu, Jianxiong Gao, Wei Wang, Yanwei Fu

机构 * Fudan University(复旦大学) Southern University of Science and Technology(南方科技大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出一种基于EEG条件的框架,用于高保真重建动态fMRI,通过引入空域中间帧重建解决采样不规则问题,提升时空连续性与应用性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14794 2026-04-01 cs.CV cs.LG 57%

Face-to-Face: A Video Dataset for Multi-Person Interaction Modeling

面对面:一个多人物交互建模的视频数据集

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出F2F-JF数据集,用于研究多人物交互建模,通过半自动流程提取对齐的主持人和嘉宾轨迹,并展示基于该数据集的反应式数字虚拟形象任务,验证了扩散模型在跨人物视觉上下文中的表现。

Comments Project Page: https://face2face2026.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05513 2026-04-01 cs.CV 57%

Know-Show: Benchmarking Video-Language Models on Spatio-Temporal Grounded Reasoning

Know-Show:在时空 grounded 推理上评估视频语言模型的基准测试

Chinthani Sugandhika, Chen Li, Deepu Rajan, Basura Fernando

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Institute of High-Performance Computing, Agency for Science, Technology and Research(新加坡科技研究局高性能计算研究所) Centre for Frontier AI Research, Agency for Science, Technology and Research(新加坡科技研究局前沿人工智能研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Know-Show基准测试评估视频语言模型在时空 grounded 推理能力,通过五个互补场景揭示现有模型与人类推理的差距,并提出GRAM方法提升模型的细粒度 grounded 推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00524 2026-04-01 cs.CV 57%

Text-guided Fine-Grained Video Anomaly Understanding

基于文本引导的细粒度视频异常理解

Jihao Gu, Kun Li, He Wang, Kaan Akşit

机构 * University College London(伦敦大学学院) CVLab, College of Information Technology, United Arab Emirates University(阿联酋大学信息技术学院计算机视觉实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出T-VAU框架,通过多模态推理提取细粒度视频异常证据,结合Anomaly Heatmap Decoder和Region-aware Anomaly Encoder提升异常检测与解释能力。

Comments Accepted by CVPR 2026 SVC Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2602.01639 2026-04-01 cs.CV 83%

ReCALL: Recalibrating Capability Degradation for MLLM-based Composed Image Retrieval

ReCALL: 为基于MLLM的组合图像检索 recalibrate 能力退化

Tianyu Yang, Chenwei He, Xiangzhao Hao, Tianyue Wang, Jiarui Guo, Haiyun Guo, Leigang Qu, Jinqiao Wang, Tat-Seng Chua

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Southeast University(东南大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Guangdong Provincial Key Laboratory of Intellectual Property and Big Data, Guangdong Polytechnic Normal University(广东技术师范大学广东省知识产权大数据重点实验室)

专题命中 跨模态检索 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 ReCALL通过诊断生成器盲点、生成修正指令和三元组、并持续训练来缓解基于生成式MLLM的检索能力退化问题,实验证明其在CIRR和FashionIQ上达到SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06753 2026-04-01 cs.CV 83%

EarthBridge: A Solution for 4th Multi-modal Aerial View Image Challenge Translation Track

EarthBridge: 4th 多模态航空视图图像挑战翻译赛道的解决方案

Zhenyuan Chen, Guanyuan Shen, Feng Zhang

机构 * Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出EarthBridge框架,通过Diffusion Bridge Implicit Models和Contrastive Unpaired Translation方法,实现EO、IR和SAR传感器间的高质量图像到图像翻译,解决了跨模态转换中的挑战,取得第二名成绩。

Comments accepted by CVPRW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29796 2026-04-01 eess.SP 82%

JEPA-MSAC: A Joint-Embedding Predictive Architecture for Multimodal Sensing-Assisted Communications

JEPA-MSAC:一种联合嵌入预测架构用于多模态传感辅助通信

Can Zheng, Jiguang He, Guofa Cai, Nannan Li, Mehdi Bennis, Henk Wymeersch, Merouane Debbah

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出JEPA-MSAC框架,通过联合嵌入预测架构实现多模态传感辅助通信的自监督学习,支持多任务预测并降低适应成本。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29631 2026-04-01 cs.CV cs.DC cs.IR 79%

Storing Less, Finding More: How Novelty Filtering Improves Cross-Modal Retrieval on Edge Cameras

存储更少,查找更多:新颖性过滤如何改进边缘摄像头上的跨模态检索

Sherif Abdelwahab

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出一种流式检索架构,通过边缘设备的epsilon-net过滤器保留语义新颖帧,构建去噪嵌入索引,并结合跨模态适配器和云重排序器,提升边缘摄像头跨模态检索性能。

Comments 6 pages, 3 figures, 5 tables; supplementary video included as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29259 2026-04-01 cs.IR cs.CL 79%

Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE

通过鲁棒直接偏好优化与稀疏MoE对齐多模态序列推荐

Hejin Huang, Jusheng Zhang, Kaitong Cai, Jian Wang, Rong Pan

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 本文研究了在隐式反馈下直接偏好优化的行为,通过系统实验比较了常见负样本选择策略及其与DPO训练的交互,发现用动态top-K候选池进行随机采样可提升排名性能,原因在于减少错误抑制梯度和保留信息硬信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29291 2026-04-01 cs.CV cs.AI 62%

MELT: Improve Composed Image Retrieval via the Modification Frequentation-Rarity Balance Network

MELT:通过修改频繁性-稀有性平衡网络改进组合图像检索

Guozhi Qiu, Zhiwei Chen, Zixu Li, Qinlei Huang, Zhiheng Fu, Xuemeng Song, Yupeng Hu

机构 * School of Software, Shandong University(山东大学软件学院) Southern University of Science and Technology(南方科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MELT通过解决罕见语义定位不对称和硬负样本下的鲁棒相似性估计问题,改进组合图像检索的性能。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01142 2026-04-01 cs.CV 57%

ArtLLM: Generating Articulated Assets via 3D LLM

ArtLLM: 通过3D语言模型生成拟合资产

Penghao Wang, Siyuan Xie, Hongyu Yan, Xianghui Yang, Jingwei Huang, Chunchao Guo, Jiayuan Gu

机构 * ShanghaiTech University(上海科技大学) Tencent Hunyuan(腾讯混元) HKUST(香港科技大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 ArtLLM通过3D语言模型直接从完整3D网格生成高质量拟合资产,解决了传统方法在关节拟合和部分检索中的局限,提升了部分布局和关节预测的准确性。

Comments CVPR 2026. Project page: https://authoritywang.github.io/artllm/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 13 篇

2509.09666 2026-04-01 cs.CV 83%

Unified Multimodal Models as Auto-Encoders

统一多模态模型作为自编码器

Zhiyuan Yan, Kaiqing Lin, Zongjian Li, Junyan Ye, Hui Han, Haochen Wang, Zhendong Wang, Bin Lin, Hao Li, Xinyan Xiao, Jingdong Wang, Haifeng Wang, Li Yuan

机构 * Shenzhen Graduate School, Peking University(北京大学深圳研究生院) Baidu(百度) Rabbitpre AI(兔展智能) SYSU(中山大学) USTC(中国科学技术大学) CASIA(中国科学院自动化研究所)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出统一GRPO方法,通过强化学习联合优化图像到文本和文本到图像任务,利用重建奖励提升语义一致性,增强多模态协同效果。

详情

展开后加载摘要…

URL PDF HTML 收藏