arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-09 至 2026-04-09 共收录 67 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2604.06711 2026-04-09 cs.CV cs.CL 76%

Specializing Large Models for Oracle Bone Script Interpretation via Component-Grounded Multimodal Knowledge Augmentation

通过组件导向的多模态知识增强专门化大型模型进行甲骨文解读

Jianing Zhang, Runan Li, Honglin Pang, Ding Xia, Zhou Zhu, Qian Zhang, Chuntao Li, Xi Yang

机构 * College of Software, Jilin University(吉林大学软件学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院) School of Archaeology, Jilin University(吉林大学考古学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MoE, China(教育部知识驱动人机智能工程研究中心)

专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL

AI总结 本文提出一种基于组件的多模态知识增强框架,利用视觉语言模型和语言模型代理进行组件识别与语义推理,通过专家标注的OB-Radix数据集提升甲骨文解读的精度与细节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22396 2026-04-09 cs.CV cs.AI 62%

Asking like Socrates: Socrates helps VLMs understand remote sensing images

像苏格拉底提问:苏格拉底帮助VLMs理解遥感图像

Run Shao, Ziyu Li, Zhaoyang Zhang, Linrui Xu, Xinran He, Hongyuan Yuan, Bolei He, Yongxing Dai, Yiming Yan, Yijun Chen, Wang Guo, Haifeng Li

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Baidu Inc.(百度公司) School of Earth Sciences, Zhejiang University(浙江大学地球科学学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出RS-EoT方法,通过迭代视觉证据寻求机制和两阶段强化学习策略,解决遥感图像中伪推理问题,提升视觉证据基础的推理能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01840 2026-04-09 cs.AI 57%

Not All Tokens See Equally: Perception-Grounded Policy Optimization for Large Vision-Language Models

并非所有token都同等重要:基于感知的策略优化方法用于大型视觉-语言模型

Zekai Ye, Qiming Li, Xiaocheng Feng, Ruihan Chen, Ziming Li, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出基于感知的策略优化方法PGPO,通过动态调整token级别的优势,提升多模态推理的鲁棒性与稳定性,实验显示在多个基准上提升18.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06502 2026-04-09 cs.LG 50%

VLMShield: Efficient and Robust Defense of Vision-Language Models against Malicious Prompts

VLMShield: 有效且稳健的视觉语言模型对抗恶意提示防御

Peigui Qi, Kunsheng Tang, Yanpu Yu, Jialin Wu, Yide Song, Wenbo Zhou, Zhicong Huang, Cheng Hong, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) University of Washington(华盛顿大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出VLMShield,通过多模态聚合特征提取框架提升视觉语言模型对恶意提示的防御能力,实验显示其在鲁棒性、效率和实用性方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05477 2026-04-09 cs.RO 50%

Trust Through Transparency: Explainable Social Navigation for Autonomous Mobile Robots via Vision-Language Models

通过透明实现信任:通过视觉语言模型实现自主移动机器人的可解释社交导航

Oluwadamilola Sotomi, Devika Kodi, Aliasghar Arab

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院) General Autonomy Inc.(通用自主公司)

专题命中 图文多模态 :multimodal(abstract)

AI总结 本文提出一种多模态可解释模块,结合视觉语言模型和热图提升自主导航的透明度,通过自然语言总结使机器人感知、分析并表达观察结果,实验表明实时解释能提升用户信任和理解。

Comments Submitted to IEEE Conferences

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2604.06824 2026-04-09 cs.CV 83%

Generate, Analyze, and Refine: Training-Free Sound Source Localization via MLLM Meta-Reasoning

生成、分析与优化:基于MLLM元推理的无训练声源定位

Subin Park, Jung Uk Kim

机构 * Kyung Hee University(庆熙大学)

专题命中 音频语音多模态 :MLLM(title);multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 本文提出无训练的声源定位框架,利用多模态大语言模型的推理能力,通过生成-分析-优化流程实现声源定位,实验表明在单源和多源基准上表现优异。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06901 2026-04-09 cs.CE cs.AI cs.CV cs.CY cs.ET 81%

XR-CareerAssist: An Immersive Platform for Personalised Career Guidance Leveraging Extended Reality and Multimodal AI

XR-CareerAssist:一种结合扩展现实与多模态AI的沉浸式个性化职业指导平台

N. D. Tantaroudas, A. J. McCracken, I. Karachalios, E. Papatheou, V. Pastrikakis

机构 * Institute of Communications and Computer Systems (ICCS)(通信与计算机系统研究所) DASKALOS-APPS National Technical University of Athens(雅典国家技术大学) University of Exeter(埃克塞特大学) CVCOSMOS Ltd(CVCOSMOS有限公司)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出XR-CareerAssist平台,结合扩展现实与多模态AI,提供沉浸式、多语言的职业指导。系统整合语音识别、神经机器翻译、对话训练助手、视觉-语言模型和3D虚拟形象,通过动态Sankey图展示职业轨迹,实验显示高准确率和用户满意度。

Comments 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09677 2026-04-09 cs.AI 70%

Logics-Parsing-Omni Technical Report

逻辑-解析-全能技术报告

Xin An, Jingyi Cai, Xiangyang Chen, Huayao Liu, Peiting Liu, Peng Wang, Bei Yang, Xiuwen Zhu, Yongfan Chen, Yan Gao, Yuan Gao, Baoyu Hou, Guangzheng Hu, Shuzhao Li, Weixu Qiao, Weidong Ren, Yanan Wang, Boyu Yang, Fan Yang, Jiangtao Zhang, Lixin Zhang, Lin Qu, Hu Wei, Xiaoxiao Xu, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.AI

AI总结 本文提出Omni Parsing框架,通过三级层次结构实现多模态解析,整合整体检测、细粒度识别和多级解释,构建证据锚定机制以提升逻辑推理能力,释放Logics-Parsing-Omni模型并发布评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23435 2026-04-09 cs.SD cs.AI cs.MM eess.AS 67%

AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models

AudioRole: 一个用于大型语言模型角色扮演的音频数据集

Wenyu Li, Xiaoqi Jiao, Yi Chang, Guangyan Zhang, Yiwen Guo

机构 * Westlake University(西湖大学) Tencent LIGHTSPEED STUDIOS(腾讯LIGHTSPEED STUDIOS) Independent Researcher(独立研究员)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出AudioRole数据集,通过13部电视剧1000+小时的100万+角色对话,提供同步音频文本对及角色身份标注,结合ARP-Eval评估框架,验证了GLM-4-Voice在角色扮演中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 8 篇

2604.04614 2026-04-09 cs.LG cs.AI 79%

A Clinical Point Cloud Paradigm for In-Hospital Mortality Prediction from Multi-Level Incomplete Multimodal EHRs

一种用于院内死亡预测的临床点云范式:从多级不完整多模态电子健康记录

Bohao Li, Tao Zou, Junchen Ye, Yan Gong, Bowen Du

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出HealthPoint范式,通过统一的4D空间表示多级不完整多模态EHRs,引入低秩关系注意力机制和分层交互策略,实现灵活的事件级交互与细粒度自监督,提升模态恢复和未标记数据利用效率,实验表明其在风险预测中性能优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06697 2026-04-09 eess.SP 78%

Heterogeneous Mixture-of-Experts for Energy-Efficient Multimodal ISAC in Highly Mobile Networks

异构专家混合模型用于高移动网络中高效多模态ISAC

Wenqi Fan, Ning Wei, Rongyan Xi, Ahmad Bazzi, Yue Xiu, Chadi Assi, Jing Dong, Jing Jin

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本文提出异构混合专家架构,解决高移动网络中多模态传感与毫米波通信的能耗与可靠性平衡问题,通过强化学习实现高效事件触发传感策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06417 2026-04-09 stat.CO 78%

Niching Importance Sampling for Multi-modal Rare-event Simulation

多模态稀有事件模拟中的 niching 重要性抽样

Hugh J. Kinnear, F. A. DiazDelaO

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 本文提出 niching 重要性抽样框架,结合可靠性分析和进化多模态优化技术,提高故障概率估计的鲁棒性,有效应对可靠性问题的几何挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06789 2026-04-09 cs.CV cs.CL 73%

Video-guided Machine Translation with Global Video Context

基于全局视频上下文的视频引导机器翻译

Jian Chen, JinZe Lv, Zi Long, XiangHua Fu

机构 * Shenzhen University(深圳大学) Shenzhen Technology University(深圳技术大学)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种全局视频引导的多模态翻译框架,通过预训练语义编码器和向量数据库实现视频片段与字幕的语义关联,结合注意力机制提升翻译效果,在大规模纪录片数据集上验证了其在长视频场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20765 2026-04-09 cs.CV cs.AI 62%

Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding

超越显而易见:视频理解中抽象概念识别的综述

Gowreesh Mago, Pascal Mettes, Stevan Rudinac

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了视频理解中抽象概念识别的挑战与方法,强调基础模型的进步对高阶抽象理解的重要性,指出需结合多模态基础模型避免重复发明轮子。

Comments Accepted at IJCV

Journal ref International Journal of Computer Vision 134, 217 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.08334 2026-04-09 cs.CL cs.AI cs.LG cs.MA 62%

Exploring Natural Language-Based Strategies for Efficient Number Learning in Children through Reinforcement Learning

探索基于自然语言的策略以通过强化学习高效学习儿童数字

Tirthankar Mittra

机构 * Univeristy Of Colorado, Boulder(科罗拉多大学博尔德分校)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文通过强化学习框架研究儿童如何使用十进制积木组成数字,发现明确动作指导的指令更有效,并提出有效的教学课程以加速收敛和提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06330 2026-04-09 cs.CL 57%

STDec: Spatio-Temporal Stability Guided Decoding for dLLMs

STDec:基于时空稳定性的解码方法用于dLLMs

Yuzhe Chen, Jiale Cao, Xuyang Liu, Jin Xie, Aiping Yang, Yanwei Pang

机构 * Tianjin University(天津大学) Sichuan University(四川大学) Chongqing University(重庆大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 STDec通过结合空间和时间稳定性,改进dLLM解码,提升吞吐量并保持性能。

Comments Homepage: https://yzchen02.github.io/STDec

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 7 篇

2604.07201 2026-04-09 cs.IR cs.CV 83%

BRIDGE: Multimodal-to-Text Retrieval via Reinforcement-Learned Query Alignment

BRIDGE:通过强化学习查询对齐实现多模态到文本检索

Mohamed Darwish Mounis, Mohamed Mahmoud, Shaimaa Sedek, Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Abdelrahman Abdallah, Hyun-Soo Kang

机构 * High institute for computer & information systems(高等计算机与信息系统学院) Chungbuk National University(忠北大学) Assiut University(艾斯尤特大学) University of Innsbruck(因斯布鲁克大学)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.CV

AI总结 BRIDGE通过强化学习查询对齐模型和增强神经搜索检索器,解决多模态查询在文本库中的检索问题,实现优于多模态编码器的nDCG@10性能。

Comments Accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05268 2026-04-09 cs.CV cs.AI cs.CL 82%

Region-R1: Reinforcing Query-Side Region Cropping for Multi-Modal Re-Ranking

Region-R1: 增强多模态重排序的查询侧区域裁剪

Chan-Wei Hu, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学)

专题命中 跨模态检索 :multi-modal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 Region-R1通过在重排序阶段引入区域裁剪机制,提升多模态重排序的鲁棒性,实验表明其在E-VQA和InfoSeek基准上显著提升召回率。

Comments 12 pages, 4 figures, accepted to ACL 2026 Findings, code available at https://github.com/taco-group/Region-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06179 2026-04-09 cs.IR cs.CL 79%

ARIA: Adaptive Retrieval Intelligence Assistant -- A Multimodal RAG Framework for Domain-Specific Engineering Education

ARIA:自适应检索智能助手——面向领域特定工程教育的多模态RAG框架

Yue Luo, Dibakar Roy Sarkar, Rachel Herring Sangree, Somdatta Goswami

机构 * Dalian University of Technology(大连理工大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL

AI总结 ARIA通过多模态内容提取管道和e5-large-v2模型,实现领域特定工程教育的智能教学助手,展现高精度和教学一致性,验证了其在课程相关问题上的高准确率和响应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29441 2026-04-09 cs.CV 79%

EarthEmbeddingExplorer: A Web Application for Cross-Modal Retrieval of Global Satellite Images

地球嵌入探索器:一种用于全球卫星图像跨模态检索的Web应用

Yijie Zheng, Weijie Wu, Bingyue Wu, Long Zhao, Guoqing Li, Mikolaj Czerkawski, Konstantin Klemmer

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所) Asterisk Labs(Asterisk实验室) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文介绍EarthEmbeddingExplorer,一种Web应用,通过跨模态查询实现全球卫星图像的动态检索,帮助研究人员将研究成果转化为实际应用。

Comments ICLR 2026 Workshop ML4RS Tutorial Track (oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07079 2026-04-09 cs.IR 78%

MARVEL: Multimodal Adaptive Reasoning-intensiVe Expand-rerank and retrievaL

MARVEL:多模态自适应推理-增强扩展-排序和检索

Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Mahmoud Abdalla, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文提出MARVEL框架,通过统一的扩展-检索-排序流程,结合LLM驱动的查询扩展、增强推理的密集检索器和基于GPT-4o的逐步推理排序,提升了多模态检索性能,在MM-BRIGHT基准上实现了37.9nDCG@10的高分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07220 2026-04-09 cs.IR 78%

HIVE: Query, Hypothesize, Verify An LLM Framework for Multimodal Reasoning-Intensive Retrieval

HIVE:一种用于多模态推理密集检索的LLM框架

Mahmoud Abdalla, Mahmoud SalahEldin Kasem, Mohamed Mahmoud, Mostafa Farouk Senussi, Abdelrahman Abdallah, Hyun-Soo Kang

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 HIVE通过引入LLM进行显式视觉-文本推理,提升多模态检索效果,达到41.7的nDCG@10,优于现有文本和多模态模型。

Comments accepted at CVPR 2026 Workshop GRAIL-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15623 2026-04-09 cs.CV 70%

PCSR: Pseudo-label Consistency-Guided Sample Refinement for Noisy Correspondence Learning

PCSR:基于伪标签一致性的样本细化用于噪声对应学习

Zhuoyao Liu, Yang Liu, Wentao Feng, Shudong Huang

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出PCSR框架,通过伪标签一致性提升对应可靠性,解决噪声对应问题,提升检索鲁棒性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2604.05584 2026-04-09 cs.CV 84%

Purify-then-Align: Towards Robust Human Sensing under Modality Missing with Knowledge Distillation from Noisy Multimodal Teacher

在模态缺失情况下通过知识蒸馏从噪声多模态教师中实现鲁棒的人体感知:Purify-then-Align

Pengcheng Weng, Yanyu Qian, Yangxin Xu, Fei Wang

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) Institute of Computer Science, Universität Bern(伯尔尼大学计算机科学研究所) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV;any-to-any(comments)

AI总结 本文提出PTA框架,通过元学习和知识扩散解决多模态人体感知中模态缺失问题,通过净化知识源和对齐模态提升单模态模型鲁棒性。

Comments Accepted by CVPR 2026 Workshop On Any-to-Any Multimodal Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01986 2026-04-09 cs.CV cs.AI 84%

Draw-In-Mind: Rebalancing Designer-Painter Roles in Unified Multimodal Models Benefits Image Editing

Draw-In-Mind: 在统一多模态模型中重新平衡设计师-画家角色有助于图像编辑

Ziyun Zeng, David Junhao Zhang, Wei Li, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab) TikTok

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Draw-In-Mind模型,通过重新分配设计职责提升图像编辑性能,展示了在统一多模态模型中平衡理解与生成模块的重要性。

Comments ICLR 2026 Camera Ready Version; Add more discussions and fix typos

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06725 2026-04-09 cs.CV 83%

Enhancing MLLM Spatial Understanding via Active 3D Scene Exploration for Multi-Perspective Reasoning

通过主动3D场景探索增强MLLM空间理解以实现多视角推理

Jiahua Chen, Qihong Tang, Weinong Wang, Qi Fan

机构 * Tsinghua University(清华大学) Nanjing University(南京大学) Tencent(腾讯)

专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的框架,通过显式3D重建机制提升MLLM的空间理解能力,通过主动探索生成新视角,优于专门空间模型和通用MLLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06489 2026-04-09 cs.HC cs.MM 83%

Language-Guided Multimodal Texture Authoring via Generative Models

基于生成模型的语言引导多模态纹理创作

Wanli Qian, Aiden Chang, Shihan Lu, Michael Gu, Heather Culbertson

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出一种语言驱动的多模态纹理创作系统,通过生成模型将自然语言提示转化为触觉和视觉纹理,实现触觉与视觉信号的语义一致性,提升创作效率与可解释性。

Comments 14 pages, 13 figures, accepted to IEEE Haptics Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06870 2026-04-09 cs.CV 79%

RefineAnything: Multimodal Region-Specific Refinement for Perfect Local Details

RefineAnything: 多模态区域特定细化以实现完美局部细节

Dewei Zhou, You Li, Zongxin Yang, Yi Yang

机构 * RELER, CCAI, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室、人工智能研究所) DBMI, HMS, Harvard University(哈佛大学医学院生物医学信息学系)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出区域特定图像细化方法,通过多模态扩散模型实现局部细节恢复,同时保持非编辑区域不变,引入边界一致性损失和Focus-and-Refine策略提升效果。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19433 2026-04-09 cs.CV 79%

dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models

dMLLM-TTS:用于扩散多模态大语言模型的自验证和高效测试时间扩展

Yi Xin, Siqi Luo, Tianxiang Xu, Qi Qin, Haoxing Chen, Kaiwen Zhu, Zhiwei Zhang, Yangfan He, Rongchao Zhang, Jinbin Bai, Shuo Cao, Bin Fu, Junjun He, Yihao Liu, Yuewen Cao, Xiaohong Liu

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出dMLLM-TTS框架,通过轨迹探索扩展和迭代细化扩展两个互补的扩展轴,提升生成多样性和稳定性,同时通过自验证机制提高效率,实验表明在GenEval基准上生成质量显著提升且效率提高6倍。

Comments Project page: https://github.com/Alpha-VLLM/Lumina-DiMOO

详情

展开后加载摘要…

URL PDF HTML 收藏