arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-21 至 2026-07-21 共收录 135 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 17 篇

2607.17386 2026-07-21 cs.CV 新提交 79%

SkyVLaM: Multimodal Large Language Model for UAV Video Understanding in Remote Sensing

SkyVLaM:用于遥感中无人机视频理解的多模态大语言模型

Kaiwen Jing, Ruixu Jia, Bingyao Li, Ruizhe Ou, Ming Wu, Chuang Zhang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Beijing Wuzi University(北京物资学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机视频理解任务,提出多模态大语言模型SkyVLaM,通过时间基感知器构建稀疏令牌,正则化稀疏基,自适应选择密集段,联合大语言模型处理,还构建SkyVid,实验证明其能有效分配视觉令牌预算,提升语言条件视频分割效果。

Comments Accepted by WAICA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16662 2026-07-21 cs.LG 新提交 78%

Multimodal Attention-based Deep Learning for Emergency Triage with Electronic Health Records

基于多模态注意力的深度学习用于电子健康记录的急诊分诊

Hazqeel Afyq Athaillah Kamarul Aryffin, Kamarul Aryffin Baharuddin, Mohd Halim Mohd Noor

机构 * Hospital Universiti Sains Malaysia(马来西亚理科大学医院)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 研究旨在提出多模态深度学习架构用于急诊分诊,利用自注意力捕捉特征关系,处理表格和文本数据。用马来西亚理科大学医院急诊科数据集验证,该模型比基线模型在准确率、F-1分数和ROC AUC上均有提升,展现出预测分诊决策的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04723 2026-07-21 eess.SP 版本更新 78%

CIG-MAE: Cross-Modal Information-Guided Masked Autoencoder for Self-Supervised WiFi Sensing

CIG-MAE:用于自监督WiFi感知的跨模态信息引导掩码自动编码器

Gang Liu, Yanling Hao, Yixuan Zou

专题命中 视频多模态 :cross-modal(title,abstract)

AI总结 研究利用WiFi CSI进行人类行为识别,针对监督方法受限及现有SSL不适用于CSI的问题,提出CIG-MAE,采用对称双流架构、自适应掩码策略和正则化器,实验证明其在多方面优于现有方法,提升了数据效率等。

Comments 12 pages, 7 figures. Published in IEEE Internet of Things Journal (Early Access)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16362 2026-07-21 cs.CV 新提交 74%

OmniStyle-INR: Universal and Multimodal Style Transfer for INRs

OmniStyle-INR:用于隐式神经表示的通用多模态风格迁移

Rafał Kajca, Michał Miziołek, Kornel Howil, Rafał Tobiasz, Przemysław Spurek

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS 研究所)

专题命中 视频多模态 :multimodal(title);分类 cs.CV

AI总结 研究针对不同数据模态的风格迁移问题,提出OmniStyle-INR框架,利用基于网络的连续表示作为通用域,实现了在文本提示和视觉示例引导下跨视觉模态的高质量风格迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交 67%

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16651 2026-07-21 cs.CR 新提交 67%

VIGIL: Verifying Identity via Gated Intermittent Likelihoods for Continuous Biometric Authentication

VIGIL:通过门控间歇似然性进行连续生物特征认证的身份验证

Aldridge Fonseca, Udayan Atreya, Amith Kamath Belman, Frank Sicong Chen

专题命中 视频多模态 :multi-modal(abstract);cross-modal(abstract)

AI总结 针对连续多模态认证中现有技术在低信号强度下难以区分真实用户与攻击者的问题,提出VIGIL框架,通过可配置跨模态融合、改进时间融合及采用三区验证决策模型等方法,有效解决现有局限并减少入侵检测时间。

Comments 16 pages, 6 figures, Supplementary Material Included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17790 2026-07-21 cs.CV cs.AI 新提交 62%

ReViV: Reconstructing the Viewer and the View in 4D from Monocular Egocentric Video

ReViV:从单目自我中心视频中重建4D中的观看者和视图

Xiaozhong Lyu, Gen Li, Zhiyin Qian, Xucong Zhang, Marc Pollefeys, Siyu Tang

机构 * ETH Zurich(苏黎世联邦理工学院) Delft University of Technology(代尔夫特理工大学) Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究旨在从单目自我中心视频重建4D中的观看者和视图,提出ReViV框架,将任务建模为学习多模态信号联合概率分布,由掩码生成自我中心变压器驱动,在多基准测试中展现出高精度和效率,还保持了竞争力强的自我中心深度估计,且代码模型开源。

Comments Accepted to ECCV 2026. The first two authors contributed equally, and their author order is interchangeable

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 57%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13247 2026-07-21 cs.CV 版本更新 57%

STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits

STARCaster:用于身份和视图感知的会说话肖像的时空自回归视频扩散

Foivos Paraperas Papantoniou, Stathis Galanakis, Rolandos Alexandros Potamias, Bernhard Kainz, Stefanos Zafeiriou

机构 * Imperial College London, UK(伦敦帝国理工学院) FAU Erlangen–Nürnberg, Germany(埃朗根-纽伦堡大学)

专题命中 视频多模态 :audio-visual(abstract);分类 cs.CV

AI总结 研究提出STARCaster模型,通过重新思考参考和几何范式,采用组合方法及解耦学习,解决语音驱动肖像动画和动态视点控制问题,能有效泛化,超越先前方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 8 篇

2607.17673 2026-07-21 cs.LG cs.AI 新提交 83%

Beyond Objective Expressivity: Geometry Preservation in Multimodal Contrastive Learning

超越目标表现力:多模态对比学习中的几何保留

Tillmann Rheude, Roland Eils, Benjamin Wild

机构 * Berlin Institute of Health, Charité - Universitätsmedizin Berlin(柏林健康研究院,柏林夏里特大学医学中心) Department of Mathematics and Computer Science, Freie Universität Berlin(柏林自由大学数学与计算机科学系) Intelligent Medicine Institute, Fudan University(复旦大学智能医学研究院)

专题命中 跨模态检索 :multimodal(title,abstract);image-text(abstract);分类 cs.AI

AI总结 研究多模态对比学习从成对扩展到高阶对齐的挑战,确定编码器雅可比条件是关键因素,引入几何保留编码器,通过正则化调节雅可比,实验证明改善其条件可提升检索和线性探针性能,表明多模态对比学习还取决于编码器几何和优化属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25693 2026-07-21 cs.AI 版本更新 83%

RADD: Retrieval-Augmented Discrete Diffusion for Multi-Modal Knowledge Graph Completion

RADD:基于检索的离散扩散用于多模态知识图谱补全

Guanglin Niu, Bo Li

机构 * School of Artificial Intelligence, Beihang University(北航人工智能学院)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

AI总结 本文提出RADD框架,通过分离检索与重排序过程,提升多模态知识图谱补全的性能,实验表明其在多个基准上表现最佳。

Comments 13 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16208 2026-07-21 cs.AI cs.CL 新提交 81%

ColGraphRAG: Late-Interaction Evidence Retrieval for Multimodal GraphRAG

ColGraphRAG:用于多模态GraphRAG的后期交互证据检索

Seonok Kim

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究多模态问答中基于图的证据检索问题,核心方法是在ColBERT/ColPali系列中用后期交互多向量评分替换视觉候选排序算子,主要贡献是改进了图相连图像候选检索及下游问答效果,揭示视觉证据作用模式,为后续工作指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16316 2026-07-21 cs.CV 新提交 79%

Eddy-VL 1.9B: Structural Pruning and Layered Distillation for Edge-Deployable Multimodal Embedding

Eddy-VL 1.9B:用于边缘可部署多模态嵌入的结构剪枝与分层蒸馏

HanYeong Cho, Changwoo Kim, Taeuk Chu, Jimin Park

机构 * Urock-AI Lab(Urock人工智能实验室)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于边缘可部署视觉语言检索的Eddy-VL 1.9B模型,采用探针驱动结构剪枝和分层知识蒸馏压缩,参数减少约9.5%,在MMEB-V2等评估中保留教师模型大部分性能,降低延迟,证明其在受限边缘部署下多模态检索的有效性。

Comments 11pages,4figures,Model weights and inference code are available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10677 2026-07-21 cs.CL cs.AI 版本更新 62%

A Survey on Knowledge-Oriented Retrieval-Augmented Generation

面向知识的检索增强生成综述

Mingyue Cheng, Yucong Luo, Jie Ouyang, Qi Liu, Huijie Liu, Li Li, Shuo Yu, Bohou Zhang, Jiawei Cao, Jie Ma, Daoyu Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 该综述对检索增强生成进行全面概述,涵盖其基本组件、关键特性、分类法、评估基准及应用等,讨论了相关挑战与新兴研究方向,强调其在自然语言处理中应对现实挑战及推动发展的潜力。

Comments Accepted by ACM Transactions on Information Systems (TOIS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 57%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17651 2026-07-21 cs.RO 新提交 50%

HCPG-Flow:Hierarchical Contact-Progress Guidance for Flow-Policy Robot Manipulation

HCPG-Flow:用于流策略机器人操作的分层接触进展引导

Guanghu Xie, Mingxu Li, Shuo Zhang, Yonglong Zhang, Yifan Yang, Yang Liu, Zongwu Xie, Baoshi Cao

机构 * State Key Laboratory of Robotics and Systems, Harbin Institute of Technology(机器人技术与系统国家重点实验室,哈尔滨工业大学)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究机器人操作流策略中动作选择问题,提出HCPG-Flow方法,通过分层、以对象为中心的接触进展引导增强SAC-Flow,在模拟和物理任务中提高成功率,减少完成时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 50%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 17 篇

2607.13125 2026-07-21 cs.CV cs.AI 版本更新 81%

Boogu-Image-0.1: Boosting Open Agentic Multimodal Generation via Understanding under a Minimal Budget

Boogu-Image-0.1:提升开源统一多模态理解与生成能力

Guoxuan Chen, Chufeng Xiao, Haoran Yang, Siyue Xie, Binxiao Huang, Ming Zhang, Cheuk Him Chau, Xinyu Fu, Yingzhao Lian, Tom S. Y. Li, Jintao Lin, Bowen Dong, Zian Qian, Yuhao Liu, Yuxuan Hu, Weikang Shi, Bin Zou, Bowen Zheng, Haoxuan Che, Chang Chen, Yuyang He, Heyang Sun, Tianyu Huang, Chong Hou Choi, Cheng Gong, Han Shi, Haoli Bai, Xihui Liu, Hongsheng Li, Qifeng Chen, Chao Huang, Rui Liu, Chenyang Lei

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 介绍开源统一多模态模型Boogu-Image-0.1,通过改进模型理解、数据质量和训练管道等,结合智能推理扩展,提升生成和编辑性能,在标准基准测试中表现出色,成本低,还分享实践讨论并开源代码等推动相关生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19789 2026-07-21 cs.CV 版本更新 79%

OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation

OmniMotion-X:通用多模态全身运动生成

Guowei Xu, Yuxuan Bian, Ailing Zeng, Zhuo Chen, Mingyi Shi, Shaoli Huang, Wen Li, Lixin Duan, Qiang Xu

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 介绍用于全身人类运动生成的OmniMotion-X框架,利用自回归扩散变换器,提出参考运动等方法,构建数据集并采用新训练策略,超越现有方法,在多模态任务中表现出色,可交互式生成逼真连贯可控的长时间运动。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12923 2026-07-21 eess.SY cs.SY 版本更新 78%

Information-Optimal Formation Geometry Design for Multimodal UAV Cooperative Perception

多模态无人机协同感知的信息最优编队几何设计

Kai Xiong, Xingyu Wu, Anna Duan, Gang Li, Yongjun Huang, Supeng Leng, Jianhua He

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 针对多模态无人机协同感知,提出信息最优优化框架,通过最大化Fisher信息矩阵行列式优化分配与控制,引入等效编队转换策略及稳定飞行控制方案,相比传统方法,视场覆盖、通信信号强度和能耗等方面有显著提升,验证了任务驱动几何分配的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26800 2026-07-21 cs.CV cs.GR cs.LG 版本更新 70%

OmniX: From Unified Panoramic Generation and Perception to Graphics-Ready 3D Scenes

OmniX:从统一全景生成与感知到适用于图形的3D场景

Yukun Huang, Jiwen Yu, Yanning Zhou, Jianan Wang, Xintao Wang, Pengfei Wan, Xihui Liu

机构 * University of Hong Kong(香港大学) Kuaishou Technology(快手科技) Tencent(腾讯)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。

Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16727 2026-07-21 cs.AI cs.CV 新提交 62%

Constraint-Anchored Reasoning Traces

约束锚定推理轨迹

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * University of Oxford(牛津大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究自回归多模态大语言模型错误滚雪球问题,提出神经符号框架CART,将自然语言推理与符号约束断言交织,经双管齐下的模块验证约束,防止错误传播,在多基准测试中降低滚雪球率、提高准确率并控制推理开销。

Comments 15 pages, ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 62%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18227 2026-07-21 cs.CV 新提交 57%

FlowMimic: Mask-free Visual Editing and Generation with Pixel-pair Warped Flow Field for Online Video Editing Data Generation and Modality Mimicry

FlowMimic:基于像素对扭曲流场的无掩码视觉编辑与生成,用于在线视频编辑数据生成及模态模仿

Dingyun Zhang, Lixue Gong, Wei Liu

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV

AI总结 研究探索在单一模型中整合视频和图像模态的生成与编辑能力,开发像素对时间扭曲流场实时生成视频编辑样本,设计模态模仿损失对齐模态能力,引入相关任务及损失让模型内化基于语言的视觉编辑能力。

Comments Due to file size constraints, the figures in the arXiv file have been heavily lossy-compressed. Please visit the uncompressed file at: https://huggingface.co/datasets/FlowMimic/Uncompressed/blob/main/main.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 57%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17779 2026-07-21 cs.AI 新提交 57%

Dynamic Defense Profiling Enables Cognitive Jailbreak of Text-to-Image Models

动态防御剖析实现文本到图像模型的认知越狱

Dongdong Yang, Deyue Zhang, Zhao Liu, Zonghao Ying, Wenzhuo Xu, Jiankai Jin, Xiangzheng Zhang, Quanchen Zou

机构 * Alibaba Tongyi Lab(阿里巴巴通义实验室)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 研究文本到图像模型易受对抗性滥用问题,提出MIND认知越狱框架,将对抗提示生成重构为信念状态推理,集成多模态判断器等组件,经实验验证其在多个防御设置下显著优于现有方法,有效实现越狱生成。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17251 2026-07-21 cs.CV 新提交 57%

VecFontLLM: Anchor-Guided Direct Synthesis of Chinese Vector Fonts

VecFontLLM:基于锚点引导的中文矢量字体直接合成

Hao Yuan, Yuxuan Luo, Xing Chen, Zhouhui Lian

机构 * Fuzhou University(福州大学) Peking University(北京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在解决直接生成中文矢量字体的难题,提出VecFontLLM这一基于锚点引导的多模态大语言模型,通过锚点预测、细化及贝塞尔控制点完成来合成矢量字形,实现高质量少样本合成,实验显示其相比现有方法有显著优势。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17140 2026-07-21 cs.CV 新提交 57%

STBridge: Shared-Target Alignment for Bridging Understanding and Generation in UMMs

STBridge:用于在统一多模态模型中弥合理解与生成的共享目标对齐

Ye Wang, Hongjun Wang, Hao Fang, Tongyuan Bai, Zuwei Long, Peixian Chen, Wei Liu, Weibo Gu, Xing Sun, Rui Ma

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 研究统一多模态模型中理解与生成的对齐差距,提出STBridge共享目标对齐框架,通过共同目标状态连接二者,采用对齐然后优化策略,经实验验证该框架能缩小模型描述与生成间差距,有效弥合理解与生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 57%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16704 2026-07-21 cs.CL 新提交 57%

Though Language Models Err While They Strive: Conformal Prediction for Self-Correcting Scientific Generation

尽管语言模型在努力时会出错:用于自我纠正科学生成的共形预测

Mingqiao Mo, Yunlong Tan, Hao Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 研究针对大语言模型生成技术内容常违反科学原理的问题,提出图结构共形预测框架SFC,将科学推理分解为单元,考虑逻辑依赖,通过实时验证和动态分支纠错,在多基准测试中表现出色,提升准确率、有效性并减少定律违反。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏