arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-28 至 2026-04-28 共收录 132 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 13 篇

2604.23173 2026-04-28 cs.CV 79%

One Identity, Many Roles: Multimodal Entity Coreference for Enhanced Video Situation Recognition

一个身份,多种角色:多模态实体指代用于增强视频情境识别

Balaji Darur, Amanmeet Garg, Makarand Tapaswi

机构 * CVIT, IIIT Hyderabad, India(IIIT海得拉尔学院计算机视觉研究所,印度) Amazon Prime Video, Seattle(亚马逊Prime视频,西雅图)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出多模态实体指代(MEC)方法,通过结合文本和视频信息提升视频情境识别的准确性和一致性,实验结果显示在描述和视觉定位方面均取得显著提升。

Comments Accepted to CVPR 2026 Findings. Project Page: https://katha-ai.github.io/projects/cinemec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21094 2026-04-28 cs.CV 79%

EMCompress: Video-LLMs with Endomorphic Multimodal Compression

EMCompress: 具有端态多模态压缩的视频大语言模型

Zheyu Fan, Jiateng Liu, Yuji Zhang, Zihan Wang, Yi R. Fung, Manling Li, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northwestern University(西北大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出端态多模态压缩(EMC)作为视频问答的结构约束充分统计问题,通过端态变换保持答案不变性,提升视频语言理解的训练和推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24002 2026-04-28 cs.HC cs.AI cs.MM 62%

IntentVLM: Open-Vocabulary Intention Recognition through Forward-Inverse Modeling with Video-Language Models

IntentVLM: 通过视频语言模型的前-后向建模实现开放词汇意图识别

Hamed Rahimi, Clemence Grislain, Adrien Jacquet Cretides, Olivier Sigaud, Mohamed Chetouani

机构 * Institute of Intelligent Systems and Robotics (ISIR)(智能系统与机器人研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI、cs.MM

AI总结 本文提出IntentVLM框架,通过前-后向建模提升多模态环境下的人意图识别效果,实验表明其在IntentQA和Inst-IT Bench数据集上达到80%准确率,超越基线30%,接近人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23532 2026-04-28 cs.CV cs.AI 62%

Emotion-Conditioned Short-Horizon Human Pose Forecasting with a Lightweight Predictive World Model

基于轻量预测世界模型的情感条件短周期人体姿态预测

Jingni Huang, Peter Bloodsworth

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究了情感嵌入对短周期姿态预测的辅助作用,提出轻量级自回归预测世界模型,结合姿态关键点与情感嵌入,提升情感驱动动作序列的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23325 2026-04-28 cs.CV cs.AI eess.IV 62%

EAD-Net: Emotion-Aware Talking Head Generation with Spatial Refinement and Temporal Coherence

EAD-Net:具有空间细化和时间一致性的情感感知说话头生成

Yahui Li, Yinfeng Yu, Liejun Wang, Shengjie Shen

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 EAD-Net通过引入同步网络监督和时空方向注意力机制,提升情感感知说话头生成的唇同步精度和时间一致性,同时利用大语言模型增强情感语义控制。

Comments Main paper (10 pages). Accepted for publication by ICMR(International Conference on Multimedia Retrieval) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23145 2026-04-28 cs.CV cs.AI 62%

UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks

UpstreamQA:一个用于视频问答任务显式推理的模块化框架

Jason Nguyen, Ameet Rao, Alexander Chang, Ishaan Kumar, Erin Tan

机构 * Lincoln North Star High School(林肯北星高中) The Charter School of Wilmington(威尔明顿 charter 学校) Greenwich High School(格林威治高中) Santa Susana High School(圣塔苏娜高中) UC Berkeley(伯克利大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出UpstreamQA框架,通过显式推理模块分离和评估视频推理核心组件,提升视频问答任务的性能和可解释性,但可能在基线性能高时导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22839 2026-04-28 cs.CV cs.AI 62%

From Skeletons to Pixels: Few-Shot Precise Event Spotting via Representation and Prediction Distillation

从骨骼到像素:通过表示和预测蒸馏实现少样本精确事件定位

Zhong Han Ervin Yeoh, Jiang Kan

机构 * Department of Business Analytics(商业分析系) School of Computing(计算学院) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出两种互补的蒸馏策略,通过多模态蒸馏提升少样本精确事件定位的泛化能力,实验表明在网球和花样滑冰数据集中均优于单一模态基线。

Comments 39 pages, 4 figures, ISACE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 57%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23198 2026-04-28 cs.AI 57%

StoryTR: Narrative-Centric Video Temporal Retrieval with Theory of Mind Reasoning

StoryTR: 基于心智理论的叙事视频时序检索

Xuanyue Zhong, Yuqiang Xie, Guanqun Bi, Jiangping Yang, Guibin Chen

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong, Hong Kong(香港中文大学计算机科学与工程系) SkyReels, Skywork AI(SkyReels与Skywork AI) Independent Researcher(独立研究者)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 StoryTR首次引入需要心智理论推理的视频时刻检索基准,通过生成包含8100个样本的叙事短视频数据集,验证了心智理论推理在视频理解中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23001 2026-04-28 cs.RO cs.AI 57%

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

机器人中的视觉-语言-动作:数据集、基准和数据引擎的综述

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, Ang Li

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Utah(犹他大学) Northeastern University(东北大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了视觉-语言-动作研究中数据基础设施的关键挑战,指出未来进展依赖于数据引擎与评估协议的协同设计,揭示了数据集、基准和数据引擎的四大开放挑战。

Comments This is a survey paper. The survey is already accepted by TMLR after peer-review. The OpenReview link is here: https://openreview.net/forum?id=tAaWFpvnmm

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07990 2026-04-28 cs.CV 57%

SceneScribe-1M: A Large-Scale Video Dataset with Comprehensive Geometric and Semantic Annotations

SceneScribe-1M:一个具有全面几何和语义标注的大规模视频数据集

Yunnan Wang, Kecheng Zheng, Jianyuan Wang, Minghao Chen, David Novotny, Christian Rupprecht, Yinghao Xu, Xing Zhu, Wenjun Zeng, Xin Jin, Yujun Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团) Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东部技术研究院,宁波) Zhejiang Key Laboratory of Industrial Intelligence and Digital Twin(浙江工业智能与数字孪生重点实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 SceneScribe-1M通过提供一个包含一百万真实视频的数据集,支持3D几何感知与视频合成的统一资源,推动了单目深度估计、场景重建等下游任务及文本到视频合成等生成任务的发展。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19554 2026-04-28 cs.LG 50%

MobText-SISA: Efficient Machine Unlearning for Mobility Logs with Spatio-Temporal and Natural-Language Data

MobText-SISA:基于时空和自然语言数据的高效机器反学习

Haruki Yonekura, Ren Ozeki, Tatsuya Amano, Hamada Rizk, Hirozumi Yamaguchi

机构 * The University of Osaka(大阪大学) RIKEN Center for Computational Science(理化学研究所计算科学中心) Tanta University(塔塔大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 MobText-SISA通过扩展SISA训练方法,实现对异构时空数据的高效机器反学习,保持预测精度并优于随机分片方法,为城市规模的多模态移动数据隐私合规分析提供基础。

Comments Accepted to The 33rd ACM International Conference on Advances in Geographic Information Systems(SIGSPATIAL '25) as a short paper in the Short Paper Track

Journal ref In Proceedings of the 33rd ACM International Conference on Advances in Geographic Information Systems (SIGSPATIAL '25), 2025, pp. 1186-1189

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 跨模态检索 11 篇

2508.05318 2026-04-28 cs.CV cs.AI 86%

mKG-RAG: Leveraging Multimodal Knowledge Graphs in Retrieval-Augmented Generation for Knowledge-intensive VQA

mKG-RAG:利用多模态知识图谱在检索增强生成中进行知识密集型视觉问答

Xu Yuan, Liangbo Ning, Qingqing Ye, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出mKG-RAG框架,通过整合多模态知识图谱提升检索增强生成在知识密集型视觉问答中的性能,采用双阶段检索策略和图提取方法构建高质量知识图谱,实验表明优于现有方法。

Comments In Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR'26), July 20-24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23323 2026-04-28 cs.CL cs.SD 83%

Robust Audio-Text Retrieval via Cross-Modal Attention and Hybrid Loss

通过跨模态注意力和混合损失实现鲁棒的音频-文本检索

Meizhu Liu, Matthew Rowe, Amit Agarwal, Michael Avendi, Yassi Abbasi, Hitesh Laxmichand Patel, Paul Li, Kyu J. Han, Tao Sheng, Sujith Ravi, Dan Roth

专题命中 跨模态检索 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL

AI总结 本文提出一种新的多模态检索框架,通过跨模态嵌入细化模块和混合损失函数提升音频与文本检索的鲁棒性,有效处理长音频和噪声。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23281 2026-04-28 cs.LG cs.CV 83%

Contrastive Learning for Multimodal Human Activity Recognition with Limited Labeled Data

基于有限标记数据的多模态人类活动识别对比学习

Long Jing, Zhixiong Yang, Yajun Zhang, Xinlong Feng

机构 * College of Computer Science, Northwest University(西北大学计算机学院) Xinjiang University(新疆大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出CLMM框架,通过两阶段训练策略提升有限标记数据下的多模态人类活动识别性能,实验表明在三个公开数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24029 2026-04-28 cs.CV cs.CL cs.IR cs.MM 82%

DeepTaxon: An Interpretable Retrieval-Augmented Multimodal Framework for Unified Species Identification and Discovery

DeepTaxon: 一种可解释的检索增强多模态框架,用于统一的物种识别与发现

Jiawei Wang, Ming Lei, Yaning Yang, Xinyan Lin, Yuquan Le, Qiwei Ma, Zhiwei Xu, Zheqi Lv, Yuchen Ang, Zhe Quan, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Hunan University(湖南大学) Xiangtan University(湘潭大学) Hunan Normal University(湖南师范大学) Zhejiang University(浙江大学) Cornell University(康奈尔大学) Meituan(美团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 DeepTaxon通过可解释的检索增强多模态框架,统一物种识别与发现,通过检索证据进行链式推理,提升识别和发现的准确性与可解释性。

Comments 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23195 2026-04-28 cs.CV cs.AI 81%

AnalogRetriever: Learning Cross-Modal Representations for Analog Circuit Retrieval

AnalogRetriever: 为模拟电路检索学习跨模态表示

Yihan Wang, Lei Li, Yao Lai, Jing Wang, Yan Lu

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Cambridge(剑桥大学) Nanjing University of Posts and Telecommunications(南京邮电大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnalogRetriever,通过构建高质量数据集和三模态检索框架,实现跨模态的模拟电路检索,实验表明其在六个方向上的Recall@1达到75.2%,显著优于现有方法。

Comments 10 pages, 7 figures. Yihan Wang and Lei Li contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22885 2026-04-28 cs.CV cs.AI 81%

Federated Cross-Modal Retrieval with Missing Modalities via Semantic Routing and Adapter Personalization

联邦跨模态检索与缺失模态的语义路由和适配器个性化

Hefeng Zhou, Xuan Liu, Sicheng Chen, Wutong Zhang, Wu Yan, Jiong Lou, Chentao Wu, Guangtao Xue, Wei Zhao, Jie Li

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎-鲁克桑克鲁特研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕尔默研究实验室) Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) Shaanghai Jiao Tong University(上海交通大学)

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出RCSR框架,通过语义路由和适配器个性化解决联邦跨模态检索中异构数据和缺失模态的问题,提升全局检索准确性和训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23522 2026-04-28 cs.IR cs.MM 79%

Beyond Static Collision Handling: Adaptive Semantic ID Learning for Multimodal Recommendation at Industrial Scale

超越静态碰撞处理:面向工业级多模态推荐的自适应语义ID学习

Yongsen Pan, Yuxin Chen, Zheng Hu, Xu Yuan, Daoyuan Wang, Yuting Yin, Songhao Ni, Hongyang Wang, Jun Wang, Fuji Ren, Wenwu Ou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.MM

AI总结 本文提出AdaSID框架,通过两阶段过程自适应处理多模态推荐中的语义ID碰撞问题,提升召回率和NDCG,并在工业场景中取得显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20291 2026-04-28 cs.CV cs.CL 62%

VisRet: Visualization Improves Knowledge-Intensive Text-to-Image Retrieval

VisRet:可视化改进知识密集型文本到图像检索

Di Wu, Yixin Wan, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 VisRet通过将文本查询投影到图像模态,提升跨模态检索效果,优于传统方法,在四个基准测试中提升nDCG@30,并提高下游问答准确性。

Comments ACL 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24469 2026-04-28 cs.IR cs.CV 57%

Geometric Analysis of Self-Supervised Vision Representations for Semantic Image Retrieval

视觉语义图像检索中自监督表示的几何分析

Esteban Rodríguez-Betancourt, Edgar Casasola-Murillo

机构 * Universidad de Costa Rica(哥斯达黎加大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 研究评估现代自监督学习方法在图像检索中的表现,发现高各向异性表示会损害基于分区和哈希的搜索性能,而更各向同性表示能提升语义检索效果。

Comments 8 pages, 3 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22755 2026-04-28 cs.IR cs.AI 57%

RADIANT-LLM: an Agentic Retrieval Augmented Generation Framework for Reliable Decision Support in Safety-Critical Nuclear Engineering

RADIANT-LLM:一种用于安全关键核工程中可靠决策支持的代理检索增强生成框架

Zavier Ndum Ndum, Jian Tao, John Ford, Mansung Yim, Yang Liu

机构 * Department of Nuclear Engineering, Texas A\&M University, College Station, TX, USA College of Performance, Visualization Fine Arts, Texas A\&M University, College Station, TX, USA

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出RADIANT-LLM框架,通过多模态检索增强生成技术,结合领域知识库和代理层,提升核工程中的决策支持准确性与透明度,降低幻觉风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16730 2026-04-28 cs.LG cs.AI stat.AP 57%

"Noisier" Noise Contrastive Eestimation is (Almost) Maximum Likelihood

更嘈杂的噪声对比估计几乎等同于最大似然估计

Peiyu Yu, Dinghuai Zhang, Hengzhi He, Xiaojian Ma, Sirui Xie, Ruiyao Miao, Yifan Lu, Yasi Zhang, Deqian Kong, Ruiqi Gao, Jianwen Xie, Guang Cheng, Ying Nian Wu

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Mila - Quebec AI Institute(魁北克人工智能研究所) Google DeepMind(谷歌DeepMind) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) Akool Research(Akool研究)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出'Noisier' NCE,通过增大噪声幅度使NCE梯度接近最大似然估计,从而在理论和实践中实现更快收敛,适用于高维和多模态数据集的密度比估计。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态生成 14 篇

2604.24506 2026-04-28 cs.AI cs.LG 88%

MIMIC: A Generative Multimodal Foundation Model for Biomolecules

MIMIC:一种生成式多模态基础模型用于生物分子

Siavash Golkar, Jake Kovalic, Irina Espejo Morales, Samuel Sledzieski, Minhuan Li, Ksenia Sokolova, Geraud Krawezik, Alberto Bietti, Claudia Skok Gibbs, Roman Klypa, Shengwei Xiong, Francois Lanusse, Liam Parker, Kyunghyun Cho, Miles Cranmer, Tom Hehir, Michael McCabe, Lucas Meyer, Rudy Morel, Payel Mukhopadhyay, Mariel Pettee, Helen Qu, Jeff Shen, David Fouhey, Hadi Sotoudeh, Vikram Mulligan, Pilar Cossio, Sonya M. Hanson, Alisha N. Jones, Olga G. Troyanskaya, Shirley Ho

机构 * Polymathic AI Center for Data Science, New York University(多学科人工智能数据科学中心,纽约大学) Polymathic AI Department of Applied Physics, Yale University(多学科人工智能应用物理系,耶鲁大学) Center for Computational Mathematics, Flatiron Institute(计算数学中心,Flatiron研究所) Center for Computational Biology, Flatiron Institute(计算生物学中心,Flatiron研究所) Princeton Precision Health, Princeton University(普林斯顿精准健康,普林斯顿大学) Department of Chemistry, New York University(化学系,纽约大学) Department of Computer Science, Princeton University(计算机科学系,普林斯顿大学) Lewis-Sigler Institute for Integrative Genomics, Princeton University(刘易斯-西格尔整合基因组学研究所,普林斯顿大学) Center for Computational Astrophysics, Flatiron Institute(计算天文学中心,Flatiron研究所) Department of Astrophysical Sciences, Princeton University(天体物理科学系,普林斯顿大学) Department of Physics, New York University(物理学系,纽约大学)

专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(title,abstract);分类 cs.AI

AI总结 MIMIC通过多模态生成模型统一生物分子的表示学习、条件预测和受限设计,实现对RNA和蛋白质的先进预测与设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 84%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23579 2026-04-28 cs.MM 83%

CineAGI: Character-Consistent Movie Creation through LLM-Orchestrated Multi-Modal Generation and Cross-Scene Integration

CineAGI:通过LLM协同多模态生成与跨场景整合实现角色一致的电影创作

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

专题命中 多模态生成 :multi-modal(title);cross-modal(abstract);audio-visual(abstract);分类 cs.MM

AI总结 CineAGI通过多代理叙事合成模块、角色中心流水线和分层音视频同步机制,提升电影创作的一致性和质量,实现40%的整体一致性提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23584 2026-04-28 cs.CV cs.IR 79%

Identity-Decoupled Anonymization for Visual Evidence in Multi-modal Retrieval-Augmented Generation

多模态检索增强生成中视觉证据的身份解耦匿名化

Zehua Cheng, Wei Dai, Jiahao Sun

机构 * Department of Computer Science University of Oxford, UK

专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出身份解耦MRAG框架,通过在检索与生成之间插入生成匿名化模块,解耦人脸身份与属性,利用生成对抗网络和拒绝采样器实现隐私保护。

Comments ACM International Conference on Multimedia Retrieval 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16702 2026-04-28 cs.CV 74%

Animalbooth: multimodal feature enhancement for animal subject personalization

Animalbooth:多模态特征增强用于动物主体个性化

Chen Liu, Haitao Wu, Kafeng Wang, Weiran Huang

机构 * College of Intelligence and Computing(智能与计算学院) Department of Computer Science and Technology(计算机科学与技术系) School of Computer Science(计算机科学学院)

专题命中 多模态生成 :multimodal(title);分类 cs.CV

AI总结 针对动物图像生成中丰富的外观线索和形态多样性带来的挑战,AnimalBooth通过Animal Net和自适应注意力模块增强身份保持,结合频域控制特征整合模块提升扩散过程的全局结构到细节纹理的逐步生成,同时构建AnimalBench数据集验证了其在多个基准上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM 67%

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 67%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏