arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 23 篇

2508.17394 2026-04-21 cs.CV 79%

LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models

面向RAG的医疗诊断的LVLM感知多模态检索

Nir Mazor, Tom Hope

机构 * School of Computer Science and Engineering, The Hebrew University of Jerusalem(希伯来大学耶路撒冷分校计算机科学与工程学院) The Allen Institute for AI (AI2)(人工智能研究院(AI2))

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出轻量级机制提升检索增强LVLM的诊断性能,通过轻量微调和通用模型实现临床分类和VQA任务的竞争力结果,并分析不一致检索预测问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16397 2026-04-21 cs.CL cs.AI 79%

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

从归因到回避:基于注意力的无训练审计用于临床摘要

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi

机构 * University of California, Santa Barbara(加州大学圣芭芭拉分校) Oracle Health AI

专题命中 跨模态检索 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ClinTrace框架,通过解码器注意力权重提取临床有用信号,实现无训练的注意力基于审计,提升临床摘要的透明性和可靠性,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 70%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 跨模态检索 :cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18051 2026-04-21 cs.CV 70%

INTENT: Invariance and Discrimination-aware Noise Mitigation for Robust Composed Image Retrieval

INTENT: 为鲁棒的复合图像检索的不变性与判别意识噪声缓解

Zhiwei Chen, Yupeng Hu, Zhiheng Fu, Zixu Li, Jiale Huang, Qinlei Huang, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出INTENT网络,通过视觉不变组成和双目标判别学习处理复合图像检索中的两种噪声类型,提升检索鲁棒性。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17581 2026-04-21 cs.LG cs.AI q-bio.NC 70%

How Much Data is Enough? The Zeta Law of Discoverability in Biomedical Data, featuring the enigmatic Riemann zeta function

需要多少数据?生物医学数据的发现率ζ定律,涉及神秘的黎曼ζ函数

Paul M. Thompson

机构 * Stevens Institute for Neuroimaging & Informatics(神经影像与信息学史蒂文斯研究所) University of Southern California(南加州大学) Los Angeles, CA, USA(洛杉矶,加利福尼亚州,美国)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出基于数据协方差算子谱结构的跨模态发现率定律框架,揭示性能指标与ζ函数的关系,为数据规模、表示学习和多模态扩展提供理论指导。

Comments 25 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18508 2026-04-21 cs.IR cs.AI cs.CL 62%

Document-as-Image Representations Fall Short for Scientific Retrieval

基于文档的图像表示在科学检索中表现不佳

Ghazal Khalighinejad, Raghuveer Thirukovalluru, Alexander H. Oh, Bhuwan Dhingra

机构 * Department of Computer Science(计算机科学系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArXivDoc新基准,通过LaTeX源代码构建,对比文本、图像和多模态检索方法,发现基于图像的文档表示效果差,文本表示更有效,多模态方法表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12069 2026-04-21 cs.CR cs.AI cs.CL cs.LG 62%

Rethinking Jailbreak Detection of Large Vision Language Models with Representational Contrastive Scoring

重新思考大型视觉语言模型的 Jailbreak 检测:基于表示对比评分

Peichun Hua, Hao Li, Shanghao Shi, Zhiyuan Yu, Ning Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于内部表示对比评分的框架,通过学习轻量投影分离良性与恶意输入,实现有效 Jailbreak 检测,改进现有方法的泛化能力和效率。

Comments To appear at ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19549 2026-04-21 cs.CL cs.CV cs.IR 62%

Sculpting the Vector Space: Towards Efficient Multi-Vector Visual Document Retrieval via Prune-then-Merge Framework

塑造向量空间:通过剪枝-然后-融合框架实现高效的多向量视觉文档检索

Yibo Yan, Mingdong Ou, Yi Cao, Xin Zou, Jiahao Huo, Shuliang Liu, James Kwok, Xuming Hu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Cloud Computing(阿里云计算)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 本文提出剪枝-然后-融合框架,通过两阶段方法提升多向量视觉文档检索效率,实验表明其在压缩率与特征保真度间取得平衡,显著扩展近无损压缩范围。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13707 2026-04-21 cs.CV cs.AI cs.LG 62%

Attention-space Contrastive Guidance for Efficient Hallucination Mitigation in LVLMs

注意力空间对比引导用于高效缓解大视觉-语言模型中的幻觉

Yujin Jo, Sangyoon Bae, Taesup Kim

机构 * Seoul National University(首尔国立大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Attention-space Contrastive Guidance方法,通过对比引导生成更视觉一致且语义忠实的文本,实验表明在CHAIR和POPE数据集上提升了忠实度并降低了延迟。

Comments Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18037 2026-04-21 cs.CV 57%

HABIT: Chrono-Synergia Robust Progressive Learning Framework for Composed Image Retrieval

HABIT: 时序协同鲁棒渐进学习框架用于复合图像检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Shiqi Zhang, Qinlei Huang, Zhiheng Fu, Yinwei Wei

机构 * School of Software, Shandong University(山东大学软件学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 HABIT框架通过互知识估计模块和双一致性渐进学习模块,解决复合图像检索中的噪声三元组对应问题,提升鲁棒性和检索性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17898 2026-04-21 cs.CV 57%

ReTrack: Evidence-Driven Dual-Stream Directional Anchor Calibration Network for Composed Video Retrieval

ReTrack:基于证据的双流方向锚校准网络用于复合视频检索

Zixu Li, Yupeng Hu, Zhiwei Chen, Qinlei Huang, Guozhi Qiu, Zhiheng Fu, Meng Liu

机构 * School of Software, Shandong University(山东大学软件学院) School of Computer Science and Technology, Shandong Jianzhu University(山东建筑大学计算机科学与技术学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 ReTrack通过校准复合特征的方向偏差,解决复合视频检索中模态贡献纠缠、特征优化和检索不确定性问题,实现多模态查询理解的提升,并在复合图像检索任务中取得最佳性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15951 2026-04-21 cs.AI 57%

Integrating Graphs, Large Language Models, and Agents: Reasoning and Retrieval

图、大语言模型与代理的整合:推理与检索

Hamed Jelodar, Samita Bai, Mohammad Meymani, Parisa Hamedi, Roozbeh Razavi-Far, Ali Ghorbani

机构 * Canadian Institute for Cybersecurity, Faculty of Computer Science, University of New Brunswick(加拿大网络安全研究所,计算机科学学院,新不伦瑞克大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了图与大语言模型整合的设计选择,分类了基于用途、图模态和整合策略的方法,探讨了不同领域中的适用场景和优缺点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13468 2026-04-21 cs.IR cs.CL 57%

From Relevance to Authority: Authority-aware Generative Retrieval in Web Search Engines

从相关性到权威性:面向网页搜索引擎的权威感知生成检索

Sunkyung Lee, Jihye Back, Donghyeon Jeon, Soonhwan Kwon, Moonkwon Kim, Inho Kang, Jongwuk Lee

机构 * Sungkyunkwan University(成均馆大学) Naver Corporation(Naver公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出权威感知生成检索框架AuthGR,通过多模态权威评分、三阶段训练和混合集成流程提升检索的权威性和准确性,在实际应用中显著提高用户参与度和可靠性。

Comments ACL 2026 (Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17005 2026-04-21 cs.CV cs.SD 57%

TeMuDance: Contrastive Alignment-Based Textual Control for Music-Driven Dance Generation

TeMuDance: 基于对比对齐的文本控制音乐驱动舞蹈生成

Xinran Liu, Diptesh Kanojia, Wenwu Wang, Zhenhua Feng

机构 * University of Surrey, Guildford, Surrey, UK(萨里大学) Jiangnan University, Wuxi, Jiangsu, China(江南大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TeMuDance框架,通过统一嵌入空间对齐音乐、文本和运动数据,实现无需手动标注数据的文本控制音乐驱动舞蹈生成,提升语义可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16678 2026-04-21 cs.LG 50%

UniCon: Unified Framework for Efficient Contrastive Alignment via Kernels

UniCon:通过核方法实现高效的对比对齐统一框架

Hangke Sui, Yuqing Wang, Minh N Do

机构 * Department of Electrical & Computer Engineering, The Grainger College of Engineering, UIUC(电气与计算机工程系,格拉inger工程学院,伊利诺伊大学香槟分校) Siebel School of Computing and Data Science, The Grainger College of Engineering, UIUC(计算与数据科学学院,格拉inger工程学院,伊利诺伊大学香槟分校) Coordinated Science Laboratory, University of Illinois Urbana-Champaign (UIUC)(协调科学实验室,伊利诺伊大学香槟分校) VinUni-Illinois Smart Health Center(VinUni-伊利诺伊智能健康中心)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 UniCon通过引入对比相似度权重矩阵S(γ),提供了一种统一的对比对齐框架,实现了闭式全局解,替代了 minibatch反向传播,提升了效率并保持了通用性和性能。

Comments 33 pages, 8 figures, 8 tables. Accepted by The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08411 2026-04-21 cs.IR 50%

A Sketch+Text Composed Image Retrieval Dataset for Thangka

用于唐卡的草图+文本组合图像检索数据集

Jinyu Xu, Yi Sun, Jiangling Zhang, Qing Xie, Daomin Ji, Zhifeng Bao, Jiachen Li, Yanchun Ma, Yongjian Liu

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出CIRThan数据集,包含2287张高质量唐卡图像,每张图像配有人工绘制的草图和三级语义描述,支持联合表达结构意图和多级语义的组合查询,用于推动文化遗址和知识特定视觉领域的草图+文本组合图像检索研究。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态生成 17 篇

2604.10741 2026-04-21 cs.CL cs.AI cs.IR 84%

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17585 2026-04-21 cs.CV cs.AI cs.LG 82%

DGSSM: Diffusion guided state-space models for multimodal salient object detection

DGSSM:基于扩散引导的状态空间模型的多模态显著目标检测

Suklav Ghosh, Arijit Sur, Pinaki Mitra

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Guwahati(计算机科学与工程系,印度理工学院,果阿提)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出DGSSM,一种结合扩散模型结构先验和多尺度状态空间编码的多模态显著目标检测框架,通过迭代Mamba扩散细化机制提升边界精度,实验表明其在多个评估指标上优于现有方法。

Comments Accepted at ICPR 2026. Diffusion-guided Mamba framework for multimodal salient object detection. Evaluated on 13 benchmarks (RGB, RGB-D, RGB-T)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV 81%

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17319 2026-04-21 cs.CV cs.CL 81%

E2E-GMNER: End-to-End Generative Grounded Multimodal Named Entity Recognition

E2E-GMNER:端到端生成式 grounded 多模态命名实体识别

Meng Zhang, Jinzhong Ning, Xiaolong Wu, Hongfei Lin, Yijia Zhang

机构 * Dalian Maritime University(大连海事大学) Dalian University of Technology(大连理工大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出E2E-GMNER,通过端到端生成框架统一实体识别、语义类型预测和视觉定位,采用链式推理和GRBP提升鲁棒性,实验证明其在多模态命名实体识别任务中表现优异。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09536 2026-04-21 cs.AI 79%

Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning

Omni-R1:迈向多模态推理的统一生成范式

Dongjie Cheng, Yongqi Li, Zhixin Ma, Hongru Cai, Yupeng Hu, Wenjie Wang, Liqiang Nie, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Singapore Management University(新加坡国立大学) Shandong University(山东大学) University of Science and Technology of China(中国科学技术大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Omni-R1,通过生成中间图像统一多模态推理技能,解决单一任务特定推理模式限制的问题,并引入Omni-R1-Zero无需多模态标注实现文本仅推理数据的逐步可视化。

Comments Accepted by ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 79%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG 78%

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

专题命中 多模态生成 :cross-modal(title,abstract)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13637 2026-04-21 cs.CV cs.MM 76%

Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation

探索互惠的跨模态注意力以实现情境感知的人体可供性生成

Prasun Roy, Saumik Bhattacharya, Subhankar Ghosh, Umapada Pal, Michael Blumenstein

机构 * University of Technology Sydney(技术大学悉尼大学) Indian Institute of Technology, Kharagpur(印度理工学院哈里科特) Indian Statistical Institute, Kolkata(印度统计研究所科契)

专题命中 多模态生成 :cross-modal(title);分类 cs.CV、cs.MM

AI总结 本文提出一种互惠的跨模态注意力机制,通过不同模态的空间特征图互相关注,以提升2D场景中人体可供性预测的准确性与效率。

Comments Accepted in The IEEE Transactions on Artificial Intelligence (TAI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14324 2026-04-21 cs.CV cs.CL 73%

DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies

DualToken: 向通过双视觉词汇统一视觉理解和生成迈进

Wei Song, Yuran Wang, Zijia Song, Yadong Li, Zenan Zhou, Long Chen, Jianhua Xu, Jiaqi Wang, Kaicheng Yu

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Baichuan Inc.(北川科技) Peking University(北京大学) Xiaomi EV(小米电动车)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 DualToken通过双视觉词汇统一视觉理解和生成,解决了视觉理解和生成所需不同表示空间的挑战,提升了ImageNet上的重建质量和零样本准确率,并在下游任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18027 2026-04-21 cs.SE cs.CL 70%

CodePivot: Bootstrapping Multilingual Transpilation in LLMs via Reinforcement Learning without Parallel Corpora

CodePivot: 通过强化学习无需平行语料库提升LLM的多语言转译

Shangyu Li, Juyong Jiang, Meibo Ren, Sizhe Zhong, Huiri Tan, Yunhao Gou, Xu Han, Chun Yong Chong, Yun Peng, Jiasi Shen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Monash University(莫纳什大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :any-to-any(abstract,abstract_cn);分类 cs.CL

AI总结 CodePivot通过Python作为中间表示和Aggressive-Partial-Functional奖励机制,无需平行语料库提升LLM的多语言转译能力,在10种编程语言上实验显示其在通用和低资源语言转译任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV 70%

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 67%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11789 2026-04-21 cs.CV 57%

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

LMMs 与以物体为中心的视觉:理解、分割、编辑和生成

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文探讨了LMMs与以物体为中心的视觉结合,总结了在理解、分割、编辑和生成方面的新进展,提出了开放挑战和未来方向。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06663 2026-04-21 cs.CV 57%

PlanViz: Evaluating Planning-Oriented Image Generation and Editing for Computer-Use Tasks

PlanViz: 评估面向计算机使用任务的图像生成与编辑

Junxian Li, Kai Liu, Leyang Chen, Weida Wang, Zhixin Wang, Jiaqi Xu, Fan Li, Renjing Pei, Linghe Kong, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Huawei Technologies Ltd(华为技术有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 PlanViz旨在评估图像生成与编辑在计算机使用任务中的表现,通过设计日常生活中常见的子任务,如路线规划、工作图示和网页与UI显示,提出任务自适应评分体系PlanScore以评估生成图像的正确性、视觉质量和效率。

Comments The main part of our paper: PlanViz Code is at: https://github.com/lijunxian111/PlanViz Supplementary material is at: https://github.com/lijunxian111/PlanViz/releases/tag/v1

详情

展开后加载摘要…

URL PDF HTML 收藏