arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-21 至 2026-04-21 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 13 篇

2604.16785 2026-04-21 cs.CV cs.AI 85%

Bridging Coarse and Fine Recognition: A Hybrid Approach for Open-Ended Multi-Granularity Object Recognition in Interactive Educational Games

弥合粗粒与细粒识别:一种混合方法用于交互教育游戏中的开放多粒度物体识别

Hanling Yi, Feng Lin, Mao Luo, Yifan Yang, Xiaotian Yu, Rong Xiao

机构 * Intellifusion Inc.(Intellifusion公司)

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出HyMOR混合框架,结合MLLM和CLIP模型,解决开放多粒度物体识别中的粗粒与细粒任务差距问题,通过TBO数据集实验验证其在多模态内容生成和互动学习中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02541 2026-04-21 cs.LG cs.AI cs.CV 82%

Rethinking Post-Unlearning Behavior of Large Vision-Language Models

重新思考大型视觉-语言模型的后反遗忘行为

Minsung Kim, Nakyeong Yang, Kyomin Jung

机构 * Seoul National University(首尔国立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出新的反遗忘任务和PUBG方法,旨在生成隐私保护且信息丰富的后反遗忘响应,解决现有方法导致的退化、幻觉或过度拒绝问题。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13868 2026-04-21 cs.CV cs.AI 81%

When Seeing Overrides Knowing: Disentangling Knowledge Conflicts in Vision-Language Models

当感知超越认知:在视觉-语言模型中解构知识冲突

Francesco Ortu, Zhijing Jin, Diego Doimo, Alberto Cazzaniga

机构 * University of Trieste(特里este大学) AREA Science Park(AREAS科学公园) MPI University of Toronto(多伦多大学) Vector Institute(向量研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文研究视觉-语言模型如何解决跨模态冲突,通过引入WHOOPS-AHA!数据集,发现特定注意力头可调节模型对内部知识或视觉信息的偏好,提升冲突解决的精确度。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 81%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 其他VLM :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17941 2026-04-21 cs.CV cs.CL 79%

From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

从头到神经元:多任务视觉-语言模型中的因果归因与操控

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出HONES框架,通过任务相关的注意力头来评估神经元的因果贡献,改进多任务视觉-语言模型中神经元的归因与操控,提升模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20751 2026-04-21 cs.CV 70%

Pref-GRPO: Pairwise Preference Reward-based GRPO for Stable Text-to-Image Reinforcement Learning

Pref-GRPO:基于偏好奖励的GRPO用于稳定文本到图像强化学习

Yibin Wang, Zhimin Li, Yuhang Zang, Yujie Zhou, Jiazi Bu, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Hunyuan, Tencent(腾讯文脉) Shanghai AI Lab(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Pref-GRPO方法,通过偏好奖励机制提升文本到图像生成的稳定性,同时引入UniGenBench基准测试评估模型性能。

Comments Project Page: https://codegoat24.github.io/UnifiedReward/Pref-GRPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08480 2026-04-21 cs.CV cs.IR 70%

Compressing then Matching: An Efficient Pre-training Paradigm for Multimodal Embedding

压缩后再匹配:一种高效的多模态嵌入预训练范式

Da Li, Yuxiao Luo, Keping Bi, Jiafeng Guo, Wei Yuan, Biao Yang, Yan Wang, Fan Yang, Tingting Gao, Guorui Zhou

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Kuaishou Technology(快手科技)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出CoMa,一种高效的多模态嵌入预训练方法,通过压缩预训练阶段提升对比学习效率,实现多模态嵌入模型的高效优化。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18269 2026-04-21 cs.CL cs.CV 70%

TextTIGER: Text-based Intelligent Generation with Entity Prompt Refinement for Text-to-Image Generation

TextTIGER:基于实体提示精炼的文本智能生成用于文本到图像生成

Shintaro Ozaki, Tomoyuki Jinno, Kazuki Hayashi, Yusuke Sakai, Jingun Kwon, Hidetaka Kamigaito, Katsuhiko Hayashi, Manabu Okumura, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技術研究所) The University of Tokyo(东京大学) Chungnam National University(Chungnam国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 TextTIGER通过增强外部信息和大语言模型总结,优化实体描述以提升文本到图像生成性能,实验表明其在多种评估指标上优于仅使用描述的提示方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07415 2026-04-21 cs.CV cs.CL cs.LG 62%

RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction

RA-RRG:结合关键短语提取的多模态检索增强放射学报告生成

Jonggwon Park, Byungmu Yoon, Soobum Kim, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司) Department of Artificial Intelligence and Data Science, Sejong University(Sejong大学人工智能与数据科学系)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 RA-RRG通过结合多模态检索与大语言模型生成放射学报告,减少幻觉和计算需求,实验显示在CheXbert指标上优于现有模型。

Comments ACL 2026, Findings of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20867 2026-04-21 cs.SD cs.AI eess.AS 57%

Generalizable Prompt Tuning for Audio-Language Models via Semantic Expansion

通过语义扩展实现音频-语言模型的通用提示微调

Jaehyuk Jang, Wonjun Lee, Kangwook Ko, Changick Kim

机构 * KAIST(韩国科学技术院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文提出SEPT框架,通过引入语义扩展损失提升音频-语言模型提示微调的泛化能力,增强嵌入空间语义结构,改进基到新泛化和跨数据集迁移。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13464 2026-04-21 cs.CL cs.AI 57%

Estimating Commonsense Plausibility through Semantic Shifts

通过语义转变估计常识可信度

Wanqing Cui, Wei Huang, Keping Bi, Jiafeng Guo, Xueqi Cheng

机构 * CAS Key Lab of Network Data Science and Technology, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(中国科学院网络数据科学与技术重点实验室,计算技术研究所,中国科学院,北京,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文提出ComPaSS框架,通过测量在添加常识信息时的语义变化来量化常识可信度,验证了判别方法在细粒度常识评估中的优势,并展示了视觉语言模型在结合ComPaSS后的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17816 2026-04-21 cs.CR 50%

Privacy-Preserving Product-Quantized Approximate Nearest Neighbor Search Framework for Large-scale Datasets via A Hybrid of Fully Homomorphic Encryption and Trusted Execution Environment

面向大规模数据集的隐私保护产品量化近邻搜索框架:通过全同态加密和可信执行环境的混合方案

Shozo Saeki, Minoru Kawahara, Hirohisa Aman

专题命中 其他VLM :visual language model(abstract)

AI总结 本文提出PPPQ-ANN框架,结合全同态加密和可信执行环境,优化大规模数据集的隐私保护近邻搜索,实现快速数据库生成和高吞吐量检索。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04609 2026-04-21 cs.CL 50%

When More Words Say Less: Decoupling Length and Specificity in Image Description Evaluation

当更多词语说更少:在图像描述评估中解耦长度与特异性

Rhea Kapur, Robert Hawkins, Elisa Kreiss

机构 * Stanford University(斯坦福大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出通过对比集定义描述特异性,验证人们更偏好信息密集的描述,无论长度如何,且长度分配影响特异性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏