arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-23 至 2026-04-23 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 15 篇

2604.20216 2026-04-23 cs.CL 50%

Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context

基于分位数标记和邻近上下文的文本到分布预测

Yilun Zhu, Yuan Zhuang, Nikhita Vedula, Dushyanta Dhyani, Shaoyuan Xu, Moyan Li, Mohsen Bayati, Bryan Wang, Shervin Malmasi

机构 * Amazon.com, Inc.(亚马逊公司) Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出分位数标记回归,通过插入专用分位数标记并结合邻近实例,提升分布预测精度,实验显示在多个数据集上效果显著,MAPE更低且预测区间更窄。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20117 2026-04-23 cs.CL 50%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20006 2026-04-23 cs.CL 50%

From Recall to Forgetting: Benchmarking Long-Term Memory for Personalized Agents

从回忆到遗忘:个性化代理长期记忆的基准测试

Md Nayem Uddin, Kumar Shubham, Eduardo Blanco, Chitta Baral, Gengyu Wang

机构 * Arizona State University(亚利桑那州立大学) Genies University of Arizona(亚利桑那大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出Memora基准测试,评估个性化代理在长期对话中的记忆、推理和推荐能力,引入FAMA指标以衡量对过时记忆的依赖,发现LLM和记忆代理在处理长期记忆时存在显著不足。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2602.13232 2026-04-23 cs.AI cs.SE 57%

PlotChain: Deterministic Checkpointed Evaluation of Multimodal LLMs on Engineering Plot Reading

PlotChain: 多模态大语言模型在工程图表阅读中的确定性检查点评估

Mayank Ravishankara

机构 * Independent Researcher, San Francisco, CA, USA(独立研究者,美国加州旧金山)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 PlotChain提出了一种确定性的基于生成器的评估基准,用于评估多模态大语言模型在工程图表阅读中的性能,通过检查点实现子技能诊断和故障定位,展示了不同模型在图表阅读任务中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08923 2026-04-23 cs.AI 57%

Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs

相同内容,不同答案:多模态大语言模型中的跨模态不一致

Angela van Sprang, Laurens Samson, Ana Lucic, Erman Acar, Sennay Ghebreab, Yuki M. Asano

机构 * University of Amsterdam(阿姆斯特丹大学) City of Amsterdam(阿姆斯特丹市) University of Technology Nuremberg(努尔堡技术大学)

专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出REST和REST+基准测试,评估多模态大语言模型的跨模态不一致性。研究发现,即使在相同语义信息下,不同模态的推理结果也不一致,且OCR错误和视觉特征影响模型性能。

Comments Accepted at CVPR 2026. Angela van Sprang and Laurens Samson contributed equally as first authors

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2604.20012 2026-04-23 cs.CV cs.AI cs.CL 89%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19905 2026-04-23 cs.SE 78%

ViBR: Automated Bug Replay from Video-based Reports using Vision-Language Models

ViBR:基于视频报告的自动化Bug回放

Sidong Feng, Dingbang Wang, Nikola Tomic, Tingting Yu, Aldeida Aleti, Chunyang Chen

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract)

AI总结 本文提出ViBR,一种基于视觉-语言模型的自动化Bug回放方法,通过动作边界分割和区域感知的GUI状态比较,实现从GUI视频记录中自动复现Bug,实验表明其复现率达72%。

Comments accepted to FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26557 2026-04-23 cs.HC 50%

The Invisible Mentor: Inferring User Actions from Screen Recordings to Recommend Better Workflows

隐形导师:从屏幕记录推断用户行为以推荐更好的工作流程

Litao Yan, Andrew Head, Ken Milne, Vu Le, Sumit Gulwani, Chris Parnin, Emerson Murphy-Hill

专题命中 GUI与屏幕智能体 :vision-language model(abstract)

AI总结 本文提出InvisibleMentor系统,通过屏幕记录推断用户行为,推荐更高效的工作流程,优于传统依赖日志或用户提示的助手。

Comments 15 pages, 6 figures

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), 1-17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 2 篇

2604.05687 2026-04-23 cs.CV 74%

3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models

由多模态大语言模型视觉先验引导的3D烟雾场景重建

Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与鲁棒性 :multimodal large language model(title);分类 cs.CV

AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 62%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 15 篇

2604.20366 2026-04-23 cs.CV 89%

Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

在不降低性能的情况下缓解大型视觉-语言模型的幻觉

Xingyu Zhu, Junfeng Fang, Shuo Wang, Beier Zhu, Zhicai Wang, Yonghui Yang, Xiangnan He

机构 * MoE Key Lab of BIPC(BIPC摩尔实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MPD框架,通过语义感知组件解耦和可解释参数更新,有效减少幻觉并保持生成能力,实验显示在LLaVA-Bench和MME上减少23.4%幻觉同时保持97.4%的生成能力。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19966 2026-04-23 cs.CV cs.AI cs.LG cs.RO 88%

DistortBench: Benchmarking Vision Language Models on Image Distortion Identification

DistortBench:用于图像失真识别的视觉语言模型基准测试

Divyanshu Goyal, Akhil Eppa, Vanya Bannihatti Kumar

机构 * Adobe Inc.(Adobe公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract_cn);vision language model(title);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DistortBench,一个用于评估视觉语言模型图像失真识别能力的基准测试,包含13500道四选一问题,涵盖27种失真类型及不同严重程度,评估18种模型,揭示当前VLM在低级感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19839 2026-04-23 cs.CV cs.AI 86%

Environmental Understanding Vision-Language Model for Embodied Agent

面向具身智能体的环境理解视觉-语言模型

Jinsik Bang, Jaeyeon Bae, Donggyu Lee, Siyeol Jung, Taehwan Kim

机构 * UNIST(全南国立大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出EUEA框架,通过细调四项核心技能提升具身智能体的环境理解能力,结合恢复步骤和GRPO阶段提升任务执行效果,实验显示在ALFRED任务中性能显著优于行为克隆基线。

Comments CVPR Findings 2026, Project Page: https://eu-ea.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25844 2026-04-23 cs.CL cs.HC 85%

Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations

相信而不看:为视觉语言模型解释提供质量评分

Keyu He, Tejas Srinivasan, Brihi Joshi, Xiang Ren, Jesse Thomason, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn)

AI总结 本文提出通过两种质量评分函数评估视觉语言模型解释的视觉忠实度和对比性,以减少对模型预测的过度依赖,实验显示质量评分能显著提升用户判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14044 2026-04-23 cs.CV 84%

Weather-R1: Logically Consistent Reinforcement Fine-Tuning for Multimodal Reasoning in Meteorology

Weather-R1: 逻辑一致的强化微调用于气象中的多模态推理

Kaiyu Wu, Pucheng Han, Hualong Zhang, Naigeng Wu, Keze Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Meteorological Observatory(广东省气象局)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Weather-R1,首个具备逻辑忠实性的气象多模态推理VLM,通过逻辑一致性奖励解决强化微调中的自相矛盾推理问题,并在WeatherQA基准上提升9.8个百分点。

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), Barcelona, Spain, 2026, pp. 4851-4855

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 84%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14980 2026-04-23 cs.AI cs.CL cs.HC 83%

Hybrid Decision Making via Conformal VLM-generated Guidance

通过符合性VLM生成的指导实现混合决策

Debodeep Banerjee, Burcu Sayin, Stefano Teso, Andrea Passerini

机构 * University of Pisa(帕尔米斯大学) DISI, University of Trento(特伦托大学DISI研究所) CIMEC, University of Trento(特伦托大学CIMEC研究所)

专题命中 VLM训练与架构 :VLM(title,title_cn);分类 cs.AI

AI总结 本文提出ConfGuide方法,通过符合性风险控制生成简洁精准的指导,提升多标签医学诊断任务中的决策质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23733 2026-04-23 cs.CL cs.CV 79%

AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization

AdaMMS: 为异构多模态大语言模型设计的模型融合方法

Yiyang Du, Xiaochen Wang, Chi Chen, Jiabo Ye, Yiru Wang, Peng Li, Ming Yan, Ji Zhang, Fei Huang, Zhifang Sui, Maosong Sun, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University(计算机科学与技术系,人工智能研究院,清华大学) Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) School of Software Microelectronics, Peking University(软件微电子学院,北京大学) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国) Jiangsu Collaborative Innovation Center for Language Competence, Jiangsu, China(江苏省语言能力协同创新中心,江苏,中国) ModelTC Open Source Organization, Beijing, China(ModelTC开源组织,北京,中国)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出AdaMMS,一种针对异构多模态大语言模型的模型融合方法,通过映射、融合和搜索三个步骤解决异构模型融合难题,无需标注数据即可在视觉语言基准测试中超越现有方法。

Comments CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07474 2026-04-23 cs.CL cs.AI 77%

Cross-Modal Taxonomic Generalization in (Vision-) Language Models

跨模态分类泛化在(视觉-)语言模型中

Tianyang Xu, Marcelo Sandoval-Castaneda, Karen Livescu, Greg Shakhnarovich, Kanishka Misra

机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 研究探讨了语言模型在无显性证据情况下通过跨模态泛化恢复超范畴知识的能力,发现语言模型能基于语言线索实现泛化。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20135 2026-04-23 cs.CL cs.IR 75%

AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerce

AFMRL: 基于属性增强的电商细粒度多模态表示学习

Biao Zhang, Lixin Chen, Bin Zhang, Zongwei Wang, Tong Liu, Bo Zheng

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 本文提出AFMRL,通过属性生成任务提升电商细粒度多模态表示学习,结合属性引导对比学习和检索感知属性强化,实现更精准的相似商品检索。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20511 2026-04-23 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

CHASM: Unveiling Covert Advertisements on Chinese Social Media

CHASM:揭示中国社交媒体上的隐蔽广告

Jingyi Zheng, Tianyi Hu, Yule Liu, Zhen Sun, Zongmin Zhang, Zifan Peng, Wenhan Dong, Xinlei He

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CHASM数据集,用于评估多模态大语言模型在检测社交媒体隐蔽广告的能力,揭示当前模型在识别隐蔽广告中的不足及改进方向。

Comments NeuIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20429 2026-04-23 cs.CV 57%

Fast-then-Fine: A Two-Stage Framework with Multi-Granular Representation for Cross-Modal Retrieval in Remote Sensing

快速-精细:一种用于遥感跨模态检索的两阶段框架,具有多粒度表示

Xi Chen, Xu Chen, Xiangyang Jia, Xu Zhang, Shuquan Wei, Wei Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种两阶段框架,通过多粒度表示提升遥感跨模态检索效率与精度,采用文本无关召回和文本引导重排序阶段,减少计算资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19857 2026-04-23 cs.LG cs.CL 57%

Rethinking Reinforcement Fine-Tuning in LVLM: Convergence, Reward Decomposition, and Generalization

重新思考LVLM中的强化微调:收敛性、奖励分解与泛化

Carter Adams, Rafael Oliveira, Gabriel Almeida, Sofia Torres

机构 * Federal University of Bahia(巴伊亚联邦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出TA-MDP框架,分析强化微调中奖励结构对GRPO收敛性的影响,并推导奖励分解定理和泛化界限,揭示工具增强策略在分布外迁移中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19386 2026-04-23 cs.CV 57%

Air-Know: Arbiter-Calibrated Knowledge-Internalizing Robust Network for Composed Image Retrieval

Air-Know: 基于仲裁校准的知识内化鲁棒网络用于组合图像检索

Zhiheng Fu, Yupeng Hu, Qianyun Yang, Shiqi Zhang, Zhiwei Chen, Zixu Li

机构 * Shandong University(山东大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对组合图像检索中噪声三元组对应问题,Air-Know提出专家-代理-分流解耦范式,通过外部先验仲裁、专家知识内化和双流协调模块,提升鲁棒性和检索性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03740 2026-04-23 cs.CV cs.CL 57%

CLIP-SVD: Efficient and Interpretable Vision-Language Adaptation via Singular Values

CLIP-SVD:通过奇异值实现高效且可解释的视觉-语言适应

Taha Koleilat, Hassan Rivaz, Yiming Xiao

机构 * Department of Electrical & Computer Engineering, Concordia University(康科迪亚大学电气与计算机工程系) Department of Computer Science & Software Engineering, Concordia University(康科迪亚大学计算机科学与软件工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP-SVD通过奇异值微调方法,以0.04%的参数量实现高效视觉-语言模型适应,提升适应性能并保留泛化能力,在11个自然和10个生物医学数据集上取得最佳分类结果。

Comments TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 3 篇

2604.20544 2026-04-23 cs.CV cs.AI 62%

Evian: Towards Explainable Visual Instruction-tuning Data Auditing

Evian:迈向可解释的视觉指令微调数据审计

Zimu Jia, Mingjie Xu, Andrew Estornell, Jiaheng Wei

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ByteDance Seed(字节跳动种子)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Evian框架,通过分解评估模型响应的三大认知组件,解决数据审计中逻辑一致性与事实准确性不足的问题,验证高质量小规模数据优于大规模低质量数据。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13533 2026-04-23 cs.RO cs.CV 57%

Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization

可进化具身代理:通过长期短期反思与优化实现机器人操作

Jianzong Wang, Botao Zhao, Yayun He, Junqing Peng, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出EEAgent框架,通过长短期反思优化机制提升机器人在复杂任务中的适应能力,实现自我进化,优于现有方法。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14649 2026-04-23 cs.CV 57%

DetailCLIP: Injecting Image Details into CLIP's Feature Space

DetailCLIP: 将图像细节注入CLIP的特征空间

Zilun Zhang, Cuifeng Shen, Yuan Shen, Xinyu Zhou, Huixin Xiong, Tiancheng Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Megvii(科大讯飞) Om AI Research(Om人工智能研究院) Binjiang Research Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 本文提出DetailCLIP框架,通过生成高分辨率图像的单一特征表示,保留多尺度细节并共享CLIP的语义空间,提升遥感文本-图像检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏