arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1566 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1566 篇

2604.11154 2026-04-14 cs.AI 57%

Environmental Footprint of GenAI Research: Insights from the Moshi Foundation Model

生成式AI研究的环境足迹:来自Moshi基金会模型的洞察

Marta López-Rauhut, Loic Landrieu, Mathieu Aubry, Anne-Laure Ligozat

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM, CNRS, 古斯塔夫·埃菲尔大学, ENPC, 巴黎综合理工学院) Université Paris-Saclay, CNRS, LISN(巴黎-萨克雷大学, CNRS, LISN) Université Paris-Saclay, CNRS, ENSIIE, LISN(巴黎-萨克雷大学, CNRS, ENSIIE, LISN) Kyutai

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

AI总结 本文通过细粒度分析Moshi模型的计算消耗,首次量化了生成式多模态大语言模型(MLLM)研究的环境影响,揭示了计算密集型研究的能耗与环境成本,为可持续AI研究提供指导。

Comments 28 pages, 12 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10188 2026-04-14 cs.CV 57%

Radiology Report Generation for Low-Quality X-Ray Images

低质量X光图像的放射科报告生成

Hongze Zhu, Chen Hu, Jiaxuan Jiang, Hong Liu, Yawen Huang, Ming Hu, Tianyu Wang, Zhijian Wu, Yefeng Zheng

机构 * Westlake University(西湖大学) Tencent Jarvis Lab(腾讯贾维斯实验室)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出针对低质量图像的稳健报告生成框架,通过双循环训练策略提升模型在不同图像质量下的诊断能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10064 2026-04-14 cs.CV 57%

On The Application of Linear Attention in Multimodal Transformers

多模态Transformer中线性注意力的应用

Armin Gerami, Seyedehanita Madani, Ramani Duraiswami

机构 * University of Maryland(马里兰大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了线性注意力在多模态框架中的应用,通过减少计算开销并保持性能,证明了线性注意力在多模态Transformer中的有效性。

Comments Workshop on Any-to-Any Multimodal Learning (Any2Any), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09885 2026-04-14 cs.AI 57%

What do your logits know? (The answer may surprise you!)

你的logits知道什么?(答案可能让你吃惊!)

Masha Fedzechkina, Eleonora Gualdoni, Rita Ramos, Sinead Williamson

机构 * Apple(苹果公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 本文通过视觉语言模型探讨不同表征层级中信息压缩的泄露问题,揭示了通过top-k logit和低维投影可能泄露任务无关信息的核心发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08063 2026-04-10 cs.CV 57%

EEG2Vision: A Multimodal EEG-Based Framework for 2D Visual Reconstruction in Cognitive Neuroscience

EEG2Vision:一种基于EEG的多模态框架,用于认知神经科学中的2D视觉重建

Emanuele Balloni, Emanuele Frontoni, Chiara Matti, Marina Paolanti, Roberto Pierdicca, Emiliano Santarnecchi

机构 * Università Politecnica delle Marche(马尔凯理工大学) University of Macerata(马切拉塔大学) Horizon Intelligence Labs(地平线智能实验室) Harvard Medical School(哈佛医学院) Massachusetts General Hospital(麻省总医院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 EEG2Vision通过多模态大语言模型和图像扩散模型提升低密度电极配置下的视觉重建质量,验证了低分辨率EEG设备在实时脑-图像应用中的可行性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07128 2026-04-09 cs.CV 57%

A Utility-preserving De-identification Pipeline for Cross-hospital Radiology Data Sharing

一种保持效用的跨医院放射学数据共享脱敏流程

Chenhao Liu, Zelin Wen, Yan Tong, Junjie Zhu, Xinyu Tian, Yuchi Liu, Ashu Gupta, Syed M. S. Islam, Tom Gedeon, Yue Yao

机构 * Shandong University(山东大学) Australian National University(澳大利亚国立大学) Hong Kong University of Science and Technology(香港科技大学) Curtin University(科廷大学) Edith Cowan University(埃迪斯科文大学) University of Western Australia(西澳大利亚大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种保持效用的脱敏流程,用于跨医院放射学数据共享,通过黑名单和白名单过滤机制,在保护隐私的同时保留诊断相关病理信息,实验证明其在诊断准确性上的竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03039 2026-04-07 cs.CV 57%

GenSmoke-GS: A Multi-Stage Method for Novel View Synthesis from Smoke-Degraded Images Using a Generative Model

GenSmoke-GS:一种基于生成模型的多阶段方法,用于从烟雾退化图像中生成新视角

Qida Cao, Xinyuan Hu, Changyue Shi, Jiajun Ding, Zhou Yu, Jun Yu

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 本文提出GenSmoke-GS方法,通过多阶段流程提升烟雾退化图像的可视性,减少场景内容变化,实验表明其在定量和视觉质量上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03016 2026-04-06 cs.AI 57%

Agentic-MME: What Agentic Capability Really Brings to Multimodal Intelligence?

Agentic-MME:代理能力为多模态智能带来了什么?

Qianshan Wei, Yishan Yang, Siyi Wang, Jinglin Chen, Binyu Wang, Jiaming Wang, Shuang Chen, Zechen Li, Yang Shi, Yuqi Tang, Weining Wang, Yi Yu, Chaoyou Fu, Qi Li, Yi-Fan Zhang

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) SEU(东南大学) NJU(南京大学) PKU(北京大学) BUAA(北京航空航天大学) NTU(南洋理工大学) UCLA(加州大学洛杉矶分校)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 Agentic-MME通过418个真实任务评估多模态代理能力,采用过程验证方法,量化效率并验证工具调用准确性,实验显示模型在复杂任务中表现显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00820 2026-04-02 cs.CV 57%

Continual Vision-Language Learning for Remote Sensing: Benchmarking and Analysis

遥感持续视觉-语言学习:基准测试与分析

Xingxing Weng, Ruifeng Ni, Chao Pang, XiangYu Hao, Yishan Wang, Xiaokang Zhang, Wei Xu, Gui-Song Xia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出CLEaRS基准,评估遥感视觉-语言模型的持续学习能力,发现现有模型存在灾难性遗忘,需开发专用持续学习方法。

Comments 23 pages, 7 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00530 2026-04-02 cs.CV 57%

AceTone: Bridging Words and Colors for Conditional Image Grading

AceTone:连接词语与颜色的条件图像评分

Tianren Ma, Mingxiang Liao, Xijin Zhang, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance(字节跳动)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 AceTone提出了一种基于多模态条件的颜色评分方法,通过生成颜色转换任务实现统一框架,利用VQ-VAE tokenizer压缩LUT向量并结合大规模数据集训练,提升图像评分的感知和美学一致性。

Comments Accepted by CVPR 2026. Project Page: github.com/martian422/AceTone

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29592 2026-04-01 cs.GR cs.CV 57%

Bioinspired123D: Generative 3D Modeling System for Bioinspired Structures

生物启发123D:用于生物启发结构的生成3D建模系统

Rachel K. Luu, Markus J. Buehler

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出Bioinspired123D,一种轻量级模块化代码-几何管道,通过参数化程序直接生成可制造的3D结构,而非密集视觉表示。系统基于生物启发3D模型,结合多模态检索增强生成和视觉-语言模型批评者,实现了高效的文本到3D生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22150 2026-04-01 cs.CV 57%

Do VLMs Perceive or Recall? Probing Visual Perception vs. Memory with Classic Visual Illusions

视觉语言模型是感知还是记忆?通过经典视觉错觉探测视觉感知与记忆

Xiaoxiao Sun, Mingyang Li, Kun Yuan, Min Woo Sun, Mark Endo, Shengguang Wu, Changlin Li, Yuhui Zhang, Zeyu Wang, Serena Yeung-Levy

机构 * Stanford University(斯坦福大学) University of Strasbourg(斯特拉斯堡大学) Technical University of Munich(慕尼黑工业大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文通过经典视觉错觉研究视觉语言模型的感知与记忆机制,提出VI-Probe框架,揭示不同模型对视觉变化的响应来源,挑战单一原因观点。

Comments 26 pages, 31 figures, 13 tables. Project Page: https://sites.google.com/view/vi-probe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11647 2026-03-30 cs.CV 57%

IVEBench: Modern Benchmark Suite for Instruction-Guided Video Editing Assessment

IVEBench:现代指令引导视频编辑评估基准套件

Yinan Chen, Jiangning Zhang, Teng Hu, Yuxiang Zeng, Zhucun Xue, Qingdong He, Chengjie Wang, Yong Liu, Xiaobin Hu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) University of Auckland(奥克兰大学) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 IVEBench通过引入多样化的视频数据库和多维评估协议,解决现有视频编辑基准在评估指令引导视频编辑方面的不足,提供全面的人类对齐评估结果。

Comments Accepted by ICLR 2026. Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/IVEBench Code: https://github.com/RyanChenYN/IVEBench Dataset: https://huggingface.co/datasets/Coraxor/IVEBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24275 2026-03-26 cs.LG 57%

Language-Assisted Image Clustering Guided by Discriminative Relational Signals and Adaptive Semantic Centers

基于判别关系信号和自适应语义中心的语言辅助图像聚类

Jun Ma, Xu Zhang, Zhengxing Jiao, Yaxin Hou, Hui Liu, Junhui Hou, Yuheng Jia

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(东南大学计算机科学与工程学院) School of Computing Information Sciences, Saint Francis University, Hong Kong, China(圣弗朗西斯大学计算信息科学学院) Department of Computer Science, City University of Hong Kong, Hong Kong, China(香港城市大学计算机科学系)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出一种新的语言辅助图像聚类框架,通过跨模态关系生成更判别的自监督信号,并利用提示学习学习类别连续语义中心,提升聚类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17055 2026-03-19 cs.CV 57%

PaAgent: Portrait-Aware Image Restoration Agent via Subjective-Objective Reinforcement Learning

PaAgent:通过主观-客观强化学习实现的面向人物图像修复代理

Yijian Wang, Qingsen Yan, Jiantao Zhou, Duwei Dai, Wei Dong

机构 * School of Computer Science, Northwestern Polytechnical University(西北工业大学计算机学院) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学智慧城市物联网国家重点实验室) National-Local Joint Engineering Research Center of Biodiagnosis and Biotherapy, the Second Affiliated Hospital of Xi’an Jiaotong University(西安交通大学生物诊断与生物治疗国家地方联合工程研究中心) College of Information and Control Engineering, Xi’an University of Architecture and Technology(西安建筑科技大学信息与控制工程学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 PaAgent通过结合自进化的人物银行和检索增强生成技术,提升图像修复任务中对复杂场景的感知能力,通过主观-客观强化学习策略优化修复工具选择,实验验证其在多种修复基准上的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14610 2026-03-18 cs.CV eess.IV 57%

Make it SING: Analyzing Semantic Invariants in Classifiers

使分类器具备语义不变性:分析分类器中的语义不变性

Harel Yadid, Meir Yossef Levi, Roy Betser, Guy Gilboa

机构 * Viterbi Faculty of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 本文提出SING方法,通过构建等价图像并赋予语义解释,揭示分类器中语义不变性,分析不同模型在保持语义方面的差异。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21435 2026-03-18 cs.CV 57%

Synergizing Understanding and Generation with Interleaved Analyzing-Drafting Thinking

融合理解与生成的交错分析-草稿思维

Shengqiong Wu, Bobo Li, Xinkai Wang, Xiangtai Li, Lei Cui, Furu Wei, Shuicheng Yan, Hao Fei, Tat-seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。

Comments 28 pages, 17 figures, 6 tables, ICLR conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12659 2026-03-16 cs.CV 57%

AVION: Aerial Vision-Language Instruction from Offline Teacher to Prompt-Tuned Network

AVION:从离线教师到提示调优网络的空域视觉-语言指令

Yu Hu, Jianyang Gu, Hao Liu, Yue Cao, Jozsef Hamari, Zheng Liu, Mohsen Zardadi

机构 * The University of British Columbia, Okanagan(不列颠哥伦比亚大学奥克兰分校) The Ohio State University(俄亥俄州立大学) TerraSense Analytics(TerraSense分析)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 AVION提出一种知识蒸馏框架,通过构建语义丰富的文本原型和轻量级提示,提升视觉语言模型在遥感图像中的适应能力,提升少样本分类和跨模态检索性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05629 2026-03-09 cs.CV 57%

Rethinking Concept Bottleneck Models: From Pitfalls to Solutions

重新思考概念瓶颈模型:从误区到解决方案

Merve Tapli, Quentin Bouniot, Wolfgang Stammer, Zeynep Akata, Emre Akbas

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 CBM-Suite通过引入熵度量、非线性层和蒸馏损失,系统解决概念瓶颈模型的准确性、可解释性和系统性研究问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05384 2026-03-06 cs.CV 57%

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

ORMOT: 一个用于全方位参照多目标跟踪的数据集和框架

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(多谱信息智能处理技术国家重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出ORMOT任务,构建ORSet数据集和ORTrack框架,解决传统数据集视野限制问题,提升模型对长周期语言描述的理解能力。

Comments https://github.com/chen-si-jia/ORMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02138 2026-03-03 cs.CV 57%

OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

OmniLottie:通过参数化Lottie令牌生成向量动画

Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。

Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01725 2026-03-03 cs.CV 57%

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

学习多领域任务提示表示以实现多领域一体化图像修复

Guanglu Dong, Chunlei Li, Chao Ren, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * Sichuan University(四川大学) MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出DATPRL-IR,通过多领域任务提示表示学习实现多领域一体化图像修复,优于现有方法并具备强泛化能力

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 57%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00854 2026-03-03 cs.LG cs.IR 57%

GeMi: A Graph-based, Multimodal Recommendation System for Narrative Scroll Paintings

GeMi:基于图的多模态推荐系统用于叙事卷轴绘画

Haimonti Dutta, Pruthvi Moluguri, Jin Dai, Saurabh Amarnath Mahindre

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 GeMi是一种基于图的多模态推荐系统,专门用于叙事卷轴绘画,结合多模态内容和用户偏好,为艺术保护和数据存储提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI 57%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21029 2026-03-03 cs.LG 57%

FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction

FORCE:通过特征过度依赖校正实现可转移的视觉劫持攻击

Runqi Lin, Alasdair Paren, Suqin Yuan, Muyang Li, Philip Torr, Adel Bibi, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 FORCE方法通过校正特征过度依赖,提升视觉劫持攻击的跨模型可转移性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 57%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 57%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22120 2026-02-26 cs.CV 57%

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

GeoDiv:文本到图像模型中地理多样性测量的框架

Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21175 2026-02-25 cs.CV 57%

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

通过文字看见:利用语言模型控制视觉检索质量

Jianglin Lu, Simon Jenni, Kushal Kafle, Jing Shi, Handong Zhao, Yun Fu

机构 * Adobe Research(Adobe研究部) Northeastern University(东北大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 通过生成语言模型扩展短查询并控制图像质量,提升视觉检索效果和可控性

详情

展开后加载摘要…

URL PDF HTML 收藏