ArtGPT-4: Towards Artistic-understanding Large Vision-Language Models with Enhanced Adapter
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
Comments arXiv admin note: text overlap with arXiv:2311.02692
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Project page: http://val.cds.iisc.ac.in/VL2V-ADiP/
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments accepted by ICLR 2024, project page at https://mzhaoshuai.github.io/RLCF/, code is at https://github.com/mzhaoshuai/RLCF
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments 19 pages 11 figures
专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted by WACV 2024
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Camera-ready version for *SEM 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments Accepted to MIDL 2023
专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV
Comments work in progress
机构 * Brown University(布朗大学)
专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG;VLM(comments)
Comments All code and resources are available at: https://github.com/ethahtz/vlm_conflicting_info_processing
AlignFace:具有可解释概念关系的人类对齐人脸相似度度量
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本研究针对人脸生成模型评估中现有度量未实现认知对齐的问题,提出AlignFace度量,结合VLM、CA、CBM、GAM等技术,利用FACETS数据集,提升了与人类亚群感知的对齐度。
Comments 10 pages, 10 figures, 2 tables, ACM MM 26
UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器
机构 * NVIDIA Research(英伟达研究院) ; Technion(以色列理工学院) ; Bar-Ilan University(巴伊兰大学) ; University of Groningen(格罗宁根大学)
专题命中 VLM训练与架构 :VLM(title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV、cs.LG
AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%
Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/
学习扩散模型的采样参数
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 研究针对扩散模型推理时采样参数固定的问题,提出LeSAMP框架,将参数选择转化为强化学习问题,通过人类偏好模型和VLM评判优化,实验表明该方法相比基线有更高胜率,为改进扩散模型输出提供补充途径。
Comments Code will be released
基于置信度蒸馏的门控关系对齐用于高效视觉语言模型
机构 * Department of Information Technology(信息科技系) ; Electrical Engineering, ETH Zurich, Zurich, Switzerland(电气工程,苏黎世联邦理工学院,苏黎世,瑞士) ; Qualcomm AI Research, Amsterdam, the Netherlands(高通人工智能研究,阿姆斯特丹,荷兰) ; Department of Electrical, Electronic and Information Engineering(电气、电子与信息工程系) ; University of Bologna, Bologna, Italy(博洛尼亚大学,博洛尼亚,意大利) ; School of Electrical and Electronic Engineering(电气与电子工程学院)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出GRACE框架,通过信息瓶颈原理统一知识蒸馏与量化感知训练,使用置信度门控解耦蒸馏、关系中心核对齐和自适应控制器,在INT4量化下实现性能超越FP16基线并接近教师模型,同时显著降低内存和提升吞吐量。
Comments Accepted to the International Conference on Machine Learning (ICML 2026)
ARGUS: 堆叠多视角身份马赛克注入用于主体保持的视频生成
机构 * Peking University(北京大学) ; Kuaishou Technology(快手科技) ; Xiamen University(厦门大学)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 提出ARGUS框架,通过堆叠多视角身份马赛克注入(SMII)将身份表示为紧凑动态分布,结合MLLM身份导演、无交叉对反事实训练等模块,在主体保持视频生成中达到SOTA。
Comments 13 pages, 3 figures
学习实例自适应低秩正交子空间用于换衣行人重识别
机构 * Dongwoo Kim(金东吾) ; Tae-Kyun Kim(金泰勋)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 提出Ortho-ReID方法,通过从VLM文本描述中显式建模低秩服装子空间,并利用几何约束提取服装不变特征,在多个基准数据集上取得最优性能。
Comments Accepted to the ICML 2026 Workshop on CoLoRAI
FAGER:基于事实的文本到图像模型评估与改进
机构 * Boston University(波士顿大学) ; Adobe(Adobe公司) ; IBM Research(IBM研究院)
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本文提出FAGER框架,用于评估和改进文本到图像模型的事实准确性,通过结合LLM生成事实和参考引导的视觉事实提取与验证,构建结构化事实评估标准,并通过VLM进行评估,验证FAGER在事实性测试中优于现有方法,并能无训练改进T2I输出。
Comments It was accepted for an oral presentation at the 2nd Workshop on the Evaluation of Generative Foundation Models (EVGENFM2026) at CVPR 2026. Total 8 pages (1 page for references). 5 figures
DiRotQ:面向4位扩散变换器的旋转感知量化
机构 * d-Matrix
专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV、cs.LG
AI总结 本文提出DiRotQ,一种W4A4量化框架,通过旋转感知激活量化缓解扩散变换器在4位精度下的性能下降问题,同时引入VLM-as-a-Judge评估协议和Triton定制内核提升压缩下的效率与质量。
我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因
机构 * Tsinghua University(清华大学) ; The University of Sydney(悉尼大学) ; Stanford University(斯坦福大学) ; Baichuan AI(百川AI)
专题命中 VLM训练与架构 :LLaVA(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI
AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。
COHERENCE:在交错多模态上下文中细粒度图像-文本对齐的基准测试
机构 * Southeast University Shanghai AI Laboratory(上海大学上海人工智能实验室) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 COHERENCE旨在评估MLLM在交错多模态上下文中恢复细粒度图像-文本对应关系的能力,涵盖四个领域,包含6161个高质量问题,并进行六类错误分析以识别当前MLLM的不足。
利用大视觉-语言模型从遥感图像中推导建成环境
机构 * Department of Urban and Regional Planning, University of Florida(佛罗里达大学城市与区域规划系)
专题命中 VLM训练与架构 :InternVL(summary_cn,abstract);分类 cs.CV、cs.AI
AI总结 本文研究了大语言模型在智慧城市中的应用,通过多尺度遥感图像输入多模态语言模型,评估其对建成环境推理的影响,并比较了InternVL和Qwen等先进模型在生成建成环境建议中的准确性和可靠性。
Comments Published in the International Conference on Industrialized Construction 2026
从场景到物体:文本引导的双目预测
机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) ; Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)
专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。
机构 * Research Center for Social Computing and Information Retrieval, Harbin Institute of Technology(社会计算与信息检索研究中心,哈尔滨工业大学) ; School of Computer Science and Engineering, Central South University(计算机科学与工程学院,中南大学) ; School of Computing, National University of Singapore(计算学院,新加坡国立大学)
专题命中 VLM训练与架构 :VLM(abstract);LLaVA(abstract);multimodal large language model(abstract);MLLM(abstract)
Comments Accepted by IEEE Transactions on Circuits and Systems for Video Technology (TCSVT). June 2025. DOI: https://doi.org/10.1109/TCSVT.2025.3578266
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);VLM(abstract);visual question answering(abstract)
专题命中 VLM训练与架构 :vision-language model(abstract);vision language model(abstract);LLaVA(abstract);multimodal large language model(abstract)
Ortho2CAD:使用视觉语言模型从正投影图生成3D CAD
专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)
AI总结 研究旨在解决工程设计中从正投影图到3D CAD模型转换的问题,核心方法是利用视觉语言模型Ortho2CAD,通过监督微调与强化学习训练,借助绘图生成器实现大规模学习,主要贡献是代码有效率高且3D CAD精度超基线。