UniFashion: A Unified Vision-Language Model for Multimodal Fashion Retrieval and Generation
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted by EMNLP 2024, main conference
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted by EMNLP 2024, main conference
专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG
Comments 8 pages
Journal ref EMNLP 2024
专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
Comments Accepted by UAI 2024
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.AI
Comments Accepted at CVPR 2024
专题命中 其他VLM :multimodal large language model(title);分类 cs.AI、cs.LG
Comments Presented at AAAI 2024 RL+LLMs Workshop
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
Comments Submitted for review to KDD '24 (ADS Track)
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
Comments NeurIPS 2023
专题命中 其他VLM :vision-language model(title);分类 cs.CV、cs.LG
Comments ICLR 2023
DisImpact:通过社交媒体量化自然灾害的生理-社会影响
专题命中 其他VLM :MLLM(abstract,abstract_cn);multimodal large language model(abstract)
AI总结 本文提出DisImpact框架,利用多模态大语言模型系统量化自然灾害的生理和社会影响,通过社交媒体内容分类和构建灾害影响指数,实现对灾害影响的统一表示和分析。
Comments Accepted by ICWSM 2026
1S-DAug:一种用于鲁棒少样本泛化的单次数据增强
机构 * National University of Singapore(新加坡国立大学) ; Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 其他VLM :vision language model(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG
AI总结 本文提出1S-DAug,一种基于单例图像生成多样且忠实变体的生成增强算子,通过结合传统几何扰动、受控噪声注入和去噪扩散过程,提升少样本分类性能,实现在多个基准测试中提升20%的准确率。
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
Comments ICCV 2025. Project page: https://donaldssh.github.io/LoRA.rar
专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG
DynaPix:视觉语言模型能否识别准确的未来?
机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) ; National University of Singapore(新加坡国立大学)
专题命中 其他VLM :vision-language model(title);分类 cs.CV
AI总结 研究构建基准DynaPix,发现视觉语言模型能较好将预测与事件关联,但难以锚定时间,经模拟器真实记录训练可改善多数问题。
Comments Work in progress
HyperCap:面向视觉语言模型的超光谱土地覆盖描述数据集
机构 * Department of Computer Science and Engineering, Vellore Institute of Technology(计算机科学与工程系,维洛雷理工学院) ; Department of Information Technology, Siddhartha Academy of Higher Education(信息技术系,斯里达拉塔高等教育学院) ; Department of Computer Science and Engineering, Indian Institute of Technology, Roorkee(计算机科学与工程系,印度理工学院罗尔基分校) ; Department of Computer Science and Engineering, Indraprastha Institute of Information Technology Delhi(计算机科学与工程系,印度信息技术学院德里) ; Department of Computer Science and Engineering, Indian Institute of Technology, Kanpur(计算机科学与工程系,印度理工学院坎浦尔) ; Department of Computer Science and Artificial Intelligence, University of Granada(计算机科学与人工智能系,格拉纳达大学) ; Hyperspectral Computing Laboratory, Department of Computers and Communications, University of Extremadura(超光谱计算实验室,计算机与通信系,埃斯特拉达大学)
专题命中 其他VLM :vision language model(title);分类 cs.CV
AI总结 本文提出HyperCap数据集,通过整合光谱数据与像素级文本标注,提升遥感应用中的模型性能,为未来研究提供基础资源。
Comments Accepted for publication in IEEE Geoscience and Remote Sensing Magazine (GRSM), 2026
ACT作为人类:多模态大语言模型数据标注中的批判性思维
机构 * University of Sydney(悉尼大学) ; University of Cambridge(剑桥大学) ; Riken AIP(理化学研究所AIP分所) ; University of Adelaide(阿德莱德大学) ; ByteDance Australia(字节跳动澳大利亚)
专题命中 其他VLM :multimodal large language model(title);分类 cs.LG
AI总结 本文提出ACT标注框架,利用大语言模型作为评判者提高标注效率,通过批判性思维识别潜在错误,减少人工成本,提升标注质量。
Comments NeurIPS 2025
词中结构:用于人类大脑显微镜的弱监督视觉-语言建模
机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) ; Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) ; Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) ; Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)
专题命中 其他VLM :vision-language model(title);分类 cs.CV
AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。
Comments 8 pages, 3 figures, submitted for inclusion at a conference
Koo-Fu CLIP:通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应
机构 * Visual Recognition Group(视觉识别组) ; Department of Cybernetics(cybernetics系) ; Faculty of Electrical Engineering(电气工程系) ; Czech Technical University in Prague(布拉格捷克技术大学)
专题命中 其他VLM :vision-language model(title);分类 cs.CV
AI总结 Koo-Fu CLIP通过Fukunaga-Koontz线性判别分析实现视觉语言模型的闭式适应,提升类别分离性和降维效率,实现高效的大规模分类与检索。
INTERLACE:大规模视觉-语言模型中的交错层剪枝与高效适应
机构 * UC Santa Barbara(加州大学圣巴巴拉分校)
专题命中 其他VLM :vision-language model(title);分类 cs.CV
AI总结 INTERLACE通过交错微调冻结设计,在剪枝25%网络后实现88.9%的性能保留,达到SOTA水平。
机构 * POSTECH ; Huawei London Research Center(华为伦敦研究中心) ; KAIST(韩国科学技术院) ; Imperial College London(伦敦帝国理工学院)
专题命中 其他VLM :vision language model(title);分类 cs.CV
机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) ; NingboTech University(宁波科技学院) ; Zhejiang University(浙江大学)
专题命中 其他VLM :MLLM(title);分类 cs.CV
机构 * School of Electronic and Computer Engineering, Peking University, China(北京大学电子与计算机工程学院) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology, Shenzhen Graduate School, Peking University(北京大学深圳研究生院)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV
Comments 6 pages, 5 figures
机构 * Southwest Jiaotong University(西南交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Tongji University(同济大学) ; University of Trento(特伦特大学)
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments 18 pages
机构 * Google Research(谷歌研究)
专题命中 其他VLM :multimodal large language model(title);分类 cs.CV
机构 * NSF AI Institute for Fundamental Interactions, MIT, Cambridge, MA 02139, USA(NSF人工智能基础相互作用研究所,麻省理工学院,剑桥,马萨诸塞州,02139,美国) ; Department of Physics, Northeastern University, Boston, MA 02115, USA(物理系,东北大学,波士顿,马萨诸塞州,02115,美国) ; Department of Mathematics, Northeastern University, Boston, MA 02115, USA(数学系,东北大学,波士顿,马萨诸塞州,02115,美国) ; Rudolf Peierls Centre for Theoretical Physics, University of Oxford, Oxford OX1 2JD, UK(鲁道夫·佩尔尔斯理论物理中心,牛津大学,牛津 OX1 2JD,英国)
专题命中 其他VLM :multimodal large language model(title);分类 cs.LG
机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) ; School of Computer Science, Peking University(北京大学计算机科学学院)
专题命中 其他VLM :multimodal large language model(title);分类 cs.LG
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Accepted by AAAI 2025
专题命中 其他VLM :vision-language model(title);分类 cs.CV
Comments Accepted to CVPR 2025