Where Does the Performance Improvement Come From? -- A Reproducibility Concern about Image-Text Retrieval
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments SIGIR 2022
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL
Comments SIGIR 2022
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM
Comments Preprint
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 11 pages, 6 figures
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :image-text(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL
Comments Short version. Accepted at Data Centric AI NeurIPS Workshop 2021
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI
专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM
Comments 14pages, 9 figures. Accepted at: IEEE Transactions on Circuits and Systems for Video Technology (Early Access Print) | |Codes Available at: https://github.com/kywen1119/DSRAN
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments Accept to ACM MM2020, code available at https://github.com/MILVLG/mmnas/
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 12 pages, 3 figures, 7 tables
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.CL
Comments 13 pages. NIPS 2014 deep learning workshop
机构 * Computer Science, School of Science and Engineering, University of Missouri - Kansas City(计算机科学系,科学与工程学院,密苏里大学-堪萨斯城分校)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV;multimodal(journal_ref)
Comments 8 pages, 6 figures, 3 tables
Journal ref Non-Archival track - The First Workshop on Multimodal Knowledge and Language Modeling IJCAI 2025 Workshop, August 16, 2025 IJCAI 2025 Workshop, August 16, 2025 Room 516B, Palais des congrès, Montreal, Canada
专题命中 图文多模态 :cross-modal(title,abstract);image-text(abstract);分类 cs.CV
Comments vision-language pre-training, contrastive learning, cross-modal, associative learning, associative mapping classification
VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题
机构 * Pohang University of Science
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。
PragMatch:分离大视觉语言模型中的语用不一致与跨模态不匹配
专题命中 图文多模态 :cross-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CL
AI总结 本研究提出PragMatch基准,揭示大视觉语言模型易受表面线索影响,为评估多模态语用推理提供测试平台。
Comments Under Review
ZOMP:面向视觉-语言模型的零阶多模态提示调优
机构 * UC Santa Barbara(加州大学圣巴巴拉分校)
专题命中 图文多模态 :multi-modal(title);multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。
面向恶劣天气去除的退化感知跨模态补偿提示学习
机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) ; School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) ; The Hong Kong Polytechnic University(香港理工大学) ; University of California, San Francisco(加利福尼亚大学旧金山分校) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 图文多模态 :cross-modal(title,abstract);分类 cs.CV
AI总结 该研究针对恶劣天气导致图像退化影响视觉系统可靠性的问题,提出 DCMPC-Net 模型,通过跨模态提示补偿实现鲁棒的恶劣天气图像修复,性能优于现有最先进方法。
Comments Accepted for publication in IEEE Transactions on Image Processing. The code is available at: https://github.com/fanamber831/DCMPC-Net
Jagle:构建大规模日语多模态预训练数据集以构建视觉-语言模型
机构 * Kyoto University(京都大学) ; NII LLMC(国立信息学研究所LLMC) ; Waseda University(早稻田大学) ; Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; Aichi Institute of Technology(爱知工业大学) ; Institute of Physical and Chemical Research(理化学研究所)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出Jagle,一个包含920万实例的日语多模态预训练数据集,通过多种策略生成VQA对,实验表明其在日语任务中表现优异,且与FineVision结合能提升英文性能。
Comments Accepted to COLM 2026
Geo-Embed:面向城市理解的统一多模态嵌入
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 本文针对现有多模态嵌入模型难以支持异构地理空间任务的问题,提出GeoMEB基准与Geo-Embed模型,在GeoMEB上实现15.3%的相对性能提升,为地理空间嵌入器发展提供方向。
面向距离的软提示学习用于多模态愉悦-唤醒估计
机构 * Graduate School of Automobile and Mobility(汽车与移动研究生院) ; Department of Automobile and IT Convergence(汽车与IT融合系)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出一种多模态框架,通过引入距离感知的软提示学习,提升多模态愉悦-唤醒估计的精度,在无约束场景中取得良好效果。
Comments 8pages
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 5294-5301
提示优化器是盲目运行的吗?用于自动提示优化的跨模态视觉反馈
专题命中 图文多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.AI
AI总结 研究多模态任务中自动提示优化的盲目性问题,提出跨模态视觉反馈方法,含故障条件视觉诊断和错误感知聚合阶段,在多个VQA数据集和目标VLM上效果显著,能提升分数且优化器可跨模型转移。
RadSight:迈向感知可靠的多模态放射学图像理解
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; Hupan Lab(湖畔实验室) ; University of Electronic Science and Technology of China(电子科技大学)
专题命中 图文多模态 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV
AI总结 该研究针对医学多模态大语言模型视觉解释可靠性低的问题,引入Perception-Bench基准分析问题。提出基于双2D/3D编码器架构的RadSight模型,经渐进课程学习训练,在多维度评估中优于现有模型,凸显低级视觉感知对可靠临床理解的关键作用。
场景图思维:增强多模态大语言模型的结构化视觉推理
机构 * Fudan University(复旦大学)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV
AI总结 针对多模态大语言模型忽视结构化关系的问题,提出场景图思维(SaGe)范式,通过自动数据引擎转换数据、构建训练数据,采用两阶段图对齐训练范式,在多模态基准测试中取得显著改进,提升细粒度感知和推理能力。
Comments ICML 2026
将交错多模态推理作为统一决策过程进行衔接
机构 * Nanjing University(南京大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Shanghai AI Laboratory(上海人工智能实验室) ; Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; University of Washington(华盛顿大学) ; The Chinese University of Hong Kong(香港中文大学) ; Australian National University(澳大利亚国立大学)
专题命中 图文多模态 :multi-modal(title,abstract);image-text(abstract);分类 cs.AI
AI总结 研究统一多模态模型中强化学习优化多轮生成的问题,提出BRAID框架,将文本-图像-文本推理视为统一马尔可夫决策过程,通过单一强化学习目标联合优化文本和视觉生成,实验表明该框架性能优于基线。
Comments 22 pages, 8 figures
净化然后引导:重新思考多模态人脸反欺骗的领域泛化
机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) ; School of Computing and Information Technology, Great Bay University(大湾区大学计算与信息科技学院) ; Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息处理重点实验室) ; Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室) ; Tencent Youtu Lab(腾讯优图实验室) ; School of Psychology, Shanghai Jiao Tong University(上海交通大学心理学院) ; Faculty of Applied Sciences, Macao Polytechnic University(澳门理工学院应用科学学院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究多模态人脸反欺骗中领域泛化问题,提出MMDA框架,利用CLIP零样本泛化能力,通过去噪和对齐机制提升跨模态对齐泛化性能,含多个模块及策略,实验表明优于现有方法。
Comments Accepted by ECCV 2026
MMLoP: 多模态低秩提示用于高效视觉-语言适配
机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV
AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。
多模态数学推理与多样化的解题视角
机构 * Tongji University(同济大学) ; National University of Singapore(新加坡国立大学) ; Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) ; Tencent(腾讯) ; Center for Future Media, University of Electronic Science and Technology of China(电子科技大学未来媒体中心)
专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CL
AI总结 本文提出MathV-DP数据集和Qwen-VL-DP模型,通过多样化解题视角提升多模态数学推理的准确性和生成多样性。
Comments 10 pages
T-IMPACT:面向上下文图像-文本操纵的严重性感知基准
机构 * The University of Queensland(昆士兰大学)
专题命中 图文多模态 :image-text(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 提出T-IMPACT基准,包含98,786个图像-文本对,涵盖原始、仅图像、仅文本和联合操纵,通过校准的连续严重性分数和粗粒度标签评估操纵对上下文理解的影响,实验表明现有模型在严重性预测上仍远弱于人类判断。
Comments 7 pages, 2 figures
InstructTime++: 通过隐式特征增强的多模态语言建模进行时间序列分类
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学认知智能国家重点实验室)
专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出将时间序列分类转化为多模态生成任务,通过离散化模块和对齐投影层弥合模态差距,并利用隐式特征建模提升语言模型性能。