ReFiNe: Recursive Field Networks for Cross-modal Multi-scene Representation
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.MM
Comments SIGGRAPH 2024. Project Page: https://zakharos.github.io/projects/refine/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.MM
Comments SIGGRAPH 2024. Project Page: https://zakharos.github.io/projects/refine/
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments Accepted to EACL 2024. Code is released at https://github.com/Lizw14/visual_probing
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.MM
Comments Accepted to IEEE Transactions on Pattern Analysis and Machine Intelligence
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.MM
Comments 9 pages
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Comments 11 pages, five figures
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.MM、eess.AS
Comments Accepted to ICASSP2023. arXiv admin note: substantial text overlap with arXiv:2203.13932
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments EMNLP 2022
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments 13 pages, 6 figures, 2 tables. Minor improvements. Accepted at EMNLP 2022
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.AI
Comments Accepted by CVPR 2022
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Comments Accepted in IMWUT for 2021 Dec issue
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments To appear in TACL 2021
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV、cs.MM
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.AI
Comments Published at the 2016 IEEE/RSJ International Conference on Intelligent Robots and Systems. Added a new baseline with respect to the IROS version. Project page with code, pretrained models and our InOutDoorPeople RGB-D dataset at http://adaptivefusion.cs.uni-freiburg.de/
专题命中 多模态训练与对齐 :multimodal(title);分类 cs.CV、cs.CL
Comments 10 pages
DistMedVL:面向不确定性感知医学图像分割的分布视觉-语言对齐方法
机构 * University of Nottingham Ningbo China(宁波诺丁汉大学) ; University of Nottingham(诺丁汉大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 针对医学图像分割中视觉-语言跨模态对齐的不确定性问题,提出DistMedVL概率框架,含PCM-Adapter等模块,在8个基准上以6.3M参数实现优于SOTA的性能,数据效率等更优。
Comments 10 pages, 5 figures
重新审视你所见:揭示视觉语义以引导LVLM解码
机构 * Yonsei University(延世大学)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);分类 cs.CV、cs.CL、cs.AI
AI总结 本文通过分析发现视觉token在幻觉中仍提供有效信息,提出ReVisiT方法通过参考视觉token引导LVLM解码,减少计算成本并提升性能。
Comments ACL 2026 Main Conference (Oral). 30 pages, 10 figures. Code: https://github.com/bscho333/ReVisiT
OptiMAG: 通过不平衡最优传输实现结构-语义对齐
机构 * Beijing Institute of Technology, Beijing, China(北京理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
AI总结 OptiMAG通过不平衡最优传输解决多模态图中结构与语义不一致问题,提升节点表示学习效果。
CT-GLIP:基于CT扫描和放射报告的3D grounded语言-图像预训练,用于全身场景
机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) ; University of Rochester(罗切斯特大学) ; Hupan Lab, \postcode 10587, \state Hangzhou, \country China(华普实验室,浙江省杭州市,中国) ; Department of Radiology, Shanghai Institution of Pancreatic Disease, \state Shanghai, \country China(胰腺疾病研究所放射科,上海市,中国)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 CT-GLIP通过构建细粒度CT报告对,提升3D grounded语言-图像预训练,实现更精确的跨模态对齐,从而在零样本任务中提升器官识别和肿瘤检测性能。
Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型
机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。
Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE
机构 * Department of Computer Science & Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);image-text(abstract)
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract)
Comments Accepted to ApJ
机构 * Meta Superintelligence Labs(Meta 超智能实验室) ; University of Oxford(牛津大学)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.MM
Comments Project page: https://junlinhan.github.io/projects/lsbs/
机构 * Kyoto University(京都大学)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 26 pages, 19 figures, 4 tables
专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
Comments This paper was accepted by ICME 2025
专题命中 多模态训练与对齐 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 13 pages, 3 figures, 13 tables
Journal ref Transactions on Machine Learning Research 2024
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NeurIPS 2024
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态训练与对齐 :multi-modal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI