CoinCLIP: A Multimodal Framework for Assessing Viability in Web3 Memecoins
专题命中 图文多模态 :multimodal(title,abstract)
Comments 4 pages, 1 figure, conference
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 图文多模态 :multimodal(title,abstract)
Comments 4 pages, 1 figure, conference
专题命中 图文多模态 :multimodal(title,abstract)
Comments AAAI 2025. The code is available at https://github.com/WentaoTan/SENA
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multi-modal(title,abstract)
Comments Accepted by NeurIPS 2024
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
Comments 12 pages, 8 figures, CIKM 2024 MMSR Workshop
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multimodal(title,abstract)
专题命中 图文多模态 :multi-modal(title);分类 cs.CV、cs.CL、eess.AS
专题命中 图文多模态 :multimodal(title,abstract)
Journal ref RO-MAN 2023 Conference
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
Comments Accepted to AI Ethics and Society 2022
专题命中 图文多模态 :multimodal(title);分类 cs.CV、cs.CL、cs.AI
Comments In EMNLP 2019
全局-局部双感知用于高分辨率文本密集图像翻译的MLLMs
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Labs, Huawei Technologies Co., LTD(华为技术有限公司2012实验室) ; School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出GLoTran框架,通过全局-局部双感知方法提升高分辨率文本密集图像翻译的准确性和完整性。
用于结合文本信息的图像聚类的深度模态共享自表达学习
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出DeepMORSE方法,通过模态共享自表达模型学习结合文本信息的图像聚类,在6个基准数据集上聚类性能提升超3%,且所学表示可迁移至下游任务。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
Fly0: 解耦语义定位与几何规划以实现零样本空中导航
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; Information Support Force Engineering University(信息支援力量工程大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。
显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型
机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Singapore(新加坡)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。
Comments Accepted to ECCV 2026
T-QPM:面向开放世界视觉语言模型的时间分布外检测与域泛化
机构 * San Diego State University(圣地亚哥州立大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出T-QPM框架,通过时间四元模式匹配和轻量级融合权重学习,增强视觉语言模型在动态环境下的分布外检测和协变量偏移鲁棒性。
KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer
机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。
AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型
机构 * Singapore Management University(新加坡国立管理学院) ; Sun Yat-sen University(中山大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。
通过可微渲染和大语言模型实现通用骨架理解
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国) ; Tencent(腾讯) ; Nanjing University of Aeronautics(南京航空航天大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出SkeletonLLM,通过可微渲染将任意骨架序列转换为大语言模型的视觉模态,实现通用骨架理解,同时引入协同训练策略提升推理能力,展示了在开放词汇动作识别中的强泛化能力,并扩展到异构骨架格式的运动描述和问答任务。
Comments Accepted by ICML 2026
OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进
机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。
大-小模型协作用于耕地语义变化检测
机构 * College of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)
专题命中 图文多模态 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出大-小协作框架,通过细粒度差分感知Mamba和CLIP文本先验实现耕地变化检测,提升精度与鲁棒性。
VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪
机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) ; Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。
Comments 7 pages
FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) ; School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Wuhan AI Research(武汉AI研究所) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。
基于图像的可靠思考
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Southwest China Institute of Electronic Technology(西南中国电子技术研究所) ; National Key Laboratory of Fundamental Algorithms(国家基础算法重点实验室) ; Models for Engineering Simulation, Sichuan University(工程模拟模型研究所,四川大学)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出RTWI方法,通过估计视觉提示和文本Co T的可靠性,以解决多模态推理中噪声思考问题,提升多模态大语言模型的性能。
Comments 26 pages, 19 figures
AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导
机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) ; Department of Automation, Tsinghua University(清华大学自动化系) ; School of Computer Science, Peking University(北京大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。
一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。
Comments Accepted by ICCV-2025