A Multimodal Anomaly Detector for Robot-Assisted Feeding Using an LSTM-based Variational Autoencoder
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 8 pages, under review
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 8 pages, under review
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
Comments 9 pages, 26th International Conference on Computer Communication and Networks (ICCCN), Vancouver, BC, Canada, 2017, pp. 1-9
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments Proceedings of the 25th European Symposium on Artificial Neural Networks, Computational Intelligence and Machine Learning, April 2017, Bruges, Belgium
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 14 pages, 6 figures, Siam Data Mining 2017
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments IEEE Wireless Communications and Networking Conference (WCNC), 2017
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 5 pages, 5 figures, under review
专题命中 多模态训练与对齐 :multi-modal(title,abstract)
Comments 20 pages, 4 figures, under submission
专题命中 多模态训练与对齐 :multimodal(title,abstract)
Comments 24 pages, 8 figures
专题命中 多模态训练与对齐 :multimodal(title,comments);分类 cs.CV、cs.AI
Comments Keywords: Multimodal Fusion, Breast Cancer, Whole Slide Images, Survival Prediction
SMA:谁说的?半黑盒RAG控制中的成员泄露审计
机构 * Sun Yat-Sen University(孙中山大学) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Science(中国科学院大学) ; Zhongguancun Academy(中关村学院) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.AI
AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。
FIRM:面向遥感推理分割的掩码细粒度令牌内表示
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。
Omni2LoRA:用于高效全模态语言模型的保持一致性的参数化存储器
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.AI
AI总结 Omni2LoRA是一种保持一致性的参数化存储器压缩框架,通过优化秩分配策略提升全模态语言模型效率,在视听问答任务中优于多种基线,大幅缩短推理时间。
多模态大模型模态迁移:自主地理信息系统智能体的先决条件
机构 * Graz University of Technology(格拉茨工业大学) ; University of Vienna(维也纳大学) ; University of Liverpool(利物浦大学)
专题命中 多模态训练与对齐 :multimodal(abstract,abstract_cn);multi-modal(abstract);分类 cs.AI
AI总结 本文针对自主GIS智能体的先决条件,提出LMM模态迁移任务,发现现有LMM在图像与文本模态间传递空间信息的能力不足,需加强多模态对齐以实现地理空间理解。
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
作为自身评论家的智能体:通过循环组相对策略优化统一区域理解与定位
机构 * National University of Singapore(新加坡国立大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanyang Technological University(南洋理工大学) ; Wuhan University(武汉大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究针对多模态大语言模型的区域理解与定位问题,提出循环组相对策略优化框架CycleGRPO,利用任务对偶性构建自我评估范式,仅需区域输入,通过质量感知奖励评估字幕,在多基准测试中提升能力,为推进MLLMs像素级能力提供新途径。
Comments Accepted to ECCV 2026
通过从细到粗的监督实现SigLIP-HD
机构 * The University of Hong Kong(香港大学) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 研究如何在低成本下实现精细视觉感知,提出SigLIP-HD,采用从细到粗监督设计,基于SigLIP 2模型构建,在相同推理预算下能产生更好视觉令牌,在多基准测试中结果优于基线模型。
Comments ICLR 2026. Code and model: https://github.com/LiheYoung/SigLIP-HD
HumanOmni-Speaker: 识别说话者说了什么以及何时
机构 * Tongyi Lab Alibaba Group(阿里云实验室) ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);omni-modal(abstract);分类 cs.CV
AI总结 本文提出HumanOmni-Speaker,通过视觉注册说话人辨识与识别方法,解决多人物对话中说话者身份与时间的识别问题,实现端到端的多模态协同。
理解多模态大语言模型如何通过Token激活图描述艺术品
机构 * University of Bari Aldo Moro(巴里阿尔多莫罗大学) ; University of Zurich(苏黎世大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 使用Token激活图(TAM)分析MLLMs在描述艺术品时对视觉区域的依赖,发现不同语义类别的token在视觉基础上有显著差异,并比较了TAM与SAM~3开放词汇分割。
Comments Accepted at PRESTIGE workshop at ICPR 2026
SpatialSV: 通过任务导向的视觉监督在多模态大语言模型中内化可解释的3D空间感知
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院)
专题命中 多模态训练与对齐 :MLLM(summary_cn);multimodal(abstract);分类 cs.CV
AI总结 提出SpatialSV框架,通过任务导向的视觉监督将MLLM的2D特征提升为显式3D表示(深度图、相机姿态、点云),实现可解释的3D空间感知内化,无需外部工具,并在半监督设置中展现强泛化能力。
Comments Accepted by IJCAI 2026
DV-SFT: 直接视觉监督用于细粒度视觉理解
机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) ; Zhongguancun Academy(中关村学院) ; Beihang University(北航) ; Zhongguancun Laboratory(中关村实验室) ; Southeast Academy of Information Technology, Beijing Institute of Technology(北京理工大学信息科学技术东南学院)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出DV-SFT方法,通过为视觉令牌构建显式令牌级监督信号,利用OCR场景中的直接视觉-文本对应关系,在不修改模型架构或增加前向传播的情况下,显著提升多模态大语言模型的细粒度视觉理解能力。
Comments Under Review
VIHD: 基于视觉干预的医学视觉问答幻觉检测
机构 * Department of Data Science \& AI, Faculty of Information Technology, Monash University, Melbourne, VIC 3800, Australia Alfred Health Radiology, Alfred Health, Melbourne, VIC 3004, Australia School of Translational Medicine, Faculty of Medicine, Nursing ; Health Sciences, Monash University, Melbourne, VIC 3800, Australia Hong Kong Polytechnic University, Hong Kong SAR, China
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.CV
AI总结 提出VIHD方法,通过视觉依赖探测和视觉干预解码校准语义熵,有效检测医学多模态大语言模型中的幻觉响应。
Comments Early accepted by MICCAI 2026. This version of the contribution has been accepted for publication, after peer review (when applicable) but is not the Version of Record and does not reflect post-acceptance improvements, or any corrections
LDDR:基于线性DPP的动态分辨率帧采样用于视频MLLMs
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Individual Researcher(个人研究员) ; National University Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学) ; Duke University(杜克大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出LDDR框架,通过任务条件特征空间中查询感知的DPP帧选择,在有限视觉token预算下提升视频理解,实现3倍速度提升,并通过组DPP重要性度量动态分配分辨率,优于现有基线方法。
Comments 21 pages, 4 figures
检索、整合与综合:空间-语义 grounded 的潜在视觉推理
机构 * State Key Laboratory of Human-Machine Hybrid Augmented Intelligence, and Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CL
AI总结 本文提出RIS框架,通过空间-语义 grounded 方法改进多模态大语言模型的视觉推理,通过构建逐步 grounded 数据集并引入短语言过渡token,提升潜在状态与词汇对齐的解码能力,实验显示在多个基准上优于现有基线。
Comments 19 pages, 8 figures
面向拓扑的表示对齐用于半监督视觉-语言学习
机构 * KAIST(韩国科学技术院) ; POSTECH
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出ToMA框架,通过持久同调识别拓扑显著边,利用跨模态对应关系对齐多模态表示,提升视觉-语言学习在遥感和时尚检索中的性能。
Comments 30 pages, 10 figures, 24 tables
单编码器遇见多编码器:在缺失模态下的脑肿瘤分割中的表示学习前融合
机构 * School of Mathematics, Shandong University(山东大学数学学院) ; GSFS, The University of Tokyo(东京大学GSFS) ; MedVisAI Lab(医学视觉人工智能实验室) ; Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) ; Centre of AI in Medicine, Singapore(新加坡医学人工智能中心)
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文提出UniME方法,通过两阶段异构架构在缺失模态下实现脑肿瘤分割,通过单编码器和多编码器的结合提升分割精度。
Comments CVPR 2026 Poster
SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成
机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) ; Zhongguancun Academy(中关村学院)
专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。