Trimodal Glioma Representation Alignment via Volumetric Contrastive Learning
三模态胶质瘤表示对齐通过体积对比学习
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
三模态胶质瘤表示对齐通过体积对比学习
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出GLORIA框架,通过Gramian对比损失对齐组织病理、基因表达和MRI三模态特征,用于胶质瘤分级和生存预测,在132例患者数据上优于双模态基线。
一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择
机构 * Hikvision Research Institute(海康威视研究院) ; Peking University(北京大学) ; East China Normal University(华东师范大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。
Comments Accepted by CVPR 2026 (highlight)
ShearFuse-UNet: Hadamard、DCT和Shearlet变换融合用于次日野火蔓延预测
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; US Forest Service, Pacific Wildland Fire Science Laboratory(美国林务局太平洋野火科学实验室)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出ShearFuse-UNet,一种轻量级深度学习模型,通过融合WHT、DCT和Shearlet变换分支,在U-Net编码器中实现多模态卫星数据的次日野火蔓延预测,以267k参数达到0.596 F1分数,优于ResNet18 U-Net。
MiniMax 稀疏注意力
机构 * MiniMax ; Peking University(北京大学) ; NVIDIA(英伟达) ; Zhejiang University(浙江大学) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出 MiniMax 稀疏注意力(MSA),一种基于分组查询注意力的块级稀疏注意力机制,通过轻量索引分支选择 Top-k 键值块,实现高效长上下文处理,在 109B 模型上以 1M 上下文减少 28.4 倍注意力计算,并带来 14.2 倍预填充和 7.6 倍解码加速。
Comments 30 pages, 14 figures
Brick: 面向混合模型范式的空间能力路由
机构 * Regolo AI ; Seeweb
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出Brick多模态路由器,通过六维能力评分与查询难度估计,结合成本惩罚几何规则调度模型,在质量与成本间实现灵活权衡。
Comments 17 pages, 5 figures. Technical report
从模仿到对齐:面向长距离人行道导航的人类偏好流策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。
运动增强外观:用于微手势在线识别的RGB-骨架门控残差融合
机构 * School of Computer Science and Information Engineering, Hefei University of Technology (HFUT), Hefei, China(合肥工业大学计算机与信息工程学院)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出DyFADet+双流RGB-骨架框架,通过门控残差模块自适应融合骨架运动与RGB特征,实现微手势在线识别,在SMG数据集上F1达40.88,排名第二。
Comments 13 pages, 2 figures
融合卫星图像与平面地图的跨视角定位
机构 * École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院洛桑校区)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV
AI总结 提出一种融合卫星图像与平面地图的模块,通过跨模态条件化和补丁级融合规则,将定位误差降低30.13%。
下一个词预测学习睡眠生理学的可泛化表示
机构 * Institute of Biomedical Engineering, University of Oxford(牛津大学生物医学工程研究所)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI
AI总结 提出Hypnos模型,通过下一个词预测目标,从多模态生理信号中学习可泛化表示,在睡眠阶段分类和房颤检测等任务上显著优于现有基础模型。
光学推理:重新思考图像作为超越文本的表达性推理媒介
机构 * The Hong Kong Polytechnic University(香港理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出光学推理概念,将图像作为独立推理媒介,通过排版和图形两种变体实现,在语言和多模态任务中匹配或超越文本推理,同时减少推理令牌。
个性化与安全的交汇:个性化大语言模型中的机制、风险与缓解措施
机构 * China Mobile Jiutian Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动九天人工智能技术(北京)有限公司) ; Chinese Academy of Sciences(中国科学院)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 本文首次对个性化大语言模型进行安全导向的综述,从用户表征、个性化范式和评估三个维度组织,提出统一的安全风险分类,并分析各范式下的脆弱性及缓解策略。
PRPO: 通过令牌级动态优势重塑的感知强化策略优化
机构 * Amap CV Lab, Alibaba Group(阿里巴巴集团高德地图计算机视觉实验室) ; Peking University(北京大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 提出令牌级强化学习框架PRPO,通过鲁棒视觉依赖(RVD)指标识别关键感知令牌,并利用感知优势重塑(PAR)技术增强其学习信号,在7个多模态推理基准上平均提升23.3%(3B模型)和21.1%(7B模型)。
SSAFE: 通过冻结视觉编码器实现简单而强大的AI生成图像检测
机构 * KAIST(韩国科学技术院) ; Google Cloud AI(谷歌云AI)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV
AI总结 本文发现冻结的多模态视觉编码器在嵌入空间中自然分离真实与合成图像,通过线性分类器即可实现强检测性能,并提出一种表示感知的数据策展策略,仅用10K图像训练,在多个基准上表现优异。
Comments Preprint. 22 pages, 10 figures, supplementary material included
基于密度传输的流匹配策略强化学习
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出在线强化学习算法RLDT,利用Stein变分梯度下降构建传输场,微调预训练流匹配策略,通过期望目标估计稳定训练,在连续控制任务中优于基线方法。
基于视觉基础模型的注意力一致纵向医学视觉问答
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; Yale Biomedical Imaging Institute(耶鲁大学生物医学成像研究所)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI
AI总结 提出一种注意力引导的编码器-解码器框架,通过轻量级配准和自适应掩码生成,结合辅助损失函数,实现胸部X光片的纵向医学视觉问答,在Medical-Diff-VQA基准上取得优异性能。
Comments Accepted to CVPR 2026 Workshop PHAROS-AIF-MIH
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 6448-6458
生成式图形图表的语义-结构对齐
机构 * Visual Computing Research Center (VCC), College of Computer Science and Software Engineering (CSSE) Shenzhen University China(视觉计算研究中心(VCC)、计算机科学与软件工程学院(CSSE)深圳大学中国)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV
AI总结 提出一种生成式框架,通过多模态扩散变压器中的结构对齐和语义对齐机制,实现兼具艺术表现力和结构保真度的图形图表自动合成。
Comments 11 pages, 17 figures, Accepted to ACM TOG
SAGE-Net:用于材料属性预测的语义增强几何编码器
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(comments)
AI总结 研究针对材料属性预测,提出语义增强几何编码器网络SAGE-Net,通过语义引导消息传递将晶体学语义注入几何消息传递,在多基准测试中表现出色,能有效捕捉晶体学特征,是深度集成多模态材料学习的通用可转移框架。
Comments 29 pages, 5 figures, multi-modal network
用于高效视觉-语言-动作策略的角色条件子令牌路由
机构 * Futurewei Technologies(未来智能技术公司)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对VLA模型推理成本高的问题,提出RoleSub方法,通过角色条件子令牌路由压缩视觉和语言表示,在匹配视觉-KV预算下多数场景优于仅令牌控制,结合压缩后总KV仅为原始的9.2-11.3%且控制性能强。
Comments 12 pages, 5 tables
基于检索的双融合与相似度感知对比的分子-文本对齐方法
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 多模态训练与对齐 :cross-modal(abstract)
AI总结 针对现有分子-文本对齐方法忽略子结构与文本细粒度语义关系的问题,提出RISEN方法,通过检索构建孪生分子并结合相似度感知对比学习,在基准数据集上取得更优性能。
让两个动作头达成一致:流匹配策略的协调机制与运行时崩溃证书
机构 * School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对流匹配策略的双动作头多模态误报问题,提出四类协调机制并推导机会校正协调边界,在LIBERO-Plus等测试中验证了残差为最强故障信号。
UniFed-VLM:面向多异质性视觉语言模型的联邦指令调优
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 UniFed-VLM是解决任务、模态、模型架构联合异质性的VLM联邦指令调优框架,含FedCSA与TCoD组件,在多基准数据集上优于现有FL方法。
FedADB:用于缓解遗忘的类别锚驱动双分支联邦学习
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对联邦学习中跨客户端数据异质性导致的全局知识遗忘问题,提出FedADB框架,通过类别锚与双分支机制平衡全局一致性与本地优化,在多数据集上提升了准确率与收敛速度。
Comments Accepted to appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)
MedMix:模态异质性下的专业化一致联邦稀疏混合专家模型
机构 * KAIST(韩国科学技术院) ; NTU Singapore(新加坡南洋理工大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对联邦多模态医疗AI的客户端与样本级模态异质性问题,提出MedMix框架,通过模态上下文感知路由、共识引导路由对齐与客户端自适应专家聚合,在多模态医疗数据集上取得最优平均F1值,严重异质性下提升显著。
QUARTZ:通过可访问表示与可视化实现定性理解
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对盲人和低视力研究者无法访问定性数据可视化的问题,提出基于网络的QUARTZ系统,通过用户研究揭示相关障碍并提出设计准则,以提升该群体参与定性研究的可访问性。
Comments 24 pages, accepted at ASSETS 2026
量子磁体中不确定性感知哈密顿量推断与实验设计的观测几何
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究提出AI赋能的不确定性感知哈密顿量推断与自适应实验设计框架,结合哈密顿量条件神经代理等方法,通过NiPS₃的中子散射测量验证,为量子材料表征与实验设计提供通用策略。
分层构型空间中接触感知不确定性校准的基于粒子的保形预测
机构 * University of Michigan(密歇根大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对机器人接触障碍物时运动模型不准确、未来构型分布异常的问题,提出CaPTURe算法,实现了接触与非接触场景下的指定覆盖率要求,任务成功率较最佳基线提升30%。
Comments 31 pages, 10 figures, 5 tables. Accepted at COPA 2026 (Conformal and Probabilistic Prediction with Applications). Project page: https://um-arm-lab.github.io/capture/
缺失模态下的共形融合
机构 * Swinburne University of Technology(斯威本科技大学)
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本文提出MCCF架构,解决缺失模态下的多模态融合问题,该架构兼具模态缺失鲁棒性与校准不确定性,在多基准测试中表现出良好的覆盖率与精度性能。
用于人工智能治理的后训练适应技术的六维分类法
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。
感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。
Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally
量子机器学习需要多少重构?独立训练量子子电路的后期融合
专题命中 多模态训练与对齐 :multimodal(abstract)
AI总结 针对电路切割量子机器学习中重构成本过高的问题,提出后期融合方法,其准确率与完全重构差距极小但成本指数级降低,且鲁棒性更强,是重构的高效替代方案。
Comments 11 pages, 6 figures. Includes technical appendix