Non-isomorphic Inter-modality Graph Alignment and Synthesis for Holistic Brain Mapping
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CL
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments 3 pages
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments 3 pages
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments IEEE Transactions on Medical Imaging 2020
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 17 pages, 4 figures, accepted in ECCV 2018
专题命中 多模态训练与对齐 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Published in WACV2018. Code will be available soon
Journal ref WACV2018
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
Comments accepted as poster at the 25th ACM Multimedia (ACM MM) 2017, Mountain View, California, USA
MARCUS:结合上下文城市信号的缺失感知区域表示用于租金预测
机构 * The Property Investors Alliance(房地产投资者联盟)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 针对城市区域表示中缺失数据的语义价值被忽略问题,提出缺失感知区域表示模型MARCUS,将缺失视为城市信号,在悉尼和纽约租金预测任务上较基线显著降低MAE,性能最优。
Comments 10 pages, 7 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Data Mining (ICDM 2026)
LLM智能体能够查看代码仓库
专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn)
AI总结 研究多模态大语言模型在仓库级问题解决中利用视觉表示的效果,发现纯视觉方案降低精度,而结合视觉结构图可减少26%输入token并保持或提升精度。
Comments Accepted by ASE 2026. Our code and data are available at https://github.com/cslsolow/SeeRepo
GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。
Comments Accepted to ACL 2026
Uni-OPD:基于双视角方案的统一策略内蒸馏框架
机构 * Zhejiang University(浙江大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; LLM Department, Tencent(腾讯大模型部门)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 针对策略内蒸馏存在的信息状态探索不足、教师监督不可靠问题,提出跨大语言与多模态大模型的统一框架Uni-OPD,经多域实验验证其通用性与有效性。
PiMiX 2.0: 人工智能增强的放射成像与断层扫描数据融合
专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract)
AI总结 提出AI增强的数据融合框架PiMiX 2.0,集成多实验多模态放射成像与断层扫描,支持自动数据摄取、3D/4D重建及物理感知解释,加速数据处理并提升可重复性。
Comments 9 pages, 4 figures, 1 table. Work presented in the 26th Topical Conference on High Temperature Plasma Diagnostics Conference, Cambridge, MA, USA (June 7 - 11, 2026)
缺失令牌提示的可靠性感知融合用于鲁棒多语种说话人识别
机构 * Hefei University of Technology(合肥工业大学) ; Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 提出MRAF框架,通过可学习的缺失令牌和可靠性感知交叉注意力融合,解决多语种场景下跨语言泛化和人脸缺失时的鲁棒性问题,在POLY-SIM 2026测试集上取得高准确率。
Comments 8 pages, 3 figures, 4 tables
RePercENT:将解耦表示学习扩展到两种模态之外
机构 * EPFL(瑞士联邦理工学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 提出RePercENT框架,通过多模态即插即用架构和联合优化目标,实现超过两种模态的可扩展成对解耦,无需联合预训练并降低计算复杂度。
ProgVLA:进度感知的机器人操作技能学习
机构 * NAVER LABS(NAVER实验室) ; NAVER LABS Europe(NAVER实验室欧洲)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)
AI总结 提出ProgVLA,一种紧凑的视觉-语言-动作模型,通过显式表示任务进度和两阶段Perceiver重采样机制,在有限计算和内存下实现长序列多模态处理,并在多任务操作基准上达到或超越大模型性能。
Hide to See: 面向VLM蒸馏中视觉锚定思维的推理前缀掩码
机构 * KAIST(韩国科学技术院) ; NVIDIA(英伟达) ; POSTECH(POSTECH大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出一种推理前缀掩码蒸馏框架,通过掩码学生模型的显著推理前缀,迫使其在推理过程中更依赖视觉证据,从而缓解长推理轨迹中的视觉遗忘问题,提升多模态推理性能。
Comments Pre-print
通过混合随机平滑实现异质扰动下的认证鲁棒性
机构 * Department of Computer Science, School of Computing, Institute of Science Tokyo, Tokyo, Japan(东京科学研究所计算机科学系) ; College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) ; PSL University, Paris, France(巴黎高等师范学院)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 本文提出统一的混合随机平滑框架,针对混合离散-连续输入,基于可解析的Neyman-Pearson联合最坏情况问题,提供闭式一维证书,扩展了高斯和离散随机平滑,应用于多模态安全过滤。
Comments ICML 2026. Code: https://github.com/tdsai-lab/hybrid-randomized-smoothing
TriFit:结合蛋白质动力学的三模态融合用于突变适应度预测
机构 * Department of Physics(物理系) ; Astronomy, Rice University, Texas, USA(天文学、里士满大学、德克萨斯州、美国)
专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract)
AI总结 TriFit通过三模态融合模块整合序列、结构和蛋白质动力学信息,利用四专家混合专家模型提升突变适应度预测性能,实现优于现有基线模型的高准确率。
非典型立体视觉估计器:结合视觉与语言进行体积感知
机构 * Purdue University(普渡大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出融合立体视觉隐式3D线索与自然语言显式先验知识的方法,通过多模态表示提升体积估计精度。
基于传感器的人类活动识别的基石模型:一种综述与展望
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)
AI总结 本文综述了基于传感器的人类活动识别中的基石模型,分析了九种技术轴上的设计模式与权衡,并探讨了数据整理、多模态对齐、个性化、隐私和负责任部署等开放挑战。
在基础模型时代的人工智能安全:从统一视角的综合调查
机构 * University of Central Florida(中佛罗里达大学) ; University of Copenhagen(哥本哈根大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文从统一视角出发,系统探讨了基础模型时代AI安全问题,提出统一闭环威胁分类框架,揭示模型与数据之间的双向风险传播,为构建可扩展的安全策略提供理论基础。
Comments Published at Transactions on Machine Learning Research (TMLR)
MeGU:基于目标特征解耦的机器引导反学习
机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) ; Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) ; Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)
专题命中 多模态训练与对齐 :multi-modal(abstract);MLLM(abstract)
AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。
与图像对话以进行反思性视觉思维
机构 * NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Nanjing University(南京大学)
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 ViLaVT通过语言引导的特征调节框架,实现多图像区域的联合重编码,提升跨模态对齐与复杂空间推理能力。
重新思考多条件DiTs:通过位置对齐和关键词范围消除冗余注意力
专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出PKA框架,通过位置对齐和关键词范围注意力消除多条件生成中的冗余,提升效率并减少资源消耗。
在暗中推理:在潜在空间中交织的视觉-文本推理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Singapore Management University(新加坡管理学院) ; Shandong University(山东大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 本文提出IVT-LR方法,通过在潜在空间中交织视觉和文本信息,提升多模态推理的效率和准确性。
从电子健康记录和可穿戴数据中学习纵向健康表示
机构 * University of the Chinese Academy of Sciences, Columbia University(中国科学院大学,哥伦比亚大学)
专题命中 多模态训练与对齐 :multimodal(abstract);multimodal foundation model(abstract)
AI总结 本文提出一种多模态基础模型,通过联合表示电子健康记录和可穿戴数据,提升纵向健康预测的准确性和鲁棒性。
ZIA:零输入AI的理论框架
机构 * Indian Institute of Technology Roorkee(印度理工学院罗奥基分校)
专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract)
AI总结 ZIA提出了一种基于多模态融合的零输入AI框架,通过整合生物信号和上下文数据实现前瞻性意图预测,提升实时推理效率与准确性。
GaussianVision: 通过二维高斯散射从压缩图像表示中实现视觉-语言对齐
机构 * Stanford University(斯坦福大学)
专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 GaussianVision通过二维高斯散射实现高效的视觉-语言对齐,提升边缘设备传输效率并优化多模态学习性能。