arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-18 至 2026-08-18 共收录 178 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 23 篇

2509.22415 2026-08-18 cs.CV cs.AI 版本更新 81%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15104 2026-08-18 cs.CV 新提交 79%

ProjFormer: Point Cloud Completion via Geometric-Projective Transformer and Cross-Modal Semantic Constraints

ProjFormer:基于几何投影Transformer与跨模态语义约束的点云补全

Sheng Liu, Meng Wang, Ruihui Li, Huilong Pi, Zhuo Tang, Kenli Li

机构 * Hunan University(湖南大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对现有点云补全方法几何一致性与适应性不足的问题,提出ProjFormer跨模态框架,通过投影引导视图注意力模块与几何感知路由网络实现高效特征聚合与融合,在轻量级设计下取得了具竞争力的补全性能。

Comments Accepted by ACM Multimedia 2026. 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12478 2026-08-18 cs.CV cs.LG 版本更新 79%

Less Data, Faster Convergence: Goal-Driven Data Optimization for Multimodal Instruction Tuning

数据更少,收敛更快:面向多模态指令微调的目标驱动数据优化

Rujie Wu, Haozhe Zhao, Hai Ci, Yizhou Wang

机构 * Peking University(北京大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出目标驱动数据优化框架GDO,通过优化训练样本实现更快收敛和更高精度,适用于多模态指令微调任务。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03096 2026-08-18 cs.CV cs.LG 版本更新 79%

FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens

FuseLIP:通过离散令牌的早期融合实现多模态嵌入

Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein

机构 * Tübingen AI Center University of Tübingen(图宾根人工智能中心大学) EPFL(瑞士联邦理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出FuseLIP架构,通过文本与图像令牌的统一词汇表实现早期融合,收集新数据集并设计挑战性任务,在多模态及单模态嵌入任务中优于后期融合方法。

Comments TMLR 2026. Code and models available at https://github.com/chs20/fuselip

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09105 2026-08-18 cs.AI 版本更新 77%

SMA: Who Said That? Auditing Membership Leakage in Semi-Black-box RAG Controlling

SMA:谁说的?半黑盒RAG控制中的成员泄露审计

Shixuan Sun, Siyuan Liang, Jianjie Huang, Jingzhi Li, Xiaochun Cao

机构 * Sun Yat-Sen University(孙中山大学) Nanyang Technological University(南洋理工大学) University of Chinese Academy of Science(中国科学院大学) Zhongguancun Academy(中关村学院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract_cn);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对半黑盒RAG控制中的成员泄露问题,提出首个源感知成员审计SMA,通过零阶优化归因估计机制与跨模态归因技术,实现生成内容的细粒度来源归因,为复杂生成系统的数据来源审计提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15972 2026-08-18 cs.CV cs.AI 新提交 76%

CM-MAE: A Physics-Guided Cross-Modal Self-Supervised Learning Framework for Vision-Wireless Applications

CM-MAE:面向视觉-无线应用的物理引导跨模态自监督学习框架

Yubo Zhang, Yiyao Liu

专题命中 多模态训练与对齐 :cross-modal(title);分类 cs.CV、cs.AI

AI总结 本文提出CM-MAE框架,通过软对比对齐损失等技术实现视觉-无线跨场景表征迁移,在DeepSense 6G数据集上提升了跨场景任务的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14829 2026-08-18 eess.IV cs.CV 新提交 70%

Modality-Invariant Coarse-to-Fine Retinal Image Registration

模态无关的由粗到细视网膜图像配准

Bo Wen, Nehal Nailesh Mehta, Melanie Tran, Dirk-Uwe Bartsch, William Freeman, Truong Nguyen

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对现有视网膜配准方法依赖模态的局限,提出可泛化的两阶段模态无关框架,含稀疏特征匹配模型与MI-RAFT网络,在多模态视网膜图像配准中性能优于现有方法。

Comments This paper is a submission to IEEE Transactions on Image Processing (TIP-40498-2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14662 2026-08-18 eess.SP cs.AI cs.LG 新提交 70%

Does the Heart Show Your Pain? Tackling the X-ITE Pain Challenge with Self-Supervised ECG Representation Learning

心脏能反映你的疼痛吗?用自监督心电表示学习应对X-ITE疼痛挑战赛

Dominika Kunc, Przemysław Kazienko, Stanisław Saganowski

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本研究针对X-ITE疼痛挑战赛,结合自监督心电表示学习与多模态预训练,分析疼痛识别中的心电信号特性,为可穿戴疼痛监测提供了基础。

Comments 5 pages, 3 Figures, 1 Table, appear in the Proceedings of the 13th International Conference on Affective Computing and Intelligent Interaction Workshops and Demos (ACIIW 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14924 2026-08-18 cs.CV cs.AI 新提交 66%

PaSTel: Anchoring Histology in Spatial Transcriptomics via Multi-Scale Hierarchical Bio-Prior Contrastive Pretraining

PaSTel:通过多尺度层级生物先验对比预训练锚定空间转录组学中的组织学

Azim Dehghani Amirabad, Junchao Zhu, Pushpak Pati, Walid Abdelmoula, Tommaso Mansi, Rui Liao

机构 * Johnson & Johnson Innovative Medicine(强生创新医药)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI;multi-modal(comments)

AI总结 PaSTel是一种整合多尺度生物先验的层级多模态预训练框架,通过三层生物先验设计解决现有空间转录组学方法的局限,在多个下游任务中性能优于现有编码器。

Comments This paper was accepted to the 3rd ICML 2026 Workshop on Multi-modal Foundation Models and Large Language Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09521 2026-08-18 cs.CL cs.AI 版本更新 62%

PEER: Unified Process-Outcome Reinforcement Learning for Structured Empathetic Reasoning

PEER:统一的过程-结果强化学习用于结构化共情推理

Yunxiao Wang, Meng Liu, Sicheng Zhao, Lizi Liao, Liqiang Nie

机构 * Shandong University(山东大学) Shandong Jianzhu University(山东建筑大学) Singapore Management University(新加坡管理大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PEER,通过结构化共情推理框架提升情感支持对话的 empathy、策略一致性及人性表现,采用GRPO与UnifiReward模型,结合数据增强减少重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16763 2026-08-18 cs.AI 新提交 57%

LAVA: Logic-Aware Validation and Augmentation Framework for Large-Scale Financial Document Auditing

LAVA:面向大规模财务文档审计的逻辑感知验证与增强框架

Ruoqi Shu, Xuhui Wang, Isaac Wang, Yanming Mai, Bo Wan

机构 * BMO Financial Group(蒙特利尔银行金融集团)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 针对财务文档验证的异构性与业务规则处理难题,提出基于多模态大语言模型的LAVA框架,通过四阶段设计提升幻觉控制与边缘案例处理能力,适用于高风险财务审计场景。

Journal ref Proceedings of The 10th Workshop on Financial Technology and Natural Language Processing (FinNLP 2025), Association for Computational Linguistics, pp. 75-92, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 57%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15309 2026-08-18 cs.AI 新提交 57%

Physiological World Models for Human State Transitions

面向人体状态转换的生理世界模型

Chongyang Zhang, Rendong Wang, Hao Zheng, Hanwen Zhang, Yang Liu, Xiaolong Wei, Bin Chong

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.AI

AI总结 本文提出生理世界模型(PWM),引入人体状态转换标记,构建含六项基准任务的框架,用于建模人体生理状态响应现实因素的变化,助力个性化健康管理等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 57%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15075 2026-08-18 cs.CV 新提交 57%

SA-GEM: Scale-Adaptive and Geospatial Evidence-Modulated Token Pruning for Efficient Remote Sensing Large Vision-Language Models

SA-GEM:面向高效遥感大视觉语言模型的尺度自适应与地理空间证据调制型令牌剪枝

Kexin Ma, Jing Xiao, Bowen Xing, Liang Liao, Chia-Wen Lin

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 本文针对遥感大视觉语言模型高分辨率处理效率低的问题,提出SA-GEM即插即用剪枝框架,通过尺度自适应与地理空间证据调制实现效率与精度提升,在XLRS-Bench上超GeoLLaVA-8K 2.3%且推理提速2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05896 2026-08-18 cs.AI cs.IT math.IT 版本更新 57%

GSBF: Gaussian Splatting for Environment-Aware Beamforming

GSBF:面向环境感知波束成形的高斯溅射

Yijie Bian, Wei Guo, Zixin Wang, Shenghui Song, Jun Zhang, Khaled B. Letaief

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.AI

AI总结 该研究针对传统波束成形依赖瞬时CSI导致开销高的问题,提出GSBF方法,通过3D高斯表示刻画环境,利用Bi-SG核与电磁光栅化合成波束,仿真显示其性能优于EBA且延迟更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16005 2026-08-18 cs.LG 新提交 50%

Retrieval-guided Twin Fusion with Similarity-aware Contrast for Molecule-Text Alignment

基于检索的双融合与相似度感知对比的分子-文本对齐方法

Shunshun Gu, Shengqi Qiu, Hang Zhou, Xiao Luo

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 多模态训练与对齐 :cross-modal(abstract)

AI总结 针对现有分子-文本对齐方法忽略子结构与文本细粒度语义关系的问题,提出RISEN方法,通过检索构建孪生分子并结合相似度感知对比学习,在基准数据集上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15748 2026-08-18 cs.RO 新提交 50%

Making two action heads agree: coordination mechanisms and a runtime collapse certificate for flow-matching policies

让两个动作头达成一致:流匹配策略的协调机制与运行时崩溃证书

Jinhui Sun, Wei Zhou, Bowen Yang, Xinliang Xiao, Li Yang

机构 * School of Automation, Nanjing University of Science and Technology(南京理工大学自动化学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 该研究针对流匹配策略的双动作头多模态误报问题,提出四类协调机制并推导机会校正协调边界,在LIBERO-Plus等测试中验证了残差为最强故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15516 2026-08-18 cs.LG 新提交 50%

UniFed-VLM: Federated Instruction Tuning for Vision-Language Models with Multiple Heterogeneity

UniFed-VLM:面向多异质性视觉语言模型的联邦指令调优

Pengyu Wang, Baochen Xiong, Xiaoshan Yang, Yifan Xu, Zhang Qimeng, Haifeng Chen, Changsheng Xu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 UniFed-VLM是解决任务、模态、模型架构联合异质性的VLM联邦指令调优框架,含FedCSA与TCoD组件,在多基准数据集上优于现有FL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15310 2026-08-18 cs.CR cs.LG 新提交 50%

FedADB: Class Anchor-Driven Dual-Branch Federated Learning for Mitigating Forgetting

FedADB:用于缓解遗忘的类别锚驱动双分支联邦学习

Zhenyan Liu, Hua Zhang, Haoran Gao, Qi Li, Hongliang Zhu, Huiyu Zhou, Zongliang Shen, Yanxin Xu, Jiahui Wang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对联邦学习中跨客户端数据异质性导致的全局知识遗忘问题,提出FedADB框架,通过类别锚与双分支机制平衡全局一致性与本地优化,在多数据集上提升了准确率与收敛速度。

Comments Accepted to appear in Proceedings of the 34th ACM International Conference on Multimedia (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 8 篇

2607.11621 2026-08-18 cs.AI cs.CL cs.LG 版本更新 81%

Lesioned Multimodal Language Models Reproduce Aphasic Picture-Naming Patterns

受损多模态语言模型再现失语症患者的图片命名模式

Yong Yang, Xiang Guan, Sophie Arheix-Parras, Saeed Ahmadi, Roger Newman-Norlund, Leonardo Bonilha, Christopher Rorden, Julius Fridriksson, Rutvik H. Desai, Srihari Nelakuditi

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究未针对临床模拟设计的通用语言模型能否再现失语症患者图片命名错误模式,通过对多模态语言模型进行扰动配置,建立定量框架再现个体失语症错误模式,表明语言模型或可成为中风后失语症患者数字替身。

Comments 15 pages, 8 figures; supplementary materials (18 pages, 6 sections) included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14951 2026-08-18 cs.LG eess.IV q-bio.QM stat.ML 新提交 78%

PathFinder: Joint Decompositions of Linked Multimodal Datasets

PathFinder:链接多模态数据集的联合分解方法

Ying-Qiu Zheng, Alex Fung, Stephen M Smith, Rogier B Mars, Saad Jbabdi

机构 * Oxford Centre for Integrative Neuroimaging(牛津整合神经成像中心) University of Oxford(牛津大学)

专题命中 其他多模态 :multimodal(title,abstract)

AI总结 PathFinder是一种通用的联合矩阵分解框架,可分析未必共享同一维度的多模态数据集,能发现跨模态等的共同模式并预测缺失数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16709 2026-08-18 cs.CV cs.AI cs.LG 新提交 76%

MIRROR: Multimodal Intelligent Radiology Reasoning and Observation Reporter

MIRROR:多模态智能放射学推理与观察报告生成器

Vignesh Nagarajan, Sriram Venkatapathy

机构 * Texas A&M University(德克萨斯农工大学) Capital One(第一资本金融公司) IIT Hyderabad(印度理工学院海得拉巴分校)

专题命中 其他多模态 :multimodal(title);分类 cs.CV、cs.AI

AI总结 MIRROR是一款多模态智能放射学报告生成原型,通过分离分类、定位与文本生成环节实现可审计的放射学发现,在ChestMNIST数据集上达到0.729的宏平均AUROC,但受类别不平衡影响存在决策弃权问题。

Comments 8 pages, 5 figures, 5 tables, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15115 2026-08-18 cs.CV 新提交 57%

Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples

具有增强对抗样本迁移性的视角不变攻击

Kaisheng Liang, Yiming Cao, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。

Journal ref IEEE Transactions on Information Forensics and Security, vol. 21, pp. 6818-6831, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14878 2026-08-18 stat.ME 新提交 50%

Quantification and Decomposition of Uncertainty Using Sliced-Normal Distribution: With Applications to NASA Data

基于切片正态分布的不确定性量化与分解:在NASA数据中的应用

Arindam RoyChowdhury, Luis G. Crespo, Henry Lam

专题命中 其他多模态 :multi-modal(abstract)

AI总结 本文改进了切片正态(SN)分布框架,将其参数估计转化为凸优化问题,明确其表达能力并提出高维拟合流程,在NASA失速飞行数据上验证了该方法可捕捉非线性依赖模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15489 2026-08-18 eess.SP cs.SY eess.SY 新提交 50%

Contours-Seeking Proposal Density Particle Filter and Resilient Terrain-Referenced Navigation

轮廓搜索提议密度粒子滤波与弹性地形基准导航

Junwoo Park, Hyochoong Bang

专题命中 其他多模态 :multimodal(abstract)

AI总结 针对粒子滤波退化问题,提出含高斯混合随机强迫机制的轮廓搜索采样策略,经实验验证可降低权重方差、提升有效样本量,在恶劣场景下仍能可靠运行。

Comments 17 pages. Author's accepted version. Published in IEEE Transactions on Aerospace and Electronic Systems

Journal ref IEEE Transactions on Aerospace and Electronic Systems, vol. 61, no. 6, pp. 15627-15641, Dec. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16572 2026-08-18 cs.RO 新提交 50%

ViHaTeleop: A Low-Cost, Lightweight Visual-Haptic Teleoperation System for Dexterous Manipulation Learning

ViHaTeleop:一种用于灵巧操作学习的低成本轻量型视觉-触觉遥操作系统

Fucai Zhu, Yanhou Lai, Paul Maestre, Koichi Hashimoto

机构 * Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院)

专题命中 其他多模态 :multi-modal(abstract)

AI总结 ViHaTeleop是一款低成本轻量型视觉-触觉遥操作系统,结合SLAM、相机跟踪与LRA反馈,经实验验证其可提升接触关键任务的操作成功率与主观体验,支持从演示到策略训练的完整流程。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS). 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15520 2026-08-18 cs.LG 新提交 50%

Guaranteed Adaptive Modality Acquisition: When the Policy Chooses Its Own Calibration Group

带保证的自适应模态获取:策略选择自身校准组时

Melika Baghi

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对自适应模态获取中策略诱导分组破坏条件校准假设的问题,提出RouteCert方法,在临床心电图任务及掩码多模态基准上实现了高回答比例与低分歧率的良好性能。

Comments 23 pages, 4 figures, 14 tables. Includes appendix with full proofs and additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏