arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 502 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 502 篇

2606.16067 2026-06-16 cs.CV 新提交 79%

Stepwise Token Selection for Efficient Multimodal Large Language Models

逐步令牌选择用于高效多模态大语言模型

Landi He, Shawn Young, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出一种基于指针机制的逐步视觉令牌选择方法,通过可微松弛实现端到端训练,动态决定保留令牌数量,在去除88.9%令牌时保持94.6%准确率并加速1.88倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15597 2026-06-16 cs.CV 新提交 79%

Fusion-E2Pulse: A Multimodal Event-RGB Fusion Network for Non-contact Pulse Wave Reconstruction

Fusion-E2Pulse:一种用于非接触式脉搏波重建的多模态事件-RGB融合网络

Qian Feng, Hao Guo, Yan Niu, Zhenhuan Xu, Yidi Li

机构 * College of Computer Science and Technology(计算机科学与技术学院) Taiyuan University of Technology(太原科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Fusion-E2Pulse多模态融合网络,利用RGB信号结构先验抑制运动伪影,结合事件流高灵敏度恢复细粒度形态细节,在脉搏波重建中实现噪声抑制与形态保真度的最佳平衡。

Comments Accepted by MICCAI 2026. The final version will appear in the official MICCAI proceedings published by Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14691 2026-06-15 cs.CL 新提交 79%

CORA: Analyzing and bridging thinking-answer gap in Multimodal RLVR via Consistency-Oriented Reasoning Alignment

CORA: 通过一致性导向的推理对齐分析与弥合多模态RLVR中的思考-答案差距

Jiayue Cao, Zhicong Lu, Xuehan Sun, Wei Jia, Hongling Zheng, Changyuan Tian, Zichuan Lin, Wenqian Lv, Nayu Liu

机构 * University of Chinese Academy of Sciences(中国科学院大学) Wuhan University(武汉大学) Tsinghua University(清华大学) Tianjin University(天津大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 本文分析多模态RLVR中思考与答案的语义不一致问题,提出CORA方法,通过轻量级一致性奖励模型引入语义一致性,并采用混合奖励优势分裂稳定优化,提升推理忠实度。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12942 2026-06-12 cs.AI 新提交 79%

PRISMR: Overcoming Parse Collapse in Multimodal Listwise Ranking via Parameterized Representation Internalization

PRISMR: 通过参数化表示内化克服多模态列表排序中的解析崩溃

Hao Jiang, Xin Li, Annan Wang, Zhi Yang, Haoxiang Zhang, Yichi Zhang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Peking University(北京大学) Independent Researcher(独立研究员)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 针对多模态长上下文场景中生成式列表排序的解析崩溃问题,提出PRISMR框架,用参数化结构条件替代临时上下文列表处理,通过轻量级超网络并行编码候选并生成LoRA权重,显著减少解析崩溃并提升排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12362 2026-06-11 cs.LG cs.AI 新提交 79%

Latent World Recovery for Multimodal Learning with Missing Modalities

缺失模态下的多模态学习中的潜在世界恢复

Hui Wang, Tianyu Ren, Joseph Butler, Christopher Baker, Karen Rafferty, Simon McDade

机构 * Queen's University Belfast(贝尔法斯特女王大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出潜在世界恢复(LWR)框架,通过邻居潜在对齐和可用性感知融合,在缺失模态下实现鲁棒的多模态预测,避免显式重构误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12303 2026-06-11 cs.CV 新提交 79%

From 2D Grids to 1D Tokens: Reforming Shared Representations for Multimodal Image Fusion

从二维网格到一维标记:重塑多模态图像融合的共享表示

Yuchen Xian, Yunqiu Xu, Yang He, Yi Yang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出基于冻结预训练图像标记器的紧凑一维标记接口,通过选择性标记编辑(STE)稀疏更新关键标记,在保持融合骨干网络不变的同时引导全局外观一致性,实现全局连贯与局部保真的最佳平衡。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11682 2026-06-11 cs.CV cs.LG 新提交 79%

Parameter-Efficient Adapter Tuning for Tabular-Image Multimodal Learning

面向表格-图像多模态学习的参数高效适配器微调

Jiaqi Luo

机构 * School of Mathematical Sciences, Soochow University(苏州大学数学科学学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出TI-Adapter框架,通过冻结表格编码器并添加适配器,以及图像分支的嵌入层和瓶颈层适配器,实现高效多模态微调,在20个数据集上以更少参数达到或超越全微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11572 2026-06-11 cs.CV 新提交 79%

FreqKD: Frequency-Decoupled Cross-Modal Knowledge Distillation for Infrared Object Detection

FreqKD: 面向红外目标检测的频率解耦跨模态知识蒸馏

Keval Thaker, Venkatraman Narayanan, Abdalmalek Aburaddaha, Samir A. Rawashdeh

机构 * University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对RGB与红外图像模态差异,提出频率解耦蒸馏框架FreqKD,对低频和高频成分分别施加严格MSE和松弛log-MSE损失,在KAIST数据集上提升DINOv2基线2.4 mAP50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11188 2026-06-10 cs.CV 新提交 79%

ARM: An AutoRegressive Large Multimodal Model with Unified Discrete Representations

ARM: 一种具有统一离散表示的自回归大型多模态模型

Junke Wang, Xiao Wang, Jiacheng Pan, Xuefeng Hu, Feng Li, Jingxiang Sun, Chaorui Deng, Zilong Chen, Yunpeng Chen, Kaibin Tian, Matthew Gwilliam, Hao Chen, Danhui Guan, Kun Xu, Weilin Huang, Zuxuan Wu, Haoqi Fan, Yu-Gang Jiang, Zhenheng Yang

机构 * Shanghai Key Lab of Intelligent Information Processing, Fudan University(复旦大学上海智能信息处理重点实验室) School of Computer Science, Fudan University(复旦大学计算机科学技术学院) Shanghai Collaborative Innovation Center of Intelligent Visual Computing(上海智能视觉计算协同创新中心) Youtu Lab, Tencent(腾讯优图实验室) Meta AI Shanghai AI Laboratory(上海人工智能实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出ARM模型,通过离散语义视觉分词器将图像映射为紧凑token序列,结合自回归建模和强化学习,统一实现图像理解、生成和编辑,并提升任务性能与跨任务协同。

Comments technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10572 2026-06-10 cs.AI 新提交 79%

One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA

每个多模态证据一个令牌:面向资源受限问答的潜在记忆

Zhi Zheng, Ziqiao Meng, Hao Luan, Wei Liu, Wee Sun Lee

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出潜在记忆范式,将每个证据压缩为单个高维潜在令牌,通过统一训练实现高效检索与生成,在资源受限场景下以3-10倍令牌节省达到竞争性问答性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10488 2026-06-10 cs.CV 新提交 79%

5% > 100%: Flatness Preference is All You Need for Multimodal Parameter-Efficient Fine-Tuning

5% > 100%: 平坦性偏好是您进行多模态参数高效微调所需的一切

Yifan Zhu, Can Lin, Hangjie Yuan, Zixiang Zhao, Pengfei Zhang, Tao Feng, Zhonghong Ou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Zhejiang University(浙江大学) ETH Zürich(苏黎世联邦理工学院) Anhui University of Science and Technology(安徽理工大学) Tsinghua University(清华大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 揭示参数高效微调方法中普遍存在的平坦性偏好,即少量尖锐维度主导泛化,并提出FlatPO方法优化这些维度以提升泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09148 2026-06-09 cs.CL 新提交 79%

Explicit Representation Alignment for Multimodal Sentiment Analysis

显式表示对齐用于多模态情感分析

Baode Wang, Ziming Wang, Huacan Wang, Ronghao Chen, Biao Wu

机构 * AgentAlpha

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 针对多模态情感分析中表示不对齐问题,提出利用视觉-语言模型将视觉内容转为文本描述,结合语义标记选择和批量级均匀性正则化,实现跨模态对齐,在多个基准上取得最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09143 2026-06-09 cs.CV 新提交 79%

CAMF-Det: Closure-Aware Multimodal Fusion for LiDAR-Camera 3D Object Detection on UAV Platforms

CAMF-Det: 面向无人机平台的激光雷达-相机闭合感知多模态融合3D目标检测

Yanze Jiang, Yanfeng Gu, Xian Li

机构 * School of Electronics and Information Engineering, Harbin Institute of Technology(哈尔滨工业大学电子与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对无人机俯视场景中树冠遮挡导致的多模态信息退化问题,提出基于比尔-朗伯定律的闭合感知融合框架CAMF-Det,通过显式建模双模态遮挡强度并注入检测流程,在自建数据集上实现困难级别mAP_BEV提升9.43%和4.88%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09091 2026-06-09 cs.LG cs.CV 新提交 79%

Stabilizing On-Policy Distillation for MLLM Reasoning with Global Normalization

稳定基于策略的蒸馏用于多模态大语言模型推理的全局归一化

Dongze Hao, Zhiwei Jin, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO AI中心)

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.CV

AI总结 针对策略蒸馏中异常状态导致梯度不稳定的问题,提出全局归一化蒸馏策略优化(GNDPO),通过将KL分数转化为批次级相对优势来稳定优化,提升多模态推理任务的训练鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08511 2026-06-09 cs.CV 新提交 79%

Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs

少看多思:面向高效多模态大语言模型的块级注意力跳过

Jie Ma, Zhike Qiu, Jiayi Ji, Xiaoshuai Sun, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉注意力饱和问题,提出训练无关的Visual-Skip方法,通过选择性跳过冗余的视觉自注意力模块实现块级稀疏性,并利用轻量级校准动态选择最优稀疏路径,在保持性能的同时显著降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07676 2026-06-09 q-bio.GN cs.AI 新提交 79%

Single-Cell Cross-Modal Transfer by Adversarial Fine-Tuning of Foundation Models

通过基础模型的对抗微调实现单细胞跨模态迁移

Joseph Boyd, Matthew Lyon, Martino Mansoldo, Christian Hurry, Finnian Firth

机构 * University of Cambridge(剑桥大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.AI

AI总结 提出利用单细胞基础模型进行对抗微调,实现未配对空间转录组与单细胞RNA测序数据的跨模态翻译,性能优于多组学翻译方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07000 2026-06-08 cs.AI 新提交 79%

Teaching the Way, Not the Answer: Privileged Tutoring Distillation for Multimodal Policy Optimization

教方法而非答案:用于多模态策略优化的特权辅导蒸馏

Shizhe Xiang, Ke An, Wenlong Yu, Yue Liu, Jian Luan, Pei Fu, Qilong Wang

机构 * Tianjin University(天津大学) Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) University of Chinese Academy of Sciences(中国科学院大学) Xiaomi Inc(小米公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 提出PTD-PO框架,通过构建特权提示提供密集的令牌级监督,避免暴露答案,并采用Top-K JS散度稳定蒸馏,显著提升多模态推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06867 2026-06-08 cs.CV 新提交 79%

Multi-FRuGaL: Multimodal Flexible Redundancy-aware Decomposed Gated Learning for Cancer Diagnosis and Prognosis

Multi-FRuGaL:面向癌症诊断与预后的多模态灵活冗余感知分解门控学习

Sanket Kachole, Siddhesh Thakur, Shubham Innani, Sanyukta Adap, Suhang You, Carla Pitarch-Abaigar, Spyridon Bakas

机构 * Division of Computational Pathology, Department of Pathology and Laboratory Medicine, Indiana University School of Medicine(计算病理学部,病理学与实验室医学部,印第安纳大学医学院) IU Melvin and Bren Simon Comprehensive Cancer Center(印第安纳大学Melvin和Bren Simon综合癌症中心) Departments of Biostatistics and Health Data Science(生物统计学与健康数据科学部) Radiology and Imaging Sciences(放射学与影像科学部) Neurological Surgery(神经外科) Indiana University School of Medicine(印第安纳大学医学院) Department of Computer Science, Luddy School of Informatics, Computing, and Engineering(计算机科学部,Luddy信息、计算与工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 提出Multi-FRuGaL框架,通过分解感知自适应门控中间融合,在缺失模态下学习模态级表示,分离冗余与互补信号,提升癌症诊断与预后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23445 2026-07-28 cs.CV cs.CL 新提交 79%

Omni-Prune: Query-Aware Unified Token Pruning for Efficient Omnimodal Large Language Models

Omni-Prune:用于高效全模态大语言模型的查询感知统一令牌剪枝

Yiming Zhong, Chang Nie, Caifeng Shan

机构 * Nanjing University(南京大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.CL

AI总结 研究针对全模态大语言模型推理时音频-视频令牌序列长、预填充延迟高和GPU内存使用量大的问题,提出无需训练的查询感知Omni-Prune框架,联合去除冗余并保留跨模态证据,实验证明其性能优于基线方法,能加速预填充并减少内存。

Comments 14 pages, 7 figures. Code: https://github.com/kimberlyii/Omni-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 79%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22138 2026-06-23 cs.CL cs.AI cs.LG q-bio.BM 新提交 79%

BioMatrix: Towards a Comprehensive Biological Foundation Model Spanning the Modality Matrix of Sequences, Structures, and Language

BioMatrix:迈向覆盖序列、结构和语言模态矩阵的综合性生物基础模型

Qizhi Pei, Zhimeng Zhou, Yi Duan, Yiyang Zhao, Wei Li, Han Guo, Liang He, Chengping Li, Chang-Yu Hsieh, Conghui He, Rui Yan, Lijun Wu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) OpenDataLab, Shanghai Artificial Intelligence Laboratory(上海人工智能实验室 OpenDataLab) Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学) Zhongguancun Academy(中关村学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出首个原生多模态生物基础模型BioMatrix,通过统一分词方案将分子序列、结构、蛋白质序列、结构和自然语言映射到共享离散标记空间,在单一解码器架构下实现所有模态的统一生成,在80项任务中77项达到最优或竞争力水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12944 2026-08-14 cs.LG eess.IV stat.ML 新提交 78%

CardioState-JEPA: Delay-Aware Cross-Modal Learning of a Shared Cardiac Representation

CardioState-JEPA:面向共享心脏表征的延迟感知跨模态学习

Hamza Shafiq, Hung Manh Pham, Bin Zhu, Pan Zhou, Jun Hu, Aaqib Saeed

机构 * Singapore Management University(新加坡管理大学) Eindhoven University of Technology(埃因霍温理工大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 CardioState-JEPA是一种延迟感知跨模态心脏基础模型,通过对齐ECG、PPG、PCG的共享生理表征,在25项下游任务上显著提升了各模态的分类性能,实现了异质心脏信号的相互监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10700 2026-08-12 cs.IR 新提交 78%

Deciding When to Rely on Visual Information: Gated Multimodal Fusion in Sequential Recommendation

何时依赖视觉信息:序列推荐中的门控多模态融合

Natalija Glisovic, Danica Kragic, Martin Tegner

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出VisGate框架,基于物品和用户上下文自适应融合多模态信号,揭示视觉效用随物品、交互稀疏性变化的规律,实现更精准的序列推荐并可解释视觉信息的作用。

Comments 8 pages, 6 figures, Accepted at CARS @ RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09830 2026-08-11 cs.LG 新提交 78%

Deep Multimodal Wearable Sensor Fusion for Detection of Body-Focused Repetitive Behaviors

用于聚焦身体重复行为检测的深度多模态可穿戴传感器融合

Samaneh Rezaeimanesh, Mohsen Behradfar, Mohammad Fili, Guiping Hu

机构 * George Mason University(乔治梅森大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本研究开发多模态深度学习框架,利用腕戴式传感器数据检测聚焦身体的重复行为,在二元及九分类任务中均优于单模态基线,为可穿戴辅助心理健康诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05647 2026-08-07 cs.RO 新提交 78%

KILVO: Kinematic-Inertial-LiDAR-Visual Odometry with Robust Multimodal Adaptation for Humanoid Robots

KILVO:面向人形机器人的具备鲁棒多模态自适应的运动学-惯性-激光雷达-视觉里程计

Jixin Gao, Fucheng Liu, Teng Zhang, Fusheng Zha

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出面向人形机器人的KILVO里程计,基于ESIKF整合多传感器并设计多模态自适应与接触估计模块,实验显示其精度、效率及鲁棒性优于现有方法,代码与数据集已开源。

Comments This article has been accepted for publication in IEEE/ASME Transactions on Mechatronics. Personal use is permitted. All other uses require IEEE permission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02692 2026-08-05 cs.LG 新提交 78%

PatTree: a novel approach for automated creation of multimodal, graph-based patient representations for medical classification tasks

PatTree:一种用于医学分类任务的多模态图基患者表示自动构建新方法

Julia Gehrmann, Lars Quakulinski, Hamza Naseem, Oya Beyan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究提出PatTree,一种自动构建的多模态图基患者表示,在ADNI-1队列子集上实现阿尔茨海默病等三分类任务98.5%平衡准确率,可作为临床AI流程的可扩展基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01620 2026-08-04 eess.SP 新提交 78%

Smartwatch Photoplethysmography-Derived Heart Age via ECG-Guided Cross-Modal Pretraining as a Digital Biomarker of Vascular Aging

通过心电引导跨模态预训练从智能手表光体积描记术衍生的心龄作为血管衰老的数字生物标志物

Donglin Xie, Xueying Gui, Yutian Zhu, Feng Xu, Guangkun Nie, Chenyang Xu, Jun Li, Shuailong Tang, Xiaoyu Li, Qi Xie, Yelei Li, Shenda Hong

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本研究开发心电引导跨模态框架,利用智能手表PPG衍生的心龄差作为数字生物标志物,证实其与动脉僵硬度、高血压显著相关,可用于血管衰老评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01020 2026-08-04 cs.CR 新提交 78%

Inverting the Hidden: Unveiling Multimodal Privacy Leakage in Collaborative LVLM Inference

反转隐藏内容:揭示协作式大型视觉语言模型(LVLM)推理中的多模态隐私泄露

Shuaifan Jin, Zhibo Wang, Qiyuan Wang, Yiting Han, Yajie Zhou, Yuanfan Zhang, Jiahui Hu, Xiaoyi Pang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 该研究针对协作式LVLM推理的隐私风险,提出RASR多模态重建攻击,可从深层LVLM隐藏状态恢复隐私信息,图像重建MSE降约50%、文本恢复token准确率达99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00621 2026-08-04 cs.LG 新提交 78%

RHEA: Reliability-Harmonized Reconstruction and Assignment for Robust Multimodal-Attributed Graph Clustering

RHEA:用于鲁棒多模态属性图聚类的可靠性协调重构与分配

Yinlin Zhu, Di Wu, Ziyu Han, Zekai Chenm, Wang Luo, Miao Hu, Guocong Quan

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态属性图聚类中属性含噪或缺失时性能下降的问题,提出RHEA框架,通过估计节点特定模态可靠性并结合邻域信息提升聚类效果,在基准测试中表现优于最强基线。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29000 2026-08-03 cs.IR cs.LG 新提交 78%

PaletteID: Prototype-Composed Semantic Identifiers for Multimodal CTR Prediction

PaletteID:用于多模态点击率预测的原型组合语义标识符

Huanyu Liu, Baining Chen, Hui Liu, Zengyang Li, Ziyi Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏