arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-09 至 2026-07-09 共收录 74 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 9 篇

2607.07673 2026-07-09 cs.CV cs.LG 新提交 85%

MedPMC: A Systematic Framework for Scaling High-Fidelity Medical Multimodal Data for Foundation Models

MedPMC:一种用于为基础模型扩展高保真医学多模态数据的系统框架

Hyunjae Kim, Dain Kim, Pan Xiao, Serina S. Applebaum, Younjoon Chung, Xuguang Ai, Yu Yin, Roy Jiang, Yuexi Du, Yawen Wei, Yiming Kong, Tuo Guo, Zhiyuan Cao, Mengmeng Du, Yuelei Fu, Yan Hu, Rui Shi, Gui Yang, Kevin W. Jin, Yuntian Liu, Yuxuan Tian, Jonathan Marquez, Zhen Chen, Sheng Zhang, Hoifung Poon, Hua Xu, Jaewoo Kang, Qingyu Chen

机构 * Yale University(耶鲁大学) Korea University(韩国大学) Washington University in St. Louis(圣路易斯华盛顿大学) The University of Queensland(昆士兰大学) The University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 研究针对医学多模态基础模型受高质量临床数据限制问题,提出MedPMC框架,将文献转化为高保真基础设施。经实验,该框架整理大量图像-文本对,在多方面评估表现出色,训练模型在多基准测试和临床场景中效果显著,还公开相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01109 2026-07-09 cs.AI 版本更新 70%

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

贫困地图绘制的柏拉图式表示:统一的视觉语言代码还是智能体诱导的新颖性?

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud

机构 * AI and Global Development Lab(人工智能与全球发展实验室) Institute for Analytical Sociology(分析社会学研究所) Institute of Computer Science(计算机科学研究所) Department of Government(政府系)

专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.AI

AI总结 研究社会经济指标在卫星图像和网络文本中的信息印记,开发多模态框架经五条管道预测家庭财富,贡献包括融合视觉与文本提升预测、发现部分表示对齐证据、发布大规模多模态数据集。

Comments ICSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30170 2026-07-09 cs.MM cs.CV cs.LG 版本更新 62%

Unveiling the Visual Counting Bottleneck in Vision-Language Models

揭示视觉语言模型中的视觉计数瓶颈

Xingzhou Pang, Yifan Hou, Junling Wang, Mrinmaya Sachan

机构 * Department of Computer Science, ETH Zürich(苏黎世联邦理工学院计算机科学系)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 通过分解视觉计数为三个认知阶段,发现视觉语言模型在符号映射阶段失败,提出断裂数量假说:模型学习到分离的模态特定统计流形,无法实现跨模态对齐。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07608 2026-07-09 cs.RO cs.CV 新提交 57%

Dual Latent Memory in Vision-Language-Action Models for Robotic Manipulation

用于机器人操作的视觉-语言-动作模型中的双潜记忆

Hongyu Qu, Jianzhe Gao, Xiaobin Hu, Shaohuan Yang, Xinlei Yu, Rui Yan, Wenguan Wang, Xiangbo Shu, Shuicheng Yan

机构 * Nanjing University of Science and Technology(南京理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对主流VLA模型处理长期任务的不足,提出LaMem-VLA框架,通过四个协调组件将历史经验重构为潜记忆令牌并与VLA推理直接交织,实现在同一潜空间处理历史经验,经实验验证该框架具有优越性。

Comments Project page: https://github.com/quhongyu/LaMem-VLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07521 2026-07-09 cs.HC cs.AI 新提交 57%

Creativity from Friction: Human-AI Interaction for Exploratory Structural Design

摩擦产生创造力:用于探索性结构设计的人机交互

Ricardo Maia Avelino, Rita Sevastjanova, Tom Van Mele, Philippe Block, Mennatallah El-Assady

机构 * Block Research Group, Department of Architecture, ETH Zurich(建筑系,苏黎世联邦理工学院) IVIA Lab, Department of Computer Science, ETH Zurich(计算机科学系,苏黎世联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 探讨当前生成式AI目标与结构设计师等创作者需求的偏差,提出允许受限人机共同创作的系统设计维度,通过试点设计界面和专家研究,展示其对设计空间探索的支持及设计师看法。

Comments Accepted at ICML 2026, Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06839 2026-07-09 cs.LG cs.CV 新提交 57%

LEMUR 2: Unlocking Neural Network Diversity for AI

LEMUR 2:释放人工智能的神经网络多样性

Tolgay Atinc Uzun, Waleed Khalid, Saif U Din, Sai Revanth Mulukuledu, Akashdeep Singh, Chandini Vysyaraju, Raghuvir Duvvuri, Avi Goyal, Yashkumar Rajeshbhai Lukhi, Muhammad A. Hussain, Krunal Jesani, Usha Shrestha, Yash Mittal, Roman Kochnev, Pritam Kadam, Mohsin Ikram, Harsh R. Moradiya, Alice Arslanian, Dmitry Ignatov, Radu Timofte

机构 * University of Würzburg(维尔茨堡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 LEMUR 2旨在释放神经网络多样性,通过统一生成、评估和部署管道,利用多种方式生成超14000个不同架构及大量训练记录,采用特定管道进行自动部署和延迟基准测试,涵盖多模态任务,为LLM微调提供数据基础,推动相关新兴范式发展。

Comments 10 pages, 9 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06726 2026-07-09 cs.CV 新提交 57%

A Good Initialization is All You Need for Faithful Visual Attribution

忠实视觉归因只需一个良好的初始化

Zihan Gu, Jiayu Wang, Hua Zhang, Yue Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 图文多模态 :MLLM(abstract);分类 cs.CV

AI总结 研究忠实视觉归因中掩码优先问题,介绍CoPAIR和TRACE两种仅向前方法,用于构建紧凑的top-k证据掩码。在多个模型和任务上实验,初始化搜索方法达新前沿,TRACE+贪心在多模态语言模型归因中表现优,直接的TRACE掩码有高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04547 2026-07-09 cs.LG cs.CV 版本更新 57%

Activation Quantization of Vision Encoders Needs Prefixing Registers

视觉编码器的激活量化需要前缀寄存器

Seunghyeon Kim, Taesun Yeom, Jinho Kim, Wonpyo Park, Kyuyeun Kim, Jaeho Lee

机构 * POSTECH Dankook University(Dankook 大学) Google(谷歌)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出RegCache算法,通过引入前缀标记减少视觉编码器中的异常值,提升低比特量化模型性能,尤其在极低比特情况下效果显著。

Comments Accepted to ECCV 2026. Code: https://github.com/spbob0418/RegCache

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06987 2026-07-09 cs.LG 新提交 50%

UP: Unbounded Positive Asymmetric Optimization for Breaking the Exploration-Stability Dilemma

UP:用于打破探索-稳定性困境的无界正不对称优化

Chongyu Fan, Pengfei Liu, Jingjia Huang, Sijia Liu, Yi Lin

机构 * ByteDance Seed(字节跳动种子) Michigan State University(密歇根州立大学)

专题命中 图文多模态 :multimodal(abstract)

AI总结 研究针对强化学习探索-稳定性困境,提出无界正不对称优化(UP)方法,通过特殊设计重组优化过程,在多种算法、模型架构及训练模式下增强探索能力,实现卓越推理精度,是通用即插即用的强化学习训练增强方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2607.07294 2026-07-09 cs.RO cs.AI cs.CL 新提交 84%

Multimodal Voice Activity Projection for Turn-Taking in Social Robots with Voice-Activity-Related Pretrained Encoders

用于社交机器人对话轮次转换的多模态语音活动投影及与语音活动相关的预训练编码器

Antonio Cano, Guillermo Pérez, Luis Merino, Randy Gomez

机构 * i Intelligent Insights(4i智能洞察公司) Universidad de Sevilla(塞维利亚大学) Universidad Pablo de Olavide(巴勃罗·德奥拉维德大学) Honda Research Institute Japan(本田日本研究所)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(abstract);分类 cs.CL、cs.AI

AI总结 研究社交机器人对话轮次转换,提出多模态语音活动投影框架,基于预训练视听主干并经低秩适应,结合说话人间注意力及语义一致性损失,实验表明该方法优于基线,适用于调解型人机交互。

Comments Accepted for presentation at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026). Acceptance notification date: 30 May 2026. Final published version pending

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06611 2026-07-09 cs.CL cs.AI cs.LG cs.SD 新提交 84%

Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts

通过生成的多语言转录本的蒸馏和跨模态集成进行音频情感分析

Andrei-George Durdun, Victor Constantinescu, Radu Tudor Ionescu

机构 * University of Bucharest(布加勒斯特大学) PPC Romania(罗马尼亚PPC)

专题命中 音频语音多模态 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 研究语音情感分析难题,提出通过跨模态变压器集成音频与文本信息的多模态方案,经自动语音识别生成转录本并翻译为多语言文本,还进行知识蒸馏,实验证明该方法能提升多模态情感分类性能及增强单模态音频模型。

Comments Accepted at KES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06892 2026-07-09 eess.AS 新提交 79%

UBG-Net: An Uncertainty-aware Bayesian Gating Network for Robust Audio-Visual Speech Recognition

UBG-Net:用于鲁棒视听语音识别的不确定性感知贝叶斯门控网络

Jinjie Fu, Hang Chen, Wu Guo, Zhijun Zhang, Kuiliang Li, Peng Gao

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 eess.AS

AI总结 针对视听语音识别系统在现实场景中的性能问题,提出UBG-Net框架,通过MUBF机制建模认知不确定性,用DUHV进行推理,实验表明其优于SOTA基线,消融研究证实相关机制增强了鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18360 2026-07-09 cs.SD cs.CL 版本更新 79%

Omni-Embed-Audio: Leveraging Multimodal LLMs for Robust Audio-Text Retrieval

Omni-Embed-Audio: 利用多模态大语言模型实现鲁棒的音频-文本检索

HaeJun Yoo, Yongseop Shin, Insung Lee, Myoung-Wan Koo, Du-Seong Chang

机构 * Sogang University(首尔大学)

专题命中 音频语音多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 提出Omni-Embed-Audio(OEA)检索编码器,利用多模态大语言模型原生理解音频,并通过用户意图查询(UIQ)和硬负样本挖掘,在文本到音频检索中达到与M2D-CLAP相当的性能,同时在文本到文本检索和硬负样本判别上显著优于现有方法。

Comments Accepted at ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15685 2026-07-09 cs.MM cs.AI cs.CV cs.SD 版本更新 75%

DASH: Dynamic Audio-Driven Semantic Chunking for Efficient Omnimodal Token Compression

DASH:动态音频驱动的语义分块以实现高效的多模态令牌压缩

Bingzhou Li, Tao Huang

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 DASH通过动态音频驱动的语义分块方法,有效压缩多模态令牌,提升推理效率,优于传统固定窗口分块和注意力剪枝方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04443 2026-07-09 cs.CV cs.AI cs.GR cs.LG 新提交 62%

Wan-Streamer v0.2: Higher Resolution, Same Latency

万流播器v0.2:更高分辨率,相同延迟

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zoubin Bi

机构 * Alibaba Group(阿里巴巴集团)

专题命中 音频语音多模态 :audio-visual(abstract);分类 cs.CV、cs.AI

AI总结 介绍万流播器v0.2,它保持v0.1建模公式,将交互输出流分辨率提高,在保持低延迟下支持场景中景智能体。核心方法是优化架构,主要贡献是提升分辨率同时保持低延迟,集中硬件于视觉生成。

Comments Website: https://wan-streamer.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07430 2026-07-09 cs.RO cs.SY eess.SY 新提交 50%

Immersive Social Interaction with VR and LLM-Assisted Humanoids

通过虚拟现实和大语言模型辅助的人形机器人实现沉浸式社交互动

Niraj Pudasaini, Geeta Chandra Raju Bethala, Pranav Doma, Anthony Tzes, Yi Fang

机构 * Inspire Robotics(Inspire机器人公司)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 研究通过集成语音控制移动、VR操作和双向社交互动的框架实现人形机器人全身控制,利用苹果视觉专业版等,经大语言模型辅助语音控制等技术,在宇树H1人形机器人上评估,新手操作成功率可观,证明该方式在多方面应用的潜力。

Comments IEEE-RAS International Conference on Humanoid Robots - Workshop: Designing Interactive Humanoids

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2607.07091 2026-07-09 cs.CV cs.AI 新提交 81%

AT-Attn: Temporal-Aware Cross-Attention for Longitudinal Multimodal Alzheimer's Disease Diagnosis

AT-Attn:用于纵向多模态阿尔茨海默病诊断的时间感知交叉注意力机制

Xinyue Du, Yibo Liu, Zhenglei Zhou, Xuancheng Yao, Weimin Zhong, Qiuhui Chen

机构 * Xinyue Du1, Yibo Liu2, Zhenglei Zhou3, Xuancheng Yao2, Weimin Zhong1, Qiuhui Chen14(未知)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对纵向AD诊断中多模态信息整合难题,提出AT-Attn框架,结合多种技术整合MRI与临床信息,在患者级五折交叉验证中,该模型多项指标优于单模态和简单融合基线,为AD诊断提供临床相关补充信息。

Comments Submitted to IEEE BIBM 2026. 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26772 2026-07-09 cs.CV cs.AI cs.CY 版本更新 81%

From Content to Audience: A Multimodal Annotation Framework for Broadcast Television Analytics

从内容到受众:一种多模态注释框架用于广播电视分析

Paolo Cupini, Francesco Pierri

机构 * Dipartimento di Elettronica, Informazione e Bioingegneria, Politecnico di Milano, Italy(意大利米兰理工大学电子、信息与生物工程系)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种多模态注释框架,用于广播电视内容分析,通过构建特定领域的基准测试,评估不同管道架构在广播新闻中的表现,展示了框架在受众分析中的应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09385 2026-07-09 cs.CV 版本更新 79%

EventVGGT: Exploring Cross-Modal Distillation for Consistent Event-based Depth Estimation

EventVGGT:探索跨模态蒸馏以实现一致的基于事件的深度估计

Yinrui Ren, Jinjing Zhu, Kanghao Chen, Zhuoxiao Li, Jing Ou, Zidong Cao, Tongyan Hua, Peilun Shi, Yingchun Fu, Wufan Zhao, Hui Xiong

机构 * HKUST(GZ)(香港科技大学(珠海)) CUHK(香港中文大学) SCNU(华南师范大学)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 EventVGGT通过跨模态蒸馏实现一致的基于事件的深度估计,有效提升深度预测精度和泛化能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06996 2026-07-09 cs.HC 新提交 71%

Multimodal Smart Glove for Sign Language Recognition Using Deep Learning

基于深度学习的用于手语识别的多模态智能手套

Anh Thu Nguyen Ngoc, Tam Phong Truong, Thai Anh Nguyen Duong, Vu Linh Nguyen, Manh Duong Phung

专题命中 视频多模态 :multimodal(title)

AI总结 研究旨在解决手语识别系统实际部署难题,提出集成可穿戴传感与深度学习的智能手套系统,利用柔性传感器、IMU及摄像头采集数据,经LSTM网络处理,准确率约95%,模型转换后可实时推理,证明系统用于手语翻译的可行性。

Comments In Proceedings of IFToMM International Symposium on Robotics and Mechatronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03834 2026-07-09 cs.RO 版本更新 67%

Let the Dynamics Flow: Stable Flow Matching Dynamical Systems

让动力学流动:稳定的流匹配动力系统

Rodrigo Pérez-Dattari, Francisco Leiva, Andrea Testa, Leonel Rozo, Javier Ruiz del Solar, Noémie Jaquier

机构 * Department of Robotics, Perception, and Learning, KTH Royal Institute of Technology(机器人、感知与学习系,皇家理工学院) Advanced Mining Technology Center (AMTC) and Department of Electrical Engineering, Universidad de Chile(先进采矿技术中心(AMTC)和电气工程系,智利大学) Bosch Center for Artificial Intelligence, Renningen, Germany(博世人工智能中心,德国Renningen) Italian Institute of Artificial Intelligence (AI4I), Turin, Italy(意大利人工智能研究所(AI4I),意大利都灵)

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract)

AI总结 提出稳定流匹配动力系统(SFMDS)框架,通过流匹配参数化动力系统并施加李雅普诺夫稳定性约束,实现稳定、可扩展、多模态的机器人运动生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07292 2026-07-09 cs.CV cs.AI 新提交 62%

CarbonCLIP: Enhance Carbon Prediction from Satellite Imagery via Integrated Street-View Semantics and Temporal Context Training

CarbonCLIP:通过集成街景语义和时间上下文训练增强卫星图像的碳排放预测

Zeru Yang, Fang-Ying Gong, Steve H. L. Yim, Chau Yuen

机构 * Energy Research Institute at NTU(国立理工学院能源研究所) Interdisciplinary Graduate Programme(跨学科研究生项目) School of Electrical and Electronic Engineering(电气电子工程学院) School of Public Administration and Policy(公共管理与政策学院) Asian School of the Environment(亚洲环境学院) Center for Climate Change and Environmental Health(气候变化与环境健康中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对城市碳排放预测难题,CarbonCLIP提出多模态蒸馏框架,通过双分支对比学习,利用街景语义和时间上下文训练增强卫星图像碳排放预测,实验证明该方法优于基线,为卫星碳建模提供有力支持。

Comments Accepted by IEEE Journal of Selected Topics in Applied Earth Observations and Remote Sensing. 21 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07518 2026-07-09 cs.CV 新提交 57%

Learning to Unify Deformable Shape and Texture Representations for Cardiac Video Classification

学习统一可变形形状和纹理表示用于心脏视频分类

Tonmoy Hossain, Miaomiao Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 针对心脏视频分类,现有方法简单拼接形状与纹理特征未充分利用互补性。本文提出新模型,在综合空间学习时间特征,设计双向交叉注意力融合特征,能动态调整贡献,在CMR视频数据集上达最优性能,提高了可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07001 2026-07-09 cs.CV 新提交 57%

Ego-Human Motion Prediction with 3D-Aware LLM

基于3D感知语言模型的自我-人类运动预测

Yujin Bae, Jaewoo Jeong, Hyeonseong Kim, Kuk-Jin Yoon

机构 * Visual Intelligence Lab., KAIST(视觉智能实验室,韩国科学技术院)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究从自我中心视角预测人类运动问题,提出Ego3DLM模型,基于准确运动预测需3D环境理解及姿势语言整体预测原则,通过三阶段训练,在相关任务中取得领先性能,实现跨模态和时间一致的运动预测。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06875 2026-07-09 cs.CV cs.LG 新提交 57%

Video2Reaction: Mapping Video to Audience Reaction Distribution in the Wild

Video2Reaction:将视频映射到自然环境中的观众反应分布

Trang Nguyen, Sidong Zhang, Shiv Shankar, Gauri Jagatap, Deepak Chandran, Andrea Fanelli, Madalina Fiterau

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Dolby Laboratories(杜比实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究旨在通过Video2Reaction数据集实现视频到观众反应分布预测,开发仅用开源语言模型的两阶段多智能体管道,建立基准,发现预训练模型零样本失败,微调可提升性能,但任务仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2512.02076 2026-07-09 cs.LG cs.AI 版本更新 83%

FDRMFL: Multimodal Federated Feature Extraction Model Based on Information Maximization and Contrastive Learning

FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型

Haozhe Wu

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。

Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874

Journal ref Applied Soft Computing 202 (2026) 115874

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07383 2026-07-09 cs.CV 新提交 57%

MMAgent-R$^2$: Learning to Rerank and Reject for Agentic mRAG

MMAgent-R$^2$:用于智能mRAG的重排与拒绝学习

Tao Zhang, Ziqi Zhang, Zongyang Ma, Yuxin Yang, Bing Li, Chunfeng Yuan, Kang Rong, Fengyun Rao, Jing Lyu, Weiming Hu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(北京多模态信息超智能安全重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) PeopleAI Inc.(人智公司) School of Information Science and Technology, ShanghaiTech University(上海科技大学信息科学与技术学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对KB-VQA中现有mRAG方法在处理视觉相似实体时的不足,提出MMAgent-R$^2$框架,集成视觉重排和主动拒绝机制,设计复合奖励函数,经GRPO训练实现联合优化,实验证明其在多任务中性能达最优。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08630 2026-07-09 cs.HC 版本更新 50%

Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval

Sycamore:用于评估基因组可视化检索的合成身份表征

Huyen N. Nguyen, Astrid van den Brandt, Nils Gehlenborg

专题命中 跨模态检索 :multimodal(abstract)

AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 9 篇

2506.22469 2026-07-09 eess.SP 版本更新 82%

Multi-Modal Beamforming with Model Compression and Modality Generation for V2X Networks

用于车联网的基于模型压缩和模态生成的多模态波束成形

Chen Shang, Dinh Thai Hoang, Jiadong Yu

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract)

AI总结 针对6G车联网中ISAC范式的不足,提出基于分层Transformer的多模态学习框架BeamTransFuser,利用跨模态相关性提升波束预测性能,开发剪枝方案减少延迟,引入生成模型处理模态缺失,实验证明该方案优于现有基线。

Comments 15 pages, 5 figures

Journal ref IEEE Transactions on Mobile Computing, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07027 2026-07-09 cs.LG cs.AI cs.CV 新提交 81%

Latent graph encoding of multimodal neuroimaging features with generative AI architectures

基于生成式人工智能架构的多模态神经影像特征的潜在图编码

Ishaan Batta, Meenu Ajith, Vince Calhoun

机构 * Center for Translational Research in Neuroimaging and Data Science (TReNDS)(转化神经影像与数据科学研究中心)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 研究旨在设计多模态生成框架用于神经影像特征分析,通过评估多种策略和模型,利用GMV和sFNC特征分析多个生成框架,提出的gMMVAE在多指标上超替代变体,有潜力用于稳健的多模态神经影像分析。

Comments 6 pages, accepted in IEEE International Conference on Image Processing (ICIP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏