arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-15 至 2026-05-15 共收录 88 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 8 篇

2605.14291 2026-05-15 cs.CR cs.AI cs.CL cs.CV cs.LG 85%

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

看清并非学习:保护多模态数据免受大视觉语言模型的未经授权微调

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu

机构 * School of Computing Augmented Intelligence, Arizona State University, Tempe, AZ, USA Department of Computer Science Engineering, Texas A\&M University, College Station, TX, USA

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MMGuard,通过注入不可察觉扰动主动利用LVLM学习动态,生成不可学习示例,从而保护多模态数据免受未经授权的微调。通过最小化训练损失,扰动创建优化捷径,导致模型在推理时因噪声过拟合而性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14906 2026-05-15 cs.CV 83%

MemLens: Benchmarking Multimodal Long-Term Memory in Large Vision-Language Models

MemLens:大型视觉-语言模型多模态长期记忆的基准测试

Xiyu Ren, Zhaowei Wang, Yiming Du, Zhongwei Xie, Chi Liu, Xinlin Yang, Haoyue Feng, Wenjun Pan, Tianshi Zheng, Baixuan Xu, Zhengnan Li, Yangqiu Song, Ginny Wong, Simon See

机构 * CSE Deparment, HKUST(香港科技大学计算机科学与工程系) CUHK(香港大学) OmniMemory (Shenzhen) Intelligent Technology Co., Ltd.(深圳奥米克记忆科技有限公司) NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达AI技术中心(NVAITC),英伟达,美国圣克拉拉)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 MemLens基准测试评估大型视觉-语言模型在多模态多会话对话中的长期记忆能力,通过789个问题测试五种记忆能力,揭示长上下文模型和记忆增强代理的优缺点,推动混合架构发展。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03532 2026-05-15 cs.CV 77%

OpenTrack3D: Towards Accurate and Generalizable Open-Vocabulary 3D Instance Segmentation

OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进

Zhishan Zhou, Siyuan Wei, Zengran Wang, Chunjie Wang, Xiaosheng Yan, Xiao Liu

机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV

AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14966 2026-05-15 cs.CV cs.AI 73%

MHSA: A Lightweight Framework for Mitigating Hallucinations via Steered Attention in LVLMs

MHSA:一种轻量级框架,通过引导注意力缓解LVLMs中的幻觉

Wei Ding, Yilin Li, Yudong Zhang, Ruobing Xie, Xingwu Sun, Jiansheng Chen, Yu Wang

机构 * Tsinghua University(清华大学) Tsinghua University, Tencent(清华大学腾讯) Tencent(腾讯) University of Science and Technology Beijing(北京科技大学) University of Macau(澳门大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MHSA框架,通过学习修正跨模态注意力模式来缓解LVLMs中的幻觉,采用简单三层MLP生成器和DHCP判别器信号指导训练,无需修改模型参数即可在多种数据集和模型上有效减少判别和生成幻觉。

Comments 19 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14621 2026-05-15 cs.CV cs.AI cs.CL 67%

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

我们真的需要外部工具来缓解幻觉吗?SIRA:共享前缀内部重构归因

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen

机构 * Tsinghua University(清华大学) The University of Sydney(悉尼大学) Stanford University(斯坦福大学) Baichuan AI(百川AI)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 SIRA通过内部构建对比参考减少视觉语言模型的幻觉,无需外部工具或额外计算,保持描述覆盖并降低开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14893 2026-05-15 cs.CV cs.AI cs.LG 62%

Your CLIP has 164 dimensions of noise: Exploring the embeddings covariance eigenspectrum of contrastively pretrained vision-language transformers

你的CLIP有164个噪声维度:探索对比性预训练视觉-语言变换器的嵌入协方差特征谱

Jakub Grzywaczewski, Dawid Płudowski, Przemysław Biecek

机构 * Warsaw University of Technology(华沙技术大学) Centre for Credible Artificial Intelligence(可信人工智能中心) University of Warsaw(华沙大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过协方差矩阵谱分解,揭示对比预训练VLMs的潜在空间中多模态噪声结构,发现去除共享噪声维度对下游任务性能无害,提供对现代VLMs表征结构的新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06202 2026-05-15 cs.CV cs.AI 62%

LoRA in LoRA: Towards Parameter-Efficient Architecture Expansion for Continual Visual Instruction Tuning

LoRA in LoRA: 朝着参数高效架构扩展的方向:持续视觉指令微调

Chang Che, Ziqi Wang, Pengwan Yang, Qi Wang, Hui Ma, Zenglin Shi

机构 * Hefei University of Technology(合肥工业大学) University of Amsterdam(阿姆斯特丹大学) Tsinghua University(清华大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出LiLoRA,一种高效的持续视觉指令微调架构扩展方法,通过共享LoRA矩阵A、低秩分解矩阵B以及余弦正则化损失,提升参数效率和任务学习性能。

Comments AAAI 2026 Oral Presentation. 9 pages

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(24):19978--19986, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04657 2026-05-15 cs.CV 57%

TRIO: Token Reduction via Inference-Objective Guidance for Efficient Vision-Language Models

TRIO: 通过推理目标引导的令牌缩减以提高视觉-语言模型的效率

Haokui Zhang, Congyang Ou, Dawei Yan, Peng Wang, Qingsen Yan, Yu Zhang, Ying Li, Rong Xiao

机构 * School of Cyberspace Security, Northwestern Polytechnical University(网络安全学院,西北工业大学) School of Computer Science, Northwestern Polytechnical University(计算机学院,西北工业大学) Intellifusion(智融科技)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 TRIO从推理目标角度出发,通过梯度显著性指导视觉令牌压缩,保留输出不变性,提升视觉-语言模型的推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 5 篇

2512.12772 2026-05-15 cs.MM cs.CV 84%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 音频语音多模态 :audio-visual(title,abstract);multi-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01015 2026-05-15 cs.CV 83%

AuralSAM2: Enabling SAM2 Hear Through Pyramid Audio-Visual Feature Prompting

AuralSAM2:通过金字塔音频视觉特征提示实现SAM2的听觉能力

Yuyuan Liu, Yuanhong Chen, Chong Wang, Junlin Han, Junde Wu, Can Peng, Jingkun Chen, Yu Tian, Gustavo Carneiro

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学人工智能研究所) Stanford University(斯坦福大学) University of Central Florida(佛罗里达中央大学) University of Surrey(萨里大学)

专题命中 音频语音多模态 :audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 AuralSAM2通过金字塔音频视觉特征提示整合音频,保持SAM2的可提示分割能力,引入AuralFuser融合音频和视觉特征,并通过音频引导对比损失对齐模态,提升分割精度。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11042 2026-05-15 cs.CV cs.AI cs.LG cs.MM cs.SD 67%

V2M-Zero: Zero-Pair Time-Aligned Video-to-Music Generation

V2M-Zero:零配对时间对齐视频到音乐生成

Yan-Bo Lin, Jonah Casebeer, Long Mai, Aniruddha Mahapatra, Gedas Bertasius, Nicholas J. Bryan

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Adobe Research(Adobe研究院)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 V2M-ZERO通过解耦的时间同步和语义控制生成与视频事件时间对齐的音乐,无需训练数据,实现更高质量的音频生成和语义对齐。

Comments Project page: https://genjib.github.io/v2m_zero/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21740 2026-05-15 cs.CL cs.AI 62%

A cross-species neural foundation model for end-to-end speech decoding

跨物种神经基础模型用于端到端语音解码

Yizi Zhang, Linyang He, Chaofei Fan, Tingkai Liu, Han Yu, Trung Le, Jingyuan Li, Scott Linderman, Lea Duncker, Francis R Willett, Nima Mesgarani, Liam Paninski

机构 * Columbia University(哥伦比亚大学) Stanford University(斯坦福大学) Microsoft(微软公司) University of Washington(华盛顿大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出端到端BraIn-to-Text框架,通过单个可微神经网络将神经活动转化为连贯句子,利用跨任务、跨物种预训练神经编码器提升语音解码性能,降低词错误率至10.22%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14731 2026-05-15 cs.GR cs.CV cs.SD 57%

UMo: Unified Sparse Motion Modeling for Real-Time Co-Speech Avatars

UMo:统一稀疏运动建模用于实时协同语音化身

Xiaoyu Zhan, Xinyu Fu, Chenghao Yang, Xiaohong Zhang, Dongjie Fu, Pengcheng Fang, Tengjiao Sun, Xiaohao Cai, Hansung Kim, Yuanqi Li, Jie Guo, Yanwen Guo

机构 * Nanjing University(南京大学) Mogo AI Ltd.(Mogo AI有限公司) University of Southampton(南安普顿大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV

AI总结 UMo通过统一稀疏运动建模架构,结合文本、音频和运动令牌,实现高效实时密集重建,提升面部表情和手势的高保真动画生成,同时在低延迟条件下保持精细的语音-运动对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2511.13026 2026-05-15 cs.CV 83%

REVISOR: Beyond Textual Reflection, Towards Multimodal Introspective Reasoning in Long-Form Video Understanding

REVISOR:超越文本反思,迈向长视频理解的多模态反思推理

Jiaze Li, Hao Yin, Wenhui Tan, Jingyang Chen, Boshen Xu, Yuxun Qu, Yijing Chen, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * MiLM Plus, Xiaomi Inc.(小米公司MiLM Plus实验室) Renmin University of China(中国人民大学)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 REVISOR通过多模态反思框架提升长视频理解能力,解决纯文本反思在动态视觉输入和跨模态交互上的不足,采用Dual Attribution Decoupled Reward机制增强因果对齐,无需额外监督微调即在多个基准测试中取得优异成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15071 2026-05-15 cs.CV cs.AI cs.CL 67%

On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

关于视觉语言模型中文化错位与时间推理的问题

Mukul Ranjan, Prince Jha, Khushboo Kumari, Zhiqiang Shen

机构 * MBZUAI Inception

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文探讨了视觉语言模型在解读历史文物时存在的文化错位问题,通过设计TAB-VLM基准测试集评估模型的时间推理能力,发现现有模型在处理非西方文化文物时存在显著缺陷。

Comments Project Page: https://khushboo0012.github.io/tab-vlm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12622 2026-05-15 cs.RO cs.CV 57%

Action Emergence from Streaming Intent

从流式意图中涌现动作

Pengfei Jing, Victor Shea-Jay Huang, Hengtong Lu, Jifeng Dai, Yan Xie, Benjin Zhu

机构 * Li Auto Tsinghua University(清华大学) CUHK

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出流式意图方法,通过连续思维链生成语义合适且安全的动作,实现自动驾驶中长尾交通场景的自主决策。

Comments Project page: https://mind-omni.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14607 2026-05-15 cs.CV cs.CY 57%

ViMU: Benchmarking Video Metaphorical Understanding

ViMU:视频隐喻理解基准测试

Qi Li, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 ViMU旨在评估视频理解模型对隐含意义的识别能力,通过多模态证据推理,解决现有模型对隐喻、讽刺和社会意义理解不足的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 57%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19973 2026-05-15 cs.NI cs.AI 57%

A Tutorial on Cognitive Biases in Agentic AI-Driven 6G Autonomous Networks

面向6G自主网络的智能偏差教程

Hatim Chergui, Farhad Rezazadeh, Merouane Debbah, Christos Verikoukis

机构 * i2CAT Foundation(i2CAT基金会) Hostelworld Group(Hostelworld集团) Technical University of Catalonia (UPC)(技术大学(加泰罗尼亚)) Khalifa University of Science and Technology(卡里玛大学) ISI/ATH University of Patras(帕特拉大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文探讨了在6G自主网络中因人类设计引入的认知偏差问题,通过两个案例展示如何利用智能体AI缓解锚定偏差和时间偏差,提升网络管理和边缘计算的效率与节能效果。

Comments 26 pages, 18 figures, 4 tables, link to source code available. Accepted at IEEE OJCOMS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13857 2026-05-15 cs.GR cs.CV cs.LG 57%

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo:释放视频扩散在动物毛发和肌肉模拟中的潜力

Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

机构 * tabular c 1 Tsinghua University 2 University of Glasgow 3 The Chinese University of Hong Kong 4 HUIJING Digital Media \& Entertainment Group 2mm Project Page: tabular

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MoZoo通过引入Role-Aware RoPE和Asymmetric Decoupled Attention,实现高保真动物视频生成,同时构建了MoZoo-Data和MoZooBench进行评估,提升了毛发和肌肉动态模拟的效率与质量。

Comments Github Page:https://dongxialiu15.github.io/MoZoo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10892 2026-05-15 cs.RO cs.MA 50%

HECTOR: Human-centric Hierarchical Coordination and Supervision of Robotic Fleets under Continual Temporal Tasks

HECTOR:面向人本的机器人舰队层级协调与监督方案

Shen Wang, Yinhang Luo, Jie Li, Meng Guo

机构 * School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) National University of Defense Technology(国防科技大学)

专题命中 视频多模态 :multimodal(abstract)

AI总结 HECTOR提出一种面向人本的机器人舰队协调与监督方案,通过三级层级结构实现动态任务分配与协调,提升计算效率并减少人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14070 2026-05-15 cs.NI 50%

WirelessSenseLLM: Zero-Shot Human Activity Understanding by Bridging Wireless Signals and Human Language

WirelessSenseLLM: 通过连接无线信号与人类语言实现零样本人体活动理解

Mahmuda Keya, Sneh Pillai, Jiawei Yuan, Kai Zeng, Long Jiao

专题命中 视频多模态 :cross-modal(abstract)

AI总结 WirelessSenseLLM通过引入CSI到语言适配器和跨模态投影机制,利用大语言模型实现从未分割的Wi-Fi CSI信号中零样本人体活动理解,提升了动作识别和语言推理性能。

Comments Accepted at IEEE SECON 2026. 9 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 9 篇

2605.13854 2026-05-15 cs.CV cs.GR cs.MM eess.IV 84%

Contrastive Multi-Modal Hypergraph Reasoning for 3D Crowd Mesh Recovery

对比多模态超图推理用于3D人群网格重建

Minghao Sun, Chongyang Xu, Yitao Xie, Buzhen Huang, Kun Li

机构 * Tianjin University(天津大学) Nanyang Technological University(南洋理工大学) Sichuan University(四川大学)

专题命中 跨模态检索 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出对比多模态超图推理方法,结合语义、几何和姿态线索,解决人群重建中的遮挡和深度模糊问题,通过超图建模高阶人群动态,提升特征融合与跨模态正交性。

Comments ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15019 2026-05-15 cs.CL 83%

From Scenes to Elements: Multi-Granularity Evidence Retrieval for Verifiable Multimodal RAG

从场景到元素:面向可验证多模态RAG的多粒度证据检索

Guanhua Chen, Chuyue Huang, Yutong Yao, Shudong Liu, Xueqing Song, Lidia S. Chao, Derek F. Wong

机构 * NLP 2 CT Lab, Department of Computer and Information Science, University of Macau(NLP2CT实验室,计算机与信息科学系,澳门大学)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本文提出GranuRAG框架,通过多粒度跨模态对齐和元素级检索,解决多模态RAG中粗粒度证据与细粒度查询不匹配的问题,提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15168 2026-05-15 cs.CL cs.AI cs.LG stat.ML 81%

Text Knows What, Tables Know When: Clinical Timeline Reconstruction via Retrieval-Augmented Multimodal Alignment

文本知晓什么,表格知晓何时:通过检索增强的多模态对齐进行临床时间线重建

Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim, Jeremy C. Weiss

机构 * National Library of Medicine National Institutes of Health(国家医学图书馆国立卫生研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种检索增强的多模态对齐框架,通过结合文本和结构化EHR数据,提高临床时间线的精确度,提升时间一致性,同时保持事件匹配率。

Comments Sayantan Kumar, Shahriar Noroozizadeh, Juyong Kim (authors contributed equally)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14448 2026-05-15 cs.CV cs.CL cs.IR 81%

Think When Needed: Adaptive Reasoning-Driven Multimodal Embeddings with a Dual-LoRA Architecture

需要时思考:基于双LoRA架构的自适应推理驱动多模态嵌入

Longxiang Zhang, Weilong Dai, Guanghao Zhang, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本文提出TWN框架,通过双LoRA架构和自适应推理机制,提升多模态嵌入效率与质量,在78个任务中达到SOTA水平,参数更少,推理成本更低。

Comments 30 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14113 2026-05-15 cs.CR cs.IR 78%

Adversarial Hubness in Multi-Modal Retrieval

多模态检索中的对抗性Hub现象

Tingwei Zhang, Fnu Suya, Rishi Jha, Collin Zhang, Vitaly Shmatikov

专题命中 跨模态检索 :multi-modal(title,abstract)

AI总结 本文研究了攻击者如何利用Hub现象在多模态检索系统中生成对抗性Hub,通过实验展示对抗性Hub在大量查询中的高召回率,并发现传统缓解自然Hub的方法对对抗性Hub无效。

Comments in IEEE S&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14156 2026-05-15 cs.LG 78%

Uncovering Trajectory and Topological Signatures in Multimodal Pediatric Sleep Embeddings

揭示多模态儿童睡眠嵌入中的轨迹和拓扑特征

Scott Ye, Harlin Lee

机构 * Department of Radiology(放射科) University of California San Francisco(加州大学旧金山分校) UNC–Chapel Hill(北卡罗来纳大学教堂山分校) UNC School of Data Science and Society(北卡罗来纳大学教堂山分校数据科学与社会学院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 本文研究多模态掩码自编码器生成的儿童睡眠嵌入中包含的会话级诊断信息,通过结合PHATE坐标、持久同调和EHR数据,发现几何、拓扑和临床特征互补提升预测性能,尤其在极端不平衡情况下提升校准和鲁棒性。

Comments Accepted to ML4H 2025, 20 pages, 6 figures

Journal ref Proceedings of the Fifth Machine Learning for Health Symposium, PMLR 297:1392-1411, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14928 2026-05-15 cs.CL 77%

Chain-of-Procedure: Hierarchical Visual-Language Reasoning for Procedural QA

过程链:用于过程问答的层次视觉语言推理

Guanhua Chen, Yutong Yao, Shenghe Sun, Ci-Jun Gao, Shudong Liu, Lidia S. Chao, Feng Wan, Derek F. Wong

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Electrical and Computer Engineering, University of Macau(电气与计算机工程系,澳门大学) Centre for Cognitive and Brain Sciences, University of Macau(认知与脑科学中心,澳门大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL

AI总结 本文提出ProcedureVQA基准,针对视觉过程问答任务,通过过程链框架解决现有VLMs在跨模态检索和步骤分解上的不足,实验显示其在六个VLMs上提升达13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14812 2026-05-15 q-bio.QM 50%

MetaGEM: Bottom-Up Reconstruction of Genome-Scale Metabolic Networks via Deep Enzyme-Metabolite Anchoring

MetaGEM:通过深度酶-代谢物锚定进行底-up式基因组尺度代谢网络重建

Weiyu Xiao, Jiangbin Zheng, Stan Z. Li

专题命中 跨模态检索 :multimodal(abstract)

AI总结 MetaGEM通过酶作为物理锚点,将系统级网络推断转化为酶-代谢物相互作用预测,实现了基因组尺度代谢网络的高效重建,并在多个菌种中生成了功能代谢模型。

Comments 21 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏