arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-16 至 2026-04-16 共收录 80 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 7 篇

2604.13054 2026-04-16 cs.CL cs.AI cs.CV 85%

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

先caption,后VQA:知识密度而非任务格式驱动多模态扩展

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen

机构 * vivo AI Lab(vivo人工智能实验室) Wuhan University(武汉大学)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究发现,多模态模型扩展的关键瓶颈在于训练数据的知识密度而非任务格式,通过结构化caption增强和跨模态知识注入可提升模型性能,表明当前多模态模型因训练数据知识覆盖不足而难以扩展。

Comments 23 pages, 4 figures, 10 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08261 2026-04-16 cs.CV cs.AI 84%

DBMF: A Dual-Branch Multimodal Framework for Out-of-Distribution Detection

DBMF:一种用于分布外检测的双分支多模态框架

Jiangbei Yue, Darren Treanor, Venkataraman Subramanian, Sharib Ali

机构 * University of Leeds(利兹大学)

专题命中 图文多模态 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DBMF框架,通过双分支利用多模态信息提升分布外检测性能,实验表明其在不同模型架构下鲁棒性强,性能提升达24.84%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13321 2026-04-16 cs.CV 81%

Why MLLMs Struggle to Determine Object Orientations

为何大规模多模态语言模型难以确定物体方向

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper

机构 * Department of Computer Science(计算机科学系)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract);分类 cs.CV

AI总结 本文研究大规模多模态语言模型在处理图像中2D物体方向推理任务时的困难,通过实验发现方向信息可从编码器表示中恢复,挑战了视觉编码器限制的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13561 2026-04-16 cs.CV cs.AI 76%

CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling

CLIP架构用于腹部CT图像-文本对齐和零样本学习:研究批量组成和数据缩放

Shivika, Kartik Bose, Pankaj Gupta

机构 * Department of Radiodiagnosis(放射诊断部门)

专题命中 图文多模态 :image-text(title);分类 cs.CV、cs.AI

AI总结 本文研究了CLIP架构在腹部CT图像-文本对齐和零样本学习中的效果,探讨了训练批量组成和数据缩放的影响,发现随机采样和交替批次比人工类平衡更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09687 2026-04-16 cs.CV cs.AI 62%

Grid2Matrix: Revealing Digital Agnosia in Vision-Language Models

Grid2Matrix: 揭示视觉语言模型中的数字失读

Yunkai Zhang, Linda Li, Yingxin Cui, Xiyuan Ruan, Zeyu Zheng, Kezhen Chen, Yi Zhang, Diji Yang

机构 * BAIR, UC Berkeley(伯克利大学BAIR实验室) UC Santa Cruz(圣克拉拉大学) Analogy AI

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 Grid2Matrix通过控制视觉复杂度测试视觉语言模型在捕捉细节方面的不足,发现模型在小网格上表现不佳,揭示了视觉编码与语言表达间的差距,即'数字失读'。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13788 2026-04-16 cs.RO cs.CV 57%

Failure Identification in Imitation Learning Via Statistical and Semantic Filtering

通过统计和语义过滤进行模仿学习中的故障识别

Quentin Rolland, Fabrice Mayran de Chamisso, Jean-Baptiste Mouret

机构 * Université Paris-Saclay, CEA, List(巴黎-萨克雷大学,CEA,List) Inria, CNRS, Université de Lorraine, LORIA(Inria,CNRS,洛林大学,LORIA) Bleu Robotics(Bleu机器人)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出FIDeL模块,结合统计和语义过滤技术,提升机器人模仿学习中的故障检测性能,通过多模态数据集BotFails验证其有效性。

Comments 8 pages, Appendix coming soon, accepted at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11671 2026-04-16 eess.SP cs.RO 50%

VLMaterial: Vision-Language Model-Based Camera-Radar Fusion for Physics-Grounded Material Identification

VLMaterial: 基于视觉-语言模型的相机-雷达融合用于物理基础的材料识别

Jiangyou Zhu, He Chen

机构 * Department of Inforation Engineering(信息工程系)

专题命中 图文多模态 :cross-modal(abstract)

AI总结 本文提出VLMaterial框架,通过融合视觉语言模型与雷达知识实现物理基础的材料识别,采用双管道架构和上下文增强生成策略,提升跨模态融合性能,实验表明其在120余次真实实验中达到96.08%的识别准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 8 篇

2604.13593 2026-04-16 cs.MM 89%

AVID: A Benchmark for Omni-Modal Audio-Visual Inconsistency Understanding via Agent-Driven Construction

AVID:一种通过代理驱动构建的多模态音频视觉不一致理解基准

Zixuan Chen, Depeng Wang, Hao Lin, Li Luo, Ke Xu, Ya Guo, Huijia Zhu, Tanfeng Sun, Xinghao Jiang

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 AVID是首个大规模多模态音频视觉不一致理解视频基准,通过可扩展的构建流程和8种细粒度不一致类别,评估检测、时间定位、分类和推理能力,验证了其在可信多模态AI系统中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14129 2026-04-16 cs.CV 85%

Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models

别让视频说话:面向音频-视觉语言模型的音频对比偏好优化

Ami Baid, Zihui Xue, Kristen Grauman

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出ACPO方法,通过引入输出对比和输入对比目标,解决音频-视觉语言模型中视频驱动的音频幻觉问题,提升音频真实性和多模态能力。

Comments Project page: https://vision.cs.utexas.edu/projects/acpo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13380 2026-04-16 cs.HC 78%

Does the TalkMoves Codebook Generalize to One-on-One Tutoring and Multimodal Interaction?

对话移动代码本是否能推广到一对一辅导和多模态交互?

Corina Luca Focsan, Marie Cynthia Abijuru Kamikazi, Tamisha Thompson, Jennifer St. John, Kirk Vanacore, Danielle R. Thomas, Kenneth R. Koedinger, René F. Kizilcec

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 研究探讨TalkMoves代码本在一对一辅导中的一致性、实用性及可解释性,对比AI-人类混合代码本,发现前者在可靠性上更优,但后者在多模态覆盖和可用性上更胜一筹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10522 2026-04-16 cs.MM cs.CV cs.LG cs.SD eess.AS 75%

AudioX: A Unified Framework for Anything-to-Audio Generation

AudioX:一种用于任意到音频生成的统一框架

Zeyue Tian, Zhaoyang Liu, Yizhu Jin, Ruibin Yuan, Liumeng Xue, Xu Tan, Qifeng Chen, Wei Xue, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Independent Researcher(独立研究者)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 本文提出AudioX框架,整合多种模态条件,通过多模态自适应融合模块提升生成质量,并构建大规模高质量数据集IF-caps,验证了其在文本到音频和文本到音乐生成中的优越性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10101 2026-04-16 cs.SD cs.AI cs.GR cs.MM eess.AS 75%

LAV: Audio-Driven Dynamic Visual Generation with Neural Compression and StyleGAN2

LAV:基于神经压缩和StyleGAN2的音频驱动动态视觉生成

Jongmin Jung, Dasaem Jeong

机构 * Dept. of Artificial Intelligence(人工智能系) Dept. of Art & Technology(艺术与技术系)

专题命中 音频语音多模态 :audio-visual(abstract,abstract_cn);分类 cs.AI、cs.MM、eess.AS

AI总结 LAV结合EnCodec神经音频压缩与StyleGAN2生成能力,通过随机初始化线性映射将音频嵌入转换为StyleGAN2的风格潜在空间,实现语义丰富的音频-视觉转换。

Comments Paper accepted at ISEA 2025, The 30th International Symposium on Electronic/Emerging Art, Seoul, Republic of Korea, 23 - 29 May 2025

Journal ref Proceedings of the International Symposium on Electronic/Emerging Art: 2025, Seoul, Republic of Korea / no., 2025, pp.1129-1132

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21760 2026-04-16 cs.CL cs.AI 73%

fMRI-LM: Towards a Universal Foundation Model for Language-Aligned fMRI Understanding

fMRI-LM:迈向语言对齐的fMRI理解的通用基础模型

Yuxiang Wei, Yanteng Zhang, Xi Xiao, Chengxuan Qian, Tianyang Wang, Vince D. Calhoun

机构 * TReNDS Center (Georgia Institute of Technology, Georgia State University, Emory)(TReNDS中心(佐治亚理工学院、佐治亚州立大学、埃默里大学)) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Jiangsu University(江苏大学)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出fMRI-LM,通过三阶段框架将fMRI与语言结合,实现跨模态脑表示,通过神经分词、预训练LLM适应及多任务微调,提升fMRI的语义理解能力。

Comments Code are available: https://github.com/yuxiangwei0808/fMRI-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20981 2026-04-16 cs.CV cs.AI 62%

Echoes Over Time: Unlocking Length Generalization in Video-to-Audio Generation Models

时间回声:解锁视频到音频生成模型中的长度泛化

Christian Simon, Masato Ishii, Wei-Yao Wang, Koichi Saito, Akio Hayakawa, Dongseok Shim, Zhi Zhong, Shuyang Cui, Shusuke Takahashi, Takashi Shibuya, Yuki Mitsufuji

机构 * Sony Group Corporation(索尼集团公司) Sony AI(索尼人工智能)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMHNet模型,通过层级结构和非因果Mamba实现长音频生成,提升生成长度至5分钟以上,证明短训练长测试的可行性,优于现有视频到音频生成方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13804 2026-04-16 cs.LG 50%

Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning

角色超越言语:通过强化学习利用角色扮演评估音频大语言模型

Dongjie Fu, Fangming Feng, Xize Cheng, Linjun Li, Zhou Zhao, Tao Jin

机构 * Zhejiang University(浙江大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出RoleJudge框架,通过多模态评估系统评估语音与角色的一致性,引入RoleChat数据集并采用多阶段训练和标准对齐强化学习,验证了多维评估框架的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2604.11244 2026-04-16 cs.CV 83%

Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding

Script-a-Video: 通过因子化流和关系 grounding 实现深度结构化音频视觉描述

Tencent Hunyuan Team

机构 * Tencent Hunyuan Team(腾讯文言团队)

专题命中 视频多模态 :audio-visual(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出MTSS框架,通过因子化流和关系 grounding 解决视频描述中信息耦合问题,提升视频理解与生成性能,实验显示在多个基准测试中均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07823 2026-04-16 cs.CV cs.AI cs.MM 75%

LPM 1.0: Video-based Character Performance Model

LPM 1.0:基于视频的角色表现模型

Ailing Zeng, Casper Yang, Chauncey Ge, Eddie Zhang, Garvey Xu, Gavin Lin, Gilbert Gu, Jeremy Pi, Leo Li, Mingyi Shi, Shawn Wang, Sheng Bi, Steven Tang, Thorn Hang, Tobey Guo, Vincent Li, Xin Tong, Yikang Li, Yuchen Sun, Yue Zhao, Yuhan Lu, Yuwei Li, Zane Zhang, Zeshi Yang, Zi Ye

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出LPM 1.0模型,通过构建多模态数据集和训练扩散变换器,实现高可控性和身份一致性的角色表现生成,支持实时交互和无限长度生成。

Comments 43 pages, 15 figures, 2 tables. Project page: https://large-performance-model.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20913 2026-04-16 cs.CV 70%

LongVideo-R1: Smart Navigation for Low-cost Long Video Understanding

LongVideo-R1: 低成本长视频理解的智能导航

Jihao Qiu, Lingxi Xie, Xinyue Huo, Qi Tian, Qixiang Ye

机构 * University of Chinese Academy of Sciences(中国科学院大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出LongVideo-R1,一种基于多模态大语言模型的智能导航系统,通过高效视频上下文导航减少冗余搜索,提升长视频理解的效率与准确性。

Comments 17 pages, 9 figures, 8 tables, accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24869 2026-04-16 cs.CV 57%

SiLVR: A Simple Language-based Video Reasoning Framework

SiLVR:一种简单的基于语言的视频推理框架

Ce Zhang, Yan-Bo Lin, Ziyang Wang, Mohit Bansal, Gedas Bertasius

机构 * Department of Computer Science(计算机科学系) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 SiLVR通过将复杂视频理解分解为两个阶段,利用多感官输入生成语言表示,并通过强大推理LLM解决复杂视频-语言任务,实现了在多个视频评估任务上的最佳表现。

Comments Accepted by TMLR (01/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13241 2026-04-16 cs.CE 50%

Early-Warning Learner Satisfaction Forecasting in MOOCs via Temporal Event Transformers and LLM Text Embeddings

通过时间事件Transformer和LLM文本嵌入在MOOCs中进行学习者满意度预警预测

Anna Kowalczyk, Jakub Kowalski

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出TET-LLM框架,结合时间事件Transformer、LLM嵌入和短文本主题分布,通过早期信号预测学习者满意度,实验表明其在7天预警范围内RMSE为0.82,AUC为0.77。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2604.14044 2026-04-16 cs.CV 85%

Decoding the Delta: Unifying Remote Sensing Change Detection and Understanding with Multimodal Large Language Models

解读Delta:利用多模态大语言模型统一遥感变化检测与理解

Xiaohe Li, Jiahao Li, Kaixin Zhang, Yuqiang Fang, Leilei Lin, Hong Wang, Haohua Wu, Zide Fan

机构 * Aerospace Information Research Institute, CAS(航天信息研究所,中国科学院) Space Engineering University(航天工程大学) Capital Normal University(首都师范大学)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出Delta-LLaVA框架,通过多时间尺度对比推理和空间定位,解决遥感变化理解中的时间盲问题,实现像素级分割与视觉问答的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13268 2026-04-16 cs.CV cs.CL cs.IR 84%

Indexing Multimodal Language Models for Large-scale Image Retrieval

多模态大语言模型的索引用于大规模图像检索

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) VRG, FEE, Czech Technical University in Prague(布拉格捷克技术大学VRG学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 本文探讨了多模态大语言模型作为无训练相似性估计器在实例级图像到图像检索中的应用,通过提示配对图像并转换下一个词的概率为相似性分数,实现了零样本重排序,展示了其在大规模检索中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14147 2026-04-16 cs.CV 70%

ROSE: Retrieval-Oriented Segmentation Enhancement

ROSE:基于检索的分割增强

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 跨模态检索 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出ROSE框架,通过引入网络检索模块和提示增强模块,提升多模态大语言模型在新兴实体和新实体分割任务中的性能,实验表明其在NEST基准上表现优异。

Comments CVPR 2026 Findings, Project Page: https://henghuiding.com/ROSE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02697 2026-04-16 cs.CV 57%

GeoBridge: A Semantic-Anchored Multi-View Foundation Model Bridging Images and Text for Geo-Localization

GeoBridge:一种语义锚定的多视图基础模型,用于图像与文本之间的地理定位

Zixuan Song, Jing Zhang, Di Wang, Zidie Zhou, Wenbin Liu, Haonan Guo, En Wang, Bo Du

机构 * School of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) School of Computer Science, Wuhan University(武汉大学计算机学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 GeoBridge通过语义锚定机制实现多视图特征桥接,提升地理定位的鲁棒性和灵活性。该模型构建了首个大规模跨模态多视图对齐数据集GeoLoc,验证了预训练对地理定位精度和跨领域泛化能力的提升。

Comments The paper is accepted by CVPR 2026! Code, dataset, and pretrained models will be released at https://github.com/MiliLab/GeoBridge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13101 2026-04-16 cs.SE cs.AI 57%

Building Trust in the Skies: A Knowledge-Grounded LLM-based Framework for Aviation Safety

在天空中建立信任:一种基于知识的LLM框架用于航空安全

Anirudh Iyengar, Alisa Tiselska, Dumindu Samaraweera, Hong Liu

机构 * Senior Member, IEEE(IEEE高级会员) IEEE

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合LLM和知识图谱的框架,提升航空安全分析的可信度,通过双阶段流程构建和验证安全知识,提高准确性和可追溯性。

Comments Initial version of a conference publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12371 2026-04-16 cs.CV 57%

Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models

在像素之间阅读:将文本-图像嵌入对齐与字体攻击成功性联系起来

Ravikumar Balakrishnan, Sanket Mendapara, Ankit Garg

机构 * Cisco Systems(思科系统)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 研究了视觉-语言模型中字体提示注入攻击的影响,发现字体大小、文本攻击有效性及嵌入距离对攻击成功率有显著影响,为防御策略提供实证指导。

Comments Accepted at ICLR 2026 Workshop on Agents in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15170 2026-04-16 cs.CV 57%

Multi-Dimensional Knowledge Profiling with Large-Scale Literature Database and Hierarchical Retrieval

多维知识谱系:基于大规模文献数据库与分层检索

Zhucun Xue, Jiangning Zhang, Juntao Jiang, Jinzhuo Liu, Haoyang He, Teng Hu, Xiaobin Hu, Yong Liu, Shuicheng Yan

机构 * Zhejiang University(浙江大学) APRIL Lab(APRIL实验室) Shanghai Jiao Tong University(上海交通大学) National University of Singapore(新加坡国立大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文通过整合22个顶级会议2020-2025年的10万+论文,构建多维知识谱系分析框架,结合主题聚类、LLM解析与结构检索,揭示研究主题生命周期、方法迁移、数据集与模型使用模式及机构研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16662 2026-04-16 cs.HC cs.AI cs.IR cs.LG 57%

Safire: Similarity Framework for Visualization Retrieval

Safire:可视化检索的相似性框架

Huyen N. Nguyen, Nils Gehlenborg

机构 * Harvard Medical School(哈佛医学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出Safire框架,通过比较标准和表示模态两个维度,系统化分析可视化相似性,揭示不同应用场景中相似性标准与表示模态的关联,并探讨其对多模态学习、AI应用和可视化可重复性的影响。

Comments To appear in IEEE VIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13867 2026-04-16 gr-qc astro-ph.CO hep-ph hep-th 50%

Robust parameter inference for Taiji via time-frequency contrastive learning and normalizing flows

为Taiji探测器开发鲁棒参数推断方法:通过时频对比学习和归一化流

Tian-Yang Sun, Bo Liang, Ji-Yu Song, Song-Tao Liu, Shang-Jie Jin, He Wang, Ming-Hui Du, Jing-Fei Zhang, Xin Zhang

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出一种结合时频多模态融合编码器和对比学习的鲁棒参数推断框架,用于Taiji探测器中的大质量黑洞双星参数推断,通过生成高保真合成瞬态数据提升训练效率,验证了深度学习在空间引力波观测中的有效性。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13313 2026-04-16 cs.LG 50%

Concrete Jungle: Towards Concreteness Paved Contrastive Negative Mining for Compositional Understanding

具体丛林:迈向由具体性铺就的对比负样本挖掘以实现组合理解

Eun Woo Im, Dhruv Madhwal, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学)

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出ConcretePlant,通过增强具体性术语的修改来提升对比学习信号,解决负样本生成中的梯度失衡问题,提出Cement损失函数以动态校准惩罚,实现更有效的组合理解。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏