arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-14 至 2026-04-14 共收录 165 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 11 篇

2604.11585 2026-04-14 cs.CV cs.RO 70%

GeomPrompt: Geometric Prompt Learning for RGB-D Semantic Segmentation Under Missing and Degraded Depth

GeomPrompt:用于在缺失和退化深度下的RGB-D语义分割的几何提示学习

Krishna Jaganathan, Patricio Vela

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 GeomPrompt通过从RGB生成任务驱动的几何提示,提升RGB-D语义分割在缺失和退化深度下的性能,同时比单目深度估计器更高效。

Comments Accepted to the CVPR 2026 URVIS Workshop. Project page: https://geomprompt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 62%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 多模态Agent :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 57%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12639 2026-04-14 cs.CV 57%

RoboStereo: Dual-Tower 4D Embodied World Models for Unified Policy Optimization

RoboStereo: 双塔4D具身世界模型用于统一策略优化

Ruicheng Zhang, Guangyu Chen, Zunnan Xu, Zihao Liu, Zhizhou Zhong, Mingyang Zhang, Jun Zhou, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot HKUST(香港科技大学)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.CV

AI总结 本文提出RoboStereo,通过双塔4D具身世界模型实现统一策略优化,解决几何幻觉和缺乏统一优化框架的问题,实验显示在细粒度操作任务中平均相对提升超过97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02387 2026-04-14 cs.AI 57%

VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments

VS-Bench:评估多智能体环境中视觉语言模型的战略能力

Zelai Xu, Zhexuan Xu, Xiangmin Yi, Huining Yuan, Mo Guang, Kaiwen Long, Xinlei Chen, Yi Wu, Chao Yu, Yu Wang

机构 * EE, Tsinghua University(清华大学电子工程系) SIGS, Tsinghua University(清华大学深圳国际研究生院) Li Auto Inc.(理想汽车) IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 VS-Bench是首个评估多智能体环境中视觉语言模型战略能力的多模态基准,涵盖合作、竞争和混合动机交互,通过感知、推理和决策三个维度评估15种领先模型,揭示当前模型在推理和决策上的显著差距。

Comments Published at CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10332 2026-04-14 cs.AI 57%

From GPT-3 to GPT-5: Mapping their capabilities, scope, limitations, and consequences

从GPT-3到GPT-5:映射其能力、范围、限制及后果

Hina Afridi, Habib Ullah, Sultan Daud Khan, Mohib Ullah

机构 * University of Bergen(卑尔根大学) Norwegian University of Life Sciences(挪威生命科学大学) Sohar University(苏哈尔大学) Norwegian University of Science and Technology(挪威科技大学) Kristiania University of Applied Sciences(克里斯蒂安尼亚应用科学大学)

专题命中 多模态Agent :multimodal(abstract);分类 cs.AI

AI总结 本文比较分析GPT系列从GPT-3到GPT-5的发展,探讨技术演进、能力变化、部署转变、持续限制及下游影响,强调后续版本不仅是更大更准的模型,而是更复杂的系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11715 2026-04-14 eess.SY cs.SY math.OC 50%

Koopman Representations for Non-Vanishing Time Intervals: An Optimization Approach and Sampling Effects

Koopman表示用于非消失时间间隔:一种优化方法和采样效应

Younghwan Cho, Richard Sowers

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出通过优化方法学习Koopman特征函数,分析了采样模式对aliasing的影响,并展示了不规则采样在恢复真实Koopman谱中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 27 篇

2503.11892 2026-04-14 cs.CV 88%

DecAlign: Hierarchical Cross-Modal Alignment for Decoupled Multimodal Representation Learning

DecAlign:解耦多模态表示学习的分层跨模态对齐

Chengxuan Qian, Shuo Xing, Shawn Li, Yue Zhao, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(title,abstract);分类 cs.CV

AI总结 DecAlign通过分层跨模态对齐框架解耦多模态表示,结合原型引导最优传输策略和多模态Transformer提升语义一致性,实验显示在四个基准上优于现有方法。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07516 2026-04-14 cs.CL cs.AI cs.LG 86%

Controlling Multimodal Conversational Agents with Coverage-Enhanced Latent Actions

通过增强覆盖的潜在动作控制多模态对话代理

Yongqi Li, Hao Lang, Tieyun Qian, Yongbin Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tongyi Lab(通义实验室) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过增强覆盖的潜在动作空间改进多模态对话代理的强化学习微调,利用跨模态投影器提升鲁棒性,在两个对话任务中优于基线方法。

Comments Accepted to ACL 2026 (Main), camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12067 2026-04-14 cs.LG cs.AI cs.CL cs.CV 85%

MM-LIMA: Less Is More for Alignment in Multi-Modal Datasets

MM-LIMA:多模态数据集对齐中的‘少即是多’

Lai Wei, Xiaozhe Li, Zihao Jiang, Weiran Huang, Lichao Sun

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Shanghai Innovation Institute(上海创新研究院) Lehigh University(里海大学) Tongji University(同济大学)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MM-LIMA,仅用200个示例(约6%的指令数据)训练,通过数据选择器过滤低质量数据,使模型在多项评估中超越MiniGPT-4,证明高质量少量指令数据的有效性。

Comments Published at Artificial Intelligence for Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09585 2026-04-14 cs.HC cs.AI cs.CV 84%

Evaluating Visual Prompts with Eye-Tracking Data for MLLM-Based Human Activity Recognition

基于眼动数据的视觉提示在基于多模态LLM的人类活动识别中的评估

Jae Young Choi, Seon Gyeom Kim, Hyungjun Yoon, Taeckyung Lee, Donggun Lee, Jaeryung Chung, Jihyung Kil, Ryan Rossi, Sung-Ju Lee, Tak Yeon Lee

机构 * KAIST(韩国科学技术院) Adobe Research(Adobe研究院)

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文通过眼动数据可视化方法提升多模态LLM处理高频传感器数据的效率,验证了视觉提示在人类活动识别中的有效性与扩展性。

Comments 6 pages. Conditionally accepted to IEEE PacificVis 2026 (VisNotes track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02123 2026-04-14 cs.AI cs.CV 84%

Nano-EmoX: Unifying Multimodal Emotional Intelligence from Perception to Empathy

Nano-EmoX:从感知到共情的多模态情感智能统一框架

Jiahao Huang, Fengyan Lin, Xuechao Yang, Chen Feng, Kexin Zhu, Xu Yang, Zhide Chen

机构 * Fujian Normal University(福建师范大学) RMIT University(皇家墨尔本理工大学) Minjiang University(闽江学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);omni-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Nano-EmoX,通过认知启发的三级架构整合感知、理解与交互层面的情感任务,首次实现六项核心情感任务的统一建模,展现高效且强大的泛化能力。

Comments This paper has been accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10404 2026-04-14 cs.ET cs.LG 82%

Sense Less, Infer More: Agentic Multimodal Transformers for Edge Medical Intelligence

感知更少,推断更多:面向边缘医疗智能的代理多模态变压器

Chengwei Zhou, Zhaoyan Jia, Haotian Yu, Xuming Chen, Brandon Lee, Christopher Pulliam, Steve Majerus, Massoud Pedram, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) University of Southern California(南加州大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出AMI框架,通过代理多模态变压器在边缘设备上实现高效医疗监测,在减少传感器使用的同时提升诊断准确性。

Comments 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11299 2026-04-14 cs.CL cs.AI 81%

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

通过字形驱动微调增强多模态大语言模型用于古汉字演变分析

Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) School of Archaeology, Jilin University, China(吉林大学考古学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出GEVO框架,通过字形驱动微调提升多模态大语言模型在古汉字演变分析中的能力,实验显示模型在多个任务上均取得显著提升。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11136 2026-04-14 cs.CV cs.AI 81%

BoxTuning: Directly Injecting the Object Box for Multimodal Model Fine-Tuning

BoxTuning:直接注入物体框进行多模态模型微调

Zekun Qian, Ruize Han, Wei Feng

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) Faculty of Computer Science and Artificial Intelligence, Shenzhen University of Advanced Technology(深圳理工大学计算机科学与人工智能学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 BoxTuning通过将物体空间时间信息直接注入视觉模态,解决多模态大语言模型在视频问答中物体细粒度定位的不足,显著降低token成本并保持时间分辨率,实验表明其在空间导向任务中优于文本坐标方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00013 2026-04-14 cs.CL cs.AI 81%

C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis

C2F-Thinker:基于提示引导强化学习的粗到细推理用于多模态情感分析

Miaosen Luo, Zhenhao Yang, Jieshen Long, Jinghu Sun, Yichu Liu, Sijie Mai

机构 * School of Computer Science, South China Normal University(华南师范大学计算机科学学院) School of Electronic and Information Engineering, South China University of Technology(华南理工大学电子与信息工程学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2F-Thinker框架,通过粗到细结构推理与提示引导强化学习,提升多模态情感分析的可解释性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14543 2026-04-14 cs.CV 79%

Exploring Cross-Modal Flows for Few-Shot Learning

探索跨模态流用于少样本学习

Ziqi Jiang, Yanghao Wang, Long Chen

机构 * Department of CSE, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 本文提出跨模态流匹配对齐(FMA)方法,通过多步调整提升跨模态对齐精度与鲁棒性,在多种基准和模型上均取得显著性能提升。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09743 2026-04-14 eess.IV cs.CV 79%

Search-MIND: Training-Free Multi-Modal Medical Image Registration

Search-MIND: 无需训练的多模态医学图像配准

Boya Wang, Ruizhe Li, Chao Chen, Xin Chen

机构 * Lab for Uncertainty in Data and Decision Making (LUCID), Nottingham Biomedical Research Centre (BRC), School of Medicine, University of Nottingham, UK(英国诺丁汉大学医学院诺丁汉生物医学研究中心(BRC)数据与决策不确定性实验室(LUCID))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文提出Search-MIND,一种无需训练的迭代优化框架,通过粗到细策略和两种新损失函数提升多模态医学图像配准的稳定性与精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10086 2026-04-14 astro-ph.IM 78%

A Multi-modal Fusion Network for Star-Galaxy Classification from CSST Simulated Datasets

基于CSST模拟数据的多模态融合网络用于星系分类

Zhuoming Han, Tianmeng Zhang, Chao Liu, Chenxiaoji Ling

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 本文提出基于ResNet-50和BiLSTM的多模态融合网络,利用CSST模拟数据提升星系和恒星分类性能,达到99.81%的召回率。

Comments 27 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09905 2026-04-14 cs.LG 78%

Improving Pediatric Emergency Department Triage with Modality Dropout in Late Fusion Multimodal EHR Models

通过晚期融合多模态EHR模型中的模态脱落改进儿科急诊分诊

Tyler Yang, Romal Mitr

机构 * Stanford University(斯坦福大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出一种晚期融合多模态架构,结合XGBoost和Bio_ClinicalBERT处理结构化数据和非结构化文本,通过逻辑回归元分类器预测急诊严重程度指数,通过模态脱落提升模型在儿科群体中的泛化能力。

Comments 10 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10347 2026-04-14 cs.CV 74%

Multi-modal, multi-scale representation learning for satellite imagery analysis just needs a good ALiBi

多模态、多尺度表示学习用于卫星影像分析只需一个良好的ALiBi

Patrick Kage, Pavlos Andreadis

专题命中 多模态训练与对齐 :multi-modal(title);分类 cs.CV

AI总结 本文提出Scale-ALiBi机制,通过空间编码偏置提升多尺度多模态卫星影像表示学习效果,并在GEO-Bench基准上取得改进。

Comments Originally appeared at the 4th Space Imaging Workshop at the Georgia Institute of Technology, October 7-9, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09533 2026-04-14 cs.CV cs.AI 73%

COXNet: Cross-Layer Fusion with Adaptive Alignment and Scale Integration for RGBT Tiny Object Detection

COXNet:跨层融合与自适应对齐与尺度整合用于RGBT微小目标检测

Peiran Peng, Tingfa Xu, Liqiang Song, Mengqi Zhu, Yuqiang Fang, Jianan Li

机构 * Beijing Institute of Technology(北京理工大学) National Astronomical Observatories, Chinese Academy of Sciences(中国科学院国家天文台) National Key Laboratory of Space Target Awareness, Space Engineering University(航天工程大学空间目标感知全国重点实验室) Key Laboratory of Photoelectronic Imaging Technology and System, Ministry of Education of China(教育部光电成像技术与系统重点实验室) Chongqing Innovation Center, Beijing Institute of Technology(北京理工大学重庆创新中心) China North Vehicle Research Institute(中国北方车辆研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出COXNet框架,通过跨层融合模块、动态对齐与尺度精修模块及优化标签分配策略,提升RGBT多模态微小目标检测的鲁棒性,在RGBTDronePerson数据集上实现3.32%的mAP50提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10591 2026-04-14 cs.CV cs.AI 73%

GeoMeld: Toward Semantically Grounded Foundation Models for Remote Sensing

GeoMeld:迈向遥感领域语义引导的基模模型

Maram Hasan, Md Aminur Hossain, Savitra Roy, Souparna Bhowmik, Ayush V. Patel, Mainak Singha, Subhasis Chaudhuri, Muhammad Haris Khan, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) Space Applications Centre, ISRO(印度空间研究组织空间应用中心) University of Trento(特伦托大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出GeoMeld数据集,通过语义引导的监督方法,结合多模态对齐,提升遥感领域基模模型的性能和鲁棒性。

Comments Accepted at CVPR Workshop 2026; 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16333 2026-04-14 cs.CV cs.LG 70%

RL makes MLLMs see better than SFT

强化学习使多模态大语言模型比监督微调看得更清楚

Junha Song, Sangdoo Yun, Dongyoon Han, Jaegul Choo, Byeongho Heo

机构 * NAVER AI Lab(NAVER AI实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文研究了强化学习在多模态大语言模型中的视觉编码器影响,发现RL能产生更精确的视觉表示,提出PIVOT方法提升视觉编码性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00748 2026-04-14 cs.CV 70%

Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning

通过强化学习提升多图像接地在MLLMs中的推理能力

Bob Zhang, Haoran Li, Tao Zhang, Jianan Li, Cilin Yan, Xikai Liu, Jiayin Cai, Yanbin Hao

机构 * Xiaohongshu Inc.(小红书公司) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Technical University of Munich(慕尼黑工业大学) Hefei University of Technology(合肥工业大学)

专题命中 多模态训练与对齐 :multimodal(abstract);multi-modal(abstract);分类 cs.CV

AI总结 本文通过强化学习策略提升多图像接地任务中MLLMs的推理能力,采用合成CoT数据、LoRA微调和规则引导的RL方法,实验表明在MIG-Bench和多个领域外基准上效果显著。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09886 2026-04-14 cs.CV cs.AI cs.LG cs.MM eess.IV 67%

Not Your Stereo-Typical Estimator: Combining Vision and Language for Volume Perception

非典型立体视觉估计器:结合视觉与语言进行体积感知

Gautham Vinod, Bruce Coburn, Siddeshwar Raghavan, Fengqing Zhu

机构 * Purdue University(普渡大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出融合立体视觉隐式3D线索与自然语言显式先验知识的方法,通过多模态表示提升体积估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11122 2026-04-14 cs.CV cs.AI 62%

Semantic-Geometric Dual Compression: Training-Free Visual Token Reduction for Ultra-High-Resolution Remote Sensing Understanding

语义-几何双压缩:无训练视觉令牌减少用于超高清遥感理解

Yueying Li, Fengxiang Wang, Yan Li, Mingshuo Chen, Mengying Zhao, Long Lan

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DualComp框架,通过任务自适应双流令牌压缩方法,有效解决超高清遥感图像处理中视觉令牌过多导致的计算开销问题,提升处理效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13621 2026-04-14 cs.CL cs.CV cs.LG 62%

LaMI: Augmenting Large Language Models via Late Multi-Image Fusion

LaMI:通过晚期多图像融合增强大型语言模型

Guy Yariv, Idan Schwartz, Yossi Adi, Sagie Benaim

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) Bar-Ilan University(巴伊兰大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 LaMI通过在测试时融合多个图像提升视觉常识推理能力,同时保持文本推理性能,适用于视觉和NLP任务。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11234 2026-04-14 cs.CV 57%

Bridging the RGB-IR Gap: Consensus and Discrepancy Modeling for Text-Guided Multispectral Detection

弥合RGB-红外差距:面向文本引导多光谱检测的共识与差异建模

Jiaqi Wu, Zhen Wang, Enhao Huang, Kangqing Shen, Yulin Wang, Yang Yue, Yifan Pu, Gao Huang

机构 * Department of Automation, Tsinghua University(清华大学自动化系) State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Tsinghua University(清华大学)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种语义桥融合框架,通过双支持建模解决文本引导多光谱检测中的共识与差异问题,提升跨模态交互的鲁棒性。

Comments 17 pages ,Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05782 2026-04-14 cs.CV 57%

TCSA-UDA: Text-Driven Cross-Semantic Alignment for Unsupervised Domain Adaptation in Medical Image Segmentation

TCSA-UDA:基于文本的跨语义对齐用于医学图像分割中的无监督域适应

Lalit Maurya, Honghai Liu, Reyer Zwiggelaar

机构 * School of Computing, University of Portsmouth(朴茨茅斯大学计算学院) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TCSA-UDA框架,通过文本驱动的跨语义对齐方法,在医学图像分割中减少域偏移并提升跨模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏