arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-25 至 2026-02-25 共收录 51 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 5 篇

2602.20330 2026-02-25 cs.CV cs.AI cs.LG 84%

Circuit Tracing in Vision-Language Models: Understanding the Internal Mechanisms of Multimodal Thinking

视觉-语言模型中的电路追踪:理解多模态思维的内部机制

Jingcheng Yang, Tianhu Xiong, Shengyi Qian, Klara Nahrstedt, Mingyuan Wu

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 图文多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出首个透明电路追踪框架,用于分析视觉-语言模型的多模态推理机制,揭示不同视觉特征电路在数学推理和跨模态关联中的作用。

Comments To appear in the Findings of CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20767 2026-02-25 cs.MM 83%

SPP-SCL: Semi-Push-Pull Supervised Contrastive Learning for Image-Text Sentiment Analysis and Beyond

SPP-SCL:半推拉监督对比学习用于图像-文本情感分析及更广泛的领域

Jiesheng Wu, Shengrong Li

专题命中 图文多模态 :image-text(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 SPP-SCL通过半推拉监督对比学习平衡图像-文本情感关系,提升跨模态情感分析的性能。

Comments Accepted and published by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17028 2026-02-25 cs.LG cs.AI 70%

Distributional Vision-Language Alignment by Cauchy-Schwarz Divergence

通过Cauchy-Schwarz散度进行分布式视觉语言对齐

Wenzhe Yin, Zehao Xiao, Pan Zhou, Shujian Yu, Jiayi Shen, Jan-Jakob Sonke, Efstratios Gavves

机构 * University of Amsterdam(阿姆斯特丹大学) The Netherlands Cancer Institute(荷兰癌症研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) The Arctic University of Norway(挪威北极大学) Singapore Management University(新加坡管理大学)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出CS-Aligner框架,通过整合Cauchy-Schwarz散度与互信息,实现更紧密的视觉语言分布对齐,提升跨模态生成与检索性能。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20423 2026-02-25 cs.CV cs.CL 62%

MedCLIPSeg: Probabilistic Vision-Language Adaptation for Data-Efficient and Generalizable Medical Image Segmentation

MedCLIPSeg: 基于概率视觉语言适应的数据高效且可泛化的医学图像分割

Taha Koleilat, Hojat Asgariandehkordi, Omid Nejati Manzari, Berardino Barile, Yiming Xiao, Hassan Rivaz

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.CL

AI总结 MedCLIPSeg通过概率视觉语言适应方法,提升医学图像分割的数据效率和泛化能力,提供可解释的不确定性图。

Comments CVPR 2026; Project Page: https://tahakoleilat.github.io/MedCLIPSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20853 2026-02-25 cs.CV 57%

On the Explainability of Vision-Language Models in Art History

关于视觉-语言模型在艺术史中的可解释性

Stefanie Schneider

机构 * Marburg University(马尔堡大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文研究了XAI方法如何使CLIP在艺术史背景下可视化推理,通过零样本定位实验和人类可解释性研究,探讨了可解释性方法的有效性依赖于类别概念稳定性和表示可用性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2510.24332 2026-02-25 cs.SD cs.CV eess.AS eess.IV 73%

Sound Source Localization for Spatial Mapping of Surgical Actions in Dynamic Scenes

动态场景中手术动作空间映射的声源定位

Jonas Hein, Lazaros Vlachopoulos, Maurits Geert Laurent Olthof, Bastian Sigrist, Philipp Fürnstahl, Matthias Seibold

机构 * ROCS(罗克辛研究所) Balgrist University Hospital(巴尔格里斯大学医院) University of Zurich(苏黎世大学) Dept. of Orthopedics(骨科部门) Computer Vision and Geometry Group(计算机视觉与几何组) ETH Zurich(苏黎世联邦理工学院)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV、eess.AS

AI总结 本文提出一种动态手术场景中声源定位的方法,通过整合3D音频与视觉数据,提升手术场景的多模态理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20163 2026-02-25 cs.SD cs.CL eess.AS 62%

Graph Modelling Analysis of Speech-Gesture Interaction for Aphasia Severity Estimation

语音-手势交互的图模型分析用于失语症严重程度估计

Navya Martin Kollapally, Christa Akers, Renjith Nelson Joseph

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.CL、eess.AS

AI总结 本文提出基于图神经网络的框架,通过分析语音和手势的交互来自动估计失语症严重程度。

Comments IJCAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20708 2026-02-25 cs.AI cs.CR 57%

ICON: Indirect Prompt Injection Defense for Agents based on Inference-Time Correction

ICON:基于推理时校正的代理间接提示注入防御

Che Wang, Fuyao Zhang, Jiaming Zhang, Ziqi Zhang, Yinghui Wang, Longtao Huang, Jianbo Gao, Zhong Chen, Wei Yang Bryan Lim

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) Alibaba(阿里巴巴) School of Computer Science, Peking University, China(计算机科学学院,北京大学,中国)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 ICON通过潜在空间轨迹探测和修正器实现对代理间接提示注入攻击的防御,有效提升任务连续性和安全性,同时保持高检测率和任务效用。

Comments 11 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20219 2026-02-25 cs.RO cs.AI 57%

An Approach to Combining Video and Speech with Large Language Models in Human-Robot Interaction

一种结合视频和语音的大型语言模型在人机交互中的应用方法

Guanting Shen, Zi Tian

机构 * Dalian University of Technology(大连理工大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文提出结合视觉-语言模型、语音处理和模糊逻辑的多模态人机交互框架,通过语音指令实现机械臂的精准操控,实验显示命令执行准确率达75%,为未来人机协作提供灵活的基础。

Comments Preprint currently under revision

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2602.20739 2026-02-25 cs.AI cs.CV 62%

PyVision-RL: Forging Open Agentic Vision Models via RL

通过强化学习构建开放代理视觉模型:PyVision-RL

Shitian Zhao, Shaoheng Lin, Ming Li, Haoquan Zhang, Wenshuo Peng, Kaipeng Zhang, Chen Wei

机构 * Shanghai AI Lab(上海人工智能实验室) Rice University(里士满大学) Shanda AI Research, Tokyo(上海沙达人工智能研究东京)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 PyVision-RL通过强化学习框架解决多模态代理的交互崩溃问题,结合回放策略和累积奖励提升多轮推理能力,实现高效视频理解与处理。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21137 2026-02-25 cs.CV 57%

UDVideoQA: A Traffic Video Question Answering Dataset for Multi-Object Spatio-Temporal Reasoning in Urban Dynamics

UDVideoQA: 一个用于城市动态多对象时空推理的交通视频问答数据集

Joseph Raj Vishal, Nagasiri Poluri, Katha Naik, Rutuja Patil, Kashyap Hegde Kota, Krishna Vinod, Prithvi Jai Ramesh, Mohammad Farhadi, Yezhou Yang, Bharatesh Chakravarthi

机构 * Arizona State University(亚利桑那州立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 UDVideoQA是一个用于城市动态多对象时空推理的交通视频问答数据集,通过统一标注流程生成28K问题-答案对,评估视觉定位和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17372 2026-02-25 cs.CV 57%

Tree crop mapping of South America reveals links to deforestation and conservation

南美树作物制图揭示与森林砍伐和保护的联系

Yuchang Jiang, Anton Raichuk, Xiaoye Tong, Vivien Sainte Fare Garnot, Daniel Ortiz-Gonzalo, Dan Morris, Konrad Schindler, Jan Dirk Wegner, Maxim Neumann

机构 * Google DeepMind(谷歌DeepMind) EcoVision Lab, DM3L, University of Zurich(EcoVision实验室、DM3L、苏黎世大学) University of Zurich(苏黎世大学) University of Copenhagen(哥本哈根大学) Google Research(谷歌研究) ETH Zürich(苏黎世联邦理工学院)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本研究通过高分辨率树作物制图揭示南美树作物与森林砍伐的联系,为制定有效且公平的保护政策提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2602.20624 2026-02-25 cs.AI cond-mat.stat-mech 89%

Physics-based phenomenological characterization of cross-modal bias in multimodal models

基于物理现象的多模态模型跨模态偏差表征

Hyeongmo Kim, Sohyun Kang, Yerin Choi, Seungyeon Ji, Junhyuk Woo, Hyunsuk Chung, Soyeon Caren Han, Kyungreem Han

机构 * B rain Science Institute(脑科学研究院) Korea Institute of Science and Technology(韩国科学技术院) Department of Physics and Astronomy(物理与天文学系) Department of Computer Science and Engineering(计算机科学与工程系) University of Science and Technology KIST School(科学技术KIST学院)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 本文提出基于物理现象的多模态模型跨模态偏差表征方法,揭示多模态输入可能强化模态主导性。

Comments Best Paper Award at BiasinAI track in AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20877 2026-02-25 cs.IR cs.AI 79%

E-MMKGR: A Unified Multimodal Knowledge Graph Framework for E-commerce Applications

E-MMKGR:面向电子商务应用的统一多模态知识图谱框架

Jiwoo Kang, Yeon-Chang Lee

机构 * UNIST(全南国立科学技术院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 E-MMKGR提出了一种统一多模态知识图谱框架,通过GNN和图谱优化学习统一物品表示,提升电子商务推荐和搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20530 2026-02-25 cs.LG cs.SD eess.AS 70%

Memory-guided Prototypical Co-occurrence Learning for Mixed Emotion Recognition

基于记忆的原型共现学习用于混合情绪识别

Ming Li, Yong-Jin Liu, Fang Liu, Huankun Sheng, Yeying Fan, Yixiang Wei, Minnan Luo, Weizhan Zhang, Wenping Wang

机构 * MOE-Key Laboratory of Pervasive Computing, Department of Computer Science and Technology, Tsinghua University(MOE-Key pervasive computing laboratory,计算机科学与技术系,清华大学) Key State Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播关键实验室,中国传媒大学) Department of Computer Science and Computer Engineering, Texas A&M University(计算机科学与工程系,德克萨斯大学)

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 eess.AS

AI总结 本文提出基于记忆的原型共现学习框架,通过多模态信号融合和原型关系蒸馏,提升混合情绪识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20271 2026-02-25 cs.LG cs.AI math.OC stat.AP 57%

Uncertainty-Aware Delivery Delay Duration Prediction via Multi-Task Deep Learning

基于多任务深度学习的不确定性感知交付延迟持续时间预测

Stefan Faulkner, Reza Zandehshahvar, Vahid Eghbal Akhlaghi, Sebastien Ouellet, Carsten Jordan, Pascal Van Hentenryck

机构 * NSF Artificial Intelligence Institute for Advances in Optimization(美国国家科学基金会人工智能优化研究所) H. Milton Stewart School of Industrial and Systems Engineering(H.米尔顿·斯图尔特工业与系统工程学院) Georgia Institute of Technology(佐治亚理工学院) Kinaxis(Kinaxis公司)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出一种多任务深度学习模型,通过端到端训练提升延迟运输检测和概率预测能力,有效应对高不平衡和异质性物流数据挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 7 篇

2602.20972 2026-02-25 cs.CV 83%

Are Multimodal Large Language Models Good Annotators for Image Tagging?

多模态大语言模型在图像标签任务中是好的标注者吗?

Ming-Kun Xie, Jia-Hao Xiao, Zhiqiang Kou, Zhongnian Li, Gang Niu, Masashi Sugiyama

机构 * RIKEN Center for Advanced Intelligence Project, Japan(日本先进人工智能研究中心) The University of Tokyo, Japan(东京大学) Southeast University, China(东南大学) China University of Mining(中国矿业大学)

专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出TagLLM框架,通过候选生成和标签歧义消除方法,有效缩小多模态大语言模型生成标注与人工标注之间的差距,提升图像标签任务的效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20161 2026-02-25 cs.CV 83%

Mobile-O: Unified Multimodal Understanding and Generation on Mobile Device

Mobile-O: 移动设备上的统一多模态理解和生成

Abdelrahman Shaker, Ahmed Heakl, Jaseel Muhammad, Ritesh Thawkar, Omkar Thawakar, Senmao Li, Hisham Cholakkal, Ian Reid, Eric P. Xing, Salman Khan, Fahad Shahbaz Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Linköping University(利尔贝里大学)

专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 Mobile-O是一款在移动设备上实现统一多模态理解和生成的高效模型,通过紧凑架构和创新训练方法,在性能和速度上均优于现有模型。

Comments Project page: https://amshaker.github.io/Mobile-O/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18701 2026-02-25 cs.CV 70%

UniGenBench++: A Unified Semantic Evaluation Benchmark for Text-to-Image Generation

UniGenBench++: 一个统一的语义评估基准用于文本到图像生成

Yibin Wang, Zhimin Li, Yuhang Zang, Jiazi Bu, Yujie Zhou, Yi Xin, Junjun He, Chunyu Wang, Qinglin Lu, Cheng Jin, Jiaqi Wang

专题命中 多模态生成 :multi-modal(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniGenBench++ 提出一个统一的语义评估基准,涵盖多样化的现实场景和多语言支持,用于评估文本到图像生成模型的语义一致性。

Comments Project page: codegoat24.github.io/UniGenBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20520 2026-02-25 cs.CV cs.AI 62%

How Do Inpainting Artifacts Propagate to Language?

图像修复伪影如何传播到语言?

Pratham Yashwante, Davit Abrahamyan, Shresth Grover, Sukruth Rao

机构 * UC San Diego(圣迭戈大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究图像修复伪影对视觉-语言模型语言生成的影响,通过两阶段诊断方法分析重建保真度与描述质量的关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16156 2026-02-25 cs.CV 57%

Pluggable Pruning with Contiguous Layer Distillation for Diffusion Transformers

可插拔剪枝与连续层蒸馏用于扩散变换器

Jian Ma, Qirong Peng, Xujie Zhu, Peixing Xie, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本研究提出PPCL方法,通过连续层蒸馏和灵活剪枝技术,在保持图像生成质量的同时实现50%的参数压缩,适用于资源受限环境。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08019 2026-02-25 cs.CV 57%

Coherent and Multi-modality Image Inpainting via Latent Space Optimization

通过潜在空间优化实现一致性和多模态图像修复

Lingzhi Pan, Tong Zhang, Bingyuan Chen, Qi Zhou, Wei Ke, Sabine Süsstrunk, Mathieu Salzmann

机构 * Xi’an Jiaotong University(西安交通大学) EPFL(苏黎世联邦理工学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 PILOT通过潜在空间优化提升图像修复的一致性和多模态处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20644 2026-02-25 cs.SE 50%

An LLM-driven Scenario Generation Pipeline Using an Extended Scenic DSL for Autonomous Driving Safety Validation

基于扩展Scenic DSL的LLM驱动场景生成流水线用于自动驾驶安全验证

Fida Khandaker Safa, Yupeng Jiang, Xi Zheng

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出基于扩展Scenic DSL和LLM的场景生成流水线,实现高精度自动驾驶安全验证。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 11 篇

2509.07525 2026-02-25 cs.CV cs.AI 84%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12876 2026-02-25 cs.AI 83%

BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents

BrowseComp-$V^3$:一种视觉、垂直和可验证的多模态浏览代理基准测试

Huanyao Zhang, Jiepeng Zhou, Bo Li, Bowen Zhou, Yanzhe Shan, Haishan Lu, Zhiyong Cao, Jiaoyang Chen, Yuqian Han, Zinan Sheng, Zhengwei Tao, Hao Liang, Jialong Wu, Yang Shi, Yuanpeng He, Jiaye Lin, Qintong Zhang, Guochen Yan, Runhao Zhao, Zhengpin Li, Xiaohan Yu, Lang Mei, Chong Chen, Wentao Zhang, Bin Cui

机构 * PKU(北京大学) HKUST(GZ)(香港科技大学) OUC(华侨大学) CASIA(中国科学院自动化研究所) HITSZ(哈尔滨工业大学) THU(清华大学) Huawei Cloud BU(华为云业务部)

专题命中 多模态评测 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 BrowseComp-$V^3$提出了一种多模态浏览代理基准测试,通过300个跨模态问题评估深度搜索能力,揭示多模态信息整合的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12815 2026-02-25 cs.CL cs.AI cs.CY cs.MA 81%

Multimodal Multi-Agent Empowered Legal Judgment Prediction

多模态多智能体赋能的法律判决预测

Zhaolu Kang, Junhao Gong, Qingxi Chen, Hao Zhang, Jiaxin Liu, Rong Fu, Zhiyuan Feng, Yuan Wang, Simon Fong, Kaiyue Zhou

机构 * Peking University(北京大学) Chengdu Minto Tech(成都Minto科技) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Macau(澳门大学) Tsinghua university(清华大学) Zhejiang University(浙江大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出JurisMMA框架,通过多模态多智能体技术提升法律判决预测的准确性,并构建了包含大量司法记录的JurisMM数据集,验证了其在法律领域应用的广泛有效性。

Comments Accepted to the IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05137 2026-02-25 cs.CV cs.AI 81%

FedGIN: Federated Learning with Dynamic Global Intensity Non-linear Augmentation for Organ Segmentation using Multi-modal Images

FedGIN: 一种用于多模态图像器官分割的联邦学习动态全局强度非线性增强

Sachin Dudda Nagaraju, Ashkan Moradi, Bendik Skarre Abrahamsen, Mattijs Elschot

机构 * Department of Circulation and Medical Imaging(循证医学与影像学系) Norwegian University of Science and Technology(挪威科学技术大学)

专题命中 多模态评测 :multi-modal(title);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 FedGIN通过动态全局强度非线性增强模块,在不共享原始数据的情况下实现多模态器官分割,提升跨模态泛化能力。

Comments Paper Accepted at MICCAI 2025 DeCaf Workshop Track

Journal ref MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08645 2026-02-25 cs.CL 79%

A Parallel Cross-Lingual Benchmark for Multimodal Idiomaticity Understanding

一种平行的跨语言基准用于多模态隐喻性理解

Dilara Torunoğlu-Selamet, Dogukan Arslan, Rodrigo Wilkens, Wei He, Doruk Eryiğit, Thomas Pickard, Adriana S. Pagano, Aline Villavicencio, Gülşen Eryiğit, Ágnes Abuczki, Aida Cardoso, Alesia Lazarenka, Dina Almassova, Amalia Mendes, Anna Kanellopoulou, Antoni Brosa-Rodríguez, Baiba Saulite, Beata Wojtowicz, Bolette Pedersen, Carlos Manuel Hidalgo-Ternero, Chaya Liebeskind, Danka Jokić, Diego Alves, Eleni Triantafyllidi, Erik Velldal, Fred Philippy, Giedre Valunaite Oleskeviciene, Ieva Rizgeliene, Inguna Skadina, Irina Lobzhanidze, Isabell Stinessen Haugen, Jauza Akbar Krito, Jelena M. Marković, Johanna Monti, Josue Alejandro Sauca, Kaja Dobrovoljc, Kingsley O. Ugwuanyi, Laura Rituma, Lilja Øvrelid, Maha Tufail Agro, Manzura Abjalova, Maria Chatzigrigoriou, María del Mar Sánchez Ramos, Marija Pendevska, Masoumeh Seyyedrezaei, Mehrnoush Shamsfard, Momina Ahsan, Muhammad Ahsan Riaz Khan, Nathalie Carmen Hau Norman, Nilay Erdem Ayyıldız, Nina Hosseini-Kivanani, Noémi Ligeti-Nagy, Numaan Naeem, Olha Kanishcheva, Olha Yatsyshyna, Daniil Orel, Petra Giommarelli, Petya Osenova, Radovan Garabik, Regina E. Semou, Rozane Rebechi, Salsabila Zahirah Pranida, Samia Touileb, Sanni Nimb, Sarfraz Ahmad, Sarvinoz Sharipova, Shahar Golan, Shaoxiong Ji, Sopuruchi Christian Aboh, Srdjan Sucur, Stella Markantonatou, Sussi Olsen, Vahide Tajalli, Veronika Lipp, Voula Giouli, Yelda Yeşildal Eraydın, Zahra Saaberi, Zhuohan Xie

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL

AI总结 本文提出XMPIE数据集,用于评估多语言多模态隐喻理解能力,包含34种语言和超过一万项内容,支持跨语言和跨模态的隐喻理解研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00618 2026-02-25 cs.CV 79%

RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking

RegTrack: 复杂性之下蕴含的简洁性在鲁棒多模态3D多目标跟踪中

Lipeng Gu, Xuefeng Yan, Song Wang, Mingqiang Wei

机构 * School of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) Shenzhen Institute of Research, Nanjing University of Aeronautics and Astronautics(深圳研究院,南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization, Nanjing, China(新型软件技术与产业化协同创新中心,南京,中国) School of Computer Science and Control Engineering, Shenzhen University of Advanced Technology(计算机科学与控制工程学院,深圳大学先进技术学院)

专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV

AI总结 RegTrack通过统一三 cue 编码器实现鲁棒、高效且通用的多模态3D多目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20994 2026-02-25 eess.IV cs.AI cs.CL cs.CV cs.LG 78%

Multimodal MRI Report Findings Supervised Brain Lesion Segmentation with Substructures

多模态MRI报告辅助的监督性脑部病变分割与亚结构

Yubin Ge, Yongsong Huang, Xiaofeng Liu

机构 * Amazon AWS(亚马逊AWS) Yale University(耶鲁大学) Tohoku University(东北大学)

专题命中 多模态评测 :multimodal(title);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究提出MS-RSuper方法,通过解析报告中的定量和定性信息,结合亚结构和不确定性,提升脑部病变分割的准确性。

Comments IEEE International Symposium on Biomedical Imaging (ISBI) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏