arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-05-05 至 2026-05-05 共收录 58 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2605.01483 2026-05-05 cs.CV cs.AI 62%

Research on Vision-Language Question Answering Models for Industrial Robots

工业机器人中视觉-语言问答模型的研究

Ping Li, Bartlomiej Brzozka

机构 * Shandong Management University(山东管理大学) Maria Curie-Sklodowska University(玛丽·居里-斯洛多夫斯卡大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种层次交叉模态融合模型,解决工业机器人中语义模糊、复杂环境布局和领域术语的问题,通过多级特征融合提升问答可靠性。

Comments 8 Pages, 5 figures

Journal ref Brzozka,B.Machine Learning Algorithms in Predicting College Students' Grades:A Review.Journal of Applied Automation Technologies,2025,3,1-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00906 2026-05-05 cs.CV cs.AI cs.LG 62%

Generalized Category Discovery under Domain Shifts: From Vision to Vision-Language Models

在域偏移下进行广义类别发现:从视觉模型到视觉-语言模型

Hongjun Wang, Po Hu, Kai Han

机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文研究在域偏移下的广义类别发现问题,提出三种适应基础模型的框架,从自监督视觉模型到视觉-语言模型,通过多级特征提取和互信息最小化等方法提升性能。

Comments Submission to TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09625 2026-05-05 cs.CV cs.AI 62%

Grounding Synthetic Data Generation With Vision and Language Models

基于视觉和语言模型的合成数据生成基础

Ümit Mert Çağlar, Alptekin Temizel

机构 * Graduate School of Informatics(信息学院)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种视觉-语言 grounded 框架,用于可解释的遥感合成数据增强与评估,引入 ARAS400k 数据集,包含 100k 真实图像和 300k 合成图像,用于语义分割和图像描述生成。

Comments Accepted for presentation at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), Synthetic Data for Computer Vision Workshop (SynData4CV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01662 2026-05-05 cs.CV 57%

Video Active Perception: Effective Inference-Time Long-Form Video Understanding with Vision-Language Models

视频主动感知:基于视觉-语言模型的高效推理时长视频理解

Martin Q. Ma, Willis Guo, Aditya Agrawal, Ankit Gupta, Paul Pu Liang, Ruslan Salakhutdinov, Louis-Philippe Morency

机构 * Carnegie Mellon University(卡内基梅隆大学) MIT(麻省理工学院)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出视频主动感知方法,通过主动感知理论提升长视频问答性能,实现帧效率提升5.6倍,优于现有模型。

Comments ICCV 2025 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 7 篇

2605.01219 2026-05-05 cs.MM cs.CV cs.SD eess.IV 90%

Multimodal Confidence Modeling in Audio-Visual Quality Assessment

音频视频质量评估中的多模态置信度建模

Mayesha Maliha R. Mithila, Mylene C. Q. Farias

机构 * Texas State University Department of Computer Science(德克萨斯州立大学计算机科学系)

专题命中 音频语音多模态 :multimodal(title,abstract);audio-visual(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM

AI总结 本文提出MCM-AVQA框架,通过多模态置信度感知方法提升音频视频质量评估的准确性与可解释性,特别在处理不对称退化时表现更优。

Comments Accepted at ICIP 2026, 6 pages, 4 figures, no supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01278 2026-05-05 cs.AI 84%

Valley3: Scaling Omni Foundation Models for E-commerce

Valley3:面向电商的多模态大语言模型规模化

Zeyu Chen, Guanghao Zhou, Qixiang Yin, Ziwang Zhao, Huanjin Yao, Pengjiu Xia, Min Yang, Cen Chen, Minghui Qiu

机构 * Valley Team, ByteDance Group(字节跳动集团山谷团队)

专题命中 音频语音多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);cross-modal(abstract);audio-visual(abstract)

AI总结 Valley3通过四阶段预训练管道,融合多模态能力与电商知识,实现跨模态指令跟随和长链推理,构建了涵盖6个任务的电商基准测试,展现出在电商场景中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15037 2026-05-05 cs.AI cs.CL cs.SD 62%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01197 2026-05-05 cs.SD cs.MM 57%

MG-Former: A Transformer-Based Framework for Music-Driven 3D Conducting Gesture Generation

MG-Former:一种基于Transformer的音乐驱动3D指挥动作生成框架

Ke Qiu, Yawen Qin, Tianzhi Jia, Xiaole Yang, Kaimin Wang, Kaixing Yang

机构 * Malou Tech Inc(Malou科技公司) South-Central Minzu University(西南民族大学) Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Renmin University of China(中国人民大学)

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.MM

AI总结 本文提出TransConductor框架,通过SMPL参数数据构建流程生成专业指挥动作,结合Transformer编码器和解码器实现音乐驱动的3D指挥动作生成,并引入检索评估模型验证音乐与动作的对应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20657 2026-05-05 cs.HC cs.AI 57%

Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects

具有情感智能的智能体:当前趋势、挑战与未来展望

Raziyeh Zall, Alireza Kheyrkhah, Erik Cambria, Zahra Naseri, M. Reza Kangavari

机构 * School of Computer Engineering, Iran University of Science and Technology(伊朗科学技术大学计算机工程学院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算机与数据科学学院)

专题命中 音频语音多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文综述了情感智能智能体的核心组件,涵盖多模态数据处理的情感理解、情感认知及表达合成,分析了发展中的关键挑战与未来方向,强调生成技术对情感计算的潜力。

Comments Enhanced the quality of figures, incorporated additional and recent references, and improved the manuscript for better clarity and writing quality

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01153 2026-05-05 cs.HC 50%

Toward a Unified Framework for Collaborative Design of Human-AI Interaction

迈向人机交互协作设计的统一框架

Ankur Bhatt, Sven Mayer

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 本文提出统一框架整合多模态对齐、交互导向的可解释性及用户代理,通过协作设计与增强现实仓库机器人场景验证,提升人机交互透明度与用户控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00943 2026-05-05 cs.RO 50%

ARIS: Agentic and Relationship Intelligence System for Social Robots

ARIS:面向社交机器人的代理与关系智能系统

Stavya Datta, Fucai Ke, Leimin Tian, Hamid Rezatofighi

机构 * Monash University(墨尔本大学)

专题命中 音频语音多模态 :multimodal(abstract)

AI总结 ARIS通过整合多模态推理、图基社会世界模型和检索增强生成技术,提升社交机器人在多轮交互和社会关系推理中的能力,实验显示其在智能感知和用户亲和力方面表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 7 篇

2605.00963 2026-05-05 cs.RO cs.AI 79%

Ablation Study of Multimodal Perception, Language Grounding, and Control for Human-Robot Interaction in an Object Detection and Grasping Task

多模态感知、语言接地与控制在物体检测与抓取任务中的人机交互消融研究

Zi Tian, Guanting Shen

机构 * Dalian University of Technology(大连理工大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 本文通过消融研究探讨多模态感知、语言接地和控制模块对端到端性能的影响,评估最佳组合以优化执行时间和成功率。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00891 2026-05-05 cs.CV cs.AI 79%

X2SAM: Any Segmentation in Images and Videos

X2SAM:图像和视频中的任意分割

Hao Wang, Limeng Qiao, Chi Zhang, Lin Ma, Guanglu Wan, Xiangyuan Lan, Xiaodan Liang

机构 * Sun Yat-Sen University(中山大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 视频多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 X2SAM是一种统一的分割多模态大语言模型,能够将图像分割能力扩展到视频,结合LLM和Mask Memory模块,支持通用、开放词汇、指称、推理、基于视觉的对话生成及交互式分割。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01506 2026-05-05 cs.CV 77%

OmniEncoder: See, Hear, and Feel Continuous Motion Like Humans With One Encoder

OmniEncoder: 通过一个编码器实现如同人类般连续的视觉、听觉与触觉感知

Detao Bai, Shimin Yao, Weixuan Chen, Chengen Lai, Yuanming Li, Zhiheng Ma, Xihan Wei

机构 * Tongyi Lab Alibaba Group(阿里巴巴集团通义实验室) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 视频多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV

AI总结 OmniEncoder通过统一的Transformer架构,在共享潜在空间中对视觉和音频信号以25fps对称嵌入,解决多模态解耦与计算效率问题,提升连续视觉理解任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00871 2026-05-05 eess.SP cs.AI cs.CV cs.LG 62%

NAKUL-Med: Spectral-Graph State Space Models with Dynamics Kernels for Medical Signals

NAKUL-Med: 带动态核的谱-图状态空间模型用于医学信号

Badri N. Patro, Vijay S. Agneeswaran

机构 * Microsoft(微软)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 NAKUL-Med通过动态核生成、谱上下文建模和图引导的空间注意力,提升多通道生理信号分析的性能,实现高准确率和高效推理。

Comments Accepted CVPR Finding Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00826 2026-05-05 cs.IR cs.CV cs.LG cs.MM 62%

Understanding the Performance Plateau in Text-to-Video Retrieval: A Comprehensive Empirical and Linguistic Analysis

理解文本到视频检索中的性能平台:全面的实证和语言分析

Maria-Eirini Pegia, Dimitrios Stefanopoulos, Björn Þór Jónsson, Anastasia Moumtzidou, Ilias Gialampoukidis, Stefanos Vrochidis, Ioannis Kompatsiaris

机构 * Information Technologies Institute(信息科技研究所) CERTH-ITI School of Computer Science(计算机科学学院) Reykjavík University(雷克雅未克大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.MM

AI总结 本文通过实证和语言分析,探讨文本到视频检索中模型性能瓶颈,揭示caption特性与模型表现的关系,指出简单清晰的caption提升召回率,而复杂事件仍具挑战性。

Comments Survey, 50 pages, 15 figures, 13 tables, 154 citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01498 2026-05-05 cs.CV 57%

Towards Visual Query Localization in the 3D World

面向3D世界的视觉查询定位

Liang Peng, Bohan Tan, Zhipeng Zhang, Haobo Li, Yifan Jiao, Xingping Dong, Libo Zhang

机构 * Wuhan University(武汉大学) AutoLab, SAI, Shanghai Jiao Tong University(AutoLab、SAI、上海交通大学) Anyverse Dynamics University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文首次提出3D多模态视觉查询定位基准3DVQL,包含2002个序列和17万帧数据,通过点云、RGB图像和深度图像多模态数据提升研究灵活性,并提出LaF算法提升性能。

Comments Accepted to CVPR 2026. 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01427 2026-05-05 cs.RO 50%

SixthSense: Task-Agnostic Proprioception-Only Whole-Body Wrench Estimation for Humanoids

SixthSense:面向人类oid的无任务依赖的本体感知-only全身 wrench 估计

Xingzhou Chen, Xiayan Xu, Yan Ning, Jiyu Yu, Yizheng Zhang, Siyi Qian, Lingzhu Xiang, Jiahao Chen, Yuquan Wang, Haodong Zhang, Ling Shi

机构 * The Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent Robotics X(腾讯机器人实验室)

专题命中 视频多模态 :multi-modal(abstract)

AI总结 本文提出SixthSense,一种基于本体感知和IMU数据的无任务依赖方法,用于估计人类oid的全身接触时间和位置及外部wrench,解决浮动物理动力学和不确定接触位置的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 6 篇

2605.01163 2026-05-05 cs.IR cs.LG 82%

Multimodal Data Curation Through Ranked Retrieval

通过排序检索进行多模态数据整理

Pratyush Muthukumar, Harshil Kotamreddy, Sarah Amiraslani, Tomo Kanazawa, Ramani Akkati, Shaan Jain, Andrew Mathau

机构 * NVIDIA

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract)

AI总结 本文提出通过优化训练对和嵌入模型来提升多模态检索对齐,利用对称核子采样和专家嵌入引擎减少模态驱动的分离,有效缩小模态差距。

Comments ICLR DATA-FM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01393 2026-05-05 cs.CV 57%

Recall to Predict: Grounding Motion Forecasting in Interpretable Motion Bank

回忆以预测:在可解释的运动库中 grounded 运动预测

Abhishek Vivekanandan, Ahmed Abouelazm, J. Marius Zöllner

机构 * FZI Forschungszentrum Informatik(弗劳恩霍夫研究所信息技术研究中心) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出了一种端到端的可区分框架,通过对比学习构建全面的'运动库'来 grounding 运动预测,采用新颖的锚点检索层动态检索显式运动先验,结合 DETR 式解码器和 WTA 动态高斯混合模型,实现可解释的多模态预测。

Comments Sumitted for PeerReview

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01165 2026-05-05 cs.CV 57%

CEZSAR: A Contrastive Embedding Method for Zero-Shot Action Recognition

CEZSAR:一种用于零样本动作识别的对比嵌入方法

Valter Estevam, Rayson Laroca, Helio Pedrini, David Menotti

机构 * Federal Institute of Paraná, Irati, Brasil(巴西南里奥格兰德联邦理工学院) Federal University of Paraná, Curitiba, Brasil(巴西南里奥格兰德联邦大学) Pontifical Catholic University of Paraná, Curitiba, Brasil(巴西南里奥格兰德天主教大学) University of Campinas, Campinas, Brasil(坎皮纳斯大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本文提出了一种基于对比学习的零样本动作识别方法,通过联合嵌入空间对视频和句子进行编码,解决语义鸿沟和领域偏移问题,实验在UCF-101和Kinetics-400数据集上取得最佳效果。

Comments Accepted for presentation at the International Conference on Pattern Recognition (ICPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00925 2026-05-05 cs.LG cs.CV q-bio.QM 57%

Linking spatial biology and clinical histology via Haiku

通过俳句连接空间生物学与临床组织学

Yan Cui, Jacob S. Leiby, Wenhui Lei, Dokyoon Kim, Yanxiang Deng, Aaron T. Mayer, Zhenqin Wu, Alexandro E. Trevino, Zhi Huang

机构 * Department of Pathology and Laboratory Medicine, University of Pennsylvania(宾夕法尼亚大学病理学与实验室医学系) Department of Bioengineering, University of Pennsylvania(宾夕法尼亚大学生物工程系) Department of Biostatistics, Epidemiology & Informatics, University of Pennsylvania(宾夕法尼亚大学生物统计学、流行病学与信息学系) Enable Medicine, Menlo Park, CA, USA(Enable Medicine)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出Haiku模型,整合分子、形态和临床数据,通过三模态对比学习实现跨模态检索,提升分类和预测任务性能,并支持零样本生物标志物推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00902 2026-05-05 cs.CV cs.IR 57%

Validation of Whole-Slide Foundation Models for Image Retrieval in TCGA Data

对TCGA数据中整张滑动图像检索的整张滑动图像基础模型进行验证

Tianhao Lei, Parsa Esmaeilkhani, Saghir Alfasly, Wataru Uegami, Judy C. Boughey, Matthew P. Goetz, Krishna R. Kalari, H. R. Tizhoosh

机构 * KIMIA Lab, Artificial Intelligence and Informatics, Mayo Clinic, Rochester, MN, USA(KIMIA实验室,人工智能与信息学,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Neurology, Northwestern University Feinberg School of Medicine, Chicago, IL, USA(神经病学系,北western大学费因伯格医学院,芝加哥,伊利诺伊州,美国) Department of Computer Science, Temple University, Philadelphia, PA, USA(计算机科学系,泰勒大学,费城,宾夕法尼亚州,美国) Department of Breast and Melanoma Surgical Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(乳腺和黑色素瘤外科肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Oncology, Comprehensive Cancer Center, Mayo Clinic, Rochester, MN, USA(肿瘤学系,综合癌症中心,梅奥诊所,罗切斯特,明尼苏达州,美国) Department of Quantitative Health Sciences, Mayo Clinic, Rochester, MN, USA(定量健康科学系,梅奥诊所,罗切斯特,明尼苏达州,美国)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 本研究验证了TCGA数据中整张滑动图像基础模型的检索性能,发现基于片段和监督聚合的方法在Top-1和Top-3准确率上表现相当,但整体性能受器官和诊断差异影响较大,形态学检索存在固有限制,需进一步改进特征表示和多模态框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12778 2026-05-05 cs.CL 57%

HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks

HeteroRAG:一种用于医疗视觉语言任务的异构检索增强生成框架

Zhe Chen, Yusheng Liao, Zhiyuan Zhu, Haolin Li, Hongcheng Liu, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 本文提出HeteroRAG框架,通过异构知识源增强医疗大视觉语言模型,解决异构数据检索问题,提升事实准确性与可靠性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 5 篇

2605.01144 2026-05-05 cs.CV cs.AI 81%

Semantic Context-aware mOdality fUsion Transformer (SCOUT): A Context-Aware Multimodal Transformer for Concept-Grounded Pathology Report Generation

语义上下文感知的多模态融合变换器(SCOUT):一种基于概念的多模态变换器,用于病理报告生成

Suryakant Singh, Saarthak Kapse, Joel Saltz, Prateek Prasanna

机构 * Stony Brook University(石桥大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 SCOUT通过整合局部组织学模式、整张滑片上下文和专家编纂的语义描述符,实现病理报告生成的语义上下文感知,提升临床相关性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01480 2026-05-05 cs.CV 57%

AttnRouter: Per-Category Attention Routing for Training-Free Image Editing on MMDiT

AttnRouter:基于MMDiT的无训练图像编辑的类别级注意力路由

Guandong Li, Mengxia Ye

机构 * iFLYTEK Aegon THTF

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本文提出AttnRouter,通过类别级路由表优化MMDiT的无训练图像编辑,实验显示其在CLIP-T+DINO-I复合指标上提升6.4%,且自动分类器在仅55%类别准确率下关闭98%的差距。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05081 2026-05-05 cs.AI 57%

MedGemma 1.5 Technical Report

MedGemma 1.5 技术报告

Andrew Sellergren, Chufan Gao, Fereshteh Mahvar, Timo Kohlberger, Fayaz Jamil, Madeleine Traverse, Alberto Tono, Bashir Sadjad, Lin Yang, Charles Lau, Liron Yatziv, Tiffany Chen, Bram Sterling, Kenneth Philbrick, Richa Tiwari, Yun Liu, Madhuram Jajoo, Chandrashekar Sankarapu, Swapnil Vispute, Harshad Purandare, Abhishek Bijay Mishra, Sam Schmidgall, Tao Tu, Anil Palepu, Chunjong Park, Tim Strother, Rahul Thapa, Yong Cheng, Preeti Singh, Kat Black, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Joelle Barral, Tris Warkentin, Shravya Shetty, Dale Webster, Sunny Virmani, David F. Steiner, Can Kirmizibayrak, Daniel Golden

机构 * Google Research and Google DeepMind(谷歌研究与谷歌深Mind)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 MedGemma 1.5 增强了医学影像处理、解剖定位和多时间点胸部X光分析能力,显著提升了3D MRI和CT分类精度,并在病理图像和临床知识推理中取得突破性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04106 2026-05-05 cs.AI 57%

InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories

InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹

Yuanshao Zhu, Yuxuan Liang, Xiangyu Zhao, Liang Han, Xinwei Fang, Xun Zhou, Xuetao Wei, James Jianqiao Yu

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of York(约克大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10571 2026-05-05 cs.CV 57%

AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner

AVI-Edit: 基于粒度感知掩码细化的音频同步视频实例编辑

Haojie Zheng, Shuchen Weng, Jingqi Liu, Siqi Yang, Boxin Shi, Xinlong Wang

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) State Key Lab of Multimedia Info. Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Nat’l Eng. Research Ctr. of Visual Tech., School of Computer Science, Peking University(北京大学计算机学院视觉技术工程研究中心) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 本文提出AVI-Edit框架,通过粒度感知掩码细化和自反馈音频代理,实现音频同步的高质量视频实例编辑,提升了空间和时间控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 15 篇

2605.01024 2026-05-05 cs.CV cs.AI 93%

EmoMM: Benchmarking and Steering MLLM for Multimodal Emotion Recognition under Conflict and Missingness

EmoMM:针对冲突和缺失性下的多模态情绪识别的MLLM基准测试与引导

Yueru Sun, Yimeng Zhang, Haoyu Gu, Nuo Chen, Dong She, Xianrong Yao, Yang Gao, Zhanpeng Jin

机构 * School of Future Technology, South China University of Technology(华南理工大学未来技术学院)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出EmoMM基准,用于研究多模态情绪识别中模态冲突和缺失性下的MLLM决策机制,发现视频贡献崩溃现象,并提出CHASE机制减轻决策偏差,提升模型在复杂情感场景中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏