Diffusion Models for Joint Audio-Video Generation
用于联合音频视频生成的扩散模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
用于联合音频视频生成的扩散模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。
改进的图表到代码生成的迭代细化方法:基于结构化指令
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Shanghai Innovation Institute(上海创新研究院) ; Lehigh University(莱特大学) ; MIFA Lab(MIFA实验室)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出基于结构化指令的ChartIR方法,通过区分视觉理解和代码翻译任务,提升图表到代码生成的性能,实验显示在Qwen2-VL和GPT-4o上表现优异。
DermaFlux:基于修正流的合成皮肤病变生成用于增强图像分类
机构 * Imperial College London, UK(伦敦帝国理工学院) ; Northeastern University London, UK(伦敦东北大学)
专题命中 多模态生成 :image-text(abstract);分类 cs.CV
AI总结 DermaFlux通过生成临床相关的皮肤病变图像,提升二分类性能,实验表明其在小数据集上提升6%,在合成数据上提升9%。
语义一维分词器用于图像重建与生成
机构 * Tsinghua University, Beijing, China(清华大学,北京,中国) ; Alibaba Group, Beijing, China(阿里巴巴集团,北京,中国)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出SemTok,一种语义一维分词器,通过压缩2D图像为1D离散token实现高效图像重建,采用三重创新框架提升生成效果。
Comments 18 pages,12 figures
InViC:面向医疗视觉问答的意图感知视觉线索
机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University, Xi’an 710072, China(集成空天地海大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学,西安710072,中国) ; Westlake University(西湖大学) ; Southern Medical University(南方医科大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出InViC框架,通过引入Cue Tokens Extraction模块和两阶段微调策略,提升医疗视觉问答中意图对齐的视觉证据利用,验证了瓶颈化训练在提高可信度上的有效性。
Comments 10 pages, 2 figures
重新思考UMM视觉生成:面向高效图像-only预训练的掩码建模
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Westlake University(西湖大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出IOMM框架,通过两阶段训练提升UMM视觉生成效率与性能,实验显示其在GenEval和WISE上优于现有基线。
Comments https://github.com/LINs-lab/IOMM
UMO:统一上下文学习解锁运动基础模型先验
机构 * Brown University(布朗大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Meta Reality Lab(Meta现实实验室) ; Max-Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ; University of Hong Kong(香港大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 UMO通过统一框架解锁运动基础模型先验,支持多种跨模态和上下文生成任务,提升文本到运动合成性能。
Comments Project Page: https://oliver-cong02.github.io/UMO.github.io/
融合理解与生成的交错分析-草稿思维
机构 * National University of Singapore(国立新加坡大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Microsoft Research(微软研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出AD-Loop机制,通过交错分析与草稿操作提升视觉语言模型的理解与生成能力,实验表明其在多个基准测试中表现优异,具备良好的迁移性。
Comments 28 pages, 17 figures, 6 tables, ICLR conference
增强检索的草图引导3D建筑生成
专题命中 多模态生成 :multimodal(abstract)
AI总结 本文提出多阶段3D生成框架,通过结合生成与检索方法实现组件级编辑与个性化定制,解决日本独栋房屋早期设计阶段因缺乏统一表示导致的设计漂移问题。
Comments 10 pages, 4 figures, Proceeding of CAADRIA 2026
ASCENT:基于Transformer的非塔台终端空域飞机轨迹预测
机构 * Institute of Visual Computing, Graz University of Technology(视觉计算研究所,格拉茨技术大学)
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文提出ASCENT模型,通过轻量级Transformer架构实现多模态3D飞机轨迹预测,结合领域感知的3D坐标归一化和参数化预测,实验表明其在TrajAir和TartanAviation数据集上优于现有方法。
Comments ICRA 2026. Project Page at https://a-pru.github.io/ascent/
知识蒸馏在分布式通信与感知中的协同学习
专题命中 多模态生成 :multi-modal(abstract)
AI总结 本文探讨了知识蒸馏和协同学习在6G分布式通信与感知节点中部署轻量级AI模型的有效性,通过系统性数值研究证明其在多模态感知辅助波束跟踪中的性能提升与复杂度降低。
Comments This paper has been submitted to IEEE Communications Magazine and under review for possible publication
通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化
机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)
专题命中 多模态评测 :multi-modal(title,abstract);MLLM(abstract,comments);image-text(abstract);分类 cs.CV、cs.CL
AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。
Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io
ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eastern Institute of Technology, Ningbo(宁波东部技术研究院) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Zhongguancun Academy(中关村学院)
专题命中 多模态评测 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV
AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。
Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/
AW-MoE:面向所有天气条件的专家混合方法用于鲁棒多模态3D目标检测
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建城市智能感知与计算重点实验室) ; School of Informatics, Xiamen University(厦门大学信息学院) ; Zhongguancun Academy(中关村学院)
专题命中 多模态评测 :multi-modal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出AW-MoE,通过引入天气感知路由和统一双模态增强方法,提升多模态3D目标检测在恶劣天气下的鲁棒性,实验表明其在恶劣天气下的性能提升达15%。
多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试
机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) ; Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) ; College of Chemistry, Beijing Normal University(北京师范大学化学学院) ; Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) ; Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI
AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。
Comments 17pages, 3 figures
循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理
机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。
KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全
机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。
Comments 12 pages, 2 figures, 6 tables
数据本地自主LLM引导的神经架构搜索用于多类多模态时间序列分类
机构 * University of Southampton(南安普顿大学)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出一种数据本地的LLM引导神经架构搜索框架,用于多类多模态时间序列分类,通过轻量级融合MLP和专家架构联合搜索提升模型性能,减少人工干预。
基于WDLoRA的多模态生成框架用于临床指导的糖尿病性周围神经病变角膜共聚焦显微镜图像合成
机构 * Department of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特 Metropolitan 大学计算与数学系) ; Department of Eye and Vision Sciences, University of Liverpool(利物浦大学眼科学与视觉科学系) ; Faculty of Biology, Medicine and Health, University of Manchester(曼彻斯特大学生物、医学与健康学院) ; Department of Medicine, Weill Cornell Medicine-Qatar(韦尔·柯尔曼医学中心-卡塔尔医学系)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出基于WDLoRA的多模态生成框架,用于生成糖尿病性周围神经病变的角膜共聚焦显微镜图像,通过结合神经分割掩膜和疾病特异性临床提示,提升图像合成的解剖学一致性与临床诊断准确性。
多语言、多模态流水线用于创建真实且结构化的事实核查数据集
机构 * Ruhr-Universität Bochum(博尔塔尔大学波恩)
专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL
AI总结 本文提出一个多语言、多模态的数据收集与处理流水线,通过整合ClaimReview feeds、抓取完整驳斥文章、标准化异构声明裁定并添加结构化元数据和对齐的视觉内容,构建了法语和德语的事实核查数据集,提升了事实核查的可解释性和证据基础。
电导活动作为可穿戴传感器中有氧运动检测的单一信号
机构 * Odle Middle School(Odle中学) ; ImagineQ Labs(ImagineQ实验室) ; Cambridge Center for International(剑桥国际中心) ; bellevue, WA, USA(西雅图,华盛顿州,美国) ; Research, United Kingdom(英国研究)
专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI
AI总结 研究探讨了仅使用电导活动特征是否能可靠区分静息与持续有氧运动,采用留一被试法验证,发现EDA单独分类在主体独立评估中表现中等,相位时间动态和事件时间对分类分离有贡献。
探索无需额外训练的水下世界分割
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) ; University of Science and Technology of China, China(中国科学技术大学,中国) ; Northwestern Polytechnical University, China(西北工业大学,中国)
专题命中 多模态评测 :multimodal(abstract);分类 cs.CV、cs.AI
AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。
V-DyKnow:面向视觉语言模型的时间敏感知识动态基准
机构 * Signals and Interactive Systems Lab, University of Trento(信号与交互系统实验室,特伦托大学)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.AI
AI总结 本文提出V-DyKnow基准,评估视觉语言模型对时间敏感事实知识的处理能力,分析模型响应可靠性、知识更新方法有效性及过时预测原因,揭示当前VLM在多模态时间敏感知识获取与更新中的局限性。
多模态数据集及一个跟踪无人飞行器的基线系统
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) ; School of Computer Science and Electronic Engineering and the Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学计算机科学与电子工程学院及视觉、语音与信号处理中心)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出多模态无人飞行器跟踪数据集MM-UAV,包含RGB、红外和事件信号三种模态,通过引入偏移引导自适应对齐模块和自适应动态融合模块,提升复杂环境下的跟踪性能。
Comments V3
重新审视RGBT跟踪基准测试:从模态有效性角度出发:一个新的基准、问题和解决方案
机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) ; Centre for Vision, Speech and Signal Processing, University of Surrey(Surrey大学视觉、语音与信号处理中心)
专题命中 多模态评测 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出MV-RGBT基准测试,针对多模态场景下的跟踪问题,引入'何时融合'新问题,并提出MoETrack解决方案,展示了其在多模态跟踪中的潜力。
基于隐性联想测试的脑和行为数据中心理量表变量的贝叶斯推断
机构 * Intheon ; Department of Psychiatry and Behavioral Sciences, University of Minnesota(大学医学院精神病学与行为科学系) ; Minneapolis VA Medical Center(明尼苏达州梅奥医疗中心) ; Institute for Health Informatics, University of Minnesota(健康信息学研究所) ; Deliberate AI
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出了一种稀疏分层贝叶斯模型,利用多模态数据预测新参与者与精神疾病症状相关的体验,实现了比传统D-score方法更高的预测性能。
Comments 43 pages, 7 figures, 6 tables, submitted to: Journal of Neural Engineering
Crowd-FM: 基于学习的条件流匹配生成轨迹的最优选择用于人群导航
机构 * Robotics Research Center, IIIT Hyderabad, India(IIIT海得拉巴机器人研究中心,印度) ; Nanyang Technological University, Singapore(新加坡南洋理工大学) ; University of Tartu, Estonia(爱沙尼亚塔尔图大学) ; Inria, Université de Lorraine, France(法国里尔大学Inria研究院)
专题命中 多模态评测 :multi-modal(abstract)
AI总结 本文提出Crowd-FM方法,通过条件流匹配学习碰撞自由的轨迹生成策略,提升机器人在人群中的安全性和人似性。
Comments Accepted at IEEE ICRA 2026. Authors Antareep Singha and Laksh Nanwani have equal contributions
多模态AI代理的前瞻性规划
机构 * University of Maryland, College Park(马里兰大学学院公园分校) ; The Ohio State University(俄亥俄州立大学) ; Adobe Research(Adobe研究) ; State University of New York at Buffalo(纽约州立大学布法罗分校)
专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出TraceR1框架,通过前瞻性轨迹推理提升多模态代理的规划能力,实现更稳定的执行和泛化性能。
Comments Published at CVPR 2026 Findings Track
MSGNav: 释放多模态3D场景图在零样本具身导航中的潜力
机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing(福建智能感知与计算重点实验室) ; Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(多媒体可信感知与高效计算重点实验室) ; Beihang University(北航) ; Nanyang Technological University(南洋理工大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; Zhongguancun Academy(中关村学院)
专题命中 多模态Agent :multi-modal(title,abstract);分类 cs.CV
AI总结 MSGNav通过多模态3D场景图实现零样本具身导航,引入关键子图选择模块、自适应词汇更新模块和闭环推理模块,解决开放词汇和视觉证据保留问题,实验表明其在GOAT-Bench和HM3D-ObjNav基准上表现优异。
Comments 18 pages, Accepted by CVPR 2026
VisTIRA: 通过结构化工具集成缩小图像-文本模态差距以提升视觉数学推理
机构 * Microsoft AI(微软人工智能)
专题命中 多模态Agent :image-text(title);分类 cs.CL、cs.AI
AI总结 VisTIRA通过结构化工具集成框架,解决图像形式数学问题的推理难题,改进视觉数学推理能力,实验表明工具监督和OCR定位能有效缩小模态差距。