TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation
TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI
AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI
AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。
Aero Realtime:用于低延迟流式多模态生成的完全对齐输入输出流
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出4B参数流式多模态模型Aero Realtime,采用双工架构实现输入输出流完全对齐,通过时隙对齐等技术降低延迟,在4块NVIDIA A6000 GPU上验证了其低延迟多模态交互的可行性。
Vorch-IR:长视频统一多模态身份替换生成模型
机构 * Vorch Team(Vorch团队) ; Fudan University(复旦大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。
Comments Project page: https://vorch-project.github.io/Vorch-IR-project/
扩散模型中的视觉锚定:多模态零样本骨骼动作识别
机构 * The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。
ToolArtist:用于智能体图像生成的工具使用统一多模态模型
机构 * RUC(中国人民大学) ; HKUST(GZ)(香港科技大学(广州)) ; NUS(新加坡国立大学) ; UCD(加州大学戴维斯分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。
面向表格到多模态报告生成的蒙特卡洛树搜索
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。
MoRoute:面向上下文多模态视频生成的动态路由
机构 * Sun Yat-sen University(中山大学) ; HUJING Digital Media & Entertainment Group(沪景数字媒体娱乐集团) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 MoRoute是采用动态层路由连接VLM与视频DiT的多模态视频生成框架,在三个基准数据集上均优于现有最优方法,提升了视频生成与编辑的性能。
Comments Project page: https://orange-3dv-team.github.io/MoRoute/
更快但不同:加速多模态扩散语言模型中的内容漂移诊断与控制
机构 * School of Mathematics and Statistics, Beijing Institute of Technology(北京理工大学数学与统计学院) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL
AI总结 该研究针对加速多模态扩散语言模型的内容漂移问题,通过实验诊断出漂移源于过期状态,提出缩短KV缓存刷新区间的控制方法,在1.3倍加速时实现近乎完全一致,且未发现事实错误差异。
Comments 9 pages, 4 figures, 6 tables. Preprint
统一多模态模型是否在同一空间中思考?通过跨分支引导的视角
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。
LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理
机构 * The Hong Kong Polytechnic University(香港理工大学) ; University College London(伦敦大学学院) ; Tsinghua University(清华大学) ; Sun Yat-sen University(中山大学) ; National University of Singapore(新加坡国立大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。
Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)
用于多模态遥感图像生成的对比参数解缠
机构 * School of Information and Communication Engineering, Dalian University of Technology(大连理工大学信息与通信工程学院) ; Unit 92728 of PLA(中国人民解放军92728部队)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);分类 cs.CV
AI总结 针对现有遥感图像生成方法局限,提出对比参数解缠框架,通过对比参数解缠模块、解缠优化策略及查询-键结构转移机制,实现多模态遥感图像高质量生成,在相关任务中性能优越。
MTVDiff:用于增强热红外到可见光面部翻译的多模态条件潜扩散
机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) ; Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University)(新一代人工智能技术及其交叉应用重点实验室(东南大学)) ; Monash University(莫纳什大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 针对热红外到可见光面部翻译的挑战,提出MTVDiff框架,通过双分支交叉注意力融合等三个核心技术,整合深度和文本信息,在多指标上优于现有方法,提升图像质量和面部验证性能,推动跨光谱面部图像翻译发展。
Comments Accepted by ECCV 2026
TAP-RAG:用于长文档多模态问答的任务感知策略控制
机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) ; The International Joint Institute of Tianjin University(天津大学国际联合学院) ; Department of Automation, Tsinghua University(清华大学自动化系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。
Comments 18 pages, 6 figures, 9 tables
S1-Omni:用于科学理解、预测和生成的统一多模态推理模型
机构 * ScienceOne AI(科学一号人工智能) ; Wenge AI(文阁人工智能)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 研究针对科学人工智能模型能力分散问题,提出S1-Omni统一多模态推理模型,基于科学数据统一表示、知识对齐和解码三个核心组件,经训练和评估,在多基准测试中表现出色优于同类模型,为统一科学建模提供实用路径。
M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。
Comments 24 pages, 13 figures
一种处理多模态心脏PET/MRI数据的新型无监督机器学习策略
机构 * Nantes Université, CHU Nantes(南特大学,南特大学医院中心) ; Siemens Healthineers France(西门子医疗法国公司)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对致心律失常性左心室心肌病诊断难题,利用PET/MRI数据,采用两步聚类等方法,对患者图像进行处理分析,生成健康报告,经交叉验证和在更大队列上验证,能准确识别异常,有助于表征心肌异质性。
Comments 11 pages, 6 figures
用于多模态自回归视觉建模的下密集步长预测
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; GE HealthCare(通用电气医疗)
专题命中 多模态生成 :multimodal(title);cross-modal(abstract);分类 cs.AI
AI总结 研究提出DenseAR范式,将自回归图像生成重构成下密集步长预测,解决现有模型局限。基于此扩展为统一模型处理多模态和成像任务,在医学和自然图像验证,在多对比脑MRI及ImageNet上取得良好效果。
InterPet4D:用于宠物运动生成的多模态4D人宠交互数据集
机构 * Institute of Science Tokyo(东京科学研究所) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 因缺乏高质量数据集,人宠交互研究不足。本文提出InterPet4D多模态数据集及InterPetMoGen框架,通过同步多视图系统记录交互并标注,含多类型数据,所提模型FID得分11.21,优于基线,有效模拟人宠交互。
模型指导绘图:用于统一多模态推理的自适应视觉门控
机构 * Imperial College London(伦敦帝国理工学院) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 针对统一多模态模型在视觉推理中存在的问题,提出基于生成意图和视觉保真度两个内部信号的AdaViG方法,可动态评估视觉步骤,避免误导性视觉证据进入推理过程,提升了准确率并降低计算量和延迟。
DeltaV:在统一大型多模态模型中通过视觉状态更新进行思考
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi Inc.(小米公司)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对统一大型多模态模型全图像生成范式的问题,提出DeltaV模型,通过视觉更新避免冗余,引入TSIM路由器匹配令牌预算,构建StructCoT数据集,实验证明该范式能减少视觉令牌、提升推理能力,DeltaV - 2B性能优异。
通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移
机构 * Honor Device Co., Ltd.(荣耀终端有限公司)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。
Comments 17 pages, 9 figures, 7 tables. Preprint
强化多模态掩码扩散模型的生成顺序
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; AGI Foundations for AWS(AWS强化人工智能基础)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。
MMDiff: 扩展扩散变换器用于多模态生成
机构 * University of Oxford, Visual Geometry Group(牛津大学视觉几何组)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 提出MMDiff框架,利用冻结的扩散变换器通过轻量解码器联合生成图像及多种密集感知模态,发现多时间步特征融合与空间变化聚合权重是关键,在语义分割等任务上取得优异性能。
视觉作为统一的多模态生成
机构 * SenseTime Research(商汤科技研究院) ; Nanyang Technological University(南洋理工大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究将计算机视觉表述为统一多模态生成,SenseNova-Vision用自然语言指令等指定任务并生成多种输出。通过转换注释形成语料库训练模型,其涵盖多种视觉任务,实验显示统一模型能匹配专用系统,为集成视觉能力到通用模型提供可扩展途径。
Comments 48 pages,22 figures
通过场景感知文档合成增强关键信息提取中的大型多模态模型
机构 * Alibaba Group(阿里巴巴集团) ; Qwen Team, Alibaba Group(阿里巴巴集团之通义千问团队) ; Taobao and Tmall Group, Alibaba(阿里巴巴淘宝和天猫集团) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 研究关键信息提取难题,提出场景感知文档合成框架SAYRE,利用示例文档生成训练数据,引入错误驱动生成,提升Qwen3-VL骨干性能,证明该方法是改进多模态KIE的有效数据中心方法。
行人扩散:用于惯性导航的多模态生成去噪和密集状态估计
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 针对消费级惯性导航受MEMS随机噪声限制问题,提出PedestrianDiffusion框架,将密集6D状态估计转化为连续条件去噪过程,引入零样本语义条件机制,用ODE求解器提升性能,在多基准测试中达先进水平。
AnyMatch: 利用大规模单视图图像增强通用多模态图像匹配
机构 * Electronic Information School, Wuhan University(武汉大学电子信息学院) ; School of Robotics, Wuhan University(武汉大学机器人学院)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 提出AnyMatch框架,利用单视图图像生成多模态训练数据,通过单目深度估计、3D重投影、扩散修复和跨模态图像翻译合成几何一致的多视图多模态图像对,构建大规模数据集Any-syn,显著提升多模态匹配网络的泛化性和鲁棒性。
Comments Accepted by ECCV 2026
AnyBokeh: 物理引导的任意到任意散景编辑与光学指纹迁移
专题命中 多模态生成 :any-to-any(title,abstract);分类 cs.CV
AI总结 提出AnyBokeh框架,通过估计源模糊状态的光学指纹并迁移到目标焦点和光圈设置,实现任意到任意散景编辑,避免全聚焦重建和测试时校准。
UniTac: 一种用于跨传感器触觉理解与生成的统一多模态模型
机构 * Zhejiang University(浙江大学) ; Yale University(耶鲁大学) ; University of Oxford(牛津大学) ; MIT(麻省理工学院) ; Shanghai Jiaotong University(上海交通大学) ; UNIX AI
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 提出UniTac,首个统一多模态模型,通过双级表示编码传感器和物体属性,实现触觉理解与生成,在跨传感器任务上达到最优性能。
Comments This paper has been accepted by ECCV 2026
Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。