arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-02 至 2026-07-02 共收录 27 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2602.21397 2026-07-02 cs.CV cs.LG 版本更新 83%

MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

MMLoP: 多模态低秩提示用于高效视觉-语言适配

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 图文多模态 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30296 2026-07-02 cs.AI 版本更新 79%

ManimAgent: Self-Evolving Multimodal Agents for Visual Education

ManimAgent: 用于视觉教育的自进化多模态智能体

Wenjia Jiang, Zongyuan Cai, Yuanhang Shao, Chenru Wang, Boyan Han, Zhixue Song, Keyu Chen, Shengwei An, Xu Yang, Zhou Yang

机构 * University of Alberta(阿尔伯塔大学) Southeast University(东南大学) Virginia Tech(弗吉尼亚理工学院) Xidian University(西安电子科技大学) Vivavia Inc(Vivavia公司)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出ManimAgent,通过双通道情节记忆库跨任务传递反思经验,无需权重更新或人工种子,在代码生成任务中提升通过率并减少反思轮次。

Comments Project page: https://manimagent.github.io/. Code: https://github.com/jwj1342/Paper2Manim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11689 2026-07-02 cs.AI 版本更新 77%

Explicit Logic Channel for Validation and Enhancement of MLLMs on Zero-Shot Tasks

显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型

Mei Chee Leong, Ying Gu, Hui Li Tan, Liyuan Li, Nancy Chen

机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) Agency for Science, Technology and Research (A*STAR)(科技研究局) Singapore(新加坡)

专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 57%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 图文多模态 :multi-modal(abstract);分类 cs.CV

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 2 篇

2603.16859 2026-07-02 cs.AI 版本更新 83%

SocialOmni: Benchmarking Audio-Visual Social Interactivity in Omni Models

SocialOmni: 全模态模型中音视频社交互动性的基准测试

Tianyu Xie, Jinfa Huang, Yuexiao Ma, Rongfang Luo, Yan Yang, Wang Chen, Yuhui Zeng, Yixuan Zou, Qingchuan Ma, Zhiqiang Lu, Ruize Fang, Xiawu Zheng, Jiebo Luo, Rongrong Ji

机构 * Media Analytics and Computing Lab, Xiamen University(厦门大学媒体分析与计算实验室) Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究所) School of Informatics, Xiamen University(厦门大学信息学院) Sichuan Agricultural University(四川农业大学) Department of Computer Science, University of Rochester(罗切斯特大学计算机科学系)

专题命中 音频语音多模态 :audio-visual(title,abstract);omni-modal(abstract);分类 cs.AI

AI总结 提出SocialOmni基准,从说话人分离、打断时机和自然打断生成三个维度评估全模态大模型的社交互动能力,发现感知准确性与上下文打断生成能力存在显著脱耦。

Comments Code is available at https://github.com/MAC-AutoML/SocialOmni and dataset is available at https://huggingface.co/datasets/alexisty/SocialOmni

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12165 2026-07-02 cs.CV 版本更新 79%

Audio-Visual Camera Pose Estimation with Passive Scene Sounds and In-the-Wild Video

利用被动场景声音和真实世界视频进行音频-视觉相机姿态估计

Daniel Adebi, Sagnik Majumder, Kristen Grauman

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 音频语音多模态 :audio-visual(title,abstract);分类 cs.CV

AI总结 本文提出一种结合方向到达谱和双耳嵌入的音频-视觉框架,用于真实世界视频中的相机姿态估计,在视觉信息受损时表现出鲁棒性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 5 篇

2605.00271 2026-07-02 cs.CV cs.AI cs.RO 版本更新 81%

REALM: An RGB- and Event-Aligned Latent Manifold for Cross-Modal Perception

REALM:一种RGB和事件对齐的潜在流形用于跨模态感知

Vincenzo Polizzi, David B. Lindell, Jonathan Kelly

机构 * University of Toronto, Robotics Institute(多伦多大学机器人研究所) University of Toronto, Department of Computer Science(多伦多大学计算机科学系)

专题命中 视频多模态 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 REALM通过将事件表示投影到预训练的RGB基础模型潜在空间,实现跨模态感知,利用LoRA技术解锁冻结RGB主干的几何和语义先验,实现零样本应用复杂解码器。

Comments Accepted to the European Conference on Computer Vision (ECCV), Malmö, SE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28369 2026-07-02 cs.IR cs.AI 版本更新 79%

Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models

基于AI基础模型的多模态与多尺度时空语义搜索与推荐

Yuanyuan Tian, Wenwen Li, Xiao Chen, Michael Brook, Michael Brubaker, Anna Liljedahl, Chitta Baral

机构 * School of Geographical Sciences and Urban Planning, Arizona State University(地理科学与城市规划学院,亚利桑那州立大学) Alaska Native Tribal Health Consortium(阿拉斯加原住民部落健康联盟) Woodwell Climate Research Center(伍德沃德气候研究中心) School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.AI

AI总结 提出融合大语言模型和视觉-语言模型的框架,通过CAMERA算法融合文本与视觉信息生成更丰富嵌入,以及ASTRA算法结合尺度依赖的时空相关性与语义相似性进行重排序,在环境事件文档检索中优于单模态方法。

Comments 17 pages, accepted for publication in the ACM Transactions on Spatial Algorithms and Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10180 2026-07-02 cs.CV 版本更新 74%

TCMA: Text-Conditioned Multi-granularity Alignment for Drone Cross-Modal Text-Video Retrieval

TCMA:面向无人机跨模态文本-视频检索的文本条件多粒度对齐

Zixu Zhao, Yang Zhan, Yunhao Li, Yan Li

机构 * Carnegie Mellon University(卡内基梅隆大学) The Hong Kong Polytechnic University(香港理工大学) Wuhan University(武汉大学)

专题命中 视频多模态 :cross-modal(title);分类 cs.CV

AI总结 针对无人机视频检索中数据集粗粒度、冗余标注问题,构建细粒度多样化标注数据集DVTMD,并提出文本条件多粒度对齐框架TCMA,实现全局-局部多层级对齐,在无人机文本-视频检索任务上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 57%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04198 2026-07-02 cs.CV cs.RO 版本更新 57%

DriveVA: Video Action Models are Zero-Shot Drivers

DriveVA: 视频动作模型是零样本驱动器

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Michael Ying Yang, Francesco Nex, Hao Cheng

机构 * University of Twente(特温特大学) Xiaomi EV(小米电动汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 DriveVA提出了一种新的自动驾驶世界模型,通过共享潜在生成过程联合解码未来视觉预测和动作序列,提升跨数据集和传感器配置的泛化能力,减少碰撞率和误差。

Comments Accepted to ECCV 2026. 30 pages, 12 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 3 篇

2602.05275 2026-07-02 cs.CV 版本更新 85%

Magic-MM-Embedding: Towards Visual-Token-Efficient Universal Multimodal Embedding with MLLMs

Magic-MM-Embedding: 面向视觉令牌高效的多模态大语言模型通用嵌入

Qi Li, Yanzhe Zhao, Yongxin Zhou, Yameng Wang, Yandong Yang, Yuanjia Zhou, Jinxiang Liu

机构 * Honor Device Co., Ltd., China(荣耀终端有限公司,中国)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出Magic-MM-Embedding,通过视觉令牌压缩架构和多阶段渐进训练策略,在通用多模态嵌入中实现高效率和最先进性能。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07221 2026-07-02 cs.CV 版本更新 85%

Histopathology Multi-modal Embedding for Pathology Composed Retrieval

病理学组合检索的组织病理学多模态嵌入

Qifeng Zhou, Wenliang Zhong, Thao M. Dang, Hehuan Ma, Saiyang Na, Yuzhi Guo, Junzhou Huang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 跨模态检索 :multi-modal(title);MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 提出HOMIE框架,将生成式多模态大语言模型适配为病理检索专家,解决组合查询中的架构、任务和领域不匹配问题,在病理组合检索基准上显著优于现有方法。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 70%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 1 篇

2504.06299 2026-07-02 eess.IV cs.CV cs.LG stat.AP 版本更新 57%

Explainability in mulimodal deep transformation models for stroke outcome prediction

多模态深度转换模型在卒中结局预测中的可解释性

Lisa Herzog, Jonas Brändli, Maurice Schneeberger, Loran Avci, Nordin Dari, Martin Hänsel, Hakim Baazaoui, Pascal Bühler, Susanne Wegener, Beate Sick

机构 * University Hospital Zurich, Department of Neurology(苏黎世大学医院神经内科) Zurich University of Applied Sciences, Institute of Data Analysis and Process Design (IDP)(苏黎世应用科学大学数据分析与流程设计研究所) University of Zurich, Epidemiology, Biostatistics and Prevention Institute (EBPI)(苏黎世大学流行病学、生物统计学与预防研究所) Thurgau Institute for Digital Transformation (TIDIT)(图尔高数字转型研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出多模态深度转换模型,结合统计方法和神经网络,通过改进Grad-CAM和Occlusion实现图像分支的可解释性,在卒中功能结局预测中达到AUC 0.81。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 8 篇

2505.19614 2026-07-02 cs.LG cs.CV 版本更新 79%

Multiplicity is an Inevitable and Inherent Challenge in Multimodal Learning

多重性是多模态学习中不可避免且固有的挑战

Sanghyuk Chun, Olga Russakovsky

机构 * Princeton University(普林斯顿大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本文论证多模态数据固有的多对多映射关系(多重性)是影响数据构建、模型训练和评估的根本瓶颈,并呼吁发展多重性感知的学习框架与评估协议。

Comments ICML 2026 Position Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-07-02 cs.CV 版本更新 70%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: https://genintel.github.io/SOCO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17920 2026-07-02 cs.CV 版本更新 70%

SegFly: A Dataset and 2D-3D-2D Paradigm for Aerial RGB-Thermal Semantic Segmentation at Scale

SegFly:大规模航空RGB-热红外语义分割的数据集与2D-3D-2D范式

Markus Gross, Sai Bharadhwaj Matha, Rui Song, Viswanathan Muthuveerappan, Conrad Christoph, Julius Huber, Daniel Cremers

机构 * Fraunhofer Institute IVI(弗劳恩霍夫交通与基础设施系统研究所) TU Munich(慕尼黑工业大学) MCML(慕尼黑机器学习中心) UCLA(加州大学洛杉矶分校) Uni Cambridge(剑桥大学)

专题命中 多模态评测 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对航空RGB-T数据集规模小、标注成本高和对齐困难的问题,提出几何驱动的2D-3D-2D范式,通过少量RGB标注自动生成密集伪标签并实现跨模态对齐,构建含2万+RGB图像和1.5万+RGB-T对的SegFly基准,实验表明该范式有效提升分割性能。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11103 2026-07-02 cs.AI cs.CL cs.SE 版本更新 62%

GameDevBench: Evaluating Agentic Capabilities Through Game Development

GameDevBench: 通过游戏开发评估智能体能力

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten, Qiuhong Anna Wei, Runkun Chen, Alexander Wang, Valerie Chen, Ameet Talwalkar, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 提出GameDevBench基准,包含333个游戏开发任务,评估智能体在多模态软件开发中的能力,发现最佳智能体仅解决53.8%任务,并引入视觉反馈机制提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23365 2026-07-02 cs.CV 版本更新 57%

SpatialMosaic: A Multiview VLM Dataset for Partial Visibility

SpatialMosaic:一个多视角VLM数据集用于部分可见性

Kanghee Lee, Jungi Hong, Sion Lee, Injae Lee, Minseok Kwak, Kwonyoung Ryu, Jaesik Park

机构 * Seoul National University(首尔大学) University College London(伦敦大学学院) Kyung Hee University(庆熙大学) POSTECH(浦项科技大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SpatialMosaic数据集,通过多视角图像生成2M问答对,引入SpatialMosaic-Bench基准测试,结合3D重建模型的混合框架提升空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19889 2026-07-02 cs.CV 版本更新 57%

OmniFall: From Staged Through Synthetic to Wild, A Unified Multi-Domain Dataset for Robust Fall Detection

OmniFall: 从舞台到合成再到真实场景,一个用于鲁棒跌倒检测的统一多域数据集

David Schneider, Zdravko Marinov, Moritz Mistol, Zeyun Zhong, Alexander Jaus, Rodi Düger, Rafael Baur, M. Saquib Sarfraz, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Mercedes-Benz Tech Innovation(梅赛德斯-奔驰技术创新)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 提出OmniFall统一基准,包含15k视频(80小时)的帧级标注,覆盖舞台、合成和真实三个域,评估微调模型和零样本多模态大模型,发现合成数据微调模型在跌倒状态检测上显著优于零样本模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 57%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新 57%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 1 篇

2603.12056 2026-07-02 cs.AI cs.CL 版本更新 81%

XSkill: Continual Learning from Experience and Skills in Multimodal Agents

XSkill: 多模态智能体中的经验与技能持续学习

Guanyu Jiang, Zhaochen Su, Xiaoye Qu, Yi R. Fung

机构 * Zhejiang University(浙江大学)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出XSkill双流框架,通过视觉经验与技能的知识提取、检索和自适应,实现多模态智能体在开放场景中无需参数更新的持续学习,显著提升工具使用和推理泛化能力。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 2 篇

2605.01896 2026-07-02 cs.CV 版本更新 79%

Divide and Conquer: Decoupled Representation Alignment for Multimodal World Models

分而治之:多模态世界模型的解耦表示对齐

Junyuan Xiao, Dingkang Liang, Xin Zhou, Yixuan Ye, Tongtong Su, Guangmo Yi, Bin Xia, Qiang Lyu, Shurui Shi, Jun Huang, Jianlou Si, Wenming Yang

机构 * Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) CSU(中南大学) ZJU(浙江大学) CUHK(香港中文大学) UCAS(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 多模态训练与对齐 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 提出M²-REPA方法,通过解耦扩散模型中间表示中的模态特定特征并与对应的专家基础模型对齐,实现多模态视频生成中多种基础模型先验的充分利用,显著提升视觉质量和长期一致性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00654 2026-07-02 cs.CV 版本更新 57%

RC-GeoCP: Geometric Consensus for Radar-Camera Collaborative Perception

RC-GeoCP:雷达-相机协同感知的几何一致性

Xiaokai Bai, Lianqing Zheng, Runwei Guan, Siyuan Cao, Songkai Wang, Huiliang Shen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Automotive Studies, Tongji University(同济大学汽车学院) Thrust of Artificial Intelligence, Hong Kong University of Science and Technology(香港科技大学人工智能研究所)

专题命中 多模态训练与对齐 :multi-modal(abstract);分类 cs.CV

AI总结 提出首个4D雷达与相机协同感知框架RC-GeoCP,通过雷达锚定几何一致性解决深度模糊和空间分散导致的错位,实现高效通信与全局一致表示。

Comments 11 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他多模态 1 篇

2512.24152 2026-07-02 math.ST cs.LG stat.ML stat.TH 版本更新 50%

Fast Score-Based Sampling via Log-Concave Reductions

基于对数凹约简的快速分数采样

M. J. Wainwright

专题命中 其他多模态 :multi-modal(abstract)

AI总结 提出将分数扩散采样问题约简为一系列强对数凹子问题,利用任意强对数凹采样器实现高效采样,并给出采样复杂度界限。

Comments Accepted to the COLT 2026 Conference, San Diego, CA

详情

展开后加载摘要…

URL PDF HTML 收藏