arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-06-30 至 2026-06-30 共收录 151 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 音频语音多模态 8 篇

2606.30294 2026-06-30 cs.AI cs.HC cs.SE 57%

Rehearsed Multi-Agent Live Product Demonstrations with Real-Time Voice Question Answering

排练式多智能体实时语音问答产品演示

Rahul Khedar, Mayank Malhotra, Avinash Karn, Mouli V, Prakhar Mehrotra

机构 * PayPal AI

专题命中 音频语音多模态 :cross-modal(abstract);分类 cs.AI

AI总结 提出多智能体系统Rhetor,通过跨模态特征表示、接地脚本、排练循环和运行时同步,实现带语音问答的实时产品演示自动化。

Comments Preprint. 4 figures, 1 algorithm, 5 tables. Systems paper with a preliminary six-session case study on four deployed applications; full benchmark protocol proposed, corpus run to appear in a later revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03283 2026-06-30 eess.AS cs.SD 57%

SpeakerCard-1M: An Evidence-Grounded Corpus for In-the-Wild Speaker Verification

SpeakerCard-1M:面向野外说话人确认的基于证据的说话人卡片语料库

Junyi Peng, Oldřich Plchot, Xiao Song, Dading Chong, Lichun Fan, Hang Su, Themos Stafylakis, Junjie Li, Kong Aik Lee, Shuai Wang, Jian Luan, Jan Černocký

机构 * Brno University of Technology, Czechia(布拉格技术大学,捷克) Peking University, China(北京大学,中国) Xiaomi, China(小米,中国) Athens University of Economics and Business, Greece(雅典经济与商业大学,希腊) The Hong Kong Polytechnic University, Hong Kong(香港理工大学,香港) Nanjing University, China(南京大学,中国)

专题命中 音频语音多模态 :cross-modal(abstract);分类 eess.AS

AI总结 提出SpeakerCard-1M双语说话人资源,通过声学探针和受限LLM生成结构化说话人卡片,并定义跨模态协议以支持基于证据的说话人确认。

Comments Corpus and protocols at https://junyipeng00.github.io/SpeakerCard-1M-page

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频多模态 12 篇

2606.29900 2026-06-30 cs.CV cs.AI 81%

LLM-based Multimodal Personality Recognition via Facial Action Unit-Text Semantic Fusion

基于面部动作单元-文本语义融合的LLM多模态人格识别

Tianyi Zhang, Wei Shan, Yuan Zong, Tianhua Qi, Wenming Zheng

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于大语言模型的面部动作单元与文本语义融合框架,通过将AU序列转化为可解释文本描述并与受访者文本回答融合,实现异步视频面试中的人格识别,在AVI-6基准上取得更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29023 2026-06-30 cs.CV cs.AI 81%

Efficient Spatio-Temporal Grounding with Multimodal Large Models via Second-Level Tracking and RL Verification

基于二级跟踪和强化学习验证的多模态大模型高效时空定位

Tianshu Zhang, Yan Wang, Ji Qi, Lijie Wen

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 提出一种从帧级到秒级跟踪的流水线,结合跨秒平滑、链式思维轨迹合成和强化学习优化,在长视频中实现高效且准确的时空定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28514 2026-06-30 cs.AI cs.CL 81%

GPTNT: Benchmarking Real-Time Collaboration Between Multimodal Agents on Keep Talking And Nobody Explodes

GPTNT:在《保持通话,无人爆炸》中基准测试多模态智能体之间的实时协作

Amit Parekh, Sabrina McCallum, Kareem Al-Hasan, Malvina Nikandrou, Alessandro Suglia, Ioannis Konstas

机构 * Heriot-Watt University(赫瑞-沃德大学) University of Edinburgh(爱丁堡大学)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 提出GPTNT基准,基于合作游戏《保持通话,无人爆炸》测试多模态智能体在实时、信息不对称条件下的协作能力,发现当前最先进系统无法在实时中拆除任何炸弹。

Comments Project website and code at https://gptnt.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29504 2026-06-30 cs.CV cs.CR 79%

Empirical Evaluation of Multi-Modal Touch Detection in Over-the-Shoulder Video Surveillance

肩后视频监控中多模态触摸检测的实证评估

Mohammadreza Rashidi

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV

AI总结 本文评估了一种多模态触摸检测框架,用于从肩后视频中重建移动键盘按键事件,但实验表明在非受控场景下无法可靠重建击键。

Comments 9 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29136 2026-06-30 cs.CV cs.AI 79%

CMTFormer: Marrying Transformer with Hierarchical Information Interaction for RGB-Event Object Detection

CMTFormer:融合Transformer与层次化信息交互的RGB-事件目标检测

Yu Li, Yuenan Hou, Yingmei Wei, Jiangming Chen, Yanming Guo

专题命中 视频多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 提出CMTFormer,通过浅层对齐、中层增强和深层可学习融合的层次化交互机制,有效融合RGB帧与事件流,在DSEC-Detection和PKU-DAVIS-SOD基准上超越现有方法。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10359 2026-06-30 cs.CV cs.AI 73%

Tool-Augmented Spatiotemporal Reasoning for Streamlining Video Question Answering Task

增强工具的时空推理用于视频问答任务的优化

Sunqi Fan, Jiashuo Cui, Meng-Hao Guo, Shuojin Yang

机构 * BNRist, Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系,北京信息科学与技术国家研究中心)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出STAR框架和视频工具包,提升多模态大语言模型的时空推理能力,在VideoMME和LongVideoBench上分别提升8.2%和4.6%。

Comments Accepted by NeurIPS 2025 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30292 2026-06-30 cs.LG cs.CV 57%

DreamForge-World 0.1 Preview: A Low-Compute Real-Time Controllable World Model

DreamForge-World 0.1 Preview:一种低计算量实时可控世界模型

Daniyel Ayupov, Artur Markov-Tsoy

机构 * DreamForge AI Lab(DreamForge AI实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出DreamForge-World 0.1 Preview,一种基于自回归视频堆栈和残差动作路径的低计算量实时交互世界模型,支持消费级GPU运行和多种交互功能。

Comments Project page: https://trydreamforge.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29820 2026-06-30 cs.LG cs.AI 57%

Dual-Flow Reinforcement Learning with State-Aware Exploration

双流强化学习与状态感知探索

Qijun Li, Zheng Fu, Qi Song, Yifei He, Weitao Zhou, Kun Jiang, Diange Yang

机构 * State Key Laboratory of Intelligent Green Vehicle and Mobility, Tsinghua University(智能绿色车辆与移动国家重点实验室,清华大学) Tsinghua University-Toyota Joint Center(清华大学-丰田联合中心) Tsinghua University–SAIC GM Wuling Joint Research Center(清华大学-上汽通用五菱联合研究中心)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出Dual-Flow RL框架,利用条件流匹配联合建模回报分布和多模态策略,并引入熵-协方差探索调节器实现状态感知探索,在连续控制任务中达到最优性能。

Comments 12 pages, 6 figures, 1 table. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29384 2026-06-30 cs.CV cs.RO 57%

Event-VLA: Action-Conditioned Event Fusion for Robust Vision-Language-Action Model

Event-VLA: 基于动作条件的事件融合用于鲁棒的视觉-语言-动作模型

Jiaxin Liu, Xun Xu, Zhenhao Zhang, Hanqing Wang, Ruiqi Chen, Shi Chang, Weiyu Guo, Laurent Kneip

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对现有VLA模型在光照变化下鲁棒性不足的问题,提出Event-VLA框架,通过事件流作为光照鲁棒的运动敏感互补观测,利用动作查询路由和门控交叉注意力融合事件信息,提升低光及近黑暗环境下的操作成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14483 2026-06-30 cs.CV 57%

Vivid-VR: Distilling Concepts from Text-to-Video Diffusion Transformer for Photorealistic Video Restoration

Vivid-VR:基于文本到视频扩散变换器的文本概念蒸馏用于逼真视频修复

Haoran Bai, Xiaoxu Chen, Canqian Yang, Zongyao He, Sibin Deng, Ying Chen

机构 * Alibaba Group - Taobao & Tmall Group(阿里巴巴集团 - 淘宝天猫集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Vivid-VR,通过文本到视频基础模型生成视频修复方法,利用ControlNet控制生成过程以保持内容一致性。为解决传统微调中的分布偏移问题,提出概念蒸馏策略,通过预训练T2V模型合成带文本概念的训练样本,提升纹理和时间一致性。

Comments Accepted by ICLR 2026; ICLR version of the paper: https://openreview.net/pdf?id=YV5Zgv8pdg

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30318 2026-06-30 cs.RO 50%

Chronos: A Physics-Informed Full-History Framework for Non-Markovian Long-Horizon Manipulation

Chronos: 一种基于物理信息的全历史框架用于非马尔可夫长时域操作

Yulin Zhou, Yimeng Wang, Nengyu Wang, Shaojia Xing, Shiyun Tu, Xiang Li, Jingkai Zhang, Ningbo Jiang, Yuankai Lin, Hua Yang, Xiangrui Zeng, Zhouping Yin

机构 * School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 视频多模态 :multimodal(abstract)

AI总结 针对现有策略依赖马尔可夫假设导致记忆依赖任务失败的问题,提出Chronos框架,将观测历史作为策略潜状态,通过选择性状态空间模型传播因果历史状态,并利用二阶薛定谔桥预测加速度场,在16个模拟和4个真实任务中显著超越基线。

Comments 20 pages, 10 figures. Submitted to IEEE Transactions on Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO 50%

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

专题命中 视频多模态 :multimodal(abstract)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 跨模态检索 14 篇

2606.28350 2026-06-30 cs.IR cs.CV 87%

UniCA: Bi-directional Cross-Attention with Positive Similarity Loss for Robust Multi-Modal Retrieval

UniCA:具有正相似性损失的双向交叉注意力用于鲁棒多模态检索

Yini Huang, Wenlong Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southern Medical University(南方医科大学)

专题命中 跨模态检索 :multi-modal(title,abstract);multimodal(abstract);cross-modal(abstract);image-text(abstract)

AI总结 提出UniCA模型,通过双向交叉注意力块和正相似性损失增强跨模态语义对齐,在WebQA基准上混合任务Recall@5提升4.09%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28845 2026-06-30 cs.CV 85%

Personalizing MLLMs via Reinforced Multimodal Reference Game

通过强化多模态参考游戏个性化多模态大语言模型

Deepayan Das, Davide Talon, Yiming Wang, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·科塞勒基金会)

专题命中 跨模态检索 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出强化参考游戏(RRG)框架,通过对比游戏学习生成准确、有区分性的概念描述,在三个个性化基准上达到最先进性能。

Comments Accepted to ECCV26. Project page: https://deepayan137.github.io/papers/conversational-personalization.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29888 2026-06-30 cs.LG cs.CV 79%

Same Concept, Different Directions: Cross-Modal Feature Heterogeneity in Sparse Autoencoders

同一概念,不同方向:稀疏自编码器中的跨模态特征异质性

Chungpa Lee, Jihoon Kwon, Kyle Min, Jy-yong Sohn

专题命中 跨模态检索 :cross-modal(title,abstract);分类 cs.CV

AI总结 发现视觉-语言模型中同一概念在不同模态下的特征方向不一致(跨模态特征异质性),并提出训练模态特定稀疏自编码器后对齐对应特征的方法,提升重建保真度和跨模态检索与概念引导性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03253 2026-06-30 cs.CV 70%

LaVPR: Benchmarking Language and Vision for Place Recognition

LaVPR:语言与视觉用于位置识别的基准测试

Ofer Idan, Dan Badur, Yosi Keller, Yoli Shavit

专题命中 跨模态检索 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。

Comments Accepted to ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30196 2026-06-30 cs.CL cs.AI cs.LG eess.AS 67%

Forewarned is Forearmed: When Non-Sequential Embedding Turns Into an Anomaly Detector

有备无患:当非序列嵌入变成异常检测器

Elys Allesiardo, Antoine Caubrière, Valentin Vielzeuf

机构 * Orange Research(Orange研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 本文深入分析非序列多模态句子级嵌入(SONAR模型),发现某些嵌入维度对扰动敏感,可作为解码异常指标,并利用编解码一致性构建准确检测器,同时探索修正异常维度。

Comments Accepted for presentation at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29069 2026-06-30 cs.AI cs.CL cs.CV 67%

Low-cost concept-based localized explanations: How far can we get with training-free approaches?

低成本基于概念的可解释性:无训练方法能走多远?

Darian Fernández-Gutiérrez, Rafael Bello, Marilyn Bello, Natalia Díaz-Rodríguez

机构 * Dept. of Computer Science and Artificial Intelligence, University of Granada (UGR)(计算机科学与人工智能系,格拉纳达大学(UGR))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出零样本概念命名协议,利用中等规模多模态大模型对局部区域进行概念标注,无需训练即可实现62%-88%的物体级精确匹配,为低成本可解释AI提供新思路。

Comments 6 pages, 2 figures, 4 tables. Accepted at the 2026 IEEE International Conference on Artificial Intelligence (CAI), 8-10 May 2026, Granada, Spain. Code: https://github.com/darianfgUgr/CoNa

Journal ref 2026 IEEE International Conference on Artificial Intelligence (CAI), Granada, Spain, 2026, pp. 1405-1410

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 67%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28697 2026-06-30 cs.CV cs.CL 62%

Mitigating Batch Effects in Histopathology via Language-Mediated Robust Embedding Generation

通过语言介导的鲁棒嵌入生成减轻组织病理学中的批次效应

Yishu Zhang, Shushan Wu, Zhenzhong Zhang, Didong Li, Huaxiu Yao, Yun Li, Iain Carmichael, Katherine A. Hoadley, Hongtu Zhu, Di Wu, Daiwei Zhang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出GLMP框架,利用通用多模态大语言模型将组织学图像转化为文本表示,再生成数值嵌入,有效抑制批次效应,提升跨机构泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12282 2026-06-30 cs.CV cs.AI 62%

CytoCLIP: Learning Cytoarchitectural Characteristics in Developing Human Brain Using Contrastive Language Image Pre-Training

CytoCLIP:利用对比语言图像预训练学习发育人类大脑的细胞架构特征

Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 CytoCLIP通过对比语言图像预训练框架学习人类大脑细胞架构特征,通过低分辨率和高分辨率模型变体实现区域分类和跨模态检索,实验表明其在整体区域和高分辨率图像分类中表现优异。

Journal ref Neuroinformatics, Volume 24, article number 38 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29328 2026-06-30 cs.IR cs.AI 57%

Covering the Unseen: Information Demand Coverage Optimization for Retrieval-Augmented Generation

覆盖未见:面向检索增强生成的信息需求覆盖优化

Bingxue Zhang, Jianying Jia, Feida Zhu

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.AI

AI总结 针对复杂查询中top-k选择忽略关键子问题的问题,提出GeoRAG,通过多维度需求分布和Sinkhorn-Wasserstein距离优化上下文选择,实现无监督、免训练且与检索无关的覆盖优化,在六个开放域QA基准上提升6.5-7.5个EM点。

Comments 12 pages, 5 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26553 2026-06-30 cs.CV 57%

SemConFlow: Semantic Grounding of Holistic Co-Speech Gesture Generation with Contrastive Flow-Matching

HolisticSemGes: 语义 grounding 的整体共语手势生成与对比流匹配

Lanmiao Liu, Esam Ghaleb, Aslı Özyürek, Zerrin Yumak

机构 * Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Utrecht University(乌得勒支大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出一种基于对比流匹配的共语手势生成模型,通过引入不匹配的音频-文本条件作为负样本,确保跨模态一致性,并在BEAT2和SHOW数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06891 2026-06-30 cs.CV 57%

CLIMP: Contrastive Language-Image Mamba Pretraining

CLIMP:对比语言-图像Mamba预训练

Nimrod Shabtay, Itamar Zimerman, Eli Schwartz, Raja Giryes

机构 * Tel-Aviv University(特拉维夫大学) IBM Research(IBM研究院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 CLIMP是首个全Mamba架构的对比视觉语言模型,通过Mamba替代视觉和文本编码器,提升跨模态检索和鲁棒性,优于CLIP-ViT-B 7.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28483 2026-06-30 quant-ph 50%

Quantum Fourier Generative Models Trainable at Large Scale

可大规模训练的量子傅里叶生成模型

Cenk Tüysüz, Oleksandr Kyriienko, Michele Grossi

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 提出一种基于并行傅里叶特征映射和forrelation型量子电路的量子生成模型,利用基于Parseval恒等式的对数似然损失实现大规模训练,并通过逆量子傅里叶变换构建采样电路,在超过1000量子比特上验证了有效性。

Comments 12 pages, 6 figures; supplementary material 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态生成 17 篇

2606.29689 2026-06-30 cs.CL 89%

Can MLLMs Critique Like Humans? Evaluating Open-Ended Aesthetic Reasoning in Multimodal Large Language Models

MLLM 能否像人类一样进行批评?评估多模态大语言模型中的开放式审美推理

Sajjad Ghiasvand, Maryam Amirizaniani, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UCSB(加州大学圣塔芭芭拉分校) University of Washington(华盛顿大学) UCLA(加州大学洛杉矶分校)

专题命中 多模态生成 :MLLM(title_cn,abstract);multimodal(title,abstract);分类 cs.CL

AI总结 本文评估多模态大语言模型在开放式审美批评中的表现,发现基于参考的相似度指标存在误导,模型在选择性、特异性和多样性方面与人类批评存在系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19679 2026-06-30 cs.CV 83%

MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation

MMControl: 多模态控制用于联合音频视频生成

Liyang Li, Wen Wang, Canyu Zhao, Tianjian Feng, Zhiyue Zhao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学)

专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出MMControl,通过双流条件注入机制实现联合音频视频生成的多模态控制,支持视觉和听觉信号的精细控制,提升跨模态对齐效果。

Comments Accepted to ECCV 2026. Project page: https://aim-uofa.github.io/MMControl/

详情

展开后加载摘要…

URL PDF HTML 收藏