arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-07-17 至 2026-07-17 共收录 71 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 10 篇

2607.14510 2026-07-17 cs.AI 新提交 89%

VLT: A Vision-Language-Time Series Multimodal Foundation Model for Industrial Intelligence

VLT:用于工业智能的视觉-语言-时间序列多模态基础模型

Haiteng Wang, Jingheng Yan, Xiaokang Wang, Lei Ren

机构 * School of Automation Science and Electrical Engineering, Beihang University(北京航空航天大学自动化科学与电气工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) State Key Laboratory of Intelligent Manufacturing System Technology(智能制造系统技术国家重点实验室) School of Computer Science and Artificial Intelligence, Zhengzhou University(郑州大学计算机科学与人工智能学院)

专题命中 图文多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 针对工业时间序列单模态建模局限及连接时间序列与文本语义的挑战,提出VLT多模态基础模型,通过设计Time-MoE等机制联合建模多种模态,经实验验证其在多种复杂设置下优于现有方法,提升了鲁棒性和泛化能力。

Comments 18 pages, 13 figures, and 13 tables, including supplementary material. Haiteng Wang and Jingheng Yan contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 87%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 图文多模态 :MLLM(summary_cn,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV、cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14721 2026-07-17 cs.CV cs.LG 新提交 70%

Multimodality as Supervision: Self-Supervised Specialization to the Test Environment via Multimodality

多模态作为监督:通过多模态进行自监督的测试环境特化

Kunal Pratap Singh, Ali Garjani, Rishubh Singh, Muhammad Uzair Khattak, Efe Tarhan, Jason Toskov, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

机构 * Swiss Federal Institute of Technology Lausanne (EPFL)(瑞士洛桑联邦理工学院)

专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 研究利用跨模态学习机制,提出在特定测试环境下的受限设置并开发TST方法,通过在测试环境收集多模态数据自监督预训练模型,评估其在下游任务的表现,发现可减少对外部大规模数据集预训练的依赖。

Comments Project page: https://tst-vision.epfl.ch/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14635 2026-07-17 cs.AI cs.CV cs.RO 新提交 62%

Action QFormer: Structured Representation Shaping under Action Supervision in Vision-Language-Action Models

动作QFormer:视觉-语言-动作模型中动作监督下的结构化表示塑造

Yufeng Ji, Wenhao Tang, Haoyi Niu, Koushil Sreenath, Yi Wu, Zhongyu Li

机构 * Shanghai Qizhi Institute(上海期智研究院) The Chinese University of Hong Kong(香港中文大学) Hong Kong Embodied AI Lab(香港具身人工智能实验室) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究视觉-语言-动作模型中动作监督问题,提出动作QFormer,通过基于指令的查询重组多模态信息。在零样本模拟到真实导航中提升了任务成功率、动作生成正确性等,还改变动作监督塑造多模态表示的方式,为提高VLA性能提供新思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14631 2026-07-17 cs.CV cs.AI 新提交 62%

Knowing You at First Glance: Inferring Apparent Personality from Faces

一眼识你:从面部推断表面人格

Shuhuan Chen, Xiangyu Zhu, Weisong Zhao, Haichao Shi, Xiao-Yu Zhang, Zhen Lei

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, UCAS(中国科学院大学网络空间安全学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science & Innovation, CAS(中国科学院香港创新研究院人工智能与机器人中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, M.U.S.T(澳门科技大学创新工程学院计算机科学与工程系)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究从面部图像推断表面人格,提出GlanceFace框架,利用视觉语言模型、语义增强模块及不确定性感知学习策略,在基于MBTI的基准测试中表现出色,揭示面部特征与人格特质关系,助力具身智能体交互策略。

Comments Accepted by The 9th Chinese Conference on Pattern Recognition and Computer Vision, PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14581 2026-07-17 cs.AI cs.CV 新提交 62%

Multi-LLM Collaborative MRI Report Generation for Visual Instruction Tuning in Brain Oncology

用于脑肿瘤视觉指令微调的多语言模型协作式MRI报告生成

Sinyoung Ra, Jonghun Kim, Hyunjin Park

专题命中 图文多模态 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 针对脑肿瘤缺乏配对3D成像 - 文本数据问题,提出用多语言模型协作创建3D图像 - 文本数据集,构建VLM将MRI扫描转换为令牌并与文本指令对齐,该方法在报告生成等任务中表现优于其他方法,有助于脑肿瘤诊断治疗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14974 2026-07-17 cs.CV cs.CR 新提交 57%

On Success and Simplicity: A Second Look at Transferable Vision-Language Attack Pipeline

关于成功与简洁:对可转移视觉语言攻击管道的再审视

Yuchen Ren, Zhengyu Zhao, Chenhao Lin, Bo Yang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University(西安交通大学网络空间安全学院) State Key Laboratory of Mathematical Engineering and Advanced Computing, Information Engineering University(信息工程大学数学工程与先进计算国家重点实验室)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV

AI总结 研究视觉语言预训练模型对抗攻击,指出现有复杂攻击管道可简化。提出SimVLA管道解决问题,经实验验证在可转移性和效率上优于基线,强调利用领域知识的重要性,为未来扩展提供简单有效主干。

Comments Accepted for publication in IEEE Transactions on Information Forensics and Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14737 2026-07-17 cs.CV cs.LG 新提交 57%

GeoDetect: Geometric Adversarial Detection for VLPs

GeoDetect:用于视觉语言预训练模型的几何对抗检测

Afsaneh Hasanebrahimi, Hanxun Huang, Christopher Leckie, James Bailey, Sarah Erfani

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究视觉语言预训练模型易受对抗攻击问题,基于其嵌入空间几何结构特点,提出GeoDetect方法,利用几何分数识别对抗样本,经综合评估,该方法能可靠检测多种VLP架构及威胁设置下的对抗样本,提升模型安全性与可靠性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14125 2026-07-17 cs.LG cs.CV 新提交 57%

CARPRT: Class-Aware Zero-Shot Prompt Reweighting for Black-Box Vision-Language Models

CARPRT:用于黑盒视觉语言模型的类感知零样本提示重加权

Ruijiang Dong, Zesheng Ye, Jianzhong Qi, Lei Feng, Feng Liu, Gang Niu, Masashi Sugiyama

机构 * University of Melbourne(墨尔本大学) Southeast University(东南大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) The University of Tokyo(东京大学)

专题命中 图文多模态 :image-text(abstract);分类 cs.CV

AI总结 研究针对预训练视觉语言模型零样本图像分类中提示与类独立性假设不成立的问题,提出类感知零样本提示重加权方法CARPRT,通过无训练方式量化提示与类的相关性并调整权重,实验表明该方法优于现有方法。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05754 2026-07-17 cs.RO 版本更新 50%

Safe-Night VLA: Seeing the Unseen via Thermal-Perceptive Vision-Language-Action Models for Safety-Critical Manipulation

Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作

Dian Yu, Qingchuan Zhou, Bingkun Huang, Majid Khadiv, Zewen Yang

机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))

专题命中 图文多模态 :multimodal(abstract)

AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 3 篇

2607.15265 2026-07-17 cs.CV cs.AI cs.MM cs.SD 新提交 80%

SceneBind: Binding What and Where Across Vision, Audio and Language

SceneBind:跨视觉、音频和语言绑定“什么”与“哪里”

Mingfei Chen, Zijun Cui, Ruoke Zhang, Hyeonggon Ryu, Eli Shlizerman

机构 * University of Washington(华盛顿大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 音频语音多模态 :cross-modal(abstract);audio-visual(abstract);omni-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 研究提出SceneBind全模态场景表示,结合全局语义与对象中心语义空间插槽解决空间结构缺失问题,还提出匹配方案。通过构建新数据集及训练协议进行训练评估,兼容预训练编码器,实现先进检索并能零样本转移到下游任务。

Comments Project website: https://scenebind.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15280 2026-07-17 cs.HC 版本更新 78%

Supporting Multimodal Data Interaction on Refreshable Tactile Displays: An Architecture to Combine Touch and Conversational AI

在可刷新触觉显示器上支持多模态数据交互:一种将触觉与对话式AI结合的架构

Samuel Reinders, Munazza Zaib, Matthew Butler, Bongshin Lee, Ingrid Zukerman, Lizhen Qu, Kim Marriott

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本文提出了一种结合触觉与对话式AI的架构,用于在可刷新触觉显示器上实现多模态数据交互,通过融合触觉输入与语音语言,提升视障人士的数据可视化体验。

Comments Accepted to be presented at IEEE PacificVis 2026; Best Paper Award (VisNotes track); Replacement: external DOI added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14182 2026-07-17 cs.RO cs.AI 新提交 57%

Semantic Audio-driven Understanding for Dynamic Humanoid Whole Body Control

用于动态人形机器人全身控制的语义音频驱动理解

J. M. A. Marcelo, M. Brienza, E. Bugli, L. Comito, D. Nardi, D. D. Bloisi, V. Suriani

机构 * Sapienza University of Rome(罗马第一大学) International University of Rome(罗马国际大学)

专题命中 音频语音多模态 :multi-modal(abstract);分类 cs.AI

AI总结 研究针对人形机器人自主性和动态环境响应受限问题,提出语义音频驱动的多模态编排框架,通过处理音频流、结合音乐与语音输入及强化学习控制,验证了该方法在模拟和实体机器人上的有效性。

Comments Accepted at 29th Robocup International Symposium, held on July 6th, 2026 in Incheon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 2 篇

2607.14935 2026-07-17 cs.CV 新提交 79%

VideoChat3: Fully Open Video MLLM for Efficient and Generalist Video Understanding

VideoChat3:用于高效通用视频理解的全开放视频多模态语言模型

Xinhao Li, Yuhan Zhu, Xiangyu Zeng, Yuhao Dong, Haoning Wu, Zhiqiu Zhang, Yuandong Yang, Changlian Ma, Qingyu Zhang, Yansong Shi, Xinyu Chen, Haoran Chen, Zizheng Huang, Jun Zhang, Kun Ouyang, Lin Sui, Ziang Yan, Yicheng Xu, Chenting Wang, Yinan He, Hongjie Zhang, Yi Wang, Yu Qiao, Yali Wang, Ziwei Liu, Kai Chen, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) Peking University(北京大学)

专题命中 视频多模态 :MLLM(title,abstract);分类 cs.CV

AI总结 研究针对视频理解开源模型局限,提出VideoChat3。通过I3D-ViT等提升效率,利用可扩展视频数据合成管道生成训练数据集提升泛化性,以4B参数在多基准测试中超越同等或更多参数的开源模型,实现泛化与计算效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16209 2026-07-17 cs.CV cs.LG 57%

VideoGAN-based Trajectory Proposal for Automated Vehicles

基于VideoGAN的自动车辆轨迹提案

Annajoyce Mariani, Kira Maag, Hanno Gottschalk

机构 * Technical University of Berlin(柏林技术大学) Heinrich-Heine-University(海因里希-海涅大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出基于VideoGAN的自动车辆轨迹生成方法,利用BEV视频训练生成对抗网络,以提高轨迹生成的准确性和现实感。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 10 篇

2607.15094 2026-07-17 cs.CV cs.LG 新提交 85%

AlphaWiSE: Adaptive Weight Interpolation for Continual Multimodal Representation Learning

AlphaWiSE:用于连续多模态表示学习的自适应权重插值

Sarthak Jain, Qiran Hu, Zhen Zhu, Yaoyao Liu

机构 * Google DeepMind(谷歌DeepMind)

专题命中 跨模态检索 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV

AI总结 研究连续多模态表示学习中跨模态对齐被破坏的问题,提出AlphaWiSE方法,通过事后权重空间插值,由两个冻结源检查点拟合系数实现插值检查点,在多模态检索实验中相比基线有持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09331 2026-07-17 cs.MM cs.AI cs.LG 版本更新 84%

Conan-embedding-v3: Fusing Modality-Specific Models for Omni-Modal Embedding

Conan-embedding-v3: 融合模态特定模型实现全模态嵌入

Shiyu Li, Zhiyuan Hu, Yifan Wang, Peiming Li, Zheng Wei, Yang Tang

机构 * Tencent(腾讯)

专题命中 跨模态检索 :omni-modal(title,abstract);multi-modal(abstract);分类 cs.AI、cs.MM

AI总结 提出解耦-融合-恢复框架,通过独立训练模态专家并融合任务向量,再使用投影器恢复和平衡多模态重演解决投影器漂移问题,实现单一骨干网络支持文本、图像、视频、文档和音频检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14568 2026-07-17 cond-mat.other cs.AI 新提交 79%

A Modern Multimodal Assistant on a 6 GB 2011 GPU: Stage-Validated, All-GPU CUDA Inference for Fermi

在6GB 2011 GPU上的现代多模态助手:针对费米架构的阶段验证、全GPU CUDA推理

A. C. Opus, J. Q. Lu

机构 * Department of Physics, University of Puerto Rico(物理系,波多黎各大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.AI

AI总结 研究在6GB 2011费米GPU上部署MiniCPM-V-4.6多模态助手,通过构建全GPU引擎、移植验证视觉部分、优化长上下文处理等方法,实现了高效的推理,能在1.7秒内端到端回答图像问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22280 2026-07-17 cs.CV 版本更新 79%

Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings

超越思维链:重写作为生成式多模态嵌入的通用接口

Peixi Wu, Ke Mei, Feipeng Ma, Bosong Chai, Zhibin Lan, Chenxi Zhao, Shannan Yan, Jie Chen, Zhangchi Hu, Yansong Peng, Bo Lin, Junjie Zhou, Dacheng Yin, Tianyi Wang, Fengyun Rao, Jing Lyu, Hebei Li, Xiaoyan Sun

机构 * WeChat Vision, Tencent Inc.(腾讯微信视觉部) Zhejiang University(浙江大学) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对思维链推理在检索中产生冗余和语义歧义的问题,提出重写驱动的多模态嵌入框架RIME,联合优化生成与嵌入,并通过跨模态对齐和精炼强化学习实现高效准确的检索。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14995 2026-07-17 cs.LG q-bio.QM 新提交 78%

Multimodal Semantic-Aware Contrastive Learning For False Negative Mitigation in 3D Medical Imaging

用于减轻 3D 医学成像中假阴性的多模态语义感知对比学习

Sara Ketabi, Matthias W. Wagner, Cynthia Hawkins, Uri Tabori, Birgit Betina Ertl-Wagner, Farzad Khalvati

机构 * University of Toronto(多伦多大学) The Hospital for Sick Children(病童医院) Vector Institute(向量研究所) University Hospital Augsburg(奥格斯堡大学医院)

专题命中 跨模态检索 :multimodal(title,abstract)

AI总结 研究针对3D医学成像中假阴性问题,提出多模态语义感知对比学习框架MseaCL,通过纳入放射学报告语义相似性作指导信号,经实验验证该框架用于预训练可提升下游任务表现,如儿科脑肿瘤分子分类AUC至少增22.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14264 2026-07-17 cs.CV cs.CL 新提交 76%

MonteRET: AI Agent Enhancing Multimodal LLMs with Multi-granularity Knowledge Retrieval for Chest CT Report Generation

MonteRET:通过多粒度知识检索增强多模态大语言模型以生成胸部CT报告的人工智能代理

Yi Lin, Yihao Ding, Elana Benishay, Elefterios Trikantzopoulos, David Nauheim, Hanley Ong, Jiang Bian, Hua Xu, Yuzhe Yang, George Shih, Yifan Peng

机构 * Weill Cornell Medicine(威尔康乃尔医学院) University of Western Australia(西澳大利亚大学) Indiana University(印第安纳大学) Regenstrief Institute(瑞根斯特里夫研究所) Yale University(耶鲁大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 跨模态检索 :multimodal(title);分类 cs.CV、cs.CL

AI总结 研究针对自动生成胸部CT报告的挑战,提出MonteRET框架,它整合多种特征,通过知识检索和报告重写代理完善报告。经训练和评估,该框架在多方面提升了报告质量,相比其他方法有显著优势,获放射科住院医师青睐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12477 2026-07-17 cs.AI cs.LG 版本更新 70%

DualHNIE: Dual-Channel Hypergraph Learning for Node Importance Estimation in Heterogeneous Knowledge Graphs

MetaHGNIE:异构知识图谱中的元路径诱导超图对比学习

Jiawen Chen, Yanyan He, Qi Shao, Mengli Wei, Duxin Chen, Wenwu Yu, Yanlong Zhao

机构 * Jiangsu Key Laboratory of Networked Collective Intelligence, School of Mathematics, Southeast University(江苏网络集体智能重点实验室,数学学院,东南大学) Jiangsu Key Laboratory of Networked Collective Intelligence, School of Cyber Science and Engineering, Southeast University(江苏网络集体智能重点实验室,网络科学与工程学院,东南大学) State Key Laboratory of Mathematical Sciences, Academy of Mathematics and Systems Science, University of Chinese Academy of Sciences(数学科学国家重点实验室,数学与系统科学研究院,中国科学院大学)

专题命中 跨模态检索 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 研究异构知识图谱中节点重要性估计问题,提出DualHNIE框架,通过构建高阶知识图谱、引入互补编码器及对比对齐机制进行显式高阶建模和解缠双通道表示学习,实验验证其优于现有方法。

Comments Accepted by IEEE Transactions on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14115 2026-07-17 cs.AI cs.CL cs.CV 新提交 67%

DialogueVPR: Towards Conversational Visual Place Recognition

DialogueVPR:迈向对话式视觉场所识别

Yukun Song, Changwei Wang, Xingtian Pei, Shibiao Xu, Wenhao Xu, Shunpeng Chen, Yu Zhang, Ke Zhang, Rongtao Xu, Xuxiang Feng, Pengyang Wang

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) Shandong Computer Science Center, Qilu University of Technology(山东省计算中心(国家超级计算济南中心),齐鲁工业大学) Macquarie University(麦考瑞大学) Spatialtemporal AI(时空人工智能公司) University of Macau(澳门大学) Aerospace Information Research Institute(航天信息研究所)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 研究针对语言引导地理定位中现有方法不足,提出DlgPR,将场所识别转为对话驱动推理过程。构建DlgQuest-Cities基准及统一推理框架,用课程训练DQ-pilot,通过特定指标指导学习并实验,该方法显著优于基线。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14256 2026-07-17 cs.AI cs.MA 新提交 57%

Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation

基于多级智能数据管理的自动硬示例合成

Genglin Liu, Muye Zhang, Krishnamurthy Viswanathan, Nichole J. Hansen, Blaž Bratanič, Nathan L Clement, Shalini Ghosh, Ariel Fuxman

机构 * UCLA(加州大学洛杉矶分校) Google(谷歌)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究多模态大语言模型在内容安全审核任务中易受攻击的问题,提出自动智能红队框架,利用多智能体架构合成对抗示例,无需人工干预,提高模型鲁棒性,降低公共图像安全基准中的误报率。

Comments 23 pages; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15267 2026-07-17 cs.CR cs.CL 版本更新 57%

When Machine Unlearning Meets Retrieval-Augmented Generation (RAG): Keep Secret or Forget Knowledge?

当模型遗忘遇上检索增强生成(RAG):保守秘密还是遗忘知识?

Shang Wang, Tianqing Zhu, Dayong Ye, Wanlei Zhou

机构 * School of Computer Science, University of Technology Sydney(悉尼科技大学计算机科学学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 研究大语言模型训练中敏感信息保留问题,提出基于检索增强生成(RAG)技术的轻量级行为遗忘框架,通过修改外部知识库模拟遗忘,经实验验证该方法符合五个关键遗忘标准,还可扩展到多模态模型和智能体。

Comments This paper is accepted by IEEE Transactions on Dependable and Secure Computing 2025. The source code is available at \url{https://github.com/shihe98/RAG_Unlearning}

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2505.16839 2026-07-17 cs.CV 版本更新 83%

LaViDa: A Large Diffusion Language Model for Multimodal Understanding

LaViDa:用于多模态理解的大型扩散语言模型

Shufan Li, Konstantinos Kallidromitis, Hritik Bansal, Akash Gokul, Yusuke Kato, Kazuki Kozuka, Jason Kuen, Zhe Lin, Kai-Wei Chang, Aditya Grover

机构 * UCLA(加州大学洛杉矶分校) Panasonic AI Research(松下人工智能研究) Adobe Research(Adobe研究) Salesforce Research(Salesforce研究)

专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);分类 cs.CV

AI总结 研究针对现有视觉语言模型在快速推理和可控生成方面的不足,提出基于离散扩散模型构建 LaViDa 系列视觉语言模型,采用多种新技术,在多模态基准测试中性能出色,成为自回归视觉语言模型的有力替代。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14008 2026-07-17 cs.CV 版本更新 79%

Sparse-LaViDa: Sparse Multimodal Discrete Diffusion Language Models

稀疏-LaViDa:稀疏多模态离散扩散语言模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 针对掩码离散扩散模型推理速度慢的问题,提出Sparse-LaViDa框架,通过动态截断冗余掩码令牌加速采样,引入专用寄存器令牌和注意力掩码保证质量与一致性,基于LaViDa - O构建,在多任务中实现加速且保持质量。

Comments 18 pages (12 pages for the main paper and 6 pages for the appendix), 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19244 2026-07-17 cs.CV 版本更新 79%

Lavida-O: Elastic Large Masked Diffusion Models for Unified Multimodal Understanding and Generation

Lavida-O:用于统一多模态理解与生成的弹性大掩码扩散模型

Shufan Li, Jiuxiang Gu, Kangning Liu, Zhe Lin, Zijun Wei, Aditya Grover, Jason Kuen

机构 * Adobe(Adobe公司) UCLA(加州大学洛杉矶分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 研究提出Lavida-O统一多模态MDM,采用Elastic-MoT架构,结合轻量级生成与理解分支,通过多种技术支持高效生成。该模型在多模态任务基准测试中性能领先,优于现有模型,还能加速推理,成为可扩展多模态推理和生成新范式。

Comments 31 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14681 2026-07-17 cs.CV 新提交 70%

ReBind: Multi-Reference Video Editing via Structured Instructions with Explicit Reference Relationships

ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑

Xinyu Liu, Shihao Li, Weihong Lin, Xinlong Chen, Yang Shi, Yujin Han, Yiyang Cai, Yanghao Wang, Ruibin Yuan, Yuanxing Zhang, Pengfei Wan, Wenhan Luo, Yike Guo

机构 * HKUST(香港科技大学) Kling Team(克林团队) NJU(南京大学) UCAS(中国科学院大学) PKU(北京大学) HKU(香港大学)

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。

Comments Project Page: https://rebind-mrv2v.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14202 2026-07-17 cs.CV 新提交 70%

KeyFrame-Compass: Towards Comprehensive Evaluation of Keyframe-Conditioned Video Generation

关键帧指南针:迈向对关键帧条件视频生成的全面评估

Yuqi Tang, Tengfei Liu, Yizheng Lai, Yuran Wang, Yang Shi, Wanshun Su, Zhuoran Zhang, Qixun Wang, Xiaohan Zhang, Xinlei Yu, Xuehai Bai, Xuanyu Zhu, Bohan Zeng, Bozhou Li, Shujie Li, Yifan Dai, Yujie Wei, Shixuan Liu, Haotian Wang, Jialu Chen, Yuanxing Zhang

专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。

Comments 35 pages

详情

展开后加载摘要…

URL PDF HTML 收藏