arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-04-15 至 2026-04-15 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 5 篇

2604.12820 2026-04-15 cs.AI cs.CL 73%

RePAIR: Interactive Machine Unlearning through Prompt-Aware Model Repair

RePAIR:通过提示感知模型修复实现交互式机器去学习

Jagadeesh Rachapudi, Pranav Singh, Ritali Vatsi, Praful Hambarde, Amit Shukla

机构 * Indian Institute of Technology Mandi(印度理工学院曼迪)

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RePAIR框架,通过提示感知模型修复实现用户交互式机器去学习,解决大语言模型在预训练中吸收有害知识、虚假信息和隐私数据的问题,实现用户自主控制数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12622 2026-04-15 cs.CV cs.AI cs.NI 62%

Efficient Semantic Image Communication for Traffic Monitoring at the Edge

边缘交通监控中的高效语义图像通信

Damir Assylbek, Nurmukhammed Aitymbetov, Marko Ristin, Dimitrios Zorbas

机构 * Nazarbayev University, School of Engineering & Digital Sciences(纳扎尔拜耶夫大学工程与数字科学学院) Zurich University of Applied Sciences (ZHAW)(苏黎世应用科学大学(ZHAW))

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MMSD和SAMR两种语义图像通信管道,通过压缩和加密实现高效传输,同时保持视觉信息。MMSD用语义表示替代原始图像,SAMR通过语义重要性选择性抑制区域,两者均采用边缘轻量处理与服务器重计算的异构架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12353 2026-04-15 cs.CV 57%

Combating Pattern and Content Bias: Adversarial Feature Learning for Generalized AI-Generated Image Detection

对抗模式与内容偏差:面向通用AI生成图像检测的对抗性特征学习

Haifeng Zhang, Qinghui He, Xiuli Bi, Bo Liu, Chi-Man Pun, Bin Xiao

机构 * Chongqing Key Laboratory of Image Cognition, School of Computer Science and Technology, Chongqing University of Posts and Telecommunications(重庆图像认知重点实验室,重庆邮电大学计算机科学与技术学院) Faculty of Science and Technology of the University of Macau(澳门大学科学与技术学院) Jinan Inspur Data Technology Co., Ltd.(济南 Inspur 数据科技有限公司)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本文提出MAFL框架,通过对抗性学习减少生成图像检测中的模式与内容偏差,提升跨模型泛化能力,实验表明其在准确率和AP上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08209 2026-04-15 cs.CL 57%

Generation-Augmented Generation: A Plug-and-Play Framework for Private Knowledge Injection in Large Language Models

生成增强生成:一种用于大语言模型私有知识注入的即插即用框架

Rongji Li, Jian Xu, Yi Chen, Xueqing Chen, Yisheng Yang, Jiayi Wang, Xingyu Chen, Chunyu Xie, Dawei Leng, Xu-Yao Zhang

机构 * MAIS, Institute of Automation, Chinese Academy of Sciences(自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy(中关村学院) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) AI Research(360人工智能研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文提出GAG框架,通过将私有专业知识作为辅助模态注入冻结的基础模型,解决私有知识注入中的效率与效果平衡问题,在科学和通用领域问答中均表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12992 2026-04-15 stat.ML cs.LG econ.EM 50%

Causal Diffusion Models for Counterfactual Outcome Distributions in Longitudinal Data

因果扩散模型用于纵向数据中的反事实结果分布

Farbod Alinezhad, Jianfei Cao, Gary J. Young, Brady Post

机构 * Department of Economics, Northeastern University(东北大学经济学系) Center for Health Policy and Healthcare Research, Northeastern University(东北大学健康政策与医疗研究中心) Department of Public Health and Health Sciences, Bouvé College of Health Sciences, Northeastern University(东北大学布维健康科学学院公共卫生与健康科学系)

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出因果扩散模型,用于生成在连续干预下的反事实结果分布,通过新颖的残差去噪架构和关系自注意力机制,提升了复杂时间依赖性和多模态结果轨迹的捕捉能力,同时在高混杂环境下实现了更高的分布准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏