arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-03 至 2026-08-03 共收录 75 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 10 篇

2512.13677 2026-08-03 cs.CV 版本更新 79%

JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing

JoVA:联合视频音频生成的统一多模态学习

Xiaohu Huang, Haoyang He, Hao Zhou, Qiangpeng Yang, Shilei Wen, Kai Han

机构 * The University of Hong Kong(香港大学) ByteDance(字节跳动)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 JoVA通过联合自注意力机制和嘴巴区域损失,实现了高质量的视频音频生成,提升了嘴唇同步和语音质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16555 2026-08-03 cs.IR 版本更新 78%

MMGRec: Multimodal Generative Recommendation with Transformer Model

MMGRec: 基于Transformer模型的多模态生成推荐

Han Liu, Yinwei Wei, Xuemeng Song, Weili Guan, Yuan-Fang Li, Liqiang Nie

专题命中 多模态生成 :multimodal(title,abstract)

AI总结 MMGRec通过生成范式引入多模态推荐,利用分层量化和Transformer模型生成用户偏好的项目标识符,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19537 2026-08-03 cs.CV cs.AI cs.LG cs.MM cs.SD eess.AS 版本更新 70%

Deepfake Media Generation and Detection in the Generative AI Era: A Survey and Outlook

生成式AI时代的深度伪造媒体生成与检测:综述与展望

Florinel-Alin Croitoru, Andrei-Iulian Hiji, Vlad Hondru, Nicolae Catalin Ristea, Paul Irofti, Marius Popescu, Cristian Rusu, Radu Tudor Ionescu, Fahad Shahbaz Khan, Mubarak Shah

机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。

Comments Accepted in ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新 57%

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07339 2026-08-03 cs.AI cs.LG cs.RO 版本更新 57%

RAPiD: Reward-Guided Consistency Distillation of Diffusion Planners for Real-Time Autonomous Driving

RAPiD: 通过扩散行为先验实现安全高效的实时确定性轨迹规划

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * School of Information Technology, Monash University, Malaysia(墨尔本大学信息科技学院) Faculty of Information Technology, Monash University, Australia(墨尔本大学信息技术学院) TCS Research, India(印度TCS研究)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 RAPiD通过扩散行为先验实现高效安全的实时轨迹规划,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08022 2026-08-03 stat.ML cs.LG cs.NA math.NA math.PR math.ST stat.TH 版本更新 50%

Provable Diffusion Posterior Sampling for Bayesian Inversion

可证明的扩散后验采样用于贝叶斯反问题

Jinyuan Chang, Chenguang Duan, Yuling Jiao, Ruoxuan Li, Jerry Zhijian Yang, Cheng Yuan

专题命中 多模态生成 :multimodal(abstract)

AI总结 本文提出了一种基于扩散的可证明后验采样方法,通过数据学习分数以捕捉先验分布结构,并提供非渐近误差界以确保复杂多模态后验分布的收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态评测 12 篇

2607.23886 2026-08-03 cond-mat.mtrl-sci cs.AI cs.CL cs.DL cs.IR 版本更新 81%

Harnessing X-ray Absorption Spectroscopy Data through Multimodal Mining of Battery Literature

通过电池文献的多模态挖掘利用X射线吸收光谱数据

Tanjin He, Aikaterini Vriza, Logan Ward, Xu Huang, Yiming Chen, Anubhav Jain, Gerbrand Ceder, Rajeev S. Assary, Ian T. Foster, Maria K. Y. Chan

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用多模态文献挖掘将电池文献中分散的X射线吸收光谱数据转化为可用于人工智能的实验数据资源,开发数字化管道并应用于电池文献,产生开放数据集,为相关分析、比较及材料发现提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29624 2026-08-03 cs.CY cs.AI cs.HC 新提交 79%

The Theoretical Foundation of Socratic Tests: Dynamic, Multimodal, Conversational Examinations

苏格拉底测试的理论基础:动态、多模态、对话式考试

Ilya Mikhelson

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出苏格拉底测试的理论基础,整合多类教育评估原则与分类学,量化最近发展区并设计非补偿性加法评分架构,以解决传统评估的缺陷并提升测量可靠性。

Comments 21 pages, 1 figure, submitted to Computers and Education: Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29039 2026-08-03 cs.CV 新提交 79%

ReMoE: Report-Guided Mixture-of-Experts for Multimodal OCT/OCTA Anomaly Detection

ReMoE:报告引导型混合专家模型用于多模态OCT/OCTA异常检测

Zihan Nie, Qincheng Qiao, Muhao Xu, Wei Feng, Xinguo Hou, Weiye Song, Zongyuan Ge

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态OCT/OCTA异常检测,提出ReMoE模型,融合正常报告语义构建模态感知先验,在两个数据集上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29002 2026-08-03 cs.AI 新提交 79%

MMShopBench: A Real-Log Benchmark for Multimodal, Multi-Turn Shopping Agents

MMShopBench:面向多模态多轮购物智能体的真实日志基准

Zeying Hao, Hao Guo, Mengtao Xu, Yimin Hu, Yuheng Song, Zesheng Zhou, Jinsong Lan, Xiaoyong Zhu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.AI

AI总结 该研究推出首个多模态多轮购物智能体真实日志基准MMShopBench,构建离线购物沙箱,经微调后开源模型性能大幅接近领先专有模型,验证了基准及配套训练数据的有效性。

Comments 16 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28991 2026-08-03 cs.CV 新提交 79%

CAER: Conflict-Aware Evidence Routing with Dual Prefix Experts for Multimodal Large Language Models

CAER:面向多模态大语言模型的冲突感知证据路由,采用双前缀专家机制

Zixuan Liu, Juntao Cai, Xiaoxu Cai, Haishuai Wang, Jiajun Bu

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 本研究提出与主干无关的CAER框架,通过双前缀专家路由机制实现视觉-语言冲突检测与冲突感知生成,在MMMC及AgriConflict数据集上验证可提升开源多模态大语言模型的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29222 2026-08-03 cs.CV 新提交 77%

Is It Time for the Renaissance of Salient Object Detection in the Era of MLLMs?

多模态大语言模型(MLLMs)时代,显著性目标检测的复兴时机已到?

Wenzhuo Zhao, Xiuzhi Li, Zhongkuan Mao, Ronghao Xian, Yao Jiang, Zhao Gao, Keren Fu, Qijun Zhao, Jian Cheng

专题命中 多模态评测 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV

AI总结 该研究针对MLLMs时代SOD的能力不匹配问题,提出无训练框架FOCUS,在13类SOD基准上超越SOTA方法,推动SOD从特定任务监督转向零样本前景组织。

Comments 10 pages, 4 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02854 2026-08-03 cs.AI 版本更新 70%

M3MAD-Bench: Multi-Dimensional Evaluation of Multi-Agent Debate Across Domains and Modalities

M3MAD-Bench: 多智能体辩论在不同领域和模态中真的有效吗?

Ao Li, Jinghui Zhang, Luyu Li, Yuxiang Duan, Lang Gao, Mingcai Chen, Weijun Qin, Shaopeng Li, Fengxian Ji, Ning Liu, Lizhen Cui, Xiuying Chen, Yuntao Du

机构 * Shandong University(山东大学) MBZUAI Nanjing University of Posts and Telecommunications(南京邮电大学) BOB Cloud(BOB云)

专题命中 多模态评测 :multimodal(abstract);multi-modal(abstract);分类 cs.AI

AI总结 M3MAD-Bench通过多领域、多模态和多维指标评估多智能体辩论方法的有效性,提供全面的性能-成本分析。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29124 2026-08-03 cs.CV cs.LG 新提交 57%

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

专题命中 多模态评测 :multimodal(abstract);分类 cs.CV

AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。

Comments 30 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28645 2026-08-03 cs.HC cs.AI 新提交 57%

Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation

看起来对,运行起来对:面向多屏移动应用生成的项目级基准测试

Fan Wu, Cuiyun Gao, Yiming Huang, Yang Xiao, Yujia Chen, Qing Liao

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对现有设计转代码基准的局限,提出首个项目级多屏移动应用生成基准MobileForge,通过五轴评估及两种测试方法,发现前沿多模态LLM构建的应用存在导航、保真度和可维护性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18529 2026-08-03 cs.HC cs.AI 版本更新 57%

EduPanel: A Three-Agent LLM Judge for Teaching Videos -- Reliability, Complementarity, and Human Trust Calibration

EduPanel:用于教学视频的三智能体大语言模型评判器——可靠性、互补性和人类信任校准

Jia-Kai Dong, Yi-Cheng Lin, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence(NTU人工智能卓越研究中心)

专题命中 多模态评测 :multimodal(abstract);分类 cs.AI

AI总结 针对教学视频教学质量评估需求,提出基于评分标准、以学习者为条件的EduPanel大语言模型评判器,通过专门智能体分解评估,经多项分析实现高可靠性,能辅助教育评估,提高评分准确性且让专家可检测不可靠输出。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29090 2026-08-03 cs.LG 新提交 50%

What Is Missing in Surgical Risk Stratification and Outcome Prediction: A Scoping Review of End-to-End Machine Learning Approaches

手术风险分层与结局预测中缺失的内容:端到端机器学习方法的范围综述

Yizhi Dong, Yuhe Ke, Hairil Rizal Abdullah, Yucheng Xing, Kevan Kai Bing Teo, Ling Huang, Mengling Feng

专题命中 多模态评测 :multimodal(abstract)

AI总结 本范围综述回顾190项研究,分析手术风险分层与结局预测的ML流程,发现数据、方法、评估等方面存在差距,为开发更严谨的围手术期ML工具提供参考。

Comments This work has been submitted to the IEEE JBHI for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08913 2026-08-03 cs.LG stat.ML 版本更新 50%

GEMSS: A Variational Method for Discovering Multiple Sparse Solutions in Classification and Regression Problems

GEMSS: 一种用于在分类和回归问题中发现多个稀疏解的变分贝叶斯方法

Kateřina Henclová, Václav Šmídl

机构 * Faculty of Electrical Engineering, Czech Technical University(捷克技术大学电子工程系)

专题命中 多模态评测 :multimodal(abstract)

AI总结 提出GEMSS算法,利用结构化spike-and-slab先验、高斯混合近似后验和Jaccard惩罚,通过变分推断同时发现多个多样化的稀疏特征组合,在128个实验和3个真实数据集上优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 多模态Agent 6 篇

2607.29637 2026-08-03 cs.CV cs.SE 新提交 79%

CodeShrink: Adaptive Visual Compression for Efficient Multimodal Code Understanding

CodeShrink:面向高效多模态代码理解的自适应视觉压缩

Wenxin Tang, Jingyu Xiao, Zhenyu Liu, Zipeng Xie, Junliang Liu, Wang Luo, Yuan Jiang, Yintong Huo, Michael Lyu

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV

AI总结 CodeShrink是含无空白渲染、自适应压缩配置、主导令牌选择的自适应视觉压缩框架,可减少代码理解的视觉令牌用量,在三类代码任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03438 2026-08-03 cs.AI 版本更新 79%

Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents

具有自适应验证器的多模态强化学习

Reuben Tan, Baolin Peng, Zhengyuan Yang, Hao Cheng, Oier Mees, Theodore Zhao, Andrea Tupini, Isar Meijer, Qianhui Wu, Yuncong Yang, Lars Liden, Yu Gu, Sheng Zhang, Xiaodong Liu, Lijuan Wang, Marc Pollefeys, Yong Jae Lee, Jianfeng Gao

机构 * Microsoft Research(微软研究院) UMass Amherst(马萨诸塞大学阿默斯特分校) ETH Zurich(苏黎世联邦理工学院) UW–Madison(威斯康星大学麦迪逊分校)

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出Argos验证器,通过结合SFT数据筛选与RL训练,提升多模态推理模型在空间推理、视觉幻觉及机器人任务中的性能,同时减少奖励黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29347 2026-08-03 cs.MA cs.AI 新提交 70%

SeekBrain: An Autonomous Multi-Agent System for Accelerating Neuroscience Discovery

SeekBrain:用于加速神经科学发现的自主多智能体系统

Jiamin Wu, Peishan Xiang, Jingyang Chen, Yuqing Zhu, Yuxi Li, Ling Luo, Qihao Zheng, Jialiang Zu, Yongchao Wu, Mindong Liu, Haitao Wu, Chaofan Hu, Yijie Sun, Yuqi Hang, Yu Zhu, Shuo Li, Yue Fan, Shiyang Feng, Wanghan Xu, Tianlei Zhang, Jie Zhang, Wenlong Zhang, Bo Zhang, Kai Wang, Lei Bai, Mianxin Liu, Wanli Ouyang, Jiulin Du, Chunfeng Song

专题命中 多模态Agent :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 SeekBrain是用于加速神经科学发现的自主多智能体框架,通过分层规划与跨模态分析生成分析流程,在BrainArena基准上优于现有智能体,实际研究中成功揭示了斑马鱼与小鼠的神经表征规律。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29600 2026-08-03 cs.RO 新提交 67%

HAM-VLN: Harnessing Hierarchical Agentic Memory for Zero-Shot Vision-and-Language Navigation

HAM-VLN:利用分层智能体记忆实现零样本视觉与语言导航

An Liu, Bingxi Liu, Hongyu Ding, Yixuan Jiang, Yaran Chen, Fulin Tang, Cong Leng, Hong Zhang, Jian Cheng

专题命中 多模态Agent :multimodal(abstract,abstract_cn)

AI总结 本研究提出HAM-VLN零样本VLN方法,通过分层智能体记忆缓解长程导航的记忆与推理瓶颈,提升导航指标并缩短上下文长度,在多个基准数据集上取得优异零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29113 2026-08-03 cs.HC 新提交 50%

Designing a digital word-learning intervention with neurodiverse children: Experiences and ideas from children with developmental language disorder

面向神经多样性儿童的数字词汇学习干预方案设计:发育性语言障碍儿童的经验与思路

Rafiah Ansari, Rina R. Wehbe, Lizbeth Olivia Escobedo

专题命中 多模态Agent :multimodal(abstract)

AI总结 该研究针对发育性语言障碍儿童,采用定制化参与式设计方法,设计词汇学习干预方案,明确了多模态等关键设计要求,为相关干预开发提供了宝贵见解。

Comments 56 pages, 7 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07792 2026-08-03 quant-ph 50%

Wigner and friends, a map is not the territory! Contextuality in multi-agent paradoxes

Sidiney B. Montanhano

专题命中 多模态Agent :multi-modal(abstract)

Comments Minor corrections. 12 pages, 2 figures, 3 tables; 20 pages with appendix and references

Journal ref Foundations of Science, 30(4), 971-1002 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 多模态训练与对齐 12 篇

2607.26947 2026-08-03 cs.CV cs.AI 版本更新 91%

Progressive Multimodal Alignment for Continual Instruction Tuning

用于持续指令微调的渐进式多模态对齐

Duzhen Zhang, Yahan Yu, Qiaoyi Su, Jiahua Dong, Tielin Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(中国科学院脑科学与智能技术卓越创新中心) Kyoto University(京都大学) Migu Culture Technology Co.,Ltd.(咪咕文化科技有限公司) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与类脑智能技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(summary_cn,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态持续指令微调中投影器级遗忘问题,提出渐进式多模态对齐框架PMA,以亚线性参数增长平衡稳定性与可塑性,在多基准实验中提升了现有方法性能且适配多种MLLM主干。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29207 2026-08-03 cs.CV 新提交 83%

Multi-Modal Object Re-Identification with Dual Semantic Guidance and Global-Local Mutual Modulation

融合双语义引导与全局-局部互调制的多模态物体重识别

Weixiang Zhou, Xingguo Xu, Yuhao Wang, Cong Wang, Yang Yang, Zhixun Su, Jinshan Pan

机构 * Dalian University of Technology(大连理工大学) University of California, San Francisco(加利福尼亚大学旧金山分校) Nanjing University of Science and Technology(南京理工大学)

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文针对多模态物体重识别的语义先验利用不足与全局-局部协同缺失问题,提出含TSI、MGLM、HMF的双语义引导与全局-局部互调制框架,经多基准实验验证有效。

Comments Accepted by IEEE TCSVT 2026. The version of record may differ slightly

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01049 2026-08-03 cs.CL 版本更新 83%

Beyond Captions: Context-Grounded Reconstruction for Biomedical Multimodal Continued Pretraining

PMC-InterCPT:重新思考用于多模态持续预训练的医学交错数据

Guanghao Zhu, Zeyu Liu, Zhitian Hou, Pengkai Wang, Zhijie Sang, Yang Yu, Minheng Ni, Wenjun Wang, Yanggan Gu, Shuo Cai, Congkai Xie, Jianmin Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University(香港理工大学) Sun Yat-sen University(中山大学) InfiX.ai PolyU-Daya Bay Technology and Innovation Research Institute(PolyU-大亚湾技术与创新研究院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract);分类 cs.CL

AI总结 针对医学多模态持续预训练中图像-文本对数据存在的上下文缺失、结构噪声等问题,提出PMC-InterCPT交错语料库,通过恢复缺失标题、清洗文本、重建交错样本及LLM监督过滤,结合模态感知重采样,有效提升医学与通用多模态性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29213 2026-08-03 cs.IR cs.LG 新提交 82%

GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习

Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang, Ma Jiang, Shaopeng Liang, Zeyang Hou, Guodong Cao, Jia Jia

专题命中 多模态训练与对齐 :multimodal(title,abstract);image-text(abstract)

AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。

Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29000 2026-08-03 cs.IR cs.LG 新提交 78%

PaletteID: Prototype-Composed Semantic Identifiers for Multimodal CTR Prediction

PaletteID:用于多模态点击率预测的原型组合语义标识符

Huanyu Liu, Baining Chen, Hui Liu, Zengyang Li, Ziyi Huang

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 提出PaletteID模型,以SQ-DPP构建原型调色板聚合语义相关原型,在两个公开数据集上提升CTR预测性能,对长尾物品增益更显著且标识符分配更鲁棒、语义更可解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28708 2026-08-03 cs.LG 新提交 78%

MMFGU: Multimodal Federated Graph Unlearning

MMFGU:多模态联邦图遗忘

Haodong Lu, Zekai Chen, Weiwei Ji, Shihao Li, Xunkai Li, Xun Wu, Yinlin Zhu, Rong-Hua Li

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对现有联邦图遗忘无法满足多模态细粒度遗忘请求的问题,提出MMFGU框架,通过目标特定表示解耦等技术解决三大挑战,实验显示其能有效移除请求信息并实现41.5倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏