Image Prompt Reconstruction Attacks on Distributed MLLM Inference Frameworks
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 多模态生成 :MLLM(title,summary_cn);multimodal(abstract,abstract_cn)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 多模态生成 :MLLM(title,summary_cn);multimodal(abstract,abstract_cn)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
Qwen-RobotWorld技术报告:通过语言条件视频生成统一具身世界模型
机构 * Qwen Team(Qwen团队)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出Qwen-RobotWorld,一种以自然语言为统一动作接口的语言条件视频世界模型,通过双流MMDiT、大规模具身世界知识语料和渐进式课程训练,在机器人操作、自动驾驶等任务中实现物理一致的未来视觉轨迹预测,在多个基准上取得最优结果。
桥接创意意图与视觉质量:基于创作者驱动的循环视频生成与代理反馈循环
机构 * University of California, Davis(加州大学戴维斯分校) ; The Harker School(哈克学校) ; Basis Independent Silicon Valley(硅谷贝斯独立学校) ; Saratoga High(萨拉托加高中)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 提出CHIEF框架,通过人类-AI协作的迭代视频精炼,结合创作者驱动和代理主观反馈,提升长视频的叙事连贯性与创意方向。
Comments Accepted to the Workshop on Human-AI Co-Creativity at ICML 2026
S3OD:基于合成数据的通用显著目标检测
机构 * University of Oxford, VGG(牛津大学,视觉信息集团)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 提出S3OD方法,通过大规模合成数据生成和歧义感知架构,显著提升显著目标检测的跨数据集泛化能力,仅用合成数据训练即可降低20-50%误差。
关于生成式AI在人类医学基因组学中的应用系统综述
机构 * Dpt. of Genomic Medicine(基因组医学系) ; D.O. Ott Research Institute of Obstetrics, Gynaecology, and Reproductology(D.O. Ott妇产科与生殖医学研究所)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL
AI总结 本文系统综述了生成式AI在罕见和常见疾病遗传研究与诊断中的应用,分析了LLM在基因组变异识别、注释及医学影像中的作用,指出其在多模态数据整合和临床应用中的挑战。
Comments 31 pages, 5 figures
Journal ref Frontiers in Genetics 16 (2026) 1694070
潜在条件参数化量子电路作为量子态分布的通用近似器
机构 * Quantum Laboratory, Fujitsu Research, Fujitsu Limited(Fujitsu 研究所量子实验室, Fujitsu 有限公司)
专题命中 多模态生成 :multimodal(abstract)
AI总结 提出潜在条件参数化量子电路(LPQC),通过经典神经网络将潜在变量映射到量子电路参数,证明其在1-Wasserstein距离下是密度算子概率测度的通用近似器,并引入多模态潜在先验和专家混合电路架构缓解贫瘠高原问题。
Comments 21 pages, 11 figures (fix the proof and update appendix for barren plateaus analysis)