SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
Comments Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments The First review of State Space Model (SSM)/Mamba and their applications in artificial intelligence, 33 pages
专题命中 多模态生成 :cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by AAAI2024
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 31 pages, 22 figures, 30M PDF file size; Project Page: https://llava-vl.github.io/llava-interactive/
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
Comments 10 pages
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Work in progress. Code is available at https://github.com/ZiyuGuo99/Point-Bind_Point-LLM
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
Comments Technical Report; Project released at: https://github.com/AILab-CVC/SEED
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
Comments 13 pages
专题命中 多模态生成 :multi-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multi-modal(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by CVPR 2022, https://github.com/drboog/Lafite
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments WACV-2020 (Accepted)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract);分类 cs.CV
专题命中 多模态生成 :multimodal(abstract,comments);分类 cs.CV、cs.CL、cs.AI
Comments Multimodal, Visual Question Answering, Vision and Language
专题命中 多模态生成 :multi-modal(abstract,comments);分类 cs.CV、cs.AI、cs.MM
Comments CVPR 2021. Code: https://github.com/weihaox/TediGAN Data: https://github.com/weihaox/Multi-Modal-CelebA-HQ Video: https://youtu.be/L8Na2f5viAM
面向纳米光子学的大语言模型综合综述:从代理建模到自主设计
专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)
AI总结 该综述探讨大语言模型(LLMs)如何通过语义接口、代码生成及工具编排改进纳米光子学工作流,梳理相关方法的两类模式及跨学科应用,展望具备物理感知的多模态基础模型,推动AI从被动工具向主动科研合作者转变。
Comments Accepted for publication in Advanced Photonics
AutoDesign:面向长视距智能体设计的元工具优化
机构 * Meituan(美团) ; MBZUAI(Mohamed bin Zayed University of Artificial Intelligence) ; Huazhong University of Science and Technology(华中科技大学) ; Peking University(北京大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 AutoDesign是符合人类设计先验的元工具优化框架,以论文转海报生成任务为实例,在PosterBench上性能优于Claude Design,集成其学习的DesignHarness可提升代码智能体性能,且获人类最高偏好。
Comments Tech Report. Code at: https://github.com/Yaxin9Luo/AutoDesign
CURV:通过课程可视化接地推理增强图表理解
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。
非配对模态无关生成式推荐
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出UnpairGR模型,从多类观测中学习统一语义ID空间,在三类基准数据集上验证其可提升完全与不完全观测下的推荐性能。
OmniCustom: 通过联合音视频生成模型实现同步音视频定制
机构 * The University of Hong Kong(香港大学) ; Shanda AI Research Tokyo(Shanda AI东京研究所) ; XIntelligence Technology Co., Limited(XIntelligence技术有限公司)
专题命中 多模态生成 :audio-visual(abstract);分类 cs.AI、cs.MM、eess.AS
AI总结 提出一种基于DiT的零样本音视频定制框架OmniCustom,通过参考图像和音频同步生成保持身份和音色一致性的视频,支持文本指定语音内容。
Comments code: https://github.com/OmniCustom-project/OmniCustom
Mage-Flow:用于图像生成和编辑的高效原生分辨率基础模型
机构 * Microsoft Mage Team(微软Mage团队)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究针对大规模视觉生成器成本高的问题,提出Mage-Flow,由Mage-VAE和原生分辨率多模态扩散Transformer组成。通过协同设计实现高效文本到图像生成及编辑,开发完整模型家族,Turbo变体在高分辨率下生成和编辑高效,性能有竞争力。
并发图像理解与生成:自校正耦合马尔可夫跳跃过程
机构 * Stony Brook University(纽约州立大学石溪分校) ; Google DeepMind(谷歌DeepMind)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 研究针对人类认知中理解与生成的耦合循环,引入自校正耦合马尔可夫跳跃过程框架及$\texttt{CO}_\texttt{2}\texttt{Jump}$采样器,解决掩码扩散模型跨模态矛盾问题,创建多模态语料库,该方法在图像相关任务中性能优异,且性能随去噪步骤数提升。
Comments Project page: https://coupled-jump.github.io
层次化合成表格数据生成:一种自上而下与自下而上混合框架
机构 * University of Southern California(南加州大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出一种层次化混合自上而下和自下而上(H-TDBU)框架,通过解耦语义结构与随机纹理,结合结构驱动的逻辑约束和轻量级表格生成器,在弱多模态金融基准上提升合成数据的语义一致性和统计保真度。
Comments Accepted as a poster at FMSD @ ICML 2026. 9 pages, 6 figures
面向同步视听重建的语义卫星通信
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)
AI总结 提出自适应多模态语义传输系统,通过双流生成架构和动态关键帧更新机制,在带宽受限的卫星场景下实现高质量同步视听重建,显著降低带宽消耗并提升鲁棒性。
T2MM:一种支持基于探究建模的LLM架构
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM
AI总结 提出T2MM架构,利用LLM在生态建模软件VERA中生成交互式模型,优于全代码生成基线。
Comments 16 pages, 4 figures
从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述
专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)
AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。
Comments 22 pages, 7 figures, Author list corrected
CURE:基于课程引导的多任务训练实现可靠的解剖学接地报告生成
机构 * Pontificia Universidad Católica de Chile(智利天主教大学) ; CENIA ; iHEALTH ; KAUST(科威特皇家科学与技术局)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
AI总结 提出CURE框架,通过课程学习动态调整多任务训练,提升医学报告生成的视觉接地准确性和事实一致性,无需额外数据。
Comments 31 pages, 7 figures, accepted to CVPR 2026 (oral)
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026, pp. 36279-36289