PUMA: Empowering Unified MLLM with Multi-granular Visual Generation
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
Comments Project page: https://rongyaofang.github.io/puma/
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :MLLM(title,abstract);multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
Comments Project page: https://rongyaofang.github.io/puma/
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments Our models, codes and datasets are released in https://github.com/TencentARC/SEED-Story
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CL
专题命中 多模态生成 :multimodal(title,abstract);multi-modal(abstract);MLLM(abstract);分类 cs.CV
Comments Accepted by ACL 2024, Main Conference, Long Paper
专题命中 多模态生成 :multimodal(title,abstract);any-to-any(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 30 pages, 6 tables, 7 figures
专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);image-text(abstract);分类 cs.CV
Comments 13 pages, 2 figures
专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
RefineSVG:视觉反馈驱动的图像转SVG生成强化学习
机构 * Shenzhen University(深圳大学) ; Peking University(北京大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.AI
AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。
Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material
EndoCoT:扩散模型中的内生思维链推理扩展
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Xi’an Jiaotong University(西安交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiaotong University(上海交通大学) ; Fudan University(复旦大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.CV、cs.CL
AI总结 提出EndoCoT框架,通过迭代思维引导模块激活MLLM的推理潜力,并利用终端思维接地模块确保推理轨迹与文本监督对齐,使DiT逐步执行复杂任务,在多个基准上平均准确率达92.1%。
Comments 23 pages, 18 figures, The code and dataset are publicly available at https://internlm.github.io/EndoCoT/
专题命中 多模态生成 :multimodal(title,abstract);multimodal foundation model(abstract,comments);分类 cs.CV、cs.CL
Comments Conference on Computer Vision and Pattern Recognition's 2nd Multimodal Foundation Models Challenge
专题命中 多模态生成 :multimodal(title);multimodal foundation model(title);分类 cs.CV、cs.AI
用于功能性抗体设计的抗原特异性抗体多模态基础模型
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :multi-modal(title);multimodal(abstract);cross-modal(abstract);multimodal foundation model(abstract)
AI总结 该研究针对抗原特异性抗体设计难题,引入AAMFM多模态基础模型,通过跨模态适配器整合抗原信息,用校准直接偏好优化微调,实现抗体 - 抗原相互作用联合建模,实验证明其在功能性抗体设计中性能最优,有抗原特异性抗体工程潜力。
利用多模态大语言模型推荐可用性改进
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 本文提出一种利用多模态大语言模型自动识别和推荐用户界面可用性改进的方法,通过分析有限的应用上下文和用户交互屏幕记录,基于尼尔森可用性启发式方法生成优先级排序的改进建议,验证了其在软件工程中的实用性。
Comments Accepted for publication at the ACM International Conference on the Foundations of Software Engineering (FSE 2026)
BrepCoder: 用于多任务B-rep推理的统一多模态大语言模型
机构 * Chungnam National University(全南国立大学)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 提出BrepCoder,一种统一的多模态大语言模型,通过将CAD建模序列转换为类Python代码并与B-rep对齐,采用两阶段训练策略,实现从B-rep输入执行多种CAD任务,包括补全、纠错和问答。
云边连续体中多模态大模型的生成质量-延迟权衡感知推理卸载
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract,abstract_cn)
AI总结 针对云边协同多模态大模型推理,提出QLMIO框架以优化生成质量与响应延迟的权衡,并构建MIOBench基准,实验表明延迟降低58.14%且任务完成率不变。
Comments This manuscript was submitted to IEEE Transactions on Mobile Computing on June 3, 2026
IMUG-Bench:交错理解与生成的统一多模态模型基准
机构 * Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Huawei(华为)
专题命中 多模态生成 :multimodal(title,abstract);image-text(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 提出IMUG-Bench基准,用于评估统一多模态模型在多轮交错图文对话中的理解与生成能力,包含3113样本和12034交互轮次,揭示了生成侧暴露偏差,并探索了测试时扩展策略。
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);cross-modal(abstract)
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) ; Zhongguancun Academy(中关村学院) ; Shanghai Innovation Institute(上海创新研究院) ; Lehigh University(莱特大学)
专题命中 多模态生成 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NeurIPS 2025
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
机构 * Character AI ; Yale University(耶鲁大学)
专题命中 多模态生成 :cross-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.MM、eess.AS
机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) ; Lambda
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Project Page: https://bifrost-1.github.io
机构 * University at Buffalo(布法罗大学) ; Adobe Research(Adobe研究) ; Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 多模态生成 :multimodal(title,abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted at ICCV 2025. Code available at https://github.com/sjz5202/LLaVA-Reward
机构 * FAIR at Meta - Montreal, New York(Meta 蒙特利尔 FAIR) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Mila ; McGill University(麦吉尔大学) ; Canada CIFAR AI chair(加拿大 CIFAR 人工智能主席)
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态生成 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by NAACL 2025 main conference
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态生成 :cross-modal(title,abstract);multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Published at ICLR 2024
专题命中 多模态生成 :multi-modal(title,abstract);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI
Comments 20 pages, 18 figures
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.CL、cs.AI
专题命中 多模态生成 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS
Proteo-R1:用于从头蛋白质设计的推理基础模型
专题命中 多模态生成 :MLLM(summary_cn,abstract);multimodal(abstract);分类 cs.AI
AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。
Journal ref ICML 2026