arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4955 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4955 篇

2503.07265 2026-06-03 cs.CV cs.AI cs.CL 67%

WISE: A World Knowledge-Informed Semantic Evaluation for Text-to-Image Generation

WISE: 一种基于世界知识的文本到图像生成语义评估方法

Yuwei Niu, Munan Ning, Mengren Zheng, Weiyang Jin, Bin Lin, Peng Jin, Jiaqi Liao, Chaoran Feng, Fanqing Meng, Kunpeng Ning, Bin Zhu, Li Yuan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 针对现有文本到图像生成模型缺乏复杂语义理解和世界知识整合评估的问题,提出WISE基准,包含25个子领域的1000个精心设计的提示,并引入WiScore指标评估知识-图像对齐,实验表明当前模型在整合世界知识方面存在显著局限。

Comments Accepted to ICML 2026. We have also released an updated version of the benchmark, WISE_Verified. Please refer to https://github.com/PKU-YuanGroup/WISE for the latest version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00664 2026-06-02 cs.LG cs.AI cs.CV cs.HC cs.MM 67%

Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation

Avatar Forcing:用于自然对话的实时交互式头部化身生成

Taekyung Ki, Sangwon Jang, Jaehyeong Jo, Jaehong Yoon, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) NTU Singapore(新加坡国立大学) DeepAuto.ai

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 提出Avatar Forcing框架,通过扩散强制实现实时交互式头部化身生成,利用直接偏好优化进行无标签学习,在低延迟(约500ms)下生成富有表现力的反应动作。

Comments CVPR 2026. Project page: https://taekyungki.github.io/AvatarForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23538 2026-05-21 cs.AI cs.CL cs.CV cs.SE 67%

JanusCoder: Towards a Foundational Visual-Programmatic Interface for Code Intelligence

JanusCoder: 向代码智能的视觉-程序化界面迈进

Qiushi Sun, Jingyang Gong, Yang Liu, Qiaosheng Chen, Lei Li, Kai Chen, Qipeng Guo, Ben Kao, Fei Yuan

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Carnegie Mellon University(卡内基梅隆大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出JanusCoder,一种面向代码智能的视觉-程序化界面,通过构建大规模多模态代码数据集和统一模型,实现从文本指令、视觉输入或两者结合生成代码,展示了其在文本和视觉编程任务中的优越性能。

Comments ICLR 2026 Camera Ready Version, with code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16295 2026-05-19 cs.CY cs.AI cs.CL cs.GR cs.HC cs.MM 67%

ANVIL: Analogies and Videos for Lecturers

ANVIL:为讲师提供类比和视频

Yuri Noviello, Anastasiia Birillo, Gosia Migut

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI、cs.MM

AI总结 ANVIL是一种多模态生成系统,可自动生成基于类比的计算机科学教学动画。通过生成文本类比、结构化视觉剧本和可执行代码,提升教学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 67%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24625 2026-04-28 cs.CV cs.AI cs.LG cs.MM 67%

Meta-CoT: Enhancing Granularity and Generalization in Image Editing

Meta-CoT:提升图像编辑的粒度与泛化能力

Shiyi Zhang, Yiji Cheng, Tiankai Hang, Zijin Yin, Runze He, Yu Xu, Wenxun Dai, Yunlong Lin, Chunyu Wang, Qinglin Lu, Yansong Tang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Hunyuan, Tencent(腾讯 Hunyuan)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 Meta-CoT通过双重分解提升图像编辑的粒度和泛化能力,通过任务-目标-理解能力三元组分解和五元基本元任务训练策略,显著提高编辑性能。

Comments Accepted by CVPR2026, Project Page: https://shiyi-zh0408.github.io/projectpages/Meta-CoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.10141 2026-04-28 cs.CV cs.CL cs.MM 67%

ANCHOR: LLM-driven Subject Conditioning for Text-to-Image Synthesis

ANCHOR:基于大语言模型的文本到图像合成中的主体条件化

Aashish Anantha Ramakrishnan, Sharon X. Huang, Dongwon Lee

机构 * Optum AI The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 多模态生成 :image-text(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 ANCHOR通过大规模抽象式标题数据集研究文本到图像合成中多主体理解与上下文推理的缺陷,提出基于大语言模型的主体感知微调方法,提升图像-标题一致性与人类偏好对齐。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL 67%

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态生成 :MLLM(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10172 2026-04-14 eess.SP 67%

Wearable AI in the Era of Large Sensor Models

在大规模传感器模型时代的人工智能可穿戴技术

Yize Cai, Baoshen Guo, Guobin Shen, Zhiqing Hong

专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract)

AI总结 本文探讨了大规模传感器模型在可穿戴AI中的应用,提出通过整合多模态数据提升系统泛化能力,并讨论了无语言能力和有语言能力的两种模型方向。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16093 2026-03-18 cs.SD cs.AI cs.CV cs.MM 67%

Diffusion Models for Joint Audio-Video Generation

用于联合音频视频生成的扩散模型

Alejandro Paredes La Torre

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出联合音频视频生成方法,通过构建高质量数据集、训练MM-扩散架构、探索联合潜在扩散及提出两步文本到音频视频生成流程,提升生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04790 2026-03-06 cs.LG cs.RO 67%

Diffusion Policy through Conditional Proximal Policy Optimization

通过条件近端策略优化实现扩散策略

Ben Liu, Shunpeng Yang, Hua Chen

机构 * Southern University of Science and Technology, Shenzhen, China(南方科技大学) Hong Kong University of Science and Technology, Hongkong, China(香港科技大学) Zhejiang University-University of Illinois Urbana-Champaign Institute, Haining, China(浙江大学-伊利诺伊大学厄巴纳-香槟分校联合研究所)

专题命中 多模态生成 :multimodal(abstract);multi-modal(abstract)

AI总结 本文提出了一种基于条件近端策略优化的高效方法,用于在在线强化学习中训练多模态扩散策略,解决了计算动作对数似然的难题,并在多个基准任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01776 2026-03-06 cs.CL cs.AI cs.CV 67%

FreeAct: Freeing Activations for LLM Quantization

FreeAct: 为LLM量化释放激活

Xiaohao Liu, Xiaobo Xia, Manyi Zhang, Ji-Fu Li, Xianzhi Yu, Fei Shen, Xiu Su, See-Kiong Ng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Huawei Technology(华为技术有限公司) Central South University(中央南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 FreeAct通过放松静态转换约束,为LLM量化提供动态适应的激活转换方法,实现性能提升5.3%。

Comments 26 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18991 2026-03-06 cs.CV cs.CL cs.MM 67%

EasyAnimate: High-Performance Video Generation Framework with Hybrid Windows Attention and Reward Backpropagation

EasyAnimate:基于混合窗口注意力和奖励反向传播的高性能视频生成框架

Jiaqi Xu, Kunzhe Huang, Xinyi Zou, Yunkuo Chen, Bo Liu, MengLi Cheng, Jun Huang, Xing Shi

机构 * Alibaba Cloud(阿里云)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 EasyAnimate通过混合窗口注意力和奖励反向传播提升视频生成效率与质量,实现高性能视频生成。

Comments 10 pages, 8 figures, ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00159 2026-03-03 cs.CV cs.AI cs.MM cs.SD 67%

FlowPortrait: Reinforcement Learning for Audio-Driven Portrait Video Generation

FlowPortrait:基于强化学习的音频驱动肖像视频生成

Weiting Tan, Andy T. Liu, Ming Tu, Xinghua Qu, Philipp Koehn, Lu Lu

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 FlowPortrait通过强化学习框架结合多模态模型和人类对齐评估系统,提升音频驱动肖像视频生成的质量和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17937 2026-02-27 cs.SD cs.AI cs.CL eess.AS 67%

Bob's Confetti: Phonetic Memorization Attacks in Music and Video Generation

Bob的彩纸:音乐和视频生成中的语音记忆攻击

Jaechul Roh, Zachary Novack, Yuefeng Peng, Niloofar Mireshghallah, Taylor Berg-Kirkpatrick, Amir Houmansadr

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CL、cs.AI、eess.AS

AI总结 研究揭示了生成音乐和视频AI系统中语音记忆攻击的漏洞,通过同音替代词绕过版权过滤,展示语音结构对跨模态检索的关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21472 2026-02-26 cs.LG 67%

The Design Space of Tri-Modal Masked Diffusion Models

三模态掩码扩散模型的设计空间

Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec, Pau Rodriguez Lopez, Lokesh Boominathan, Nikhil Bhendawade, Amitis Shidani, Joris Pelemans, Theo X. Olausson, Devon Hjelm, Paul Dixon, Joao Monteiro, Pierre Ablin, Vishnu Banna, Arno Blaas, Nick Henderson, Kari Noriy, Dan Busbridge, Josh Susskind, Marco Cuturi, Irina Belousova, Luca Zappella, Russ Webb, Jason Ramapuram

机构 * Apple(苹果公司) Google Deepmind(谷歌DeepMind) University of Cambridge(剑桥大学) MIT(麻省理工学院)

专题命中 多模态生成 :multimodal(abstract);image-text(abstract)

AI总结 本文提出了一种从头开始预训练的三模态掩码扩散模型,通过分析多模态扩展定律和批大小效应,实现了优化的推理采样,并在文本生成、图像生成和语音生成任务中取得了显著成果。

Comments 41 pages, 29 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18055 2026-02-23 cs.LG 67%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract)

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 67%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03069 2026-02-04 cs.DB 67%

Skill-Based Autonomous Agents for Material Creep Database Construction

基于技能的自主代理用于材料蠕变数据库构建

Yue Wu, Tianhao Su, Shunbo Hu, Deng Pan

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

AI总结 本文提出基于技能的自主代理框架,用于从科学文献中自动提取高保真的材料蠕变数据,实现物理自洽的数据库构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10527 2026-01-19 cs.AI cs.CL cs.CV cs.LG 67%

A Safety Report on GPT-5.2, Gemini 3 Pro, Qwen3-VL, Grok 4.1 Fast, Nano Banana Pro, and Seedream 4.5

GPT-5.2、Gemini 3 Pro、Qwen3-VL、Grok 4.1 Fast、Nano Banana Pro 和 Seedream 4.5 的安全报告

Xingjun Ma, Yixu Wang, Hengyuan Xu, Yutao Wu, Yifan Ding, Yunhan Zhao, Zilong Wang, Jiabin Hua, Ming Wen, Jianan Liu, Ranjie Duan, Yifeng Gao, Yingshui Tan, Yunhao Chen, Hui Xue, Xin Wang, Wei Cheng, Jingjing Chen, Zuxuan Wu, Bo Li, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation institute(上海创新研究院) Deakin University(德克萨斯大学) UIUC(伊利诺伊大学香槟分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本报告对六个前沿模型进行综合安全性评估,揭示其在安全性和鲁棒性方面的差异,强调需要标准化评估以指导负责任的部署。

Comments 41 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08179 2026-01-14 cs.CV cs.AI cs.GR cs.LG cs.MM 67%

Instruction-Driven 3D Facial Expression Generation and Transition

基于指令的3D面部表情生成与转换

Anh H. Vo, Tae-Seok Kim, Hulin Jin, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(忠南大学计算机工程系) School of Computer Science and Technology, Anhui University(安徽大学计算机科学与技术学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 本文提出基于指令的3D面部表情生成与转换框架,通过IFED模块和I2FET方法实现面部表情的生成与平滑过渡,实验表明其在多个数据集上优于现有方法。

Journal ref IEEE Transactions on Multimedia, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08120 2026-01-14 cs.CV cs.AI cs.LG cs.MM 67%

UniF$^2$ace: A Unified Fine-grained Face Understanding and Generation Model

UniF$^2$ace: 一个统一的细粒度人脸理解和生成模型

Junzhe Li, Sifan Zhou, Liya Guo, Xuerui Qiu, Linrui Xu, Delin Qu, Tingting Long, Chun Fan, Ming Li, Hehe Fan, Jun Liu, Shuicheng Yan

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Central South University(中南大学) Fudan University(复旦大学) Guangming Lab(光明实验室) Zhejiang University(浙江大学) Lancaster University(兰卡斯特大学) National University of Singapore(新加坡国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM

AI总结 UniF$^2$ace是一个专门针对细粒度人脸理解和生成的统一多模态模型,通过双离散扩散损失和多级分组专家混合架构,提升高质量面部细节生成和细粒度属性处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00827 2026-01-13 eess.AS cs.AI cs.MM 67%

Speak the Art: A Direct Speech to Image Generation Framework

Speak the Art: 一种直接语音到图像生成框架

Mariam Saeed, Manar Amr, Farida Adel, Nada Hassan, Nour Walid, Eman Mohamed, Mohamed Hussein, Marwan Torki

专题命中 多模态生成 :image-text(abstract);分类 cs.AI、cs.MM、eess.AS

AI总结 本文提出Speak the Art框架,通过改进语音嵌入和使用扩散模型,实现更稳定和多样化的语音到图像生成,并验证了多语言扩展的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12196 2025-12-16 cs.MM cs.CV cs.SD eess.AS 67%

AutoMV: An Automatic Multi-Agent System for Music Video Generation

AutoMV: 一种自动多智能体系统用于音乐视频生成

Xiaoxuan Tang, Xinping Lei, Chaoran Zhu, Shiyun Chen, Ruibin Yuan, Yizhi Li, Changjae Oh, Ge Zhang, Wenhao Huang, Emmanouil Benetos, Yang Liu, Jiaheng Liu, Yinghao Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University(南京大学) Queen Mary University of London(伦敦大学女王学院) Hong Kong University of Science and Technology(香港科技大学) University of Manchester(曼彻斯特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.MM、eess.AS

AI总结 AutoMV通过多智能体协作生成完整音乐视频,优于现有方法并接近专业水准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10949 2025-12-12 cs.CV cs.AI cs.CL 67%

Are We Ready for RL in Text-to-3D Generation? A Progressive Investigation

我们是否准备好在文本到3D生成中使用强化学习?一项渐进性的调查

Yiwen Tang, Zoey Guo, Kaixin Zhu, Ray Zhang, Qizhi Chen, Dongzhi Jiang, Junli Liu, Bohan Zeng, Haoming Song, Delin Qu, Tianyi Bai, Dan Xu, Wentao Zhang, Bin Zhao

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文首次系统研究了强化学习在文本到3D生成中的应用,提出Hi-GRPO范式和AR3D-R1模型,探讨奖励设计、算法优化及3D生成基准。

Comments Code is released at https://github.com/Ivan-Tang-3D/3DGen-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05112 2025-12-05 cs.CV cs.AI cs.CL cs.LG 67%

DraCo: Draft as CoT for Text-to-Image Preview and Rare Concept Generation

DraCo: 文本到图像预览与稀有概念生成的草稿作为CoT

Dongzhi Jiang, Renrui Zhang, Haodong Li, Zhuofan Zong, Ziyu Guo, Jun He, Claire Guo, Junyan Ye, Rongyao Fang, Weijia Li, Rui Liu, Hongsheng Li

机构 * CUHK MMLab(香港中文大学 MMLab) CUHK IMIXR(香港中文大学 IMIXR) Sun Yat-Sen University(中山大学) SCUT(华南理工大学) CUHK (Shenzhen)(香港中文大学(深圳))

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 DraCo通过结合文本和视觉内容的交错推理,提升文本到图像生成的精度和稀有概念生成能力。

Comments Project Page: https://github.com/CaraJ7/DraCo

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16671 2025-11-21 cs.CV cs.AI cs.CL 67%

Thinking-while-Generating: Interleaving Textual Reasoning throughout Visual Generation

生成中思考:在视觉生成过程中穿插文本推理

Ziyu Guo, Renrui Zhang, Hongyu Li, Manyuan Zhang, Xinyan Chen, Sifan Wang, Yan Feng, Peng Pei, Pheng-Ann Heng

机构 * CUHK(香港中文大学) IMIXR MMLab Meituan Project(美团项目)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出TwiG框架,通过在视觉生成过程中穿插文本推理,提升生成内容的上下文感知和语义丰富性。

Comments Project Page: https://think-while-gen.github.io Code: https://github.com/ZiyuGuo99/Thinking-while-Generating

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15030 2025-11-20 eess.SP 67%

WiCo-PG: Wireless Channel Foundation Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Ziwei Huang, Xuesong Cai, Xiang Cheng, Jianjun Wu

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02423 2025-11-05 eess.SP 67%

LLM4PG: Adapting Large Language Model for Pathloss Map Generation via Synesthesia of Machines

Mingran Sun, Lu Bai, Xiang Cheng, Jianjun Wu

专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13883 2025-10-17 q-bio.NC cs.MA 67%

Large Language Model Agents Enable Autonomous Design and Image Analysis of Microwell Microfluidics

Dinh-Nguyen Nguyen, Sadia Shakil, Raymond Kai-Yu Tong, Ngoc-Duy Dinh

专题命中 多模态生成 :multimodal(abstract);MLLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏