Multimodal Tip-Enhanced Nonlinear Optical Nano-Imaging of Plasmonic Silver Nanocubes
专题命中 多模态生成 :multimodal(title)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
专题命中 多模态生成 :multimodal(title)
Comments 42 pages,3 Figures,4 Tables, 13 Supplemental Figures, 11 Supplemental Tables
专题命中 多模态生成 :multi-modal(title)
Comments 17 pgs, 8 figures
Journal ref Phys. Rev. E 97, 042402 (2018)
专题命中 多模态生成 :multimodal(title)
Comments SPIE Medical Imaging 2016, Proc. SPIE Medical Imaging: Biomedical Applications in Molecular, Structural, and Functional Imaging, 2016
Journal ref SPIE Medical Imaging, pp. 97881Y-97881Y. 2016
当前谁主导?用于图表转代码生成的令牌级模态仲裁
专题命中 多模态生成 :cross-modal(abstract,abstract_cn);分类 cs.AI
AI总结 提出MoCA模型,通过CAB分离视觉与编码能力并动态仲裁贡献,经两阶段训练后在三个基准测试中取得与同类模型相当的图表转代码性能。
持久故事世界模拟与连续角色定制
机构 * Xiamen University(厦门大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) ; Fuxi AI Lab, Netease Inc.(福克斯AI实验室,网易公司)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出EverTale,通过统一LoRA模块实现连续角色自定义,引入质量门和区域聚焦采样策略,提升多角色视觉叙事的准确性和一致性。
面向临床增强型医疗报告生成的语言对齐与视觉 grounded 的偏好优化
机构 * Huazhong University of Science and Technology(华中科技大学)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对现有医疗报告生成方法的临床事实错误与视觉-语言对齐不足问题,提出DPO-Clin框架,通过ECD模块、M²DPO及反事实偏好数据构建提升模型可靠性,在多医学数据集上取得优异性能。
Comments Accepted by ECCV 2026
ExpertVerse:知识密集型视觉合成中专家级推理的通用基准
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。
Comments 14 pages, 6 figures
LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Tongji University(同济大学) ; Tsinghua University(清华大学)
专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。
ReGraph:从食物图像生成食谱图的学习方法
机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信体智能研究院) ; Singapore Management University(新加坡管理大学)
专题命中 多模态生成 :multimodal(abstract,abstract_cn);分类 cs.AI
AI总结 本研究针对现有食谱生成方法的过程结构捕捉不足问题,构建了ReGraph食谱图数据集并提出RGL两阶段框架,可让LMM从食物图像生成结构化食谱图,提升了烹饪实体与过程关系的生成效果。
Talker-T2AV:基于自回归扩散模型的联合说话音频视频生成
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学) ; The Chinese University of Hong Kong(香港中文大学) ; Peking University(北京大学) ; Independent Researcher(独立研究者)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本文提出Talker-T2AV,通过共享骨干和模态特定解码器实现音频视频联合生成,提升跨模态一致性与生成效率。
从不确定性到确定性:无射线匹配的由粗到细视觉楼层平面图定位
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 该研究针对视觉楼层平面图定位的多模态姿态分布问题,提出无射线匹配的由粗到细框架,通过图像条件姿态扩散模型与局部细化器实现定位,在S3D和ZInD基准上达到最优精度与鲁棒性。
MMPhysVideo: 通过联合多模态建模提升视频生成的物理合理性
机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, CASIA(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; StepFun(阶跃星辰) ; Beijing Key Laboratory of Super Intelligent Security of Multi-Modal Information(多模态信息超级智能安全北京市重点实验室) ; School of Information Science and Technology, Shanghai Tech University(上海科技大学信息科学与技术学院)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 MMPhysVideo通过联合多模态建模提升视频生成的物理合理性,将感知线索统一为伪RGB格式,提出双向控制教师架构以减少跨模态干扰,并通过MMPhysPipe构建物理丰富的多模态数据集,提升物理合理性和视觉质量。
Comments Project Page: https://shubolin028.github.io/MMPhysVideo-Page
生成式AI时代的深度伪造媒体生成与检测:综述与展望
机构 * Department of Computer Science, University of Bucharest(布加勒斯特大学计算机科学系) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Department of Computer Science, University of Central Florida(中佛罗里达大学计算机科学系)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 综述了深度伪造生成与检测技术,涵盖图像、视频、音频和多模态内容,构建了分类体系,并提出了新的多模态基准测试,发现现有检测器对未见生成器的深度伪造泛化能力不足。
Comments Accepted in ACM Computing Surveys
VIPER:用于物理上合理的视频生成的视觉上下文物理推理
机构 * Zhejiang University(浙江大学) ; vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。
Comments tech report
超越融合:用于无校准红外超分辨率和红外-可见光融合的自对齐潜在扩散
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对移动红外-可见光成像中跨传感器未对准问题,提出超越融合框架,通过引入跨模态自对齐模块及未对准增强模块,实现无校准条件下的红外超分辨率和红外-可见光融合,经实验验证了其有效性。
Comments 13 pages
Axolotl3D:用于精确3D形状完成的统一框架
机构 * NVIDIA(英伟达)
专题命中 多模态生成 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 针对3D生成模型在多场景适用性有限及缺乏统一框架的问题,提出Axolotl3D模型,它基于多种模态条件设定,利用点云和相机参数,通过统一训练策略实现精确3D形状完成,实验验证其在多方面性能出色。
Comments Accepted to ECCV 2026
RS-RIE-Bench:推理引导的遥感图像编辑基准测试
机构 * Huawei(华为)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 该研究针对遥感图像编辑,引入RS-RIE-Bench基准,将任务分类,通过特定评估协议和方法评估模型,经实验发现当前模型在推理引导的遥感编辑中有局限,为未来模型提供了基准和研究方向。
OmniX:从统一全景生成与感知到适用于图形的3D场景
机构 * University of Hong Kong(香港大学) ; Kuaishou Technology(快手科技) ; Tencent(腾讯)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 研究基于全景的2D提升技术,提出OmniX框架,利用跨模态适配器结构和循环空间算子,将预训练2D流匹配先验用于多模态联合建模,构建数据集,实现适用于图形的3D场景生成,为虚拟世界创建开辟新可能。
Comments ECCV 2026; Project page: https://yukun-huang.github.io/OmniX/
ReBind:通过具有显式参考关系的结构化指令进行多参考视频编辑
机构 * HKUST(香港科技大学) ; Kling Team(克林团队) ; NJU(南京大学) ; UCAS(中国科学院大学) ; PKU(北京大学) ; HKU(香港大学)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 研究针对多参考图像条件视频编辑中现有方法难以协调多视觉源信息的问题,提出ReBind框架,通过带嵌入参考令牌的语义指令及两阶段渐进方案学习建立显式绑定,实现轻量级适配,在指令质量和性能上表现出色。
Comments Project Page: https://rebind-mrv2v.github.io/
关键帧指南针:迈向对关键帧条件视频生成的全面评估
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 研究关键帧条件视频生成,提出关键帧指南针综合基准及自动评估框架,将关键帧执行分解为六个指标评估,通过实验揭示当前模型在关键帧执行与自然视频合成间存在权衡等局限性。
Comments 35 pages
Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成
机构 * KE Holdings Inc.(KE控股公司) ; Beijing, China(中国北京)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。
Comments The first two authors contributed equally. The fourth author is the corresponding author
MAGIC:利用大语言模型生成具有可导航多场景的游戏世界并感知过渡
机构 * Department of Computer Science and Engineering(计算机科学与工程系)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.AI
AI总结 研究利用大语言模型生成多场景游戏世界时面临的问题,提出MAGIC系统,通过四阶段管道将自然语言提示转化为可运行项目,解决跨场景一致性等问题,在新基准测试中表现出色,生成可执行项目且过渡识别指标优。
循环渲染:通过视觉自反馈生成矢量图形
机构 * School of Software, Beihang University(北航软件学院) ; Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) ; Paradigm(4Paradigm)
专题命中 多模态生成 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV
AI总结 本文提出Render-in-the-Loop方法,通过视觉上下文引导矢量图形生成,提升模型对视觉信息的利用效率,实现更高效的SVG生成。
UniVideo:视频的统一理解、生成与编辑
机构 * University of Waterloo(多伦多大学) ; Kling Team, Kuaishou Technology(快手技术团队)
专题命中 多模态生成 :multimodal(abstract);MLLM(abstract);分类 cs.CV
AI总结 提出UniVideo框架,采用双流设计,结合多模态大语言模型与多模态DiT进行视频生成等任务。统一多种视频任务于单范式,实验表明其性能出色,还支持任务组合与能力迁移,且发布了模型和代码。
Comments Project Website https://congwei1230.github.io/UniVideo/
EM3M:用于微观结构分割与生成的电子显微镜图像数据集
机构 * DP Technology(DP技术)
专题命中 多模态生成 :multimodal(abstract);image-text(abstract);分类 cs.CV
AI总结 针对深度学习分析电子显微镜图像缺乏大规模专家标注数据集的问题,引入EM3M数据集,介绍构建过程,提供文本到图像扩散模型,评估分割方法并给出优化基线,推动自动化材料分析研究。
Comments 31 pages, 13 figures, Accepted by ECCV2026
ADMC: 基于注意力扩散模型的缺失模态特征补全
机构 * National University of Defense Technology(国防科学技术大学) ; The Fifth Electronic Research Institute of MIIT(信息产业部第五电子研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology Beijing(北京科技大学) ; Hunan University(湖南大学)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.AI
AI总结 提出基于注意力扩散的缺失模态特征补全方法,通过独立训练各模态特征网络避免过耦合,利用注意力扩散网络生成与真实分布一致的缺失模态特征,在IEMOCAP和MIntRec基准上取得最优结果。
BrainJanus:一个统一的大脑、视觉与语言理解与生成模型
专题命中 多模态生成 :multimodal(abstract);any-to-any(abstract);分类 cs.CV
AI总结 提出首个统一大脑模型BrainJanus,通过统一大脑分词器和全能自回归架构,实现脑信号与视觉、语言之间的双向编码与解码,在多个基准上取得优异性能并具备零样本泛化能力。
Journal ref ICML 2026