Training an adaptive dialogue policy for interactive learning of visually grounded word meanings
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments 11 pages, SIGDIAL 2016 Conference
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments 11 pages, SIGDIAL 2016 Conference
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CL、cs.AI
Comments 19 pages, 2 figures, 8 tables; EMNLP 2017
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV、cs.CL
Comments Under review as a conference paper at ICLR 2016
专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.MM
Journal ref Proceedings of the Research Note Sessions of the 10th Conference of the European Chapter of the Association for Computational Linguistics (EACL'03), 2003, pp. 151-154
MammoWise:多模型本地RAG流水线用于乳腺X线摄影报告生成
机构 * University of California, Davis(加州大学戴维斯分校)
专题命中 多模态生成 :multimodal(abstract,comments);分类 cs.CV
AI总结 MammoWise是一种本地多模型流水线,通过多任务分类和检索增强生成技术,实现乳腺X线摄影报告的高准确度生成与分类。
Comments arXiv preprint (submitted 25 Feb 2026). Local multi-model pipeline for mammography report generation + classification using prompting, multimodal RAG (ChromaDB), and QLoRA fine-tuning; evaluates MedGemma, LLaVA-Med, Qwen2.5-VL on VinDr-Mammo and DMID; reports BERTScore/ROUGE-L and classification metrics
专题命中 多模态生成 :multi-modal(abstract,comments);分类 cs.CV
Comments Accepted at AAAI 2025. This is the preprint version. Keywords: Multi-modal generation, diffuison models, scientific data generation, unbalanced modalities
专题命中 多模态生成 :multimodal(abstract,comments);分类 cs.CV
Comments Accepted in Multiscale Multimodal Medical Imaging workshop in MICCAI 2023
专题命中 多模态生成 :any-to-any(abstract,comments);分类 cs.CV
Comments Accepted by CVPRW 2021. This solution obtains the 3 rd position in the NTIRE 2021 Depth Guided Any-to-any Relighting Challenge
整流流中对比速度匹配的几何擦除
机构 * University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 提出GEM框架,通过对比速度匹配实现整流流模型中的概念擦除,结合生成流网络与教师引导的流匹配,有效抑制有害内容生成。
在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。
利用扩散变换器的完整性感知实现统一的3D MRI合成
机构 * School of Engineering, University of Birmingham, UK(伯明翰大学工程学院) ; William Harvey Research Institute, Queen Mary University London, UK(女王玛丽大学伦敦威廉·哈里维研究所) ; Barts Heart Centre, St Bartholomew’s Hospital, Barts Health NHS Trust, UK(巴特勒心脏中心,圣巴塞洛缪医院,巴特勒健康 NHS信托) ; Division of Cardiology, Johns Hopkins University School of Medicine, US(约翰霍普金斯大学医学院心脏病科)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 本文提出CoPeDiT模型,通过完整性感知机制提升3D MRI合成的语义一致性与鲁棒性。
Comments Accepted to TMLR
通过放松参数优化损失函数引导扩散用于逆材料设计
机构 * Intelligent Perception in Technical Systems Group, University of Augsburg, Germany(技术系统智能感知组,乌尔姆大学,德国) ; Faculty of Mathematics, Natural Science and Engineering, University of Augsburg, Germany(数学、自然科学与工程学院,乌尔姆大学,德国) ; Centre for Advanced Analytics and Predictive Sciences, University of Augsburg, Germany(高级分析与预测科学中心,乌尔姆大学,德国)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 通过优化损失函数引导扩散模型,用于逆材料设计,实现高效且多样化的设计生成。
利用工具链持续学习:超越模型参数的持续适应
机构 * University of Wollongong(卧龙岗大学) ; Nanjing University(南京大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。
Know3D: 通过视觉-语言模型的知识提示3D生成
机构 * Peking University(北京大学) ; Math Magic(数学魔术) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Guangdong Provincial Key Laboratory of Ultra High Definition Immersive Media Technology(广东省超高清沉浸媒体技术重点实验室) ; Dalian University of Technology(大连理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出Know3D框架,利用多模态大语言模型的知识提升3D生成的可控性,通过潜在状态注入实现语言可控的后视图生成,改进3D生成的几何细节与一致性。
Comments ECCV2026 page: https://xishuxishu.github.io/Know3D.github.io/
VicEdit:从视觉上下文示例学习编辑视频
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 针对文本指令视频编辑难以传达细粒度视觉信息的问题,提出视觉上下文编辑新范式,构建VicEdit-400K数据集,开发VicEdit框架,在VicEditBench上实现SOTA性能。
PersonaShot:多镜头视频生成中以人为中心的叙事连续性基准
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究针对多镜头视频生成中角色叙事连续性评估的不足,推出PersonaShot基准,设计三类特定评估器,发现先进模型感知质量与跨镜头连续性存在差距,评估器与人类专家判断一致性强。
SAGE-OR:面向手术室的半监督自适应场景图生成
机构 * Concordia University(康考迪亚大学)
专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV
AI总结 SAGE-OR是面向手术室的半监督自适应场景图生成框架,采用解耦范式,轻量高效,在4D-OR基准上F1达76%,经无监督手部增强后达86%,可低成本适配新手术场景。
Comments Accepted at BMVC 2026
DiffImaginE:通过想象验证实体类型
机构 * Fuzhou University(福州大学) ; Chinese Academy of Sciences(中国科学院) ; Peking University(北京大学) ; Alibaba Group(阿里巴巴集团) ; University of Science and Technology of China(中国科学技术大学) ; Fullive Innovation (Beijing) AI Technology Co., Ltd.(福莱创新(北京)人工智能科技有限公司) ; Baidu(百度) ; Wuhan University(武汉大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 DiffImaginE将多模态命名实体识别的类型验证建模为条件潜在扩散推理,在Twitter-2015和Twitter-2017数据集上,相比确定性对照模型取得了一致的性能提升。
RankT2I:一种用于发现文本到图像模型中可解释且多样化语义的子模框架
机构 * Virginia Tech(弗吉尼亚理工大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文提出无训练、模型无关的RankT2I框架,通过子模方法自动发现T2I模型的可编辑语义,性能优于现有方法,可高效获取多领域文本到图像编辑所需的多样化语义。
Comments ECCV 2026
MMUSV-Sim:面向多无人水面艇协同感知的感知导向型仿真与数据生成平台
机构 * School of Intelligent Systems Engineering, Sun Yat-sen University(中山大学智能工程学院) ; School of Intelligent Imagery Engineering, Beijing Film Academy(北京电影学院智能影像工程学院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 该研究提出基于Unreal Engine 5和Project AirSim的MMUSV-Sim仿真与数据生成平台,用于多USV协同感知,实验表明其生成的数据集可使激光雷达协同BEV船舶检测的AP@0.5达72.74,显著优于单USV方案。
EchoChange:用于事实性遥感灾害变化描述的双遍重掩蔽扩散语言模型
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 针对现有遥感灾害变化描述方法的级联事实错误问题,提出EchoChange扩散语言模型,经实验在RSCC基准上优于各类基线
InfiniVerse: 面向自动驾驶的占用引导无界场景生成
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Nanyang Technological University(南洋理工大学) ; Huawei Technologies Ltd.(华为技术有限公司) ; University of New South Wales(新南威尔士大学)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 提出InfiniVerse统一框架,通过3D占用表示和视频扩散模型实现从单帧到长距离、2D-3D对齐的动态城市场景可控生成,在Waymo和nuScenes上达到SOTA。
Comments Paper accepted as poster at ECCV workshop SPAD
Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。
Comments 9 pages, 6 figures, work in progress
面向物理保真的科学图表生成
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对现有文本到图像生成模型生成的科学图表存在物理错误的问题,提出Princigram生成器,通过结构化物理思维链实现物理保真的科学图表生成,在相关基准上验证了其有效性。
从视觉控件到UI代码:高效的基于工具的生成
机构 * McMaster University(麦克马斯特大学) ; University of Toronto(多伦多大学) ; Concordia University(康考迪亚大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本研究提出轻量级工具框架WidgetGen,在6个多模态模型和1000个控件上,其视觉重建指标优于直接提示和Widget2Code,且重建的图像-代码对可提升Qwen系列模型性能
Comments ECCV2026 (MUCG Workshop)
使用Clear2Fog管道研究合成雾的数据效率
机构 * Waymo Open Dataset(Waymo开放数据集)
专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV
AI总结 本文提出Clear2Fog管道,通过物理模拟生成雾数据,研究环境多样性对模型鲁棒性的影响,发现混合密度数据训练模型优于固定密度数据,且通过调整学习率可克服合成偏见。
Comments Accepted to Neurocomputing. Project code and experimental configs available at https://github.com/mmohamed28/Clear2Fog
Journal ref Neurocomputing, Vol. 703, 134798, 2026
GUIDE:企业场景下从文档到制品生成的受控统一智能
机构 * Centific Research(森蒂菲克研究院)
专题命中 多模态生成 :multimodal(abstract);分类 cs.AI
AI总结 针对企业指南文档手动处理效率低的问题,提出基于共享版本化规则库的多智能体框架GUIDE,在120份真实文档上实现96%成功率,大幅提升文档到制品的生成效率。
像素空间扩散变换器
机构 * Peking University(北京大学) ; Nanjing University(南京大学) ; Stanford University(斯坦福大学) ; Cornell University(康奈尔大学) ; University of Oulu(奥卢大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 本文探讨像素空间扩散变换器,针对潜在扩散模型的局限,研究直接对原始像素建模的像素空间扩散方法,介绍其在高维建模中的挑战与多模态建模优势,从多方面回顾pDiTs,总结方法、识别挑战并展望未来方向。
DreamOmni3:基于涂鸦的编辑与生成
机构 * CUHK(香港中文大学) ; ByteDance Inc(字节跳动公司) ; HKUST(香港科技大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 DreamOmni3通过结合文本、图像和自由手绘涂鸦,实现更灵活的图形用户界面编辑与生成,解决了复杂编辑任务中的数据创建和框架设计问题。
超越全局编辑:用于LVLMs无训练幻觉缓解的实例级解耦子空间
机构 * Macquarie University(麦考瑞大学) ; York University(约克大学) ; Northern Illinois University(北伊利诺伊大学) ; University of Technology Sydney(悉尼科技大学) ; North South University(北南大学) ; Lancaster University(兰卡斯特大学) ; Australian National University(澳大利亚国立大学)
专题命中 多模态生成 :multimodal(abstract);分类 cs.CV
AI总结 针对LVLMs现有模型编辑技术采用单一全局子空间无法适配多样幻觉模式的问题,提出无训练的实例级解耦子空间框架,经多基准实验验证其鲁棒性、通用性与效率。
Comments BMVC 2026