Personalized Multimodal Feedback Generation in Education
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments Accepted in The 28th International Conference on Computational Linguistics (COLING 2020)
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CL、cs.AI
Comments Accepted in The 28th International Conference on Computational Linguistics (COLING 2020)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments Accepted by COLING 2020
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV、eess.AS
Comments Best Paper Award. 8 pages, 4 figures, IVA '20: Proceedings of the 20th ACM International Conference on Intelligent Virtual Agent
专题命中 多模态生成 :cross-modal(title,abstract);分类 cs.CV、cs.CL
Comments ACL 2020
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI
Comments 10 pages, 4 figures. Accepted for CoRL 2019
机构 * Media and Data Science Research Lab, Adobe(Adobe媒体与数据科学研究实验室)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments Accepted in CVPR 2025 Workshop on What's Next in Multimodal Foundational Models
机构 * Computer Science Engineering(计算机科学与工程) ; Hindustan Institute of Technology and Science(印度恒河理工学院与科学研究院)
专题命中 多模态生成 :multimodal(title,comments);分类 cs.CV、cs.CL、cs.AI
Comments 10 pages, seven figures about Multimodal Cinematic Video Synthesis Using Text-to-Image and Audio Generation Models
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
Comments Accepted at ICML2024 Workshop on Trustworthy Multi-modal Foundation Models and AI Agents (TiFA)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
Comments This is a new expanded version of our previous CVPR2023 paper "SeqTrack: Sequence to Sequence Learning for Visual Object Tracking." SeqTrackv2 extends SeqTrack to four multi-modal tracking tasks with a unified model and parameter set
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
Comments Project page: https://anthonysimeonov.github.io/rpdiff-multi-modal/
通过隐式文化对齐奖励建模消除文本到图像评估中的偏差
机构 * National Tsing Hua University(国立清华大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 研究文本到图像评估中文化真实性问题,提出基于轻量级多模态大语言模型构建的隐式文化对齐奖励模型,集成隐式文化探测器与跳跃连接交叉注意力机制,实验证明该模型准确率高、速度快,能为偏好优化管道提供有效信号。
Comments 16 pages, 2 figures, ECCV 2026 Workshop FAILED
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
联合音视频生成模型是否理解物理?
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of Washington(华盛顿大学) ; University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 针对联合音视频生成模型,提出AV-Phys Bench基准测试其物理常识,发现所有模型在物理一致性上表现不足,尤其是事件驱动和环境驱动转换场景。
Comments Preprint. Project Page: https://zijuncui.com/AV-Phys/. Full abstract appears in the PDF
Bernini: 视频扩散中的潜在语义规划
机构 * Bernini Team(伯尼尼团队)
专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.AI、cs.MM
AI总结 本文提出Bernini框架,通过将大规模多模态语言模型用于语义规划,扩散模型用于像素生成,实现了视频生成与编辑的统一方法,提升了编辑任务的泛化能力。
Comments Project Page: https://bernini-ai.github.io/
专题命中 多模态生成 :multimodal(abstract,comments);multi-modal(abstract);MLLM(abstract);分类 cs.CV、cs.AI
Comments An unified model for multimodal understanding, text-to-image generation, and image editing. GitHub: https://github.com/AIDC-AI/Ovis-U1
GaussianDWM++:用于统一场景理解、编辑与多模态生成的语言接地3D高斯驾驶世界模型
机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) ; Tsinghua University(清华大学) ; Chongqing Afari Intelligent Drive Co., Ltd.(重庆阿法瑞智能驾驶有限公司) ; Nanyang Technological University(南洋理工大学)
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.CV
AI总结 该研究提出GaussianDWM++,通过基础特征高斯分词器等模块构建统一框架,在多类驾驶任务中实现场景理解、编辑与多模态生成,性能达当前最优。
GLaQ:基于视觉证据的潜在查询定位用于多模态推理
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。
DECO:解耦多模态扩散变压器用于配备插件触觉适配器的双臂灵巧操作
机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) ; School of Computation, Information and Technology, Technical University of Munich, Garching, Germany(慕尼黑技术大学计算与信息学院) ; Department of Shenyang Institute of Computing Technology, University of Chinese Academy of Sciences, Beijing, China(中国科学院沈阳计算技术研究所部门) ; State Key Laboratory for Novel Software Technology, Nanjing University, Nanjing, China(新型软件技术国家重点实验室) ; Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 DECO通过解耦多模态输入和触觉适配器,实现了双臂灵巧操作的高效整合与高成功率
Comments 25 pages, 8 figures. Project Page: https://baai-humanoid.github.io/DECO-webpage/
RAISECity: 一种用于城市级现实对齐3D世界生成的多模态代理框架
机构 * College of AI, Tsinghua University(人工智能学院,清华大学) ; Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) ; Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,北京研究院,清华大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 RAISECity通过多模态代理框架实现城市级3D世界生成,提升现实对齐、精度和性能,适用于沉浸媒体和具身智能应用。
Comments Accepted by ACM MM 2026, the code is available at: https://github.com/tsinghua-fib-lab/UrbanWorld2.0
Wyvern:用于生成基于事实的多模态报告的智能体框架
机构 * Politecnico di Torino(都灵理工大学) ; Huawei Research(华为研究院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 针对生成式模型内容缺乏事实依据的问题,提出Wyvern多智能体框架生成多模态技术报告,经评估其图像信息量、报告实用性及引用指标均优于基准方法。
HAM-RAG:面向结构保真交错生成的层级感知多模态检索增强生成
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文针对现有多模态RAG方法丢失结构化文档层级信息的问题,提出HAM-RAG框架,引入HAM-Bench基准验证,使多模态平均性能提升17.3%,为可靠多模态助手提供了层级感知的基础信号。
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
Comments 10 Pages, 4 figures, 1 table, 7th International Conference on Trends in Computational and Cognitive Engineering(TCCE-2025)
HounsWorld:用于隐藏患者状态读取、重建与模拟的多模态世界模型
机构 * East China Normal University(华东师范大学) ; DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) ; Hupan Laboratory(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究提出3B参数多模态世界模型HounsWorld,结合CT扫描与临床语言,通过共享潜在患者状态实现读取、重建、模拟三类任务,在HounsBench基准上表现优异,提升了CT理解能力。
语义引导用于可控生成:多模态扩散Transformer中的无调优概念擦除
机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) ; School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对MM-DiTs的安全风险,提出一种无调优的概念擦除方法,通过在MM-DiT中间模块构建引导向量注入模型,实现高效鲁棒的概念擦除,性能优于现有方法。
Comments Accepted to ACM MM 2026
Hunyuan3D-Buffalo 1.0:用于可扩展3D生成、理解与编辑的统一多模态模型
机构 * Tencent Hunyuan(腾讯混元)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Hunyuan3D-Buffalo 1.0是支持3D理解、文本到3D生成等功能的统一多模态模型,构建87M规模语料库训练,在相关基准上达SOTA或领先性能,验证了统一训练的有效性。
Comments Project Page: https://tencent-hunyuan.github.io/Hunyuan3D-Buffalo1.0
TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型
专题命中 多模态生成 :multi-modal(title,abstract);分类 cs.AI
AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。
机构 * Department of Computer Science University of Iowa(计算机科学系 印第安纳大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
Comments 22 pages, 14 figures, 7 tables
Journal ref International Conference on Learning Representations (ICLR), 2026
Aero Realtime:用于低延迟流式多模态生成的完全对齐输入输出流
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI
AI总结 本文提出4B参数流式多模态模型Aero Realtime,采用双工架构实现输入输出流完全对齐,通过时隙对齐等技术降低延迟,在4块NVIDIA A6000 GPU上验证了其低延迟多模态交互的可行性。
Vorch-IR:长视频统一多模态身份替换生成模型
机构 * Vorch Team(Vorch团队) ; Fudan University(复旦大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 Vorch-IR是基于LTX2的统一多模态视频身份替换框架,支持单人、双人身份及可选背景替换,通过自动数据构建流水线与时间重叠推理策略,实现长视频生成,在身份保留、动作保真等方面表现出色。
Comments Project page: https://vorch-project.github.io/Vorch-IR-project/
扩散模型中的视觉锚定:多模态零样本骨骼动作识别
机构 * The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV
AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。