UniCom: Unified Multimodal Modeling via Compressed Continuous Semantic Representations
UniCom: 通过压缩的连续语义表示实现统一多模态建模
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
UniCom: 通过压缩的连续语义表示实现统一多模态建模
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 UniCom通过压缩连续语义表示实现统一多模态建模,有效解决离散化与连续建模的矛盾,提升生成性能和图像可控性。
OmniVTON++: 无需训练的通用虚拟试衣系统 with 主要姿态引导
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 OmniVTON++是一种无需训练的通用虚拟试衣系统,通过协调结构化服装变形、主要姿态引导和连续边界缝合,实现跨数据集和服装类型的高性能虚拟试衣。
UniWeTok: 一种具有 $2^{128}$ 大小代码本的统一二进制分词器用于统一多模态大语言模型
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 UniWeTok通过大规模二进制代码本和改进的训练框架,实现统一多模态大语言模型的高效视觉表示。
Comments 29 pages, 9 figures, 33 tables
RoboPCA:基于姿态的从人类示范中学习空间可及性的方法用于机器人操作
机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室、计算技术研究所) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 RoboPCA通过联合预测接触区域和姿态,提升机器人操作中从人类示范中学习空间可及性的性能。
Comments Accepted to ICRA 2026
UniUGG: 通过几何-语义编码实现统一的3D理解与生成
机构 * Fudan University(复旦大学) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。
语义噪声初始化能否从图像迁移到视频?一项配对诊断研究
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 该研究探讨了语义噪声初始化在文本到视频生成中的有效性,发现其在时间相关维度有小幅度提升,但整体效果与基线相当,建议采用提示级评估和噪声空间分析作为标准方法。
Comments 8 pages, 1 figure. Accepted to the ICLR 2026 Workshop on Multimodal Intelligence: Next Token Prediction & Beyond
ReDepth Anything: 通过自监督重照明进行测试时深度细化
机构 * Bielefeld University(比勒菲尔德大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 ReDepth Anything通过自监督重照明技术,在测试时提升深度估计的准确性和真实感,优于现有方法并达到最新水平。
Comments Accepted at CVPR 2026 (Findings). Project Page: https://anantarb.github.io/redepth Code: https://github.com/anantarb/Re-Depth-Anything
EffectMaker:统一推理与生成以实现定制化视觉效果创建
机构 * Tencent Hunyuan(腾讯文言) ; City University of Hong Kong(香港城市大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。
Comments Project page: https://effectmaker.github.io
InnoAds-Composer: 电商海报生成中的高效条件组合
机构 * JD.com, Inc.(京东公司) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Zhejiang University(浙江大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。
Comments Accepted by CVPR2026
Cog2Gen3D: 三维语义-几何认知雕刻用于三维生成
机构 * School of Artificial and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) ; School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; School of Computing, Macquarie University(麦考瑞大学计算机学院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Cog2Gen3D通过结合语义和绝对几何信息,提出了一种三维认知引导的扩散框架,以实现可控的三维生成。
UniTS:面向遥感的统一时空生成模型
机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) ; Department of Geography, the University of Hong Kong(香港大学地理系) ; School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) ; Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) ; Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。
PoI: 一种从新视角提取感兴趣像素的滤波器用于场景坐标回归
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 PoI通过像素级过滤策略提升场景坐标回归的定位精度,结合扩散模型和重投影误差优化新视角合成效果。
FC-VFI: 用于高帧率慢动作视频生成的忠实且一致的视频帧插值
机构 * Zhejiang University Chinese University of Hong Kong(浙江大学香港中文大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 FC-VFI通过引入时间建模策略和语义匹配线,实现了高帧率慢动作视频生成中的忠实且一致的帧插值。
Comments ICASSP2026
UFO-4D:从两幅图像中进行无约束前馈4D重建
机构 * Google(谷歌) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
专题命中 可控生成 :image synthesis(abstract);分类 cs.CV
AI总结 UFO-4D通过统一的前馈框架,从两幅图像中高效重建密集4D表示,实现3D几何、运动和相机姿态的联合估计,提升4D重建精度与效率。
Comments ICLR 2026, Project page: https://ufo-4d.github.io/
TextMaster: 一种通过字形-风格双控实现真实文本编辑的统一框架
机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 TextMaster通过字形-风格双控机制,实现了高精度、可控的文本编辑,适用于多种场景和图像区域,提升了文本布局的准确性和风格的可控性。
Comments Accepted to ICCV 2025
Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025, pp. 16112-16121
NOVA:无配对视频编辑的稀疏控制与密集合成
机构 * Nanjing University(南京大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; WeChat, Tencent(微信、腾讯) ; The University of Hong Kong(香港大学)
专题命中 可控生成 :image editing(abstract);分类 cs.CV
AI总结 NOVA提出了一种无配对视频编辑框架,通过稀疏控制与密集合成提升编辑保真度和时间一致性。
Comments Accepted by CVPR 2026
LiftAvatar:基于运动空间的表达控制3D高斯人偶动画
机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) ; Institute of Artificial Intelligence of China Telecom(中国电信人工智能研究院)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 LiftAvatar通过多粒度表达控制和多参考条件机制,提升3D人偶动画的质量和可控性。
Comments 19 pages, 11 figures
语义相似性是漫画理解的虚假度量:来自基准实验中幻觉的教训
专题命中 可控生成 :generative vision(abstract);分类 cs.CV
AI总结 本文提出了一项初步基准测试,评估生成视觉-语言模型在漫画解释任务中的表现,并分析了幻觉现象,强调未来研究中需加强幻觉缓解和数据整理。
Comments 8 pages, 2 figures, 3 tables. Includes link to code
通过脑交互变换器从fMRI中进行图像重建
机构 * Weizmann Institute of Science(魏茨曼科学研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Brain-IT通过脑交互变换器从fMRI中实现高保真图像重建,结合高层语义和低层结构特征,提升重建精度与效率。
Comments Accepted at ICLR 2026
Uni-X: 通过双端分离架构缓解多模态冲突以实现统一多模态模型
机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) ; Baidu Inc.(百度公司)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 Uni-X通过双端分离和中间共享的架构缓解多模态冲突,提升统一多模态模型的训练效率和性能。
Comments ICLR 2026
SesaHand: 通过语义和结构对齐可控生成增强3D手重建
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Communication University of China(中国通信大学)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 SesaHand通过语义和结构对齐提升可控手部生成,优化3D手重建性能。
下一步视觉粒度生成
机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) ; SenseTime Research(商汤科技研究院)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 NVG框架通过分层生成方法实现图像生成,优于VAR系列,提升FID分数并展示出良好的扩展性和潜在应用。
Comments ICLR 2026
朝向生成逼真3D语义训练数据以实现自动驾驶
机构 * Center for Robotics, University of Bonn, Germany(bonn大学机器人中心) ; RWTH Aachen, Germany(亚琛工业大学) ; Lamarr Institute for Machine Learning and Artificial Intelligence, Germany(lamarr机器学习与人工智能研究所)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 本文提出一种无需投影或分离开的多分辨率模型的3D语义生成方法,生成更逼真的场景数据,提升自动驾驶训练效果。
立体说话者:基于优先级的混合专家引导的音频驱动3D人类合成
机构 * Department of Automation, Tsinghua University(自动化系,清华大学) ; Bytedance Inc.(字节跳动公司) ; State Key Laboratory of Media Convergence and Communication, Communication University of China(媒体融合与传播国家重点实验室,中国传媒大学) ; School of Artificial Intelligence, Beijing Normal University(人工智能学院,北京师范大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 Stereo-Talker通过优先级引导的混合专家机制实现音频驱动的3D人类合成,生成具有精确唇同步和逼真质量的视频。
Journal ref TPAMI 2025
ProjFlow: 基于流匹配的投影采样用于零样本精确空间运动控制
机构 * Waseda University(早稻田大学) ; LY Corporation(LY公司)
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 ProjFlow通过引入运动学感知度量和时间变化公式,在无需训练的情况下实现精确空间约束满足,提升运动现实性。
BetterScene: 一种基于表示对齐生成模型的3D场景合成
机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) ; USACE ERDC GRL(美国陆军工程兵队ERDC GRL)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。
DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成
机构 * XPeng Motors
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。
DICArt: 在离散状态空间中推进类别级拟合物体姿态估计
机构 * University of Science and Technology of China(中国科学技术大学) ; Shanghai Jiao Tong University(上海交通大学) ; Zhejiang University(浙江大学) ; East China Normal University(华东师范大学) ; Peking University(北京大学) ; Emory University(埃默里大学) ; Hefei University of Technology(合肥工业大学) ; Jianghuai Advance Technology Center(江淮先进技术中心) ; Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。
几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文
机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) ; TeleAI ; MUST
专题命中 可控生成 :inpainting(abstract);分类 cs.CV
AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。
Comments Accepted by CVPR 2026
TherA: 用于可控RGB到热红外转换的热感知视觉-语言提示
机构 * Seoul National University(首尔国立大学) ; Kyungpook National University(庆北国立大学) ; KENTECH
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 TherA通过热感知视觉-语言提示方法,实现了可控的RGB到热红外转换,提升了翻译性能和细粒度控制能力。