GenClaw: Code-Driven Agentic Image Generation
GenClaw: 代码驱动的智能体图像生成
专题命中 可控生成 :image generation(title,abstract);分类 cs.CV
AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。
Comments 21 pages, 7 figures
视觉与机器人
图像生成、文生图、图像编辑、扩散模型和可控生成。
GenClaw: 代码驱动的智能体图像生成
专题命中 可控生成 :image generation(title,abstract);分类 cs.CV
AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。
Comments 21 pages, 7 figures
MergeTok: 通过令牌合并实现统一连续和离散视觉令牌化
机构 * Tsinghua University(清华大学) ; Westlake University(西湖大学) ; Zhejiang University(浙江大学) ; Hong Kong University of Science and Technology(香港科学与技术大学) ; OPPO ; Shanghai AI Lab(上海人工智能实验室)
专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV
AI总结 提出MergeTok统一令牌化器,通过令牌合并技术联合优化连续VAE和离散VQ令牌化器,实现高保真重建与语义可控离散表示的兼顾。
Comments 11 pages (main text), 7 figures. Preprint. Under review at NeurIPS 2026
SLAP: 用于变分视频-语言建模的语义最小作用原理
机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) ; Nanyang Technological University, Singapore(新加坡南洋理工大学)
专题命中 可控生成 :diffusion(abstract);分类 cs.CV
AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。
Comments Accepted by ICML 2026
X-GS:基于3D高斯溅射的感知与思考可扩展框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Fudan University(复旦大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院)
专题命中 可控生成 :generative vision(abstract);分类 cs.CV
AI总结 提出X-GS框架,包含感知器和思考器,统一多种3DGS技术实现实时在线SLAM与语义蒸馏,并支持多模态模型完成下游任务。
自回归视觉生成需要一个序幕
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; hi-Lab, Xiaohongshu Inc(小红书实验室)
专题命中 可控生成 :image generation(abstract);分类 cs.CV
AI总结 提出Prologue方法,通过生成前置的序幕令牌来弥合自回归图像生成中的重建-生成差距,在不影响重建质量的前提下显著提升生成性能。
Comments Code: https://github.com/Zyriix/prologue Demo: https://huggingface.co/spaces/Zyriix/prologue-demo
AnchorSteer: 自发现概念注入用于结构保持的音乐编辑
机构 * National Taiwan University(国立台湾大学)
专题命中 可控生成 :diffusion(abstract)
AI总结 提出AnchorSteer框架,通过结构锚定与自发现语义注入解耦语义-结构纠缠,实现高保真结构保持下的显著语义变换。
Comments Accepted by the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)
SlotMemory: 面向流式长视频生成的以对象为中心的KV记忆
机构 * Fudan University(复旦大学) ; Meta Superintelligence Labs(Meta超智能实验室) ; Baidu(百度)
专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV
AI总结 提出SlotMemory,一种以对象为中心的键值记忆机制,通过将变换器的键值流形分解为离散语义槽,实现实体级持久性和提示感知检索,在60秒交互叙事中动态一致性相对提升22.8%。
共形可靠性:条件生成的新评估指标
机构 * Institute of Science and Technology for Brain-Inspired Intelligence(脑启发式智能科学与技术研究院) ; Shanghai Innovation Institute(上海创新研究院) ; School of Data Science(数据科学学院) ; Nanyang Technological University(南洋理工大学) ; School of Information Science and Technology(信息科学与技术学院)
专题命中 图像生成评测 :text-to-image(abstract)
AI总结 提出基于共形预测的可靠性分数作为条件生成模型的新评估指标,并开发CReL框架高效计算该分数,实验证明其有效性和可解释性。
Comments Accepted at ICML 2026
生成性漂移实际上是分数匹配:一个谱与变分视角
机构 * LIX, Ecole Polytechnique, IP Paris(巴黎高等理工学院信息研究所)
专题命中 图像生成评测 :image generation(abstract)
AI总结 本文通过揭示高斯核下漂移算子等价于平滑分布上的分数差,将生成性漂移方法纳入分数匹配框架,并利用谱分析和变分方法解决了原始工作中的三个遗留问题,同时提出了指数带宽退火策略和基于JKO方案的停止梯度算子理论依据。
通过扩散采样逆变换数据变换
机构 * Mila - Quebec Artificial Intelligence Institute, Montr\'eal, Canada ; School of Computer Science, McGill University, Montr\'eal, Canada
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 提出一种在一般李群上通过扩散采样逆变换未知变换的方法,用于恢复原始数据分布,并在测试时等变性应用中提升预训练神经网络的鲁棒性。
Comments 31 pages, 11 figures
边界引导策略优化:面向扩散大语言模型的内存高效强化学习
机构 * Tsinghua University(清华大学)
专题命中 效率与蒸馏 :diffusion(title,abstract)
AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。
推理时奖励对齐中的并行回火初始采样
机构 * Department of Artificial Intelligence(人工智能系) ; Department of Computer Science(计算机科学系)
专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV
AI总结 针对推理时奖励对齐中标准SMC方法因初始采样陷入局部模式的问题,提出基于并行回火的PATHS方法,通过耦合多条回火链实现高效探索,提升对齐质量。
Comments 31 pages, 11 figures
一种高效且可扩展的保结构图压缩方法
机构 * Southwest University(西南大学)
专题命中 效率与蒸馏 :diffusion(abstract)
AI总结 提出一种解耦节点压缩与图结构生成的保结构图压缩方法(SP-ESGC),通过热核特征传播和混合聚类策略实现高效图压缩,并利用预训练边预测器生成可迁移的结构模式,在保持高计算效率的同时提升跨GNN架构的泛化能力。