arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-01 至 2026-06-01 共收录 103 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2605.30248 2026-06-01 cs.CV 79%

GenClaw: Code-Driven Agentic Image Generation

GenClaw: 代码驱动的智能体图像生成

Junyan Ye, Jun He, Zilong Huang, Dongzhi Jiang, Xuan Yang, Rui Chen, Weijia Li

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 提出GenClaw,一种代码驱动的智能体图像生成范式,通过概念构思、代码草图绘制和纹理补充三个阶段,将黑盒图像生成转变为可控、可解释的分阶段过程。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30904 2026-06-01 cs.CV 70%

MergeTok: Unified Continuous and Discrete Visual Tokenization via Token Merging

MergeTok: 通过令牌合并实现统一连续和离散视觉令牌化

Luyuan Zhang, Siyuan Li, Zedong Wang, Qingsong Xie, Cheng Tan, Anna Wang, Yanhao Zhang, Chen Chen, Haonan Lu, Haoqian Wang

机构 * Tsinghua University(清华大学) Westlake University(西湖大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) OPPO Shanghai AI Lab(上海人工智能实验室)

专题命中 可控生成 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出MergeTok统一令牌化器,通过令牌合并技术联合优化连续VAE和离散VQ令牌化器,实现高保真重建与语义可控离散表示的兼顾。

Comments 11 pages (main text), 7 figures. Preprint. Under review at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV 57%

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09632 2026-06-01 cs.CV cs.CL 57%

X-GS: An Extensible Framework for Perceiving and Thinking via 3D Gaussian Splatting

X-GS:基于3D高斯溅射的感知与思考可扩展框架

Yueen Ma, Zenglin Xu, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 提出X-GS框架,包含感知器和思考器,统一多种3DGS技术实现实时在线SLAM与语义蒸馏,并支持多模态模型完成下游任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06137 2026-06-01 cs.CV cs.AI cs.LG 57%

Autoregressive Visual Generation Needs a Prologue

自回归视觉生成需要一个序幕

Bowen Zheng, Weijian Luo, Guang Yang, Colin Zhang, Tianyang Hu

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) hi-Lab, Xiaohongshu Inc(小红书实验室)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 提出Prologue方法,通过生成前置的序幕令牌来弥合自回归图像生成中的重建-生成差距,在不影响重建质量的前提下显著提升生成性能。

Comments Code: https://github.com/Zyriix/prologue Demo: https://huggingface.co/spaces/Zyriix/prologue-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31053 2026-06-01 cs.SD cs.AI 50%

AnchorSteer: Self-Discovered Concept Injection for Structure-Preserving Music Editing

AnchorSteer: 自发现概念注入用于结构保持的音乐编辑

Chih-Heng Chang, Keng-Seng Ho, Chih-Yu Tsai, Kuan-Lin Chen, Yi-Hsuan Yang, Jian-Jiun Ding

机构 * National Taiwan University(国立台湾大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出AnchorSteer框架,通过结构锚定与自发现语义注入解耦语义-结构纠缠,实现高保真结构保持下的显著语义变换。

Comments Accepted by the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 1 篇

2605.31033 2026-06-01 cs.CV 57%

SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation

SlotMemory: 面向流式长视频生成的以对象为中心的KV记忆

Weijia Dou, Hui Li, Jiahao Cui, Lei Zhou, Jingdong Wang, Siyu Zhu

机构 * Fudan University(复旦大学) Meta Superintelligence Labs(Meta超智能实验室) Baidu(百度)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出SlotMemory,一种以对象为中心的键值记忆机制,通过将变换器的键值流形分解为离散语义槽,实现实体级持久性和提示感知检索,在60秒交互叙事中动态一致性相对提升22.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 2 篇

2605.30807 2026-06-01 cs.LG 50%

Conformal Reliability: A New Evaluation Metric for Conditional Generation

共形可靠性:条件生成的新评估指标

Yachen Gao, Xinwei Sun, Yikai Wang, Ye Shi, Jingya Wang, Jianfeng Feng, Yanwei Fu

机构 * Institute of Science and Technology for Brain-Inspired Intelligence(脑启发式智能科学与技术研究院) Shanghai Innovation Institute(上海创新研究院) School of Data Science(数据科学学院) Nanyang Technological University(南洋理工大学) School of Information Science and Technology(信息科学与技术学院)

专题命中 图像生成评测 :text-to-image(abstract)

AI总结 提出基于共形预测的可靠性分数作为条件生成模型的新评估指标,并开发CReL框架高效计算该分数,实验证明其有效性和可解释性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09936 2026-06-01 cs.LG 50%

Generative Drifting is Secretly Score Matching: a Spectral and Variational Perspective

生成性漂移实际上是分数匹配:一个谱与变分视角

Erkan Turan, Nicolas Dufour, Maks Ovsjanikov

机构 * LIX, Ecole Polytechnique, IP Paris(巴黎高等理工学院信息研究所)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文通过揭示高斯核下漂移算子等价于平滑分布上的分数差,将生成性漂移方法纳入分数匹配框架,并利用谱分析和变分方法解决了原始工作中的三个遗留问题,同时提出了指数带宽退火策略和基于JKO方案的停止梯度算子理论依据。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 4 篇

2602.08267 2026-06-01 cs.LG cs.AI 78%

Inverting Data Transformations via Diffusion Sampling

通过扩散采样逆变换数据变换

Jinwoo Kim, Sékou-Oumar Kaba, Jiyun Park, Seunghoon Hong, Siamak Ravanbakhsh

机构 * Mila - Quebec Artificial Intelligence Institute, Montr\'eal, Canada School of Computer Science, McGill University, Montr\'eal, Canada

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 提出一种在一般李群上通过扩散采样逆变换未知变换的方法,用于恢复原始数据分布,并在测试时等变性应用中提升预训练神经网络的鲁棒性。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11683 2026-06-01 cs.LG cs.AI cs.CL 78%

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models

边界引导策略优化:面向扩散大语言模型的内存高效强化学习

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30991 2026-06-01 cs.LG cs.CV 57%

Parallel Tempering Initial Sampling in Inference-Time Reward Alignment

推理时奖励对齐中的并行回火初始采样

Myeongjun Oh, Gwangho Kim, Sungyoon Lee

机构 * Department of Artificial Intelligence(人工智能系) Department of Computer Science(计算机科学系)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 针对推理时奖励对齐中标准SMC方法因初始采样陷入局部模式的问题,提出基于并行回火的PATHS方法,通过耦合多条回火链实现高效探索,提升对齐质量。

Comments 31 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31016 2026-06-01 cs.LG 50%

An Efficient and Scalable Graph Condensation with Structure-Preserving

一种高效且可扩展的保结构图压缩方法

Yulin Hu, Fuyan Ou, Ye Yuan

机构 * Southwest University(西南大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出一种解耦节点压缩与图结构生成的保结构图压缩方法(SP-ESGC),通过热核特征传播和混合聚类策略实现高效图压缩,并利用预训练边预测器生成可迁移的结构模式,在保持高计算效率的同时提升跨GNN架构的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏