arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-30 至 2026-07-30 共收录 4 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4 篇

2607.26529 2026-07-30 cs.CV 新提交 57%

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26411 2026-07-30 cs.CV 新提交 57%

Do Unified Multimodal Models Think in One Space? A Lens Through Cross-Branch Steering

统一多模态模型是否在同一空间中思考?通过跨分支引导的视角

Yu Wang, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 本研究针对统一多模态模型是否共享统一可迁移语义空间的问题,提出跨分支语义引导框架,发现理解分支的引导向量可迁移至生成分支,揭示架构统一不保证语义对齐,该框架可用于探测多模态表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19651 2026-07-30 cs.AI cs.CV cs.LG 版本更新 57%

BrainG3N: A Dual-Purpose Tokenizer for Controllable 3D Brain MRI Generation

BrainG3N:用于可控3D脑MRI生成的双用途分词器

Max Van Puyvelde, Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Department of Biomedical Data Science, Stanford University School of Medicine(斯坦福大学医学院生物医学数据科学系) Department of Mathematical Modelling, Statistics & Bioinformatics, Ghent University(根特大学数学建模、统计与生物信息学系) Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出基于3D掩码自编码器的分词器,解耦编码器与解码器,在23项线性探测任务中21项超越SOTA,并支持条件生成和纵向预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26762 2026-07-30 cs.CL 新提交 50%

Relation Geometry in Semantic Space of Language Models

语言模型语义空间中的关系几何

Zhihan Cao, Hiroaki Yamada, Simone Teufel, Tatsuya Hiraoka, Kentaro Inui, Hitomi Yanaka, Takenobu Tokunaga

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究语言模型语义空间中关系几何的表征情况,通过三类语言模型在6种语义关系上的实验,发现非对称关系的表征更清晰,且不同模型依赖的信息来源存在差异。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏