arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-02-27 至 2026-02-27 共收录 76 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 10 篇

2411.19381 2026-02-27 cs.CV cs.GR 81%

Enhancing Sketch Animation: Text-to-Video Diffusion Models with Temporal Consistency and Rigidity Constraints

增强草图动画:带有时间一致性和刚性约束的文本到视频扩散模型

Gaurav Rai, Ojaswa Sharma

机构 * Graphics Research Group, Indraprastha Institute of Information Technology Delhi(印度普拉斯塔信息技术研究所图形研究组)

专题命中 可控生成 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出了一种基于文本到视频扩散模型的草图动画方法,通过引入时间一致性和刚性约束,提升了动画的平滑度和形状保持性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 79%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 可控生成 :image generation(title,abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22742 2026-02-27 cs.CV 57%

ProjFlow: Projection Sampling with Flow Matching for Zero-Shot Exact Spatial Motion Control

ProjFlow: 基于流匹配的投影采样用于零样本精确空间运动控制

Akihisa Watanabe, Qing Yu, Edgar Simo-Serra, Kent Fujiwara

机构 * Waseda University(早稻田大学) LY Corporation(LY公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 ProjFlow通过引入运动学感知度量和时间变化公式,在无需训练的情况下实现精确空间约束满足,提升运动现实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22596 2026-02-27 cs.CV cs.AI 57%

BetterScene: 3D Scene Synthesis with Representation-Aligned Generative Model

BetterScene: 一种基于表示对齐生成模型的3D场景合成

Yuci Han, Charles Toth, John E. Anderson, William J. Shuart, Alper Yilmaz

机构 * Dept. of Electrical and Computer Engineering, The Ohio State University(电气与计算机工程系,俄亥俄州立大学) USACE ERDC GRL(美国陆军工程兵队ERDC GRL)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 BetterScene通过引入时间等价性正则化和视觉基础模型对齐的表示,提升3D场景合成的视角一致性与质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22549 2026-02-27 cs.CV cs.AI 57%

DrivePTS: A Progressive Learning Framework with Textual and Structural Enhancement for Driving Scene Generation

DrivePTS: 一种结合文本和结构增强的渐进式学习框架用于驾驶场景生成

Zhechao Wang, Yiming Zeng, Lufan Ma, Zeqing Fu, Chen Bai, Ziyao Lin, Cheng Lu

机构 * XPeng Motors

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DrivePTS通过渐进式学习、多视角文本生成和频率引导结构损失,提升驾驶场景生成的保真度和可控性,生成稀有场景并增强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19565 2026-02-27 cs.CV cs.AI 57%

DICArt: Advancing Category-level Articulated Object Pose Estimation in Discrete State-Spaces

DICArt: 在离散状态空间中推进类别级拟合物体姿态估计

Li Zhang, Mingyu Mei, Ailing Wang, Xianhui Meng, Yan Zhong, Xinyuan Song, Liu Liu, Rujing Wang, Zaixing He, Cewu Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学) Peking University(北京大学) Emory University(埃默里大学) Hefei University of Technology(合肥工业大学) Jianghuai Advance Technology Center(江淮先进技术中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DICArt通过离散扩散过程和层次化运动学耦合策略,提升复杂环境下类别级6D姿态估计的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22868 2026-02-27 cs.CL 50%

Rejection Mixing: Fast Semantic Propagation of Mask Tokens for Efficient DLLM Inference

拒绝混合:用于高效DLLM推理的快速语义传播掩码标记

Yushi Ye, Feng Hong, Huangjie Zheng, Xu Chen, Zhiyong Chen, Yanfeng Wang, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学联合中位网创新中心,上海交通大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 ReMix通过在离散扩散解码过程中引入连续混合状态,实现高效DLLM推理,提升速度同时保持质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2602.23262 2026-02-27 cs.CV cs.CR 79%

Decomposing Private Image Generation via Coarse-to-Fine Wavelet Modeling

通过粗到细的小波建模分解私有图像生成

Jasmine Bayrooti, Weiwei Kong, Natalia Ponomareva, Carlos Esteves, Ameesh Makadia, Amanda Prorok

机构 * University of Cambridge(剑桥大学) Google Research(谷歌研究)

专题命中 图像修复 :image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于小波空间的频谱DP框架,通过粗到细的两阶段方法提升图像生成的隐私与效用平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 3 篇

2602.23203 2026-02-27 cs.CV cs.AI 57%

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22819 2026-02-27 cs.CV 57%

Face Time Traveller : Travel Through Ages Without Losing Identity

面容时间旅行者:无需丢失身份即可穿越年龄

Purbayan Kar, Ayush Ghadiya, Vishal Chudasama, Pankaj Wasnik, C. V. Jawahar

机构 * Sony Research India(索尼印度研究实验室) IIIT Hyderabad(Hyderabad 研究学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 FaceTT通过基于扩散的框架实现高保真身份一致的年龄变换,引入了Face-Attribute-Aware Prompt Refinement策略、无调优的Angular Inversion方法和自适应注意力控制机制,提升了年龄变换的精度和稳定性。

Comments Accepted at CVPR 2026 (Findings Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22430 2026-02-27 cs.GR cs.LG 57%

TopoEdit: Fast Post-Optimization Editing of Topology Optimized Structures

TopoEdit: 快速拓扑优化结构的后期优化编辑

Hongrui Chen, Josephine V. Carstensen, Faez Ahmed

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.GR

AI总结 TopoEdit通过利用预训练拓扑基础模型的潜在嵌入,实现快速的拓扑优化结构后期编辑,提升机械性能并避免灾难性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 2 篇

2602.22570 2026-02-27 cs.CV cs.AI 86%

Guidance Matters: Rethinking the Evaluation Pitfall for Text-to-Image Generation

引导至关重要:重新审视文本到图像生成中的评估误区

Dian Xie, Shitong Shao, Lichen Bai, Zikai Zhou, Bojun Cheng, Shuo Yang, Jun Wu, Zeke Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Cogniser Information Technology(Cogniser信息科技)

专题命中 图像生成评测 :image generation(title);text-to-image(title);diffusion(abstract);分类 cs.CV

AI总结 本文重新审视文本到图像生成中的评估误区,提出引导感知评估框架,并设计超越扩散引导方法以提升人类偏好评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 57%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 3 篇

2508.12691 2026-02-27 cs.GR cs.CV cs.LG 81%

Adaptive Hybrid Caching for Efficient Text-to-Video Diffusion Model Acceleration

自适应混合缓存用于高效文本到视频扩散模型加速

Yuanxin Wei, Lansong Diao, Bujiao Chen, Shenggan Cheng, Zhengping Qian, Wenyuan Yu, Nong Xiao, Wei Lin, Jiangsu Du

机构 * Sun Yat-sen University(中山大学) Alibaba Group(阿里巴巴集团) National University of Singapore(新加坡国立大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出MixCache,一种基于缓存的训练自由框架,通过自适应混合缓存策略提升视频DiT模型的生成效率和质量。

Comments 9 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05251 2026-02-27 stat.ML cs.LG 78%

One-Step Diffusion Samplers via Self-Distillation and Deterministic Flow

通过自蒸馏和确定性流实现单步扩散采样器

Pascal Jutras-Dube, Jiaru Zhang, Ziran Wang, Ruqi Zhang

机构 * Purdue University(普渡大学)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 本文提出一种单步扩散采样器,通过自蒸馏和确定性流实现快速稳定采样和证据估计。

Comments Accepted to the 29th International Conference on Artificial Intelligence and Statistics (AISTATS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03175 2026-02-27 q-fin.CP 50%

Breaking the Dimensional Barrier: Dynamic Portfolio Choice with Parameter Uncertainty via Pontryagin Projection

突破维度壁垒:通过庞特里亚金投影实现动态投资组合选择与参数不确定性

Jeonggyu Huh, Hyeng Keun Koo

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出PG-DPO方法,通过庞特里亚金投影和BPTT随机梯度上升解决高维参数不确定性下的动态投资组合选择问题,实验表明其在高维漂移不确定性中表现优于无模型PPO基线。

详情

展开后加载摘要…

URL PDF HTML 收藏