arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-04-29 至 2026-04-29 共收录 66 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 4 篇

2604.02467 2026-04-29 cs.CV cs.AI 57%

VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation

VERTIGO:用于电影摄像机轨迹生成的视觉偏好优化

Mengtian Li, Yuwei Lu, Feifei Li, Chenqi Gan, Zhifeng Xie, Xi Wang

机构 * Shanghai University Shanghai Engineering Research Center of Motion Picture Special Effects LIX, \'Ecole Polytechnique, CNRS, IPP magenta http://vertigo.magic-lab.tech/

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VERTIGO,通过视觉偏好优化提升摄像机轨迹生成的质量,通过实时渲染和视觉语言模型优化,提高画面构图和视觉效果。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17492 2026-04-29 cs.CV 57%

MMLANDMARKS: a Cross-View Instance-Level Benchmark for Geo-Spatial Understanding

MMLANDMARKS: 一种用于地理空间理解的跨视图实例级基准

Oskar Kristoffersen, Alba Reinders Sánchez, Morten Rieger Hannemose, Anders Bjorholm Dahl, Dim P. Papadopoulos

机构 * Technical University of Denmark(丹麦技术大学) Pioneer Center for AI(先锋人工智能中心)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出MMLandmarks基准,包含四类数据:高分辨率航拍图、地面视图、文本信息和地理坐标,用于跨视图地物检索、定位及文本到图像等任务,揭示多模态数据对地理空间理解的重要性。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07348 2026-04-29 cs.CV 57%

MICo-150K: A Comprehensive Dataset Advancing Multi-Image Composition

MICo-150K:一个多图像合成的综合数据集

Xinyu Wei, Kangrui Cen, Hongyang Wei, Zhen Guo, Kai Cui, Bairui Li, Zeqing Wang, Jinrui Zhang, Lei Zhang

机构 * Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) Peking University(北京大学) Sun Yat-Sen University(中山大学) OPPO Research Institute(OPPO研究院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出MICo-150K数据集,通过系统研究多图像合成任务,构建高质量图像和多样提示,结合人类反馈生成平衡的合成图像,同时建立评估基准和新指标,验证了数据集对模型提升的有效性。

Comments Project Page: https://MICo-150K.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与蒸馏 2 篇

2604.10103 2026-04-29 cs.CV 57%

Long-Horizon Streaming Video Generation via Hybrid Attention with Decoupled Distillation

通过混合注意力与解耦蒸馏实现长时域流式视频生成

Ruibin Li, Tao Yang, Fangzhou Ai, Tianhe Wu, Shilei Wen, Bingyue Peng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) ByteDance(字节跳动) City University of Hong Kong(香港城市大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出混合强制方法,通过混合注意力设计联合优化时序信息保留与计算效率,采用轻量线性时序注意力和块稀疏注意力,实现高效稳定流式视频生成,实测在单块H100 GPU上达到29.5 FPS的实时832x480视频生成

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21942 2026-04-29 physics.chem-ph cs.AI 50%

Suiren-1.0 Technical Report: A Family of Molecular Foundation Models

苏iren-1.0技术报告:分子基础模型家族

Junyi An, Xinyu Lu, Yun-Fei Shi, Li-Cheng Xu, Nannan Zhang, Chao Qu, Yuan Qi, Fenglei Cao

机构 * Shanghai Academy of AI for Science (SAIS)(上海人工智能科学研究院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 苏iren-1.0通过结合3D构象几何与2D统计集合空间,提出分子基础模型家族,包含Suiren-Base、Suiren-Dimer和Suiren-ConfAvg三种变体,实现量子属性预测和分子表示学习的先进方法。

Comments 24 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他图像生成 1 篇

2507.11567 2026-04-29 cs.CY 50%

Consumer Law for AI Agents

人工智能代理的消费者法

Christoph Busch

专题命中 其他图像生成 :image generation(abstract)

AI总结 本文探讨欧盟现行消费者法是否能适应人工智能代理带来的变革,分析其对电子商务和人类中心消费法的挑战,并提出未来兼顾人类与机器的消费者法框架。

Journal ref German Law Journal 26 (2025) 1367-1382

详情

展开后加载摘要…

URL PDF HTML 收藏