arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-09 至 2026-03-09 共收录 78 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 8 篇

2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 73%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 可控生成 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06014 2026-03-09 cs.CV 57%

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

EffectMaker:统一推理与生成以实现定制化视觉效果创建

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao

机构 * Tencent Hunyuan(腾讯文言) City University of Hong Kong(香港城市大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 EffectMaker通过统一推理生成框架实现定制化视觉效果创建,利用多模态模型和扩散变换器提升效果质量和一致性,构建大规模数据集增强泛化能力。

Comments Project page: https://effectmaker.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05898 2026-03-09 cs.CV 57%

InnoAds-Composer: Efficient Condition Composition for E-Commerce Poster Generation

InnoAds-Composer: 电商海报生成中的高效条件组合

Yuxin Qin, Ke Cao, Haowei Liu, Ao Ma, Fengheng Li, Honghe Zhu, Zheng Zhang, Run Ling, Wei Feng, Xuanhua He, Zhanjie Zhang, Zhen Guo, Haoyi Bian, Jingjing Lv, Junjie Shen, Ching Law

机构 * JD.com, Inc.(京东公司) Chongqing University of Posts and Telecommunications(重庆邮电大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 InnoAds-Composer通过单阶段框架实现对电商海报生成中主体、文本和风格的高效三条件控制,提升了生成质量并减少了计算开销。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05845 2026-03-09 cs.CV 57%

Cog2Gen3D: Sculpturing 3D Semantic-Geometric Cognition for 3D Generation

Cog2Gen3D: 三维语义-几何认知雕刻用于三维生成

Haonan Wang, Hanyu Zhou, Haoyue Liu, Tao Gu, Luxin Yan

机构 * School of Artificial and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 Cog2Gen3D通过结合语义和绝对几何信息,提出了一种三维认知引导的扩散框架,以实现可控的三维生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04461 2026-03-09 cs.CV 57%

UniTS: Unified Spatio-Temporal Generative Model for Remote Sensing

UniTS:面向遥感的统一时空生成模型

Yuxiang Zhang, Shunlin Liang, Wenyuan Li, Han Ma, Jianglei Xu, Yichuan Ma, Jiangwei Xie, Wei Li, Mengmeng Zhang, Ran Tao, Xiang-Gen Xia

机构 * Jockey Club STEM Laboratory of Quantitative Remote Sensing(裘英俊STEM实验室(定量遥感)) Department of Geography, the University of Hong Kong(香港大学地理系) School of Information and Electronics, Beijing Institute of Technology(北京理工大学信息电子学院) Beijing Key Laboratory of Fractional Signals and Systems(北京分数信号与系统重点实验室) Department of Electrical and Computer Engineering, University of Delaware(德雷塞尔大学电气与计算机工程系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 UniTS提出了一种统一时空生成模型,整合时间序列重建、云去除、语义变化检测和预测等任务,通过自适应条件注入和时空感知调节器提升多模态生成质量,有效应对复杂环境挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04843 2026-03-09 cs.CV 57%

PoI: A Filter to Extract Pixel of Interest from Novel Views for Scene Coordinate Regression

PoI: 一种从新视角提取感兴趣像素的滤波器用于场景坐标回归

Feifei Li, Qi Song, Chi Zhang, Hui Shuai, Rui Huang

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PoI通过像素级过滤策略提升场景坐标回归的定位精度,结合扩散模型和重投影误差优化新视角合成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06282 2026-03-09 physics.flu-dyn cond-mat.soft 50%

Confined drying of a binary liquid mixture droplet: A quantitative interferometric study under humidity control

二元液体混合物滴状受限干燥:在湿度控制下的定量干涉研究

Ole Milark, Jean-Baptiste Salmon, Benjamin Sobac

专题命中 可控生成 :diffusion(abstract)

AI总结 本研究通过干涉仪和湿度控制实验,揭示了二元液体混合物在受限条件下的干燥动力学和传输机制,提取了浓度依赖的扩散系数和水的化学活性。

Journal ref Phys. Rev. Fluids 11, 033603 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 1 篇

2603.01034 2026-03-09 cs.CV cs.AI cs.LG 57%

Reparameterized Tensor Ring Functional Decomposition for Multi-Dimensional Data Recovery

重新参数化张量环功能分解用于多维数据恢复

Yangyang Xu, Junbo Ke, You-Wei Wen, Chao Wang

机构 * Key Laboratory of Computing and Stochastic Mathematics (Ministry of Education)(计算与随机数学重点实验室(教育部)) School of Mathematics and Statistics(数学与统计学学院) Department of Statistics and Data Science(统计与数据科学系)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 本文提出了一种重新参数化的张量环功能分解方法,通过结合可学习的潜在张量和固定基底,提升多维数据恢复的性能。

Comments 22 pages, 18 figures, 12 tables. Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 1 篇

2603.06038 2026-03-09 cs.CV cs.GR 73%

FontUse: A Data-Centric Approach to Style- and Use-Case-Conditioned In-Image Typography

FontUse: 一种以数据为中心的方法用于风格和使用场景条件下的图像内字体设计

Xia Xin, Yuki Endo, Yoshihiro Kanamori

机构 * University of Tsukuba(茨口大学)

专题命中 个性化与一致性 :image generation(abstract);text-to-image(abstract);分类 cs.CV、cs.GR

AI总结 FontUse提出了一种以数据为中心的方法,通过构建大规模字体数据集并结合多模态模型,提升文本生成中字体风格和使用场景的控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 3 篇

2510.11512 2026-03-09 cs.CV cs.AI 79%

LikePhys: Evaluating Intuitive Physics Understanding in Video Diffusion Models via Likelihood Preference

LikePhys: 通过似然偏好评估视频扩散模型中的直观物理理解

Jianhao Yuan, Fabio Pizzati, Francesco Pinto, Lars Kunze, Ivan Laptev, Paul Newman, Philip Torr, Daniele De Martini

机构 * University of Oxford(牛津大学) MBZUAI(穆斯林人工智能研究所) University of Chicago(芝加哥大学) UWE Bristol(布里斯托尔大学)

专题命中 图像生成评测 :diffusion(title,abstract);分类 cs.CV

AI总结 LikePhys通过似然偏好评估视频扩散模型的直观物理理解,展示其与人类偏好一致,优于现有基线,并揭示模型设计和推理设置对物理理解的影响。

Comments 23 pages, 9 figures, Project Page: https://yuanjianhao508.github.io/LikePhys/

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 67%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 图像生成评测 :diffusion(abstract);inpainting(abstract)

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04756 2026-03-09 cs.AI cs.CE cs.SE 50%

MOOSEnger -- a Domain-Specific AI Agent for the MOOSE Ecosystem

MOOSEnger -- 一个针对MOOSE生态系统的领域特定AI代理

Mengnan Li, Jason Miller, Zachary Prince, Alexander Lindsay, Cody Permann

机构 * Idaho National Laboratory(爱达荷国家实验室)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 MOOSEnger 是一个专为MOOSE生态系统的AI代理,通过检索增强生成和领域特定工具提升多物理场仿真效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 效率与蒸馏 6 篇

2603.06449 2026-03-09 cs.CV 57%

CaTok: Taming Mean Flows for One-Dimensional Causal Image Tokenization

CaTok:通过Mean流平滑均值流以实现一维因果图像标记化

Yitong Chen, Zuxuan Wu, Xipeng Qiu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究所,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CaTok 通过 MeanFlow 解码器实现一维因果图像标记化,提升图像生成与重建性能。

Comments Project website is available in https://sharelab-sii.github.io/catok-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13669 2026-03-09 cs.CV cs.AI cs.LG 57%

CanvasMAR: Improving Masked Autoregressive Video Prediction With Canvas

CanvasMAR: 通过Canvas提升遮蔽自回归视频预测

Zian Li, Muhan Zhang

机构 * Institute for Artificial Intelligence, Peking University, Beijing, China(人工智能研究院,北京大学,北京,中国) School of Intelligence Science and Technology, Peking University, Beijing, China(智能科学与技术学院,北京大学,北京,中国) State Key Laboratory of General Artificial Intelligence, Peking University, Beijing, China(通用人工智能国家重点实验室,北京大学,北京,中国)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 CanvasMAR通过引入canvas机制和运动感知采样顺序,提升视频生成的保真度和效率,实现更高质量的视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06517 2026-03-09 astro-ph.SR 50%

Constraining turbulent solar flare acceleration regions by connecting kinetic modeling and X-ray observations

通过连接动能建模和X射线观测来约束太阳耀斑加速区域

Morgan Stores, Natasha Jeffrey, Ewan Dickson, James McLaughlin, Eduard Kontar

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 通过结合动能建模和X射线观测,研究太阳耀斑中湍流对电子加速的影响,确定加速区域和时间尺度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06287 2026-03-09 cs.CE cs.AI cs.LG math.AP 50%

Learning Where the Physics Is: Probabilistic Adaptive Sampling for Stiff PDEs

学习物理所在的位置:用于刚性PDEs的概率自适应采样

Akshay Govind Srinivasan, Balaji Srinivasan

机构 * Indian Institute of Technology, Madras(印度理工学院马德拉斯学院)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出GMM-PIELM方法,通过概率模型自适应采样,有效解决刚性PDEs中的刚性问题,实现高精度与高速度的平衡。

Comments Accepted at AI&PDE Workshop at the Fourteenth International Conference on Learning Representations

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05800 2026-03-09 cs.DC cs.AI 50%

StreamWise: Serving Multi-Modal Generation in Real-Time at Scale

StreamWise: 实时大规模多模态生成服务

Haoran Qiu, Gohar Irfan Chaudhry, Chaojie Zhang, Íñigo Goiri, Esha Choukse, Rodrigo Fonseca, Ricardo Bianchini

机构 * Microsoft Azure Research(微软Azure研究院) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 效率与蒸馏 :image generation(abstract)

AI总结 StreamWise通过实时播客视频生成,整合LLM、文本转语音和视频音频生成,实现高效多模态实时服务,兼顾延迟、成本和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05527 2026-03-09 physics.chem-ph cs.NA math.NA physics.comp-ph 50%

Drifting to Boltzmann: Million-Fold Acceleration in Boltzmann Sampling with Force-Guided Drifting

漂向玻尔兹曼:在玻尔兹曼采样中实现百万倍加速的力引导漂移

Pipi Hu

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 该研究提出力引导漂移模型,通过漂移分数恒等式实现分子构型生成,显著提升玻尔兹曼采样效率,达到百万倍加速并保持结构和分布准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏