arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1655 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 37 篇

2602.06886 2026-08-03 cs.CV 版本更新 92%

Prompt Reinjection: Alleviating Prompt Forgetting in Multimodal Diffusion Transformers for Text-to-Image Generation

提示重注入:缓解多模态扩散变换器中的提示遗忘

Yuxuan Yao, Yuxuan Chen, Hui Li, Kaihui Cheng, Qipeng Guo, Yuwei Sun, Zilong Dong, Jingdong Wang, Siyu Zhu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(title,abstract);分类 cs.CV

AI总结 本研究针对多模态扩散变换器中提示遗忘问题,提出一种无需训练的提示重注入方法,通过将早期层的提示表示重新注入到后期层,以提升指令遵循能力和生成质量。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14945 2026-08-12 cs.CV 版本更新 90%

Introspective Attention Modulation for Safe Text-to-Image Generation

用于安全文本到图像生成的内省注意力调制

Basim Azam, Hossein Rahmani, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) Lancaster University(兰卡斯特大学)

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);diffusion(abstract);image synthesis(abstract)

AI总结 研究基于流的文本到图像模型易产生不安全内容的问题,提出通过推理时内省调节注意力动态实现安全的方法,该方法在保持或提升质量的同时显著提高安全分数,为安全图像生成提供新途径。

Comments Accepted at ECCV 2026. 20 pages, 7 figures. Project page: https://basim-azam.github.io/iam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22568 2026-07-29 cs.CV 版本更新 89%

SeFi-Image: A Text-to-Image Foundation Model with Semantic-First Diffusion

SeFi-Image: 一种基于语义优先扩散的文本到图像基础模型

Ruoyu Feng, Jinming Liu, Yuqi Wang, Xin Cheng, Boyuan Liu, Shanglin Li, Hanshen Zhu, Wenfeng Lin, Mingyu Guo, Xin Jin

机构 * SeFi Team(SeFi 团队)

专题命中 文生图 :text-to-image(title,abstract);diffusion(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SeFi-Image,一种基于语义优先扩散的文本到图像基础模型,在1B、2B和5B参数规模上训练,仅用125K A800 GPU小时(约Z-Image的10-20%计算量)即达到与Qwen-Image和Z-Image相当或更优的性能,并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12506 2026-07-07 cs.CV cs.AI cs.LG 版本更新 88%

Naïve PAINE: Lightweight Text-to-Image Generation Improvement with Prompt Evaluation

朴素PAINE:通过提示评估改进文本到图像生成

Joong Ho Kim, Nicholas Thai, Souhardya Saha Dip, Dong Lao, Keith G. Mills

机构 * LSU ATHENA Lab(LSU ATHENA实验室) LSU Vision Lab(LSU视觉实验室)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出朴素PAINE改进扩散模型生成质量,利用文本到图像偏好基准,从初始噪声和给定提示直接预测图像质量,选择高质量噪声传入扩散模型,提供反馈且轻量,实验表明其在基准测试中优于现有方法。

Comments Code available at https://github.com/LSU-ATHENA/Naive-PAINE

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15283 2026-06-26 cs.CV 版本更新 88%

TF-TI2I: Training-Free Text-and-Image-to-Image Generation via Multi-Modal Implicit-Context Learning in Text-to-Image Models

TF-TI2I:通过文本到图像模型中的多模态隐式上下文学习实现无需训练的文本与图像到图像生成

Teng-Fang Hsiao, Bo-Kai Ruan, Yi-Lun Wu, Tzu-Ling Lin, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 文生图 :image generation(title,abstract);text-to-image(title,abstract);分类 cs.CV

AI总结 提出无需训练的TF-TI2I方法,利用MM-DiT架构中文本标记隐式学习视觉信息,通过参考上下文掩码和胜者全取模块实现选择性信息共享,并引入FG-TI2I基准,在复杂图像生成任务中表现稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20651 2026-07-22 cs.CV 版本更新 86%

RubricRL: Simple Generalizable Rewards for Text-to-Image Generation

RubricRL:文本到图像生成的简单通用奖励

Xuelu Feng, Yunsheng Li, Ziyu Wan, Zixuan Gao, Junsong Yuan, Dongdong Chen, Chunming Qiao

机构 * University at Buffalo(布法罗大学) Microsoft CoreAI(微软核心人工智能)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 提出RubricRL框架,通过为每个提示动态构建可分解的检查表(如对象正确性、属性准确性等),并由多模态评判器独立评估,实现可解释、可组合的奖励设计,提升文本到图像生成的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28091 2026-06-26 cs.CV 版本更新 85%

Qwen-Image-Bench: From Generation to Creation in Text-to-Image Evaluation

Qwen-Image-Bench:从生成到创造——文本到图像评估

Niantong Li, Guangzheng Hu, Weixu Qiao, Ying Ba, Qichen Hong, Shijun Shen, Jinlin Wang, Fan Zhou, Jianye Kang, Xin Shang, Ziyi He, Wei Wang, Dalin Li, Jiahao Li, Jie Zhang, Kaiyuan Gao, Kun Yan, Lihan Jiang, Ningyuan Tang, Shengming Yin, Tianhe Wu, Xiao Xu, Xiaoyue Chen, Yuxiang Chen, Yan Shu, Yanran Zhang, Yilei Chen, Yixian Xu, Zekai Zhang, Zhendong Wang, Zihao Liu, Zikai Zhou, Hongzhu Shi, Yi Wang, Bing Zhao, Hu Wei, Lin Qu, Chenfei Wu

机构 * Alibaba(阿里巴巴)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08652 2026-08-07 cs.AI 版本更新 85%

CoCo: Code as CoT for Text-to-Image Preview and Rare Concept Generation

CoCo:用于文本到图像预览和稀有概念生成的代码作为CoT

Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo Peng, Dingming Li, Yuhong Dai, ZePeng Lin, Juanxi Tian, Yi Zhou, Siqi Dai, Jingwei Wu, Pheng-Ann Heng

机构 * South China University of Technology(南方科技大学) StepFun Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);image editing(abstract)

AI总结 CoCo通过代码驱动的推理框架,提升文本到图像生成的精度和可控性,实现结构化图像生成和稀有概念生成。

Comments 21 pages, 7 figures, and 3 tables. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08724 2026-06-09 cs.LG 版本更新 85%

Exposing Hidden Biases in Text-to-Image Models via Automated Prompt Search

通过自动化提示搜索暴露文本到图像模型中的隐藏偏见

Manos Plitsis, Giorgos Bouritsas, Vassilis Katsouros, Yannis Panagakis

机构 * University of Edinburgh(爱丁堡大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract,abstract_cn)

AI总结 本文提出Bias-Guided Prompt Search框架,通过自动生成提示最大化图像偏见,揭示文本到图像模型中的隐藏偏见,提升公平性评估。

Comments ICML 2026. Code is here: https://github.com/manosplitsis/BGPS

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19946 2026-07-17 cs.CV cs.AI 版本更新 83%

When Pretty Isn't Useful: Investigating Why Modern Text-to-Image Models Fail as Reliable Training Data Generators

当漂亮并不有用:调查现代文本到图像模型为何无法作为可靠的训练数据生成器

Krzysztof Adamkiewicz, Brian Bernhard Moser, Stanislav Frolov, Tobias Christian Nauen, Federico Raue, Andreas Dengel

机构 * RPTU University Kaiserslautern-Landau(凯撒斯劳滕-兰道大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 研究发现现代文本到图像模型在生成合成数据时性能下降,揭示其生成的数据分布狭窄且缺乏多样性,挑战了生成现实感进步即意味着数据现实感进步的假设。

Comments Accepted to CVPR26, Project Page: https://bill2462.github.io/When-Pretty-Isn-t-Useful-page/, Code: https://github.com/Bill2462/When-Pretty-Isn-t-Useful-codebase

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12893 2026-07-01 cs.CV cs.AI cs.LG cs.NE stat.ML 版本更新 83%

Finite Difference Flow Optimization for RL Post-Training of Text-to-Image Models

文本到图像模型强化学习后训练的有限差分流优化

David McAllister, Miika Aittala, Tero Karras, Janne Hellsten, Angjoo Kanazawa, Timo Aila, Samuli Laine

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 文生图 :text-to-image(title);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出一种在线强化学习变体,通过采样配对轨迹并将流速度拉向更优图像方向来降低模型更新方差,将整个采样过程视为单一动作,实现更快的收敛和更高的输出质量与提示对齐。

Comments Code available at https://github.com/NVlabs/finite-difference-flow-optimization

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17901 2026-06-29 eess.IV cs.CV cs.GT 版本更新 83%

MeDUET: Disentangled Unified Pretraining for 3D Medical Image Synthesis and Analysis

MeDUET:面向3D医学图像合成与分析的解耦统一预训练

Junkai Liu, Ling Shao, Le Zhang

专题命中 文生图 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出MeDUET框架,在变分自编码器潜在空间中通过解耦学习域不变内容因子和域特定风格因子,统一3D医学图像合成与分析任务,提升合成质量、收敛速度和域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03483 2026-06-18 cs.CV cs.AI 版本更新 83%

When Cars Have Stereotypes: Auditing Demographic Bias in Objects from Text-to-Image Models

当汽车有刻板印象:审计文本到图像模型中对象的群体偏见

Dasol Choi, Jihwan Lee, Minjae Lee, Minsuk Kahng

机构 * AIM Intelligence(AIM智能研究院) Yonsei University(延世大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 提出SODA框架,通过三个指标系统测量文本到图像模型在生成对象中的群体偏见,发现中性提示隐含偏向中年和白人,且人口统计线索导致高度偏斜的刻板输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04981 2026-06-15 cs.CV cs.LG 版本更新 83%

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

对齐但刻板?系统提示如何塑造基于LLM的文本到图像模型中的人口统计偏见

NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

机构 * KAIST(韩国科学技术院) HKUST (GZ)(香港科技大学(广州))

专题命中 文生图 :text-to-image(title,abstract);image generation(abstract);分类 cs.CV

AI总结 研究LLM增强的文本到图像系统在提示扩展中引入隐性人口统计偏见的问题,提出无训练的去偏框架FairPro,通过自适应生成公平性指令减少人口统计差异。

Comments Project page: https://fairpro-t2i.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06113 2026-06-12 cs.CV 版本更新 83%

Where, What, Why, and Importance: Structured Defect Grounding for Text-to-Image Feedback

位置、类型、原因与重要性:面向文本到图像反馈的结构化缺陷定位

Huaisong Zhang, Hao Yu, Yuxuan Zhang, Jiahe Wang, Xinrui Chen, Haoxiang Cao, Feng Lu, Wendong Zhang, Changqian Yu, Chun Yuan

机构 * Tsinghua University(清华大学) Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) South China Normal University(华南师范大学)

专题命中 文生图 :text-to-image(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 提出结构化缺陷定位(SDG)方法,将文本到图像生成中的缺陷诊断建模为结构化集合预测,通过构建SDG-30K数据集和SDG-Eval评估协议,并利用视觉语言模型作为检测器,结合BoxFlow-GRPO将预测的缺陷集合转化为空间奖励以改进扩散模型对齐。

Comments 25 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20155 2026-07-20 cs.CV cs.CL 版本更新 79%

NAMESAKES: Probing Identity Memorization in Text-to-Image Models

NAMESAKES: 探究文本到图像模型中的身份记忆

Morris Alper, Vasudha Varadarajan, Moran Yanuka, Angelina Wang, Hadar Averbuch-Elor

机构 * Carnegie Mellon University(卡内基梅隆大学) Tel Aviv University(特拉维夫大学) Cornell University(康奈尔大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 提出一种黑盒行为探针,无需参考照片或训练数据,即可区分文本到图像模型生成的图像是记忆还是虚构,并在NAMESAKES数据集上验证其有效性。

Comments Project page: https://namesakes-web.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15967 2026-06-23 cs.CR cs.CV 版本更新 79%

When Safe Concepts Become Unsafe: Multi-Concept Compositional Vulnerabilities in Text-to-Image Models

TwoHamsters:文本到图像模型中多概念组合不安全性的基准测试

Chaoshuo Zhang, Yibo Liang, Mengke Tian, Chenhao Lin, Zhengyu Zhao, Le Yang, Chong Zhang, Yang Zhang, Qian Wang, Chao Shen

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学计算机科学与工程学院) CISPA Helmholtz Center for Information Security(信息安全研究中心) School of Cyber Science and Engineering, Wuhan University(武汉大学计算机科学与工程学院)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 本文提出TwoHamsters基准,通过17500个提示测试文本到图像模型在多概念组合不安全性的表现,揭示现有模型和防御机制在处理危险组合生成时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17853 2026-06-23 cs.CV cs.AI 版本更新 79%

Detail++: Training-Free Detail Enhancer for T2I Diffusion Models

Detail++: 文本到图像扩散模型的免训练细节增强器

Lifeng Chen, Jiner Wang, Zihao Pan, Beier Zhu, Xiaofeng Yang, Chi Zhang

机构 * AGI Lab, Westlake University(AGI实验室,西lake大学) Nanyang Technological University(南洋理工大学)

专题命中 文生图 :diffusion(title);text-to-image(abstract);分类 cs.CV

AI总结 提出免训练框架Detail++,通过渐进式细节注入策略分解复杂提示词,利用自注意力布局控制与交叉注意力质心对齐损失,提升多主体复杂提示下的生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17951 2026-07-24 cs.CV 版本更新 70%

SuperFlow: Training Flow Matching Models with RL on the Fly

SuperFlow: 通过实时强化学习训练流匹配模型

Kaijie Chen, Zhiyang Xu, Ying Shen, Zihao Lin, Yuguang Yao, Lifu Huang

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 SuperFlow通过实时强化学习优化流模型训练,提升文本-图像生成效率和质量。

Comments This article is withdrawn because it was submitted to arXiv without obtaining the consent of all listed authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19558 2026-07-14 cs.CR cs.AI cs.CV cs.LG 版本更新 70%

SPQR: A Multi-Dimensional Benchmark for Safety Alignment under Benign Model Adaptation

SPQR:良性模型适应下安全对齐的多维基准测试

Mohammed Talha Alam, Nada Saadi, Fahad Shamshad, Nils Lukas, Karthik Nandakumar, Fahkri Karray, Samuele Poppi

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University of Waterloo(滑铁卢大学) Michigan State University(密歇根州立大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 研究文本到图像扩散模型安全对齐在良性微调下的稳定性,引入SPQR基准测试,通过单评分指标提供统一框架,经多方面分析确定安全对齐失败情况,为T2I安全对齐技术提供简洁全面的基准。

Comments 34 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21081 2026-06-19 cs.CV 版本更新 70%

Shape of Thought: Progressive Object Assembly via Visual Chain-of-Thought

思维形状:通过视觉思维链进行渐进式物体组装

Yu Huo, Siyu Zhang, Kun Zeng, Haoyue Liu, Owen Lee, Junlin Chen, Yuquan Lu, Yifu Guo, Yaodong Liang, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来网络智能研究所(FNii-Shenzhen)) Guangdong Provincial Key Laboratory of Future Networks of Intelligence, CUHK(SZ)(广东省未来网络智能重点实验室,CUHK(SZ))

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出Shape-of-Thought (SoT)框架,通过视觉思维链在渲染2D域中逐步组装形状,解决文本到图像生成中的组合结构约束问题,在组件计数和结构拓扑上显著优于直接生成。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14798 2026-06-18 cs.LG cs.CV 版本更新 70%

RUB: Evaluating Residual Knowledge in Unlearned Models

RUB: 评估未学习模型中的残留知识

Hao Xuan, Xingyu Li

机构 * Electrical and Computer Engineering University of Alberta(电气与计算机工程大学阿尔伯塔大学)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出鲁棒未学习原则及统一基准RUB,通过未学习映射攻击(UMA)检测残留信息,揭示现有方法在对抗评估下的脆弱性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, June 2026, pages 8550-8559

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10496 2026-06-16 cs.CV 版本更新 70%

CheXGenBench: A Unified Benchmark For Fidelity, Privacy and Utility of Synthetic Chest Radiographs

CheXGenBench:合成胸片保真度、隐私和实用性的统一基准

Raman Dutt, Pedro Sanchez, Yongchen Yao, Steven McDonagh, Sotirios A. Tsaftaris, Timothy Hospedales

机构 * University of Edinburgh(爱丁堡大学) Samsung AI Center, Cambridge(剑桥三星AI中心)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出CheXGenBench,首个统一评估框架,同时衡量合成胸片生成模型的保真度、隐私风险和下游实用性,涵盖11种前沿T2I模型,揭示当前模型在长尾分布、隐私风险和下游多模态任务中的局限。

Comments Published in Transactions of Machine Learning Research (06/2026)

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00807 2026-07-30 cs.AI 版本更新 67%

BioPro: Towards Difference-Aware Gender Fairness for Vision-Language Models

BioPro: 关于差分意识的性别公平性在视觉-语言模型中

Yujie Lin, Jiayao Ma, Qingguo Hu, Wenbo Li, Genji Li, Derek Wong, Jinsong Su

机构 * School of Informatics, Xiamen University(厦门大学信息学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract)

AI总结 BioPro通过差分意识的性别公平性方法,在视觉-语言模型中实现选择性去偏,减少中性情境中的性别偏见同时保持显性情境中的性别忠实性。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12445 2026-06-16 cs.AI cs.LG stat.ML 版本更新 67%

Computational Safety for Generative AI: A Hypothesis Testing Perspective

生成式AI的计算安全性:假设检验视角

Pin-Yu Chen

机构 * IBM Research(IBM研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract)

AI总结 本文从假设检验角度形式化生成式AI的计算安全性,提出基于信号处理的方法检测恶意输入和AI生成内容。

Comments Extended version of the paper presented at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08831 2026-08-04 cs.GR cs.CV cs.RO 版本更新 62%

DiffPhysCam: Differentiable Physics-Based Camera Simulation for Inverse Rendering and Embodied AI

DiffPhysCam:面向逆渲染与具身智能的可微分基于物理的相机仿真

Bo-Hsun Chen, Nevindu M. Batagoda, Dan Negrut

机构 * Simulation-Based Engineering Lab, University of Wisconsin-Madison(模拟基于工程实验室,威斯康星大学麦迪逊分校)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV、cs.GR

AI总结 本文提出DiffPhysCam,一款可微分基于物理的相机模拟器,解决现有虚拟相机局限,支持正向与逆渲染,经实验验证可提升机器人感知性能,还用于自主地面车辆导航的虚拟实验。

Comments 37 pages, 24 figures, and 5 tables. Code of DiffPhysCam-CamCaliExp: https://github.com/DanielYamChen/DiffPhysCam-CamCaliExp Code of DiffPhysCam-NovelViewSynthesis: https://github.com/DanielYamChen/DiffPhysCam-NovelViewSynthesis Data of DiffPhysCam_Data: https://huggingface.co/datasets/DanielYamChen/DiffPhysCam_Data Simulation video: https://youtu.be/gQwSMrdmHJI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18036 2026-07-27 cs.CR cs.CV 版本更新 57%

NWaaS: A Non-Intrusive and Privacy-Preserving Watermarking-as-a-Service System with Adaptive Resource Scheduling

NWaaS:一种具有自适应资源调度的非侵入性和隐私保护水印即服务系统

Haonan An, Qianyao Ren, Guang Hua, Tao Li, Yu Guo, Yanan Ma, Hangcheng Cao, Yuguang Fang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对机器学习即服务中保护知识产权的挑战,提出NWaaS框架。核心方法包括$\mathtt{ShadowMark}$算法、协作分区机制和比例差异联合调度算法。贡献是能在多样模态中提供强大所有权验证,保障隐私并提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新 57%

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22545 2026-07-07 cs.CV cs.AI 版本更新 57%

SFL-Net: Source-Factorized Latent Representation Learning for Multi-Contrast MRI to Tau-PET Synthesis

基于部分信息分解指导的解耦量化半UNet的多模态T1加权和FLAIR MRI生成可解释的tau-PET

Agamdeep S. Chopra, Caitlin Neher, Tianyi Ren, Juampablo E. Heras Rivera, Hesamoddin Jahanian, Mehmet Kurt

机构 * Department of Mechanical Engineering, University of Washington(华盛顿大学机械工程系) Department of Radiology, University of Washington(华盛顿大学放射学系)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种可解释的多模态图像合成框架,通过部分信息分解指导的解耦量化半UNet生成tau-PET,结合向量量化编码器和半UNet解码器,实现了在ADNI-3和OASIS-3数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03650 2026-07-02 cs.CV cs.LG 版本更新 57%

Generated Contents Enrichment

生成内容丰富化

Mahdi Naseri, Jiayan Qiu, Zhou Wang

机构 * University of Waterloo(滑铁卢大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出生成内容丰富化任务,通过显式场景表示丰富稀疏场景描述,再用对抗框架生成语义更丰富、结构连贯的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏