arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86539 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2605.27595 2026-05-28 cs.CV cs.AI 70%

Hallucination Behavior in Multimodal LLMs Across Agricultural Image Interpretation and Generation Tasks

多模态大语言模型在农业图像解释与生成任务中的幻觉行为

Partho Ghose, Al Bashir, Prem Raj, Azlan Zahid

机构 * Texas A&M University System(德克萨斯大学系统)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本研究系统评估了多模态大语言模型在农业图像解释(图像到文本)和生成(文本到图像)任务中的幻觉行为,发现模型存在生物不一致、上下文不准确和农学不合理等错误模式,并通过少样本提示等方法分析了幻觉的残留影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25574 2026-05-26 cs.CV cs.AI 70%

Mosaic: Compositional Multi-Concept Erasure via Vector Field Blending

Mosaic: 通过向量场混合的组合式多概念擦除

Junseok Ko, Jungwoo Kim, Jong-Seok Lee

机构 * Department of Artificial Intelligence, Yonsei University(延世大学人工智能系) School of Integrated Technology, Yonsei University(延世大学整合技术学院)

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对流式文本到图像模型中同时擦除多个目标概念的任务,提出Mosaic框架,通过动态构建概念特定掩码并选择性混合向量场,无需额外优化即可有效移除复杂场景中的多概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08615 2026-05-26 cs.CV 70%

Inspiration Seeds: Learning Non-Literal Visual Combinations for Generative Exploration

灵感种子:学习用于生成式探索的非字面视觉组合

Kfir Goldberg, Elad Richardson, Yael Vinker

机构 * MIT(麻省理工学院)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 提出Inspiration Seeds框架,通过CLIP稀疏自编码器提取编辑方向并隔离概念对,实现无需文本提示的两张输入图像的视觉组合生成,支持早期创意阶段的探索性构思。

Comments Project page available at https://kfirgoldberg.github.io/InspirationSeeds/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22061 2026-05-22 cs.CV 70%

Distributed Image Compression with Multimodal Side Information at Extremely Low Bitrates

分布式图像压缩与多模态侧信息在极低比特率下的应用

Guojun Xu, Mingyang Zhang, Jianwen Xiang, Cheng Tan, Yanchao Yang, Junwei Zhou

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种多模态分布式图像压缩框架(MDIC),通过利用多模态侧信息在极低比特率下实现高质量图像重建,核心方法是引入文本到图像扩散解码器和特征掩码生成器,以提升全局感知质量和局部细节保留能力。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06163 2026-05-19 cs.CV cs.LG 70%

Forget-It-All: Multi-Concept Machine Unlearning via Concept-Aware Neuron Masking

Forget-It-All: 通过概念感知神经元掩码实现多概念机器去学习

Kaiyuan Deng, Bo Hui, Gen Li, Jie Ji, Minghai Qin, Geng Yuan, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) The University of Tulsa(塔尔萨大学) Clemson University(克莱姆森大学) Western Digital Corporation(西部数据公司) University of Georgia(佐治亚大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究提出Forget-It-All框架,通过利用模型稀疏性,解决多概念去学习问题,有效提升去学习效果并保持生成质量。

Comments Accepted to ICML 2026

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14876 2026-05-18 cs.CV cs.AI 70%

Unlocking Complex Visual Generation via Closed-Loop Verified Reasoning

通过闭环验证推理解锁复杂视觉生成

Hanbo Cheng, Limin Lin, Ruo Zhang, Yicheng Pan, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CLVR框架,结合视觉语言逻辑规划与像素级扩散生成,通过自动化数据引擎和PPRL解决多步推理中的优化问题,同时引入DSWM降低推理成本,实验表明其在多个基准上优于开源模型,实现了复杂视觉生成的扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-05-14 cs.CV 70%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10780 2026-05-13 cs.CV cs.AI 70%

Beyond the Last Layer: Multi-Layer Representation Fusion for Visual Tokenization

超越最后一层:多层表示融合用于视觉标记化

Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou

机构 * Peking University(北京大学) Meituan Inc(美团公司) Tsinghua University(清华大学) IGDL

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出DRoRAE,通过多层特征融合恢复丢失的视觉信息,提升图像生成质量,并揭示了表示丰富性与重建质量的log-linear关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14888 2026-04-28 cs.CV cs.AI 70%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17206 2026-04-21 cs.CV 70%

SciDraw-6K: A Multilingual Scientific Illustration Dataset Generated by Google Gemini

SciDraw-6K:由Google Gemini生成的多语言科学插图数据集

Davie Chen

机构 * University of Arts in Poznań(波兹南艺术大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 SciDraw-6K是6291个由Google Gemini生成的科学插图数据集,涵盖11种语言,用于支持多语言文本到图像研究和科学可视化领域适应。

Comments 9 pages, 5 figures. Dataset: https://huggingface.co/datasets/SciDrawAI/SciDraw-6K. Code: https://github.com/SciDrawAI/scidraw-6k

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11521 2026-04-14 cs.LG cs.CV 70%

Continuous Adversarial Flow Models

连续对抗流模型

Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan

机构 * ByteDance Seed(字节跳动Seed)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出连续对抗流模型,通过对抗目标训练,改进了流匹配的均方误差准则,提升样本与目标分布的对齐性,适用于现有流匹配模型的后训练,显著降低FID分数并提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09850 2026-04-14 cs.CV 70%

Training-Free Object-Background Compositional T2I via Dynamic Spatial Guidance and Multi-Path Pruning

无需训练的物体-背景组合性T2I通过动态空间引导和多路径剪枝

Yang Deng, David Mould, Paul L. Rosin, Yu-Kun Lai

机构 * Cardiff University(卡迪夫大学) Carleton University(卡尔顿大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的框架,通过动态空间引导和多路径剪枝,提升文本到图像扩散模型中背景与物体的组合性与平衡性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17458 2026-04-14 cs.CV cs.CL 70%

CARINOX: Inference-time Scaling with Category-Aware Reward-based Initial Noise Optimization and Exploration

CARINOX:推理时间缩放与基于类别感知的奖励驱动初始噪声优化与探索

Seyed Amir Kasaei, Ali Aghayari, Arash Marioriyad, Niki Sepasian, Shayan Baghayi Nejad, MohammadAmin Fazli, Mahdieh Soleymani Baghshah, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CARINOX框架,结合噪声优化与探索,通过基于人类判断的奖励选择提升文本到图像扩散模型的对齐性能,在两个基准测试中分别提升16%和11%。

Comments Accepted at TMLR (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11795 2026-04-13 cs.CV 70%

Intrinsic Concept Extraction Based on Compositional Interpretability

基于组合可解释性的内在概念提取

Hanyu Shi, Hong Tao, Guoheng Huang, Jianbin Jiang, Xuhang Chen, Chi-Man Pun, Shanhu Wang, Pan Pan

机构 * Guangdong University of Technology(广东工业大学) VIPSHOP(唯品会) Huizhou University(惠州学院) University of Macau(澳门大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出CI-ICE任务,利用扩散模型提取可组合的物体和属性概念,通过超表达方法实现概念解耦与可组合性,提升单图内在概念提取性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06662 2026-04-09 cs.CV cs.LG 70%

Towards Robust Content Watermarking Against Removal and Forgery Attacks

面向对抗性移除与伪造攻击的鲁棒内容水印技术

Yifan Zhu, Yihan Wang, Xiao-Shan Gao

机构 * Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) University of Chinese Academy of Sciences(中国科学院大学) University of Waterloo(滑铁卢大学)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Instance-Specific watermarking with Two-Sided detection方法,通过动态控制水印注入时间和模式提升鲁棒性,有效对抗移除和伪造攻击。

Comments 14 pages, 5 figures, CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02748 2026-04-06 cs.CV 70%

Visual Instruction-Finetuned Language Model for Versatile Brain MR Image Tasks

面向多样化脑部MRI任务的视觉指令微调语言模型

Jonghun Kim, Sinyoung Ra, Hyunjin Park

机构 * Sungkyunkwan University(成均馆大学) Department of Electrical and Computer Engineering(电气与计算机工程系) Department of Artificial Intelligence(人工智能系)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出LLaBIT模型,通过视觉指令微调提升语言模型在脑部MRI任务中的表现,通过特征图重用和文本数据生成提升性能,验证了其在报告生成、视觉问答、图像分割和图像翻译中的有效性。

Comments ICPR 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01553 2026-04-03 cs.CV 70%

Cross-Domain Vessel Segmentation via Latent Similarity Mining and Iterative Co-Optimization

跨域血管分割:通过潜在相似性挖掘和迭代联合优化

Zhanqiang Guo, Jianjiang Feng, Jie Zhou

机构 * Department of Automation, Tsinghua University(清华大学自动化系) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种跨域血管分割框架,通过挖掘潜在血管相似性并迭代联合优化生成与分割网络,提升跨域图像合成质量和分割精度,实验显示在临床场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18123 2026-04-03 cs.CV cs.AI cs.CL cs.LG 70%

Bias Is a Subspace, Not a Coordinate: A Geometric Rethinking of Post-hoc Debiasing in Vision-Language Models

偏差是子空间,而非坐标:视觉-语言模型中事后去偏的几何重思

Dachuan Zhao, Weiyue Li, Zhenda Shen, Yushu Qiu, Bowen Xu, Haoyu Chen, Yongchao Chen

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出SPD框架,通过几何方法识别并去除线性可解码的偏子空间,提升视觉-语言模型的公平性与任务性能。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00267 2026-04-02 cs.CV 70%

ActErase: A Training-Free Paradigm for Precise Concept Erasure via Activation Redirection

ActErase: 一种无需训练的概念擦除范式通过激活重定向

Yi Sun, Xinhao Zhong, Hongyan Li, Yimin Zhou, Junhao Li, Bin Chen, Xuan Wang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Peng Cheng Laboratory(鹏城实验室)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的概念擦除方法ActErase,通过激活差异区域分析和动态替换输入激活,实现高效概念擦除,同时保持模型生成能力,且具有对抗攻击鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27332 2026-03-31 cs.CV 70%

Unsafe by Reciprocity: How Generation-Understanding Coupling Undermines Safety in Unified Multimodal Models

因互惠而不安全:生成-理解耦合如何在统一多模态模型中损害安全性

Kaishen Wang, Heng Huang

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了统一多模态模型中生成与理解之间的互惠关系可能成为安全漏洞的根源,提出RICE攻击方法,揭示了跨功能互惠对安全性的负面影响。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 70%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23500 2026-03-25 cs.CV 70%

UniGRPO: Unified Policy Optimization for Reasoning-Driven Visual Generation

UniGRPO:用于推理驱动视觉生成的统一策略优化

Jie Liu, Zilyu Ye, Linxiao Yuan, Shenhan Zhu, Yu Gao, Jie Wu, Kunchang Li, Xionghui Wang, Xiaonan Nie, Weilin Huang, Wanli Ouyang

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出UniGRPO框架,通过统一强化学习方法优化文本和图像生成策略,解决多轮交错生成问题,提升生成质量与可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19708 2026-03-23 cs.CV 70%

WorldAgents: Can Foundation Image Models be Agents for 3D World Models?

WorldAgents: 2D基础图像模型是否能作为3D世界模型的智能体?

Ziya Erkoç, Angela Dai, Matthias Nießner

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 文生图 :image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨2D基础图像模型是否具备3D世界生成能力,提出多智能体架构实现3D世界合成,通过实验验证2D模型能生成一致且逼真的3D世界。

Comments Webpage: https://ziyaerkoc.com/worldagents/ Video: https://www.youtube.com/watch?v=Mj2FqqhurdI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08221 2026-03-18 cs.CV cs.AI cs.LG 70%

Generate Any Scene: Scene Graph Driven Data Synthesis for Visual Generation Training

生成任意场景:基于场景图的数据合成用于视觉生成训练

Ziqi Gao, Weikai Huang, Jieyu Zhang, Aniruddha Kembhavi, Ranjay Krishna

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出Generate Any Scene,通过系统生成场景图来合成高质量数据,用于提升视觉生成模型的合成能力与语义对齐。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 70%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.17066 2026-03-12 cs.AI cs.CL cs.CV cs.LG cs.MA 70%

Mindstorms in Natural Language-Based Societies of Mind

自然语言基础的思维社会中的风暴

Mingchen Zhuge, Haozhe Liu, Francesco Faccio, Dylan R. Ashley, Róbert Csordás, Anand Gopalakrishnan, Abdullah Hamdi, Hasan Abed Al Kader Hammoud, Vincent Herrmann, Kazuki Irie, Louis Kirsch, Bing Li, Guohao Li, Shuming Liu, Jinjie Mai, Piotr Piękos, Aditya Ramesh, Imanol Schlag, Weimin Shi, Aleksandar Stanić, Wenyi Wang, Yuhui Wang, Mengmeng Xu, Deng-Ping Fan, Bernard Ghanem, Jürgen Schmidhuber

专题命中 文生图 :text-to-image(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨了基于自然语言的思维社会(NLSOMs)的结构和应用,通过多代理系统解决多种AI任务,并提出未来研究方向。

Comments published in Computational Visual Media Journal (CVMJ); 9 pages in main text + 7 pages of references + 38 pages of appendices, 14 figures in main text + 13 in appendices, 7 tables in appendices

Journal ref (2025). Computational Visual Media, 11(1), 29-81

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09538 2026-03-11 cs.CV 70%

Towards Unified Multimodal Interleaved Generation via Group Relative Policy Optimization

迈向统一多模态交错生成的群体相对策略优化

Ming Nie, Chunwei Wang, Jianhua Han, Hang Xu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Noah’s Ark Lab, Huawei(华为诺亚实验室) Yinwang Intelligent Technology Co., Ltd.(亿恒智能科技有限公司)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出基于强化学习的后训练策略,通过群体相对策略优化框架提升统一多模态模型的交错生成能力,实验表明其在质量与连贯性上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 70%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07839 2026-03-10 cs.CV 70%

Training-free Temporal Object Tracking in Surgical Videos

无需训练的手术视频时间物体跟踪

Subhadeep Koley, Abdolrahim Kadkhodamohammadi, Santiago Barbarisi, Danail Stoyanov, Imanol Luengo

机构 * Medtronic plc.(梅奥诊所)

专题命中 文生图 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出无需训练的扩散模型用于手术视频中时间物体跟踪,通过提取特征和跨帧交互实现高精度定位与跟踪。

Comments Accepted in IPCAI 2025

Journal ref Int J CARS 20, 1067-1075 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04267 2026-03-05 cs.CV 70%

UniLight: A Unified Representation for Lighting

UniLight: 一种统一的光照表示

Zitian Zhang, Iliyan Georgiev, Michael Fischer, Yannick Hold-Geoffroy, Jean-François Lalonde, Valentin Deschaintre

机构 * Université Laval(拉瓦尔大学) Adobe Research(Adobe研究)

专题命中 文生图 :diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 UniLight通过联合潜在空间统一多种光照表示,实现跨模态的光照特征提取与迁移,支持光照检索、环境映射生成和扩散模型中的光照控制。

Comments Project page: https://lvsn.github.io/UniLight

详情

展开后加载摘要…

URL PDF HTML 收藏