arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-05-14 至 2026-05-14 共收录 125 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 7 篇

2602.00616 2026-05-14 cs.AI 88%

SPOT: Selective Prompt Projection via Total Variation for Inference-Only Safe Text-to-Image Generation

SPOT:基于总变分的选性提示投影用于仅推理的文本到图像生成

Minhyuk Lee, Hyekyung Yoon, Myungjoo Kang

机构 * Seoul National University(首尔国立大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);diffusion(abstract)

AI总结 本文提出SPOT框架,通过总变分约束生成器参考分布,实现对文本到图像生成中不安全内容的抑制,同时保持良性提示的行为,实验显示其在多个数据集上显著降低不适当评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13223 2026-05-14 cs.CV 86%

Skill-Aligned Annotation for Reliable Evaluation in Text-to-Image Generation

基于技能对齐的标注以在文本到图像生成中实现可靠评估

Abdelrahman Eldesokey, Merey Ramazanova, Ahmad Sait, Ansar Khangeldin, Karen Sanchez, Tong Zhang, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(卡斯泰大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title);分类 cs.CV

AI总结 本文提出基于技能对齐的标注方法,通过统一不同评估技能的特性,提高文本到图像生成评估的一致性和稳定性,同时提供可扩展的评估流程。

Comments Project Page: https://abdo-eldesokey.github.io/skill-aligned-eval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12650 2026-05-14 cs.CV 79%

CRAFT: Clinical Reward-Aligned Finetuning for Medical Image Synthesis

CRAFT:面向医学图像合成的临床对齐微调

Yunsung Chung, Alex El Darzi, Carlo El Khoury, Han Feng, Nassir Marrouche, Jihun Hamm

机构 * Department of Computer Science, Tulane University(路易斯安那大学计算机科学系) School of Medicine, Tulane University(路易斯安那大学医学院)

专题命中 文生图 :image synthesis(title);diffusion(abstract);分类 cs.CV

AI总结 本文提出CRAFT框架,通过临床对齐评分和奖励优化提升医学图像生成质量,减少幻觉生成,提升分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13155 2026-05-14 cs.CV 70%

Pareto-Guided Optimal Transport for Multi-Reward Alignment

基于帕累托前沿的多奖励对齐最优传输

Ying Ba, Tianyu Zhang, Mohan Zhou, Yalong Bai, Wenyi Mo, Guiwei Zhang, Bing Su, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models(北京大模型研究关键实验室) Engineering Research Center of Next-Generation Intelligent Search(下一代智能搜索与推荐工程技术研究中心) Rutgers University(罗格斯大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出帕累托前沿引导的最优传输框架,通过构建任务特定的帕累托前沿并利用分布感知最优传输将支配样本映射到前沿,结合在线和离线优化策略,引入联合支配率和联合坍塌率作为评估指标,实验显示在多奖励协同和对抗攻击中优于基线方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 57%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12517 2026-05-14 cs.CL cs.AI cs.CV 57%

Bridging the Missing-Modality Gap: Improving Text-Only Calibration of Vision Language Models

弥合缺失模态的差距:改进纯文本校准的视觉语言模型

Mingyeong Kim, Jungwon Choi, Chaeyun Jang, Juho Lee

机构 * Graduate School of AI, KAIST(人工智能研究生院,韩国科学技术院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出Latent Imagination Module,通过预测文本输入的潜在嵌入来提升纯文本环境下视觉语言模型的准确性和校准性能。

Comments 9 pages, 16 figures. Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI: Interpretability, Robustness, and Safety across Modalities

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13113 2026-05-14 cs.CY cs.AI 50%

Context Matters: Auditing Gender Bias in T2I Generation through Risk-Tiered Use-Case Profiles

语境至关重要:通过风险分层用例配置审计T2I生成中的性别偏见

Jose Luna, Yankun Wu, Xiaofei Xie, Noa Garcia

机构 * Singapore Management University(新加坡国立大学) The University of Osaka(大阪大学)

专题命中 文生图 :text-to-image(abstract)

AI总结 本文提出一个风险对齐的审计框架,用于评估T2I模型中的性别偏见,通过风险分层用例配置、指标目录和危害类型,系统化地审计性别偏见。

Comments FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 9 篇

2507.01908 2026-05-14 cs.CV 85%

Reasoning to Edit: Hypothetical Instruction-Based Image Editing with Visual Reasoning

基于推理的编辑:基于假设指令的图像编辑与视觉推理

Qingdong He, Xueqin Chen, Chaoyi Wang, Yanjie Pan, Xiaobin Hu, Zhenye Gan, Yabiao Wang, Chengjie Wang, Xiangtai Li, Jiangning Zhang

机构 * Tencent Youtu Lab(腾讯云图实验室) Sichuan University(四川大学) University of the Chinese Academy of Sciences(中国科学院大学) Fudan University(复旦大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出Reason50K数据集和ReasonBrain框架,通过多模态大语言模型和扩散模型实现复杂隐含指令的图像编辑,提升视觉推理能力。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13349 2026-05-14 cs.CV 83%

Drag within Prior Distribution: Text-Conditioned Point-Based Image Editing within Distribution Constraints

在先验分布中进行拖拽:基于文本的点基图像编辑在分布约束内

Haoyang Hu, Masataka Seo, Yen-Wei Chen

机构 * Ritsumeikan University, Graduate School of Information(日光大学信息工程研究生院) Engineering, Osaka Institute of Technology(工程学,大阪技术学院)

专题命中 图像编辑 :image editing(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出基于CLIP模型的编辑引导方法和先验保留损失,以提高图像编辑的语义一致性和生成质量,同时减少编辑时间。

Comments ICASSP 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13122 2026-05-14 cs.CV 83%

Early Semantic Grounding in Image Editing Models for Zero-Shot Referring Image Segmentation

图像编辑模型中的早期语义接地用于零样本指引用图像分割

Jingxuan He, Xiyu Wang, Yunke Wang, Mengyu Zheng, Chang Xu

机构 * The University of Sydney(悉尼大学)

专题命中 图像编辑 :image editing(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文探讨利用图像编辑模型的隐含语义接地能力进行零样本指引用图像分割,通过分析发现早期去噪步骤即可实现前景背景分离,提出无需训练的框架利用预训练模型的中间表示进行分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02521 2026-05-14 cs.CV 79%

MooD: Perception-Enhanced Efficient Affective Image Editing via Continuous Valence-Arousal Modeling

MooD:通过连续的效价-唤醒建模提升的感知增强高效情感图像编辑

Xinyi Yin, Yiduo Wang, Tingqi Hu, Meicong Si, Yunyun Shi, Shi Chen, Hao Wang, Junxiao Xue, Xuecheng Wu

机构 * School of Cyber Science and Engineering, Zhengzhou University(郑州大学信息科学与工程学院) School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) School of Journalism and New Media, Xi’an Jiaotong University(西安交通大学新闻与传播学院) Research Center for Space Computing System, Zhejiang Lab(浙江实验室空间计算系统研究中心)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 MooD通过连续效价-唤醒建模实现高效情感图像编辑,结合视觉迁移与感知增强的语义引导,提升情感可控性和视觉保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07458 2026-05-14 cs.CV 79%

SpatialReward: Bridging the Perception Gap in Online RL for Image Editing via Explicit Spatial Reasoning

SpatialReward: 通过显式空间推理弥合在线强化学习中图像编辑的感知差距

Yancheng Long, Yankai Yang, Hongyang Wei, Wei Chen, Tianke Zhang, Haonan fan, Changyi Liu, Kaiyu Jiang, Jiankang Chen, Kaiyu Tang, Bin Wen, Fan Yang, Tingting Gao, Han Li, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生学院,清华大学)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出SpatialReward,通过显式空间推理提升在线强化学习中图像编辑的感知准确性,其在MMRB2和EditReward-Bench上表现优异,并在MultiEditReward-Bench上超越专用评估器。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13062 2026-05-14 cs.CV 79%

Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling

Edit-Compass 与 EditReward-Compass:图像编辑与奖励建模的统一基准

Xuehai Bai, Yang Shi, Yi-Fan Zhang, Xuanyu Zhu, Yuran Wang, Yifan Dai, Xinyu Liu, Yiyan Ji, Xiaoling Gu, Yuanxing Zhang

机构 * HDU(杭州大学) PKU(北京大学) Kling Team(Kling团队) CASIA(中国科学院自动化研究所)

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出Edit-Compass和EditReward-Compass,通过精细多维评估框架和真实奖励建模场景,解决现有图像编辑和奖励模型评估中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12724 2026-05-14 cs.CV cs.AI 79%

Inline Critic Steers Image Editing

内联批评引导图像编辑

Weitai Kang, Xiaohang Zhan, Yizhou Wang, Mang Tik Chiu, Jason Kuen, Kangning Liu, Yan Yan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Adobe

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 本文提出内联批评方法,通过在图像编辑过程中实时修正模型输出,提升生成质量,在多个基准测试中取得优异成绩。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.12784 2026-05-14 cs.CV 57%

The GAN that Warped: Semantic Attribute Editing with Unpaired Data

扭曲的GAN:无配对数据下的语义属性编辑

Gara Dorta, Sara Vicente, Neill D. F. Campbell, Ivor J. A. Simpson

机构 * University of Bath(巴斯大学) Anthropics Technology Ltd.(Anthropics技术有限公司) University of Sussex(苏塞克斯大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出通过平滑扭曲场进行语义图像编辑,利用生成对抗网络在无配对数据下实现高分辨率人脸编辑,有效保持身份特征。

Comments CVPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12826 2026-05-14 cs.CV cs.AI 57%

FRAME: Forensic Routing and Adaptive Multi-path Evidence Fusion for Image Manipulation Detection

FRAME:图像篡改检测的取证路由与自适应多路径证据融合

Kaixiang Zhao, Tianrun Yu, Aoxu Zhang, Junhao Su, Porter Jenkins, Amanda Hughes

机构 * Brigham Young University Rutgers University

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 FRAME通过多路径分析空间整合多种取证算法,自适应选择信息量大的路径并融合互补证据,提升图像篡改检测与定位性能。

Comments Accepted to CVPR 2026 SAFE Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 92 篇

2511.17031 2026-05-14 cs.LG cs.CV cs.CY 89%

Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation

扩散模型的能量缩放规律:量化图像生成中的计算需求

Aniketh Iyengar, Jiaqi Han, Boris Ruf, Vincent Grari, Marcin Detyniecki, Stefano Ermon

机构 * Stanford University(斯坦福大学) AXA AI Research(AXA人工智能研究)

专题命中 扩散模型 :diffusion(title,abstract);image generation(title,abstract);分类 cs.CV

AI总结 本文提出基于计算复杂度(FLOPs)的扩散模型GPU能耗预测方法,通过分解推理过程中的文本编码、去噪和解码步骤,验证去噪操作主导能耗,并在四种先进模型和三种GPU架构上验证了预测准确性与跨架构泛化能力。

Comments Accepted at ACM Conference on Fairness, Accountability, and Transparency (FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13010 2026-05-14 cs.CV cs.AI cs.SY eess.SY math.OC 88%

Amortized Guidance for Image Inpainting with Pretrained Diffusion Models

基于预训练扩散模型的图像修复的 amortized 指导

Yilie Huang, Xun Yu Zhou

机构 * Department of Industrial Engineering and Operations Research, Columbia University, New York, NY 10027, USA(工业工程与运筹学系,哥伦比亚大学,纽约,NY 10027,美国) Department of Industrial Engineering and Operations Research & Data Science Institute, Columbia University, New York, NY 10027, USA(工业工程与运筹学系及数据科学研究所,哥伦比亚大学,纽约,NY 10027,美国)

专题命中 扩散模型 :diffusion(title,abstract);inpainting(title,abstract);分类 cs.CV

AI总结 本文提出AID模型,通过预训练扩散模型和离线训练的指导模块,在多种掩码类型下提升图像修复的质量-速度平衡,训练开销低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12088 2026-05-14 cs.CV 83%

UniCustom: Unified Visual Conditioning for Multi-Reference Image Generation

UniCustom: 多参考图像生成的统一视觉条件化

Yiyan Xu, Qiulin Wang, Wenjie Wang, Yunyao Mao, Xintao Wang, Pengfei Wan, Kun Gai, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Kling Team, Kuaishou Technology(快手技术团队)

专题命中 扩散模型 :image generation(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 UniCustom通过融合ViT和VAE特征提升多参考图像生成中主体一致性和指令遵循能力,采用两阶段训练策略和槽绑定正则化减少跨参考混淆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04557 2026-05-14 cs.CV cs.AI 83%

Efficient Geometry-Controlled High-Resolution Satellite Image Synthesis

高效几何控制高分辨率卫星图像合成

Vlad Vasilescu, Daniela Faur, Teodor Costachioiu

机构 * Univ. POLITEHNICA Bucharest SIGMA Lab , CAMPUS Institute(巴比什-博亚尔银行大学 SIGMA 实验室,CAMPUS 机构) Univ. POLITEHNICA Bucharest GEOSENSE , CAMPUS Institute(巴比什-博亚尔银行大学 GEOSENSE,CAMPUS 机构)

专题命中 扩散模型 :image synthesis(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 本文提出一种高效方法,通过利用跳连特征和滑动窗口交叉注意力模块,改进扩散模型以实现几何控制的高分辨率卫星图像合成,同时探讨了当前评估方法的局限性。

Comments 2026 IEEE International Geoscience and Remote Sensing Symposium (IGARSS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13293 2026-05-14 cs.CV 83%

Img2CADSeq: Image-to-CAD Generation via Sequence-Based Diffusion

Img2CADSeq:通过序列扩散生成图像到CAD

Shiyu Tan, Zixuan Zhao, Hao Gao, Zhiheng Chen, Xiaolong Yin, Enya Shen

机构 * School of Software Tsinghua University China(软件学院清华大学中国) Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出Img2CADSeq,通过序列扩散模型生成高质量CAD模型,采用三级代码本和对比学习解决模态差异问题,实现工业领域应用。

Comments Accepted by SIGGRAPH 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13382 2026-05-14 cs.RO 82%

BlockVLA: Accelerating Autoregressive VLA via Block Diffusion Finetuning

BlockVLA: 通过块扩散微调加速自回归VLA

Ruiheng Wang, Shuanghao Bai, Haoran Zhang, Badong Chen, Xiangyu Xu

机构 * Xi'an Jiaotong University(西安交通大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出BlockVLA框架,通过块扩散方法将预训练自回归模型转化为高效离散扩散策略,减少推理延迟并提升训练效率,实验证明在复杂长周期任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13115 2026-05-14 cs.CR cs.LG 82%

DiffusionHijack: Supply-Chain PRNG Backdoor Attack on Diffusion Models and Quantum Random Number Defense

DiffusionHijack: 供应链PRNG后门攻击针对扩散模型和量子随机数防御

Ziyang You, Liling Zheng, Xiaoke Yang, Xuxing Lu

机构 * School of Electronics, Electrical Engineering and Physics, Fujian University of Technology(福建工程学院电子工程与物理学院) School of Humanities, Fujian University of Technology(福建工程学院人文学院) Institute of Applied Physics and Materials Engineering, University of Macau(澳门大学应用物理与材料工程学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究提出DiffusionHijack攻击通过供应链注入恶意PRNG控制扩散模型生成图像,采用量子随机数生成器有效防御该攻击,降低输出相似度至随机基线水平。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12778 2026-05-14 cs.GR cs.CV 81%

Generative Motion In-betweening by Diffusion over Continuous Implicit Representations

通过扩散在连续隐式表示上生成运动中间帧

Shiyu Fan, Paul Henderson, Edmond S. L. Ho

机构 * School of Computing Science, University of Glasgow(格拉斯哥大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 本文提出基于运动隐式神经表示的扩散模型新管道和采样优化策略,通过映射隐式神经表示与稀疏时空信息,实现从稀疏模糊关键帧数据中采样并生成流畅运动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13815 2026-05-14 cs.CV cs.RO 79%

OmniLiDAR: A Unified Diffusion Framework for Multi-Domain 3D LiDAR Generation

OmniLiDAR:一个多领域3D激光雷达生成的统一扩散框架

Youquan Liu, Weidong Yang, Ao Liang, Xiang Xu, Lingdong Kong, Yang Wu, Dekai Zhu, Xin Li, Runnan Chen, Ben Fei, Tongliang Liu, Wanli Ouyang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Computing, Department of Computer Science, National University of Singapore(新加坡国立大学计算机学院) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) Technical University of Munich(慕尼黑技术大学) Nanjing University of Science and Technology(南京理工大学) Shanghai AI Laboratory(上海人工智能实验室) University of Sydney(悉尼大学) The Chinese University of Hong Kong, Hong Kong SAR(香港中文大学(深圳))

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 OmniLiDAR提出一种统一的文本条件扩散框架,生成跨八个领域的3D激光雷达扫描,通过跨域训练策略和特征建模提升多域生成能力,实验显示在数据增强和鲁棒性评估中表现优异。

Comments Preprint; 12 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13778 2026-05-14 cs.RO cs.CV 79%

Realtime-VLA FLASH: Speculative Inference Framework for Diffusion-based VLAs

实时-VLA FLASH:基于扩散模型的视觉-语言-动作模型的推测推理框架

Jiahui Niu, Kefan Gu, Yucheng Zhao, Shengwen Liang, Tiancai Wang, Xing Hu, Ying Wang, Huawei Li

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Nanjing University(南京大学) Dexmal

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出实时-VLA FLASH框架,通过轻量级草案模型和主模型的Action Expert并行验证,实现低延迟高频率重规划,实验显示在LIBERO上任务性能保持良好,推理延迟降低至19.1ms。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13713 2026-05-14 cs.CV eess.IV 79%

Learning to Optimize Radiotherapy Plans via Fluence Maps Diffusion Model Generation and LSTM-based Optimization

通过束流图扩散模型生成和基于LSTM的优化学习优化放射治疗计划

Isabella Poles, Simon Arberet, Riqiang Gao, Martin Kraus, Marco D. Santambrogio, Florin C. Ghesu, Ali Kamen, Dorin Comaniciu

机构 * Politecnico di Milano(米兰理工学院) Digital Technology and Innovation, Siemens Healthineers(西门子医疗数字化技术与创新)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出一种扩散驱动的学习优化方法,用于端到端的VMAT计划,通过生成可行的束流图并利用LSTM优化模块提高计划效率和机器可交付性。

Comments Early Accept at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13316 2026-05-14 cs.CV 79%

Test-time Sparsity for Extreme Fast Action Diffusion

测试时稀疏性用于极端快速动作扩散

Kangye Ji, Yuan Meng, Jianbo Zhou, Ye Li, Chen Tang, Zhi Wang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出测试时稀疏性方法,通过动态预测可剪枝的残差计算来加速动作扩散,解决开放环境中的动态策略问题,实验表明在减少92% FLOPs的同时提升5倍生成速度,保持无损性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13182 2026-05-14 cs.CV 79%

DiffST: Spatiotemporal-Aware Diffusion for Real-World Space-Time Video Super-Resolution

DiffST: 用于现实世界时空视频超分辨率的时空感知扩散模型

Zheng Chen, Ruofan Yang, Jin Han, Dehua Song, Zichen Zou, Chunming He, Yong Guo, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Duke University(杜克大学) Huawei Consumer Business Group(华为消费者业务集团)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DiffST提出一种高效时空感知视频扩散框架,通过跨帧上下文聚合和视频表示引导提升时空信息利用,实现高效实时世界时空视频超分辨率。

Comments Code is available at: https://github.com/zhengchen1999/DiffST

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13041 2026-05-14 cs.CV 79%

EgoForce: Robust Online Egocentric Motion Reconstruction via Diffusion Forcing

EgoForce:通过扩散强迫实现鲁棒的在线自体视角运动重建

Inwoo Hwang, Donggeun Lim, Hojun Jang, Young Min Kim

机构 * Seoul National University(首尔国立大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出EgoForce框架,通过扩散强迫方法实现从噪声自体视角输入中鲁棒的长时间全身体运动重建,优于现有在线和离线方法。

Comments Project page: https://inwoohwang.me/EgoForce

详情

展开后加载摘要…

URL PDF HTML 收藏