arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-03-19 至 2026-03-19 共收录 83 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 9 篇

2603.15026 2026-03-19 cs.CV cs.LG 57%

Training-free Detection of Generated Videos via Spatial-Temporal Likelihoods

无需训练的生成视频检测方法:时空似然方法

Omer Ben Hayun, Roy Betser, Meir Yossef Levi, Levi Kassel, Guy Gilboa

机构 * Technion – Israel Institute of Technology(技术学院–以色列理工学院)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 本文提出STALL方法,通过时空似然建模实现无需训练的视频合成检测,优于传统图像和视频检测方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17375 2026-03-19 cs.CV 57%

Stereo World Model: Camera-Guided Stereo Video Generation

立体世界模型:基于摄像头的立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi

机构 * The University of Hong Kong(香港大学) VAST ByteDance Pico(字节跳动Pico)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出StereoWorld,一种基于摄像头的立体世界模型,通过联合学习外观和双眼几何实现端到端的立体视频生成。该模型在RGB模态中操作,直接从视差中获取几何信息,通过统一的相机帧RoPE和立体感知注意力分解提升生成效率和一致性。

Comments Project Page: https://sunyangtian.github.io/StereoWorld-web/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17117 2026-03-19 cs.CV 57%

MosaicMem: Hybrid Spatial Memory for Controllable Video World Models

MosaicMem: 用于可控视频世界模型的混合空间记忆

Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth Chakaravarthy P, Dennis Anthony, Yang Ye, Yidi Li, Weiwei Wan, Animesh Garg

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) The University of Osaka(大阪大学) Georgia Institute of Technology(佐治亚理工学院) Mujin Inc.(Mujin公司) University of Texas at Austin(德克萨斯大学奥斯汀分校) Taiyuan University of Technology(太原本科技大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MosaicMem提出一种混合空间记忆方法,通过提升片段至3D实现可靠定位与检索,结合模型原生条件化保留提示生成,提升姿态一致性与动态建模能力,支持细粒度导航与场景编辑。

Comments Project Page: https://mosaicmem.github.io/mosaicmem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 57%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23728 2026-03-19 cs.CV cs.AI 57%

M3DLayout: A Multi-Source Dataset of 3D Indoor Layouts and Structured Descriptions for 3D Generation

M3DLayout:一个多源的3D室内布局及结构描述数据集用于3D生成

Yiheng Zhang, Zhuojiang Cai, Mingdao Wang, Meitong Guo, Tianxiao Li, Li Lin, Yuwang Wang

机构 * Tsinghua University(清华大学) Beihang University(北京航空航天大学) Migu Beijing Research Institute(咪咕北京研究院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出M3DLayout数据集,包含21367个布局和433k个物体实例,整合真实扫描、专业CAD设计和程序生成场景,为3D生成模型提供多样化的空间和语义学习基础。

Comments CVPR 2026; Project Page: https://graphic-kiliani.github.io/M3DLayout/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17419 2026-03-19 cs.CR cs.AI 50%

Caging the Agents: A Zero Trust Security Architecture for Autonomous AI in Healthcare

将代理笼中:面向医疗AI自主系统的零信任安全架构

Saikat Maiti

机构 * VP of Trust, Commure(Commure 职务负责人) Founder & CEO, nFactor Technologies(nFactor Technologies 创始人及首席执行官)

专题命中 可控生成 :image generation(abstract)

AI总结 本文提出零信任安全架构,用于医疗AI自主代理,通过多层防御机制解决代理在医疗环境中存在的关键安全漏洞,包括凭证泄露、执行能力滥用等,并开源相关配置和工具。

Comments Keywords: agentic AI security, autonomous agents, healthcare cybersecurity, zero trust, prompt injection, HIPAA, Kubernetes security, OpenClaw

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2602.21818 2026-03-19 cs.CV 83%

SkyReels-V4: Multi-modal Video-Audio Generation, Inpainting and Editing model

SkyReels-V4:多模态视频-音频生成、修复和编辑模型

Guibin Chen, Dixuan Lin, Jiangping Yang, Youqiang Zhang, Zhengcong Fei, Debang Li, Sheng Chen, Chaofeng Ao, Nuo Pang, Yiming Wang, Yikun Dou, Zheng Chen, Mingyuan Fan, Tuanhui Li, Mingshan Chang, Hao Zhang, Xiaopeng Sun, Jingtao Xu, Yuqiang Xie, Jiahua Wang, Zhiheng Xu, Weiming Xiong, Yuzhe Jin, Baoxuan Gu, Binjie Mao, Yunjie Yu, Jujie He, Yuhao Feng, Shiwen Tu, Chaojie Wang, Rui Yan, Wei Shen, Jingchen Wu, Peng Zhao, Xuanyue Zhong, Zhuangzhuang Liu, Kaifei Wang, Fuxiang Zhang, Weikai Xu, Wenyan Liu, Binglu Zhang, Yu Shen, Tianhui Xiong, Bin Peng, Liang Zeng, Xuchen Song, Haoxiang Guo, Peiyu Wang, Max W. Y. Lam, Chien-Hung Liu, Yahui Zhou

机构 * Skywork AI

专题命中 图像修复 :inpainting(title,abstract);diffusion(abstract);分类 cs.CV

AI总结 SkyReels-V4是一款多模态视频基础模型,支持视频音频生成、修复和编辑,采用双流多模态扩散变换器架构,结合文本编码器实现多模态指令处理,支持高分辨率、长时长视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17382 2026-03-19 cs.CV 79%

VisionNVS: Self-Supervised Inpainting for Novel View Synthesis under the Virtual-Shift Paradigm

VisionNVS: 一种基于虚拟位移范式的自监督补全方法用于新型视角合成

Hongbo Lu, Liang Yao, Chenghao He, Fan Liu, Wenlong Liao, Tao He, Pai Peng

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(河海大学) COWARobot Co. Ltd.(COWARobot有限公司)

专题命中 图像修复 :inpainting(title,abstract);分类 cs.CV

AI总结 本文提出VisionNVS,通过引入虚拟位移策略,将视角合成问题转化为自监督补全任务,利用单目深度代理模拟遮挡模式,提升自动驾驶中新型视角合成的几何精度和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17408 2026-03-19 cs.CV cs.AI 57%

Joint Degradation-Aware Arbitrary-Scale Super-Resolution for Variable-Rate Extreme Image Compression

联合退化感知任意尺度超分辨率用于可变速率极值图像压缩

Xinning Chai, Zhengxue Cheng, Xin Li, Rong Xie, Li Song

机构 * School of Information Science and Electronic Engineering, Shanghai Jiao Tong University(上海交通大学信息科学与电子工程学院) Department of Electronic Engineer and Information Science, University of Science and Technology of China(中国科学技术大学电子工程与信息科学系) MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University(上海交通大学人工智能教育部重点实验室)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 本文提出ASSR-EIC框架,利用任意尺度超分辨率支持可变速率极值图像压缩,通过联合退化感知解码器实现率自适应重建,提升低比特率下的图像恢复质量。

Comments Accepted by IEEE Transactions on BroadCasting

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 5 篇

2512.12220 2026-03-19 cs.CV 83%

TechImage-Bench: Rubric-Based Evaluation for Technical Image Generation

TechImage-Bench: 基于评分标准的技术图像生成评估

Minheng Ni, Zhengyuan Yang, Yaowen Zhang, Linjie Li, Chung-Ching Lin, Kevin Lin, Zhendong Wang, Xiaofei Wang, Shujie Liu, Lei Zhang, Wangmeng Zuo, Lijuan Wang

机构 * Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学) Microsoft Project Website(微软项目网站)

专题命中 图像生成评测 :image generation(title,abstract);text-to-image(abstract);分类 cs.CV

AI总结 本文提出TechImage-Bench,通过评分标准评估技术图像生成,发现现有模型在科学准确性上存在显著差距,并展示评分标准对改进图像生成的监督作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13399 2026-03-19 cs.CV cs.AI cs.LG 70%

EdiVal-Agent: An Object-Centric Framework for Automated, Fine-Grained Evaluation of Multi-Turn Editing

EdiVal-Agent:一个面向多轮编辑自动细粒度评估的对象中心框架

Tianyu Chen, Yasi Zhang, Zhi Zhang, Peiyu Yu, Shu Wang, Zhendong Wang, Kevin Lin, Xiaofei Wang, Zhengyuan Yang, Linjie Li, Chung-Ching Lin, Jianwen Xie, Oscar Leong, Lijuan Wang, Ying Nian Wu, Mingyuan Zhou

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of California, Los Angeles(加州大学洛杉矶分校) Microsoft AI Superintelligence(微软人工智能超智实验室) Lambda, Inc(Lambda公司)

专题命中 图像生成评测 :diffusion(abstract);image editing(abstract);分类 cs.CV

AI总结 本文提出EdiVal框架,通过对象中心视角实现多轮编辑的细粒度评估,引入EdiVal-IF、EdiVal-CC和EdiVal-VQ三个指标,构建多轮编辑基准测试平台,用于识别现有编辑模型的失败模式。

Comments Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong, Lijuan Wang, Ying Nian Wu, and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17476 2026-03-19 cs.CV cs.AI cs.CL 57%

UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models

UniSAFE:统一多模态模型安全评估的综合基准

Segyu Lee, Boryeong Cho, Hojung Jung, Seokhyun An, Juhyeong Kim, Jaehyun Kwak, Yongjin Yang, Sangwon Jang, Youngrok Park, Wonjun Chang, Se-Young Yun

机构 * KAIST AI(KAIST人工智能研究院) Department of Computer Science and Engineering, UNIST(UNIST计算机科学与工程系) Department of Mathematical Sciences, KAIST(KAIST数学科学系) University of Toronto(多伦多大学) KAIST CS(KAIST计算机科学系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出UniSAFE基准,用于评估统一多模态模型的系统级安全性,发现多图像生成任务比文本生成任务更易出现安全漏洞。

Comments Equal contribution by first three authors, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 57%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16897 2026-03-19 eess.SP cs.CL cs.HC cs.LG q-bio.NC 50%

EEG-Based Brain-LLM Interface for Human Preference Aligned Generation

基于EEG的脑-大语言模型接口用于人类偏好对齐生成

Junzi Zhang, Jianing Shen, Weijie Tu, Yi Zhang, Hailin Zhang, Tom Gedeon, Bin Jiang, Yue Yao

机构 * Shandong University, China(山东大学) Australian National University, Australia(澳大利亚国立大学) Curtin University, Australia(Curtin大学)

专题命中 图像生成评测 :image generation(abstract)

AI总结 本文提出基于EEG的脑-大语言模型接口,通过EEG信号引导图像生成模型,利用神经信号反馈实现模型动态适应,为适应性语言模型推理提供新思路。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 9 篇

2603.10744 2026-03-19 cs.CV 83%

Just-in-Time: Training-Free Spatial Acceleration for Diffusion Transformers

即时加速:扩散变换器的无训练空间加速

Wenhao Sun, Ji Li, Zhaoqiang Liu

机构 * University of Electronic Science and Technology of China(电子科技大学) Capital Normal University(首都师范大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);image synthesis(abstract);分类 cs.CV

AI总结 本文提出JiT框架,通过空间域加速解决扩散变换器的高计算成本问题,实现7倍加速且性能接近无损,优于现有方法。

Comments Accepted by CVPR2026. Project Page: https://wenhao-sun77.github.io/JiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17671 2026-03-19 cs.CV 79%

Few-Step Diffusion Sampling Through Instance-Aware Discretizations

通过实例感知离散化实现少步扩散采样

Liangyu Yuan, Ruoyu Wang, Tong Zhao, Dingwen Fu, Mingkun Lei, Beier Zhu, Chi Zhang

机构 * Westlake University(西湖大学) Tongji University(同济大学) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出实例感知离散化框架,通过输入依赖先验调整时间步分配,提升生成质量,减少训练和推理开销。

Comments 24 pages, 20 figures. code: https://github.com/851695e35/INDIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12346 2026-03-19 cs.CV cs.AI 79%

Efficient Diffusion as Low Light Enhancer

高效扩散作为低光照增强器

Guanzhou Lan, Qianli Ma, Yuqi Yang, Zhigang Wang, Dong Wang, Xuelong Li, Bin Zhao

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) TeleAI

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出ReDDiT框架,通过线性外推错误分数函数和迁移高斯流到反射感知残差空间,提升低光照图像增强效率,仅用2步即可达到SOTA效果。

Comments CVPR 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17652 2026-03-19 cs.RO cs.CV 74%

VectorWorld: Efficient Streaming World Model via Diffusion Flow on Vector Graphs

VectorWorld: 通过向量图上的扩散流实现高效的流式世界模型

Chaokang Jiang, Desen Zhou, Jiuming Liu, Kevin Li Sun

机构 * University of Cambridge, Cambridge, United Kingdom(剑桥大学)

专题命中 效率与蒸馏 :diffusion(title);分类 cs.CV

AI总结 VectorWorld通过向量图上的扩散流实现高效的流式世界模型,解决了自动驾驶政策闭环评估中的初始化不匹配、采样延迟和运动可行性问题,提升了地图结构精度和闭环运行稳定性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13377 2026-03-19 cs.LG 67%

Score Distillation Beyond Acceleration: Generative Modeling from Corrupted Data

生成模型从损坏数据中学习:超越加速的分数蒸馏

Yasi Zhang, Tianyu Chen, Zhendong Wang, Ying Nian Wu, Mingyuan Zhou, Oscar Leong

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft AI Superintelligence(微软人工智能超级智能)

专题命中 效率与蒸馏 :diffusion(abstract);inpainting(abstract)

AI总结 本文提出RSD框架,通过预训练腐蚀感知扩散教师模型并蒸馏出高效单步生成器,实现高保真生成模型,适用于图像修复、超分辨率等任务,实验显示在多个数据集上FID均优于传统方法。

Comments This paper merges DSD(Denoising Score Distillation) and RSD(Restoration Score Distillation)v1. Tianyu Chen and Yasi Zhang contributed equally; Oscar Leong and Mingyuan Zhou advised equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14331 2026-03-19 cs.CV 57%

AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising

AvatarForcing:通过局部-未来滑动窗口去噪实现一步流式谈话 avatars

Liyuan Cui, Wentao Hu, Wenyuan Zhang, Zesong Yang, Fan Shi, Xiaoqiang Liu

机构 * Zhejiang University(浙江大学) Beijing University of Posts and Telecommunications(北京邮电大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出AvatarForcing,一种一步流式扩散框架,通过局部-未来滑动窗口去噪实现高实时性谈话 avatars,实验证明其在34ms/帧下具备高质量视觉和唇同步性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01419 2026-03-19 cs.CV 57%

Towards One-step Causal Video Generation via Adversarial Self-Distillation

基于对抗自蒸馏的单步因果视频生成

Yongqi Yang, Huayang Huang, Xu Peng, Xiaobin Hu, Donghao Luo, Jiangning Zhang, Chengjie Wang, Yu Wu

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Tencent YouTu Lab(腾讯优图实验室) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于蒸馏的高效因果视频生成框架,通过对抗自蒸馏策略提升生成质量,结合首帧增强策略减少误差传播,实验表明在单步和双步视频生成中优于现有方法。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17622 2026-03-19 eess.SP 50%

Fast Beam-Brainstorm: Few-Step Generative Site-Specific Beamforming with Flexible Probing

快速波束-脑暴:基于灵活探测的少步生成式波束成形

Zihao Zhou, Zhaolin Wang, Yuanwei Liu

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出快速波束-脑暴方法,通过两阶段蒸馏策略实现快速生成高保真通信波束,减少生成成本并适应灵活的信道探测长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17052 2026-03-19 cs.LG cs.AI 50%

Early Quantization Shrinks Codebook: A Simple Fix for Diversity-Preserving Tokenization

早量化缩小代码表:一种维持多样性token化问题的简单修复

Wenhao Zhao, Qiran Zou, Rushi Shah, Yudi Wu, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore(国立新加坡大学) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文研究了向量量化中的坍塌问题,发现随机初始化和编码器容量限制导致token和嵌入坍塌,并提出缓解方案,是首次系统探讨该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏