arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-13 至 2026-08-13 共收录 47 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.11452 2026-08-13 cs.CV cs.AI 新提交 79%

TangPoetryBench: A Multi-Dimensional Benchmark and Rubric-Conditioned Evaluator for Poetry-to-Image Generation

TangPoetryBench:面向诗歌到图像生成的多维度基准与基于评分规则的评估器

Haoqi Hu, Tongji Luo, Li Zhang, Boning Zhou

专题命中 文生图 :image generation(title);text-to-image(abstract);分类 cs.CV

AI总结 该研究推出TangPoetryBench多维度基准与PAE评估器,解决T2I模型生成诗歌插图的评估难题,PAE性能接近Claude且可泛化,相关资源已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11343 2026-08-13 cs.AI cs.CV cs.IR cs.LG 新提交 74%

Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval

前沿大语言模型能否媲美原生多模态嵌入?在难负例文本到图像检索上的对比

Archan Dutta, Vyanktesh Kanungo

机构 * Westcliff University(韦克利夫大学)

专题命中 文生图 :text-to-image(title);分类 cs.CV

AI总结 本研究在Flickr30k数据集上对比Gemini Embedding 2等原生多模态嵌入与GPT-4.1、Claude Sonnet 4.6等前沿LLM的难负例文本到图像检索性能,发现二者表现相当,且多模态嵌入更适配低延迟应用

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.12122 2026-08-13 cs.RO cs.CV 新提交 79%

HandEdit: A Unified Benchmark for Egocentric Human-to-Robot Dexterous Hand Image Editing

HandEdit:用于自我中心视角下人类到机器人灵巧手图像编辑的统一基准

Zhenjie Yang, Xingyu Jiao, Guopeng Zhong, Shuzhe Yang, Shi Che, Chao Wu, Chenyu Jiang, Dongjie Zhang, Yideng Zhang, Zheng Zhang, Muyun Jiang, Haisheng Su, Shuang Jin, Donghang Zhang, Chao Yang, Li Chen, Hongyang Li, Zuxuan Wu, Yu-Gang Jiang, Xiaosong Jia, Junchi Yan

专题命中 图像编辑 :image editing(title,abstract);分类 cs.CV

AI总结 HandEdit是含2亿+实例、覆盖26种URDF的统一具身感知图像编辑基准,用于弥合人类与机器人数据差异,可评估11种图像编辑基线,助力具身人工智能发展。

Comments Technical Report. Project Page: https://handedit.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 38 篇

2608.11732 2026-08-13 cs.CR cs.AI 新提交 88%

Fingerprinting Text-to-Image Diffusion Models via Collapsed Generation

基于塌陷生成的文本到图像扩散模型指纹识别

Yuanmin Huang, Chen Chen, Geng Hong, Xiaoyu You, Hui Xue, Zhenxing Qian, Mi Zhang, Min Yang

专题命中 扩散模型 :text-to-image(title,abstract);diffusion(title,abstract)

AI总结 本研究提出基于塌陷生成的非侵入式指纹框架,可在白盒和黑盒设置下验证文本到图像扩散模型的所有权,且对微调衍生模型及混淆具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11807 2026-08-13 cs.CV 新提交 83%

CoDiR: Confidence-Guided Diffusion Refinement for Semi-Supervised Histopathology Segmentation

CoDiR:用于半监督组织病理学分割的置信度引导扩散精调

Hoai Nhan Pham, Dang-Nguyen Bui, Le-Van Thai, Thanh-Hiep Vo, Lan Anh Dinh Thi, Tien Dat Nguyen, Duy-Dong Nguyen, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI VIETNAM实验室) Portland Community College(波特兰社区学院) University of Science, VNU-HCM(胡志明市国家大学科学大学) Hanoi University of Science and Technology(河内科技大学) Jeonbuk National University(全北国立大学) Washington University School of Medicine(华盛顿大学医学院) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对半监督组织病理学分割的标注稀缺与伪标签不可靠问题,提出CoDiR框架,结合Mean Teacher与扩散模型精调伪标签,在GlaS、CRAG数据集上取得优异mDice指标,精调模块贡献显著

Comments Accepted to the MICCAI COMPAYL Workshop 2026 (11 pages, 2 figures, 6 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11475 2026-08-13 q-bio.QM cs.LG 新提交 82%

Probing and steering biology across Boltz-1s trunk-diffusion boundary

探测与操控Boltz-1主干-扩散边界处的生物学特性

Piotr Jedryszek, Tongmeng Xie, Adam Winnifrith, Alexander Hasson, Weronika Ślesak, George Wicks, Toby Winnifrith, Oliver M. Crook

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究以Boltz-1为对象,分析其主干与扩散模块的生物学信息传递差异,验证线性可解码方向的操控性,发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12308 2026-08-13 cs.CV cs.AI 新提交 79%

DreamFly: Causal Memory and Receding-Horizon Diffusion Planning for Aerial Vision-Language Navigation

DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划

Yan Deng, Fei Xu

机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。

Comments 24 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12175 2026-08-13 cs.CV 新提交 79%

TGRHuman: Text-Guided Realistic 3D Human Generation via Diffusion Renderer

TGRHuman:基于扩散渲染器的文本引导逼真3D人体生成

Muxin Zhang, Chaohui Yu, Yuanwang Yang, Min Wei, Zhuo Su, Kun Li

机构 * Tianjin University(天津大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究提出TGRHuman方法,解耦3D人体的几何与纹理生成,采用显式多视图优化结合扩散渲染器,实现高效高质量文本引导的逼真3D人体生成,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12155 2026-08-13 cs.CV 新提交 79%

Understanding Why Foundation Models Work for Diffusion-Generated Image Detection

探究基础模型为何适用于扩散生成图像检测

Davide Cozzolino, Giovanni Poggi, Luisa Verdoliva

机构 * University Federico II of Naples(那不勒斯费德里科二世大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本研究探究基础模型用于扩散生成图像检测的原因,通过DDIM反演、频率交换及潜在空间分析,发现其利用中低频分布差异实现检测,为该类方法的可解释性提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12032 2026-08-13 cs.CV cs.AI 新提交 79%

LoSA: Near-Lossless Sparse Attention for Training-Free Video Diffusion Acceleration

LoSA:用于无训练视频扩散加速的近无损稀疏注意力

Enhuai Liu, Yunke Wang, Yutong Wang, Changming Sun, Chang Xu

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 LoSA是一种无训练稀疏注意力方法,通过固定99%的注意力质量阈值移除冗余计算,在多款视频扩散Transformer上实现最高3.2倍加速,且速度-质量权衡优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11942 2026-08-13 cs.CV 新提交 79%

Evaluating and Calibrating Diffusion Model-derived Uncertainty for Quantitative MRI Mapping

评估与校准扩散模型衍生的定量MRI成像不确定性

Shishuai Wang, Stefan Klein, Juan A. Hernandez-Tamames, Dirk H. J. Poot

机构 * Erasmus MC(伊拉斯姆斯医学中心) TU Delft(代尔夫特理工大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对深度学习定量MRI成像方法可靠性未明确表征的问题,评估了扩散模型衍生的不确定性,发现其与成像误差正相关,经校准后可用于可靠性评估与选择性预测。

Comments 11 pages, 6 figures. Accepted at the MICCAI 2026 Workshop on Uncertainty for Safe Utilization of Machine Learning in Medical Imaging (UNSURE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11913 2026-08-13 cs.CV 新提交 79%

HarmoniDPO: Video-guided Audio Generation via Preference-Optimized Diffusion

HarmoniDPO:基于偏好优化扩散模型的视频引导音频生成

Wenshuo Peng, Kaipeng Zhang

机构 * Tsinghua University(清华大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出HarmoniDPO框架,采用双视频表示、online-DPO微调及DDS算法,实现更精准的视频到音频生成,在音视频同步性与主观质量上优于现有最优方法。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11765 2026-08-13 cs.CV 新提交 79%

ProBAG: Prototype-Guided Boundary-Aware Graph Diffusion for Weakly Supervised Histopathology Segmentation

ProBAG:用于弱监督组织病理学分割的原型引导边界感知图扩散

Duy-Dong Nguyen, Le-Van Thai, Hoai Nhan Pham, Ngoc Lam Quang Bui, Tam Tran, Zhi Huang

机构 * AI VIETNAM Lab(AI越南实验室) Washington University School of Medicine(华盛顿大学医学院) Jeonbuk National University(全北国立大学) Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学佩雷尔曼医学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProBAG是一种新的弱监督组织病理学分割方法,通过结合视觉与文本原型、逐类功率重新校准及图扩散机制,在BCSS-WSSS和LUAD-HistoSeg数据集上取得优于现有方法的性能。

Comments 12 pages, 2 figures, 4 tables. Accepted by MICCAI Workshop (COMPAYL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11748 2026-08-13 cs.CV 新提交 79%

Dual Modality Prompted Diffusion Priors for Zero Shot Hyperspectral Pansharpening

用于零样本高光谱 pansharpening 的双模态提示扩散先验

Pengwei Xie, Fei Zhu, Jiajun Li, Xiangyuan Liu, Xiangyuan Liu, Kangqing Shen, Gemine Vivone

机构 * School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Peking University(北京大学) National Center for Applied Mathematics Shenzhen (NCAMS), Southern University of Science and Technology(南方科技大学深圳应用数学国家中心) Department of Automation, Tsinghua University(清华大学自动化系) National Research Council of Italy, Institute of Integrated Methodologies for Earth Observation (CNR-IMIOT)(意大利国家研究委员会综合地球观测方法研究所)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对零样本高光谱 pansharpening 问题,提出双模态提示扩散模型 DIDM,通过双模态提示注入与全色引导正则化实现空间细节与光谱保真的平衡,在多数据集实验中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11617 2026-08-13 cs.CV 新提交 79%

KANResDiff: Learning Local Residual Diffusion via Kolmogorov-Arnold Network for Ambiguous Medical Image Segmentation

KANResDiff:基于柯尔莫哥洛夫-阿诺德网络学习局部残差扩散以解决模糊医学图像分割问题

Fanding Li, Chenglin Wang, Xiangyu Li, Xingyu Qiu, Xinghua Ma, Xiangming Yin, Haiyang Li, Suyu Dong, Wei Wang, Kuanquan Wang, Gongning Luo, Shuo Li

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算学部) College of Computer and Control Engineering, Northeast Forestry University(东北林业大学计算机与控制工程学院) Case Western Reserve University(凯斯西储大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对现有模糊医学图像分割方法无法形成渐进式语义建模的问题,提出KANResDiff模型,通过独立时间编码与残差薛定谔桥实现阶段感知模糊性建模,在公开数据集上取得SOTA性能。

Comments 10 pages, 3 figures, MICCAI 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11562 2026-08-13 cs.CV cs.AI eess.IV 新提交 79%

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

从合成到去除:基于物理的反射模拟与基于扩散的视频去反射

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

机构 * Xiaomi Inc.(小米公司) MiLM Plus

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对视频反射去除数据与模型缺失问题,提出闭环框架S2R,含基于物理的反射模拟、首个扩散式视频去反射模型及专用基准,实现了更优性能与更快推理。

Comments Project page: https://codingwzp.github.io/VideoDereflection_S2R

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11514 2026-08-13 eess.IV 新提交 78%

SinoDiff: Physics-Consistent Self-Supervised Diffusion for Unified Low-Dose to Standard-Dose PET Sinogram Recovery

SinoDiff:用于统一低剂量到标准剂量PET正弦图恢复的物理一致性自监督扩散模型

Ghulam Nabi Ahmad Hassan Yar, Himashi Peiris, Sharna Jamadar, Alex Fornito, Zhaolin Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对现有PET恢复方法的泛化性或灵活性不足问题,提出SinoDiff物理一致性自监督扩散框架,通过泊松 thinning 与频域卷积实现统一剂量水平的PET正弦图恢复,在两类数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12083 2026-08-13 cs.LG cs.AI 新提交 78%

Faithful, Sufficient and Understandable: Rethinking Graph Counterfactual Explanations via Discrete Diffusion Inversion

忠实、充分且可解释:通过离散扩散反演重新思考图反事实解释

David Bechtoldt, Sidney Bender

机构 * TU Berlin(柏林工业大学) BIFOLD–Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对图神经网络预测缺乏内在解释的问题,提出GDCE-I方法,结合离散扩散反演技术,在统一评估框架下于四个基准测试中大幅优于相关工作,可生成符合领域规则的可解释图反事实解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11742 2026-08-13 cs.CL 新提交 78%

Ripple-Pivot Search: Active Parallel Decoding for Diffusion Large Language Models

波纹枢轴搜索:扩散大语言模型的主动并行解码

Yushi Ye, Xu Chen, Haoyun Jiang, Jinsong Lan, Haihong Tang, Bo Han, Ivor Tsang, Yanfeng Wang, Bo Zheng, Jiangchao Yao

机构 * Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学合作中位数网络创新中心) Alibaba Group TMLR Group(阿里巴巴集团TMLR团队) Hong Kong Baptist University(香港浸会大学) A*STAR CFAR and Nanyang Technological University(新加坡科研局计算科学中心和南洋理工大学) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出RPS方法,利用dLLM解码的波纹效应,在保持生成质量的同时,大幅提升解码速度与准确率,适用于推理及代码生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11419 2026-08-13 cs.LG 新提交 78%

Diffusion-Based Data-Driven Assortment Optimization

基于扩散模型的数据驱动 assortment 优化

Junyi Liao, Xiaohui Jiang, Zhengwei Tong, Ethan X. Fang, Vahid Tarokh

机构 * Duke University(杜克大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对传统 assortment 优化模型对设定误差敏感、难以捕捉复杂客户行为的问题,提出基于引导离散扩散的模型无关框架,可高效生成高质量、多样化的 assortment,在高维场景下鲁棒性良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11235 2026-08-13 cs.AI 新提交 78%

CORA-Diff: Confidence-Oriented Residual Acceptance for Efficient Diffusion Language Model Inference

CORA-Diff:面向高效扩散语言模型推理的置信导向残差接受

Yifan Wu, Yufeng Zhang, Kenli Li

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文提出无需训练的CORA-Diff方法,利用原生置信度与持久性门控识别残差位置,在多基准测试中显著降低扩散语言模型推理的重复计算,同时保持任务性能。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/wyffffff/cora-diff-llada

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11249 2026-08-13 cs.CL cs.AI cs.IT cs.LG math.IT 新提交 78%

Diffuse to Compress: Leveraging Diffusion LMs for Lossless Compression

扩散到压缩:利用扩散语言模型进行无损压缩

Angelo Nardone, Paolo Ferragina

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对无损文本压缩的吞吐量瓶颈,首次引入扩散语言模型(DLM)替代自回归LLM,设计策略解决算法挑战,在enwik8数据集上推进了无损文本压缩的现有技术水平。

Comments 18 pages, 11 figures, 2 tables. Main paper: 9 pages (7 pages text + 2 pages references). Includes 9 pages of supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11982 2026-08-13 math.AP 新提交 78%

Improved weak-strong uniqueness for general cross-diffusion systems

一般交叉扩散系统的改进弱-强唯一性

Noah Geltner, Maria Heitzinger, Ansgar Jüngel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对含/不含体积填充效应、含/不含完全强制性的一般交叉扩散系统,建立有界解的弱-强唯一性,通过构造粘合熵、利用梯度估计与Gagliardo-Nirenberg不等式放宽假设,将分析扩展至非强制性系统,弥补强制性缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11695 2026-08-13 math.PR math.AP 新提交 78%

Generalised stochastic curvature flow in $d \geq 2$, and sharp interface limit for the stochastic Allen-Cahn equation with nonlinear diffusion

d≥2 下的广义随机曲率流,以及带非线性扩散的随机 Allen-Cahn 方程的尖锐界面极限

Weijun Xu, Shuhan Zhou

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文构造了d≥2下受时间白噪声驱动的广义随机曲率流局部时间解,将其应用于带非线性扩散的随机Allen-Cahn方程,证明该方程的尖锐界面极限为对应随机曲率流。

Comments 50 pages. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12223 2026-08-13 physics.flu-dyn physics.comp-ph 新提交 78%

Effects of Soret Diffusion and Radiative Heat Loss on the Evolution of Buoyant Flame Kernels in Ultra-Lean Hydrogen-Air Mixture

索雷特扩散与辐射热损失对超贫氢空气混合物中浮力火焰核演化的影响

Ivan S. Yakovenko, Alexey D. Kiverin

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究采用数值方法,探究索雷特扩散与辐射热损失对超贫氢空气混合物中浮力火焰核演化的影响,明确二者对火焰核生长、轨迹及破碎的作用规律。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11729 2026-08-13 astro-ph.GA 新提交 78%

Molecule-specific diffusion and desorption of interstellar ices on carbonaceous dust

星际冰在碳质尘埃上的分子特异性扩散与脱附

Yi-Hsuan Chiu, Tushar Suhasaria, Cornelia Jäger, Chun-Yi Lee, Ko-Ju Chuang, Thomas Henning, Yu-Jung Chen

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 通过实验室研究发现,星际冰在碳质尘埃上的扩散与脱附具有分子特异性,尘埃-冰界面会影响冰的结构和脱附动力学,为天文观测和星际冰化学模型提供了新约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11407 2026-08-13 cs.RO cs.MA 新提交 71%

Top-down Traffic Scenario Generation via Joint Initial-Goal Diffusion and Trajectory Infilling

基于联合初始-目标扩散与轨迹填充的自上而下交通场景生成

Da Saem Lee, Yash Vardhan Pant, Sebastian Fischmeister

机构 * University of Waterloo(滑铁卢大学)

专题命中 扩散模型 :diffusion(title)

AI总结 提出TrafficDiffuser框架,联合建模初始与目标状态对生成高级交通场景,在Argoverse 2数据集上验证,其智能体初始化性能优于次优方法,可降低速度分布距离与越野率。

Comments Accepted for publication at the IEEE International Conference on Intelligent Transportation Systems (ITSC), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12286 2026-08-13 math-ph math.MP 新提交 71%

PatternFormer: Learning Multiple Solution Patterns in Reaction--Diffusion Systems

PatternFormer:学习反应-扩散系统中的多种解模式

Zhipeng Chang, Wenpeng Yin, Wenrui Hao

专题命中 扩散模型 :diffusion(title)

AI总结 该研究提出基于大语言模型的PatternFormer框架,可学习非线性偏微分方程的多种解,在非线性椭圆问题和Gray-Scott问题上表现优异,还可微调以构建解景观通用基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11643 2026-08-13 cs.CV cs.LG 新提交 70%

Robustness of AI-Art Detectors under Generator Shift

生成器偏移下AI生成艺术检测器的鲁棒性

Shivank Singh Thakur, Meien Li, Mark Stamp

机构 * San Jose State University(圣何塞州立大学)

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 该研究针对生成器偏移问题,在SD3.5m数据集上评估了五个AI艺术检测器的鲁棒性,发现模型在跨生成器场景下泛化能力不足,CLIP ViT-L/14表现最优,为分层防御检测器的开发提供了依据。

Comments To appear as a chapter in the book "Artificial Intelligence for Cyber Defense in Emerging Threats", to be published by Springer by early 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12209 2026-08-13 cs.CV 新提交 57%

Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction

作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解

Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang

机构 * ByteDance(字节跳动)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏