arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-25 至 2026-06-25 共收录 26 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1 篇

2603.29591 2026-06-25 cs.CV 版本更新 70%

FlowID : Enhancing Forensic Identification with Latent Flow-Matching Models

FlowID: 利用潜在流匹配模型增强法医鉴定

Jules Ripoll, David Bertoin, Alasdair Newson, Charles Dossal, Jose Pablo Baraybar

机构 * INSA Toulouse(图卢兹理工学院) La Sorbonne Université(索邦大学) International Committee of the Red Cross(国际红十字委员会)

专题命中 图像编辑 :image generation(abstract);image editing(abstract);分类 cs.CV

AI总结 提出FlowID方法,结合单图像微调与注意力掩码,修复暴力死亡面部损伤并保留身份特征,在InjuredFaces基准上优于现有开源方法。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 扩散模型 21 篇

2507.09052 2026-06-25 cs.CV cs.LG 版本更新 85%

Contrastive Conditional-Unconditional Alignment for Long-tailed Diffusion Model

对比条件-无条件对齐用于长尾扩散模型

Fang Chen, Alex Villa, Gongbo Liang, Fuxing Li, Xiaoyi Lu, Meng Tang

机构 * University of California Merced(加州大学默塞德分校) Oregon State University(俄勒冈州立大学) University of Florida(佛罗里达大学)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对长尾分布下条件扩散模型的模式坍塌问题,提出对比条件-无条件对齐方法,通过对齐损失和对比损失提升尾部类别的多样性与保真度。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24946 2026-06-25 cs.CV cs.AI cs.MM 版本更新 81%

HaineiFRDM: Structure-Preserving Diffusion for Film Restoration under Fast Motion and Diverse Defects

HaineiFRDM:面向快速运动与多样缺陷的保结构扩散电影修复方法

Rongji Xun, Junjie Yuan, Zhongjie Wang

机构 * Tongji University, Shanghai, China(同济大学) Shanghai Film Restoration Laboratory, Shanghai, China(上海电影修复实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.MM

AI总结 针对电影修复中快速运动导致肢体消失和结构扭曲的问题,提出基于扩散模型的HaineiFRDM,采用内容感知修复、分块策略与位置感知全局融合模块,实现高分辨率保结构修复,并引入频率模块增强纹理一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25661 2026-06-25 cs.CV 版本更新 79%

DRM: Diffusion-based Reward Model With Step-wise Guidance

DRM: 基于扩散的奖励模型与逐步引导

Jaxon Zhang, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu

机构 * Peking University(北京大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出基于扩散的奖励模型(DRM),利用预训练扩散模型作为评估骨干,通过逐步评估能力改进强化学习对齐和推理采样,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17917 2026-06-25 cs.LG cs.AI cs.CL cs.CV 版本更新 79%

Streaming-dLLM: Accelerating Diffusion LLMs via Suffix Pruning and Dynamic Decoding

Streaming-dLLM: 通过后缀剪枝和动态解码加速扩散大语言模型

Zhongyu Xiao, Zhiwei Hao, Jianyuan Guo, Yong Luo, Jia Liu, Jie Xu, Han Hu

机构 * School of information(信息学院) Electronics, Beijing Institute of Technology, Beijing(电子学院,北京理工大学,北京) Department of Computer Science, City University of Hong Kong, Hong Kong(计算机科学系,香港城市大学,香港) School of Computer Science, Wuhan University, Wuhan(计算机科学学院,武汉大学,武汉) School of Economics(经济学院) Management, Communication University of China, Beijing(管理学院,中国传媒大学,北京) School of Science(科学学院) Engineering, The Chinese University of Hong Kong (Shenzhen), Shenzhen(工程学院,香港中文大学(深圳),深圳)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Streaming-dLLM,通过空间上的注意力引导后缀建模剪枝冗余掩码令牌和时间上的动态置信度感知早停策略,实现无需训练的扩散大语言模型推理加速,最高达68.2倍加速且保持生成质量。

Comments Tech report. Code is available at https://github.com/xiaoshideta/Streaming-dLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22962 2026-06-25 cs.LG stat.ML 版本更新 78%

Asymptotic Learning Curves for Diffusion Models with Random Features Score and Manifold Data

具有随机特征得分和流形数据的扩散模型的渐近学习曲线

Anand Jerry George, Nicolas Macris

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散模型中去噪得分匹配的理论行为,当数据分布支持在低维流形上且得分用随机特征神经网络参数化时,推导高维极限下测试、训练和得分误差的渐近精确表达式,发现线性流形样本复杂度与内在维度线性相关,而非线性流形则削弱低维结构优势。

Comments Added proof of Claim 1 in a restricted setting

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18100 2026-06-25 math.AP 版本更新 78%

Fokas method for linear convection-diffusion equation with time-dependent coefficients and its extension to other evolution equations

含时系数线性对流扩散方程的Fokas方法及其对其他演化方程的推广

Konstantinos Kalimeris, Türker Özsarı

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对有界区间上含时系数的线性对流扩散方程,应用并改进Fokas方法得到解的显式积分公式,证明分数阶Sobolev空间中的适定性和正则性估计,并推广至其他含时系数的演化方程。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02205 2026-06-25 cs.LG 版本更新 78%

From Uncertain to Safe: Conformal Adaptation of Diffusion Models for Safe PDE Control

从不确定到安全:扩散模型的安全自适应用于PDE控制

Peiyan Hu, Xiaowei Qian, Wenhao Deng, Rui Wang, Haodong Feng, Ruiqi Feng, Tao Zhang, Long Wei, Yue Wang, Zhi-Ming Ma, Tailin Wu

机构 * intern(实习生) Westlake University(西湖大学) School of Engineering, Westlake University(西湖大学工程学院) Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院) Fudan University(复旦大学) Zhongguancun Academy(中关村学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出SafeDiffCon方法,通过共形预测估计不确定性分位数,结合后训练和推理阶段调整扩散模型,在满足安全约束下实现最优PDE控制。

Comments ICML 2025. 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17002 2026-06-25 cond-mat.str-el 版本更新 71%

Electronic Sound and Diffusion in Disordered Multiband Metals

无序多带金属中的电子声与扩散

Miguel-Ángel Sánchez-Martínez, Blaise Goutéraux, Louk Rademaker, Felix Flicker

专题命中 扩散模型 :diffusion(title)

AI总结 研究无序多带金属中声学等离激元(恶魔)的动力学,发现无序导致模式频率变为纯虚数,产生扩散行为,解释了Sr₂RuO₄中恶魔的异常非线性色散。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05354 2026-06-25 cs.CV cs.GR 版本更新 62%

SplatPainter: Interactive Authoring of 3D Gaussians from 2D Edits via Test-Time Training

SplatPainter: 通过测试时训练从2D编辑交互式创作3D高斯

Yang Zheng, Hao Tan, Kai Zhang, Peng Wang, Leonidas Guibas, Gordon Wetzstein, Wang Yifan

机构 * Stanford University(斯坦福大学) Adobe

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV、cs.GR

AI总结 提出SplatPainter,一种状态感知的前馈模型,通过测试时训练实现从用户2D视图连续编辑3D高斯资产,支持局部细节优化、涂改和全局重着色,达到交互速度。

Comments project page https://y-zheng18.github.io/SplatPainter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22121 2026-06-25 cs.CV 版本更新 57%

MotionDPS: Motion-Compensated 3D Brain MRI Reconstruction

MotionDPS: 3D脑部MRI重建中的运动补偿

Antonio Ortiz-Gonzalez, Erich Kobler, Lukas Schletter, Alexander Effland

机构 * Life and Medical Sciences Institute, University of Bonn(波恩大学生命与医学科学研究所) Institute for Machine Learning, LIT AI Lab, Department of Virtual Morphology, Clinical Research Institute Medical AI, Johannes Kepler University Linz(林茨约翰尼斯·凯撒大学机器学习研究所、LIT AI实验室、虚拟形态部门、医学人工智能临床研究机构) German Center for Neurodegenerative Diseases (DZNE)(德国神经退行性疾病研究中心(DZNE)) Institute for Applied Mathematics, University of Bonn(波恩大学应用数学研究所)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种统一的贝叶斯框架,用于运动补偿的3D MRI重建,通过直接从运动损坏的k空间数据中联合估计解剖图像、刚体运动参数和线圈灵敏度图,实现了无需配对无运动训练数据的完全无监督重建。

Comments This work has been accepted for publication in IEEE Transactions on Medical Imaging (TMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10702 2026-06-25 cs.CV cs.AI 版本更新 57%

Backbone-Conditional Behavior of Modality Gating in Multi-Modal Prostate MRI Segmentation: A 5-Fold Cross-Validation and Gate Mechanism Analysis

模态隔离门控融合:用于稳健多模态前列腺MRI分割的架构无关方法

Yongbo Shu, Wenzhao Xie, Shanhu Yao, Zirui Xin, Luo Lei, Kewen Chen, Aijing Luo

机构 * The Second Xiangya Hospital of Central South University(中南大学湘雅医学院第二医院) The Third Xiangya Hospital of Central South University(中南大学湘雅医学院第三医院) School of Life Sciences, Central South University(中南大学生命科学学院) Hunan Provincial Key Laboratory of Medical Information Research (Central South University)(湖南省医学信息研究重点实验室(中南大学)) Hunan Provincial Clinical Medical Research Center for Cardiovascular Intelligent Medicine(湖南省心血管智能医学临床医学研究中心)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出模态隔离门控融合(MIGF)方法,通过独立编码流和门控阶段提升多模态前列腺MRI分割的鲁棒性,实验表明其在不同模态缺失和伪影情况下均有效。

Comments Major revision. Single-fold analysis replaced by 5-fold cross-validation (180 trained models) plus a direct gate-mechanism analysis; conclusions updated to show that modality gating is backbone-conditional. Supersedes v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17773 2026-06-25 cs.CV 版本更新 57%

LoT-Pass: Long-term-robust Image Watermarking for Image to Video Generation

LoT-Pass: 面向图像到视频生成的长期鲁棒图像水印

Guanjie Wang, Zehua Ma, Han Fang, Weiming Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对图像引导视频生成中源图像追踪缺失的问题,提出跨模态水印框架I2VWM,通过视频模拟噪声层和光流对齐模块增强水印的时间鲁棒性,在开源和商业模型上验证了效果。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 57%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04066 2026-06-25 q-bio.NC cs.LG 版本更新 50%

SC-TauPath: A Structural Connectivity Attribution Framework for Mapping Tau Propagation Pathways in Alzheimer's Disease

SC-TauPath:一种用于映射阿尔茨海默病中tau蛋白传播路径的结构连接归因框架

Jing Zhang, Norman Scheel, Minheng Chen, Tong Chen, Yanjun Lyu, David C. Zhu, Rong Zhang, Dajiang Zhu

机构 * University of Texas at Arlington(德克萨斯理工大学) Michigan State University(密歇根州立大学) University of Texas Southwestern Medical Center(德克萨斯西南医学中心)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出SC-TauPath框架,结合网络扩散模型增强的多层感知机和梯度×输入归因方法,从体内神经影像数据中映射tau蛋白传播路径,并验证了与Braak分期解剖学的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23434 2026-06-25 cs.LG 版本更新 50%

Onsager-Machlup Posterior Transport for Deep Gaussian Processes

深度高斯过程的Onsager-Machlup后验传输

Jian Xu, Delu Zeng, John Paisley, Qibin Zhao

机构 * RIKEN iTHEMS(日本理化学研究院iTHEMS研究中心) RIKEN AIP(日本理化学研究院AIP研究中心) South China University of Technology(华南理工大学) Columbia University(哥伦比亚大学)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出OM-Path方法,通过概率流ODE和Onsager-Machlup路径正则化将深度高斯过程推断转化为后验传输,在大型UCI数据集上优于现有变分推断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03548 2026-06-25 math.PR 版本更新 50%

Degree-preserving conservative processes and a unified approach for their hydrodynamics

保度保守过程及其流体动力学的统一方法

Chiara Franceschini, Patrícia Gonçalves, Kohei Hayashi, Makiko Sasada

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文研究一类满足“保度性质”的一维守恒型相互作用系统,建立了不变测度与流体动力学极限的统一分析框架,证明乘积不变测度的边缘分布属于六种特定分布族,并揭示宏观行为由经典热方程控制。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21996 2026-06-25 cs.CE 版本更新 50%

Intrusive and Non-Intrusive Model Order Reduction for Airborne Contaminant Transport: Comparative Analysis and Uncertainty Quantification

空气污染物传输的侵入式与非侵入式模型降阶:比较分析与不确定性量化

Lisa Kühn, Jacopo Bonari, Max von Danwitz, Alexander Popp

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对化工泄漏后污染物扩散的高保真模拟计算成本高的问题,本文比较了侵入式与非侵入式模型降阶方法,并构建了非侵入式降阶模型,实现快速预测及不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01759 2026-06-25 cs.LG cs.AI 版本更新 50%

Weight Space Representation Learning via Neural Field Adaptation

通过神经场自适应进行权重空间表示学习

Zhuoqian Yang, Mathieu Salzmann, Sabine Süsstrunk

机构 * EPFL(苏黎世联邦理工学院)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出利用预训练基础模型和低秩自适应约束优化空间,诱导权重空间结构,实现高质量、有区分性和语义结构的表示,并在潜在扩散模型中提升生成质量。

Comments 9 pages body, 9 pages appendix

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05835 2026-06-25 cond-mat.mes-hall cond-mat.mtrl-sci quant-ph 版本更新 50%

Boltzmann transport theory of magnon-exciton drag

磁振子-激子拖曳的玻尔兹曼输运理论

Zakhar A. Iakovlev, Akashdeep Kamra, Mikhail M. Glazov

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对双层范德华反铁磁半导体CrSBr,发展磁振子-激子拖曳效应的微观理论,通过玻尔兹曼方程揭示磁振子-激子散射主导输运,产生大且各向同性的激子传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17247 2026-06-25 cs.LG cs.AI q-bio.BM 版本更新 50%

OmegAMP: Targeted AMP Discovery via Biologically Informed Generation

OmegAMP:通过生物信息引导的靶向抗菌肽发现

Diogo Soares, Leon Hetzel, Paulina Szymczak, Marcelo Der Torossian Torres, Johanna Sommer, Cesar de la Fuente-Nunez, Fabian Theis, Stephan Günnemann, Ewa Szczurek

机构 * Institute of AI for Health, Helmholtz Munich(海德堡-慕尼黑人工智能与健康研究所) School of Computation, Information and Technology, Technical University of Munich(慕尼黑技术大学计算、信息与技术学院) Institute of Computational Biology, Helmholtz Munich(海德堡-慕尼黑计算生物学研究所) Munich Data Science Institute, Technical University of Munich(慕尼黑技术大学慕尼黑数据科学研究所) Faculty of Medicine, Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学医学院) Machine Biology Group, Departments of Psychiatry and Microbiology, Institute for Biomedical Informatics, Institute for Translational Medicine and Therapeutics, Perelman School of Medicine, University of Pennsylvania(宾夕法尼亚大学马歇尔医学中心机器生物学组) Departments of Bioengineering and Chemical and Biomolecular Engineering, University of Pennsylvania(宾夕法尼亚大学生物工程与化学与生物分子工程系) Department of Chemistry, School of Arts and Sciences, University of Pennsylvania(宾夕法尼亚大学化学系) Penn Institute for Computational Science, University of Pennsylvania(宾夕法尼亚大学宾夕法尼亚计算科学研究所) TUM School of Life Sciences, Technical University of Munich(慕尼黑技术大学生命科学学院) Faculty of Mathematics, Informatics and Mechanics, University of Warsaw(华沙大学数学、信息学与力学系)

专题命中 扩散模型 :diffusion(abstract)

AI总结 提出OmegAMP框架,利用扩散模型和生物信息编码空间实现可控抗菌肽生成,结合数据增强分类器降低假阳性,在湿实验中达到96%活性率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07149 2026-06-25 math.AP cs.NA math-ph math.MP math.NA 版本更新 50%

Derivation of the fourth-order DLSS equation with nonlinear mobility via chemical reactions

通过化学反应推导具有非线性迁移率的四阶DLSS方程

Alexander Mielke, André Schlichting, Artur Stephan

专题命中 扩散模型 :diffusion(abstract)

AI总结 将一维四阶DLSS方程解释为化学反应网络,通过速率方程在离散圆上的极限推导出经典DLSS方程或具有幂次型非线性迁移率的变体,并利用EDP收敛识别极限梯度结构。

Comments 36 pages, 2 figure. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 可控生成 1 篇

2601.14945 2026-06-25 cs.RO cs.AI 版本更新 78%

TIDAL: Temporally Interleaved Diffusion and Action Loop for High-Frequency VLA Control

TIDAL: 时间交错扩散与动作循环用于高频VLA控制

Yuteng Sun, Haoran Wang, Ruofei Bai, Zhengguo Li, Jun Li, Meng Yee Michael Chuah, Wei Yun Yau

机构 * Institute for Infocomm Research (I$^2$R), A*STAR, Singapore(信息通信研究所(I²R),A*STAR,新加坡) Tsinghua University, Beijing, China(清华大学,北京,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 提出TIDAL分层框架,通过双频架构解耦语义推理与高频执行,实现边缘硬件上约9Hz控制更新,在动态拦截任务中性能提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 个性化与一致性 1 篇

2511.22411 2026-06-25 cs.CV 版本更新 57%

StyleFusion360: View-Consistent Head Stylization via Adaptive Style Modulation

StyleFusion360: 通过自适应风格调制实现视图一致的人头风格化

Furkan Guzelant, Arda Goktogan, Tarık Kaya, Aysegul Dundar

机构 * Bilkent University(比尔肯特大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出StyleFusion360,一种基于扩散的框架,通过自适应风格调制实现单风格参考图像的多视图一致、身份保持的3D人头风格化,无需逐风格训练,并支持强度控制和局部编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 图像生成评测 2 篇

2509.26376 2026-06-25 cs.CV 版本更新 79%

ScalingAR: Scaling Confidence for Autoregressive Image Generation

ScalingAR: 自回归图像生成的置信度缩放

Harold Haodong Chen, Xianfeng Wu, Wen-Jie Shu, Rongjin Guo, Disen Lan, Harry Yang, Ying-Cong Chen

专题命中 图像生成评测 :image generation(title,abstract);分类 cs.CV

AI总结 提出ScalingAR框架,通过令牌熵作为置信度信号,在轮廓级和策略级进行自适应轨迹剪枝和动态引导调度,无需早期解码或外部奖励,显著提升自回归图像生成性能。

Comments ICML 2026; Code: https://github.com/EnVision-Research/ScalingAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17037 2026-06-25 cs.CV cs.AI 版本更新 70%

AMVICC: A Novel Benchmark for Cross-Modal Failure Mode Profiling for VLMs and IGMs

AMVICC: 一种用于VLM和IGM跨模态故障模式分析的新型基准

Aahana Basappa, Pranay Goel, Anusri Karra, Anish Karra, Asa Gilmore, Kevin Zhu

机构 * Centennial High School, Frisco, Texas, USA(Centennial High School, Texas, USA) Lebanon Trail High School, Frisco, Texas, USA(Lebanon Trail High School, Texas, USA) West Windsor-Plainsboro High School, Princeton Junction, New Jersey, USA(West Windsor-Plainsboro High School, New Jersey, USA) Algoverse AI Research, Palo Alto, California, USA(Algoververse AI Research, California, USA)

专题命中 图像生成评测 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出AMVICC基准,通过图像到文本和文本到图像任务系统比较多模态大模型和图像生成模型的视觉推理失败模式,发现故障模式在模型和模态间共享,但存在特定于模型和模态的失败。

Comments 14 pages, 4 figures, 8 tables. Presented at the 39th Conference on Neural Information Processing Systems Workshop: VLM4RWD. Presented at the 43th International Conference on Machine Learning Workshops: ICML 2026 CTB, ICML 2026 FAGEN, ICML 2026 EMM-QA. Authors Aahana Basappa and Pranay Goel contributed equally. Code: https://github.com/AahanaB24/AMVICC, Data: https://doi.org/10.5281/zenodo.17646068

详情

展开后加载摘要…

URL PDF HTML 收藏