arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-02 至 2026-06-02 共收录 258 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2507.02792 2026-06-02 cs.CV 88%

RichControl: Structure- and Appearance-Rich Training-Free Spatial Control for Text-to-Image Generation

RichControl: 面向文本到图像生成的、结构和外观丰富的免训练空间控制

Lexi Pang, Liheng Zhang, Hang Ye, Xiaoxuan Ma, Yizhou Wang

机构 * Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 可控生成 :text-to-image(title,abstract);image generation(title);diffusion(abstract);分类 cs.CV

AI总结 提出一种免训练框架,通过解耦条件特征的采样调度与去噪过程,并引入重启细化调度和外观丰富提示策略,在复杂条件下实现结构和外观平衡的受控生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00121 2026-06-02 cs.CV cs.AI 86%

Versatile Framework with Semantic and Structural guidance for Image Reconstruction from Brain Activity

基于语义和结构引导的大脑活动图像重建通用框架

Yizhuo Lu, Changde Du, Qiongyi Zhou, Liuyun Jiang, Huiguang He

机构 * State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Future Technology, University of Chinese Academy of Sciences(中国科学院大学未来技术学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 可控生成 :diffusion(summary_cn,abstract);image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MindDiffuser两阶段框架,结合CLIP文本嵌入和视觉特征,通过Stable Diffusion生成语义图像并迭代优化结构信息,在fMRI、EEG、MEG三种模态上显著提升图像重建性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01608 2026-06-02 cs.CV 57%

Exploiting Semantic and Pixel Representations for Ultra-Low Bitrate Image Compression

利用语义和像素表示进行超低比特率图像压缩

Hao Wei, Yanhui Zhou, Chenyang Ge, Saeed Anwar, Ajmal Mian

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(人机混合增强智能国家重点实验室,人工智能与机器人研究院,西安交通大学) School of Information and Telecommunication, Xi’an Jiaotong University(信息与电信学院,西安交通大学) Department of Computer Science and Software Engineering, The University of Western Australia(计算机科学与软件工程系,西澳大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出SPRDiff扩散压缩方法,通过三重编码器架构和失真感知重建模块,在超低比特率下同时保持语义一致性和像素级保真度,实现率-失真-感知权衡最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00954 2026-06-02 cs.CV 57%

COLLAR: Cascaded Object-Level Latent Refinement for High-Fidelity Conditional Generation

COLLAR: 级联对象级潜在精化用于高保真条件生成

Xinlong Zhang, Jia Wei, Xiaoyu Zhang, Teng Zhou, Chengyu Lin, Yongchuan Tang

机构 * College of Computer Science, Zhejiang University(浙江大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出COLLAR框架,通过视场扩展和级联对象级潜在精化,在扩散Transformer中实现无训练的高保真对象级控制,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25195 2026-06-02 cs.CV 57%

Baton: Explicit Semantic Blueprints for Joint Video-Audio Generation

Baton: 用于联合视频-音频生成的显式语义蓝图

Shuyuan Tu, Qi Tian, Zihan Yang, Yue Wu, Xintong Han, Weijie Kong, Jiangfeng Xiong, Jian-Wei Zhang, Zhao Zhong, Liefeng Bo, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent Hunyuan(腾讯幻元)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Baton框架,通过VA-Planner生成语义对齐的模态感知规划令牌作为蓝图,注入扩散骨干以协调视频和音频去噪,解决现有方法因缺乏共享长期规划导致的跨模态对齐脆弱问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09877 2026-06-02 cs.CV cs.AI cs.RO 57%

Genie 4D: Semantic-Prior-Guided 4D Dynamic Scene Reconstruction

Genie 4D:语义先验引导的4D动态场景重建

Yiru Yang, Zhuojie Wu, Nishant Kumar Singh, Max Schulthess

机构 * University of Zurich(苏黎世大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出Genie 4D框架,结合实时视觉惯性高斯泼溅前端和前馈4D骨干网络,利用冻结的DINOv3特征作为结构先验抑制身份漂移,并通过条件扩散精炼器恢复高频细节,最终通过轻量级潜在动作头实现用户可控的4D世界模型重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09390 2026-06-02 cs.CV 57%

Training-Free Coverless Multi-Image Steganography with Access Control

免训练的无载体多图像隐写术与访问控制

Minyeol Bae, Si-Hyeon Lee

机构 * Department of Computer Science, Seoul National University(首尔国立大学计算机科学系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 提出MIDAS框架,通过潜在级融合实现免训练的多图像隐写与用户特定访问控制,引入随机基机制抑制残差结构信息,并理论分析信息泄露。

Comments Accepted (Poster) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03938 2026-06-02 physics.optics cs.CV cs.NE physics.app-ph 57%

Super-resolution image projection over an extended depth of field using a diffractive decoder

使用衍射解码器实现扩展景深上的超分辨率图像投影

Hanlong Chen, Cagatay Isil, Tianyi Gan, Mona Jarrahi, Aydogan Ozcan

机构 * Electrical and Computer Engineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校电子与计算机工程系) Bioengineering Department, University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校生物工程系) California NanoSystems Institute (CNSI), University of California, Los Angeles, California 90095, USA(加州大学洛杉矶分校加州纳米系统研究所)

专题命中 可控生成 :image synthesis(abstract);分类 cs.CV

AI总结 提出一种混合图像投影系统,结合CNN编码器和全光学衍射解码器,实现扩展景深和像素超分辨率,提升空间带宽积。

Comments 18 Pages, 6 Figures

Journal ref Light: Science & Applications (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01938 2026-06-02 cond-mat.mes-hall quant-ph 50%

Magnetic control of electron scattering in silicene quantum dots

硅烯量子点中电子散射的磁控制

Mohamed El Azar, Elmustapha Feddi, Pablo Díaz, David Laroze, Ahmed Jellal

专题命中 可控生成 :diffusion(abstract)

AI总结 通过外加垂直磁场和硅烯自旋轨道耦合,研究电子在硅烯量子点中的准束缚态形成机制,并证明自旋选择性约束。

Comments 12 pages, 7 figures

Journal ref Annals of Physics 492 (2026) 170543

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01597 2026-06-02 cs.RO cs.MA 50%

Physics-Informed Modeling and Control of Emergent Behaviors in Robot Swarms

机器人群体涌现行为的物理信息建模与控制

Zixuan Jin, Wenzhuo Zhang, Shuxian Quan, Zirui Dong, Fangwen Ye, Yuchen Shi, Cheng Xu

机构 * School of Computer and Communication Engineering, University of Science and Technology Beijing(北京科技大学计算机与通信工程学院) Shunde Innovation School, University of Science and Technology Beijing(北京科技大学顺德创新学院)

专题命中 可控生成 :diffusion(abstract)

AI总结 提出PhySwarm框架,利用多阶段对流-扩散-反应宏观模型和等效确定性运动微观模型,结合神经物理控制器,实现机器人群体多阶段涌现行为的建模与控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01122 2026-06-02 cs.LG q-fin.CP 50%

A Per-Component Diagnostic Protocol for Neural HJB-PIDE Solvers under Control-Dependent Lévy Jumps

控制依赖 Lévy 跳跃的神经 HJB-PIDE 求解器的逐分量诊断协议

R. Drissi

专题命中 可控生成 :diffusion(abstract)

AI总结 提出一个五步诊断协议,用于检测残差训练的神经 HJB-PIDE 求解器在控制依赖 Lévy 跳跃下的算子计算错误,并通过 CRRA-Merton-Variance-Gamma 基准案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00960 2026-06-02 quant-ph 50%

Palindromic structure of depth-efficient quantum search algorithms

深度高效的量子搜索算法的回文结构

Kun Zhang, Hai-Long Shi, Xiao-Hui Wang, Vladimir Korepin

专题命中 可控生成 :diffusion(abstract)

AI总结 通过将非结构化量子搜索建模为电路深度优化问题,发现回文结构可对称替换Grover扩散层,实现深度高效振幅放大,并导出最小期望深度的解析表达式,对X型混频器、局部扩散算子和嵌套局部扩散算子应用后,总电路深度减少约40%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30895 2026-06-02 cs.CE 50%

CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors

CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验

Xuanyi Liu, Deyi Ji, Liqun Liu, Lanyun Zhu, Xuhang Chen, Qianxiong Xu, Peng Shu, Huan Yu, Jie Jiang, Feng Gao, Siwei Ma

专题命中 可控生成 :diffusion(abstract)

AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像修复 3 篇

2606.00704 2026-06-02 cs.CV 57%

VICR: Visual In-Context Restoration for Real-World Image Super-Resolution

VICR: 面向真实图像超分辨率的视觉上下文恢复

Qichang Zhang, Hailong Wang, Baiang Li, Linhao Wang, Rong Fu, Erkang Cheng, Simon James Fong

机构 * Faculty of Science and Technology, University of Macau(澳门大学科技学院) Nullmax Hefei University of Technology(合肥工业大学) Shandong Normal University(山东师范大学)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 提出基于扩散变换器的视觉上下文恢复框架,通过解耦的视觉先验注入机制将真实图像超分辨率建模为图像补全,实现结构保真与细节合成的平衡。

Comments 28 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00310 2026-06-02 cs.CV cs.AI cs.LG 57%

Beyond Visual Fidelity: Benchmarking Super-Resolution Models for Large-Scale Remote Sensing Imagery via Downstream Task Integration

超越视觉保真度:通过下游任务集成评估大规模遥感影像的超分辨率模型

Zhili Li, Kangyang Chai, Zhihao Wang, Xiaowei Jia, Yanhua Li, Gengchen Mai, Sergii Skakun, Dinesh Manocha, Yiqun Xie

机构 * University of Maryland(马里兰大学) University of Pittsburgh(匹兹堡大学) Worcester Polytechnic Institute(沃思利技术学院) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 图像修复 :diffusion(abstract);分类 cs.CV

AI总结 针对现有超分辨率评估依赖PSNR/SSIM等保真度指标而忽略下游任务效用的问题,提出GeoSR-Bench基准数据集,集成土地覆盖分割、基础设施映射等下游任务,评估GAN、Transformer等9种SR模型在270种设置下的性能,发现保真度指标与任务性能弱相关甚至负相关。

Comments Under review at IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12321 2026-06-02 cs.CV 57%

Enhancing Blind Source Separation with Dissociative Principal Component Analysis

增强盲源分离的解离主成分分析

Muhammad Usman Khalid

机构 * College of Computer and Information Sciences, Imam Mohammad Ibn Saud Islamic University(伊斯兰国际大学计算机与信息科学学院)

专题命中 图像修复 :inpainting(abstract);分类 cs.CV

AI总结 提出解离主成分分析(DPCA),通过联合估计主成分和载荷向量并显式建模其相互依赖关系,克服传统稀疏PCA在源重叠时性能下降的问题,在模拟fMRI源恢复、前景背景分离等任务中优于经典sPCA。

Comments 13 pages with 6 figures, this work has not been published before

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 个性化与一致性 8 篇

2606.01858 2026-06-02 cs.CV 79%

Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs

Polaris: 将指令引导的图像生成扩展到数百万个性化风格需求

Zhi-Kai Chen, Jun-Peng Jiang, Jun-Jie Tao, De-Chuan Zhan, Han-Jia Ye

机构 * Tsinghua University(清华大学)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出Polaris智能检索框架,通过索引和检索超过6500个检查点和75000个适配器,自动选择和集成最相关的模型组件,实现无需额外训练的可扩展、可控且对齐的指令驱动图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00742 2026-06-02 cs.CL 71%

CURP: Codebook-based Continuous User Representation for Personalized Generation with LLMs

CURP: 基于码本的连续用户表示用于大语言模型的个性化生成

Liang Wang, Xinyi Mou, Xiaoyou Liu, Xuanjing Huang, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 个性化与一致性 :personalized generation(title)

AI总结 提出CURP框架,通过双向用户编码器和离散原型码本提取多维用户特征,实现少量可训练参数的即插即用个性化生成,在变体生成任务上优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02441 2026-06-02 cs.CV 57%

Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation

空间-时间解耦参考条件用于身份保持的文本到视频生成

Yuheng Chen, Teng Hu, Yuji Wang, Qingdong He, Lizhuang Ma, Jiangning Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ST-DRC框架,通过空间-时间解耦参考条件、TASS-RoPE机制和身份目标,实现高保真身份保持视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02042 2026-06-02 cs.CV 57%

Normality-Preserving Continual Industrial Anomaly Detection via Orthogonal LoRA Banks

通过正交LoRA库保持正态性的持续工业异常检测

Weibai Fang, Haijun Che, Feiyang Ren, Qiancheng Lao

机构 * Yisu University(Yorkshire University)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于历史冻结正交LoRA库和分层新颖性自适应库增长模块的框架,解决扩散模型在持续工业异常检测中的历史正态先验漂移和灾难性遗忘问题。

Comments 33 pages,6 figures,Submitted to Advanced Engineering Informatics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01079 2026-06-02 cs.CV 57%

Chameleon: Style-Content Disentangled Framework for Cross-Domain Object Compositing

Chameleon: 面向跨域对象合成的风格-内容解耦框架

Sukhun Ko, Soo Ye Kim, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang大学CMLab) Adobe Research(Adobe研究)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出基于大规模数据集ChameleonDataset的两阶段训练框架Chameleon,通过联合硬对比学习和时空注意力门控实现跨域对象合成的风格-内容解耦与自适应风格化。

Comments The last two authors are co-corresponding authors. Please visit our project page at https://cmlab-korea.github.io/Chameleon/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00673 2026-06-02 cs.CV 57%

T-CLIP: Enabling Thermal Perception for Contrastive Language-Image Pretraining

T-CLIP:面向对比语言-图像预训练的热感知

Tayeba Qazi, Ayush Maheshwari, Prerana Mukherjee, Brejesh Lall

机构 * Indian Institute of Technology Delhi, India(印度理工学院德里分校) NVIDIA AI Technology Center, India(NVIDIA AI技术中心) Jawaharlal Nehru University, India(贾瓦哈拉尔·尼赫鲁大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对CLIP无法对齐热图像与文本描述的问题,提出物理感知的热描述数据集IR-Cap和解耦双LoRA框架T-CLIP,实现场景级和对象级热理解,在跨模态检索任务上超越所有基线。

Comments 34pages (including references and appendix), 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06163 2026-06-02 eess.IV cs.CV cs.LG physics.med-ph 57%

Cross-Modal Fine-Tuning of 3D Convolutional Foundation Models for ADHD Classification with Low-Rank Adaptation

基于低秩适应的3D卷积基础模型跨模态微调用于ADHD分类

Jyun-Ping Kao, Shinyeong Rho, Shahar Lazarev, Hyun-Hae Cho, Fangxu Xing, Taehoon Shin, C. -C. Jay Kuo, Jonghye Woo

机构 * National Institute of Mental Health, National Institutes of Health(国家精神卫生研究所,国立卫生研究院)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出一种参数高效的迁移学习方法,通过3D低秩适应(LoRA)将预训练于CT图像的3D卷积基础模型微调至MRI的ADHD分类任务,在公开扩散MRI数据集上达到71.9%准确率和0.716 AUC,仅需164万可训练参数。

Comments Accepted for presentation at the IEEE International Symposium on Biomedical Imaging (ISBI) 2026

Journal ref 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI), pp. 1-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10362 2026-06-02 cs.LG cs.CV 57%

OP-LoRA: The Blessing of Dimensionality

OP-LoRA:维度的祝福

Piotr Teterwak, Kate Saenko, Bryan A. Plummer, Ser-Nam Lim

机构 * Boston University(波士顿大学) University of Central Florida(中央佛罗里达大学)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 提出OP-LoRA方法,通过额外MLP预测LoRA适配器权重以改善优化,训练后丢弃MLP,在零额外推理成本下提升性能并降低对学习率的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 图像生成评测 9 篇

2606.02535 2026-06-02 cs.CV 57%

LL-Bench: Rethinking Low-Level Vision Evaluation in the Era of Large-Scale Generative Models

LL-Bench: 在大规模生成模型时代重新思考低级视觉评估

Lu Liu, Huiyu Duan, Chenxin Zhu, Jintong Lu, Haoyun Jiang, Liu Yang, Qiang Hu, Guangtao Zhai, Xiaoyun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 提出LL-Bench基准,包含大量真实退化图像和人工偏好标注,系统评估大规模生成模型在低级视觉任务中的性能,并引入LL-Score评估器以更好对齐人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01911 2026-06-02 cs.CV 57%

Residual Decoder Adapter: ID-Preserving Tokenizer Adaption for Autoregressive Text Rendering

残差解码器适配器:用于自回归文本渲染的身份保持分词器适配

Dongxing Mao, Jinpeng Wang, Jiahao Tang, Kevin Qinghong Lin, Linjie Li, Zhengyuan Yang, Lijuan Wang, Min Li, Jingru Tan

机构 * Central South University(中南大学) University of Oxford(牛津大学) Microsoft Research(微软研究院)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 提出残差解码器适配器(RDA),通过引入配对码本和平行分支学习像素空间残差,在不重新训练分词器和自回归模型的情况下显著提升文本渲染性能。

Comments CVPR 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00931 2026-06-02 cs.CV cs.AI 57%

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences

CV-Arena: 面向教学计算机视觉问题求解的开放基准与人类-AI协作偏好

Fangzhou Lin, Peiran Li, Lingyu Xu, Wenjing Chen, Qianwen Ge, Shuo Xing, Mingyang Wu, Xiangbo Gao, Siyuan Yang, Kazunori Yamada, Ziming Zhang, Haichong Zhang, Zhen Dong, Ming-Hsuan Yang, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯A&M大学) Worcester Polytechnic Institute(沃斯特理工大学) Tohoku University(东北大学) Georgia Institute of Technology(佐治亚理工学院) NVIDIA(英伟达) UCSB(加州大学圣塔芭芭拉分校) UC Merced(加州大学默塞德分校)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 提出CV-Arena基准,包含12K高分辨率真实图像指令对,覆盖16种任务类型,并采用Active Elo协议结合人类与AI偏好评估21个系统,揭示指令遵循、物理推理等方面的差距,同时开发CV-Agent代理模型展示闭环推理的潜力。

Comments 26 pages, 7 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00630 2026-06-02 cs.CV stat.ML 57%

A Systematic Benchmark of Intraoperative Ultrasound-to-MR Synthesis for Brain Tumour Surgery

脑肿瘤手术中术中超声到MR合成的系统基准测试

Olga Esteban-Sinovas, Santiago Cepeda, Ignacio Arrese, Rosario Sarabia

机构 * Department of Neurosurgery, Neurovascular Unit Río Hortega University Hospital(里奥霍尔特ega大学医院神经外科部门,神经血管单元) Specialized Group in Biomedical Imaging and Computational Analysis (GEIBAC)(生物医学成像与计算分析专项组(GEIBAC)) Instituto de Investigación Biosanitaria de Valladolid (IBioVALL)(瓦尔拉多利德生物医学研究 institute(IBioVALL))

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 针对脑肿瘤手术中术中超声(ioUS)到MR图像合成问题,本研究在公共ReMIND数据集上系统比较了6种生成器、4种推理模式和2种目标,结合图像保真度指标和下游分割评估,发现感知质量(LPIPS)与下游效用最相关,而SSIM与效用负相关,SynDiff-2.5D在下游分割中表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15278 2026-06-02 cs.CV cs.AI 57%

Visual Persuasion: What Influences Decisions of Vision-Language Models?

视觉说服:什么影响了视觉语言模型的决策?

Manuel Cherep, Pranav M R, Pattie Maes, Nikhil Singh

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT Media Lab(MIT媒体实验室)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 提出一个框架,通过控制图像选择任务并系统性地扰动输入,利用视觉提示优化方法推断视觉语言模型的潜在视觉效用,揭示影响模型决策的视觉偏好。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04946 2026-06-02 cs.CV cs.AI 57%

Prototypicality Bias Reveals Blindspots in Multimodal Evaluation Metrics

原型性偏差揭示多模态评估指标中的盲点

Subhadeep Roy, Gagan Bhatia, Steffen Eger

机构 * University of Technology Nuremberg(图恩大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文通过构建受控诊断基准PROTOBIAS,发现并验证了多模态评估指标中存在原型性偏差,即倾向于选择视觉或社会原型性高但语义错误的图像,并提出了轻量级对比训练评估器PROTOSCORE作为缓解基线。

详情

展开后加载摘要…

URL PDF HTML 收藏