arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2603.05042 2026-03-27 cs.CV cs.RO 57%

CoIn3D: Revisiting Configuration-Invariant Multi-Camera 3D Object Detection

CoIn3D:重新审视配置不变的多摄像头3D目标检测

Zhaonian Kuang, Rui Ding, Haotian Wang, Xinhu Zheng, Meng Yang, Gang Hua

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence, Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所人机混合增强智能全国重点实验室) Intelligent Transportation Thrust of the Systems Hub, HKUST(GZ)(香港科技大学(广州)系统枢纽智能交通学域) Amazon Alexa AI(亚马逊Alexa人工智能)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出CoIn3D框架,通过空间先验整合和摄像头感知数据增强,提升多摄像头3D目标检测在不同配置下的泛化能力。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24730 2026-03-27 cs.CV 57%

A Framework for Generating Semantically Ambiguous Images to Probe Human and Machine Perception

一种生成语义模糊图像的框架以探测人类和机器感知

Yuqi Hu, Vasha DuTell, Ahna R. Girshick, Jennifer E. Corbett

机构 * University of California, Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 该研究通过生成语义模糊图像探讨人类和机器感知的边界,揭示模型在概念区分上的偏差,展示控制模糊性作为诊断工具的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 57%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23041 2026-03-25 cs.CV cs.AI cs.LG 57%

HUydra: Full-Range Lung CT Synthesis via Multiple HU Interval Generative Modelling

HUydra: 通过多HU区间生成建模实现全范围肺CT合成

António Cardoso, Pedro Sousa, Tania Pereira, Hélder P. Oliveira

机构 * INESC TEC, Portugal(葡萄牙INESC TEC研究院) Faculty of Engineering, University of Porto, Portugal(葡萄牙波尔图大学工程学院) Faculty of Sciences, University of Porto, Portugal(葡萄牙波尔图大学科学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种多HU区间生成建模方法,通过训练针对特定组织的生成模型并融合输出,实现全范围肺CT合成,优于传统2D基线,提升FID和MMD等指标。

Comments Submitted to iEEE TPAMI (Transactions on Pattern Analysis and Machine Intelligence)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23029 2026-03-25 cs.CV 57%

WISER: Wider Search, Deeper Thinking, and Adaptive Fusion for Training-Free Zero-Shot Composed Image Retrieval

WISER:更广的搜索、更深入的思考和自适应融合用于无训练零样本复合图像检索

Tianyue Wang, Leigang Qu, Tianyu Yang, Xiangzhao Hao, Yifan Xu, Haiyun Guo, Jinqiao Wang

机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所基础模型研究中心) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学先进交叉学科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) National University of Singapore(新加坡国立大学) Wuhan AI Research(武汉人工智能研究院) Minzu University of China(民族大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 WISER通过'检索-验证-细化'流程统一文本到图像和图像到图像检索,显式建模意图和不确定性意识,实现更广泛的搜索和更深入的思考,提升零样本复合图像检索性能。

Comments Accept to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17655 2026-03-24 cs.CV cs.AI 57%

Interpretable Cross-Domain Few-Shot Learning with Rectified Target-Domain Local Alignment

可解释的跨领域少样本学习与修正的目标域局部对齐

Yaze Zhao, Yixiong Zou, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CC-CDFSL方法,通过循环一致性解决CLIP-based CDFSL中的局部对齐问题,提升局部视觉语言对齐和可解释性,实现SOTA性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23098 2026-03-20 cs.CV cs.AI 57%

Blind to Position, Biased in Language: Probing Mid-Layer Representational Bias in Vision-Language Encoders for Zero-Shot Language-Grounded Spatial Understanding

无视位置,语言偏见:探测视觉语言编码器中中间层表征偏见以实现零样本语言基础空间理解

Na Min An, Inha Kang, Minhyun Lee, Hyunjung Shim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Samsung Electronics(三星电子)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究探讨了视觉语言编码器中间层中位置和语言相关信息的偏见,通过层间分析发现常规最终层多模态嵌入优先考虑全局语义对齐,导致视觉嵌入对位置线索敏感性低,多语言文本嵌入在共享空间中形成语言依赖的几何偏移,提出构建空间地图的方法提升零样本图像分割性能。

Comments 61 pages, 28 Figures, 15 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17895 2026-03-19 cs.CV 57%

A Creative Agent is Worth a 64-Token Template

一个创意代理值得一个64-token模板

Ruixiao Shi, Fu Feng, Yucheng Xie, Xu Yang, Jing Wang, Xin Geng

机构 * School of Computer Science and Engineering, Southeast University, Nanjing, China(1 南京大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education, China(2 教育部新一代人工智能技术及其跨学科应用关键实验室(东南大学))

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出CAT框架,通过创意令牌化提升文本到图像生成的创造力,实现3.7倍速度提升和4.8倍计算成本降低,生成图像更受人类偏好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22287 2026-03-17 cs.CV 57%

Match-and-Fuse: Consistent Generation from Unstructured Image Sets

匹配与融合:从无结构图像集实现一致生成

Kate Feingold, Omri Kaduri, Tali Dekel

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出Match-and-Fuse方法,通过图模型实现无结构图像集的一致生成,利用内部特征融合和密集输入对应关系,在无需掩码或人工监督的情况下生成一致且高质量的图像集。

Comments CVPR 2026. Project page: https://match-and-fuse.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13118 2026-03-16 cs.CV 57%

NOIR: Neural Operator mapping for Implicit Representations

NOIR:用于隐式表示的神经算子映射

Sidaty El Hadramy, Nazim Haouchine, Michael Wehrli, Philippe C. Cattin

机构 * Department of Biomedical Engineering, University of Basel(巴塞尔大学生物医学工程系) Harvard Medical School, Brigham and Women’s Hospital(哈佛医学院布里奇沃特医院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 NOIR框架将医学影像任务重新表述为连续函数空间间的算子学习,实现分辨率无关的功能到功能转换,展示了对未见过离散化的强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12155 2026-03-13 cs.CV cs.AI 57%

GlyphBanana: Advancing Precise Text Rendering Through Agentic Workflows

GlyphBanana: 通过代理工作流推进精确文本渲染

Zexuan Yan, Jiarui Jin, Yue Ma, Shijian Wang, Jiahui Hu, Wenxiang Jiao, Yuan Lu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) South China University of Technology(华南理工大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 GlyphBanana通过代理工作流整合辅助工具,提升复杂文本和公式渲染的精度,适用于多种文本到图像模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12126 2026-03-13 cs.CV cs.LG 57%

Hoi3DGen: Generating High-Quality Human-Object-Interactions in 3D

Hoi3DGen:生成高质量的人-物交互的3D模型

Agniv Sharma, Xianghui Xie, Tom Fischer, Eddy Ilg, Gerard Pons-Moll

机构 * University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心) Max Planck Institute for Informatics(马克斯·普朗克信息学院) Technische Universität Nürnberg(纽伦堡技术大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 Hoi3DGen通过多模态大语言模型生成高质量3D人-物交互模型,显著提升交互保真度和3D生成质量,实现文本到3D的高效生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11493 2026-03-13 cs.CV cs.AI cs.CY 57%

OrthoEraser: Coupled-Neuron Orthogonal Projection for Concept Erasure

OrthoEraser: 基于耦合神经元的正交投影用于概念擦除

Chuancheng Shi, Wenhua Wu, Fei Shen, Xiaogang Zhu, Kun Hu, Zhiyong Wang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 OrthoEraser通过稀疏自编码器实现高分辨率特征解耦,利用分析梯度正交化策略有效擦除有害内容,同时保留良性语义,实验表明其在安全性和有效性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV 57%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07119 2026-03-10 cs.CV 57%

TIQA: Human-Aligned Text Quality Assessment in Generated Images

TIQA: 生成图像中的人工对齐文本质量评估

Kirill Koltsov, Aleksandr Gushchin, Dmitriy Vatolin, Anastasia Antsiferova

机构 * Lomonosov Moscow State University(洛蒙诺索夫莫斯科国立大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院信息与系统研究所在可信人工智能领域研究中心) MSU Institute for Artificial Intelligence(莫斯科大学人工智能研究所)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 TIQA通过ANTIQA方法提升生成图像中文本质量评估的准确性,有效提高文本生成任务的过滤与重排序性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06043 2026-03-09 cs.CV 57%

Learning to Generate via Understanding: Understanding-Driven Intrinsic Rewarding for Unified Multimodal Models

通过理解学习生成:基于理解的内在奖励用于统一多模态模型

Jiadong Pan, Liang Li, Yuxin Peng, Yu-Ming Tang, Shuohuan Wang, Yu Sun, Hua Wu, Qingming Huang, Haifeng Wang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Sun Yat-sen University(中山大学) Baidu Inc.(百度公司)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出GvU机制,通过内在奖励提升统一多模态模型的生成能力,同时增强其视觉理解能力,缩小理解与生成之间的能力差距。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03163 2026-03-04 cs.CV cs.AI 57%

Conditioned Activation Transport for T2I Safety Steering

基于条件激活传输的T2I安全引导

Maciej Chrabąszcz, Aleksander Szymczyk, Jan Dubiński, Tomasz Trzciński, Franziska Boenisch, Adam Dziedzic

机构 * NASK National Research Institute(NASK国家研究所) Warsaw University of Technology(华沙技术大学) IDEAS Research Institute(IDEAS研究 institute) CISPA Helmholtz Center for Information Security(CISPA海德堡中心 for 信息安全)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出条件激活传输框架,通过几何条件机制和非线性传输映射,有效减少T2I生成不安全内容的风险,提升图像生成的安全性与保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02026 2026-03-03 cs.CV cs.CL cs.LG 57%

Learning to Read Where to Look: Disease-Aware Vision-Language Pretraining for 3D CT

学习如何注视:面向3D CT的疾病感知视觉-语言预训练

Simon Ging, Philipp Arnold, Sebastian Walter, Hani Alnahas, Hannah Bast, Elmar Kotter, Jiancheng Yang, Behzad Bozorgtabar, Thomas Brox

机构 * Computer Vision Group, University of Freiburg, Germany Adaptive \& Agentic AI (A3) Lab, Aarhus University, Denmark Department of Radiology, Medical Center -- University of Freiburg, Germany Chair of Algorithms Data Structures, University of Freiburg, Germany ELLIS Institute Finland School of Electrical Engineering, Aalto University, Finland

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种面向3D CT的疾病感知视觉-语言预训练模型,通过对比预训练和基于提示的疾病监督,实现了文本到图像检索、疾病分类及内扫描片段定位的统一模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00882 2026-03-03 eess.IV cs.CV eess.SP 57%

Solving a Nonlinear Blind Inverse Problem for Tagged MRI with Physics and Deep Generative Priors

求解带标签MRI的非线性盲逆问题:结合物理和深度生成先验

Zhangxing Bian, Shuwen Wei, Samuel W. Remedios, Junyu Chen, Aaron Carass, Blake E. Dewey, Jerry L. Prince

机构 * Johns Hopkins University(约翰霍普金斯大学) Johns Hopkins School of Medicine(约翰霍普金斯医学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种结合物理和深度生成先验的非线性盲逆框架,用于带标签MRI,实现了解剖恢复、高分辨率 cine 图像合成和运动估计的统一处理。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06566 2026-03-03 cs.CV 57%

Dynamic Uncertainty Learning with Noisy Correspondence for Text-Based Person Search

基于噪声对应关系的动态不确定性学习用于基于文本的人脸搜索

Zequn Xie, Haoming Ji, Chengxuan Li, Lingwei Meng

机构 * Zhejiang University(浙江大学) Beijing University of Posts Telecommunications(北京邮电大学) Beijing Forestry University(北京林业大学) Northwest Normal University(西北师范大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出DURA框架,通过动态不确定性学习和关系对齐方法,提升基于文本的人脸搜索在噪声环境下的鲁棒性和检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22734 2026-02-27 cs.CV 57%

Asymmetric Idiosyncrasies in Multimodal Models

多模态模型中的非对称个性化特征

Muzi Tao, Chufan Shi, Huijuan Wang, Shengbang Tong, Xuezhe Ma

机构 * University of Southern California(南加州大学) New York University(纽约大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文研究了多模态模型中描述模型的个性化特征及其对文本到图像模型的影响,发现生成图像丢失了描述中的关键变化,提出了一种新的量化方法。

Comments Project page: https://muzi-tao.github.io/asymmetric-idiosyncrasies/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06292 2026-02-24 eess.IV cs.CV 57%

Zero-shot Multi-Contrast Brain MRI Registration by Intensity Randomizing T1-weighted MRI (LUMIR25)

无监督多对比脑MRI配准:通过强度随机化T1加权MRI(LUMIR25)

Hengjie Liu, Yimeng Dou, Di Xu, Xinyi Fu, Dan Ruan, Ke Sheng

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出了一种基于强度随机化的多对比度脑MRI配准方法,通过多模态损失、强度随机化和轻量级优化策略,在无需显式图像合成的情况下实现了跨对比度的稳健泛化。

Comments Submitted to and reviewed by Learn2Reg MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08145 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.CY 57%

Reliable and Responsible Foundation Models: A Comprehensive Survey

可靠且负责任的基础模型:全面综述

Xinyu Yang, Junlin Han, Rishi Bommasani, Jinqi Luo, Wenjie Qu, Wangchunshu Zhou, Adel Bibi, Xiyao Wang, Jaehong Yoon, Elias Stengel-Eskin, Shengbang Tong, Lingfeng Shen, Rafael Rafailov, Runjia Li, Zhaoyang Wang, Yiyang Zhou, Chenhang Cui, Yu Wang, Wenhao Zheng, Huichi Zhou, Jindong Gu, Zhaorun Chen, Peng Xia, Tony Lee, Thomas Zollo, Vikash Sehwag, Jixuan Leng, Jiuhai Chen, Yuxin Wen, Huan Zhang, Zhun Deng, Linjun Zhang, Pavel Izmailov, Pang Wei Koh, Yulia Tsvetkov, Andrew Wilson, Jiaheng Zhang, James Zou, Cihang Xie, Hao Wang, Philip Torr, Julian McAuley, David Alvarez-Melis, Florian Tramèr, Kaidi Xu, Suman Jana, Chris Callison-Burch, Rene Vidal, Filippos Kokkinos, Mohit Bansal, Beidi Chen, Huaxiu Yao

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文综述了基础模型的可靠和负责任发展,探讨了偏见、安全、不确定性等关键问题,并提出了未来研究方向。

Comments TMLR camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04009 2026-02-09 cs.LG cs.AI cs.CV 57%

PromptSplit: Revealing Prompt-Level Disagreement in Generative Models

PromptSplit: 暴露生成模型中的提示级分歧

Mehdi Lotfian, Mohammad Jalali, Farzan Farnia

机构 * Department of Computer Science and Engineering, The Chinese University of Hong Kong(计算机科学与工程系,香港中文大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 PromptSplit通过核方法检测生成模型在提示层面的分歧,提供可解释的分析工具以识别模型行为差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12946 2026-02-03 cs.CY cs.AI cs.CL cs.CV cs.LG 57%

AI-generated data contamination erodes pathological variability and diagnostic reliability

AI生成的数据污染侵蚀病理变异性与诊断可靠性

Hongyu He, Shaowen Xiang, Ye Zhang, Yingtao Zhu, Jin Zhang, Hao Deng, Emily Alsentzer, Yun Liu, Qingyu Chen, Kun-Hsing Yu, Andrew Marshall, Tingting Chen, Srinivas Anumasa, Daniel Ebner, Dean Ho, Kee Yuan Ngiam, Ching-Yu Cheng, Dianbo Liu

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 AI生成的数据污染导致病理变异性下降和诊断可靠性降低,需政策强制的人类监督以防止医疗数据生态系统的退化。

Comments *Corresponding author: Dianbo Liu (dianbo@nus.edu.sg)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04236 2026-02-03 cs.CV 57%

Scaling Sequence-to-Sequence Generative Neural Rendering

序列到序列生成神经渲染的扩展

Shikun Liu, Kam Woh Ng, Wonbong Jang, Jiadong Guo, Junlin Han, Haozhe Liu, Yiannis Douratsos, Juan C. Pérez, Zijian Zhou, Chi Phung, Tao Xiang, Juan-Manuel Pérez-Rúa

机构 * Meta AI

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 Kaleido通过统一的解码器-only rectified flow transformer实现了序列到序列生成神经渲染的扩展,能够在无显式3D表示的情况下生成多视角视图,并在多个视图设置中达到与场景优化方法相当的性能。

Comments Published at ICLR 2026. Project Page: https://shikun.io/projects/kaleido

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00221 2026-02-03 eess.IV cs.CV 57%

Benchmarking Vanilla GAN, DCGAN, and WGAN Architectures for MRI Reconstruction: A Quantitative Analysis

对MRI重建中Vanilla GAN、DCGAN和WGAN架构进行基准测试:一项定量分析

Humaira Mehwish, Hina Shakir, Muneeba Rashid, Asarim Aamir, Reema Qaiser Khan

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究通过定量分析比较了Vanilla GAN、DCGAN和WGAN在MRI重建中的性能,发现DCGAN和WGAN在图像质量和准确性方面表现更优。

Comments 20 pages

Journal ref Edelweiss Applied Science and Technology January 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17706 2026-01-27 cs.CL cs.CV 57%

A Computational Approach to Visual Metonymy

一种视觉隐喻的计算方法

Saptarshi Ghosh, Linfeng Liu, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出了一种基于符号学理论的计算方法,通过构建ViMET数据集评估多模态语言模型在理解视觉隐喻方面的认知推理能力,并揭示了机器在处理间接视觉参考上的局限性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15888 2026-01-23 cs.CV cs.AI 57%

Understanding the Transfer Limits of Vision Foundation Models

理解视觉基础模型的迁移限制

Shiqi Huang, Yipei Wang, Natasha Thorley, Alexander Ng, Shaheer Saeed, Mark Emberton, Shonit Punwani, Veeru Kasivisvanathan, Dean Barratt, Daniel Alexander, Yipeng Hu

机构 * University College London(伦敦大学学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文研究了视觉基础模型在迁移时的限制,发现预训练目标与下游任务需求的匹配程度影响迁移性能,提出通过改进预训练目标以提升模型效果。

Comments accepted in ISBI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15859 2026-01-23 cs.LG cs.CV 57%

Uncertainty-guided Generation of Dark-field Radiographs

不确定性引导的暗场放射图像生成

Lina Felsner, Henriette Bast, Tina Dorosti, Florian Schaff, Franz Pfeiffer, Daniela Pfeiffer, Julia Schnabel

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出基于不确定性引导的生成对抗网络,从标准衰减X光片生成暗场图像,提升图像生成的可解释性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏