arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3480 篇

2607.27959 2026-07-31 cs.CV cs.IR 新提交 57%

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。

Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27616 2026-07-31 cs.CV 新提交 57%

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

MPIE-Bench:解剖学上合理的多人交互编辑基准测试

Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(元石科技)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25164 2026-07-29 cs.CV cs.AI 新提交 57%

OrganLens: Organ-Specific Representation Learning for CT Foundation Models

OrganLens:用于CT基础模型的器官特异性表征学习

Zhixuan Ge, Anqi Li, Sadeer Al-Kindi, Hanwen Xu, Wei Qiu

机构 * Rice University(莱斯大学) University of Washington(华盛顿大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对CT检查中特定器官表征需求,提出OrganLens通过自监督学习,用器官标识调节共享编码器,经器官特异性蒸馏等方法获取器官特异性表征,在多数据集评估中提升指标,提供了可扩展方法和 reusable 框架。

Comments 16 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24729 2026-07-28 cs.CV 新提交 57%

MicroZoom: Structure-Preserving Detail Synthesis at Extreme Scale

MicroZoom:极端尺度下的结构保留细节合成

Huy Huynh, Jingwei Ma, Brian Curless, Ira Kemelmacher-Shlizerman, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 MicroZoom旨在解决微观尺度下基于参考的极端尺度超分辨率问题,通过两阶段级联设计,第一阶段恢复全局图案连贯性,第二阶段细化局部纹理细节,辅以分割掩码指导合成,实现了全局连贯、基于物质的千兆像素图像合成。

Comments Project page: https://microzoom-sr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22994 2026-07-28 cs.CV cs.LG 新提交 57%

Breaking the Synthetic-Real Domain Shortcut for Training-Free Generative Replay-based Class Incremental Learning

打破合成-真实域捷径用于无训练生成重放的类增量学习

Tao Zhang, Qixuan Fan, Yiyuan Liang, Yanjie Wang, Song Yan, Tian Tian, Jiahuan Zhou, Luxin Yan, Sheng Zhong, Xu Zou

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究类增量学习中合成旧数据与真实新数据混合导致性能下降的问题,提出DREAM模型,利用无训练生成器合成旧数据,通过子空间校正、正交投影及真实锚定原型正则化消除域捷径并加强语义对齐,取得最优性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18036 2026-07-27 cs.CR cs.CV 版本更新 57%

NWaaS: A Non-Intrusive and Privacy-Preserving Watermarking-as-a-Service System with Adaptive Resource Scheduling

NWaaS:一种具有自适应资源调度的非侵入性和隐私保护水印即服务系统

Haonan An, Qianyao Ren, Guang Hua, Tao Li, Yu Guo, Yanan Ma, Hangcheng Cao, Yuguang Fang

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对机器学习即服务中保护知识产权的挑战,提出NWaaS框架。核心方法包括$\mathtt{ShadowMark}$算法、协作分区机制和比例差异联合调度算法。贡献是能在多样模态中提供强大所有权验证,保障隐私并提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12042 2026-07-15 cs.CV cs.LG 新提交 57%

SymbOmni: Evolving Agentic Omni Models via Symbolic Concept Learning

SymbOmni:通过符号概念学习进化智能全能模型

Jinxiu Liu, Jianru Li, Tanqing Kuang, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * South China University of Technology(华南理工大学) Westlake University(西湖大学) Johns Hopkins University(约翰·霍普金斯大学) The Chinese University of Hong Kong(香港中文大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 针对视觉生成模型无法累积学习与自主进化的问题,提出SymbOmni智能全能模型,通过符号概念学习和归纳-转导循环运行,经言语反向传播训练。实验验证其在多方面性能优越,能有效降低令牌消耗并实现持续学习。

Comments ECCV 2026 (49 pages, 10 figures, project page: https://spherelab.ai/symbomni)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11199 2026-07-14 cs.CV 新提交 57%

DynEval: Holistic Evaluations of T2I Generative Models in the Wild

DynEval:对自然环境下的文本到图像生成模型进行全面评估

Shyam Marjit, Dheeraj Baiju, Anuj Shikarkhane, Akhil Sakthieswaran, Sayak Paul, Anirban Chakraborty

机构 * Indian Institute of Science(印度科学研究所) Hugging Face(拥抱脸)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究针对文本到图像生成模型评估难题,提出DynEval动态评估框架,通过构建两个数据集,利用课程学习策略微调评估器,在多基准测试中与人类判断相关性更高,可对多个T2I模型进行细粒度分析。

Comments Accepted at ECCV 2026. Project page: https://vcl-iisc.github.io/dyneval/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新 57%

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08515 2026-07-10 cs.CV 新提交 57%

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

超越轮椅和眼罩:使用INCLUDE - BENCH研究文本到图像模型中的残疾刻板印象

Sophia Lichtenberg, Albert Gatt, Judith Masthoff

机构 * Utrecht University(乌得勒支大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像模型中的残疾刻板印象,引入INCLUDE - BENCH基准,涵盖多维度偏见提示设计的大量图像,评估多个模型,揭示模型在残疾相关表现上的问题,如轮椅描绘占比高、多样性少等,并引入SCM分数反映刻板关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22545 2026-07-07 cs.CV cs.AI 版本更新 57%

SFL-Net: Source-Factorized Latent Representation Learning for Multi-Contrast MRI to Tau-PET Synthesis

基于部分信息分解指导的解耦量化半UNet的多模态T1加权和FLAIR MRI生成可解释的tau-PET

Agamdeep S. Chopra, Caitlin Neher, Tianyi Ren, Juampablo E. Heras Rivera, Hesamoddin Jahanian, Mehmet Kurt

机构 * Department of Mechanical Engineering, University of Washington(华盛顿大学机械工程系) Department of Radiology, University of Washington(华盛顿大学放射学系)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本文提出一种可解释的多模态图像合成框架,通过部分信息分解指导的解耦量化半UNet生成tau-PET,结合向量量化编码器和半UNet解码器,实现了在ADNI-3和OASIS-3数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.03650 2026-07-02 cs.CV cs.LG 版本更新 57%

Generated Contents Enrichment

生成内容丰富化

Mahdi Naseri, Jiayan Qiu, Zhou Wang

机构 * University of Waterloo(滑铁卢大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出生成内容丰富化任务,通过显式场景表示丰富稀疏场景描述,再用对抗框架生成语义更丰富、结构连贯的图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26930 2026-06-26 cs.CV 新提交 57%

PortraitGen: Exemplar-Driven GRPO with Dual-Reward Guidance for Photorealistic Portrait Generation

PortraitGen: 基于示例驱动的双奖励引导GRPO的逼真肖像生成

Xiaomin Li, Qian Liang, Yinan Li, Ying Zhang, Chen Li, Jing Lyu, Huchuan Lu, Xu Jia

机构 * Dalian University of Technology(大连理工大学) University of Electronic Science and Technology of China(电子科技大学) Zhejiang University(浙江大学) WeChat, Tencent Inc.(腾讯微信)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出PortraitGen框架,通过将真实图像引入GRPO采样组并设计双奖励机制(OmniReward和AI-Portrait),有效抑制AI伪影,实现逼真肖像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24484 2026-06-24 cs.CV 新提交 57%

Advancing WordArt-Oriented Scene Text Recognition: Datasets and Methods

推进面向艺术字的场景文本识别:数据集与方法

Xingsong Ye, Yongkun Du, Jiaxin Zhang, Haojie Zhang, Chong Sun, Chen Li, Jing Lyu, Zhineng Chen

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Key Laboratory of Multimodal Embodied AI, Fudan University(复旦大学上海市多模态具身人工智能重点实验室) WeChat Vision, Tencent Inc.(腾讯微信视觉团队) South China University of Technology(华南理工大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 针对艺术字场景文本识别(WATER)的挑战,构建了百万级合成数据集WATER-S,并提出支持任意形状输入和自回归解码的WATERec模型,在WordArt-Bench上达到90.40%准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00032 2026-06-23 cs.CY cs.AI cs.CV 版本更新 57%

Happy Young Women, Grumpy Old Men? Emotion-Driven Demographic Biases in Synthetic Face Generation

快乐年轻女性,暴躁老年男性?合成人脸生成中情绪驱动的人口统计偏见

Mengting Wei, Aditya Gulati, Guoying Zhao, Nuria Oliver

机构 * University of Oulu(奥卢大学) ELLIS Alicante(阿利坎特ELLIS)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究系统审计了文本到图像模型在情绪提示下生成人脸的人口统计偏见,发现模型过度代表年轻面孔和白人特征,负面情绪提示加剧了特定群体的缺失,并降低了感知吸引力。

Comments 39 pages, 16 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.10705 2026-06-23 eess.IV cs.CV 版本更新 57%

3D Vessel Reconstruction from Sparse-View Dynamic DSA Images via Vessel Probability Guided Attenuation Learning

基于血管概率引导衰减学习的稀疏视角动态DSA图像三维血管重建

Zhentao Liu, Huangxuan Zhao, Wenhui Qin, Zhenghong Zhou, Xinggang Wang, Wenping Wang, Xiaochun Lai, Chuansheng Zheng, Dinggang Shen, Zhiming Cui

机构 * School of Biomedical Engineering \& State Key Laboratory of Advanced Medical Materials Devices, ShanghaiTech University, Shanghai, China National Engineering Research Center for Multimedia Software, School of Computer Science, Wuhan University, Wuhan, China School of Electronic Information Communications, Huazhong University of Science Department of Computer Science \& Engineering, Texas A\&M University, USA

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出血管概率引导衰减学习框架,通过静态与动态衰减场互补加权实现稀疏视角DSA重建,降低辐射剂量,并采用渐进训练和时间扰动损失提升质量。

Comments Accepted by Medical Image Analysis (MedIA), 2026; code: https://github.com/ShanghaiTech-IMPACT/VPAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00222 2026-06-16 cs.RO cs.AI cs.CV 版本更新 57%

MapDream: Task-Driven Map Learning for Vision-Language Navigation

MapDream: 面向视觉-语言导航的任务驱动地图学习

Guoxin Lian, Shuo Wang, Yucheng Wang, Yongcai Wang, Maiyue Chen, Kaihui Wang, Bo Zhang, Zhizhong Su, Deying Li, Zhaoxin Fan

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MapDream框架,通过自回归鸟瞰图生成联合学习地图与动作预测,在R2R-CE和RxR-CE上达到单目最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14297 2026-06-15 cs.CV cs.AI 新提交 57%

Pix2Pix-Hybrid: Structure-Guided Conditional Synthesis of Hajj Crowd Images with Multi-Channel Conditioning and Weak Attribute Supervision

Pix2Pix-Hybrid: 结构引导的多通道条件与弱属性监督的朝觐人群图像条件合成

Amirah F. Alshammari, Bander A. Alzahrani, Nahed A. Alowidi

机构 * King Abdulaziz University(阿卜杜勒阿齐兹国王大学) Jouf University(焦夫大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出Pix2Pix-Hybrid条件GAN,通过多通道结构线索和上下文属性条件合成朝觐人群图像,用于数据增强,在减少人工标注的同时提升合成质量,并验证了合成数据对人群计数模型的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 57%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15947 2026-06-15 eess.IV cs.CV 版本更新 57%

MCR-VQGAN: A Scalable and Cost-Effective Tau PET Synthesis Approach for Alzheimer's Disease Imaging

MCR-VQGAN:一种用于阿尔茨海默病成像的可扩展且经济高效的Tau PET合成方法

Jin Young Kim, Jeremy Hudson, Jeongchul Kim, Qing Lyu, Christopher T. Whitlow

机构 * Department of Biomedical Engineering, Wake Forest University School of Medicine(生物医学工程系,威克森林大学医学院) Department of Radiology, Wake Forest School of Medicine(放射学系,威克森林医学院) Department of Radiology and Biomedical Imaging, Yale School of Medicine(放射学与生物医学成像系,耶鲁医学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出MCR-VQGAN模型,通过多尺度卷积、ResNet块和CBAM模块改进VQGAN,从T1加权MRI合成高保真tau PET图像,在ADNI数据集上优于cGAN等方法,且合成图像保留诊断特征,区域SUVR等效分析显示与真实图像高度一致。

Comments Accepted for publication in IEEE Access. 14 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13341 2026-06-12 cs.CV cs.AI physics.med-ph 新提交 57%

Dual-Domain Equivariant Generative Adversarial Network for Multimodal CT-PET Synthesis

双域等变生成对抗网络用于多模态CT-PET合成

Gabriel Steele, Alzahra Altalib, Alessandro Perelli

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出双域等变生成对抗网络(DDE-GAN),联合空间与频域学习并融入旋转等变性,实现高保真多模态CT-PET图像合成。

Comments 4 pages, 3 figures, 1 table, 2026 IEEE 23rd International Symposium on Biomedical Imaging (ISBI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08421 2026-06-09 cs.CV 新提交 57%

Segmentation-Assisted Brain MRI Synthesis with Cross-Image Multi-Contrast Feature Memory Bank Retrieval Augmentation

基于跨图像多对比度特征记忆库检索增强的分割辅助脑MRI合成

Wenwei Huang, Jia Wei, Jianlong Zhou

机构 * South China University of Technology(华南理工大学) University of Technology Sydney(悉尼科技大学)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出分割辅助的闭环生成对抗框架,通过辅助分割分支和双库检索增强策略,提高多对比度脑MRI中肿瘤区域的合成保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07613 2026-06-09 cs.CV cs.AI 新提交 57%

Can You Trust What You See? Human and AI Detection of Synthetic Legal Evidence

你能相信你所见的吗?人类与AI对合成法律证据的检测

Jinzhe Tan, Ali Ekber Cinar, Karim Benyekhlef

机构 * Faculty of Law, McGill University(麦吉尔大学法学院)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究人类和前沿多模态大模型在民事纠纷场景中区分真实照片与AI生成图像的能力,发现两者均不可靠,提出结合人工审查、MLLM筛查和来源认证的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04498 2026-06-09 cs.LG cs.CV 版本更新 57%

IGenBench: Benchmarking the Reliability of Text-to-Infographic Generation

IGenBench:文本到信息图生成可靠性基准测试

Yinghao Tang, Xueding Liu, Boyuan Zhang, Tingfeng Lan, Yupeng Xie, Jiale Lao, Yiyao Wang, Haoxuan Li, Tingting Gao, Bo Pan, Luoxuan Weng, Xiuqi Huang, Minfeng Zhu, Yingchaojie Feng, Yuyu Luo, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) UESTC University of Virginia(弗吉尼亚大学) HKUST(GZ)(香港科技大学(广州)) Cornell University(康奈尔大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出IGENBENCH基准,包含30种信息图类型和600个测试用例,通过多模态大语言模型分解为10类原子问题评估10种T2I模型,发现数据完整性等维度是普遍瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06828 2026-06-08 cs.CV cs.LG 新提交 57%

AdaGRPO: A Capability-Aware Adaptive Enhancement for Flow-based GRPO

AdaGRPO: 一种面向基于流的GRPO的能力感知自适应增强方法

Jiazi Bu, Pengyang Ling, Yujie Zhou, Yibin Wang, Yuhang Zang, Tianyi Wei, Xiaohang Zhan, Jiaqi Wang, Tong Wu, Xingang Pan, Dahua Lin

机构 * Shanghai Jiao Tong University(上海交通大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Stanford University(斯坦福大学) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) CPII under InnoHK(InnoHK下的CPII) Adobe Research(Adobe研究)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出AdaGRPO,通过在线课程过滤策略和跨层级优势融合,解决流模型GRPO中提示选择随机和优势估计缺乏全局视角的问题,提升训练稳定性和性能。

Comments Project Website: https://bujiazi.github.io/adagrpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05949 2026-06-08 cs.CV 版本更新 57%

Faithful, Enriched, and Precise: Benchmarking Natural-Science Illustration Generation by T2I models

忠实、丰富且精确:T2I模型在自然科学插图生成中的基准测试

Yifan Chang, Jiaxin Ai, Jianwen Sun, Yuandong Pu, Siqi Luo, Liangliang Zhao, Yuchen Ren, Minghao Liu, Yunfei Yu, Yu Qiao, Kaipeng Zhang, Yihao Liu

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Wuhan University(武汉大学) Nankai University(南开大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) ZODA Alaya Studio(Alaya工作室)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出FEPBench基准,通过细粒度原子集标注和三维评估(指令忠实性、推理丰富性、语义精确性)系统评估T2I模型在自然科学插图生成中的表现,发现即使最先进的闭源模型仍存在文本渲染瓶颈、推理丰富性有限以及生成丰富性与精确性难以平衡的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05491 2026-06-05 cs.CV cs.RO 57%

Unpaired RGB-Thermal Gaussian-Splatting Using Visual Geometric Transformers

无配对RGB-热成像高斯泼溅使用视觉几何变换器

Jean Cordonnier, Chenghao Xu, Olga Fink, Malcolm Mielle

机构 * Ecole Polytechnique Federale de Lausanne(瑞士联邦理工学院洛桑分校) Schindler EPFL Lab(施耐德EPFL实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出一种无配对RGB-热成像新视角合成框架,利用VGGT估计各模态相机位姿并通过Procrustes对齐,结合多模态3D高斯泼溅实现联合重建,在保持RGB保真度的同时实现热成像视图合成。

Comments Accepted at ICRA 2026's Workshop MM-SpatialAI: Multi-Modal Spatial AI for Robust Navigation and Open-World Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04479 2026-06-04 cs.CV cs.AI cs.CL 57%

Evaluating Reasoning Fidelity in Visual Text Generation

评估视觉文本生成中的推理保真度

Jiajun Hong, Jiawei Zhou

机构 * Stony Brook University(石桥大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 通过长文本渲染、事实知识探测、上下文理解和多步推理等任务,评估当前文本到图像模型在视觉文本生成中是否忠实保持推理能力,发现其常产生语义错误和逻辑不一致,与纯文本模型存在显著差距。

Comments Peer reviewed and accepted at CVPR 2026 at the GRAIL-V (Grounded Retrieval and Agentic Intelligence for Vision-Language) workshop (non-archival track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20807 2026-06-02 cs.CV cs.RO 57%

RU4D-SLAM: Reweighting Uncertainty in Gaussian Splatting SLAM for 4D Scene Reconstruction

RU4D-SLAM:面向4D场景重建的高斯溅射SLAM不确定性重加权

Yangfan Zhao, Hanwei Zhang, Ke Huang, Qiufeng Wang, Zhenzhou Shao, Dengyu Wu

机构 * Capital Normal University(首都师范大学) Saarland University(萨尔兰大学) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) King’s College London(伦敦国王学院)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 提出RU4D-SLAM框架,通过引入时间因子、不确定性感知和语义引导重加权机制,解决动态环境中3D高斯溅射SLAM的跟踪与4D场景重建问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24078 2026-06-02 cs.CV 57%

Beyond Objects: Contextual Synthetic Data Generation for Fine-Grained Classification

超越对象:面向细粒度分类的上下文合成数据生成

William Yang, Xindi Wu, Zhiwei Deng, Esin Tureci, Olga Russakovsky

机构 * Princeton University(普林斯顿大学) Google DeepMind(谷歌DeepMind)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 提出BOB微调策略,通过提取并条件化类不可知属性(如场景背景和物体姿态)来缓解过拟合,提升细粒度分类中合成训练数据的质量,在多个数据集上达到最优性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏