arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 1204 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 1204 篇

2603.29697 2026-04-01 cs.CV 57%

FED-Bench: A Cross-Granular Benchmark for Disentangled Evaluation of Facial Expression Editing

FED-Bench:一种跨粒度的面部表情编辑评估基准

Fengjian Xue, Xuecheng Wu, Heli Sun, Yunyun Shi, Shi Chen, Liangyu Fu, Jinheng Xie, Dingkang Yang, Hao Wang, Junxiao Xue, Liang He

机构 * Xi’an Jiaotong University(西安交通大学) Northwestern Polytechnical University(西北工业大学) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Zhejiang Lab(之江实验室)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出FED-Bench,通过构建747个三元组基准,引入FED-Score评估协议,评估面部表情编辑的对齐、保真度和相对表达增益,揭示当前方法在高保真与准确表达操控间的困境,并提供20k+真实世界面部训练集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17320 2026-04-01 cs.CV 57%

EMMA: Concept Erasure Benchmark with Comprehensive Semantic Metrics and Diverse Categories

EMMA:具有综合语义度量和多样类别的概念擦除基准

Lu Wei, Yuta Nakashima, Noa Garcia

机构 * The University of Osaka(大阪大学)

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 EMMA通过13项指标评估五种概念擦除方法,揭示其在隐含提示和视觉相似非目标概念下的鲁棒性问题,发现部分方法加剧性别和种族偏见。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28766 2026-03-31 cs.CV 57%

HandX: Scaling Bimanual Motion and Interaction Generation

HandX:扩展双臂运动和交互生成

Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Specs Inc.(Specs公司) Snap Inc.(Snap公司)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出HandX,通过整合数据、标注和评估,解决双臂运动生成中精细指节动态和协作的不足,验证了大模型在生成高质量双臂运动中的有效性。

Comments CVPR 2026. Project Page: https://handx-project.github.io. Code: https://github.com/handx-project/HandX

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 57%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26794 2026-03-31 cs.CV 57%

The Quest for Generalizable Motion Generation: Data, Model, and Evaluation

可泛化动作生成的探索:数据、模型与评估

Jing Lin, Ruisi Wang, Junzhe Lu, Ziqi Huang, Guorui Song, Ailing Zeng, Xian Liu, Chen Wei, Wanqi Yin, Qingping Sun, Zhongang Cai, Lei Yang, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA Research(英伟达研究院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出一个综合框架,通过数据、建模和评估三大支柱将视频生成知识迁移至动作生成,引入大规模数据集和改进模型,提升动作生成的泛化能力。

Comments Homepage: https://motrixlab.github.io/2026_iclr_vimogen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22025 2026-03-30 cs.CV 57%

Olbedo: An Albedo and Shading Aerial Dataset for Large-Scale Outdoor Environments

Olbedo:一个用于大规模户外环境的反光与阴影数据集

Shuang Song, Debao Huang, Deyan Deng, Haolin Xiong, Yang Tang, Yajie Zhao, Rongjun Qin

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) Institute for Creative Technologies(创意技术研究所)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 Olbedo数据集通过多视角一致的反光和阴影地图等标注,使基于合成数据训练的扩散模型在真实户外场景中实现更优的内在图像分解性能,支持3D资产光照一致重映射和城市数字孪生分析。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25178 2026-03-27 cs.CV cs.CL 57%

Bilingual Text-to-Motion Generation: A New Benchmark and Baselines

双语文本到动作生成:一个新的基准和基线

Wanjiang Weng, Xiaofeng Tan, Xiangbo Shu, Guo-Sen Xie, Pan Zhou, Hongsong Wang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications (Southeast University), Ministry of Education(教育部新一代人工智能技术及其跨学科应用重点实验室(东南大学)) Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡管理大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出BiHumanML3D双语文本到动作基准及BiMD基线,通过跨语言对齐策略提升多语言动作生成质量,实验显示其在FID和R@3指标上显著优于单语模型和翻译基线。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23265 2026-03-27 cs.CV 57%

SPR-128K: A New Benchmark for Spatial Plausibility Reasoning with Multimodal Large Language Models

SPR-128K:一种多模态大语言模型空间合理性推理的新基准

Zhiyuan Hu, Zheng Sun, Yi Wei, Long Yu

机构 * Tsinghua University(清华大学) Alibaba Health Information Technology Limited(阿里巴巴健康信息技术有限公司)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出SPR-128K数据集及DPA-GRPO方法,解决图像筛选中多模态大语言模型空间推理能力不足的问题,实验表明小型模型在该任务上优于主流模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23883 2026-03-26 cs.CV 57%

BioVITA: Biological Dataset, Model, and Benchmark for Visual-Textual-Acoustic Alignment

BioVITA: 生物数据集、模型和基准用于视觉-文本-音频对齐

Risa Shinoda, Kaede Shiohara, Nakamasa Inoue, Kuniaki Saito, Hiroaki Santo, Fumio Okura

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究所) OMRON SINIC X

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出BioVITA框架,通过大规模数据集、模型和跨模态检索基准,实现生物物种的多模态对齐,提升生物多样性理解。

Comments CVPR 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21937 2026-03-24 cs.CV 57%

MultiBind: A Benchmark for Attribute Misbinding in Multi-Subject Generation

MultiBind:多主体生成中属性误绑定的基准测试

Wenqing Tian, Hanyi Mao, Zhaocheng Liu, Lihua Zhang, Qiang Liu, Jian Wu, Liang Wang

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别新实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The University of Chicago(芝加哥大学) ByteDance(字节跳动)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出MultiBind基准,用于评估多主体生成中属性误绑定问题,通过实体索引提示和混淆评估协议识别跨主体干扰模式,揭示传统指标无法检测的绑定失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20289 2026-03-24 cs.CV 57%

Remote Sensing Image Dehazing: A Systematic Review of Progress, Challenges, and Prospects

遥感图像去雾:进展、挑战与前景的系统综述

Heng Zhou, Xiaoxiong Liu, Zhenxi Zhang, Jieheng Yun, Chengyang Li, Yunchu Yang, Dongyi Xia, Chunna Tian, Xiao-Jun Wu

机构 * School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Josef Kittler Research Institute on Artificial Intelligence(乔塞夫·基特勒人工智能研究所) School of Electronic Engineering(电子工程学院) College of Artificial Intelligence(人工智能学院) Aerospace Information Research Institute(航天信息研究所) Department of Computer Science(计算机科学系)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文系统综述了遥感图像去雾的研究进展、挑战与前景,总结了超过30种方法,分析了不同模型在性能上的差异,并提出了未来研究方向。

Comments 82 pages, 23 figures,

Journal ref ISPRS P&RS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15085 2026-03-24 cs.CV 57%

OCRGenBench: A Comprehensive Benchmark for Evaluating OCR Generative Capabilities

OCRGenBench: 一个全面的评估OCR生成能力的基准

Peirong Zhang, Haowei Xu, Jiaxin Zhang, Xuhan Zheng, Guitao Xu, Yuyi Zhang, Junle Liu, Zhenhua Yang, Wei Zhou, Lianwen Jin

机构 * South China University of Technology(南方科技大学) Cardiff University(卡迪夫大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出OCRGenBench,通过整合文本中心的T2I生成、文本编辑和OCR相关的图像到图像翻译任务,全面评估模型的视觉文本综合能力,揭示现有模型在文本定位、内容修改和密集文本处理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11431 2026-03-20 cs.CV 57%

Remove360: Benchmarking Residuals After Object Removal in 3D Gaussian Splatting

Remove360: 3D高斯散射中物体移除后残差的基准测试

Simona Kocour, Assia Benbihi, Torsten Sattler

机构 * CTU in Prague, Czech Republic(布拉格CTU,捷克共和国)

专题命中 图像生成评测 :inpainting(abstract);分类 cs.CV

AI总结 本文提出Remove360数据集和评估框架,用于量化3D高斯散射中物体移除后的语义残差,揭示几何移除与语义擦除之间的差距,强调隐私保护移除方法的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17476 2026-03-19 cs.CV cs.AI cs.CL 57%

UniSAFE: A Comprehensive Benchmark for Safety Evaluation of Unified Multimodal Models

UniSAFE:统一多模态模型安全评估的综合基准

Segyu Lee, Boryeong Cho, Hojung Jung, Seokhyun An, Juhyeong Kim, Jaehyun Kwak, Yongjin Yang, Sangwon Jang, Youngrok Park, Wonjun Chang, Se-Young Yun

机构 * KAIST AI(KAIST人工智能研究院) Department of Computer Science and Engineering, UNIST(UNIST计算机科学与工程系) Department of Mathematical Sciences, KAIST(KAIST数学科学系) University of Toronto(多伦多大学) KAIST CS(KAIST计算机科学系)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出UniSAFE基准,用于评估统一多模态模型的系统级安全性,发现多图像生成任务比文本生成任务更易出现安全漏洞。

Comments Equal contribution by first three authors, 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16958 2026-03-19 cs.CV cs.AI 57%

PhysQuantAgent: An Inference Pipeline of Mass Estimation for Vision-Language Models

PhysQuantAgent: 一种用于视觉-语言模型的物体质量估计推断流水线

Hisayuki Yokomizo, Taiki Miyanishi, Yan Gang, Shuhei Kurita, Nakamasa Inoue, Yusuke Iwasawa

机构 * The University of Tokyo(东京大学) Institute of Science Tokyo(东京科学研究院) National Institute of Informatics(信息处理技术研究所)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 本文提出PhysQuantAgent框架和VisPhysQuant基准数据集,通过引入三种视觉提示方法提升视觉-语言模型对真实物体质量的估计精度。

Comments Code and dataset will be available at https://github.com/hisasnow/PhysQuantAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13228 2026-03-17 cs.LG cs.AI cs.CV cs.RO 57%

PhysMoDPO: Physically-Plausible Humanoid Motion with Preference Optimization

PhysMoDPO:基于物理的类人运动与偏好优化

Yangsong Zhang, Anujith Muraleedharan, Rikhat Akizhanov, Abdul Ahad Butt, Gül Varol, Pascal Fua, Fabio Pizzati, Ivan Laptev

机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) LIGM, École des Ponts, IP Paris, Univ Gustave Eiffel, CNRS(LIGM,巴黎理工学院,IP巴黎,古斯塔夫·埃菲尔大学,国家科学研究中心) École polytechnique fédérale de Lausanne (EPFL)(洛桑联邦理工学院)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 PhysMoDPO通过整合完整身体控制器和偏好优化框架,提升生成运动在物理真实性和任务性能上的表现,适用于文本到运动和空间控制任务。

Comments Project page: https://mael-zys.github.io/PhysMoDPO/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13507 2026-03-17 cs.CV 57%

MIRAGE: Model-agnostic Industrial Realistic Anomaly Generation and Evaluation for Visual Anomaly Detection

MIRAGE:模型无关的工业真实异常生成与评估用于视觉异常检测

Jinwei Hu, Francesco Borsatti, Arianna Stropeni, Davide Dalle Pezze, Manuel Barusco, Gian Antonio Susto

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 MIRAGE提出了一种无需训练和真实异常数据的自动化流程,通过API调用生成模型生成真实异常图像并生成像素级掩码,结合CLIP质量过滤器和轻量级双分支语义变化检测模块,评估生成图像的质量和异常分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11846 2026-03-13 cs.CV 57%

ZeroSense:How Vision matters in Long Context Compression

ZeroSense:视觉在长上下文压缩中的作用

Yonghan Gao, Zehong Chen, Lijian Xu, Jingzhi Chen, Jingwei Guan, Xingyu Zeng

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出ZeroSense框架,通过解耦多模态大语言模型能力,评估视觉-文本压缩质量,并通过低语义相关性基准测试验证长上下文压缩效果与下游任务准确性之间的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11089 2026-03-13 cs.SD cs.MM eess.AS 57%

V2A-DPO: Omni-Preference Optimization for Video-to-Audio Generation

V2A-DPO:面向视频到音频生成的多偏好优化

Nolan Chan, Timmy Gang, Yongqian Wang, Yuzhe Liang, Dingdong Wang

专题命中 图像生成评测 :diffusion(abstract);分类 cs.MM

AI总结 V2A-DPO通过多偏好优化提升视频到音频生成的质量,结合AudioScore评分系统和课程学习策略,在VGGSound数据集上实现了优于DDPO和预训练基线的性能。

Comments Accepted at ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10990 2026-03-12 cs.CV 57%

Too Vivid to Be Real? Benchmarking and Calibrating Generative Color Fidelity

过于生动以至于不真实?生成式颜色真实性的基准测试与校准

Zhengyao Fang, Zexi Jia, Yijia Zhong, Pengcheng Luo, Jinchao Zhang, Guangming Lu, Jun Yu, Wenjie Pei

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 本文提出颜色真实性数据集和度量标准,通过多模态编码器和自适应指导尺度提升生成图像的颜色真实性,构建了评估与改进的渐进框架。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10814 2026-03-12 cs.CV 57%

HanMoVLM: Large Vision-Language Models for Professional Artistic Painting Evaluation

HanMoVLM:用于专业艺术绘画评估的大型视觉-语言模型

Hongji Yang, Yucheng Zhou, Wencheng Han, Songlian Li, Xiaotong Zhao, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(SKL-IOTSC、CIS、澳门大学) CSE, Shandong University(山东大学计算机科学与工程学院) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 HanMoVLM通过引入HanMo-Bench数据集和链式推理机制,实现专业艺术绘画评估,提升中国绘画生成质量。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.04796 2026-03-12 cs.CV 57%

In Pursuit of Many: A Review of Modern Multiple Object Tracking Systems

追寻众多:现代多目标跟踪系统的综述

Mk Bashar, Samia Islam, Kashifa Kawaakib Hussain, Md. Bakhtiar Hasan, A. B. M. Ashikur Rahman, Md. Hasanul Kabir

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了现代多目标跟踪系统的发展,涵盖从基于检测到端到端设计的演变,以及基于变压器、生成模型等架构的最新进展,并探讨了基准趋势和实际部署中的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01433 2026-03-11 cs.CV 57%

DOCFORGE-BENCH: A Comprehensive 0-shot Benchmark for Document Forgery Detection and Analysis

DOCFORGE-BENCH:一个全面的零样本文档伪造检测与分析基准

Zengqi Zhao, Weidi Xia, En Wei, Yan Zhang, Jane Mo, Tiannan Zhang, Yuanqin Dai, Zexi Chen, Yiran Tao, Simiao Ren

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Irvine(加州大学尔湾分校) Washington University in St. Louis(圣路易斯华盛顿大学) Duke University(杜克大学) University of California, Davis(加州大学戴维斯分校) New York University(纽约大学) Georgetown University(乔治城大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 DOCFORGE-BENCH提出首个零样本文档伪造检测基准,揭示校准失败问题,强调阈值适应对实际部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.16990 2026-03-10 cs.CV 57%

Single Image, Any Face: Generalisable 3D Face Generation

单张图像,任意人脸:可泛化的3D人脸生成

Wenqing Wang, Haosen Yang, Josef Kittler, Xiatian Zhu

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Gen3D-Face模型,通过单张无约束图像生成逼真的3D人脸,解决了现有方法在泛化能力上的不足,并在跨域和域内设置中均取得优异表现。

Comments Accepted by Pattern Recognition, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17881 2026-03-10 cs.CV 57%

Deepfake Generation and Detection: A Benchmark and Survey

深度伪造生成与检测:基准与综述

Gan Pei, Jiangning Zhang, Menghan Hu, Zhenyu Zhang, Chengjie Wang, Yunsheng Wu, Guangtao Zhai, Jian Yang, Dacheng Tao

机构 * East China Normal University(华东师范大学) Zhejiang University(浙江大学) Nanjing University(南京大学) Youtu Lab, Tencent(腾讯优图实验室) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 本文综述了深度伪造生成与检测的最新进展,分析了相关技术、数据集及未来研究方向。

Comments This paper has been accepted by ACM Computing Surveys. We closely follow the latest developments in this \href{https://github.com/flyingby/Awesome-Deepfake-Generation-and-Detection}{project}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 57%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02619 2026-03-04 cs.CV 57%

Direct Reward Fine-Tuning on Poses for Single Image to 3D Human in the Wild

基于姿态的直接奖励微调用于单图像到野外3D人体

Seunguk Do, Minwoo Huh, Joonghyuk Shin, Jaesik Park

机构 * Seoul National University(首尔国立大学)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 DrPose通过直接奖励微调提升单图像到3D人体重建的姿态一致性,利用姿态与图像配对数据训练,改进多视图扩散模型,提升动态和复杂姿态的重建质量。

Comments ICLR 2026, Project webpage: https://seunguk-do.github.io/drpose

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01163 2026-03-03 cs.CV 57%

BeautyGRPO: Aesthetic Alignment for Face Retouching via Dynamic Path Guidance and Fine-Grained Preference Modeling

BeautyGRPO: 通过动态路径引导和细粒度偏好建模实现面部修饰的美观对齐

Jiachen Yang, Xianhui Lin, Yi Dong, Zebiao Zheng, Xing Liu, Hong Gu, Yanmei Fang

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学计算机科学与技术学院,深圳校区) vivo BlueImage Lab, vivo Mobile Communication Co., Ltd., China(vivo蓝影实验室,vivo移动通信有限公司)

专题命中 图像生成评测 :image editing(abstract);分类 cs.CV

AI总结 BeautyGRPO通过动态路径引导和细粒度偏好建模,解决面部修饰中保真度与审美偏好对齐的难题,实现更高质量的图像编辑效果。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05606 2026-03-03 cs.CV cs.CL 57%

Uni-cot: Towards Unified Chain-of-Thought Reasoning Across Text and Vision

Uni-cot: 向跨文本和视觉的统一链式推理迈进

Luozheng Qin, Jia Gong, Yuqing Sun, Tianjiao Li, Mengping Yang, Xiaomeng Yang, Chao Qu, Zhiyu Tan, Hao Li

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 图像生成评测 :image generation(abstract);分类 cs.CV

AI总结 Uni-CoT通过统一的链式推理框架实现跨文本和视觉的连贯多模态推理,采用宏级和微级推理范式,提升多模态推理的效率和性能。

Comments Accepted by ICLR 2026, Project Page: https://sais-fuxi.github.io/projects/uni-cot/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00825 2026-03-03 cs.CV 57%

COMBAT: Conditional World Models for Behavioral Agent Training

COMBAT:基于行为代理训练的条件世界模型

Anmol Agarwal, Pranay Meshram, Sumer Singh, Saurav Suman, Andrew Lapp, Shahbuland Matiana, Louis Castricato, Spencer Frazier

机构 * Overworld AI Indian Institute of Science Education and Research Bhopal(印度科学教育与研究学院博帕尔分校)

专题命中 图像生成评测 :diffusion(abstract);分类 cs.CV

AI总结 COMBAT通过在Tekken 3中训练实时动作控制的世界模型,利用扩散模型模拟动态对手,实现对玩家行为的响应性训练。

详情

展开后加载摘要…

URL PDF HTML 收藏