arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2312.13771 2026-07-07 cs.CV 版本更新 57%

AppAgent: Multimodal Agents as Smartphone Users

AppAgent:作为智能手机用户的多模态智能体

Chi Zhang, Zhao Yang, Jiaxuan Liu, Yanda Li, Yucheng Han, Xin Chen, Zebiao Huang, Bin Fu, Gang Yu

机构 * Tencent(腾讯)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 介绍基于大语言模型的多模态智能体框架,通过简化动作空间操作智能手机应用,无需系统后端访问,经自主探索或观察人类示范学习,能执行复杂任务,测试验证其处理多种高级任务的能力。

Comments Accepted to CHI 2025, project page is https://appagent-official.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05778 2026-07-03 cs.CV 版本更新 57%

Beyond Absolute Scores: Relative Edit-induced Difference for Generalizable Image Aesthetic Assessment

超越绝对分数:基于编辑诱导差异的通用图像美学评估

Qifei Jia, Xintong Yao, Yasen Zhang, Minghao Li, Yajie Chai, Qiming Lu, Baoyue Shen, Runyu Shi, Ying Huang, Yue Zhang

机构 * Xiaomi Corporation, Beijing, China(小米公司,北京,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出RED-Aes框架,利用可控图像编辑模型模拟人类审美推理,通过相对编辑诱导差异学习通用美学原则,实现跨场景泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01521 2026-07-03 cs.CV 版本更新 57%

MiraGe: Editable 2D Images using Gaussian Splatting

MiraGe: 使用高斯溅射的可编辑2D图像

Joanna Waczyńska, Tomasz Szczepanik, Piotr Borycki, Sławomir Tadeja, Thomas Bohné, Przemysław Spurek

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MiraGe方法,利用镜面反射在3D空间中感知2D图像,并通过平面控制的高斯函数实现精确编辑,提升渲染质量并支持物理仿真修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18765 2026-07-02 cs.CV cs.AI 版本更新 57%

NI-Tex: Non-isometric Image-based Garment Texture Generation

NI-Tex: 基于非等距图像的服装纹理生成

Hui Shan, Ming Li, Haitao Yang, Kai Zheng, Sizhe Zheng, Yanwei Fu, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Fudan University(复旦大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对非等距图像与3D服装网格间的纹理生成问题,提出结合物理模拟数据集、非等距图像编辑和迭代烘焙的框架,生成高质量PBR纹理。

Comments Accepted to CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16711 2026-07-02 cs.CV eess.IV 57%

Motion Transfer-Enhanced StyleGAN for Generating Diverse Macaque Facial Expressions

增强型运动转移StyleGAN用于生成多样化猕猴面部表情

Takuya Igaue, Catia Correia-Caeiro, Akito Yoshida, Takako Miyabe-Nishiwaki, Ryusuke Hayashi

机构 * Human Informatics Research Institute, National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究所(AIST)人类信息学研究所) Graduate School of Engineering, The University of Tokyo(东京大学工学研究科) Human Biology & Primate Cognition, Institute of Biology, Leipzig University(莱比锡大学生物研究所人类生物学与灵长类认知) Araya Inc.(Araya公司) Center for the Evolutionary Origins of Human Behavior (EHuB), Kyoto University(京都大学人类行为进化起源中心(EHuB))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出利用StyleGAN2生成猕猴面部表情,通过运动转移增强数据,改进训练集多样性与精度,实现更丰富的表情生成。

Journal ref IEEE Access, vol. 14, pp. 95120-95136, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31637 2026-07-01 cs.GR cs.AI 新提交 57%

Intrinsic decomposition and editing of 3D Gaussian splats

3D高斯散点的本征分解与编辑

Alexandre Lanvin, Jeffrey Hu, Simon Lucas, Adrien Bousseau, George Drettakis

机构 * Inria, Université Côte d’Azur(法国国家信息与自动化研究所,蔚蓝海岸大学) Cambridge University(剑桥大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.GR

AI总结 提出将本征分解扩展到高斯散点辐射场的方法,通过独立高斯基元、数据驱动优化和单图纹理编辑实现场景的材质与光照分离及编辑。

Comments 18 pages

Journal ref Proc. ACM Comput. Graph. Interact. Tech. 9, 1, Article 10 (May 2026), 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 57%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28724 2026-06-30 cs.CV cs.AI 57%

CCRC: A Change-Aware Captioning and Reasoning Chain for Image Change Captioning and Segmentation

CCRC:面向图像变化描述与分割的变化感知描述与推理链

Jinhong Hu, Xiaoping Wang, Shuyin Huang, Guojin Zhong, Kaitai Liu, Kai Lu

机构 * College of Computer Science and Electronic Engineering, Hunan University, China(湖南大学计算机科学与电子工程学院,中国) Guangxi Minzu University, China(广西民族大学,中国) National University of Defense Technology, China(国防科学技术大学,中国)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出变化感知描述与推理链(CCRC),通过双链框架解耦语义推理与空间分割,实现图像变化描述与分割(ICCS)任务,在合成和真实基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13082 2026-06-30 cs.CV cs.RO eess.IV 57%

InterEdit: Navigating Text-Guided 3D Dyadic Human Motion Editing

InterEdit:文本引导的3D双人运动编辑

Yebin Yang, Di Wen, Lei Qi, Weitong Kong, Junwei Zheng, Ruiping Liu, Yufan Chen, Chengzhi Wu, Kailun Yang, Yuqian Fu, Danda Pani Paudel, Luc Van Gool, Kunyu Peng

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) KAUST(韩国国立大学) INSAIT

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出InterEdit3D数据集和TMME基准,基于文本引导的双人3D运动编辑方法,通过语义感知计划令牌对齐和交互感知频率令牌对齐策略提升编辑一致性与保真度。

Comments Accepted to ECCV 2026. The dataset and code will be released at https://github.com/YNG916/InterEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03143 2026-06-30 cs.CV cs.AI 57%

Edit in 2D, Verify in 3D: Reinforcement Learning for Multi-view Consistent Scene Editing

二维编辑,三维验证:强化学习用于多视角一致场景编辑

Jiyuan Wang, Chunyu Lin, Lei Sun, Zhi Cao, Yuyang Yin, Lang Nie, Zhenlong Yuan, Xiangxiang Chu, Yunchao Wei, Kang Liao, Guosheng Lin

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出RL3DEdit框架,利用强化学习优化多视角一致的3D场景编辑,通过VGGT模型生成的置信度图和姿态误差作为奖励信号,提升编辑质量与效率。

Comments Accepted by ECCV 2026, 32 pages, 10 figures, with Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04349 2026-06-26 cs.CV cs.AI 版本更新 57%

VecSet-Edit: Unleashing Pre-trained LRM for Mesh Editing from Single Image

VecSet-Edit:利用预训练的LRM进行单图像网格编辑

Teng-Fang Hsiao, Bo-Kai Ruan, Yu-Lun Liu, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 本文提出VecSet-Edit,利用VecSet LRM进行单图像网格编辑,通过Mask引导的token播种和注意力对齐的token门控策略,结合漂移感知的token修剪和细节保留的纹理烘焙模块,实现高精度网格编辑。

Comments Accepted by SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22042 2026-06-23 cs.CV 新提交 57%

IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance

IDAG-Edit: 基于实例解耦注意力和引导的多对象视频编辑

Yuan-Zhih Lin, Huu-Thang Nguyen, Huu-Phu Do, Hong-Han Shuai, Ching-Chun Huang

机构 * Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(台湾阳明交通大学计算机科学系)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 提出IDAG-Edit框架,通过布局引导注意力调制和实例级掩码实现无训练的多对象视频编辑,解决注意力泄露和身份漂移问题,提升时间一致性和多对象可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20709 2026-06-23 cs.CV 新提交 57%

TeleStyle V2: Beyond Content-Preserving Style Transfer with Self-Distillation and Distribution-Matching-Distillation

TeleStyle V2:超越内容保持风格迁移的自蒸馏与分布匹配蒸馏

Shiwen Zhang, Yifan Xu, Haibin Huang, Chi Zhang, Xuelong Li

机构 * TeleAI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出TeleStyle V2,通过自蒸馏数据合成和分布匹配蒸馏,支持四种内容-风格参考组合,解决内容一致性退化问题,性能与Qwen-Image-Edit和Gemini 3 Pro相当。

Comments https://github.com/Tele-AI/TeleStyleV2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20556 2026-06-19 cs.CV 新提交 57%

Thinking in Boxes: 3D Editing in Real Images Made Easy

Thinking in Boxes: 真实图像中的3D编辑变得简单

Pradhaan S Bhat, Naveen Chandra R, Rishubh Parihar, Vaibhav Vavilala, R. Venkatesh Babu, D. A. Forsyth, Anand Bhattad

机构 * Indian Institute of Science(印度科学研究所) Apple(苹果公司) UIUC(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出使用3D盒子作为结构化规范,通过用户提供输入和输出盒子来精确控制真实图像中的平移、旋转、缩放和视角变化,同时保持场景和物体身份,恢复未见的物体区域。

Comments Project Page: https://thinking-in-boxes.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21542 2026-06-19 cs.CV cs.AI 版本更新 57%

Bi-Anchor Interpolation Solver for Accelerating Generative Modeling

双锚点插值求解器加速生成建模

Hongxu Chen, Hongxiang Li, Zhen Wang, Long Chen

机构 * The Hong Kong University of Science(香港科学与技术大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BA-solver,通过轻量SideNet(1-2%主干大小)学习双向时间感知和双锚点速度积分,在不重新训练主干的情况下,以极低训练成本实现10步内达到100+步Euler求解器质量,支持即插即用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.14490 2026-06-16 cs.CV 57%

Making Images Real Again: A Comprehensive Survey on Deep Image Composition

让图像重现真实:深度图像合成的全面综述

Li Niu, Wenyan Cong, Liu Liu, Yan Hong, Bo Zhang, Jing Liang, Liqing Zhang

机构 * MOE Key Lab of Artificial Intelligence, Department of Computer Science and Engineering, Shanghai Jiao Tong University(教育部人工智能联合研究院,计算机科学与工程系,上海交通大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文综述了深度图像合成的子任务与综合任务,总结了现有方法、数据集及评估指标,并提供了首个图像合成工具箱libcom。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13558 2026-06-12 cs.CV cs.CL 新提交 57%

Edit the Bits, Diff the Codes: Bitwise Residual Editing for Visual Autoregressive Models

编辑比特,差异编码:面向视觉自回归模型的逐比特残差编辑

Shengqiang Zhang, Ruotong Liao, Volker Tresp, Barbara Plank, Hinrich Schütze

机构 * LMU Munich & Munich Center for Machine Learning (MCML)(慕尼黑大学 & 慕尼黑机器学习中心 (MCML))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BitResEdit,一种无需训练的视觉自回归图像编辑方法,通过比特级源负引导和残差编码注入,在保持背景的同时实现强文本对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07171 2026-06-08 cs.CV 新提交 57%

When Recovery Matters: The Blind Spot of Surrogate Privacy in MLLM Editing

当恢复至关重要时:MLLM编辑中替代隐私的盲点

Siyuan Xu, Yibing Liu, Peilin Chen, Yung-Hui LI, Shiqi Wang, Sam Kwong

机构 * City University of Hong Kong(香港城市大学) Hon Hai Research Institute(鸿海研究院) Lingnan University(岭南大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对多模态大模型编辑中的隐私风险,提出首个面向恢复的替代隐私保护编辑基准SPPE,涵盖36个细粒度隐私类别和65个编辑指令,并设计可编辑性评估与替代到源编辑恢复两个任务及对应方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05142 2026-06-04 cs.CV cs.AI 57%

GeM-NR: Geometry-Aware Multi-View Editing for Nonrigid Scene Changes

GeM-NR:面向非刚性场景变化的几何感知多视角编辑

Josef Bengtson, Yaroslava Lochman, Fredrik Kahl

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出GeM-NR,一种无需训练的快速灵活方法,通过深度图对齐、视角投影和条件细化实现多视角一致的通用非刚性图像编辑,支持几何和外观的显著变化。

Comments Project page: https://gem-nr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04880 2026-06-04 cs.CV 57%

MAOAM: Unified Object and Material Selection with Vision-Language Models

MAOAM: 基于视觉语言模型的统一对象与材质选择

Jaden Park, Valentin Deschaintre, Jason Kuen, Kangning Liu, Iliyan Georgiev, Krishna Kumar Singh, Yong Jae Lee, Michael Fischer

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出MAOAM框架,利用视觉语言模型和分割头,通过文本或点击交互实现对象和材质的精确选择,并设计数据生成流水线解决材质选择数据缺乏问题。

Comments Accepted to SIGGRAPH 2026 Conference. Project page: \href{https://jadenpark0.github.io/project_pages/maoam/}{here}

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06006 2026-06-04 cs.CV cs.AI cs.CL 57%

Can VLMs Predict Future States? Bootstrapping World Models from Inverse Dynamics

视觉语言模型能预测未来状态吗?从逆动力学引导世界模型

Yifu Qiu, Yftah Ziser, Anna Korhonen, Shay B. Cohen, Edoardo M. Ponti

机构 * Institute for Language, Cognition and Computation, University of Edinburgh(语言、认知与计算研究所,爱丁堡大学) Language Technology Lab, University of Cambridge(语言技术实验室,剑桥大学) NVIDIA(NVIDIA公司) University of Groningen(格罗宁根大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文发现视觉语言模型(VLM)难以直接进行前向动力学预测(FDP),但逆动力学预测(IDP)更容易学习,并利用IDP通过弱监督学习和推理时验证两种策略引导FDP,在Aurora-Bench上取得与最先进图像编辑模型竞争的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
1703.08001 2026-06-04 cs.CV cs.NA math.NA 57%

Nonlinear Spectral Image Fusion

非线性频谱图像融合

Martin Benning, Michael Möller, Raz Z. Nossek, Martin Burger, Daniel Cremers, Guy Gilboa, Carola-Bibiane Schönlieb

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文展示基于总变分正则化的非线性频谱分解框架在图像融合及更广泛的图像处理任务中的有效性,通过选择特定图像的频率转移特征如面部皱纹,实现图像编辑。

Comments 13 pages, 9 figures, submitted to SSVM conference proceedings 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19945 2026-06-03 cs.CV 57%

Low-Resolution Editing is All You Need for High-Resolution Editing

低分辨率编辑足以实现高分辨率编辑

Junsung Lee, Hyunsoo Lee, Yong Jae Lee, Bohyung Han

机构 * ECE & IPAI, Seoul National University(电子与信息物理学院及首尔国立大学IPAI) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 本文提出一种测试时优化框架,通过分块优化、细节迁移和同步策略,实现高分辨率图像编辑。

Comments CVPR 2026. Project website: https://hleephilip.github.io/ScaleEdit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01819 2026-06-02 cs.CV eess.IV 57%

Hist2Style: Histogram-Guided Stylization with Bilateral Grids

Hist2Style: 基于双边网格的直方图引导风格化

Dekel Galor, Adam Pikielny, Zhoutong Zhang, Ke Wang, Laura Waller, Jiawen Chen, Ilya Chugunov

机构 * Adobe Nextcam University of California, Berkeley(加州大学伯克利分校)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出Hist2Style,利用双边网格实现快速、边缘感知的逼真风格迁移,通过蒸馏大模型为轻量网络,并基于直方图嵌入提供可解释的用户控制。

Comments 10 pages, 8 figures. Extended results are at https://www.dekelgalor.com/hist2style

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01213 2026-06-02 cs.CV cs.AI cs.CL 57%

TECCI: Tricky Edits of Collected and Curated Images

TECCI:收集与策划图像的棘手编辑

Aishwarya Agrawal, Roy Hirsch, Yasumasa Onoe, Sherry Ben, Jason Baldridge

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出TECCI基准,包含7550对图像与编辑指令,通过人工与自动评估揭示现有图像编辑模型在指令遵循、最小编辑和视觉质量方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31145 2026-06-01 cs.CV cs.AI cs.LG 57%

FOCUS: Forcing In-Context Object Localization through Visual Support Constraints and Policy Optimization

FOCUS: 通过视觉支持约束和策略优化强制上下文目标定位

Mohammed Asad Karim, Vinay Kumar Verma

机构 * Amazon, Seattle, USA(亚马逊(美国西雅图))

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出一种两阶段训练框架,通过优化支持框与查询图像间的上下文注意力并结合GRPO强化学习,实现无类别监督的类别无关上下文目标定位,7B模型性能超越72B模型。

Comments Accepted at ICML 2026. * Equal Contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28450 2026-05-28 cs.CV cs.AI 57%

BiasEdit: A Training-Free Bias-Detect-and-Edit Framework for Learning Fair Visual Classifiers

BiasEdit: 一种无需训练的偏差检测与编辑框架,用于学习公平的视觉分类器

Jungwook Seo, Yoonsik Park, Changmin Lee, Sungyong Baik

机构 * Hanyang University Department of Artificial Intelligence BAIK Lab Seoul South Korea(翰阳大学人工智能系BAIK实验室首尔韩国) Hanyang University Department of Data Science BAIK Lab Seoul South Korea(翰阳大学数据科学系BAIK实验室首尔韩国) Hanyang University Department of Data Science Department of Artificial Intelligence BAIK Lab Seoul South Korea(翰阳大学数据科学系人工智能系BAIK实验室首尔韩国) Hanyang University(翰阳大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出BiasEdit框架,通过统计依赖和互信息分析自动检测偏差属性,并利用文本引导的图像编辑生成无偏样本,无需手动标注即可实现公平分类。

Comments Accepted to The Web Conference 2026 (formerly WWW) as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22096 2026-05-28 cs.CV 57%

WeatherCity: Urban Scene Reconstruction with Controllable Multi-Weather Transformation

WeatherCity: 可控多天气变换的城市场景重建

Wenhua Wu, Huai Guan, Zhe Liu, Hesheng Wang

机构 * School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(自动化与智能感知学院,上海交通大学)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出WeatherCity框架,利用文本引导的图像编辑、天气高斯表示和物理驱动模型,实现高保真、时间一致的4D城市场景重建与多天气编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24794 2026-05-26 cs.CV cs.CL 57%

DUEL: Adversarial Self-Play for Multimodal Reasoning

DUEL: 用于多模态推理的对抗性自我对弈

Lin Qiu, Hanqing Zeng, Yao Liu, Bingjun Sun, Guangdeng Liao, Ji Liu

机构 * Meta AI

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 提出DUEL框架,通过对抗性自我对弈从预训练VLM生成监督信号,结合长度归一化对数似然奖励,无需人工标注即可提升视觉推理与判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23897 2026-05-25 cs.CV cs.AI cs.CL 57%

ETCHR: Editing To Clarify and Harness Reasoning

ETCHR: 通过编辑来澄清和利用推理

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin

机构 * The Chinese University of Hong Kong Shanghai AI Laboratory(香港中文大学上海人工智能实验室) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 图像编辑 :image editing(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在需要细粒度关注或视角变换的问题上纯文本思维链的瓶颈,提出了一种解耦的图像编辑模型ETCHR,通过两阶段训练(推理模仿和推理增强)弥合语言侧和生成侧差距,无需训练即可插入不同MLLM,在五个任务族上平均Pass@1提升4.61-5.47个百分点。

Comments Code, model and data are open-sourced at https://github.com/InternLM/ETCHR

详情

展开后加载摘要…

URL PDF HTML 收藏