arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 86585 信号源:cs.CV, cs.GR, cs.MM

1. 图像编辑 1264 篇

2603.11703 2026-04-09 cs.LG 50%

EvoFlows: Evolutionary Edit-Based Flow-Matching for Protein Engineering

EvoFlows:基于进化编辑的蛋白质工程流匹配

Nicolas Deutschmann, Constance Ferragu, Jonathan D. Ziegler, Shayan Aziznejad, Eli Bixby

机构 * Cradle Zürich, CH(Cradle 苏黎世,瑞士)

专题命中 图像编辑 :diffusion(abstract)

AI总结 EvoFlows通过编辑流学习蛋白质序列间的突变轨迹,实现可控的插入、删除和替换操作,生成与自然蛋白家族一致的变异体,优于现有方法。

Comments Accepted at Workshop on Foundation Models for Science: Real-World Impact and Science-First Design, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07990 2026-03-25 cs.LG 50%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 图像编辑 :image editing(abstract)

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07148 2026-03-10 cs.LG 50%

Agentic Planning with Reasoning for Image Styling via Offline RL

基于推理的图像风格化代理规划 via 离线强化学习

Subhojyoti Mukherjee, Stefano Petrangeli, Branislav Kveton, Trung Bui, Franck Dernoncourt, Arko Mukherjee

机构 * Adobe Research(Adobe研究)

专题命中 图像编辑 :image editing(abstract)

AI总结 本文提出基于推理的代理规划框架,通过结构化规划和工具链提升图像风格化效果,采用合成数据生成和离线强化学习方法,验证在视觉质量和指令遵循上的优越性。

Comments 85 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08570 2026-02-23 cs.LG 50%

Who Said Neural Networks Aren't Linear?

谁说神经网络不是线性的?

Nimrod Berman, Assaf Hallak, Assaf Shocher

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出线性化器架构,通过结构运输概念使神经网络在特定向量空间中表现为线性算子,从而应用线性代数工具处理非线性映射,并展示其在扩散模型和风格迁移中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06050 2026-02-05 cs.LG 50%

Edit-Based Flow Matching for Temporal Point Processes

基于编辑的流匹配用于时间点过程

David Lüdke, Marten Lienen, Marcel Kollovieh, Stephan Günnemann

机构 * School of Computation, Information and Technology & Munich Data Science Institute(计算、信息与技术学院及慕尼黑数据科学研究所)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出了一种基于编辑操作的流匹配方法,用于改进时间点过程的建模,通过连续时间马尔可夫链框架学习瞬时编辑率,提升生成效率和灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01206 2026-02-03 cs.AI 50%

Addressing Explainability of Generative AI using SMILE (Statistical Model-agnostic Interpretability with Local Explanations)

通过SMILE(统计模型无关可解释性与局部解释)解决生成AI的可解释性问题

Zeinab Dehghani

机构 * School of Computer Science(计算机科学学院) University of Hull(赫尔大学)

专题命中 图像编辑 :image editing(abstract)

AI总结 gSMILE通过受控扰动、Wasserstein距离和加权替代模型,提升生成AI的可解释性,实现细粒度归因和直观热图生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22408 2026-02-02 q-bio.BM cs.LG 50%

Minimal-Action Discrete Schrödinger Bridge Matching for Peptide Sequence Design

最小作用离散薛定谔桥匹配用于肽序列设计

Shrey Goel, Pranam Chatterjee

机构 * Duke University(杜克大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 图像编辑 :diffusion(abstract)

AI总结 本文提出MadSBM框架,通过最小作用离散薛定谔桥匹配方法,实现肽序列设计的高效生成与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12174 2025-11-18 cs.LG 50%

TSGDiff: Rethinking Synthetic Time Series Generation from a Pure Graph Perspective

Lifeng Shen, Xuyang Li, Lele Long

专题命中 图像编辑 :diffusion(abstract)

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07627 2025-10-09 cs.CE q-bio.BM 50%

LSMTCR: A Scalable Multi-Architecture Model for Epitope-Specific T Cell Receptor de novo Design

Ruihao Zhang, Xiao Liu

专题命中 图像编辑 :diffusion(abstract)

Comments 13 main pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04738 2025-10-07 cs.SD cs.AI cs.CL cs.LG eess.AS 50%

Speak, Edit, Repeat: High-Fidelity Voice Editing and Zero-Shot TTS with Cross-Attentive Mamba

Baher Mohammad, Magauiya Zhussip, Stamatios Lefkimmiatis

机构 * MTS AI(MTS人工智能公司) ITMO University(ITMO大学)

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02109 2025-09-30 cs.LG math.PR stat.ML 50%

Differentiable Expectation-Maximisation and Applications to Gaussian Mixture Model Optimal Transport

Samuel Boïté, Eloi Tanguy, Julie Delon, Agnès Desolneux, Rémi Flamary

机构 * Université Paris Cité, CNRS, MAP5(巴黎大学、国家科学研究中心、MAP5) CNRS(国家科学研究中心) ENS Paris-Saclay(巴黎-萨克雷大学) ECOLE POLYTECHNIQUE(巴黎高等理工学院) Institut Polytechnique de Paris(巴黎理工学院)

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01456 2025-07-03 math.GN 50%

QC-OT: Optimal Transport with Quasiconformal Mapping

Yuping Lv, Qi Zhao, Xuebin Chang, Wei Zeng

专题命中 图像编辑 :image editing(abstract)

Comments 24 pages,18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.03477 2025-04-22 cs.HC 50%

CrowdGenUI: Aligning LLM-Based UI Generation with Crowdsourced User Preferences

Yimeng Liu, Misha Sra, Chang Xiao

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.03992 2025-03-20 eess.IV 50%

Medical Image Fusion for High-Level Analysis: A Mutual Enhancement Framework for Unaligned PAT and MRI

Yutian Zhong, Jinchuan He, Zhichao Liang, Shuangyang Zhang, Qianjin Feng, Lijun Lu, Li Qi

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17410 2025-01-31 cs.HC 50%

Copying style, Extracting value: Illustrators' Perception of AI Style Transfer and its Impact on Creative Labor

Julien Porquet, Sitong Wang, Lydia B. Chilton

专题命中 图像编辑 :text-to-image(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11233 2025-01-22 cs.IR cs.CL cs.MA 50%

PlotEdit: Natural Language-Driven Accessible Chart Editing in PDFs via Multimodal LLM Agents

Kanika Goswami, Puneet Mathur, Ryan Rossi, Franck Dernoncourt

专题命中 图像编辑 :image editing(abstract)

Comments Accepted at ECIR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11908 2024-10-17 cs.HC cs.AI 50%

ChatHouseDiffusion: Prompt-Guided Generation and Editing of Floor Plans

Sizhong Qin, Chengyu He, Qiaoyun Chen, Sen Yang, Wenjie Liao, Yi Gu, Xinzheng Lu

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01971 2024-10-04 cs.RO cs.LG 50%

Run-time Observation Interventions Make Vision-Language-Action Models More Visually Robust

Asher J. Hancock, Allen Z. Ren, Anirudha Majumdar

专题命中 图像编辑 :image editing(abstract)

Comments Website: https://aasherh.github.io/byovla/

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06082 2024-09-17 cs.HC 50%

MemoVis: A GenAI-Powered Tool for Creating Companion Reference Images for 3D Design Feedback

Chen Chen, Cuong Nguyen, Thibault Groueix, Vladimir G. Kim, Nadir Weibel

专题命中 图像编辑 :image editing(abstract)

Comments In the Journal of ACM Transactions on Computer-Human Interaction

Journal ref ACM Transactions on Computer-Human Interaction, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14170 2024-08-27 eess.IV 50%

Image Provenance Analysis via Graph Encoding with Vision Transformer

Keyang Zhang, Chenqi Kong, Shiqi Wang, Anderson Rocha, Haoliang Li

专题命中 图像编辑 :image editing(abstract)

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.16732 2024-08-06 cs.SE cs.AI 50%

PyBench: Evaluating LLM Agent on various real-world coding tasks

Yaolun Zhang, Yinxu Pan, Yudong Wang, Jie Cai

专题命中 图像编辑 :image editing(abstract)

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02247 2023-11-07 cs.LG 50%

PRISM: Progressive Restoration for Scene Graph-based Image Manipulation

Pavel Jahoda, Azade Farshad, Yousef Yeganeh, Ehsan Adeli, Nassir Navab

专题命中 图像编辑 :image generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02953 2023-04-11 eess.IV 50%

Using Decoupled Features for Photo-realistic Style Transfer

Trevor D. Canham, Adrián Martín, Marcelo Bertalmío, Javier Portilla

专题命中 图像编辑 :diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.00079 2023-02-02 cs.HC cs.LG 50%

GANravel: User-Driven Direction Disentanglement in Generative Adversarial Networks

Noyan Evirgen, Xiang 'Anthony' Chen

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.09164 2022-08-17 cs.LG cs.AI 50%

High Fidelity Visualization of What Your Self-Supervised Representation Knows About

Florian Bordes, Randall Balestriero, Pascal Vincent

专题命中 图像编辑 :diffusion(abstract)

Comments Accepted at TMLR 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.08320 2022-08-16 cs.HC cs.AI cs.LG 50%

GANzilla: User-Driven Direction Discovery in Generative Adversarial Networks

Noyan Evirgen, Xiang 'Anthony' Chen

专题命中 图像编辑 :image editing(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2109.11139 2021-09-24 eess.IV 50%

Source Printer Identification using Printer Specific Pooling of Letter Descriptors

Sharad Joshi, Yogesh Kumar Gupta, Nitin Khanna

专题命中 图像编辑 :image editing(abstract)

Comments 34 pages, 5 figures, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.06900 2020-11-02 cs.LG cs.CL stat.ML 50%

Improving GAN Training with Probability Ratio Clipping and Sample Reweighting

Yue Wu, Pan Zhou, Andrew Gordon Wilson, Eric P. Xing, Zhiting Hu

专题命中 图像编辑 :image generation(abstract)

Comments NeurIPS 2020 camera ready version (citations updated)

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.01046 2020-06-02 cs.CL 50%

TutorialVQA: Question Answering Dataset for Tutorial Videos

Anthony Colas, Seokhwan Kim, Franck Dernoncourt, Siddhesh Gupte, Daisy Zhe Wang, Doo Soon Kim

专题命中 图像编辑 :image editing(abstract)

Comments Accepted at LREC 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1808.08703 2020-05-19 cs.CL cs.AI cs.LG 50%

Generating Text through Adversarial Training using Skip-Thought Vectors

Afroz Ahamad

专题命中 图像编辑 :image generation(abstract)

Comments NAACL 2019: https://www.aclweb.org/anthology/N19-3008

Journal ref "Proceedings of the 2019 Conference of the North {A}merican Chapter of the Association for Computational Linguistics: Student Research Workshop, Jun 2019, Pages 53-60"

详情

展开后加载摘要…

URL PDF HTML 收藏