arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 4211 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 4211 篇

2602.05213 2026-02-06 cs.CV 57%

Dual-Representation Image Compression at Ultra-Low Bitrates via Explicit Semantics and Implicit Textures

通过显式语义和隐式纹理实现超低比特率的双表示图像压缩

Chuqin Zhou, Xiaoyue Ling, Yunuo Chen, Jincheng Dai, Guo Lu, Wenjun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出了一种融合显式语义和隐式纹理的图像压缩框架,通过无训练的方式提升超低比特率下的压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03339 2026-02-04 cs.CV 57%

Composable Visual Tokenizers with Generator-Free Diagnostics of Learnability

可组合的视觉标记生成器:无生成器诊断的可学习性

Bingchen Zhao, Qiushan Guo, Ye Wang, Yixuan Huang, Zhonghua Zhai, Yu Tian

机构 * University of Edinburgh(爱丁堡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 CompTok通过训练可组合的视觉标记生成器,提升图像生成的组合性和语义编辑能力,同时引入两个度量标准评估标记空间的可学习性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03314 2026-02-04 cs.CV 57%

PQTNet: Pixel-wise Quantitative Thermography Neural Network for Estimating Defect Depth in Polylactic Acid Parts by Additive Manufacturing

PQTNet:用于通过增材制造估计聚乳酸部件缺陷深度的像素级定量热成像神经网络

Lei Deng, Wenhao Huang, Chao Yang, Haoyuan Zheng, Yinbin Tian, Yue Ma

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PQTNet通过像素级定量热成像神经网络,实现了对增材制造聚乳酸部件缺陷深度的高精度估计,具有高精度和鲁棒性的定量缺陷表征能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03105 2026-02-04 cs.CV 57%

Gromov Wasserstein Optimal Transport for Semantic Correspondences

Gromov Wasserstein最优传输用于语义对应关系

Francis Snelgar, Stephen Gould, Ming Xu, Liang Zheng, Akshay Asthana

机构 * Seeing Machines

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出使用 Gromov Wasserstein 最优传输算法替代传统方法,提升语义对应关系任务的性能并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01905 2026-02-03 cs.CV cs.AI cs.LG 57%

Learning Sparse Visual Representations via Spatial-Semantic Factorization

通过空间-语义分解学习稀疏视觉表示

Theodore Zhengde Zhao, Sid Kiblawi, Jianwei Yang, Naoto Usuyama, Reuben Tan, Noel C Codella, Tristan Naumann, Hoifung Poon, Mu Wei

机构 * Microsoft(微软)

专题命中 可控生成 :generative vision(abstract);分类 cs.CV

AI总结 STELLAR通过空间-语义分解实现稀疏视觉表示,在保持高重建质量的同时达到与密集模型相当的语义性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 57%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 可控生成 :text-to-image(abstract);分类 cs.CV

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00570 2026-02-03 cs.CV 57%

GLAD: Generative Language-Assisted Visual Tracking for Low-Semantic Templates

GLAD: 生成式语言辅助低语义模板视觉跟踪

Xingyu Luo, Yidong Cai, Jie Liu, Jie Tang, Gangshan Wu, Limin Wang

机构 * State Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 GLAD通过生成式多模态融合提升低语义模板视觉跟踪性能,实现更高效的多模态特征融合与语义增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22887 2026-02-02 cs.LG cs.AI cs.CL cs.CV 57%

MoVE: Mixture of Value Embeddings -- A New Axis for Scaling Parametric Memory in Autoregressive Models

MoVE:价值嵌入的混合——扩展自回归模型参数内存的新轴

Yangyan Li

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 MoVE通过引入价值嵌入的混合机制,实现了自回归模型参数内存的独立扩展,提升了文本和图像生成任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19236 2026-02-02 cs.RO cs.CV 57%

MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation

MemoryVLA: 视觉-语言-动作模型中用于机器人操作的感知-认知记忆

Hao Shi, Bin Xie, Yingfei Liu, Lin Sun, Fengrong Liu, Tiancai Wang, Erjin Zhou, Haoqiang Fan, Xiangyu Zhang, Gao Huang

机构 * Department of Automation, BNRist, Tsinghua University(自动化系、BNRist、清华大学) Dexmal MEGVII Technology(MEGVII技术) Tianjin University(天津大学) Harbin Institute of Technology(哈尔滨工业大学) StepFun

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MemoryVLA通过结合感知与认知记忆机制,提升机器人操作中长时间跨度任务的性能,实现对时间依赖任务的高效处理。

Comments ICLR 2026 | The project is available at https://shihao1895.github.io/MemoryVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22455 2026-02-02 cs.CV 57%

ScribbleSense: Generative Scribble-Based Texture Editing with Intent Prediction

ScribbleSense: 基于生成的涂鸦纹理编辑与意图预测

Yudi Zhang, Yeming Geng, Lei Zhang

机构 * School of Computer Science, Beijing Institute of Technology(计算机学院,北京理工大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 ScribbleSense通过结合多模态大语言模型和图像生成模型,实现了基于生成的涂鸦纹理编辑与意图预测,提升交互式编辑性能。

Comments Accepted by IEEE TVCG. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22522 2026-01-30 cs.LG cs.CV 57%

JointDiff: Bridging Continuous and Discrete in Multi-Agent Trajectory Generation

JointDiff: 在多智能体轨迹生成中弥合连续与离散

Guillem Capellera, Luis Ferraz, Antonio Rubio, Alexandre Alahi, Antonio Agudo

机构 * Kognia Sports Intelligence(Kognia体育智能) Visual Intelligence for Transportation, EPFL(交通视觉智能,EPFL) Institut de Robòtica i Informàtica Industrial, CSIC-UPC(机器人与信息工业研究所,CSIC-UPC)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 JointDiff通过联合生成连续和离散事件,提升多智能体轨迹生成的可控性和真实性。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20425 2026-01-29 cs.CV 57%

Quartet of Diffusions: Structure-Aware Point Cloud Generation through Part and Symmetry Guidance

四重扩散:通过部件和对称性指导的结构感知点云生成

Chenliang Zhou, Fangcheng Zhong, Weihao Xia, Albert Miao, Canberk Baykal, Cengiz Oztireli

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 四重扩散通过部件和对称性指导,实现了结构感知的点云生成,首次在生成过程中整合并强制执行对称性和部件先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19461 2026-01-28 cs.CV cs.RO eess.IV 57%

Towards Gold-Standard Depth Estimation for Tree Branches in UAV Forestry: Benchmarking Deep Stereo Matching Methods

面向无人机林业作业的树枝深度估计金标准:深度立体匹配方法的基准测试

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) Victoria University of Wellington(惠灵顿维多利亚大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Canterbury(坎特伯雷大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文首次系统评估了八种深度立体匹配方法在无人机林业中对树枝深度估计的性能,发现DEFOM在植被密集环境下表现最佳,成为新的金标准基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01943 2026-01-28 cs.CV 57%

Learning Video Generation for Robotic Manipulation with Collaborative Trajectory Control

基于协作轨迹控制的机器人操作视频生成学习

Xiao Fu, Xintao Wang, Xian Liu, Jianhong Bai, Runsen Xu, Pengfei Wan, Di Zhang, Dahua Lin

机构 * The Chinese University of Hong Kong(香港中文大学) Kuaishou Technology(快手科技) Zhejiang University(浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 RoboMaster通过协作轨迹控制方法,解决多物体交互建模问题,实现机器人操作视频生成的高保真度与多物体交互建模。

Comments ICLR 2026. Project Page: https://fuxiao0719.github.io/projects/robomaster/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16532 2026-01-27 cs.CV 57%

AnchoredDream: Zero-Shot 360° Indoor Scene Generation from a Single View via Geometric Grounding

AnchoredDream: 通过几何约束从单视角生成零样本360°室内场景

Runmao Yao, Junsheng Zhou, Zhen Dong, Yu-Shen Liu

机构 * School of Software, Tsinghua University(清华大学软件学院) Wuhan University(武汉大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AnchoredDream通过几何约束和外观-几何互促机制,实现从单视角零样本生成高质量360°室内场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17857 2026-01-27 cs.CV 57%

SynMind: Reducing Semantic Hallucination in fMRI-Based Image Reconstruction

SynMind:减少基于fMRI的图像重建中的语义幻觉

Lan Yang, Minghan Yang, Ke Li, Honggang Zhang, Kaiyue Pang, Yi-Zhe Song

机构 * School of Artificial Intelligence, Beijing University of Posts and Telecommunications(人工智能学院,北京邮电大学) SketchX Lab, Centre for Vision, Speech and Signal Processing (CVSSP), University of Surrey(SketchX实验室,视觉、语音和信号处理中心(CVSSP), Surrey大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 SynMind通过整合显式语义编码与视觉先验,提升基于fMRI的图像重建质量,减少语义幻觉并提高与人类视觉感知的一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17088 2026-01-27 cs.CV 57%

GlassesGB: Controllable 2D GAN-Based Eyewear Personalization for 3D Gaussian Blendshapes Head Avatars

GlassesGB: 可控的基于GAN的2D眼镜个性化技术用于3D高斯混合形状头虚拟角色

Rui-Yang Ju, Jen-Shiun Chiang

机构 * Kyoto University(京都大学) Tamkang University(Tamkang 大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 GlassesGB结合GAN与3D高斯混合形状技术,实现可控的2D眼镜个性化生成,用于3D头虚拟角色的定制化设计。

Comments IEEE VR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16429 2026-01-26 cs.CV cs.AI 57%

AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose

AlphaFace: 高保真和实时的面部交换器,对面部姿态具有鲁棒性

Jongmin Yu, Hyeontaek Oh, Zhongtian Sun, Angelica I Aviles-Rivero, Moongu Jeon, Jinhong Yang

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Tsinghua University(清华大学) Gwangju Institute of Science and Technology(全州科学技术院) Inje University(庆北大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 AlphaFace通过结合视觉-语言模型和CLIP嵌入,实现高保真和实时的面部交换,提升对极端面部姿态的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10250 2026-01-26 cs.CV 57%

GAMMA: Generalizable Alignment via Multi-task and Manipulation-Augmented Training for AI-Generated Image Detection

GAMMA: 通过多任务和操控增强训练实现通用对齐的AI生成图像检测

Haozhen Yan, Yan Hong, Suning Lang, Jiahui Zhan, Yikun Ji, Yujie Gao, Huijia Zhu, Jun Lan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 GAMMA通过多任务和操控增强训练,提升AI生成图像检测的泛化能力与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11074 2026-01-21 cs.CV 57%

Evaluating Latent Generative Paradigms for High-Fidelity 3D Shape Completion from a Single Depth Image

评估用于从单个深度图像生成高保真3D形状补全的潜在生成范式

Matthias Humt, Ulrich Hillenbrand, Rudolph Triebel

机构 * German Aerospace Center(德国航空航天中心) TU Munich(慕尼黑技术大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文比较了扩散模型和自回归模型在单个深度图像生成高保真3D形状补全任务中的性能,发现扩散模型在连续潜在空间中表现更优,而自回归模型在离散潜在空间中可匹敌或超越扩散模型。

Comments 16 pages, 4 figures, 19 tables. To appear in 3DV 2026. Project page: https://hummat.github.io/2026-3dv-genz/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10117 2026-01-16 cs.CV 57%

Beyond Single Prompts: Synergistic Fusion and Arrangement for VICL

超越单一提示:协同融合与排列用于VICL

Wenwen Liao, Jianbo Yu, Yuansong Wang, Shifu Yan, Xiaofeng Yang

机构 * College of Intelligent Robotics and Advance Manufacturing, Fudan University(智能机器人与先进制造学院,复旦大学) School of Microelectronics, Fudan University(微电子学院,复旦大学) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ByteDance Ltd.(字节跳动有限公司)

专题命中 可控生成 :inpainting(abstract);分类 cs.CV

AI总结 本文提出一种端到端的VICL框架,通过自适应融合模块和排列特定MLP,解决单一提示选择和结构信息利用的问题,提升跨任务的修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22974 2026-01-16 cs.CV 57%

RealCamo: Boosting Real Camouflage Synthesis with Layout Controls and Textual-Visual Guidance

RealCamo: 通过布局控制和文本-视觉引导提升真实伪装合成

Chunyuan Chen, Yunuo Cai, Shujuan Li, Weiyun Liang, Bin Wang, Jing Xu

机构 * College of Artificial Intelligence, Nankai University, Tianjin, China(人工智能学院,南开大学,天津,中国) School of Data Science, Fudan University, Shanghai, China(数据科学学院,复旦大学,上海,中国)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 RealCamo通过布局控制和文本-视觉引导提升真实伪装合成,解决现有方法在伪装效果和背景一致性上的不足。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09255 2026-01-15 cs.CV 57%

PhyRPR: Training-Free Physics-Constrained Video Generation

PhyRPR: 无训练物理约束视频生成

Yibo Zhao, Hengjia Li, Xiaofei He, Boxi Wu

机构 * State Key Lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 PhyRPR提出一种无训练的三阶段视频生成方法,通过解耦物理理解和视觉合成,提升生成视频的物理合理性和运动可控性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08193 2026-01-14 cs.CV 57%

Unified Multi-Site Multi-Sequence Brain MRI Harmonization Enriched by Biomedical Semantic Style

统一多站点多序列脑部MRI谐调增强生物医学语义风格

Mengqi Wu, Yongheng Sun, Qianqian Wang, Pew-Thian Yap, Mingxia Liu

机构 * Department of Radiology and Biomedical Research Imaging Center (BRIC), University of North Carolina at Chapel Hill(放射科与生物医学研究成像中心(BRIC)、北卡罗来纳大学教堂山分校) Lampe Joint Department of Biomedical Engineering, University of North Carolina at Chapel Hill and North Carolina State University(Lampe联合生物医学工程部门、北卡罗来纳大学教堂山分校和北卡罗来纳州立大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 MMH通过生物医学语义先验实现多站点多序列脑部MRI谐调,有效分离风格与解剖结构,提升图像一致性与下游任务性能。

Comments 15 pages, 10 figures. Extended version of a paper published at MICCAI 2025 (DOI: 10.1007/978-3-032-04947-6_65)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07660 2026-01-13 cs.CV 57%

StdGEN++: A Comprehensive System for Semantic-Decomposed 3D Character Generation

StdGEN++: 一种用于语义分解3D人物生成的综合性系统

Yuze He, Yanning Zhou, Wang Zhao, Jingwen Ye, Zhongkai Wu, Ran Yi, Yong-Jin Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Tencent AIPD(腾讯AIPD) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 StdGEN++是一种基于双分支语义感知模型的综合性系统,通过语义分解和高效生成技术,实现高保真3D人物生成,适用于自动化角色资产生产。

Comments 13 pages, 12 figures. Extended version of CVPR 2025 paper arXiv:2411.05738

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05246 2026-01-09 cs.CV 57%

Pixel-Perfect Visual Geometry Estimation

像素级视觉几何估计

Gangwei Xu, Haotong Lin, Hongcheng Luo, Haiyang Sun, Bing Wang, Guang Chen, Sida Peng, Hangjun Ye, Xin Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Xiaomi EV(小米电动车)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。

Comments Code: https://github.com/gangweix/pixel-perfect-depth

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10688 2026-01-09 cs.CV 57%

Novel View Synthesis using DDIM Inversion

基于DDIM反向的新型视图合成

Sehajdeep Singh, A V Subramanyam, Aditya Gupta, Sahil Gupta

机构 * Indraprastha Institute of Information Technology(印度普拉斯塔大学信息科技学院)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出基于DDIM反向的轻量级视图合成方法,利用预训练扩散模型生成高质量新视角重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03517 2026-01-08 cs.CV 57%

Semantic Belief-State World Model for 3D Human Motion Prediction

语义信念状态世界模型用于3D人体运动预测

Sarim Chaudhry

机构 * Department of Computer Science, Purdue University(计算机科学系,普渡大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 本文提出语义信念状态世界模型,通过将人体视为世界模型状态空间的一部分,实现更稳定的长期运动预测与模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02646 2026-01-07 cs.CV cs.AI 57%

DreamLoop: Controllable Cinemagraph Generation from a Single Photograph

DreamLoop:从单张照片生成可控的cinemagraph

Aniruddha Mahapatra, Long Mai, Cusuh Ham, Feng Liu

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 DreamLoop通过训练视频扩散模型实现从单张照片生成可控cinemagraph,提供灵活的运动路径控制,生成高质量且符合用户意图的动画。

Comments Project Page: https://anime26398.github.io/dreamloop.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09040 2026-01-06 cs.CV cs.AI cs.CL 57%

Autoregressive Semantic Visual Reconstruction Helps VLMs Understand Better

自回归语义视觉重建有助于VLMs更好地理解

Dianyi Wang, Wei Song, Yikun Wang, Siyuan Wang, Kaicheng Yu, Zhongyu Wei, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) AutoLab, Westlake University(西湖大学AutoLab) Zhejiang University(浙江大学) Shanghai AI Lab(上海人工智能实验室) University of Southern California(美国南加州大学)

专题命中 可控生成 :image generation(abstract);分类 cs.CV

AI总结 自回归语义视觉重建通过提升多模态理解能力,改进了VLMs对视觉信息的把握

详情

展开后加载摘要…

URL PDF HTML 收藏