arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-31 至 2026-07-31 共收录 44 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 3 篇

2607.27779 2026-07-31 cs.CV 新提交 79%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27959 2026-07-31 cs.CV cs.IR 新提交 57%

FiRE: Enhancing MLLMs with Fine-Grained Context Learning for Complex Image Retrieval

FiRE:利用细粒度上下文学习增强多模态大语言模型(MLLMs)以实现复杂图像检索

Bohan Hou, Haoqiang Lin, Xuemeng Song, Haokun Wen, Meng Liu, Yupeng Hu, Xiangyu Zhao

机构 * Shandong University(山东大学) City University of Hong Kong(香港城市大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shandong Jianzhu University(山东建筑大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 本研究针对MLLMs在复杂图像检索任务中细粒度建模不足的问题,提出自动化细粒度多模态五元组数据集构建流程与两阶段微调策略,在零样本设置下于五个数据集上取得优于现有方法的性能。

Journal ref Proceedings of the ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27616 2026-07-31 cs.CV 新提交 57%

MPIE-Bench: Benchmarking Anatomically Plausible Multi-Person Interaction Editing

MPIE-Bench:解剖学上合理的多人交互编辑基准测试

Jiajia Lin, Mingxuan Du, Tuowen Zhou, Benfeng Xu, Hongtao Xie

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(元石科技)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 该研究针对多人交互编辑的解剖学与几何错误问题,构建了MPIE-Bench基准,提出MPIE-Eval评估方法,发现现有编辑模型在两个维度表现不均衡,且其评估比VLM清单更贴合人类判断。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2607.27292 2026-07-31 cs.CV 新提交 77%

VETO: Towards Protecting Images From Frontier AI Editing

VETO:面向保护图像免受前沿AI编辑的侵害

Jonas Grebe, Hossein Shakibania, Tobias Braun, Marcus Rohrbach, Anna Rohrbach

专题命中 图像编辑 :text-to-image(abstract);diffusion(abstract);image synthesis(abstract);分类 cs.CV

AI总结 针对前沿AI图像编辑模型的滥用问题,提出抗编辑伪装VETO,引入评估基准VetoBench,实验显示其在保护与保真度权衡上优于现有防御。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 32 篇

2607.28489 2026-07-31 cs.IT math.IT 新提交 83%

Forecasting Land Art Under Climate Scenarios

气候情景下的大地艺术预测

Alev Cinbarci, Sean Kalaycioglu

专题命中 扩散模型 :diffusion(summary_cn,abstract);image synthesis(abstract)

AI总结 本文基于《螺旋防波堤》的遥感数据,构建两阶段预测流程,结合IPCC气候情景与Stable Diffusion XL模型,预测该大地艺术的图像复杂性及暴露状态,并探讨文化遗产伦理问题。

Comments 15 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27386 2026-07-31 cs.AI cs.LG 新提交 82%

Beyond the Bidirectional Promise: Re-evaluating the Robustness of Diffusion Language Models

超越双向承诺:重新评估扩散语言模型的鲁棒性

Saurabh Yadav, Badri Narayana Patro, Vijay Srinivas Agneeswaran

机构 * Microsoft(微软公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究评估了扩散语言模型的鲁棒性,发现其虽能抵御部分对抗攻击但易受自然噪声影响,存在过度自信问题,脆弱性源于解码器路由故障,需将鲁棒性整合入迭代解码循环。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28164 2026-07-31 cs.CV cs.GR 新提交 81%

S-Avatar: Diffusion-Guided Gaussian Head Avatars from a Single Image

S-Avatar:基于单张图像的扩散引导高斯头部化身

Hail Song, Seokhwan Yang, Jiwon Yang, Woojin Cho, Woontack Woo

机构 * KAIST(韩国科学技术院) KAIST KI-ITC ARRC(韩国科学技术院KI-ITC ARRC)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV、cs.GR

AI总结 S-Avatar通过三阶段流水线,结合扩散引导3DGS生成与FLAME控制,从单张图像生成高逼真3D头部化身,提升了3D一致性,在新视点和表情生成上优于现有方法,适用于VR/AR应用。

Comments 15 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28611 2026-07-31 cs.CV 新提交 79%

Chimera: Designing and Chinchilla-Scaling Hybrid Visual Diffusion Transformers

Chimera:设计与遵循Chinchilla缩放规律的混合视觉扩散Transformer

Chongjian Ge, Hanwen Jiang, Tianyu Wang, Jiuxiang Gu, Yiran Xu, Ziwen Chen, Shaoteng Liu, Jing Shi, Yicong Hong, Zefan Cai, Hailin Jin, Hao Tan

机构 * Adobe Research(奥多比研究院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 Chimera是一款混合视觉扩散骨干网络,结合KDA、MLA等模块与HeteroP缩放方案,训练出11B参数(2B激活)的模型,在计算效率、视频泛化等方面优于基线,为长上下文扩散架构设计提供基础。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28565 2026-07-31 cs.CV 新提交 79%

MIND: Multimodal Intent-Driven Network via Diffusion Transformers for Medical Image Fusion

MIND:基于扩散Transformer的多模态意图驱动网络用于医学图像融合

Yunzhan Fu, Xiangyu Shen, Yifei Sun, Yuhan Chen, Jian Wu, Hongxia Xu

机构 * Transvascular Implantation Devices Research Institute, Zhejiang University(浙江大学血管内植入器械研究院) Zhejiang University(浙江大学) Hangzhou Institute of Technology, Xidian University(西安电子科技大学杭州研究院) Hangzhou Dianzi University(杭州电子科技大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有医学图像融合方法缺乏对诊断意图深度理解的问题,提出基于DiTs的MIND网络,通过BioMedGPT、多尺度潜在适配器和医学语义一致性损失优化,在多数据集上取得优异效果,可提升脑肿瘤分割精度并支持交互式融合。

Comments 14pages, 14 figures, accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交 79%

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27842 2026-07-31 cs.CV cs.LG 新提交 79%

FeatFix: Reuse What You Verify through Local Exact-Feature Correction for Faster Cached Diffusion Inference

FeatFix:通过局部精确特征校正重用已验证特征以实现更快的缓存扩散模型推理

Hanshuai Cui, Zhiqing Tang, Zhi Yao, Qianli Ma, Fanshuai Meng, Weijia Jia

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文针对扩散模型推理计算密集的问题,提出FeatFix方法,通过重用已验证的局部精确特征校正草稿,实现最高6.70倍的生成加速且保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27800 2026-07-31 cs.CV 新提交 79%

FDDWAN: A Frequency-Decoupled Diffusion Network for Watermarking Attack

FDDWAN:用于水印攻击的频率解耦扩散网络

Chunpeng Wang, Yuxin Li, Xiaoyu Wang, Jidong Yang, Suo Gao, Qi Li

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 该研究针对现有水印去除方法的权衡缺陷,提出FDDWAN框架,经实验验证其在水印去除与视觉保真度间的表现优于传统及学习型攻击方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27537 2026-07-31 cs.CV 新提交 79%

ProgFormer: Hierarchical Voxel Diffusion Transformer for Longitudinal Brain MRI Prediction

ProgFormer:用于纵向脑部MRI预测的分层体素扩散Transformer

Dexuan Ding, Yuankai Qi, Luping Zhou, Jian Yang, Quan Z. Sheng, Ming-Hsuan Yang

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 ProgFormer是一种分层体素扩散Transformer,通过粗-细通路结合条件流匹配,在ADNI等三个基准上实现了更优的纵向脑部MRI预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28596 2026-07-31 cs.RO 新提交 78%

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

FA-RDP:用于接触丰富操作的频率自适应反应式扩散策略

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺玛特里斯有限公司)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 FA-RDP 是一种频率自适应反应式扩散策略,通过多频率视觉-力 Transformer 和多模态指标动态调整采样策略,结合流形一致性蒸馏,在接触丰富操作任务中兼顾多模态保留与反应性,实现最高成功率。

Comments Project page: https://fa-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 78%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28344 2026-07-31 math.CA cs.LG math.AP math.PR 新提交 78%

Reflected diffusion, no-flux continuity equations and confined Lagrangian flows in bounded domains

有界域中的反射扩散、无通量连续性方程与受限拉格朗日流

Rama Cont

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对有界域中反射扩散的边际分布流,给出密度/通量对存在正则拉格朗日流的充分条件,构造反例说明边界假设不可放松,还建立无通量Fokker-Planck方程的唯一性结果,为反射扩散模型的ODE采样提供数学依据。

Comments 31 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28578 2026-07-31 math.PR cond-mat.stat-mech math-ph math.MP 新提交 78%

On two differing geometric descriptions of the passage from microscopy to macroscopy in Markov diffusion theory

马尔可夫扩散理论中从显微学到宏观学过渡的两种不同几何描述

Dalton A R Sakthivadivel

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对马尔可夫扩散理论中显微学到宏观学的过渡,构造协调两种几何描述的核心对象,实现了马尔可夫分析中微观-介观-宏观层级的部分普适化。

Comments 52+3 pages. The main text consists of 49 pages and appendices comprise the remainder

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28325 2026-07-31 cond-mat.soft 新提交 78%

Influence of Rotational Diffusion on Macromolecular Self-Assembly Kinetics

旋转扩散对大分子自组装动力学的影响

Prabeen Kumar Pattnayak, Aloke Kumar, Gaurav Tomar

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究通过匹配平动扩散系数分离旋转扩散的影响,发现大分子结合概率依赖内部结构,自组装路径受旋转扩散系数影响,建立了大分子平衡动力学与自组装动力学的关联。

Comments 26 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27551 2026-07-31 cs.CR 新提交 71%

AnchorMark: Robust Diffusion Watermarking via Latent-Space Rotation Synchrony

AnchorMark:基于隐空间旋转同步的鲁棒扩散水印

Yuqi Qian, Yun Cao, Haocheng Fu, Haochen Zhao, Hong Zhang, Meineng Zhu

专题命中 扩散模型 :diffusion(title)

AI总结 针对现有反转水印在旋转等复合攻击下鲁棒性不足的问题,提出无训练的AnchorMark,利用隐空间旋转同步属性嵌入同步锚点,提升旋转及复合攻击下的比特准确率且对图像质量影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 57%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28470 2026-07-31 cs.AI cs.CV 新提交 57%

Towards Autonomous Aircraft Surveillance from Nanosatellites through On-Board Inference and Generative Data Augmentation

基于星上推理与生成式数据增强的纳卫星自主飞机监视技术研究

Antonio Delgado-Rosa, David Muñoz-Valero, Enrique Adrian Villarrubia-Martin, Juan Moreno-Garcia

机构 * Universidad de Castilla–La Mancha(卡斯蒂利亚-拉曼恰大学) Universidad de Castilla-La Mancha(卡斯蒂利亚-拉曼恰大学) Escuela de Ingeniería Industrial y Aeroespacial de Toledo(托莱多工业与航空航天工程学院) Escuela Superior de Informática(高等信息学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对纳卫星机载监视的下行链路瓶颈与数据集类别不平衡问题,提出结合星上推理与生成式数据增强的工作流,提升了检测精度与帧率,可作为实时自主监视的决策支持工具。

Comments 43 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 57%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27749 2026-07-31 cs.CV cs.RO 新提交 57%

Articulated Object Reconstruction from Rest-State Observation

从静止状态观测的关节对象重建

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park

机构 * Seoul National University(首尔大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究针对需多关节状态运动观测的现有关节对象重建方法的局限,提出从单一静止闭合配置重建关节对象的方法,通过显式网格融合多模型输出,结合视频扩散模型实现无运动观测下的关节参数估计,性能与多种基线相当。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27634 2026-07-31 cs.CV 新提交 57%

4DHumanDiff: Direct Text-to-4DGS Generation for Consistent 360-Degree Dynamic Humans

4DHumanDiff:直接基于文本生成4DGS以实现一致的360度动态人类

Renlong Wu, Haoran Chen, Yuxiang Wei, Xiaowei Jin, Wangmeng Zuo, Hui Li

机构 * School of Computer Science and Technology, Harbin Institute of Technology(哈尔滨工业大学计算机科学与技术学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对文本生成360度动态人类的现有方法存在成本高、一致性差的问题,本文提出4DHumanDiff扩散框架,直接基于文本生成4DGS表示的动态人类,结合新数据集与技术,实现高效且一致性更好的生成。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27372 2026-07-31 cs.LG cs.AI cs.CL cs.CV 新提交 57%

Explorative Modeling: Unlocking a Third Pretraining Axis and End-to-End Generation

探索式建模:解锁第三大预训练轴与端到端生成

Alexi Gladstone, Heng Ji, Yilun Du

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) Harvard(哈佛大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出探索式建模(XMs),为生成式模型增添第三预训练轴,可提升多域性能与效率,还能实现端到端重构生成建模,推理步骤大幅减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27768 2026-07-31 cs.SD cs.AI 新提交 50%

VocalRender: Score-Native Singing Voice Synthesis for Real-World Composition

VocalRender:面向实际作曲的原生乐谱歌声合成

Yukun Chen, Tianrui Wang, Zhaoxi Mu, Xinyu Yang, EngSiong Chng

专题命中 扩散模型 :diffusion(abstract)

AI总结 VocalRender是一种原生乐谱歌声合成系统,通过歌词、音高等乐谱信息直接合成歌声,采用交错歌词-音符表示与自回归扩散模型,在2300小时数据集训练后,自然度CMOS较最强基线高0.42分,适配实际作曲工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28408 2026-07-31 cs.LG cs.AI math.ST stat.ML stat.TH 新提交 50%

On-Policy and Off-Policy Learning for Large Action Spaces

面向大动作空间的在线策略与离线策略学习

Imad Aouali

专题命中 扩散模型 :diffusion(abstract)

AI总结 本论文针对大动作空间交互式系统的策略学习挑战,提出meTS、dTS、sDM等结构化贝叶斯方法,解决在线与离线策略学习的关键问题并提供理论保证。

Comments PhD Thesis, 241 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27563 2026-07-31 cs.LG math.OC math.PR stat.AP stat.ML 新提交 50%

Strategies for Milestone-driven Start-ups in Multi-activity Settings

多活动场景下里程碑驱动型初创企业的策略

Zhengli Wang

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文构建多活动下里程碑驱动的初创企业随机控制模型,求解出仅依赖有效前沿曲线的最优策略,为创业决策提供了基础支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28614 2026-07-31 math.PR 新提交 50%

Tampered Memory Elephant Random Walk on One-Dimensional Integer Lattice

一维整数格上的篡改记忆大象随机游走

Vinita Mulay, Neeraja Sahasrabudhe, Debleena Thacker

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对一维整数格提出篡改记忆大象随机游走,确定其相变的尖锐记忆阈值为1/2,推测该阈值也适用于随机记忆划分的情形,为大象随机游走的记忆相变问题提供了关键理论结果。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28004 2026-07-31 math.PR 新提交 50%

Folding representations of reflected diffusions

反射扩散过程的折叠表示

David Itkin, Ioannis Karatzas

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对欧氏空间正则闭凸域边界上的带反射扩散过程,提出通过无约束扩散的瞬时变换(折叠)构造的新方法,完善了此类扩散过程的构建途径。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏