arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-08-12 至 2026-08-12 共收录 46 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 2 篇

2608.11002 2026-08-12 cs.CL cs.AI 新提交 86%

On the Limitations of Cross-Lingual Consistency in Multilingual Text-to-image Generation

多语言文本到图像生成中跨语言一致性的局限性研究

Sicheng Zhang, Zhonghao Yan, Binzhu Xie, Shi Qiu, Muzammal Naseer, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(哈利法大学) Queen Mary University of London(伦敦玛丽女王大学) The Chinese University of Hong Kong(香港中文大学) The University of Western Australia(西澳大学) The University of Melbourne(墨尔本大学) University of Central Florida(中佛罗里达大学)

专题命中 文生图 :text-to-image(title,abstract);image generation(title)

AI总结 本文针对多语言文本到图像生成的跨语言一致性局限,构建含10种语言、3.3万条提示词的LingT2I基准,经分析揭示语言相关生成规律,为开发更鲁棒的多语言T2I模型奠定基础。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 57%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 文生图 :image synthesis(abstract);分类 cs.CV

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2608.10870 2026-08-12 cs.CV 新提交 57%

NullEdit: Stealthy Image Protection via VLM Condition Redirection

NullEdit:通过视觉语言模型条件重定向实现隐秘图像保护

Weiyao Huang, Liqin Wang, Ziqi Sheng, Wei Lu

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 NullEdit针对VLM表示进行重定向,可隐秘抑制图像编辑且保留源内容,在基准模型上平均降低EditReward IF分数0.813,实现了高效的图像保护。

Comments 9 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 37 篇

2608.10995 2026-08-12 cs.CV 新提交 83%

HNDiff: Haze-Noise Diffusion for Image Dehazing

HNDiff:用于图像去雾的雾霾-噪声扩散模型

Jin-Ting He, Fu-Jen Tsai, Yan-Tsung Peng, Min-Hung Chen, Chia-Wen Lin, Yen-Yu Lin

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学) National Tsing Hua University(国立清华大学) National Chengchi University(国立政治大学) NVIDIA(英伟达)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出嵌入大气散射模型的HNDiff扩散框架,通过雾霾感知噪声调度器关联正向退化物理机制,反向同步去雾去噪,改进主流去雾骨干网络并在基准数据集达最优结果。

Comments Accepted to ECCV 2026. Project Page: https://jin-ting-he.github.io/HNDiff

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10173 2026-08-12 cs.CV 新提交 79%

DoseBridge: Denoising Diffusion Bridge Model for Dose Prediction in Lung Intensity-Modulated Proton Therapy

DoseBridge:用于肺调强质子治疗剂量预测的去噪扩散桥模型

Zerun Zhang, Xiaoda Cong, Xiangkun Xu, Peter Y. Chen, Xuanfeng Ding

机构 * Corewell Health William Beaumont University Hospital(Corewell Health William Beaumont大学医院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究针对肺调强质子治疗剂量预测问题,提出DoseBridge去噪扩散桥模型,融合CT与射野几何信息,在52例患者数据上的多项指标优于对比模型,为放疗剂量预测提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10162 2026-08-12 cs.CV 新提交 79%

MAD-HOI: Masked Autoregressive Diffusion for Generating Articulated Hand Object Interactions from Text

MAD-HOI:用于从文本生成关节手-物体交互的掩码自回归扩散模型

Ananya Bal, Kartik Sharma, Ethan Lai, Samyak Tiwari, Liza Dahiya, Chaitanya Chawla, Laszlo A. Jeni

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 MAD-HOI是一种结合掩码自回归与扩散的HOI生成模型,可生成多样且符合物理规律的手-物体交互序列,支持可变长度生成、运动补全填充等功能,在ARCTIC和GRAB数据集上优于开源基线。

Comments 17 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10983 2026-08-12 cs.IR cs.AI 新提交 78%

TimeRoute: Time-Aware Modality Routing and Diffusion for Multi-Modal Recommendation

TimeRoute:面向多模态推荐的时间感知模态路由与扩散模型

Pengyu Zhang, Yangqin Jiang, Klim Zaporojets, Congfeng Cao, Paul Groth

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 TimeRoute通过时间感知模态路由器和带FiLM的双流去噪扩散图重构器,解决多模态推荐的模态时间尺度不匹配问题,在三个公开数据集上提升了推荐指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10980 2026-08-12 cs.SD 新提交 78%

Measuring Cross-Cultural Style Diffusion Through Era Classification: US and Korean Popular Music

通过时代分类测量跨文化风格传播:美国与韩国流行音乐

Dasol Lee, Minhee Lee, Seonguk Ju, Daewoong Kim, Harin Lee, Dasaem Jeong

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出时代分类框架,通过CNN分类器量化美韩流行音乐的跨文化风格传播,发现1960-80年代韩流滞后美流4-5年,90年代后偏差缩小,该框架可推广至其他榜单文化对。

Comments 8 pages, 6 figures, 4 tables. Accepted at ISMIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10941 2026-08-12 cs.LG 新提交 78%

Physics-informed Diffusion Generative Model for Time-Series Data Synthesis in Dynamic Systems

用于动态系统时间序列数据合成的物理信息扩散生成模型

Haiteng Wang, Yunfei Zhu, Tao Wang, Yikang Li, Jiabao Dong, Xiaoge Zhang, Lei Ren

机构 * Beihang University(北京航空航天大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出PhysDGM模型,将物理规则嵌入扩散生成过程以合成符合物理定律的工业时间序列,构建的440万样本数据集可提升下游任务性能并减少数据需求,助力数据稀缺环境的AI应用。

Comments 27 pages; 5 main figures and 4 extended data figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10615 2026-08-12 cs.CL 新提交 78%

Simplex Relaxation for Discrete Diffusion

离散扩散的单纯形松弛

Jinya Sakurai, Patrick Pynadath, Satoshi Hayakawa, Jaehong Yoon, Xulei Yang, Nancy F. Chen, Xun Xu

机构 * NTU Singapore(新加坡南洋理工大学) The University of Tokyo(东京大学) Purdue University(普渡大学) Institute for Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) Centre for Frontier AI Research (CFAR), A*STAR(新加坡科技研究局前沿人工智能研究中心)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出Simplax方法,通过单纯形松弛丰富离散扩散模型的训练目标与反向转移,在OpenWebText和数独生成任务中取得了更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10438 2026-08-12 cs.AI 新提交 78%

Continuous Interaction Diffusion: A Diffusion-Native Runtime for Asynchronous Tool-Augmented Reasoning

连续交互扩散:面向异步工具增强推理的原生扩散运行时

Yuhang Cao

机构 * Nanjing University(南京大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语言模型异步工具增强推理的局限,提出连续交互扩散架构,将工具交互整合至迭代去噪,可提升效率并减少冗余,首次聚焦只读工具。

Comments 15 pages, 5 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10393 2026-08-12 cs.AI cs.RO 新提交 78%

Hidden in Plain Sight: Diffusion-Based Unrestricted Robotic Attacks on Vision-Language-Action Models

隐藏于明处:针对视觉-语言-动作模型的基于扩散的无约束机器人攻击

Jiahui Han, Yuhui Yao, Xin Wang, Jiafei Cao, Mingxuan Zhang, Danfeng Shan, Huiqi Deng, Guanchu Wang, Xia Hu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本研究提出基于扩散的无约束机器人攻击方法DURA,针对视觉-语言-动作模型生成自然对抗补丁,实验表明其性能优于现有方法,暴露了物理部署的VLA模型的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11178 2026-08-12 math.PR 新提交 78%

A submartingale for the probability of avoiding the origin in one-point interaction ground-state diffusion: $d \in \{2,3\}$

单点相互作用基态扩散中避开原点概率的次鞅:$d \in \{2,3\}$

Barkat Mian

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对二维和三维带单点势的奇异扩散,构造次鞅分析其击中原点的概率、首次击中时间分布及避开原点的条件动力学,以统一方法验证相关性质。

Comments 35 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11172 2026-08-12 math.AP 新提交 78%

A reaction-diffusion system with nonconstant diffusion coefficients: exact and numerical solutions

带有非常数扩散系数的反应-扩散系统:精确解与数值解

Roman Cherniha, Galyna Kriukova

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文研究带非常数扩散的Lotka-Volterra反应-扩散系统,构造多参数精确解,证明其满足零Neumann条件及存在两个稳定稳态点,用精确解求解边值问题并验证小扰动下数值解与精确解吻合度高。

Comments 21 pages, 7 figures

Journal ref Axioms, 2025, vol.14, 655

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11107 2026-08-12 math.AP 新提交 78%

Harnack-type inequalities and traveling waves for non-cooperative nonlocal diffusion systems

非合作非局部扩散系统的哈纳克型不等式与行波

Bo-Sheng Chen, Chang-Hong Wu

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文针对实数域上弱耦合非局部扩散系统,建立了不依赖耦合矩阵合作性或不可约性的ℓ¹-范数哈纳克型不等式,结合重标度论证等方法,得到了一类带网络结构的非合作非局部扩散系统行波的最小波速存在性及波剖面负无穷处的精确渐近行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11055 2026-08-12 math.NA cs.NA 新提交 78%

Diffusion Quasi-Monte Carlo

Jianlong Chen, Yifeng Yu

专题命中 扩散模型 :diffusion(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10868 2026-08-12 cond-mat.dis-nn math-ph math.MP quant-ph 新提交 78%

Analytical Theory for Anomalous Diffusion in the Anderson Model with Heavy Tails

具有重尾跳变幅度的安德森模型中反常扩散的分析理论

Elizaveta Safonova, Aleksey Lunkin, Mikhail Feigel'man

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 该研究针对具有重尾跳变幅度的非相互作用安德森模型建立反常输运分析理论,推导均方位移时间依赖关系,发现稀有跳变过程可作为单粒子机制产生反常输运,为区分两类动力学提供基准。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10985 2026-08-12 cs.CV 新提交 70%

PEAK: Precise and Persistent Concept Erasure via k-Sparse Autoencoders

PEAK:基于k稀疏自编码器(kSAEs)的精确且持久的概念擦除

Man Jiang, Ouxiang Li, Weibao Xue, Zhenhua Tang, Yuan Wang, Shuo Wang, Yanbin Hao

专题命中 扩散模型 :text-to-image(abstract);diffusion(abstract);分类 cs.CV

AI总结 本研究针对文本到图像扩散模型的概念擦除难题,提出基于k稀疏自编码器的PEAK框架,实现了精确持久的概念擦除,在I2P基准上大幅降低了冒犯性内容检测量与攻击成功率,同时保留了生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10000 2026-08-12 eess.IV cs.CV 新提交 57%

Pre- to Post-Contrast Synthesis of Breast DCE-MRI using Latent Bridge Matching

基于潜在桥匹配的乳腺动态对比增强MRI从造影前到造影后合成

Sina Amirrajab, Zohaib Salahuddin, Henry C Woodruff, Philippe Lambin

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 该研究提出潜在桥匹配框架,在MAMA-SYNTH挑战中从乳腺DCE-MRI造影前图像合成峰值增强图像,肿瘤条件变体性能优于造影前条件及LDM基线,为虚拟造影增强提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11205 2026-08-12 cs.CV 新提交 57%

AdvFD: Boosting Visual Generation via Adversarial Fr'echet Distance Loss

AdvFD:通过对抗性Fréchet距离损失提升视觉生成性能

Mingju Gao, Jingkai Zhou, Kun Gai, Changqian Yu, Hao Tang

机构 * Peking University(北京大学) KlingAI(可灵AI)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出AdvFD算法,通过补充静态Fréchet损失的对抗学习表示并引入真实特征白化,解决Fréchet攻击问题,提升了JiT、pMF等骨干网络的单步生成器后训练性能。

Comments Project Page: https://gasaiyu.github.io/AdvFD-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10933 2026-08-12 cs.CV 新提交 57%

SafeCA: Safe Cross-Attention Localization and Regulation for Text-to-Video Jailbreak Defense

SafeCA:用于文本到视频越狱防御的安全交叉注意力定位与调控

Siyuan Liang, Yupeng Qiu, Junfeng Fang, Rong-Cheng Tu, Jiaxing Huang, Dacheng Tao

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 SafeCA是一种特征级T2V越狱防御机制,通过分析交叉注意力特征差异提出,可降低主流模型越狱成功率约20%,仅增0.1s推理开销且保持语义一致性,提供架构级可部署防护范式。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10744 2026-08-12 cs.CV 新提交 57%

Beyond Pixels: From Video Priors to 4D Worlds

超越像素:从视频先验到4D世界

Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文提出Latent-to-4D方法,利用共享VAE的视频模型去噪潜在变量作为接口实现4D生成,在两个数据集上的DINO-F1指标优于对比方法,且受人类评估者认可。

Comments Project page: https://hayd-zju.github.io/Beyond-Pixels

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10519 2026-08-12 cs.CV 新提交 57%

SparSTAR: Sparse Attention for SpaceTime AutoRegressive Video Synthesis

SparSTAR:用于时空自回归视频合成的稀疏注意力机制

Jongbeom Lee, Hyunwoo Yu, Jincheol Yang, Jaemin Choi, Suk-Ju Kang

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对InfinityStar视频合成中高成本注意力与不可靠稀疏模式问题,提出无需训练的SparSTAR块稀疏注意力,在720p生成任务中实现约1.6倍加速且保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10439 2026-08-12 cs.CV 新提交 57%

Stream Forcing: Constructing Unified Training Trajectory for Robust Streaming Video Generation

流强制:构建用于鲁棒流视频生成的统一训练轨迹

Yueting Zhu, Yuehao Song, Kaicheng Zhang, Bao Tang, Shaoyu Chen, Qian Zhang, Wenyu Liu, Xinggang Wang

机构 * Huazhong University of Science & Technology(华中科技大学) Horizon Robotics(地平线机器人) Anyverse Dynamics

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对流视频扩散模型的训练-推理不匹配问题,提出Stream Forcing统一训练框架,通过构建训练轨迹及相关算法,在UCF-101基准测试中FVD分别提升36.6%、27.9%,提升了生成质量与长时序泛化能力。

Comments 15 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10435 2026-08-12 cs.CV 新提交 57%

DynaPPI: A Large-scale Dynamic Protein Dataset for AI-driven Advances in Protein Interactomics

DynaPPI:面向AI驱动蛋白质互作组学进展的大规模动态蛋白质数据集

Jiabao Wei, Zilong Geng, Yuze Wang, Jianjun Li, Ning Ding, Bowen Zhou, Bing Zhang, Zhiyuan Ma

机构 * BIT(北京理工大学) HUST(华中科技大学) SJTU(上海交通大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本研究提出DynaPPI动态蛋白质数据集,填补现有数据集忽略多体结合动态过程的空白,助力扩散模型预测未知蛋白质复合物结构,推动AI驱动的蛋白质互作组学发展。

Comments 9 pages, 1 figure, 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: AI4Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10598 2026-08-12 q-bio.BM 新提交 50%

Is Retrieval All You Need? Assessment and Emergence of Novelty in Protein Structure Generation

检索就是全部所需?蛋白质结构生成中的新颖性评估与涌现

Tongyue Xu, Yijie Zhang, Mutian He, Lingdong Shen, Zhihong Liu, Tianlei Ying, Cheng Tan

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究针对蛋白质结构生成模型的新颖性评估问题,引入DRR指标,分析8种模型的输出,提出零训练基线RetFold,成本远低于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11114 2026-08-12 cs.LG cs.AI 新提交 50%

Two-stage Odd Residual Flows for Mean-Preserving Probabilistic Time Series Forecasting

用于保均值概率时间序列预测的两阶段奇数残差流

Kiran Madhusudhanan, Christian Klötergens, Lars Schmidt-Thieme, Vijaya Krishna Yalavarthi

专题命中 扩散模型 :diffusion(abstract)

AI总结 针对概率预测中分布灵活性与均值准确性的权衡,提出两阶段奇数残差流框架,解耦均值预测与不确定性估计,在长短时域预测中同时实现最优确定性精度与出色密度估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11045 2026-08-12 cs.LG cs.CL 新提交 50%

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound:用于解决无校准LLM量化中中点歧义的重构舍入法

He-Yen Hsieh, H. T. Kung

专题命中 扩散模型 :diffusion(abstract)

AI总结 ReRound是一种后训练量化方法,通过条件扩散模型解决无校准LLM量化的中点歧义,在小型LLM的3、4比特量化上优于标准RTN,性能接近依赖校准方法且无额外推理开销。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10921 2026-08-12 eess.SY cs.SY 新提交 50%

Multi-Rate Distributed Unscented Kalman Filtering Under Collective Detectability

集体可检测性下的多速率分布式无迹卡尔曼滤波

Mohammad Ali Abooshahab, Morten Hovd

专题命中 扩散模型 :diffusion(abstract)

AI总结 本文针对无融合中心的非线性网络,提出多速率分布式UKF方法,基于集体可检测性实现信息扩散,在多速率采样下保持稳定且精度优于五轮协方差平均一致性。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10210 2026-08-12 cs.SI 新提交 50%

FUBU-EPSTEIN: A Large-Scale Twitter Dataset on the Jeffrey Epstein Case and Its Global Public Discourse (2019-2023)

FUBU-EPSTEIN:关于杰弗里·爱泼斯坦案件及其全球公众讨论的大规模Twitter数据集(2019-2023)

Michael Kreil, Tristan Manfred Stöber, Daniel Thilo Schroeder

专题命中 扩散模型 :diffusion(abstract)

AI总结 该研究推出了FUBU-EPSTEIN数据集,包含5438万条Twitter状态等数据,经去标识化处理后发布,支持爱泼斯坦案件相关的计算研究,降低了数据泄露风险。

详情

展开后加载摘要…

URL PDF HTML 收藏