arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-10 至 2026-07-10 共收录 61 信号源:cs.CV, cs.GR, cs.MM

1. 文生图 4 篇

2607.08201 2026-07-10 cs.CV cs.AI 新提交 79%

TMI: Text-to-Image Meets Image-to-Image for Complementary Data Synthesis to Boost Long-Tailed Instance Segmentation

TMI:文本到图像与图像到图像结合用于互补数据合成以促进长尾实例分割

Hyeonseop Song, Seokhun Choi, Hoseok Do

机构 * LG Electronics(LG电子)

专题命中 文生图 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究针对大词汇量实例分割受长尾分布和类间模糊性限制的问题,提出结合文本到图像生成与上下文感知图像到图像编辑的混合管道,引入VRAIN编辑器,在LVIS基准测试中超越基线,有效提升分割性能。

Comments Accepted to ECCV 2026. The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07827 2026-07-10 cs.CR 新提交 78%

Open Models, Open Risks: Measuring Unsafe Generation in Text-to-Image Models In the Wild

开放模型,开放风险:衡量实际应用中的文本到图像模型的不安全生成

Peilin Han, Yang Liu, Yilong Yang, Jingchun Zhang, Teng Li, Jianfeng Ma, Zhuo Ma

专题命中 文生图 :text-to-image(title,abstract)

AI总结 研究实际应用中的文本到图像模型的不安全生成问题,通过越狱视角进行大规模实证研究。引入高级ASR改进指标,评估200多个模型,发现安全退化不普遍不均匀,识别出高风险模型并追溯其发布背景,向Hugging Face报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12886 2026-07-10 cs.CV cs.AI 新提交 70%

Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement

交错思维中的模态隔离桥接:通过逐步强化监督模态转换

Tingyu Li, Le Zhou, Siyuan Li, Yujun Wu, Xinglong Xu, Jingxuan Wei, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiaotong University(上海交通大学) Zhejiang University(浙江大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 文生图 :image generation(abstract);text-to-image(abstract);分类 cs.CV

AI总结 提出MoTiF框架,通过反射式SFT和Flow-GRPO优化模态转换保真度,解决交错思维中图像与文本脱节的模态隔离问题,提升跨模态一致性和任务准确性。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08515 2026-07-10 cs.CV 新提交 57%

Beyond wheelchairs and blindfolds: Investigating disability stereotypes in T2I models with INCLUDE-BENCH

超越轮椅和眼罩:使用INCLUDE - BENCH研究文本到图像模型中的残疾刻板印象

Sophia Lichtenberg, Albert Gatt, Judith Masthoff

机构 * Utrecht University(乌得勒支大学)

专题命中 文生图 :text-to-image(abstract);分类 cs.CV

AI总结 研究文本到图像模型中的残疾刻板印象,引入INCLUDE - BENCH基准,涵盖多维度偏见提示设计的大量图像,评估多个模型,揭示模型在残疾相关表现上的问题,如轮椅描绘占比高、多样性少等,并引入SCM分数反映刻板关联。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像编辑 1 篇

2607.08227 2026-07-10 cs.CV 新提交 57%

Multimodal 3D LUT Generation via StatLUT with Statistical Features for Photorealistic Style Transfer

通过具有统计特征的StatLUT进行多模态3D LUT生成以实现逼真的风格迁移

Yifan Wang, Zhixiang Hao, Yu Wang, Congchao Zhu

机构 * Honor Device Co., Ltd.(荣耀终端有限公司)

专题命中 图像编辑 :diffusion(abstract);分类 cs.CV

AI总结 研究针对逼真风格迁移中现有方法的瓶颈,提出StatLUT框架,通过提取统计特征、基于Transformer的Seq2Seq任务预测3D LUT及用H-Diffuser从自然语言提示合成特征,实现多模态逼真风格迁移,性能优于现有方法。

Comments 17 pages, 9 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 扩散模型 40 篇

2607.08056 2026-07-10 cs.LG cs.AI stat.ML 新提交 87%

Reinforcing the Generation Order of Multimodal Masked Diffusion Models

强化多模态掩码扩散模型的生成顺序

Yidong Ouyang, Zhe Wang, Sourav Bhabesh, Dmitriy Bespalov

机构 * University of California, Los Angeles(加州大学洛杉矶分校) AGI Foundations for AWS(AWS强化人工智能基础)

专题命中 扩散模型 :diffusion(title,abstract);image generation(abstract);text-to-image(abstract);image synthesis(abstract)

AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08337 2026-07-10 cs.LG stat.ML 新提交 82%

AutoAnchor: Stable Diffusion Unlearning Using Cross-Attention as a Manifold Surrogate

AutoAnchor:以交叉注意力作为流形替代的稳定扩散去学习

Siyuan Wen, Jiahao Zeng, Ningning Ding

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 扩散模型 :diffusion(title,abstract);text-to-image(abstract)

AI总结 研究文本到图像模型中扩散去学习的不稳定问题,提出AutoAnchor两阶段框架,利用交叉注意力一致性损失自动合成流形近端锚点,有效实现稳健无偏去学习,提升目标概念去除率和非目标效用,还可集成到现有方法中提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08770 2026-07-10 cs.CV 新提交 79%

LongE2V: Long-Horizon Event-based Video Reconstruction, Prediction, and Frame Interpolation with Video Diffusion Models

LongE2V:基于视频扩散模型的长时程基于事件的视频重建、预测和帧插值

Cheng-De Fan, Chun-Wei Tuan Mu, Chen-Wei Chang, Chin-Yang Lin, Kun-Ru Wu, Yu-Chee Tseng, Yu-Lun Liu

机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究从稀疏事件流恢复高质量视频的难题,提出LongE2V方法,利用预训练视频扩散先验,通过微调基础模型实现联合处理视频重建、预测和帧插值,在多任务上优于现有方法,有高数据效率、时间连贯性和零样本泛化能力。

Comments SIGGRAPH 2026. Project page: https://cdfan0627.github.io/LongE2V-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08241 2026-07-10 cs.CV cs.LG 新提交 79%

Closing the Null Space: Guidance-Aware Quantization for Classifier-Free Diffusion

消除零空间:用于无分类器扩散的引导感知量化

Abdullah Al Shafi, Sumaiya Rahim Suma

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究在实际计算预算下部署CFG扩散模型的量化问题,针对现有方法忽略其结构导致的问题,提出引导感知混合精度方法,通过直接校准引导预测等操作防止无条件分支漂移,实现更好量化效果。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08086 2026-07-10 cs.CV 新提交 79%

GRE-Diff: Gaussian Room Embeddings for Structured Layout Diffusion

GRE-Diff:用于结构化布局扩散的高斯房间嵌入

Jing Wang, Haoran Xiong, Zihao Yan, Minglun Gong, Hui Huang

机构 * Guangdong Provincial Key Laboratory of Visual Media and Multidimensional Intelligence, CSSE, Shenzhen University(广东省视觉媒体与多维智能重点实验室,计算机科学与软件学院,深圳大学) School of Computer Science, University of Guelph(圭尔夫大学计算机科学学院)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 本文提出GRE-Diff框架,结合AI建议与人工编辑,通过大语言模型或图形用户界面让用户指定房间相关约束和操作,利用高斯房间嵌入生成多样合理设计,实验表明其能产生高质量布局,助力空间设计中AI与人类创造力结合。

Comments 37 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06553 2026-07-10 cs.CV 新提交 79%

From RGB Generation to Dense Field Readout: Pixel-Space Dense Prediction with Text-to-Image Models

从 RGB 生成到密集场读出:使用文本到图像模型进行像素空间密集预测

Zanyi Wang, Xin Lin, Haodong Li, Dengyang Jiang, Yijiang Li

机构 * UCSD(加州大学圣地亚哥分校) HKUST(香港科技大学)

专题命中 扩散模型 :text-to-image(title,abstract);分类 cs.CV

AI总结 研究利用文本到图像模型进行像素空间密集预测,提出ReChannel方法,保留DiT输入分布的VAE编码器,去掉目标侧解码器,用任务LoRA调整,通过线性头映射令牌到像素空间补丁,在多个密集预测任务上表现出色,比对比方法更准确快速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30308 2026-07-10 cs.CV 版本更新 79%

The Surprising Effectiveness of Video Diffusion Models for Hand Motion Reconstruction

视频扩散模型在手部运动重建中的惊人有效性

Yuxi Wang, Chengkai Jin, Yufei Liu, Wenqi Ouyang, Tianyi Wei, Zhiwei Zeng, Siyuan Huang, Zhiqi Shen, Xingang Pan

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 提出ViDiHand,利用预训练视频扩散模型重建4D双手姿态,无需检测器或优化,在多个基准上显著超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14584 2026-07-10 cs.CV 版本更新 79%

Anatomically Guided Latent Diffusion for Brain MRI Progression Modeling

用于脑 MRI 进展建模的解剖学引导潜在扩散

Cheng Wan, Bahram Jafrasteh, Ehsan Adeli, Miaomiao Zhang, Qingyu Zhao

机构 * Cornell University(康奈尔大学) Weill Cornell Medicine(韦尔医学院) Stanford University(斯坦福大学) University of Virginia(弗吉尼亚大学)

专题命中 扩散模型 :diffusion(title,abstract);分类 cs.CV

AI总结 研究旨在准确建模脑 MRI 进展,提出解剖学引导潜在扩散模型 AG-LDM,通过融合多因素简化训练流程,经实验验证其在图像质量、误差降低及特征捕捉等方面表现优异,是可靠的脑 MRI 进展建模框架。

Comments 24 pages, 7 figures, 7 tables. Code available at https://github.com/JornyWan/AG-LDM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08357 2026-07-10 cs.AI 新提交 78%

MobiDiff: Semantic-Aware Multi-Channel Discrete Diffusion for Human Mobility Data Generation

MobiDiff:用于人类移动性数据生成的语义感知多通道离散扩散

Rongchao Xu, Lin Jiang, Dahai Yu, Ximiao Li, Taichi Liu, Desheng Zhang, Yuan Tian, Guang Wang

机构 * Florida State University(佛罗里达州立大学) Rutgers University(罗格斯大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究旨在解决人类移动性数据生成难题,提出MobiDiff框架,通过直接对多通道语义骨架去噪生成数据,避免复杂管道。该框架能分解事件通道并采用掩码捕获移动模式与依赖性,实验证明其在保真度、隐私保护和效率上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07967 2026-07-10 stat.ML cs.LG math.OC 新提交 78%

Expressivity and Statistical Trade-offs in Diffusion Policy Learning

扩散策略学习中的表达能力与统计权衡

Viet Vu, Renyuan Xu, Jiacheng Zhang, Yufei Zhang

机构 * Stanford University(斯坦福大学) Chinese University of Hong Kong(香港中文大学) Imperial College London(伦敦帝国理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散策略学习中表达能力与统计权衡,确定漂移Lipschitz预算K为核心量,通过近似量化表达能力,证明其与统计复杂性的关系,给出有限样本性能差距,数值实验验证,还提出根据样本大小选K及对应神经网络架构的实现原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08237 2026-07-10 math.NA cs.NA 新提交 78%

3D Virtual Element Method for Advection-Diffusion-Reaction Problems with Variable Coefficients on Locally Quasi-Uniform Polytopes

局部拟均匀多面体上变系数对流扩散反应问题的三维虚拟单元法

M. Trezzi

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对三维对流扩散反应方程,提出CIP稳定的VEM,克服二维分析依赖全局网格拟均匀性和恒定物理参数的局限,引入新拟插值建立双曲极限下误差估计,经三维数值实验验证理论收敛率且无物理振荡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08041 2026-07-10 cs.LG cond-mat.dis-nn 新提交 78%

An exact information theory of generalization phase transitions in Bayesian diffusion models

贝叶斯扩散模型中泛化相变的精确信息理论

Henry Hunt, Mason Kamb, Surya Ganguli

机构 * Stanford University(斯坦福大学)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究扩散模型如何从有限训练集学习复杂分布,引入BIRD模型,通过贝叶斯后验推断实现时间反转扩散,确定记忆与泛化的信息理论相变边界,实验证实理论预测,揭示信息受限在生成式AI中规避维度灾难的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07829 2026-07-10 math.NA cond-mat.stat-mech cs.NA 新提交 78%

Thermodynamic Structure and Composition in Nonlinear Convection-Diffusion

非线性对流扩散中的热力学结构与组成

J. J. Segura

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究非线性对流扩散系统中热力学平衡问题,开发连续优先框架,将热力学一致性表述为自由能平衡。证明相关操作下平衡可保持,推导线性模型,以实例说明,贡献了组合输运框架,使第二定律贯穿各环节。

Comments Published in Open Transport. Author-prepared arXiv version. Version of Record available at DOI: 10.1515/ot-2026-0013

Journal ref Open Transport, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24035 2026-07-10 eess.AS 新提交 78%

A Variational-Flow Analysis of Diffusion-Based Speech Enhancement under Noise-Power Mismatch

噪声功率失配下StoRM的变分流分析

Shuubham Ojha

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对扩散语音增强中SI-SDR退化曲线在训练噪声幅度处的非光滑转折,通过变分流分析将非光滑性定位到预测器阶段,并给出参数灵敏度的精确分解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16589 2026-07-10 cs.DC 新提交 78%

DRIFT: Risk-Constrained Diffusion with Imitation Priors for Mixed-Autonomy Traffic Generation

DRIFT: 基于模仿先验的风险约束扩散用于混合自主交通生成

Yaoshen Yu, Minghui Liwang, Wenbo Zhu, Xinlei Yi, Zhang Liu, Yiguang Hong, Xianbin Wang, Seyyedali Hosseinalipour

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 提出DRIFT框架,通过风险约束扩散和模仿先验,生成混合自主交通中人类与自动驾驶车辆的多样化可执行轨迹,实现安全-效率权衡。

Comments 19 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16447 2026-07-10 cs.RO cs.AI 新提交 78%

Training and Evaluating Diffusion Policies with Long Context Lengths

训练和评估具有长上下文长度的扩散策略

Abhinav Agarwal, Adam Wei, Taylan Kargin, Michael Zeng, Cole Becker, Arif Kerem Dayi, Pablo Parrilo, Asuman Ozdaglar, Russ Tedrake

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 本文首次详细研究模仿学习中上下文长度的影响,发现简单扩展上下文长度并不脆弱,并提出联合训练多上下文长度策略的方法以降低样本复杂度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08055 2026-07-10 cond-mat.mtrl-sci 版本更新 78%

Anisotropic Defect Diffusion in Layered CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$ Perovskites

层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中各向异性缺陷扩散

Konrad Wilke, Mike Pols, Titus S. van Erp, Geert Brocks, Shuxia Tao

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 研究通过分子动力学模拟探讨层状CsPbBr$_\mathrm{x}$I$_\mathrm{3-x}$钙钛矿中缺陷扩散的各向异性,揭示层状卤素排列对材料稳定性及缺陷迁移的调控作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11440 2026-07-10 cs.LG cs.AI cs.CE 版本更新 78%

GenDA: Generative Data Assimilation on Complex Urban Areas via Classifier-Free Diffusion Guidance

GenDA:基于无分类器扩散引导的复杂城市区域生成式数据同化

Francisco Giral, Álvaro Manzano, Ignacio Gómez, Ricardo Vinuesa, Soledad Le Clainche

机构 * Applied Mathematics Department, ETSIAE-School of Aeronautics, Universidad Politécnica de Madrid, Spain(马德里理工大学应用数学系) Department of Aerospace Engineering, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学航空航天工程系)

专题命中 扩散模型 :diffusion(title,abstract)

AI总结 针对仅靠稀疏传感器数据进行城市风流重建的难题,提出GenDA框架,利用多尺度图扩散架构及无分类器引导机制,在RANS模拟实验中表现出色,相比其他方法降低误差、提高相似性指数,为复杂领域环境监测提供可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08757 2026-07-10 stat.ML cs.LG cs.NA math.NA math.PR 新提交 71%

Score Accuracy Along the Forward Diffusion Does Not Certify Numerical Stability in Diffusion Sampling

正向扩散过程中的得分准确性并不能保证扩散采样中的数值稳定性

Yiwei Zhou

专题命中 扩散模型 :diffusion(title)

AI总结 研究正向扩散得分准确性与数值稳定性关系,构造特殊得分场及去噪器族揭示小正向边缘误差不能保证稳定性,对紧支集数据有肯定结果,实验展示数值轨迹增长及投影抑制效果。

Comments 27 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16920 2026-07-10 cs.CV 版本更新 70%

DeltaDeno: Zero-Shot Anomaly Generation via Delta-Denoising Attribution

DeltaDeno:通过Delta去噪归因实现零样本异常生成

Chaoran Xu, Chengkan Lv, Qiyu Chen, Yunkang Cao, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences, Beijing, China(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学人工智能学院) CASI Vision Technology CO., LTD., Luoyang, China(CASI视觉科技有限公司) School of Artificial Intelligence and Robotics, Hunan University, Changsha, China(湖南大学人工智能与机器人学院)

专题命中 扩散模型 :diffusion(abstract);inpainting(abstract);分类 cs.CV

AI总结 研究在无真实异常样本和训练情况下的零样本异常生成问题,提出DeltaDeno方法,通过对比两个扩散分支定位编辑缺陷,累积去噪增量生成掩码,经令牌级提示细化等操作提升性能,在公共数据集实验中效果良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08359 2026-07-10 cs.RO cs.AI 新提交 67%

FSD-VLN: Fast-Slow Dual-System Modeling for Aerial Long-Horizon Vision-Language Navigation

FSD-VLN:用于空中长距离视觉语言导航的快慢双系统建模

Xueke Zhu, Qingyan Meng, Liutao Yu, Wei Zhang, Zhengyu Ma, Huihui Zhou, Yonghong Tian

机构 * Pengcheng Laboratory(鹏城实验室) Shenzhen Institutes of Advanced Technology(中国科学院深圳先进技术研究院) Peking University(北京大学)

专题命中 扩散模型 :diffusion(abstract,abstract_cn)

AI总结 研究空中长距离视觉语言导航问题,提出FSD-VLN快慢双系统架构,将语义推理与低延迟飞行命令解耦,通过两个异步分支及时间感知自适应优化器实现,实验表明该方法提升导航成功率,减少推理延迟和运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08270 2026-07-10 cs.CV 新提交 57%

Progression as Latent Drift: Generative Forecasting of Slow-Evolving Pathologies

作为潜在漂移的进展:缓慢演变病理的生成预测

Yuxiang Feng, Juncheng Wang, Chao Xu, Wenlong Hou, Huihan Wang, Yijie Qian, Yang Liu, Baigui Sun, Yong Liu, Shujun Wan

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(IROOTECH技术) Wolf 1069 b Lab, Sany Group(Wolf 1069 b实验室,三一集团)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 研究针对缓慢演变神经退行性疾病未来解剖结构预测难题,提出潜在漂移的渐进生成框架,在压缩语义表示中学习变化,结合有限标量量化抑制干扰波动,实验表明该方法在神经预测上优于基线。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07880 2026-07-10 cs.CV 新提交 57%

GIRAF: Towards Generalizable Human Interactions with Articulated Objects

GIRAF:迈向与关节物体的可泛化人类交互

Xiaohan Zhang, Sebastian Starke, Alexander Winkler, Federica Bogo, Samir Aroudj, Yuting Ye

机构 * Meta

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对合成与关节物体的逼真全身人类交互难题,现有模型有局限。本文提出文本条件扩散模型,通过以物体为中心的表示、混合域训练策略和基于接触的增强方案应对挑战,实验证明其对未见物体配置泛化能力强,超越现有方法。

Comments 12 pages, 6 figures, 3 tables. Accepted at the Third Workshop on Human Motion Generation (HuMoGen), CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19480 2026-07-10 cs.CV 版本更新 57%

Deep Sprite-based Image Models: An Analysis

基于深度精灵的图像模型:一种分析

Zeynep Sonat Baltacı, Romain Loiseau, Mathieu Aubry

机构 * LIGM, CNRS, Univ Gustave Eiffel, ENPC, Institut Polytechnique de Paris(LIGM研究所、国家科学研究中心、巴黎理工大学、ENPC、巴黎理工学院)

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 本文分析了基于精灵的图像分解模型,提出了一种深度方法,在CLEVR基准上与最新无监督类感知分割方法相当,线性扩展对象数量并明确识别对象类别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 57%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 扩散模型 :diffusion(abstract);分类 cs.CV

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏