arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-22 至 2026-07-22 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 5 篇

2607.18637 2026-07-22 cs.RO cs.LG 新提交 78%

End-to-end Conditional Diffusion for Realistic and Controllable Visual Traffic Scenario Generation

用于逼真且可控的视觉交通场景生成的端到端条件扩散

Jingzheng Li, Yufei Ge, Zhijun Chen, Qianren Mao, Zizhe Wang, Binhang Qi, Bing Li, Keyu Chen, Baochang Zhang, Xianglong Liu, Philip S Yu

机构 * Zhongguancun Laboratory(中关村实验室) Tianjin University(天津大学) Beihang University(北京航空航天大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) State Key Laboratory of Software Development Environment(软件开发环境国家重点实验室) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 可控生成 :diffusion(title,abstract)

AI总结 研究如何生成逼真且可控的视觉交通场景,提出端到端条件扩散框架E2E-CDiff,基于前视图视觉观察联合去噪未来运动状态等,减轻规划控制不匹配,实验表明其在可控性与逼真性权衡上表现良好,还能引发挑战性交互,作为自我规划器有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19000 2026-07-22 cs.CV 新提交 57%

Learning Semantic-Robust Change Detection via Semantic-Invariant Self-Distillation

通过语义不变自蒸馏学习语义鲁棒的变化检测

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对遥感图像变化检测中模型特征易受非语义变化干扰的问题,提出SCDistill框架,通过语义不变自蒸馏策略和扩散扰动模拟管道,增强语义一致性并扩展数据,提升变化检测性能,在多基准测试中达最优,泛化能力强。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18924 2026-07-22 cs.CV 新提交 57%

Learning Explicit Physical Parameter Control and Benchmarking for Video Generation

学习用于视频生成的显式物理参数控制和基准测试

Yanxun Li, Hao Wen, Bingze Song, Jiashu Zhu, Aiming Hao, Chubin Chen, Jintao Chen, Jiahong Wu, Xiangxiang Chu, Miao Wang

机构 * Beihang University(北京航空航天大学) Alibaba Group(阿里巴巴集团)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对图像到视频生成中物理参数控制问题,引入含密集物理参数化的数据集PhyParam-Dataset,提出物理引导的扩散模型PhyParam,建立基准PhyParam-Bench,通过实验证明该模型能在保持视觉保真度时提升物理一致性。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18917 2026-07-22 cs.CV 新提交 57%

TAP-RAG: Task-Aware Policy Control for Long-Document Multimodal Question Answering

TAP-RAG:用于长文档多模态问答的任务感知策略控制

Zhong Ji, Keqi Jin, Yan Zhang, Jiasheng Li

机构 * School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院) The International Joint Institute of Tianjin University(天津大学国际联合学院) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究长文档多模态问答,提出TAP-RAG框架,含任务感知策略控制器及两个执行器,能预测任务先验、估计证据信号并生成策略,在多模态文档图上扩展证据,在相关数据集上取得最佳总体准确率。

Comments 18 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16727 2026-07-22 cs.CV cs.LG 版本更新 57%

Pain in 3D: Generating Controllable Synthetic Faces for Automated Pain Assessment

3D 中的疼痛:生成用于自动疼痛评估的可控合成面部

Xin Lei Lin, Soroush Mehraban, Abhishek Moturu, Babak Taati

机构 * Vector Institute(向量研究所) KITE Research Institute(KITE研究机构) University Health Network(大学健康网络) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Medical Imaging, University of Toronto(多伦多大学医学成像系) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所)

专题命中 可控生成 :diffusion(abstract);分类 cs.CV

AI总结 研究针对面部表情自动疼痛评估面临的数据稀缺等问题,提出3DPain数据集及三阶段框架合成多视图面部,还引入ViTPain框架,为可推广的自动疼痛评估建立了可控、多样且基于临床的基础。

详情

展开后加载摘要…

URL PDF HTML 收藏