arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-26 至 2026-06-26 共收录 5 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 5 篇

2606.26899 2026-06-26 cs.AI 新提交 71%

Generative Retrieval via Diffusion Transformer with Metric-Ordered Sequence Training and Hybrid-Policy Preference Optimization

基于扩散Transformer的生成式检索:度量有序序列训练与混合策略偏好优化

Chenghao Liu, Yu Zhang, Zhongtao Jiang, Kun Xu, Zhenwei An, Renzhi Wang, Zhao Wang, Jiachen Zhang, Yuxiao Zhang, Kun Xu, Songfang Huang

机构 * Peking University(北京大学)

专题命中 图像生成评测 :diffusion(title)

AI总结 针对模式保持的属性检索任务,提出MO-DiT+HPPO框架,通过度量有序训练和混合策略偏好优化,在八个领域分割中七个取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27376 2026-06-26 cs.CV 新提交 70%

Ask, Solve, Generate: Self-Evolving Unified Multimodal Understanding and Generation via Self-Consistency Rewards

Ask, Solve, Generate: 通过自一致性奖励实现自我进化的统一多模态理解与生成

Ritesh Thawkar, Shravan Venkatraman, Omkar Thawakar, Abdelrahman Shaker, Fahad Khan, Hisham Cholakkal, Salman Khan, Rao Muhammad Anwer

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出一个自我进化的训练框架,通过内部角色(提议者、求解者、生成者)和自一致性信号,无需人工标注或外部奖励模型,同时提升统一多模态模型的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07295 2026-06-26 cs.CV cs.AI cs.LG 版本更新 70%

Reconstruction Alignment Improves Unified Multimodal Models

重建对齐改进统一多模态模型

Ji Xie, Trevor Darrell, Luke Zettlemoyer, XuDong Wang

机构 * UC Berkeley(加州大学伯克利分校) University of Washington(华盛顿大学) Duke University(杜克大学)

专题命中 图像生成评测 :image generation(abstract);diffusion(abstract);分类 cs.CV

AI总结 提出重建对齐(RECA),一种资源高效的后训练方法,利用视觉理解编码器嵌入作为密集文本提示,通过自监督重建损失对齐理解与生成,显著提升多种统一多模态模型的生成和编辑性能。

Comments 43 pages, 36 figures and 14 tables; accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26498 2026-06-26 math.OC cs.LG 新提交 50%

Mean-Field PhiBE: Continuous-Time Mean-Field Reinforcement Learning from Discrete-Time Data

平均场 PhiBE:基于离散时间数据的连续时间平均场强化学习

Erhan Bayraktar, Martin Hernandez, Qinxin Yan, Yuhua Zhu

机构 * Department of Mathematics, University of Michigan, Ann Arbor, MI, USA(密歇根大学数学系,安阿伯,密歇根州,美国) Department of Statistics and Data Science, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校统计与数据科学系,加利福尼亚州,美国) Program in Applied and Computational Mathematics, Princeton University, Princeton, NJ, USA(普林斯顿大学应用与计算数学项目,普林斯顿,新泽西州,美国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对仅离散时间数据可用但种群连续演化的模型无关连续时间平均场控制问题,提出平均场PhiBE方法,将离散时间信息融入Wasserstein空间上的连续时间PDE,并推导策略梯度定理,实现模型无关的演员-评论家算法,证明一阶一致性估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 50%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏