arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-06-17 至 2026-06-17 共收录 99 信号源:cs.CV, cs.GR, cs.MM

1. 个性化与一致性 4 篇

2606.17619 2026-06-17 cs.CV 新提交 79%

RAVA: Retrieval-Augmented Viewpoint Alignment for Subject-Driven Image Generation

RAVA: 检索增强的视角对齐用于主题驱动图像生成

Qiwei Yan, Zhiqiang Yuan, Chongyang Li, Jiapei Zhang, Ying Deng, Jinchao Zhang, Jie Zhou

机构 * WeChat AI, Tencent Inc.(腾讯微信人工智能实验室)

专题命中 个性化与一致性 :image generation(title,abstract);分类 cs.CV

AI总结 提出RAVA框架,通过检索增强提供几何证据,解决跨主体视角对齐中的视角漂移和结构不匹配问题,在保持身份的同时实现可靠视角控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18156 2026-06-17 cs.CV cs.AI 新提交 57%

ReAge3D: Re-Aging 3D Faces with View Consistency

ReAge3D:具有视角一致性的3D人脸回龄

Libing Zeng, Li Ma, Mingming He, Ning Yu, Paul Debevec, Nima Khademi Kalantari

机构 * Texas A&M University(德克萨斯农工大学) Netflix Eyeline Studios

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 提出ReAge3D框架,通过2D扩散模型DiffReaging和中心向外编辑传播策略,实现多视角一致的3D人脸回龄,保持身份和细节,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17296 2026-06-17 cs.CV 新提交 57%

Pareto LoRA: Mitigating Modality Imbalance in Unified Multimodal Models via Pareto-Optimal Gradient Integration

Pareto LoRA:通过帕累托最优梯度集成缓解统一多模态模型中的模态不平衡

Xiwen Wei, Mark Nutter, Madhusudhanan Srinivasan, Radu Marculescu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Advanced Micro Devices, Inc.(超威半导体公司)

专题命中 个性化与一致性 :image generation(abstract);分类 cs.CV

AI总结 针对统一多模态模型在LoRA微调中语言梯度主导优化导致图像生成质量下降的问题,提出帕累托最优梯度集成策略Pareto LoRA,通过调节梯度方向和强度平衡文本与图像目标,在CoMM基准上显著提升图像感知质量达44.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15148 2026-06-17 cs.RO cs.AI 新提交 50%

MimicIK: Real-Time Generative Inverse Kinematics from Teleoperation with FK Consistency

MimicIK: 基于遥操作且保持正运动学一致性的实时生成式逆运动学

Jiahao Yang, Shenhao Yan, Fan Feng, Chengsi Yao, Ge Wang, Zhixin Mai, Yiming Zhao, Yatong Han

机构 * Ising AI CUHK-Shenzhen(香港中文大学(深圳))

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 提出MimicIK框架,利用条件流匹配从遥操作数据学习平滑鲁棒的关节空间运动先验,通过两阶段迭代优化和正运动学一致性损失实现实时逆运动学求解,在6-DOF机器人数据集上达到4.65mm位置误差和92.01%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 图像生成评测 2 篇

2605.09313 2026-06-17 cs.CV 版本更新 87%

Attention Sinks in Diffusion Transformers: A Causal Analysis

扩散变换器中的注意力 sinks:一种因果分析

Fangzheng Wu, Brian Summa

机构 * Department of Computer Science, Tulane University, New Orleans, LA, USA(路易斯安那州新奥尔良大学计算机科学系)

专题命中 图像生成评测 :diffusion(title,abstract);text-to-image(abstract,abstract_cn);分类 cs.CV

AI总结 研究探讨了扩散变换器中注意力 sinks 的作用,通过动态识别并抑制注意力接收者,发现其对文本-图像对齐和偏好代理影响有限,但强干预下出现特定边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 50%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 效率与蒸馏 3 篇

2605.15980 2026-06-17 cs.CV 版本更新 79%

Flash-GRPO: Efficient Alignment for Video Diffusion via One-Step Policy Optimization

Flash-GRPO:通过单步策略优化实现视频扩散的高效对齐

Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li, Dacheng Yin, Shuai Dong, Haoyang Huang, Hongfa Wang, Nan Duan, Bohan Zhuang

机构 * Zhejiang University(浙江大学) Joy Future Academy(京东探索研究院) Independent Researcher(独立研究员) Tsinghua University(清华大学)

专题命中 效率与蒸馏 :diffusion(title,abstract);分类 cs.CV

AI总结 提出Flash-GRPO单步训练框架,通过等时分组和时间梯度校正解决计算瓶颈,在低计算预算下实现优于全轨迹训练的对齐质量和训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11146 2026-06-17 quant-ph physics.comp-ph 50%

An efficient explicit implementation of a near-optimal quantum algorithm for simulating linear dissipative differential equations

一种高效的显式实现方法,用于模拟线性耗散微分方程的近优量子算法

Ivan Novikau, Ilon Joseph

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 本文提出一种高效块编码技术,用于实现线性哈密顿量模拟,通过混合时间尺度模拟耗散问题,采用坐标变换将求和指数转化为三角函数,提升量子电路效率,并在数字模拟器上验证了其在输运-扩散方程中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15379 2026-06-17 stat.ML cs.LG math.PR math.ST stat.TH 版本更新 50%

Randomized Midpoint Method for Log-Concave Sampling under Constraints

对数凹分布约束采样的随机中点方法

Yifeng Yu, Shijie Zhang, Lu Yu

机构 * Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(深圳MSU-BIT大学人工智能研究院) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 提出约束域中过阻尼和动能朗之万扩散的随机中点离散化方法,通过投影算子建立统一框架,证明Wasserstein-q距离下的收敛保证并得到近最优下界。

详情

展开后加载摘要…

URL PDF HTML 收藏