arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-29 至 2026-07-29 共收录 2 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 2 篇

2607.25901 2026-07-29 cs.IR 新提交 83%

RecoReward: Recommender-Guided Multimodal Description Generation for Recommendation

RecoReward:用于推荐的推荐器引导多模态描述生成

Guohong Mu, Yueyang Liu, Jiangxia Cao, Changxin Lao, Zijie Zhuang, Yuhui Zhang, Jiaqi Feng, Ruochen Yang, Shuang Yang, Zhaojie Liu, Qibin Hou

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract)

AI总结 研究针对多模态推荐中传统方法不足,提出RecoReward,训练时用行为衍生奖励,保留仅内容推理。在直播推荐中利用用户历史等估计亲和力,通过推荐器亲和力分数提供反馈,实验表明该方法能提升MLLM性能,利于下游推荐且保留内容服务。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25642 2026-07-29 cs.CV cs.CL 新提交 57%

Instruction-based Image Editing: A Survey on Data, Models, Evaluation, and Applications

基于指令的图像编辑:数据、模型、评估及应用综述

Xianghao Zang, Zijian Jiang, Jiarong Cheng, Qianrui Teng, Ying He, Yuxuan Mu, Chao Ban, Huayu Zhang, Lanxiang Zhou, Zerun Feng, Chi Zhang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 综述基于指令的图像编辑研究,围绕任务定义、数据构建、模型架构、评估指标及商业应用五个维度展开,提出综合深度诊断基准,通过开源方案比较揭示优缺点,探讨未来研究方向以推动该领域发展。

Comments 33 pages, 7 figures, Vicinagearth

Journal ref Zang, X., Jiang, Z., Cheng, J. et al. Instruction-based image editing: a survey on data, models, evaluation, and applications. Vicinagearth 3, 3 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏