arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-19 至 2026-08-19 共收录 13 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 13 篇

2607.09520 2026-08-19 cs.CV cs.AI 版本更新 89%

Seeing is Free, Speaking is Not: Uncovering the True Energy Bottleneck in Edge VLM Inference

眼见无需耗能,言语却要代价:揭示边缘视觉语言模型推理中的真正能量瓶颈

Junfei Zhan, Haoxun Shen, Mingang Guo, Zixuan Huang, Tengjiao He

机构 * University of Pennsylvania(宾夕法尼亚大学) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Jinan University(暨南大学)

专题命中 VLM训练与架构 :VLM(title,summary_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 研究边缘VLM推理的能量瓶颈,通过系统能量分析发现平均推理功率恒定,输出令牌耗时多是关键,图像复杂度因输出长度影响能量,揭示视觉令牌修剪局限,控制输出长度能大幅节能。

Comments Accepted to ACM MM 2026. This version includes the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17722 2026-08-19 cs.CR cs.LG 新提交 85%

MemCatalyst: Amplifying Data Auditing on Vision-Language Models via Data Poisoning

MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计

Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16978 2026-08-19 cs.RO cs.LG 新提交 84%

VLCP: Vision Language Control Policy Closed-Loop Code Replanning for Robot Manipulation

VLCP:用于机器人操纵的视觉语言控制策略闭环代码重规划

Dhia Naouali, Minghan Wu, Claudia Wong, Abhinav Puthran, Omar G. Younis

机构 * University of Monastir(莫纳斯提尔大学) St. Mildred’s-Lightbourn School(圣米尔德雷德-莱特本学校) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学) Silverstream AI(银流人工智能公司) Mila -- Quebec AI Institute(米拉-魁北克人工智能研究所)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.LG

AI总结 VLCP是一种无需训练的机器人操纵策略,通过在单回合内每K步由VLM重写控制代码闭合循环,在57项任务的评估中综合成功率达35.1%,较开环策略提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16927 2026-08-19 cs.LG cs.CV 新提交 82%

Hierarchical Data Selection via Manifold Coverage and Sparse Feature Coverage in LLM Post-training

大语言模型后训练中基于流形覆盖与稀疏特征覆盖的分层数据选择

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 本文提出MASS算法,将LLM后训练的数据选择建模为分层覆盖问题,在Vision Flan与LLaVA-CoT上仅用少量数据即可达到或超过全量训练效果,且优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16926 2026-08-19 cs.LG 新提交 81%

Data-DPO: Direct Preference Optimization for Target Model Data Selection in LLM Post-Training

Data-DPO:面向大语言模型后训练中目标模型数据选择的直接偏好优化

Peng Sun, Yi Yang, Antong Zhang, Chunxiao Li, Yanbo Wang, Dianbo Liu, xin chen, Kai Yu, Lu Chen, Tianfan Fu

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);分类 cs.LG

AI总结 针对现有数据选择方法忽略数据与目标模型能力分布兼容性的问题,提出Data-DPO方法,结合目标模型偏好、外部质量评分与边际多样性筛选数据,在Vision-Flan和LLaVA-CoT上性能优于基线及全数据训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23088 2026-08-19 cs.CV 版本更新 74%

Cytoarchitecture in Words: Weakly Supervised Vision-Language Modeling for Human Brain Microscopy

词中结构:用于人类大脑显微镜的弱监督视觉-语言建模

Matthew Sutton, Katrin Amunts, Timo Dickscheid, Christian Schiffer

机构 * Institute of Neuroscience and Medicine (INM-1), Research Centre Jülich(神经科学与医学研究所(INM-1),焦耳研究中心) Helmholtz AI, Research Centre Jülich(海德堡人工智能研究所,焦耳研究中心) Institute for Brain Research, University Hospital Düsseldorf(脑研究所在杜塞尔多夫大学医院) Computer Vision, Institute for Computational Visualistics, University of Koblenz(计算机视觉,计算视觉研究所,科布伦茨大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本研究提出了一种弱监督视觉-语言建模方法,通过标签介导生成人类大脑显微镜的区域描述,实现了在缺乏配对标注情况下的自然语言生成。

Comments 13 pages, 5 figures, accepted for inclusion at GCPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17423 2026-08-19 cs.RO cs.LG 新提交 70%

Prism-GRPO: Faster VLA Policy Optimization via Splitting Same-outcome Groups

Prism-GRPO:通过拆分相同结果组实现更快的视觉-语言-动作(VLA)策略优化

Zeyun Deng, Yuzhe Lu, Yawei Wang, Linbo Liu, Qing Ping, Han Ding, Guande Wu, Panpan Xu, Jun Huan

机构 * AWS AI(亚马逊云科技人工智能部门)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出 Prism-GRPO 算法,通过拆分 GRPO 的相同结果组并引入加权执行质量分数,减少机器人 rollout 预算浪费,在四个 RoboTwin 任务中使达到目标成功率的 rollout 最多减少 56%,还抑制了奖励黑客捷径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17514 2026-08-19 cs.CV cs.MM 新提交 57%

SE-MoLoRA: Shared-Expert LoRA Adapters for Domain-Specific Photographic Assessment

SE-MoLoRA:用于特定领域摄影评估的共享专家LoRA适配器

Bishwash Khanal, Anlan Zhang, Sasu Tarkoma, Tommi Mikkonen, Abhishek Kumar

机构 * Faculty of Information Technology(信息技术学院) University of Jyväskylä(于韦斯屈莱大学) Adobe Research(奥多比研究院) University of Helsinki(赫尔辛基大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SE-MoLoRA框架,通过共享LoRA专家与路由适配器解耦通用摄影知识和专业判断,在摄影评论生成任务上显著提升BERTScore-F1,且更受偏好、参数更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17402 2026-08-19 cs.CV 新提交 57%

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar

机构 * Meta

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17203 2026-08-19 stat.ML cs.LG math.ST 新提交 57%

Expressivity In Multimodal Contrastive Learning

多模态对比学习中的表达能力

Andrew Stuart, Florian Wolf

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 该研究针对多模态对比学习的表达能力展开分析,明确CLIP架构的表达能力随模态数量变化,提出Hadamard-CLIP模型,实现任意数量模态联合分布的通用近似且保留CLIP的检索优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15062 2026-08-19 cs.CL cs.LG 版本更新 57%

RecurrentGPT: Expressive Depth through Recurrent Modulation in Transformers

RecurrentGPT:通过Transformer中的循环调制实现表达性深度

Amr Hegazy, Amr Alanwar, Mostafa Elhoushi

机构 * The German University in Cairo(开罗德国大学) Technical University of Munich(慕尼黑工业大学) Cerebras Systems Inc.(赛布拉斯系统公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 本文提出RecurrentGPT,通过循环调制解决Transformer语言模型表达性与内存效率的矛盾,在多约束下优于基线模型,实现参数与内存的高效利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03553 2026-08-19 cs.AI cs.CL cs.DL 版本更新 57%

Chronos: The AI Co-Historian

迈向AI历史学家:从原始资料中进行代理信息提取

Lorenz Hufe, Niclas Griesshaber, Gavin Greif, Sebastian Oliver Eck, Pieter Francois, Wojciech Samek, Christian Schroeder de Witt, Philip Torr

机构 * Torr Vision Group, Department of Engineering Science, University of Oxford(牛津大学工程科学系托尔视觉组) Oxford Centre for Economic and Social History, University of Oxford(牛津大学牛津经济与社会史中心) Faculty of Music, University of Oxford(牛津大学音乐学院) Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.AI

AI总结 本文介绍Chronos项目首个模块,通过自然语言交互将历史文献图像转化为数据,允许历史学家自定义流程、评估模型性能并迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-19 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 VLM训练与架构 :grounding(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏