arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-28 至 2026-07-28 共收录 7 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 7 篇

2607.22603 2026-07-28 cs.AI 新提交 83%

Group Preference Collapse in Personalized Multimodal Large Language Models

个性化多模态大语言模型中的群体偏好崩溃

Fan Lyu, Wenqi Zhang, Joost van de Weijer

机构 * Computer Vision Center, Universitat Autònoma de Barcelona(计算机视觉中心,巴塞罗那自治大学)

专题命中 其他VLM :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.AI

AI总结 研究个性化多模态大语言模型中群体偏好崩溃问题,提出PrefMoE框架,它分离配置文件信息与偏好表示,分解偏好,保留个性化残差并通过单独路径路由因素,实验表明该框架能改善偏好敏感个性化并减少偏好崩溃。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31513 2026-07-28 cs.CV 版本更新 79%

Personalize Your Large Vision-language Models With In-context Prompt Tuning

用上下文提示调优个性化你的大型视觉语言模型

Yanshu Li, Jiaqian Li, Kuai Yu, Xi Xiao, Dongfang Liu, Tianyang Wang, Ruixiang Tang

机构 * Brown University(布朗大学) Columbia University(哥伦比亚大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Purdue University(普渡大学) Rutgers University(罗格斯大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 提出上下文提示调优(ICPT)方法,通过轻量投影模块从多参考图像中提取细粒度视觉语义并转化为连续提示,结合几何正则化解决环境偏差和跨概念干扰,实现高效个性化。

Comments Accepted at ECCV 2026, 27 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07544 2026-07-28 cs.AI 版本更新 79%

From Pixels to Prompts: Vision-Language Models

从像素到提示:视觉-语言模型

Khang Nhat Hoang Vo

机构 * MBZUAI

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文探讨了视觉-语言模型的发展历程,旨在提供清晰的认知框架,帮助读者理解该领域的核心概念和应用,而非罗列所有数据集和模型变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24157 2026-07-28 cs.CV 新提交 70%

UniGen-AR: Unifying Visual Generation with Auto-Regressive Modeling

UniGen-AR:通过自回归建模统一视觉生成

Zhipeng Bao, Zhen Zhu, Nupur Kumari, Anurag Bagchi, Yu-Xiong Wang, Pavel Tokmakov, Martial Hebert

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳 - 香槟分校) Toyota Research Institute(丰田研究院)

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究统一视觉生成问题,提出UniGen-AR框架,将通用多模态语言模型与视觉自回归解码器配对,能为多任务生成图像值输出,相比基于扩散的基线,推理延迟低达19倍,确立视觉自回归建模为统一视觉生成的高效主干。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23808 2026-07-28 cs.CL cs.AI 新提交 57%

Indic DiarBench: A Multilingual Joint Diarization and ASR Benchmark for Indian Languages

Indic DiarBench:印度语言的多语言联合语音分离与自动语音识别基准

Deovrat Mehendale, Aditya Mehndiratta, Dhruv Rathi, Kaushal Bhogale, Mitesh M. Khapra

机构 * Sarvam AI(萨尔瓦姆人工智能公司) AI4Bharat, IIT Madras(印度理工学院马德拉斯分校人工智能促进印度发展实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 介绍涵盖印度22种在册语言的Indic DiarBench基准数据集,含约108小时多说话者音频,经人工校正注释。通过评估领先系统建立基线,该数据集作为开放资源推动印度语言多语言语音技术研究。

Comments 5 pages, 2 figures, Interspeech 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22632 2026-07-28 cs.AI 新提交 57%

VlogReward: Learning Multi-Dimensional Evaluation for Vlog Editing

VlogReward:学习用于Vlog编辑的多维评估

Yexiang Liu, Wen Zhong, Sijie Zhu, Xin Gu, Fan Chen, Junxian Duan, Jie Cao, Longyin Wen, Zhenfang Chen

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 针对Vlog评估主观性强且缺乏标准等问题,提出VlogReward模型。通过专业指导定义评估框架,构建数据集和基准,增强GRPO框架。该模型能提供多维分数与反馈,优于现有MLLMs,助力Vlog创作者及自动化评估完善系统。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09708 2026-07-28 eess.AS 版本更新 50%

Adapting a Text-to-Audio Model for Room Impulse Response Generation

为房间脉冲响应生成适应文本到音频模型

Kirak Kim, Sungyoung Kim

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出利用预训练文本到音频模型生成房间脉冲响应,通过视觉语言模型提取声学描述解决数据稀缺问题,验证大规模生成音频先验在该任务中的有效性。

Comments Accepted to IWAENC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏