arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-14 至 2026-08-14 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2608.12333 2026-08-14 cs.CL cs.AI cs.CV 新提交 81%

Vision-Language Models are Fragile Multilingual Associators

视觉-语言模型是脆弱的多语言关联器

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal

机构 * Manipal University Jaipur(斋浦尔马尼帕尔大学) University of North Carolina Charlotte(北卡罗来纳大学夏洛特分校) University of Salford(索尔福德大学) University of Manchester(曼彻斯特大学) Indian Statistical Institute Kolkata(印度统计研究所加尔各答分所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视觉-语言模型的多语言关联稳定性问题,构建M²BIND基准,发现其跨语系/文字时会出现绑定崩溃,关系密切语言则表现较好,表明多语言部署的VLMs关联质量存疑。

Comments Preprint (under review). Project Page: https://ritabrata04.github.io/m2bind/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12724 2026-08-14 cs.LG 新提交 70%

MAG: MAnifold Guided Semi-Supervised Multi-modal In-Context Learning

MAG:流形引导的半监督多模态上下文学习

Zirui Cheng, Xun Xu, Tiankai Chen, Fady Rezk, Bowen Zheng, Xiaodong Shi, Shijie Li, Kangkang Lu, Bharadwaj Veeravalli, Nancy F. Chen

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出MAG框架,通过将未标记多模态数据用于半监督传播的演示选择,提升多模态大语言模型的上下文学习性能,在8个基准的标签稀缺场景下优于强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12532 2026-08-14 cs.MM cs.CV cs.IR 新提交 57%

MASCOT: Model-Aware Submodular Coverage for Composite-Attribute Text-to-Image Retrieval

MASCOT:面向复合属性文本到图像检索的模型感知子模覆盖

Aaryan Sharma, Vishak Prasad C, Virendra Singh, Ganesh Ramakrishnan

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 针对现有流形重排序方法在复合属性文本到图像检索的多样性降低任务中早期排名召回率大幅下降的问题,提出MASCOT方法,在PixelProse数据集复合约束任务中表现优于MS-DPP,尤其在排名1后召回率上优势显著。

Comments 21 pages, 4 figures. Accepted at ACM Multimedia 2026 (MM '26), Rio de Janeiro, Brazil. Extended version with full appendices

详情

展开后加载摘要…

URL PDF HTML 收藏