arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-23 至 2026-07-23 共收录 3 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 3 篇

2607.20291 2026-07-23 cs.CV 新提交 70%

Diverse-Intent Multi-Turn Fashion Image Retrieval

多样化意图的多轮时尚图像检索

Mingqiang Tang, Haokun Wen, Meng Liu, Yupeng Hu, Weili Guan, Xuemeng Song

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究现实世界时尚多轮图像检索问题,提出FashionAM框架直接对齐多模态对话查询与时尚图库嵌入空间,避免文本化,引入DIM-Fashion数据集,实验证明该框架优于现有方法,数据集和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19767 2026-07-23 cs.AI 新提交 57%

Symbol and Footprint Database for Electronic Components by Agentic Recognition and Generation

基于智能识别与生成的电子元件符号与引脚封装数据库

Yichen Shi, Yuzhi Liu, Zhuofu Tao, Li Huang, Yuhao Gao, Ting-Jung Lin, Lei Hel

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology(宁波数字孪生研究院,东方理工大学) Shanghai Jiao Tong University(上海交通大学) BTD Technology(BTD科技)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 研究利用多模态大语言模型开发电子元件符号和引脚封装智能识别与生成流程SFgen,其符号生成准确率86%,引脚封装生成准确率80%,并用此创建含1000个元件的SFnet数据库,为PCB设计自动生成奠定基础。

Comments Accepted by PRCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19830 2026-07-23 cs.CL 新提交 50%

VizRAG: Enhancing Retrieval-Augmented Generation with Hypergraph Visualization

VizRAG:通过超图可视化增强检索增强生成

Yanbin Wei, Yang Chen, Renling Gan, Ziru Liu, Xinyu Fu, Chun Kang, Ning Lu, Rui Liu, Yu Zhang, James Kwok

机构 * Southern University of Science and Technology(南方科技大学) Hong Kong University of Science and Technology(香港科技大学) Huawei Research(华为研究院) Beihang University(北京航空航天大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究旨在增强检索增强生成,核心方法是通过视觉线索将超图感知整合到RAG系统中,引入VizRAG支持视觉超图结构感知,实验证明该方法显著优于基线,验证了超图可视化用于RAG系统的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏