arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-04-13 至 2026-04-13 共收录 63 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2604.08644 2026-04-13 cs.CL 50%

EXAONE 4.5 Technical Report

EXAONE 4.5 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Changhun Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Kwangrok Ryoo, Minju Seo, Sejong Yang, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Kyubeen Han, Joonwon Jang, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Jiyeon Jung, Daeseong Kim, Dohoon Kim, Dohyun Kim, Hyunseo Kim, Minu Kim, Myoungshin Kim, Youchul Kim, Byungoh Ko, Christopher Lee, Edward Hwayoung Lee, Honglak Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Woohyung Lim, Jueun Mun, Jaewoo Park, Jimin Park, Jinho Park, Yongmin Park, Wooseok Seo, Yongwoo Song, Sihyuk Yi, Kyungjae Yoo, Sangyeon Yoon

机构 * LG AI Research(LG AI 研究院)

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 EXAONE 4.5通过集成专用视觉编码器扩展EXAONE 4.0框架,实现多模态预训练,提升文档理解和语言能力,支持256K tokens上下文长度,优于同类模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2512.07833 2026-04-13 cs.CV cs.AI cs.LG 67%

Relational Visual Similarity

关系视觉相似性

Thao Nguyen, Sicheng Mo, Krishna Kumar Singh, Yilin Wang, Jing Shi, Nicholas Kolkin, Eli Shechtman, Yong Jae Lee, Yuheng Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Adobe Research(Adobe研究院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出通过关系相似性而非视觉属性来衡量图像相似性,构建了首个基于关系逻辑的图像表示空间,揭示了现有视觉模型在捕捉关系相似性方面的不足。

Comments CVPR 2026 camera-ready; Project page, data, and code: https://thaoshibe.github.io/relsim

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08664 2026-04-13 cs.RO 50%

Generative Simulation for Policy Learning in Physical Human-Robot Interaction

生成仿真在物理人机交互中政策学习中的应用

Junxiang Wang, Xinwen Xu, Tiancheng Wu, Julian Millan, Nir Pechuk, Zackory Erickson

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 其他VLM :vision-language model(abstract)

AI总结 本文提出零样本生成仿真框架,通过自然语言提示生成多样化的物理人机交互场景,用于自主收集合成数据并训练基于视觉的模仿学习策略,实现从仿真到现实的零样本迁移。

Comments 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏