arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-25 至 2026-03-25 共收录 11 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 11 篇

2603.22622 2026-03-25 cs.CV 83%

A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images

一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型

Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * Biological and Agricultural Engineering(生物与农业工程系) Department of Plant Sciences(植物科学系) Viticulture and Enology(葡萄栽培与酿酒系) Wageningen University & Research(瓦赫宁根大学与研究学院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23386 2026-03-25 cs.CV cs.GR cs.RO 79%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22714 2026-03-25 cs.CY cs.AI 79%

PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset

PopResume:基于人口代表性数据集的LLM/VLM简历筛选器因果公平性评估

Sumin Yu, Juhyeon Park, Taesup Moon

机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) IPAI, Seoul National University(首尔国立大学人工智能研究所) ASRI / INMC / AIIS, Seoul National University(首尔国立大学人工智能研究所)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

AI总结 PopResume通过人口统计数据和自然属性关系,实现对LLM和VLM简历筛选系统的因果公平性评估,识别出五种传统指标无法捕捉的歧视模式。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 73%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 73%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23190 2026-03-25 cs.CV 70%

Gaze-Regularized VLMs for Ego-Centric Behavior Understanding

基于目光调节的视觉语言模型用于以自身为中心的行为理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆凯特基金会数据科学研究所,香港大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种基于目光调节的视觉语言模型框架,通过整合目光信息提升以自身为中心的行为理解能力,实验结果显示在语义得分上提升了近13%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23132 2026-03-25 cs.CV 70%

InterDyad: Interactive Dyadic Speech-to-Video Generation by Querying Intermediate Visual Guidance

InterDyad:通过查询中间视觉指导实现交互式双人语音到视频生成

Dongwei Pan, Longwei Guo, Jiazhi Guan, Luying Huang, Yiding Li, Haojie Liu, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou

机构 * Baidu Inc.(百度公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出InterDyad框架,通过查询结构运动指导实现自然交互动态合成,解决双人场景中跨个体依赖和精细行为控制问题,提出交互性注入器、元查询模态对齐机制和角色感知双人高斯指导等方法,提升唇形同步和空间一致性。

Comments Project Page: https://interdyad.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22847 2026-03-25 cs.CV 70%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23308 2026-03-25 cs.CV cs.AI 62%

Curriculum-Driven 3D CT Report Generation via Language-Free Visual Grafting and Zone-Constrained Compression

基于课程学习的3D CT报告生成:通过无语言视觉移植与区域约束压缩

V. K. Cody Bumgardner, Mitchell A. Klusty, Mahmut S. Gokmen, Evan W. Damron

机构 * Center for Applied Artificial Intelligence, University of Kentucky(应用人工智能中心,肯塔基大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Ker-VLJEPA-3B框架,通过四阶段课程学习生成胸腔CT报告,采用无语言视觉主干和区域约束压缩提升生成质量,实验显示其在CT-RATE基准上取得更高F1分数。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG 57%

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏