arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-25 至 2026-03-25 共收录 66 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 19 篇

2603.07990 2026-03-25 cs.LG 57%

MJ1: Multimodal Judgment via Grounded Verification

MJ1: 通过 grounded 验证实现多模态判断

Bhavesh Kumar, Dylan Feng, Leonard Tang

机构 * Haize Labs(哈泽实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 MJ1 通过结构化 grounded 验证链和反事实一致性奖励提升多模态判断准确性,训练后在 MMRB2 数据集上达到 77.0% 准确率,超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18933 2026-03-25 cs.CV cs.RO 57%

Point What You Mean: Visually Grounded Instruction Policy

指出你的意图:基于视觉的指令策略

Hang Yu, Juntu Zhao, Yufeng Liu, Kaiyu Li, Cheng Ma, Di Zhang, Yingdong Hu, Guang Chen, Junyuan Xie, Junliang Guo, Junqiao Zhao, Yang Gao

机构 * Tongji University(同济大学) Shanghai Jiao Tong University(上海交通大学) Spirit AI Tsinghua University(清华大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出Point-VLA,通过结合视觉提示提升物体指称能力,在复杂场景中实现更精准的视觉 grounding。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22289 2026-03-25 cs.CL cs.AI 57%

MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing

MERIT: 用于可解释知识追踪的记忆增强检索

Runze Li, Kedi Chen, Guwei Feng, Mo Yu, Jun Wang, Wei Zhang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) WeChat AI, Tencent(微信AI,腾讯)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23013 2026-03-25 cs.CL 50%

Knowledge Access Beats Model Size: Memory Augmented Routing for Persistent AI Agents

知识访问胜过模型规模:基于对话记忆的持久AI代理路由

Xunzhuo Liu, Bowei He, Xue Liu, Andy Luo, Haichen Zhang, Huamin Chen

机构 * vLLM Semantic Router Project(vLLM语义路由器项目) MBZUAI McGill University(麦吉尔大学) Mila AMD Red Hat(红帽)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出利用对话记忆提升AI代理效率,通过轻量模型结合检索信息,使小模型在用户特定查询中表现优于大模型,证明知识访问比模型规模更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22704 2026-03-25 cs.CL 50%

Synthetic or Authentic? Building Mental Patient Simulators from Longitudinal Evidence

合成还是真实?从纵向证据构建心理健康患者模拟器

Baihan Li, Bingrui Jin, Kunyao Lan, Ming Wang, Mengyue Wu

机构 * SJTU Paris Elite Institute of Technology(上海交通大学巴黎精英理工学院) X-LANCE Lab(X-LANCE实验室) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理大学计算机与信息系统学院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出DEPROFILE框架,通过整合多源数据构建统一患者档案,提升对话真实性和行为多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21898 2026-03-25 cs.HC 50%

From Scores to Strategies: Towards Gaze-Informed Diagnostic Assessment for Visualization Literacy

从分数到策略:面向可视化素养的凝视引导诊断评估

Kathrin Schnizer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出通过凝视数据补充传统测试,以更全面评估读者在可视化信息处理中的认知负荷和策略差异,推动评估从二元分类向精细化描述转变。

Comments 4 pages, Workshop on Data Literacy for the 21st Century at CHI 2026, April 26, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14425 2026-03-25 cs.DB 50%

Time and Relations into Focus: Ontological Foundations of Object-Centric Event Data

时间与关系聚焦:对象导向事件数据的本体论基础

Hosna Hooshyar, Mattia Fumagalli, Marco Montali, Giancarlo Guizzardi

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出基于本体论的对象导向事件数据模型,通过三步方法解决现有模型在时间与动态关系方面的不足,增强表达能力与清晰度。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 2 篇

2512.01248 2026-03-25 cs.CV 79%

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22458 2026-03-25 cs.CV 57%

MinerU-Diffusion: Rethinking Document OCR as Inverse Rendering via Diffusion Decoding

MinerU-Diffusion:通过扩散解码重新思考文档OCR作为逆向渲染

Hejun Dong, Junbo Niu, Bin Wang, Weijun Zeng, Wentao Zhang, Conghui He

机构 * Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Peking University(北京大学)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MinerU-Diffusion,通过扩散解码替代自回归解码,提升文档OCR的鲁棒性和效率,实验表明其在长序列推理中速度提升3.2倍,且在视觉OCR能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 7 篇

2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 75%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 GUI与屏幕智能体 :visual reasoning(abstract);grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 67%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 GUI与屏幕智能体 :VLM(abstract);visual reasoning(abstract)

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22529 2026-03-25 cs.CV cs.AI cs.CL 62%

Ego2Web: A Web Agent Benchmark Grounded in Egocentric Videos

Ego2Web:一种基于第一人称视频的网络代理基准测试

Shoubin Yu, Lei Shu, Antoine Yang, Yao Fu, Srinivas Sunkara, Maria Wang, Jindong Chen, Mohit Bansal, Boqing Gong

机构 * Google DeepMind(谷歌DeepMind) UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Ego2Web通过结合真实世界第一人称视频与网络任务,解决网络代理在现实物理环境中的感知问题,提出LLM-as-a-Judge评估方法,揭示当前代理在视觉理解和任务规划上的不足。

Comments CVPR 2026. Project page: https://ego2web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23149 2026-03-25 cs.AI 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 GUI与屏幕智能体 :vision language model(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14315 2026-03-25 cs.GR cs.CV 57%

ImmerseGen: Agent-Guided Immersive World Generation with Alpha-Textured Proxies

ImmerseGen:基于代理的沉浸式世界生成与Alpha纹理代理

Jinyan Yuan, Bangbang Yang, Keke Wang, Panwang Pan, Lin Ma, Xuehai Zhang, Xiao Liu, Zhaopeng Cui, Yuewen Ma

机构 * Bytedance(字节跳动) Zhejiang University(浙江大学)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 ImmerseGen通过轻量级几何代理和合成RGBA纹理实现高效沉浸式VR场景生成,结合地形条件纹理和上下文感知纹理生成多样且视觉一致的世界,提升真实感和渲染效率。

Comments Accepted by IEEE VR 2026 and TVCG Special Issue. Project webpage: https://immersegen.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 GUI与屏幕智能体 :visual reasoning(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22760 2026-03-25 cs.RO 50%

SG-VLA: Learning Spatially-Grounded Vision-Language-Action Models for Mobile Manipulation

SG-VLA:学习空间接地的视觉-语言-动作模型用于移动操作

Ruisen Tu, Arth Shukla, Sohyun Yoo, Xuanlin Li, Junxi Li, Jianwen Xie, Hao Su, Zhuowen Tu

机构 * UC San Diego(南加洲大学) Lambda, Inc(Lambda公司)

专题命中 GUI与屏幕智能体 :grounding(abstract)

AI总结 本文提出SG-VLA模型,通过辅助任务协同训练和多模态输入增强,提升移动操作中视觉-语言-动作模型的空间感知与表征能力,实现在家庭环境中更高效的物体抓取与操作。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 8 篇

2603.22623 2026-03-25 cs.CV cs.AI 90%

To Agree or To Be Right? The Grounding-Sycophancy Tradeoff in Medical Vision-Language Models

同意还是正确?医学视觉-语言模型中的 grounding 与谄媚权衡

OFM Riaz Rahman Aranya, Kevin Desai

机构 * Department of Computer Science, The University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校计算机科学系)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);grounding(title,abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 研究评估了六种医学视觉问答模型,揭示了 grounding 与谄媚之间的权衡关系,并提出三种新指标以评估模型的可靠性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17108 2026-03-25 cs.CV 83%

LLM-Powered Flood Depth Estimation from Social Media Imagery: A Vision-Language Model Framework with Mechanistic Interpretability for Transportation Resilience

基于大语言模型的社交媒体影像洪水深度估计:一种具有机制可解释性的视觉-语言模型框架用于交通韧性

Nafis Fuad, Xiaodong Qian

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出FloodLlama,一种基于视觉-语言模型的洪水深度估计框架,通过合成数据集和多模态传感管道实现厘米级实时洪水深度估计,提升交通网络韧性。

Comments There is a update in result, which is needed to be addressed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22882 2026-03-25 cs.LG cs.CV 81%

TreeTeaming: Autonomous Red-Teaming of Vision-Language Models via Hierarchical Strategy Exploration

TreeTeaming:通过分层策略探索实现视觉语言模型的自主红队测试

Chunxiao Li, Lijun Li, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 TreeTeaming通过动态演化策略探索方法,实现对视觉语言模型的自主红队测试,显著提升攻击成功率和策略多样性,同时降低攻击毒性。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21356 2026-03-25 cs.CV cs.AI 81%

Gaze-VLM:Bridging Gaze and VLMs through Attention Regularization for Egocentric Understanding

gaze-VLM:通过注意力正则化连接 gaze 与 VLMs 以实现 egocentric 理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆斯克特基金会数据科学研究所,香港大学) Department of Electrical and Electronic Engineering, The University of Hong Kong(电气电子工程系,香港大学)

专题命中 幻觉与鲁棒性 :VLM(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出 gaze-regularized 框架,通过注意力正则化提升 VLMs 在细粒度未来事件预测和当前活动理解任务中的性能,实验表明在预测精度和鲁棒性上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 81%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15253 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化模型生成的描述和人工标注揭示了模型在不同难度任务中的表现差异,并发现检测器倾向于认为响应开头的句子正确。

Comments This work was intended as a replacement of arXiv:2511.20515 and any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20515 2026-03-25 cs.CV 57%

HalDec-Bench: Benchmarking Hallucination Detector in Image Captioning

HalDec-Bench:图像描述中幻觉检测的基准测试

Kuniaki Saito, Risa Shinoda, Shohei Tanaka, Tosho Hirasawa, Fumio Okura, Yoshitaka Ushiku

机构 * OMRON SINICX The University of Tokyo(东京大学) The University of Osaka(大阪大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出HalDec-Bench,用于评估图像描述中幻觉检测的性能,通过多样化VLM生成的描述和人类标注揭示模型差异,发现检测器倾向于认可响应开头的句子,并通过强VLM过滤减少数据噪声。

Comments Previously this version appeared as arXiv:2603.15253 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22856 2026-03-25 eess.IV 50%

Retrieval-Guided Photovoltaic Inventory Estimation from Satellite Imagery for Distribution Grid Planning

基于卫星图像的检索引导光伏库存估计用于配电网规划

Muhao Guo, Lihao Mai, Erik Blasch, Jafarali Parol, Turki Rakan, Yang Weng

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出Solar-RAG框架,通过图像检索与多模态视觉语言推理结合,提升光伏部署估计的鲁棒性,减少配电网规划中的电压偏差和承载能力误差。

Comments 38 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 11 篇

2603.22622 2026-03-25 cs.CV 83%

A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images

一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型

Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * Biological and Agricultural Engineering(生物与农业工程系) Department of Plant Sciences(植物科学系) Viticulture and Enology(葡萄栽培与酿酒系) Wageningen University & Research(瓦赫宁根大学与研究学院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23386 2026-03-25 cs.CV cs.GR cs.RO 79%

SIMART: Decomposing Monolithic Meshes into Sim-ready Articulated Assets via MLLM

SIMART: 通过MLLM将单体网格分解为可模拟的关节化资产

Chuanrui Zhang, Minghan Qin, Yuang Wang, Baifeng Xie, Hang Li, Ziwei Wang

机构 * ByteDance Seed(字节跳动种子) NTU(国立台湾大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV

AI总结 SIMART通过统一的MLLM框架实现部分级分解和运动学预测,减少3D令牌数量,提升多部分组装的保真度,并在PartNet-Mobility和野外AIGC数据集上取得最佳性能,支持物理仿真的机器人模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22714 2026-03-25 cs.CY cs.AI 79%

PopResume: Causal Fairness Evaluation of LLM/VLM Resume Screeners with Population-Representative Dataset

PopResume:基于人口代表性数据集的LLM/VLM简历筛选器因果公平性评估

Sumin Yu, Juhyeon Park, Taesup Moon

机构 * ECE, Seoul National University(首尔国立大学电子与计算机工程系) IPAI, Seoul National University(首尔国立大学人工智能研究所) ASRI / INMC / AIIS, Seoul National University(首尔国立大学人工智能研究所)

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.AI

AI总结 PopResume通过人口统计数据和自然属性关系,实现对LLM和VLM简历筛选系统的因果公平性评估,识别出五种传统指标无法捕捉的歧视模式。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23311 2026-03-25 cs.CV cs.LG 73%

ARGENT: Adaptive Hierarchical Image-Text Representations

ARGENT:自适应层次图像-文本表示

Chuong Huynh, Hossein Souri, Abhinav Kumar, Vitali Petsiuk, Deen Dayal Mohan, Suren Kumar

机构 * University of Maryland, College Park(马里兰大学 College Park分校) Samsung Research America, AI Center(三星美国研究院人工智能中心)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 ARGENT通过自适应蕴含损失和规范正则化解决超几何VLM的层级结构问题,引入角度基于的概率蕴含协议评估层次理解,提升图像分类、文本到图像检索及层次指标性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 73%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23190 2026-03-25 cs.CV 70%

Gaze-Regularized VLMs for Ego-Centric Behavior Understanding

基于目光调节的视觉语言模型用于以自身为中心的行为理解

Anupam Pani, Yanchao Yang

机构 * HKU Musketeers Foundation Institute of Data Science, The University of Hong Kong(香港大学穆凯特基金会数据科学研究所,香港大学)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出一种基于目光调节的视觉语言模型框架,通过整合目光信息提升以自身为中心的行为理解能力,实验结果显示在语义得分上提升了近13%。

详情

展开后加载摘要…

URL PDF HTML 收藏