arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-12 至 2026-05-12 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 6 篇

2605.10576 2026-05-12 cs.CV cs.AI 81%

SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models

SenseBench: 一个用于遥感低级视觉感知与描述的大型视觉-语言模型基准

Chen Zhong, Xiao An, Jiaxing Sun, Zihan Gui, Guangyi Yang, Wei He

机构 * Wuhan University(武汉大学) Shanghai Artificial Intelligent Laboratory(上海人工智能实验室)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出SenseBench,首个专为遥感低级视觉感知与描述设计的基准,通过物理基础的分层分类体系,评估29种先进VLMs在遥感降质识别中的性能,揭示领域先验偏差、多退化崩溃、流畅性幻觉及感知-描述反转效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10247 2026-05-12 cs.CV cs.AI 81%

LPT: Less-overfitting Prompt Tuning for Vision-Language Model

LPT: 降低过拟合的提示微调用于视觉-语言模型

Chenhao Ding, Xinyuan Gao, Songlin Dong, Jizhou Han, Qiang Wang, Zhengdong Zhou, Yuhang He, Yihong Gong

机构 * IEEE(国际电气电子工程师协会)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LPT框架,通过CLIP过滤细粒度前景信息并引入结构保持和层级logit约束,提升视觉-语言模型的泛化能力并缓解过拟合问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10012 2026-05-12 cs.HC cs.CR 67%

Sketch-based Access Control: A Multimodal Interface for Translating User Preferences into Intent-Aligned Policies

基于草图的访问控制:一种多模态接口,用于将用户偏好转化为意图对齐的策略

Kyzyl Monteiro, Sauvik Das

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract_cn)

AI总结 本文提出SBAC系统,结合草图和多模态大语言模型,帮助用户逐步完善访问策略,发现潜在问题并验证策略行为。

Comments 27 pages including appendix; 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10409 2026-05-12 cs.CV 57%

Progressive Photorealistic Simplification

渐进式逼真简化

Adi Rosenthal, Dana Berman, Yedid Hoshen, Ariel Shamir

机构 * Reichman University and Google(里奇曼大学和谷歌) Google Israel(谷歌以色列) Hebrew University and Google(希伯来大学和谷歌) Google(谷歌)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出渐进式语义图像简化框架,通过迭代去除并修补元素保持逼真外观,结合视觉-语言模型和学习验证器实现高效高质量的简化过程,应用于内容感知清理和交互编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09954 2026-05-12 cs.RO cs.CV 57%

JODA: Composable Joint Dynamics for Articulated Objects

JODA:可组合的联合动力学用于连杆物体

Tianhong Gao, Cheng Yu, Yinghao Xu, Mengyu Chu

机构 * Peking University(北京大学) Ant Group, Robbyant(蚂蚁集团,Robbyant)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 JODA通过结构化三通道场生成关节级动力学,结合视觉和语言模型推断并优化关节动力学,实现可控的连杆物体动力学建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10501 2026-05-12 cs.DC 50%

Accelerating Compound LLM Training Workloads with Maestro

通过Maestro加速复合大语言模型训练工作负载

Xiulong Yuan, Hongqing Chen, Jiaxuan Peng, Fan Zhou, Zhixiang Ruan, Zekun Wang, Bo Zheng, Rui Men, Haiquan Wang, Zhipeng Zhang, Langshi Chen, Man Yuan, Jiaqi Gao, Zhengping Qian, Junyang Lin, Yong Li, Wei Lin, Junhua Wang, Jingren Zhou

专题命中 其他VLM :MLLM(abstract)

AI总结 本文提出Maestro框架,针对复合LLM训练中的静态异构性和动态不规则性,通过分段图重构和波前调度算法提升硬件利用率,减少40%的GPU消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏