arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 2619 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 536 篇

2608.08630 2026-08-11 cs.CV 新提交 57%

VLZip: Unified Visual and Textual Compression for Interleaved Long-Context Modeling

VLZip:用于交错长上下文建模的统一视觉与文本压缩方法

Yuqi Zhang, Cheng Chen, Yuyu Guo, Wenjie Yang, Lingchen Meng, Peng Di, Hang Yu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 VLZip 是统一视觉与文本压缩的框架,通过提炼软前缀缩短注意力序列,在长上下文多模态推理上性能领先,支持超大规模 token 处理,为长上下文多模态 AI 建立新高效标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08336 2026-08-11 cs.CV 新提交 57%

Circuit Fine-Tuning for Compute-Efficient Transformer Adaptation

面向计算高效的Transformer适配的电路微调

Uri Z. Kialy, Gil Ben-Artzi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 提出电路微调(CFT)框架,通过电路发现选择ViT待微调子图,仅微调该子图,可大幅降低训练FLOPs与时间,在多类视觉任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06246 2026-08-07 cs.LG 新提交 57%

A Six-Dimensional Taxonomy of Post-Training Adaptation Techniques with Applications in AI Governance

用于人工智能治理的后训练适应技术的六维分类法

Fardin Afdideh, Fernando Seoane, Farhad Abtahi

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 本综述构建了后训练适应技术的六维分类法,梳理技术间关系,为AI治理提供术语支持,并指出该领域的开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06012 2026-08-07 cs.AI 新提交 57%

HERALD: Counterfactual Audits and Minimal Repairs for Proof-of-Retrieval Rewards

HERALD:检索证明奖励的反事实审计与最小修复

Zhuowen Liu, Bohan Cui, YinShang Guo, Yuting Wang, Hao Li

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 HERALD是一种离线审计方法,可对搜索智能体的检索证明奖励进行反事实审计与最小修复,能有效抵御引用清洗攻击,提升引用精度等指标并分离稳健评分与策略迁移。

Comments 9 pages, 3 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05803 2026-08-07 cs.CV 新提交 57%

Vorch-Omni: Multi-Task Orchestration of Sight and Sound

Vorch-Omni:视觉与听觉的多任务编排

Vorch Team, Xiaoyu Chen, Yang Ding, Cong Han, Menglin Han, Yuxin Hong, Jiebo Hou, Zequn Jie, Xiang Li, Jing Liu, Qi Liu, Yulei Lu, Siyuan Luo, Lin Ma, Xin Ma, Yinlong Qian, Peng Shi, Fang Wan, Siqi Wang, Yaohui Wang, Yaole Wang, Yidi Wu, Siqian Yang, Mingyu Yin, Haoran Yu, Gang Yue, Lisai Zhang, Yuting Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 Vorch-Omni是基于流匹配扩散Transformer的统一多任务视听合成框架,支持10余项视听相关任务,为通用视听生成与操作提供可扩展基础。

Comments Project Page: https://vorch-project.github.io/Vorch-Omni-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05260 2026-08-07 cs.CV 新提交 57%

A Paragraph is Worth a Thousand Captions: Rethinking Text Supervision for Vision-Language Retrieval

一段文本胜过千条标题:重新思考视觉-语言检索的文本监督

Mahyar Ghazanfari, Amin Tabrizian, Arsyi Aziz, Binshuai Wang, Peng Wei

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对视觉-语言检索,通过系统对比单标题与段落文本监督,发现仅微调BLIP文本编码器的段落监督模型在DOCCI等任务上优于Long-CLIP,为文本粒度与检索性能的关系提供了新见解。

Comments Accepted at the MUCG workshop, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 57%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交 57%

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 57%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03885 2026-08-05 cs.CV 新提交 57%

MuRA: Multi-Rank Adaptation for Efficient and Effective Test-Time Vision-Language Generalization

MuRA:用于高效且有效的测试时视觉-语言泛化的多秩适配

Gengyuan Liu, Nanzhou Wang, Chang Liu, Qinwen Wu, Zhenhao Wang, Jiacong Wang, Bokui Chen, Xiangyang Ji

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对测试时视觉-语言模型因静态秩配置导致的性能瓶颈,提出多秩适配(MuRA)框架,动态选择适配模块,在多基准测试中达最优准确率且降低计算内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02704 2026-08-05 cs.AI cs.LO q-bio.NC 新提交 57%

Predictive Set Theory: A Generative Framework for Cognitive Architecture with Operationalized Core Mechanisms

预测集合论:具有可操作核心机制的认知架构生成框架

Yiyang Yu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出预测集合论(PST)这一形式生成框架,从第一性原理重构认知架构,解决经典认知问题,并确立其原创性与完整性。

Comments 103 pages. This preprint establishes the theoretical framework of Predictive Set Theory, providing a generative design specification for cognitive architecture. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02660 2026-08-05 cs.CY cs.AI cs.HC 新提交 57%

AI Alignment and Fiduciary Obligation

AI对齐与受托义务

Benjamin Lange

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出将受托理论应用于长期AI助手部署,以开发者对用户负有的忠诚、注意、善意和坦诚四项受托义务为基础构建AI对齐标准,为AI对齐研究提供新视角。

Comments 10 pages, 1 table. Accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 57%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00056 2026-08-04 eess.SP cs.LG eess.IV 新提交 57%

Domain-Generalized Adaptive Semantic Communication for Collaborative Perception

面向协同感知的域泛化自适应语义通信

Fan Gao, Youzheng Wang, Ning Ge

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

AI总结 提出域泛化语义通信框架RSTA,通过跨域原型对齐等技术解决车路协同感知中观测域偏移与信道损坏耦合退化问题,在多基准测试中取得AP指标提升且部署开销极低。

Comments Accepted by IEEE ICCC 2026. 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-04 cs.CV cs.CL 新提交 57%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 57%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01397 2026-08-04 cs.RO cs.CV 新提交 57%

SG-WAM: Self-Guided World Modeling in Geometry-Aware Policy Space

SG-WAM:几何感知策略空间中的自引导世界建模

Ruiteng Zhao, Zhengshen Zhang, Yue Su, Wenshuo Wang, Jiahui Li, Zhiyuan Yang, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 SG-WAM是自引导的几何感知世界动作模型框架,通过策略衍生空间联合优化动态预测等,在LIBERO等数据集上实现高成功率,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01392 2026-08-04 cs.CV 新提交 57%

FineMoLA: Towards Fine-Grained Motion-Language Alignment from Clip-Level Supervision

FineMoLA:基于片段级监督的细粒度动作-语言对齐研究

Tongyan Wang, Zhengyuan Li, Muhan Lin, Shengyang Luo, Yifan Shen, Aniket Bera, Baijian Yang, Yingjie Victor Chen

机构 * Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 针对现有动作-语言数据集仅提供片段级监督导致细粒度对齐不足的问题,提出弱监督框架FineMoLA,将动作-语言对齐建模为最优传输问题,在SnapMoGen上的实验显示其动作-文本定位性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28463 2026-07-31 cs.CV 新提交 57%

VisualRouter: Query-Grounded Visual Sampling for Long Video Understanding

VisualRouter:面向长视频理解的查询驱动视觉采样

Haiyue Zhang, Yi Bin, Xun Jiang, Zeyu Ma, Duo Peng, Guoqing Wang, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出无训练即插即用框架VisualRouter,通过将查询分为全局或局部并采用对应采样策略,提升了大型视觉语言模型的长视频理解性能,在多个基准数据集上优于均匀采样及现有无训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27917 2026-07-31 cs.AI 新提交 57%

One Anchor for All: Unified Multilingual and Multimodal Safety Alignment for LVLMs

统一多语言多模态的LVLM安全对齐:一个通用锚点

Enyi Shi, Fei Shen, Chuancheng Shi, Linxia Zhu, Shuyi Miao, Jinhui Tang, Tat-Seng Chua

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 针对LVLM面临的多语言多模态复合攻击防御难题,提出MLS-Neurons驱动的跨维度安全对齐框架,仅更新约0.03%参数实现安全监督迁移,在多语言多模态安全基准上性能优于SOTA且保留通用实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27779 2026-07-31 cs.CV 新提交 57%

CXR-Retrieve: Compositional Text-to-Image Retrieval in Chest Radiography

CXR-Retrieve:胸部X线摄影中的组合式文本到图像检索

Tomer Erez, Moshe Kimhi, Chaim Baskin, Ehud Rivlin

机构 * Technion – Israel Institute of Technology(以色列理工学院) Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对胸部X线检索的目标不匹配问题,提出CXR-Retrieve基准与标签感知对比微调方法,在双病理组合和否定查询的Precision@5上较CXR-CLIP分别提升8.5和22.0个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 57%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24424 2026-07-28 cs.CV 新提交 57%

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning

MAViE:用于细粒度视觉感知和高效多模态推理的多尺度自适应视觉编码器

Shaofei Lei

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究针对视觉语言模型问题,提出多尺度自适应视觉编码器MAViE,通过融合多层特征、进行令牌路由及引入相关策略,在统一框架下实验,减少视觉令牌数量,提升多任务分数并降低处理时间,还给出模型设计与评估协议。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23631 2026-07-28 cs.CV 新提交 57%

PathSelect: Sequential Token Selection for Whole Slide Pathology

PathSelect:用于全切片病理学的序列令牌选择

Jingzhi Chen, Landi He, Zehong Chen, Peihang Wu, Lijian Xu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 针对全切片图像给视觉语言模型带来的计算瓶颈,提出解耦路由框架PathSelect,将令牌剪枝重构成序列选择过程,训练时引入方差保持噪声门等,推理时模块分离,有效减少令牌数,提高准确率并优于基于采样的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23600 2026-07-28 cs.CV 新提交 57%

ConFusion: Continuous Fusion Space Learning for Fine-Grained Controllable Infrared and Visible Image Fusion

ConFusion:用于细粒度可控红外与可见光图像融合的连续融合空间学习

Guo Yurong, He Yufei, Li Yonghao, Chang Dongliang, Zhang Ke, Ma Zhanyu

机构 * North China Electric Power University(华北电力大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究可控红外与可见光图像融合,提出ConFusion框架,通过高斯条件空间感知调制学习连续融合空间,采用双分支架构及相关模块实现实例级细粒度可控融合,实验证明其在融合质量和下游任务上达先进水平。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23046 2026-07-28 cs.CV 新提交 57%

Structured Redundancy Modeling for Efficient Visual Token Pruning in High-Resolution MLLMs

用于高分辨率多模态大语言模型中高效视觉令牌剪枝的结构化冗余建模

Jouwon Song, Woohyeong Kim, Kyeongbo Kong

机构 * LG Electronics(LG电子) Pusan National University(釜山国立大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 针对高分辨率多模态大语言模型视觉令牌爆炸致延迟瓶颈问题,提出单向前向剪枝器SFPruner,通过语义引导岭杠杆方案和基于排名的方向掩码两个互补机制,在单次前向传递中实现冗余感知重要性选择,有效减少令牌选择时间并保持性能。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22078 2026-07-27 cs.CV 新提交 57%

CommandLM: Data driven behavior level descriptor for ego vehicles

CommandLM:用于自动驾驶车辆的数据驱动行为级描述符

Boris Tokic, Constantin Selzer, Fabian B. Flohr

机构 * Munich University of Applied Sciences(慕尼黑应用技术大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对自动驾驶系统中可解释行为级决策需求,提出多模态大语言模型CommandLM,通过融合多传感器数据生成行为描述,经特定训练和适配器处理,实验表现优于基线,人工评估显示其输出可助力行为审计,实现高效透明的行为级理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22043 2026-07-27 cs.CL cs.CV 新提交 57%

Scaling Native Multimodal Pre-Training From Scratch

从零开始扩展原生多模态预训练

Haoyuan Wu, Aoqi Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Bei Yu

机构 * The Chinese University of Hong Kong(香港中文大学) LLM Department, Tencent(腾讯大语言模型部)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21417 2026-07-24 cs.CV 新提交 57%

Towards Privacy-Preserving Federated Prompt Tuning under Data Heterogeneity: A Subspace-Decomposed Expert Approach

面向数据异构性下的隐私保护联邦提示调优:一种子空间分解专家方法

Yuhua Wang, Xiaodong Li, Yihao Guo, Yuxiang Jia, Qinnan Zhang, Yifan Sun, Hainan Zhang, Yongxin Tong, Zhiming Zheng

机构 * School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Center for the Applied Statistics, School of Statistics, Renmin University of China(中国人民大学统计学院应用统计中心) School of Computer Science & Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) School of Software, Beihang University(北京航空航天大学软件学院) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)

专题命中 VLM训练与架构 :VLM(abstract_cn);分类 cs.CV

AI总结 研究针对数据异构性下的隐私保护联邦提示调优问题,提出FedSEPT方法,采用子空间分解专家建模及实例感知专家融合技术,在11个异构基准实验中,于相同隐私约束下,该方法在局部适配和全局泛化间实现更好权衡。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20981 2026-07-24 cs.AI 新提交 57%

Beyond Independent Optimization: Compression, MoE Routing, and Quantization Interactions in Multimodal Edge Intelligence

超越独立优化:多模态边缘智能中的压缩、混合专家路由和量化交互

Jay Gor, Karm Dave, Akshita Abrol, Rajesh Gupta, Sudeep Tanwar, Zhengkui Wang

机构 * Nirma University(尼玛大学) Singapore Institute of Technology(新加坡理工学院) Marwadi University(马尔瓦迪大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态边缘智能中高效推理受多种因素限制,回顾相关模型进展,指出技术间相互影响不能独立优化,介绍关键设计权衡,引入视频MoE模型诊断方法,强调多方面开放研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏