arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5058 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5058 篇

2602.07014 2026-02-10 cs.CV cs.AI 62%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21798 2026-02-09 cs.CV cs.HC cs.LG 62%

An Evaluation of Hybrid Annotation Workflows on High-Ambiguity Spatiotemporal Video Footage

对高歧义时空视频 footage 的混合标注流程的评估

Juan Gutiérrez, Victor Gutiérrez, Ángel Mora, Silvia Rodriguez, José Luis Blanco

机构 * IPTC(信息处理与电信中心) Telecommunications Center, Escuela Técnica Superior de Ingenieros de Telecomunicación, Av. Complutense 30, 28040 Madrid, Spain(电信中心,电信工程师高级学院,Complutense大道30号,28040马德里,西班牙)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文评估了混合标注流程在高歧义时空视频中的有效性,通过实验表明其能显著减少标注时间并提供更严谨的AI辅助工作流程评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06013 2026-02-06 cs.CV cs.AI 62%

GenArena: How Can We Achieve Human-Aligned Evaluation for Visual Generation Tasks?

GenArena: 如何在视觉生成任务中实现人对齐的评估?

Ruihang Li, Leigang Qu, Jingxu Zhang, Dongnan Gui, Mengde Xu, Xiaosong Zhang, Han Hu, Wenjie Wang, Jiaqi Wang

机构 * University of Science(科学大学) Shanghai Innovation Institute(上海创新研究所) Tencent(腾讯) National University of Singapore(新加坡国立大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 GenArena通过成对比较范式实现视觉生成任务的人对齐评估,使开源模型超越专有模型,提升评估准确性达20%以上。

Comments Project Page: https://genarena.github.io/, Code: https://github.com/ruihanglix/genarena

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04937 2026-02-06 cs.LG cs.AI cs.CL 62%

Linear Model Merging Unlocks Simple and Scalable Multimodal Data Mixture Optimization

线性模型合并解锁了简单且可扩展的多模态数据混合优化

Davide Berasi, Matteo Farina, Massimiliano Mancini, Elisa Ricci

机构 * University of Trento(特伦托大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过模型合并高效估算多模态数据混合效果,结合领域专家训练与参数空间组合,实现可扩展的混合优化方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02539 2026-02-04 cs.LG cs.CV 62%

How Much Information Can a Vision Token Hold? A Scaling Law for Recognition Limits in VLMs

视觉标记能承载多少信息?VLMs中识别限制的缩放定律

Shuxin Zhuang, Zi Liang, Runsheng Yu, Hongzong Li, Rong Feng, Shiqin Tang, Youzhi Zhang

机构 * City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology(香港理工大学) Centre for Artificial Intelligence and Robotics, Chinese Academy of Sciences(中国科学院人工智能与机器人研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过压力测试揭示了视觉标记的信息上限,提出了一种统一的缩放定律,为优化视觉上下文压缩的效率-精度权衡提供了实证依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 62%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00393 2026-02-03 cs.CV cs.CL cs.LG 62%

Brazilian Portuguese Image Captioning with Transformers: A Study on Cross-Native-Translated Dataset

巴西葡萄牙语图像描述生成:跨原生翻译数据集研究

Gabriel Bromonschenkel, Alessandro L. Koerich, Thiago M. Paixão, Hilário Tomaz Alves de Oliveira

机构 * Instituto Federal do Espírito Santo (IFES)(巴西联邦大学埃斯皮里图圣安东尼奥理工学院) École de Technologie Supérieure (ÉTS)(加拿大超技术学院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 本研究通过跨原生翻译数据集评估Transformer模型在巴西葡萄牙语图像描述生成中的表现,发现Swin-DistilBERTimbau表现优异,GPT-4在CLIP-Score上表现最佳,同时揭示了模型中的系统性偏见。

Comments Accepted to JBCS. 18 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00340 2026-02-03 cs.CV cs.AI 62%

Bridging the Semantic Chasm: Synergistic Conceptual Anchoring for Generalized Few-Shot and Zero-Shot OOD Perception

弥合语义鸿沟:协同概念锚定用于通用少样本和零样本OOD感知

Alexandros Christoforos, Sarah Jenkins, Michael Brown, Tuan Pham, David Chen

机构 * Boston University(波士顿大学) Suffolk University(苏富比大学) Kyung Hee University, South Korea(韩国庆熙大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 SynerNet通过协同神经代理网络框架,解决视觉语言模型在分布外概念感知中的跨模态对齐退化问题,提升少样本和零样本场景下的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00105 2026-02-03 cs.CV cs.AI 62%

HYPE-EDIT-1: Benchmark for Measuring Reliability in Frontier Image Editing Models

HYPE-EDIT-1:衡量前沿图像编辑模型可靠性的基准

Wing Chan, Richard Allen

机构 * Sourceful Ltd(源丰有限公司)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.AI

AI总结 HYPE-EDIT-1是一个评估前沿图像编辑模型可靠性的基准,通过100个任务测试模型通过率和有效成本,揭示了低单价模型在考虑重试和人工审查后的高总成本。

Comments 14 pages, 5 figures, for code and data, see https://github.com/sourceful-official/hype-edit-1-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22828 2026-02-02 cs.LG cs.CV 62%

Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA

分解与组合:通过单个LoRA中的秩-1专家池实现高效的视觉-语言连续学习

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Wanqi Yang, Yinghuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 通过单个LoRA中的秩-1专家池实现高效的视觉-语言连续学习,减少参数更新并提升领域感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06646 2026-02-02 cs.CV cs.LG 62%

The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models

窄门:原生多模态模型中的局部图像-文本通信

Alessandro Pietro Serra, Francesco Ortu, Emanuele Panizon, Lucrezia Valeriani, Lorenzo Basile, Alessio Ansuini, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里斯特科学公园) SISSA, Trieste, Italy(SISSA) University of Trieste, Trieste, Italy(特里斯特大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究揭示了原生多模态模型中图像与文本信息交互的机制,发现通过单个标记作为窄门影响图像理解性能,提出基于标记级干预的精细控制方法。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 62%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22189 2026-02-02 eess.IV cs.CV cs.LG cs.MM 62%

SCENE: Semantic-aware Codec Enhancement with Neural Embeddings

SCENE:基于神经嵌入的语义感知编码器增强

Han-Yu Lin, Li-Wei Chen, Hung-Shin Lee

机构 * United Link Co., Ltd.(联合链接有限公司) Dept. Computer Science and Information Engineering, National Tsing Hua University(国立清华大学计算机科学与信息工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SCENE通过整合视觉语言模型的语义嵌入,实现对压缩视频中伪影的语义感知增强,提升感知质量和细节纹理保留。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 62%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI 62%

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19327 2026-01-27 cs.CV cs.AI 62%

DeepInsert: Early Layer Bypass for Efficient and Performant Multimodal Understanding

DeepInsert: 早期层绕过以实现高效且高性能的多模态理解

Moulik Choraria, Xinbo Wu, Akhil Bhimaraju, Nitesh Sekhar, Yue Wu, Xu Zhang, Prateek Singhal, Lav R. Varshney

机构 * UIUC(伊利诺伊大学) Amazon(亚马逊) Capital One Apple(苹果) Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 DeepInsert通过将多模态令牌插入模型中间层以绕过早期层,从而在降低训练和推理成本的同时保持或提升多模态语言模型的性能。

Comments To be presented at EACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15370 2026-01-23 cs.LG cs.AI 62%

Improving MoE Compute Efficiency by Composing Weight and Data Sparsity

通过组合权重和数据稀疏性提高MoE计算效率

Maciej Kilian, Oleg Mkrtchyan, Luke Zettlemoyer, Akshat Shrivastava, Armen Aghajanyan

机构 * University of Washington(华盛顿大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 通过结合权重和数据稀疏性,提高MoE计算效率,减少训练-推理不匹配,提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.11551 2026-01-23 cs.CV cs.IR cs.LG 62%

Multi-event Video-Text Retrieval

多事件视频-文本检索

Gengyuan Zhang, Jisen Ren, Jindong Gu, Volker Tresp

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Oxford(牛津大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出多事件视频-文本检索任务,设计Me-Retriever模型,通过关键事件表示和新损失函数提升视频-文本检索性能。

Comments [fixed typos in equations] accepted to ICCV2023 Poster; some figures are not supported when viewed online, please download the file and view locally

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20941 2026-01-21 cs.LG cs.AI physics.flu-dyn 62%

A Multi-fidelity Double-Delta Wing Dataset and Empirical Scaling Laws for GNN-based Aerodynamic Field Surrogate

多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律

Yiren Shen, Juan J. Alonso

机构 * Department of Aeronautics and Astronautics(航空与宇航系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出一个多保真度双三角翼数据集及基于GNN的气动场替代模型的实证标度定律,通过实验发现数据量与预测精度呈幂律关系,提出最优采样密度为每个维度八个样本。

Journal ref AIAA SCITECH 2026 Forum

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10378 2026-01-21 cs.CV cs.AI 62%

Global Context Compression with Interleaved Vision-Text Transformation

全局上下文压缩与交错视觉-文本转换

Dian Jiao, Jiaxin Duan, Shuai Zhao, Jiabing Leng, Yiran Zhang, Feng Huang

机构 * China Electronics Cloud Technology Co Ltd.(中国电子云科技有限公司)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VIST2模型,通过交错视觉与文本信息实现全局上下文压缩,提升长写任务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11269 2026-01-19 cs.CV cs.AI 62%

X-Distill: Cross-Architecture Vision Distillation for Visuomotor Learning

X-Distill:跨架构视觉蒸馏用于视觉-运动学习

Maanping Shao, Feihong Zhang, Gu Zhang, Baiye Cheng, Zhengrong Xue, Huazhe Xu

机构 * Tsinghua University(清华大学) Institute for Interdisciplinary Information Sciences(交叉信息研究院) Shanghai Qi Zhi Institute(上海启智研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 X-Distill通过跨架构知识蒸馏结合视觉转换器和紧凑型CNN,实现了在数据有限的机器人操作任务中优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08017 2026-01-14 cs.CV cs.AI 62%

Representations of Text and Images Align From Layer One

文本和图像的表示从第一层对齐

Evžen Wybitul, Javier Rando, Florian Tramèr, Stanislav Fort

机构 * D-INFK, ETH Zurich, Switzerland(苏黎世联邦理工学院信息与知识系统研究所) Aisle Research(Aisle研究)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究通过合成方法证明,视觉-语言模型中图像和文本表示在第一层即可实现对齐,为模型可解释性提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17875 2026-01-14 cs.CV cs.LG 62%

Visually Prompted Benchmarks Are Surprisingly Fragile

通过视觉提示的基准测试出人意料地脆弱

Haiwen Feng, Long Lian, Lisa Dunlap, Jiahao Shu, XuDong Wang, Renhao Wang, Trevor Darrell, Alane Suhr, Angjoo Kanazawa

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV、cs.LG

AI总结 研究发现视觉提示基准测试对细节敏感,通过创建VPBench减少不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11720 2026-01-13 cs.LG cs.AI 62%

RPO: Fine-Tuning Visual Generative Models via Rich Vision-Language Preferences

RPO:通过丰富的视觉-语言偏好进行视觉生成模型微调

Hanyang Zhao, Haoxian Chen, Yucheng Guo, Genta Indra Winata, Tingting Ou, Ziyu Huang, David D. Yao, Wenpin Tang

机构 * Columbia University(哥伦比亚大学) Amazon(亚马逊) Princeton University(普林斯顿大学) Capital One

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过利用视觉语言模型的丰富反馈信号,改进偏好对的编纂,从而提升视觉生成模型的微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04404 2026-01-09 cs.CV cs.AI 62%

3D-Agent:Tri-Modal Multi-Agent Collaboration for Scalable 3D Object Annotation

3D-Agent:三模态多智能体协作用于可扩展的3D物体标注

Jusheng Zhang, Yijia Fan, Zimo Wen, Jian Wang, Keze Wang

机构 * Sun Yat-sen University(中山大学) Shanghai Jiao Tong University(上海交通大学) Snap Inc.(Snap公司)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 Tri MARF通过三模态多智能体协作提升大规模3D物体标注效率与精度

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14435 2026-01-08 cs.CV cs.LG 62%

MoTE: Mixture of Ternary Experts for Memory-efficient Large Multimodal Models

MoTE:混合三元专家用于内存高效的大型多模态模型

Hongyu Wang, Jiayu Xu, Ruiping Wang, Yan Feng, Yitao Zhai, Peng Pei, Xunliang Cai, Xilin Chen

机构 * Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院人工智能安全重点实验室,计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 MoTE通过训练更多低精度三元专家,实现内存高效的大规模多模态模型训练,提升端任务性能并降低内存需求。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17254 2026-01-07 cs.CV cs.AI 62%

Intervene-All-Paths: Unified Mitigation of LVLM Hallucinations across Alignment Formats

干预所有路径:统一缓解跨对齐格式的大型视觉-语言模型幻觉

Jiaye Qian, Ge Zheng, Yuchen Zhu, Sibei Yang

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ShanghaiTech University(上海科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种统一干预框架,通过分析不同路径间的相互作用,有效缓解跨对齐格式的LVLM幻觉问题。

Comments Accepted to NeurIPS 2025, Project Page: https://github.com/SooLab/AllPath

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01024 2026-01-06 cs.CV cs.AI cs.IR 62%

ITSELF: Attention Guided Fine-Grained Alignment for Vision-Language Retrieval

ITSELF: 基于注意力引导的细粒度对齐用于视觉-语言检索

Tien-Huy Nguyen, Huu-Loc Tran, Thanh Duc Ngo

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国家大学)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV、cs.AI

AI总结 ITSELF通过基于注意力引导的细粒度对齐框架,在视觉-语言检索任务中实现最先进的性能和跨数据集泛化能力。

Comments Accepted at WACV Main Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00993 2026-01-06 cs.CV cs.AI 62%

WildIng: A Wildlife Image Invariant Representation Model for Geographical Domain Shift

WildIng: 一种用于地理域转移的野生动物图像不变表示模型

Julian D. Santamaria, Claudia Isaza, Jhony H. Giraldo

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 WildIng通过整合文本描述与图像特征,提升野生动物在不同地理区域的识别准确率,有效解决地理域转移问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24478 2026-01-06 cs.LG cs.AI stat.ME 62%

HOLOGRAPH: Active Causal Discovery via Sheaf-Theoretic Alignment of Large Language Model Priors

HOLOGRAPH:通过sheaf理论对大型语言模型先验进行对齐以实现主动因果发现

Hyunjun Kim

机构 * Korea Advanced Institute of Science \'Ecole Polytechnique F\'ed\'erale de Lausanne (EPFL), Lausanne, Switzerland

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 HOLOGRAPH通过sheaf理论对齐大型语言模型先验,实现主动因果发现,提供严谨的数学基础并实现竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏