arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-20 至 2026-03-20 共收录 58 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 20 篇

2603.18625 2026-03-20 cs.CV 57%

GenVideoLens: Where LVLMs Fall Short in AI-Generated Video Detection?

GenVideoLens:在AI生成视频检测中LVLMs的局限性

Yueying Zou, Pei Pei Li, Zekun Li, Xinyu Guo, Xing Cui, Huaibo Huang, Ran He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of California, Santa Barbara(加州大学圣巴巴拉分校) Center for Research on Intelligent Perception and Computing, NLPR, Institute of Automation, Chinese Academy of Sciences(智能感知与计算中心、国家智能感知与信息处理实验室、中国科学院自动化研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 GenVideoLens通过细粒度评估揭示LVLM在AI生成视频检测中的能力差距,发现其在光学一致性、物理交互和时间因果推理上表现不足,且模型性能在不同维度上差异显著。

Comments ECCV 2026 submission. 14 pages, 6 figures, 4 tables. Supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18510 2026-03-20 cs.CV 57%

OnlinePG: Online Open-Vocabulary Panoptic Mapping with 3D Gaussian Splatting

OnlinePG: 在线开放词汇全景映射与3D高斯点云分裂

Hongjia Zhai, Qi Zhang, Xiaokun Pan, Xiyu Zhang, Yitong Dong, Huaqi Zhang, Dan Xu, Guofeng Zhang

机构 * State Key Lab of CAD & CG(CAD与CG国家重点实验室) VIVO BlueImage Lab(VIVO BlueImage实验室) HKUST(香港科技大学)

专题命中 视觉定位与Grounding :VLM(abstract);分类 cs.CV

AI总结 本文提出OnlinePG,通过在线全景映射结合3D高斯点云分裂实现开放词汇场景理解,解决现有方法在实时性和实例级理解上的不足。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18331 2026-03-20 cs.AI 57%

Understanding the Theoretical Foundations of Deep Neural Networks through Differential Equations

通过微分方程理解深度神经网络的理论基础

Hongjue Zhao, Yizhuo Chen, Yuchen Wang, Hairong Qi, Lui Sha, Tarek Abdelzaher, Huajie Shao

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Tennessee, Knoxville(田纳西大学科廷分校) William & Mary(威廉与玛丽学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文通过微分方程探讨深度神经网络的理论基础,分析其架构、性能提升及实际应用,提出模型和层级的双重视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17314 2026-03-20 cs.CV 57%

A Proposal-Free Query-Guided Network for Grounded Multimodal Named Entity Recognition

无提案查询引导网络用于 grounded 多模态命名实体识别

Hongbing Li, Jiamin Liu, Shuo Zhang, Bo Xiao

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出无提案查询引导网络,通过文本引导和跨模态交互统一多模态推理与解码,提升开放域场景下的命名实体识别精度与鲁棒性。

Comments There is an error in the methods section

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10053 2026-03-20 cs.CV 57%

DREAM: A Benchmark Study for Deepfake photoREalism AssessMent

DREAM:深度伪造照片真实感评估基准研究

Bo Peng, Zichuan Wang, Sheng Yu, Xiaochuan Jin, Wei Wang, Jing Dong

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出DREAM基准,用于评估深度伪造照片的真实感,包含高质量视频数据集、14万评分及描述文本,分析18种方法,包括基于大视觉语言模型和新提出描述对齐CLIP方法。

Comments Accepted by IEEE T-PAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19195 2026-03-20 eess.AS cs.CL cs.SD 50%

How Auditory Knowledge in LLM Backbones Shapes Audio Language Models: A Holistic Evaluation

LLM骨干中的听觉知识如何塑造音频语言模型:全面评估

Ke-Han Lu, Szu-Wei Fu, Chao-Han Huck Yang, Zhehuai Chen, Sung-Feng Huang, Chih-Kai Yang, Yi-Cheng Lin, Chi-Yuan Hsiao, Wenze Ren, En-Pei Hu, Yu-Han Huang, An-Yu Cheng, Cheng-Han Chiang, Yu Tsao, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * National Taiwan University, Taiwan(国立台湾大学) NVIDIA Academia Sinica, Taiwan(台湾“学术院”)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究比较不同LLM在文本仅和音频基础设置下的表现,揭示听觉知识在不同家族间差异显著,文本结果与音频性能强相关。

Comments Project website: https://kehanlu.github.io/AKB

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2603.16098 2026-03-20 cs.CV cs.AI 62%

LICA: Layered Image Composition Annotations for Graphic Design Research

LICA:图形设计研究的分层图像组成标注

Elad Hirsch, Shubham Yadav, Mohit Garg, Purvanshi Mehta

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 LICA提出了一个包含155万个多层图形设计作品的数据集,通过分层结构和丰富的元数据,推动图形布局的结构理解和生成,同时引入动画布局挑战,支持时序感知生成模型等研究。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2603.12696 2026-03-20 cs.RO cs.CV 70%

HaltNav: Reactive Visual Halting over Lightweight Topological Priors for Robust Vision-Language Navigation

HaltNav: 基于轻量拓扑先验的反应式视觉停止用于鲁棒视觉-语言导航

Zihui Yu, Pingcong Li, Bichi Zhang, Sören Schwertfeger

机构 * SIST, ShanghaiTech University(上海科技大学信息与通信科学核心平台,上海科技大学) Key Laboratory of Intelligent Perception and Human-Machine Collaboration(智能感知与人机协同重点实验室)

专题命中 GUI与屏幕智能体 :grounding(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出HaltNav框架,结合轻量拓扑先验与局部探索能力,通过反应式视觉停止机制提升视觉-语言导航的鲁棒性,实验表明其在复杂环境下的表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18091 2026-03-20 cs.CV cs.RO 57%

Action Draft and Verify: A Self-Verifying Framework for Vision-Language-Action Model

动作草稿与验证:一种用于视觉-语言-动作模型的自验证框架

Chen Zhao, Zhuoran Wang, Haoyang Li, Shifeng Bao, Guanlin Li, Youhe Feng, Yang Li, Jie Tang, Jing Zhang

机构 * Key Laboratory of Data Engineering(数据工程与知识工程重点实验室) Tsinghua University(清华大学) Beijing University of Posts(北京邮电大学) School of Information, Renmin University of China(中国人民大学信息学院)

专题命中 GUI与屏幕智能体 :VLM(abstract);分类 cs.CV

AI总结 本文提出Action-Draft-and-Verify框架,结合扩散动作专家和VLM,通过单次前向传递选择最优动作片段,提升模拟和现实场景中的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19233 2026-03-20 cs.RO 50%

Not All Features Are Created Equal: A Mechanistic Study of Vision-Language-Action Models

并非所有特征都具有同等价值:一种视觉-语言-动作模型的机制研究

Bryce Grant, Xijia Zhao, Peng Wang

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 GUI与屏幕智能体 :VLM(abstract)

AI总结 研究通过激活注入、稀疏自编码器和线性探针分析视觉-语言-动作模型,发现视觉路径主导动作生成,语言敏感性取决于任务结构而非模型设计,且专家路径编码运动程序,VLM路径编码目标语义,释放Action Atlas供探索。

Comments Accepted to Multimodal Intelligence Workshop @ ICLR

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 7 篇

2603.19092 2026-03-20 cs.CV cs.AI cs.CL cs.LG 82%

SAVeS: Steering Safety Judgments in Vision-Language Models via Semantic Cues

SAVeS: 通过语义线索引导视觉-语言模型中的安全判断

Carlos Hinojosa, Clemens Grange, Bernard Ghanem

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学科学与技术学院) Technical University of Munich(慕尼黑技术大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 研究通过语义线索引导视觉-语言模型的安全判断,提出SAVeS基准和评估协议,验证安全决策对语义线索的敏感性,揭示模型对视觉-语言关联的依赖及潜在安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19028 2026-03-20 cs.CV cs.AI cs.LG 82%

SEM: Sparse Embedding Modulation for Post-Hoc Debiasing of Vision-Language Models

SEM:用于视觉-语言模型后验去偏的稀疏嵌入调制

Quentin Guimard, Federico Bartsch, Simone Caldarella, Rahaf Aljundi, Elisa Ricci, Massimiliano Mancini

机构 * University of Trento(特伦托大学) Toyota Motor Europe(丰田欧洲公司) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出SEM框架,通过稀疏自编码器空间调制嵌入,实现视觉-语言模型的后验去偏,提升检索和零样本分类的公平性。

Comments CVPR Findings 2026. Project website: https://sparse-embedding-modulation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10846 2026-03-20 cs.CL 78%

DUAL-Bench: Measuring Over-Refusal and Robustness in Vision-Language Models

DUAL-Bench: 测量视觉语言模型中的过度拒绝与鲁棒性

Kaixuan Ren, Preslav Nakov, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(马克斯·普朗克智能系统研究所)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract)

AI总结 本文提出DUAL-Bench,通过评估18种VLM在12类危险场景下的表现,揭示模型在双重使用场景中的脆弱安全边界,强调安全完成与过度拒绝的平衡需求。

Comments 26pages, 13 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19182 2026-03-20 cs.AI cs.CL 57%

Box Maze: A Process-Control Architecture for Reliable LLM Reasoning

迷宫盒子:一种用于可靠大语言模型推理的过程控制架构

Zou Qiang

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出Box Maze框架,通过内存 grounding、结构化推理和边界约束三层结构提升LLM推理可靠性,实验显示其在对抗性场景中显著降低边界失效率。

Comments 10 pages, 5 tables, 0 figures. Conceptual architecture with preliminary simulation-based validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18911 2026-03-20 cs.CL cs.AI 57%

Progressive Training for Explainable Citation-Grounded Dialogue: Reducing Hallucination to Zero in English-Hindi LLMs

逐步训练用于可解释的引用导向对话:在英语-印地语LLM中将幻觉减少到零

Vedant Pandya

机构 * School of Artificial Intelligence and Data Engineering (SAIDE)(人工智能与数据工程学院) Indian Institute of Technology Jodhpur(印度理工学院朱罗普尔)

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出XKD-Dial,一种逐步四阶段训练流程,用于生成可解释的引用导向对话,通过跨语言适应、英语对话SFT与引用定位、双语对话SFT及GRPO对齐与引用感知奖励,减少幻觉并提升印地语能力。

Comments 30 pages, 15 figures, 11 tables. Comprehensive study across 6 LLMs (250M-7B parameters) with explainability analysis. Code and data available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18598 2026-03-20 cs.CV 57%

Complementary Text-Guided Attention for Zero-Shot Adversarial Robustness

互补文本引导注意力用于零样本对抗鲁棒性

Lu Yu, Haiyang Zhang, Changsheng Xu

机构 * School of Computer Science and Engineering, Tianjin University of Technology(天津理工大学计算机科学与工程学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) School of Artificial Intelligence, University of the Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出TGA-ZSR和Comp-TGA方法,通过局部注意力细化模块和全局注意力约束模块提升CLIP模型的零样本对抗鲁棒性,实验显示在16个数据集上分别提升9.58%和11.95%。

Comments Accepted to TPAMI 2026. arXiv admin note: substantial text overlap with arXiv:2410.21802

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02290 2026-03-20 cs.CL cs.AI 57%

Hallucination or Creativity: How to Evaluate AI-Generated Scientific Stories?

幻觉或创造力:如何评估AI生成的科学故事?

Alex Argese, Pasquale Lisena, Raphaël Troncy

机构 * EURECOM

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI

AI总结 本文提出StoryScore指标,用于评估AI生成的科学故事,结合语义对齐、词汇 grounding、叙事控制等方法,解决传统指标无法区分教育创造力与事实错误的问题。

Journal ref Proceedings of the Text2Story'26 Workshop, Delft (The Netherlands), 29-March-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 9 篇

2603.18795 2026-03-20 cs.CV cs.AI 86%

Perceptio: Perception Enhanced Vision Language Models via Spatial Token Generation

Perceptio:通过空间标记生成增强视觉语言模型

Yuchen Li, Amanmeet Garg, Shalini Chaudhuri, Rui Zhao, Garin Kessler

机构 * Amazon(亚马逊)

专题命中 VLM训练与架构 :vision language model(title,abstract);InternVL(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Perceptio通过生成2D和3D空间标记提升视觉语言模型的空间推理能力,结合语义分割和深度标记实现更精确的空间理解,提升多个基准测试性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18480 2026-03-20 cs.CV cs.AI cs.HC 81%

Do Vision Language Models Understand Human Engagement in Games?

视觉语言模型是否能理解游戏中的玩家参与度?

Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 VLM训练与架构 :vision language model(title);VLM(abstract);分类 cs.CV、cs.AI

AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18656 2026-03-20 cs.AI 79%

Balanced Thinking: Improving Chain of Thought Training in Vision Language Models

平衡思考:改进视觉语言模型中的推理链训练

Shaked Perek, Ben Wiesel, Avihu Dekel, Nimrod Shabtay, Eli Schwartz

机构 * IBM Research(IBM研究院)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);分类 cs.AI

AI总结 本文提出SCALe方法,通过动态权重平衡推理和答案段,提升视觉语言模型的推理效率和准确性,且训练时间仅为传统方法的七分之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18465 2026-03-20 cs.CV 79%

MedQ-UNI: Toward Unified Medical Image Quality Assessment and Restoration via Vision-Language Modeling

MedQ-UNI: 向通过视觉-语言建模实现医学图像质量评估与修复的统一迈进

Jiyao Liu, Junzhi Ning, Wanying Qu, Lihao Liu, Chenglong Ma, Junjun He, Ningsheng Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出MedQ-UNI,一种统一的视觉-语言模型,通过先评估再修复的范式,利用医学图像质量评估指导医学图像修复,实现了跨模态和降质类型的统一处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06678 2026-03-20 cs.CV cs.LG 73%

Flexible Concept Bottleneck Model

灵活的概念瓶颈模型

Xingbo Du, Qiantong Dou, Lei Fan, Rui Zhang

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出灵活的概念瓶颈模型(FCBM),通过动态概念适应和改进的稀疏max模块,提升模型在新概念下的适应性与灵活性,实验表明其在多个基准上的表现优异。

Comments To appear in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18415 2026-03-20 cs.MM cs.CV 70%

DuoTeach: Dual Role Self-Teaching for Coarse-to-Fine Decision Coordination in Vision--Language Models

DuoTeach: 视觉-语言模型中粗到细决策协调的双角色自教学

Wei Yang, Yiran Zhu, Zilin Li, Xunjia Zhang, Jun Xia, Hongtao Wang

机构 * Department of Computer, North China Electric Power University, Baoding, China(华北电力大学计算机学院) AIMS Lab, HKUST (GZ), Guangzhou, China(香港科技大学(广州)人工智能实验室) HKUST, Hong Kong SAR, China(香港科技大学) School of Information and Intelligent Science, Donghua University, Shanghai, China(东华大学信息与智能科学学院)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DuoTeach框架,通过双角色自教学提升视觉-语言模型在粗到细决策协调中的性能,改进领域内DWPA指标并提升零样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11052 2026-03-20 cs.RO 67%

AdaptPNP: Integrating Prehensile and Non-Prehensile Skills for Adaptive Robotic Manipulation

AdaptPNP: 集成抓取与非抓取技能以实现适应性机器人操控

Jinxuan Zhu, Chenrui Tie, Xinyi Cao, Yuran Wang, Jingxiang Guo, Zixuan Chen, Haonan Chen, Junting Chen, Yangyu Xiao, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) RoboScience(机器人科学) East China Normal University(华东师范大学) Peking University(北京大学) Nanjing University(南京大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 本文提出AdaptPNP框架,通过视觉-语言模型整合抓取与非抓取技能,实现复杂机器人操控任务的规划与执行。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09658 2026-03-20 cs.CV 57%

Image2Garment: Simulation-ready Garment Generation from a Single Image

Image2Garment: 从单张图像生成可模拟的服装

Selim Emir Can, Jan Ackermann, Kiyohiro Nakayama, Ruofan Liu, Tong Wu, Yang Zheng, Hugo Bertiche, Menglei Chai, Thabo Beeler, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google(谷歌) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种框架,通过微调视觉语言模型获取材料属性,再训练轻量预测模型生成物理参数,实现从单张图像生成可模拟的服装。

Comments Project Page: https://image2garment.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他VLM 2 篇

2510.16344 2026-03-20 cs.RO cs.AI 79%

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

Manual2Skill++: 通过视觉语言模型实现连接器感知的指令手册驱动机器人装配

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Junting Chen, Ruihai Wu, Lin Shao

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) University of Toronto(多伦多大学) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.AI

AI总结 本文提出Manual2Skill++框架,通过视觉语言模型从指令手册中提取结构化连接信息,构建层次化图表示,实现连接器为核心的装配任务理解与执行。

Journal ref ICRA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10045 2026-03-20 cs.CL 50%

Do Language Models Associate Sound with Meaning? A Multimodal Study of Sound Symbolism

语言模型是否将声音与意义关联?一种多模态研究声音象征主义

Jinhong Jeong, Sunghyun Lee, Jaeyoung Lee, Seonah Han, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学) Korea University(韩国大学)

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 研究语言模型在多模态输入中对声音象征性的处理,通过分析不同语义维度下的音节注意力分数,揭示模型对声音与意义关联的理解机制。

Comments 33 pages, 27 tables, 10 figures, accepted to AAAI 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏