arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7552 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7552 篇

2607.29370 2026-08-03 cs.CV 新提交 78%

VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection

VFAD:变分语义提示与频率自适应表示学习结合的零样本异常检测

Peng Chen, Kaige Li, Wei Wang, Mingbo Yang, Wenqiang Wang, Li Shen, Fangjun Huang, Chao Huang

专题命中 知识编辑与模型理解 :prompting(title,abstract)

AI总结 该研究提出VFAD框架,结合变分语义提示与频率自适应表示学习,在13个工业和医学基准上,其零样本异常检测性能优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29200 2026-08-03 cs.CV 新提交 78%

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型

Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 78%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23169 2026-07-28 cs.SE 新提交 78%

Bifrost: Empowering Pretrained Language Model with Fallibility Representation for Log-Based Fault Diagnosis

Bifrost:利用基于日志的故障诊断的可错性表示赋能预训练语言模型

Minghua He, Tong Jia, Lingzhe Zhang, Chiming Duan, Xinlong Zhao, Leyi Pan, Cheng Wang, Kangjin Wang, Yinghao Yu, Liping Zhang, Yifan Wu, Ying Li

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 研究基于日志的故障诊断问题,提出Bifrost方法,借鉴站点可靠性工程师经验,基于自监督对比学习设计策略学习日志可错性表示,在多个系统中其生成的日志表示在故障诊断相关指标上优于现有PLMs。

Comments Accepted by ASE 2026 (Research Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23054 2026-07-28 cs.LG cs.AI cs.CL 新提交 78%

Through the Bottleneck: How Multi-head Latent Attention Separates Content from Position in Language Models

穿越瓶颈:多头潜在注意力如何在语言模型中分离内容与位置

Dhruvil S, Fenil Sojitra, Ravirajsinh Chauhan

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) P P Savani University(P P萨瓦尼大学)

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多头潜在注意力(MLA)在语言模型中如何分离内容与位置。通过训练特定Transformer并运用多种分析方法,发现其瓶颈能保留内容丢弃位置信息,归纳头集中在单层,有“语义中心”层,且瓶颈容量供应过剩,重塑了模型相关结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20202 2026-07-23 eess.SP 新提交 78%

JEPA-CFM: A Joint Embedding Predictive Architecture-based Channel Foundation Model for Robust Fluid Antenna Systems

JEPA-CFM:一种基于联合嵌入预测架构的稳健流体天线系统信道基础模型

Yuan Gao, Yiming Liu, Jun Jiang, Jianbo Du, Shunqing Zhang, Xiaoli Chu, Kai-Kit Wong

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 针对流体天线系统获取信道信息及定位的障碍,提出基于联合嵌入预测架构的信道基础模型,通过提取潜在嵌入学习通用表示,结合互补损失项训练,经仿真验证其在信道外推和无线定位上优于传统基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19977 2026-07-23 physics.chem-ph physics.atm-clus physics.comp-ph 新提交 78%

Rem3Di: Learning smooth, chiral 3D molecular descriptors from atomistic foundation models

Rem3Di:从原子基础模型学习平滑、手性3D分子描述符

Steffen Wedig, Felix Burton, Rokas Elijošius, Christoph Schran, Lars L. Schaaf

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 Rem3Di是一种表征学习框架,利用原子基础模型潜在特征生成可转移分子描述符,用于性质预测和虚拟筛选。它能捕捉分子手性,在药物性质基准测试中表现出色,还能区分过渡金属配合物,为化学机器学习提供新途径。

Comments An earlier version of this work appeared at the NeurIPS 2025 Workshop on Symmetry and Geometry in Neural Representations (NeurReps). Workshop version: https://openreview.net/forum?id=jOmZsvXoK5

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19120 2026-07-22 cs.CV 新提交 78%

Latent Riemannian Flow Matching for Geometry-Grounded 3D Foundation Models

用于几何基础3D基础模型的潜在黎曼流匹配

Lisa Weijler, Irene Ballester, Guofeng Mei, Tolga Birdal, Pedro Hermosilla

机构 * TU Wien(维也纳工业大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) Imperial College London(伦敦帝国理工学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究如何弥合几何基础模型与3D场景生成模型的范式差异,通过在VGGT潜在空间进行黎曼流匹配,利用其3D先验,不依赖明确下游表示,在多个数据集上取得良好性能,确立该方法为3D生成的可行范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 78%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新 78%

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新 78%

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 78%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12507 2026-07-15 cs.CR 新提交 78%

When Binaries Talk Back: Representation-Confusion Attacks on LLM-Assisted Reverse Engineering

当二进制文件进行反击:对大语言模型辅助逆向工程的表示混淆攻击

Igor Santos-Grueiro

专题命中 知识编辑与模型理解 :LLM(title,abstract)

AI总结 研究大语言模型辅助逆向工程中的表示混淆攻击,通过RARE-Bench衡量,测试RARE-Guard控制,发现无运行时控制时模型有不安全提议,工具授权、支持门和来源门在处理虚假声明上表现不同,二进制派生内容可指导分析且多工具视图不一定提供独立证据。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28543 2026-07-07 cs.AI cs.CL cs.LG 版本更新 78%

Cultural Binding Heads in Language Models

语言模型中的文化绑定头

Avrile Floro, Luca Benedetto

机构 * Mistral-7B Mistral-Nemo-12B Llama-3.1-8B Gemma-2-9B

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过机制可解释性和析因设计,识别出8个语言模型中2-3个中间层注意力头对文化绑定有因果贡献,且绑定主要在预训练阶段形成,知识探测表明模型知道的知识远多于其行为表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 78%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 知识编辑与模型理解 :LLM(title,abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09907 2026-07-02 physics.chem-ph 78%

Multi-head committees enable direct uncertainty prediction for atomistic foundation models

多头委员会使原子基础模型能够直接进行不确定性预测

Hubert Beck, Pavol Simko, Lars L. Schaaf, Ondrej Marsalek, Christoph Schran

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出利用多头委员会机制构建神经网络势能,用于原子基础模型的不确定性预测,通过主动学习将训练集缩小至原大小的5%,同时保持预测精度。

Comments 11 pages, 7 figures in main article + supporting information

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30020 2026-06-30 cs.CV 78%

Uncertainty Estimation in Pathology Foundation Models via Deep Mutual Learning

病理基础模型中的不确定性估计:基于深度互学习

Gbègninougbo Aurel Davy Tchokponhoue, Sevda Öğüt, Ali Idri, Dorina Thanou, Pascal Frossard

机构 * UM6P(摩洛哥穆萨-阿卜杜勒-阿齐兹大学) EPFL(瑞士联邦理工学院) UM5(摩洛哥穆萨-阿卜杜勒-阿齐兹大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 提出DICE框架,通过集成多个冻结的病理基础模型并利用深度互学习对齐,以模型分歧作为不确定性代理,实现可靠的不确定性估计、异常定位,并在分类、校准和定位上匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26287 2026-06-26 cs.CV 新提交 78%

GeMoE: Gating Entropy is All You Need for Uncertainty-aware Adaptive Routing in MoE-based Large Vision-Language Models

GeMoE:基于门控熵的MoE大视觉语言模型中不确定性感知自适应路由

Chaoxiang Cai, Minghe Weng, Jie Li, Yibo Jiang, Longrong Yang, Zequn Qin, Xi Li

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对MoE架构中静态路由无法自适应选择专家的问题,提出基于门控熵的不确定性感知自适应路由方法GeMoE,通过最小描述长度原理建模复杂度与性能的权衡,在保持99.5%性能的同时提升36.5%专家激活稀疏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20479 2026-06-19 cs.RO 新提交 78%

GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates

GroundControl: 通过轨迹一致的不确定性估计预测视觉语言智能体中的导航失败

Nastaran Darabi, Divake Kumar, Sina Tayebati, Devashri Naik, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago (UIC)(伊利诺伊大学芝加哥分校)

专题命中 知识编辑与模型理解 :language agent(title,abstract)

AI总结 提出轨迹一致的不确定性估计方法GroundControl,通过卡尔曼滤波建模距离变化并结合轨迹特征,有效预测导航失败,在选择性风险-覆盖评估中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14728 2026-06-16 cs.CV 新提交 78%

FUSE: Quantifying Uncertainty in Vision-Language Models by Bayesian Fusing Epistemic and Aleatoric Uncertainty

FUSE: 通过贝叶斯融合认知不确定性和偶然不确定性来量化视觉语言模型中的不确定性

Harry Zhang, Luca Carlone

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 提出FUSE概率框架,通过贝叶斯融合视觉语言模型中的偶然不确定性和认知不确定性,生成标量不确定性度量,用于可靠预测输出正确性,实现SOTA不确定性校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30750 2026-06-01 cs.CV 78%

SLAP: The Semantic Least Action Principle for Variational Video-Language Modeling

SLAP: 用于变分视频-语言建模的语义最小作用原理

Xiang Fang, Wanlong Fang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 提出语义最小作用原理(SLAP),将视频插值建模为黎曼流形上的边界值问题,通过离散欧拉-拉格朗日方程保持对象持久性,解决大视频语言模型中的时间间隙问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30161 2026-05-29 cs.CV 78%

Why Far Looks Up: Probing Spatial Representation in Vision-Language Models

为什么远处看起来在上方:探究视觉-语言模型中的空间表征

Cheolhong Min, Jaeyun Jung, Daeun Lee, Hyeonseong Jeon, Yu Su, Jonathan Tremblay, Chan Hee Song, Jaesik Park

机构 * Seoul National University(首尔国立大学) The Ohio State University(俄亥俄州立大学) NVIDIA(英伟达)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 通过最小对比对分析,发现视觉-语言模型存在垂直-距离纠缠(将图像垂直位置与距离混淆),这种透视偏差导致性能差距,并随数据规模扩大而加剧,而具有良好分离空间轴的模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28132 2026-05-28 cs.CV 78%

Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models

哪种预训练范式更有利于空间智能?视觉-语言模型与视频生成模型的实证比较

Haozhan Shen, Tiancheng Zhao, Kangjia Zhao, Jianwei Yin

机构 * Zhejiang University(浙江大学) Om AI Research(Om人工智能研究) Binjiang Institute of Zhejiang University(浙江大学滨江研究院)

专题命中 知识编辑与模型理解 :pretraining(title);language model(abstract)

AI总结 本文通过冻结特征探测研究,系统比较了视觉-语言模型(VLM)和视频生成模型(VGM)在语义标注、实例分组和3D几何预测三个空间智能维度上的表现,发现两者互补且简单融合可提升整体性能。

Comments Code is here: \href{https://github.com/om-ai-lab/Probing-VLM-VGM}{https://github.com/om-ai-lab/Probing-VLM-VGM}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06006 2026-05-21 eess.AS cs.SD 78%

Discriminative-Generative Target Speaker Extraction with Decoder-Only Language Models

判别-生成目标说话人提取与解码器-only语言模型

Bang Zeng, Beilong Tang, Wang Xiang, Ming Li

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Suzhou Municipal Key Laboratory of Multimodal Intelligent Systems, Digital Innovation Research Center, Duke Kunshan University(多模态智能系统苏州市重点实验室、数字创新研究中心、杜克昆山大学) North Carolina State University(北卡罗来纳州立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本文提出了一种判别-生成两阶段框架,结合判别提取的可控性和生成模型的重建能力,以提高目标说话人提取和语音增强的感知质量、可懂度和说话人一致性。

Comments 13 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20337 2026-05-21 cs.CV 78%

Capability $\neq$ Interpretability: Human Interpretability of Vision Foundation Models

能力 ≠ 可解释性:视觉基础模型的人类可解释性

Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre

机构 * ELLIS Alicante, Spain(阿利坎特ELLIS研究所,西班牙) Brown University, USA(布朗大学,美国) imec, Leuven, Belgium(imec,比利时卢旺达)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文研究了视觉基础模型的人类可解释性,提出了一种评估框架,发现基础模型比监督模型更难解释,且可解释性与下游任务性能无关,而是与特征的局部性和粗粒度语义对齐有关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19792 2026-05-20 cs.CV 78%

Mechanisms of Object Localization in Vision-Language Models

视觉-语言模型中物体定位的机制

Timothy Schaumlöffel, Martina G. Vilas, Gemma Roig

机构 * Goethe University Frankfurt, Germany(法兰克福歌德大学,德国) The Hessian Center for AI, Germany(黑森人工智能中心,德国)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本文研究了视觉-语言模型中物体定位的核心机制,通过分析LLaVA-1.5和InternVL-3.5等模型,揭示了定位依赖于容器化机制,并发现只有少量注意力头参与分类和定位任务,为未来模型设计提供了指导。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18085 2026-05-19 eess.SP 78%

PRiSE-EEG: A Prior-Guided Foundation Model with Depth-Stratified Experts for Cross-Paradigm EEG Representation Learning

PRiSE-EEG: 一种基于先验的EEG基础模型,具有深度分层专家,用于跨范式EEG表示学习

Wei Xiong, Jiangtong Li, Kun Zhu, Jie Li

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出PRiSE-EEG,一种基于先验的EEG基础模型,通过深度分层专家实现跨范式EEG表示学习,通过CKA校准的深度分层专家分配提升了模型的跨范式性能。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15910 2026-05-18 hep-ph 78%

Geometric algebra as the input language of collider foundation models

几何代数作为碰撞物理基础模型的输入语言

E. Abasov, L. Dudko, F. Grigoryev, P. Volkov, A. Zaborenko

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出将碰撞事件视为单一几何对象,利用几何代数的分级分解组织所有可观测量,提供34个经典可观测量的字典,并展示如何通过投影获得高阶不变量和低阶配方,最终通过多共振拓扑分离示例展示方法。

Comments 39 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13667 2026-05-14 cs.CV 78%

SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models

SceneGraphVLM:基于视频的动态场景图生成方法

Vladislav Makarov, Mark Gizetdinov, Dmitry Yudin

机构 * MIRAI

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 SceneGraphVLM通过紧凑的视觉语言模型生成视频场景图,采用TOON格式提升效率,结合监督微调与强化学习实现高精度与速度的平衡,适用于PSG、PVSG和Action Genome数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13156 2026-05-14 cs.CV 78%

Dual-Pathway Circuits of Object Hallucination in Vision-Language Models

视觉语言模型中物体幻觉的双路径电路

Jiaxin Liu, Ding Zhong, Yue Wang, Zhidong Yang, Zhaolu Kang, Guangyuan Dong, Qishi Zhan, Pengcheng Fang, Aofan Liu

机构 * UIUC(伊利诺伊大学香槟分校) UMich(密歇根大学) Stanford(斯坦福大学) HKUST(香港科技大学) PKU(北京大学) NUS(新加坡国立大学) Marquette(马quette大学) Southampton(南安普顿大学)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 研究通过双路径电路分析框架揭示视觉语言模型中物体幻觉的机制,发现视觉接地路径与幻觉路径的交互特性,并通过抑制幻觉路径组件降低幻觉发生率。

详情

展开后加载摘要…

URL PDF HTML 收藏