arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7552 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7552 篇

2604.02685 2026-04-06 cs.LG cs.AI 73%

Finding Belief Geometries with Sparse Autoencoders

通过稀疏自编码器寻找信念几何结构

Matthew Levinson

机构 * Independent Researcher(独立研究员) Simplex AI Safety

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种通过稀疏自编码器、k子空间聚类和AANet发现变换器表示中简单形结构子空间的管道,验证了在多部分隐藏马尔可夫模型训练的变换器中,Gemma-2-9B中存在候选简单形几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21745 2026-04-03 cs.AI cs.CL 73%

The Presupposition Problem in Representation Genesis

表征生成中的预设问题

Yiling Wu

机构 * BridgeM, Inc.(BridgeM公司) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型在未经历表征生成过渡时的认知能力问题,指出现有哲学框架存在预设结构导致解释延迟,并提出表征回归概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27403 2026-03-31 cs.LG cs.AI 73%

Conditional Factuality Controlled LLMs with Generalization Certificates via Conformal Sampling

基于符合采样的通用化证书的条件事实性控制大语言模型

Kai Ye, Qingtao Pan, Shuo Li

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出条件事实性控制框架CFC,通过增强分位数回归定义连续特征条件接受阈值,实现条件覆盖保证,并在理论和实验上证明其高效性与稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22299 2026-03-25 cs.LG cs.AI 73%

Between the Layers Lies the Truth: Uncertainty Estimation in LLMs Using Intra-Layer Local Information Scores

层间之中蕴藏真相:利用层内局部信息评分在LLMs中进行不确定性估计

Zvi N. Badash, Yonatan Belinkov, Moti Freiman

机构 * Faculty of Data and Decision Sciences, Technion --- Israel Institute of Technology(数据与决策科学学院,技术离子研究所) Faculty of Computer Science, Technion --- Israel Institute of Technology(计算机科学学院,技术离子研究所) Faculty of Biomedical Engineering, Technion --- Israel Institute of Technology(生物医学工程学院,技术离子研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种轻量级方法,通过单次前向传递评估内部表示中的跨层一致模式,实现LLMs的不确定性估计,在跨数据集迁移中优于传统探针方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22295 2026-03-25 cs.CL cs.AI 73%

Whether, Not Which: Mechanistic Interpretability Reveals Dissociable Affect Reception and Emotion Categorization in LLMs

是否而非哪一个:机制可解释性揭示了LLMs中可分离的情感接收与情绪分类

Michael Keeman

机构 * Keido Labs(Keido实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过机制可解释性方法揭示了LLMs中情感处理的两种可分离机制,证明了情绪电路并非依赖关键词,为AI安全评估提供了新标准。

Comments 38 pages, 11 figures, 16 tables. Code and data: https://github.com/keidolabs/affect-reception

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04803 2026-03-23 cs.CV cs.AI cs.LG 73%

Guiding Diffusion-based Reconstruction with Contrastive Signals for Balanced Visual Representation

通过对比信号引导扩散重建以实现平衡的视觉表示

Boyu Han, Qianqian Xu, Shilong Bao, Zhiyong Yang, Ruochen Cui, Xilin Zhao, Qingming Huang

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(人工智能安全国家重点实验室,计算技术研究所,中国科学院) School of Computer Science and Tech., University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Information Engineering, CAS(信息工程研究所,中国科学院) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过对比信号优化扩散重建,以提升CLIP中判别能力和细节感知能力,解决传统方法在平衡视觉表示上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03415 2026-03-20 cs.CL cs.AI 73%

Farther the Shift, Sparser the Representation: Analyzing OOD Mechanisms in LLMs

越远离分布,表示越稀疏:分析LLM中的OOD机制

Mingyu Jin, Yutong Yin, Jingcheng Niu, Qingcheng Zeng, Wujiang Xu, Mengnan Du, Wei Cheng, Zhaoran Wang, Tianlong Chen, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Northwestern University(西北大学) UKP Lab, TU Darmstadt(德累斯顿技术大学UKP实验室) New Jersey Institute of Technology(新泽西理工学院) NEC Lab American(美国NEC实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究LLM在面对难度增加的输入时内部表示的适应机制,发现任务难度提升导致最后隐藏层表示稀疏化,提出基于稀疏性的课程学习策略提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09734 2026-03-20 cs.CL cs.AI 73%

From Detection to Diagnosis: Advancing Hallucination Analysis with Automated Data Synthesis

从检测到诊断:通过自动化数据合成推进幻觉分析

Yanyi Liu, Qingwen Yang, Tiezheng Guo, Feiyu Qu, Jun Liu, Yingyou Wen

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出从检测到诊断的新范式,通过自动化数据合成生成高质量训练样本,训练出HDM-4B-RL模型,在幻觉诊断任务中超越现有检测模型,实现更可靠的生成式AI系统。

Comments Accepted at The 40th Annual AAAI Conference on Artificial Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10781 2026-03-12 cs.CV cs.AI cs.LG 73%

Taking Shortcuts for Categorical VQA Using Super Neurons

通过超级神经元进行类别视觉问答的捷径

Pierre Musacchio, Jaeyi Jeong, Dahun Kim, Jaesik Park

机构 * Seoul National University(首尔国立大学) EPFL(瑞士联邦理工学院) Google Deepmind(谷歌DeepMind)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过超级神经元提升类别视觉问答的性能,利用标量激活代替注意力向量,实现更高效的分类和更快的推理速度。

Comments 25 pages, 15 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08234 2026-03-10 cs.AI cs.LG 73%

The Struggle Between Continuation and Refusal: A Mechanistic Analysis of the Continuation-Triggered Jailbreak in LLMs

延续与拒绝之间的斗争:对LLMs中延续触发突破的机理分析

Yonghong Deng, Zhen Yang, Ping Jian, Xinyue Zhang, Zhongbin Guo, Chengzhi Li

机构 * School of Computer Science & Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了LLMs中延续触发突破现象,揭示了模型内在延续驱动与安全防御之间的竞争机制,为提升模型安全性提供了新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18582 2026-03-10 cs.CL cs.LG 73%

Exploring Embedding Priors in Prompt-Tuning for Improved Interpretability and Control

探索提示调优中嵌入先验以提升可解释性和可控性

Sergey Sedov, Sumanth Bharadwaj Hachalli Karanam, Venu Gopal Kadamba

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了提示调优中嵌入坍缩现象对模型性能的影响,提出嵌入先验以提升可解释性和可控性,并发现不同激活区域的嵌入能有效提升任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07343 2026-03-10 cs.LG cs.AI 73%

Learning Concept Bottleneck Models from Mechanistic Explanations

从机制解释学习概念瓶颈模型

Antonio De Santis, Schrasing Tong, Marco Brambilla, Lalana Kagal

机构 * Politecnico di Milano(米兰理工大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 知识编辑与模型理解 :LLM(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出机制CBM模型,通过从黑盒模型自身学习的概念构建瓶颈层,提升模型的可解释性和预测性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.15048 2026-03-09 cs.CV cs.AI cs.LG cs.MM 73%

Make VLM Recognize Visual Hallucination on Cartoon Character Image with Pose Information

使VLM在卡通角色图像上通过姿态信息识别视觉幻觉

Bumsoo Kim, Wonseop Shin, Kyuchul Lee, Yonghoon Jung, Sanghyun Seo

机构 * Chung-Ang University(Chung-Ang 大学) Coupang(韩国Coupang)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于姿态信息的VLM幻觉检测方法,通过上下文学习提升识别准确率,实验表明在卡通角色图像中幻觉检测效果提升50%-80%。

Comments Accepted at WACV 2025, Project page: https://gh-bumsookim.github.io/Cartoon-Hallucinations-Detection/. (Fixed typos)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04805 2026-03-06 cs.CL cs.AI 73%

Attention's Gravitational Field:A Power-Law Interpretation of Positional Correlation

注意力的引力场:位置相关性的幂律解释

Edward Zhang

机构 * Edward Zhang 1(Edward Zhang)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出注意力引力场概念,通过解耦位置编码与语义嵌入优化模型架构,展现其与万有引力定律的一致性,推动注意力机制的解释与模型优化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08666 2026-03-04 cs.CL cs.AI 73%

Hallucination, Monofacts, and Miscalibration: An Empirical Investigation

幻觉、单事实与校准偏差:一项实证研究

Miranda Muqing Miao, Michael Kearns

机构 * University of Pennsylvania(宾夕法尼亚大学) Department of Computer and Information Science(计算机与信息科学系)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过实验证明,选择性加权可有效降低大型语言模型的幻觉,同时保持准确性,揭示了优化目标间的内在矛盾。

Comments Code available at https://github.com/mmiao2/Hallucination.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11999 2026-03-03 cs.CV cs.AI cs.IR cs.LG 73%

MOON: Generative MLLM-based Multimodal Representation Learning for E-commerce Product Understanding

MOON: 基于生成式多模态大语言模型的电商产品理解多模态表示学习

Daoze Zhang, Chenghan Fu, Zhanheng Nie, Jianyu Liu, Wanxian Guan, Yuan Gao, Jun Song, Pengjie Wang, Jian Xu, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MOON通过生成式多模态大语言模型改进电商产品理解的多模态表示学习,引入引导的MoE模块、核心语义区域检测和负采样策略,提升零样本性能和泛化能力。

Comments Accepted by WSDM 2026 (oral). 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00306 2026-03-02 q-bio.CB cs.AI cs.LG 73%

VCWorld: A Biological World Model for Virtual Cell Simulation

VCWorld:一种用于虚拟细胞模拟的生物世界模型

Zhijian Wei, Runze Ma, Zichen Wang, Zhongmin Li, Shuotong Song, Shuangjia Zheng

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 VCWorld通过整合生物学知识与大语言模型的推理能力,构建了可解释的虚拟细胞模拟模型,实现了对细胞扰动的高效预测和机理阐释。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22424 2026-02-27 cs.CL cs.LG 73%

Causality $\neq$ Invariance: Function and Concept Vectors in LLMs

因果 ≠ 不变:大型语言模型中的函数向量与概念向量

Gustaw Opiełka, Hannes Rosenbusch, Claire E. Stevenson

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLMs中函数向量与概念向量的差异,发现FVs在不同输入格式下不不变,而CVs能提供更稳定的概念表示,且在跨语言和问题类型时表现更优。

Journal ref Opielka, G., Rosenbusch, H., & Stevenson, C. E. (2026). Causality != Invariance: Function and Concept Vectors in LLMs. In Proceedings of the International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21442 2026-02-26 cs.LG cs.AI 73%

MINAR: Mechanistic Interpretability for Neural Algorithmic Reasoning

MINAR: 图神经网络中神经算法推理的机制可解释性

Jesse He, Helen Jenne, Max Vargas, Davis Brown, Gal Mishne, Yusu Wang, Henry Kvinge

机构 * Pacific Northwest National Laboratory, Richland, WA(太平洋西北国家实验室) Halıcıoğlu Data Science Institute, University of California, San Diego, San Diego, CA(哈利奇奥格鲁数据科学研究所,加州大学圣地亚哥分校) Department of Computer and Information Science, University of Pennsylvania, Pennsylvaina, PA(计算机与信息科学系,宾夕法尼亚大学) Department of Mathematics, University of Washington, Seattle, WA(数学系,华盛顿大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MINAR是一种用于图神经网络中神经算法推理的机制可解释性工具,通过归因修补方法发现电路,揭示训练过程中的电路形成和剪枝机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09886 2026-02-26 cs.CL cs.AI 73%

Probabilistic distances-based hallucination detection in LLMs with RAG

基于概率距离的LLM中幻觉检测方法(RAG)

Rodion Oblovatny, Alexandra Kuleshova, Konstantin Polev, Alexey Zaytsev

机构 * Markov Lab, Department of Mathematics(马尔可夫实验室,数学系) Computer Science, Saint-Petersburg University(计算机科学,圣彼得堡大学) AI Center, Skoltech(人工智能中心,斯克里普丘克技术学院) SB AI Lab(SB人工智能实验室) AI Center, Skoltech, Risk department, Sber(人工智能中心,斯克里普丘克技术学院,风险部门)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于概率距离的LLM幻觉检测方法,利用提示标记与响应标记嵌入分布的距离来检测幻觉,具有高效性和可迁移性。

Comments Updated approach to constructing a hallucination detection score. Added results from experiments with the NLI task. The approach with trainable deep kernels has been removed, with a focus on the unsupervised approach

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18346 2026-02-23 cs.CL cs.AI 73%

Vichara: Appellate Judgment Prediction and Explanation for the Indian Judicial System

Vichara:印度司法系统上诉判决预测与解释

Pavithra PM Nair, Preethu Rose Anish

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Vichara通过结构化方法预测和解释印度司法系统中的上诉判决,利用大型语言模型在两个数据集上取得优异表现,尤其在可解释性方面表现突出。

Journal ref AI and Law @ AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15038 2026-02-19 cs.CL cs.AI 73%

Indic-TunedLens: Interpreting Multilingual Models in Indian Languages

Indic-TunedLens:解读印度语言多语言模型

Mihir Panchal, Deeksha Varshney, Mamta, Asif Ekbal

机构 * Dwarkadas Jivanlal Sanghvi College of Engineering(达沃拉斯·吉文拉尔工程学院) Indian Institute of Technology Jodhpur(印度理工学院乔浦尔分校) King’s College London(伦敦国王学院) Indian Institute of Technology Patna(印度理工学院帕特纳分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Indic-TunedLens通过学习共享仿射变换,为印度语言提供更准确的模型表示解码,提升多语言模型的可解释性。

Comments 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL) Thirteenth Workshop on NLP for Similar Languages, Varieties and Dialects (VarDial) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13791 2026-02-17 cs.LG cs.AI 73%

MechPert: Mechanistic Consensus as an Inductive Bias for Unseen Perturbation Prediction

MechPert: 机制共识作为未见扰动预测的归纳偏置

Marc Boubnovski Martell, Josefa Lia Stoisser, Lawrence Phillips, Aditya Misra, Robert Kitchen, Jesper Ferkinghoff-Borg, Jialin Yu, Philip Torr, Kaspar Märten

专题命中 知识编辑与模型理解 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MechPert通过机制共识引导LLM生成定向调控假说,提升未见扰动预测的准确性与实验设计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02543 2026-02-11 cs.LG cs.AI 73%

Toward Ultra-Long-Horizon Sequential Model Editing

迈向超长 horizon 的序列模型编辑

Mingda Liu, Zhenghan Zhu, Ze'an Miao, Katsuki Fujisawa

机构 * Institute of Science Tokyo(东京科学研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Norm-Anchor Scaling NAS方法,通过范数约束策略解决序列模型编辑中的崩溃问题,显著提升编辑性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01220 2026-02-10 cs.CL cs.AI 73%

Towards Open-Ended Discovery for Low-Resource NLP

面向低资源NLP的开放性发现

Bonaventure F. P. Dossou, Henri Aïdasso

机构 * McGill University(麦吉尔大学) Mila Quebec AI Institute(魁北克人工智能研究所) École de technologie supérieure (ÉTS)(高等技术学院)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文呼吁转向互动性语言发现,通过人机协作动态学习低资源语言,推动参与式共适应学习。

Comments Proceedings of the 2nd Workshop on Uncertainty-Aware NLP (UncertaiNLP) at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03696 2026-02-04 cs.LG cs.CL 73%

Conflict-Resolving and Sharpness-Aware Minimization for Generalized Knowledge Editing with Multiple Updates

冲突解决与尖锐性感知最小化:多更新通用知识编辑

Duy Nguyen, Hanqi Xiao, Archiki Prasad, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CoRSA通过冲突解决与尖锐性感知最小化方法,提升多更新知识编辑的泛化能力和稳定性,实现比基线方法更高的性能。

Comments 22 pages, 8 figures. Code link: https://github.com/duykhuongnguyen/CoRSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19875 2026-02-03 cs.CL cs.AI 73%

Stream: Scaling up Mechanistic Interpretability to Long Context in LLMs via Sparse Attention

Stream: 通过稀疏注意力扩展机械可解释性以分析LLM中的长上下文

J Rosser, José Luis Redondo García, Gustavo Penha, Konstantina Palla, Hugues Bouchard

机构 * University of Oxford(牛津大学) Spotify Spain(Spotify西班牙分公司) Spotify Netherlands(Spotify荷兰分公司) Spotify UK(Spotify英国分公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Stream通过稀疏注意力技术实现LLM长上下文的高效可解释性分析,显著减少内存消耗并提升推理轨迹追踪能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15386 2026-02-03 cs.CL cs.AI 73%

RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection

RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉

Yiming Huang, Junyan Zhang, Zihao Wang, Biquan Bie, Yunzhong Qiu, Xuming Hu, Yi R. Fung, Xinlei He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00848 2026-02-03 cs.CL cs.AI 73%

Factuality on Demand: Controlling the Factuality-Informativeness Trade-off in Text Generation

按需事实性:在文本生成中控制事实性与信息性之间的权衡

Ziwei Gong, Yanda Chen, Julia Hirschberg, Chen Zhao, He He, Zhou Yu, Kathleen Mckeown

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Factuality-Controlled Generation框架,通过合成数据训练提升模型在信息性与事实性之间的平衡能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25178 2026-02-03 cs.CV cs.AI cs.LG 73%

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

GHOST:诱导幻觉的多模态大语言模型图像生成

Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

机构 * The University of Melbourne(墨尔本大学) University of Maryland(马里兰大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GHOST通过优化隐蔽令牌生成诱导幻觉的图像,评估多模态大语言模型的可靠性,并发现高幻觉成功率及可转移漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏