arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2603.22042 2026-07-14 cs.CV cs.AI 版本更新 79%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20433 2026-06-23 cs.CL 版本更新 79%

Disentangling Geometry, Performance, and Training in Language Models

解耦语言模型中的几何、性能与训练

Atharva Kulkarni, Jacob Mitchell Springer, Arjun Subramonian, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 系统研究Transformer权重几何(尤其是解嵌入矩阵有效秩)与下游性能的关系,发现有效秩主要反映训练超参数而非性能,不能可靠预测模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00918 2026-06-23 cs.AI 版本更新 79%

Sparse Neuron Ablation Triggers Catastrophic Collapse of the Language Core in Large Vision-Language Models

稀疏神经元消融引发大型视觉-语言模型中语言核心的灾难性崩溃

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(瑞士洛桑联邦理工学院) Idiap Research Institute(日内瓦研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 提出渐进式神经元消融方法CAN,发现消融极少量(如LLaVA-1.5-7b中仅4个)位于语言模型下投影层的神经元即可导致LVLM灾难性崩溃,揭示功能依赖语言骨干中的稀疏神经元子集。

Comments Accepted to ICML 2026 Mechanistic Interpretability Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07025 2026-06-08 cs.CV cs.AI 版本更新 79%

The Geometry of Representational Failures in Vision Language Models

视觉语言模型中表征失败的几何结构

Daniele Savietto, Declan Campbell, André Panisson, Marco Nurisso, Giovanni Petri, Jonathan D. Cohen, Alan Perotti

机构 * Dipartimento di Fisica, Università di Torino(都灵大学物理系) Princeton Neuroscience Institute and AI Lab, Princeton University(普林斯顿大学神经科学研究所和AI实验室) Intesa Sanpaolo AI Research(Intesa Sanpaolo AI研究中心) Dipartimento di Scienze Matematiche, Politecnico di Torino(都灵理工学院数学科学系) Network Science Institute, Northeastern University London, UK(伦敦大学东北方大学网络科学研究所)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.AI

AI总结 通过分析开源视觉语言模型的概念向量几何重叠,揭示多目标视觉任务中幻觉等错误与认知约束的关联,并提出基于干预的验证方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31087 2026-08-12 cs.CL cs.AI 版本更新 79%

When Reranking Hurts: Uncertainty-Based Gating for Few-Shot Reranking

当重排序有害时:基于不确定性的门控机制用于少样本重排序

Orian Dabod, Amir DN Cohen, Gabriel Stanovsky

机构 * The Hebrew University of Jerusalem(耶路撒冷希伯来大学) OriginAI

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对少样本选择中重排序可能降低性能的问题,提出无训练门控重排序方法,基于模型不确定性决定是否重排序,在8个LLM上降低15%-80%计算成本并提升平均性能达2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07998 2026-08-11 cs.LG cs.AI 版本更新 79%

Enhancing AI Interpretability with Localised Architectures

通过局部化架构增强AI可解释性与安全性

Ian Seet, Jonas Bozenhard, Simon Ostermann

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对大型生成式AI模型可解释性差、计算成本高的问题,提出局部化机器学习架构,通过降低带宽、提高节点表达能力来提升可解释性和效率,并评估了多种硬件实现方案的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17229 2026-07-20 cs.AI cs.CL 版本更新 79%

Mechanistic Interpretability of Cognitive Complexity in LLMs via Linear Probing using Bloom's Taxonomy

通过线性探针利用布洛姆分类法探讨大语言模型中认知复杂性的机制可解释性

Bianca Raimondi, Maurizio Gabbrielli

机构 * University of Bologna(博洛尼亚大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过线性探针利用布洛姆分类法,证明大语言模型中认知复杂性可通过线性可访问子空间表示,揭示模型在处理提示时早期解决认知难度的机制。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03730 2026-08-12 cs.CV 版本更新 78%

Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models

超越虚假稳定性:面向视觉语言模型测试时对抗防御的高噪声漂移门控

Hashmat Shadab Malik, Muzammal Naseer, Salman Khan

机构 * Mohamed Bin Zayed University of AI, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋) Khalifa University, UAE(卡布斯大学,阿联酋) Australian National University, Australia(澳大利亚国立大学,澳大利亚)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 针对视觉语言模型在测试时易受对抗攻击的问题,提出一种无训练、即插即用的高噪声漂移门控机制,通过检测高噪声下的特征不稳定性触发防御,改善了干净-鲁棒性权衡。

Journal ref The 37th British Machine Vision Conference (BMVC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04641 2026-07-30 cs.CV 版本更新 78%

CAST: Mitigating Object Hallucination in Large Vision-Language Models via Caption-Guided Visual Attention Steering

CAST:通过字幕引导的视觉注意力调控缓解大型视觉语言模型中的物体幻觉

Qiming Li, Zekai Ye, Xiaocheng Feng, Weihong Zhong, Libo Qin, Ruihan Chen, Lei Huang, Baohang Li, Kui Jiang, Yaowei Wang, Ting Liu, Bing Qin

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 本研究针对大型视觉语言模型的物体幻觉问题,提出无需训练的即插即用方法CAST,通过字幕引导的视觉注意力调控,在低推理成本下平均降低物体幻觉6.03%,实现最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新 78%

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新 78%

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 知识编辑与模型理解 :language model(title,abstract)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18931 2026-07-21 cs.CV 版本更新 78%

Enhancing Vision Foundation Models via Multimodal Continual Pre-Training

通过多模态持续预训练增强视觉基础模型

Yitong Chen, Lingchen Meng, Wujian Peng, Jun Tao, Chenjie Xu, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Baosight Software Co., Ltd.(上海博视软件有限公司)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 研究通过多模态持续预训练增强视觉基础模型,提出M-CPT框架,用持续位置嵌入处理不同分辨率视觉输入,通过特征对齐目标提升视觉与文本表示一致性,实验证明该框架能提升多模态理解性能并保持标准视觉任务表现。

Comments Code is available in https://github.com/ShareLab-SII/CoMP-MM

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28543 2026-07-07 cs.AI cs.CL cs.LG 版本更新 78%

Cultural Binding Heads in Language Models

语言模型中的文化绑定头

Avrile Floro, Luca Benedetto

机构 * Mistral-7B Mistral-Nemo-12B Llama-3.1-8B Gemma-2-9B

专题命中 知识编辑与模型理解 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 通过机制可解释性和析因设计,识别出8个语言模型中2-3个中间层注意力头对文化绑定有因果贡献,且绑定主要在预训练阶段形成,知识探测表明模型知道的知识远多于其行为表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 78%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 知识编辑与模型理解 :LLM(title,abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04552 2026-08-06 cs.CL q-bio.GN 版本更新 77%

LDARNet: DNA Adaptive Representation Network with Learnable Tokenization for Genomic Modeling

LDARNet: 用于基因组建模的DNA自适应表示网络与可学习分词

Daria Ledneva, Denis Kuznetsov

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 提出LDARNet,一种结合动态分块和双向路由的120M参数层次基因组基础模型,在27个任务中优于更大模型,并发现学习到的边界与生物学基序对齐。

Comments Fix parameter count typo; update results

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01557 2026-07-31 cs.CL 版本更新 77%

Language Diversity: Evaluating Language Usage and AI Performance on African Languages in Digital Spaces

语言多样性:评估非洲语言在数字空间中的使用情况和人工智能性能

Edward Ajayi, Eudoxie Umwari, Mawuli Deku, Prosper Singadi, Jules Udahemuka, Bekalu Tadele, Chukuemeka Edeh

机构 * Carnegie Mellon University(卡内基梅隆大学) Africa Kigali Rwanda(非洲基加利卢旺达) Bahir Dar Institute of Technology(巴希尔达尔技术学院) Federal University Otuoke Bayelsa Nigeria(贝莱萨州联邦大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本研究发现本地新闻数据比对话平台数据更有效用于训练非洲语言的AI模型,强调了处理干净和语言切换文本的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01457 2026-07-28 cs.CL 版本更新 77%

Wired for Overconfidence: A Mechanistic Perspective on Inflated Verbalized Confidence in LLMs

为自信所束缚:对大语言模型中过度自信的机械视角分析

Tianyi Zhao, Yinhan He, Wendy Zheng, Yujie Zhang, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了大语言模型中过度自信的机制,发现中间层的MLP块和注意力头会生成自信信号,并通过干预提升校准性。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05618 2026-07-27 cs.CL 版本更新 77%

Learning to Reason for Factuality

学习进行事实性推理

Xilun Chen, Ilia Kulikov, Vincent-Pierre Berges, Barlas Oğuz, Rulin Shao, Gargi Ghosh, Jason Weston, Wen-tau Yih

机构 * FAIR at Meta(Meta 的 FAIR) University of Washington(华盛顿大学)

专题命中 知识编辑与模型理解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究推理大型语言模型在事实性推理方面的问题,提出同时考虑事实精度、响应细节和答案相关性的新型奖励函数,应用在线强化学习,使模型在长篇事实性基准测试中幻觉率降低、答案细节提升且响应帮助性无降。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20817 2026-07-23 cs.CL 版本更新 77%

EssayCBM: Rubric-Aligned Concept Bottleneck Models for Transparent Essay Grading

EssayCBM: 基于评分标准的概念瓶颈模型用于透明的作文评分

Kumar Satvik Chaudhary, Chengshuai Zhao, Fan Zhang, Garima Agrawal, Yuli Deng, Huan Liu

机构 * Arizona State University(亚利桑那州立大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 EssayCBM通过分解为八种可解释的写作概念,提供透明的作文评分方法,使教师能够检查和调整评分标准级别的预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02911 2026-07-16 cs.CL 版本更新 77%

The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架

Mirko Lai, Alessandra Urbinati, Simona Frenda, Fabiana Vernero, Marco Antonio Stranisci

机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) Heriot-Watt University(赫瑞-沃顿大学) aequa-tech Università del Piemonte Orientale(皮埃蒙特东方大学) Università degli Studi di Torino(托斯卡纳大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 提出结合共形预测与协同过滤式标注者表征的框架,通过幽灵预测度量和幽灵标注者表征量化模型预测与所有人类标注的分歧,并发现模型在标注者分歧时不确定性增加,但大型模型对无人类对齐文本更自信,且存在结构性人口统计偏差。

Comments The publishing of this preprint is contextual with the ACL ARR cycle system. After an encouraging review in January we revised and submit the paper on Arxiv. However, a new batch of reviewers raised additional issues that will lead to significant revisions of the experimental setting. Therefore, we decide to withdraw the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29693 2026-07-09 cs.AI 版本更新 77%

Measuring the metacognition of AI

测量人工智能的元认知

Richard Servajean, Philippe Servajean

机构 * Center for Brain Science, RIKEN(日本立命馆大学脑科学研究中心)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出使用meta-d'框架和信号检测理论评估AI的元认知能力,通过实验验证其在不同任务和风险下的决策调节能力。

Comments 19 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10371 2026-06-25 eess.AS cs.CL 版本更新 77%

Speech Codec Probing from Semantic and Phonetic Perspectives

从语义和语音角度探测语音编解码器

Xuan Shi, Chang Zeng, Tiantian Feng, Shih-Heng Wang, Jianbo Ma, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Dolby Laboratories(杜比实验室)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过三项任务系统分析多种语音分词器编码的信息,发现当前分词器主要捕获语音结构而非词汇语义,为下一代语音分词方法设计提供指导。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20045 2026-06-18 cs.CL 版本更新 77%

Efficient Hallucination Detection for LLMs Using Uncertainty-Aware Attention Heads

基于不确定性感知注意力头的高效大语言模型幻觉检测

Artem Vazhentsev, Lyudmila Rvanova, Gleb Kuzmin, Ekaterina Fadeeva, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Mrinmaya Sachan, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德人工智能大学) ETH Zurich(苏黎世联邦理工学院) Independent Researcher(独立研究者) Applied AI Institute(应用人工智能研究所)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出RAUQ框架,利用不确定性感知注意力头与令牌级置信度,通过单次前向传递实现无监督、高效的序列级幻觉检测,在12个数据集上优于现有方法且额外计算少于1%。

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16823 2026-06-09 cs.LG 版本更新 77%

VQ-Atom: Semantic Discretization of Local Atomic Environments for Molecular Representation Learning

原子作为语言:VQ-Atom:用于分子表示学习的语义离散化

Takayuki Kimura

机构 * Atoms as Language, LLC(Atoms as Language公司)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出VQ-Atom,一种用于分子表示学习的语义离散化框架,通过将连续的原子级图表示转换为对应局部化学环境的离散标记,从而提升分子表示的学习效果。

Comments 7 pages, 6 figures. Submitted to ICML 2026 Workshop on Foundation Models for Life Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24730 2026-08-06 cs.HC 版本更新 75%

Diamonds in the rough: Transforming SPARCs of imagination into a game concept by leveraging medium sized LLMs

粗糙中的钻石:通过利用中型大语言模型将想象力的SPARCs转化为游戏概念

Julian Geheeb, Farhan Abid Ivan, Daniel Dyrda, Miriam Anschütz, Georg Groh

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了中型大语言模型在早期游戏设计中的应用,通过生成和评估游戏创意,展示了这些模型在提供有用反馈方面的潜力,并指出需要进一步优化提示方法以提高一致性。

Comments 13 pages, 4 figures, 2 tables

Journal ref Proceedings of AI4HGI '25, the First Workshop on Artificial Intelligence for Human-Game Interaction at the 28th European Conference on Artificial Intelligence (ECAI '25), Bologna, October 25-30, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21022 2026-08-04 cs.SE 版本更新 75%

Don't Use a Cannon to Kill a Fly: Lightweight Model Editing for LLMs to Correct Deprecated API Recommendations

轻量级模型编辑用于LLMs纠正过时的API推荐

Guancheng Lin, Xiao Yu, Jacky Keung, Xing Hu, Xin Xia, Alex X. Liu

专题命中 知识编辑与模型理解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AdaLoRA-L方法,通过区分通用API层和特定API层,提升LLMs生成最新API的能力。

Comments Accepted to ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24884 2026-07-30 cs.SE cs.AI cs.CL cs.LG 版本更新 75%

Beyond "What to Retrieve": Uncertainty in Retrieval-Augmented Code Generation

超越“检索什么”:检索增强代码生成中的不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究存储库级代码生成中异构证据不确定性问题,提出不确定性感知框架OpenCoder,通过估计特定源不确定性来过滤和排序证据以指导相关操作,实验表明其能提高输出正确性,支持将不确定性作为可操作控制信号。

Comments 9 pages, 4 figures. Source code and supporting materials are available at https://github.com/Rocky5502/OpenCoder_V1

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14300 2026-07-13 cs.AI cs.CL cs.LG 版本更新 75%

Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors

超越黑盒混淆:白盒监测器的机制分析与防御

Maheep Chaudhary, Fazl Barez

机构 * University of Oxford(牛津大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型白盒监测器可被规避且缺乏防御措施的问题,通过红队实验揭示几何转移和协方差操纵两种逃避策略,引入SafetyNet集成方法,在多模型家族实验中取得高AUROC分数,为稳健潜在空间监测提供了实证和起点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29466 2026-07-03 cs.LG cs.AI cs.CL 版本更新 75%

An Isotropic Approach to Efficient Uncertainty Quantification with Gradient Norms

基于梯度范数的高效不确定性量化方法

Nils Grünefeld, Jes Frellsen, Christian Hardmeier

机构 * IT University of Copenhagen(哥本哈根信息技术大学) Pioneer Centre for Artificial Intelligence(人工智能先锋中心) Technical University of Denmark(丹麦技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种轻量级方法,通过梯度范数和参数协方差的近似,实现对神经网络预测不确定性的高效量化,验证了其在不同基准测试中的有效性。

Comments ProbML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21577 2026-06-16 cs.CL cs.AI cs.LG stat.ML 版本更新 75%

A Unified Definition of Hallucination: It's The World Model, Stupid!

幻觉的统一定义:是世界模型的问题,笨蛋!

Emmy Liu, Varun Gangal, Chelsea Zou, Michael Yu, Xiaoqi Huang, Alex Chang, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :LLM(abstract_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出幻觉的统一定义,即用户可观察到的错误内部世界建模,并连接至HalluWorld基准测试,以区分真实幻觉与规划或奖励错误。

Comments ICML 2026. HalluWorld benchmark at https://github.com/DegenAI-Labs/HalluWorld

详情

展开后加载摘要…

URL PDF HTML 收藏