arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7527 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7527 篇

2509.25045 2026-07-22 cs.CL cs.AI cs.LG 版本更新 88%

Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures

超维探针:通过向量符号架构解码大语言模型表示

Marco Bronzini, Carlo Nicolini, Bruno Lepri, Jacopo Staiano, Andrea Passerini

机构 * University of Trento(特伦托大学) Ipazia S.p.A.(Ipazia公司) Fondazione Bruno Kessler (FBK)(布鲁诺·凯塞勒基金会)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在解码大语言模型表示,提出超维探针,结合符号表示与神经探测,利用向量符号架构和超向量代数统一先前方法,能深入提取输入特征并支持输出分析,实验表明其可在多场景提取语义信息,推进了语义理解。

Comments CODE: https://github.com/Ipazia-AI/hyperprobe

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 88%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11449 2026-06-10 cs.SD cs.AI cs.CL cs.LG eess.AS 版本更新 88%

Whisper-GPT -- Continuous Discrete Hybrid Representation Language Models For Speech And Music

Whisper-GPT -- 语音和音乐的连续离散混合表示语言模型

Prateek Verma

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Whisper-GPT,一种结合连续音频表示(如频谱图)和离散音频令牌的生成式大语言模型,解决了离散令牌方法上下文长度过长的问题,在语音和音乐的下一个令牌预测中降低了困惑度和负对数似然。

Comments 6 pages, 3 figures. 50th International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27668 2026-05-28 cs.LG cs.AI cs.CL 88%

Aligning LLMs with Human Uncertainty: A Beta-Bernoulli Calibrator for LLM Forecasting

将LLM与人类不确定性对齐:用于LLM预测的Beta-Bernoulli校准器

Hui Dai, Ryan Teehan, Parsa Torabian, Mengye Ren

机构 * Agentic Learning AI Lab(代理学习AI实验室) New York University(纽约大学) The University of Chicago(芝加哥大学) Chronologies AI

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Beta-Bernoulli校准器(BBC),通过结合二元结果和人类预测信号,将初始点估计转换为事件似然分布,实现校准和不确定性量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05859 2026-02-06 cs.LG cs.AI cs.CL 88%

DLM-Scope: Mechanistic Interpretability of Diffusion Language Models via Sparse Autoencoders

DLM-Scope:通过稀疏自编码器实现扩散语言模型的机制可解释性

Xu Wang, Bingqing Jiang, Yu Wan, Baosong Yang, Lingpeng Kong, Difan Zou

机构 * The University of Hong Kong(香港大学) Tongyi Lab, Alibaba Group Inc(阿里云实验室)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract);large language model(abstract);post-training(abstract)

AI总结 DLM-Scope通过稀疏自编码器首次实现扩散语言模型的机制可解释性,展示了其在特征提取和干预中的有效性。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02904 2025-11-11 cs.CL cs.AI cs.LG 88%

How Post-Training Reshapes LLMs: A Mechanistic View on Knowledge, Truthfulness, Refusal, and Confidence

Hongzhe Du, Weikai Li, Min Cai, Karim Saraipour, Zimin Zhang, Himabindu Lakkaraju, Yizhou Sun, Shichang Zhang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of Alberta(阿尔伯塔大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学)

专题命中 知识编辑与模型理解 :post-training(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08329 2025-08-15 cs.AI cs.CL cs.LG 88%

MedRep: Medical Concept Representation for General Electronic Health Record Foundation Models

Junmo Kim, Namkyeong Lee, Jiwon Kim, Kwangsoo Kim

专题命中 知识编辑与模型理解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13229 2024-06-21 cs.CL cs.AI cs.LG 88%

Probing the Emergence of Cross-lingual Alignment during LLM Training

Hetong Wang, Pasquale Minervini, Edoardo M. Ponti

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.18344 2023-10-31 cs.CL cs.AI cs.LG 88%

Chainpoll: A high efficacy method for LLM hallucination detection

Robert Friel, Atindriyo Sanyal

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16035 2023-10-25 cs.CV cs.AI cs.CL cs.LG stat.ML 88%

What's Left? Concept Grounding with Logic-Enhanced Foundation Models

Joy Hsu, Jiayuan Mao, Joshua B. Tenenbaum, Jiajun Wu

专题命中 知识编辑与模型理解 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments NeurIPS 2023. First two authors contributed equally. Project page: https://web.stanford.edu/~joycj/projects/left_neurips_2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12283 2026-08-13 q-fin.PM cs.CL 新提交 88%

Large Language Model-Driven Small-Capitalization Trading: Integrating Financial News Sentiment, Macroeconomic Indicators, and Technical Signals

大语言模型驱动的小盘股交易:整合财经新闻情绪、宏观经济指标与技术信号

Alireza Kargarzadeh, Nariman Khaledian, Navid Parvini, Arman Khaledian

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究提出将大语言模型预测的分解型风险输入投资组合协方差矩阵的方法,在罗素2000股票上验证分离纯阿尔法与纯贝塔选股机制的策略,其在40天持有期下夏普比率达2.33,表现优于双渠道一致机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27101 2026-08-13 cs.CV cs.CL 版本更新 88%

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

弹出式干扰揭示视频大语言模型中的事件袋行为

Oscar Chew, Serhii Honcharenko, Qian-Hui Chen, Patricia Lu, Dishant Zaveri, Khoa D. Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) Stanford University(斯坦福大学) VinUniversity(文大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过插入无关广告片段,发现视频大语言模型常将不同片段的事件错误关联,表现出将视频视为事件集合而非时间序列的“事件袋”行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 88%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 88%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00123 2026-08-10 cs.AI 版本更新 88%

Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models

最小、局部、因果解释用于大语言模型中的对抗成功

Shubham Kumar, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型对抗成功的因果机制,提出LOCA方法通过局部解释识别最小的中间表示变化,以解释对抗成功的原因。

Comments Published at COLM 2026 (updated bib)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04029 2026-08-07 cs.CL 版本更新 88%

CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

CrossHallu:大语言模型内部的幻觉信号能否跨语言和领域泛化?

Aisha Alansari, Malak Alkhorasani, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学) Imam Abdulrahman bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型内部幻觉检测信号能否跨语言和领域泛化,通过CrossHallu对六个模型的内部表征在生成式问答任务上进行评估,结果揭示了模型内部状态幻觉信号跨语言和领域转移的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00209 2026-08-06 cs.CL 版本更新 88%

Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations

大语言模型是否了解内部隐私?在大型语言模型表示中探测和引导上下文隐私规范

Haoran Wang, Li Xiong, Kai Shu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大语言模型中上下文隐私规范的编码结构,通过探测和引导上下文隐私参数,揭示了模型在隐私保护上的不足,并展示了如何通过结构化控制减少隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26825 2026-07-31 cs.CL 版本更新 88%

From Found to Designed: Concepts as a Design Axis for Large Language Models

从发现到设计:将概念作为大语言模型的设计轴

Chen Shani

机构 * Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型概念级结构依赖事后发现而非设计的问题,提出将概念作为设计轴,划分设计空间维度并分析现有模式,推动转向设计带显式概念表示的大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20995 2026-07-24 cs.CL 新提交 88%

Where Animacy Lives in Large Language Models: Tracing the Circuits of the Animacy Concept

大语言模型中 animacy 的所在之处:追踪 animacy 概念的电路

Samuele Punzo, Giovanni Cinà, Sandro Pezzelle

机构 * Graduate School of Informatics, University of Amsterdam(阿姆斯特丹大学信息学研究生院) Amsterdam University Medical Center(阿姆斯特丹大学医学中心) ILLC, University of Amsterdam(阿姆斯特丹大学逻辑、语言与计算研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型中 animacy 概念相关电路,构建受控数据集对四个开放权重模型进行电路发现,通过实验和消融表明存在处理 animacy 的因果机制,发现的电路定位性差且泛化有限,证实 animacy 概念特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02528 2026-07-21 q-fin.GN cs.CY cs.LG 版本更新 88%

Auditing Asset-Specific Preferences in Financial Large Language Models: Evidence from Bitcoin Representations and Portfolio Allocation

审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据

Wenbin Wu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。

Comments 31 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10382 2026-07-21 cs.CL 版本更新 88%

Language Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models

触发器劫持语言电路:大型语言模型中后门行为的机制分析

Théo Lasnier, Wissam Antoun, Francis Kulumba, Benoît Sagot, Djamé Seddah

机构 * Inria Paris(巴黎研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型中后门行为的机制,发现触发器通过劫持现有语言组件实现输出语言切换,为后门防御提供了新思路。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 88%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04430 2026-07-07 cs.CL 新提交 88%

Uncertainty-Aware Abstention in Large Language Models with Provable Alignment Guarantees

具有可证明对齐保证的大语言模型中的不确定性感知弃权

Sijin Dong, Hiroyuki Shinnou

机构 * Ibaraki University(茨城大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型在问答系统中无可靠置信估计的问题,提出基于置信区间的校准框架CIC,将任意不确定性分数转化为风险可控的选择性回答规则,保证所选阈值控制错误率,兼具风险控制和回答效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08831 2026-06-30 cs.AI 新提交 88%

Inference-Time Conformal Reasoning with Valid Factuality Control for Large Language Models

面向大语言模型的推理时保形推理与有效事实性控制

Ting Wang, Yuanjie Shi, Yan Yan, Huan Zhang

机构 * Machine Learning, ICML(机器学习,国际机器学习大会)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出推理时保形推理框架,将保形预测集成到推理图生成中,通过图级不确定性校准生成停止阈值,实现有效事实性控制。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28153 2026-06-29 cs.CR cs.AI 新提交 88%

Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models

越狱攻击下的鲁棒有害特征:来自大型语言模型中注意力头特化的机制证据

Yanchen Yin, Dongqi Han, Linghui Li

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 通过分析注意力头特化,发现越狱攻击通过抑制早期层的对抗妥协头(ACHs)绕过安全对齐,而中间层的安全对齐头(SAHs)保持鲁棒激活,揭示了鲁棒有害特征现象,并利用这些持久激活实现无需训练的检测。

Comments 33 pages, 19 figures. Accepted at ICML 2026 as an Oral presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26422 2026-06-26 cs.AI 新提交 88%

Estimating Uncertainty in Classifier Performance with Applications to Large Language Models and Nested Data

分类器性能不确定性估计及其在大语言模型和嵌套数据中的应用

Kylie Anglin

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(康涅狄格大学尼格教育学院教育心理学系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对文本分类中性能指标置信区间报告不足且方法不当的问题,本文评估了多种区间估计方法,推荐了适用于小样本、低频构念和嵌套数据的准确方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19542 2026-06-19 cs.LG 新提交 88%

Tracking Representation Dynamics in Large Language Models with Persistent Homology

利用持续同调追踪大型语言模型中的表示动态

Naman Malhotra, Jay Ambadkar, Abhinav Gupta, Kushal Kasivel, Abbas Schwarz, Kamillo Ferry, Anthea Monod

机构 * Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 通过持续同调分析激活空间拓扑,发现对齐过程中拓扑重组主要发生在训练早期,且不同对齐目标产生可区分的拓扑轨迹。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16629 2026-06-16 cs.CL 新提交 88%

Islamic Large Language Models: From Knowledge Acquisition to Trustworthy and Hallucination-Resistant AI

伊斯兰大语言模型:从知识获取到可信且抗幻觉的人工智能

Mohammed Amine Mouhoub

机构 * Paris Dauphine University(巴黎多芬纳大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 综述伊斯兰大语言模型领域,提出构建可信、抗幻觉的伊斯兰AI需结合阿拉伯语NLP、检索增强生成、教法学派推理及专家评估等关键技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08157 2026-06-09 cs.CL 新提交 88%

Cross Paraphrastic Invariance Learning for Hallucination Detection

跨释义不变性学习用于幻觉检测

Shanshan Lin, Dongsheng Hong, Sibo Ju, Chao Chen, Sihong Xie, Xiangwen Liao

机构 * Fuzhou University(福州大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出CPIL框架,通过构建正负样本对进行两阶段对比学习,仅用1%标注数据即在11个任务上超越基线,高效检测LLM幻觉。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02469 2026-06-09 q-fin.CP cs.AI cs.MA 88%

Modeling Hawkish-Dovish Latent Beliefs in Multi-Agent Debate-Based LLMs for Monetary Policy Decision Classification

多智能体辩论式LLM中鹰派-鸽派隐含信念建模用于货币政策决策分类

Kaito Takano, Masanori Hirano, Kei Nakagawa

机构 * Osaka Metropolitan University(大阪市立大学) Preferred Networks, Inc.

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多智能体辩论式LLM框架,通过建模鹰派与鸽派隐含信念提升货币政策预测准确性,优于传统LLM基线。

Comments PRIMA2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏