arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7505 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7505 篇

2512.14751 2026-08-07 cs.CR cs.AI 版本更新 89%

One Leak Away: How Pretrained Model Exposure Amplifies Jailbreak Risks in Finetuned LLMs

一个泄漏:预训练模型暴露如何放大微调LLM中的劫持风险

Yixin Tan, Zhe Yu, Rui Wen, Jun Sakuma

机构 * Institute of Science Tokyo(东京科学研究所) Riken AIP(理化学研究所AIP)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究揭示了预训练模型暴露如何放大微调LLM的劫持风险,提出PGP攻击方法,证明了预训练到微调过程中存在的安全漏洞。

Comments This paper has been accepted to the ACM SIGSAC Conference on Computer and Communications Security (ACM CCS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03411 2026-08-05 cs.CL 新提交 89%

DUD: Decoupled Update Dynamics for Reliable Uncertainty Quantification in Large Language Models

DUD:用于大语言模型可靠不确定性量化的解耦更新动力学

Yixin Bu, Runze Xia, Guanyun Zou, Yupeng Ji, Haodong Liu, Piji Li

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本研究针对大语言模型不确定性量化的传统方法缺陷,提出DUD框架通过因果干预解耦FFN与注意力的更新贡献,实验表明其在不确定性估计、校准及跨数据集泛化上均优于现有基线。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10771 2026-08-05 cs.CL 版本更新 89%

Word Recovery in Large Language Models Enables Character-Level Tokenization Robustness

在大语言模型中实现词恢复增强了字符级分词的鲁棒性

Zhipeng Yang, Shu Yang, Lijie Hu, Di Wang

机构 * Zhipeng Yang(杨志鹏) Shu Yang(杨舒) Lijie Hu(胡丽杰) Di Wang(王迪)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本研究通过机制可解释性发现词恢复是大语言模型处理字符级输入的关键机制,增强了分词鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17890 2026-07-23 cs.AI 版本更新 89%

Stress Testing Concept Erasure with Large Language Model Agents

用大语言模型智能体对概念擦除进行压力测试

Yuyang Xue, Feng Chen, Zhihua Liu, Edward Moroshko, Jingyu Sun, Steven McDonagh, Sotirios A. Tsaftaris

机构 * School of Engineering, University of Edinburgh(爱丁堡大学工程学院) The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对概念擦除评估面临的验证挑战,提出STACE框架,利用大语言模型智能体迭代生成并验证压力测试假设,通过一套指标评估性能效率,经实验证明该框架在多方面表现优异且可拓展到其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13596 2026-07-16 cs.CR cs.AI 新提交 89%

Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

保护能力幻觉:当大语言模型声称具备不存在的能力时

Eunna Lee, Jungpyo Nam, Sunjun Hwang

机构 * Korea Cyber University(韩国网络大学) Yonsei University(延世大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型的保护能力幻觉现象,通过三阶段研究发现其受情境严重程度和交互形式影响,体现了角色分配与能力边界规范的差距,提出能力边界的部署端规范是缓解该问题的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05721 2026-07-08 cs.CL 新提交 89%

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ:用于大语言模型生成的跨度级不确定性量化

Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

机构 * Amazon(亚马逊) Northeastern University(东北大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究大语言模型生成的跨度级不确定性量化问题,提出SPANUQ轻量级探测器,通过混合贝塔分布估计不确定性,经特殊训练方式构建基准。实验显示其在不确定性质量、速度及错误定位上表现出色,且能在多个大语言模型上通用。

Comments The project page is available at https://damon-demon.github.io/SpanUQ.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18895 2026-07-07 q-fin.RM cs.LG 89%

Could Large Language Models work as Post-hoc Explainability Tools in Credit Risk Models?

大语言模型能否在信用风险模型中作为事后可解释性工具?

Wenxi Geng, Dingyuan Liu, Liya Li, Yiqing Wang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) Southern Methodist University(南方 Methodist 大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究大语言模型是否能作为信用风险模型的事后可解释性接口,评估其在保持特征重要性排名和生成自主解释方面的能力。

Comments 39 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03335 2026-06-30 cs.CL 89%

Compressed Sensing for Capability Localization in Large Language Models

压缩感知在大语言模型能力定位中的应用

Anna Bair, Yixuan Even Xu, Mingjie Sun, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究通过压缩感知方法识别大语言模型中特定能力依赖的稀疏注意力头,发现关闭少量头可显著降低特定能力表现,揭示了模型模块化组织原则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18263 2026-06-18 cs.HC cs.AI 新提交 89%

How Well Do Large Language Models Capture Human Personality?

大型语言模型在多大程度上捕捉人类个性?

Aanisha Bhattacharyya, Yaman Kumar Singla, Rajiv Ratn Shah, Changyou Chen, Jitendra Ajmera

机构 * Adobe Media and Data Science Research (MDSR)(Adobe媒体与数据科学研究院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究通过形式化假设并系统评估,发现增加角色描述复杂性会导致表征和行为多样性收缩(角色流形坍缩),简单年龄-性别角色比丰富描述更准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08589 2026-06-09 cs.CL cs.DL cs.IR 新提交 89%

Detection and Interpretability Analysis of Quotation Errors by Large Language Models

大语言模型对引用错误的检测与可解释性分析

Bei Huang, Yingyi Zhang, Shenghao Huang, Chengzhi Zhang

机构 * School of Social Science, Soochow University(苏州大学社会科学学院) School of Economics and Management, Nanjing University of Science and Technology(南京理工大学经济与管理学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 针对引用错误问题,提出基于大语言模型微调的自动检测方法,通过引入全文数据优化数据集构建,并利用TokenSHAP进行可解释性分析,实验表明微调方法有效且基于源摘要的全文整合方案性能最佳。

Journal ref The Electronic Library, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05858 2026-06-05 cs.CL 89%

ReverseEOL: Improving Training-free Text Embeddings via Text Reversal in Decoder-only LLMs

ReverseEOL: 通过解码器仅LLM中的文本反转改进无训练文本嵌入

Ailiang Lin, Zhuoyun Li, Yusong Wang, Keyu Mao, Kotaro Funakoshi, Manabu Okumura

机构 * Institute of Science Tokyo(东京科学研究所) Tencent(腾讯)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出ReverseEOL方法,通过反转输入文本生成互补嵌入,结合前向嵌入提升冻结解码器仅LLM的文本表示能力,在STS和MTEB基准上显著提升无训练基线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29751 2026-06-01 cs.CL 89%

DySem: Uncovering Dynamic Semantic Components of Large Language Models for Calculating Semantic Textual Similarity

DySem: 揭示大语言模型的动态语义组件以计算语义文本相似度

Kaijie Zheng, Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering(计算机科学与软件工程学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 提出DySem框架,通过多语言共识提取大语言模型中与语义更相关的内部组件,并构建文本相关的联合语义集实现动态维度相似度计算,无需训练且性能优于基线。

Comments 18 pages, 23 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28170 2026-05-28 cs.AI 89%

Localizing Input Uncertainty Quantification for Large Language Models via Shapley Values

通过Shapley值为大型语言模型定位输入不确定性量化

Seongjun Lee, Suwan Yoon, Changhee Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 提出ShaQ框架,利用Shapley值将输入中的模糊跨度建模为合作博弈参与者,通过条件熵的边际减少加权平均量化每个跨度对输入不确定性的贡献,实现跨度级归因,在AmbigQA、AmbiEnt和MediTOD基准上取得最先进性能。

Comments Codes are available https://anonymous.4open.science/r/ShaQ-0E39/README.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14125 2026-05-19 cs.CL 89%

Polar probe linearly decodes semantic structures from LLMs

极性探针线性解码LLM中的语义结构

Pablo J. Diego-Simón, Pierre Orhan, Emmanuel Chemla, Yair Lakretz, Jean-Rémi King

机构 * LSCP, ENS, PSL, EHESS, CNRS(LSCP、ENS、PSL、EHESS、CNRS) Paris Brain Institute(巴黎脑研究所) Earth Species Project(地球物种计划) Meta AI

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过极性探针线性恢复LLM中的语义结构,发现其基于嵌入距离和方向表示实体存在与关系类型,且在中层表现更优,能泛化至新实体但随语义结构规模下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03182 2026-05-11 cs.SE cs.LG 89%

Understanding Robustness of Model Editing in Code LLMs

理解代码LLM中模型编辑的鲁棒性

Vinaik Chhetri, Moghis Fereidouni, A. B Siddique, Umar Farooq

机构 * Louisiana State University(路易斯安那州立大学) University of Kentucky(肯塔基大学)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究代码LLM在API更新下的模型编辑鲁棒性,评估不同方法在单次和连续编辑下的性能,发现多数方法在泛化和特定性上表现不佳,且连续编辑导致性能显著下降。

Comments 26 pages, 14 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01189 2026-05-08 cs.HC cs.AI 89%

Beyond Value Elicitation: Towards Moral Profiles in Early Requirements Engineering via Role-Playing Games and Anthropologist LLMs

超越价值获取:通过角色扮演游戏和人类学家LLM实现早期需求工程中的道德画像

Gianluca De Ninno, Paola Inverardi, Francesca Belotti

机构 * Computer Science Area, Gran Sasso Science Institute(格兰萨索科学研究所计算机科学部门) Department of Computer Science, University of Pisa(比萨大学计算机科学系) Department of Humanities, University of L’Aquila(拉奎拉大学人文学系)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过结合沉浸式角色扮演游戏与LLM分析,提出一种获取和表示数字系统用户道德画像的方法,解决了传统方法在捕捉隐性、情境依赖性价值观上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14427 2026-04-29 cs.CL 89%

Token-Level Density-Based Uncertainty Quantification Methods for Eliciting Truthfulness of Large Language Models

基于令牌密度的不确定性量化方法用于获取大语言模型的真实性

Artem Vazhentsev, Lyudmila Rvanova, Ivan Lazichny, Alexander Panchenko, Maxim Panov, Timothy Baldwin, Artem Shelmanov

机构 * Skoltech(斯克里普切尔技术学院) AIRI(人工智能研究所) MBZUAI(马斯克商学院人工智能研究所) MIPT(莫斯科国立信息技术机械与光学学院) FRC CSC RAS(俄罗斯科学院远东分院计算机科学与控制学院) The University of Melbourne(墨尔本大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出一种基于令牌密度的不确定性量化方法,通过提取多层嵌入并计算Mahalanobis距离,提升文本生成和事实核查任务的不确定性评估精度与效率。

Journal ref Proceedings of the 2025 Conference of the Nations of the Americas Chapter of the Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22345 2026-04-27 cs.CL 89%

Preference Heads in Large Language Models: A Mechanistic Framework for Interpretable Personalization

大型语言模型中的偏好头:可解释个性化机制框架

Weixu Zhang, Ye Yuan, Changjiang Han, Yuxing Tian, Zipeng Sun, Linfeng Du, Jikun Kang, Hong Kang, Xue Liu, Haolun Wu

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) MBZUAI(马克斯·普朗克人工智能研究所) University of Montreal(蒙特利尔大学) Salesforce(Salesforce公司)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出DPS框架,通过因果掩码分析识别偏好头并实现可控可解释的个性化,实验表明在保持内容连贯性的同时提升个性化精度。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20945 2026-04-24 cs.CR cs.LG 89%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16161 2026-04-22 cs.CV cs.CL 89%

OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models

OmniParser V2:结构化思维点用于统一的视觉文本解析及其在多模态大语言模型中的通用性

Wenwen Yu, Zhibo Yang, Jianqiang Wan, Sibo Song, Jun Tang, Wenqing Cheng, Yuliang Liu, Xiang Bai

机构 * School of Information Science and Engineering, East China University of Science and Technology(东华大学信息科学与工程学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件工程学院) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Alibaba Group(阿里巴巴集团)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出OmniParser V2,通过结构化思维点提示方案统一视觉文本解析任务,简化流程并提升性能,在多个数据集上取得最佳结果,并验证其在多模态大语言模型中的通用性。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22795 2026-04-16 cs.CL 89%

Sparse or Dense? A Mechanistic Estimation of Computation Density in Transformer-based LLMs

稀疏还是密集?一种对基于Transformer的LLM计算密度的机理估计

Corentin Kervadec, Iuliia Lysova, Marco Baroni, Gemma Boleda

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过机理可解释性方法系统量化了基于Transformer的LLM的计算密度,发现LLM通常涉及密集计算,计算密度动态变化,且不同模型对相同输入的密度相关性显著。

Comments We have detected an error in the code used for the experiment. Most of the results in sections 4 and 5 are significantly affected. A new and corrected version will be available soon. For further information, please contact the first author

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18774 2026-03-26 cs.CL 89%

Disentangling Knowledge Representations for Large Language Model Editing

解构知识表示以实现大语言模型编辑

Mengqi Zhang, Zisheng Zhou, Xiaotian Ye, Qiang Liu, Zhaochun Ren, Zhumin Chen, Pengjie Ren

机构 * Shandong University(山东大学) Suzhou Research Institute of Shandong University(山东大学苏州研究院) School of Computer Science, Beijing University of Posts and Telecommunications(北京邮电大学计算机学院) New Laboratory of Pattern Recognition (NLPR) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS) Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR)多模态人工智能系统国家重点实验室(MAIS)中国科学院自动化研究所) Leiden University(莱顿大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出DiKE方法,通过解构知识表示来提升大语言模型编辑中细粒度无关知识的保留能力,同时保持编辑性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20808 2026-03-24 cs.CV cs.LG 89%

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

预测正则化对抗多模态大语言模型中的视觉表征退化

Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng

机构 * NKIARI VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) AAIS, Nankai University(AAIS,南开大学) Tencent Youtu Lab(腾讯优设实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15518 2026-03-17 cs.CL 89%

Beyond the Covariance Trap: Unlocking Generalization in Same-Subject Knowledge Editing for Large Language Models

超越协方差陷阱:在大型语言模型中解锁同一主体知识编辑的泛化能力

Xiyu Liu, Qingyi Si, Zhengxiao Liu, Chenxu Yang, Naibin Gu, Zheng Lin

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文针对大型语言模型在同一主体知识编辑中泛化能力不足的问题,提出RoSE方法,通过几何对齐和知识整合提升指令遵循能力。

Comments 23 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01716 2026-03-13 cs.CL 89%

Mechanistic Indicators of Steering Effectiveness in Large Language Models

大语言模型中转向效果的机制指标

Mehdi Jafari, Hao Xue, Flora Salim

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究通过分析大语言模型中转向效果的机制指标,探讨如何利用内部模型信号诊断转向可靠性,并提出新的评估基线以提升转向方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07275 2026-03-04 cs.LG cs.HC stat.AP 89%

Tailored Behavior-Change Messaging for Physical Activity: Integrating Contextual Bandits and Large Language Models

针对体力活动的定制行为改变信息:整合上下文老虎机和大型语言模型

Haochen Song, Dominik Hofer, Rania Islambouli, Laura Hawkins, Ananya Bhattacharjee, Zahra Hassanzadeh, Jan Smeddinck, Meredith Franklin, Joseph Jay Williams

机构 * University of Toronto(多伦多大学) Ludwig Boltzmann Institute for Digital Health(卢德维希·玻尔兹曼数字健康与预防研究所) Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出了一种结合上下文老虎机和大型语言模型的混合方法,用于个性化体力活动干预,通过动态上下文因素优化信息内容,提升干预效果和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17529 2026-02-20 cs.AI 89%

Enhancing Large Language Models (LLMs) for Telecom using Dynamic Knowledge Graphs and Explainable Retrieval-Augmented Generation

通过动态知识图谱和可解释检索增强生成增强大型语言模型用于电信

Dun Yuan, Hao Zhou, Xue Liu, Hao Chen, Yan Xin, Jianzhong, Zhang

机构 * School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Standards and Mobility Innovation Lab, Samsung Research America(三星美国标准与移动创新实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出KG-RAG框架,通过整合知识图谱与检索增强生成技术,提升大型语言模型在电信领域中的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16977 2026-02-20 cs.LG cs.CR 89%

Fail-Closed Alignment for Large Language Models

大型语言模型的Fail-Closed对齐

Zachary Coalson, Beth Sohler, Aiden Gabriel, Sanghyun Hong

机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06181 2026-02-09 cs.CL 89%

Uncertainty Drives Social Bias Changes in Quantized Large Language Models

不确定性驱动量化大语言模型中的社会偏见变化

Stanley Z. Hua, Sanae Lotfi, Irene Y. Chen

机构 * UC Berkeley(伯克利大学) Centre for Computational Medicine at The Hospital for Sick Children(儿童医院计算医学中心) UCSF(旧金山大学) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 研究发现量化过程导致大语言模型中社会偏见的翻转,且不确定性与量化强度影响偏见变化,需进行后续评估以确保可靠性。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01933 2026-02-03 cs.AI 89%

Large Language Model and Formal Concept Analysis: a comparative study for Topic Modeling

大语言模型与形式概念分析:一种用于主题建模的比较研究

Fabrice Boissier, Monica Sen, Irina Rychkova

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究比较大语言模型与形式概念分析在主题建模中的应用,通过实验评估两者在生成和标注主题方面的性能与优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏