arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 266 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 266 篇

2608.13333 2026-08-17 cs.AI 版本更新 89%

LLM-Guided Graph Generation for Structure-Based Local Improvement Methods

基于大语言模型引导的图生成的基于结构的局部改进方法

Hai Xia, Vaidyanathan Peruvemba Ramaswamy, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);prompting(abstract);分类 cs.AI

AI总结 该研究构建了适用于MiniZinc格式问题的自动流程,引导LLM生成图生成器以辅助SLIM框架,在20个MiniZinc竞赛问题上使算法选择胜率大幅提升,证明LLM语义生成可实现高效的约束优化自动特征提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05280 2026-08-12 cs.IT cs.AI cs.LG math.IT 版本更新 88%

On Solomonoff Induction in Large Language Models and the Limits of Self-Improving: The Singularity Is Not Near Without Symbolic Model Synthesis

在大型语言模型中自我改进的极限:没有符号模型合成,奇点并不临近

Hector Zenil

机构 * Algorithmic Dynamics Lab(算法动力实验室) Department of Biomedical Computing(生物医学计算系) School of Biomedical Engineering and Imaging Sciences(生物医学工程与成像科学学院) King’s Institute for AI(国王人工智能研究所) King’s College London(伦敦国王学院) Oxford Immune Algorithmics(牛津免疫算法公司) Oxford University Innovation(牛津大学创新中心) London Institute for Healthcare Engineering(伦敦医疗工程研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究指出大型语言模型在缺乏外部信号时自我改进会退化,提出神经符号整合方法以突破这一限制。

Comments 31 pages. Update: DPI and Levin's non-growth is not violated explanation when it comes to finite learners

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05969 2026-07-21 cs.CL cs.AI 版本更新 88%

Probing the Difficulty Perception Mechanism of Large Language Models

探究大语言模型的难度感知机制

Sunbowen Lee, Qingyu Yin, Chak Tou Leong, Jialiang Zhang, Yicheng Gong, Shiwen Ni, Min Yang, Xiaoyu Shen

机构 * Institute of Digital Twin, EIT(数字孪生研究所,EIT) Wuhan University of Science and Technology(武汉科技大学) Zhejiang University(浙江大学) Hong Kong Polytechnic University(香港理工大学) Shenzhen Institutes of Advanced Technology, CAS(深圳先进技术研究院,中国科学院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型内部评估问题难度的能力,通过线性探测和定位特定注意力头实现难度感知建模,经消融实验验证,为用LLMs作自动难度注释器提供支持,揭示token级差异,表明难度感知有结构组织,提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05126 2026-06-23 cs.CL cs.AI 版本更新 88%

Generalization of Fine-Tuned Uncertainty Communication and Metacognition in Large Language Models

微调后大语言模型的不确定性沟通与元认知的泛化

Mark Steyvers, Catarina Belem, Padhraic Smyth

机构 * Department of Cognitive Sciences, University of California, Irvine, United States(认知科学系,加州大学伊文斯顿分校,美国) Department of Computer Science, University of California, Irvine, United States(计算机科学系,加州大学伊文斯顿分校,美国)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过监督微调提升大语言模型不确定性沟通能力,发现领域内校准和判别改善,但任务间迁移有限,多任务训练可促进泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25045 2026-07-22 cs.CL cs.AI cs.LG 版本更新 88%

Hyperdimensional Probe: Decoding LLM Representations via Vector Symbolic Architectures

超维探针:通过向量符号架构解码大语言模型表示

Marco Bronzini, Carlo Nicolini, Bruno Lepri, Jacopo Staiano, Andrea Passerini

机构 * University of Trento(特伦托大学) Ipazia S.p.A.(Ipazia公司) Fondazione Bruno Kessler (FBK)(布鲁诺·凯塞勒基金会)

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在解码大语言模型表示,提出超维探针,结合符号表示与神经探测,利用向量符号架构和超向量代数统一先前方法,能深入提取输入特征并支持输出分析,实验表明其可在多场景提取语义信息,推进了语义理解。

Comments CODE: https://github.com/Ipazia-AI/hyperprobe

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11449 2026-06-10 cs.SD cs.AI cs.CL cs.LG eess.AS 版本更新 88%

Whisper-GPT -- Continuous Discrete Hybrid Representation Language Models For Speech And Music

Whisper-GPT -- 语音和音乐的连续离散混合表示语言模型

Prateek Verma

机构 * Stanford University(斯坦福大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Whisper-GPT,一种结合连续音频表示(如频谱图)和离散音频令牌的生成式大语言模型,解决了离散令牌方法上下文长度过长的问题,在语音和音乐的下一个令牌预测中降低了困惑度和负对数似然。

Comments 6 pages, 3 figures. 50th International Conference on Acoustics, Speech and Signal Processing, Hyderabad, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27101 2026-08-13 cs.CV cs.CL 版本更新 88%

Pop-Up Distractions Reveal Bag-of-Events Behavior in Video Large Language Models

弹出式干扰揭示视频大语言模型中的事件袋行为

Oscar Chew, Serhii Honcharenko, Qian-Hui Chen, Patricia Lu, Dishant Zaveri, Khoa D. Doan, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯A&M大学) National Taiwan University(台湾国立大学) Stanford University(斯坦福大学) VinUniversity(文大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过插入无关广告片段,发现视频大语言模型常将不同片段的事件错误关联,表现出将视频视为事件集合而非时间序列的“事件袋”行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29418 2026-08-12 cs.CV cs.AI 版本更新 88%

Covert Visual Prompt Injection against Commercial Multimodal Large Language Models

对抗性提示注入攻击多模态大语言模型

Meiwen Ding, Song Xia, Chenqi Kong, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院快速丰富目标搜索实验室)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了针对强大闭源多模态大语言模型的不可察觉视觉提示注入攻击,通过界文本叠加嵌入恶意提示并优化视觉扰动,提升攻击性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03985 2026-08-11 cs.CR cs.AI 版本更新 88%

NeuroBreak: Unveil Internal Jailbreak Mechanisms in Large Language Models

NeuroBreak:揭示大语言模型的内部越狱机制

Chuhan Zhang, Ye Zhang, Bowen Shi, Yuyou Gan, Tianyu Du, Shouling Ji, Dazhan Deng, Yingcai Wu

机构 * Zhejiang University(浙江大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 NeuroBreak是一个自上而下的大语言模型越狱分析系统,可分析神经元级安全机制、关键神经元,经评估验证了有效性,为开发下一代防御策略提供机制见解。

Comments 11 pages, 10 figures. Accepted to IEEE VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00123 2026-08-10 cs.AI 版本更新 88%

Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models

最小、局部、因果解释用于大语言模型中的对抗成功

Shubham Kumar, Narendra Ahuja

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究了大语言模型对抗成功的因果机制,提出LOCA方法通过局部解释识别最小的中间表示变化,以解释对抗成功的原因。

Comments Published at COLM 2026 (updated bib)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04029 2026-08-07 cs.CL 版本更新 88%

CrossHallu: Do Hallucination Signals Generalize Across Languages and Domains in Large Language Model's Internals?

CrossHallu:大语言模型内部的幻觉信号能否跨语言和领域泛化?

Aisha Alansari, Malak Alkhorasani, Hamzah Luqman

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油与矿产大学) Imam Abdulrahman bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究大语言模型内部幻觉检测信号能否跨语言和领域泛化,通过CrossHallu对六个模型的内部表征在生成式问答任务上进行评估,结果揭示了模型内部状态幻觉信号跨语言和领域转移的情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00209 2026-08-06 cs.CL 版本更新 88%

Do LLMs Know What Is Private Internally? Probing and Steering Contextual Privacy Norms in Large Language Model Representations

大语言模型是否了解内部隐私?在大型语言模型表示中探测和引导上下文隐私规范

Haoran Wang, Li Xiong, Kai Shu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大语言模型中上下文隐私规范的编码结构,通过探测和引导上下文隐私参数,揭示了模型在隐私保护上的不足,并展示了如何通过结构化控制减少隐私泄露。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26825 2026-07-31 cs.CL 版本更新 88%

From Found to Designed: Concepts as a Design Axis for Large Language Models

从发现到设计:将概念作为大语言模型的设计轴

Chen Shani

机构 * Tel Aviv University(特拉维夫大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究针对大语言模型概念级结构依赖事后发现而非设计的问题,提出将概念作为设计轴,划分设计空间维度并分析现有模式,推动转向设计带显式概念表示的大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02528 2026-07-21 q-fin.GN cs.CY cs.LG 版本更新 88%

Auditing Asset-Specific Preferences in Financial Large Language Models: Evidence from Bitcoin Representations and Portfolio Allocation

审计金融大语言模型中的资产特定偏好:来自比特币表征与投资组合配置的证据

Wenbin Wu

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本研究通过三级审计协议,发现大型语言模型对比特币存在框架依赖的偏好,并识别出模型内部一个可因果干预的比特币选择性特征,该特征能显著影响下游投资组合配置。

Comments 31 pages, 6 figures, 18 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10382 2026-07-21 cs.CL 版本更新 88%

Language Triggers Hijack Language Circuits: A Mechanistic Analysis of Backdoor Behaviors in Large Language Models

触发器劫持语言电路:大型语言模型中后门行为的机制分析

Théo Lasnier, Wissam Antoun, Francis Kulumba, Benoît Sagot, Djamé Seddah

机构 * Inria Paris(巴黎研究所)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文研究了大型语言模型中后门行为的机制,发现触发器通过劫持现有语言组件实现输出语言切换,为后门防御提供了新思路。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06600 2026-06-08 cs.CL 版本更新 88%

Probing Multimodal Large Language Models on Cognitive Biases in Chinese Short-Video Misinformation

探究多模态大语言模型在中国短视频虚假信息中的认知偏差

Jen-tse Huang, Chang Chen, Shiyang Lai, Wenxuan Wang, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) University of Chicago(芝加哥大学) Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过200个短视频数据集评估8种多模态大语言模型在健康领域虚假信息中的表现,发现Gemini-2.5-Pro表现最佳(信念分数71.5/100),而模型易受权威频道ID等社会线索影响。

Comments Accepted to ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24929 2026-08-05 cs.AI cs.CL cs.IT math.IT 版本更新 88%

LogitScope: A Framework for Analyzing LLM Uncertainty Through Information Metrics

LogitScope:通过信息度量分析大语言模型不确定性框架

Farhan Ahmed, Yuya Jeremy Ong, Chad DeLuca

机构 * IBM Research(IBM研究院) Plastic Labs

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LogitScope通过计算概率分布中的信息度量,分析大语言模型生成过程中的不确定性,揭示模型置信度模式,识别潜在幻觉并暴露高不确定决策点,无需标注数据或语义解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18037 2026-07-28 cs.AI cs.CL cs.MA 版本更新 88%

ProvenanceGuard: Source-Aware Factuality Verification for MCP-Based LLM Agents

ProvenanceGuard: 基于MCP的LLM智能体的源感知事实性验证

Ander Alvarez, Santhiya Rajan, Samuel Mugel, Román Orús

机构 * Multiverse Computing Parque Cientifico y Tecnológico de Gipuzkoa(吉普斯夸科技园) Centre for Social Innovation(社会创新中心) Donostia International Physics Center(多诺斯蒂亚国际物理中心) Ikerbasque Foundation for Science(伊克尔巴斯克科学基金会)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ProvenanceGuard,一种源感知验证器,通过追踪MCP工具调用、分解声明并路由到特定源,检测跨源混淆错误,在医疗领域数据集上优于源无关基线。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21262 2026-07-24 cs.AI cs.CL 版本更新 88%

ARCO: Adaptive Rubrics with Co-Evolution for Multi-Step LLM-Based Agents

ARCO: 基于自适应规则与协同进化的多步LLM智能体

Zihang Tian, Jingsen Zhang, Rui Li, Xiaohe Bo, Yuanzi Li, Xu Chen

机构 * Renmin University of China(中国人民大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 提出ARCO框架,通过同尺度模型的双头结构(生成头与评分头)实现步骤级规则生成与奖励分配,结合轨迹分解约束和策略协同进化,在多个多跳QA任务上取得最优EM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29031 2026-07-10 cs.CL cs.AI 版本更新 88%

How to Leverage Synthetic Speech for LLM-Based ASR Systems?

如何利用合成语音提升基于LLM的ASR系统?

Yanis Labrak, Dairazalia Sanchez-Cortes, Sergio Burdisso, Séverin Baroudi, Shashi Kumar, Esaú Villatoro-Tello, Srikanth Madikeri, Manjunath K E, Oldřich Plchot, Kadri Hacioğlu, Petr Motlicek, Andreas Stolcke

机构 * Idiap Research Institute(Idiap研究 institute) Universite de Toulon(里昂大学) EPFL(瑞士联邦理工学院) University of Zurich(苏黎世大学) Uniphore(Uniphore公司) Brno University of Technology(布拉格技术大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对隐私敏感领域合成语音与真实数据分布差异问题,通过分析SLAM-ASR架构定位差异来源,发现早期到中间层对时间与韵律扰动敏感,并证明卷积房间脉冲响应可缩小差距,结合层选择模块与RIR增强仅用25%真实语音即达到全真实数据基线。

Comments Submitted to SLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11950 2026-07-09 cs.SE cs.AI cs.CL cs.CR 版本更新 88%

AnyPoC: Universal Proof-of-Concept Test Generation for Scalable LLM-Based Bug Detection

AnyPoC:用于可扩展LLM基于Bug检测的通用证明-概念测试生成

Zijie Zhao, Chenyuan Yang, Weidong Wang, Yihan Yang, Ziqi Zhang, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 AnyPoC通过多代理框架生成可执行的证明-概念测试,以验证候选Bug报告,提升自动化Bug检测的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21105 2026-08-06 cs.CV 版本更新 88%

HalluScope: Fine-grained Hallucination Diagnosis for Multimodal Large Language Models

HalluScope:多模态大语言模型的细粒度幻觉诊断

Weilin Jin, Mingyu Wang, Wenbo Li, Haoyang Huang, Yifan Wu, Ying Li, Gang Huang, Zhonghai Wu

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对多模态大语言模型的幻觉问题,提出细粒度幻觉诊断任务,开发数据集并设计奖励函数,训练HalluScope-4B和HalluScope-8B模型,在多个基准测试中达最优,其诊断解释能有效指导目标模型纠正幻觉。

Comments Accepted to ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20720 2026-08-05 cs.HC 版本更新 88%

Beyond Text: Probing K-12 Educators' Perspectives and Ideas for Learning Opportunities Leveraging Multimodal Large Language Models

超越文本:探索K-12教育工作者对利用多模态大语言模型学习机会的视角和想法

Tiffany Tseng, Katelyn Lam, Tiffany Lin Fu, Alekhya Maram

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究通过工作坊探讨K-12教育工作者对多模态大语言模型在教育中的应用看法,分析其面临的挑战与需求,提出两种用户导向的实施方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00997 2026-08-11 cs.CL 版本更新 87%

Uncertainty-Aware Variational Reward Factorization via Probabilistic Preference Bases for LLM Personalization

基于概率偏好基的不确定性感知变分奖励分解用于大语言模型个性化

Gyuseok Lee, Wonbin Kweon, Zhenrui Yue, SeongKu Kang, Jiawei Han, Dong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Korea University(高丽大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出变分奖励分解框架,通过概率偏好基和变分分布实现用户偏好建模,提升LLM个性化效果。

Comments COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09001 2026-07-28 cs.CL 版本更新 87%

Entropy Sentinel: Probing Entropy Traces for LLM Monitoring

熵哨兵:基于STEM解码熵迹的连续LLM准确性监控

Pedro Memoli Buffa, Luciano Del Corro

机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.CL

AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20750 2026-06-24 cs.AI 版本更新 87%

Subjective-Graph LLM Agents for Simulating Uncertainty in Classroom Social Perception

主观图LLM智能体用于模拟课堂社会感知中的不确定性

Jinming Yang, Xinyu Jiang, Xinshan Jiao, Xinping Zhang

机构 * Complex Lab, School of Computer Science and Engineering(复杂实验室,计算机科学与工程学院) University of Electronic Science and Technology of China(电子科学与技术大学) Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) School of Health and Medical Technology, Chengdu Neusoft University(成都新软大学健康与医疗技术学院)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于主观图和可信度通信的多智能体框架,模拟课堂中学术地位的持久扭曲,在12个班级482名学生数据上验证,排名误差从0.066增至0.124。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16462 2026-08-10 cs.CL cs.CY cs.LG 版本更新 87%

Let's Unlearn Stereotypes Before Decision-Making: Assessing the Impact of Intrinsic Bias Mitigation on Downstream Fairness in LLMs

让我们在决策前忘却刻板印象:评估内在偏差缓解对大语言模型下游公平性的影响

Mina Arzaghi, Alireza Dehghanpour Farashah, Florian Carichon, Jean-François Plante, Golnoosh Farnadi

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出公平感知概念忘却(FACU)方法,在保留预测性能的同时缓解LLM内在偏差,可提升下游公平性,结合反事实数据增强效果更佳,为LLM公平性优化提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24539 2026-07-29 cs.CL cs.AI 版本更新 87%

Localizing Persona Representations in LLMs

在大语言模型中定位角色表示

Celia Cintas, Miriam Rateike, Erik Miehling, Elizabeth Daly, Skyler Speakman

机构 * IBM Research Africa(IBM非洲研究院) IBM Research Europe(IBM欧洲研究院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中角色表示的编码位置与方式,运用降维和模式识别方法,发现角色表示差异在解码器层最后三分之一内,特定伦理观点有重叠激活,政治意识形态区域不同,有助于理解LLM信息表示及改进输出调制。

Comments Corrected small naming inconsistencies for Level 0, 1, and 2 analysis

Journal ref Proceedings of the AAAI ACM Conference on AI, Ethics, and Society, 8(1), 630-642, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15334 2026-07-07 cs.CL cs.AI 版本更新 87%

No Reliable Evidence of Self-Reported Sentience in Small Large Language Models

小语言模型中自我报告的感知能力缺乏可靠证据

Caspar Kaiser, Sean Enderby

机构 * University of Warwick, Warwick Business School(沃里克大学,沃里克商学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI

AI总结 通过询问多个开源语言模型关于其自身意识的问题,并利用基于内部激活训练的分类器验证回答,对语言模型是否认为自己有感知能力进行测试,发现模型否认有感知,分类器也无反例,且Qwen模型中越大越确定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19755 2026-06-09 cs.AI cs.LG 版本更新 87%

Explainable AML Triage with LLMs: Evidence Retrieval and Counterfactual Checks

可解释的AML优先级排序与LLMs:证据检索与反事实检查

Dorothy Torres, Wei Cheng, Ke Hu

机构 * School of Science, Technology, Engineering and Mathematics(科学、技术、工程与数学学院) School of Electrical Engineering and Computer Science(电气工程与计算机科学学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可解释的AML优先级排序框架,结合证据增强的证据捆绑、结构化LLM输出合同和反事实验证,提升审计性和鲁棒性,实验证明其在优先级排序和证据支持方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏