arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 11 篇

2604.27401 2026-05-01 cs.CL cs.LG 91%

Perturbation Probing: A Two-Pass-per-Prompt Diagnostic for FFN Behavioral Circuits in Aligned LLMs

扰动探测:对齐语言模型中FFN行为电路的双次提示诊断

Hongliang Liu, Tung-Ling Li, Yuhao Wu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 知识编辑与模型理解 :RLHF(summary_cn,abstract);LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 通过双次提示传递和无反向传播的扰动探测,识别LLM中两种行为电路结构,揭示RLHF组织的行为机制及模板层编辑工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28178 2026-05-01 cs.AI 90%

LLM as Clinical Graph Structure Refiner: Enhancing Representation Learning in EEG Seizure Diagnosis

基于LLM的临床图结构细化:增强EEG癫痫诊断中的表示学习

Lincan Li, Zheng Chen, Yushun Dong

机构 * Department of Computer Science, Florida State University(佛罗里达州立大学计算机科学系) SANKEN, The University of Osaka(大阪大学SANKEN)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型对图结构进行细化,以提升EEG信号在癫痫诊断中的表示学习效果,通过两阶段框架去除冗余边,提高诊断准确率和图结构意义。

Comments This paper is accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI-ECAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07101 2026-05-01 cs.AI 90%

Grounding Machine Creativity in Game Design Knowledge Representations: Empirical Probing of LLM-Based Executable Synthesis of Goal Playable Patterns under Structural Constraints

将机器创造力扎根于游戏设计知识表示:在结构约束下对基于LLM的可执行合成目标可玩模式的实证探测

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚德大学技术学院和哥德堡大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了在结构约束下,基于LLM的可执行合成目标可玩模式的可行性,通过对比不同生成方法,揭示了结构和项目层面的瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27714 2026-05-01 cs.CR cs.SE 89%

How Code Representation Shapes False-Positive Dynamics in Cross-Language LLM Vulnerability Detection

代码表示如何影响跨语言LLM漏洞检测中的假阳性动态

Maofei Chen, Laifu Wang, Yue Qin, Yuan Wang, Bo Wu, Dongxin Liu

专题命中 知识编辑与模型理解 :LLM(title,title_cn)

AI总结 本文研究了代码表示格式对跨语言LLM漏洞检测假阳性的影响,通过对比不同训练强度和代码表示格式,发现文本微调会提高假阳性率,而AST表示能有效降低假阳性,且在不同语言间具有鲁棒性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27167 2026-05-01 cs.GT cs.AI cs.LG 88%

What Suppresses Nash Equilibrium Play in Large Language Models? Mechanistic Evidence and Causal Control

在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制

Paraskevas V. Lekeas, Giorgos Stamatopoulos

机构 * DreamWorks Animation(梦工厂动画) University of Crete(希腊克里特大学)

专题命中 知识编辑与模型理解 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28129 2026-05-01 cs.CR cs.AI 87%

Latent Adversarial Detection: Adaptive Probing of LLM Activations for Multi-Turn Attack Detection

潜在对抗检测:适应性探测LLM激活以多轮攻击检测

Prashant Kulkarni

机构 * Mountain View, CA(山景城,加利福尼亚州)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过分析LLM激活层的轨迹特征,提出对抗性不稳定性概念,提升多轮攻击检测精度,验证了模型家族间的信号一致性及数据分布对泛化能力的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17469 2026-05-01 cs.CL cs.HC 83%

Cross-Lingual Sentiment Misalignment: Auditing Multilingual Language Models for Inversion Risk, Dialectal Representation, and Affective Stability

跨语言情感不一致:审计多语言语言模型以检测反向风险、方言表示和情感稳定性

Nusrat Jahan Lia, Shubhashis Roy Dipta

机构 * Institute of Information Technology University of Dhaka(达卡大学信息科技学院) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过控制基准框架评估多语言Transformer模型在平行孟加拉语-英语句子对上的表现,揭示了模型在情感反向、同理心不对称和方言表示中的问题,提出需引入情感稳定性指标以提升跨语言可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27275 2026-05-01 cs.HC cs.AI cs.CY 81%

Evaluating Epistemic Guardrails in AI Reading Assistants: A Behavioral Audit of a Minimal Prototype

评估人工智能阅读助手中的认知护栏:一个最小原型的行为审计

Matthew Christian Agustin

机构 * Responsible Innovation Lab(负责任创新实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过TextWalk原型评估认知护栏在AI阅读助手中的行为特性,探讨在压力下其动态表现及对读者解读劳动的影响。

Comments 18 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22046 2026-05-01 cs.CV cs.CR 78%

Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models

针对提示驱动视频分割基础模型的后门攻击

Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Fujian Normal University(福建师范大学) Jinan University(暨南大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文研究了针对提示驱动视频分割基础模型的后门攻击,提出BadVSFM框架,通过两阶段策略实现可控的后门效果,实验表明其在多种模型和数据集上具有有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24026 2026-05-01 cs.CL cs.AI 73%

From Skill Text to Skill Structure: The Scheduling-Structural-Logical Representation for Agent Skills

从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示

Qiliang Liang, Hansi Wang, Zhong Liang, Yang Liu

机构 * Key Laboratory of Computational Linguistics, Ministry of Education, Peking University(计算语言学重点实验室,教育部,北京大学) School of Computer Science, Peking University(北京大学计算机学院) Department of Chinese Language and Literature, Peking University(北京大学中文语言文学系)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出调度-结构-逻辑(SSL)表示法,通过解耦技能调度信号、执行结构和逻辑证据,提升智能体技能的可搜索性和可审查性,实验表明其在技能发现和风险评估任务中优于纯文本基线。

Comments 21 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28190 2026-05-01 cs.CV 50%

Representation Fréchet Loss for Visual Generation

用于视觉生成的表示弗雷歇损失

Jiawei Yang, Zhengyang Geng, Xuan Ju, Yonglong Tian, Yue Wang

机构 * USC(美国南加州大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) OpenAI

专题命中 知识编辑与模型理解 :post-training(abstract)

AI总结 本文提出FD-loss,通过分离FD估计的种群规模与梯度计算的批次规模,发现基于表示空间的FD优化能提升视觉质量,且多步生成器可转为强单步生成器,同时揭示FID可能误判视觉质量。

Comments Code and checkpoints are available at https://github.com/Jiawei-Yang/FD-loss

详情

展开后加载摘要…

URL PDF HTML 收藏