arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7 篇

2604.20945 2026-04-24 cs.CR cs.LG 89%

Breaking Bad: Interpretability-Based Safety Audits of State-of-the-Art LLMs

打破坏:基于可解释性的最新LLM安全审计

Krishiv Agarwal, Ramneet Kaur, Colin Samplawski, Manoj Acharya, Anirban Roy, Daniel Elenius, Brian Matejek, Adam D. Cobb, Susmit Jha

机构 * NuSCI Research Group, Computer Science Laboratory, SRI(NuSCI研究组、计算机科学实验室、SRI)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于可解释性的 jailbreaking 审计方法,评估了八种最新开源LLM的安全性,发现Llama-3模型易受攻击,而GPT-oss-120B表现稳健,Qwen和Phi模型结果混杂,揭示了可解释性工具在安全审计中的有效性及潜在风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20903 2026-04-24 cs.CR 88%

Sensitivity Uncertainty Alignment in Large Language Models

大语言模型中的敏感性不确定性对齐

Prakul Sunil Hiremath, Harshit R. Hiremath

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SUA框架,用于分析大语言模型在对抗性和模糊输入下的失败原因,通过敏感性与不确定性对齐提升模型可靠性。

Comments 24 pages, 4 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21036 2026-04-24 cs.AI 87%

Who Defines Fairness? Target-Based Prompting for Demographic Representation in Generative Models

谁定义了公平性?面向生成模型的基于目标的提示方法用于人口特征表示

Marzia Binta Nizam, James Davis

机构 * University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 知识编辑与模型理解 :prompting(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种轻量级框架,在推理阶段通过提示级干预减轻生成模型中的代表性偏见,允许用户选择多种公平性定义,通过审计目标符合度和肤色分布来评估公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21433 2026-04-24 q-fin.GN 80%

ChatGPT as a Time Capsule: The Limits of Price Discovery

ChatGPT 作为时间胶囊:价格发现的局限性

Sebastian Lehner, Alejandro Lopez-Lira

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究ChatGPT等冻结大语言模型如何提取预截止公开文本信息,用于预测股票回报,发现其与分析师修正和股价变化正相关,且预测性随时间 horizon 增加而增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19192 2026-04-24 cs.GR 80%

Empowering NPC Dialogue with Environmental Context Using LLMs and Panoramic Images

通过LLMs和全景图像增强NPC对话的环境上下文

Grega Radež, Ciril Bohak

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出利用LLMs和计算机视觉技术增强游戏NPC的环境感知能力,通过语义分割生成环境结构化数据,提升NPC对玩家行为的响应性和沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21139 2026-04-24 cs.CL cs.LG 62%

Slot Machines: How LLMs Keep Track of Multiple Entities

老虎机:大语言模型如何跟踪多个实体

Paul C. Bogdan, Jack Lindsey

机构 * Anthropic Fellows Program(Anthropic 合作者计划)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了大语言模型如何在上下文中绑定多个实体及其属性,通过多槽探针方法揭示当前实体与前一实体的表示机制,发现当前实体槽用于事实检索,而前一实体槽支持关系推理,但存在信息与实际使用之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21043 2026-04-24 cs.CY cs.AI cs.LG 62%

Strategic Polysemy in AI Discourse: A Philosophical Analysis of Language, Hype, and Power

人工智能话语中的战略多义性:语言、炒作与权力的哲学分析

Travis LaCroix, Fintan Mallory, Sasha Luccioni

机构 * Durham University(杜伦大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨人工智能话语中语言的策略性使用,分析术语如'幻觉'、'思考链'等的多义性如何影响机构和话语实践,揭示语言作为社会技术机制塑造AI发展与治理的作用。

Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏