arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-25 至 2026-05-25 共收录 16 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 16 篇

2605.22880 2026-05-25 cs.CL cs.AI cs.CY 92%

How Far Will They Go? Red-Teaming Online Influence with Large Language Models

它们会走多远?使用大型语言模型对在线影响力进行红队测试

Daniel C. Ruiz, Anna Serbina, Ashwin Rao, Emilio Ferrara, Luca Luceri

机构 * Information Sciences Institute University of Southern California(信息科学研究所 乌德穆尔特国立大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个红队测试框架,通过测量大型语言模型在争议话题上的政治观点表达范围(Overton Window),并量化简单自然语言越狱如何扩展该范围,发现开源LLM在政治表达上存在系统性不对称,且越狱效果因模型系列而异。

Comments 30 pages, 8 figures, submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23035 2026-05-25 cs.CL cs.AI q-bio.NC 91%

Sparse Autoencoders Map Brain-LLM Alignment onto Cortical Semantic Topography

稀疏自编码器将大脑-LLM对齐映射到皮层语义拓扑

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过稀疏自编码器分解LLM中间层特征,发现语义特征主导大脑预测表现,并验证了皮层语义拓扑的细粒度对齐。

Comments Accepted at CoNLL 2026. 20 pages (9 main + 1 limitations/acknowledgments + 3 references + 7 appendix), 5 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21500 2026-05-25 cs.LG 87%

Task-Awareness Improves LLM Generations and Uncertainty

任务感知提升大语言模型生成与不确定性

Tim Tomov, Dominik Fuchsgruber, Stephan Günnemann

机构 * School of Computation, Information \& Technology, Technical University of Munich Munich Data Science Institute Munich Center for Machine Learning

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.LG

AI总结 提出在任务依赖的潜在结构中直接建模LLM输出,通过贝叶斯最优响应合成和贝叶斯风险量化不确定性,优于标准解码方法并改善与输出质量的校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22963 2026-05-25 cs.CL cs.AI 87%

Graph Alignment Topology as an Inductive Bias for Grounding Detection

图对齐拓扑作为接地检测的归纳偏置

Paul Landes, Pranav Herur, Adam Cross, Jimeng Sun

机构 * Department of Pediatrics, University of Illinois College of Medicine Peoria(伊利诺伊大学皮奥里亚医学院儿科部) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校计算机与数据科学学院) Carle Illinois College of Medicine, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校卡莱医学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出利用图对齐拓扑作为归纳偏置,通过构建参考信息与LLM输出之间的对齐二分图并训练图神经网络建模对齐结构,在幻觉检测和问答任务上取得最先进结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23189 2026-05-25 cs.LG 83%

Empirical Bayes Conformal Prediction for Vision and Language Models

视觉与语言模型的经验贝叶斯共形预测

Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校) Xiamen University(厦门大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出经验贝叶斯共形预测框架,利用r值将得分变异性转化为不确定性感知的非一致性得分,在保持目标覆盖的同时减少高方差假候选的包含。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22902 2026-05-25 cs.LG cs.AI cs.CL 82%

Transcoders Trace Visual Grounding and Hallucinations in Vision-Language Models

Transcoders 追踪视觉语言模型中的视觉基础与幻觉

Dimitrios Damianos, Leon Voukoutis, Georgios Skyrianos, Vassilis Katsouros, Georgios Paraskevopoulos

机构 * Institute of Language and Speech Processing(语言与语音处理研究所) Athena Research Center(雅典研究中心)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 采用基于Transcoders的功能中心框架分解视觉语言模型的计算路径,揭示视觉输入如何影响文本生成,并通过反事实分析和图结构特征预测幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23821 2026-05-25 cs.CL cs.LG 81%

Hierarchical Concept Geometry in Language Models Emerges from Word Co-occurrence

语言模型中的层级概念几何源于词汇共现

Andres Nava, Matthieu Wyart

机构 * Johns Hopkins University(约翰霍普金斯大学) EPFL(苏黎世联邦理工学院)

专题命中 知识编辑与模型理解 :language model(title);LLM(abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出一种分布理论,证明语言表示中的上下义关系几何结构源于词汇共现的谱结构,并在word2vec和Gemma 2B嵌入中得到验证。

Comments 34 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13930 2026-05-25 cs.LG cs.HC cs.NE 79%

Mechanistic Interpretability of EEG Foundation Models via Sparse Autoencoders

基于稀疏自编码器的脑电图基础模型机制可解释性

William Lehn-Schiøler, Magnus Ruud Kjær, Rahul Thapa, Magnus Guldberg Pedersen, Anton Mosquera Storgaard, Nick Williams, Radu Gatej, Tue Lehn-Schiøler, Andreas Brink-Kjær, Sadasivan Puthusserypady, Sándor Beniczky, James Zou, Lars Kai Hansen

机构 * BrainCapture DTU Health Tech(技术大学丹麦健康技术) DTU Compute(技术大学丹麦计算) Department of Biomedical Data Science(生物医学数据科学系) Department of Computer Science(计算机科学系) Seer Medical(Seer医疗) Filadelfia Epilepsy Hospital(菲拉德尔菲亚癫痫医院) University Hospital of Copenhagen(哥本哈根大学医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 通过TopK稀疏自编码器从三种EEG Transformer中提取稀疏特征字典,结合临床分类法评估单语义性和纠缠性,并引入概念引导分析目标与非目标区域,揭示模型表征失败和临床纠缠问题。

Comments Preprint. 14 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23780 2026-05-25 cs.AI 70%

Beyond Binary Edits Robust Multimodal Knowledge Editing with Adversarial Subspace Alignment

超越二元编辑:基于对抗子空间对齐的鲁棒多模态知识编辑

Haoyuan Wang, Xiaohao Liu, Jiajie Su, Jianmao Xiao, Chaochao Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Jiangxi Normal University(江西师范大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型知识编辑泛化性不足的问题,提出对抗子空间对齐方法(ASAM),通过潜在对抗鲁棒化(LAR)和秩约束子空间学习(RCSL)实现鲁棒的多模态知识编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23036 2026-05-25 cs.CL 70%

Multilingual Steering by Design: Multilingual Sparse Autoencoders and Principled Layer Selection

通过设计实现多语言引导:多语言稀疏自编码器与原则性层选择

Yusser Al Ghussin, Daniil Gurgurov, Tanja Baeumel, Josef van Genabith, Patrick Schramowski, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) TU Darmstadt(德累斯顿技术大学) Centre for European Research in Trusted AI (CERTAIN)(欧洲可信AI研究中心)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对稀疏自编码器在多语言环境中语言控制不可靠的问题,提出在多语言数据上训练SAE并基于多语言对齐与语言可分离性交集的原则性层选择规则,在LLaMA-3.1-8B和Gemma-2-9B上验证了该方法能稳定语言识别准确率与生成质量之间的权衡。

Comments Accepted to TrustNLP Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11195 2026-05-25 cs.CR cs.AI 70%

RAG-Pull: Turning Retrieval into a Code-Injection Channel via Invisible Unicode Perturbations

RAG-Pull:通过不可见Unicode扰动将检索转化为代码注入通道

Aritra Dhar, Vasilije Stambolic, Lukas Cavigelli

机构 * Computing System Labs, Huawei Technologies Switzerland AG(华为瑞士技术有限公司计算系统实验室) BKW Energie AG(BKW能源集团)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出RAG-Pull攻击,通过向查询或外部代码库插入不可见UTF字符,使检索系统偏向恶意代码,从而破坏LLM的安全对齐,实现远程代码执行和SQL注入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23099 2026-05-25 cs.MA 67%

SVR-MAD: A Bayesian-Inspired Framework for Posterior-Guided Multi-Agent Debate

SVR-MAD:一种贝叶斯启发的后验引导多智能体辩论框架

Weifan Jiang, Rana Shahout, Minghao Li, Zhenting Qi, Yilun Du, Michael Mitzenmacher, Minlan Yu

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 针对多智能体辩论中上下文快速增长导致可扩展性受限的问题,提出贝叶斯启发的SVR-MAD框架,利用辩论前后信号构建通信图,在降低令牌成本的同时保持或提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10347 2026-05-25 cs.AI cs.CL 62%

How Mobile World Model Guides GUI Agents?

移动世界模型如何指导GUI代理?

Weikai Xu, Kun Huang, Yunren Feng, Jiaxing Li, Yuhan Chen, Yuxuan Liu, Zhizheng Jiang, Heng Qu, Pengzhi Gao, Wei Liu, Jian Luan, Xiaolin Hu, Bo An

机构 * Nanyang Technological University(南洋理工大学) MiLM Plus, Xiaomi Inc.(小米公司) Independent Researchers(独立研究人员) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Wuhan University(武汉大学) Xiamen University(厦门大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过训练四种模态(增量文本、完整文本、扩散图像、可渲染代码)的世界模型,并评估其在下游任务中的效用,发现可渲染代码重建在分布内保真度高,文本反馈对在线分布外执行更鲁棒,世界模型生成的轨迹可提供迁移经验但无法替代原始分布,且对低熵过度自信的代理,后验自省收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22903 2026-05-25 cs.CV cs.AI cs.CL 62%

Seeing without Looking: Do Vision-Language Benchmarks Really Test Vision?

不看而见:视觉-语言基准测试真的测试视觉吗?

Zixuan Lan, Luzhe Sun, Matthew R. Walter, Jiawei Zhou

机构 * University of Chicago(芝加哥大学) Stony Brook University(石溪大学) Toyota Technological Institute at Chicago(芝加哥丰田技术研究所)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 通过系统性实验发现,视觉-语言模型对细粒度视觉证据的依赖程度低于预期,表明当前基准测试不足以可靠评估其视觉基础能力。

Comments Accepted to GRAIL-V: Grounded Retrieval and Agentic Intelligence for Vision-Language, CVPR 2026 Workshop. accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23344 2026-05-25 cs.CV cs.AI 57%

CHASD: Language Increment-Calibrated Contrastive Decoding against Hallucination in LVLMs

CHASD:面向LVLMs中幻觉的语言增量校准对比解码

Xiaoyi Huang, Kejia Zhang, Zhiming Luo

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能学院) Department of Artificial Intelligence, Xiamen University(厦门大学人工智能系)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 提出CHASD框架,通过不确定性驱动的置信门控和注意力引导的局部扰动,在推理时按需校准对比解码,减少对象幻觉并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23043 2026-05-25 cs.CL stat.ML 57%

HawkesLLM: Semantic Uncertainty Propagation in Agentic Text Simulation

HawkesLLM:智能体文本模拟中的语义不确定性传播

Zewei Deng, Tinghan Ye, Liyan Xie

机构 * Department of Industrial and Systems Engineering, University of Minnesota(工业与系统工程系,明尼苏达大学) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. Milton Stewart工业与系统工程学院,佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL

AI总结 提出HawkesLLM框架,通过多变量Hawkes过程建模时间影响与文本生成分离,解决智能体文本模拟中语义不确定性路径依赖问题,在GDELT新闻级联案例中提升后期语义对齐。

Comments 10 pages, 4 figures, Accepted at the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏