arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-05 至 2026-06-05 共收录 383 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 26 篇

2601.22580 2026-06-05 cs.CL cs.AI cs.LG 75%

SpanNorm: Reconciling Training Stability and Performance in Deep Transformers

SpanNorm: 在深度Transformer中协调训练稳定性与性能

Chao Wang, Bei Li, Jiaqi Zhang, Xinyu Liu, Yuchun Fan, Linkun Lyu, Xin Chen, Jingang Wang, Tong Xiao, Peng Pei, Xunliang Cai

机构 * Meituan Inc.(美团公司) NLP Lab, School of Computer Science and Engineering(自然语言处理实验室,计算机科学与工程学院) Northeastern University, Shenyang, China(东北大学,沈阳,中国)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SpanNorm技术,通过结合前归一化和后归一化的优势,解决深度Transformer中训练稳定性与性能之间的根本性权衡问题,理论分析和实验结果表明其在密集和专家混合(MoE)场景中均优于传统归一化方案。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05843 2026-06-05 cs.CL cs.AI 73%

Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads

多模态大语言模型中通过CoRe头的功能稀疏性机制洞察

Ruoxi Sun, Quantong Qiu, Juntao Li, Zecheng Tang, Yihang Lou, Min Zhang

机构 * Soochow University(苏州大学) Peking University(北京大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过识别和分析CoRe头,揭示多模态大语言模型在跨模态检索中功能稀疏的结构特性,并验证其必要性及加速推理的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07253 2026-06-05 cs.AI cs.CL 73%

From Out-of-Distribution Detection to Hallucination Detection: A Geometric View

从分布外检测到幻觉检测:一个几何视角

Litian Liu, Reza Pourreza, Yubing Jian, Yao Qin, Roland Memisevic

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过将幻觉检测重新定义为分布外检测问题,利用几何视角提出了一种无需训练、基于单样本的检测方法,在推理任务中实现了高准确率。

Comments ICML 2026 main conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05641 2026-06-05 cs.CV 71%

Multi-Task Crack Foundation Model for Engineering-Reliable Crack Representation and Topology Preservation in Civil Infrastructure

面向工程可靠裂缝表示与拓扑保持的土木基础设施多任务裂缝基础模型

Blessing Agyei Kyem, Joshua Kofi Asamoah, Eugene Denteh, Armstrong Aboah

机构 * NDSU(内达苏大学)

专题命中 知识编辑与模型理解 :foundation model(title)

AI总结 提出 CrackGeoFM 多任务框架,结合冻结视觉基础骨干与裂缝专用适配模块,实现掩码预测、骨架重建和不确定性估计,在20个数据集上达到最优分割、拓扑保持和校准不确定性。

Comments 60 pages, 17 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06342 2026-06-05 stat.ML cs.LG 70%

Symmetric Divergence and Normalized Similarity: A Unified Topological Framework for Representation Analysis

对称散度与归一化相似性:表示分析的统一拓扑框架

Yan Wang, Tianyang Hu

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(数据科学学院,香港中文大学(深圳))

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出对称表示拓扑散度(SRTD)和归一化拓扑相似性(NTS),分别解决现有拓扑散度的非对称性和无界性问题,实现细粒度结构诊断与跨场景标准化评估。

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16311 2026-06-05 stat.ML cs.LG stat.ME 70%

Generator-Mediated Bandits: Thompson Sampling for GenAI-Powered Adaptive Interventions

生成器介导的老虎机:面向生成式人工智能的自适应干预的汤普森采样

Marc Brooks, Gabriel Durham, Kihyuk Hong, Ambuj Tewari

机构 * Department of Statistics, University of Michigan, Ann Arbor, MI (USA)(密歇根大学统计学系,安阿伯,MI (美国))

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种生成器介导的老虎机算法(GAMBITTS),用于解决生成式人工智能(GenAI)驱动的自适应干预问题。该算法通过建模治疗和奖励生成过程,利用观察到的治疗信息加速策略学习,并在模拟研究中优于传统算法。

Comments 39 pages, 12 figures

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06485 2026-06-05 cs.CV 67%

PAR3D: A Unified 3D-MLLM with Part-Aware Representation for Scene Understanding

PAR3D: 一种用于场景理解的统一部件感知3D多模态大语言模型

Shaohui Dai, Yansong Qu, You Shen, Shengchuan Zhang, Liujuan Cao

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract)

AI总结 提出PAR3D框架,通过部件感知3D表示学习和层次化分割查询生成,解决现有3D-MLLM在细粒度部件理解上的不足,在部件级问答和指代分割任务上取得显著提升。

Comments Project page: https://atrovast.github.io/PAR3D/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05173 2026-06-05 cs.CL cs.AI 62%

Predict and Reconstruct: Joint Objectives for Self-Supervised Language Representation Learning

预测与重构:自监督语言表示学习的联合目标

Aimen Boukhari

机构 * École Nationale Supérieure d’Informatique (ESI)(阿尔及利亚国家信息学院(ESI))

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种结合JEPA潜空间预测损失与MLM目标的混合预训练目标,通过可学习标量平衡两者,在GLUE基准上分析表明混合编码器产生更均匀的嵌入和更丰富的谱几何,且语义-词汇平衡更优。

Comments 12 pages, 10 figures, 11 tables. Preprint. Code available at : https://github.com/aymen-000/predict-reconstruct-language-models

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 15 篇

2606.05725 2026-06-05 cs.CR cs.CL 92%

An Embarrassingly Simple Detector for Model Extraction Attacks in Large Language Model API Traffic

一种用于大型语言模型API流量中模型提取攻击的极其简单的检测器

Shuze Liu, Qianwen Guo, Yushun Dong

机构 * Santa Clara University(圣克拉拉大学) Florida State University(佛罗里达州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种基于最大均值差异(MMD)的简单检测方法,通过将查询嵌入语义空间并比较其与历史良性流量的分布差异,有效检测LLM API中的模型提取攻击。

Comments Preprint. Code available at https://github.com/LabRAI/mmd-llm-mea-detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06266 2026-06-05 cs.CL 91%

From Self to Other: Evaluating Demographic Perspective-Taking in LLM Hate Speech Annotation

从自我到他人:评估LLM仇恨言论标注中的人口统计学视角采纳

Paloma Piot, Javier Parapar

机构 * Information Retrieval Lab(信息检索实验室) CITIC Research Centre(CITIC研究中心) Universidade da Coruña(科鲁纳大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过评估人格化LLM在仇恨言论检测中模拟不同人口群体视角的能力,发现模型在群体间分歧、群体内敏感性和替代性预测三个维度上表现不一,其中使用Llama 3.1的替代性提示在多数人口统计轴上实现了最高跨群体一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01489 2026-06-05 cs.LG cs.AI cs.DC cs.PF cs.SE 89%

CuTeGen: An LLM-Based Agentic Framework for Generation and Optimization of High-Performance GPU Kernels using CuTe

CuTeGen: 基于LLM的代理框架用于使用CuTe生成和优化高性能GPU内核

Tara Saba, Zhiyang Chen, Jikai Jason Li, Anne Ouyang, Xujie Si, Fan Long

机构 * Department of Computer Science, University of Toronto(计算机科学系,多伦多大学)

专题命中 其他LLM :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出CuTeGen,一种基于LLM的代理框架,通过CuTe抽象层实现GPU内核的生成和优化,通过结构化生成-测试-优化工作流,在标准基准测试中实现了比PyTorch快1.71倍的速度提升,并在生成成本相近的情况下优于现有代理基线CudaForge。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11527 2026-06-05 cs.HC cs.AI cs.CY 87%

"What if she doesn't feel the same?" What Happens When We Ask AI for Relationship Advice

如果她不再有同样的感觉呢?当我们将AI用于关系建议时会发生什么

Niva Manchanda, Akshata Kishore Moharir, Ratna Kandala

机构 * Department of Psychology, University of Kansas(堪萨斯大学心理学系) Independent Researcher(独立研究者)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了用户对LLM生成的浪漫关系建议的评价,发现用户对建议的满意度高,并且这种满意度与对模型可靠性和有用性的感知正相关,同时用户对LLM的态度也显著改善。

Journal ref First Workshop on LLM Persona Modeling, NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06056 2026-06-05 cs.CY cs.AI cs.CV 86%

Using street view images and visual LLMs to predict heritage values for governance support: Risks, ethics, and policy implications

利用街景图像和视觉大语言模型预测遗产价值以支持治理:风险、伦理与政策影响

Tim Johansson, Mikael Mangold, Kristina Dabrock, Anna Donarelli, Ingrid Campo-Ruiz

机构 * RISE Research Institutes of Sweden AB(瑞典RISE研究机构) Malmö University(马尔默大学) Forschungszentrum Jülich GmbH(朱利奇研究中心) Uppsala University(乌普萨拉大学)

专题命中 其他LLM :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究利用街景图像和视觉大语言模型评估瑞典建筑遗产价值,以支持建筑翻新计划的制定,探讨了方法中的问题、潜在改进以及使用LLM数据的伦理风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12620 2026-06-05 cs.CL 85%

What Makes Two Language Models Think Alike?

是什么让两个语言模型思考相似?

Louis Jalouzot, Christophe Pallier, Emmanuel Chemla, Yair Lakretz

机构 * UNICOG CNRS(法国国家科学研究中心) INSERM(法国国家健康与医学研究院) CEA(法国原子能委员会) Paris-Saclay University(巴黎-萨克雷大学) LSCP(语言科学研究中心) EHESS(高等科学研究所) ENS(巴黎高等师范学校) PSL University(巴黎科学哲学大学)

专题命中 其他LLM :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了语言模型表示和处理语言的方式是否受架构和训练差异影响,提出了一种新的方法来量化模型间相似性和差异性,并发现模型相似性主要由发布日期和模型家族决定。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06387 2026-06-05 cs.CR 82%

WebMCP Tool Surface Poisoning: Runtime Manipulation Attacks on LLM Agents

WebMCP工具表面投毒:针对LLM智能体的运行时操纵攻击

Lin-Fa Lee, Yi-Yu Chang, Chia-Mu Yu, Kuo-Hui Yeh

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本文提出一种新的威胁——会话中工具注入(MSTI),通过第三方脚本在活跃会话中注入恶意工具,并细分为工具劫持和工具框架两类,实验证明可破坏WebMCP功能,最后给出缓解方向和安全设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06320 2026-06-05 cs.LG cs.AI cs.CL 82%

Learning What to Forget: Improving LLM Unlearning via Learned Token-Level Importance

学习遗忘什么:通过习得的词元级重要性改进大语言模型遗忘

Gizem Yüce, Giorgos Nikolaou, Nicolas Flammarion

机构 * Theory of Machine Learning Lab, EPFL(机器学习理论实验室,EPFL)

专题命中 其他LLM :LLM(title);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出交替词元加权遗忘(ATWU)框架,通过联合学习词元遗忘特异性和模型参数,在无外部监督下实现最优的遗忘-保留权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00911 2026-06-05 cs.AI 81%

Synapse: Federated Tool Routing via Typed Compendium Artifacts

Synapse: 通过类型化编目工件实现联邦工具路由

Abhijit Chakraborty, Yash Shah, Vivek Gupta

机构 * MongoDB Arizona State University(亚利桑那州立大学)

专题命中 其他LLM :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出了一种名为Synapse的联邦工具路由编目系统,通过类型化联邦工件实现跨客户端的联邦学习,解决了在异构LLM和无共享数据的情况下,如何实现隐私保护、冲突解决和跨架构迁移的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06347 2026-06-05 eess.SY cs.LG cs.SY 79%

Attack Detection using Time Series Foundation Models

使用时间序列基础模型的攻击检测

Sribalaji C. Anand, Anh Tung Nguyen, George J. Pappas

机构 * University of Pennsylvania(宾夕法尼亚大学) KTH Royal Institute of Technology(皇家理工学院) Uppsala University(乌普萨拉大学)

专题命中 其他LLM :foundation model(title,abstract);分类 cs.LG

AI总结 针对无模型知识的网络物理系统,提出基于TimesFM时间序列基础模型的零样本攻击检测方法,在IEEE 14节点电力系统上验证其性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05339 2026-06-05 cs.SE cs.AI 77%

A Taxonomy of Runtime Faults in Model Context Protocol Servers

模型上下文协议服务器运行时故障的分类法

Joshua Owotogbe, Indika Kumara, Willem-Jan van den Heuvel, Damian Andrew Tamburri, Antonio Ken Iannillo, Roberto Natella

机构 * Jheronimus Academy of Data Science and Tilburg University(赫伦尼姆数据科学学院和蒂尔堡大学) Jheronimus Academy of Data Science(赫伦尼姆数据科学学院) University of Sannio(萨尼亚大学) University of Luxembourg(卢森堡大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 其他LLM :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过手动分析473个MCP服务器仓库中的837个故障线程,采用自下而上的开放式编码方法,首次建立了MCP服务器运行时故障的经验分类法,包含11个顶层类别和27个子类别(73种叶子故障类型),并通过开发者调查验证了其外部有效性。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05609 2026-06-05 cs.CR cs.AI cs.LG 73%

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

SlotGCG:利用LLMs中的位置脆弱性进行越狱攻击

Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

机构 * Dongguk University-Seoul(东国大学-首尔)

专题命中 其他LLM :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SlotGCG方法,通过量化提示中不同插入位置(槽)的脆弱性得分(VSS),选择最脆弱的位置插入对抗性令牌,从而显著提升基于优化的越狱攻击成功率。

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05847 2026-06-05 cs.AI 70%

Agentic Molecular Recovery via Molecule-Aware Exploration

通过分子感知探索实现智能体分子恢复

Suwan Yoon, Changhee Lee

机构 * Department of Artificial Intelligence, Korea University(韩国大学人工智能系)

专题命中 其他LLM :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对文本引导分子生成中无效SMILES问题,提出AMREC方法,通过分子感知失配追踪、扩展候选探索和轨迹级选择,在恢复化学有效性的同时保留目标相关结构线索和分子身份。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05476 2026-06-05 cs.CR cs.MA 67%

SHIELDS: Automating OS Hardening with Iterative Multi-Agent Remediation

SHIELDS: 通过迭代多智能体修复实现操作系统加固自动化

Andrew Hamara, Dwight Horne, Aldehir Rojas, Timothy Kurniawan, Sophie Lamothe, Vishal Suresh, Nicholas Turoci, Lawrence Wong

专题命中 其他LLM :large language model(abstract);language model(abstract)

AI总结 提出SHIELDS多智能体系统,利用大语言模型通过迭代反馈驱动的方式自动修复操作系统安全配置错误,在多种虚拟机配置下成功修复高达73%的扫描发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19446 2026-06-05 eess.AS 50%

Leveraging Cascaded Binary Classification and Multimodal Fusion for Dementia Detection through Spontaneous Speech

利用级联二分类和多模态融合进行自发语音中的痴呆症检测

Yin-Long Liu, Yuanchao Li, Rui Feng, Liu He, Jia-Xin Chen, Yi-Ming Wang, Yu-Ang Chen, Yan-Han Peng, Jia-Hong Yuan, Zhen-Hua Ling

专题命中 其他LLM :language model(abstract)

AI总结 本文提出了一种级联二分类和多模态融合的方法,用于通过自发语音进行早期痴呆症检测,解决了类别不平衡问题,并在Mini-Mental State Examination评分回归任务中实现了优于基线方法的性能。

Comments Accepted by Interspeech 2025

Journal ref Proc. Interspeech 2025, pp. 544-548, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏