arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 34 篇

2605.18298 2026-05-19 cs.AI cs.HC cs.LG 81%

DARE-EEG: A Foundation Model for Mining Dual-Aligned Representation of EEG

DARE-EEG: 一种用于挖掘双对齐表示的EEG基础模型

Yang Shao, Peiliang Gong, Qun Dai, Daoqiang Zhang

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(航空宇航学院人工智能学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARE-EEG,一种通过双对齐表示学习预训练的自监督基础模型,旨在解决EEG编码器在不完整观测下学习不变表示的问题,通过对比学习和动量更新实现语义稳定性,并通过卷积-线性探针策略适应异构电极配置和采样率,实验表明其在EEG基准测试中表现优异。

Comments 22 pages, 10 pages of main text + 12 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18055 2026-05-19 cs.LG cs.AI 81%

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: 通过图结构的潜在扩散对齐实现基础模型表示以空间基因表达预测

Qi Si, Penglei Wang, Yushuai Wu, Yifeng Jiao, Xuyang Liu, Xin Guo, Yuan Qi, Yuan Cheng

机构 * Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China.(上海交通大学生物医学工程学院) Incubation Institute, Fudan University, Shanghai, China.(复旦大学孵化院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FLAG框架,通过图结构的潜在扩散对齐方法,解决空间基因表达预测中的基因协调和空间分布关系问题,并引入基因维度诅咒的概念,通过空间图编码器和基因基础模型对齐来提升模型的结构一致性与基因间保真度。

Comments 9 pages for main text, 3 pages for references, 19 pages for appendix. accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17562 2026-05-19 cs.LG cs.AI cs.HC 81%

Beyond Accuracy: Robustness, Interpretability and Expressiveness of EEG Foundation Models

超越准确率:EEG基础模型的鲁棒性、可解释性和表达性

Urban Širca, Maryam Alimardani, Stefanos Zafeiriou, Konstantinos Barmpas

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了EEG基础模型的鲁棒性、可解释性和表达性,通过在八个数据集上对六个EEG-FMs和一个基线深度学习模型进行基准测试,揭示了模型在不同扰动下的表现,以及其在可解释性和表达性方面的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03328 2026-05-19 cs.CL cs.AI 81%

StructLens: A Structural Lens for Language Models via Maximum Spanning Trees

StructLens:通过最大生成树实现语言模型的结构镜像

Haruki Sakajo, Frederikus Hudi, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出StructLens框架,通过最大生成树分析语言模型的表示结构,揭示模型在不同层和训练阶段中如何组织token表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17084 2026-05-19 cs.LG cs.CL 81%

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

尺度决定语言模型是否为预测组织表示几何

Weilun Xu

机构 * School of Computer and Communication Sciences(计算机与通信科学学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了语言模型中表示几何是否为预测组织,通过Subspace PGA指标发现,模型规模影响表示几何的组织程度,小模型在训练后期逐渐失去这种组织,而大模型则保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08169 2026-05-19 cs.LG cs.CL 81%

Spherical Steering: Geometry-Aware Activation Rotation for Language Models

球面操控:面向语言模型的几何感知激活旋转

Zejia You, Chunyuan Deng, Hanjie Chen

机构 * Rice University(里士大学) Tufts University(塔夫茨大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出球面操控方法,通过激活旋转而非加法实现无训练的推理控制,有效避免隐藏状态幅度变化,提升模型在多项选择基准上的表现,同时保持开放生成能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17765 2026-05-19 cs.LG 79%

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

AURORA:用于医疗基础模型中几何表示学习的上下文正交化

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出AURORA框架,通过上下文潜在几何进行正交化,以解决医疗基础模型中潜在表示的语义模糊和上下文变化不稳定性问题,提升了模型在不同机构分布变化下的鲁棒性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18085 2026-05-19 eess.SP 78%

PRiSE-EEG: A Prior-Guided Foundation Model with Depth-Stratified Experts for Cross-Paradigm EEG Representation Learning

PRiSE-EEG: 一种基于先验的EEG基础模型,具有深度分层专家,用于跨范式EEG表示学习

Wei Xiong, Jiangtong Li, Kun Zhu, Jie Li

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出PRiSE-EEG,一种基于先验的EEG基础模型,通过深度分层专家实现跨范式EEG表示学习,通过CKA校准的深度分层专家分配提升了模型的跨范式性能。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 75%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18257 2026-05-19 cs.CV cs.AI cs.CL 73%

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

CodeBind: 一种用于多模态对齐的解耦表示学习框架

Zeyu Chen, Jie Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(视觉人工智能实验室,香港大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CodeBind通过统一的组合代码本设计优化多模态表示空间,解决了传统方法在跨模态信息差异和数据稀缺导致的对齐空间不足问题,实现了多模态分类和检索任务中的最佳性能。

Comments ACL 2026 Findings; Project page: https://visual-ai.github.io/codebind

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18554 2026-05-19 cs.LG stat.ML 70%

Federated Martingale Posterior Samping

联邦马尔可夫后验采样

Boning Zhang, Matteo Zecchin, Mingzhao Guo, Dongzhu Liu, Osvaldo Simeone

机构 * School of Computing, University of Glasgow(格拉斯哥大学计算学院) Communication Systems Department, EURECOM(EURECOM通信系统部门) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出联邦马尔可夫后验采样方法,通过在不共享本地数据集的情况下,利用预测分布恢复参数不确定性,从而在联邦学习中提升模型校准性能。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14347 2026-05-19 cs.LG 70%

Exemplar Partitioning for Mechanistic Interpretability

基于示例的机制可解释性划分

Jessica Rumbelow

机构 * Leap Laboratories(Leap实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Exemplar Partitioning方法,通过更少的token构建可解释特征字典,展示其在不同层和模型间的可比性及因果干预能力。

Comments Code: https://github.com/jessicarumbelow/exemplar-partitioning. Pretrained dictionaries: https://huggingface.co/datasets/J-RUM/exemplar-partitioning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16581 2026-05-19 cs.LG 70%

Structure-Aware Masking for Protein Representation Learning

基于结构的掩码策略用于蛋白质表示学习

Thomas Walton, Ayan Goel, Amirali Aghazadeh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出结构感知掩码策略,通过三维空间接近性选择残基组,改进蛋白质表示学习,提升下游预测任务性能,实现14%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17366 2026-05-19 cs.IR 67%

Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation

基于文本引导的视觉表示学习用于鲁棒的多模态电子商务推荐

Yufei Guo, Jing Ma, Tianlu Zhang, Shijie Yang, Yanlong Zang, Weijie Ding, Pinghua Gong, Jungong Han

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文提出Text-Guided Q-Former框架,通过结构化元数据指导视觉令牌提取,提升多模态检索的鲁棒性,实验表明其在电子商务数据集上显著提升了检索性能。

Comments 12 pages, 5 figures. Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06162 2026-05-19 cs.LG cs.CV 57%

Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models

忘却众多,忘却正确:扩散模型中可扩展且精确的概念反学习

Kaiyuan Deng, Gen Li, Yang Xiao, Bo Hui, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) Clemson University(克莱姆森大学) The University of Tulsa(塔尔萨大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 本文提出了一种名为ScaPre的统一框架,用于在大规模扩散模型中实现精确的概念反学习,通过解决冲突更新、不精确机制和依赖额外数据的问题,提高了反学习的效率和精度。

Comments Accepted at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17204 2026-05-19 cs.RO cs.AI 57%

Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies

基于事件的稀疏自编码器用于视觉-语言-动作策略

Xinchen Jin, Aditya Chatterjee, Pranav Kumar, Rohan Paleja

机构 * Department of Computer Science, Purdue University West Lafayette, IN 47907(计算机科学系,普渡大学西拉法叶分校,印第安纳州,47907)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于事件的稀疏自编码器(SAE)分析方法,用于视觉-语言-动作(VLA)策略的可解释性研究,通过行为事件锚定SAE特征分析,提升了对闭合回路行为的因果影响和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18680 2026-05-19 cs.CV 50%

CMAG: Concept-Scaffolded Retrieval for Marketplace Avatar Generation

CMAG:基于概念的市场人像生成检索

Rajeev Goel, Jason Ding, Phani Harish Wajjala, Pavan Turaga, Tejaswi Gowda, Krishna C. Garikipati

机构 * Arizona State University(亚利桑那州立大学) Roblox Corporation(Roblox公司)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出CMAG框架,通过概念引导的检索和验证组合方法,解决市场人像生成中因文本模糊、元数据噪声和部件不一致导致的检索问题,提升生成人像的拓扑一致性和组合正确性。

Comments Accepted to CVPR 2026 Workshop (GRAIL-V)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18541 2026-05-19 cs.CV 50%

LESSViT: Robust Hyperspectral Representation Learning under Spectral Configuration Shift

LESSViT: 在光谱配置偏移下鲁棒的高光谱表示学习

Haozhe Si, Yuxuan Wan, Yuqing Wang, Minh Do, Han Zhao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Siebel School of Computing and Data Science(计算与数据科学学院)

专题命中 知识编辑与模型理解 :pretraining(abstract)

AI总结 本文提出LESSViT,一种灵活的跨光谱泛化架构,通过低秩高效空间-光谱ViT,解决不同传感器下的高光谱图像建模问题,提升鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16949 2026-05-19 cs.CV 50%

Beyond Point-Wise Matching: Structural Representation Alignment for Accelerating Diffusion Transformers

超越点对点匹配:为加速扩散变换器的结构表示对齐

Shaodong Xu, Zhendong Wang, Litong Gong, Zexian Li, Wengang Zhou, Tiezheng Ge, Houqiang Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 本文提出sREPA框架,通过显式结构约束来对齐特征图的相对几何关系,以提高生成质量并加速收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16405 2026-05-19 cs.CV 50%

Concepts Worth Having: Refining VLM-Guided Concept Bottleneck Models with Minimal Annotations

值得拥有的概念:通过最小标注精炼VLM引导的概念瓶颈模型

Nicola Debole, Andrea Passerini, Stefano Teso, Andrea Pugnana, Emanuele Marconato

机构 * DISI, University of Trento, Italy(特伦托大学DISI研究所,意大利)

专题命中 知识编辑与模型理解 :language model(abstract)

AI总结 本文提出VH-CBM模型,结合VLM和少量标注提升概念预测准确性与可解释性,验证其在概念校准和主动学习中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 37 篇

2605.17787 2026-05-19 cs.LG 92%

Revisiting the Adam-SGD Gap in LLM Pre-Training: The Role of Large Effective Learning Rates

重新审视LLM预训练中Adam与SGD的差距:大有效学习率的作用

Athanasios Glentis, Dawei Li, Chung-Yiu Yau, Mingyi Hong

机构 * University of Minnesota(明尼苏达大学)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过实证和理论分析,发现SGD在LLM预训练中表现较差的原因在于其无法维持与Adam相媲美的有效学习率,而大有效学习率需求源于小梯度范数和大权重-梯度比,且在大批次大小下更加明显。通过简单剪枝机制,SGD在大学习率下能恢复大部分Adam性能,实验显示验证损失差距从超过50%降至约3.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04932 2026-05-19 cs.CL 92%

Beyond the Final Actor: Modeling the Dual Roles of Creator and Editor for Fine-Grained LLM-Generated Text Detection

超越最终作者:为细粒度LLM生成文本检测建模创作者与编辑的双重角色

Yang Li, Qiang Sheng, Zhengjia Wang, Yehan Yang, Danding Wang, Juan Cao

机构 * ict.ac.cn(中国科学院)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RACE方法,通过建模创作者和编辑的双重角色,实现细粒度LLM生成文本检测,以更精确地区分不同类型的文本,从而为LLM监管提供政策对齐的解决方案。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13635 2026-05-19 econ.GN q-fin.EC 91%

Interpreting the Interpreter: Can We Model post-ECB Conferences Volatility with LLM Agents?

解读解释器:我们能否用LLM代理模型post-ECB会议波动?

Umberto Collodel

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种框架,利用大型语言模型模拟30个异质交易者解读欧洲中央银行会议 transcript,以衡量合成代理之间的横截面分歧。该框架在1998至2026年的293次 Governing Council 事件中,与实际 Overnight Index Swap 波动率相关性约为0.5,优于标准文本方法。LLM推导的分歧提供了超越波动聚类的信息,并在出样本验证中保持稳健。此外,提供历史前后的波动示例能提高模型响应的校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16308 2026-05-19 cs.GR 90%

Conformal Geometric Algebra as a Symbolic Interface for LLM-Driven 3D Scene Editing

共形几何代数作为LLM驱动3D场景编辑的符号接口

Manos Kamarianakis, Pandelis Sofianos, George Papagiannakis

专题命中 其他LLM :LLM(title,title_cn);prompting(abstract)

AI总结 研究探讨了共形几何代数在LLM驱动3D场景编辑中的可靠性与效率,发现其在保持操作顺序和降低token消耗方面优于传统方法。

Comments 34 pages, 15 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16976 2026-05-19 cs.CR 89%

Securing LLM Agents Need Intent-to-Execution Integrity

为LLM代理的安全性需要意图到执行的完整性

Wenjie Qu, Ming Xu, Peiran Wang, Shengfang Zhai, Jiaheng Zhang, Dawn Song

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本文提出了一种新的正确性属性,用于定义LLM代理在执行时如何忠实反映用户的意图,同时提出了四个必须同时满足的完整性属性,以确保代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00560 2026-05-19 cs.CR cs.SE quant-ph 89%

Quantum-Safe Code Auditing: LLM-Assisted Static Analysis and Quantum-Aware Risk Scoring for Post-Quantum Cryptography Migration

量子安全代码审计:基于LLM的静态分析与量子感知风险评分用于后量子密码学迁移

Animesh Shaw

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本文提出量子安全代码审计工具,结合正则表达式检测量子脆弱算法、LLM辅助上下文丰富及VQE模型风险评分,评估五个开源库发现5775项问题,实现高精度和召回率。

Comments 13 pages, 2 figures. Code and evaluation data: https://github.com/AnimeshShaw/quantum-safe-auditor

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16933 2026-05-19 cs.HC 87%

The Effects of Structured LLM-Generated Feedback on Programming Assignment Performance

结构化大语言模型生成反馈对编程作业表现的影响

Tsvetomila Mihaylova, Evanfiya Logacheva, Arto Hellas, Jing Fan, Francisco Castro, Bita Akram, Narges Norouzi, Peter Brusilovsky, Juho Leinonen

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本研究探讨了不同指导级别的大语言模型生成反馈对学生编程问题解决行为的影响,发现结构化反馈能提高解题速度并促进学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16709 2026-05-19 cs.IT math.IT 87%

Covert Multi-bit LLM Watermarking: An Information Theory and Coding Approach

隐秘多比特大语言模型水印:信息论与编码方法

Sidong Guo, Tyler Kann, Teodora Baluta, Matthieu R. Bloch

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于信息论和编码的多比特大语言模型隐写方法,通过块自回归模型和极码算法实现高效隐写,实验显示在短词长下误码率低于10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16646 2026-05-19 cs.SE 87%

LLM-based vs. Search-based Merge Conflict Resolution: An Empirical Study of Competing Paradigms

基于大语言模型与基于搜索的合并冲突解决:对两种范式的实证研究

Heleno de Souza Campos Junior, Leonardo Gresta Paulino Murta

专题命中 其他LLM :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过实证研究比较了基于大语言模型和基于搜索的合并冲突解决方法,揭示了两者在实际场景中的优劣势及权衡。

Comments Paper submitted to the Empirical Software Engineering Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18239 2026-05-19 cs.CL cs.AI 85%

Multilingual jailbreaking of LLMs using low-resource languages

使用低资源语言对LLM进行多语言劫持

Dylan Marx, Marcel Dunaiski

机构 * Computer Science Division, Mathematical Sciences Department(计算机科学系,数学科学系)

专题命中 其他LLM :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过使用低资源非洲语言进行多轮对话来测试大型语言模型的安全机制,发现翻译质量是影响低资源语言劫持成功率的关键因素。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏