arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 34 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 34 篇

2603.23638 2026-05-19 cs.AI 92%

Can LLM Agents Be CFOs? Benchmarking Long-Horizon Resource Allocation in an Uncertain Enterprise Environment

LLM代理能成为CFO吗?在不确定的企业环境中评估长期资源分配

Yi Han, Yan Wang, Lingfei Qian, Haohang Li, Yupeng Cao, Yueru He, Xueqing Peng, Nanhan Shen, Yitao Xu, Yankai Chen, Dongji Feng, Jimin Huang, Xue Liu, Jian-Yun Nie, Sophia Ananiadou

机构 * Georgia Institute of Technology(佐治亚理工学院) The Fin AI Stevens Institute of Technology(史蒂文斯理工学院) Columbia University(哥伦比亚大学) George Mason University(乔治·马歇尔大学) McGill University(麦吉尔大学) Mohamed bin Zayed University of Artificial Intelligence(莫扎大学人工智能学院) California State University, Monterey Bay(加州州立大学蒙特雷湾分校) University of Manchester(曼彻斯特大学) Mila – Quebec Artificial Intelligence Institute(魁北克人工智能研究所) Université de Montréal(蒙特利尔大学)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过EnterpriseArena模拟器评估LLM在不确定环境下的长期资源分配能力,发现现有模型在复杂任务中表现不足,仅15.4%的试验能持续完整周期。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14125 2026-05-19 cs.CL 89%

Polar probe linearly decodes semantic structures from LLMs

极性探针线性解码LLM中的语义结构

Pablo J. Diego-Simón, Pierre Orhan, Emmanuel Chemla, Yair Lakretz, Jean-Rémi King

机构 * LSCP, ENS, PSL, EHESS, CNRS(LSCP、ENS、PSL、EHESS、CNRS) Paris Brain Institute(巴黎脑研究所) Earth Species Project(地球物种计划) Meta AI

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过极性探针线性恢复LLM中的语义结构,发现其基于嵌入距离和方向表示实体存在与关系类型,且在中层表现更优,能泛化至新实体但随语义结构规模下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16699 2026-05-19 cs.CL cs.AI 88%

Calibrate-Then-Act: Cost-Aware Exploration in LLM Agents

校准后再行动:在大语言模型代理中考虑成本的探索

Wenxuan Ding, Nicholas Tomlin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 知识编辑与模型理解 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本文提出Calibrate-Then-Act框架,使LLM代理在不确定环境下显式平衡成本与不确定性,从而更优地决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20562 2026-05-19 cs.CL cs.AI 87%

Permutation-Consensus Listwise Judging for Robust Factuality Evaluation

排列一致性列表判断用于鲁棒事实性评估

Tianyi Huang, Nathan Huang, Justin Tang, Wenqian Chen, Elsa Fan

机构 * App-In Club(App-In俱乐部) Carnegie Mellon University(卡内基梅隆大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PCFJudge方法,通过多排列重跑列表事实性提示以提高LLM事实性判断的鲁棒性,实验显示其在RewardBench 2 Factuality上显著提升准确率。

Comments Accepted at the Fifth Workshop on Natural Language Generation, Evaluation, and Metrics at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17193 2026-05-19 cs.MA 87%

Multi-LLM Systems Exhibit Robust Semantic Collapse

多语言模型系统表现出稳健的语义崩溃

Weiyi Kong, Shiyang Lai, Jinghua Piao, James Evans

专题命中 知识编辑与模型理解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨了多语言模型系统在闭环设置中维持开放知识生产的基本限制,发现系统在语义表示上出现系统性收敛,尽管表面上有词汇变化。

Comments 64 pages, 8 figures, 7 tables; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16686 2026-05-19 cs.LG 86%

Scalable Knowledge Editing for Mixture-of-Experts LLMs via Tensor-Structured Updates

基于张量结构更新的混合专家LLM可扩展知识编辑

Roman Maksimov, Vladimir Aletov, Dmitry Bylinkin, Daniil Medyakov, Vladimir Solodkin, Aleksandr Beznosikov

机构 * OpenAI DeepSeek-AI Qwen Team(Qwen团队) Shazeer et al.(Shazeer等人) Molodtsov et al.(Molodtsov等人)

专题命中 知识编辑与模型理解 :LLM(title_cn,summary_cn);分类 cs.LG

AI总结 本文提出一种针对混合专家架构LLM的知识编辑方法,通过张量结构和Woodbury矩阵恒等式实现高效参数更新,提升编辑效率6倍,扩展了知识编辑的应用范围。

Comments 17 pages, 3 architectures, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01235 2026-05-19 cs.SD cs.AI 86%

MindMelody: A Closed-Loop EEG-Driven System for Personalized Music Intervention

MindMelody:一种基于EEG的闭环个性化音乐干预系统

Yimeng Zhang, Yueru Sun, Haoyu Gu, Zhanpeng Jin

机构 * South China University of Technology(南方科技大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MindMelody系统,通过EEG信号实时生成个性化音乐,结合Transformer-GNN和RAG-LLM实现情绪感知与音乐生成的闭环控制,提升情感适应性与用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13339 2026-05-19 cs.CL cs.AI 86%

Probing Persona-Dependent Preferences in Language Models

探测语言模型中依赖人格的偏好

Oscar Gilg, Pierre Beckmann, Daniel Paleka, Patrick Butlin

机构 * MATS EPFL(瑞士联邦理工学院) ETH Zürich(苏黎世联邦理工学院) Eleos AI Research(Eleos AI研究)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文通过训练线性探针来探测语言模型中不同人格下的偏好表示,发现偏好向量在不同人格间具有共享特性,并能通过调整偏好向量来影响模型的输出选择。

Comments 41 pages, 45 figures. Code: https://github.com/oscar-gilg/Preferences. Earlier write-up on LessWrong: https://www.lesswrong.com/posts/pxC2RAeoBrvK8ivMf/models-have-linear-representations-of-what-tasks-they-like-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10134 2026-05-19 cs.CR cs.AI cs.CL 86%

Reverse-Engineering Model Editing on Language Models

语言模型上的逆向工程模型编辑

Zhiyu Sun, Minrui Luo, Yu Wang, Zhili Chen, Tianxing He

专题命中 知识编辑与模型理解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了语言模型中参数编辑的漏洞,提出了一种名为KSTER的逆向工程攻击方法,通过利用参数更新的低秩结构恢复编辑数据,并提出subspace camouflage防御策略以降低重建风险。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18163 2026-05-19 cs.AI cs.CL 85%

TRACE: Trajectory Correction from Cross-layer Evidence for Hallucination Reduction

TRACE: 通过跨层证据进行轨迹修正以减少幻觉

Tej Sanibh Ranade

机构 * Independent Researcher(独立研究者)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TRACE算法,通过跨层证据在推理时修正LLM中的幻觉,无需训练或标注,通过内部证据选择修正策略,提升多个基准测试的性能。

Comments 25 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02178 2026-05-19 cs.CL cs.AI cs.LG 85%

The Expert Strikes Back: Interpreting Mixture-of-Experts Language Models at Expert Level

专家反击:在专家层面解读混合专家语言模型

Jeremy Herbst, Stefan Wermter, Jae Hee Lee

机构 * Department of Informatics, University of Hamburg, Hamburg, Germany(汉堡大学信息学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过k稀疏探测比较MoE专家与密集FFN,发现专家神经元更单语义,提出以专家为分析单位,揭示专家是细粒度任务专家,而非领域专家或token处理者。

Comments 8 pages, 7 Figures. Accepted at ICML 2026. Improved writing, changed author order, updated citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17435 2026-05-19 cs.CL 84%

BELIEF: Structured Evidence Modeling and Uncertainty-Aware Fusion for Biomedical Question Answering

BELIEF: 结构化证据建模与不确定性感知融合用于生物医学问答

Chang Zong, Hao Ning, Siliang Tang, Jie Huang, Jian Wan

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) College of Artificial Intelligence, Zhejiang University(浙江大学人工智能学院) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology, Zhejiang University of Science and Technology(浙江理工大学生物医学智能计算技术重点实验室)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出BELIEF框架,通过结构化证据建模和不确定性感知融合,提升生物医学问答任务中检索文献的利用效率,实现对证据可靠性、不确定性以及候选假设的支持强度的显式建模。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02028 2026-05-19 cs.CL 83%

Language models fail at extended rule following

语言模型在扩展规则遵循中表现不佳

Tianxiang Dai, Jonathan Fan

机构 * Department of Electrical Engineering, Stanford University(斯坦福大学电气工程系)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 研究发现语言模型在重复应用规则时无法保持精确状态,即使增加模型规模和计算资源也无法克服这一缺陷,表明需要新的模型架构来实现可靠的规则遵循。

Comments for accessing the data and code for reproduction of the study, see https://txdai.github.io/counting-reliability/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18442 2026-05-19 cs.RO 82%

SG-CADVLM: A Context-Aware Decoding Powered Vision Language Model for Safety-Critical Scenario Generation

SG-CADVLM: 一种基于上下文感知解码的视觉语言模型,用于安全关键场景生成

Hongyi Zhao, Shuo Wang, Qijie He, Ziyuan Pu

机构 * School of Transportation, Southeast University(东南大学交通学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);large language model(abstract)

AI总结 本文提出SG-CADVLM,一种结合上下文感知解码的多模态输入处理框架,用于从事故报告中生成高保真的安全关键场景,通过减少视觉语言模型的幻觉并同时生成道路几何和车辆轨迹,提升了生成场景的准确性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18298 2026-05-19 cs.AI cs.HC cs.LG 81%

DARE-EEG: A Foundation Model for Mining Dual-Aligned Representation of EEG

DARE-EEG: 一种用于挖掘双对齐表示的EEG基础模型

Yang Shao, Peiliang Gong, Qun Dai, Daoqiang Zhang

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(航空宇航学院人工智能学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DARE-EEG,一种通过双对齐表示学习预训练的自监督基础模型,旨在解决EEG编码器在不完整观测下学习不变表示的问题,通过对比学习和动量更新实现语义稳定性,并通过卷积-线性探针策略适应异构电极配置和采样率,实验表明其在EEG基准测试中表现优异。

Comments 22 pages, 10 pages of main text + 12 pages of appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18055 2026-05-19 cs.LG cs.AI 81%

FLAG: Foundation model representation with Latent diffusion Alignment via Graph for spatial gene expression prediction

FLAG: 通过图结构的潜在扩散对齐实现基础模型表示以空间基因表达预测

Qi Si, Penglei Wang, Yushuai Wu, Yifeng Jiao, Xuyang Liu, Xin Guo, Yuan Qi, Yuan Cheng

机构 * Shanghai Academy of Artificial Intelligence for Science, Shanghai, China.(上海人工智能科学研究院) School of Biomedical Engineering, Shanghai Jiao Tong University, Shanghai, China.(上海交通大学生物医学工程学院) Incubation Institute, Fudan University, Shanghai, China.(复旦大学孵化院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出FLAG框架,通过图结构的潜在扩散对齐方法,解决空间基因表达预测中的基因协调和空间分布关系问题,并引入基因维度诅咒的概念,通过空间图编码器和基因基础模型对齐来提升模型的结构一致性与基因间保真度。

Comments 9 pages for main text, 3 pages for references, 19 pages for appendix. accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17562 2026-05-19 cs.LG cs.AI cs.HC 81%

Beyond Accuracy: Robustness, Interpretability and Expressiveness of EEG Foundation Models

超越准确率:EEG基础模型的鲁棒性、可解释性和表达性

Urban Širca, Maryam Alimardani, Stefanos Zafeiriou, Konstantinos Barmpas

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Imperial College London(伦敦帝国学院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了EEG基础模型的鲁棒性、可解释性和表达性,通过在八个数据集上对六个EEG-FMs和一个基线深度学习模型进行基准测试,揭示了模型在不同扰动下的表现,以及其在可解释性和表达性方面的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03328 2026-05-19 cs.CL cs.AI 81%

StructLens: A Structural Lens for Language Models via Maximum Spanning Trees

StructLens:通过最大生成树实现语言模型的结构镜像

Haruki Sakajo, Frederikus Hudi, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出StructLens框架,通过最大生成树分析语言模型的表示结构,揭示模型在不同层和训练阶段中如何组织token表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17084 2026-05-19 cs.LG cs.CL 81%

Scale Determines Whether Language Models Organize Representation Geometry for Prediction

尺度决定语言模型是否为预测组织表示几何

Weilun Xu

机构 * School of Computer and Communication Sciences(计算机与通信科学学院) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了语言模型中表示几何是否为预测组织,通过Subspace PGA指标发现,模型规模影响表示几何的组织程度,小模型在训练后期逐渐失去这种组织,而大模型则保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08169 2026-05-19 cs.LG cs.CL 81%

Spherical Steering: Geometry-Aware Activation Rotation for Language Models

球面操控:面向语言模型的几何感知激活旋转

Zejia You, Chunyuan Deng, Hanjie Chen

机构 * Rice University(里士大学) Tufts University(塔夫茨大学)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出球面操控方法,通过激活旋转而非加法实现无训练的推理控制,有效避免隐藏状态幅度变化,提升模型在多项选择基准上的表现,同时保持开放生成能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17765 2026-05-19 cs.LG 79%

AURORA: Contextual Orthogonalization for Geometric Representation Learning in Healthcare Foundation Models

AURORA:用于医疗基础模型中几何表示学习的上下文正交化

Yuanyun Zhang, Shi Li

机构 * University of the Chinese Academy of Sciences(中国科学院大学) Columbia University(哥伦比亚大学)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出AURORA框架,通过上下文潜在几何进行正交化,以解决医疗基础模型中潜在表示的语义模糊和上下文变化不稳定性问题,提升了模型在不同机构分布变化下的鲁棒性和预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18085 2026-05-19 eess.SP 78%

PRiSE-EEG: A Prior-Guided Foundation Model with Depth-Stratified Experts for Cross-Paradigm EEG Representation Learning

PRiSE-EEG: 一种基于先验的EEG基础模型,具有深度分层专家,用于跨范式EEG表示学习

Wei Xiong, Jiangtong Li, Kun Zhu, Jie Li

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 本文提出PRiSE-EEG,一种基于先验的EEG基础模型,通过深度分层专家实现跨范式EEG表示学习,通过CKA校准的深度分层专家分配提升了模型的跨范式性能。

Comments 32 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23180 2026-05-19 cs.CV 75%

GaussianDWM: 3D Gaussian Driving World Model for Unified Scene Understanding and Multi-Modal Generation

GaussianDWM: 基于3D高斯场景表示的统一场景理解和多模态生成驱动世界模型

Tianchen Deng, Xuefeng Chen, Yi Chen, Qu Chen, Yuyao Xu, Lijin Yang, Le Xu, Yu Zhang, Bo Zhang, Wuxiong Huang, Hesheng Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) MEGVII Technology(商汤科技) Mach Drive

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出基于3D高斯表示的统一驱动世界模型框架,实现3D场景理解和多模态生成,并通过语言引导采样策略和双条件生成模型提升生成效果,实验验证其在nuScenes和NuInteract数据集上的优越性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18257 2026-05-19 cs.CV cs.AI cs.CL 73%

CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook

CodeBind: 一种用于多模态对齐的解耦表示学习框架

Zeyu Chen, Jie Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(视觉人工智能实验室,香港大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CodeBind通过统一的组合代码本设计优化多模态表示空间,解决了传统方法在跨模态信息差异和数据稀缺导致的对齐空间不足问题,实现了多模态分类和检索任务中的最佳性能。

Comments ACL 2026 Findings; Project page: https://visual-ai.github.io/codebind

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18554 2026-05-19 cs.LG stat.ML 70%

Federated Martingale Posterior Samping

联邦马尔可夫后验采样

Boning Zhang, Matteo Zecchin, Mingzhao Guo, Dongzhu Liu, Osvaldo Simeone

机构 * School of Computing, University of Glasgow(格拉斯哥大学计算学院) Communication Systems Department, EURECOM(EURECOM通信系统部门) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出联邦马尔可夫后验采样方法,通过在不共享本地数据集的情况下,利用预测分布恢复参数不确定性,从而在联邦学习中提升模型校准性能。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14347 2026-05-19 cs.LG 70%

Exemplar Partitioning for Mechanistic Interpretability

基于示例的机制可解释性划分

Jessica Rumbelow

机构 * Leap Laboratories(Leap实验室)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Exemplar Partitioning方法,通过更少的token构建可解释特征字典,展示其在不同层和模型间的可比性及因果干预能力。

Comments Code: https://github.com/jessicarumbelow/exemplar-partitioning. Pretrained dictionaries: https://huggingface.co/datasets/J-RUM/exemplar-partitioning

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16581 2026-05-19 cs.LG 70%

Structure-Aware Masking for Protein Representation Learning

基于结构的掩码策略用于蛋白质表示学习

Thomas Walton, Ayan Goel, Amirali Aghazadeh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出结构感知掩码策略,通过三维空间接近性选择残基组,改进蛋白质表示学习,提升下游预测任务性能,实现14%的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17366 2026-05-19 cs.IR 67%

Text-Guided Visual Representation Learning for Robust Multimodal E-Commerce Recommendation

基于文本引导的视觉表示学习用于鲁棒的多模态电子商务推荐

Yufei Guo, Jing Ma, Tianlu Zhang, Shijie Yang, Yanlong Zang, Weijie Ding, Pinghua Gong, Jungong Han

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn)

AI总结 本文提出Text-Guided Q-Former框架,通过结构化元数据指导视觉令牌提取,提升多模态检索的鲁棒性,实验表明其在电子商务数据集上显著提升了检索性能。

Comments 12 pages, 5 figures. Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026). Pre-camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06162 2026-05-19 cs.LG cs.CV 57%

Forget Many, Forget Right: Scalable and Precise Concept Unlearning in Diffusion Models

忘却众多,忘却正确:扩散模型中可扩展且精确的概念反学习

Kaiyuan Deng, Gen Li, Yang Xiao, Bo Hui, Xiaolong Ma

机构 * The University of Arizona(亚利桑那大学) Clemson University(克莱姆森大学) The University of Tulsa(塔尔萨大学)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.LG

AI总结 本文提出了一种名为ScaPre的统一框架,用于在大规模扩散模型中实现精确的概念反学习,通过解决冲突更新、不精确机制和依赖额外数据的问题,提高了反学习的效率和精度。

Comments Accepted at ICLR 2026

Journal ref International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17204 2026-05-19 cs.RO cs.AI 57%

Event-Grounded Sparse Autoencoders for Vision-Language-Action Policies

基于事件的稀疏自编码器用于视觉-语言-动作策略

Xinchen Jin, Aditya Chatterjee, Pranav Kumar, Rohan Paleja

机构 * Department of Computer Science, Purdue University West Lafayette, IN 47907(计算机科学系,普渡大学西拉法叶分校,印第安纳州,47907)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于事件的稀疏自编码器(SAE)分析方法,用于视觉-语言-动作(VLA)策略的可解释性研究,通过行为事件锚定SAE特征分析,提升了对闭合回路行为的因果影响和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏