arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-10 至 2026-06-10 共收录 367 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 25 篇

2605.03217 2026-06-10 cs.LG cs.CY 版本更新 86%

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

大语言模型中的道德敏感性:通过行为剖析和机制可解释性对上下文偏见进行分层评估

Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Purdue University(普渡大学) Meta Apple(苹果公司) Wright State University(怀特州立大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 知识编辑与模型理解 :SLM(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出道德敏感性指数(MSI)量化大语言模型在七级压力测试中的偏见概率,并通过行为剖析和机制验证揭示模型偏见随情境变化的U型曲线,发现推理蒸馏会重新激活浅层统计关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09875 2026-06-10 cs.LG cs.AI stat.ML 新提交 85%

Integrating Local and Global Entropy for Uncertainty Quantification in LLMs

集成局部和全局熵用于大语言模型的不确定性量化

Johanne Medina, Tianyi Zhou, Keivin Isufaj, Aristides Gionis, Sanjay Chawla

机构 * Qatar Computing Research Institute, HBKU(卡塔尔计算研究所,哈马德·本·哈利法大学) KTH Royal Institute of Technology(瑞典皇家理工学院)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GLU方法,通过融合隐藏状态几何熵(全局)和token级熵(局部)来量化LLM不确定性,有效捕捉自信但错误的失败模式,无需额外训练。

Comments 17 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21543 2026-06-10 cs.CL 版本更新 81%

inversedMixup: Data Augmentation via Inverting Mixed Embeddings

inversedMixup:通过反转混合嵌入进行数据增强

Fanshuang Kong, Richong Zhang, Qiyu Sun, Zhijie Nie, Ting Deng, Chunming Hu

机构 * Beihang University(北京航空航天大学)

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出 inversedMixup 框架,结合 Mixup 的可控性与 LLM 的可解释性,通过对齐嵌入空间将混合嵌入重构为可读句子,首次实证文本 Mixup 中的流形入侵现象,并扩展为三阶段数据增强方法,在少样本和全监督场景下有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10882 2026-06-10 cs.SE 新提交 80%

From Quality Properties to Practice: A Guideline and Workflow for Explainability Requirements

从质量属性到实践:可解释性需求的指南与工作流

Martin Obaidi, Jakob Droste, Hannah Deters, Marc Herrmann, Michel Krahl, Kurt Schneider

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一个基于指南的迭代工作流,通过结构化文献综述、开发者访谈和从业者调查提炼出十个核心质量属性,并开发工具支持,实验表明工具辅助可减少23.5%的制定时间且需求质量与手动编写相当。

Comments This paper has been accepted at the research track of the 34th IEEE International Requirements Engineering Conference (RE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10594 2026-06-10 cs.CV 新提交 80%

Segment and Select: Vision-Language Segmentation in 3D Scenarios

Segment and Select: 3D场景中的视觉-语言分割

Yulin Chen, Zhihang Zhong, Yuenan Hou

机构 * Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Shanghai Jiaotong University(上海交通大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出SEGA3D范式,通过掩码候选生成器、大语言模型和语义空间选择器实现3D场景中基于语言指令的细粒度分割,在ScanNet和Matterport3D上分别提升8.3和5.3 mIoU。

Comments The core idea is to reformulate 3D vision-language segmentation as the segment-and-select paradigm (free from the superpoint dependency)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06037 2026-06-10 cs.SD cs.CL eess.AS 交叉投稿 79%

SpeechJBB: Probing Safety Alignment and Comprehension in Large Audio Language Models under Code-Switched Speech

SpeechJBB:探究大型音频语言模型在代码切换语音下的安全对齐与理解

Virginia Ceccatelli, Yejin Jeon, David Ifeoluwa Adelani

机构 * Mila - Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 知识编辑与模型理解 :language model(title,abstract);分类 cs.CL

AI总结 提出SpeechJBB数据集,通过代码切换有害音频和伪词插入方法,揭示大型音频语言模型在多语言和口语设置下的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10803 2026-06-10 cs.CL cs.AI cs.CV 新提交 73%

Beyond APIs: Probing the Limits of MLLMs in Physical Tool Use

超越API:探索多模态大语言模型在物理工具使用中的极限

Zhixin Ma, Yutong Zhou, Yongqi Li, Chong-Wah Ngo, Wenjie Li

机构 * Singapore Management University(新加坡管理大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PhysTool-Bench基准,评估多模态大语言模型在真实场景中识别物理工具并规划使用的能力,发现最强模型仅完成21%任务,揭示感知与规划双重缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10554 2026-06-10 cs.CL cs.AI 新提交 73%

Benchmarking Knowledge Editing using Logical Rules

使用逻辑规则对知识编辑进行基准测试

Tatiana Moteu Ngoli, NDah Jean Kouagou, Hamada M. Zahera, Axel-Cyrille Ngonga Ngomo

机构 * Data Science Group, Heinz Nixdorf Institute, Paderborn University(帕德博恩大学海因茨·尼克斯多夫研究所数据科学组)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于逻辑规则的基准,评估知识编辑方法对单次编辑逻辑后果的处理能力,发现现有方法在蕴含知识上性能下降高达24%。

Comments Accepted at the 24th International Semantic Web Conference 2025

Journal ref The Semantic Web. ISWC 2025. ISWC 2025. Lecture Notes in Computer Science, vol 16141. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10099 2026-06-10 cs.LG cs.AI 新提交 73%

Unsupervised Style Representation Learning for AI-Text Detection via Paraphrase Inversion

无监督风格表示学习用于通过释义反转检测AI文本

Rafael Rivera Soto, Barry Chen, Nicholas Andrews

机构 * Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Johns Hopkins University(约翰霍普金斯大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出无监督风格编码器,通过重构人工文本与机器生成释义间的差异学习判别性风格特征,实现少样本和零样本AI文本检测,性能优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09868 2026-06-10 cs.LG cs.AI 新提交 73%

SPACE: Source-free Proxy Anchor Concept Erasure for MLLMs

SPACE: 面向多模态大语言模型的无源代理锚点概念擦除

Zhijing Zhang, Jiaqi Ding, Qianshan Wei, Nan Zhou, Jiaqi Li, Yongliang Wu, Tongxin Zhu, Xiaolin Fang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出SPACE框架,首个针对多模态大语言模型的无源机器遗忘方法,通过文本引导的代理锚点选择和双约束语义隔离,在不访问目标数据的情况下擦除概念,并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02378 2026-06-10 cs.LG cs.AI 版本更新 73%

When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures

注意力电路何时形成?三种1B级架构中能力和注意力汇出现的发育轨迹

Yongzhong Xu

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文追踪三种1B级语言模型中注意力头电路的形成轨迹,发现归纳电路形成早于注意力汇形成10-20倍令牌,且电路识别无需最终模型。

Comments 27pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14397 2026-06-10 cs.CL cs.AI 版本更新 73%

Generating Concept Lexicalizations via Dictionary-Based Cross-Lingual Sense Projection

基于词典的跨语言语义投影生成概念词汇化

David Basil, Chirooth Girigowda, Bradley Hauer, Sahir Momin, Ning Shi, Grzegorz Kondrak

机构 * University of Toronto(多伦多大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种通过语义投影将英语WordNet概念扩展到新语言的方法,利用双语词典增强对齐并过滤错误投影,在多个语言上提升了精度且保持可解释性和资源效率。

Comments Paper presented at Canadian AI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04935 2026-06-10 cs.SE cs.AI 版本更新 70%

ASA: Backbone-Training-Free Representation Engineering for Tool-Calling Agents

ASA:无需骨干训练的工具调用智能体表示工程

Youjin Wang, Run Zhou, Yingjie Ma, Rong Fu, Jiani Liang, Shuaishuai Cao, Min Huang, Tao Fang, Liangming Pan

机构 * Renmin University of China(中国人民大学) University of Macau(澳门大学) Central South University(中南大学) Jiangxi Normal University(江西师范大学) Macau Millennium College(澳门 millennium 学院) Peking University(北京大学)

专题命中 知识编辑与模型理解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对大语言模型在工具调用中的惰性代理问题,提出一种无需训练、推理时激活干预的方法ASA,通过路由条件混合引导向量和探针引导门控,显著提升工具使用F1并降低误报率。

Comments The manuscript consists of 24 pages formatted in the ACL style. Youjin Wang, Run Zhou, and Yingjie Ma contributed equally to this work. Tao Fang and Liangming Pan are the co-corresponding authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.08726 2026-06-10 cs.CL 版本更新 70%

Standard Language Ideology in AI-Generated Language

AI生成语言中的标准语言意识形态

Genevieve Smith, Eve Fleisig, Ishita Rustagi, Xavier Yin

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个分类法,揭示大型语言模型如何强化标准语言意识形态,导致语言变体的边缘化,并讨论其社会影响及应对建议。

Comments To appear in the 2026 ACM Conference on Fairness, Accountability, and Transparency (FAccT '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09936 2026-06-10 cs.LG cs.AI 新提交 62%

One Lens, Many Worlds : A Capability-Typed Interface for World-Model Interpretability

一个镜头,多个世界:面向世界模型可解释性的能力类型接口

Bhavith Chandra Challagundla, Sanskar Pandey, Param Thakkar, Rishikesh Mallagundla, Yugandhar Reddy Gogireddy, Wenhao Lu, Hindol Roy Choudhury, Shravani Challagundla, Mohamed Deraz Nasr, Spursh Deshpande

机构 * New York University(纽约大学) Independent Researcher(独立研究者) Veermata Jijabai Technological Institute(韦尔玛塔·吉贾拜技术学院) Mercity University of Southern California(南加州大学) Independent Researcher, MIT(麻省理工学院独立研究者) Independent Researcher, GITAM(GITAM独立研究者) Georgia Institute of Technology(佐治亚理工学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出WorldModelLens,通过能力类型适配器统一不同世界模型(如PlaNet、IRIS、I-JEPA)的可解释性分析,避免重复实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09919 2026-06-10 cs.LG cs.AI cs.MA cs.RO 新提交 62%

Co-GLANCE: Uncertainty-Aware Active Perception for Heterogeneous Robot Teaming

Co-GLANCE: 异构机器人团队的不确定性感知主动感知

Michal P. Podolinsky, Neel P. Bhatt, Pranay Samineni, Rohan Siva, Christian Ellis, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Co-GLANCE系统,通过蒸馏视觉语言模型实现实时遮挡分割与机器人分配,结合共形预测与选择性弃权提供统计保证的不确定性量化,驱动主动感知,在真实场景中遮挡分割和分配准确率分别提升25%和36%,推理延迟降低350倍。

Comments Code, videos, and dataset available at https://co-glance.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09899 2026-06-10 cs.LG cs.AI 新提交 62%

When Attribution Patching Lies: Diagnosis and a Second-Order Correction

当归因补丁说谎时:诊断与二阶修正

Luyang Zhang, Jialu Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究归因补丁(梯度一阶近似)在机制可解释性中的不可靠性,发现主要误差源于下游网络的非线性,并提出可靠性评分、误差界和HVP二阶修正方法。

Comments 30 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10614 2026-06-10 cs.RO cs.CV cs.LG 新提交 57%

Dexterous Point Policy: Learning Point-based Dexterous Hand Policies from Human Demonstrations

灵巧点策略:从人类演示中学习基于点的灵巧手策略

Beomjun Kim, Seong Hyeon Park, Seunghoon Sim, Seungjun Moon, Sanghyeok Lee, Jinwoo Shin

机构 * KAIST(韩国科学技术院)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.LG

AI总结 提出Dexterous Point Policy框架,通过统一3D关键点表示从人类视频学习灵巧操作策略,无需机器人演示,在真实任务中达到75%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06735 2026-06-10 cs.AI 版本更新 57%

A Geometric Account of Activation Steering through Angle-Norm Decomposition

通过角度-范数分解的激活引导的几何解释

Georgii Aparin, Tatiana Gaintseva

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Queen Mary University of London(女王玛丽大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 本文通过控制实验分离角度和径向分量,发现概念主要编码在角度结构中,但范数对引导的稳定性和下游效应至关重要,建议将激活引导参数化为可解释的角度和径向分量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 50%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 知识编辑与模型理解 :foundation model(abstract)

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他LLM 17 篇

2507.09788 2026-06-10 cs.MA cs.AI cs.CL cs.HC 版本更新 92%

TinyTroupe: An LLM-powered Multiagent Persona Simulation Toolkit

TinyTroupe:一个基于LLM的多智能体人物模拟工具包

Paulo Salem, Robert Sim, Christopher Olsen, Prerit Saxena, Rafael Barcelos, Yi Ding

机构 * Microsoft Corporation(微软公司) Dipeak Technology(迪佩克技术)

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对现有LLM多智能体系统在细粒度人物模拟方面的不足,提出TinyTroupe工具包,支持详细人物定义和程序化控制,用于行为研究和社会模拟。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10853 2026-06-10 eess.AS 新提交 91%

Speech Encoder Fusion for LLM-based Automatic Speech Recognition

面向基于LLM的自动语音识别的语音编码器融合

Jakob Poncelet, Hugo Van hamme

专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究融合多个预训练语音编码器以增强基于LLM的ASR性能,提出多种融合策略并在多场景下验证其有效性。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00745 2026-06-10 cs.CL cs.AI cs.GT cs.IR econ.TH 版本更新 91%

Dynamics of Adversarial Attacks on Large Language Model-Based Search Engines

基于大型语言模型的搜索引擎对抗攻击动力学

Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学)

专题命中 其他LLM :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文将排名操纵攻击建模为无限重复囚徒困境,分析合作维持条件,发现降低攻击成功率可能反而激励攻击,防御措施在某些情况下无效。

Comments New Frontiers in Game-Theoretic Learning Workshop, International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10439 2026-06-10 cs.SD cs.CL eess.AS 新提交 90%

Enhancing Multilingual LLM-based ASR with Mixture of Experts and Dynamic Downsampling

利用混合专家和动态下采样增强基于多语言大模型的语音识别

Guodong Lin, Ziqi Chen, Yuxiang Fu, Ke Li, Wei-Qiang Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他LLM :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于投影器的LLM-ASR框架,通过混合专家架构提升跨语言适应性,并利用连续整合-触发机制实现动态下采样和模态对齐,实验表明该方法显著超越强基线模型。

Comments Accepted by ICASSP 2026

Journal ref ICASSP (2026),18807-18811

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10434 2026-06-10 cs.HC cs.ET 新提交 89%

Profiling cognitive offloading in LLM-mediated synthesis writing: Volume vs. content

LLM中介的合成写作中认知卸载的剖析:数量与内容

Oleksandra Poquet, Mani Shankar Nanduri, Maria Ximena Salinas Loyer, Matthias Stadler, Michael Sailer, Jelena Jovanovic

专题命中 其他LLM :LLM(title,title_cn)

AI总结 本研究通过聚类分析比较了两种认知卸载剖析方法(基于使用量和基于内容),发现内容剖析能揭示更丰富的认知模式,为理解LLM如何重新分配认知活动提供新视角。

Comments Accepted to the Proceedings of the European Conference for Tecnology-Enhanced Learning' 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10311 2026-06-10 cs.SE 新提交 89%

From Awareness to Action: How Developers Engage with Accessibility Innovation in LLM-Assisted Development

从意识到行动:开发者如何在LLM辅助开发中参与无障碍创新

Thayssa Águila da Rocha, Luciane Silva, Ana Duarte, Marcelle Pereira Mota, Gustavo Pinto

专题命中 其他LLM :LLM(title,title_cn)

AI总结 通过分析14个基于LLM的无障碍项目提案和9名参与者的焦点小组讨论,发现由残障人士主导的倡议能促进包容性创新,推动无障碍从合规要求转变为技术卓越和文化变革的驱动力。

Comments WASHES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04397 2026-06-10 cs.SE cs.IR 版本更新 89%

Context-as-AI-Service: Surfacing Cross-File Dependency Chains for LLM-Generated Developer Documentation

上下文即服务:为LLM生成的开发者文档揭示跨文件依赖链

Ameya Gawde, Vyzantinos Repantis, Harshvardhan Singh, Lucy Moys

专题命中 其他LLM :LLM(title,title_cn)

AI总结 提出Context-as-a-Service (CaaS)检索层,通过索引代码库并支持关键词与语义搜索,帮助LLM代理在生成或审查文档时追踪跨文件依赖链,实验表明CaaS能发现基线遗漏的错误并减少时间和输入令牌消耗。

Comments 8 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10692 2026-06-10 cs.CR cs.LG 新提交 89%

Do LLMsMakeNeural Distinguishers Wise?

LLM 是否使神经区分器更智能?

Tatsuya Sakagami, Masashi Hisai, Naoto Yanai

机构 * University of Tokyo(东京大学)

专题命中 其他LLM :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于大语言模型(LLM)的神经区分器,通过提示设计在SPECK-32/64上实验,发现LLM未显著提升性能,高轮次下差分选择失效,但加入XOR结果可改善性能。

Journal ref DeMeSSAI 2026 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10338 2026-06-10 cs.CL cs.AI 新提交 86%

Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

路由感知的专家校准用于混合专家语言模型中的机器遗忘

Jingyi Xie, Yijun Lin, Yinjiang Xiong, Zhikun Zhang, Sai Li

机构 * Renmin University of China(中国人民大学) Tsinghua University(清华大学) Zhejiang University(浙江大学) Lightstandard

专题命中 其他LLM :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 针对MoE模型中遗忘数据与保留数据路由不匹配导致遗忘关键专家正则化不足的问题,提出TRACE方法,通过离线激活统计检测遗忘关键专家并重新加权保留损失以校准保留侧激活频率,实验表明在WMDP和MUSE-BOOKS上遗忘-效用权衡提升9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09892 2026-06-10 cs.LG stat.ME 新提交 81%

LMT: A Bayesian Framework for Causal Discovery from Textual Alarm Records in Manufacturing Systems

LMT: 制造系统中文本告警记录的因果发现贝叶斯框架

Xiaofeng Xiao, Jianhong Chen, Qiuzhuang Sun, Naichen Shi, Xubo Yue

机构 * Department of Mechanical & Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系) College of Integrative Studies, Singapore Management University, Singapore(新加坡国立大学整合研究学院) Department of Industrial Engineering and Management Sciences, Department of Mechanical Engineering, Northwestern University, IL, USA(西北大学工业工程与管理科学系、机械工程系)

专题命中 其他LLM :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出LMT框架,结合大语言模型提取的语义信号和基于泊松过程的时间证据,通过贝叶斯方法从文本告警记录中发现因果图,在小样本场景下表现优异。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏