arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-13 至 2026-08-13 共收录 77 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 77 篇

2608.11493 2026-08-13 cs.AI cs.LG 新提交 92%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 92%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11623 2026-08-13 cs.LG cs.AI cs.NI eess.SP 新提交 92%

FM-LLM: A frequency-enhanced mixture-of-experts framework for adapting LLMs to time series forecasting

FM-LLM:一种用于适配大语言模型(LLMs)进行时间序列预测的频率增强型混合专家框架

Rentao Gu, Yihang Ding, Junjie Li, Yi Ding, Weijing Sang, Xiaoli Huo, Xin Qin, Yuefeng Ji

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) China Telecom Research Institute(中国电信研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出FM-LLM框架,通过频谱标记对齐器与非对称MoE解码器等设计,在11个基准的多数指标上优于现有LLM基线,且具备良好迁移性。

Journal ref R. Gu, Y. Ding, J. Li, Y. Ding, W. Sang, X. Huo, X. Qin, and Y. Ji, Knowl.-Based Syst., vol.341, p.115776, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 92%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11705 2026-08-13 cs.AI 新提交 92%

Making Your LLMs More Objective: Stabilizing LLM Safety Behavior Across Traits with Trait-Invariant Safety Tuning

提升大语言模型的客观性:通过特质不变安全微调稳定LLM在不同特质下的安全行为

Lang Cao

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM因系统提示词中特质不同导致同一请求安全决策不一致的问题,提出特质不变安全微调(TIST)框架及TraSN方法,提升跨特质安全稳定性且保留通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11650 2026-08-13 cs.CL 版本更新 92%

Investigating Learner-Aware Design of LLM-Generated Educational Feedback

哪种反馈适用于谁?LLM生成反馈元素在学习者特征中的差异效应

Momoka Furuhashi, Kouta Nakayama, Noboru Kawai, Takashi Kodama, Saku Sugawara, Kyosuke Takami

机构 * Tohoku University(东北大学) NII LLMC(日本信息处理学会LLMC研究中心) NII(日本信息处理学会) University of Tokyo(东京大学) Osaka Kyoiku University(大阪教养大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探讨了不同人格特征学习者对LLM生成反馈元素的接受差异,发现有效反馈元素有共同支持学习成果的模式,学习者主观偏好在人格集群中存在差异。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11965 2026-08-13 cs.SE 新提交 91%

Developing LLM-based Multi-Agent Systems in Software Engineering: A Mixed-Method Experience Report

在软件工程中开发基于大语言模型(LLM)的多智能体系统:一项混合方法经验报告

Mariama Celi Serafim De Oliveira, Motunrayo Osatohanmen Ibiyo, Marco Gianrusso, Claudio Di Sipio, Davide Di Ruscio, Phuong T. Nguyen

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文通过定量和定性分析,梳理软件工程中基于LLM的MAS现有框架,发现其基本组件覆盖良好但缺高级功能,摘要任务ROUGE分数无显著差异,为相关人员选框架提供指导。

Comments The paper has been peer reviewed and accepted for publication with the Empirical Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29717 2026-08-13 cond-mat.mtrl-sci cs.AI cs.LG 版本更新 91%

Optimizing Expert-Designed Crystal Graph Networks for Band-Gap Prediction with an Autonomous LLM Research Loop

利用自主LLM研究循环优化专家设计的晶体图网络用于带隙预测

Chenmu Zhang, Boris I. Yakobson

机构 * Department of Materials Science and NanoEngineering(材料科学与纳米工程系)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出一个自主LLM研究循环,在MatBench带隙基准上构建了无需外部预训练的最准确模型,超越了所有17个专家设计模型,通过实现元素对特征和空间群嵌入等已知方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11454 2026-08-13 cs.SE 新提交 90%

Simplifying Requirements Engineering in the Context of the LGPD: An LLM-Based Investigation

在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究

Cinara Gomes de Melo Carneiro, Renato de Freitas Bulcão Neto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。

Comments The document consists of 12 pages and includes 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-13 cs.CL cs.IR cs.LG 新提交 90%

LODESTAR: Trustworthy Entropy Is Navigated, Not Merely Measured -- Reinforced Polarizer Keeps a Frozen LLM from Being Confidently Misled by the Wrong Evidence

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Po-Jen Ko, Che-Cheng Wu, Hung-Chun Hsu, Li-Yang Chang, Chuan-Ju Wang

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11434 2026-08-13 cs.AI cs.CL cs.CV 新提交 90%

Benchmarking LLM Judges for Mobile Agent Evaluation

面向移动智能体评估的LLM评判基准测试

Ziqiang Wan, Li Gu, Zhixiang Chi, Zhi Liu, Seyed Mehdi Ayyoubzadeh, Yuanhao Yu, Yang Wang

机构 * Mila – Québec AI Institute(米拉-魁北克人工智能研究所) Concordia University(康考迪亚大学) University of Toronto(多伦多大学) Shanghai University(上海大学) McMaster University(麦克马斯特大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 该研究推出MobileJudgeBench基准,评估6种LLM评判器方法在移动智能体轨迹上的可靠性,发现简单基线评判器具竞争力、基准质量指标可预测评判器效用,且不同LLM后端故障特征相反。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11735 2026-08-13 cs.CL cs.AI cs.LG 新提交 90%

Locating and Controlling Implicit Personalization in Large Language Models

定位并控制大语言模型中的隐式个性化

Yueru Yan, Siqi Wu, Thai Le

机构 * Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对5种大语言模型,发现追踪推荐变化的局部内部激活信号与隐式个性化行为相关,移除对应信号可抑制线索影响且保留基准性能,为控制大语言模型隐式个性化提供了因果控制思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 90%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11679 2026-08-13 cs.AI cs.IR cs.MA 新提交 90%

AgenticTwin: An Agentic LLM Framework Integrated with Digital Twin for Anomaly Detection

AgenticTwin:集成数字孪生的智能体大语言模型异常检测框架

Touseef Hasan, Mounika Ghanta, Souvika Sarkar, Ujjwal Guin

机构 * School of Computing, Wichita State University(威奇托州立大学计算机学院) Auburn University(奥本大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出AgenticTwin框架,整合LLM推理与数字孪生异常检测管道,构建基准评估管道并验证轻量级开源LLM部署可行性,可提升异常诊断、检索及缓解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11008 2026-08-13 cs.CL cs.CY 版本更新 90%

Templated or fully synthetic? Prompt construction as a confound in measuring LLM political stance beyond writing assistance

模板化还是完全合成?提示构造是测量LLM政治立场的混淆因素——超越写作辅助的视角

Ilias Chalkidis

机构 * The National Center for AI in Society (CAISA), University of Copenhagen(哥本哈根大学社会人工智能国家中心(CAISA))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 该研究针对LLM政治立场检测中模板化提示的混淆问题,扩展IssueBench框架,提出用LLM生成的完全合成提示,验证其在立场测量中更具生态效度,可减少估计偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11804 2026-08-13 eess.AS cs.SD 新提交 89%

MiDashengLM-Gen: Unified Audio Scene Generation via LLM-Driven Autoregressive Flow Matching

MiDashengLM-Gen:基于大语言模型驱动的自回归流匹配的统一音频场景生成

Xingwei Sun, Heinrich Dinkel, Gang Li, Jiahao Mei, Yadong Niu, Zerui Han, Yuepeng Jiang, Jiahao Zhou, Lichun Fan, Jian Luan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 MiDashengLM-Gen是首个端到端训练的通用文本到音频生成模型,通过结合LLM与每token条件流匹配,在Seed-TTS等基准上大幅提升语音可懂度,且支持多语言场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 89%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11584 2026-08-13 cs.AI 新提交 89%

EnterpriseRAG: Benchmarking LLM Instruction Adherence and Robustness under Non-Ideal Enterprise Retrieval

EnterpriseRAG:非理想企业检索场景下LLM指令遵循与鲁棒性的基准测试

Huiqi Miao, Xinbao Sun, Bo Wang, Fanyu Meng, Lijun Mei, Na Wu, Di Jin, Chao Deng, Junlan Feng

机构 * Jiutian Research, China Mobile(中国移动九天研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究针对企业RAG部署的可靠性问题,推出含983个样本的EnterpriseRAG基准,评估13个LLM发现其指令遵循崩溃,为生产级RAG提供可复现的评估基础

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 88%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 88%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11583 2026-08-13 cs.AI 新提交 88%

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13452 2026-08-13 cs.CL cs.AI 版本更新 88%

LLM-Powered Automatic Translation and Urgency in Crisis Scenarios

基于大型语言模型的自动翻译与危机场景中的紧急性

Belu Ticona, Antonis Anastasopoulos

机构 * George Mason University(乔治·马歇尔大学) George Mason University – Archimedes AI Research Unit(乔治·马歇尔大学阿基米德人工智能研究单元) Athena RC, Greece(雅典RC,希腊)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在危机场景中翻译的性能,发现其在保持紧急性方面存在显著缺陷,强调了对危机通信技术的特殊评估需求。

Comments Accepted to ISCRAM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10528 2026-08-13 cs.IR cs.LG 版本更新 87%

When Do Anchor-Based Pointwise LLM Rerankers Help? Retriever Quality, Statistical Scope, and Anchor Design

基于锚点的点式大语言模型重排序器何时有用?检索器质量、统计范围与锚点设计

Utshab Kumar Ghosh, Shubham Chatterjee

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.LG

AI总结 该研究以GCCP/PAGC为对象,复现并分析锚点式点式LLM重排序器,发现其增益源于对比打分,适用条件较窄,锚点构建可简化,检索器强度影响其效果。

Comments To be published in the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12004 2026-08-13 cs.SE cs.AI 新提交 86%

RealisticTritonBench: A Benchmark for Triton-Kernel Generation in Real-World AI Frameworks

RealisticTritonBench:面向真实世界AI框架的Triton内核生成基准测试

Jinjun Huang, Zhongzhen Wen, Tongtong Xu, Meng Yan, Xin Xia, Zhongxin Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出RealisticTritonBench基准,解决现有Triton内核生成基准的局限,评估发现领先LLM在真实世界Triton内核生成任务上仍表现不佳。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14267 2026-08-13 cs.AI cond-mat.mtrl-sci 版本更新 86%

DREAMS: Density Functional Theory Based Research Engine for Agentic Materials Simulation

DREAMS:基于密度泛函理论的智能体材料模拟研究引擎

Ziqi Wang, Hongshuo Huang, Hancheng Zhao, Changwen Xu, Shang Zhu, Jan Janssen, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程系,密歇根大学,安阿伯,密歇根州,美国) Max-Planck-Institute for Sustainable Materials, Materials Informatics, Düsseldorf, Germany(可持续材料研究所,材料信息学,杜塞尔多夫,德国) Mechanical Engineering, University of Michigan, Ann Arbor, Michigan, USA(机械工程,密歇根大学,安阿伯,密歇根州,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于DFT的分层多智能体框架DREAMS,通过多层安全防护提升LLM智能体材料模拟的可信度,在Sol27LC基准等任务中表现优异,可平衡可信度与成本,推动自主材料模拟发展。

Comments 47 pages, 44 pages of Supporting Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08417 2026-08-13 cs.CR 版本更新 86%

Attention is All You Need to Defend Against Indirect Prompt Injection Attacks in LLMs

注意力是所有你需要的:用于防御大语言模型中的间接提示注入攻击

Yinan Zhong, Qianhao Miao, Yanjiao Chen, Jiangyi Deng, Yushi Cheng, Wenyuan Xu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出Rennervate框架,通过注意力机制在token级别检测并清除IPI攻击,有效提升LLM的安全性。

Comments Accepted by Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09900 2026-08-13 cs.CL 版本更新 85%

Decoding-Level Taboo: A Diagnostic Stress Test for LLM Robustness

解码层面禁忌:大语言模型鲁棒性的诊断压力测试

Tadanobu Chuyo Kamijo, Ori Rottenstreich, Javier Conde, Gonzalo Martínez, Pedro Reviriego

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出Decoding-Level Taboo这一零提示诊断压力测试,通过干预logit空间迫使大语言模型偏离标称路径,评估发现其鲁棒性与参数规模、指令对齐正相关,该测试还可用于生成合成数据集等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 84%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12150 2026-08-13 cs.AI cs.CL 新提交 84%

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

哪种模型表现最佳取决于你给的时间:大语言模型评估中依赖预算的排名

Rodrigo Guedes de Souza, Alison R. Panisson

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学(UFSC))

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过调整 token 生成预算评估 4 个大语言模型在 3 个推理基准的表现,发现模型排名随预算变化反转,提出需采用预算条件化的评估协议。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11408 2026-08-13 cs.CL 新提交 83%

Measure, Don't Optimize: Forecasting Recovery in LLM Unlearning

测量,而非优化:预测大语言模型遗忘中的恢复情况

Zirui Song, Huaxing Liu, Xiang Wang, Shuai Li, Xinye Li, Lang Gao, Jinghui Zhang, Zheng Lu, Fengxian Ji, Xiaojun Chang, Xiuying Chen

机构 * AMAP, Alibaba Group(阿里巴巴集团 AMAP)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出推理时审计方法J-Access,对398个采用8种遗忘方法的公开模型审计后发现,J-Access可评估模型残留知识恢复易感性,直接最小化J-Access无法促进真正删除,内部审计不应随意转为优化目标。

Comments In processing

详情

展开后加载摘要…

URL PDF HTML 收藏