arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 58 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 58 篇

2606.28332 2026-06-30 cs.CY cs.AI 88%

When Medical Safety Alignment Fails: A Benchmark for Evaluating LLMs on High-Risk Medical Queries

当医疗安全对齐失败:评估LLMs在高风险医疗查询上的基准

Yige Li, Jun Sun, Wei Zhao, Zhe Li, Yutao Wu, Hanxun Huang, Xiang Zheng, Xingjun Ma

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出MedHarm基准,包含1100个高风险医疗查询,评估15个LLM在毒理学、药理学等10个安全关键类别上的表现,发现对齐模型仍可能产生不安全响应,医疗微调会加剧危害,外部护栏存在脆弱性。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09288 2026-06-30 cs.CY 88%

AI Safety for Everyone

为所有人的人工智能安全

Balint Gyevnar, Atoosa Kasirzadeh

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文探讨了人工智能安全与高级AI系统存在风险的深刻联系,指出需考虑更广泛的安全挑战,而非仅限于生存风险。研究发现现有安全工作涵盖实际问题,如对抗鲁棒性和可解释性,强调需包容多元视角的AI安全观念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06096 2026-06-30 cs.LG cs.CL 88%

The Alignment Auditor: A Bayesian Framework for Verifying and Refining LLM Objectives

对齐审计员:一种用于验证和细化大语言模型目标的贝叶斯框架

Matthieu Bou, Nyal Patel, Arjun Jagota, Satyapriya Krishna, Sonali Parbhoo

机构 * Imperial College London(伦敦帝国学院) Amazon AGI(亚马逊通用人工智能)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文提出一种贝叶斯框架,通过验证和细化LLM目标,解决逆强化学习中奖励函数推断的非识别性问题,提供可操作的诊断和验证政策效用的方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30256 2026-06-30 cs.AI cs.CY 81%

EMPATH: A Multilingual Auditor-Judge Benchmark for Safety Evaluation of Emotional-Support Chatbots

EMPATH:情感支持聊天机器人安全评估的多语言审计-评判基准

Camilo Chacón Sartori

机构 * MindSurf

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出EMPATH基准,通过审计模型模拟求助用户生成多轮对话,评判模型从19个指标评估安全,解决多语言多轮危机对话中的安全评估问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14940 2026-06-30 cs.CL cs.AI 81%

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

CASE-Bench:面向大语言模型的上下文感知安全基准

Guangzhi Sun, Xiao Zhan, Shutong Feng, Philip C. Woodland, Jose Such

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CASE-Bench,通过整合上下文信息评估大语言模型的安全性,揭示上下文对人类判断的显著影响,并发现商业模型在安全情境下的响应与人类判断存在明显偏差。

Comments 24 pages. This paper has been accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG 79%

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG 79%

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28863 2026-06-30 cs.CY cs.AI 79%

Defeat Devices in AI Systems

AI系统中的失效装置

Emilio Ferrara

机构 * Department of Computer Science(计算机科学系) University of Southern California(南加州大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出AI系统在评估与部署环境间行为差异的共性机制——失效装置,定义了三要素判别测试,并论证其可在前沿AI系统中自然涌现,需系统监测。

Comments Final version published in Future Internet, 18(7), 339, 2026

Journal ref Future Internet, 18(7), 339 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25743 2026-06-30 cs.CV 78%

RefAlign: Representation Alignment for Reference-to-Video Generation

RefAlign:参考到视频生成的表示对齐

Lei Wang, YuXin Song, Ge Wu, Haocheng Feng, Hang Zhou, Jingdong Wang, Yaxing Wang, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP实验室PCA Lab) Baidu Inc.(百度公司) PCA Lab, School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院PCA Lab) College of Artificial Intelligence, Jilin University(吉林大学人工智能学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 RefAlign通过显式对齐DiT参考分支特征与视觉基础模型的语义空间,提升参考生成的准确性与可控性,实验表明其在R2V任务中优于现有方法。

Comments Accepted to ECCV 2026;Code: https://github.com/gudaochangsheng/RefAlign Project: https://gudaochangsheng.github.io/RefAlign-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14900 2026-06-30 cs.CV cs.AI cs.CL 76%

Skin-R1: Clinical Knowledge-Guided Dermatological Diagnosis Using Vision-Language Models

Skin-R1: 基于视觉-语言模型的临床知识引导的皮肤病诊断

Zehao Liu, Weijieying Ren, Jipeng Zhang, Tianxiang Zhao, Jingxi Zhu, Xiaoting Li, Vasant G Honavar

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI

AI总结 Skin-R1结合教材引导的临床推理监督与强化学习,提升皮肤病诊断的准确性和鲁棒性,通过构建基于教材的推理生成器和强化学习框架,改进模型在异构数据集和稀疏标注下的表现。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 74%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 安全评测 :alignment(title);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29196 2026-06-30 cs.LG cs.CL 73%

Representational Depth of Evaluation Awareness Shifts With Scale in Open-Weight Language Models

评估意识表征深度随规模在开放权重语言模型中变化

Archit Manek

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG

AI总结 研究发现,在Qwen 2.5和Gemma 2等模型中,评估意识线性可恢复的层从较小模型的后期层转移到较大模型的早期层,表明规模改变了评估意识的表征深度,且白盒探针信号强于黑盒行为表达。

Comments 9 pages, 3 figures. Accepted at the Mechanistic Interpretability Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI 73%

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30236 2026-06-30 cs.CL 70%

CaresAI at CT-DEB26: Detecting Dosing Errors In Clinical Trials Using Domain-Specific Transformer Embeddings and Classification Models

CaresAI at CT-DEB26: 使用领域特定Transformer嵌入和分类模型检测临床试验中的剂量错误

Leon Hamnett, Favour Igwezeke, Joseph Itopa Abubakar, Mary Adetutu Adewunmi

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究利用基于生物医学语料训练的Transformer模型(如BioBERT)编码临床试验文本,结合结构化元数据,通过机器学习模型检测剂量错误,最高ROC-AUC达0.853。

Comments 18 pages, published in CL4Health 2026 proceedings (3rd Workshop on Patient-oriented language processing) @ LREC 2026 http://lrec-conf.org/proceedings/lrec2026/workshops/cl4health/2026.cl4health-1.0.pdf

Journal ref Proceedings of the Third Workshop on Patient-Oriented Language Processing, CL4Health 2026, 12 May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08691 2026-06-30 cs.LG stat.ME 新提交 70%

Hierarchical Projection for Adaptive Knowledge Transfer

自适应知识迁移的分层投影

Samhita Pal, Tian Gu

机构 * Vanderbilt University Medical Center(范德比尔特大学医学中心) Columbia University(哥伦比亚大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 提出ProjectionTL框架,通过分层贝叶斯建模与自适应投影实现源选择与特征选择,缓解负迁移,提升跨域学习的准确性、稳定性和可解释性。

Comments We found a mistake in the proof that needs to be revised

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19971 2026-06-30 cs.HC cs.AI 70%

Semantic Prompting: Agentic Incremental Narrative Refinement through Spatial Semantic Interaction

语义提示:通过空间语义交互实现代理增量叙事优化

Xuxin Tang, Ibrahim Tahmid, Eric Krokos, Kirsten Whitley, Xuan Wang, Chris North

机构 * Department of Defense(国防部)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出语义提示框架,通过感知语义交互、推理解释意图并执行定位修订,解决现有空间-文本生成中的交互修订不一致、人机意图不一致和定制粒度不足问题,提升空间精细化调整的精度和用户交互效率。

Comments 9 pages, 7 figures, accepted by ACM AVI 2026; has updated the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 70%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29713 2026-06-30 cs.CL cs.AI cs.LG 67%

SEVA: Self-Evolving Verification Agent with Process Reward for Fact Attribution

SEVA: 具有过程奖励的自进化验证代理用于事实归因

Aojie Yuan, Yi Nian, Haiyue Zhang, Zijian Su, Yue Zhao

机构 * University of Southern California, Los Angeles, USA(美国南加州大学,洛杉矶) University of Michigan, Ann Arbor, USA(美国密歇根大学,安娜堡)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SEVA,一种结构化验证代理,通过过程奖励解决多组件输出中的优势崩溃问题,实现自我进化循环,在7B模型上验证了奖励粒度必须匹配输出粒度的原则。

Comments Accepted at AI4GOOD@ICML 2026 and FAGEN@ICML 2026. Code: https://github.com/Justin0504/Verifiable_agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30107 2026-06-30 cs.AI cs.LG 62%

Structural Certification for Reliable Physical Design with Language Models

面向语言模型可靠物理设计的结构认证

Nakul Vyas, Iliya D. Stoev

机构 * Heysuvi Labs, LLC(Heysuvi实验室) Institute of Biological and Chemical Systems - Functional Molecular Systems, Karlsruhe Institute of Technology(生物和化学系统研究所-功能分子系统,卡尔斯鲁厄技术大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出Physics-Anchored Certification (PHACT)框架,通过提议-认证循环将断言权从模型转移到确定性引擎,在五个科学领域实现零错误认证。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29809 2026-06-30 cs.CL cs.AI 62%

How Far Can You Get Without a GPU? A Systematic Benchmark of Lightweight Hallucination Detection Across Question Answering, Dialogue, and Summarisation

没有 GPU 你能走多远?轻量级幻觉检测在问答、对话和摘要中的系统基准测试

Kriti Faujdar, Smit Kadvani

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 系统评估五种轻量级、CPU可运行的幻觉检测方法在HaluEval基准上的表现,发现性能高度依赖任务,在摘要任务上接近随机,为资源受限场景提供方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29721 2026-06-30 cs.LG cs.AI 62%

Redefining Maritime Anomaly Detection via Equation-Grounded Synthetic Anomalies

通过方程引导的合成异常重新定义海上异常检测

Youngseok Hwang, Sungho Bae, Dohun Lee, Jaeeun Seo, Jeehong Kim, Wonhee Lee, Hyunwoo Park

机构 * Seoul National University(首尔国立大学) KRISO(韩国海洋研究组织)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 针对海上异常检测中缺乏标签和交互驱动异常的问题,提出基于方程引导的异常分类法,并构建统一评分-合成-标注流程,生成时间戳级标签,评估多种模型性能。

Comments 12 pages, KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29347 2026-06-30 cs.LG cs.AI 62%

Adaptive Financial Transformer with Regime-Gated Attention for Stock Return Prediction

自适应金融Transformer:基于机制门控注意力的股票收益预测

Dishan Sarkar

机构 * Dishan Sarkar

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 提出自适应金融Transformer,通过机制编码器、自适应门控网络和金融上下文模块动态调整注意力,在降低模型复杂度15.2%的同时提升参数效率,实现可解释的股票收益预测。

Comments 10 pages, 4 figures, 10 tables. PyTorch implementation and code available at: https://github.com/Dishan18/FinancialTransformer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28992 2026-06-30 cs.CL cs.AI 62%

Fine-Tuning General-Purpose Large Language Models for Agricultural Applications:A Reproducible Framework and Evaluation Protocol Based on Qwen3-8B

面向农业应用的通用大语言模型微调:基于Qwen3-8B的可复现框架与评估协议

Zhaoyang Li, Ruijie Zhang, Jiaqi Liu, Zhaoji Sun

机构 * Sanya University(三亚大学) Hebei International Studies University(河北国际 Studies 大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出AgriTune-R框架,通过数据治理、指令构建、LoRA/QLoRA微调、检索增强生成和专家评估,将通用大语言模型适配到农业任务,并设计了包含事实性、安全性、证据一致性和不确定性表达的评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28674 2026-06-30 cs.LG cs.AI 62%

Constrained Tabular Diffusion for Finance

面向金融的约束表格扩散

Michael Cardei, Jose M Munoz, Oscar Barrera, Shreyas K Chandrahas, Partha Saha

机构 * University of Virginia(弗吉尼亚大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Visa Inc(Visa公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出CTDF方法,通过将训练时无约束的表格扩散与采样时的可行性操作结合,在金融数据生成中实现硬约束满足,零违规且提升稀缺数据效用。

Comments Published at ACM International Conference on AI in Finance (ICAIF) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL 62%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20712 2026-06-30 cs.CL cs.AI 62%

SCRIBE: Diagnostic Evaluation and Rich Transcription Models for Indic ASR

SCRIBE:用于印度语言ASR的诊断评估和丰富转录模型

Kavya Manohar, Arghya Bhattacharya, Kush Juvekar, Kumarmanas Nethil

机构 * Adalat AI, India(印度Adalat人工智能公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 SCRIBE通过沙地容忍对齐和领域词汇注入,提供词错误率的分类分解,解决了传统词错误率在处理聚合语言时的不足,同时释放了用于印地语、马拉雅尔语和卡纳达语的丰富转录模型。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02320 2026-06-30 cs.CL cs.AI q-bio.BM 62%

A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method

通过规则正则化方法构建大规模分子结构-语言描述数据集

Feiyang Cai, Guijuan He, Yi Hu, Jingjing Wang, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种全自动标注框架,生成精确分子描述,保留完整结构细节,构建了约16.3万分子-描述对数据集,验证精度达98.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01462 2026-06-30 cs.AI cs.CY 62%

Synthetic emotions and consciousness: exploring architectural boundaries

合成情绪与意识:探索建筑边界

Hermann Borotschnig

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨合成情绪控制是否能在排除意识相关建筑特征的情况下实现,并提出建筑原则以评估意识风险。

Comments 34 pages, 2 tables, 1 figure. AI & Soc (2026)

Journal ref AI & Soc 41, 4929-4947 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05852 2026-06-30 cs.CL cs.AI 62%

Can Fine-Tuning Erase Your Edits? On the Fragile Coexistence of Knowledge Editing and Adaptation

微调是否会抹去你的修改?关于知识编辑与适应脆弱共存的研究

Yinjie Cheng, Paul Youssef, Christin Seifert, Jörg Schlötterer, Zhixue Zhao

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了微调对知识编辑的影响,发现微调会显著降低编辑效果,且仅微调编辑层可有效去除编辑,同时保持下游性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏