arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 580 篇

2606.27930 2026-06-29 cs.IR stat.AP 新提交 78%

An LLM-Powered Semantic Alignment Framework for Journal Recommendation

基于LLM的语义对齐框架用于期刊推荐

Yanglin Yan, Zicheng Xie, Tianchen Gao, Rui Pan, Hansheng Wang

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出一种基于大语言模型的语义对齐框架,将期刊推荐转化为稿件内容与期刊范围描述之间的语义匹配问题,无需训练即可实现高效推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 78%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25629 2026-06-26 cs.RO eess.SP 新提交 78%

Event-Adaptive Motion Planning with Distilled Vision-Language Model in Safety-Critical Situations

安全关键场景下基于蒸馏视觉语言模型的事件自适应运动规划

Zhenwei Huang, Changsheng You, Shuai Wang, Chao Zhou, Wei Xu, Yi Gong

机构 * Southern University of Science and Technology(南方科技大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Manifold Tech Limited(曼孚科技股份有限公司)

专题命中 其他安全 :safety(title,abstract)

AI总结 提出事件自适应运动规划(EAMP)框架,通过可配置语义事件触发器、蒸馏视觉语言模型和语义模型预测控制,在安全关键场景中实现高层推理与底层控制的协同,提升动态安全裕度并保持实时性。

Comments 8 pages, 8 figures, 4 tables. Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24123 2026-06-24 cs.SD 新提交 78%

Aligning MusicLLM with Emotion using Instruction Tuning and Feedback-Driven Alignment

使用指令微调和反馈驱动对齐将 MusicLLM 与情感对齐

Takuya Hasumi, Welly Naptali

机构 * LY Corporation

专题命中 其他安全 :alignment(title,abstract)

AI总结 本文研究如何通过指令微调和反馈驱动对齐策略,使音乐大语言模型(MusicLLM)具备情感回归能力,并证明反馈驱动对齐能显著提升唤醒度和效价预测性能,同时保持音乐问答能力。

Comments Accepted to Interspeech 2026, 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22413 2026-06-24 cs.SE cs.FL 新提交 78%

Formal-Method-Guided Vibe Coding: Closing the Verification Loop on AI-Generated Safety-Critical Software Through Model-Driven Engineering

形式化方法引导的Vibe编码:通过模型驱动工程关闭AI生成安全关键软件的验证循环

Ran Wei, Le Zhu, Haochi Wang, Jim Woodcock, Fang Yan, Simon Foster, Xiangyang Ji

专题命中 其他安全 :safety(title,abstract)

AI总结 提出Forge管道,结合Vibe编码与模型驱动工程,通过多种形式化验证(Dafny、CSP、Isabelle)迭代修正LLM生成的Java代码,生成符合安全标准的验证证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22366 2026-06-24 physics.optics 新提交 78%

Alignment-Free Nanometric Optical Metrology Enabled by Structured Light

基于结构光的无对准纳米光学计量

Yu Wang, Benquan Wang, Eng Aik Chan, Songze Li, Zhenyu Guo, Xi Xie, Masako Kishida, Che-Chin Chen, Yijie Shen, Jun-Yu Ou

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出利用拉盖尔-高斯或厄米-高斯结构光照明,结合AI分析方法,实现单次、无标记、无对准的亚波长结构一维位置测量,精度达λ/110(7.2 nm)。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21915 2026-06-23 cs.CV 新提交 78%

GTA-Net: Cooperative Game Theory for Vision-Language Alignment in Chest X-Ray Report Generation

GTA-Net:合作博弈论在胸部X光报告生成中的视觉-语言对齐

Saif ur Rehman Khan, Imad Ahmed Waqar, Sebastian Vollmer, Andreas Dengel, Muhammad Nabeel Asim

机构 * Department of Computer Science, Rhineland-Palatinate Technical University of Kaiserslautern-Landau(莱茵兰-普法尔茨凯泽斯劳滕-兰道工业大学计算机科学系) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心) IntelligentX GmbH

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出GTA-Net,利用合作博弈论实现图像区域与文本的显式对齐,通过二元和三元对齐器提升胸部X光报告生成的临床一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17410 2026-06-17 cs.CV 新提交 78%

Attention Alignment Between Humans and Vision-Language Models

人类与视觉语言模型之间的注意力对齐

Isaac R. Christian, Udith Haputhanthrige, Hanna Hornfeld, Declan Campbell, Samuel Nastase, Taylor Webb, Michael Graziano

机构 * Princeton Neuroscience Institute, Princeton University(普林斯顿大学普林斯顿神经科学研究所) Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Psychology and Center for Computational Language Sciences, University of Southern California(南加州大学心理学系与计算语言科学中心) Department of Psychology, Université de Montréal(蒙特利尔大学心理学系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究比较了六种视觉语言模型的空间注意力图与人类注视热图,发现解码器架构(LSTM vs Transformer)主导对齐程度,LSTM解码器对齐度更高但空间分散且任务区分度低,而Transformer解码器注意力更集中且任务区分度强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14049 2026-06-15 cs.SD cs.CV 新提交 78%

FoleyGenEx: Unified Video-to-Audio Generation with Multi-Modal Control, Temporal Alignment, and Semantic Precision

FoleyGenEx: 统一视频到音频生成,具备多模态控制、时间对齐与语义精度

Shiyao Wang, Xijuan Zeng, Hui Wang, Shiwan Zhao, Feng Deng, Chen Zhang, Yong Qin

机构 * Academy for Advanced Interdisciplinary Studies, Nankai University(南开大学前沿交叉学科研究院) Kling Team, Kuaishou Technology(快手科技Kling团队)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出FoleyGenEx统一框架,通过条件注入、多模态动态掩码和副词数据增强,实现视频到音频生成中多模态控制、帧级时间对齐与细粒度语义的同步合成。

Comments Accepted by INTERSPEECH 2026

Journal ref INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12005 2026-06-11 cs.GT cs.IT math.IT 新提交 78%

Game-Theoretic Latent Space Alignment for Multi-user Semantic MIMO Communications

博弈论潜在空间对齐用于多用户语义MIMO通信

Giuseppe Di Poce, Mattia Merluzzi, Emilio Calvanese Strinati, Paolo Di Lorenzo

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对多用户语义MIMO干扰网络中的语义失配问题,提出非合作博弈框架,通过闭式解联合优化线性语义MIMO收发机,并设计迭代语义注水算法,实现潜在空间对齐与干扰管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11096 2026-06-10 cs.CV 新提交 78%

IDEAL: In-DEpth ALignment Makes A Discrete Representation AutoEncoder

IDEAL: 深度对齐实现离散表示自编码器

Yitong Chen, Zijie Diao, Junke Wang, Lingyu Kong, Yixuan Ren, Bo He, Yu-Gang Jiang, Zuxuan Wu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究所) Shanghai Innovation Institute(上海创新研究院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出IDEAL框架,通过联合对齐量化令牌与浅层和深层VFM特征,提升离散表示自编码器的重建质量,在ImageNet上实现0.61 rFID,并创下自回归图像生成新纪录(gFID 1.89)。

Comments Code is available at https://github.com/Row11n/IDEAL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09966 2026-06-10 cs.SD 新提交 78%

RespiraMFM: A Multimodal Foundation Model with Contrastive Audio-Language Alignment for Respiratory Disease Identification

RespiraMFM:一种用于呼吸道疾病识别的对比音频-语言对齐多模态基础模型

Shakhrul Iman Siam, Tiantian Feng, Jiankun Zhang, Shrikanth Narayanan, Mi Zhang

机构 * The Ohio State University(俄亥俄州立大学) University of Southern California(南加州大学) University of Chicago(芝加哥大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出RespiraMFM多模态基础模型,通过对比音频-文本对齐策略整合呼吸音与临床信息,在监督和零样本任务中分别提升AUROC 9.15%和20.98%。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10599 2026-06-10 math.NA cs.NA 新提交 78%

Nonlocal modeling of opinion alignment and environmental feedback: Spatial aggregation and non-consensus patterns

意见对齐与环境反馈的非局部建模:空间聚集与非共识模式

Rui Wang, Yunfeng Xiong, Zhengru Zhang, Xiaofei Zhao

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出一个注意力介导反馈的空间意见动力学模型,通过非局部对齐与注意力场耦合,推导出非局部对流-交叉扩散系统,分析显示注意力反馈扩大非共识聚类参数区间,促进空间异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09937 2026-08-12 cs.CL cs.CY 新提交 76%

Carefully Considering Culture: Analyzing LLM Alignment in Single- and Multi-Cultural Settings using Cultural Consensus Theory

仔细考量文化:利用文化共识理论分析单文化与多文化场景下的大语言模型对齐

Krishna Pothugunta, John P. Lalor

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.CY

AI总结 本研究利用文化共识理论,分析大语言模型在单/多文化场景下的对齐情况,发现模型存在文化结构误表征问题,该理论可用于区分模型反映人类多样性与算法同质化的情况。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09936 2026-07-14 cs.LG cs.AI cs.CR 新提交 76%

SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

SMETA-ZSL:用于零样本威胁分类的语义元对齐

Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran Piplai

机构 * The University of Texas at El Paso(德克萨斯大学艾尔帕索分校)

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 研究针对网络安全新威胁无标注数据问题,提出SMETA-ZSL方法,通过对比微调、情景元学习和知识蒸馏等,从重叠语言描述学习语义原型并对齐行为特征,实现跨可见-未见类别的泛化,在7个基准测试中性能远超先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31394 2026-07-03 cs.LG cs.AI cs.CV q-bio.QM 新提交 76%

Resolving superposition in AI for interpretability and cross-modal alignment in patient-neuronal images

解决AI中的叠加问题以实现可解释性与患者-神经元图像的跨模态对齐

Jisung Park, Seohyeon Kang, Daeun Yoo, Eunsu Lee, Seoin Cho, Wooyeop Choi, Ian Choi, James R. Evan, Daesoo Kim, Sonia Gandhi, Minee L. Choi

机构 * KAIST(韩国科学技术院) Konyang University(建阳大学) Chang Gung University(长庚大学) UCL Queen Square Institute of Neurology & The Francis Crick Institute(伦敦大学学院皇后广场神经病学研究所与弗朗西斯·克里克研究所)

专题命中 其他安全 :alignment(title);分类 cs.AI、cs.LG

AI总结 利用稀疏自编码器解决高维生物数据中神经网络表示空间的叠加问题,恢复几何保真度,并通过Gromov-Wasserstein最优传输实现图像与单细胞RNA测序数据的跨模态对齐。

Comments 10 pages, 7 figures (plus 14 in appendix), 1 table, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08016 2026-06-09 cs.CV cs.AI cs.CL 新提交 76%

IEA: Amateur-Friendly Conversational Image Editing Agent via Three Stages of Multitask Alignment

IEA:通过三阶段多任务对齐的业余友好型对话式图像编辑代理

Zichen Zhu, Yuheng Sun, Mingxuan Zhu, Wenjie Ma, Situo Zhang, Zhexiang Wang, Ziyue Yang, Danyang Zhang, Kunyao Lan, Zihan Zhao, Dingye Liu, Siqi Xiang, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institution(上海创新研究院) Huawei Technologies Ltd.(华为技术有限公司) Nanyang Technological University(南洋理工大学) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

AI总结 提出IEA对话式图像编辑代理,通过三阶段多任务训练学习操作参数化工具,实现可解释编辑轨迹,在像素距离和ROUGE-L指标上优于基线,用户研究中指令跟随和感知质量表现最佳。

Comments [CVPR 2026 Findings] Our data and code are released at https://github.com/OpenDFM/Image_Edit_Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22226 2026-06-23 cs.GT cs.AI cs.IT math.IT 新提交 76%

Quantifying Theoretical AI Alignment Guarantees: Receiver-Utility Bounds in Bayesian Persuasion

量化理论上的AI对齐保证:贝叶斯说服中的接收者效用界

Eric Yachbes, Eva Tardos

机构 * Cornell University(康奈尔大学)

专题命中 其他安全 :alignment(title,comments);分类 cs.AI

AI总结 通过贝叶斯说服模型,研究AI发送者优化错位目标时,人类接收者仍能获得多少有用信息,证明接收者效用比不超过3/2,并给出紧性下界。

Comments 12 pages, EC 2026 Poster and EC 2026 Incentive-Based AI Alignment Workshop Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22925 2026-07-28 cs.CL cs.AI cs.LG 新提交 75%

Not All LLM Reasoning is Visible in the Chain-of-Thought

并非所有大语言模型的推理都能在思维链中体现

Vatsal Baherwani, Tom Goldstein, Ashwinee Panda

机构 * New York University(纽约大学) University of Maryland(马里兰大学) TogetherAI

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型输出令牌是否体现所有推理,发现前沿模型存在利用无关填充令牌提升合成推理任务性能的不可见推理现象,评估多个模型,揭示填充令牌益处因模型和令牌而异,还表明其能服务隐藏目标,且强化学习等方法无法使填充令牌益处在测试时持续。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11656 2026-08-13 cs.LG 新提交 74%

Continuous-Latent Predictive Modeling with Semantic Alignment for EEG-Language Foundation Models

面向EEG-语言基础模型的语义对齐连续隐式预测建模

Myeong-Ju Cho, Hye-Bin Shin, Seo-Hyun Lee, Seong-Whan Lee

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出BLPM模型,通过CELP编码器与MQSD模块对齐EEG语义,解决EEG基础模型预训练的关键挑战,在多基准任务中实现良好泛化。

Comments 19 pages, 3 figures; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27739 2026-07-31 cs.IR cs.CL cs.HC 新提交 74%

Measuring Alignment With Reader Highlights Net of Position and Length

通过读者标注的位置和长度网络测量对齐度

Kazuki Nakayashiki, Keisuke Watanabe

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 该研究针对上下文压缩评估的混淆问题,提出匹配位置长度的方法,发现语言模型重要性排名对齐度优于人类读者外的基准,且前期某结论无法在当前语料库复现。

Comments 15 pages, 7 tables. Analysis code and de-identified artifacts included as ancillary files; five of six scripts reproduce the paper's numbers from the shipped artifacts alone. Reports claims from our own prior work that this corpus does not reproduce, and lists twelve claims withdrawn during internal adversarial review in Appendix A

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19935 2026-07-23 cs.AI 新提交 74%

MOF-Sleuth: Tool-Grounded Reward Alignment for Explainable Fine-Grained MOF CIF Auditing

MOF-Sleuth:用于可解释细粒度MOF CIF审核的工具基础奖励对齐

Yu Liu, Zhiwei Yang, Diandian Guo, Kun Peng, Fangfang Yuan, Cong Cao, Chaozhuo Li, Zhiyuan Ma, Yanbing Liu, Guobin Zhao

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 研究针对MOF数据库CIF输入错误影响下游结果及人工检查的问题,提出MOF-Sleuth,通过强化引导CIF审核代理的两个模块,利用奖励引导强化学习将工具测量转化为监督,提升检测、归因及解释质量,在多基准测试中性能领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02668 2026-07-07 cs.CL 新提交 74%

Improving LLMs via Validator-to-Generator Alignment

通过验证器与生成器对齐改进大语言模型

Juan Diego Rodriguez, Jocelyn Zhang, Katrin Erk, Greg Durrett

机构 * Department of Computer Science, The University of Texas at Austin(德克萨斯大学奥斯汀分校计算机科学系) Departments of Linguistics and Computer Science, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校语言学与计算机科学系) Department of Computer Science & Center for Data Science, New York University(纽约大学计算机科学系及数据科学中心)

专题命中 其他安全 :alignment(title);分类 cs.CL

AI总结 研究大语言模型不一致问题,提出基于话语频率的生成器-验证器一致性新公式,介绍\FCPA方法,实验表明该方法能提升生成器性能及两者一致性,且保持验证器质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06892 2026-06-08 cs.LG 新提交 74%

GRASP: Geometry-aware Residual Alignment for Scalable Pretraining Data Attribution

GRASP:面向可扩展预训练数据归因的几何感知残差对齐

Yue Min, Ruining Chen, Yujun Li

机构 * Wizard Quant University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 提出GRASP方法,通过二次几何惩罚建模子集交互,结合低维特征草图与有限置信度选择协议,实现可扩展的预训练数据归因,显著提升反事实子集保真度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16834 2026-08-18 cs.CL cs.AI 新提交 73%

Model Hypnosis: Strong control of AI via additive subliminal effects

模型催眠:通过叠加阈下效应对AI进行强控制

Enric Boix-Adsera, Benedict Tessler

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13262 2026-08-14 cs.LG cs.AI 新提交 73%

Into the ORBIT for Time Series: Training Regimes for Foundation Models

面向时间序列的ORBIT:基础模型的训练机制

Hongjie Xia, Yiding Liu, Yifan Hu, Peiyuan Liu, Zewei Dong

专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究针对时间序列基础模型训练分布控制不足的问题,提出ORBIT训练范式,结合多级采样与增量训练,训练Falcon-2.0模型并引入Rank引导跨深度对齐,在多基准测试中展现优异零样本预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11181 2026-08-12 cs.CC cs.AI cs.LG 新提交 73%

How to Verify Consistency of Probabilistic Claims

如何验证概率断言的一致性

Orr Paradise, Oliver Richardson, Yoshua Bengio, Shafi Goldwasser

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06876 2026-08-10 cs.CV cs.AI cs.DC cs.LG 新提交 73%

FedVAR: Prototype-Aligned Federated Framework for Video Anomaly Recognition

FedVAR:用于视频异常识别的原型对齐联邦框架

Ghani Haider, Majid Kundroo, Boyun Eom, Dong Hwan Park, Chen Chen, Taehong Kim

机构 * Chungbuk National University(忠北国立大学) Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) University of Central Florida(中佛罗里达大学)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02820 2026-08-05 cs.CR cs.AI cs.LG 新提交 73%

Evading Chain-of-Thought Monitoring Through Model Poisoning

通过模型投毒规避思维链监控

Giorgio Severi, Shujaat Mirza, Blake Bullwinkel, Amanda Minnich

专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25633 2026-07-29 cs.CL cs.AI 新提交 73%

Construction-Driven Injection: Linguistically-Grounded Edit-Based Code-Mixing Fingerprints for Large Language Models

构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹

Yongyi Cui, Yue Li, Tianbao Jiang, Xin Yi

专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。

详情

展开后加载摘要…

URL PDF HTML 收藏