arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-27 至 2026-03-27 共收录 204 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2603.22459 2026-03-27 cs.CL cs.AI 86%

LLM-guided headline rewriting for clickability enhancement without clickbait

基于大语言模型的引导性标题重写以增强点击率而不产生标题党

Yehudit Aperstein, Linoy Halifa, Sagiv Bar, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿菲卡工程学院智能系统系) School of Computer Science, Faculty of Sciences, HIT-Holon Institute of Technology(霍隆理工学院理学院计算机科学系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种引导性标题重写框架,通过控制生成过程中的语言属性,在保持语义忠实的前提下提升标题吸引力,避免产生误导性内容。

Comments 14 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14861 2026-03-27 q-bio.GN cs.AI q-bio.QM 85%

BMFM-RNA: whole-cell expression decoding improves transcriptomic foundation models

BMFM-RNA:全细胞表达解码改进转录组基础模型

Michael M. Danziger, Bharath Dandala, Viatcheslav Gurev, Matthew Madgwick, Sivan Ravid, Tim Rumbell, Akira Koseki, Tal Kozlovski, Ching-Huei Tsou, Ella Barkan, Tanwi Biswas, Jielin Xu, Yishai Shimoni, Jianying Hu, Michal Rosen-Zvi

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI

AI总结 通过全细胞表达解码方法,改进转录组基础模型,在下游任务中表现优于掩码语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 85%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24804 2026-03-27 cs.CV cs.AI cs.LG 84%

GoldiCLIP: The Goldilocks Approach for Balancing Explicit Supervision for Language-Image Pretraining

GoldiCLIP:平衡显式监督的Goldilocks方法用于语言-图像预训练

Deen Dayal Mohan, Hossein Souri, Vitali Petsiuk, Juhong Min, Gopal Sharma, Luowei Zhou, Suren Kumar

机构 * AI Center – Mountain View, Samsung Electronics(三星电子山景城AI中心)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 GoldiCLIP通过平衡监督信号提出新框架,结合文本条件自蒸馏、编码器解码器与VQA目标及不确定性加权机制,在3000万数据下实现高效预训练,提升多任务检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24826 2026-03-27 cs.CL 83%

Synthetic Rewriting as a Quality Multiplier: Evidence from Portuguese Continued Pretraining

合成重写作为质量乘数:来自葡萄牙持续预训练的证据

Thales Sales Almeida, Rodrigo Nogueira, Hélio Pedrini

机构 * Maritaca AI

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);分类 cs.CL

AI总结 该研究通过控制实验探讨合成重写在葡萄牙持续预训练中对数据质量的影响,发现高质量数据通过重写可提升模型性能,而低质量数据效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23211 2026-03-27 physics.geo-ph 82%

The NCS-Model: A seismic foundation model trained on the Norwegian repository of public data

NCS模型:基于挪威公共数据仓库的地震基础模型

Alba Ordonez, Theodor Johannes Line Forgaard, David Wade, Aina Juell Bugge, Hakon Nese, Anders Ueland Waldeland

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出NCS模型,通过挪威大陆架的公开DISKOS数据库预训练,开发大规模地震基础模型,提供可扩展的3D训练方法,并量化盆地定向预训练和嵌入维度对下游解释性能的影响。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25537 2026-03-27 cs.CL 79%

Humans vs Vision-Language Models: A Unified Measure of Narrative Coherence

人类与视觉-语言模型:叙事连贯性的一种统一衡量方法

Nikolai Ilinykh, Hyewon Jang, Shalom Lappin, Asad Sayeed, Sharid Loáiciga

机构 * University of Gothenburg(哥德堡大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 研究通过比较人类写作与视觉语言模型生成的叙事,评估视觉基础故事中的叙事连贯性,发现模型在连贯性方面与人类存在系统性差异。

Comments 9 pages of content, 1 page of appendices, 9 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.05696 2026-03-27 cs.LG q-bio.QM 79%

SMILES-Mamba: Chemical Mamba Foundation Models for Drug ADMET Prediction

SMILES-Mamba:用于药物ADMET预测的化学Mamba基础模型

Bohao Xu, Yingzhou Lu, Chenhao Li, Ling Yue, Xiao Wang, Tianfan Fu, Minjie Shen, Lulu Chen

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Washington(华盛顿大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.LG

AI总结 SMILES-Mamba通过自监督预训练和微调策略,利用未标记和标记数据预测药物ADMET属性,在22个数据集上表现优异,提升分子属性预测准确性并减少对大规模标注数据的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25186 2026-03-27 cs.LG 77%

Knowledge-Guided Retrieval-Augmented Generation for Zero-Shot Psychiatric Data: Privacy Preserving Synthetic Data Generation

基于知识的检索增强生成用于零样本心理数据:隐私保护的合成数据生成

Adam Jakobsen, Sushant Gautam, Hugo Lewi Hammer, Susanne Olofsdotter, Miriam S Johanson, Pål Halvorsen, Vajira Thambawita

机构 * SimulaMet Oslo Metropolitan University(奥斯陆城市大学) Uppsala University(乌普萨拉大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种零样本知识引导框架,利用检索增强生成技术生成隐私保护的合成心理数据,通过对比CTGAN和TVAE模型,证明临床知识增强LLM在生成高质量、隐私保护的合成数据方面具有优势。

Comments Submitted to CBMS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11770 2026-03-27 cs.CL cs.CY cs.SI 77%

The Value of Nothing: Multimodal Extraction of Human Values Expressed by TikTok Influencers

nothing的价值:通过TikTok影响者表达的人类价值观多模态提取

Alina Starovolsky-Shitrit, Alon Neduva, Naama Appel Doron, Itamar Gafni, Ella Daniel, Oren Tsur

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文研究通过TikTok影响者上传的视频提取隐含价值观,采用两阶段方法优于直接提取,使用少量样本的大语言模型在两个阶段表现更优,首次公开TikTok视频价值观标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24676 2026-03-27 cs.AI cond-mat.dis-nn cond-mat.stat-mech physics.bio-ph physics.soc-ph 77%

When Is Collective Intelligence a Lottery? Multi-Agent Scaling Laws for Memetic Drift in LLMs

集体智慧何时是一场彩票?LLM中膜etic漂移的多智能体缩放定律

Hidenori Tanaka

机构 * CBS–NTT Program in Physics of Intelligence(物理智能中心-NTT项目) Center for Brain Science(脑科学中心) Harvard University(哈佛大学) Physics of Artificial Intelligence Group(人工智能物理研究组) NTT Research, Inc.(NTT研究公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过QSG模型揭示LLM多智能体系统中集体共识的形成机制,发现共识可能由膜etic漂移驱动,提出基于群体规模、通信带宽等因素的缩放定律。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10000 2026-03-27 cs.LG cond-mat.other 70%

Neural Scaling Laws for Deep Regression

深度回归的神经扩展定律

Tilen Cadez, Kyoung-Min Kim

机构 * Asia Pacific Center for Theoretical Physics(亚太理论物理中心) Department of Physics(物理系) Pohang University of Science and Technology(坡山科学技术大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究深度回归模型中神经扩展定律,通过参数估计模型探讨回归性能与训练数据量和模型容量的幂律关系,发现损失与这些因素呈1到2之间的幂律关系。

Comments Supplementary Information will be provided with the published manuscript

Journal ref Machine Learning: Science and Technology, 7 025011 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17490 2026-03-27 cs.LG stat.ML 70%

Revisit, Extend, and Enhance Hessian-Free Influence Functions

重新审视、扩展和增强Hessian-Free影响函数

Ziao Yang, Han Yue, Jian Chen, Hongfu Liu

机构 * Brandeis University(布兰迪大学) Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文重新审视TracIn方法,扩展其应用至公平性和鲁棒性,并通过集成策略增强其性能,通过合成数据和噪声标签检测等实验验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12118 2026-03-27 cs.SE 67%

Do Code LLMs Do Static Analysis?

代码LLM进行静态分析吗?

Chia-Yi Su, Collin McMillan

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract)

AI总结 本文研究代码LLM在代码智能任务中的静态分析能力,发现LLM在静态分析任务中表现不佳,且预训练静态分析任务无法提升代码智能任务性能。

Comments 42 pages, 2 figures, Accepted at Empirical Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25687 2026-03-27 cs.LG 61%

On Neural Scaling Laws for Weather Emulation through Continual Training

关于通过持续训练进行天气仿真的神经扩展定律

Shashank Subramanian, Alexander Kiefer, Arnur Nigmetov, Amir Gholami, Dmitriy Morozov, Michael W. Mahoney

机构 * Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 预训练与数据 :foundation model(abstract,comments);分类 cs.LG

AI总结 本文研究了科学机器学习中神经扩展定律,通过最小化设置的Swin Transformer架构和持续训练策略,展示了模型在预测天气中的性能提升及计算优化。

Comments ICLR Foundation Models for Science Workshop 2026, 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24477 2026-03-27 cs.SE cs.LG 57%

Composer 2 Technical Report

Composer 2 技术报告

Cursor Research, :, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger, Andrew Zhai, Anurag Ajay, Ashvin Nair, Charlie Snell, Chen Lu, Chen Shen, Emily Jia, Federico Cassano, Hanpeng Liu, Haoyu Chen, Henry Wildermuth, Jacob Jackson, Janet Li, Jediah Katz, Jiajun Yao, Joey Hejna, Josh Warner, Julius Vering, Kevin Frans, Lee Danilek, Less Wright, Lujing Cen, Luke Melas-Kyriazi, Michael Truell, Michiel de Jong, Naman Jain, Nate Schmidt, Nathan Wang, Niklas Muennighoff, Oleg Rybkin, Paul Loh, Phillip Kravtsov, Rishabh Yadav, Sahil Shah, Sam Kottler, Alexander M Rush, Shengtong Zhang, Shomil Jain, Sriram Sankar, Stefan Heule, Stuart H. Sul, Sualeh Asif, Victor Rong, Wanqi Zhu, William Lin, Yuchen Wu, Yuri Volkov, Yury Zemlyanskiy, Zack Holbrook, Zhiyuan Zhang

机构 * Cursor Research

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 Composer 2 是一种专为智能软件工程设计的模型,通过两阶段训练提升长期规划和编码能力,其在真实软件问题上的表现优于前代模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04820 2026-03-27 cs.CL cs.CY 57%

Autoscoring Anticlimax: A Meta-analytic Understanding of AI's Short-answer Shortcomings and Wording Weaknesses

自评分的反高潮:对AI在简答短处和用词弱点的元分析理解

Michael Hardy

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文通过元分析研究AI在简答评分中的不足,发现人类评分难度对LLM性能无显著影响,且某些人类易评任务对LLM更难,同时探讨了LLM技术对评分的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.03083 2026-03-27 quant-ph 50%

Dual-VQE: A quantum algorithm to lower bound the ground-state energy

双VQE:一种用于降低基态能量下限的量子算法

Hanna Westerheim, Jingxuan Chen, Zoë Holmes, Ivy Luo, Theshani Nuradha, Dhrumil Patel, Soorya Rethinasamy, Kathie Wang, Mark M. Wilde

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出双VQE算法,通过半正定规划对偶性将基态优化问题转化为受约束最大化问题,并通过变分量子算法求解。该算法能提供基态能量的下限估计,与VQE互补用于验证解的质量。

Comments v3: 15 pages, 8 figures, accepted for publication in Physical Review A

Journal ref Physical Review A, vol. 113, no. 3, page 032443, March 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25038 2026-03-27 cs.RO 50%

$π$, But Make It Fly: Physics-Guided Transfer of VLA Models to Aerial Manipulation

$π$, 但使其飞行:基于物理的VLA模型向空中操作的转移

Johnathan Tucker, Denis Liu, Aiden Swann, Allen Ren, Javier Yu, Jiankai Sun, Brandon Kim, Lachlain McGranahan, Quan Vuong, Mac Schwager

机构 * Stanford University(斯坦福大学) Physical Intelligence

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出AirVLA系统,研究预训练VLA模型在空中抓取任务中的迁移性,通过引入负载感知指导机制和高斯点扩散管道合成数据,提升空中操作性能,实现导航任务100%成功和抓取任务50%成功。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 17 篇

2603.24767 2026-03-27 cs.CL 90%

Fine-Tuning A Large Language Model for Systematic Review Screening

为系统综述筛查微调大型语言模型

Kweku Yamoah, Noah Schroeder, Emmanuel Dorley, Neha Rani, Caleb Schutz

机构 * University of Florida(佛罗里达大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过微调大型语言模型提升系统综述中文献筛选效率,实验显示微调模型在F1分数和与人类评分者的一致性上显著优于基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13734 2026-03-27 cs.CL cs.AI cs.LG 90%

Instruction Following by Principled Boosting Attention of Large Language Models

通过原理性提升大语言模型的注意力来实现指令遵循

Vitoria Guardieiro, Avishree Khare, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02465 2026-03-27 eess.SP 88%

Large Language Models Can Achieve Explainable and Training-Free One-shot HRRP ATR

大语言模型可实现可解释且无需训练的一次性高分辨率距离谱自动目标识别

Lingfeng Chen, Panhe Hu, Zhiliang Pan, Qi Liu, Zhen Liu

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种无需训练且可解释的框架,利用大语言模型将一维HRRP信号转换为文本散射中心表示,通过少样本上下文学习对齐语义空间,实现无需参数更新的ATR。

Comments Submitted to IEEE SPL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22752 2026-03-27 cs.CL cs.AI 85%

Towards Simulating Social Media Users with LLMs: Evaluating the Operational Validity of Conditioned Comment Prediction

向LLMs模拟社交媒体用户迈进:评估条件评论预测的运作有效性

Nils Schwager, Simon Münker, Alistair Plum, Achim Rettinger

机构 * Trier University(特里尔大学) University of Luxembourg(卢森堡大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文通过条件评论预测任务评估LLMs在模拟社交媒体用户行为方面的运作有效性,发现监督微调在低资源环境下会导致表层结构与语义脱节,强调真实行为轨迹优于描述性人设。

Comments 14 pages, 1 figure, 7 tables. Accepted to the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA) at EACL 2026, Rabat, Morocco

Journal ref Proceedings of the 15th Workshop on Computational Approaches to Subjectivity, Sentiment & Social Media Analysis (WASSA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15090 2026-03-27 cs.CL cs.AI 79%

Mapping the Course for Prompt-based Structured Prediction

基于提示的结构预测路径映射

Matt Pauk, Maria Leonor Pacheco

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出结合大语言模型与组合推理,提升结构预测的准确性和一致性,并通过实验验证符号推理在下游任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25411 2026-03-27 cs.CV 78%

HiSpatial: Taming Hierarchical 3D Spatial Understanding in Vision-Language Models

HiSpatial:在视觉-语言模型中驯服层次化3D空间理解

Huizhi Liang, Yichao Shen, Yu Deng, Sicheng Xu, Zhiyuan Feng, Tong Zhang, Yaobo Liang, Jiaolong Yang

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Xi’an Jiaotong University(西安交通大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出一种层次化框架,通过分解VLM中3D空间理解的学习过程,从几何感知到抽象空间推理,生成多样化任务和场景的3D空间VQA对,提升视觉-语言模型的空间理解能力。

Comments Accepted by CVPR 2026. Project page: https://microsoft.github.io/HiSpatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24242 2026-03-27 cs.CL 77%

Optimizing Multilingual LLMs via Federated Learning: A Study of Client Language Composition

通过联邦学习优化多语言大语言模型:对客户端语言构成的研究

Aleix Sant, Jordi Luque, Carlos Escolano

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了客户端语言构成对多语言联邦学习性能、公平性和成本的影响,提出本地动态早停机制提升效率,发现多语言客户端能提升全局模型质量与公平性,但需更多优化步骤。

Comments 12 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24780 2026-03-27 cs.LG 77%

Transformers in the Dark: Navigating Unknown Search Spaces via Bandit Feedback

在黑暗中导航:通过多臂反馈探索未知搜索空间

Jungtaek Kim, Thomas Zeng, Ziqian Lin, Minjae Lee, Chungpa Lee, Jy-yong Sohn, Hyung Il Koo, Kangwook Lee

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) FuriosaAI Yonsei University(延世大学) KRAFTON AI Ludo Robotics

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨LLM能否通过Transformer架构近似搜索算法,提出未知树搜索与多臂反馈框架,证明Transformer可实现不同搜索策略并具备泛化能力。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25118 2026-03-27 cs.CV 75%

AnyDoc: Enhancing Document Generation via Large-Scale HTML/CSS Data Synthesis and Height-Aware Reinforcement Optimization

AnyDoc:通过大规模HTML/CSS数据合成和高度感知强化优化提升文档生成

Jiawei Lin, Wanrong Zhu, Vlad I Morariu, Christopher Tensmeyer

机构 * Xi’an Jiaotong University(西安交通大学) Adobe Research(Adobe研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 AnyDoc通过大规模HTML/CSS数据合成和高度感知强化优化,实现多文档生成任务,包含265206个样本,覆盖111类和32种风格,提升文档生成性能。

Comments CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11864 2026-03-27 cs.CR 75%

NeuroStrike: Neuron-Level Attacks on Aligned LLMs

NeuroStrike:对对齐大语言模型的神经层面攻击

Lichao Wu, Sasha Behrouzi, Mohamadreza Rostami, Maximilian Thang, Stjepan Picek, Ahmad-Reza Sadeghi

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NeuroStrike通过利用对齐技术引入的稀疏安全神经元漏洞,提出了一种通用攻击框架,实现了对多种大语言模型的高效攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10700 2026-03-27 cs.CL cs.AI 73%

LLMs know their vulnerabilities: Uncover Safety Gaps through Natural Distribution Shifts

大语言模型知其弱点:通过自然分布偏移揭示安全漏洞

Qibing Ren, Hao Li, Dongrui Liu, Zhanxu Xie, Xiaoya Lu, Yu Qiao, Lei Sha, Junchi Yan, Lizhuang Ma, Jing Shao

机构 * MoE Key Lab of Artificial Intelligence, Shanghai Jiao Tong University(人工智能大模型关键实验室,上海交通大学) Beihang University(北京航空航天大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究大语言模型对自然分布偏移的脆弱性,提出ActorBreaker攻击方法,通过识别有毒提示相关角色构建多轮提示,揭示模型安全漏洞,并构建安全数据集提升鲁棒性。

Comments ACL 2025 main conference. Code is available at https://github.com/AI45Lab/ActorAttack

详情

展开后加载摘要…

URL PDF HTML 收藏