arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11585 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11585 篇

2608.17310 2026-08-19 cs.LG 新提交 87%

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements

Agentic ESOpt:以最小GPU资源微调长视野大语言模型智能体

Zhi Zheng, Rongsheng Chen, Yunpeng Ba, Zhenkun Wang, Yee Whye Teh, Wee Sun Lee

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.LG

AI总结 本文提出Agentic ESOpt框架,用进化策略微调长视野LLM智能体,仅需最小GPU资源,在WebArena-Lite上使Qwen-3.5-27B性能提升6.69%,提示-参数协同演化在多数设置中优于基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17450 2026-08-13 cs.IR cs.AI 版本更新 87%

VLM2Rec: Resolving Modality Collapse in Vision-Language Model Embedders for Multimodal Sequential Recommendation

VLM2Rec: 解决视觉语言模型嵌入器在多模态序列推荐中的模态崩溃问题

Junyoung Kim, Woojoo Kim, Wonbin Kweon, Jaehyung Lim, Dongha Kim, Hwanjo Yu

机构 * Pohang University of Science

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出VLM2Rec框架,通过弱模态惩罚对比学习和跨模态关系拓扑正则化,解决多模态序列推荐中模态崩溃问题,提升推荐准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04412 2026-08-11 cs.AI 版本更新 87%

LLM-as-a-Tutor: Policy-Aware Prompt Adaptation for Non-Verifiable RL

大语言模型作为导师:不可验证强化学习中的策略感知提示适应

Yujin Kim, Namgyu Ho, Sangmin Hwang, Joonkee Kim, Yongjin Yang, Sangmin Bae, Seungone Kim, Jaehun Jung, Se-Young Yun, Hwanjun Song

机构 * KAIST(韩国科学技术院) Upstage University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达)

专题命中 指令微调 :LLM(title,summary_cn);分类 cs.AI

AI总结 针对不可验证强化学习中训练提示静态导致的问题,提出LLM-as-a-Tutor框架,让大语言模型从评判扩展为导师,通过对比策略展开检测无挑战性提示并添加约束,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07226 2026-08-10 cs.AR cs.LG 新提交 87%

Dual-Node NVIDIA DGX Spark over Tailscale: A Remote-Access Testbed for Distributed LLM Training and Cyber-Threat-Intelligence Fine-Tuning

基于Tailscale的双节点NVIDIA DGX Spark:用于分布式大语言模型训练和网络威胁情报微调的远程访问测试平台

Vasanth Iyer

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本研究展示了双节点NVIDIA DGX Spark通过Tailscale VPN实现分布式NanoChat预训练,构建网络安全微调数据集并验证其效果,同时该集群可支持研究与教学,证明适度本地基础设施的可行性。

Comments 12 pages, 3 figures, 4 tables. Deployment runbook and code: https://github.com/viyer-research/dual-dgx-spark-tailscale-testbed

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01437 2026-08-04 cs.AI 新提交 87%

Beyond Routing Saturation: A Long-Horizon Class-Incremental Perspective on Expert Routing in Multimodal Continual Instruction Tuning

超越路由饱和:多模态持续指令调优中专家路由的长程类增量视角

Huiyu Yi, Yongqi Xu, Bogang Zhang, Dunwei Tu, Xu Zhiming, Zhen-Hao Xie, Baile Xu, Furao Shen

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多模态持续指令调优中专家路由的任务识别问题,构建含34个任务的FLEX基准,提出MCIL框架,适配CIL方法后使LoRA匹配和MacroScore分别提升最高16.3个百分点、4.6个点

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18232 2026-07-23 cs.CL 版本更新 87%

It's Not What You Say, It's How You Say It: Evaluating LLM Responses to Expressions of Belief

重要的不是你说了什么,而是你怎么说:评估大语言模型对信念表达的回应

Kevin Du, Clara Kümpel, Michelle Wastl, Alex Warstadt

机构 * ETH Zürich(苏黎世联邦理工学院) University of Zurich(苏黎世大学) UC San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究用户信念表达形式对大语言模型的影响,引入基于语言维度的类型学,生成可控查询对,评估不同架构、规模和训练阶段的16个LLMs,发现响应行为差异及能显著说服模型的特定信念表达,揭示语言框架对模型情境整合的影响。

Comments Published at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14530 2026-07-17 cs.LG 版本更新 87%

Code Correctness Is Linearly Decodable from LLM Hidden States Before Generation

LLM隐藏状态中的代码正确性信号:生成前探测与修复几何

Carlo Di Cicco

机构 * Independent researcher(独立研究员)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文通过残差化方法,发现Qwen3-4B-Instruct模型在生成前隐藏状态可线性解码代码正确性(AUC 0.931),但修复成功的方向性信号在控制上下文协变量后消失,揭示了方法学上的正负结果。

Comments 7 pages, 4 tables. Code, data, and analysis scripts available at https://github.com/CarloDiCicco/ReasoningLab

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24787 2026-07-15 cs.AI 版本更新 87%

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

ReLope:KL正则化的LoRA探针用于多模态大语言模型路由

Yaopei Zeng, Congchao Wang, Blake JianHang Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊AGI) Google(谷歌)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型路由中探针性能下降问题,提出Attention Probe和KL正则化的LoRA探针ReLope,通过改进隐藏状态质量提升路由效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12682 2026-07-15 cs.LG 版本更新 87%

RAFP: Identifying LLM Lineages via Rare-Region Fingerprints

RAFP:通过稀有区域指纹识别大语言模型谱系

Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

机构 * Department of Computer Science, Columbia University, USA(哥伦比亚大学计算机科学系) Meta, USA(Meta公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型所有权验证需求,提出RAFP框架,利用稀有区域指纹识别模型谱系。该方法非侵入性,通过离散梯度优化构建指纹,理论分析表明其在微调下似然变化有界,实验显示在黑盒设置中性能优于基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09448 2026-07-07 cs.SD cs.AI 版本更新 87%

One Prompt, Many Sounds: Modeling Listener Variability in LLM-Based Equalization

一个提示,多种声音:在基于大语言模型的均衡中建模听众差异

Ioannis Stylianou, Jon Francombe, Pablo Martinez-Nuevo, Sven Ewan Shepstone, Zheng-Hua Tan

机构 * Bang & Olufsen A/S, Struer, Denmark(丹麦Bang & Olufsen A/S公司,Struer) Department of Electronic Systems, Aalborg University(奥胡斯大学电子系统系) Pioneer Centre for AI, Copenhagen, Denmark(哥本哈根先锋人工智能中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用大语言模型将自然语言提示映射到均衡设置,通过上下文学习和参数高效微调技术,实现更灵活的音频均衡控制。

Comments 13 pages, 15 figures, 2 tables, Accepted for publication in the IEEE Journal of Selected Topics in Signal Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17289 2026-07-02 cs.LG 版本更新 87%

REALM: Reliable Expertise-Aware Language Model Fine-Tuning from Noisy Annotations

REALM:从嘈杂标注中可靠地进行语言模型微调

Sajjad Ghiasvand, Mark Beliaev, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 指令微调 :language model(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 REALM通过无监督学习同时学习模型参数和标注者专业能力评分,提升在噪声标注下的微调效果,实验显示其在多种任务和数据集上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30943 2026-07-01 cs.CL 新提交 87%

Bridging Scientific Heritage: An Arabic--Russian Parallel Corpus and LLM Benchmark for Sustainable Knowledge Transfer

连接科学遗产:面向可持续知识转移的阿拉伯语-俄语平行语料库与LLM基准

M. K. Arabov

机构 * Kazan Federal University(喀山联邦大学)

专题命中 指令微调 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 为解决阿拉伯语和俄语科学交流的语言障碍,构建了约2.7万句对的混合平行语料库,微调mT5、NLLB和Qwen2.5-7B模型,Qwen2.5-7B+QLoRA达到BLEU 23.15,推动跨语言知识转移与可持续发展。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28649 2026-06-30 cs.CR cs.AI cs.RO 87%

RIPA: Sensory-Vector Prompt Injection Attacks on LLM-Controlled ROS 2 Robots

RIPA: 针对LLM控制的ROS 2机器人的感官向量提示注入攻击

Nima Dorzhiev

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 提出RIPA,首个通过感官管道对ROS 2机器人进行多通道提示注入攻击的系统研究,发现模型脆弱性不随规模单调变化,并提出混合语义防火墙。

Comments 12 pages, 4 figures, 10 tables, 3 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25034 2026-06-29 cs.CV cs.AI 新提交 87%

Yuvion VL: A Multimodal Foundation Model for Adversarial Content and AI Safety

Yuvion VL:面向对抗性内容和AI安全的多模态基础模型

Shikai Qiu, Xiaowen Xu, Benlei Cui, Ting Ma, Xiufeng Huang, Wenjing Jiang, Shaoxuan He, Haolei Xu, Chunyang Chai, Yujian Li, Yiliang Zhang, Guanghui Wang, Ziheng Wang, Ziwen Xu, Zhaoyu Fan, Jinhao Chen, Ruijie Jian, Hongxing Li, Chuxi Xiao, Xinyue Chen, Wenxuan Liu, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Dongjie Zhang, Yangfan Zhou, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Huiming Zhang, Wei Wang, Xipeng Cao, Jialun Chen, Xiao Chen, Shaola Ren, Yunqing Hu, Bin Li, Chengwen Yao, Meng Huang, Xianfeng Li, Bin Tang, Chao Liu, Hui Xue, Longtao Huang, Haiwen Hong

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 指令微调 :foundation model(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Yuvion VL系列多模态大语言模型,通过对抗性感知数据合成、三阶段训练和混淆对比微调,在内容和AI安全任务上达到行业领先性能,同时保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27210 2026-06-26 cs.CL 新提交 87%

Paved with True Intents: Intent-Aware Training Improves LLM Safety Classification Across Training Regimes

以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类

Jeremias Ferrao, Niclas Müller-Hof, Iustin Sîrbu, Traian Rebedea, Yftah Ziser

机构 * University of Groningen(格罗宁根大学) University Politehnica of Bucharest(布加勒斯特理工大学) NVIDIA(英伟达)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21453 2026-06-23 cs.HC cs.AI cs.SD eess.AS 新提交 87%

CORTIS: Text-Only Adaptation of Spoken Language Models for Task-Oriented Voice Agents

CORTIS:面向任务型语音代理的纯文本口语语言模型适配

Youngwon Choi, Hyeonyu Kim, Taeyoun Kwon, Donghyuk Jung, Myeongkyun Cho

机构 * Maum AI Inc.(马姆人工智能公司) Seoul National University(首尔国立大学) Korea Culture Technology Institute(韩国文化科技研究所) KAIST(韩国科学技术院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract_cn);分类 cs.AI

AI总结 提出CORTIS框架,通过纯文本任务监督微调口语语言模型,实现推理时直接生成结构化输出,无需配对语音-目标数据,在声学退化下优于级联方法。

Comments Submitted to EMNLP 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19605 2026-06-23 cs.SE cs.AI 新提交 87%

FAPO: Fully Automated Prompt Optimization of Multi-Step LLM Pipelines

FAPO:多步骤LLM流水线的全自动提示优化

Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(基础AI–思科系统公司) Yale University(耶鲁大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI

AI总结 提出FAPO框架,通过自动诊断流水线瓶颈并迭代优化提示或链结构,在18个模型-基准比较中15次优于基线GEPA,平均提升14.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01750 2026-06-23 cs.LG 87%

Communication-Aware Knowledge Distillation for Federated LLM Fine-Tuning over Wireless Networks

面向通信的联邦知识蒸馏用于无线网络上的大语言模型微调

Xinlu Zhang, Na Yan, Yang Su, Yansha Deng, Toktam Mahmoodi

机构 * Department of Engineering, King’s College London(伦敦国王学院工程学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种通信高效的联邦知识蒸馏方法,通过动态选择Top-k logits和自适应logits聚合方案,降低通信开销并提升蒸馏效果,实验显示在降低约50%通信开销的同时性能更优。

Comments accepted by Globecom 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19989 2026-06-19 cs.DC cs.LG 新提交 87%

Online Dynamic Batching with Formal Guarantees for LLM Training

面向LLM训练的具有形式保证的在线动态批处理

Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

机构 * Tencent(腾讯)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.LG

AI总结 提出在线动态批处理(ODB)系统,在数据加载器侧将批构建延迟到样本真实成本可观测时,解决离线批采样中预处理成本不可见问题,实现1.58-4.43x吞吐量提升,并提供无死锁有界终止的形式化保证。

Comments 29 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19103 2026-06-18 cs.CV cs.AI 新提交 87%

ProductConsistency: Improving Product Identity Preservation in Instruction-Based Image Editing via SFT and RL

ProductConsistency:通过SFT和RL改进基于指令的图像编辑中的产品身份保持

Mukund Khanna, Raj Singh Yadav, Kunal Singh

机构 * Fractal Analytics

专题命中 指令微调 :SFT(title,title_cn);分类 cs.AI

AI总结 针对基于指令的图像编辑中产品特征保持不足的问题,提出ProductConsistency数据集和循环一致性奖励,结合监督微调与强化学习,显著提升产品一致性、文本渲染和视觉质量。

Comments CVPR HiGen 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17838 2026-06-17 cs.CL 新提交 87%

Environment-Grounded Automated Prompt Optimization for LLM Game Agents

面向LLM游戏智能体的环境驱动自动提示优化

Rean Clive Fernandes, Lukas Fehring, Theresa Eimer, Marius Lindauer, Matthias Feurer

机构 * Lamarr institute for ML and AI(拉马尔机器学习与人工智能研究所) TU Dortmund University(多特蒙德工业大学) Leibniz University Hannover(莱布尼茨汉诺威大学) L3S Research Center(L3S研究中心)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL

AI总结 提出一种自动提示优化框架,将观察-动作管道分解为描述器和选择器,通过环境回报驱动的进化循环迭代优化提示,在BabyAI任务中显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09092 2026-06-09 cs.LG 新提交 87%

From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

从捷径到推理:基于强化学习的心理理论鲁棒后训练

Jike Zhong, Yuxiang Lai, Ming Li, Yuheng Li, Wuao Liu, Behzad Dariush, Konstantinos Psounis, Shao-Yuan Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);foundation model(abstract);分类 cs.LG

AI总结 针对心理理论后训练中的捷径问题,提出Thinking-RFT方法,结合可验证奖励和显式推理链,在多个无捷径数据集上显著提升推理能力,尤其在复杂高阶推理和多模态场景中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01053 2026-06-02 cs.LG 87%

LRAgent: Efficient KV Cache Sharing for Multi-LoRA LLM Agents

LRAgent: 面向多LoRA LLM代理的高效KV缓存共享

Hyesung Jeon, Hyeongju Ha, Jae-Joon Kim

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.LG

AI总结 针对多LoRA代理系统中每个代理独立存储相同长轨迹的KV缓存导致内存和计算开销大的问题,提出LRAgent框架,通过将缓存分解为共享基座部分和适配器依赖部分,并利用共享A的多LoRA架构和Flash-LoRA-Attention内核,实现高效共享,在保持精度的同时显著降低开销。

Comments 25 pages, 10 figures, 22 tables

Journal ref ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30857 2026-06-01 cs.CL 87%

MADS: Model-Aware Diverse Core Set Selection for Instruction Tuning

MADS: 面向指令微调的模型感知多样化核心集选择

Yi Bai, Wenhao Zhang, Yao Chen, Jiao Xue, Zhumin Chen, Pengjie Ren

机构 * Shandong University(山东大学) Inspurcloud

专题命中 指令微调 :instruction tuning(title);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于模型推理时神经激活状态区分数据特征的多样化核心集选择方法,在减少数据量的同时提升大语言模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28822 2026-05-29 cs.CL 87%

Lightweight Multimodal LLM-Enabled Cost-Effective Defect Grading of Power Transmission Equipment

轻量级多模态大语言模型驱动的输电设备经济高效缺陷分级

Tao Wang, Lipeng Zhu, Jiayong Li, Feng Gao, Siwen Liang

专题命中 指令微调 :LLM(title);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于多模态大语言模型的缺陷分级框架,通过上下文学习最大化商业模型潜力,并利用链式思考问答对微调轻量级模型,实现低成本高精度分级。

Comments 9pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11896 2026-05-28 cs.CR cs.AI cs.SE 87%

VULPO: Context-Aware Vulnerability Detection via On-Policy LLM Optimization

VULPO:基于策略优化的上下文感知漏洞检测

Youpeng Li, Fuxun Yu, Weiliang Qi, Xinda Wang

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Microsoft(微软)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VULPO框架,通过构建包含上下文信息和推理轨迹的数据集ContextVul,结合冷启动监督微调和自适应策略优化,显著提升大语言模型在真实仓库中的漏洞检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25399 2026-05-26 cs.AI 87%

Towards end-to-end LLM-based censoring-aware survival analysis

面向端到端基于大语言模型的删失感知生存分析

Yishu Wei, Hexin Dong, Yi Lin, Jiahe Qian, Yi Liu, Yifan Peng

机构 * Department of Population Health Science, Weill Cornell Medicine(人口健康科学系,韦尔·科恩医学中心) Weill Cornell Medicine(韦尔·科恩医学中心)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出LLMSurvival框架,通过成对排序重制定时间事件预测,实现删失感知的生存分析,在ICU死亡率和骨折风险预测中优于Cox比例风险模型和三种深度学习模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21834 2026-05-22 cs.LG 87%

On-Policy Consistency Training Improves LLM Safety with Minimal Capability Degradation

基于策略的一致性训练通过最小能力退化提升大语言模型安全性

Andy Han, Kristina Fujimoto, Avidan Shah, Kiet Nguyen, Kai Xu, Chen Yueh-Han, Ilia Sucholutsky, Rico Angell

机构 * New York University(纽约大学)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);分类 cs.LG

AI总结 本文提出基于策略的一致性训练(OPCT)方法,通过模型自身响应对比性提示来提升大语言模型的安全性,实验表明OPCT在抑制顺从性、防止越狱和增强安全意识方面优于传统监督微调(SFT),同时避免了SFT导致的能力退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21781 2026-05-22 cs.CL 87%

Reflective Prompt Tuning through Language Model Function-Calling

通过语言模型功能调用实现反思式提示调优

Farima Fatahi Bayat, Moin Aminnaseri, Pouya Pezeshkpour, Estevam Hruschka

机构 * Megagon Labs(梅加穹实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文提出了一种名为Reflective Prompt Tuning (RPT)的框架,利用语言模型功能调用模拟人类提示工程师的迭代工作流程,通过诊断函数评估目标模型,生成结构化诊断报告,并利用历史报告优化提示,从而提升提示效果和置信度校准。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10265 2026-05-14 cs.CL 87%

Backdoor Collapse: Eliminating Unknown Threats via Known Backdoor Aggregation in Language Models

后门崩溃:通过已知后门聚合消除未知威胁

Liang Lin, Miao Yu, Moayad Aloqaily, Zhenhong Zhou, Kun Wang, Linsey Pang, Prakhar Mehrotra, Qingsong Wen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Science and Technology of China(中国科学技术大学) United Arab Emirates University(阿联酋大学) PayPal Inc(PayPal公司) Walmart Labs(沃尔玛实验室) Squirrel Ai Learning(Squirrel Ai学习) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文提出一种无需提前了解触发器设置的防御框架,通过后门表示聚合和恢复微调,有效降低攻击成功率并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏