arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11211 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 917 篇

2606.08908 2026-06-09 cs.CV cs.AI 新提交 74%

Failure-Aware Refinement of Vision-Language Model for Lithography Defect Detection

面向光刻缺陷检测的视觉-语言模型失败感知精炼

Pangyun Jeong, Jiyeong Kong, Yuehua Hu, Dohee Jeong, Kyung-Tae Kang

机构 * Hanyang University(汉阳大学) Korea University(高丽大学) Korea Institute of Industrial Technology(韩国生产技术研究院)

专题命中 指令微调 :language model(title);分类 cs.AI

AI总结 提出两阶段视觉-语言框架,先微调Qwen3-VL检测缺陷,再通过训练精炼模块修正第一阶段错误,提升检测可靠性。

Comments 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16333 2026-08-18 cs.CL cs.AI 新提交 73%

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法

Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) University of Chinese Academy of Sciences(中国科学院大学) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15381 2026-08-18 cs.AI cs.LG 新提交 73%

FedPA-LoRA: Product-Aligned Framework for Mitigating Aggregation and Initialization Errors in Heterogeneous Federated LoRA

FedPA-LoRA:用于缓解异构联邦LoRA中聚合与初始化误差的产品对齐框架

Juseok Jeon, Ramy E. Ali, Doyun Kwon, Myungbeom Her, Jinhwi Kim, Jinhyun So

机构 * DGIST(大邱庆北科学技术院) Samsung(三星)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 FedPA-LoRA是缓解异构联邦LoRA聚合与初始化误差的产品对齐框架,在多任务实验中较基线方法平均GLUE准确率最高提升6.82个百分点。

Comments 35 pages, 6 figures. Code: https://github.com/Juseok-Jeon/FedPA-LoRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14681 2026-08-18 cs.CL cs.AI 新提交 73%

Automatic or Controlled? Repetition Priming Reveals Divergent Processing in Base LLMs, Instruct LLMs, and Humans

自动还是受控?重复启动揭示基础大语言模型、指令调优大语言模型与人类的加工差异

Jinglei Ren, Yuyue Wang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过重复启动实验对比基础大语言模型、指令调优大语言模型与人类的重复信息加工差异,发现训练后模型加工模式发生质变,且Qwen 2.5家族中该差异随规模增大而增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12334 2026-08-14 cs.CL cs.AI 新提交 73%

Steering the Language Axis: From Linear Decodability to Causal Control

操控语言轴:从线性可解码到因果控制

Arnav Srivastav

机构 * University of California, Santa Cruz(加利福尼亚大学圣克鲁兹分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探究大语言模型的语言身份是否可通过紧凑激活方向因果控制,在Qwen、Llama等模型的126万次生成上证实,分离的PCA导出语言轴可可靠操控语言切换,且语言选择具层特异性与语言对依赖性。

Comments 22 pages, 14 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 73%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05891 2026-08-07 cs.AI cs.CL 新提交 73%

AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents

AppDeltaWorld:面向移动GUI智能体的基于转换的增量代码世界模型

Weikai Xu, Yunren Feng, Haoxiang Lei, Kun Huang, Yuxuan Liu, Kang Zhao, Xiaolin Hu, Shuo Shang, Bo An

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对移动GUI智能体轨迹获取难、模拟环境扩展难等问题,提出AppDeltaWorld增量代码世界模型,在CMGUIBench-500评估中表现最优,支撑的AppDeltaAgent在多基准达SOTA,测试时强化学习可进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05141 2026-08-06 cs.AI cs.LG cs.SE 新提交 73%

OctoLong: Mid-Training On Cross-Repository Code Contexts Enhances Long-Context Modeling

OctoLong:跨仓库代码上下文的训练中优化增强长上下文建模

Indraneil Paul, Falko Helm, Goran Glavaš, Iryna Gurevych

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出OctoLong流水线,通过跨仓库代码上下文的训练中优化,训练出OctoLong-Instruct长上下文开源LMs,用其替代12%传统语料库可显著提升长上下文相关任务性能及短场景API使用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05045 2026-08-06 cs.CR cs.AI cs.CL 新提交 73%

Gradient Immunity: Null-Space Resistance to Malicious Fine-Tuning

梯度免疫:对恶意微调的零空间抗性

Yuxuan Huang, Xingyu Zeng, Tianhang Zheng, Chaochao Lu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对部分保护开放权重(PPOW)发布场景的大型语言模型,提出单向安全门(USG)防御,可抑制恶意微调的有害梯度,提升恶意下游适应的成本且无需下游用户配合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04548 2026-08-06 cs.LG cs.AI 新提交 73%

A Model Merging Approach for Continual MLLM Unlearning

面向持续多模态大语言模型(MLLM)遗忘的模型合并方法

Yuhang Wang, Linlin Zhang, Haoxuan Ji, Xianmin Ye, Zhenxing Niu, Haichang Gao

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对现有MLLM遗忘方法无法应对持续场景的问题,本文提出MCU方法,通过动态合并遗忘适配器缓解跨任务依赖的干扰,在多个基准测试中实现了更优的遗忘效果与知识保留。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04084 2026-08-06 cs.LG cs.CL cs.CV 新提交 73%

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

SpecDrop:无参数类别条件路由的模块化专业化方法

Boyao Wang, Zhihan Lei

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出无参数类别条件路由方法SpecDrop,在视觉任务上性能优于参数匹配基线,表明路由的有效性取决于训练信号粒度与类别的对齐而非路由算法。

Comments 35 pages, 6 figures. Code: https://github.com/Beryex/SpecDrop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03527 2026-08-05 cs.IR cs.AI cs.CL 新提交 73%

Training Documents Reranker with Search Rubrics for Deep Research Agent

面向深度研究智能体的、基于搜索 rubrics 的训练文档重排序器

Wenhan Liu, Yu Lu, Qiaolin Xia, Hui Xu, Tong Zhao, Jian Xi, Yutao Zhu, Haijin Liang, Haibo Shi, Hao Wang, Zhicheng Dou

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对现有检索器无法满足深度研究智能体复杂信息需求的问题,提出搜索 rubrics 并训练文档重排序器 RubricRanker,在多基准上取得优于基线的性能且泛化性良好。

Comments 28 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01318 2026-08-04 eess.SP cs.AI cs.LG 新提交 73%

Sheaf-theoretic Signal Processing on Graphs: Spectral Theory, Filtering, and Sampling

基于层论的图上信号处理:谱理论、滤波与采样

Gabriele D'Acunto, Leonardo Di Nino, Paolo Di Lorenzo, Sergio Barbarossa

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文开发了统一的层信号处理框架,将信号处理基本操作扩展到异构局部空间,提出层傅里叶变换等方法,在多类数据集上验证其性能优于经典图信号处理基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26618 2026-07-30 cs.LG cs.CL 新提交 73%

FedWeave: Rethinking the Unit of Specialization in Heterogeneous Federated MoE-LoRA

FedWeave:重新思考异构联邦MoE-LoRA中的专业化单元

Donghang Duan, Xu Zheng, Lizong Zhang, Chong Mu, Meng Han

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 FedWeave针对异构联邦MoE-LoRA中客户端粒度专业化的局限,提出非对称聚合框架,分离专家聚合与路由优化,在异构多任务基准上优于强基线,实现高效联邦大模型适配。

Comments 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25299 2026-07-29 cs.LG cs.AI 新提交 73%

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

用于LoRA微调的Stiefel流形上无回缩优化

Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系) Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Stiefel流形优化中现有方法的问题,提出无回缩且无惩罚参数算法,利用相关特性建立收敛保证。将LoRA微调问题转为流形优化问题,引入Manifold-LoRA,经实验验证其在加速训练及下游性能方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24814 2026-07-29 cs.AI cs.LG q-bio.OT 新提交 73%

Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings

Aletheia:用于低资源医疗环境中鉴别诊断的离线优先临床决策支持系统

Joseph Walusimbi, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, Charles Brian Okoboi

机构 * Soroti University(索罗蒂大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对撒哈拉以南非洲低资源医疗环境,提出基于Qwen2.5 - 3B - Instruct并经QLoRA微调的Aletheia临床决策支持系统,评估显示其在诊断准确率等指标上表现良好,证明在无云设施的资源受限环境初级保健层部署大语言模型临床推理的可行性。

Comments 8 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23446 2026-07-28 cs.CL cs.AI 新提交 73%

Do Small Models Use the Law You Give Them? Context-Injected Fine-Tuning for Legal QA in Bangladesh

小模型会遵循你赋予它们的法律吗?孟加拉国法律问答的上下文注入微调

Moniruzzaman Mahadi, Abrar Mohammed Tanzim Alam, Sayma Siddika Monalisa, Mir Mohammad Asif Abdullah, Swakkhar Shatabda, Md Adnan Arefeen

机构 * North South University(南北大学) BRAC University(BRAC大学)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 研究孟加拉国法律问答,通过整理双语问答记录对不同参数的Qwen3.5进行微调,发现微调能提升部分模型表现,降低答案语言偏差,表明检索质量非唯一瓶颈,小型双语法律模型运用法律和语言回答有差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22625 2026-07-28 cs.AI cs.LG 新提交 73%

TokenMem: Faithful Knowledge Injection for Frozen LLMs

TokenMem:为冻结的语言模型进行忠实的知识注入

Chengzhang Yu, Chenyang Zheng, Zening Lu, Yingru He, Yutong Huang, Yiming Zhang, Yue Xu, Zhanpeng Jin

机构 * South China University of Technology(华南理工大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对RAG增强LLMs时的知识冲突问题,提出TokenMem轻量级记忆系统,通过专用通道向冻结LLMs注入知识,经两阶段课程训练薄门控适配器,实验显示其在反事实基准上知识一致性远超普通RAG,两阶段课程关键,门控适配器能自主学习策略。

Comments 15 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21774 2026-07-27 cs.CL cs.AI 新提交 73%

Probing Latent Colombian Identity Inferences in Qwen2.5-7B with Natural Language Autoencoders

用自然语言自动编码器探究Qwen2.5 - 7B中潜在的哥伦比亚身份推断

Pablo Santiago Potes Velasco, María del Mar García Matabanchoy, Óscar Julián Pérez Ladino, Jhoan Stevan Mosquera Ortiz, Nicolás Lozano Mazuera, Gilber Alexis Corrales Gallego

机构 * Universidad Autónoma de Occidente(西自治大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究Qwen2.5 - 7B - Instruct处理提示时是否表征哥伦比亚相关信息,用自然语言自动编码器转化残差流激活,通过含30个提示的数据集进行研究,将激活可解释性与西班牙语变体偏差评估相联系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21612 2026-07-27 cs.AI cs.LG 新提交 73%

Procedural Knowledge Is Not Low-Rank: Why LoRA Fails to Internalize Multi-Step Procedures

过程性知识不是低秩的:为什么LoRA无法内化多步骤过程

Simon Dennis, Kevin Shabahang, Hao Guo, Rivaan Patil

机构 * University of Melbourne(墨尔本大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究发现对于过程性知识,LoRA在保持效率优势的秩上无法与完全微调匹配。通过实验表明在旅行预订等任务中LoRA配置失败,跨域复制也证实其普遍不佳,分析指出完全微调权重变化的有效秩高,LoRA难以企及,这是智能体应用的基本限制。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19399 2026-07-23 cs.LG cs.AI cs.CV 新提交 73%

Leveraging Offline Supervision for Efficient and Generalizable Reinforcement Learning in Large-Scale Vision-Language-Action Models

在大规模视觉-语言-动作模型中利用离线监督实现高效且通用的强化学习

Dmitriy Poyarkov, Aleksei Staroverov, Aleksandr I. Panov

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究在大规模视觉-语言-动作模型中,通过将离线监督纳入强化学习,结合离线与在线训练优点,提升训练效率。经实验验证,该混合方法在保持强大分布外能力的同时,所需训练预算减半,实现效率与性能双赢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17620 2026-07-21 cs.LG cs.CL math.OC 新提交 73%

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

PoLoRA:一种预处理正交化的LoRA优化器

Nikhil Ghosh, Tetiana Parshakova, Robert M. Gower

机构 * Center for Computational Mathematics, Flatiron Institute(计算数学中心,熨斗研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对LoRA优化问题,提出PoLoRA优化器,由乘积感知谱更新方向、曲率预处理及幅度规则构成。在多模型指令调优数据集上评估,结果显示它步数减少,开销增加少,对学习率不敏感,最优学习率稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13044 2026-07-16 cs.CL cs.AI 新提交 73%

The Perplexity Trap: When Patent Law Makes Human Writing Look Like AI

困惑陷阱:专利法何时让人类写作看起来像人工智能

Anubhab Banerjee

机构 * European Patent Office(欧洲专利局)

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专利法下筛选疑似人工智能生成专利文本的难题,在消费级硬件条件下用多种策略进行基准测试,发现现有检测器误报率高,问题是结构性的,提出七特征语言复杂性逻辑回归方法,提升了准确率。

Journal ref Proceedings of the ICML 2026 Workshop on AI4Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12279 2026-07-15 cs.CL cs.LG 新提交 73%

A Shared Subcircuit Lets LLMs Count Down Across Tasks

一个共享子电路使大语言模型能够跨任务进行倒计时

Jacob Dunefsky, Wes Gurnee, Emmanuel Ameisen

机构 * Yale University(耶鲁大学) Anthropic

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现Llama-3.1-70B-Instruct中有个“倒计时子电路”可跨任务执行特定任务,先在受控设置中分离它,再研究其表示几何结构,发现与另一模型有相同模式,还通过无监督探测找到其用于多种任务的情况,有助于理解行为推广。

Comments 12 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12112 2026-07-15 cs.LG cs.AI cs.CV cs.DC 新提交 73%

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

机构 * The University of British Columbia(英属哥伦比亚大学) Fudan University(复旦大学) Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) Dyson School of Design Engineering(戴森设计工程学院) Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) East China Normal University(华东师范大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。

Comments submitted to IEEE JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12111 2026-07-15 cs.LG cs.AI cs.DC cs.MA cs.NI 新提交 73%

PFAdapter: Hierarchical LoRA Decomposition for Personalized Federated MLLMs

PFAdapter:用于个性化联邦多模态大语言模型的分层LoRA分解

Jing Liu, Kun Yang, Yan Wang, Dingkang Yang, Xiaoshuai Hao, Wei Zhang, Yang Liu, Wei Zhou

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息技术学院) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, The University of British Columbia(英属哥伦比亚大学电气与计算机工程系) Ant Group(蚂蚁集团) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) College of Intelligent Robotics and Advanced Manufacturing, Fudan University & Fysics AI(复旦大学智能机器人与先进制造学院及复肆智能科技(上海)有限公司) Xiaomi EV, Xiaomi Campus(小米汽车、小米园区) Information and Communications Technology Cluster, Singapore Institute of Technology (SIT)(新加坡理工学院信息通信技术集群) College of Electronic and Information Engineering, Tongji University(同济大学电子与信息工程学院) School of Computer Science and Informatics, Cardiff University(卡迪夫大学计算机科学与信息学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对分布式网络中联邦微调平衡全局知识与局部适应的挑战,提出PFAdapter框架,用分层LoRA分解将适配器参数分离,通过正交正则化和选择性聚合协议减少通信成本,实验证明该框架在多数据集上性能优于基线,为智能AI部署提供有效方案。

Comments submitted to IEEE TCCN

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10750 2026-07-14 cs.AI cs.LG 新提交 73%

Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF

过滤有害行为是不够的:智能体自反决策函数中的幻影转移

Chinmayi Dixit

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在含对抗交互的合成智能体轨迹训练的影响,通过微调Llama 3.3 70B Instruct并评估,发现有害行为过滤不足,生成过程引入失调倾向且分散编码,依赖生成模型,安全基准难区分影响,强调动作级过滤无法确保合成智能体训练数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10517 2026-07-14 cs.LG cs.AI 新提交 73%

Conditional Optimal Bridge for Riemannian Activation Steering

用于黎曼激活控制的条件最优桥

Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理时激活控制问题,提出\textsc{Cobras}方法,将其视为残差流超球面上的薛定谔桥,从优化问题推导控制目标,使控制方向查询自适应,实验显示该方法性能优于基线且避免分布外性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09287 2026-07-13 cs.LG cs.CL 新提交 73%

Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning

超调优:从激活感知剪枝到稀疏微调

Ivan Ilin, Philip Zmushko, Peter Richtárik

机构 * KAUST(沙特阿卜杜拉国王科技大学) ISTA(奥地利科学技术研究所) Yandex Research(Yandex 研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大型语言模型微调成本高的问题,提出Super和Supra方法,利用剪枝显著性信号,结合Wanda分数与LoRA,通过预算分配规则保持参数预算,在算术实验中取得高准确率,证明简单排序可为PEFT提供支持。

Comments 26 pages, 3 figures, 19 tables. Code: https://github.com/vectozavr/SuperTuning

详情

展开后加载摘要…

URL PDF HTML 收藏