arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11601 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11601 篇

2506.05346 2025-06-06 cs.CR cs.CL cs.LG 84%

Why LLM Safety Guardrails Collapse After Fine-tuning: A Similarity Analysis Between Alignment and Fine-tuning Datasets

Lei Hsiung, Tianyu Pang, Yung-Chen Tang, Linyue Song, Tsung-Yi Ho, Pin-Yu Chen, Yaoqing Yang

机构 * Dartmouth College(达特茅斯学院) EPFL(苏黎世联邦理工学院) UC Berkeley(加州大学伯克利分校) CUHK(香港大学) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(title,comments);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Project Page: https://hsiung.cc/llm-similarity-risk/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16467 2026-08-18 cs.HC cs.CL cs.CY 新提交 84%

Computational KJ-Ho: An Analyst-Bias-Free Insight Extraction Framework from Large-Scale Qualitative Data Using Domain-Specialized LLMs

计算KJ-Ho:利用领域专用大型语言模型从大规模定性数据中提取无分析师偏差见解的框架

Kasumi Ban

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出计算KJ-Ho框架,结合领域专用LLM实现无分析师偏差的定性数据见解提取,整合三种方法论并作出五项贡献,属概念性研究。

Comments Concept paper. 38 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 84%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14492 2026-08-17 cs.LG 新提交 84%

Approximate Muon with low-rank adapters

基于低秩适配器的近似Muon优化器

Ben Anson, Conor Houghton, Edward Milsom

机构 * University of Bristol(布里斯托大学) School of Mathematics(数学学院) School of Engineering Mathematics and Technology(工程数学与技术学院) University of Bath(巴斯大学)

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对Muon优化器难以与LoRA结合用于低秩微调的问题,提出sMuon方法,经实验验证其在SFT和ReLoRA预训练中表现良好,可适度提升低秩微调性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26690 2026-08-13 cs.LG 版本更新 84%

LoRAQuant: Mixed-Precision Quantization of LoRA to Ultra-Low Bits

LoRAQuant:将LoRA混合精度量化至超低比特

Amir Reza Mirzaei, Yuqiao Wen, Yanshuai Cao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(计算科学系及阿尔伯塔人工智能研究所(Amii),阿尔伯塔大学) RBC Borealis Canada CIFAR AI Chair(加拿大CIFAR人工智能 chair)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多LoRA适配器规模化部署的高存储成本问题,提出专为LoRA定制的混合精度后训练量化方法LoRAQuant,在LLaMA 2、Mistral模型的多任务上,以更低比特实现了相当或更优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03742 2026-08-11 cs.CL 版本更新 84%

Benchmarking Parameter-Efficient Fine-Tuning of Large Language Models for Low-Resource Tajik Text Generation with the Tajik Web Corpus

针对低资源塔吉克语文本生成的大语言模型参数高效微调基准测试:基于塔吉克网络语料库

Mullosharaf K. Arabov

专题命中 指令微调 :large language model(title);language model(title);分类 cs.CL

AI总结 该研究发布塔吉克网络语料库,测试9种架构17种配置的三种微调策略,得出Mistral 7B搭配QLoRA r=8为最优方案,是首个针对塔吉克语文本生成的PEFT基准测试。

Comments LaTeLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08746 2026-08-11 cs.AI 新提交 84%

Scale-to-Dialogue: Low-Burden Elicitation of Daily Premenstrual Symptom Ratings with Small Language Models

对话式量表:用小型语言模型低负担引出日常经前症状评分

Yifan Wang

机构 * The Chinese University of Hong Kong, Shenzhen (CUHK-Shenzhen)(香港中文大学(深圳))

专题命中 指令微调 :language model(title);small language model(title);分类 cs.AI

AI总结 该研究将经前症状追踪转化为对话式有序标签恢复问题,用ModernBERT和Qwen2.5-1.5B-Instruct模型,实现低负担的日常经前症状评分,三簇策略效果接近固定六项策略且提问量减半。

Comments 10 pages, 4 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07570 2026-08-11 cs.CV cs.AI 新提交 84%

COMEX: A Composition-Grounded Benchmark and Learning Framework for Explainable Aesthetic Image Cropping

COMEX:用于可解释美学图像裁剪的基于构图的基准测试与学习框架

Rui Yang, Wei Zhou, Dingyong Gou, Xiaohui Cui, Cong Li, Yinyin Gong, Yipo Huang, Jiliang Zhao

机构 * ZTE Corporation(中兴通讯)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于构图的COMEX基准与SFT+GRPO两阶段框架,用于可解释美学图像裁剪,通过多组实验验证了框架的有效性与可迁移性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11149 2026-08-11 cs.CL 版本更新 84%

Data Repetition Beats Data Scaling in Long-CoT Supervised Fine-Tuning

数据重复胜过数据扩展在长链推理监督微调中

Dawid J. Kopiczko, Sagar Vaze, Tijmen Blankevoort, Yuki M. Asano

机构 * University of Technology Nuremberg(图恩大学) NVIDIA(英伟达)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本研究发现,在长链推理监督微调中,数据重复训练比数据扩展更有效,通过token准确率作为停止标准可替代昂贵的数据扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04200 2026-08-06 q-fin.MF cs.LG 新提交 84%

From Financial Sentiment Classification to Return Predictability: A QLoRA Benchmark of Large Language Models

从金融情感分类到收益可预测性:大型语言模型的QLoRA基准测试

Fusheng Luo

专题命中 指令微调 :large language model(title);language model(title);分类 cs.LG

AI总结 该研究构建金融情感分类基准,对比TF-IDF朴素贝叶斯等模型,发现QLoRA可提升Qwen2.5性能,但分类准确率高的模型在收益预测的经济有效性上无显著优势,揭示分类准确率与可交易信号的差距。

Comments Waiting to submit to a conference (ICAIF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00181 2026-08-04 cs.SE cs.AI 新提交 84%

Cross-Benchmark Generalization in Long-Horizon Agents

长视野智能体的跨基准泛化

Sushant Mehta, Logan Ritchie, Liudas Panavas, Edwin Chen

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 本研究针对长视野智能体,通过两阶段SFT-再-RL流程后训练Qwen3.5-122B-A10B模型,在5项外部基准实现性能提升,证明长视野多工具后训练的工作方式可跨领域迁移。

Comments Accepted at the COLM 2026 Workshop on Agent Behavior. 11 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16637 2026-08-04 cs.AI 版本更新 84%

TopoTuner: Topological Finetuning of Large Language Models

TopoTuner:大语言模型的拓扑微调

Abdulkadir Erol, Yash Mahajan, Vepaul Hariprashad, Baha Rababah, Santu Karmaker, Cuneyt G. Akcora, Mubarak Shah

机构 * University of Central Florida(中佛罗里达大学) University of Manitoba(曼尼托巴大学)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 研究针对大语言模型微调成本高及LoRA不足的问题,提出TopoTuner框架,通过拓扑引导选择性冻结注意力投影矩阵,从源数据集学习可复用冻结配置文件,在多模型上效果优于LoRA且大幅减少训练时间和参数更新量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 84%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交 84%

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26596 2026-07-30 cs.CV cs.AI 新提交 84%

Decoupled Visual Processing: Efficient Multimodal Adaptation via Modality-Specific Transformer Substitution

解耦视觉处理:通过模态特定Transformer替换实现高效多模态适配

Mingkuan Feng, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 该研究针对多模态大语言模型视觉指令微调成本高的问题,提出解耦视觉处理框架,替换预训练大语言模型上层解码器为轻量Transformer块,仅训练该块即可在多个基准上实现竞争力性能,降低了计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24522 2026-07-28 cs.LG cs.CV 新提交 84%

FlowCTS: On-policy Continuous Trajectory Supervision of Flow Models

FlowCTS:流模型的在线连续轨迹监督

Kaiyang Ye, Yuan Ge, Junxiang Zhang, Bei Li, Ziming Zhu, Haishu Zhao, Xiaoqian Liu, Chenglong Wang, Jingbo Zhu, Zhengtao Yu, Tong Xiao

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 【一句话总结】研究针对策略蒸馏在流模型中的扩展探索不足的问题,提出FlowCTS,通过匹配轨迹等方法得出速度匹配上限并离散化,在多参考设置下有优势,还揭示了基于KL的策略蒸馏的不足,且在策略外设置也表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16643 2026-07-21 cs.AI cs.CV 新提交 84%

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

基于不确定性的幻觉检测的面向多样性的微调

Qiuyuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 指令微调 :SFT(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究基于不确定性的幻觉检测,提出面向多样性的微调策略,包括基于监督微调(SFT)和直接偏好优化(DPO)的方法,经实验验证可提高幻觉检测有效性,结果优于或可比现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22818 2026-07-20 cs.CR cs.AI 版本更新 84%

Hide and Seek in Embedding Space: Geometry-based Steganography and Detection in Large Language Models

嵌入空间中的隐秘行动:基于几何的隐写术与大语言模型中的检测

Charles Westphal, Keivan Navaie, Fernando E. Rosas

机构 * UCL Centre for Artificial Intelligence, University College London, UK(伦敦大学学院人工智能中心,大学学院伦敦) School of Computing and Communications, Lancaster University, UK(兰卡斯特大学计算机与通讯学院) Department of Informatics, University of Sussex, UK(苏塞克斯大学信息学院) Centre for Psychedelic Research and Centre for Complexity Science, Imperial College London, UK(伦敦帝国学院迷幻研究与复杂科学中心) Centre for Eudaimonia and Human Flourishing, University of Oxford, UK(牛津大学幸福与人类繁荣中心)

专题命中 指令微调 :large language model(title);language model(title);分类 cs.AI

AI总结 本研究提出了一种低恢复性隐写术,通过嵌入空间衍生映射提升秘密恢复率,同时减少负载恢复性,并提出基于机制可解释性的检测方法,提高微调模型中的秘密检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11703 2026-07-14 cs.CL 新提交 84%

Production and Perception in LLMs: A Token Probability Approach

大语言模型中的生成与感知:一种令牌概率方法

Anna Marklová, Jiří Milička, Martina Vokáčová, Rudolf Rosa

机构 * Faculty of Arts, Charles University, Prague(布拉格查理大学文学院) Faculty of Mathematics and Physics, Charles University, Prague(布拉格查理大学数学与物理系)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨大语言模型中语言生成与感知的区别,通过直接令牌概率测量,利用Llama - 3.1 - 8B等模型实验发现,提示框架能引发生成 - 感知区别,此区别特定于交际框架,在多模型中可复制,感知提示在序列起始影响最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31846 2026-07-01 cs.RO cs.AI 新提交 84%

Z-1: Efficient Reinforcement Learning for Vision-Language-Action Models

Z-1: 面向视觉-语言-动作模型的高效强化学习

Lang Cao, Renhong Chen, Luyi Li, Peng Wang, Mofan Peng, Yitong Li

机构 * Zioneer Robot Team(Zioneer机器人团队)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.AI

AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01193 2026-06-26 cs.CL 版本更新 84%

Embarrassingly Simple Self-Distillation Improves Code Generation

令人惊讶的简单自蒸馏方法提升代码生成能力

Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan Collobert, Yizhe Zhang

机构 * Apple(苹果公司)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 84%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 指令微调 :SFT(summary_cn,abstract);pretraining(abstract);分类 cs.AI

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16808 2026-06-16 cs.AI 新提交 84%

Adaptive and Explicit safe: Triggering Latent Safety Awareness in Large Reasoning Models

自适应且显式安全:触发大型推理模型中的潜在安全意识

Ke Miao, Jiaxin Li, Hongliang Chen, Yuke Hu, Zhan Qin

机构 * The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全全国重点实验室) Hangzhou HighTech Zone (Binjiang) Blockchain and Data Security Research Institute, China(杭州高新区(滨江)区块链与数据安全研究院) Li Auto Inc.(理想汽车) Tsinghua University(清华大学) King Abdullah University Of Science And Technology(阿卜杜拉国王科技大学)

专题命中 指令微调 :SFT(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 针对大型推理模型易受越狱攻击的问题,提出Safe Trigger方法,通过SFT显式诱导安全标签触发安全分析,并用DPO优化,显著降低攻击成功率而不影响通用性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17421 2026-06-16 cs.CL 版本更新 84%

Oops, Wait: Discourse Tokens Matter in Reasoning Model

哎呀,等等:话语标记在推理模型中的重要性

Jaehui Hwang, Byeongho Heo, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究话语标记(如“wait”)在推理轨迹中的作用,发现数据高效微调可部分复现其模式,但不如大规模后训练与高置信答案转换对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14179 2026-06-15 cs.CL 新提交 84%

CacheRL:Multi-Turn Tool-Calling Agents via Cached Rollouts and Hybrid Reward

CacheRL: 通过缓存轨迹和混合奖励实现多轮工具调用智能体

Md Amirul Islam, Sumiran Thakur, Huancheng Chen, Su Min Park, Jiayun Wang, Gyuhak Kim

机构 * Center for Advanced AI Accenture(埃森哲高级人工智能中心)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);foundation model(abstract);分类 cs.CL

AI总结 提出CacheRL系统,通过混合思维轨迹流水线、三级模糊缓存和缓存层级感知奖励,以100倍更少计算量实现92%的多步工具调用准确率,接近GPT-5的94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13038 2026-06-12 cs.AI 新提交 84%

Nous: An Attempt to Extract and Inject the Cognition Behind Prediction-Market Behavior

Nous: 提取并注入预测市场行为背后认知的尝试

Haowei Qian

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 针对LLM代理在预测市场中认知同质化问题,提出Nous方法从真实交易行为提取八维行为画像并注入提示,发现提取部分有效但提示注入无法传递认知多样性。

Comments 37 pages, 1 figure, 7 tables. Reproduction artifacts (code, frozen profiles, prompts, model outputs): https://github.com/WillChienT/nous-paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14194 2026-06-08 cs.CL 版本更新 84%

GradShield: Alignment Preserving Finetuning

GradShield: 保持对齐的微调

Zhanhao Hu, Xiao Huang, Patrick Mendoza, Emad A. Alghamdi, Basel Alomair, Raluca Ada Popa, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) HUMAIN King Abdulaziz City for Science and Technology(国王阿卜杜勒阿齐兹科学与技术城) University of Washington, Seattle(华盛顿大学(西雅图))

专题命中 指令微调 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出GradShield过滤方法,通过计算微调隐式危害分数并采用自适应阈值,在微调前移除有害数据,保持LLM安全对齐,攻击成功率低于6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05395 2026-06-05 cs.RO cs.AI 84%

VASO: Formally Verifiable Self-Evolving Skills for Physical AI Agents

VASO:物理AI智能体的形式可验证自进化技能

Yunhao Yang, Neel P. Bhatt, Kevin Wang, Samuel Tetteh, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Iowa State University(爱荷华州立大学)

专题命中 指令微调 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 提出VASO框架,通过形式验证引导LLM生成的机器人技能合约自进化,将模型检查的反例转化为文本梯度更新技能合约,无需微调模型权重,在Jackal和四旋翼任务中达到97.2%的形式规范符合率。

Comments Project webpage: https://languagegroundedriskdetection.github.io/ProjectPage/vaso-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29498 2026-05-29 cs.CL cs.CV 84%

Mask the Target: A Plug-and-Play Regularizer Against LoRA Forgetting

Mask the Target: 一种即插即用的正则化器,用于对抗LoRA遗忘

Runze Xu, Arpit Garg, Hemanth Saratchandran, Simon Lucey

机构 * Australian Institute for Machine Learning(澳大利亚机器学习研究所)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 针对LoRA微调中目标分布与原始训练分布差异大时导致的灾难性遗忘问题,提出一种无需重放数据的输出空间正则化方法,通过遮蔽目标token并仅对非目标词汇进行KL正则化,在不增加推理开销的前提下改善新学习与遗忘之间的平衡。

Comments In Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28534 2026-05-28 cs.CL 84%

GUI-CIDER: Mid-training GUI Agents via Causal Internalization and Density-aware Exemplar Reselection

GUI-CIDER:通过因果内化和密度感知示例重选进行GUI代理的中期训练

Zheng Wu, Chengcheng Han, Zhengxi Lu, Tianjie Ju, Yanyu Chen, Qi Gu, Xunliang Cai, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出GUI-CIDER中期训练方法,通过因果内化和密度感知示例重选显式内化GUI世界知识,提升代理对GUI操作的理解和任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏