arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11511 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11511 篇

2608.11631 2026-08-13 cs.AI 新提交 90%

CLAIM: Leading Open-domain Active Clarification of Large Language Models with Uncertainty Measurement

CLAIM:基于不确定性度量的大语言模型开放域主动澄清领先方案

Kuangzhao Yang, Ziliang Zhao, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 本研究提出基于不确定性度量的CLAIM框架,无需人工标注,结合监督学习与强化学习训练统一澄清决策模型,实现开放域人机交互中低成本鲁棒的主动澄清。

Comments 11 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09109 2026-08-11 cs.AI 新提交 90%

Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models

不同反馈,不同更新:针对大语言模型的用户交互选择性自学习

Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Tencent(腾讯)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对LLM用户反馈的泛化范围差异问题,提出选择性自学习框架SLIFT,通过训练两个互补LoRA适配器,在MemoryBench和WildFB上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23671 2026-08-04 cs.CL 版本更新 90%

Can LLMs Reliably Self-Report Adversarial Prefills, and How?

LLM 能否可靠地自我报告对抗性预填充,以及如何实现?

Quang Minh Nguyen, Uzair Ahmed, Taegyoon Kim

机构 * KAIST(韩国科学技术院)

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);SFT(abstract_cn)

AI总结 研究LLM在安全场景中识别自身输出是否受对抗性预填充攻击的能力,发现模型平均27.3%声称预填充输出有意图,且内省信号主要来自安全/拒绝推理,LoRA微调方法扩大了意图-篡改探针差距并提高了攻击成功率。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02906 2026-08-03 cs.LG 版本更新 90%

OpsLLM: Construction of Large Language Model for Software Operations with Multi-stage Learning

面向软件运维构建大型语言模型的端到端框架

Jingkai He, Pengfei Chen, Chenghui Wu, Shuang Liang, Ye Li, Gou Tan, Xidao Wen, Chuanfu Zhang, Fang Situ, Qi Zhou

机构 * School of Systems Science and Engineering, Sun Yat-sen University(系统科学与工程学院,中山大学) School of Computer Science and Engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) Alibaba Cloud Computing(阿里云 computing)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出OpsLLM,一个专为软件运维设计的大型语言模型,支持基于知识的问题回答和根本原因分析。通过人机协同机制构建高质量数据集,并结合监督微调和强化学习优化模型性能,在多个任务中优于现有开源和闭源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26594 2026-07-30 eess.SY cs.AI cs.SY 新提交 90%

A Physics-Informed Framework for PID Tuning of Chemical Processes Using Large Language Model Agents

基于大语言模型智能体的化工过程PID整定的物理信息框架

Zhoupeng Shou, Xiaodong Hong, Congjing Ren, Jingdai Wang, Yongrong Yang, Zuwei Liao

专题命中 指令微调 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 本研究提出一种适用于大、小语言模型的PID整定框架,将工程师整定流程形式化,通过微调Qwen3-0.6B并在测试案例中取得优异整定成功率,提升了PID整定的可靠性与稳定裕度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21003 2026-07-28 cs.AI 版本更新 90%

Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

贝叶斯-LoRA:大型语言模型的概率低秩适应

Moule Lin, Shuhao Guan, Andrea Patane, David Gregg, Goetz Botterweck

机构 * School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) School of Computer Science, University College Dublin, Dublin, Ireland(都柏林大学学院计算机科学学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出贝叶斯-LoRA,通过概率低秩表示改进LoRA,提升模型校准性,在多个常识推理基准中实现84%的ECE和76%的NLL减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23381 2026-07-22 cs.CL 版本更新 90%

Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT

Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏

Wonhyuk Lee, Youngchol Kim, Yunjin Park, Junhyung Moon, Dongyoung Jeong, Wanjin Park

专题命中 指令微调 :SFT(title,summary_cn);LLM(title);language model(abstract);分类 cs.CL

AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13753 2026-07-21 cs.CL 版本更新 90%

Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration

训练后转移置信度:对自训练微调、强化学习和在线策略蒸馏如何塑造思维链前、中、后校准的三阶段分析

Shuhao Li, Guodong Du, Anhao Zhao, Wanyu Lin, Tianyu Yuan, Xiaoyu Shen

机构 * Eastern Institute of Technology(东理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :post-training(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型训练后方法在推理中重塑置信度的情况,提出三阶段校准框架,发现不同方法在不同阶段的置信度特点,基于此提出位置感知置信策略PosConf,提升了强化学习答案聚合及在线策略蒸馏早期停止效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05285 2026-07-14 cs.LG 版本更新 90%

Attribution-Guided Continual Learning for Large Language Models

基于属性引导的大型语言模型持续学习

Yazheng Liu, Yuxuan Wan, Rui Xu, Xi Zhang, Sihong Xie, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) The Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出基于属性引导的持续学习框架,通过估计每个Transformer层中参数的重要性,调节梯度以保留旧任务知识,实验表明在持续学习基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29254 2026-06-30 cs.CL cs.NE 90%

Travel-Oriented Reasoning Large Language Model via Domain-Specific Knowledge Graphs

面向旅游的推理大语言模型:基于领域特定知识图谱

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar, Samuel Simpson, Golnaz Moallem

机构 * Expedia Group(Expedia集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出一种模块化流水线,利用专家构建的知识图谱生成多跳问答对,微调大语言模型以提升旅游领域推理的准确性和校准能力,在基准上达到82.4%精确匹配。

Comments Accepted to the Uncertainty Reasoning and Quantification in Decision Making (UDM) Workshop, KDD 2026 (To be presented in August 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 90%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27634 2026-06-29 cs.LG 新提交 90%

Continual Learning for Sequential Personalization of Small Language Models: A Stability Monitoring Analysis

小语言模型的持续学习与顺序个性化:稳定性监测分析

Thomas S. Paula, Lucas S. Kupssinskü, Rodrigo C. Barros

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS(MALTA,机器学习理论与应用实验室,PUCRS) Kunumi Institute(Kunumi研究所)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract_cn)

AI总结 研究小语言模型在顺序LoRA个性化中的灾难性遗忘问题,提出基于检查点的监测协议,利用轻量级参考集分布诊断揭示模型特定不稳定性模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23533 2026-06-29 cs.AI 新提交 90%

POTracker: Optimizing Large Language Models for Standard-Compliant Power Outage Report Generation

POTracker:优化大语言模型以生成符合标准的停电报告

Hung Phan, Aniroop Naladala, Dubey Avanindra, Supryia Chinthavali, Lunga Dalton, Ali Jannesari

机构 * Iowa State University(爱荷华州立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出POTracker,通过新损失函数POTrackerLoss同时优化文本相似度和结构相似度,微调Qwen2.5-7B-Instruct生成符合美国电力行业标准的停电报告,结构准确率达86.47%。

Comments Data Science paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17832 2026-06-19 cs.LG 新提交 90%

From Drift to Coherence: Stabilizing Beliefs in LLMs

从漂移到一致:稳定LLM中的信念

SongEun Kim, Seungyoo Lee, Edwin Fong, Hyungi Lee, Juho Lee

机构 * Department of Statistics, Seoul National University Korea Advanced Institute of Science \& Technology Department of AI, Kookmin University University of Hong Kong

专题命中 指令微调 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究LLM在多项选择问答中的信念漂移问题,提出提示式预测重采样(PPR)方法,发现信念过程会自稳定并收敛,进而提出种子答案提示策略和自一致性损失以加速稳定并提高预测一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16801 2026-06-16 cs.CL 新提交 90%

The Art of Mixology: Mixup-based Obfuscation for Privacy-Preserving Split Learning in Large Language Models

混合艺术:基于混合的混淆方法用于大型语言模型中隐私保护的分割学习

Chen Chen, Xiang Gao, Xianshun Wang, Chengran Li, Shengyu Xia, Xueluan Gong, Linru Zhang, Qian Wang, Kwok-Yan Lam

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院) School of Cyber Science and Engineering, Wuhan University, China(武汉大学网络空间安全学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出MIXGUARD框架,通过令牌级混淆、表示级混淆和自适应梯度扰动机制,在保护隐私的同时保持模型效用,实验表明其优于现有方法。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.13089 2026-06-16 cs.CL 版本更新 90%

Automatic Summarization of Doctor-Patient Encounter Dialogues Using Large Language Model through Prompt Tuning

通过提示调优使用大型语言模型自动总结医患对话

Mengxian Lyu, Cheng Peng, Xiaohan Li, Patrick Balian, Jiang Bian, Yonghui Wu

机构 * University of Florida(佛罗里达大学) University of Florida Health Cancer Center(佛罗里达大学健康癌症中心)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出通过提示调优生成式大型语言模型来自动总结医患对话,实验表明GatorTronGPT-20B模型在所有评估指标上表现最佳,且计算成本低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11256 2026-06-11 physics.chem-ph cs.LG cs.NE 新提交 90%

My Chemical Harness: Evolutionary Molecular Design over Synthetic Pathways with Large Language Model Agents

我的化学缰绳:基于合成路径的大语言模型智能体进化分子设计

César Ojeda, Darius A. Faroughy, Maryam Karimi, Payam Zarrintaj, Mir Mehdi Seyedebrahimi, Martín Carballo-Pacheco

机构 * Institute of Mathematics, Faculty of Science, University of Potsdam(数学研究所,科学学院,波茨坦大学) NHETC, Department of Physics and Astronomy, Rutgers University(NHETC,物理与天文学系,罗格斯大学) Potsdam Transfer, University of Potsdam(波茨坦转移,波茨坦大学) E3 LLC

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出一种以可执行合成路径为种群、大语言模型仅作策略控制器的进化框架,在可溶性环氧化物水解酶代理任务上达到最优性能。

Comments 27 pages | 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10989 2026-06-10 cs.AI 新提交 90%

Null-Space Constrained Low-Rank Adaptation for Response-Specified Large Language Model Unlearning

零空间约束的低秩自适应用于指定响应的大型语言模型遗忘

Bocheng Ju, Jianhua Wang, Chengliang Liu, Xiaolin Chang

机构 * Beijing Key Laboratory of Security and Privacy in Intelligent Transportation, Beijing Jiaotong University(北京交通大学智能交通信息安全与隐私保护北京市重点实验室) College of Computer Science and Technology, Taiyuan University of Technology(太原理工大学计算机科学与技术学院) Institute of Computing Technologies, China Academy of Railway Sciences Corporation Limited(中国铁道科学研究院集团有限公司计算技术研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出零空间约束响应指定遗忘框架,通过正交投影低秩参数化将LoRA更新限制在保留子空间的零空间内,在抑制遗忘知识的同时保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22017 2026-06-10 cs.LG 版本更新 90%

Domain Adapted Large Language Models for Additive Manufacturing

面向增材制造的领域自适应大语言模型

Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University(机械工程系,卡内基梅隆大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文通过约5000万token的小型数据集对开源大语言模型进行领域自适应预训练和指令微调,构建多模态领域自适应模型,在增材制造基准测试中达到90%以上准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05781 2026-06-09 cs.LG 版本更新 90%

Domain-Adapted Small Language Models with Hybrid Post-Processing: Achieving Cost-Efficient, Low-Latency Multi-Label Structured Prediction via LoRA Fine-Tuning on Scarce Data

领域自适应的小语言模型与混合后处理:通过LoRA微调在稀缺数据上实现成本高效、低延迟的多标签结构化预测

Srinivasan Manoharan, Dilipkumar Nallusamy, Sachin Kumar, Haifeng Wu

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 提出一种结合LoRA微调的小语言模型(LLaMA 3.1 8B)和确定性规则后处理的混合框架,在仅219个样本上训练,实现多标签合规评估,达到100% JSON结构有效性和83.0%人工验证准确率,成本降低46-76%。

Comments 4 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07026 2026-06-08 cs.CV cs.AI cs.MM 版本更新 90%

Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models

模态间隙驱动的子空间对齐训练范式用于多模态大语言模型

Xiaomin Yu, Yi Xin, Yuhui Zhang, Wenjie Zhang, Chonghan Liu, Hanzhen Zhao, Chen Liu, Xiaoxing Hu, Ziyue Qiao, Hao Tang, Xiaobin Hu, Chengwei Qin, Hui Xiong, Yu Qiao, Shuicheng Yan

机构 * HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) sh AILab SII Stanford(斯坦福大学) UCLA(加州大学洛杉矶分校) Yale(耶鲁大学) SJTU(上海交通大学) GBU(国防大学) PKU(北京大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 针对多模态对比学习中的模态间隙问题,提出固定帧模态间隙理论,并基于该理论设计无训练的对齐策略ReAlign和可扩展训练范式ReVision,利用无配对数据实现视觉与语言表示的高效对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16282 2026-06-03 cs.CL 90%

Instant Personalized Large Language Model Adaptation via Hypernetwork

通过超网络实现即时个性化大型语言模型自适应

Zhaoxuan Tan, Zixuan Zhang, Haoyang Wen, Zheng Li, Rongzhi Zhang, Pei Chen, Fengran Mo, Zheyuan Liu, Qingkai Zeng, Qingyu Yin, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) Amazon.com Inc(亚马逊公司) Université de Montréal(蒙特利尔大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Profile-to-PEFT框架,使用超网络将用户编码直接映射到适配器参数,实现无需用户训练的即时个性化,在降低计算成本的同时优于现有方法。

Comments accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 90%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06858 2026-05-25 physics.soc-ph cs.AI nlin.AO 90%

Disentangling Interaction and Bias Effects in Opinion Dynamics of Large Language Models

大型语言模型中意见动态的交互与偏差效应的分离

Vincent C. Brockers, David A. Ehrlich, Viola Priesemann

机构 * Max-Planck-Institute for Dynamics and Self-Organization(马克斯·普朗克动态与自组织研究所) Institute for the Dynamics of Complex Systems(复杂系统动力学研究所) University of Göttingen(哥廷根大学) Campus Institute for Dynamics of Biological Networks(校园生物网络动力学研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出贝叶斯框架分离主题偏差、同意偏差和锚定偏差,分析LLM在多步对话中的意见轨迹,发现意见快速收敛至共享吸引子,且微调可改变吸引子位置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03526 2026-05-21 cs.CL eess.AS 90%

Enhancing Speech Large Language Models through Reinforced Behavior Alignment

通过强化行为对齐增强语音大语言模型

Yansong Liu, Jiateng Li, Yuan Liu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出了一种名为强化行为对齐(RBA)的框架,通过自合成方法生成高质量对齐数据来提升语音大语言模型(SpeechLMs)的语言生成能力,实验表明该方法显著提升了SpeechLMs的指令遵循能力,并可扩展至语音问答和语音转文本翻译等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04161 2026-05-19 cs.CL 90%

Traces of Social Competence in Large Language Models

大语言模型中社会能力的踪迹

Tom Kouwenhoven, Michiel van der Meer, Max van Duijn

机构 * Leiden Institute of Advanced Computer Science(莱顿先进计算机科学研究所) Leiden University(莱顿大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);post-training(abstract)

AI总结 本文研究了大语言模型在虚假信念测试中的表现,通过贝叶斯逻辑回归分析模型大小和训练方法对社会认知能力的影响,发现模型规模扩大有助于性能提升,但并非绝对,同时指出解释命题态度会改变响应模式,进一步的推理导向微调会加剧这种影响。

Comments Presented at the 2026 Conference on Computational Natural Language Learning (CoNLL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14636 2026-05-15 cs.AI 90%

Teaching Large Language Models When Not to Know: Learning Temporal Critique for Ex-Ante Reasoning

教大语言模型何时不知:学习事前推理的临时批评

Chenlu Ding, Jiancan Wu, Yanchen Luo, Zheyuan Liu, Yancheng Yuan, Xiang Wang

机构 * University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Notre Dame(圣母大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract);prompting(abstract)

AI总结 本文研究大语言模型在时间截止下的推理失败,提出TCFT框架通过训练模型识别时间泄漏并判断响应的可接受性,实验表明其在减少时间泄漏方面优于提示和监督微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25340 2026-05-14 cs.CL 90%

Large Language Model as Token Compressor and Decompressor

大语言模型作为令牌压缩机和解压机

Wenbing Li, Yiran Wang, Zikai Song, Jielei Zhang, Tianhao Zhao, Junkai Lin, Wei Yang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL

AI总结 本文研究能否将现成的LLM适配为离散可变长度令牌压缩机和解压机以处理长上下文。设计了自表达自动编码框架,通过轻量LoRA适配器微调预训练LLM,将长文本映射为紧凑的学得潜在代码序列Z-令牌,并解码回自然语言或任务输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00195 2026-05-12 cs.LG 90%

Diversity in Large Language Models under Supervised Fine-Tuning

大型语言模型在监督微调下的多样性

Roman Klypa, Oleksandr Cherednichenko

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LJK, 38000 Grenoble, France(格勒诺布尔阿尔卑斯大学,国家科学研究中心,格勒诺布尔INP,LJK,法国格勒诺布尔) Department of Mathematics and Mathematical Statistics, Integrated Science Lab, Umeå University, Sweden(乌梅大学数学与统计学系,整合科学实验室,瑞典)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究监督微调对大型语言模型生成多样性的影响,提出TOFU损失函数以解决低频模式忽略和知识遗忘问题,验证微调后生成多样性下降,并展示TOFU提升输出多样性同时保持高质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08766 2026-05-12 cs.IR cs.CL 90%

UserGPT Technical Report

UserGPT 技术报告

Yunyi Xuan, Hao Yi, Fengling Mao, Daye Cai, Leikun Liang, Xingsheng He, Jiangnan Xie, Guoshuai Wang, Yushan Han, Wenwen Guo, Xiaoxiao Xu, Lin Qu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出UserGPT框架,通过属性生成和摘要生成提升LLM的人格理解能力,结合行为模拟引擎和数据导向语义化模块,实现对长行为历史的高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏