arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-29 至 2026-05-29 共收录 535 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 35 篇

2603.02082 2026-05-29 cs.CL 57%

What Exactly do Children Receive in Language Acquisition? A Case Study on CHILDES with Automated Detection of Filler-Gap Dependencies

儿童在语言习得中究竟获得了什么?基于CHILDES的填充词-空位依赖自动检测案例研究

Zhenghao Herbert Zhou, William Dai, Maya Viswanathan, Simon Charlow, R. Thomas McCoy, Robert Frank

机构 * Department of Linguistics, Yale University(耶鲁大学语言学系) Department of Computer Science, Yale University(耶鲁大学计算机科学系) Wu Tsai Institute, Yale University(耶鲁大学吴氏研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 通过自动检测英语口语语料中的三种核心填充词-空位结构,量化儿童语言输入中的分布证据,并分析儿童产出轨迹,为先天语法知识与统计学习之争提供数据支持。

Comments Camera-ready version accepted to CoNLL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29358 2026-05-29 cs.AI 57%

Scaling Monosemanticity: Extracting Interpretable Features from Claude 3 Sonnet

扩展单一语义性:从Claude 3 Sonnet中提取可解释特征

Adly Templeton, Tom Conerly, Jonathan Marcus, Jack Lindsey, Trenton Bricken, Brian Chen, Adam Pearce, Craig Citro, Emmanuel Ameisen, Andy Jones, Hoagy Cunningham, Nicholas L Turner, Callum McDougall, Monte MacDiarmid, Alex Tamkin, Esin Durmus, Tristan Hume, Francesco Mosconi, C. Daniel Freeman, Theodore R. Sumers, Edward Rees, Joshua Batson, Adam Jermyn, Shan Carter, Chris Olah, Tom Henighan

机构 * Anthropic

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 本研究通过稀疏自编码器从生产级语言模型Claude 3 Sonnet中提取可解释特征,验证了字典学习方法在大规模模型上的可扩展性,并分析了特征的多语言、多模态特性及其对模型行为的因果影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28940 2026-05-29 hep-ph cs.LG hep-ex physics.data-an 57%

Neural Scaling Laws for Jet Generation

喷注生成的神经缩放定律

Oz Amram, Darius A. Faroughy, Tjarko Gerdes, Anna Hallin, Gregor Kasieczka, Michael Krämer, Humberto Reyes-Gonzalez, David Shih

机构 * Fermi National Accelerator Laboratory(费米国家加速器实验室) Rutgers University(罗格斯大学) Institute for Experimental Physics, Universität Hamburg(汉堡大学实验物理研究所) Institute for Theoretical Particle Physics and Cosmology, RWTH Aachen University(亚琛工业大学理论粒子物理与宇宙学研究所)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本文首次探索粒子喷注生成任务中的缩放定律,发现模型大小缩放遵循对数定律,并证明下一个标记预测验证损失与物理性能单调相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10765 2026-05-29 cs.LG 57%

Collaborative Threshold Watermarking

协作阈值水印

Tameem Bakr, Anish Ambreth, Nils Lukas

机构 * Department of Machine Learning, MBZUAI(机器学习系,MBZUAI)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 针对联邦学习中多客户端模型溯源问题,提出 (t,K)-阈值水印协议,通过秘密共享水印密钥实现至少 t 个客户端协作验证,且抵抗少于 t 客户端的共谋攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27607 2026-05-29 cs.CV cs.RO 50%

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

双流扩散用于世界模型增强的视觉-语言-动作模型

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin

机构 * Kim Jaechul Graduate School of AI, Korea Advanced Institute of Technology, Seoul, Republic of Korea(金 Jaechul 人工智能研究生院,韩国科学技术院,首尔,大韩民国)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出DUST框架,通过双流扩散Transformer和异步采样方法,解决世界模型增强的视觉-语言-动作模型中的模态差距问题,在模拟和真实任务中取得显著性能提升。

Comments Accepted at ICML 2026. Project page at https://periphanes.github.io/dust (20 pages, 10 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 54 篇

2605.29303 2026-05-29 cs.AI 92%

Entropy-KL Divergence-based Token Masking: A Novel Approach for Selective Fine-tuning of Large Language Models

基于熵-KL散度的令牌掩码:一种用于大语言模型选择性微调的新方法

Qi Liu, Mingdi Sun, Yongyi He, Zhi Zheng, Tong Xu, Yi Zheng, Zhefeng Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Cloud(华为云)

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)

AI总结 针对低数据场景下标准监督微调导致模型分布偏移的问题,提出EKSFT方法,通过选择性掩码高熵或高KL散度的令牌,在注入任务知识的同时保持预训练分布完整性,在数学推理基准上优于标准SFT并提升后续RL性能。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 92%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL 92%

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30148 2026-05-29 cs.LG cs.AI 92%

Overcoming Forgetting in LLM Fine-Tuning with Evolution Strategies

克服LLM微调中的遗忘:进化策略方法

Kajetan Schweighofer, Conor F. Hayes, Roberto Dailey, Risto Miikkulainen, Xin Qiu

机构 * Cognizant AI Lab(Cognizant AI实验室) UT Austin(得克萨斯大学奥斯汀分校)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文发现进化策略微调中的先前任务遗忘实为性能漂移且可恢复,并引入锚定权重衰减(AWD)正则化技术有效稳定先前任务性能,表明遗忘可避免,使ES成为LLM持续学习的可行方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29394 2026-05-29 cs.AI 92%

EvoMD-LLM: Learning the Language of Species Evolution in Reactive Molecular Dynamics

EvoMD-LLM:学习反应分子动力学中物种进化的语言

Zhichen Tang, Zhengzheng Dang, Yulin Chen, Jixin Wu, Haiwen Li, Yanming Wang

机构 * Global College, Shanghai Jiao Tong University(上海交通大学全球学院) Global Institute of Future Technology, Shanghai Jiao Tong University(上海交通大学未来技术全球研究院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出EvoMD-LLM框架,将反应分子动力学轨迹离散化为符号时间序列,通过时间脚手架机制使自回归大语言模型学习物种组成演化,在多项时间预测任务上优于基线模型,并能生成可解释性预测。

Comments 17 pages, ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30247 2026-05-29 cs.LG cs.MM 91%

OOD-GraphLLM: Graph Large Language Model for Out-of-Distribution Generalized Drug Synergy Prediction

OOD-GraphLLM:面向分布外泛化的药物协同预测图大语言模型

Xin Wang, Linxin Xiao, Yang Yao, Wenwu Zhu

机构 * DCST, BNRist, Tsinghua University(国防科技大学、北京理工大学、清华大学) DCST, Tsinghua University(国防科技大学、清华大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);instruction tuning(abstract)

AI总结 针对药物协同预测中因新化合物导致的分布外偏移问题,提出OOD-GraphLLM框架,通过联合优化分子图表示与生物医学语义语言表示实现准确预测。

Comments 12 pages, 9 figures, ACM KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30014 2026-05-29 cs.AI 91%

From GPS Points to Travel Patterns: Flexible and Semantic Trajectory Generation with LLMs

从GPS点到出行模式:基于LLM的灵活语义轨迹生成

Silin Zhou, Chenhao Wang, Yuntao Wen, Shuo Shang, Lisi Chen, Panos Kalnis

机构 * University of Electronic Science and Technology of China(电子科技大学) King Abdullah University of Science and Technology(国王阿卜杜勒·阿齐兹大学)

专题命中 指令微调 :LLM(title_cn,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出HTP方法,通过层次化生成出行模式再生成GPS点,利用LLM和RQ-VAE实现灵活、语义丰富的轨迹生成,在质量上平均提升29.78%。

Comments This paper is accepted by KDD2026 second round

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29427 2026-05-29 cs.CL 91%

FinGuard: Detecting Financial Regulatory Non-Compliance in LLM Interactions

FinGuard:检测LLM交互中的金融监管违规

Huaixia Dou, Jie Zhu, Minghao Wu, Shuo Jiang, Junhui Li, Lifan Guo, Feng Chen, Chi Zhang

机构 * Qwen DianJin Team, Alibaba Cloud Computing(阿里云计算Qwen金融团队) Tongyi Lab, Alibaba Group(阿里集团通义实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对金融领域LLM交互中的监管违规检测问题,提出基于监管文档的自动化管道,构建首个金融合规检测基准FinGuard-Bench,并训练FinGuard模型,在基准上显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21909 2026-05-29 cs.AI cs.CL 91%

From Meta-Thought to Execution: Cognitively Aligned Post-Training for Generalizable and Reliable LLM Reasoning

从元思维到执行:面向通用且可靠的大语言模型推理的认知对齐后训练

Shaojie Wang, Liang Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 指令微调 :LLM(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出一种认知启发的两阶段后训练框架,通过元思维链监督学习通用策略和置信度校准强化学习优化执行可靠性,在分布内和分布外分别提升2.10%和3.86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30334 2026-05-29 cs.AI cs.CL 90%

Demystifying Data Organization for Enhanced LLM Training

揭秘数据组织以增强大语言模型训练

Yalun Dai, Yangyu Huang, Tongshen Yang, Yonghan Wang, Xin Zhang, Wenshan Wu, Qihao Zhao, Hao Li, Yuanyuan Gao, Kim-Hui Yap, Scarlett Li

机构 * Nanyang Technological University(南洋理工大学) Microsoft Research(微软研究院) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文系统探索数据组织对大语言模型训练的影响,提出边界锐化、循环调度、课程连续性和局部多样性四项优化准则,并基于此设计了两种新的数据排序方法STR和SAW,实验验证了其在预训练和微调阶段的有效性。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24846 2026-05-29 cs.LG cs.AI 90%

Tiny Brains, Giant Impact: Uncovering the Keystone Neurons of LLM with Just a Few Prompts

微小大脑,巨大影响:仅用少量提示揭示LLM的关键神经元

Xiangtian Ji, Yuxin Chen, Zhengzhou Cai, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究通过跨任务激活强度分析,发现大型语言模型中存在一组极其稀疏的关键神经元,其移除会导致模型行为崩溃,并基于此提出仅更新关键神经元的微调方法,在少量参数修改下达到与全参数微调相当或更优的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05614 2026-05-29 cs.CL cs.AI 90%

GroundAct: Can LLM Agents Ground Actions in Environmental States?

GroundAct:LLM智能体能否在环境状态中实现动作落地?

Zixuan Wang, Dingming Li, Hongxing Li, Yanrui Miao, Shuo Chen, Yuchen Yan, Wenqi Zhang, Yongliang Shen, Weiming Lu, Jun Xiao, Yueting Zhuang

机构 * Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本研究提出GroundAct基准,通过1500个场景和16592个任务实例评估15个LLM,发现动作落地能力是多维挑战,不能仅通过模型规模解决。

Comments Project Page: https://zju-real.github.io/OmniEmbodied Code: https://github.com/ZJU-REAL/OmniEmbodied

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29408 2026-05-29 nucl-th 90%

Large language model for unified and accurate description of multidimensional nuclear properties

用于统一准确描述多维核性质的大型语言模型

S. J. Guo, S. Y. Wang, E. H. Wang, Z. M. Niu, Y. M. Ding

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出一种先验信息增强的大型语言模型多任务学习框架,通过低秩适配微调预训练模型,在电荷半径、质量、结合能、分离能和衰变能等七个可观测量上实现了超过98%的训练损失降低,为核物理多任务回归提供了高效共享方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30076 2026-05-29 cs.CL 90%

UniSteer: Text-Guided Flow Matching in Activation Space for Versatile LLM Steering

UniSteer: 文本引导的激活空间流匹配用于多功能LLM引导

Yingdong Shi, Ruiming Zhang, Changming Li, Zhiyu Yang, Kaixing Zhang, Jingyi Yu, Kan Ren

机构 * ShanghaiTech University(上海科技大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出UniSteer,一种文本引导的激活流匹配模型,通过学习残差流激活的条件分布,实现统一的行为控制、真实性引导、细粒度概念引导、多约束指令遵循和激活空间分类。

Comments 16 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29559 2026-05-29 cs.CL 90%

LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents

LiteCoder-Terminal: 扩展用于学习语言代理的长时程终端环境

Xiaoxuan Peng, Kaiqi Zhang, Xinyu Lu, Boxi Cao, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language agent(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出零依赖合成框架LiteCoder-Terminal-Gen,自动生成可执行且可验证的终端训练环境,构建大规模SFT和RL数据集,通过监督微调和直接多轮偏好优化显著提升语言代理在终端任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29401 2026-05-29 cs.LG 90%

Rethinking Post-Training Recipes for Multimodal Time-Series Forecasting

重新思考多模态时间序列预测的后训练方法

Haoxin Liu, Yichen Zhou, Rajat Sen, B. Aditya Prakash, Abhimanyu Das

机构 * Georgia Institute of Technology(佐治亚理工学院) Google Research(谷歌研究)

专题命中 指令微调 :post-training(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);foundation model(abstract)

AI总结 提出PostTime后训练方法,结合监督微调和基于可验证奖励的强化学习,利用大语言模型根据多模态上下文修正数值时间序列基础模型的预测,显著提升多模态时间序列预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29000 2026-05-29 cs.CL 90%

Text-Preserving Lossy Text Compression: A Study of Strategic Deletion and LLM Reconstruction

保留文本的有损文本压缩:策略性删除与LLM重建研究

Yuchun Zou, Junhong Tong, Jun Li

机构 * CUNY Graduate Center(纽约大学研究生中心) CUNY Queens College(纽约大学皇后学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究有损语义文本压缩,通过策略性删除文本并用大语言模型重建,比较多种删除策略,发现词频删除是低成本基线,语义方法在中度压缩时优势明显,QLoRA微调可得到强解码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15180 2026-05-29 cs.AI 89%

PuzzleClone: A DSL-Powered Framework for Synthesizing Verifiable Data

PuzzleClone: 一种基于DSL的可验证数据合成框架

Kai Xiong, Yanwei Huang, Rongjunchen Zhang, Kun Chen, Haipang Wu, Yingcai Wu

机构 * HiThink Research(HiThink研究院) HKUST(香港科技大学) Zhejiang University(浙江大学)

专题命中 指令微调 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出PuzzleClone框架,通过DSL驱动的方法合成大规模、高可靠、多样化的可验证数学逻辑数据集,并构建PC-83K基准,实验表明后训练能显著提升LLM在逻辑与数学任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14399 2026-05-29 cs.CV 89%

Multi-Turn Adaptive Prompting Attack on Large Vision-Language Models

多轮自适应提示攻击对大型视觉-语言模型

In Chong Choi, Jiacheng Zhang, Feng Liu, Yiliao Song

机构 * The University of Melbourne(墨尔本大学) The University of Adelaide(阿德莱德大学)

专题命中 指令微调 :language model(title,abstract);prompting(title,abstract);large language model(abstract)

AI总结 提出多轮自适应提示攻击(MAPA),通过交替文本-视觉攻击动作和跨轮迭代调整攻击轨迹,显著提升对大型视觉-语言模型的多轮越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11171 2026-05-29 cs.CL cs.AI 88%

A Language-Guided Bayesian Optimization for Efficient LoRA Hyperparameter Search

语言引导的贝叶斯优化用于高效LoRA超参数搜索

Baek Seong-Eun, Lee Jung-Mok, Kim Sung-Bin, Tae-Hyun Oh

机构 * Grad. School of AI, POSTECH, Pohang, Korea(POSTECH人工智能研究生院,韩国坡安) School of EE, KAIST, Daejeon, Korea(韩国科学技术院电子工程学院,韩国大田) School of Computing, KAIST, Daejeon, Korea(韩国科学技术院计算学院,韩国大田)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一种利用预训练LLM领域知识的贝叶斯优化框架,通过语言提示将超参数映射到连续空间,结合子集训练代理评估,仅需约30次迭代即可发现比标准超参数提升20%以上性能的LoRA超参数。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29009 2026-05-29 cs.LG cs.AI 88%

Label-Free Reinforcement Learning via Cross-Model Entropy

无标签强化学习:跨模型熵方法

Matt Gorbett, Hossein Shirazi

机构 * Independent Researcher(独立研究者) San Diego State University(圣地亚哥州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出跨模型熵(CME)作为无标签奖励信号,用于强化学习后训练大语言模型,在开放指令遵循任务上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29816 2026-05-29 cs.AI 88%

Harnessing non-adversarial robustness in large language models

利用大语言模型中的非对抗鲁棒性

Qinghua Zhou, Ellina Aleshina, Andrey Lovyagin, Oleg Somov, Mikhail Seleznyov, Alexander Panchenko, Ivan Oseledets, Elena Tutubalina, Ivan Y. Tyukin

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所) King's College London, London, UK(伦敦国王学院) International Joint Laboratory of AI for Industry, QUST, Qingdao, China(工业人工智能联合实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过理论分析和实验,提出了一种基于去偏的微调方法,以提升大语言模型对语义相似但文本不同的提示的鲁棒性,并提供了认证保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06431 2026-05-29 cs.AI 88%

LsrIF: Enhancing Logic-Structured Instruction Following of Large Language Models

LsrIF: 增强大语言模型的逻辑结构化指令遵循能力

Qingyu Ren, Qianyu He, Jingwen Chang, Geng Zhang, Jiajie Zhu, Xingzhou Chen, Zhuofei Shi, Jiaqing Liang, Yanghua Xiao, Han Xia, Zeye Sun, Fei Yu

机构 * Shanghai Key Laboratory of Data Science, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学数据科学重点实验室,计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 提出LsrIF框架,通过构建并行、顺序、条件和嵌套结构的原子约束数据,并采用结构感知的奖励聚合方法,提升大语言模型在逻辑结构化指令遵循任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28822 2026-05-29 cs.CL 87%

Lightweight Multimodal LLM-Enabled Cost-Effective Defect Grading of Power Transmission Equipment

轻量级多模态大语言模型驱动的输电设备经济高效缺陷分级

Tao Wang, Lipeng Zhu, Jiayong Li, Feng Gao, Siwen Liang

专题命中 指令微调 :LLM(title);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出基于多模态大语言模型的缺陷分级框架,通过上下文学习最大化商业模型潜力,并利用链式思考问答对微调轻量级模型,实现低成本高精度分级。

Comments 9pages, 6figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30260 2026-05-29 cs.CL cs.AI cs.CV cs.LG 87%

How LoRA Remembers? A Parametric Memory Law for LLM Finetuning

LoRA如何记忆?大语言模型微调的参数记忆定律

Ziwen Xu, Haiwen Hong, Linsong Yu, Benglei Cui, Longtao Huang, Hui Xue, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出参数记忆定律,揭示LoRA在微调中参数与序列长度对损失降低的幂律关系,并基于此设计MemFT优化策略提升记忆保真度与效率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏