arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-21 至 2026-07-21 共收录 45 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 45 篇

2511.07457 2026-07-21 cs.CL cs.AI 版本更新 91%

GRIP: In-Parameter Graph Reasoning through Fine-Tuning Large Language Models

GRIP:通过微调大语言模型进行参数内图推理

Jiarui Feng, Donghong Cai, Yixin Chen, Muhan Zhang

机构 * Washington University in Saint Louis(华盛顿大学圣路易斯分校) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);post-training(abstract)

AI总结 研究如何让大语言模型适应结构数据,提出GRIP方法,通过微调任务将图关系知识内化到模型参数,存储于轻量级LoRA模块,实验表明该方法在处理大图时优于基线,处理小图时以低推理成本达可比性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21492 2026-07-21 cs.LG cs.AI cs.CL 版本更新 91%

GradAlign: Gradient-Aligned Data Selection for LLM Reinforcement Learning

GradAlign: 用于大语言模型强化学习的梯度对齐数据选择

Ningyuan Yang, Weihua Du, Weiwei Sun, Sean Welleck, Yiming Yang

机构 * Institute for Interdisciplinary Information Sciences (IIIS), Tsinghua University(交叉信息学院(IIIS)、清华大学) Language Technologies Institute (LTI), Carnegie Mellon University(语言技术研究所(LTI)、卡内基梅隆大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 GradAlign通过梯度对齐数据选择方法提升大语言模型强化学习的训练稳定性与性能。

Comments 20 pages. Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13753 2026-07-21 cs.CL 版本更新 90%

Post-Training Shifts Confidence: A Three-Stage Analysis of How SFT, RL, and OPD Shape CoT Calibration

训练后转移置信度:对自训练微调、强化学习和在线策略蒸馏如何塑造思维链前、中、后校准的三阶段分析

Shuhao Li, Guodong Du, Anhao Zhao, Wanyu Lin, Tianyu Yuan, Xiaoyu Shen

机构 * Eastern Institute of Technology(东理工学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :post-training(title,abstract);SFT(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大型语言模型训练后方法在推理中重塑置信度的情况,提出三阶段校准框架,发现不同方法在不同阶段的置信度特点,基于此提出位置感知置信策略PosConf,提升了强化学习答案聚合及在线策略蒸馏早期停止效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17456 2026-07-21 cs.CV 新提交 89%

Bio-SFT: Asymmetric Cortical Guidance and Retinal Adaptation for Robust HDR Reconstruction

Bio-SFT:用于稳健 HDR 重建的不对称皮层引导和视网膜适应

Tingyu Cheng, Ting Zhang, Chongyi Li, Zhaoqing Pan, Tiesong Zhao

机构 * College of Physics and Information Engineering, Fuzhou University(福州大学物理与信息工程学院) School of Computer Science, Nankai University(南开大学计算机科学学院) School of Electrical and Information Engineering, Tianjin University(天津大学电气与信息工程学院)

专题命中 指令微调 :SFT(title,title_cn)

AI总结 研究针对单图像 HDR 重建难题,提出 Bio-SFT 方法,它包含可学习的视网膜适应前端、小细胞 - 大细胞分裂引导及事件驱动的 SNN 硬门控模块,经训练能有效抑制暗区噪声,提高感知质量,减少伪影传播。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16580 2026-07-21 stat.AP cs.CE cs.SE 新提交 89%

Automating structural reliability analysis with a multi-agent large language model framework

使用多智能体大语言模型框架实现结构可靠性分析自动化

Jaehwan Jeon, Chang Hee Lee, Taeyong Kim

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究提出多智能体大语言模型框架,通过专门智能体处理结构可靠性分析流程,用QLoRA微调方法规划器,由确定性求解器计算结果,降低专业知识壁垒,保持计算可信度,实现结构可靠性分析自动化。

Comments 41 pages, 10 figures. Submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16991 2026-07-21 cs.LG cs.AI 版本更新 88%

Sparsity-Aware Low-Rank Representation for Efficient Fine-Tuning of Large Language Models

稀疏感知低秩表示用于大型语言模型高效微调

Longteng Zhang, Sen Wu, Shuai Hou, Zhengyu Qing, Zhuo Zheng, Danning Ke, Qihong Lin, Qiang Wang, Shaohuai Shi, Xiaowen Chu

专题命中 指令微调 :language model(title,abstract);large language model(title);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 SALR 通过结合低秩适应与稀疏剪枝,实现大型语言模型的高效微调,达到 50% 稀疏度并提升推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 88%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);SFT(abstract)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16461 2026-07-21 cs.CV 版本更新 88%

GAP-MLLM: Geometry-Aligned Pre-training for Activating 3D Spatial Perception in Multimodal Large Language Models

GAP-MLLM:几何对齐预训练以激活多模态大语言模型中的3D空间感知

Jiaxin Zhang, Junjun Jiang, Haijie Li, Youyu Chen, Kui Jiang, Dave Zhenyu Chen

机构 * Harbin Institute of Technology(哈尔滨工业大学) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Huawei(华为)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出GAP-MLLM,通过几何对齐预训练激活多模态大语言模型中的3D空间感知,改进了传统方法在3D空间感知上的不足。

Comments Accepted by ECCV 2026. Project page: https://gapmllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10848 2026-07-21 cs.CL 版本更新 86%

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning

Psyche-R1:通过统一的同理心、专业知识和推理实现可靠的心理语言模型

Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究旨在将大语言模型应用于心理领域,提出Psyche-R1模型。通过设计数据合成管道生成大量心理问题及对话,采用混合训练策略,经实验验证该模型在多个心理基准测试中有效,7B的Psyche-R1能取得与671B的DeepSeek-R1相当的结果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 85%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17575 2026-07-21 cs.AI 新提交 85%

A Dual-Hypothesis Reasoning Framework for LLM Guardrails

一种用于大语言模型护栏的双假设推理框架

Md Asiful Islam, Mihai Surdeanu

机构 * University of Arizona(亚利桑那大学)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ARBITER大语言模型护栏框架,采用双假设推理和多组件监督微调方法,用成本效益高的策略生成推理痕迹及基于LoRA微调,性能超现有方法,还能为不安全决策提供解释,在安全审核基准实验中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17043 2026-07-21 cs.CL 新提交 85%

Learning from Synthetic Data without Model Collapse in Iterative Instruction Tuning

在迭代指令微调中从合成数据学习而不发生模型崩溃

Xiaonan Luo, Yue Huang, Kehan Guo, Ping He, Chuan Zou, Ting Hua, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学) Vanderbilt University(范德堡大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究在合成数据用于指令微调时避免模型崩溃的问题,提出KITE两阶段框架,结合失败引导数据生成与边界感知不确定性整理,实验表明该框架比合成数据基线能更稳定地提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18039 2026-07-21 cs.IR 新提交 85%

Evidence-in-the-Loop: Trace-Driven Optimization for Customer-Service LLM Agents

循证优化:面向客户服务语言模型代理的跟踪驱动优化

Chunming Wu, Dafei Qiu, Congde Yuan, Charles Quan, Jun Wu, Suipeng Li, Mo Wu, Gavin Xie, Hope Chen, Max Yao

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究面向客户服务语言模型代理的优化,提出循证客户服务代理工作流程,通过多种技术构建证据,结合政策引导编排。贡献混合RAG证据构建、循证问题/行动决策、跟踪驱动的RAG和重排器改进三种部署模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16643 2026-07-21 cs.AI cs.CV 新提交 84%

Diversity-Oriented Fine-Tuning for Uncertainty-Based Hallucination Detection

基于不确定性的幻觉检测的面向多样性的微调

Qiuyuan Li, Hongliang Dai, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 指令微调 :SFT(summary_cn,abstract);preference optimization(abstract);分类 cs.AI

AI总结 研究基于不确定性的幻觉检测,提出面向多样性的微调策略,包括基于监督微调(SFT)和直接偏好优化(DPO)的方法,经实验验证可提高幻觉检测有效性,结果优于或可比现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07559 2026-07-21 cs.CL cs.AI quant-ph 版本更新 84%

Phantom Transitions in Language Model Fine-Tuning: A Density-Matrix Analysis

语言模型微调中的幻影相变

Vaibhav Prakash, Jayasri Dontabhaktuni

机构 * Mahindra University(马恒达大学)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究语言模型微调时,正确补全被近义词竞争而失败的现象,通过序参量分解信号与背景拖拽,发现两种失败模式,并揭示相变为幻影,源于softmax读出而非几何相变。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17806 2026-07-21 cs.AI 新提交 83%

PGN: Design and Implementation of a Vision-Language Navigation System Based on Pangu Multimodal Foundation Model

PGN:基于盘古多模态基础模型的视觉语言导航系统的设计与实现

Li Xian, Mingxi Li, Yizheng Wang, Yiming Shen, Qi Chen, Zhuoling Xiao

机构 * University of Electronic Science and Technology of China(电子科技大学) School of Information and Communication Engineering(信息与通信工程学院)

专题命中 指令微调 :foundation model(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于盘古多模态基础模型设计实现视觉语言导航系统PGN,训练分两阶段,先对齐视觉与语言编码器,再使模型适应专家轨迹,结合多种计算方式,在特定评估下取得一定指标,量化了离线专家动作对齐情况。

Comments 6 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17532 2026-07-21 cs.SE cs.AI 新提交 81%

CommitLLM: A Fine-Tuned Pipeline for Git Commit Message Generation

CommitLLM:用于生成Git提交消息的微调管道

Md Rafid Haque, Poojan Narendrabhai Patel, Meetkumar Vijaybhai Raychura

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.AI

AI总结 针对开发人员编写的信息不足的Git提交消息问题,提出CommitLLM管道,通过微调小语言模型、约束解码和后处理,从代码差异生成合规消息,经评估效果良好,后处理对质量提升贡献更大。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13314 2026-07-21 cs.LG cs.AI econ.EM 版本更新 81%

Tabular Foundation Models for Discrete Choice Estimation

用于离散选择估计的表格基础模型

Liu Liu, Dan Zhang

机构 * Leeds School of Business, University of Colorado Boulder(科罗拉多大学博尔德分校利兹商学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究离散选择估计中表格基础模型的应用,提出编码选择集依赖性和个体异质性的重新表述方法,在酸奶扫描仪面板数据上评估,该方法在预测准确性和速度上优于分层贝叶斯估计,为基础模型应用于消费者选择问题提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18006 2026-07-21 cs.LG cs.AI cs.CL cs.MA 新提交 80%

MADA-RL: Multi-Agent Debate-Aware Reinforcement Learning for Parameter-Efficient Reasoning in Compact Models

MADA-RL:用于紧凑模型中参数高效推理的多智能体辩论感知强化学习

Martino M. L. Pulici, Cuong Xuan Chu, Evgeny Kharlamov, Zifeng Ding, Volker Tresp, Yunpu Ma

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对紧凑模型训练成本高问题,提出MADA-RL框架,将其分为生成器和评论家角色,用辩论感知信号训练,通过LoRA微调少量参数。核心是反事实评论家优势,提高了模型准确率,在数学推理基准测试中有显著效果。

Comments 20 pages, 3 figures, 9 tables, 2 algorithms, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17599 2026-07-21 cs.CV 新提交 80%

ConsiSpace: Learning Geometric Consistency Matters for Video Spatial Reasoning

ConsiSpace:学习几何一致性对视频空间推理很重要

Ting Huang, Zhenyu Zhang, Wenyuan Huang, Jian Yang, Hao Tang

机构 * School of Intelligent Science and Technology, Nanjing University(南京大学智能科学与技术学院) School of Computer Science, Peking University(北京大学计算机科学学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对视频空间推理中现有模型难以聚合一致空间证据的问题,提出ConsiSpace框架,通过构建几何一致内存及采用统一一致性自监督强化学习,在三个空间推理基准测试上取得成绩提升,平均得分比最强基线高12.6分。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16635 2026-07-21 cs.CV cs.AI 新提交 79%

TellTale: Blending Multi-Instance LoRA Text Encoders and a Zero-Shot LLM Judge for Ambivalence/Hesitancy Recognition in Videos

TellTale:融合多实例LoRA文本编码器和零样本大语言模型判断器用于视频中的矛盾/犹豫识别

Abdel-Karim Al-Tamimi, Ali Rodan

机构 * Sheffield Hallam University(谢菲尔德哈勒姆大学) Yarmouk University(亚尔穆克大学) The University of Jordan(约旦大学)

专题命中 指令微调 :LLM(title,abstract);分类 cs.AI

AI总结 TellTale旨在解决视频中矛盾/犹豫识别问题,它融合多实例LoRA文本编码器和零样本大语言模型判断器,结合三个概率流,在BAH数据集上取得优异成绩,相比官方基于视觉的基线有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16325 2026-07-21 cs.CV cs.LG 新提交 79%

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

RegionFM:使用基础模型嵌入进行可解释的基于区域的脑MRI分类

Wei Zhang

机构 * L3S Research Center(L3S研究中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对脑MRI基础模型预测难解释问题,提出RegionFM框架,将解剖分割与基础模型嵌入结合,通过划分区域、编码嵌入及构建模型组合,用于认知障碍分类评估,在保持性能同时使解释与临床推理更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18082 2026-07-21 cs.CL cs.HC 版本更新 79%

Octo-planner: On-device Language Model for Planner-Action Agents

Octo-planner:用于规划-行动智能体的设备端语言模型

Wei Chen, Zhiyuan Li, Zhen Guo, Yikang Shen

机构 * Nexa AI & Stanford(Nexa AI 与 斯坦福大学) MIT EECS(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(麻省理工-IBM Watson AI 实验室)

专题命中 指令微调 :language model(title);LLM(abstract);分类 cs.CL

AI总结 研究如何让人工智能智能体有效规划行动,提出设备端规划-行动框架,分离规划与行动执行组件,用模型微调优化性能,多LoRA训练方法应对多域规划挑战,在域内测试成功率达97%,并开源模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00454 2026-07-21 cs.LG cs.AI 版本更新 79%

Rooted Absorbed Prefix Trajectory Balance with Submodular Replay for GFlowNet Training

基于子模重放的根吸收前缀轨迹平衡用于GFlowNet训练

Xi Wang, Wenbo Lu, Shengjie Wang

机构 * Courant Institute School of Mathematics, Computing, and Data Science, New York University(纽约大学Courant研究所数学、计算与数据科学学院) Courant Institute School of Mathematics, Computing(纽约大学Courant研究所数学、计算与数据科学学院) Data Science, New York University(纽约大学数据科学学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对GFlowNet的模式坍塌问题,提出RapTB目标函数(通过根锚定子轨迹监督和吸收后缀备份提供密集前缀学习信号)和SubM子模重放策略(促进高奖励和多样性),在分子生成等任务中提升优化性能和多样性。

Journal ref Forty-third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17052 2026-07-21 cs.CV 新提交 78%

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

寻找特定任务的视觉路径:跨视觉语言模型的进化块剪枝

Tarun Tomar

机构 * IIIT(国际信息技术研究所)

专题命中 指令微调 :language model(title,abstract)

AI总结 研究视觉语言模型中能否跳过固定预算视觉块组合,引入源平衡进化搜索并与其他方法比较,实验表明组合搜索可改进路由构建,但能力标签不能定义普遍可转移视觉路径,搜索能跨架构转移,能力专业化稳定性欠佳。

Comments 14 pages, 8 figures. Code and aggregate evidence: https://github.com/TarunTomar122/vision-pathways

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16244 2026-07-21 cs.LG cs.AI cs.CL 新提交 78%

CIGPO: Contextual Information-Gain Policy Optimization for Multi-Turn Evidence-Reading LLM Agents

CIGPO:用于多轮证据阅读语言模型代理的上下文信息增益策略优化

Hao Dou

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :LLM(title);分类 cs.CL、cs.AI、cs.LG

AI总结 研究多轮证据阅读语言模型代理训练不稳定问题,提出CIGPO方法,通过方差注入策略,利用冻结参考模型对数似然边际增加作逐轮信号,避免奖励方差崩溃,在HotpotQA实验中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16808 2026-07-21 cs.CL 新提交 74%

Schema-Constrained Document-Level Event Argument Extraction with Lightweight LLM Fine-Tuning

基于轻量级语言模型微调的模式约束文档级事件论元抽取

Roberto Pietrantuono, Antonio Guerriero, Pouya Sattari

机构 * University of Naples Federico II(那不勒斯费德里科二世大学) University of Salerno(萨勒诺大学)

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 研究文档级模式约束事件论元抽取,结合角色集注入、参数高效监督微调及确定性解码后处理方法,使微调后的中型开放模型在MAVEN-ARG评估中优于GPT基线,最好模型在事件共指级别达42.39% F1值。

Comments Accepted at ECML PKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16252 2026-07-21 cs.LG cs.AI 新提交 73%

SOS-LoRA: Static Orthogonal-Subspace Low-Rank Adaptation with Fixed Multi-Scale Scaling

SOS-LoRA:具有固定多尺度缩放的静态正交子空间低秩自适应

Yupeng Chang, Yuan Wu, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动的人机智能工程研究中心) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型中LoRA方法的不足,提出SOS-LoRA,将秩更新重参数化为多个静态低秩专家之和,通过分解总秩、固定多尺度缩放及正交初始化等,实现性能提升且可完全合并,实验证明其优于基线和变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17620 2026-07-21 cs.LG cs.CL math.OC 新提交 73%

PoLoRA: A Preconditioned Orthogonalized LoRA Optimizer

PoLoRA:一种预处理正交化的LoRA优化器

Nikhil Ghosh, Tetiana Parshakova, Robert M. Gower

机构 * Center for Computational Mathematics, Flatiron Institute(计算数学中心,熨斗研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对LoRA优化问题,提出PoLoRA优化器,由乘积感知谱更新方向、曲率预处理及幅度规则构成。在多模型指令调优数据集上评估,结果显示它步数减少,开销增加少,对学习率不敏感,最优学习率稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16412 2026-07-21 cs.AI 新提交 70%

Interactive Task Alignment as a POMDP

作为部分可观测马尔可夫决策过程的交互式任务对齐

Andy Dai, Zexue He, Zhenyu Zhang, Alex Pentland, Jiaxin Pei

机构 * Stanford University(斯坦福大学)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 研究语言模型在面对模糊用户任务时的任务对齐问题,引入基于部分可观测马尔可夫决策过程的框架,通过用户研究验证,发现模型任务对齐困难,训练能改善但仍落后于人类,揭示其缺乏关键交互能力。

详情

展开后加载摘要…

URL PDF HTML 收藏