arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 5534 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 430 篇

2606.31413 2026-07-31 cs.AI cs.LG 版本更新 73%

Learning to Select, Not Relearn: Hard-Routed Mixtures of Reasoning LoRAs

学会选择,而非重新学习:硬路由推理LoRA混合

Seyed Alireza Molavi, Zhan Su, Yan Hu, Peyman Sheikholharam Mashhadi, Stefan Byttner, Prayag Tiwari

机构 * Halmstad University(哈尔姆斯塔德大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出硬路由MoR-LoRA框架,通过硬top-1路由组合冻结的推理LoRA专家,保留专家行为且可训练参数少于软路由方法。

Comments Code available at: https://github.com/sar-molavi/hard-routed-mor-lora

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10497 2026-07-31 cs.CL cs.AI 版本更新 73%

Hallucinations and Truth: A Comprehensive Accuracy Evaluation of RAG, LoRA and DoRA

幻觉与真相:RAG、LoRA和DoRA的综合准确率评估

Mohammad Baqar, Rajat Khanda

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文评估RAG、LoRA、DoRA在2万条FAQ查询、40万条知识库上的性能,发现DoRA准确率90.1%、相关性0.88、延迟110毫秒最优,为高准确率领域部署生成式AI提供指导。

Comments 10 Pages

Journal ref 2026 2nd International Conference on Federated Learning and Intelligent Computing Systems (FLICS), 10.1109/FLICS70075.2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00192 2026-07-30 cs.LG cs.AI 版本更新 73%

Train Large, Deploy Compact: Structured Compression for Compact Low-Rank Adaptation

大模型训练,紧凑部署:用于紧凑低秩适配的结构化压缩

Xin Yu, Cong Xie, Xunmei Liu, Tiantian Fan, Lingzhou Xue, Zhi Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对LoRA表征能力不足的问题,提出PrunedLoRA框架,通过动态结构化剪枝实现自适应秩分配,在多项微调任务中性能优于LoRA及其变体和现有结构化剪枝方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20785 2026-07-23 cs.AI cs.LG 版本更新 73%

Fara-1.5: Scalable Learning Environments for Computer Use Agents

Fara-1.5:面向计算机使用智能体的可扩展学习环境

Ahmed Awadallah, Sahil Gupta, Yash Lara, Yadong Lu, Hussein Mozannar, Akshay Nambi, Zach Nussbaum, Yash Pandya, Aravind Rajeswaran, Corby Rosset, Alexey Taymanov, Luiz do Valle, Vibhav Vineet, Spencer Whitehead, Andrew Zhao

机构 * Microsoft(微软)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出FaraGen1.5数据流水线,结合真实网站与合成环境生成训练数据,通过三个互补验证器评分,训练出Fara1.5系列模型,在浏览器使用基准上达到新最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05493 2026-07-22 cs.CL cs.AI cs.MA 版本更新 73%

LinguistAgent Technical Report: A Reflective Multi-Model Platform for Automated Linguistic Annotation

LinguistAgent: 一个用于自动化语言标注的反思多模型平台

Bingru Li

机构 * University of Birmingham(伯明翰大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LinguistAgent通过反思多模型架构实现自动化语言标注,采用双代理工作流程模拟同行评审,支持多种标注范式并提供实时评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.01514 2026-07-20 cs.CL cs.AI cs.CR 版本更新 73%

Decoupled Alignment for Robust Plug-and-Play Adaptation

用于鲁棒即插即用适应的解耦对齐

Haozheng Luo, Jiahao Yu, Wenxin Zhang, Jialong Li, Chenghao Qiu, Yimin Wang, Eric Hanchen Jiang, Jerry Yao-Chieh Hu, Yan Chen, Binghui Wang, Xinyu Xing, Han Liu

机构 * Northwestern University(西北大学) New York University Abu Dhabi(纽约大学阿布扎克分校) Stanford University(斯坦福大学) Texas A&M University(德克萨斯农工大学) University of California, Los Angeles(加州大学洛杉矶分校) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出无需训练的大语言模型对齐方法,利用知识蒸馏提取对齐信号,经模型融合实现即插即用的对齐校正,采用增量调试识别关键知识组件,在有害问题数据集上显著提升防御成功率,且不损性能。

Comments Revised to correct the Acknowledgments section. Previous versions inadvertently included acknowledgments of NSF and NIH awards that did not support this work. Those funding acknowledgments have been removed. The technical content, results, and conclusions are unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06142 2026-07-07 cs.CL cs.AI 版本更新 73%

IRC-Bench: Recognizing Entities from Contextual Cues in First-Person Reminiscences

IRC-Bench: 从第一人称回忆中的上下文线索识别实体

Yehudit Aperstein, Eden Moran, Alexander Apartsin

机构 * Intelligent Systems, Afeka Academic College of Engineering(阿法卡学术工程学院智能系统) School of Computer Science, Faculty of Sciences, Holon Institute of Technology(霍隆理工学院计算机科学学院)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出IRC-Bench基准,用于评估回忆文本中隐式实体识别任务,通过对比本地提及与分散叙述证据,探讨非局部性挑战,测试多种模型配置。

Comments 36 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19266 2026-06-29 cs.CL cs.AI 版本更新 73%

FormalASR: End-to-End Spoken Chinese to Formal Text

FormalASR: 语音中文到正式文本的端到端系统

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出FormalASR,一种端到端的中文语音到正式文本转换模型,通过构建大规模的语音到正式文本数据集,并使用Qwen3-ASR进行微调,实现了比原声基线减少37.4%的CER,同时提升了ROUGE-L和BERTScore指标,提供了一个轻量级的设备端解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11061 2026-06-26 cs.LG cs.CL 版本更新 73%

Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs

虚假奖励悖论:从机制上理解RLVR如何在LLMs中激活记忆捷径

Lecheng Yan, Ruizhe Li, Guanhua Chen, Qing Li, Jiahui Geng, Wenxi Li, Longyue Wang, Chenyang Lyu

机构 * University of Science and Technology of China(中国科学技术大学) University of Aberdeen(阿伯丁大学) University of Birmingham(伯明翰大学) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究RLVR中虚假奖励导致模型依赖记忆而非推理的机制,发现锚定-适配器电路,并通过因果干预验证其作用。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23638 2026-06-15 cs.LG cs.AI 版本更新 73%

FedRot-LoRA: Mitigating Rotational Misalignment in Federated LoRA

FedRot-LoRA: 缓解联邦LoRA中的旋转偏移

Haoran Zhang, Dongjun Kim, Seohyeon Cha, Haris Vikalo

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出FedRot-LoRA框架,通过正交变换对齐客户端更新以减少子空间不匹配,提升联邦LoRA在异质数据下的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06573 2026-06-12 cs.CL cs.AI 版本更新 73%

WildIFEval: Instruction Following in the Wild

WildIFEval: 野外指令遵循

Gili Lior, Asaf Yehudai, Ariel Gera, Liat Ein-Dor

机构 * The Hebrew University of Jerusalem(希伯来大学杰里科分校) IBM Research(IBM研究院)

专题命中 指令微调 :LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 提出WildIFEval数据集,包含7K条真实用户的多约束指令,用于评估LLM的指令遵循能力,发现所有模型仍有较大改进空间。

Comments Accepted to the 5th Workshop on Generation, Evaluation and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12612 2026-06-09 cs.LG cs.AI 版本更新 73%

Learning Task Mixtures from Task Affinities: A Probabilistic Graphical Model for Supervised Fine-Tuning

学习什么是重要的:通过互信息的概率任务选择用于模型微调

Prateek Chanda, Saral Sureka, Parth Pratim Chatterjee, Krishnateja Killamsetty, Nikhil Shivakumar Nayak, Ganesh Ramakrishnan

机构 * IIT Bombay(印度理工学院班加罗尔分校) IBM Research(IBM研究) Red Hat AI Innovation(红帽AI创新) MIT-IBM Watson AI Lab(麻省理工-IBM沃森AI实验室)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TaskPGM框架,通过基于能量的任务模型学习连续任务混合,利用互信息和行为分歧来捕捉任务间的关系,从而在任务覆盖和冗余之间取得平衡,提升大语言模型的监督微调性能。

Comments 9, 8 tables, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01850 2026-06-08 cs.CV cs.AI cs.LG cs.MM 版本更新 73%

MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs

MoDA: 面向指令型多模态大语言模型的细粒度视觉定位的调制适配器

Wayner Barrios, Andrés Villa, Juan León Alcázar, SouYoung Jin, Bernard Ghanem

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MoDA调制适配器,通过指令引导的通道级乘法调制增强细粒度视觉定位,在12个基准上对三种MLLM架构取得一致提升,计算开销极小。

Comments Accepted at ICML 2026. Code is available at https://github.com/waybarrios/MoDA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08208 2026-07-17 cs.CL 版本更新 72%

Diarization-Guided Qwen-ASR Adaptation for Multilingual Two-Speaker Conversational Speech

用于多语言双说话者对话语音的基于语音分离引导的Qwen-ASR适配

Hao Wu, RongQi Han, Zhen Wang, Wei Liang, Wei Xu

专题命中 指令微调 :SLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对多语言双说话者对话语音,设计了结合语音分离前端与适配Qwen3-ASR-1.7B识别器的系统。通过多步微调及强化学习适配ASR模型,在挑战赛中取得较好成绩,消融实验显示各部分对提升性能和鲁棒性的作用。

Comments Accepted by Interspeech 2026 MLC-SLM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05813 2026-06-18 eess.AS 版本更新 71%

Activation Steering for Accent Adaptation in Large Audio Language Models

大型音频语言模型中口音适应的激活引导

Jinuo Sun, Yang Xiao, Sung Kyun Chung, Qiuchi Hu, Gongping Huang, Eun-Jung Holden, Ting Dang

专题命中 指令微调 :language model(title)

AI总结 提出激活引导方法,通过识别编码器中间层的口音敏感子空间,在推理时直接调整表示,无需参数更新,在八个口音上降低词错误率。

Comments Accepted by Interspeech 2026. 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16382 2026-08-12 cs.CL 版本更新 70%

LiFT: How to Enable In-Context Learning for Longitudinal Modelling

LiFT:指令微调是否通过增强上下文学习提高大型语言模型的纵向建模能力?

Iqra Ali, Talia Tseriotou, Mahmud Elahi Akhter, Yuxiang Zhou, Maria Liakata

机构 * Queen Mary University of London(伦敦玛丽女王大学) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 LiFT框架通过统一的指令方案整合多种纵向建模任务,利用渐进增加的时间难度课程和少样本结构进行训练,提升模型对历史上下文的有效利用,实验显示其在不同参数规模模型上均优于基础模型的上下文学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06233 2026-08-11 cs.AI 版本更新 70%

Demonstrating TOFFEE: A Learned System for Synthesizing Data Agent Trajectories at Scale

展示TOFFEE:一个大规模合成数据代理轨迹的学习系统

Ziting Wang, Yin Li, Zuhao Yang, Xiuchang Li, Jiale Bai, Gao Cong

机构 * Nanyang Technological University(南洋理工大学) Huawei(华为) Industrial and Commercial Bank of China Limited(中国工商银行)

专题命中 指令微调 :LLM(abstract);SFT(abstract);分类 cs.AI

AI总结 针对现有数据代理难以适应新环境的问题,提出TOFFEE系统,通过蒙特卡洛树搜索等方法,能从给定数据环境合成高质量数据代理轨迹,可用于监督微调与上下文学习,还展示了系统框架、界面及工作流程与应用场景。

Comments Accepted to VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12705 2026-08-11 cs.LG 版本更新 70%

Early Data Exposure Improves Robustness to Subsequent Fine-Tuning

早期数据暴露提高对后续微调的鲁棒性

Lawrence Feng, Gaurav R. Ghosal, Jacob Mitchell Springer, Ziqian Zhong, Aditi Raghunathan

机构 * Department of Computer Science(计算机科学系) Cranberry-Lemon University(Cranberry-Lemon 大学) Department of Computational Neuroscience(计算神经科学系) University of the Witwatersrand(沃茨沃斯兰德大学)

专题命中 指令微调 :pretraining(abstract);post-training(abstract);分类 cs.LG

AI总结 本文研究了上游训练策略如何影响模型在后续微调中的鲁棒性,发现早期数据暴露能提升模型在微调后的表现,而传统方法如回放和dropout在后续微调中提供补充增益。

Comments Published at COLM 2026. Project website: https://ar-forum.github.io/earlyexposure-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22191 2026-08-07 cs.CR cs.CL 版本更新 70%

Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning

行为 Canary:在 RL 微调中审计私有检索上下文的使用

Chaoran Chen, Dayu Yuan, Peter Kairouz

机构 * Google(谷歌)

专题命中 指令微调 :LLM(abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文提出 Behavioral Canaries 机制,用于审计 RL 微调过程中是否非法使用受保护的检索上下文,通过行为信号检测未经授权的文档条件训练,实现 67% 的检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24413 2026-08-05 cs.CL 版本更新 70%

Pingala: Prosody-Aware Decoding for Sanskrit Poetry Generation

PINGALA:面向梵文诗歌生成的声调感知解码

Manoj Balaji Jagadeeshan, Atul Singh, Nallani Chakravartula Sahith, Amrith Krishna, Pawan Goyal

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PINGALA解码方法,通过将诗歌分段提升语义连贯性10%,并利用SLP1转写提高音律对齐46%,同时引入参考无关评估方法。

Comments new changes added

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09757 2026-08-04 cs.CL cs.AI 版本更新 70%

RSRA: Training-Free Probing of Representation Sensitivity for Efficient LoRA Rank Allocation

RSLoRA:通过表示敏感性探测实现LoRA的无训练秩分配

Jiaqi Liu, Haidong Kang, Qihui Zhao, Guo Yu, Jingchao Wang

机构 * Dalian University of Technology(大连理工大学) Northeastern University(东北大学) Hebei Key Laboratory of Marine Perception Network and Data Processing(河北省海洋感知网络与数据处理重点实验室) Nanjing Tech University(南京工业大学) Institute of Intelligent Manufacturing(智能制造研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对LoRA传统秩分配问题,提出RSLoRA,通过激活空间几何及虚拟表示探测机制确定高敏感性模块,无需训练调整和反向梯度,在主流基准测试中优于现有方法,为模型自适应提供高效方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23541 2026-07-29 cs.CL 版本更新 70%

Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning

Med-R$^3$:通过渐进强化学习增强LLMs的医学检索增强推理

Keer Lu, Zheng Liang, Youquan Li, Jiejun Tan, Da Pan, Shusen Zhang, Guosheng Dong, Bin Cui, Yunhuai Liu, Wentao Zhang

机构 * Peking University(北京大学) Baichuan Inc.(北川科技公司)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.CL

AI总结 Med-R$^3$ 通过渐进强化学习提升医疗场景下LLMs的检索增强推理能力,实现检索与推理的协同优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21151 2026-07-28 cs.AI 版本更新 70%

V-DEAL: Diagnosing Video Safety De-Calibration as an Understanding-Refusal Coupling Failure

V-DEAL:将视频安全去校准诊断为理解-拒绝耦合失败

Zhetong Zhang, Honghao Fu, Miao Xu, Yiwei Wang, Yujun Cai

机构 * University of Queensland(昆士兰大学) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频大语言模型安全对齐问题,提出V-DEAL三级诊断框架分析漏洞机制,通过测试发现模型识别有害视频内容有一定准确率,但配对有害视频与良性查询时攻击成功率高,视觉理解激活拒绝倾向弱,还引入提示注入干预方法降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05988 2026-07-27 cs.LG 版本更新 70%

Layer-wise LoRA fine-tuning: a similarity metric approach

逐层LoRA微调:相似性度量方法

Keith Ando Ogawa, Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出逐层LoRA微调方法,通过选择性微调部分层以减少可训练参数并保持预测性能,适用于不同架构和任务。

Comments Accepted at the International Conference on Pattern Recognition (ICPR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05518 2026-07-23 cs.CR cs.AI 版本更新 70%

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

概率匹配排名实现真正深度的安全对齐

Jason Vega, Gagandeep Singh

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究开源大语言模型安全问题,针对预填充攻击及相关防御,提出排名辅助预填充(RAP)攻击,又通过匹配令牌排名提出PRESTO方法,提升了模型在RAP攻击下的安全性,为安全开源模型发展助力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19737 2026-07-22 cs.CL 版本更新 70%

XCOMPS: A Multilingual Benchmark of Conceptual Minimal Pairs

XCOMPS:概念最小对的多语言基准测试

Linyang He, Ercong Nie, Sukru Samet Dindar, Arsalan Firoozi, Adrian Florea, Van Nguyen, Corentin Puffay, Riki Shimizu, Haotian Ye, Jonathan Brennan, Helmut Schmid, Hinrich Schütze, Nima Mesgarani

机构 * Columbia University(哥伦比亚大学) Munich Center for Machine Learning(慕尼黑机器学习中心) LMU Munich(慕尼黑大学) University of Michigan(密歇根大学) KU Leuven(根特大学)

专题命中 指令微调 :instruction tuning(abstract);prompting(abstract);分类 cs.CL

AI总结 介绍多语言概念最小对数据集XCOMPS,通过多种方式评估LLMs多语言概念理解,比较不同模型发现LLMs对低资源语言概念理解弱,指令微调与知识蒸馏有不同效果,形态复杂语言理解分数低。

Comments Accepted at SIGTYP 2025: https://aclanthology.org/2025.sigtyp-1.9/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21751 2026-07-17 cs.LG 版本更新 70%

Models Can Model, But Can't Bind: Structured Grounding in Text-to-Optimization

模型可以建模,但无法绑定:文本到优化中的结构化 grounding

Zhiqi Gao, Albert Ge, Alexander Berenbeim, Nathaniel D. Bastian, Frederic Sala

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) United States Military Academy(美国军事学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);分类 cs.LG

AI总结 本文研究了文本到优化任务中建模与绑定两个关键能力的分离性,发现随着实例数据增长,模型准确性下降,提出BIND方法通过结构化文件外部化数据来提升绑定性能,验证了绑定专精模型在不同优化类别中的优势。

Comments Accepted to COLM 2026. Code and data: https://github.com/SprocketLab/Text2Opt-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10593 2026-07-17 cs.AI cs.DB cs.IR 版本更新 70%

QDA-SQL: Questions Enhanced Dialogue Augmentation for Multi-Turn Text-to-SQL

QDA-SQL:用于多轮文本到SQL的问题增强对话扩充

Yinggang Sun, Ziming Guo, Haining Yu, Chuanyi Liu, Xiang Li, Bingxuan Wang, Xiangzhan Yu, Tiancheng Zhao

机构 * School of Cyberspace Science Harbin Institute of Technology Harbin, China(网络空间科学学院 哈尔滨工业大学 哈尔滨,中国) School of Computer Science(计算机科学学院) Technology Harbin University of Science(技术 哈尔滨理工大学) School of Cyberspace Science Harbin Institute of Technology, Shenzhen Shenzhen, China(网络空间科学学院 哈尔滨工业大学深圳 哈尔滨,中国)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对多轮文本到SQL任务中微调模型面临的问题,提出QDA-SQL数据扩充方法,利用大语言模型生成多轮问答对,并引入验证和校正机制,提升了微调模型在SQL语句准确性及处理复杂问题上的能力。

Comments CAAI International Conference on Artificial Intelligence 2026 (CICAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 70%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04364 2026-07-14 cs.LG 版本更新 70%

RL Forgets! Towards Continual Policy Optimization

强化学习会遗忘!迈向持续策略优化

Mao-Lin Luo, Zhe-Xu Wang, Zi-Hao Zhou, Bo Ye, Jian Zhao, Min-Ling Zhang, Tong Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration (Southeast University), Ministry of Education(教育部计算机网络和信息集成重点实验室(东南大学)) Zhongguancun Academy(中关村科学城公司) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 指令微调 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究持续训练中强化学习易遗忘问题,引入MRCL基准测试,提出持续策略优化框架CPO,通过参数移动正则化减少遗忘,多模型规模实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏