arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11585 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11585 篇

2605.09995 2026-05-12 cs.CL 87%

Annotations Mitigate Post-Training Mode Collapse

标注缓解训练后模式崩溃

Jacob Mitchell Springer, Madhu Advani, Lukas Aichberger, Arwen Bradley, Eran Malach, Omid Saremi, Sinead Williamson, Preetum Nakkiran, Etai Littwin, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Apple(苹果公司) Johannes Kepler University Linz(林茨约翰尼斯·开普勒大学)

专题命中 指令微调 :post-training(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.CL

AI总结 本文提出标注锚定训练方法,通过在预训练中引入语义标注,减少训练后模型的语义模式崩溃,提升模型多样性。

Comments 21 pages, 8 figures, 11 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24320 2026-04-28 cs.CL 87%

DPEPO: Diverse Parallel Exploration Policy Optimization for LLM-based Agents

DPEPO:基于大语言模型代理的多样化并行探索策略优化

Junshuo Zhang, Chengrui Huang, Feng Guo, Zihan Li, Ke Shi, Menghua Jiang, Jiguo Yu, Shuo Shang, Shen Gao

机构 * University of Electronic Science and Technology of China(电子科技大学) DiDi(滴滴)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出DPEPO算法,通过并行探索提升大语言模型代理在复杂任务中的性能,实验表明其在ALFWorld和ScienceWorld上达到最先进的成功率。

Comments Accepted by ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23987 2026-04-28 cs.LG 87%

Continual Calibration: Coverage Can Collapse Before Accuracy in Lifelong LLM Fine-Tuning

持续校准:在终身LLM微调中,覆盖度可能在准确性之前崩溃

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(艾奥瓦州立大学计算机科学系) Department of Civil, Construction & Environmental Engineering, Iowa State University(艾奥瓦州立大学土木、建设与环境工程系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在连续学习中,覆盖度可能早于准确性下降的问题,提出校准回放方法以恢复覆盖度,通过实验和理论分析验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23557 2026-04-28 cs.MA cs.AI 87%

DLM: Unified Decision Language Models for Offline Multi-Agent Sequential Decision Making

DLM:统一的决策语言模型用于离线多智能体顺序决策制定

Zhuohui Zhang, Bin Cheng, Bin He

机构 * Department of Control Science and Engineering, Tongji University, Shanghai 201804, China(同济大学控制科学与工程学院) Shanghai Institute of Intelligent Science and Technology(上海智能科学研究院) Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院) State Key Laboratory of Autonomous Intelligent Unmanned Systems, Shanghai 200120, China(自主智能无人系统国家重点实验室)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI

AI总结 本文提出DLM,通过统一决策语言模型解决离线多智能体强化学习中的决策问题,采用集中训练分散执行框架,提升泛化能力。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23091 2026-04-28 cs.LG 87%

Channel Adaptation for EEG Foundation Models: A Systematic Benchmark Across Architectures, Tasks, and Training Regimes

EEG基础模型的通道适应:跨架构、任务和训练模式的系统性基准测试

Kuntal Kokate, Bruno Aristimunha, Dung Truong, Arnaud Delorme

机构 * Swartz Center for Computational Neuroscience, Institute for Neural Computation, University of California San Diego(斯瓦茨计算神经科学中心,神经计算研究所,加州大学圣地亚哥分校) Yneuro Centre de Recherche Cerveau et Cognition, CNRS, Université Paul Sabatier(脑与认知研究中心,法国国家科学研究中心,保罗·萨巴蒂埃大学)

专题命中 指令微调 :foundation model(title,abstract);SFT(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 本文系统比较了四种通道适应方法在不同EEG基础模型、任务和训练模式中的表现,发现灵活模型在微调时需外部方法辅助,且5M参数CBraMod在4/5数据集上超越更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19526 2026-04-22 cs.CR cs.LG cs.SE 87%

Evaluating LLM-Generated Obfuscated XSS Payloads for Machine Learning-Based Detection

评估基于大语言模型生成的混淆XSS载荷用于基于机器学习的检测

Divyesh Gabbireddy, Suman Saha

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Pennsylvania State University(宾夕法尼亚州立大学) University Park, PA, USA(帕克大学,宾夕法尼亚州,美国)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种生成和评估混淆XSS载荷的结构化流程,结合确定性转换技术与大语言模型生成,通过浏览器运行时评估比较载荷行为,展示生成模型在对抗性安全数据生成中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14164 2026-04-22 cs.CL 87%

How to Fine-Tune a Reasoning Model? A Teacher-Student Cooperation Framework to Synthesize Student-Consistent SFT Data

如何微调一个推理模型?一种教师-学生合作框架来合成学生一致的SFT数据

Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He Du, Kai Chen, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Dalian University of Technology(大连理工大学) Nanjing University(南京大学)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.CL

AI总结 本文提出TESSY框架,通过交替生成风格和非风格标记,解决教师生成数据与学生分布之间的风格差异问题,提升推理模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17715 2026-04-21 cs.SE cs.LG 87%

Program Structure-aware Language Models: Targeted Software Testing beyond Textual Semantics

基于程序结构的语言模型:超越文本语义的针对性软件测试

Khang Tran, Khoa Nguyen, Cristian Borcea, NhatHai Phan

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG

AI总结 本文提出GLMTest框架,通过整合代码属性图和语义,利用图神经网络和语言模型生成针对性测试用例,提升分支覆盖和漏洞发现能力。

Comments Accepted in The 64th Annual Meeting of the Association for Computational Linguistics (ACL Findings 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16058 2026-04-20 cs.SE cs.CL 87%

LLMSniffer: Detecting LLM-Generated Code via GraphCodeBERT and Supervised Contrastive Learning

LLMSniffer:通过GraphCodeBERT和监督对比学习检测LLM生成的代码

Mahir Labib Dihan, Abir Muhtasim

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LLMSniffer框架,通过GraphCodeBERT和监督对比学习检测AI生成代码,实验表明其在GPTSniffer和Whodunit数据集上准确率显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10508 2026-04-14 cs.SE cs.AI 87%

How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks

需要多少次尝试?跨模型规模和基准的LLM代码生成中的迭代自修复

Johin Johny Arimbur

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了在不同模型规模和基准测试中,通过迭代自修复提高代码生成正确率的方法,发现自修复显著提升了通过率,且现代模型无需微调即可实现有效自修复。

Comments 11 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08926 2026-04-13 cs.LG 87%

Bridging SFT and RL: Dynamic Policy Optimization for Robust Reasoning

弥合SFT与RL:面向鲁棒推理的动态策略优化

Taojie Zhu, Dongyang Xu, Ding Zou, Sen Zhao, Qiaobo Hao, Zhiguo Yang, Yonghong He

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Intelligent System Department, Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司智能系统部) Institute of Advanced Interdisciplinary Studies, Chongqing University of Posts and Telecommunications(重庆邮电大学前沿交叉研究院)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出DYPO框架,通过组对齐损失、多教师蒸馏和动态探索-利用门控机制,解决SFT与RL间的偏倚-方差权衡问题,提升复杂推理和分布外任务性能。

Comments ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07361 2026-04-13 cs.LG 87%

BLEG: LLM Functions as Powerful fMRI Graph-Enhancer for Brain Network Analysis

BLEG: LLM作为强大的fMRI图增强器用于脑网络分析

Rui Dong, Zitong Wang, Jiaxing Li, Weihuang Zheng, Youyong Kong

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出BLEG方法,通过结合大语言模型与图神经网络,提升fMRI脑网络分析性能,采用三阶段流程增强图神经网络表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 87%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05629 2026-03-02 cs.LG 87%

On the Generalization of SFT: A Reinforcement Learning Perspective with Reward Rectification

在SFT的泛化上:从强化学习视角的奖励校正

Yongliang Wu, Yizhou Zhou, Zhou Ziheng, Yingzhe Peng, Xinyu Ye, Xinting Hu, Wenbo Zhu, Lu Qi, Ming-Hsuan Yang, Xu Yang

机构 * Southeast University(东南大学) University of California, Los Angeles(加州大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) University of California, Berkeley(加州大学伯克利分校) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出动态微调方法,通过奖励校正提升SFT的泛化能力,在多个任务中表现优于传统SFT。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17835 2026-02-23 cs.LG 87%

Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning

保留影响的梯度基数据选择代理

Sirui Chen, Yunzhe Qi, Mengting Ai, Yifan Sun, Ruizhong Qiu, Jiaru Zou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Iprox通过两阶段框架直接从目标模型生成保留影响的代理,有效提升LLM微调中基于梯度的数据选择效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13773 2026-02-17 cs.LG 87%

On Representation Redundancy in Large-Scale Instruction Tuning Data Selection

在大规模指令微调数据选择中的表示冗余性

Youwei Shu, Shaomian Zheng, Dingnan Jin, Wenjie Qu, Ziyao Guo, Qing Cui, Jun Zhou, Jiaheng Zhang

机构 * National University of Singapore(新加坡国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CRDS框架,通过压缩表示减少指令微调数据冗余,提升数据质量与模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11884 2026-02-17 cs.CL 87%

Context-Emotion Aware Therapeutic Dialogue Generation: A Multi-component Reinforcement Learning Approach to Language Models for Mental Health Support

情境-情绪感知的治疗对话生成:一种多组件强化学习方法用于语言模型的心理健康支持

Eric Hua Qing Zhang, Julia Ive

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);SFT(abstract)

AI总结 本文提出一种多组件强化学习方法,通过改进GPT-2的治疗对话生成能力,提升情绪准确性和上下文相关性,以支持心理健康领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03073 2026-02-04 cs.LG 87%

TMS: Trajectory-Mixed Supervision for Reward-Free, On-Policy SFT

TMS:轨迹混合监督用于无奖励、在线策略微调

Rana Muhammad Shahroz Khan, Zijie Liu, Zhen Tan, Charles Fleming, Tianlong Chen

专题命中 指令微调 :SFT(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 TMS通过轨迹混合监督在无奖励的情况下提升大语言模型的保留能力,有效弥补了传统SFT与RL之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01461 2026-02-03 cs.CL cs.SD eess.AS 87%

Bridging the gap: A comparative exploration of Speech-LLM and end-to-end architecture for multilingual conversational ASR

弥合差距:Speech-LLM与端到端架构在多语言对话ASR中的比较探索

Yuxiang Mei, Dongxing Xu, Jiaen Liang, Yanhua Long

机构 * Shanghai Normal University(上海师范大学) Unisound AI Technology Co., Ltd.(Unisound AI技术有限公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SLM(abstract)

AI总结 本文提出一种结合微调Whisper和mHuBERT编码器与LLM的ASR框架,通过交叉注意力机制提升多语言对话ASR性能,实验表明其在性能上接近端到端模型,但仍有提升空间。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14598 2026-02-03 cs.SE cs.AI 87%

HELIOS: Hierarchical Graph Abstraction for Structure-Aware LLM Decompilation

HELIOS:基于结构的图抽象用于结构感知的LLM反编译

Yonatan Gizachew Achamyeleh, Harsh Thomare, Mohammad Abdullah Al Faruque

机构 * Dept. of Electrical Engineering and Computer Science, University of California, Irvine, CA, USA(电气工程与计算机科学系,加州大学伊文斯顿分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HELIOS通过结构化图抽象提升LLM反编译的准确性和可编译性,实现功能正确性和语法正确性的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18225 2026-01-27 cs.AI 87%

ShopSimulator: Evaluating and Exploring RL-Driven LLM Agent for Shopping Assistants

ShopSimulator: 评估和探索基于强化学习的LLM代理用于购物助手

Pei Wang, Yanan Wu, Xiaoshuai Song, Weixun Wang, Gengru Chen, Zhongwen Li, Kezhong Yan, Ken Deng, Qi Liu, Shuaibing Zhao, Shaopan Xiong, Xuepeng Liu, Xuefeng Chen, Wanxi Deng, Wenbo Su, Bo Zheng

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出ShopSimulator,一个大规模中文购物环境,用于评估和探索基于强化学习的LLM代理在购物助手中的性能和改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15879 2026-01-23 cs.SE cs.CL 87%

Evaluating and Achieving Controllable Code Completion in Code LLM

评估和实现可控的代码补全在代码LLM中

Jiajun Zhang, Zeyu Cui, Lei Zhang, Jian Yang, Jiaxi Yang, Qiang Liu, Zilei Wang, Binyuan Hui, Liang Wang, Junyang Lin

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Group(阿里巴巴集团) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出可控代码补全基准C3-Bench,评估了40种LLM在代码补全中的指令遵循能力,开发数据合成管道并推出Qwen2.5-Coder-C3模型,实现代码补全性能的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05867 2026-01-23 cs.CR cs.CL 87%

Can LLM Infer Risk Information From MCP Server System Logs?

LLM能否从MCP服务器系统日志中推断风险信息?

Jiayi Fu, Yuansen Zhang, Yinggui Wang

机构 * Southern University of Science and Technology(南方科技大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出首个评估LLM从MCP服务器系统日志中识别安全风险的合成基准,通过训练不同模型展示强化学习在提升LLM安全性能中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09750 2026-01-16 cs.SE cs.AI cs.HC cs.MA 87%

SAGE: Tool-Augmented LLM Task Solving Strategies in Scalable Multi-Agent Environments

SAGE:可扩展多智能体环境中基于工具的LLM任务解决策略

Robert K. Strehlow, Tobias Küster, Oskar F. Kupke, Brandon Llanque Kurps, Fikret Sivrikaya, Sahin Albayrak

机构 * Technische Universität Berlin(柏林技术大学) DAI-Labor, TU Berlin, Chair of Agent Technologies(柏林技术大学DAI实验室,代理技术系) GT-ARC gGmbH(GT-ARC公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SAGE通过OPACA框架实现动态工具整合,提供灵活的任务解决策略,提升LLM在多智能体环境中的效率与适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15456 2025-12-12 cs.CL 87%

Teaching Language Models to Evolve with Users: Dynamic Profile Modeling for Personalized Alignment

教导语言模型与用户共同进化:面向个性化对齐的动态资料模型

Weixiang Zhao, Xingyu Sui, Yulin Hu, Jiahe Guo, Haixiao Liu, Biye Li, Yanyan Zhao, Bing Qin, Ting Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本研究提出RLPA框架,通过动态资料推断提升个性化对话性能,Qwen-RLPA在多个基准测试中超越现有方法。

Comments NeurIPS 2025 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08179 2025-12-10 q-fin.ST cs.AI 87%

RAG-IT: Retrieval-Augmented Instruction Tuning for Automated Financial Analysis -- A Case Study for the Semiconductor Sector

RAG-IT:基于检索的指令微调用于自动化财务分析——半导体行业案例研究

Hai-Thien To, Tien-Cuong Bui, Van-Duc Le

机构 * University of Transport Technology(运输技术大学) Arontier Co., Ltd.(阿隆蒂尔公司)

专题命中 指令微调 :instruction tuning(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 RAG-IT通过检索增强和指令微调,提升LLM在半导体行业财务分析中的性能,实现与商业系统相当的财务报告生成能力。

Comments We updated title, abstract and added more details in experiment section. We also updated the list of authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20059 2025-11-21 cs.CL 87%

Is Preference Alignment Always the Best Option to Enhance LLM-Based Translation? An Empirical Analysis

基于偏好对齐是否总是提升基于大语言模型的翻译质量的最佳选项?一项实证分析

Hippolyte Gisserot-Boukhlef, Ricardo Rei, Emmanuel Malherbe, Céline Hudelot, Pierre Colombo, Nuno M. Guerreiro

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本研究通过实证分析探讨了基于偏好的对齐在提升大语言模型翻译质量中的效果,发现CPO在高质量数据上表现优异,但可能在下游度量上存在不稳定性,同时基础模型生成翻译的表现与多个外部系统相当且更一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02234 2025-11-05 cs.MM cs.CL cs.SD 87%

An Evaluation of Interleaved Instruction Tuning on Semantic Reasoning Performance in an Audio MLLM

Jiawei Liu, Enis Berk Çoban, Zarina Schevchenko, Hao Tang, Zhigang Zhu, Michael I Mandel, Johanna Devaney

机构 * The Graduate Center, CUNY(CUNY研究生中心) Brooklyn College, CUNY(CUNY布鲁克林学院) Borough of Manhattan Community College, CUNY(CUNY曼哈顿社区学院) The City College of New York, CUNY(CUNY纽约城市学院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14824 2025-10-17 cs.CL cs.CV cs.IR 87%

Supervised Fine-Tuning or Contrastive Learning? Towards Better Multimodal LLM Reranking

Ziqi Dai, Xin Zhang, Mingxin Li, Yanzhao Zhang, Dingkun Long, Pengjun Xie, Meishan Zhang, Wenjie Li, Min Zhang

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11121 2025-10-14 cs.LG 87%

Refining Hybrid Genetic Search for CVRP via Reinforcement Learning-Finetuned LLM

Rongjie Zhu, Cong Zhang, Zhiguang Cao

机构 * School of Teacher Education, Nanjing University of Information Science and Technology, China(南京信息工程大学教师教育学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) Singapore Management University, Singapore(新加坡管理大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏