arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11502 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11502 篇

2406.17305 2024-12-03 cs.CL 92%

Retrieval Augmented Instruction Tuning for Open NER with Large Language Models

Tingyu Xie, Jian Zhang, Yan Zhang, Yuanyuan Liang, Qi Li, Hongwei Wang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);prompting(abstract)

Comments To be appeared at COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.20174 2024-08-13 cs.CV cs.AI 92%

Advancing Multimodal Large Language Models in Chart Question Answering with Visualization-Referenced Instruction Tuning

Xingchen Zeng, Haichuan Lin, Yilin Ye, Wei Zeng

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07487 2024-07-11 cs.CL 92%

Review-LLM: Harnessing Large Language Models for Personalized Review Generation

Qiyao Peng, Hongtao Liu, Hongyan Xu, Qing Yang, Minglai Shao, Wenjun Wang

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11458 2024-05-21 cs.AI cs.SY eess.SY 92%

CPS-LLM: Large Language Model based Safe Usage Plan Generator for Human-in-the-Loop Human-in-the-Plant Cyber-Physical System

Ayan Banerjee, Aranyak Maity, Payal Kamboj, Sandeep K. S. Gupta

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

Comments Accepted for publication in AAAI 2024, Planning for Cyber Physical Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05225 2024-04-09 cs.CV cs.CL 92%

LayoutLLM: Layout Instruction Tuning with Large Language Models for Document Understanding

Chuwei Luo, Yufan Shen, Zhaoqing Zhu, Qi Zheng, Zhi Yu, Cong Yao

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

Comments CVPR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16409 2026-08-13 cs.CV cs.CL cs.LG 版本更新 92%

Multilingual OCR-Aware Fine-Tuning and Prompt-Guided Chain-of-Thought Reasoning for Multimodal Large Language Models

多语言OCR感知微调和提示引导的链式思维推理用于多模态大语言模型

Qinwu Xu, Yifan Jiang, Haoyu Ren

机构 * Meta AI UT Austin(德克萨斯大学奥斯汀分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出一种多语言OCR感知的多模态训练框架,通过合成数据生成、OCR感知微调和结构化视觉链式思维提示,提升多模态大语言模型在复杂视觉条件下的OCR完整性和多语言翻译准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10273 2026-08-12 cs.CL cs.AI 新提交 92%

Locally Deployable Small Language Models for Emergency Department Decision Support: A Systematic Benchmark of Fine-Tuning Strategies

可本地部署的小型语言模型用于急诊科决策支持:微调策略的系统基准测试

Qingfeng Zhang, Yuanxiong Guo, Yanmin Gong

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 该研究针对急诊科决策支持的隐私风险,通过基准测试发现经LoRA微调的开源小型语言模型在分诊和转诊任务上优于商业模型,可本地部署且具备临床竞争力。

Comments Accepted to AMIA 2026 Annual Symposium

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06795 2026-08-10 cs.CR cs.AI cs.CL 新提交 92%

LoRAScan: Detecting Backdoor Prompts in Low-Rank Adapters for Large Language Models via Down-Projection Activation Spikes

LoRAScan:通过下投影激活尖峰检测大语言模型低秩适配器中的后门提示

Doniyorkhon Obidov, Honggang Yu, Xiaolong Guo, Kaichen Yang

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 LoRAScan是首个无需修改适配器参数、在推理时检测并拒绝含触发词输入的适配器感知防御方法,在LLM后门基准测试中拒98.49%恶意输入,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26707 2026-07-16 cs.CL cs.CY cs.LG 版本更新 92%

Value Drifts: Tracing Value Alignment During LLM Post-Training

价值漂移:在大语言模型训练后追踪价值对齐

Mehar Bhatia, Shravan Nayak, Gaurav Kamath, Marius Mosbach, Karolina Stańczak, Vered Shwartz, Siva Reddy

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) ETH Zurich(苏黎世联邦理工学院) University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);LLM(title);preference optimization(abstract)

AI总结 研究大语言模型训练后价值对齐问题,通过实验区分训练后算法和数据集影响,测量价值漂移,发现SFT阶段确立模型价值,后续偏好优化难重对齐,不同算法在偏好数据不变时也有不同结果,为相关选择提供见解。

Comments TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02938 2026-05-22 cs.LG cs.AI 92%

Beyond One-Size-Fits-All: Adaptive Subgraph Denoising for Zero-Shot Graph Learning with Large Language Models

超越一刀切:基于大语言模型的零样本图学习中的自适应子图去噪

Fengzhi Li, Liang Zhang, Yuan Zuo, Ruiqing Zhao, YanSong Liu, Yunfei Ma, Fanyu Meng, Junlan Feng

机构 * JIUTIAN Research(JIUTIAN研究) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) MIIT Key Laboratory of Data and Decision Intelligence(信息与决策智能重点实验室) Beihang University(北航)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出GraphSSR框架,通过自适应子图提取和去噪方法,解决传统图神经网络在零样本学习中泛化能力不足的问题,提升大语言模型在图推理任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16452 2026-05-19 cs.LG cs.AI 92%

Peak-Detector: Explainable Peak Detection via Instruction-Tuned Large Language Models in Physiological Sign

峰值检测器:通过指令调优的大语言模型实现可解释的多模态峰值检测

Jiahui Li, Yida Zhang, Zixuan Zeng, Jiayu Chen, Yingjian Song, Yin Xiao, Nishan Dong, Junjie Lu, Younghoon Kwon, Xiang Zhang, Jin Lu, Wenzhan Song, Fei Dou

机构 * University of Georgia(佐治亚大学) Yixing People’s Hospital(宜兴人民医院) University of Washington(华盛顿大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本文提出Peak-Detector框架,利用指令调优的大语言模型实现跨模态、可解释的峰值检测,通过峰表示技术压缩时间序列数据并提升检测准确性,同时生成解释性内容以支持验证与错误分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16113 2026-05-18 cs.CL cs.AI 92%

DebiasRAG: A Tuning-Free Path to Fair Generation in Large Language Models through Retrieval-Augmented Generation

DebiasRAG: 通过检索增强生成实现大型语言模型中公平生成的无调优路径

Rui Chu, Bingyin Zhao, Thanh Quoc Hung Le, Duy Cao Hoang, Huawei Lin, Ping Li, Weijie Zhao, Khoa D Doan, Yingjie Lao

机构 * Huawei(华为)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DebiasRAG,一种基于检索增强生成的无调优动态查询特定去偏框架,通过生成查询特定去偏候选、构建上下文候选池和梯度更新去偏引导上下文重排序三阶段,提升生成公平性并保留LLM固有属性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05676 2026-05-08 cs.CL cs.AI 92%

Decomposing the Basic Abilities of Large Language Models: Mitigating Cross-Task Interference in Multi-Task Instruct-Tuning

分解大型语言模型的基本能力:在多任务指令微调中缓解跨任务干扰

Bing Wang, Ximing Li, Changchun Li, Jinjin Chi, Gang Niu, Masashi Sugiyama

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, Ministry of Education, Jilin University(吉林大学符号计算与知识工程重点实验室) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心) Graduate School of Frontier Sciences, University of Tokyo(东京大学前沿科学研究生院)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过实验揭示现有方法仍存在跨任务干扰问题,提出BADIT方法将LLM参数分解为正交的高奇异值LoRA专家,通过球形聚类保持正交性,实验证明其在多任务指令微调中优于现有方法。

Comments Accepted by ICML 2026. 25 pages, 13 figures. Code: https://github.com/wangbing1416/BADIT

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01455 2026-04-15 cs.AI cs.LG quant-ph 92%

Infeasibility Aware Large Language Models for Combinatorial Optimization

面向组合优化的可行性感知大语言模型

Yakun Wang, Min Chen, Zeguan Wu, Junyu Liu, Sitao Zhang, Zhenwen Shao

机构 * Lehigh University(莱荷大学) University of Pittsburgh(匹兹堡大学) Johnson & Johnson(强生公司)

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种结合可验证数据集构建、监督微调和LLM辅助下游搜索的框架,用于解决组合优化问题中的可行性检测,实验显示模型在准确率和搜索速度上有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.03444 2024-09-06 cs.CL cond-mat.mtrl-sci cs.AI 92%

Fine-tuning large language models for domain adaptation: Exploration of training strategies, scaling, model merging and synergistic capabilities

Wei Lu, Rachel K. Luu, Markus J. Buehler

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02148 2024-06-05 cs.CL cs.AI 92%

Synergetic Event Understanding: A Collaborative Approach to Cross-Document Event Coreference Resolution with Large Language Models

Qingkai Min, Qipeng Guo, Xiangkun Hu, Songfang Huang, Zheng Zhang, Yue Zhang

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);small language model(abstract)

Comments Accepted to ACL-24 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12468 2026-07-15 cs.SD cs.AI 新提交 92%

An Omnilingual-ASR-Based Speech-LLM System for the 2nd MLC-SLM Challenge

用于第二届MLC-SLM挑战赛的基于全语言自动语音识别的语音语言模型系统

Shuming Fang, Shuifei Zeng

专题命中 指令微调 :SLM(title,title_cn);LLM(title,abstract);分类 cs.AI

AI总结 该研究针对第二届MLC-SLM挑战赛任务1,提出级联分帧识别系统,结合多种技术,测试无先验信息。分析工程选择影响,如基于嵌入的聚类更优,重叠感知分割虽提召回率但增加tcpMER,在开发集和评估集有相应表现。

Comments Accepted to INTERSPEECH 2026. 4 pages + references. Technical description of our 2nd MLC-SLM Challenge Task 1 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29496 2026-05-29 cs.CL cs.CV 92%

On Asymmetric Optimization of Reasoning and Perception in Vision-Language Model Post-Training

视觉语言模型后训练中推理与感知的非对称优化研究

Xueqing Wu, Yu-Chi Lin, Kai-Wei Chang, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过合成任务诊断发现,后训练中推理提升显著优于感知,SFT源于感知token少导致训练信号弱,RL源于奖励耦合,提出动态重加权损失和感知奖励可缓解不平衡并提升端到端性能。

Comments Project: https://asymmetric-vlm-post-training.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-03 cs.IR 新提交 92%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 指令微调 :LLM(title,summary_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05952 2026-07-03 cs.CY 版本更新 92%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL 92%

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18384 2026-05-27 cs.RO cs.FL 92%

LAD-VF: LLM-Automatic Differentiation Enables Fine-Tuning-Free Robot Planning from Formal Methods Feedback

LAD-VF:LLM自动微分实现基于形式化方法反馈的无微调机器人规划

Yunhao Yang, Junyuan Hong, Gabriel Jacob Perin, Zhiwen Fan, Li Yin, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) University of São Paulo(圣保罗大学) Texas A&M University(德克萨斯A&M大学) SylphAI

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 提出LAD-VF框架,利用形式化验证反馈和LLM自动微分自动优化提示词,无需微调即可提升机器人规划任务中规范符合率,成功率从60%提升至90%以上。

Comments Presented at ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18474 2026-05-20 cs.CR cs.AI cs.CL cs.LG 92%

Prompt2Fingerprint: Plug-and-Play LLM Fingerprinting via Text-to-Weight Generation

Prompt2Fingerprint: 通过文本到权重生成实现即插即用的LLM指纹生成

Sixu Chen, Xiang Chen, Hongyao Yu, Jiaxin Hong, Hao Fang, Shuoyang Sun, Bin Chen, Shu-Tao Xia

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院,中国深圳) South China University of Technology, Guangzhou, China(华南理工大学,中国广州) Harbin Institute of Technology, Shenzhen, Shenzhen, China(哈尔滨工业大学深圳校区,中国深圳)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Prompt2Fingerprint框架,将LLM指纹生成重新定义为条件参数生成任务,通过专用生成器将文本描述直接映射到低秩参数增量,实现无需进一步模型微调的即插即用LLM指纹注入,显著降低计算开销,提供可扩展且即时的LLM所有权管理解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20375 2026-05-08 cs.LG cs.AI cs.CL 92%

LLM-AutoDP: Automatic Data Processing via LLM Agents for Model Fine-tuning

LLM-AutoDP: 通过LLM代理实现模型微调的自动数据处理

Wei Huang, Anda Cheng, Yinggui Wang, Lei Wang, Tao Wei

机构 * Ant Group(蚂蚁集团)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLM-AutoDP框架,利用LLM代理自动生成和优化数据处理策略,通过迭代学习机制提升处理质量,同时减少隐私风险和人工成本。

Comments Accepted by VLDB2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12710 2026-04-24 cs.LG cs.AI cs.CL 92%

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性

Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18134 2026-04-21 cs.CV 92%

Can LLM-Generated Text Empower Surgical Vision-Language Pre-training?

LLM生成文本能否增强外科视觉-语言预训练?

Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera

机构 * Visual Understanding Research Group, Department of Informatics, King’s College London, UK(视觉理解研究组,信息学院,伦敦国王学院,英国)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出SurgLIME框架,利用LLM生成的文本进行多模态预训练,以解决标注成本高的问题,通过LoRA适配和自适应置信度估计机制提升模型鲁棒性。

Comments Accepted at CVPRW 2026 (AI4RWC Oral presentationn)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24189 2025-07-18 cs.LG cs.AI cs.CL 92%

Fine-Tune an SLM or Prompt an LLM? The Case of Generating Low-Code Workflows

Orlando Marquez Ayala, Patrice Bechard, Emily Chen, Maggie Baird, Jingfei Chen

机构 * ServiceNow

专题命中 指令微调 :SLM(title,abstract);LLM(title);large language model(abstract,comments);language model(abstract,comments)

Comments 8 pages, 7 figures. Accepted to Workshop on Structured Knowledge for Large Language Models (SKnowLLM) at KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03601 2025-06-13 cs.CV 92%

GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest

Shilong Zhang, Peize Sun, Shoufa Chen, Min Xiao, Wenqi Shao, Wenwei Zhang, Yu Liu, Kai Chen, Ping Luo

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);LLM(abstract)

Comments ECCV2024-Workshop, Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.17044 2025-06-04 cs.CL cs.AI cs.LG 92%

How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not

Francesco Verdini, Pierfrancesco Melucci, Stefano Perna, Francesco Cariaggi, Marco Gaido, Sara Papi, Szymon Mazurek, Marek Kasztelnik, Luisa Bentivogli, Sébastien Bratières, Paolo Merialdo, Simone Scardapane

机构 * Sapienza University of Rome(罗马萨皮恩扎大学) Roma Tre University(罗马三大学) TranslatedItaly(译意大利) Pi School(皮学校) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) AGH University of Krakow(克拉科夫AGH大学) ACC Cyfronet AGH

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);foundation model(title);LLM(abstract)

Comments Submitted to Interspeech 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01874 2024-08-29 cs.CL cs.AI cs.LG cs.RO 92%

The RL/LLM Taxonomy Tree: Reviewing Synergies Between Reinforcement Learning and Large Language Models

Moschoula Pternea, Prerna Singh, Abir Chakraborty, Yagna Oruganti, Mirco Milletari, Sayli Bapat, Kebei Jiang

专题命中 指令微调 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 30 pages (including bibliography), 1 figure, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏