arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-24 至 2026-04-24 共收录 178 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12 篇

2604.21579 2026-04-24 cs.SE cs.AI 92%

A Metamorphic Testing Approach to Diagnosing Memorization in LLM-Based Program Repair

一种用于诊断基于LLM的程序修复中记忆现象的元测试方法

Milan De Koning, Ali Asgari, Pouria Derakhshanfar, Annibale Panichella

机构 * JetBrains Research(JetBrains研究) Delft University of Technology(代尔夫特理工大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过结合元测试与负对数似然,揭示LLM程序修复中数据泄露问题,发现模型在变换基准上的修复成功率显著下降,与NLL值高度相关。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21104 2026-04-24 cs.CV cs.LG 88%

Pretrain Where? Investigating How Pretraining Data Diversity Impacts Geospatial Foundation Model Performance

预训练在哪里?探究预训练数据多样性如何影响地理空间基础模型性能

Amandeep Kaur, Mirali Purohit, Gedeon Muhawenayo, Esther Rolf, Hannah Kerner

机构 * Arizona State University(亚利桑那州立大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文研究预训练数据地理组成对模型下游性能的影响,发现欧洲预训练数据在全局和本地评估中表现最佳,发现光谱多样性与性能强相关。

Comments Accepted at EarthVision workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21159 2026-04-24 cs.CR cs.AI cs.CL cs.LG 87%

Adaptive Instruction Composition for Automated LLM Red-Teaming

自适应指令生成用于自动化大语言模型红队测试

Jesse Zymet, Andy Luo, Swapnil Shinde, Sahil Wadhwa, Emily Chen

机构 * Capital One, AI Foundations(Capital One人工智能基础研究)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出自适应指令生成框架,通过强化学习平衡探索与利用,提升红队测试的攻击效果与多样性,优于随机组合和现有方法。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20100 2026-04-24 cs.RO 82%

JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy

JoyAI-RA 0.1:一种用于机器人自主性的基础模型

Tianle Zhang, Zhihao Yuan, Dafeng Chi, Peidong Liu, Dongwei Li, Kejun Hu, Likui Zhang, Junnan Nie, Ziming Wei, Zengjue Chen, Yili Tang, Jiayi Li, Zhiyuan Xiang, Mingyang Li, Tianci Luo, Hanwen Wan, Ao Li, Linbo Zhai, Zhihao Zhan, Xiaodong Bai, Jiakun Cai, Peng Cao, Kangliang Chen, Siang Chen, Yixiang Dai, Shuai Di, Yicheng Gong, Chenguang Gui, Yucheng Guo, Peng Hao, Qingrong He, Haoyang Huang, Kunrui Huang, Zhixuan Huang, Shibo Jin, Yixiang Jin, Anson Li, Dongjiang Li, Jiawei Li, Ruodai Li, Yihang Li, Yuzhen Li, Jiaming Liang, Fangsheng Liu, Jing Long, Mingxi Luo, Xing Pan, Hui Shen, Xiaomeng Tian, Daming Wang, Song Wang, Junwu Xiong, Hang Xu, Wanting Xu, Zhengcheng Yu, He Zhang, Jiyao Zhang, Lin Zhao, Chen Zhou, Nan Duan, Yuzheng Zhuang, Liang Lin

机构 * Joy Future Academy(京东探索研究院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文提出JoyAI-RA,一种面向通用机器人操作的视觉-语言-动作基础模型,通过多源多层级预训练框架提升跨身体行为学习能力,在仿真和现实任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21352 2026-04-24 cs.CL 81%

CARE: Counselor-Aligned Response Engine for Online Mental-Health Support

CARE:面向在线心理健康支持的咨询师对齐响应引擎

Hagai Astrin, Ayal Swaid, Avi Segal, Kobi Gal

机构 * Ben-Gurion University(本· Gurion 大学) School of Informatics, University of Edinburgh(爱丁堡大学信息学院) School of Informatics, University of Edinburgh Edinburgh UK(爱丁堡大学信息学院爱丁堡 英国)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CARE通过针对希伯来语和阿拉伯语的微调,提升心理健康领域低资源语言下的响应质量,增强咨询师与求助者对话的动态结构和情感语境。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20850 2026-04-24 cs.IR cs.AI cs.CL 73%

Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval

关联并非相似性:为多跳检索学习语料特定的关联

Jason Dury

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出AAR方法,通过对比学习在嵌入空间中学习语料特定的关联关系,提升多跳检索的召回率,且无需评估集调优。

Comments 10 pages, 7 appendices, 10 tables. Code: https://github.com/EridosAI/AAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21265 2026-04-24 cs.CL 70%

Listen and Chant Before You Read: The Ladder of Beauty in LM Pre-Training

在阅读前聆听与吟唱:在LM预训练中的美感阶梯

Yoshinori Nomura

机构 * Mirage Mountain Technologies Inc.(Mirage Mountain Technologies公司)

专题命中 预训练与数据 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 通过在语言前预训练音乐模型,显著加速语言学习。音乐→诗歌→散文的流程在随机初始化下提升了17.5%的困惑度,且在不同模型容量下表现出数据校准原则。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21061 2026-04-24 cs.AI 70%

InVitroVision: a Multi-Modal AI Model for Automated Description of Embryo Development using Natural Language

InVitroVision:一种多模态AI模型,用于通过自然语言自动描述胚胎发育

Nicklas Neu, Thomas Ebner, Jasmin Primus, Raphael Zefferer, Bernhard Schenkenfelder, Mathias Brunbauer, Florian Kromp

机构 * Software Competence Center Hagenberg GmbH(软件能力中心海根贝格有限公司) Kinderwunsch Zentrum Kepler Universitätsklinikum(儿童愿望中心凯普勒大学诊所) Wunschkind Klinik Dr. Brunbauer(愿望宝宝诊所布兰鲍尔医生)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InVitroVision模型,通过微调多模态视觉语言模型,实现了对胚胎形态和发育的自然语言描述预测,展示了基础视觉语言模型在有限数据下应用于体外受精任务的潜力。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04548 2026-04-24 cond-mat.dis-nn cs.LG stat.ML 70%

Learning Linear Regression with Low-Rank Tasks in-Context

在上下文中学习低秩任务的线性回归

Kaito Takanami, Takashi Takahashi, Yoshiyuki Kabashima

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了在上下文中学习如何在高维极限下精确刻画预测分布和泛化误差,并发现有限预训练数据中的统计波动诱导了隐式正则化,揭示了任务结构对泛化误差的相变。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03933 2026-04-24 cs.CL 70%

Losing our Tail, Again: (Un)Natural Selection & Multilingual LLMs

再次失去我们的尾巴:(非)自然选择与多语言大语言模型

Eva Vanmassenhove

机构 * Research Centre for Cognitive Science & Artificial Intelligence(认知科学与人工智能研究中心) Department of Computational Cognitive Science(计算认知科学系) Tilburg University(蒂尔堡大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨多语言大语言模型中翻译技术导致语言多样性丧失的问题,指出模型崩溃可能使语言形式、语法特征和文化内涵消失,呼吁保护多语言多样性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21153 2026-04-24 cs.CR 50%

Image-Based Malware Type Classification on MalNet-Image Tiny: Effects of Multi-Scale Fusion, Transfer Learning, Data Augmentation, and Schedule-Free Optimization

基于图像的恶意软件类型分类在MalNet-Image Tiny上的应用:多尺度融合、迁移学习、数据增强和无调度优化的效果

Ahmed A. Abouelkhaire, Waleed A. Yousef, Issa Traor

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文研究了在MalNet-Image Tiny数据集上进行43类恶意软件分类,探讨多尺度融合、迁移学习、数据增强和无调度优化对紧凑图像分类器性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03061 2026-04-24 physics.chem-ph physics.comp-ph 50%

Modal Backflow Neural Quantum States for Anharmonic Vibrational Calculations

模态反流神经量子态用于非谐振动计算

Lexin Ding, Markus Reiher

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出模态反流神经量子态方法,用于高效处理非谐振动问题,通过改进的配置选择方案提升计算精度,并在人工和从头计算哈密顿量中验证了其在零点能和振动跃迁计算中的准确性。

Comments 32 pages, 6 figures, 1 table

Journal ref J. Chem. Theory Comput. 22 (2026) 3032

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 16 篇

2604.21076 2026-04-24 cs.CL cs.AI 93%

Serialisation Strategy Matters: How FHIR Data Format Affects LLM Medication Reconciliation

序列化策略至关重要:FHIR数据格式如何影响LLM药物重整

Sanjoy Pator

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 研究探讨FHIR数据序列化对LLM药物重整性能的影响,发现临床叙述格式在小模型中表现更优,而大模型更倾向使用原始JSON,揭示了序列化策略对临床安全审计的重要性。

Comments 14 pages, 7 figures, independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21525 2026-04-24 cs.CL 92%

Job Skill Extraction via LLM-Centric Multi-Module Framework

通过以LLM为中心的多模块框架进行工作技能提取

Guojing Li, Zichuan Fu, Junyi Li, Faxue Liu, Wenxia Zhou, Yejing Wang, Jingtong Gao, Maolin Wang, Rungen Liu, Wenlin Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 指令微调 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SRICL框架,结合语义检索、上下文学习和监督微调,解决长尾术语和跨域迁移下的工作广告技能提取问题,提升F1指标并减少无效标签。

Comments 5 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12710 2026-04-24 cs.LG cs.AI cs.CL 92%

LASA: Language-Agnostic Semantic Alignment at the Semantic Bottleneck for LLM Safety

LASA:语言无关的语义对齐在语义瓶颈处用于LLM安全性

Junxiao Yang, Haoran Liu, Jinzhe Tu, Jiale Cheng, Zhexin Zhang, Shiyao Cui, Jiaqi Weng, Jialing Tao, Hui Xue, Hongning Wang, Han Qiu, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)组,DCST,清华大学) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LASA方法,通过在语义瓶颈层对齐安全理解,提升LLM在所有语言中的安全性,实验显示攻击成功率显著降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11707 2026-04-24 cs.CL cs.AI 91%

Federated Co-tuning Framework for Large and Small Language Models

联邦联合微调框架用于大语言模型和小语言模型

Tao Fan, Yan Kang, Guoqiang Ma, Lixin Fan, Shuoling Liu, Kai Chen, Qiang Yang

机构 * Hong Kong University of Science and Technology(香港科技大学) WeBank Co., Ltd(WeBank公司) Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出FedCoLLM框架,通过轻量级适配器实现大模型与小模型的协同微调,提升小模型性能并增强大模型领域知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16006 2026-04-24 cs.CL 90%

Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model

探索连续微调以增强大语言模型的语言能力

Divyanshu Aggarwal, Sankarshan Damle, Navin Goyal, Satya Lokam, Sunayana Sitaram

机构 * Microsoft(微软) Microsoft Research India(微软印度研究院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了连续微调对大语言模型语言适应性的影响,发现相同比例数据集可保持任务能力,而数据不相似时会导致性能下降,通过层冻结和生成重放方法提升语言能力。

Comments 19 pages, 6 tables, 4 figures, Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16737 2026-04-24 cs.LG cs.AI cs.CL cs.CR math.OC 89%

Secure LLM Fine-Tuning via Safety-Aware Probing

通过安全感知探测实现安全的大语言模型微调

Chengcan Wu, Zhixin Zhang, Zeming Wei, Yihao Zhang, Xiaokun Luan, Meng Sun

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文探讨了非有害数据微调为何可能降低安全性,提出安全感知探测框架,通过对比安全信号定位安全相关方向,优化轻量级探针以引导参数更新远离有害轨迹,提升安全与性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20933 2026-04-24 cs.LG cs.AI 88%

IRIS: Interpolative Rényi Iterative Self-play for Large Language Model Fine-Tuning

IRIS:基于Rényi的迭代自博弈用于大语言模型微调

Wenjie Liao, Like Wu, Liangjie Zhao, Shihui Xu, Shigeru Fujimura

机构 * Graduate School of Information, Production and Systems(信息、生产与系统研究生院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院大学计算技术研究所)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 IRIS通过可调Rényi自博弈框架提升大语言模型微调效果,统一解释多种自博弈方法,实验表明其在少样本下优于传统监督微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21571 2026-04-24 cs.AI cs.LG 88%

Separable Expert Architecture: Toward Privacy-Preserving LLM Personalization via Composable Adapters and Deletable User Proxies

可分离专家架构:通过可组合的适配器和可删除的用户代理实现隐私保护的LLM个性化

Chris Schneider, Philipp Schoenegger, Ben Bariach

机构 * Microsoft AI(微软人工智能)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种三层架构,通过静态基础模型、可组合的领域专家LoRA适配器和可删除的用户代理,实现将个人数据与共享权重解耦,从而在不重新训练的情况下实现隐私保护的个性化LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21045 2026-04-24 cs.CL 86%

Hierarchical Policy Optimization for Simultaneous Translation of Unbounded Speech

分层策略优化用于无界语音的同时翻译

Siqi Ouyang, Shuoyang Ding, Oleksii Hrinchuk, Vitaly Lavrukhin, Brian Yan, Boris Ginsburg, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA(英伟达)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出分层策略优化方法,通过后训练处理不完美的监督微调数据,提升同时语音翻译质量与效率,实验显示在1.5秒延迟下,COMET和MetricX得分分别提升超7和1.25。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06498 2026-04-24 cs.CL astro-ph.IM 83%

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

Spec-o3:一种工具增强的视觉-语言代理,用于通过自动化光谱检查验证稀有天体候选体

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, CAS(SKL-MAIS,自动化研究所,中国科学院) School of Advanced Interdisciplinary Sciences, UCAS(交叉科学学院,中国科学院大学) National Astronomical Observatories, CAS(国家天文台,中国科学院) School of Artificial Intelligence, UCAS(人工智能学院,中国科学院大学)

专题命中 指令微调 :language agent(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出Spec-o3,一种工具增强的视觉-语言代理,通过多模态链式推理实现天文学家对稀有天体候选体的自动化光谱检查,提升验证效率和准确性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09253 2026-04-24 cs.LG cs.AI 82%

RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning

RIFT:通过奖励引导微调重用负样本

Zehua Liu, Shuqi Liu, Tao Zhong, Mingxuan Yuan

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 RIFT通过奖励引导微调利用所有自生成样本,重用负轨迹并重新加权损失,提升对齐效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07961 2026-04-24 cs.CV 80%

SGG-R$^{\rm 3}$: From Next-Token Prediction to End-to-End Unbiased Scene Graph Generation

SGG-R$^{\rm 3}$: 从单token预测到端到端无偏场景图生成

Jiaye Feng, Qixiang Yin, Yuankun Liu, Tong Mo, Weiping Li

机构 * School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) Zhongguancun Academy(中关村学院)

专题命中 指令微调 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SGG-R$^{\rm 3}$框架,通过结合任务特定的推理过程和强化学习优化,解决场景图生成中的关系稀疏和长尾问题,提升生成效果和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06428 2026-04-24 cs.LG 79%

BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models

BackPlay:用于扩散语言模型的头部-only回溯自校正

Liming Liu, Binxuan Huang, Zixuan Zhang, Xin Liu, Bing Yin, Tuo Zhao

机构 * Amazon(亚马逊)

专题命中 指令微调 :language model(title,abstract);分类 cs.LG

AI总结 BackPlay通过在冻结的生成器上训练轻量级校正头,改进多token解码下的生成质量,利用回溯校正机制减少错误积累。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12845 2026-04-24 cs.CV 78%

Multimodal Protein Language Models for Enzyme Kinetic Parameters: From Substrate Recognition to Conformational Adaptation

多模态蛋白质语言模型用于酶动力学参数:从底物识别到构象适应

Fei Wang, Xinye Zheng, Kun Li, Yanyan Wei, Yuxin Liu, Ganpeng Hu, Tong Bao, Jingwen Yang

机构 * School of Computer Science and Information Engineering(计算机科学与信息工程学院) Institute of Artificial Intelligence(人工智能研究院) CVLab, College of Information Technology(CV实验室,信息学院) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) School of Food Biological Engineering(食品生物工程学院)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出多阶段多模态条件建模方法,通过ERBA模块在蛋白质语言模型中注入跨模态信息,提升酶动力学参数预测的准确性与生物合理性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18629 2026-04-24 cs.LG cs.AI 62%

HyperAdapt: Simple High-Rank Adaptation

HyperAdapt: 简单的高秩适应

Abel Gurung, Joseph Campbell

机构 * Purdue University(普渡大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 HyperAdapt通过高秩更新减少可训练参数,实现高效的微调,在多个基准测试中表现接近全微调方法。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.16774 2026-04-24 math.DS math.AT math.GR 50%

Contractible subshifts

可缩缩移子系统

Leo Poirier, Ville Salo

专题命中 指令微调 :SFT(abstract)

AI总结 本文引入了可缩缩移子系统的概念,探讨了其与强不可约性的关系,并展示了其在动力系统中的应用与贡献。

Comments 58 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 9 篇

2604.21223 2026-04-24 cs.CL cs.AI 92%

Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model

通过隐式奖励模型实现LLM生成文本的零样本检测

Runheng Liu, Heyan Huang, Xingchen Xiao, Zhijing Wu

机构 * School of Computer Science and Technology, Beijing Institute of Technology(计算机科学与技术学院,北京理工大学)

专题命中 后训练与偏好优化 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IRM方法,利用隐式奖励模型实现LLM生成文本的零样本检测,无需偏好收集或额外训练,在DetectRL基准上表现优于现有方法。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21209 2026-04-24 cs.AI cs.CL 88%

Align Generative Artificial Intelligence with Human Preferences: A Novel Large Language Model Fine-Tuning Method for Online Review Management

对齐生成式人工智能与人类偏好:一种用于在线评论管理的新型大语言模型微调方法

Yanan Wang, Yong Ge

机构 * Department of Information Systems and Operations Management, The University of Texas at Arlington(信息系统与运营管理系,德克萨斯大学阿灵顿分校) Department of Management Information Systems, University of Arizona(管理信息学系,亚利桑那大学)

专题命中 后训练与偏好优化 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出一种新型微调方法,通过上下文增强和理论驱动的偏好微调,解决在线评论生成中的幻觉、偏好表示和保守优化问题,提升生成质量。

Comments Accepted to Information Systems Research (ISR). This is a preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏