arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-16 至 2026-03-16 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12 篇

2603.11139 2026-03-16 cs.LG 92%

H2LooP Spark Preview: Continual Pretraining of Large Language Models for Low-Level Embedded Systems Code

H2LooP Spark Preview:为低级嵌入式系统代码进行大语言模型的持续预训练

Amit Singh, Vedant Nipane, Pulkit Agrawal, Jatin Kishnani, Sairanjan Mishra

机构 * H2LooP.ai

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.LG

AI总结 本文提出H2LooP Spark Preview,通过持续预训练方法,利用BF16 LoRA技术将OLMo-3-7B模型适应于嵌入式系统领域,显著降低困惑度并提升代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12343 2026-03-16 cs.CL 83%

LLM-Augmented Therapy Normalization and Aspect-Based Sentiment Analysis for Treatment-Resistant Depression on Reddit

基于大型语言模型的疗法规范化与基于方面的情感分析用于抗药性抑郁症的Reddit研究

Yuxin Zhu, Sahithi Lakamana, Masoud Rouhizadeh, Selen Bozkurt, Rachel Hershenberg, Abeed Sarker

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过Reddit数据研究抗药性抑郁症患者的药物使用和情感倾向,利用大型语言模型进行情感分析,揭示药物感知差异及治疗经验特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13220 2026-03-16 cs.MA 80%

A Generative Model of Conspicuous Consumption and Status Signaling

conspicuous 消费与地位信号的生成模型

Logan Cross, Jordi Grau-Moya, William A. Cunningham, Alexander Sasha Vezhnevets, Joel Z. Leibo

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出基于适当性理论的生成模型,通过模拟LLM代理群体的社会互动,揭示了社会观察与预测模式完成的反馈循环如何驱动地位符号的内生生成,展示了消费行为与地位信号的动态关系。

Comments 29 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12998 2026-03-16 cs.CV 78%

A Closed-Form Solution for Debiasing Vision-Language Models with Utility Guarantees Across Modalities and Tasks

为跨模态和任务提供具有实用保障的视觉-语言模型去偏方法

Tangzheng Lian, Guanyu Hu, Yijing Ren, Dimitrios Kollias, Oya Celiktutan

机构 * King’s College London(伦敦国王学院) Queen Mary University of London(伦敦女王学院)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出一种无需标注数据的训练自由去偏方法,在跨模态空间中获得帕累托最优公平性,同时保持有限的实用性损失,实验显示其在多种公平度量和任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25941 2026-03-16 cs.CL 77%

RECAP: Reproducing Copyrighted Data from LLMs Training with an Agentic Pipeline

RECAP:通过代理流水线从LLM训练中重现受版权保护的数据

André V. Duarte, Xuying li, Bin Zeng, Arlindo L. Oliveira, Lei Li, Zhuo Li

机构 * Carnegie Mellon University(卡内基梅隆大学) Instituto Superior Técnico/INESC-ID(里斯本技术大学/INESC-ID) Hydrox AI

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RECAP通过代理流水线从LLM输出中提取和验证记忆的训练数据,利用反馈循环和对抗模块提升版权文本提取效果,实验显示其在ROUGE-L评分上显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12906 2026-03-16 cs.CL cs.AI 73%

Learning from Child-Directed Speech in Two-Language Scenarios: A French-English Case Study

在双语场景中学习儿童引导的口语:一项法语-英语案例研究

Liel Binyamin, Elior Sulem

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在严格数据匹配条件下,扩展BabyBERTa至英法双语场景的紧凑语言模型,对比儿童口语与多领域语料对语法和语义任务的影响,发现儿童口语在单语任务中表现更优,双语预训练对文本蕴含任务有显著提升。

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03222 2026-03-16 cs.CV 71%

Mocap-2-to-3: Multi-view Lifting for Monocular Motion Recovery with 2D Pretraining

Mocap-2-to-3:多视角提升用于单目运动恢复的2D预训练

Zhumei Wang, Zechen Hu, Ruoxi Guo, Huaijin Pi, Ziyong Feng, Liang Zhang, Mingtao Pei, Siyuan Huang

机构 * Beijing Institute of Technology(北京理工大学) State Key Laboratory of General Artificial Intelligence, BIGAI(国家一般人工智能重点实验室,BIGAI) Deep Glint Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Shandong Agricultural University(山东农业大学)

专题命中 预训练与数据 :pretraining(title)

AI总结 本文提出Mocap-2-to-3框架,通过多视角合成过程和分阶段训练提升单目运动恢复的精度与泛化能力,实现更精确的物理空间定位。

Comments Project page: https://wangzhumei.github.io/mocap-2-to-3/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13421 2026-03-16 cs.LG stat.ML 70%

Larger Datasets Can Be Repeated More: A Theoretical Analysis of Multi-Epoch Scaling in Linear Regression

更大的数据集可以重复更多次:线性回归中多轮缩放的理论分析

Tingkai Yan, Haodong Wen, Binghui Li, Kairong Luo, Wenguang Chen, Kaifeng Lyu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文理论分析了在线性回归中,通过多次训练同一数据集的常见方法如何改变数据缩放规律。研究发现,当训练轮数K较小时,数据有效重复率E(K,N)近似为K,而随着K增加,E(K,N)趋于一个随数据规模N增长的值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13036 2026-03-16 cs.HC cs.AI cs.CY 57%

Interrogating Design Homogenization in Web Vibe Coding

审视网络 vibe 编码中的设计同质化

Donghoon Shin, Alice Gao, Rock Yuren Pang, Jaewook Lee, Katharina Reinecke, Emily Tseng

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :prompting(abstract);分类 cs.AI

AI总结 本文探讨了生成式AI在复杂结构任务如网络设计中的同质化影响,分析了vibe编码生命周期中的风险阶段,并提出通过引入productive friction来缓解同质化问题的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12887 2026-03-16 cs.CV cs.LG 57%

Forecasting Epileptic Seizures from Contactless Camera via Cross-Species Transfer Learning

通过无接触摄像头进行癫痫发作的跨物种迁移学习预测

Mingkai Zhai, Wei Wang, Zongsheng Li, Quanying Liu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 本文提出基于视频的癫痫发作预测任务,利用短预发作视频片段预测后续5秒内是否会发作,通过跨物种迁移学习利用大量啮齿类动物视频数据提升预测准确性,实验结果显示在纯视频设置下预测准确率超过70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08820 2026-03-16 cs.CV 50%

Omni-Video 2: Scaling MLLM-Conditioned Diffusion for Unified Video Generation and Editing

Omni-Video 2:基于MLLM条件扩散模型的统一视频生成与编辑扩展

Hao Yang, Zhiyu Tan, Jia Gong, Luozheng Qin, Hesen Chen, Xiaomeng Yang, Yuqing Sun, Yuetan Lin, Mengping Yang, Hao Li

专题命中 预训练与数据 :language model(abstract)

AI总结 本文提出Omni-Video 2,通过连接预训练多模态大语言模型与视频扩散模型,实现视频生成与编辑的统一。核心方法是利用MLLM生成明确的目标描述以指导生成过程,并通过轻量适配器高效注入多模态条件token,提升复杂编辑任务性能。

Comments Technical Report, Project: https://howellyoung-s.github.io/Omni-Video2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06684 2026-03-16 cs.CV 50%

EMGauss: Continuous Slice-to-3D Reconstruction via Dynamic Gaussian Modeling in Volume Electron Microscopy

EMGauss:通过动态高斯建模在体积电子显微镜中实现连续切片到三维重建

Yumeng He, Zanwei Zhou, Yekun Zheng, Chen Liang, Yunbo Wang, Xiaokang Yang

专题命中 预训练与数据 :pretraining(abstract)

AI总结 EMGauss通过动态高斯建模方法,解决体积电子显微镜中切片到三维重建的异质性限制,提升插值质量并实现连续切片合成。

Comments Accepted by CVPR 2026. Project page: https://raynehe.github.io/EMGauss/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2603.13201 2026-03-16 cs.CL 92%

Neuron-Aware Data Selection In Instruction Tuning For Large Language Models

面向神经元的数据选择用于大语言模型的指令微调

Xin Chen, Junchao Wu, Shu Yang, Runzhe Zhan, Zeyu Wu, Min Yang, Shujian Huang, Lidia S. Chao, Derek F. Wong

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Provable Responsible AI and Data Analytics Lab, KAUST(可证明责任AI与数据分析实验室,卡尔斯兰大学) National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(title,abstract);分类 cs.CL

AI总结 本文提出NAIT框架,通过分析神经元激活模式相似性选择高效指令微调数据,提升大语言模型特定或通用能力,实验证明其在多种任务中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20796 2026-03-16 econ.GN cs.AI cs.LG q-fin.EC 90%

Aligning Large Language Model Agents with Rational and Moral Preferences: A Supervised Fine-Tuning Approach

对齐大型语言模型代理的理性与道德偏好:一种监督微调方法

Wei Lu, Amit Dhanda, Daniel L. Chen, Christian B. Hansen

机构 * Zicklin School of Business, CUNY Baruch College(纽约大学法学院) Amazon(亚马逊) Toulouse School of Economics(图卢兹经济学院)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文通过监督微调方法对齐LLM代理的理性与道德偏好,揭示了代理在经济游戏中的系统性偏差,并展示了不同偏好结构对均衡结果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07597 2026-03-16 cs.CL 86%

Instructing Large Language Models for Low-Resource Languages: A Systematic Study for Basque

为低资源语言指导大型语言模型:巴斯克语的系统研究

Oscar Sainz, Naiara Perez, Julen Etxaniz, Joseba Fernandez de Landa, Itziar Aldabe, Iker García-Ferrero, Aimar Zabala, Ekhi Azurmendi, German Rigau, Eneko Agirre, Mikel Artetxe, Aitor Soroa

专题命中 指令微调 :language model(title,abstract);large language model(title);分类 cs.CL

AI总结 本文系统研究了巴斯克语在低资源场景下的指导模型方法,发现目标语言语料库至关重要,合成指令能产生稳健模型,且使用指导模型作为骨干优于非指导基础模型。

Comments Accepted at EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03627 2026-03-16 cs.CL cs.AI 84%

Partially Recentralization Softmax Loss for Vision-Language Models Robustness

部分重校正softmax损失用于视觉-语言模型鲁棒性

Hao Wang, Jinzhe Jiang, Xin Zhang, Chen Li

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出部分重校正softmax损失,通过限制top K softmax输出提升预训练多模态模型的对抗鲁棒性,实验显示细调后模型对主流攻击更具鲁棒性。

Comments The study described in Section 4 was conducted without required institutional review board approval. The paper is withdrawn pending completion of the approval process

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12989 2026-03-16 cs.CV cs.CR 78%

Test-Time Attention Purification for Backdoored Large Vision Language Models

针对受污染的大视觉语言模型的测试时间注意力净化

Zhifang Zhang, Bojun Yang, Shuo He, Weitong Chen, Wei Emma Zhang, Olaf Maennel, Lei Feng, Miao Xu

机构 * University of Queensland(昆士兰大学) Southeast University(东南大学) Nanyang Technological University(南洋理工大学) Adelaide University(阿德莱德大学)

专题命中 指令微调 :language model(title,abstract)

AI总结 本文提出CleanSight,一种无需训练的测试时间防御方法,通过检测和净化异常的视觉-文本注意力分布来对抗后门攻击,显著优于现有基于像素的净化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10862 2026-03-16 cs.CL cs.AI cs.CR cs.CY cs.LG 75%

Superficial Safety Alignment Hypothesis

表面安全对齐假说

Jianwei Li, Jung-Eun Kim

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出表面安全对齐假说,认为安全对齐通过让模型选择正确推理方向来实现,识别出四种关键组件以建立安全防护。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12298 2026-03-16 cs.LG cs.AI 73%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07490 2026-03-16 cs.CL cs.LG 73%

Mask-Enhanced Autoregressive Prediction: Pay Less Attention to Learn More

增强的自回归预测:少关注多学习

Xialie Zhuang, Zhikai Jia, Jianjin Li, Zhenyu Zhang, Li Shen, Zheng Cao, Shiwei Liu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出MEAP方法,通过整合MLM与NTP提升上下文检索能力,实验显示其在关键信息检索和长上下文推理任务中表现优异,且在常识推理任务中不逊色。

Comments 17 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25084 2026-03-16 cs.CL cs.AI cs.IR cs.LG 67%

Scaling Generalist Data-Analytic Agents

放大通用数据分析代理

Shuofei Qiao, Yanqiu Zhao, Zhisong Qiu, Xiaobin Wang, Jintian Zhang, Zhao Bin, Ningyu Zhang, Yong Jiang, Pengjun Xie, Fei Huang, Huajun Chen

专题命中 指令微调 :SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataMind,通过细粒度任务分类和递归易难任务组合机制,解决开源数据分析代理的数据不足、训练策略不当和代码多轮滚动不稳定问题,构建出性能优异的DataMind-14B和DataMind-7B代理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06119 2026-03-16 cs.CV 67%

Omni-Video: Democratizing Unified Video Understanding and Generation

Omni-Video:统一视频理解与生成的普及

Zhiyu Tan, Hao Yang, Luozheng Qin, Jia Gong, Mengping Yang, Hao Li

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出Omni-Video框架,通过改进多模态大语言模型生成连续视觉线索,结合轻量架构和高效训练方案,实现视频理解、生成与编辑的统一模型。

Comments Technical report, project page: https://howellyoung-s.github.io/OmniVideo_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13007 2026-03-16 eess.IV cs.CV cs.LG physics.med-ph 57%

Accelerating Stroke MRI with Diffusion Probabilistic Models through Large-Scale Pre-training and Target-Specific Fine-Tuning

通过大规模预训练和目标特定微调加速中风MRI

Yamin Arefeen, Sidharth Kumar, Steven Warach, Hamidreza Saber, Jonathan Tamir

机构 * Chandra Family Department of Electrical and Computer Engineering(查克拉家族电气与计算机工程系) Department of Imaging Physics(成像物理系) Dell Medical School Department of Neurology(德莱尔医学院神经学系) Dell Medical School Department of Neurosurgery(德莱尔医学院神经外科系) Dell Medical School Department of Diagnostic Medicine(德莱尔医学院诊断医学系) Oden Institute for Computational Engineering and Sciences(奥登计算工程与科学研究院)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种高效策略,利用扩散概率生成模型在有限数据下加速MRI重建,通过大规模预训练和目标特定微调实现临床中风MRI的快速扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23228 2026-03-16 cs.CV cs.AI 57%

MovieTeller: Tool-augmented Movie Synopsis with ID Consistent Progressive Abstraction

MovieTeller: 借助工具的电影概要与ID一致的渐进抽象

Yizhi Li, Xiaohan Chen, Miao Jiang, Wentao Tang, Gaoang Wang

机构 * Central Universities(中央高校) National Natural Science Foundation of China(中国国家自然科学基金委员会) Research Fund for International Scientists of National Natural Science Foundation of China(中国国家自然科学基金委员会国际科学家研究基金)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 MovieTeller通过工具增强的渐进抽象生成电影概要,解决传统VLM在长视频摘要中的身份一致性和叙事连贯性问题,提升事实准确性与一致性。

Comments 6 pages, CSCWD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12811 2026-03-16 cs.CV 50%

OARS: Process-Aware Online Alignment for Generative Real-World Image Super-Resolution

OARS:面向生成真实世界图像超分辨率的在线对齐

Shijie Zhao, Xuanyu Zhang, Bin Chen, Weiqi Li, Qunliang Xing, Kexin Zhang, Yan Wang, Junlin Li, Li Zhang, Jian Zhang, Tianfan Xue

机构 * ByteDance Inc.(字节跳动公司) Peking University(北京大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :preference optimization(abstract)

AI总结 OARS通过过程感知的在线对齐框架,结合COMPASS奖励模型,在线优化图像超分辨率模型,实现感知与保真度的平衡,提升真实世界图像超分辨率性能。

Comments Super-Resolution, Reinforcement Learning

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2603.13045 2026-03-16 cs.CL 81%

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

修补漏洞:在多语言翻译中缓解奖励黑客

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。

Comments Our code is available at https://github.com/LeiLiLab/WALAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12628 2026-03-16 q-bio.NC cs.AI eess.SP 81%

Towards unified brain-to-text decoding across speech production and perception

迈向跨语音生成与感知的统一脑-文本解码

Zhizhang Yuan, Yang Yang, Gaorui Zhang, Baowen Cheng, Zehan Wu, Yuhao Xu, Xiaoying Liu, Liang Chen, Ying Mao, Meng Li

机构 * Computer Science and Technology(计算机科学与技术) Zhejiang University(浙江大学) Shanghai Institute of Microsystem and Information Technology(上海微系统与信息工程研究所) Chinese Academy of Sciences(中国科学院) Department of Neurosurgery(神经外科部门) Huashan Hospital, Fudan University(复旦大学华山医院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出一种统一的脑-句子解码框架,用于 Mandarin Chinese 的语音生成与感知,通过单字符数据训练实现句子级解码,并通过多模态神经动态比较提升解码性能。

Comments 37 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12565 2026-03-16 cs.SD cs.CL 79%

Speech-Worthy Alignment for Japanese SpeechLLMs via Direct Preference Optimization

通过直接偏好优化实现日语SpeechLLMs的Speech-Worthy对齐

Mengjie Zhao, Lianbo Liu, Yusuke Fujita, Hao Shi, Yuan Gao, Roman Koshkin, Yui Sudo

机构 * SB Intuitions

专题命中 后训练与偏好优化 :preference optimization(title);LLM(abstract);分类 cs.CL

AI总结 本文提出通过直接偏好优化方法,改进日语SpeechLLMs以生成适合语音合成的简洁、口语化文本,引入SpokenElyza基准测试,并在保持原有性能的同时显著提升语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12050 2026-03-16 cs.CL cs.AI cs.LG 75%

AdaBoN: Adaptive Best-of-N Alignment

AdaBoN: 适应性最佳N对齐

Vinod Raman, Hilal Asi, Satyen Kale

专题命中 后训练与偏好优化 :language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种适应性最佳N对齐策略,通过两阶段算法高效分配推理计算资源,实验证明其在不同提示批次中优于均匀分配方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12595 2026-03-16 cs.LG cs.AI 62%

Swap-guided Preference Learning for Personalized Reinforcement Learning from Human Feedback

基于交换引导的偏好学习用于从人类反馈中获得个性化强化学习

Gihoon Kim, Euntai Kim

机构 * Yonsei University(延世大学) Korea Institute of Science and Technology(韩国科学技术院)

专题命中 后训练与偏好优化 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Swap-guided Preference Learning (SPL)来解决变分偏好学习中后验崩溃的问题,通过引入交换引导基础正则化、偏好逆自回归流和自适应潜在条件化来提升个性化强化学习效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏