arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-25 至 2026-03-25 共收录 246 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 17 篇

2603.22301 2026-03-25 cs.LG cs.AI 90%

Latent Semantic Manifolds in Large Language Models

大型语言模型中的潜在语义流形

Mohamed A. Mabrok

机构 * Qatar University(卡塔尔大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型中隐藏状态作为流形点的几何解释,定义表达性差距并验证其在不同架构中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23251 2026-03-25 cs.CL cs.LG 87%

Is AI Catching Up to Human Expression? Exploring Emotion, Personality, Authorship, and Linguistic Style in English and Arabic with Six Large Language Models

人工智能是否正在赶上人类表达?探索英语和阿拉伯语中情感、个性、作者身份和语言风格的模仿

Nasser A Alsadhan

机构 * College of Computer and Information Sciences, King Saud University(计算机与信息科学学院,沙特阿拉伯国王沙德大学)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文研究六种大语言模型在英语和阿拉伯语中模仿情感和个性的能力,发现AI生成文本可被识别,但分类性能下降,揭示了LLM在情感信号编码上的差异。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23421 2026-03-25 econ.GN cs.AI q-fin.EC 85%

Quantifying Systemic Vulnerability in the Foundation Model Industry

量化基础模型行业的系统性脆弱性

Claudio Pirrone, Stefano Fricano, Gioacchino Fazio

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AIIVI指数,基于O-Ring理论量化基础模型行业脆弱性,发现计算基础设施和能源系统是主要约束因素,揭示了行业在数据透明度低和技术快速演变下的极端脆弱性。

Comments Conference Paper - SIEPI (29-30 January 2026) - Bari

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22039 2026-03-25 cs.LG cs.AI 84%

UniCA: Unified Covariate Adaptation for Time Series Foundation Model

UniCA: 时空基础模型的统一协变量适应

Lu Han, Yu Liu, Lan Li, Qiwen Deng, Jian Jiang, Yinbo Sun, Zhe Yu, Binfeng Wang, Xingyu Lu, Lintao Ma, Han-Jia Ye, De-Chuan Zhan

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院,中国) National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室,中国) Ant Group, Hangzhou, China(蚂蚁集团,杭州,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 UniCA通过协变量同质化和统一注意力融合机制,提升时空基础模型对异质协变量的适应能力,实验证明其在多模态预测任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22953 2026-03-25 cs.CV 82%

Cluster-Wise Spatio-Temporal Masking for Efficient Video-Language Pretraining

基于簇的时空掩码用于高效的视频-语言预训练

Weijun Zhuang, Yuqing Huang, Weikang Meng, Xin Li, Ming Liu, Xiaopeng Hong, Yaowei Wang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract)

AI总结 本文提出ClusterSTM策略,通过簇内掩码保留关键时空信息,提升视频-语言预训练效率,并在多任务上取得新状态。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17075 2026-03-25 cs.CL cs.LG 79%

Perturb Your Data: Paraphrase-Guided Training Data Watermarking

扰动你的数据:基于改写引导的训练数据水印

Pranav Shetty, Mirazul Haque, Petr Babkin, Zhiqiang Ma, Xiaomo Liu, Manuela Veloso

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SPECTRA方法,通过LLM改写文本并结合评分模型,实现训练数据可靠检测,即使数据占比低于0.001%。该方法能有效区分训练数据与非训练数据,具有高鲁棒性和可扩展性。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16051 2026-03-25 cs.LG cs.AI cs.HC 79%

GUIrilla: A Scalable Framework for Automated Desktop UI Exploration

GUIrilla:一个可扩展的自动化桌面UI探索框架

Sofiya Garkot, Maksym Shamrai, Ivan Synytsia, Mariya Hirna

机构 * MacPaw

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GUIrilla框架,用于生成大规模真实桌面交互数据,以提升交互系统基础模型的性能与泛化能力,特别针对macOS平台,提供可重用的MacApp Trees结构化表示。

Comments Accepted to the 3rd DATA-FM Workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22622 2026-03-25 cs.CV 78%

A Vision Language Model for Generating Procedural Plant Architecture Representations from Simulated Images

一种用于从模拟图像生成程序化植物建筑表示的视觉语言模型

Heesup Yun, Isaac Kazuo Uyehara, Ioannis Droutsas, Earl Ranario, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * Biological and Agricultural Engineering(生物与农业工程系) Department of Plant Sciences(植物科学系) Viticulture and Enology(葡萄栽培与酿酒系) Wageningen University & Research(瓦赫宁根大学与研究学院)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出一种视觉语言模型,通过合成图像生成3D植物建筑模型,提取器官级参数,验证了从图像数据中提取植物建筑参数的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22577 2026-03-25 cs.CR cs.AI cs.MA 77%

STRIATUM-CTF: A Protocol-Driven Agentic Framework for General-Purpose CTF Solving

STRIATUM-CTF: 一种基于协议的代理框架用于通用CTF求解

James Hugglestone, Samuel Jacob Chacko, Dawson Stoller, Ryan Schmidt, Xiuwen Liu

机构 * Department of Computer Science, Florida State University, Tallahassee, USA(计算机科学系,佛罗里达州立大学,塔拉萨斯,美国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出STRIATUM-CTF框架,通过Model Context Protocol标准化工具接口,提升CTF求解的自主性和适应性,在真实竞赛中取得第一名。

Comments 8 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23481 2026-03-25 cs.RO cs.AI cs.CV cs.LG 73%

VTAM: Video-Tactile-Action Models for Complex Physical Interaction Beyond VLAs

VTAM:用于复杂物理交互的视频-触觉-动作模型超越VLAs

Haoran Yuan, Weigang Yi, Zhenyu Zhang, Wendi Chen, Yuchen Mo, Jiashi Yin, Xinzhuo Li, Xiangyu Zeng, Chuan Wen, Cewu Lu, Katherine Driggs-Campbell, Ismini Lourentzou

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 VTAM通过整合触觉感知提升复杂物理交互的稳定性,其多模态框架在接触密集任务中表现优异,成功率达到90%。

Comments https://plan-lab.github.io/projects/vtam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22629 2026-03-25 cs.CL cs.AI 73%

LGSE: Lexically Grounded Subword Embedding Initialization for Low-Resource Language Adaptation

LGSE: 词法基础的子词嵌入初始化用于低资源语言适应

Hailay Teklehaymanot, Dren Fazlija, Wolfgang Nejdl

机构 * L3S Research Center Hannover(汉诺威L3S研究中心)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 LGSE通过引入词法信息的子词分割方法,改进低资源语言适应中的词嵌入初始化,通过平均预训练的子词或FastText词法表示,提升表示质量。

Comments 12 pages, 1 figure, 1 Table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22294 2026-03-25 cs.LG cs.AI 73%

Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks

高效嵌入式合成数据生成用于复杂推理任务

Srideepika Jayaraman, Achille Fokoue, Dhaval Patel, Jayant Kalagnanam

机构 * IBM Research(IBM研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于嵌入的合成数据生成方法,通过增强数据多样性提升多个基准的性能,分析嵌入空间中数据分布与预测准确性之间的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06690 2026-03-25 cs.CV 67%

Spectral Gaps and Spatial Priors: Studying Hyperspectral Downstream Adaptation Using TerraMind

光谱间隙与空间先验:利用TerraMind研究高光谱下游适应

Julia Anna Leonardi, Johannes Jakubik, Paolo Fraccaro, Maria Antonia Brovelli

机构 * IBM Research Europe(IBM欧洲研究院)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract)

AI总结 本文研究了TerraMind在无高光谱预训练情况下处理高光谱下游任务的适应性,比较了通道适应策略并证明了深度学习模型在处理高光谱数据方面的优势。

Comments Accepted to ICLR 2026 Machine Learning for Remote Sensing (ML4RS) Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16740 2026-03-25 cs.CV 50%

Task-Oriented Data Synthesis and Control-Rectify Sampling for Remote Sensing Semantic Segmentation

面向任务的数据合成与控制-校正采样用于遥感语义分割

Yunkai Yang, Yudong Zhang, Kunquan Zhang, Jinxiao Zhang, Xinying Chen, Haohuan Fu, Runmin Dong

机构 * Sun Yat-Sen University(中山大学) Tsinghua University(清华大学) Beijing Institute of Technology(北京理工大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出TODSynth框架,结合多模态扩散变换器和任务反馈驱动的采样策略,提升遥感语义分割数据合成效果,尤其在少样本和复杂场景中表现优异。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22574 2026-03-25 cs.RO 50%

GIFT: Generalizing Intent for Flexible Test-Time Rewards

GIFT:基于意图的灵活测试时间奖励

Fin Amin, Nathaniel Dennler, Andreea Bobu

机构 * NC State(北卡罗来纳州立大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 预训练与数据 :language model(abstract)

AI总结 GIFT通过语言模型推断用户演示中的高层意图,以提升奖励在新环境下的泛化能力,优于基于视觉和语义相似性的基线方法。

Comments To appear at IEEE ICRA '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09892 2026-03-25 cs.SE 50%

Immersion in the GitHub Universe: Scaling Coding Agents to Mastery

在GitHub宇宙中的沉浸:将编码代理扩展至精通

Jiale Zhao, Guoxin Chen, Fanzhe Meng, Minghao Li, Jie Chen, Hui Xu, Yongshuai Sun, Wayne Xin Zhao, Ruihua Song, Yuan Zhang, Peng Wang, Cheng Chen, Jirong Wen, Kai Jia

专题命中 预训练与数据 :LLM(abstract)

AI总结 本文提出ScaleSWE系统,通过自动化多代理工作流生成高质量SWE数据,产生10万验证实例,超越现有数据集的多样性和复杂性,训练出性能提升三倍的ScaleSWE代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20565 2026-03-25 cs.CV 50%

DINO-Tok: Adapting DINO for Visual Tokenizers

DINO-Tok:为视觉分词器适应DINO

Mingkai Jia, Mingxiao Li, Zhijian Shu, Anlin Zheng, Liaoyuan Fan, Jiaxin Guo, Tianxing Shi, Dongyue Lu, Zeming Li, Xiaoyang Guo, Xiaojuan Qi, Xiao-Xiao Long, Qian Zhang, Ping Tan, Wei Yin

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Horizon Robotics(Horizon机器人) Nanjing University(南京大学) Hong Kong University(香港大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :foundation model(abstract)

AI总结 本文提出DINO-Tok,一种基于冻结DINO编码器的视觉分词器,结合连续自编码和离散向量量化方法,提升高维潜在空间中的语义一致性和生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 11 篇

2410.12164 2026-03-25 cs.CL cs.DB cs.LG 88%

Table-LLM-Specialist: Language Model Specialists for Tables using Iterative Generator-Validator Fine-tuning

Table-LLM-Specialist: 用于表格任务的语言模型专家使用迭代生成-验证微调

Junjie Xing, Yeye He, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang, Surajit Chaudhuri

机构 * University of Michigan(密歇根大学) Microsoft Corporation(微软公司)

专题命中 指令微调 :LLM(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出Table-LLM-Specialist,通过生成-验证框架实现表格任务的有效微调,无需人工标注数据,提升性能并降低部署成本。

Comments Full version of a paper in EMNLP 2025; code is available at: https://github.com/microsoft/Table-Specialist

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06501 2026-03-25 cs.SE 87%

Evaluating Language Model Applications for Identifying Solution-Related Content in Issue Report Discussions

评估语言模型在问题报告讨论中识别解决方案相关内容的应用

Antu Saha, Mehedi Sun, Oscar Chaparro

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);prompting(abstract)

AI总结 本文利用语言模型自动识别问题讨论中的解决方案内容,通过三种应用(嵌入、提示、微调)评估不同分类器性能,发现微调大语言模型效果最佳,且模型迁移能提升其他项目的效果。

Comments 50 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22287 2026-03-25 cs.CV cs.AI cs.CL 86%

Founder effects shape the evolutionary dynamics of multimodality in open LLM families

奠基效应塑造了开放大语言模型家族中多模态的进化动态

Manuel Cebrian

机构 * Center for Automation and Robotics, Spanish National Research Council, Madrid, Spain(自动化与机器人中心,西班牙国家研究委员会,西班牙马德里)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究通过分析模型谱系数据,发现多模态能力在开放大语言模型家族中通过罕见的奠基事件进入,并在后代谱系中快速扩展,导致多模态能力的采用动态呈现突变特征。

Comments 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03673 2026-03-25 cs.CL cs.AI 79%

TACOS: Open Tagging and Comparative Scoring for Instruction Fine-Tuning Data Selection

TACOS:用于指令微调数据选择的开放标签和比较评分

Xixiang He, Hao Yu, Qiyao Sun, Ao Cheng, Tailai Zhang, Cong Liu, Shuxuan Guo

机构 * National University of Defense Technology(国防科技大学) Intelligent Game and Decision Lab(智能游戏与决策实验室)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 TACOS通过开放标签和比较评分方法提升指令微调数据选择的效率与效果,通过开放域标签和去噪处理增强数据多样性,并通过比较评分避免单一标准的不一致性,实验显示其在多个数据集和模型架构上均表现优异。

Journal ref 2025 IEEE International Conference on Multimedia and Expo (ICME)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01248 2026-03-25 cs.CV 78%

TRivia: Self-supervised Fine-tuning of Vision-Language Models for Table Recognition

TRivia: 基于视觉-语言模型的自监督微调用于表格识别

Junyuan Zhang, Bin Wang, Qintong Zhang, Fan Wu, Zichen Wen, Jialin Lu, Junjie Shan, Ziqi Zhao, Shuya Yang, Ziling Wang, Ziyang Miao, Huaping Zhong, Yuhang Zang, Xiaoyi Dong, Ka-Ho Chow, Conghui He

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiaotong University(上海交通大学) Sensetime

专题命中 指令微调 :language model(title,abstract)

AI总结 TRivia通过自监督微调方法,使预训练视觉-语言模型直接从未标注的表格图像中学习表格识别,无需人工标注,提升了表格识别性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22446 2026-03-25 cs.CL cs.AI cs.LG 75%

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

稀疏但关键:RLVR微调中LLMs分布偏移的token级分析

Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过token级分析揭示RLVR微调中分布偏移的机制,发现微调导致稀疏且针对性强的token分布变化,通过交叉采样实验验证了少量token决策对性能提升的关键作用。

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08686 2026-03-25 cs.CL cs.CY cs.LG 73%

LatentQA: Teaching LLMs to Decode Activations Into Natural Language

LatentQA: 教授大语言模型将激活解码为自然语言

Alexander Pan, Lijie Chen, Jacob Steinhardt

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 指令微调 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LatentQA任务,通过生成激活与自然语言描述的数据库,训练解码器LLM以回答关于激活的开放性问题,并验证其在阅读任务和行为控制中的优越性。

Comments ICLR 2026; project page at https://latentqa.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00333 2026-03-25 cs.LG eess.SP 70%

Two Stage Wireless Federated LoRA Fine-Tuning with Sparsified Orthogonal Updates

双阶段无线联邦LoRA微调与稀疏正交更新

Bumjun Kim, Wan Choi

机构 * Department of Electrical and Computer Engineering, and the Institute of New Media and Communications, Seoul National University (SNU)(电气与计算机工程系,以及新媒体与通讯研究所,首尔国立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种双阶段联邦算法,通过稀疏正交微调方法优化学习性能和通信效率,减少通信开销同时保持模型准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22706 2026-03-25 cs.CV cs.SE 67%

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

VLMs在视觉缺陷检测中能走多远?研究41小时游戏录像中的19,738个关键帧

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学)

专题命中 指令微调 :language model(abstract);prompting(abstract)

AI总结 研究通过分析41小时游戏录像中的19,738个关键帧,评估VLMs在实际场景中检测视觉缺陷的能力,发现其性能有限,需结合混合方法提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22819 2026-03-25 cs.CV cs.AI 57%

TDATR: Improving End-to-End Table Recognition via Table Detail-Aware Learning and Cell-Level Visual Alignment

TDATR:通过表格细节感知学习和单元级视觉对齐改进端到端表格识别

Chunxia Qin, Chenyu Liu, Pengcheng Xia, Jun Du, Baocai Yin, Bing Yin, Cong Liu

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK Research(iFLYTEK研究院)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 TDATR通过表格细节感知学习和单元级视觉对齐改进端到端表格识别,采用感知-融合策略,提升模型鲁棒性和识别精度,无需数据集特定微调即可在七个基准上取得领先性能。

Comments Acceptd by CVPR 2026. Project Page: https://github.com/Chunchunwumu/TDATR.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23691 2026-03-25 astro-ph.SR 50%

Improved reconstruction of the century-long solar magnetic field by incorporating morphological asymmetry in sunspots

通过引入日珥形态不对称性改进百年太阳磁场重建

Subhadip Pal, Gopal Hazra, Sudip Mandal

专题命中 指令微调 :SFT(abstract)

AI总结 本文改进SFT模型,结合日珥形态不对称性、观测到的倾斜角和日珥面积数据,提高了对太阳磁场特别是极区磁场的重建精度,尤其在预测太阳活动周期方面有显著提升。

Comments 17 pages, 13 figures, accepted for publication in ApJ

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2603.22829 2026-03-25 cs.AI 87%

Improving Safety Alignment via Balanced Direct Preference Optimization

通过平衡直接偏好优化提升安全性对齐

Shiji Zhao, Mengyang Wang, Shukun Xiong, Fangzhou Chen, Qihui Zhu, Shouwei Ruan, Yisong Xiao, Ranjie Duan, Xun Chen, XingXing Wei

机构 * Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出B-DPO方法,通过平衡偏好与非偏好响应的优化强度,缓解偏好对齐中的过拟合问题,提升模型安全性同时保持竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23184 2026-03-25 cs.CL cs.AI stat.AP 84%

ImplicitRM: Unbiased Reward Modeling from Implicit Preference Data for LLM alignment

ImplicitRM: 从隐式偏好数据中无偏奖励建模以实现语言模型对齐

Hao Wang, Haocheng Yang, Licheng Pan, Lei Shen, Xiaoxi Li, Yinuo Wang, Zhichao Chen, Yuan Lu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title);language model(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitRM,通过隐式反馈数据学习无偏奖励模型,解决隐式偏好数据中缺乏明确负样本和用户偏好偏差的问题,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏