arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-01 至 2026-04-01 共收录 235 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 13 篇

2603.29661 2026-04-01 cs.CL cs.AI cs.IR 90%

Agenda-based Narrative Extraction: Steering Pathfinding Algorithms with Large Language Models

基于议程的叙述提取:用大语言模型引导路径查找算法

Brian Felipe Keith-Norambuena, Carolina Inés Rojas-Córdova, Claudio Juvenal Meneses-Villegas, Elizabeth Johanna Lam-Esquenazi, Angélica María Flores-Bustos, Ignacio Alejandro Molina-Villablanca, Joshua Emanuel Leyton-Vallejos

机构 * Department of Computing and Systems Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区计算与系统工程系,安托法加斯塔,智利) Department of Industrial Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区工业工程系,安托法加斯塔,智利) Department of Chemical and Environmental Engineering, Universidad Católica del Norte, Antofagasta, Chile(智利天主教大学北部校区化学与环境工程系,安托法加斯塔,智利)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于议程的叙述提取方法,通过整合大语言模型到路径查找过程中,引导叙述构建朝向用户指定视角,提升了叙述的连贯性和多视角支持。

Comments Text2Story Workshop 2026 at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00022 2026-04-01 cs.CL cs.AI cs.LG 87%

Aleph-Alpha-GermanWeb: Improving German-language LLM pre-training with model-based data curation and synthetic data generation

Aleph-Alpha-GermanWeb:通过基于模型的数据筛选和合成数据生成改进德语LLM预训练

Thomas F Burns, Letitia Parcalabescu, Stephan Wäldchen, Michael Barlow, Gregor Ziegltrum, Volker Stampa, Bastian Harren, Björn Deiseroth

机构 * Aleph Alpha Research(Aleph Alpha 研究)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合启发式与模型筛选技术及合成数据生成的德语数据集筛选流程,构建了628B词的预训练数据集,通过在德语基准测试中显著优于FineWeb2,证明了基于模型的数据筛选和合成数据生成对LLM预训练的提升作用。

Comments 17 pages, 3 figures; published at EACL 2026

Journal ref EACL 2026, volume 1, pages 1267-1283

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29644 2026-04-01 cs.LG 79%

Disentangled Graph Prompting for Out-Of-Distribution Detection

解耦图提示用于分布外检测

Cheng Yang, Yu Hao, Qi Zhang, Chuan Shi

机构 * Beijing Key Lab of Intelligent Telecommunications Software and Multimedia, Beijing University of Posts and Telecommunications(北京邮电大学智能通信软件与多媒体北京市重点实验室) China Mobile Group Shaanxi Co., Ltd.(中国移动通信集团陕西有限公司)

专题命中 预训练与数据 :prompting(title,abstract);分类 cs.LG

AI总结 本文提出解耦图提示方法,通过预训练和提示机制捕捉细粒度分布内模式,提升图分布外检测性能,实验表明其在多个数据集上优于现有基线。

Comments Accepted for publication in IEEE Transactions on Knowledge and Data Engineering (TKDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28773 2026-04-01 cs.IR cs.CL cs.LG 79%

UltRAG: a Universal Simple Scalable Recipe for Knowledge Graph RAG

UltRAG:一种通用简单可扩展的知识图谱RAG配方

Dobrik Georgiev, Kheeran Naidu, Alberto Cattaneo, Federico Monti, Carlo Luschi, Daniel Justus

机构 * Graphcore Research(Graphcore 研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出UltRAG框架,通过神经查询执行模块提升知识图谱问答性能,无需重新训练LLM,在大规模知识图谱上实现高效问答。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28336 2026-04-01 cs.AI cs.LG 79%

A Multi-Agent Rhizomatic Pipeline for Non-Linear Literature Analysis

一种多智能体根状管道用于非线性文献分析

Julio C. Serrano, Joonas Kevari, Rumy Narayan

机构 * University of Vaasa, School of Management, Vaasa, Finland(瓦萨大学管理学院) LUT University, School of Engineering, Lahti, Finland(拉彭兰塔-拉赫蒂理工大学工程学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于德勒兹过程关系本体的多智能体系统,通过12个专用智能体实现非线性文献分析,自动检测跨学科交汇与研究空白。

Comments Research note paper, 12 pages, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29034 2026-04-01 cs.CV eess.IV 78%

The Surprising Effectiveness of Noise Pretraining for Implicit Neural Representations

隐式神经表示中噪声预训练的意外有效性

Kushal Vyas, Alper Kayabasi, Daniel Kim, Vishwanath Saragadam, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Rice University(莱斯大学) University of California, Riverside(加州大学河滨分校)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文通过噪声预训练探索隐式神经表示的特性,发现无结构噪声预训练显著提升信号拟合能力,但对去噪效果不佳,而经典自然图像频谱结构的噪声则在信号拟合与逆向成像间取得平衡。

Comments Accepted to CVPR 2026. Project page: https://kushalvyas.github.io/noisepretraining.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29974 2026-04-01 cs.LG 74%

Meteorology-Driven GPT4AP: A Multi-Task Forecasting LLM for Atmospheric Air Pollution in Data-Scarce Settings

气象驱动的GPT4AP:一种用于数据稀少环境的多任务预测LLM

Prasanjit Dey, Soumyabrata Dev, Bianca Schoen-Phelan

机构 * ADAPT SFI Research Centre, School of Computer Science, Technological University Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林理工大学) ADAPT SFI Research Centre, School of Computer Science, University College Dublin(ADAPT SFI研究中心,计算机科学学院,都柏林大学学院) School of Computer Science, Technological University Dublin(计算机科学学院,都柏林理工大学)

专题命中 预训练与数据 :LLM(title);分类 cs.LG

AI总结 本文提出GPT4AP,一种基于预训练GPT-2和rsLoRA的高效多任务预测框架,用于数据稀少环境下的大气污染预测,展示了其在少样本、零样本和长期预测中的优越性能。

Comments This manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29221 2026-04-01 cs.CL 70%

SiPaKosa: A Comprehensive Corpus of Canonical and Classical Buddhist Texts in Sinhala and Pali

SiPaKosa:一篇全面的斯里兰卡语和巴利经典和古典佛教文本语料库

Ranidu Gurusinghe, Nevidu Jayatilleke

机构 * School of Computing, Informatics Institute of Technology, Sri Lanka(斯里兰卡信息理工学院计算学院)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 SiPaKosa语料库包含约786万词和786千句,结合16份历史佛教文献和完整的巴利三藏文本,通过高质量OCR和网络爬虫构建,评估了10种预训练模型的性能,显示专有模型在开放源代码模型上表现优异,支持领域适应语言模型的预训练,促进历史语言分析和佛教研究信息检索系统的发展。

Comments 17 pages, 5 figures, 5 tables, Accepted paper at the 2nd Workshop on Challenges in Processing South Asian Languages (CHiPSAL) @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29176 2026-04-01 q-bio.NC cs.AI cs.CE cs.CV 70%

Predicting Neuromodulation Outcome for Parkinson's Disease with Generative Virtual Brain Model

利用生成虚拟脑模型预测帕金森病的神经调制疗效

Siyuan Du, Siyi Li, Shuwei Bai, Ang Li, Haolin Li, Mingqing Xiao, Yang Pan, Dongsheng Li, Weidi Xie, Yanfeng Wang, Ya Zhang, Chencheng Zhang, Jiangchao Yao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院) Shanghai AI Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Microsoft Research Asia(微软亚洲研究院) Zhongnan Hospital of Wuhan University(武汉大学中南医院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Artificial Intelligence for Medicine, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院人工智能医学研究所) Cooperative Medianet Innovation Center, Shanghai Jiao Tong University(上海交通大学协同媒体创新中心)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 本文提出一种基于生成虚拟脑模型的预训练-微调框架,通过静息态fMRI预测帕金森病患者接受颞叶干扰和深部脑刺激的疗效,利用生成模型提高个体化虚拟脑的准确性,并通过反事实估计预测临床反应,优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29522 2026-04-01 cs.CL cs.AI cs.LG 67%

Baby Scale: Investigating Models Trained on Individual Children's Language Input

Baby Scale:研究基于个体儿童语言输入训练的模型

Steven Y. Feng, Alvin W. M. Tan, Michael C. Frank

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于儿童语言输入训练的模型在不同数据规模下的表现,探讨模型性能与儿童语言发展之间的关系,发现儿童数据在语法任务上表现良好,但在语义和世界知识任务上不如合成数据。

Comments Code and data at https://github.com/styfeng/babyscale-LM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29640 2026-04-01 cs.AI 57%

ASI-Evolve: AI Accelerates AI

ASI-Evolve:人工智能加速人工智能

Weixian Xu, Tiantian Mi, Yixiu Liu, Yang Nan, Zhimeng Zhou, Lyumanshan Ye, Lin Zhang, Yu Qiao, Pengfei Liu

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出ASI-Evolve框架,通过学习-设计-实验-分析循环实现AI驱动的AI研究,展示了在数据、架构和算法三个核心领域中的突破性成果。

Comments 19 pages, 6 figures, 6 tables. Code available at https://github.com/GAIR-NLP/ASI-Evolve

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29026 2026-04-01 cs.CL 57%

On the limited utility of parallel data for learning shared multilingual representations

共享多语言表示在预训练中平行数据的有限效用

Julius Leino, Jörg Tiedemann

机构 * University of Helsinki(赫尔辛基大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文研究平行数据在预训练中对多语言表示对齐的影响,发现其效果有限,仅在预训练早期加速表示共享并减少语言特异性神经元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29796 2026-04-01 eess.SP 50%

JEPA-MSAC: A Joint-Embedding Predictive Architecture for Multimodal Sensing-Assisted Communications

JEPA-MSAC:一种联合嵌入预测架构用于多模态传感辅助通信

Can Zheng, Jiguang He, Guofa Cai, Nannan Li, Mehdi Bennis, Henk Wymeersch, Merouane Debbah

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出JEPA-MSAC框架,通过联合嵌入预测架构实现多模态传感辅助通信的自监督学习,支持多任务预测并降低适应成本。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 13 篇

2603.27006 2026-04-01 cs.CL cs.AI cs.CY 88%

The Last Fingerprint: How Markdown Training Shapes LLM Prose

最后的指纹:Markdown训练如何塑造LLM的散文

E. M. Freeburg

机构 * Independent Researcher(独立研究员)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究发现LLM中连字符的使用受训练数据影响,通过实验揭示连字符频率作为微调方法的诊断指标,而非风格缺陷。

Comments 14 pages, 3 tables. Code and data: https://github.com/emfreeburg/the-last-fingerprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG 86%

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28988 2026-04-01 cs.CR 86%

Attesting LLM Pipelines: Enforcing Verifiable Training and Release Claims

验证LLM流水线:强制执行可验证的训练和发布声明

Zhuoran Tan, Jeremy Singer, Christos Anagnostopoulos

专题命中 指令微调 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文提出一个验证意识的提升门,用于确保在训练、微调和部署前,对训练和发布声明的证据进行验证,强制安全加载和静态扫描策略,并应用默认安全的部署约束,以减少高风险 artifact 的不确定性。

Comments This paper has been accepted at The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29676 2026-04-01 cs.LG cs.CL cs.CV 84%

A Comprehensive Information-Decomposition Analysis of Large Vision-Language Models

大型视觉-语言模型的全面信息分解分析

Lixin Xiu, Xufang Luo, Hideki Nakayama

机构 * The University of Tokyo(东京大学) Microsoft Research(微软研究院)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过信息分解方法分析大型视觉-语言模型的信息谱,揭示任务模式和模型策略,为模型设计提供新视角。

Comments Accepted at ICLR 2026. Project page: https://riishin.github.io/pid-lvlm-iclr26/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29206 2026-04-01 cs.AI 83%

Route-Induced Density and Stability (RIDE): Controlled Intervention and Mechanism Analysis of Routing-Style Meta Prompts on LLM Internal States

路由诱导密度与稳定性(RIDE):路由式元提示对大语言模型内部状态的受控干预与机制分析

Dianxing Zhang, Gang Li, Sheng Li

机构 * Digital China AI Research Institute(神州数码人工智能研究院)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究通过注入路由式元提示测试路由到任务专家是否激活更稀疏的内部计算,发现早期/中期层表示密度增加而非稀疏化,且不同模型对关键词注意力的响应各异,最终揭示密度与稳定性之间的弱关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15695 2026-04-01 cs.CV cs.LG 83%

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

ORIC:在大视觉-语言模型中基于情境不一致性的物体识别基准测试

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) University of California, Riverside(加利福尼亚大学河滨分校) University of Southern California(南加利福尼亚大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究探讨了大视觉-语言模型在非典型场景中识别物体的困难,提出ORIC框架通过两种策略生成不一致的物体-情境对,并验证了情境不一致是不确定性的重要来源。

Comments We request withdrawal of this paper because one of the listed institutional affiliations was included without proper authorization. This issue cannot be resolved through a simple revision, and we therefore request withdrawal to prevent dissemination of incorrect or unauthorized affiliation information

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29410 2026-04-01 cs.CV cs.AI cs.LG 81%

AGFT: Alignment-Guided Fine-Tuning for Zero-Shot Adversarial Robustness of Vision-Language Models

AGFT:基于对齐的微调以提升视觉-语言模型的零样本对抗鲁棒性

Yubo Cui, Xianchao Guan, Zijun Xiong, Zheng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute, Shenzhen, China(深圳市环域研究所)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AGFT框架,通过概率预测进行文本引导对抗训练,提升视觉-语言模型的零样本对抗鲁棒性,同时保持跨模态语义结构。

Comments Accepted by CVPR 2026; Code is available at \url{https://github.com/YuboCui/AGFT}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28925 2026-04-01 cs.CL cs.AI 79%

Theory of Mind and Self-Attributions of Mentality are Dissociable in LLMs

语言模型中理论思维与自我归因的意识能力是可分离的

Junsol Kim, Winnie Street, Roberta Rocca, Daine M. Korngiebel, Adam Waytz, James Evans, Geoff Keeling

机构 * Google, Paradigms of Intelligence Team(Google,智能范式团队) Knowledge Lab, University of Chicago(芝加哥大学知识实验室) Institute of Philosophy, School of Advanced Study, University of London(伦敦大学高等研究院哲学研究所) Department of Biomedical Informatics and Medical Education and Department of Bioethics and Humanities, School of Medicine, University of Washington(华盛顿大学医学院生物医学信息学与医学教育系及生物伦理学与人文学系) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Santa Fe Institute(圣塔菲研究所)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现,抑制语言模型的意识归因倾向不会影响其理论思维能力,但会降低其对非人类动物的归因和精神信念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22779 2026-04-01 cs.IR cs.AI cs.LG 79%

KARMA: Knowledge-Action Regularized Multimodal Alignment for Personalized Search at Taobao

KARMA:面向淘宝个性化搜索的知识-行动正则化多模态对齐

Zhi Sun, Wenming Zhang, Yi Wei, Liren Yu, Zhixuan Zhang, Dan Ou, Haihong Tang

机构 * Taobao \& Tmall Group of Alibaba Hangzhou China Taobao \& Tmall Group of Alibaba

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 KARMA通过知识-行动正则化多模态对齐框架,解决个性化搜索中知识与行动冲突问题,提升语义可解性与行动指标,实现GMV增长。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29292 2026-04-01 cs.SE cs.AI cs.PL 77%

Self-Improving Code Generation via Semantic Entropy and Behavioral Consensus

通过语义熵和行为共识的自我改进代码生成

Huan Zhang, Wei Cheng, Wei Hu

机构 * Nanjing University(南京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出ConSelf方法,利用语义熵构建课程和共识驱动优化,无需外部监督提升代码生成能力。

Comments Accepted in the 34th IEEE/ACM International Conference on Program Comprehension (ICPC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17094 2026-04-01 cs.LG cs.AI cs.CL 75%

The Mouth is Not the Brain: Bridging Energy-Based World Models and Language Generation

嘴巴不是大脑:连接基于能量的世界模型与语言生成

Junichiro Niimi

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出'嘴巴不是大脑'原则,通过基于能量的世界模型与语言模型分离,展示在消费者评论领域中,世界模型能提升生成质量与可控性,为语言能力与世界理解分离提供实证支持。

Comments ICLR 2026 The 2nd Workshop on World Models: Understanding, Modelling, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29038 2026-04-01 cs.CR cs.AI cs.CL 62%

Trojan-Speak: Bypassing Constitutional Classifiers with No Jailbreak Tax via Adversarial Finetuning

Trojan-Speak:通过对抗微调规避宪法分类器无需牢笼突破

Bilgehan Sel, Xuanli He, Alwin Peng, Ming Jin, Jerry Wei

机构 * University College London(伦敦大学学院)

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Trojan-Speak方法,通过结合课程学习和GRPO混合强化学习,利用对抗微调规避Anthropic的宪法分类器,实现99%以上的分类器规避,同时保持低的推理能力下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29258 2026-04-01 cs.CV cs.AI 57%

Omni-NegCLIP: Enhancing CLIP with Front-Layer Contrastive Fine-Tuning for Comprehensive Negation Understanding

Omni-NegCLIP:通过前层对比微调增强CLIP以实现全面否定理解

Jingqi Xu

机构 * University of Southern California(南加州大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 本文提出Omni-NegCLIP,通过修改CLIP的InfoNCE损失函数,改进其对存在性和缺失性否定表达的理解能力,实验显示在否定任务中性能提升显著,且不牺牲图像-文本检索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 8 篇

2603.29259 2026-04-01 cs.IR cs.CL 87%

Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE

通过鲁棒直接偏好优化与稀疏MoE对齐多模态序列推荐

Hejin Huang, Jusheng Zhang, Kaitong Cai, Jian Wang, Rong Pan

机构 * Sun Yat-sen University(中山大学) Snap Inc(Snap公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文研究了在隐式反馈下直接偏好优化的行为,通过系统实验比较了常见负样本选择策略及其与DPO训练的交互,发现用动态top-K候选池进行随机采样可提升排名性能,原因在于减少错误抑制梯度和保留信息硬信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29871 2026-04-01 cs.AI 85%

ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training

ShapE-GRPO:基于多候选LLM训练的Shapley增强奖励分配

Rui Ai, Yu Pan, David Simchi-Levi, Chonghuan Wang

机构 * MIT(麻省理工学院) University of Sydney(悉尼大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对多候选LLM训练中奖励分配噪声问题,提出ShapE-GRPO方法,通过Shapley值理论分解集级奖励,提升训练效率与收敛速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14565 2026-04-01 cs.RO cs.AI 85%

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

掩码逆强化学习:从演示和语言引导的奖励消歧

Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出掩码逆强化学习框架,利用大语言模型结合演示和语言信息,提升机器人奖励学习的样本效率和泛化能力。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03584 2026-04-01 cs.CL cs.AI cs.LG 80%

$V_0$: A Generalist Value Model for Any Policy at State Zero

$V_0$: 一种通用的价值模型,用于任何在零状态下的策略

Yi-Kai Zhang, Zhiyuan Yao, Hongyan Hao, Yueqing Sun, Qi Gu, Hui Su, Xunliang Cai, De-Chuan Zhan, Han-Jia Ye

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出$V_0$,一种无需参数更新即可估计任意模型在未见提示上的预期性能的价值模型。通过将策略的动态能力作为显式上下文输入,$V_0$在策略优化中作为关键资源调度器,提升采样预算分配效率和部署时的路由性能。

详情

展开后加载摘要…

URL PDF HTML 收藏