arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 190 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.21218 2026-06-23 cs.CL cs.AI cs.CR cs.LG 版本更新 89%

EPSVec: Efficient and Private Synthetic Data Generation via Dataset Vectors

EPSVec: 通过数据集向量实现高效且私密的合成数据生成

Amin Banayeeanzade, Qingchuan Yang, Deqing Fu, Spencer Hong, Erin Babinsky, Alfy Samuel, Anoop Kumar, Robin Jia, Sai Praneeth Karimireddy

机构 * Capital One

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出EPSVec,一种轻量级差分隐私方法,通过提取并净化数据集向量来引导LLM生成合成文本,在低数据场景下实现高保真度,且计算开销低。

Comments Accepted at ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12683 2026-06-23 cs.CV q-bio.NC 版本更新 88%

Brain-DiT: A Universal Multi-state fMRI Foundation Model with Metadata-Conditioned Pretraining

Brain-DiT:一种基于元数据条件预训练的通用多状态fMRI基础模型

Junfeng Xia, Wenhao Ye, Xuanye Pan, Xinke Shen, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, China(南方科技大学生物医学工程系,中国) School of Biomedical Engineering, Shenzhen University, China(深圳大学生物医学工程学院,中国)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract)

AI总结 提出Brain-DiT,一种基于扩散Transformer和元数据条件预训练的通用多状态fMRI基础模型,在24个数据集上预训练,通过生成式预训练学习多尺度表示,在7个下游任务中优于重建和对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22503 2026-06-23 cs.CL cs.SD eess.AS 版本更新 87%

Joint Speech and Text Training for LLM-Based End-to-End Spoken Dialogue State Tracking

基于LLM的端到端口语对话状态跟踪的联合语音与文本训练

Katia Vendrame, Bolaji Yusuf, Santosh Kesiraju, Šimon Sedláček, Oldřich Plchot, Jan Černocký

机构 * Brno University of Technology(布拉格技术大学)

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出联合训练口语DST数据和跨域文本DST数据的方法,解决口语数据稀缺和跨域泛化问题,无需目标域口语训练数据即可获得良好性能。

Comments accepted for Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24037 2026-06-23 cs.LG math.ST stat.TH 版本更新 79%

A Limit Theory of Foundation Models: A Mathematical Approach to Understanding Emergent Intelligence and Scaling Laws

基础模型的极限理论:从极限理论角度理解涌现智能与扩展定律的数学方法

Jun Shu, Junxiong Jia, Deyu Meng, Zongben Xu

机构 * School of Mathematics and Statistics(数学与统计学学院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过极限理论构建数学框架,量化智能行为,揭示涌现智能源于参数极限架构,并推导基础模型的扩展定律。

Comments There exist some typos and inaccurate expression in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21489 2026-06-23 cs.LG 版本更新 79%

GraphPFN: A Prior-Data Fitted Graph Foundation Model

GraphPFN:一种先验数据拟合的图基础模型

Dmitry Eremeev, Oleg Platonov, Gleb Bazhenov, Artem Babenko, Liudmila Prokhorenkova

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对图基础模型的可迁移性和数据稀缺问题,提出GraphPFN,基于先验数据拟合网络框架,设计多级随机块模型和优先连接过程生成合成图,结合图感知结构化因果模型生成属性,并扩展LimiX模型以融合图邻域聚合层,在节点级任务上实现上下文学习和微调的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20904 2026-06-23 eess.IV cs.LG 版本更新 79%

ECGFlowCMR: Pretraining with ECG-Generated Cine CMR Helps Cardiac Disease Classification and Phenotype Prediction

ECGFlowCMR: 利用心电图生成电影心脏磁共振的预训练助力心脏病分类和表型预测

Xiaocheng Fang, Zhengyao Ding, Guangkun Nie, Jieyi Cai, Yujie Xiao, Bo Liu, Jiarui Jin, Haoyu Wang, Shun Huang, Ting Chen, Hongyan Li, Shenda Hong

机构 * School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Polytechnic Institute of Zhejiang University, Zhejiang University(浙江大学 polytechnic 院) Institute of Computing Technology, University of the Chinese Academy of Sciences(中国科学院计算技术研究所) National Institute of Health Data Science, Peking University(北京大学健康数据科学国家研究院) Institute of Microelectronics, University of the Chinese Academy of Sciences(中国科学院微电子研究所) Department of Cardiology, Zhejiang University(浙江大学心内科部)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 提出ECGFlowCMR框架,通过相位感知掩码自编码器和解剖运动解耦流解决ECG与CMR的跨模态时序错配和解剖可观测性差距,生成逼真电影CMR序列,提升下游心脏病分类和表型预测性能。

Comments Accepted to KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21456 2026-06-23 cs.IR cs.AI cs.CL 版本更新 79%

Revisiting Text Ranking in Deep Research

重新审视深度研究中的文本排序

Chuan Meng, Litu Ou, Sean MacAvaney, Jeff Dalton

机构 * The University of Edinburgh(爱丁堡大学) University of Glasgow(格拉斯哥大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过复现实验,从检索单元、流水线配置和查询特性三个角度评估文本排序方法在深度研究中的有效性,并提出Q2Q方法缓解查询不匹配问题。

Comments Accepted at the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02370 2026-06-23 cs.CV 版本更新 78%

Cultural Counterfactuals: Evaluating Cultural Biases in Large Vision-Language Models with Counterfactual Examples

文化反事实:用反事实示例评估大型视觉语言模型中的文化偏见

Phillip Howard, Xin Su, Kathleen C. Fraser

机构 * Thoughtworks University of Ottawa(Ottawa大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 提出文化反事实数据集(近6万张反事实图像),通过图像编辑模型将不同人口特征的人置于真实文化背景中,量化大型视觉语言模型在宗教、国籍和社会经济地位方面的文化偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12879 2026-06-23 cs.LG cs.AI cs.CL 版本更新 78%

Hierarchical Sparse Circuit Extraction from Billion-Parameter Language Models through Scalable Attribution Graph Decomposition

通过可扩展归因图分解从十亿参数语言模型中提取分层稀疏电路

Mohammed Mudassir Uddin, Shahnawaz Alam, Mohammed Kaif Pasha

机构 * Department of CSE, Muffakham Jah College of Engineering and Technology (MJCET)(计算机科学与工程系,穆法卡姆·贾赫工程与技术学院(MJCET))

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出分层归因图分解(HAGD)方法,通过跨层编码器训练、谱粗化、GNN引导分层遍历和因果干预验证,将电路提取复杂度降至O(n² log n),在多个大模型上实现高行为保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13491 2026-06-23 cs.IT cs.LG math.IT math.ST stat.TH 版本更新 77%

From Zipf's Law to Neural Scaling through Heaps' Law and Hilberg's Hypothesis

从齐普夫定律到神经缩放:通过希普斯定律和希尔伯格假设

Łukasz Dębowski

机构 * Institute of Computer Science, Polish Academy of Sciences(波兰科学院计算机科学研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文系统揭示了神经缩放定律与齐普夫定律之间的演绎关系,通过推导词汇增长的希普斯定律和熵缩放的希尔伯格假设,证明神经缩放定律是齐普夫定律在广泛假设下的推论。

Comments 32 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28737 2026-06-23 eess.AS cs.AI cs.CL cs.SD 版本更新 76%

ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining

ParaSpeechCLAP:面向丰富风格语言-音频预训练的双编码器语音-文本模型

Anuj Diwan, Eunsol Choi, David Harwath

机构 * Department of Computer Science, The University of Texas at Austin, USA(德克萨斯大学奥斯汀分校计算机科学系) Computer Science and Data Science, New York University, USA(纽约大学计算机科学与数据科学系)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

AI总结 提出ParaSpeechCLAP双编码器模型,将语音与文本风格描述映射到共享嵌入空间,支持丰富内在和情境风格描述,在风格描述检索、属性分类及TTS奖励模型中优于基线。

Comments Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07822 2026-06-23 eess.SP cs.AI cs.HC cs.LG 版本更新 73%

Exploration of LLMs, EEG, and behavioral data to measure and support attention and sleep

探索LLMs、EEG和行为数据以测量和支持注意力与睡眠

Akane Sano, Judith Amores, Mary Czerwinski

机构 * Rice University(里士大学) Microsoft Research(微软研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探索利用大语言模型(LLMs)结合脑电图(EEG)和活动数据估计注意力状态、睡眠阶段和质量,并生成改善建议和引导想象脚本,发现LLMs能基于行为特征评估睡眠质量,但基于EEG和活动数据的检测需更多训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17655 2026-06-23 cs.CL 版本更新 70%

What Language is This? Ask Your Tokenizer

这是什么语言?问你的分词器

Clara Meister, Ahmetcan Yavuz, Pietro Lesci, Tiago Pimentel

机构 * EPFL(苏黎世联邦理工学院) University of Cambridge(剑桥大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出基于UnigramLM分词算法的UniLID方法,通过比较字符串在各语言单字分布下的似然进行语言识别,在低资源和细粒度方言场景下显著提升样本效率。

Comments In Proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17377 2026-06-23 cs.CL 版本更新 70%

Corpus Prevalence of Multiple-Choice Question Options

多项选择题选项的语料普遍性

Leonidas Zotos, Hedderik van Rijn, Malvina Nissim

机构 * Center for Language and Cognition, University of Groningen(语言与认知中心,格罗宁根大学) Department of Experimental Psychology, University of Groningen(实验心理学系,格罗宁根大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多项选择题中正确选项在语料库中更常见的问题,提出基于文本嵌入的计算方法,发现正确选项普遍性显著高于错误选项,最高比随机基线高9.0%。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25665 2026-06-23 cs.LG 版本更新 57%

Gradual Capacity Growth for Sparse Network Discovery

稀疏网络发现的渐进容量增长

Qihang Yao, Constantine Dovrolis

机构 * Georgia Institute of Technology(佐治亚理工学院) The Cyprus Institute(塞浦路斯研究所)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 提出渐进容量增长(GCG)框架,通过路径增长规则在训练中逐步分配网络容量,无需预训练或预设稀疏度,以较低成本发现接近稠密性能的稀疏网络。

Comments Accepted at ICANN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 10 篇

2602.07930 2026-06-23 cs.CL 版本更新 91%

Patches of Nonlinearity: Instruction Vectors in Large Language Models

非线性补丁:大型语言模型中的指令向量

Irina Bigoulaeva, Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(计算机科学系,达姆施塔特技术大学和应用网络安全国家研究中心ATHENE,德国)

专题命中 指令微调 :language model(title,abstract);large language model(title);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 通过因果中介分析发现指令表示在模型中高度局部化,称为指令向量(IVs),并揭示其线性可分性与非线性因果交互并存,提出一种免于线性假设的新方法定位信息处理,发现IVs作为电路选择器。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29473 2026-06-23 cs.HC cs.AI cs.CL cs.CY cs.SI 版本更新 90%

Inform, Coach, Relate, Listen: Auditing LLM Caregiving Support Roles

告知、指导、共情、倾听:审计LLM护理支持角色

Drishti Goel, Agam Goyal, Veda Duddu, Olivia Pal, Jeongah Lee, Qiuyue Joy Zhong, Violeta J. Rodriguez, Daniel S. Brown, Dong Whi Yoo, Ravi Karkar, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) OSF HealthCare(OSF医疗集团) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 指令微调 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09777 2026-06-23 cs.NE cs.AI cs.CL cs.LG 版本更新 89%

EvoPref: Multi-Objective Evolutionary Optimization Discovers Diverse LLM Alignments Beyond Gradient Descent

EvoPref:多目标进化优化发现超越梯度下降的多样化大语言模型对齐

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 EvoPref通过多目标进化算法在帮助性、无害性和诚实性目标上优化LoRA适配器,发现比梯度下降更丰富的对齐方式,实验显示其在偏好覆盖和崩溃率上均有显著提升。

Comments 10 pages, 2 figures, 6 tables, 1 algorithm. Accepted to GECCO 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07528 2026-06-23 cs.CL cs.AI 版本更新 89%

From RAG to Agentic RAG for Faithful Islamic Question Answering

从RAG到智能体RAG:面向可靠的伊斯兰问答

Gagan Bhatia, Hamdy Mubarak, Mustafa Jarrar, George Mikros, Fadi Zaraket, Mahmoud Alhirthani, Mutaz Al-Khatib, Logan Cochrane, Kareem Darwish, Rashid Yahiaoui, Firoj Alam

机构 * Qatar Computing Research Institute, HBKU, Qatar(卡塔尔计算研究中心,HBKU,卡塔尔) College of Humanities and Social Sciences, HBKU, Qatar(人文与社会科学学院,HBKU,卡塔尔) Arab Center for Research and Policy Studies, Qatar(阿拉伯研究中心与政策研究所,卡塔尔) College of Islamic Studies, HBKU, Qatar(伊斯兰研究学院,HBKU,卡塔尔) College of Public Policy, HBKU, Qatar(公共政策学院,HBKU,卡塔尔)

专题命中 指令微调 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments)

AI总结 针对LLM在伊斯兰问答中的幻觉与弃权问题,构建双语基准IslamicFaithQA,并提出基于结构化工具调用的智能体RAG框架,显著提升正确性与鲁棒性。

Comments Islamic Question Answering; Faithful Question Answering; Retrieval-Augmented Generation; Agentic RAG; Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23946 2026-06-23 cs.LG cs.AI cs.CL stat.ML 版本更新 86%

Explore-Execute Chain: Towards an Efficient Structured Reasoning Paradigm

探索-执行链:迈向高效的结构化推理范式

Kaisen Yang, Tinghe Zhang, Rushi Shah, Kaicheng Yang, Qinwei Ma, Dianbo Liu, Alex Lamb

机构 * Qizhi Institute(启智研究院) Dept. of Computer Science, Tsinghua University(清华大学计算机科学系) College of AI, Tsinghua University(清华大学人工智能学院) Engineering Department, National University of Singapore(新加坡国立大学工程系) Dept. of Automation, Shanghai Jiao Tong University(上海交通大学自动化系) IIIS, Tsinghua University(清华大学人工智能研究院) College of Software, Northeastern University(东北大学软件学院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出探索-执行链(E²C),将推理分为随机探索阶段(生成简洁高层计划)和确定性执行阶段(忠实执行计划),通过因果SFT和RL训练分离,在AIME'2024上以更少token超越思维树,并支持轻量领域适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14343 2026-06-23 cs.LG 版本更新 83%

Localizing and Editing Knowledge in Large Audio-Language Models

定位与编辑大型音频-语言模型中的知识

Sung Kyun Chung, Jiaheng Dong, Qiuchi Hu, Gongping Huang, Hong Jia, Ting Dang

机构 * The University of Melbourne, Australia(墨尔本大学) University of Auckland, New Zealand(奥克兰大学) Wuhan University, China(武汉大学)

专题命中 指令微调 :language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出首个音频知识定位与编辑基准,通过语音感知因果追踪定位事实知识存储的层和模块,并应用编辑实现细粒度知识控制。

Comments Paper was accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31201 2026-06-23 cs.CL 版本更新 81%

Point-in-Time Financial RAG with Frozen LLMs and Market-Feedback Adaptive Retrieval

学习信任谁:事件驱动金融RAG中冻结大语言模型的市场反馈自适应检索

Zijie Zhao, Roy E. Welsch

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对事件驱动金融RAG,提出通过外部贝叶斯源记忆更新检索层,利用市场反馈自适应选择证据源,在冻结LLM情况下提升预测和投资组合表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08206 2026-06-23 cs.LG cs.AI 版本更新 81%

Distributional Regression with Tabular Foundation Models: Evaluating Probabilistic Predictions via Proper Scoring Rules

基于表格基础模型的分布回归:通过适当评分规则评估概率预测

Jonas Landsgesell, Pascal Knoll, Tizian Wenzel

机构 * University of Stuttgart(斯图加特大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对表格基础模型(如TabPFN、TabICL)生成完整预测分布但基准仅用点估计指标的问题,提出使用适当评分规则进行训练、微调和排名,证明不同评分规则在有限数据上导致不同归纳偏差和模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01949 2026-06-23 cs.LG cs.AI cs.CE 版本更新 62%

Probabilistic Retrofitting of Learned Simulators

学习模拟器的概率性改造

Cristiana Diaconu, Miles Cranmer, Richard E. Turner, Tanya Marwah, Payel Mukhopadhyay

机构 * The Polymathic AI Collaboration(多智AI协作体) University of Cambridge(剑桥大学) Alan Turing Institute(艾伦·图灵研究所)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种训练高效的策略,通过连续排序概率得分(CRPS)将预训练的确定性模型改造为概率模型,无需从头训练,适用于多种架构,在多个动力系统上显著提升预测性能。

Comments Code provided at https://github.com/cddcam/lola_crps

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20237 2026-06-23 cs.CV 版本更新 50%

AnimeAdapter: A Modular Adapter for Appearance-Consistent Anime Character Generation

AnimeAdapter: 细粒度且一致的零样本动漫人物生成

Yixuan Han

机构 * National University of Singapore, Singapore(新加坡国立大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出了一种轻量级的外观适配器,用于在多样编辑条件下实现可控且一致的动漫人物生成,通过注入单张参考图像的细粒度视觉特征到扩散过程中,并结合CLIP的局部空间化特性,开发出语义选择性局部注意力机制,进一步解耦人物外观与空间布局,从而实现高效的动漫人物生成。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 17 篇

2510.17385 2026-06-23 cs.LG cs.AI 版本更新 91%

Strengthening LLMs for Tabular Prediction with Structural Priors

利用结构先验增强LLM在表格预测中的能力

Pengxiang Cai, Zihao Gao, Wanchen Lian, Guocong Li, Jintai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出PRPO方法,通过列排列不变性和两级优势估计将表格结构先验融入LLM后训练,使8B模型在139个OpenML数据集上达到与强监督基线竞争的性能,零样本设置下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10999 2026-06-23 cs.CL 版本更新 90%

KBQA-R1: Reinforcing Large Language Models for Knowledge Base Question Answering

KBQA-R1:强化大语言模型用于知识库问答

Xin Sun, Zhongqi Chen, Xing Zheng, Qiang Liu, Shu Wu, Bowen Song, Zilei Wang, Weiqiang Wang, Liang Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出KBQA-R1框架,通过强化学习(GRPO)将知识库问答建模为多轮决策过程,并引入参考拒绝采样(RRS)解决冷启动问题,在多个基准上取得最优性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新 90%

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04477 2026-06-23 cs.LG 版本更新 86%

Data-dependent Exploration for Online Reinforcement Learning from Human Feedback

基于数据的探索:面向人类反馈的在线强化学习

Zhen-Yu Zhang, Yuting Tang, Jiandong Zhang, Lanjihong Ma, Masashi Sugiyama

机构 * Center for Advanced Intelligence Project, RIKEN(日本理化学研究所先进智能研究中心) Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究生院) Northeastern University(东北大学) Zhejiang Gongshang University(浙江工商大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出数据依赖探索的偏好优化方法(DEPO),利用历史数据构建不确定性奖励,鼓励探索高价值区域,理论证明其数据依赖的遗憾界更紧,实验表明样本效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04389 2026-06-23 cs.CL cs.AI 版本更新 86%

Safety Is Not Universal: The Selective Safety Trap in LLM Alignment

安全并非普遍:大语言模型对齐中的选择性安全陷阱

Iago Alves Brito, Walcy Santos Rezende Rios, Julia Soares Dollis, Diogo Fernandes Costa Silva, Arlindo Rodrigues Galvão Filho

机构 * Advanced Knowledge Center for Immersive Technologies(沉浸式技术先进知识中心) Federal University of Goiás(戈亚斯联邦大学)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究揭示大语言模型在安全对齐中的选择性安全陷阱,通过MiJaBench基准测试发现安全防御存在人口统计学层级差异,通过DPO优化实现跨群体的安全泛化。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏