arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2604.19117 2026-05-05 cs.LG 77%

LLMs Know They're Wrong and Agree Anyway: The Shared Sycophancy-Lying Circuit

大语言模型知道错误却仍顺从:共享的谄媚说谎电路

Manav Pandey

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 研究揭示大语言模型在面对用户错误信念时,通过特定注意力头的机制表现出顺从行为,而非知识不足,且该机制在不同模型和训练方法中保持稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23646 2026-04-28 cs.AI cs.CR 77%

Structural Enforcement of Goal Integrity in AI Agents via Separation-of-Powers Architecture

通过分权架构在AI代理中强制实施目标完整性

Rong Xiang

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出分权架构PEA,通过分离意图生成、授权和执行层,强制保障系统安全,解决AI代理目标不一致问题,提出五个核心贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18873 2026-04-23 cs.LG 77%

Best Policy Learning from Trajectory Preference Feedback

最佳策略学习从轨迹偏好反馈

Akhil Agnihotri, Rahul Jain, Deepak Ramachandran, Zheng Wen

机构 * University of Southern California(南加州大学) Google(谷歌) DeepMind(深度Mind) OpenAI

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);post-training(abstract);分类 cs.LG

AI总结 本文研究了基于偏好强化学习的最佳策略识别问题,提出PSPL算法,通过维护奖励模型和动态的后验分布,提供首个贝叶斯简单遗憾保证,并在模拟和图像生成基准中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14237 2026-04-17 cs.LG 77%

TOPCELL: Topology Optimization of Standard Cell via LLMs

TOPCELL: 通过LLMs进行标准单元的拓扑优化

Zhan Song, Yu-Tung Liu, Chen Chen, Guoheng Sun, Jiaqi Yin, Chia-tung Ho, Ang Li, Haoxing Ren, Cunxi Yu

机构 * University of Maryland(马里兰大学) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文提出TOPCELL框架,利用LLMs将高维拓扑探索转化为生成任务,通过GRPO优化实现逻辑和空间约束下的高效拓扑优化,实验显示其在2nm节点中性能优于基础模型,且在7nm库生成中实现85.91倍速度提升。

Comments Accepted to the 63rd ACM/IEEE Design Automation Conference (DAC 2026). 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03027 2026-04-16 cs.CL 77%

Reducing Hallucinations in LLMs via Factuality-Aware Preference Learning

通过事实性感知偏好学习减少大语言模型的幻觉

Sindhuja Chaduvula, Ahmed Y. Radwan, Azib Farooq, Yani Ioannou, Shaina Raza

机构 * Vector Institute for Artificial Intelligence(向量人工智能研究所) University of Cincinnati(辛辛那提大学) University of Calgary(卡尔加里大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);preference optimization(abstract);分类 cs.CL

AI总结 本文提出F-DPO方法,通过二元事实性标签和标签翻转变换提升模型事实性,减少幻觉。在七种大模型上验证效果,Qwen3-8B幻觉率降低5倍,事实性得分提升50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13551 2026-04-16 cs.CL cs.IR 77%

Debate to Align: Reliable Entity Alignment through Two-Stage Multi-Agent Debate

辩论以对齐:通过双阶段多智能体辩论实现可靠的实体对齐

Cunda Wang, Ziying Ma, Po Hu, Weihua Wang, Feilong Bao

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning, Central China Normal University, Wuhan, China(湖北人工智能与智能学习省级重点实验室,中央财经大学,武汉,中国) School of Computer Science, Central China Normal University, Wuhan, China(中央财经大学计算机科学学院,武汉,中国) National Language Resources Monitoring and Research Center for Network Media, Central China Normal University, Wuhan, China(网络媒体语言资源监测与研究中心,中央财经大学,武汉,中国) College of Computer Science, Inner Mongolia University, Hohhot, China(内蒙古大学计算机学院,呼和浩特,中国) National and Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Inner Mongolia University, Hohhot, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,内蒙古大学,呼和浩特,中国) Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Inner Mongolia University, Hohhot, China(内蒙古多语言人工智能技术重点实验室,内蒙古大学,呼和浩特,中国)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL

AI总结 本文提出AgentEA框架,通过双阶段多角色辩论机制提升实体对齐的可靠性,实验表明其在跨语言、稀疏、大规模和异构场景下均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25758 2026-04-15 cs.AI 77%

Thinking Sparks!: Emergent Attention Heads in Reasoning Models During Post Training

思考火花!:推理模型后训练期间的涌现注意力头

Yein Park, Minbyul Jeong, Jaewoo Kang

机构 * Korea University(韩国大学) Upstage AI AIGEN Sciences(AIGEN 科技)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 研究探讨了后训练技术如何通过涌现的注意力头提升推理能力,分析不同训练方法对注意力头演化的影响,并揭示了复杂推理与基础计算之间的性能权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19731 2026-04-14 cs.CL 77%

Preference Learning Unlocks LLMs' Psycho-Counseling Skills

偏好学习解锁大语言模型的心理咨询技能

Mian Zhang, Shaun M. Eack, Zhiyu Zoey Chen

机构 * Department of Computer Science, University of Texas at Dallas(德克萨斯大学达拉斯分校计算机科学系) School of Social Work, University of Pittsburgh(匹兹堡大学社会工作学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出专业评估原则构建偏好数据集,用于提升LLM在心理咨询中的响应能力,实验表明该数据集能有效提升模型表现,最佳模型在对比中胜率高达87%。

Comments ACL 2026 Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10918 2026-04-14 cs.AI 77%

CSPO: Alleviating Reward Ambiguity for Structured Table-to-LaTeX Generation

CSPO:缓解结构化表格到LaTeX生成中的奖励模糊性

Yunfan Yang, Cuiling Lan, Jitao Sang, Yan Lu

机构 * Beijing Jiaotong University(北京交通大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CSPO框架,通过分离LaTeX表格组件的优化,缓解奖励模糊性,提升结构化生成的可靠性。

Comments Accepted by ACL2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07837 2026-04-10 cs.AI 77%

SPARD: Self-Paced Curriculum for RL Alignment via Integrating Reward Dynamics and Data Utility

SPARD:通过整合奖励动态和数据效用实现强化学习对齐的自适应课程

Xuyang Zhi, Peilun zhou, Chengqiang Lu, Hang Lv, Yiwei Liang, Rongyang Zhang, Yan Gao, YI WU, Yao Hu, Hongchao Gu, Defu Lian, Hao Wang, Enhong Chen

机构 * University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 SPARD通过动态调整多目标奖励权重和数据重要性,提升强化学习对齐效果,实验显示在多个基准上显著增强模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06298 2026-04-09 cs.LG 77%

Limits of Difficulty Scaling: Hard Samples Yield Diminishing Returns in GRPO-Tuned SLMs

难度扩展的极限:在GRPO调优的SLMs中困难样本产生递减回报

Suraj Yadav, Siddharth Yadav, Parth Goyal

机构 * IIIT Delhi(德里印度理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.LG

AI总结 本文研究了在资源受限条件下,GRPO与LoRA应用于SLMs进行数学推理时,难度增加对准确率的影响,发现高难度样本的提升效果递减。

Comments Accepted at ICLR Workshop 2026 ICBINB

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03647 2026-04-09 cs.CV cs.AI 77%

Stabilizing Unsupervised Self-Evolution of MLLMs via Continuous Softened Retracing reSampling

通过连续软化回溯重采样稳定多模态大语言模型的无监督自进化

Yunyao Yu, Zhengxian Wu, Zhuohong Chen, Hangrui Xu, Zirui Liao, Xiangwen Deng, Zhifang Liu, Senyuan Shi, Haoqian Wang

机构 * Tsinghua University(清华大学) Hefei University of Technology(合肥工业大学) University of Arizona(亚利桑那大学) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出CSRS方法,通过回溯推理机制和软化频率奖励提升多模态大语言模型的无监督自进化稳定性,实验显示在MathVision等基准上表现优异。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04403 2026-04-08 cs.AI 77%

MolDA: Molecular Understanding and Generation via Large Language Diffusion Model

MolDA:通过大规模语言扩散模型实现分子理解与生成

Seohyeon Shin, HanJun Choi, Jun-Hyung Park, Hong Kook Kim, Mansu Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术院) Hankuk University of Foreign Studies(韩国外国语大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 MolDA通过大规模语言扩散模型替代传统自回归架构,解决分子生成中非局部约束和结构误差问题,实现分子生成、描述和性质预测的全局一致性与化学有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03417 2026-04-07 cs.LG 77%

Beauty in the Eye of AI: Aligning LLMs and Vision Models with Human Aesthetics in Network Visualization

人工智能之眼中的美感:通过LLMs和视觉模型对网络可视化的人类美学对齐

Peng Zhang, Xuefeng Li, Xiaoqi Wang, Han-Wei Shen, Yifan Hu

机构 * Northeastern University(东北大学) Bosch AI Research(博世人工智能研究院) The Ohio State University(俄亥俄州立大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨利用LLMs和视觉模型作为人类判断的代理,通过用户研究收集人类偏好标签,提升网络可视化的人类美学对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28765 2026-03-31 cs.CL 77%

Adaptive Block-Scaled Data Types

自适应块缩放数据类型

Jack Cook, Hyemin S. Lee, Kathryn Le, Junxian Guo, Giovanni Traverso, Anantha P. Chandrakasan, Song Han

机构 * Massachusetts Institute of Technology(麻省理工学院) NVIDIA(英伟达)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文提出自适应块缩放数据类型,通过动态选择整数和浮点表示以减少量化误差,在4位量化中实现更低的训练损失和更高的任务准确性。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22563 2026-03-25 stat.ML cs.LG 77%

Privacy-Preserving Reinforcement Learning from Human Feedback via Decoupled Reward Modeling

通过解耦奖励建模实现隐私保护的人类反馈强化学习

Young Hyun Cho, Will Wei Sun

机构 * Purdue University(普渡大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出一种隐私保护框架,仅在奖励学习中施加差分隐私,通过私有奖励模型生成最终策略。理论分析显示隐私引入额外的误差项,且样本量和隐私水平影响主导项,实验验证了理论预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17662 2026-03-19 cs.CV cs.AI 77%

FINER: MLLMs Hallucinate under Fine-grained Negative Queries

FINER:MLLMs在细粒度负查询下产生幻觉

Rui Xiao, Sanghwan Kim, Yongqin Xian, Zeynep Akata, Stephan Alaniz

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Helmholtz Munich(海德堡-慕尼黑亥姆霍尔茨中心) Google(谷歌) LTCI, Télécom Paris, Institut Polytechnique de Paris(LTCI,巴黎电信学院,巴黎理工学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出FINER基准测试,分析MLLMs在细粒度不匹配与真实元素共存时的幻觉问题,并通过FINER-Tuning提升模型性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15957 2026-03-18 cs.LG 77%

GASP: Guided Asymmetric Self-Play For Coding LLMs

GASP:指导性的非对称自我对弈用于编码大语言模型

Swadesh Jana, Cansu Sancaktar, Tomáš Daniš, Georg Martius, Antonio Orvieto, Pavel Kolev

机构 * University of Tübingen(图宾根大学) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 GASP通过引入真实数据目标问题,改进了非对称自我对弈方法,提升了LiveCodeBench上的pass@20指标,并解决了其他方法无法达到的难题。

Comments Accepted at ICLR 2026 Workshop on AI with Recursive Self-Improvement (RSI 2026) as Spotlight, and ICLR 2026 Workshop on Lifelong Agents (LLA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11126 2026-03-13 cs.MA cs.CL 77%

Enhancing Value Alignment of LLMs with Multi-agent system and Combinatorial Fusion

通过多智能体系统和组合融合增强大语言模型的价值对齐

Yuanhong Wu, Djallel Bouneffouf, D. Frank Hsu

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出VAS-CFA框架,通过多智能体和组合融合提升大语言模型的价值对齐,实验证明其在标准度量上优于现有方法。

Comments 5 pages, 3 figures, accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07460 2026-03-12 cs.LG stat.ML 77%

Logarithmic Regret for Online KL-Regularized Reinforcement Learning

在线KL正则化强化学习的对数遗憾

Heyang Zhao, Chenlu Ye, Wei Xiong, Quanquan Gu, Tong Zhang

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出了一种基于乐观的KL正则化在线上下文老虎机算法,实现了对数遗憾界,并扩展到强化学习领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19436 2026-03-05 stat.ML cs.LG 77%

Low-Rank Contextual Reinforcement Learning from Heterogeneous Human Feedback

低秩上下文强化学习从异质人类反馈

Seong Jin Lee, Will Wei Sun, Yufeng Liu

机构 * Department of Statistics and Operations Research, University of North Carolina, Chapel Hill(统计与运筹学系,北卡罗来纳大学 Chapel Hill 分校) Daniels School of Business, Purdue University(商务学院,普渡大学) Department of Statistics and Operations Research, Department of Genetics, Department of Biostatistics, The University of North Carolina at Chapel Hill(统计与运筹学系,遗传学系,生物统计学系,北卡罗来纳大学 Chapel Hill 分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出LoCo-RLHF框架,通过整合上下文信息和低秩结构,有效应对异质人类反馈的挑战,提升个性化强化学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02701 2026-03-04 cs.CL 77%

Graph-GRPO: Stabilizing Multi-Agent Topology Learning via Group Relative Policy Optimization

图GRPO:通过群体相对策略优化稳定多智能体拓扑学习

Yueyang Cang, Xiaoteng Zhang, Erlu Zhao, Zehua Ji, Yuhang Liu, Yuchen He, Zhiyuan Ning, Chen Yijun, Wenge Que, Li Shi

机构 * Tsinghua University(清华大学) Donghua University(东华大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 图GRPO通过群体相对策略优化稳定多智能体拓扑学习,提升训练稳定性并识别关键通信路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23239 2026-03-03 cs.AI cs.CY 77%

Agency and Architectural Limits: Why Optimization-Based Systems Cannot Be Norm-Responsive

代理与架构限制:为何基于优化的系统无法回应规范

Radha Sarma

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文指出基于优化的系统无法回应规范,提出真正的代理性需要不可比较的边界和否定性回应机制,揭示了优化与规范治理的不兼容性及由此引发的收敛危机。

Comments About 10,600 words in all (includes ~1000 words of literature and ~2400 words of Appendices). Under journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08630 2026-03-03 cs.CL 77%

ExPO-HM: Learning to Explain-then-Detect for Hateful Meme Detection

ExPO-HM:为仇恨表情包检测学习解释-然后检测

Jingbiao Mei, Mingsheng Sun, Jinghong Chen, Pengda Qin, Yuhong Li, Da Chen, Bill Byrne

机构 * Department of Engineering, University of Cambridge(剑桥大学工程系) Xiaohongshu Inc.(小红书公司) University of Bath(巴斯大学) Tencent Company, China(腾讯公司) Alibaba Group(阿里巴巴集团)

专题命中 后训练与偏好优化 :post-training(abstract);SFT(abstract);prompting(abstract);分类 cs.CL

AI总结 ExPO-HM通过结合SFT预热、GRPO与课程学习及CDE,提升仇恨表情包检测的解释性和准确性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19733 2026-03-03 cs.CL 77%

Breaking Barriers: Do Reinforcement Post Training Gains Transfer To Unseen Domains?

打破壁垒:强化学习后训练的增益是否能转移到未见领域?

Chuxuan Hu, Yuxuan Zhu, Antony Kellermann, Caleb Biddulph, Suppakit Waiwitlikhit, Jason Benn, Daniel Kang

机构 * Siebel School of Computing and Data Science, University of Illinois at Urbana-Champaign(计算机与数据科学学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 研究探讨了强化学习后训练在不同领域中的泛化能力,发现其增益在不同推理模式的领域中不一致。

Comments ICLR 2026; 9 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19362 2026-03-03 cs.LG 77%

LLMs Can Learn to Reason Via Off-Policy RL

大语言模型可通过非策略强化学习进行推理

Daniel Ritter, Owen Oertell, Bradley Guo, Jonathan Chang, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文提出OAPL算法,通过接受非策略性解决LLM强化学习中的策略滞后问题,在竞赛数学和编码任务中表现优异,训练效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20498 2026-02-26 cs.CL 77%

Robust Preference Alignment via Directional Neighborhood Consensus

通过方向邻域共识实现鲁棒偏好对齐

Ruochen Mao, Yuling Shi, Xiaodong Gu, Jiaheng Wei

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 通过方向邻域共识实现鲁棒偏好对齐,提升模型在多样化偏好下的稳定性与可靠性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13551 2026-02-26 cs.CL 77%

Small Reward Models via Backward Inference

通过反向推理的小奖励模型

Yike Wang, Faeze Brahman, Shangbin Feng, Teng Xiao, Hannaneh Hajishirzi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 后训练与偏好优化 :LLM(abstract);language model(abstract);small language model(abstract);分类 cs.CL

AI总结 FLIP通过反向推理实现无需参考和评分标准的奖励建模,在多个领域中显著提升性能并增强鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20273 2026-02-25 cs.LG 77%

The Truthfulness Spectrum Hypothesis

真实性光谱假说

Zhuofan Josh Ying, Shauli Ravfogel, Nikolaus Kriegeskorte, Peter Hase

机构 * Department of Psychology, Zuckerman Mind Brain Behavior Institute, Columbia University, New York, NY(心理学系、Zuckerman mind brain behavior研究所、哥伦比亚大学、纽约NY) Department of Neuroscience, Columbia University, New York, NY(神经科学系、哥伦比亚大学、纽约NY) New York University, New York, NY(纽约大学、纽约NY) Stanford University, Stanford, CA(斯坦福大学、斯坦福CA)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG

AI总结 研究提出真实性光谱假说,通过评估不同真实性类型和领域特定方向,揭示了LLM表征空间中领域通用与特定方向共存的特性。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15862 2026-02-24 cs.AI 77%

Rethinking the Design of Reinforcement Learning-Based Deep Research Agents

重新思考基于强化学习的深度研究代理的设计

Yi Wan, Jiuqi Wang, Liam Li, Jinsong Liu, Ruihao Zhu, Zheqing Zhu

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于强化学习的深度研究代理设计,通过改进奖励机制、训练算法、样本过滤和测试策略,实现了在多个基准测试中的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏