arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 14 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 14 篇

2607.26515 2026-07-30 cs.LG cs.AI 新提交 91%

HiFloat4 Format for End-To-End Reinforcement Learning Post-Training of Large Language Models

用于大语言模型端到端强化学习后训练的HiFloat4格式

Hei Yi Mak, Shadan Golestan, Hoang Le, Mehran Taghian Jazi, Yunke Peng, Yaoyuan Wang, Yao Wang, Junsong Wang, Tianchi Hu, Fengchen He, Guipeng Hu, Tanzila Rahman, Anandharaju Durai Raju

机构 * Huawei(华为)

专题命中 后训练与偏好优化 :post-training(title,abstract);large language model(title);language model(title);pretraining(abstract)

AI总结 本文提出首个端到端FP4 RL后训练方案,通过HiFloat4格式与Rollout-ResQ技术,将FP4 RL与BF16的准确率差距大幅缩小,使全量化FP4 RL接近全精度水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26981 2026-07-30 cs.CL 新提交 91%

OptimismBench: Forecasting Bias and the Alignment Effect in Language Model Judgment

OptimismBench:语言模型判断中的偏差预测与对齐效应

Seonglae Cho, Adriano Koshiyama

机构 * Holistic AI(整体人工智能公司) University College London(伦敦大学学院)

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)

AI总结 本研究推出OptimismBench基准,检测到多数LLM存在乐观方向偏差,且对齐会使模型概率产生偏差,下游流程会默认继承该偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26094 2026-07-30 cs.LG cs.CL 新提交 87%

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback

用于人类反馈强化学习的元学习奖励塑形

Yunpeng Chu

专题命中 后训练与偏好优化 :RLHF(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MeRLa是元学习的任务感知奖励塑形框架,在RLHF训练前通过辅助任务元学习塑形函数,可提升LLaMA-3-8B在多基准上的对齐性能,降低训练不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26115 2026-07-30 cs.CR cs.AI cs.CL cs.LG 新提交 86%

GPT-Red: Automated Red Teaming via Self-Play at Scale

GPT-Red:基于大规模自博弈的自动化红队测试

Eric Wallace, Christopher A. Choquette-Choo, Nikhil Kandpal, Sam Toyer, Dylan Hunn, Stephanie Lin, Yuxin Wen, Xiangyu Qi, Christopher Wolff, Zizhao Wang, Milad Nasr, Sicheng Zhu, Chuan Guo, Juan Felipe Cerón Uribe, Kaiwen Wang, Aiden Low, Kai Xiao, Kai Chen

专题命中 后训练与偏好优化 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出GPT-Red,一种基于大规模自博弈的自动化红队测试智能体,可发现新型提示注入攻击、攻破过往模型且泛化能力强,用于提升LLM鲁棒性并形成自我改进飞轮。

Comments 28 pages.13 main pages and 13 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27182 2026-07-30 cs.HC 新提交 83%

GraphQAG: A Knowledge-Graph-Guided Visual Analytics Framework for Question-Answer Pairs Generation

GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架

Yize Li, Ruiqi Yu, Tianya Pan, Ningxin Li, Songyue Li, Xiangyang Wu, Jinchang Li, Zhiguang Zhou

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05174 2026-07-30 cs.CL cs.AI 79%

Improving Heart-Focused Medical Question Answering in LLMs via Variance-Aware Rubric Rewards with GRPO

通过基于方差感知的评分规则奖励与GRPO改进LLMs中心脏医学问答

Arash Ahmadi, Parisa Masnadi Khiabani, Sarah Sharif, Charles Nicholson, David Ebert, Mike Banad

机构 * School of Electrical and Computer Engineering, University of Oklahoma, Norman, OK, USA(电气与计算机工程学院,俄克拉荷马大学,诺曼,OK,USA) Intelligent Neuromorphic and Quantum Understanding for Innovative Research and Engineering (INQUIRE) Laboratory, University of Oklahoma, Norman, OK, USA(创新研究与工程智能神经形态与量子理解实验室,俄克拉荷马大学,诺曼,OK,USA) Khiabani Data Science and Analytics Institute, University of Oklahoma, Norman, OK, USA(Khiabani数据科学与分析研究所,俄克拉荷马大学,诺曼,OK,USA) Data Institute for Societal Challenges (DISC), University of Oklahoma, Norman, OK, USA(社会挑战数据研究所(DISC),俄克拉荷马大学,诺曼,OK,USA) School of Industrial and Systems Engineering, University of Oklahoma, Norman, OK, USA(工业与系统工程学院,俄克拉荷马大学,诺曼,OK,USA) Office of Responsible Artificial Intelligence (ORAI), University of Arizona, Tucson, AZ, USA(负责任人工智能办公室(ORAI),亚利桑那大学,图森,AZ,USA)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 提出一种方差感知奖励框架,结合GRPO和RaR-Medicine的评分规则,通过连续分析奖励函数替代离散聚合,提升LLMs在心脏医学问答上的准确率和F1分数。

Comments 27 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08027 2026-07-30 cs.CL cs.CY 77%

"Amazing, They All Lean Left" -- Analyzing the Political Temperaments of Current LLMs

W. Russell Neuman, Chad Coleman, Ali Dasdan, Safinah Ali, Manan Shah, Kund Meghani

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26862 2026-07-30 cs.LG cs.AI 新提交 73%

ReCo: Reweighting GRPO Against Distributional Concentration

ReCo:针对分布集中问题的GRPO重加权方法

Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院)

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对GRPO过度关注高概率响应导致推理覆盖度下降的问题,提出ReCo重加权方法,在多个数学推理基准上提升了大k值下的Pass@k表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06194 2026-07-30 cs.CL cs.AI 版本更新 73%

MICA: Multi-granularity Intertemporal Credit Assignment for Long-Horizon Emotional Support Dialogue

MAPO:混合优势策略优化用于长时多轮对话

Naifan Zhang, Ruihan Sun, Jinwei Su, Hengjie Yang, Zhengyuan Pan, Zhaohan Chen, Xiaofan Zhang

机构 * NatureSelect Tsinghua University(清华大学) South China Normal University(华南师范大学) Xiamen University(厦门大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MAPO通过混合优势策略优化,利用密集过程反馈和多级归一化,提升长时多轮对话的稳定性和性能,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26795 2026-07-30 cs.CL 新提交 70%

When Does Span-Guided Detoxification Help? Human Preferences and Evaluator Diagnostics in a Controlled Comparison

基于跨度引导的解毒方法何时有效?受控比较中的人类偏好与评估者诊断

Kyungwon Park

机构 * Yonsei University(延世大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究对比跨度引导与无引导解毒方法的人类偏好,发现二者存在权衡,不同分层偏好不同,自动评估无法替代人类判断,推动了新评估协议的发展。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 57%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20253 2026-07-30 cs.SD cs.AI eess.AS 版本更新 57%

Pushing the Frontier of Full-Song Generation: Hierarchical Autoregressive Planning Meets Flow-Matching Rendering

推动全曲生成的前沿:分层自回归规划与流匹配渲染

Junyu Dai, Xinyue Fan, Weiqin Li, Xiangang Li, Yunjia Li, Bin Ma, Yukun Ma, Chongjia Ni, Yufei Shi, Biao Tian, Haoxu Wang, Menglin Wu, Jianwei Yu, Huaicheng Zhang, Han Zhao, Shengkui Zhao, Haina Zhu

机构 * Alibaba(阿里巴巴)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 该研究提出统一歌曲生成框架,支持多项任务,由四个组件构成。通过特定编码、建模、匹配及模块实现歌曲生成,还研究多种后训练策略,实验表明该框架在评估中性能具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09229 2026-07-30 cs.NE cs.AI q-bio.NC 版本更新 57%

The Fast Lane Hypothesis: Von Economo Neurons Implement a Biological Speed-Accuracy Tradeoff

快速通道假说:von Economo神经元实现一种生物速度-准确性权衡

Esila Keskin

机构 * School of Computing and Creative Technologies, University of the West of England, Bristol, UK(西英格兰大学计算与创意技术学院,布里斯托尔,英国)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出von Economo神经元通过稀疏快速投射路径实现生物速度-准确性权衡,通过模拟社会辨别任务验证其在不同病理条件下对决策速度的影响。

Comments 7 pages, 5 figures. Code available at https://github.com/esila-keskin/fast-lane-hypothesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27061 2026-07-30 cond-mat.stat-mech math-ph math.MP physics.data-an 新提交 50%

Neural variational framework for random Young-diagram limit shapes

随机杨图极限形状的神经变分框架

Qian Chen, Bo-Xuan Ge

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 该研究提出适配随机杨图系综结构与尺度的保持结构神经变分框架,在多类系综上验证后,用于研究无解析鞍形的四次变形钩长系综,为变形依赖的宏观鞍形族提供数值证据。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏