arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-27 至 2026-07-27 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2607.20002 2026-07-27 cs.LG cs.AI 版本更新 90%

Post-Training in Time Series Foundation Models: A Unifying Framework

时间序列基础模型的训练后处理:一个统一框架

Shifeng Xie, Ambroise Odonnat, Zehao Xiao, Lei Zan, Malik Tiomoko, Lujia Pan, Themis Palpanas, Boris N. Oreshkin, Chenghao Liu, Keli Zhang

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究时间序列基础模型预训练不足以可靠部署下游任务的问题,基于预测管道干预位置分析训练后处理方法,分为五类并研究其代表性方法与局限,确定未来方向,提供统一框架助于相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21757 2026-07-27 cs.CY cs.AI cs.HC 新提交 83%

Co-design of LLM-based preference agents: participation may drive overtrust

基于大语言模型的偏好智能体协同设计:参与可能导致过度信任

Michael J. Fell

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型模拟人类偏好引发的问题,通过12名参与者在家庭能源领域协同设计个人偏好智能体的定性研究,发现参与和过程透明度或成“过度信任引擎”,并将此发展为参与式偏好智能体设计核心机制。

Comments 43 pages (18 main text plus supplementary material), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01551 2026-07-27 cs.LG cs.AI cs.CL 版本更新 75%

Self-Guided Process Reward Optimization with Redefined Step-wise Advantage for Process Reinforcement Learning

基于重新定义的逐步优势的自引导过程奖励优化用于过程强化学习

Wu Fei, Shuxian Liang, Yibo Yang, Yang Lin, Jing Tang, Lei Chen, Xiansheng Hua, Hao Kong

机构 * Terminus Group(Terminus集团) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对过程强化学习中引入奖励模型计算开销大且缺乏统一优势估计框架的问题,提出SPRO框架,通过从策略模型导出奖励及重新定义优势进行过程感知强化学习,实验显示其训练效率高、准确率提升且无额外开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21619 2026-07-27 cs.CL cs.AI 新提交 73%

Adversarial Style Optimization: Enhancing VLM Jailbreaks by GRPO-based Stylistic Triggers Optimization

对抗风格优化:通过基于GRPO的风格触发优化增强VLM越狱

Bingjun Luo, Jialin Guo, Yue Yao, Xinpeng Ding

机构 * Tsinghua University(清华大学) Harbin Engineering University(哈尔滨工程大学) Shandong University(山东大学) Xidian University(西安电子科技大学)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究MLLMs安全对齐易受越狱攻击问题,提出基于GRPO的对抗风格优化(ASO)方法,通过优化风格触发增强视觉越狱,实验证明该方法显著提高攻击成功率,凸显风格偏差对MLLMs红队测试的作用。

Comments Accepted by CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21626 2026-07-27 cs.AI 新提交 70%

Discrete Action Space as a Prerequisite for GRPO Convergence in Small-Model Continuous Control

离散动作空间是小模型连续控制中GRPO收敛的前提条件

Dmytro Filatov, Valentyn Fedorov, Vira Filatova

专题命中 后训练与偏好优化 :language model(abstract);small language model(abstract);分类 cs.AI

AI总结 研究GRPO对小语言模型用于四旋翼连续控制任务微调的情况,发现普通GRPO微调失败,两项消融实验虽防熵崩溃但无法学习,更换动作接口后训练收敛,描绘出帕累托前沿,该方法在三个模型上评估,还对比了经典基线并发现训练分布差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30789 2026-07-27 cs.LG cs.AI 版本更新 62%

Smaller Models are Natural Explorers for Policy-Level Diversity in GRPO

小型模型是GRPO中策略级多样性的自然探索者

Yiran Xu, Yiming Ren, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang, Tianhe Wu, Junjie Wang, Yujiu Yang, Yu Qiao, Ruihang Chu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 后训练与偏好优化 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出S2L-PO框架,利用小型模型作为自然探索者生成策略级多样性的rollout,通过渐进退火策略过渡到大型模型自身采样,提升数学推理性能并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22270 2026-07-27 cs.SE 新提交 50%

Comparing and Conceptualizing Data Protection Requirements Worldwide for Privacy Regulatory Compliance

全球范围内隐私监管合规的数据保护要求比较与概念化

Claudia Negri-Ribalta, Lorena Sanchez Chamorro, Ioana Visescu, Muriel Frank, Anastasia Sergeeva, Alberto García, Rene Noel

专题命中 后训练与偏好优化 :prompting(abstract)

AI总结 本文从法律专家角度,通过访谈和法规分析,识别全球通用及不同的数据保护要求,回答相关问题,并转化为数据保护官故事,助力组织管理跨境个人数据流动的监管合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21722 2026-07-27 cs.CV 新提交 50%

Be Consistent! Enhancing Robust Visual Reasoning in LVLMs with Consistency Constraints

保持一致!利用一致性约束增强大视觉语言模型中的鲁棒视觉推理

Liqiang Jing, Xiong Zhou, Siddharth Varia, Neha Anna John, Xinya Du, Vassilis N. Ioannidis

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Amazon Web Services(亚马逊网络服务公司)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 研究针对LVLMs在视觉推理任务中较脆弱的问题,引入ConVBench基准及逻辑一致性等评估指标,提出ConVLM,通过基于GRPO的强化学习及一致性奖励改进LVLM推理,利用自动生成的问答对和双重奖励设计提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏