arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 8 篇

2510.13434 2026-07-29 cs.CL 版本更新 87%

$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation

$M^2PO$:用于机器翻译的多视角多对偏好优化

Hao Wang, Linlong Xu, Heng Liu, Yangyang Liu, Xiaohu Zhao, Bo Zeng, Liangying Shao, Yichen Dong, Xinwei Wu, Jiang Zhou, Tianyu Dong, xiangxiang Zeng, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce(阿里巴巴国际数字商业)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对机器翻译中主流方法受误导性奖励信号影响的问题,提出$M^2PO$框架,通过双视角机制和多对目标优化偏好,实验证明该框架能使模型性能提升,超越开源基线并接近专有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03957 2026-07-29 cs.CL cs.AI 版本更新 85%

NormWorlds-CF: Solver-Verified Counterfactual Normative Reasoning with Metamorphic-Relation GRPO

NormWorlds-CF:使用变质关系GRPO进行求解器验证的反事实规范推理

Xinqi Zhang

机构 * Tsinghua University(清华大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);LLM(abstract);language model(abstract);post-training(abstract)

AI总结 介绍NormWorlds-CF用于可执行规则世界的反事实规范推理,其求解器能产生多种结果用于监督评估。通过实验对比不同奖励机制对任务的影响,显示验证的反事实结构可影响训练后表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25136 2026-07-29 cs.AI 新提交 79%

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07884 2026-07-29 cs.CL cs.AI 版本更新 79%

Contrastive Weak-to-strong Generalization

对比性弱到强泛化

Houcheng Jiang, Junfeng Fang, Jiaxin Wu, Tianyu Zhang, Chen Gao, Xiang Wang, Xiangnan He, Yang Deng

机构 * ustc(中国科学技术大学) nus(新加坡国立大学) zgc(中关村学院) smu(新加坡管理学院)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对弱到强泛化中弱模型输出噪声和偏差问题,利用隐式奖励与对比解码的联系,提出ConG框架,通过对比解码生成高质量样本,实现可靠能力转移等,经实证验证其有效性和通用性,推动了弱到强泛化及通向通用人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25659 2026-07-29 cs.AI 新提交 57%

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

CoRT:用于令牌级评分标准引导策略优化的反事实重放

Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo

机构 * ByteDance(字节跳动)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09733 2026-07-29 cs.CL cs.CV 版本更新 57%

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

VisRAG2.0:通过视觉检索增强生成中的证据引导多图像推理减轻视觉幻觉

Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

机构 * School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.CL

AI总结 研究针对视觉检索增强生成中VLM存在的视觉幻觉及证据识别问题,提出证据引导的多图像推理框架EVisRAG,引入RS-GRPO改进训练,实验表明该方法能提升性能、减少幻觉,有效提高视觉基础和推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25258 2026-07-29 q-fin.RM q-fin.CP q-fin.PR 新提交 50%

Robust Hedging Valuation Adjustment for Deep Hedging Policies under Market Frictions

市场摩擦下深度套期保值策略的稳健套期保值估值调整

Takayuki Sakuma

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 研究在市场摩擦下对衍生品头寸套期保值的交易规则,应用稳健套期保值估值调整,结合资金和保证金附加项评估跟踪损失CVaR,在不同流动性市场比较经典与学习到的套期保值规范,给出不同风险预算下的选择建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 50%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏