arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-29 至 2026-07-29 共收录 195 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 9 篇

2607.24769 2026-07-29 cs.AI cs.CL 新提交 88%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 预训练与数据 :pretraining(title,abstract);LLM(title);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25135 2026-07-29 cs.AI cs.LG 新提交 82%

ScalableRAG: High-Quality RAG at Zero Ingestion Cost

ScalableRAG:零摄入成本下的高质量检索增强生成

Hilaf Hasson, Aditya Chakravarty, Jayant Thomas, Krishna Gogineni

机构 * Cohesity(科赫思)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 研究提出零摄入成本的ScalableRAG及有限摄入的改进版本,通过维护工作区实现即时聚合推理,在六个语料库测试中表现出色,平均准确率大幅超越基线,还通过固定LLM调用次数等进一步提升大规模时的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25271 2026-07-29 cs.LG cs.AI cs.PF 新提交 81%

Bridging Compute- and Data-Optimal Pretraining

弥合计算最优和数据最优预训练之间的差距

Tian Qin, Kimia Hamidieh, David Alvarez-Melis

机构 * Harvard University(哈佛大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对计算增长快于高质量数据可用性的问题,提出计算-数据(CD)缩放定律框架,通过引入令牌有效性函数η拟合数据扩展策略,划分训练操作模式,指出经典计算最优分配在多数实际设置下次优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24791 2026-07-29 cs.IR cs.AI cs.CL 新提交 73%

From Naive RAG to Deep Agentic Retrieval: An Evolving Context Engineering Pipeline for Regulatory Compliance

从朴素检索增强生成到深度智能检索:用于合规监管的不断演进的上下文工程管道

Mishca de Costa, Muhammad Saleh Anwar, Dave Mercier, Issam Hammad

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对RAG朴素实现的局限,追溯安大略发电公司检索管道演变,历经多阶段形成PEA-CAE架构,表明上下文工程对监管语料库更具优势,深度智能检索进展反映经典思想,迭代证据获取等渐成企业问答基础。

Comments Accepted at the 2026 IEEE the 14th International Conference on Smart Energy Grid Engineering (SEGE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25184 2026-07-29 cs.CL 新提交 70%

A scaling law of contextual persistence in human language

人类语言中上下文持久性的标度律

Elan Barenholtz

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究人类语言中单词顺序排列的规律,用大语言模型测量上下文持久性函数P(d),发现其在多个语料库中按1/d衰减,建立了人类语言中上下文持久性的标度律。

Comments 21 pages, 5 figures (plus 1 supplementary figure); Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25851 2026-07-29 cs.SE 新提交 67%

Rethinking Training Data for Generating Code Review Comments

重新思考用于生成代码审查评论的训练数据

Leonardo Centellas-Claros, Estefania Pakarati-Cofre, Juan Pablo Sandoval Alcocer, Diego Elias Costa

专题命中 预训练与数据 :LLM(abstract,abstract_cn)

AI总结 研究代码审查评论生成,指出尽管有进展但生成的评论存在问题,通过实证检查识别出不匹配训练对并得出分类法,探讨纳入分类法能否改善问题,发现仍有挑战,认为改进需更多举措而非仅数据集清理。

Comments Paper accepted to ICSME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25169 2026-07-29 cs.LG cs.AI 新提交 62%

CondPSE: A Polynomial-Filtered Structural Encoder with Conditional Modulation for Graphs

CondPSE:一种具有条件调制的多项式滤波结构编码器用于图

Woohyun Lee, Hogun Park

机构 * Sungkyunkwan University(成均馆大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究针对消息传递图神经网络局限,提出CondPSE编码器,用多项式图滤波器组和条件调制处理节点探针,预训练后冻结用作下游输入编码。在合成基准上提升结构判别准确率,在分子性质预测中与GPSE相当,探讨了其优势及局限性。

Comments Accepted as a poster at the 2nd Frontiers in Graph Machine Learning for the Large Model Era (GMLLM'26), a KDD 2026 workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24745 2026-07-29 cs.IR cs.AI cs.CL cs.CV 新提交 62%

DocAnnot -- Accelerating the Creation of Key Information Extraction Datasets with GenAI-Powered Auto-annotation

DocAnnot——利用生成式人工智能驱动的自动注释加速关键信息提取数据集的创建

Siddartha Reddy, Harikrishnan P M, Goutham Vignesh, Varun V, Vishal Vaddina

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对关键信息提取中训练数据集创建耗时的问题,提出DocAnnot框架,利用大型视觉语言模型、OCR及SICM算法,在基准测试中自动生成注释有一定F1分数,还能用于微调下游模型,大幅节省时间成本,减少人工依赖但未完全消除人工干预。

Comments 15 pages, 2 figures

Journal ref Proc. ICDAR 2025, Lecture Notes in Computer Science, vol 16025, Part III, pp. 563-576

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25085 2026-07-29 eess.AS 新提交 50%

Text-Prompted CLAP: Learning Query-Conditioned Audio Representations via Contrastive Learning

文本提示的CLAP:通过对比学习学习查询条件音频表示

Mohan Li, Rama Doddipatla, Philip C. Woodland

专题命中 预训练与数据 :pretraining(abstract)

AI总结 研究旨在解决CLAP独立编码模态限制,提出TP-CLAP,通过引入交叉注意力融合模块,利用音频多项选择题框架训练,在音频问答、检索等任务中表现出色,优于标准CLAP基线。

Comments 5 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 18 篇

2607.25063 2026-07-29 cs.AI 新提交 94%

Similar Models Learn Differently: Final-Window Pretraining Shapes Post-Training Beyond SFT

相似模型学习方式不同:最终窗口预训练对训练后行为的塑造超越监督微调

Cen Lu, Yung-Chen Tang, Andrea Cavallaro

专题命中 指令微调 :SFT(title,summary_cn);pretraining(title,abstract);post-training(title,abstract);instruction tuning(abstract)

AI总结 研究探讨模型预训练最后窗口对训练后行为的影响,通过控制实验发现不同预训练最后窗口数据的分支,SFT后表现相近,但后续训练走向不同,安全文本分支有保护效果,表明不能仅依SFT后行为评估模型,还应考虑预训练最后内容。

Comments 16 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25956 2026-07-29 cs.AI math.OC 新提交 93%

Large Language Model for Operations Research Formulation Selection in Multi-Warehouse Inventory Allocation

用于多仓库库存分配中运筹学公式选择的大语言模型

Jintao Xu, Yingzheng Ma, Jiong Dong, Yongzhi Qi, Jianshen Zhang

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 研究多仓库库存分配中运筹学公式选择问题,提出求解器引导的大语言模型框架,通过构建SFT记录、转换质量差距为偏好等进行训练,实验表明GRPO能显著提高选择准确性和分配质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24824 2026-07-29 cs.IR 新提交 90%

Retrieval-based and Fine-tuned LLM Approaches for Industrial Asset Health Monitoring and Decision Support

基于检索和微调的大语言模型方法用于工业资产健康监测和决策支持

Seshu Kumar Damarla, Xiuli Zhu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究基于检索和微调的大语言模型方法在工业资产健康监测中的故障传感器诊断推理表现,通过FailureSensorIQ基准测试,发现语义搜索和混合搜索效果好,基于LLM的微调模型性能最佳,且各方法对一些干扰因素敏感。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25091 2026-07-29 cs.AI cs.CL cs.LG math.OC stat.CO 新提交 90%

Towards Robust Reinforcement Learning for Small-Scale Language Model Agents

迈向用于小规模语言模型智能体的稳健强化学习

Md Rezwanul Haque, Md. Milon Islam, Fakhri Karray

机构 * University of Waterloo(滑铁卢大学) Khulna University of Engineering & Technology(库尔纳工程技术大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :language model(title,abstract);SLM(abstract,abstract_cn);SFT(abstract,abstract_cn);small language model(abstract)

AI总结 研究小规模语言模型强化学习不稳定问题,识别出三种失败模式,提出容量余量假设,采用合并并重新初始化适配器技术等方法,所提系统稳定收敛,提升偏好胜率,优于指令调整基线且减少训练数据。

Comments Proceedings of the 2026 IEEE International Conference on Systems, Man, and Cybernetics (SMC), Bellevue, WA, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25069 2026-07-29 cs.CL cs.AI 新提交 90%

DS@GT ARC at CheckThat! 2026: LLM-Based Trace Ranking and Grouped Reward Modeling for Multilingual Numerical Claim Verification

DS@GT ARC在CheckThat! 2026中的应用:基于大语言模型的多语言数值声明验证的推理轨迹排序和分组奖励建模

Sagnik Sinha, Shreyas Shrestha

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多语言数值声明验证,探索基于大语言模型(LLM)的推理轨迹排序和分组奖励建模两种方法。LLM方法用LoRA微调验证器评分,还尝试子声明分解;奖励模型用TF-IDF及特征评分。结果显示LLM方法多数指标更优,阿拉伯语中AraBERT表现更佳且子声明分解未提升性能。

Comments 10 pages, 2 figures. Accepted at CLEF 2026 CheckThat!. To appear in CEUR Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26023 2026-07-29 cs.AI 新提交 89%

CHARM: A Multimodal Graph Foundation Model with Hierarchical Context Modeling for Zero-Shot Transfer

CHARM:一种用于零样本迁移的具有分层上下文建模的多模态图基础模型

Ankang Yang, Jitao Zhao, Di Jin, Yuxiao Huang, Dongxiao He

机构 * School of Computer Science and Technology, College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部计算机科学与技术学院) Data Science Program, Columbian College of Arts and Sciences, The George Washington University(乔治华盛顿大学文理学院哥伦比亚艺术与科学学院数据科学项目)

专题命中 指令微调 :foundation model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究多模态图零样本迁移问题,提出CHARM模型,通过分层上下文建模,用图上下文替换原始节点,减少对目标域监督或适配的依赖,经实验验证该模型在零样本多模态图任务上有改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24764 2026-07-29 cs.AI 新提交 88%

GrocLM: Grocery Category Recommendation in E-Commerce with Large Language Models

GrocLM:使用大语言模型进行电子商务中的杂货类别推荐

Yuan Zhong, Chuanwei Ruan, Moein Hasani, Tejaswi Tenneti, Haixun Wang, Fenglong Ma

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Instacart(因斯塔卡特公司) Evenup(伊文纳普公司)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对在线杂货购物推荐系统面临的挑战,提出GROCLM模型。采用基于LoRA的两阶段训练策略及基于前缀树的约束解码机制,在实验中表现出色,在实时生产补货任务中提升了购物车添加量,凸显将大语言模型集成到结构化推荐系统的有效性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25292 2026-07-29 cs.AI 新提交 85%

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

指令微调语言模型无法从它们能描述的分布中进行采样

Chaemin Jang, Dongman Lee, Jihee Kim

机构 * School of Computing, KAIST(韩国科学技术院计算学院) School of Business and Technology Management, KAIST(韩国科学技术院商业与技术管理学院)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);post-training(abstract);分类 cs.AI

AI总结 研究发现指令微调语言模型无法从其能描述的分布中采样,存在“知道/做”分裂,通过让模型描述分布可减半误差,还提出PPA在无额外成本下降低21%误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25763 2026-07-29 cs.NI cs.LG 新提交 79%

WALoMA: A Multitask Wireless Foundation Model via Adaptive Low-Rank Masked Autoencoders

WALoMA:一种通过自适应低秩掩码自动编码器实现的多任务无线基础模型

Madi Makin, Asmaa Abdallah, Abdulkadir Celik, Ahmed M. Eltawil

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 研究针对6G无线物理层架构中特定任务模型局限和标记数据稀缺问题,提出WALoMA模型,利用自适应低秩掩码自动编码器,通过自监督学习从无标签数据中学习可转移表示,在五个下游任务中表现出色,显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26015 2026-07-29 cs.CL 新提交 77%

Instruction-Tuned Models Locally Reuse Human Syntax More Than Humans Do

指令微调模型在局部比人类更多地复用人类句法

Zandi Eberstadt

机构 * University of Oxford(牛津大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL

AI总结 研究大语言模型是否像人类一样句法趋同,通过替换范式数据在多个模型测量CFG规则复用。发现各模型与前一轮人类话语规则重叠多,指令微调模型有特点,还在词汇和语义相似度上有表现,揭示了模型在句法复用方面与人类的异同。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24783 2026-07-29 cs.AI 新提交 77%

Unified Semantic Modeling Framework for Large-Scale Job Understanding at LinkedIn

领英大规模职位理解的统一语义建模框架

Dan Xu, Baofen Zheng, Jianqiang Shen, Qi Xiao, Benjamin Hoan Le, Wen Pu, Saurabh Gupta, Ran Zhou, Neha Saraf, Alice Leung, Qianqi Shen, Liangjie Hong, Jingwei Wu, Wenjing Zhang

机构 * LinkedIn Corporation(领英公司)

专题命中 指令微调 :language model(abstract);small language model(abstract);SLM(abstract);分类 cs.AI

AI总结 领英为应对职位理解系统构建挑战,提出统一语义建模框架。先微调小型语言模型,再引入多适配器架构。经离线评估和在线A/B测试,该框架提升了性能、降低了复杂性,为构建行业规模文本理解系统提供实用见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24803 2026-07-29 cs.IR cs.CL 新提交 74%

SciClaimSeekers at CheckThat! 2026: Retrieving Scientific Sources for Social Media Claims with LLM Reranking

SciClaimSeekers参加CheckThat! 2026:使用大语言模型重排检索社交媒体声明的科学来源

Mohotarema Rashid, Nansu Baniya, Anirban Saha Anik, Xiaoying Song, Lingzi Hong

专题命中 指令微调 :LLM(title);分类 cs.CL

AI总结 针对社交媒体科学声明难核实且少链接原始学术来源的问题,提出SciClaimSeekers系统,结合BM25、E5检索及倒数排名融合,经Qwen2.5-14B-Instruct重排,在相关评估中表现良好,证明大型预训练模型组合在该任务中可与微调方法竞争。

Comments CLEF 2026 Working Notes / CheckThat! Lab at CLEF 2026, Jena, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25299 2026-07-29 cs.LG cs.AI 新提交 73%

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

用于LoRA微调的Stiefel流形上无回缩优化

Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系) Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对Stiefel流形优化中现有方法的问题,提出无回缩且无惩罚参数算法,利用相关特性建立收敛保证。将LoRA微调问题转为流形优化问题,引入Manifold-LoRA,经实验验证其在加速训练及下游性能方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24814 2026-07-29 cs.AI cs.LG q-bio.OT 新提交 73%

Aletheia: An Offline-First Clinical Decision Support System for Differential Diagnosis in Low-Resource Healthcare Settings

Aletheia:用于低资源医疗环境中鉴别诊断的离线优先临床决策支持系统

Joseph Walusimbi, Ann Move Oguti, Abubakhari Sserwadda, Precious Boss Kasasira, Charles Brian Okoboi

机构 * Soroti University(索罗蒂大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对撒哈拉以南非洲低资源医疗环境,提出基于Qwen2.5 - 3B - Instruct并经QLoRA微调的Aletheia临床决策支持系统,评估显示其在诊断准确率等指标上表现良好,证明在无云设施的资源受限环境初级保健层部署大语言模型临床推理的可行性。

Comments 8 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25583 2026-07-29 cs.AI 新提交 57%

How Small Can You Go? A Controlled Study of LoRA Rank, Target Modules, and Quantization Trade-offs for Text-to-SQL on a 60M-Parameter Model

你能做多小?关于60M参数模型上文本到SQL的LoRA秩、目标模块和量化权衡的对照研究

Mahendra Singh Rathor, Anagheem Azzam

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究在60M参数模型上文本到SQL时,LoRA秩、目标模块和量化的权衡。通过对照单变量研究,发现r = 16的LoRA在训练参数少、内存消耗低时接近全量微调准确性,QLoRA的INT8和NF4量化以低内存成本实现可比准确性,为内存受限部署提供方案。

Comments 8 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24900 2026-07-29 cs.LG 新提交 57%

Inverse RL Helps Align AI by Imitating Humans

逆强化学习通过模仿人类帮助对齐人工智能

Michał Wiliński, Liu Leqi, Chirag Nagpal

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 研究语言模型对齐问题,受逆强化学习启发提出PARED方法,通过恢复示范的隐式奖励来改进基础策略,无需特定任务偏好注释,经实验验证其有效性及可用于上下文对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25355 2026-07-29 cs.SD 新提交 50%

From Semantics to Readout: Mechanistic Understanding of Audio Tokens after Fine-Tuning for Temporal Audio Grounding

从语义到读出:时间音频接地微调后音频令牌的机制理解

Yujian Ma, Jinqiu Sang, Ruizhe Li, Jiaao Yu, Ang Li

专题命中 指令微调 :language model(abstract)

AI总结 研究大型音频语言模型中音频令牌在微调后的机制,通过四种分析研究其分层语义等,发现微调前已有潜在证据,微调后解码器更易访问事件信息,支持从语义到读出的解释,有助于解码器连接时间输出。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 3 篇

2607.25136 2026-07-29 cs.AI 新提交 79%

Less Data, Better Alignment: Data-Centric Multi-Evaluator Agreement for Preference Optimization

数据更少,对齐更好:用于偏好优化的数据中心多评估器一致性方法

Zhengtao Yao, Runhao Li, Xupeng Chen, Jiayi Cheng, Chenqian Le, Michael Yue, Siheng Wang, Haoyan Xu, Yuqi Li, Chenhao Wei, Zhengdao Li, Rongchao Zhang, Guang Yang, Yidong Wang, Junhao Dong

机构 * University of Southern California(南加州大学) New York University(纽约大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加利福尼亚大学伯克利分校) City College of New York, CUNY(纽约市立大学城市学院) Stevens Institute of Technology(史蒂文斯理工学院) Nanyang Technological University(南洋理工大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.AI

AI总结 研究聚焦偏好优化,提出DMAPO方法,从目标策略生成候选响应,经多评估器评估、校正后保留高一致性示例。实验表明该方法数据效率高,能提升模型在MT - Bench等指标上的表现,且改变评估器或准则对下游性能影响小。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25659 2026-07-29 cs.AI 新提交 57%

CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization

CoRT:用于令牌级评分标准引导策略优化的反事实重放

Bo-Wen Zhang, Junwei He, Wen Wang, Song-Lin Lv, Wentao Ma, Rongyi Lin, Shuhan Zhong, Lan-Zhe Guo

机构 * ByteDance(字节跳动)

专题命中 后训练与偏好优化 :language model(abstract);分类 cs.AI

AI总结 研究基于评分标准的强化学习中响应内信用分配问题,提出CoRT方法,利用反事实重放对响应重新评分,将对比映射为权重来重新分配优势,实验表明该方法能有效提升训练效果,兼具简单性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25258 2026-07-29 q-fin.RM q-fin.CP q-fin.PR 新提交 50%

Robust Hedging Valuation Adjustment for Deep Hedging Policies under Market Frictions

市场摩擦下深度套期保值策略的稳健套期保值估值调整

Takayuki Sakuma

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 研究在市场摩擦下对衍生品头寸套期保值的交易规则,应用稳健套期保值估值调整,结合资金和保证金附加项评估跟踪损失CVaR,在不同流动性市场比较经典与学习到的套期保值规范,给出不同风险预算下的选择建议。

详情

展开后加载摘要…

URL PDF HTML 收藏