arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4526 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4526 篇

2605.01350 2026-08-04 cs.CL 版本更新 83%

LLM Output Detectability and Task Performance Can be Jointly Optimized

大语言模型输出可检测性与任务性能可以联合优化

Koshiro Saito, Ryuto Koike, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) MBZUAI National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) NII LLMC(日本信息基础设施中心LLMC)

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出PUPPET框架,通过强化学习优化大语言模型,使其输出更易检测且在下游任务中表现更优,实验表明其在长文问答、摘要和作文写作中均优于传统水印方法。

Comments 15 pages, 9 figures, 20 tables. Code: https://github.com/pakapaka333/PUPPET

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25702 2026-08-04 cs.CL 版本更新 83%

Backtranslation Augmented Direct Preference Optimization for Neural Machine Translation

反向翻译增强的直接偏好优化用于神经机器翻译

Mehrdad Ghassabi, Spehr Rajabi, Hamidreza Baradaran Kashani, Sadra Hakim, Mahshid Keivandarian, Amirhossein Jahani Bahnamiri

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出基于直接偏好优化的强化学习后训练框架,利用通用文本语料和专家反馈纠正神经机器翻译错误,在英德翻译任务上将COMET分数从0.703提升至0.747。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21757 2026-07-27 cs.CY cs.AI cs.HC 新提交 83%

Co-design of LLM-based preference agents: participation may drive overtrust

基于大语言模型的偏好智能体协同设计:参与可能导致过度信任

Michael J. Fell

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨大语言模型模拟人类偏好引发的问题,通过12名参与者在家庭能源领域协同设计个人偏好智能体的定性研究,发现参与和过程透明度或成“过度信任引擎”,并将此发展为参与式偏好智能体设计核心机制。

Comments 43 pages (18 main text plus supplementary material), 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20345 2026-07-23 cs.RO cs.AI 新提交 83%

Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids

弥合实验室与商店之间的差距:一种用于零售类人机器人的数据高效训练后及经验驱动学习的VLA框架

Roger Sala Sisó, Tiago Silvério, Jakob Sand, Tran Nguyen Le

机构 * HIVE Robots(蜂巢机器人公司) Technical University of Denmark(丹麦技术大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.AI

AI总结 研究针对VLA类人机器人弥合实验室与实际应用差距的问题,提出DEED系统级方法,含数据高效训练后管道、经验驱动细化研究及潜在空间分析工具,经实验证明精心设计数据和训练后处理可解决该问题。

Comments 8 pages. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11070 2026-07-14 cs.CL 新提交 83%

MJ: Multi-turn LLM Jailbreaking via Decomposed Credit Assignment

MJ:通过分解信用分配实现多轮语言模型越狱

Junyoung Park, Namgyu Park, Sechan Lee, Yoon-Chan Jhi, Jihoon Cho, Sangdon Park

机构 * POSTECH GSAI(浦项科技大学全球人工智能学院) Samsung SDS(三星 SDS)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对多轮语言模型越狱的信用分配难题,提出DC-GRPO框架,通过结合即时和未来信用为各轮次分配学习信号,经静态和动态加权规则实例化,在多模型和基准测试中显著优于现有方法,核心优势在于轮次级组相对信用分配。

Comments 29 pages. Warning: This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05863 2026-07-08 cs.LG cs.GT 新提交 83%

Strategic Bargaining in Multi-Buyer Markets: Reinforcement Learning from Verifiable Rewards for LLM Negotiations

多买家市场中的战略谈判:基于可验证奖励的强化学习用于大语言模型谈判

Shuze Daniel Liu, Claire Chen, Jiabao Sean Xiao, Xin Chen, David Simchi-Levi

机构 * Institute for Data, Systems, and Society, Massachusetts Institute of Technology(数据、系统与社会研究所,麻省理工学院) Mitch Daniels School of Business, Purdue University(米奇·丹尼尔斯商学院,普渡大学) The Division of Physics, Mathematics and Astronomy, California Institute of Technology(物理、数学与天文学部,加州理工学院) Department of Computing and Mathematical Sciences, California Institute of Technology(计算与数学科学系,加州理工学院) H. Milton Stewart School of Industrial and Systems Engineering, Georgia Institute of Technology(H. 米尔顿·斯图尔特工业与系统工程学院,佐治亚理工学院) Department of Civil and Environmental Engineering, Operations Research Center, Massachusetts Institute of Technology(土木与环境工程系、运筹学中心,麻省理工学院)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多买家市场中卖家与买家的谈判,提出基于可验证奖励的强化学习方法,使卖家能平衡市场探索与剩余提取,实现多阶段战略演变,提升谈判技能,提取更高剩余,且策略可推广。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01830 2026-07-03 cs.LG 新提交 83%

Many Voices, One Reward: Multi-Role Rubric Generation for LLM Judging and Reward Modeling

众声归一:面向大模型评判与奖励建模的多角色评分标准生成

Dazhi Fu, Jiuding Yang, Yiwen Guo, Jicong Fan

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) LIGHTSPEED Independent Researcher(独立研究员)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出多角色评分标准生成框架(MRRG),通过整合多个互补角色的评估标准,消除单一通用评估器的维度盲区,在偏好验证和强化学习奖励信号上均优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24669 2026-06-24 cs.AI 新提交 83%

LaGO: Latent Action Guidance for Online Reinforcement Learning

LaGO:面向在线强化学习的潜在动作引导

Kuan-Yen Liu, Ren-Jyun Huang, Ti-Rong Wu

机构 * Siebel School of Computing(计算科学系) Data Science, University of Illinois Urbana-Champaign, USA(数据科学,伊利诺伊大学厄巴纳-香槟分校,美国) Department of Computer Science, National Yang Ming Chiao Tung University, Taiwan(计算机科学系,National Yang Ming Chiao Tung大学,台湾) Institute of Information Science, Academia Sinica, Taiwan(信息科学研究所, Academia Sinica,台湾)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 提出LaGO框架,利用预训练大语言模型作为潜在动作先验,软引导在线策略优化,在离散和连续控制基准上显著提升奖励与成功率。

Comments 9 pages, 2 figures. Accepted at the ICML 2026 Workshop on Large Language Models for Planning (LM4Plan)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17979 2026-06-19 cs.AI 新提交 83%

STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training

STAR: 文本到图像强化学习后训练中的时空自适应奖励分配

Jinjie Shen, Wei Deng, Xian Hu, Daiguo Zhou, Jian Luan

机构 * institutetext: STAR: SpatioTemporal Adaptive Reward Allocation for Text-to-Image RL Post-Training(机构文本:STAR:时空自适应奖励分配用于文本到图像强化学习后训练)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract);分类 cs.AI

AI总结 针对文本到图像生成中奖励与生成轨迹粒度不匹配的问题,提出STAR方法,利用文本-图像注意力构建时空自适应分配图,对相关潜在区域施加更强策略更新,提升语义对齐和文本渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13709 2026-06-15 stat.ML cs.LG 新提交 83%

LoMC: Localized Multidirectional Correction for Refusal Suppression in Routed Foundation Models

LoMC: 路由基础模型中拒绝抑制的局部多方向校正

Yan Hong, Kedong Xiu, Wei Li, Jun Lan, Huijia Zhu, Shuheng Zhou, Zhongcai Lyu, Weiqiang Wang, Jianfu Zhang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 后训练与偏好优化 :foundation model(title,abstract);post-training(abstract);分类 cs.LG

AI总结 提出LoMC方法,通过支持门控干预框架在路由MoE和混合MoE模型中实现紧凑的拒绝抑制,提升非拒绝目标响应行为并保持通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12280 2026-06-15 cs.LG 新提交 83%

Holding the FP8 Quality Ceiling at 8-Bit Weights and Activations: INT8 and GGUF Post-Training Quantization of Ideogram 4.0 for Consumer GPUs

在8位权重和激活下保持FP8质量上限:Ideogram 4.0的INT8和GGUF后训练量化用于消费级GPU

Deep Gandhi, Ali Asaria, Tony Salomone

机构 * Transformer Lab

专题命中 后训练与偏好优化 :post-training(title,abstract);LLM(abstract);分类 cs.LG

AI总结 本文对Ideogram 4.0模型进行INT8 W8A8量化,在无FP8张量核心的Ampere GPU上达到FP8质量水平,并优于NF4,同时GGUF Q4_K在质量-内存前沿上成为帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12507 2026-06-12 cs.LG 新提交 83%

Rubric-Guided Self-Distillation: Post-Training Without Rubric Verifiers

基于评分标准的自蒸馏:无需评分标准验证器的后训练

MohammadHossein Rezaei, Anas Mahmoud, Zihao Wang, Utkarsh Tyagi, Advait Gosai, Razvan-Gabriel Dumitru, Aakash Sabharwal, Bing Liu, Yunzhong He

机构 * Scale AI

专题命中 后训练与偏好优化 :post-training(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出RGSD方法,通过将评分标准作为条件蒸馏到学生模型,无需验证器即可实现密集逐令牌学习,在医学和科学领域达到与基于评判的GRPO相当的评分标准满足率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04396 2026-06-04 cs.CL 83%

Read the Trace, Steer the Path: Trajectory-Aware Reinforcement Learning for Diffusion Language Models

读取轨迹,引导路径:面向扩散语言模型的轨迹感知强化学习

Anant Khandelwal, Manish Gupta

机构 * Microsoft AI, India(微软印度人工智能)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 提出CAPR算法,通过缓存轨迹状态和块级价值头,利用去噪轨迹提供类似树搜索的细粒度监督,在降低计算成本的同时提升扩散语言模型的强化学习效果。

Comments 19 pages, 10 figures, 7 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04946 2026-06-01 cs.CL 83%

LocalSUG: City-Preference-Enhanced LLM for Query Suggestion in Local-Life Services

LocalSUG:面向本地生活服务的城市偏好增强大语言模型查询建议

Jinwen Chen, Shiwen Zhang, Shuai Gong, Zheng Zhang, Yachao Zhao, Lingxiang Wang, Haibo Zhou, Wei Lin, Hainan Zhang

机构 * Meituan(美团)

专题命中 后训练与偏好优化 :LLM(title,abstract);preference optimization(abstract);分类 cs.CL

AI总结 提出LocalSUG框架,通过挖掘城市偏好候选词注入提示、束搜索GRPO算法和加速解码,解决大语言模型在本地生活服务查询建议中城市偏好不足、偏好暴露偏差和延迟约束问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19923 2026-06-01 cs.CV cs.CL 83%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);language model(abstract);分类 cs.CL

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28814 2026-05-28 cs.CL 83%

Self-Improving Language Models with Bidirectional Evolutionary Search

具有双向进化搜索的自我改进语言模型

Guowei Xu, Zhenting Qi, Huangyuan Su, Weirui Ye, Himabindu Lakkaraju, Sham M. Kakade, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 提出双向进化搜索(BES)框架,通过前向候选进化与后向目标分解相结合,克服了传统搜索方法中稀疏验证信号和自回归扩展的局限,在训练后和推理时均显著提升语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18843 2026-05-20 cs.LG 83%

TEMPO: Temporal Enforcement via Mode-Separated Policy Optimization for Trustworthy LLM Backtesting

TEMPO: 通过模式分离策略优化实现可信大语言模型回测的时序执行

Zeyu Zhang, Bradly C. Stadie

机构 * Department of Statistic and Data Science(统计与数据科学系)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TEMPO方法,通过模式分离策略优化,解决大语言模型回测中因泄露后截止日期知识导致的评估不准确问题,核心贡献是引入双模式奖励和基于GRPO的训练流程,有效减少知识泄露并提升任务性能。

Comments 9 pages in main context

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10759 2026-05-19 cs.LG cs.CV 83%

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

强化共轭匹配:扩散和流匹配模型的后训练强化学习扩展

Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) King's College London(伦敦国王学院) Microsoft Research New England(微软研究院新英格兰分部) University of Oxford(牛津大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出Reinforce Adjoint Matching方法,通过强化学习后训练优化扩散和流匹配模型,无需SDE回滚或梯度,提升生成质量与人类偏好匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04660 2026-05-12 cs.CL 83%

Composing Policy Gradients and Prompt Optimization for Language Model Programs

将策略梯度与提示优化组合用于语言模型程序

Noah Ziems, Dilara Soylu, Lakshya A Agrawal, Isaac Miller, Liheng Lai, Chen Qian, Kaiqiang Song, Meng Jiang, Dan Klein, Matei Zaharia, Karel D'Oosterlinck, Christopher Potts, Omar Khattab

机构 * University of Notre Dame(诺特大学) Stanford University(斯坦福大学) UC Berkeley(伯克利大学) Anyscale CMU(卡内基梅隆大学) Zoom, Inc.(Zoom公司) Contextual AI MIT(麻省理工学院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 本文研究了如何将GRPO与自动提示优化结合,以提升多提示程序的性能,实验表明这种组合在分类、多跳搜索和隐私保护委托任务中平均提升准确率11%。

Comments ACM CAIS 2026. Lakshya*, Dilara*, and Noah* contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06730 2026-05-11 cs.LG 83%

Semantic State Abstraction Interfaces for LLM-Augmented Portfolio Decisions: Multi-Axis News Decomposition and RL Diagnostics

语义状态抽象接口用于LLM增强的组合决策:多轴新闻分解与强化学习诊断

Likhita Yerra, Remi Uttejitha Allam

机构 * AIVANCITY School of AI & Data(AIVANCITY人工智能与数据学院)

专题命中 后训练与偏好优化 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出语义状态抽象接口(SSAI),通过多轴新闻分解和强化学习诊断,提升稀疏文本决策系统的可解释性与性能。

Comments 18 pages, 3 figures. NeurIPS 2024 manuscript style (preprint)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22840 2026-04-28 cs.CV cs.CL cs.MM 83%

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

AeSlides:通过可验证奖励激励基于大语言模型的幻灯片生成中的美观布局

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI (Z.ai)(智谱AI)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AeSlides框架,通过可验证奖励优化幻灯片生成的美观布局,实验表明其在布局合规性、空格减少、元素碰撞和视觉平衡方面均优于现有方法。

Comments 21 pages, 25 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16399 2026-04-23 cs.LG math.OC 83%

A Hessian-Free Actor-Critic Algorithm for Bi-Level Reinforcement Learning with Applications to LLM Fine-Tuning

一种用于双层强化学习的无Hessian演员-评论员算法及其在大语言模型微调中的应用

Sihan Zeng, Sujay Bhatt, Sumitra Ganesh, Alec Koppel

机构 * JPMorgan AI Research(摩根大通AI研究) Johns Hopkins University Applied Physics Laboratory(约翰霍普金斯大学应用物理实验室)

专题命中 后训练与偏好优化 :LLM(title);RLHF(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一种单循环一阶演员-评论员算法,用于解决双层优化问题,通过惩罚重述法优化双层目标,引入衰减熵正则化以实现无偏上层超梯度估计,且在特殊Polyak-Lojasiewicz条件下证明了有限时间与样本收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14932 2026-04-17 cs.AI 83%

WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training

WavAlign:通过自适应混合后训练增强口语对话模型的智能与表达性

Yifu Chen, Shengpeng Ji, Qian Chen, Tianle Liang, Yangzhuo Li, Ziqing Wang, Wen Wang, Jingyu Lu, Haoxiao Wang, Xueyi Pu, Fan Zhuo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tongyi Fun Team, Alibaba Group(通义实验室,阿里巴巴集团) Beijing University of Technology(北京理工大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出WavAlign方法,通过自适应混合后训练提升口语对话模型的智能与表达性,通过语义通道约束和显式锚定改进语音生成,避免不可靠的偏好梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13029 2026-04-15 cs.CV cs.AI 83%

Visual Preference Optimization with Rubric Rewards

基于评分标准的视觉偏好优化

Ya-Qi Yu, Fangyu Hong, Xiangyang Qu, Hao Wang, Gaojie Wu, Qiaoyu Luo, Nuo Xu, Huixin Wang, Wuheng Xu, Yongxin Liao, Zihao Chen, Haonan Li, Ziming Li, Dezhi Peng, Minghui Liao, Jihao Wu, Haoyu Ren, Dandan Tu

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出rDPO框架,通过实例特定的评分标准提升多模态任务中的偏好优化效果,实验表明其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05279 2026-04-08 cs.AI 83%

Pressure, What Pressure? Sycophancy Disentanglement in Language Models via Reward Decomposition

压力,何为压力?通过奖励分解实现语言模型中的奉承解缠

Muhammad Ahmed Mohsin, Ahsan Bilal, Muhammad Umer, Emily Fox

机构 * Stanford University(斯坦福大学) University of Oklahoma(俄克拉荷马大学)

专题命中 后训练与偏好优化 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出通过奖励分解方法减少语言模型的奉承行为,引入多组件组相对策略优化(GRPO)奖励,分解训练信号为五个维度,有效降低奉承倾向。

Comments Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21383 2026-03-24 cs.AI 83%

PivotRL: High Accuracy Agentic Post-Training at Low Compute Cost

PivotRL: 高精度代理后训练的低计算成本

Junkeun Yi, Damon Mosk-Aoyama, Baihe Huang, Ritu Gala, Charles Wang, Sugam Dipak Devare, Khushi Bhardwaj, Abhibha Gupta, Oleksii Kuchaiev, Jiantao Jiao, Jian Zhang, Venkat Srinivasan

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 后训练与偏好优化 :post-training(title,abstract);SFT(abstract);分类 cs.AI

AI总结 PivotRL结合监督微调的高效计算与端到端强化学习的泛化能力,通过局部策略滚动和奖励机制提升代理后训练的准确性和效率。

Comments 22 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11901 2026-03-13 cs.LG 83%

FlexRec: Adapting LLM-based Recommenders for Flexible Needs via Reinforcement Learning

FlexRec: 通过强化学习适应LLM推荐系统以满足灵活需求

Yijun Pan, Weikang Qiu, Qiyao Ma, Mingxuan Ju, Tong Zhao, Neil Shah, Rex Ying

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.LG

AI总结 FlexRec通过强化学习框架解决LLM推荐系统在需求特定排序和泛化设置中的挑战,提升NDCG@5和Recall@5性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06444 2026-03-09 cs.SD cs.AI 83%

Prosodic Boundary-Aware Streaming Generation for LLM-Based TTS with Streaming Text Input

面向流式文本输入的语调边界感知流式生成用于基于大语言模型的语音合成

Changsong Liu, Tianrui Wang, Ye Ni, Yizhou Peng, Eng Siong Chng

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Tianjin University, China(天津大学) Southeast University, China(东南大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出一种面向语调边界的后训练策略,通过调整预训练模型以处理流式文本输入,从而提升语音合成的语调质量和长文本生成的稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05275 2026-03-06 cs.MM cs.CL cs.SD 83%

SarcasmMiner: A Dual-Track Post-Training Framework for Robust Audio-Visual Sarcasm Reasoning

SarcasmMiner:一种双轨后训练框架,用于鲁棒的音频视觉讽刺推理

Zhu Li, Yongjian Chen, Huiyuan Lai, Xiyuan Gao, Shekhar Nayak, Matt Coler

机构 * Speech Technology Lab, University of Groningen, The Netherlands(格罗宁根大学语音技术实验室,荷兰) Center for Language and Cognition, University of Groningen, The Netherlands(格罗宁根大学语言与认知中心,荷兰)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL

AI总结 SarcasmMiner通过双轨蒸馏和组相对策略优化提升多模态讽刺检测性能,实现F1值显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21461 2026-02-26 cs.CL 83%

VecGlypher: Unified Vector Glyph Generation with Language Models

VecGlypher: 一种基于语言模型的统一向量图形单元生成方法

Xiaoke Huang, Bhavul Gauri, Kam Woh Ng, Tony Ng, Mengmeng Xu, Zhiheng Liu, Weiming Ren, Zhaochong An, Zijian Zhou, Haonan Qiu, Yuyin Zhou, Sen He, Ziheng Wang, Tao Xiang, Xiao Han

机构 * Meta AI

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(abstract);分类 cs.CL

AI总结 VecGlypher通过多模态语言模型直接生成高质量向量图形,无需位图中间步骤,显著提升字体创建效率和可编辑性。

Comments Accepted to CVPR'26. Project page: https://xk-huang.github.io/VecGlypher/

详情

展开后加载摘要…

URL PDF HTML 收藏