arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 152 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 9 篇

2607.29129 2026-08-03 cs.LG 新提交 84%

PluRel-to-RDB-PFN: Schema-Guided Synthetic Relational Pretraining

PluRel-to-RDB-PFN:模式引导的合成关系预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract,comments);分类 cs.LG

AI总结 该研究将合成关系数据库生成器PluRel作为RDB-PFN的外部预训练数据源,通过三种课程策略对比,发现模式优先引导策略仅用少量数据即可恢复RDB-PFN近94%的性能,证实早期接触真实模式的有效性。

Comments Proceedings of the 2nd ICML on Foundation Models for Structured Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29484 2026-08-03 cs.CL cs.LG 新提交 81%

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

证据类型竞争:干预数据何时能教会语言模型因果方向?

Xining Xun

机构 * Tsingjiao Information Science (Beijing) Co., Ltd(北京清教信息科技有限公司)

专题命中 预训练与数据 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现干预数据训练语言模型因果推理的金标准假设存在局限,观测上下文会抑制模型的因果方向判断能力,提出证据平均方案可降低符号错误率。

Comments 13 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28994 2026-08-03 cs.NI cs.AI cs.CV cs.LG 新提交 81%

Point2Radio: A Foundation Model for Cross-Scene Radio Fields from Material-Aware Point Clouds

Point2Radio:面向材料感知点云的跨场景无线电场基础模型

Chaozheng Wen, Chenghong Bian, Hongze Chen, Jun Zhang

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Point2Radio是从多环境学习可迁移传播先验的基础模型,基于材料感知点云实现跨场景无线电场预测,在路径增益预测上较UNet基线误差降76.7%,轻量微调可提升环境适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29120 2026-08-03 cs.LG cs.DB 新提交 79%

Curriculum Matters: Data-Efficient Relational PFN Pretraining with Synthetic Data

课程很重要:基于合成数据的数据高效关系型PFN预训练

Mohammad Sadeq Abolhasani, Viswanath Ganapathy

机构 * SAP Labs, LLC.(思爱普实验室有限责任公司)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究针对关系型PFN预训练,发现采用PluRel作为合成数据源,渐进式课程设计可大幅减少所需合成数据量,且其性能接近专用关系型管线,凸显课程设计与合成数据多样性的关键作用。

Comments Accepted to the International Conference on Very Large Databases (VLDB 2026), Tabular Data Analysis (TaDA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29283 2026-08-03 cs.AR cs.LG 新提交 77%

RTLCurator: Label-Efficient Data Curation for RTL Generation

RTLCurator:用于RTL生成的标签高效数据整理

Siyang Cai, Cangyuan Li, Wenjing Chang, Kun Wang, Haoyu Gao, Yinhe Han, Ying Wang

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 RTLCurator通过对比规范与模拟失败的实现学习兼容性先验,用少量验证配对校准后,平衡对齐度、覆盖度与结构丰富度保留80%语料,在CodeV和RTLCoder上提升RTL生成模型性能,仅需验证10%语料池。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29188 2026-08-03 cs.CL 新提交 77%

Detecting Experiential Intertextuality Across Migration Routes: Beyond Surface Similarity in French Narratives

检测移民路线间的经验互文性:法语叙事中超越表面相似性

Sakayo Toadoum Sari, Nelly Robin, Michelle Auzanneau, Lakhdar Sais, Veronique Petit, Marie Veniard, Said Jabbour, Fabien Delorme

机构 * CRIL, CNRS – Université d’Artois(CRIL,法国国家科学研究中心——阿图瓦大学) CEPED, Université Paris Cité(CEPED,巴黎西岱大学) EDA, Université Paris Cité(EDA,巴黎西岱大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 本文提出无需标注训练数据的经验互文性检测任务,采用多种方法分析法语移民叙事,发现Qwen2.5-7B零-shot及监督混合方法表现最优,且叙事位置显著影响互文性。

Comments 11 pages, 3 figures, 5 tables. Accepted at SIGDIAL 2026 (27th Annual Meeting of the Special Interest Group on Discourse and Dialogue)

Journal ref Proceedings of the 27th Annual Meeting of the Special Interest Group on Discourse and Dialogue (SIGDIAL 2026), Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29065 2026-08-03 cs.CL 新提交 70%

Tokenizer-Agnostic Engram Module

与分词器无关的恩格拉姆模块(Tokenizer-Agnostic Engram Module)

Jia Peng Lim, Hai Leong Chieu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对Deepseek Engram模块与分词器耦合的问题,通过替换哈希方式构建联合嵌入空间,实现了分词器无关性,同时保持了相当的性能。

Comments Preprint, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29019 2026-08-03 cs.CR cs.CL cs.IR 新提交 70%

GoldenRetriever: Non-Interactive Homomorphic Encrypted Retrieval for Privacy-Preserving RAG

GoldenRetriever:用于隐私保护RAG的非交互式同态加密检索

Yang Gao, Gang Quan, Scott Piersall, Qian Lou, Dongdong Wang, Liqiang Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对现有隐私保护RAG检索方案延迟高、易泄露的问题,提出基于阈值选择的非交互式同态加密检索框架,通过CKKS同态计算与掩码极化方法实现高效安全的检索,性能优于排名式加密方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28796 2026-08-03 cs.CV 新提交 50%

Can Synthetic Data Overcome the Generalization Limits of AI-Based Flower and Pod Detection Across Cowpea Breeding Genotypes and Environments?

合成数据能否克服基于AI的豇豆花与荚果检测在不同育种基因型及环境下的泛化极限?

Hamid Kamangir, Jonathan Berlingeri, Earl Ranario, Isaac Kazuo Uyehara, Lars Lundqvist, Heesup Yun, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本研究针对AI豇豆花荚检测在不同基因型环境下泛化差的问题,发现优化的HDR合成数据仅需少量真实图像即可达到真实数据基线性能,证实合成数据可克服该检测的泛化极限。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 19 篇

2607.29378 2026-08-03 cs.CL cs.LG 新提交 90%

PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction

PTP:基于前序令牌预测的大语言模型反演方法,用于近精确提示重构

Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi

机构 * IIT Bombay(印度理工学院孟买分校) Adobe Research(奥多比研究中心)

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出PTP方法,在黑盒场景下从零训练逆语言模型,通过前序令牌预测实现近精确提示重构,泛化性与迁移性良好,性能优于现有LLM反演工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28997 2026-08-03 cs.IR 新提交 89%

Think2Go: Generative Next POI Recommendation with LLM Reasoning

Think2Go:基于大语言模型推理的生成式下一个兴趣点(POI)推荐

Zhuang Zhuang, Shanshan Feng, Hangwei Qian, Mingqi Yang, Heng Qi, Yanming Shen, Baocai Yin

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(title);large language model(abstract);language model(abstract)

AI总结 Think2Go框架统一SFT与RL推理,通过优势加权机制校准策略优化,解决现有POI推荐模型的意图捕捉不足问题,提升推荐性能与稳健性。

Comments Accepted by KDD 2026 Research Track Cycle 1 (Oral presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29238 2026-08-03 cs.CL cs.AI cs.CY cs.ET cs.HC 新提交 87%

Small Is Enough: Per-User Style Rewriting of AI-Edited Text via LoRA Adapters

小模型已足够:通过LoRA适配器对AI编辑文本进行单用户风格重写

Antorweep Chakravorty

机构 * University of Stavanger(斯塔万格大学)

专题命中 指令微调 :LLM(summary_cn,abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 InMyStyle是注重隐私的单用户系统,用多本地辅助LLM构建配对训练示例,微调0.5B-7B参数模型的LoRA适配器,可将AI编辑文本重写为用户风格,小模型即可完成重写任务,其输出感知AI性低于辅助AI生成内容

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29172 2026-08-03 cs.RO cs.AI 新提交 86%

CLIFT: Turning Gemini Robotics On-Device into Humanoid Specialists via Non-Invasive Closed-Loop Iterative Fine-Tuning

CLIFT:通过非侵入式闭环迭代微调将Gemini机器人端侧模型转化为人形机器人专家

Yuxin Chen, Hari Srikanth, Nathan Jew, Menglin Wu, Pengcheng Wang, Junli Ren, Masayoshi Tomizuka, Peng Xu, Jinyu Xie, Thomas Tian

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) NVIDIA Research(英伟达研究院)

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究针对闭源机器人模型的托管式SFT API范式,提出CLIFT方法,在不访问模型内部机制的情况下,将Gemini机器人端侧模型经两次飞轮循环提升至接近完美的敏捷接触任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 85%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28661 2026-08-03 cs.CL 新提交 84%

Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements

大型语言模型(LLMs)的财务推理是否可信?针对长期财务报表的现实测试

Xinke Tong, Xuanming Zhang, Tianyi Tang, An Yang, Jiatu Hu, Guojie Lin, Zhenzhen Shi, Lingfeng Zeng, Boyu Yang, Bing Zhao, Hu Wei, Lin Qu, Dayiheng Liu

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对LLMs的财务推理可信度,构建含对抗陷阱的FinIndices基准测试,发现其存在知识与结构瓶颈,监督微调可部分恢复结构化逻辑。

Comments The FinIndices dataset is publicly available at https://huggingface.co/datasets/User158072/Finindice

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28647 2026-08-03 cs.HC cs.AI 新提交 81%

ConnectED: A Curriculum-Aligned AI System for Vietnamese Instructional Lesson Planning and Student Learning

ConnectED:面向越南教学课程规划与学生学习的课程对齐AI系统

Thang Doan Viet, Anh Nguyen Hoang, Tinh Luong Son, Anh Hoang Thi Ngoc, Huyen Giang Thi Thu, Tai Le Quy

专题命中 指令微调 :preference optimization(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出以人为本的AI系统ConnectED,基于VietEduQwen构建,支持越南教育完整教学生命周期,经评估其准确率优于基准模型,可缩短教师备课时间且获师生高满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29071 2026-08-03 cs.LG cs.AI 新提交 81%

Federated Foundation Models Fine-Tuning with Heterogeneous Compressed Clients

采用异构压缩客户端的联邦基础模型微调

Shengkun Zhu, Jinshan Zeng, Zhihua Allen-Zhao, Mayi Xu, Quanqing Xu, Wei Ren, Qiang Yang, Yang Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) OceanBase, Ant Group(蚂蚁集团OceanBase) School of Management, Xi’an Jiaotong University(西安交通大学管理学院) School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学院) School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, China University of Geosciences(中国地质大学计算机学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 针对基础模型联邦学习的资源不对称问题,提出FedSLM框架,通过SVD分解等技术实现异构压缩客户端的联邦微调,实验显示其在多基准上优于现有基线且客户端内存需求更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29601 2026-08-03 cs.LG 新提交 70%

The Parts Are Greater Than the Sum: Automated Task Sequencing for Efficient Training of Multi-Policy LLMs

部分之和大于整体:用于高效训练多策略大语言模型的自动任务排序

Jiajia Tang, Sizhe Yuen, Francisco Gomez Medina, Yali Du, Adam Sobey

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对多策略大语言模型训练中共享优化空间的干扰问题,提出自动多策略PEFT框架,通过任务分组排序组织独立QLoRA路径,在TRACE基准取得44.78的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29250 2026-08-03 cs.CL 新提交 70%

Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

Data Turnstile:面向函数调用数据生成的可扩展开源框架

Goutham Ramakrishnan, Megha Sharma

机构 * Amazon AGI(亚马逊AGI)

专题命中 指令微调 :language model(abstract);small language model(abstract);分类 cs.CL

AI总结 该研究提出开源框架Data Turnstile,可基于用户定义API规范生成高质量函数调用合成训练数据,经其微调的小型语言模型在BFCL、τ²-bench等基准上性能大幅提升,缩小了与更大规模模型的差距。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29412 2026-08-03 cs.CV 新提交 67%

Role-Break in Attention Heads: Understanding and Detecting Hallucinations in VLMs

注意力头中的角色断裂:理解和检测视觉语言模型中的幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Nan Duan, Tong Jia, Chaoran Luo, Ying Li

专题命中 指令微调 :language model(abstract,abstract_cn)

AI总结 该研究提出注意力头的角色断裂现象,构建无需微调的轻量级线性检测器,在6个VLMs和4个基准上平均AUROC达93.23,可检测VLM幻觉并支持干预操作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29367 2026-08-03 cs.CV 新提交 67%

SatEdit: Mask-Conditioned Image Editing via VLM-Guided Segment Annotation

SatEdit:基于VLM引导的区域标注的掩码条件卫星图像编辑

Muhammad Talha, Muhammad Ahmed Amer

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 SatEdit是基于VLM引导区域标注的卫星图像编辑框架,通过未标注图像构建监督信号,经LoRA微调后在对比中实现最高掩码区域语义对齐,为卫星图像编辑提供了数据高效的可行方案。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28658 2026-08-03 cs.CL cs.AI cs.LG 新提交 67%

Evaluating Federated Pre-Training: On the Reliability of Downstream Fine-Tuning and Intrinsic Evaluation

联邦预训练评估:下游微调与内在评估的可靠性研究

Claudia Grosser, Maike Heuer, Denis Krompass, Thomas A. Runkler

机构 * Technical University Munich(慕尼黑工业大学) Siemens AG(西门子公司)

专题命中 指令微调 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究对比联邦预训练的下游微调(含全量、仅头部等变体)与GLUE文本下一个词预测的评估效果,发现后者与预训练测试困惑度相关性更强,提示仅下游微调易产生误导,需关注更接近预训练目标的评估信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29100 2026-08-03 cs.LG cs.CR cs.CV 新提交 57%

StraightDP: Geometry-Aware Differential Privacy for Rectified-Flow Transformers

StraightDP:面向整流流Transformer的几何感知差分隐私

Xujun Che, Depeng Xu, Xintao Wu

专题命中 指令微调 :pretraining(abstract);分类 cs.LG

AI总结 StraightDP利用整流流的几何异质性,通过释放类条件矩结合DP-SGD,在强差分隐私约束下提升文本条件生成模型的下游准确率与生成质量,且可迁移到SD3-medium。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28967 2026-08-03 cs.CV cs.LG 新提交 57%

Visual Distribution Anchoring for Efficient Prompt Tuning

用于高效提示调优的视觉分布锚定

Pouya Parsa, Raoof Zare Moayedi, Seongjin Choi

机构 * University of Minnesota(明尼苏达大学)

专题命中 指令微调 :language model(abstract);分类 cs.LG

AI总结 本文提出无需训练的VDA框架,用未标记目标池的类级视觉原型增强冻结语义分类器,在10次ImageNet到目标域迁移中显著提升多个视觉-语言模型性能,且与各类分类器互补。

Comments 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28669 2026-08-03 cs.LG 新提交 57%

LARA: Lightweight Adapters in the Residual Stream for Composable Adaptation and Alignment

LARA:用于可组合适配与对齐的残差流中的轻量适配器

Pascal Ekin, Hyosun Choi, Wei Jie

机构 * Royal Holloway, University of London(伦敦大学皇家霍洛威学院) University of West London(西伦敦大学)

专题命中 指令微调 :preference optimization(abstract);分类 cs.LG

AI总结 本研究提出LARA,一种在冻结模型残差流中运行的轻量适配方法,在参数数量相同时性能与LoRA相当,支持多种行为平滑插值与按token路由,可在单个模型上高效托管多种行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28637 2026-08-03 cs.CL 新提交 57%

ZeroR@CHiPSAL 2026: Two-Stage Vision-Language Adaptation with Contrastive Learning for Nepali Meme Classification

ZeroR@CHiPSAL 2026:用于尼泊尔表情包分类的对比学习两阶段视觉-语言适配

Nitiz Khanal

机构 * Pulchowk Campus, Institute of Engineering, Tribhuvan University(特里布万大学工程学院普尔乔克校区)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 该研究针对尼泊尔表情包多模态仇恨言论与情感检测任务,适配RA-HMD框架,采用两阶段视觉-语言对比学习方法,取得两项任务的优异排名,为低资源南亚语言适配大模型提供了见解。

Comments 9 pages, 2 figures, system description paper for the CHiPSAL 2026 shared task at LREC 2026

Journal ref Proceedings of the Second Workshop on Challenges in Processing South Asian Languages (CHiPSAL 2026) @ LREC 2026, pages 275-283, Palma, Mallorca, Spain, 16 May 2026. ELRA Language Resources Association (ELRA). ISBN 978-2-493814-66-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29033 2026-08-03 cs.CV 新提交 50%

SAM+D: Parameter-Efficient Dimensional Lifting of SAM-Family Models via Depth-Routed LoRA and Depth Shifting

SAM+D:通过深度路由LoRA与深度移位实现SAM系列模型的参数高效维度提升

Yu Song, Hao Sun, Shiyu Teng, Ikuko Nishikawa, Yen-wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院)

专题命中 指令微调 :foundation model(abstract)

AI总结 该研究提出SAM+D框架,通过DRLoRA与DSM两个轻量模块,以仅微调约2.8%(SAM)或3.7%(SAM2)参数的方式,实现2D SAM至3D、SAM2至4D的高效分割,在多个基准上取得具竞争力结果。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28987 2026-08-03 cs.SE 新提交 50%

A Formalism-Aware Reward Loop for Handwritten UML-to-PlantUML Generation

面向手写UML到PlantUML生成的形式化感知奖励循环

Mersedeh Sadeghi, Simon Scholz, Adrian Psoch-Bajraktari

专题命中 指令微调 :language model(abstract)

AI总结 本研究提出形式化感知奖励循环,通过微调视觉-语言模型结合Group Relative Policy Optimisation生成PlantUML,提升了转换质量,为建模评估提供了新方向。

Comments Accepted for publication in the Proceedings of the ACM/IEEE 29th International Conference on Model Driven Engineering Languages and Systems (MODELS 2026). This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 7 篇

2607.28862 2026-08-03 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TextCloak: Thwarting Unauthorized LLM Exploitation via RL-Driven Unlearnable Text

TextCloak:基于强化学习的不可学习文本防御未经授权的大语言模型利用

Chengshuai Zhao, Pingchuan Ma, Dawei Li, Bohan Jiang, Zhiyuan Yu, Zhen Tan, Huan Liu

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出TextCloak框架,采用强化学习与GRPO-UE技术生成不可学习文本,可削弱大语言模型的未经授权微调,兼具实用性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29185 2026-08-03 cs.CL 新提交 81%

Learning Latent Reasoning Traces for Scalar Reward Models End-to-End

学习标量奖励模型的端到端潜在推理轨迹

Sanwoo Lee, Clive Bai, Hsiu-Yuan Huang, Kun Liang, Weijie Liu, Yunfang Wu

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对奖励模型范式不匹配问题,提出LatentRM框架,将推理轨迹作为潜在变量端到端优化,在多任务上优于各类基准奖励模型。

详情

展开后加载摘要…

URL PDF HTML 收藏