arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-23 至 2026-03-23 共收录 187 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 16 篇

2602.02632 2026-03-23 cs.LG cs.AI 92%

Performance of Small Language Model Pretraining on FABRIC: An Empirical Study

小型语言模型在FABRIC上的预训练性能:一项实证研究

Praveen Rao

机构 * The University of Missouri(密苏里大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);small language model(title);large language model(abstract)

AI总结 本文研究小型语言模型在FABRIC实验平台上的预训练性能,探讨数据并行、操作符并行及流水线并行等技术对预训练效果的影响,发现Alpa在地理分布GPU上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15851 2026-03-23 cs.CL cs.AI 91%

Control Illusion: The Failure of Instruction Hierarchies in Large Language Models

控制幻觉:大型语言模型中指令层级的失效

Yilin Geng, Haonan Li, Honglin Mu, Xudong Han, Timothy Baldwin, Omri Abend, Eduard Hovy, Lea Frermann

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);post-training(abstract)

AI总结 研究探讨了大型语言模型中指令层级机制的有效性,发现模型在处理简单格式冲突时难以保持一致的优先级,且系统/用户提示分离方法无法建立可靠层级,社会层级框架对模型行为影响更大。

Comments Accepted to AAAI-26 Main Technical Track Proceedings

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(36): 30816-30824, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 89%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19427 2026-03-23 cs.CL cs.AI cs.LG 85%

Vocabulary shapes cross-lingual variation of word-order learnability in language models

词汇如何塑造语言模型中词序可学习性的跨语言变异

Jonas Mayer Martins, Jaap Jumelet, Viola Priesemann, Lisa Beinborn

机构 * University of Göttingen, Germany(德国哥廷根大学) University of Groningen, Netherlands(荷兰格罗宁根大学) MPI for Dynamics and Self-Organization, Germany(德国动态与自组织研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过预训练变换器语言模型探讨不同词序语言的可学习性差异,发现词汇结构是影响词序可学习性的关键因素。

Comments Submitted to ACL 2026. 17 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19473 2026-03-23 q-bio.BM cs.LG 79%

Reinforcement-guided generative protein language models enable de novo design of highly diverse AAV capsids

强化引导的生成性蛋白质语言模型实现高多样性的AAV衣壳从头设计

Lucas Ferraz, Ana F. Rodrigues, Pedro Giesteira Cotovio, Mafalda Ventura, Gabriela Silva, Ana Sofia Coroadinha, Miguel Machuqueiro, Catia Pesquita

机构 * LASIGE, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院LASIGE实验室) BioISI, Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院BioISI实验室) iBET – Instituto de Biologia Experimental e Tecnológica(生物实验与技术研究所)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本文提出基于蛋白质语言模型和强化学习的生成设计框架,用于从头设计高多样性的AAV衣壳,通过强化学习引导序列生成,提升序列空间探索能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19773 2026-03-23 cs.CV 78%

Template-based Object Detection Using a Foundation Model

基于模板的对象检测使用基础模型

Valentin Braeutigam, Matthias Stock, Bernhard Egger

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(埃朗根-纽伦堡弗里德里希-亚历山大大学) e.solutions GmbH(e.solutions公司)

专题命中 预训练与数据 :foundation model(title,abstract)

AI总结 本文提出一种无需训练数据的模板基于对象检测方法,通过分割基础模型和简单特征分类结合,实现快速检测与分类,适用于自动化界面测试场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19695 2026-03-23 cs.CV 78%

Demographic-Aware Self-Supervised Anomaly Detection Pretraining for Equitable Rare Cardiac Diagnosis

具有人口统计学意识的自监督异常检测预训练用于公平的罕见心脏诊断

Chaoqin Huang, Zi Zeng, Aofan Jiang, Yuchen Xu, Qing Cao, Kang Chen, Chenfei Chi, Yanfeng Wang, Ya Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Defense Technology(国防科技大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(瑞金医院,上海交通大学医学院) Renji Hospital, Shanghai Jiao Tong University School of Medicine(仁济医院,上海交通大学医学院)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种两阶段ECG框架,结合自监督异常检测与人口统计学意识表征学习,提升罕见心脏异常检测的灵敏度并确保公平性,实验显示在超过一百万临床ECG数据上,方法在罕见异常检测中达到94.7%的AUROC,并缩小了常见-罕见性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18090 2026-03-23 cs.SD cs.AI cs.CL 73%

MOSS-TTS Technical Report

MOSS-TTS 技术报告

Yitian Gong, Botian Jiang, Yiwei Zhao, Yucheng Yuan, Kuangwei Chen, Yaozhou Jiang, Cheng Chang, Dong Hong, Mingshu Chen, Ruixiao Li, Yiyang Zhang, Yang Gao, Hanfu Chen, Ke Chen, Songlin Wang, Xiaogui Yang, Yuqian Zhang, Kexin Huang, ZhengYuan Lin, Kang Yu, Ziqi Chen, Jin Wang, Zhaoye Fei, Qinyuan Cheng, Shimin Li, Xipeng Qiu

机构 * SII-OpenMOSS Team(SII-OpenMOSS团队)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 MOSS-TTS 基于可扩展的 recipe 提出语音生成基础模型,支持多语言和开放域场景,具备零样本语音克隆、音素级发音控制等能力。

Comments Project page: https://github.com/OpenMOSS/MOSS-TTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19280 2026-03-23 cs.CL cs.AI cs.CY 73%

From Feature-Based Models to Generative AI: Validity Evidence for Constructed Response Scoring

从基于特征的模型到生成式AI:构造响应评分的效度证据

Jodi M. Casabianca, Daniel F. McCaffrey, Matthew S. Johnson, Naim Alper, Vladimir Zubenko

机构 * BroadMetrics ETS

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了生成式AI在构造响应评分中的效度证据收集,对比了传统特征模型与生成式AI的差异,提出最佳实践以支持AI评分系统的使用和解释。

Comments 37 pages, 8 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03962 2026-03-23 cs.CL 70%

Exploring NLP Benchmarks in an Extremely Low-Resource Setting

在极低资源环境下探索NLP基准测试

Ulin Nuha, Adam Jatowt

机构 * National Kaohsiung University of Science and Technology(高雄科技大学) University of Innsbruck(因斯布鲁克大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文针对濒危罗曼语Ladin的Val Badia变体,利用少量平行语料生成合成数据集,提升低资源环境下的情感分析和多项选择问答性能,提供首个公开可用的Ladin数据集。

Comments The Association for Computational Linguistics: EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18014 2026-03-23 cs.LG 70%

Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models

为高效训练大推理模型的预测缩放定律

Datta Nimmaturi, Vaishnavi Bhargava, Rajat Ghosh, Johnu George, Debojyoti Dutta

机构 * Nutanix

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出预测框架,通过实验推导出基于模型大小、初始性能和训练进度的经验缩放定律,识别三个训练阶段并建议提前停止以减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19711 2026-03-23 cs.CL 57%

EvoTaxo: Building and Evolving Taxonomy from Social Media Streams

EvoTaxo:从社交媒体流中构建和演化分类体系

Yiyang Li, Tianyi Ma, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出EvoTaxo框架,通过结构化草案动作和双视角聚类,有效处理动态社交媒体数据,实现更平衡且结构质量更高的分类体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17470 2026-03-23 cs.CV cs.AI 57%

VirPro: Visual-referred Probabilistic Prompt Learning for Weakly-Supervised Monocular 3D Detection

VirPro: 基于视觉引用的概率提示学习用于弱监督单目3D检测

Chupeng Liu, Jiyong Rao, Shangquan Sun, Runkai Zhao, Weidong Cai

机构 * The University of Sydney(悉尼大学) Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 本文提出VirPro,通过生成场景条件化提示并结合多高斯提示建模,提升单目3D检测的弱监督性能,实验表明在KITTI基准上平均精度提升4.8%。

Comments Accepted by CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19497 2026-03-23 cs.LG 57%

ICLAD: In-Context Learning for Unified Tabular Anomaly Detection Across Supervision Regimes

ICLAD:跨监督模式的上下文学习统一表格异常检测

Jack Yi Wei, Narges Armanfard

机构 * Department of Electrical and Computer Engineering, McGill University, Canada(麦吉尔大学电气与计算机工程系,加拿大) Mila - Quebec Artificial Intelligence Institute, Montreal, Canada(魁北克人工智能研究所,蒙特利尔,加拿大)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 ICLAD通过元学习训练合成表格异常检测任务,实现跨数据集和监督模式的统一表格异常检测框架,实验显示在57个数据集上取得最佳性能。

Comments 33 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19283 2026-03-23 cs.CL 57%

Automated Motif Indexing on the Arabian Nights

阿拉伯之夜上的自动动机索引

Ibrahim H. Alyami, Mark A. Finlayson

机构 * College of Computer Science and Information Systems(计算机科学与信息系统学院) Najran University(纳杰兰大学) Knight Foundation School of Computing and Information Sciences(骑士基金会计算与信息科学学院)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL

AI总结 本文提出首个自动动机索引方法,利用《阿拉伯之夜》文本和El-Shamy的动机索引,通过五种方法检测动机表达,最佳系统在F1分数上达到0.85。

Comments 30 pages, 4 figures, 9 tables Preprint. Submitted to Digital Scholarship in the Humanities(DSH) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19256 2026-03-23 cs.CL 57%

ShobdoSetu: A Data-Centric Framework for Bengali Long-Form Speech Recognition and Speaker Diarization

ShobdoSetu: 一种以数据为中心的孟加拉语长篇语音识别与说话人聚类框架

Md. Nazmus Sakib, Shafiul Tanvir, Mesbah Uddin Ahamed, H. M. Aktaruzzaman Mukdho

机构 * Dept.\ of Computer Science \& Engineering Bangladesh University of Engineering

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文提出了一种以数据为中心的孟加拉语长篇语音识别与说话人聚类框架,通过数据工程和领域适应微调,在低资源条件下实现了竞争力的性能。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 9 篇

2603.20100 2026-03-23 cs.CL cs.AI 92%

An Empirical Study of SFT-DPO Interaction and Parameterization in Small Language Models

小语言模型中SFT-DPO交互与参数化的实证研究

Yuming Feng, Christy Yang

机构 * Department of Computer Science(计算机科学系) Stanford University(斯坦福大学)

专题命中 指令微调 :language model(title,abstract);SFT(title,abstract);small language model(title);preference optimization(abstract)

AI总结 本文通过对比SFT、DPO及分阶段训练方法,发现全参数微调在小模型中表现更优,而偏好优化和低秩适应带来的边际收益有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19255 2026-03-23 cs.CL cs.AI 88%

LARFT: Closing the Cognition-Action Gap for Length Instruction Following in Large Language Models

LARFT:为大语言模型的长度指令跟随缩小认知-行动差距

Wei Zhang, Lintong Du, Yuanhe Zhang, Zhenhong Zhou, Kun Wang, Li Sun, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 LARFT通过结合强化学习与 hindsight 长度意识,提升大语言模型对输出长度的控制能力,在多个基准测试中取得显著提升。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19649 2026-03-23 cs.SI cs.AI 85%

PolicySim: An LLM-Based Agent Social Simulation Sandbox for Proactive Policy Optimization

PolicySim:一种基于LLM的代理社会模拟沙盒,用于主动政策优化

Renhong Huang, Ning Tang, Jiarong Xu, Yuxuan Cao, Qingqian Tu, Sheng Guo, Bo Zheng, Huiyuan Liu, Yang Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) University of Nottingham(诺丁汉大学) PowerChina Huadong Engineering Corporation Limited(国家电网华东工程公司)

专题命中 指令微调 :LLM(title,abstract);SFT(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出PolicySim,通过用户代理模块和自适应干预模块,模拟用户行为与平台干预的双向动态,实现对干预政策的主动评估与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 85%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19265 2026-03-23 cs.CL cs.AI cs.HC 84%

When the Pure Reasoner Meets the Impossible Object: Analytic vs. Synthetic Fine-Tuning and the Suppression of Genesis in Language Models

当纯粹推理者遇见不可能之物:分析性与合成性微调及语言模型中生成的抑制

Amin Amouhadi

机构 * Institute for Artificial Intelligence, University of Georgia(人工智能研究所,佐治亚大学)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在'不可能之物'上微调大语言模型的本体论后果,通过分析与合成微调对比,揭示了逻辑矛盾对语言模型生成能力的抑制作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19931 2026-03-23 cs.CL 70%

SAGE: Sustainable Agent-Guided Expert-tuning for Culturally Attuned Translation in Low-Resource Southeast Asia

SAGE:面向文化适应翻译的可持续代理引导专家调优

Zhixiang Lu, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Imran Razzak, Jionglong Su, Zhengyong Jiang

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过能量感知方法优化低资源东南亚地区翻译任务,利用强化学习代理筛选高质量数据,显著降低能耗和数据使用量,提升模型性能与环保性。

Comments Accepted by WWW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07451 2026-03-23 cs.CL 70%

DLLM Agent: See Farther, Run Faster

DLLM Agent: 看得更远,跑得更快

Huiling Zhen, Weizhe Lin, Renxi Liu, Kai Han, Yiming Li, Yuchuan Tian, Hanting Chen, Xiaoguang Li, Xiaosong Li, Chen Chen, Xianzhi Yu, Mingxuan Yuan, Youliang Yan, Peifeng Qin, Jun Wang, Yu Wang, Dacheng Tao, Yunhe Wang

机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) UCL(伦敦大学学院) Tsinghua University(清华大学) NTU(国立新加坡大学) Peking University(北京大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了扩散大语言模型(DLLM)在代理多步决策中的表现,发现其在准确率相当的情况下,整体效率比自回归模型(AR)高30%以上,并提出部署扩散骨架的两个实用考虑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18282 2026-03-23 cs.CV 67%

CycleCap: Improving VLMs Captioning Performance via Self-Supervised Cycle Consistency Fine-Tuning

CycleCap: 通过自监督循环一致性微调提升VLMs的描述性能

Marios Krestenitis, Christos Tzelepis, Konstantinos Ioannidis, Stefanos Vrochidis, Ioannis Kompatsiaris, Georgios Tzimiropoulos, Shaogang Gong, Ioannis Patras

机构 * Queen Mary, University of London(伦敦大学玛丽女王学院) Centre for Research and Technology Hellas(希腊研究中心) City St George’s, University of London(伦敦大学圣乔治学院)

专题命中 指令微调 :language model(abstract);instruction tuning(abstract)

AI总结 本文提出CycleCap,通过自监督循环一致性训练提升VLMs的图像描述性能,利用GRPO优化策略,基于重建图像与原始图像相似性作为奖励信号,无需标注数据即可提高描述准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08934 2026-03-23 cs.LG cs.AI cs.CR 62%

StealthRL: Reinforcement Learning Paraphrase Attacks for Multi-Detector Evasion of AI-Text Detectors

StealthRL:面向多检测器规避的强化学习对抗攻击

Suraj Ranganath, Atharv Ramesh

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 指令微调 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 StealthRL通过强化学习框架在真实对抗条件下测试AI文本检测器的鲁棒性,通过GRPO和LoRA适配器训练句法替换策略,平衡检测规避与语义保持,成功在多个检测器上实现高逃逸率。

Comments Expanded version of a workshop submission. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 11 篇

2603.19741 2026-03-23 cs.LG cs.CL 93%

FedPDPO: Federated Personalized Direct Preference Optimization for Large Language Model Alignment

FedPDPO:联邦个性化直接偏好优化用于大语言模型对齐

Kewen Zhu, Liping Yi, Zhiming Zhao, Zhuang Qi, Han Yu, Qinghua Hu

机构 * College of Intelligence and Computing, Tianjin University, Tianjin, China(智能与计算学院,天津大学,天津,中国) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡)

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出FedPDPO,一种联邦个性化直接偏好优化框架,通过参数高效微调和个性化奖励头解决非iid数据下的大语言模型对齐问题,实验显示在联邦内域和跨域设置中平均准确率提升达4.80%。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19987 2026-03-23 cs.LG cs.AI cs.CL 91%

Breaking the Capability Ceiling of LLM Post-Training by Reintroducing Markov States

突破大语言模型微调的性能上限:重新引入马尔可夫状态

Yurun Yuan, Tengyang Xie

机构 * UW-Madison(威斯康星大学麦迪逊分校)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出通过引入马尔可夫状态突破大语言模型微调的性能上限,理论和实验均表明该方法能显著降低样本复杂度并提升复杂逻辑谜题的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20795 2026-03-23 cs.CL 88%

Test-Time Alignment for Large Language Models via Textual Model Predictive Control

通过文本模型预测控制对大型语言模型进行测试时对齐

Kuang-Da Wang, Teng-Ruei Chen, Yu Heng Hung, Guo-Xun Ko, Shuoyang Ding, Yueh-Hua Wu, Yu-Chiang Frank Wang, Chao-Han Huck Yang, Wen-Chih Peng, Ping-Chun Hsieh

机构 * National Yang Ming Chiao Tung University NVIDIA National Taiwan University

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出TMPC方法,通过文本模型预测控制解决测试时对齐问题,通过分层强化学习原理改进生成过程,提升不同任务的性能。

Comments Accepted for ICLR 2026. Project page: https://rl-bandits-lab.github.io/TMPC/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19251 2026-03-23 cs.CL 85%

Enhancing Legal LLMs through Metadata-Enriched RAG Pipelines and Direct Preference Optimization

通过元数据增强的RAG流水线和直接偏好优化增强法律LLM

Suyash Maniyar, Deepali Singh, Rohith Reddy

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出元数据增强的RAG和直接偏好优化,解决法律领域长文本检索和生成中的精度问题,提升模型的可靠性与安全性。

Comments 12 pages including Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14400 2026-03-23 cs.AI 84%

HPS: Hard Preference Sampling for Human Preference Alignment

HPS: 人类偏好对齐的硬偏好采样

Xiandong Zou, Wanyu Lin, Yuchen Li, Pan Zhou

机构 * Singapore Management University(新加坡国立管理学院) The Hong Kong Polytechnic University(香港理工大学)

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);RLHF(abstract)

AI总结 本文提出HPS框架,通过优先选择最受好评的响应并拒绝所有不受欢迎和有害的响应,提升大语言模型与人类偏好的对齐效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏