arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4535 信号源:cs.CL, cs.AI, cs.LG

1. 后训练与偏好优化 4535 篇

2412.09899 2024-12-16 cs.LG 79%

TTAQ: Towards Stable Post-training Quantization in Continuous Domain Adaptation

Junrui Xiao, Zhikai Li, Lianwei Yang, Yiduo Mei, Qingyi Gu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07268 2024-12-11 cs.LG cs.MM 79%

PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models

Zining Wnag, Jinyang Guo, Ruihao Gong, Yang Yong, Aishan Liu, Yushi Huang, Jiaheng Liu, Xianglong Liu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14503 2024-11-11 cs.LG 79%

Catastrophic Goodhart: regularizing RLHF with KL divergence does not mitigate heavy-tailed reward misspecification

Thomas Kwa, Drake Thomas, Adrià Garriga-Alonso

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

Comments Mechanistic Interpretability workshop at ICML 2024; Main conference poster at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14751 2024-11-06 cs.LG 79%

AGILE: A Novel Reinforcement Learning Framework of LLM Agents

Peiyuan Feng, Yichen He, Guanhua Huang, Yuan Lin, Hanchong Zhang, Yuchen Zhang, Hang Li

专题命中 后训练与偏好优化 :LLM(title,abstract);分类 cs.LG

Comments accepted by NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.10203 2024-10-29 cs.CL 79%

A Probability--Quality Trade-off in Aligned Language Models and its Relation to Sampling Adaptors

Naaman Tan, Josef Valvoda, Tianyu Liu, Anej Svete, Yanxia Qin, Kan Min-Yen, Ryan Cotterell

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

Comments EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18853 2024-10-29 cs.LG 79%

Decoding-Time Language Model Alignment with Multiple Objectives

Ruizhe Shi, Yifang Chen, Yushi Hu, Alisa Liu, Hannaneh Hajishirzi, Noah A. Smith, Simon S. Du

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

Comments NeurIPS accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.16576 2024-10-29 q-bio.BM cs.LG 79%

Antigen-Specific Antibody Design via Direct Energy-based Preference Optimization

Xiangxin Zhou, Dongyu Xue, Ruizhe Chen, Zaixiang Zheng, Liang Wang, Quanquan Gu

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.LG

Comments Accepted to NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01829 2024-10-18 quant-ph cs.LG 79%

A Post-Training Approach for Mitigating Overfitting in Quantum Convolutional Neural Networks

Aakash Ravindra Shinde, Charu Jain, Amir Kalev

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments 9 pages, 14 images, 6 tables

Journal ref Phys Rev A 110 042409 (2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.06256 2024-10-15 cs.LG 79%

Mitigating the Alignment Tax of RLHF

Yong Lin, Hangyu Lin, Wei Xiong, Shizhe Diao, Jianmeng Liu, Jipeng Zhang, Rui Pan, Haoxiang Wang, Wenbin Hu, Hanning Zhang, Hanze Dong, Renjie Pi, Han Zhao, Nan Jiang, Heng Ji, Yuan Yao, Tong Zhang

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14726 2024-07-30 cs.CV cs.LG 79%

MetaAug: Meta-Data Augmentation for Post-Training Quantization

Cuong Pham, Hoang Anh Dung, Cuong C. Nguyen, Trung Le, Dinh Phung, Gustavo Carneiro, Thanh-Toan Do

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments Accepted by ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11581 2024-07-30 cs.CL 79%

Style Transfer with Multi-iteration Preference Optimization

Shuai Liu, Jonathan May

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06322 2024-07-09 cs.CV cs.LG 79%

Post-training Quantization for Text-to-Image Diffusion Models with Progressive Calibration and Activation Relaxing

Siao Tang, Xin Wang, Hong Chen, Chaoyu Guan, Zewen Wu, Yansong Tang, Wenwu Zhu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments Accepted by ECCV2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06886 2024-06-04 cs.LG math.OC stat.ML 79%

Principled Penalty-based Methods for Bilevel Reinforcement Learning and RLHF

Han Shen, Zhuoran Yang, Tianyi Chen

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

Comments Shorter version accepted to ICML 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18810 2024-05-30 cs.CV cs.AI 79%

UniPTS: A Unified Framework for Proficient Post-Training Sparsity

Jingjing Xie, Yuxin Zhang, Mingbao Lin, Zhihang Lin, Liujuan Cao, Rongrong Ji

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

Comments Accepted by CVPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.13038 2024-04-22 cs.AI cs.CY 79%

Mapping Social Choice Theory to RLHF

Jessica Dai, Eve Fleisig

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.06838 2024-04-16 cs.CL 79%

MAPO: Advancing Multilingual Reasoning through Multilingual Alignment-as-Preference Optimization

Shuaijie She, Wei Zou, Shujian Huang, Wenhao Zhu, Xiang Liu, Xiang Geng, Jiajun Chen

专题命中 后训练与偏好优化 :preference optimization(title,abstract);分类 cs.CL

Comments The project is available at https://github.com/NJUNLP/MAPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01730 2024-04-03 cs.LG cs.IT math.IT stat.ML 79%

Asymptotics of Language Model Alignment

Joy Qiping Yang, Salman Salamatian, Ziteng Sun, Ananda Theertha Suresh, Ahmad Beirami

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.17031 2024-03-27 cs.LG 79%

The N+ Implementation Details of RLHF with PPO: A Case Study on TL;DR Summarization

Shengyi Huang, Michael Noukhovitch, Arian Hosseini, Kashif Rasul, Weixun Wang, Lewis Tunstall

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18950 2024-03-01 cs.CL 79%

PopALM: Popularity-Aligned Language Models for Social Media Trendy Response Prediction

Erxin Yu, Jing Li, Chunpu Xu

专题命中 后训练与偏好优化 :language model(title,abstract);分类 cs.CL

Comments Accepted by COLING 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10584 2024-02-27 cs.LG 79%

Policy Optimization in RLHF: The Impact of Out-of-preference Data

Ziniu Li, Tian Xu, Yang Yu

专题命中 后训练与偏好优化 :RLHF(title);preference optimization(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.16827 2023-10-02 cs.LG 79%

Post-Training Overfitting Mitigation in DNN Classifiers

Hang Wang, David J. Miller, George Kesidis

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04332 2023-08-09 cs.LG cs.HC 79%

RLHF-Blender: A Configurable Interactive Interface for Learning from Diverse Human Feedback

Yannick Metz, David Lindner, Raphaël Baur, Daniel Keim, Mennatallah El-Assady

专题命中 后训练与偏好优化 :RLHF(title,abstract);分类 cs.LG

Comments 14 pages, 3 figures

Journal ref ICML2023 Interactive Learning from Implicit Human Feedback Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04269 2023-08-09 cs.CV cs.AI 79%

Lossy and Lossless (L$^2$) Post-training Model Size Compression

Yumeng Shi, Shihao Bai, Xiuying Wei, Ruihao Gong, Jianlei Yang

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.06900 2023-08-08 cs.LG cs.CR 79%

MM-BD: Post-Training Detection of Backdoor Attacks with Arbitrary Backdoor Pattern Types Using a Maximum Margin Statistic

Hang Wang, Zhen Xiang, David J. Miller, George Kesidis

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00569 2023-07-04 cs.CL 79%

SSP: Self-Supervised Post-training for Conversational Search

Quan Tu, Shen Gao, Xiaolong Wu, Zhao Cao, Ji-Rong Wen, Rui Yan

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.CL

Comments Accepted by ACL 2023 Findings, Long Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.07217 2023-04-20 cs.CV cs.AI 79%

Influential Rank: A New Perspective of Post-training for Robust Model against Noisy Labels

Seulki Park, Hwanjun Song, Daeho Um, Dae Ung Jo, Sangdoo Yun, Jin Young Choi

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04906 2023-04-12 cs.LG cs.CV 79%

Survey on Leveraging Uncertainty Estimation Towards Trustworthy Deep Neural Networks: The Case of Reject Option and Post-training Processing

Mehedi Hasan, Moloud Abdar, Abbas Khosravi, Uwe Aickelin, Pietro Lio', Ibrahim Hossain, Ashikur Rahman, Saeid Nahavandi

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.02634 2023-03-21 stat.ML cs.CV cs.LG 79%

QFT: Post-training quantization via fast joint finetuning of all degrees of freedom

Alex Finkelstein, Ella Fuchs, Idan Tal, Mark Grobman, Niv Vosco, Eldad Meller

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments Presented at CADL2022 workshop at ECCV2022

Journal ref Computer Vision - {ECCV} 2022 Workshops - Tel Aviv, Israel, October 23-27, 2022, Proceedings, Part {VII}

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.09643 2023-01-10 cs.CV cs.AI 79%

CPT-V: A Contrastive Approach to Post-Training Quantization of Vision Transformers

Natalia Frumkin, Dibakar Gope, Diana Marculescu

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.01847 2022-07-06 cs.LG 79%

PoF: Post-Training of Feature Extractor for Improving Generalization

Ikuro Sato, Ryota Yamada, Masayuki Tanaka, Nakamasa Inoue, Rei Kawakami

专题命中 后训练与偏好优化 :post-training(title,abstract);分类 cs.LG

Comments Accepted to ICML2022. Contains a link to the code

详情

展开后加载摘要…

URL PDF HTML 收藏