arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 3243 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3243 篇

2306.01693 2023-10-31 cs.CL 57%

Fine-Grained Human Feedback Gives Better Rewards for Language Model Training

Zeqiu Wu, Yushi Hu, Weijia Shi, Nouha Dziri, Alane Suhr, Prithviraj Ammanabrolu, Noah A. Smith, Mari Ostendorf, Hannaneh Hajishirzi

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments NeurIPS 2023 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.16681 2023-10-26 cs.CL 57%

BabyStories: Can Reinforcement Learning Teach Baby Language Models to Write Better Stories?

Xingmeng Zhao, Tongnian Wang, Sheri Osborn, Anthony Rios

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments Accepted to BabyLM workshop at CoNLL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.09968 2023-10-17 cs.CL 57%

On Improving Summarization Factual Consistency from Natural Language Feedback

Yixin Liu, Budhaditya Deb, Milagro Teruel, Aaron Halfaker, Dragomir Radev, Ahmed H. Awadallah

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments ACL 2023 Camera Ready, GitHub Repo: https://github.com/microsoft/DeFacto

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13308 2023-09-26 cs.CL 57%

Calibrating LLM-Based Evaluator

Yuxuan Liu, Tianchi Yang, Shaohan Huang, Zihan Zhang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.13094 2023-09-26 cs.GL cs.AI 57%

Computational Natural Philosophy: A Thread from Presocratics through Turing to ChatGPT

Gordana Dodig-Crnkovic

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.01659 2023-09-06 cs.SI cs.CL 57%

Evolving linguistic divergence on polarizing social media

Andres Karjus, Christine Cuskley

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16529 2023-09-01 cs.RO cs.AI cs.HC 57%

Developing Social Robots with Empathetic Non-Verbal Cues Using Large Language Models

Yoon Kyung Lee, Yoonwon Jung, Gyuyi Kang, Sowon Hahn

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Journal ref In Proceedings of 2023 IEEE International Conference on Robot & Human Interactive Communication (RO-MAN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.01852 2023-08-25 cs.CL 57%

Summary of ChatGPT-Related Research and Perspective Towards the Future of Large Language Models

Yiheng Liu, Tianle Han, Siyuan Ma, Jiayue Zhang, Yuanyuan Yang, Jiaming Tian, Hao He, Antong Li, Mengshen He, Zhengliang Liu, Zihao Wu, Lin Zhao, Dajiang Zhu, Xiang Li, Ning Qiang, Dingang Shen, Tianming Liu, Bao Ge

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

Comments 21 pages, 4 figures, accepted by Meta-Radiology

Journal ref Meta-Radiology (2023)100017

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00360 2023-08-16 cs.CL 57%

BatGPT: A Bidirectional Autoregessive Talker from Generative Pre-trained Transformer

Zuchao Li, Shitou Zhang, Hai Zhao, Yifei Yang, Dongjie Yang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02223 2023-08-07 cs.CL 57%

ESRL: Efficient Sampling-based Reinforcement Learning for Sequence Generation

Chenglong Wang, Hang Zhou, Yimin Hu, Yifu Huo, Bei Li, Tongran Liu, Tong Xiao, Jingbo Zhu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.12966 2023-07-25 cs.CL 57%

Aligning Large Language Models with Human: A Survey

Yufei Wang, Wanjun Zhong, Liangyou Li, Fei Mi, Xingshan Zeng, Wenyong Huang, Lifeng Shang, Xin Jiang, Qun Liu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.05532 2023-07-13 cs.CL 57%

Opening up ChatGPT: Tracking openness, transparency, and accountability in instruction-tuned text generators

Andreas Liesenfeld, Alianda Lopez, Mark Dingemanse

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04349 2023-06-09 cs.CL cs.DB 57%

GPT Self-Supervision for a Better Data Annotator

Xiaohuan Pei, Yanxi Li, Chang Xu

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.13324 2023-04-27 cs.AI cs.HC 57%

A Portrait of Emotion: Empowering Self-Expression through AI-Generated Art

Yoon Kyung Lee, Yong-Ha Park, Sowon Hahn

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

Comments Accepted CogSci 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05332 2023-04-12 physics.chem-ph cs.CL 57%

Emergent autonomous scientific research capabilities of large language models

Daniil A. Boiko, Robert MacKnight, Gabe Gomes

专题命中 偏好对齐 :safety(abstract);分类 cs.CL

Comments Version 1, April 11, 2023. 48 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.07459 2023-02-21 cs.CL 57%

The Capacity for Moral Self-Correction in Large Language Models

Deep Ganguli, Amanda Askell, Nicholas Schiefer, Thomas I. Liao, Kamilė Lukošiūtė, Anna Chen, Anna Goldie, Azalia Mirhoseini, Catherine Olsson, Danny Hernandez, Dawn Drain, Dustin Li, Eli Tran-Johnson, Ethan Perez, Jackson Kernion, Jamie Kerr, Jared Mueller, Joshua Landau, Kamal Ndousse, Karina Nguyen, Liane Lovitt, Michael Sellitto, Nelson Elhage, Noemi Mercado, Nova DasSarma, Oliver Rausch, Robert Lasenby, Robin Larson, Sam Ringer, Sandipan Kundu, Saurav Kadavath, Scott Johnston, Shauna Kravec, Sheer El Showk, Tamera Lanham, Timothy Telleen-Lawton, Tom Henighan, Tristan Hume, Yuntao Bai, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, Christopher Olah, Jack Clark, Samuel R. Bowman, Jared Kaplan

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.10107 2023-01-25 cs.AI cs.GT cs.HC 57%

Story Shaping: Teaching Agents Human-like Behavior with Stories

Xiangyu Peng, Christopher Cui, Wei Zhou, Renee Jia, Mark Riedl

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.08144 2023-01-20 cs.IR cs.AI cs.HC 57%

Towards the design of user-centric strategy recommendation systems for collaborative Human-AI tasks

Lakshita Dodeja, Pradyumna Tambwekar, Erin Hedlund-Botti, Matthew Gombolay

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.11602 2022-11-22 cs.LG cs.HC cs.MA 57%

Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback

Josh Abramson, Arun Ahuja, Federico Carnevale, Petko Georgiev, Alex Goldin, Alden Hung, Jessica Landon, Jirka Lhotka, Timothy Lillicrap, Alistair Muldal, George Powell, Adam Santoro, Guy Scully, Sanjana Srivastava, Tamara von Glehn, Greg Wayne, Nathaniel Wong, Chen Yan, Rui Zhu

专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10760 2022-10-20 cs.LG stat.ML 57%

Scaling Laws for Reward Model Overoptimization

Leo Gao, John Schulman, Jacob Hilton

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.14165 2022-08-31 cs.CL 57%

Towards Boosting the Open-Domain Chatbot with Human Feedback

Hua Lu, Siqi Bao, Huang He, Fan Wang, Hua Wu, Haifeng Wang

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

Comments First two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2107.08946 2022-04-28 cs.CY cs.HC 57%

Using automated decision-making (ADM) to allocate Covid-19 vaccinations? Exploring the roles of trust and social group preference on the legitimacy of ADM vs. human decision-making

Marco Lünich, Kimon Kieslich

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.07745 2020-03-18 cs.AI cs.RO 57%

Learning to Optimize Autonomy in Competence-Aware Systems

Connor Basich, Justin Svegliato, Kyle Hollins Wray, Stefan Witwicki, Joydeep Biswas, Shlomo Zilberstein

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments To be published in Proceedings of the 19th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2020). 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.07615 2019-10-18 cs.RO cs.AI cs.CV 57%

Conditional Driving from Natural Language Instructions

Junha Roh, Chris Paxton, Andrzej Pronobis, Ali Farhadi, Dieter Fox

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

Comments Accepted by the 3rd Conference on Robot Learning, Osaka, Japan (CoRL 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1910.03704 2019-10-10 cs.CL cs.IT cs.PL math.IT 57%

Do People Prefer "Natural" code?

Casey Casalnuovo, Kevin Lee, Hulin Wang, Prem Devanbu, Emily Morgan

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.05781 2018-09-18 cs.LG stat.ML 57%

Modelling Latent Travel Behaviour Characteristics with Generative Machine Learning

Melvin Wong, Bilal Farooq

专题命中 偏好对齐 :safety(abstract);分类 cs.LG

Comments Published in the proceedings of IEEE Intelligent Transportation Systems Conference 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1705.03597 2017-05-11 cs.AI 57%

Solving Multi-Objective MDP with Lexicographic Preference: An application to stochastic planning with multiple quantile objective

Yan Li, Zhaohan Sun

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07207 2024-12-23 cs.LG cs.AI cs.CL 56%

MAPLE: A Framework for Active Preference Learning Guided by Large Language Models

Saaduddin Mahmud, Mason Nakamura, Shlomo Zilberstein

专题命中 偏好对齐 :分类 cs.CL、cs.AI、cs.LG;alignment(comments)

Comments AAAI 2025 AI Alignment Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14260 2026-08-17 eess.IV cs.MM 新提交 50%

Personalized Digital Semantic Communication for Image Transmission with Vision-Language Models

基于视觉语言模型的图像传输个性化数字语义通信

Nan Li, Li Zhou, Haijun Wang, Jun Xiong, Haitao Zhao, Jibo Wei

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有语义通信方案忽略接收端依赖语义的问题,提出整合VLM与LDM的PDSC框架,构建容量受限的个性化语义率失真问题,实验证实其在带宽受限场景下的源语义一致性与个性化表现优于CDDM、MoS等基线。

Comments Accepted by IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 偏好对齐 :alignment(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏