arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2306.00074 2024-02-26 cs.LG cs.CY cs.HC stat.ML 62%

Human-Aligned Calibration for AI-Assisted Decision Making

Nina L. Corvelo Benz, Manuel Gomez Rodriguez

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15019 2024-02-26 cs.LG cs.AI stat.ML 62%

Consistency-Guided Temperature Scaling Using Style and Content Information for Out-of-Domain Calibration

Wonjeong Choi, Jungwuk Park, Dong-Jun Han, Younghyun Park, Jaekyun Moon

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments Accepted at AAAI-24 (The 38th AAAI Conference on Artificial Intelligence, February 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.02068 2024-02-06 cs.SI cs.CY cs.LG 62%

Specious Sites: Tracking the Spread and Sway of Spurious News Stories at Scale

Hans W. A. Hanley, Deepak Kumar, Zakir Durumeric

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY、cs.LG

Comments Accepted to IEEE S&P 2024. Updated Emails

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05085 2024-02-02 cs.CL cs.AI 62%

Characterizing Large Language Models as Rationalizers of Knowledge-intensive Tasks

Aditi Mishra, Sajjadur Rahman, Hannah Kim, Kushan Mitra, Estevam Hruschka

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.01841 2024-01-23 cs.AI cs.LG 62%

Act as You Learn: Adaptive Decision-Making in Non-Stationary Markov Decision Processes

Baiting Luo, Yunuo Zhang, Abhishek Dubey, Ayan Mukhopadhyay

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted for publication at the International Conference on Autonomous Agents and MultiAgent Systems (AAMAS), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.09865 2024-01-19 cs.CV cs.AI cs.LG 62%

Improving fine-grained understanding in image-text pre-training

Ioana Bica, Anastasija Ilić, Matthias Bauer, Goker Erdogan, Matko Bošnjak, Christos Kaplanis, Alexey A. Gritsenko, Matthias Minderer, Charles Blundell, Razvan Pascanu, Jovana Mitrović

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.10801 2023-12-19 cs.AI cs.LG 62%

Scope Compliance Uncertainty Estimate

Al-Harith Farhad, Ioannis Sorokos, Mohammed Naveed Akram, Koorosh Aslansefat, Daniel Schneider

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.05488 2023-12-13 cs.AI cs.CL cs.GT 62%

Can Large Language Models Serve as Rational Players in Game Theory? A Systematic Analysis

Caoyun Fan, Jindou Chen, Yaohui Jin, Hao He

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments AAAI 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04388 2023-12-12 cs.CL cs.AI 62%

Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting

Miles Turpin, Julian Michael, Ethan Perez, Samuel R. Bowman

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.01959 2023-12-05 cs.AI cs.LG 62%

Learning-Based Approaches to Predictive Monitoring with Conformal Statistical Guarantees

Francesca Cairoli, Luca Bortolussi, Nicola Paoletti

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.18062 2023-12-01 cs.LG cs.AI 62%

Understanding Your Agent: Leveraging Large Language Models for Behavior Explanation

Xijia Zhang, Yue Guo, Simon Stepputtis, Katia Sycara, Joseph Campbell

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17446 2023-11-30 cs.LG cs.AI 62%

Uncertainty in Additive Feature Attribution methods

Abhishek Madaan, Tanya Chowdhury, Neha Rana, James Allan, Tanmoy Chakraborty

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 14

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11732 2023-11-21 cs.LG cs.CL 62%

Investigating Uncertainty Calibration of Aligned Language Models under the Multiple-Choice Setting

Guande He, Peng Cui, Jianfei Chen, Wenbo Hu, Jun Zhu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.09358 2023-11-17 cs.CL cs.AI 62%

Empirical evaluation of Uncertainty Quantification in Retrieval-Augmented Language Models for Science

Sridevi Wagle, Sai Munikoti, Anurag Acharya, Sara Smith, Sameera Horawalavithana

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14613 2023-11-16 cs.CL cs.AI 62%

Selectively Answering Ambiguous Questions

Jeremy R. Cole, Michael J. Q. Zhang, Daniel Gillick, Julian Martin Eisenschlos, Bhuwan Dhingra, Jacob Eisenstein

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments To appear in EMNLP 2023. 9 pages, 5 figures, 2 pages of appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05245 2023-11-10 cs.LG cs.AI stat.ML 62%

Uncertainty Wrapper in the medical domain: Establishing transparent uncertainty quantification for opaque machine learning models in practice

Lisa Jöckel, Michael Kläs, Georg Popp, Nadja Hilger, Stephan Fricke

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04921 2023-11-10 cs.CL cs.AI 62%

Successor Features for Efficient Multisubject Controlled Text Generation

Meng Cao, Mehdi Fatemi, Jackie Chi Kit Cheung, Samira Shabanian

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02271 2023-11-10 cs.CL cs.AI 62%

FaMeSumm: Investigating and Improving Faithfulness of Medical Summarization

Nan Zhang, Yusen Zhang, Wu Guo, Prasenjit Mitra, Rui Zhang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

Comments Main Conference of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.05161 2023-10-31 cs.LG cs.AI 62%

What is Flagged in Uncertainty Quantification? Latent Density Models for Uncertainty Categorization

Hao Sun, Boris van Breugel, Jonathan Crabbe, Nabeel Seedat, Mihaela van der Schaar

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.11227 2023-10-18 cs.CL cs.AI 62%

RealBehavior: A Framework for Faithfully Characterizing Foundation Models' Human-like Behavior Mechanisms

Enyu Zhou, Rui Zheng, Zhiheng Xi, Songyang Gao, Xiaoran Fan, Zichu Fei, Jingting Ye, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.00398 2023-10-02 cs.CV cs.AI cs.LG 62%

ProbVLM: Probabilistic Adapter for Frozen Vision-Language Models

Uddeshya Upadhyay, Shyamgopal Karthik, Massimiliano Mancini, Zeynep Akata

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Comments ICCV 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12674 2023-08-25 cs.CL cs.AI 62%

Improving Translation Faithfulness of Large Language Models via Augmenting Instructions

Yijie Chen, Yijin Liu, Fandong Meng, Yufeng Chen, Jinan Xu, Jie Zhou

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Our code and datasets are released in Github: https://github.com/pppa2019/swie_overmiss_llm4mt

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.14891 2023-07-25 cs.LG cs.AI 62%

Broken Neural Scaling Laws

Ethan Caballero, Kshitij Gupta, Irina Rish, David Krueger

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Comments Published as a conference paper at International Conference on Learning Representations (ICLR) 2023

Journal ref International Conference on Learning Representations (ICLR), 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.06513 2023-07-14 cs.AI cs.LG 62%

Leveraging Contextual Counterfactuals Toward Belief Calibration

Qiuyi, Zhang, Michael S. Lee, Sherol Chen

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Comments ICML (International Conference on Machine Learning) Workshop on Counterfactuals in Minds and Machines, 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.05118 2023-07-06 cs.LG cs.AI 62%

Beyond In-Domain Scenarios: Robust Density-Aware Calibration

Christian Tomani, Futa Waseda, Yuesong Shen, Daniel Cremers

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments In Proceedings of the International Conference on Machine Learning (ICML), 2023. Code available at https://github.com/futakw/DensityAwareCalibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.01229 2023-06-02 cs.CL cs.AI 62%

Almanac: Retrieval-Augmented Language Models for Clinical Medicine

Cyril Zakka, Akash Chaurasia, Rohan Shad, Alex R. Dalal, Jennifer L. Kim, Michael Moor, Kevin Alexander, Euan Ashley, Jack Boyd, Kathleen Boyd, Karen Hirsch, Curt Langlotz, Joanna Nelson, William Hiesinger

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.06708 2023-04-14 cs.CV cs.AI cs.CL 62%

Verbs in Action: Improving verb understanding in video-language models

Liliane Momeni, Mathilde Caron, Arsha Nagrani, Andrew Zisserman, Cordelia Schmid

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05736 2023-04-13 cs.LG cs.AI stat.AP 62%

Communicating Uncertainty in Machine Learning Explanations: A Visualization Analytics Approach for Predictive Process Monitoring

Nijat Mehdiyev, Maxim Majlatow, Peter Fettke

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12872 2023-03-24 cs.HC cs.AI cs.LG 62%

Human Uncertainty in Concept-Based AI Systems

Katherine M. Collins, Matthew Barker, Mateo Espinosa Zarlenga, Naveen Raman, Umang Bhatt, Mateja Jamnik, Ilia Sucholutsky, Adrian Weller, Krishnamurthy Dvijotham

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.02628 2023-02-07 cs.LG cs.AI 62%

Trust, but Verify: Using Self-Supervised Probing to Improve Trustworthiness

Ailin Deng, Shen Li, Miao Xiong, Zhirui Chen, Bryan Hooi

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments European Conference on Computer Vision 2022

详情

展开后加载摘要…

URL PDF HTML 收藏