arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2409.13585 2024-09-23 cs.LG cs.AI 62%

Neurosymbolic Conformal Classification

Arthur Ledaguenel, Céline Hudelot, Mostepha Khouadjia

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 10 pages, 0 figures. arXiv admin note: text overlap with arXiv:2404.08404

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.09056 2024-09-11 cs.AI cs.LG 62%

Is Epistemic Uncertainty Faithfully Represented by Evidential Deep Learning Methods?

Mira Jürgens, Nis Meinert, Viktor Bengs, Eyke Hüllermeier, Willem Waegeman

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Journal ref Proceedings of the 41st International Conference on Machine Learning (ICML), 2024, pp. 22624--22642

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06736 2024-08-14 cs.CY cs.AI 62%

Speculations on Uncertainty and Humane Algorithms

Nicholas Gray

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02706 2024-08-07 cs.LG cs.AI 62%

Bayesian Kolmogorov Arnold Networks (Bayesian_KANs): A Probabilistic Approach to Enhance Accuracy and Interpretability

Masoud Muhammed Hassan

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01301 2024-08-05 stat.ML cs.AI cs.LG 62%

A Decision-driven Methodology for Designing Uncertainty-aware AI Self-Assessment

Gregory Canal, Vladimir Leung, Philip Sage, Eric Heim, I-Jeng Wang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01168 2024-08-05 cs.CL cs.AI 62%

Misinforming LLMs: vulnerabilities, challenges and opportunities

Bo Zhou, Daniel Geißler, Paul Lukowicz

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.00550 2024-08-02 cs.CV cs.AI cs.CL 62%

Mitigating Multilingual Hallucination in Large Vision-Language Models

Xiaoye Qu, Mingyang Song, Wei Wei, Jianfeng Dong, Yu Cheng

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.18370 2024-07-29 cs.LG cs.CL 62%

Trust or Escalate: LLM Judges with Provable Guarantees for Human Agreement

Jaehun Jung, Faeze Brahman, Yejin Choi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12330 2024-07-18 cs.LG cs.AI 62%

Uncertainty Calibration with Energy Based Instance-wise Scaling in the Wild Dataset

Mijoo Kim, Junseok Kwon

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments Accepted to ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02662 2024-07-04 cs.SI cs.CL cs.CY 62%

Supporters and Skeptics: LLM-based Analysis of Engagement with Mental Health (Mis)Information Content on Video-sharing Platforms

Viet Cuong Nguyen, Mini Jain, Abhijat Chauhan, Heather Jaime Soled, Santiago Alvarez Lesmes, Zihang Li, Michael L. Birnbaum, Sunny X. Tang, Srijan Kumar, Munmun De Choudhury

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.CY

Comments 12 pages, in submission to ICWSM

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.21028 2024-07-04 cs.CL cs.AI 62%

LACIE: Listener-Aware Finetuning for Confidence Calibration in Large Language Models

Elias Stengel-Eskin, Peter Hase, Mohit Bansal

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments 18 pages. Code: https://github.com/esteng/pragmatic_calibration

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.01122 2024-07-02 cs.CL cs.LG 62%

Calibrated Large Language Models for Binary Question Answering

Patrizio Giovannotti, Alexander Gammerman

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.LG

Comments Accepted to COPA 2024 (13th Symposium on Conformal and Probabilistic Prediction with Applications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11353 2024-06-18 cs.LG cs.CL 62%

$\texttt{MoE-RBench}$: Towards Building Reliable Language Models with Sparse Mixture-of-Experts

Guanjie Chen, Xinyu Zhao, Tianlong Chen, Yu Cheng

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 8 figures, camera ready on ICML2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.12350 2024-06-14 cs.AI cs.CY econ.GN q-fin.EC 62%

Artificial Intelligence and Dual Contract

Qian Qi

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18715 2024-06-06 cs.CV cs.AI cs.CL cs.MM 62%

Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding

Xintong Wang, Jingheng Pan, Liang Ding, Chris Biemann

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13006 2024-06-05 cs.LG cs.CL 62%

Investigating the Impact of Model Instability on Explanations and Uncertainty

Sara Vera Marjanović, Isabelle Augenstein, Christina Lioma

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04974 2024-06-04 cs.LG cs.AI 62%

Conservative Prediction via Data-Driven Confidence Minimization

Caroline Choi, Fahim Tajwar, Yoonho Lee, Huaxiu Yao, Ananya Kumar, Chelsea Finn

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments Transactions on Machine Learning Research (TMLR), 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.04518 2024-06-04 cs.CL cs.AI 62%

The Critique of Critique

Shichao Sun, Junlong Li, Weizhe Yuan, Ruifeng Yuan, Wenjie Li, Pengfei Liu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments Accepted to Findings of ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.15185 2024-05-27 cs.CL cs.AI cs.HC 62%

An Evaluation of Estimative Uncertainty in Large Language Models

Zhisheng Tang, Ke Shen, Mayank Kejriwal

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.06694 2024-05-14 cs.CL cs.AI 62%

SUTRA: Scalable Multilingual Language Model Architecture

Abhijit Bendale, Michael Sapienza, Steven Ripplinger, Simon Gibbs, Jaewon Lee, Pranav Mistry

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05286 2024-05-12 cs.LG cs.AI cs.DC 62%

Tiny Deep Ensemble: Uncertainty Estimation in Edge AI Accelerators via Ensembling Normalization Layers with Shared Weights

Soyed Tuhin Ahmed, Michael Hefenbrock, Mehdi B. Tahoori

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.16893 2024-04-29 cs.LG cs.AI cs.RO 62%

Automatic AI controller that can drive with confidence: steering vehicle with uncertainty knowledge

Neha Kumari, Sumit Kumar. Sneha Priya, Ayush Kumar, Akash Fogla

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: substantial text overlap with arXiv:2303.08187

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11207 2024-04-18 cs.CV cs.AI cs.LG 62%

Exploring the Transferability of Visual Prompting for Multimodal Large Language Models

Yichi Zhang, Yinpeng Dong, Siyuan Zhang, Tianzan Min, Hang Su, Jun Zhu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

Comments Accepted in CVPR 2024 as Poster (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02269 2024-04-04 cs.CL cs.AI 62%

Extracting Norms from Contracts Via ChatGPT: Opportunities and Challenges

Amanul Haque, Munindar P. Singh

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

Comments Accepted at COINE-AAMAS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10189 2024-04-01 cs.CL cs.LG 62%

Uncertainty Quantification for In-Context Learning of Large Language Models

Chen Ling, Xujiang Zhao, Xuchao Zhang, Wei Cheng, Yanchi Liu, Yiyou Sun, Mika Oishi, Takao Osaki, Katsushi Matsuda, Jie Ji, Guangji Bai, Liang Zhao, Haifeng Chen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

Comments Accepted to the main conference of NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.04933 2024-03-28 cs.LG cs.AI 62%

Uncertainty Quantification in Machine Learning for Engineering Design and Health Prognostics: A Tutorial

Venkat Nemani, Luca Biggio, Xun Huan, Zhen Hu, Olga Fink, Anh Tran, Yan Wang, Xiaoge Zhang, Chao Hu

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

Journal ref Mechanical Systems and Signal Processing 205 (2023) 110796

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14952 2024-03-25 cs.CL cs.AI 62%

Evidence-Driven Retrieval Augmented Response Generation for Online Misinformation

Zhenrui Yue, Huimin Zeng, Yimeng Lu, Lanyu Shang, Yang Zhang, Dong Wang

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL、cs.AI

Comments Accepted to NAACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.14003 2024-03-22 cs.CV cs.CL cs.LG 62%

Multi-Modal Hallucination Control by Visual Information Grounding

Alessandro Favero, Luca Zancato, Matthew Trager, Siddharth Choudhary, Pramuditha Perera, Alessandro Achille, Ashwin Swaminathan, Stefano Soatto

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.CL、cs.LG

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.08774 2024-03-11 cs.CL cs.AI 62%

GPT-4 Technical Report

OpenAI, Josh Achiam, Steven Adler, Sandhini Agarwal, Lama Ahmad, Ilge Akkaya, Florencia Leoni Aleman, Diogo Almeida, Janko Altenschmidt, Sam Altman, Shyamal Anadkat, Red Avila, Igor Babuschkin, Suchir Balaji, Valerie Balcom, Paul Baltescu, Haiming Bao, Mohammad Bavarian, Jeff Belgum, Irwan Bello, Jake Berdine, Gabriel Bernadett-Shapiro, Christopher Berner, Lenny Bogdonoff, Oleg Boiko, Madelaine Boyd, Anna-Luisa Brakman, Greg Brockman, Tim Brooks, Miles Brundage, Kevin Button, Trevor Cai, Rosie Campbell, Andrew Cann, Brittany Carey, Chelsea Carlson, Rory Carmichael, Brooke Chan, Che Chang, Fotis Chantzis, Derek Chen, Sully Chen, Ruby Chen, Jason Chen, Mark Chen, Ben Chess, Chester Cho, Casey Chu, Hyung Won Chung, Dave Cummings, Jeremiah Currier, Yunxing Dai, Cory Decareaux, Thomas Degry, Noah Deutsch, Damien Deville, Arka Dhar, David Dohan, Steve Dowling, Sheila Dunning, Adrien Ecoffet, Atty Eleti, Tyna Eloundou, David Farhi, Liam Fedus, Niko Felix, Simón Posada Fishman, Juston Forte, Isabella Fulford, Leo Gao, Elie Georges, Christian Gibson, Vik Goel, Tarun Gogineni, Gabriel Goh, Rapha Gontijo-Lopes, Jonathan Gordon, Morgan Grafstein, Scott Gray, Ryan Greene, Joshua Gross, Shixiang Shane Gu, Yufei Guo, Chris Hallacy, Jesse Han, Jeff Harris, Yuchen He, Mike Heaton, Johannes Heidecke, Chris Hesse, Alan Hickey, Wade Hickey, Peter Hoeschele, Brandon Houghton, Kenny Hsu, Shengli Hu, Xin Hu, Joost Huizinga, Shantanu Jain, Shawn Jain, Joanne Jang, Angela Jiang, Roger Jiang, Haozhun Jin, Denny Jin, Shino Jomoto, Billie Jonn, Heewoo Jun, Tomer Kaftan, Łukasz Kaiser, Ali Kamali, Ingmar Kanitscheider, Nitish Shirish Keskar, Tabarak Khan, Logan Kilpatrick, Jong Wook Kim, Christina Kim, Yongjik Kim, Jan Hendrik Kirchner, Jamie Kiros, Matt Knight, Daniel Kokotajlo, Łukasz Kondraciuk, Andrew Kondrich, Aris Konstantinidis, Kyle Kosic, Gretchen Krueger, Vishal Kuo, Michael Lampe, Ikai Lan, Teddy Lee, Jan Leike, Jade Leung, Daniel Levy, Chak Ming Li, Rachel Lim, Molly Lin, Stephanie Lin, Mateusz Litwin, Theresa Lopez, Ryan Lowe, Patricia Lue, Anna Makanju, Kim Malfacini, Sam Manning, Todor Markov, Yaniv Markovski, Bianca Martin, Katie Mayer, Andrew Mayne, Bob McGrew, Scott Mayer McKinney, Christine McLeavey, Paul McMillan, Jake McNeil, David Medina, Aalok Mehta, Jacob Menick, Luke Metz, Andrey Mishchenko, Pamela Mishkin, Vinnie Monaco, Evan Morikawa, Daniel Mossing, Tong Mu, Mira Murati, Oleg Murk, David Mély, Ashvin Nair, Reiichiro Nakano, Rajeev Nayak, Arvind Neelakantan, Richard Ngo, Hyeonwoo Noh, Long Ouyang, Cullen O'Keefe, Jakub Pachocki, Alex Paino, Joe Palermo, Ashley Pantuliano, Giambattista Parascandolo, Joel Parish, Emy Parparita, Alex Passos, Mikhail Pavlov, Andrew Peng, Adam Perelman, Filipe de Avila Belbute Peres, Michael Petrov, Henrique Ponde de Oliveira Pinto, Michael, Pokorny, Michelle Pokrass, Vitchyr H. Pong, Tolly Powell, Alethea Power, Boris Power, Elizabeth Proehl, Raul Puri, Alec Radford, Jack Rae, Aditya Ramesh, Cameron Raymond, Francis Real, Kendra Rimbach, Carl Ross, Bob Rotsted, Henri Roussez, Nick Ryder, Mario Saltarelli, Ted Sanders, Shibani Santurkar, Girish Sastry, Heather Schmidt, David Schnurr, John Schulman, Daniel Selsam, Kyla Sheppard, Toki Sherbakov, Jessica Shieh, Sarah Shoker, Pranav Shyam, Szymon Sidor, Eric Sigler, Maddie Simens, Jordan Sitkin, Katarina Slama, Ian Sohl, Benjamin Sokolowsky, Yang Song, Natalie Staudacher, Felipe Petroski Such, Natalie Summers, Ilya Sutskever, Jie Tang, Nikolas Tezak, Madeleine B. Thompson, Phil Tillet, Amin Tootoonchian, Elizabeth Tseng, Preston Tuggle, Nick Turley, Jerry Tworek, Juan Felipe Cerón Uribe, Andrea Vallone, Arun Vijayvergiya, Chelsea Voss, Carroll Wainwright, Justin Jay Wang, Alvin Wang, Ben Wang, Jonathan Ward, Jason Wei, CJ Weinmann, Akila Welihinda, Peter Welinder, Jiayi Weng, Lilian Weng, Matt Wiethoff, Dave Willner, Clemens Winter, Samuel Wolrich, Hannah Wong, Lauren Workman, Sherwin Wu, Jeff Wu, Michael Wu, Kai Xiao, Tao Xu, Sarah Yoo, Kevin Yu, Qiming Yuan, Wojciech Zaremba, Rowan Zellers, Chong Zhang, Marvin Zhang, Shengjia Zhao, Tianhao Zheng, Juntang Zhuang, William Zhuk, Barret Zoph

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

Comments 100 pages; updated authors list; fixed author names and added citation

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15525 2024-02-27 cs.CL cs.CY 62%

Detecting misinformation through Framing Theory: the Frame Element-based Model

Guan Wang, Rebecca Frederick, Jinglong Duan, William Wong, Verica Rupar, Weihua Li, Quan Bai

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.CY

Comments 17 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏