arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2511.03166 2025-11-06 cs.CL 57%

Measuring Aleatoric and Epistemic Uncertainty in LLMs: Empirical Evaluation on ID and OOD QA Tasks

Kevin Wang, Subre Abdoul Moktar, Jia Li, Kangshuo Li, Feng Chen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by UDM-KDD'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01458 2025-11-04 cs.CV cs.AI 57%

When to Trust the Answer: Question-Aligned Semantic Nearest Neighbor Entropy for Safer Surgical VQA

Dennis Pierantozzi, Luca Carlini, Mauro Orazio Drago, Chiara Lena, Cesare Hassan, Elena De Momi, Danail Stoyanov, Sophia Bano, Mobarak I. Hoque

机构 * IRCCS Humanitas Research Hospital(Humanitas研究医院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00419 2025-11-04 cs.CV cs.AI 57%

LGCA: Enhancing Semantic Representation via Progressive Expansion

Thanh Hieu Cao, Trung Khang Tran, Gia Thinh Pham, Tuong Nghiem Diep, Thanh Binh Nguyen

机构 * University of Science, Vietnam National University Ho Chi Minh City, Vietnam(越南胡志明市国家大学科学大学) National University of Singapore, Singapore(新加坡国立大学) AISIA Lab, Ho Chi Minh City, Vietnam(越南胡志明市AISIA实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments 15 pages, 5 figures, to appear in SoICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08809 2025-11-04 cs.LG 57%

Decoupling Contrastive Decoding: Robust Hallucination Mitigation in Multimodal Large Language Models

Wei Chen, Xin Yan, Bin Wen, Fan Yang, Tingting Gao, Di Zhang, Long Chen

机构 * HKUST(香港科技大学) University of Waterloo(滑铁卢大学) Kuaishou Technology(快手科技)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.LG

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12149 2025-11-04 cs.CL cs.MM cs.SI 57%

Seeing Sarcasm Through Different Eyes: Analyzing Multimodal Sarcasm Perception in Large Vision-Language Models

Junjie Chen, Xuyang Liu, Subin Huang, Linfeng Zhang, Hang Yu

机构 * Anhui Polytechnic University (AHPU)(安徽工程大学) Shanghai University (SHU)(上海大学) Shanghai Jiao Tong University (SJTU)(上海交通大学) Sichuan University (SCU)(四川大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26769 2025-10-31 cs.CV cs.LG 57%

SteerVLM: Robust Model Control through Lightweight Activation Steering for Vision Language Models

Anushka Sivakumar, Andrew Zhang, Zaber Hakim, Chris Thomas

机构 * Department of Computer Science(计算机科学系) Virginia Tech(弗吉尼亚理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24368 2025-10-29 cs.LG 57%

Filtering instances and rejecting predictions to obtain reliable models in healthcare

Maria Gabriela Valeriano, David Kohan Marzagão, Alfredo Montelongo, Carlos Roberto Veiga Kiffer, Natan Katz, Ana Carolina Lorena

机构 * Instituto de Computação(计算研究所) Universidade Estadual de Campinas(Campinas州立大学) Department of Informatics(信息学院) King’s College London(伦敦国王学院) Núcleo de Telessaúde(远程医疗中心) Universidade Federal do Rio Grande do Sul(鲁汶联邦大学) Escola Paulista de Medicina(巴西圣保罗医学学院) Universidade Federal de São Paulo(圣保罗联邦大学) Divisão de Ciência da Computação(计算机科学部) Instituto Tecnológico de Aeronáutica(航空技术研究所)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments This paper is under review at Machine Learning (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23464 2025-10-29 cs.AI 57%

The Confidence Paradox: Can LLM Know When It's Wrong

Sahil Tripathi, Md Tabrez Nafis, Imran Hussain, Jiechao Gao

机构 * Jamia Hamdard(贾迈亚哈姆达德大学) Center for SDGC, Stanford University(SDGC中心,斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Accepted at the 14th IJCNLP & 4th AACL 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22614 2025-10-28 cs.SE cs.AI 57%

Does In-IDE Calibration of Large Language Models work at Scale?

Roham Koohestani, Agnia Sergeyuk, David Gros, Claudio Spiess, Sergey Titov, Prem Devanbu, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学) JetBrains Research(JetBrains研究) University of California, Davis(加州大学戴维斯分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20011 2025-10-24 cs.CV cs.LG 57%

Improving Predictive Confidence in Medical Imaging via Online Label Smoothing

Kushan Choudhury, Shubhrodeep Roy, Ankur Chanda, Shubhajit Biswas, Somenath Kuiry

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

Comments Accepted and presented in International Conference on Advancing Science and Technologies in Health Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19997 2025-10-24 cs.SE cs.AI 57%

A Framework for the Adoption and Integration of Generative AI in Midsize Organizations and Enterprises (FAIGMOE)

Abraham Itzhak Weinberg

机构 * AI-WEINBERG, AI Experts(AI-WEINBERG人工智能专家)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19310 2025-10-23 cs.CL 57%

JointCQ: Improving Factual Hallucination Detection with Joint Claim and Query Generation

Fan Xu, Huixuan Zhang, Zhenliang Zhang, Jiahao Wang, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学) Trustworthy Technology and Engineering Laboratory, Huawei(可信技术与工程实验室,华为)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14345 2025-10-21 q-fin.PM cs.AI 57%

LLM-Enhanced Black-Litterman Portfolio Optimization

Youngbin Lee, Yejin Kim, Juhyeong Kim, Suin Kim, Yongjae Lee

机构 * Elice AI Quant Lab, MODULABS Seoul Republic of Korea Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Seoul Republic of Korea Mirae Asset Global Investments AI Quant Lab, MODULABS Seoul Republic of Korea Ulsan National Institute of Science Elice AI Quant Lab, MODULABS Meritz Fire \& Marine Insurance AI Quant Lab, MODULABS Mirae Asset Global Investments AI Quant Lab, MODULABS

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

Comments Presented at the CIKM 2025 Workshop on Financial AI (https://advancesinfinancialai.com/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16376 2025-10-21 math.OC cs.AI cs.RO cs.SY eess.SY math.ST stat.TH 57%

Conformal Prediction in The Loop: A Feedback-Based Uncertainty Model for Trajectory Optimization

Han Wang, Chao Ning

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16359 2025-10-21 cs.CL 57%

Utilising Large Language Models for Generating Effective Counter Arguments to Anti-Vaccine Tweets

Utsav Dhanuka, Soham Poddar, Saptarshi Ghosh

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments 14 pages, 1 figure, work done as a part of B.Tech project at IIT Kharagpur

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13750 2025-10-17 cs.CL 57%

Confidence-Based Response Abstinence: Improving LLM Trustworthiness via Activation-Based Uncertainty Estimation

Zhiqi Huang, Vivek Datla, Chenyang Zhu, Alfy Samuel, Daben Liu, Anoop Kumar, Ritesh Soni

机构 * Capital One

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

Comments UncertaiNLP at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25373 2025-10-17 cs.AI 57%

From Perception to Cognition: A Survey of Vision-Language Interactive Reasoning in Multimodal Large Language Models

Chenyue Zhou, Mingxuan Wang, Yanbiao Ma, Chenxu Wu, Wanyi Chen, Zhe Qian, Xinyu Liu, Yiwei Zhang, Junhao Wang, Hengbo Xu, Fei Luo, Xiaohua Chen, Xiaoshuai Hao, Hehan Li, Andi Zhang, Wenxuan Wang, Kaiyan Zhang, Guoli Jia, Lingling Li, Zhiwu Lu, Yang Lu, Yike Guo

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Xiamen University(厦门大学) The Hong Kong University of Science and Technology(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12470 2025-10-16 cs.CL 57%

Reasoning on a Spectrum: Aligning LLMs to System 1 and System 2 Thinking

Alireza S. Ziabari, Nona Ghazizadeh, Zhivar Sourati, Farzan Karimi-Malekabadi, Payam Piray, Morteza Dehghani

机构 * University of Southern California(南加州大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13183 2025-10-16 cs.CL 57%

DSCD: Large Language Model Detoxification with Self-Constrained Decoding

Ming Dong, Jinkui Zhang, Bolong Zheng, Xinhui Tu, Po Hu, Tingting He

机构 * Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北人工智能与智能学习省级重点实验室) National Language Resources Monitoring and Research Center for Network Media(网络媒体语言资源监测与研究国家中心) Central China Normal University(中央财经大学) Wuhan University of Technology(武汉理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00378 2025-10-15 cs.AI cs.CV 57%

CoRGI: Verified Chain-of-Thought Reasoning with Post-hoc Visual Grounding

Shixin Yi, Lin Shang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

Comments The paper is not yet mature and needs further improvement

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11457 2025-10-14 cs.AI 57%

From <Answer> to <Think>: Multidimensional Supervision of Reasoning Process for LLM Optimization

Beining Wang, Weihang Su, Hongtao Tian, Tao Yang, Yujia Zhou, Ting Yao, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学) Tencent Inc(腾讯公司)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11242 2025-10-14 astro-ph.EP astro-ph.IM cs.LG 57%

Analyzing Data Quality and Decay in Mega-Constellations: A Physics-Informed Machine Learning Approach

Katarina Dyreby, Francisco Caldas, Cláudia Soares

机构 * FCT-UNL, Portugal(葡萄牙FCT-UNL)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments 76th International Astronautical Congress

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10462 2025-10-14 cs.CV cs.AI 57%

Learning from Disagreement: A Group Decision Simulation Framework for Robust Medical Image Segmentation

Chen Zhong, Yuxuan Yang, Xinyue Zhang, Ruohan Ma, Yong Guo, Gang Li, Jupeng Li

机构 * School of Electronics and Information Engineering, Beijing Jiaotong University, China(电子信息工程学院,北京交通大学) Peking University School and Hospital of Stomatology, China(北京大学口腔医院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17178 2025-10-14 cs.CL 57%

Attention Consistency for LLMs Explanation

Tian Lan, Jinyuan Xu, Xue He, Jenq-Neng Hwang, Lei Li

机构 * Milkuya Studio(Milkuya工作室) ERTIM, INALCO(ERTIM与INALCO) Sorbonne University(索邦大学) IRD(国家农业与食品研究所) University of Washington(华盛顿大学) VitaSight

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10290 2025-10-14 cs.SE cs.LG 57%

Grounded AI for Code Review: Resource-Efficient Large-Model Serving in Enterprise Pipelines

Sayan Mandal, Hua Jiang

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

Comments Submitted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09913 2025-10-14 cs.CL 57%

Don't Throw Away Your Pretrained Model

Shangbin Feng, Wenhao Yu, Yike Wang, Hongming Zhang, Yulia Tsvetkov, Dong Yu

机构 * University of Washington(华盛顿大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21641 2025-10-13 cs.LG cs.CR stat.ME 57%

PrivATE: Differentially Private Confidence Intervals for Average Treatment Effects

Maresa Schröder, Justin Hartenstein, Stefan Feuerriegel

机构 * LMU Munich(慕尼黑莱茵河大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12444 2025-10-13 cs.CL 57%

Augmenting Compliance-Guaranteed Customer Service Chatbots: Context-Aware Knowledge Expansion with Large Language Models

Mengze Hong, Chen Jason Zhang, Di Jiang, Yuanqin He

机构 * Hong Kong Polytechnic University(香港理工大学) AI Group, WeBank Co., Ltd(WeBank金融科技部)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments Accepted by EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08389 2025-10-10 cs.AI 57%

Revisiting Hallucination Detection with Effective Rank-based Uncertainty

Rui Wang, Zeming Wei, Guanzhang Yue, Meng Sun

机构 * Peking University(北京大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16922 2025-10-10 cs.CL 57%

UNCLE: Benchmarking Uncertainty Expressions in Long-Form Generation

Ruihan Yang, Caiqi Zhang, Zhisong Zhang, Xinting Huang, Dong Yu, Nigel Collier, Deqing Yang

机构 * Fudan University(复旦大学) University of Cambridge(剑桥大学) Tencent AI Lab(腾讯AI实验室) City University of Hong Kong(香港城市大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏