arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2601.15745 2026-01-23 cs.CL 57%

Hallucination Mitigating for Medical Report Generation

缓解医疗报告生成中的幻觉

Ruoqing Zhao, Runze Xia, Piji Li

机构 * College of Artificial Intelligence, Nanjing University of Aeronautics and Astronautics(南京航空航天大学人工智能学院) MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education(教育部脑机智能技术重点实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 KERM框架通过知识检索、净化模块和细粒度奖励,有效缓解医疗报告生成中的幻觉问题,提升报告质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04339 2026-01-22 cs.AI 57%

Deliberative Reasoning Network: An Uncertainty-Driven Paradigm for Belief-Tracked Inference with Pretrained Language Models

辩证推理网络:一种基于不确定性的信念跟踪推理范式,用于预训练语言模型

Anran Xu, Jincheng Wang, Baigen Cai, Tao Wen

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 DRN通过不确定性最小化范式提升预训练语言模型的逻辑推理能力,实现高准确率和强泛化性能。

Comments This submission represents an early exploratory draft and was uploaded prematurely. The authors have decided to withdraw it because the current version does not accurately reflect the intended scope and technical formulation of the work, and may be misleading if cited

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14208 2026-01-21 cs.CV cs.GR cs.LG 57%

Rig-Aware 3D Reconstruction of Vehicle Undercarriages using Gaussian Splatting

基于相机 rig 的车辆底盘 3D 重建使用高斯溅射

Nitin Kulkarni, Akhil Devarashetti, Charlie Cluss, Livio Forte, Dan Buckmaster, Philip Schneider, Chunming Qiao, Alina Vereshchaka

机构 * University at Buffalo(布法罗大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出一种基于相机 rig 的 3D 重建方法,利用高斯溅射生成逼真的车辆底盘模型,提升检查效率和买家信任度。

Comments 8 pages, 9 figures, Conference: IEEE International Conference on Machine Learning and Applications 2025 (ICMLA 2025): https://www.icmla-conference.org/icmla25/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11563 2026-01-21 cs.CY 57%

Human-like Social Compliance in Large Language Models: Unifying Sycophancy and Conformity through Signal Competition Dynamics

大语言模型中的类人社会合规:通过信号竞争动态统一讨好与顺从

Long Zhang, Wei-neng Chen

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 本研究提出信号竞争机制,揭示大语言模型中讨好与顺从的几何流形机制,并通过整合认知对齐框架提升模型的社会合规性鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06860 2026-01-21 cs.AI 57%

ET-Agent: Incentivizing Effective Tool-Integrated Reasoning Agent via Behavior Calibration

ET-Agent:通过行为校准激励有效的工具集成推理代理

Yifei Chen, Guanting Dong, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 ET-Agent通过自我进化数据飞轮和行为校准训练框架,提升工具集成推理代理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 57%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14022 2026-01-19 cs.LG 57%

BLIPs: Bayesian Learned Interatomic Potentials

BLIPs: 基于贝叶斯学习的原子间势能

Dario Coscia, Pim de Haan, Max Welling

机构 * mathLab, SISSA University of Amsterdam(mathLab、SISSA大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 BLIPs是一种基于贝叶斯学习的原子间势能方法,通过变分dropout实现可扩展的不确定性估计,提升模拟化学任务中的预测精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09929 2026-01-16 cs.AI 57%

Hallucination Detection and Mitigation in Large Language Models

大语言模型中的幻觉检测与缓解

Ahmad Pesaranghader, Erin Li

机构 * CIBC(加拿大帝国商业银行)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种系统化的框架,通过分层架构和闭环反馈机制,提升大语言模型在金融等高风险领域的可靠性,减少幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08237 2026-01-14 cs.AI 57%

The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination

奖励工程的终结:大型语言模型如何重新定义多智能体协调

Haoran Su, Yandong Sun, Congjia Yu

机构 * New York University(纽约大学) Lerna AI

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过语义奖励规范和动态适应替代传统奖励工程,重新定义多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06786 2026-01-13 cs.CL 57%

EpiCaR: Knowing What You Don't Know Matters for Better Reasoning in LLMs

EpiCaR: 了解未知对提高大语言模型的推理能力至关重要

Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(数据科学研究生院,首尔国立大学) Department of Rural Systems Engineering, Seoul National University(农村系统工程系,首尔国立大学) Department of Aerospace Engineering, Seoul National University(航空航天工程系,首尔国立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 EpiCaR通过知识校准推理提升大语言模型的推理准确性和校准性,减少推理计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06631 2026-01-13 cs.CL 57%

Labels have Human Values: Value Calibration of Subjective Tasks

标签具有人类价值观:主观任务的价值校准

Mohammed Fayiz Parappan, Ricardo Henao

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) Duke University(杜克大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出MC-STL框架,通过价值集群校准提升主观任务NLP系统的对齐性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02973 2026-01-13 cs.CL 57%

Expanding before Inferring: Enhancing Factuality in Large Language Models through Premature Layers Interpolation

在推断前扩展:通过提前层插值增强大语言模型的事实性

Dingwei Chen, Ziqiang Liu, Feiteng Fang, Chak Tou Leong, Shiwen Ni, Ahmadreza Argha, Hamid Alinejad-Rokny, Min Yang, Chengming Li

机构 * Sun Yat-Sen University(中山大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学) The Hong Kong Polytechnic University(香港理工大学) UNSW, Sydney, NSW 2052, Australia(新南威尔士大学) Shenzhen Key Laboratory for High Performance Data Mining, Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳高性能数据挖掘重点实验室,深圳先进技术研究院,中国科学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出PLI方法,通过提前层插值提升大语言模型的事实一致性,有效减少幻觉并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05520 2026-01-12 cs.CL 57%

CHisAgent: A Multi-Agent Framework for Event Taxonomy Construction in Ancient Chinese Cultural Systems

CHisAgent:一种用于古代中国文化系统事件分类的多智能体框架

Xuemei Tang, Chengxi Yan, Jinghang Gu, Chu-Ren Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Renmin University of China(中国人民大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 CHisAgent通过多智能体框架实现古代中国历史事件的自动分类,提升历史知识组织与跨文化理解能力。

Comments 22 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 57%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03860 2026-01-08 cs.CL 57%

PartisanLens: A Multilingual Dataset of Hyperpartisan and Conspiratorial Immigration Narratives in European Media

PartisanLens: 一种多语言的欧洲媒体中极偏见和阴谋论移民叙述数据集

Michele Joshua Maggini, Paloma Piot, Anxo Pérez, Erik Bran Marino, Lúa Santamaría Montesinos, Ana Lisboa, Marta Vázquez Abuín, Javier Parapar, Pablo Gamallo

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes da USC(乌拉特大学智能技术研究中心) IRLab, CITIC Research Centre, Universidade da Coruña(IR实验室,CITIC研究中心,科鲁纳大学) Universidade de Évora(埃夫拉大学) Universidad de La Rioja(里瓦达维亚大学) GESIS Leibniz Institute for the Social Sciences(莱比锡社会科学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 PartisanLens 是首个多语言数据集,用于研究欧洲媒体中的极偏见和阴谋论移民叙述,评估LLMs在分类和标注中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02562 2026-01-07 cs.LG eess.IV 57%

CutisAI: Deep Learning Framework for Automated Dermatology and Cancer Screening

CutisAI: 用于自动化皮肤科和癌症筛查的深度学习框架

Rohit Kaushik, Eva Kaushik

机构 * Hanson Professional Services USA(Hanson专业服务公司) University of Tennessee Knoxville(田纳西大学肯纳邦克分校) Oak Ridge National Laboratory USA(橡树岭国家实验室)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 CBDC框架结合统计学习理论、拓扑数据分析和贝叶斯符合推断,实现了皮肤病和癌症筛查的高准确率和可信不确定性量化。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 57%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01378 2026-01-06 cs.AI 57%

Empowering Small Language Models with Factual Hallucination-Aware Reasoning for Financial Classification

赋能小型语言模型以实现金融分类的事实幻觉感知推理

Han Yuan, Yilin Wu, Li Zhang, Zheng Ma

机构 * Decision Science Center of Excellence(决策科学中心卓越机构) American Express(美国运通)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AAAI流程,通过缓解事实幻觉提升小型语言模型在金融分类中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.20034 2026-01-05 cs.CV cs.CL 57%

Do Vision Encoders Truly Explain Object Hallucination?: Mitigating Object Hallucination via Simple Fine-Grained CLIPScore

视觉编码器真的能解释物体幻觉吗?:通过简单细粒度CLIPScore缓解物体幻觉

Hongseok Oh, Wonseok Hwang

机构 * Department of Artificial intelligence University of Seoul(人工智能系首尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本文提出F-CLIPScore,通过细粒度文本嵌入缓解LVLM中的物体幻觉问题,显著提升评估准确性。

Comments Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22189 2025-12-30 cs.LG 57%

Physics-Informed Machine Learning for Transformer Condition Monitoring -- Part II: Physics-Informed Neural Networks and Uncertainty Quantification

基于物理的机器学习用于变压器状态监测 -- 第二部分:基于物理的神经网络和不确定性量化

Jose I. Aizpurua

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出基于物理的神经网络和贝叶斯框架,用于变压器状态监测中的不确定性量化与预测。

Comments 7 pages, 8 figures, published as conference paper in IEEE Advanced Research Workshop on Transformers 2025 as part of the Tutorial delivered with the title "Physics-informed Machine Learning for Transformer Condition Monitoring"

Journal ref 8th International Advanced Research Workshop on Transformers (ARWtr), Baiona, Spain, 2025, pp. 95-101

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01564 2025-12-24 cs.CL 57%

Enhancing Uncertainty Estimation in LLMs with Expectation of Aggregated Internal Belief

通过聚合内部信念期望增强大语言模型的不确定性估计

Zeguan Xiao, Diyang Dou, Boya Xiong, Yun Chen, Guanhua Chen

专题命中 幻觉与事实性 :RLHF(abstract);分类 cs.CL

AI总结 本文提出EAGLE方法,通过聚合内部信念期望提升大语言模型的不确定性估计,改进校准性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15584 2025-12-23 cs.AI cs.GT 57%

A Decision-Theoretic Approach for Managing Misalignment

一种用于管理偏差的决策理论方法

Daniel A. Herrmann, Abinav Chari, Isabelle Qian, Sree Sharvesh, B. A. Levinstein

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17383 2025-12-23 cs.RO cs.LG 57%

Confidence Calibration in Vision-Language-Action Models

视觉-语言-动作模型中的置信度校准

Thomas P Zollo, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。

Comments 38 pages, 19 figures; additional experiments with VLA variants

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08971 2025-12-23 cs.CL 57%

Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval

结构语言生成模型:损失校准与格式解码以实现稳健的结构预测与知识检索

Minho Lee, Junghyun Min, Yerang Kim, Woochul Lee, Yeonsoo Lee

机构 * KT Gen AI Lab(KT生成人工智能实验室) Georgetown University(乔治城大学) Korea University(韩国大学) NC AI(NC人工智能)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 SLGM通过损失校准和格式解码提升结构预测和知识检索性能,无需额外参数或数据集特定工程。

Comments 20 pages, 4 figures. FrontierIR at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14851 2025-12-18 cs.LG 57%

Unreliable Uncertainty Estimates with Monte Carlo Dropout

基于蒙特卡洛滴落的不可靠不确定性估计

Aslak Djupskås, Alexander Johannes Stasik, Signe Riemer-Sørensen

机构 * Department of Data Science, Norwegian University of Life Sciences(数据科学系,挪威生命科学大学) SINTEF AS, Department of Mathematics and Cybernetics(SINTEF公司,数学与自动化系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文指出蒙特卡洛滴落在估计不确定性时不可靠,尤其在插值和外推区域表现不佳,不如传统贝叶斯方法可靠。

Comments Accepted for the Northern Lights Deep Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04566 2025-12-17 cs.LG physics.data-an stat.ML 57%

Reliable Statistical Guarantees for Conformal Predictors with Small Datasets

在小数据集上为符合预测器提供可靠的统计保证

Miguel Sánchez-Domínguez, Lucas Lacasa, Javier de Vicente, Gonzalo Rubio, Eusebio Valero

机构 * ETSIAE-UPM - School of Aeronautics, Universidad Politécnica de Madrid(西班牙马德里理工大学航空航天学院) Institute for Cross-Disciplinary Physics and Complex Systems (IFISC), CSIC-UIB(交叉学科物理与复杂系统研究所(IFISC),CSIC-UIB) Center for Computational Simulation, Universidad Politécnica de Madrid, Campus de Montegancedo, Boadilla del Monte(计算模拟中心,马德里理工大学蒙特加森多校区,博阿迪利亚德尔蒙特)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种新的统计保证方法,用于在小数据集上提高符合预测器的可靠性,通过提供覆盖概率信息并验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12341 2025-12-16 cs.LG stat.ML 57%

Uncertainty Quantification for Machine Learning: One Size Does Not Fit All

机器学习中的不确定性量化:一大小并不适合所有

Paul Hofman, Yusuf Sale, Eyke Hüllermeier

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种灵活的不确定性度量方法,适用于不同任务和场景,强调根据具体应用定制不确定性量化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏