arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1732 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1732 篇

2606.03130 2026-06-03 cs.LG 70%

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

专题命中 幻觉与事实性 :DPO(abstract,abstract_cn);分类 cs.LG

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28722 2026-05-28 cs.AI 70%

Multi-Adapter Representation Interventions via Energy Calibration

通过能量校准的多适配器表示干预

Manjiang Yu, Hongji Li, Junwei Chen, Xue Li, Priyanka Singh, Yang Cao, Lijie Hu

机构 * The University of Queensland, Brisbane, Australia(昆士兰大学) Mohamed bin Zayed University of Artificial Intelligence, Abu Dhabi, United Arab Emirates(马尔代夫 bin Zayed 人工智能大学) Institute of Science Tokyo, Tokyo, Japan(东京科学研究所)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 提出MARI方法,通过竞争性多适配器机制和基于能量的门控模块,自适应地确定干预方向和强度,在保持通用能力的同时提升对齐性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25832 2026-04-29 cs.AI 70%

TrialCalibre: A Fully Automated Causal Engine for RCT Benchmarking and Observational Trial Calibration

TrialCalibre:一种完全自动化的因果引擎用于RCT基准测试和观察性试验校准

Amir Habibdoust, Xing Song

专题命中 幻觉与事实性 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出TrialCalibre,一种多智能体系统,用于自动化和扩展BenchExCal流程,通过专门的智能体协调整个过程,实现适应性、可审计和透明的因果效应估计。

Comments 5 pages , 2 figures

Journal ref Proceedings of the 42nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025. Copyright 2025 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17590 2026-04-28 cs.AI cs.CL cs.CV cs.CY cs.LG 70%

MERIT: Modular Framework for Multimodal Misinformation Detection with Web-Grounded Reasoning

MERIT:基于网络基础推理的多模态虚假信息检测模块化框架

Mir Nafis Sharear Shopnil, Sharad Duwal, Abhishek Tyagi, Adiba Mahbub Proma

机构 * University of Rochester(罗切斯特大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 MERIT通过四个专用模块提升多模态虚假信息检测性能,采用GPT-4o-mini在MMFakeBench上取得81.65% F1得分,优于零样本基线,验证了其架构设计的有效性。

Comments 18 pages, 4 tables, 3 figures. Major revision with updated title, framing, methodology, experiments, and error analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16727 2026-04-20 cs.AI 70%

Deliberative Searcher: Improving LLM Reliability via Reinforcement Learning with constraints

反思搜索器:通过带有约束的强化学习提高大语言模型的可靠性

Zhenyun Yin, Shujie Wang, Xuhong Wang, Xingjun Ma, Yinchun Wang

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出反思搜索器框架,结合置信度校准与基于检索的搜索,通过强化学习优化准确性,提升模型输出的可靠性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07513 2026-04-10 cs.LG cs.AI cs.CL cs.CY 70%

SYN-DIGITS: A Synthetic Control Framework for Calibrated Digital Twin Simulation

SYN-DIGITS: 一种合成控制框架用于校准数字孪生模拟

Grace Jiarui Fan, Chengpiao Huang, Tianyi Peng, Kaizheng Wang, Yuhang Wu

机构 * Finance Division, Columbia Business School(哥伦比亚商学院金融系) Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系) Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营系) Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系和数据科学研究所)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出SYN-DIGITS框架,通过学习数字孪生响应的潜在结构,校准大语言模型预测与人类行为的一致性,提升市场研究和社交科学中的模拟可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09438 2026-04-08 cs.CL 70%

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

GrACE:一种生成方法,用于改进置信度 elicitation 和大语言模型在测试时的高效扩展

Zhaohan Zhang, Ziquan Liu, Ioannis Patras

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文提出GrACE,一种生成方法,用于改进大语言模型的置信度 elicitation 和测试时的高效扩展,通过实时计算隐藏状态与特殊标记嵌入的相似性,实现可靠且可扩展的置信度评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04231 2026-04-07 cs.LG 70%

Subspace Control: Turning Constrained Model Steering into Controllable Spectral Optimization

子空间控制:将受约束的模型操控转化为可控的谱优化

Yancheng Huang, Changsheng Wang, Chongyu Fan, Yicheng Lang, Bingqi Shang, Yang Zhang, Mingyi Hong, Qing Qu, Alvaro Velasquez, Sijia Liu

机构 * OPTML, Michigan State University(OPTML,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI Lab,IBM研究院) University of Minnesota(明尼苏达大学) University of Michigan(密歇根大学) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本文提出子空间控制框架,通过分析谱交叉任务干扰并利用一阶解正交化合并子空间,引入SIFT方法,实现可控更新以缓解目标与约束冲突,在四个应用中均取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22413 2026-04-02 cs.AI 70%

Epistemic Filtering and Collective Hallucination: A Jury Theorem for Confidence-Calibrated Agents

知识过滤与集体幻觉:一个适用于置信度校准代理的陪审团定理

Jonas Karge

机构 * Technische Universität Dresden(德累斯顿工业大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究异质代理在时间中学习自我可靠性估计并选择性 abstain 的集体准确性,提出基于置信度校准的框架,推导非渐近下界并证明其在置信度门控设置下的泛化能力,通过蒙特卡洛模拟验证,探讨其在AI安全中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23743 2026-03-24 cs.SE cs.AI 70%

Hybrid-Code v2: Zero-Hallucination Clinical ICD-10 Coding via Neuro-Symbolic Verification and Automated Knowledge Base Expansion

Hybrid-Code v2:通过神经符号验证和自动知识库扩展实现零幻觉的临床ICD-10编码

Yunguo Yu

机构 * AI Innovation & Prototyping, Zyter(人工智能创新与原型开发,Zyter)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 Hybrid-Code v2结合神经网络与符号验证,实现零类型I幻觉,同时保持高覆盖率和精度,通过自动知识库扩展解决规则系统扩展性问题。

Comments Version 2: Substantially extended version with (1) multi-layer verification framework (format, evidence, negation, temporal, exclusion), (2) automated knowledge base expansion from unlabeled clinical text, (3) formal zero Type-I hallucination guarantees, and (4) expanded experimental evaluation on 5,000 cases with detailed error analysis. 28 pages, 3 figure, original research paper;

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18353 2026-03-20 cs.AI 70%

Interpretability without actionability: mechanistic methods cannot correct language model errors despite near-perfect internal representations

无需可操作性:机制方法无法纠正语言模型错误,尽管内部表示几乎完美

Sanjay Basu, Sadiq Y. Patel, Parth Sheth, Bhairavi Muralidharan, Namrata Elamaran, Aakriti Kinra, John Morgan, Rajaie Batniji

机构 * University of California San Francisco(加州大学旧金山分校) Waymark University of Pennsylvania(宾夕法尼亚大学) Virginia Commonwealth University(弗吉尼亚 Commonwealth 大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 研究探讨了机制解释方法在纠正语言模型错误中的有效性,发现尽管内部表示接近完美,但现有方法无法有效将知识转化为正确输出,揭示了AI安全框架中的潜在问题。

Comments 27 pages, 5 figures, 10 tables. Code available at https://github.com/sanjaybasu/interpretability-triage

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15645 2026-02-18 cs.AI cs.CV 70%

CARE Drive A Framework for Evaluating Reason-Responsiveness of Vision Language Models in Automated Driving

CARE Drive:一种用于评估视觉语言模型在自动驾驶中推理响应性的框架

Lucas Elbert Suryana, Farah Bierenga, Sanne van Buuren, Pepijn Kooij, Elsefien Tulleners, Federico Scari, Simeon Calvert, Bart van Arem, Arkady Zgonnikov

机构 * organization= Department of Transport \& Planning, Faculty of Civil Engineering Geosciences, Delft University of Technology organization= Department of Cognitive Robotics, Faculty of Mechanical Engineering, Delft University of Technology organization= Centre for Meaningful Human Control, Delft University of Technology organization= Faculty of Mechanical Engineering, Delft University of Technology , city= Delft , country= The Netherlands

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 CARE Drive提出了一种评估视觉语言模型在自动驾驶中推理响应性的框架,通过受控上下文变化比较基线和增强模型决策,验证人类原因对决策的影响。

Comments 21 pages, on submission to Transportation Research Part C

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22399 2026-02-11 astro-ph.IM cs.AI physics.space-ph 70%

Space AI: Leveraging Artificial Intelligence for Space to Improve Life on Earth

空间AI:利用人工智能推动空间探索,改善地球生活

Ziyang Wang

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出空间AI作为跨学科领域,旨在通过人工智能技术提升太空探索能力,同时为地球带来广泛的社会效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23506 2026-02-09 cs.LG stat.ML 70%

Position: Epistemic uncertainty estimation methods are fundamentally incomplete

位置:epistemic不确定性估计方法本质上是不完整的

Sebastián Jiménez, Mira Jürgens, Willem Waegeman

机构 * Department of Data Analysis and Mathematical Modeling, Ghent University, Ghent, Belgium(数据分析与数学建模系,根特大学,根特,比利时)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文指出epistemic不确定性估计方法存在固有缺陷,导致不确定性量化不准确且难以解释,需在高风险决策中谨慎使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06103 2026-02-09 cs.LG 70%

Toward Faithful and Complete Answer Construction from a Single Document

从单个文档构建忠实且完整的答案

Zhaoyang Chen, Cody Fleming

机构 * Department of Mechanical Engineering(机械工程系) Iowa State University(爱荷华州立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 EVE通过结构化框架提升文档基础推理的完整性和准确性,同时解决单次生成中覆盖与准确性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02034 2026-02-03 cs.AI 70%

Constrained Process Maps for Multi-Agent Generative AI Workflows

多代理生成AI工作流的约束过程图

Ananya Joshi, Michael Rudow

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 70%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19017 2026-01-28 cs.SD cs.LG 70%

A Framework for Evaluating Faithfulness in Explainable AI for Machine Anomalous Sound Detection Using Frequency-Band Perturbation

一种用于可解释人工智能在机器异常声音检测中评估忠实度的框架 使用频率带扰动

Alexander Buck, Georgina Cosma, Iain Phillips, Paul Conway, Patrick Baker

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种评估XAI在机器异常声音检测中忠实度的框架,通过频率带扰动方法评估不同XAI技术的可靠性,发现遮挡方法在模型敏感性上表现最佳。

Comments 16 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08525 2026-01-08 cs.CL 70%

Investigating CoT Monitorability in Large Reasoning Models

探究大型推理模型中的CoT可监控性

Shu Yang, Junchao Wu, Xilin Gong, Xuansheng Wu, Derek Wong, Ninghao Liu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证明负责任的人工智能与数据分析师实验室) King Abdullah University of Science and Technology(卡布斯大学) University of Georgia(佐治亚大学) University of Macau(澳门大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本文探讨了大型推理模型中CoT可监控性的挑战与潜力,提出MoME范式以通过CoT监控其他模型的误行并提供结构化判断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09881 2026-01-06 cs.AI physics.ao-ph physics.plasm-ph 70%

Uncertainty Quantification of Surrogate Models using Conformal Prediction

利用符合预测对代理模型的不确定性量化

Vignesh Gopakumar, Ander Gray, Joel Oskarsson, Lorenzo Zanisi, Daniel Giles, Matt J. Kusner, Stanislas Pamela, Marc Peter Deisenroth

机构 * Centre for Artificial Intelligence Department of Computer Science University College London(人工智能中心 计算机科学系 伦敦大学学院) Heudiasyc Laboratory Université de Technologie de Compiègne(Heudiasyc实验室 技术大学Compiègne) Department of Computer and Information Science Linköping University(计算机与信息科学系 链接普大学) Computing Division UK Atomic Energy Authority(计算部门 英国原子能局)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于符合预测的框架,用于对代理模型的不确定性进行统计保证的量化,适用于高维空间-时间问题,且计算成本低,能有效验证预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 70%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20630 2025-12-25 cs.AI 70%

MicroProbe: Efficient Reliability Assessment for Foundation Models with Minimal Data

MicroProbe: 用极少数据高效评估基础模型的可靠性

Aayam Bansal, Ishaan Gangwani

机构 * Aayam Bansal(未知) Ishaan Gangwani(未知)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 MicroProbe通过仅使用100个精心选择的示例,高效评估基础模型可靠性,比随机采样方法提升23.5%的综合分数,显著降低评估成本并保持高覆盖率。

Comments ICML NewInML

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02217 2025-12-03 cs.LG physics.app-ph 70%

Uncertainty Reasoning with Photonic Bayesian Machines

基于光子贝叶斯机器的不确定性推理

F. Brückerhoff-Plückelmann, H. Borras, S. U. Hulyal, L. Meyer, X. Ji, J. Hu, J. Sun, B. Klein, F. Ebert, J. Dijkstra, L. McRae, P. Schmidt, T. J. Kippenberg, H. Fröning, W. Pernice

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出一种基于光子技术的贝叶斯机器,利用混沌光源实现高速不确定性推理,应用于血细胞图像分类与域外检测,提升可信AI系统的效率与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01568 2025-12-03 cs.LG cs.AI cs.CL cs.CY 70%

Do Large Language Models Walk Their Talk? Measuring the Gap Between Implicit Associations, Self-Report, and Behavioral Altruism

大型语言模型是否言出必行?隐含关联、自我报告与行为利他主义之间的差距测量

Sandro Andric

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究发现大型语言模型在隐含利他主义偏见和自我报告与实际行为之间存在显著差距,建议将校准差距作为衡量标准。

Comments 14 pages, 7 figures, 7 tables. Code and data available at https://github.com/sandroandric/LLMs_Altruism_Study_Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14776 2025-12-02 cs.CL 70%

COMPASS: Context-Modulated PID Attention Steering System for Hallucination Mitigation

COMPASS:基于上下文调节的PID注意力转向系统用于减少幻觉

Kenji Sahay, Snigdha Pandya, Rohan Nagale, Anna Lin, Shikhar Shiromani, Kevin Zhu, Dev Sunishchal

机构 * Algoverse Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

AI总结 COMPASS通过上下文调节PID注意力转向系统减少大型语言模型的幻觉,通过可解释的反馈回路提升生成的准确性与可解释性。

Comments 9 pages, 6 figures including algorithmns, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23031 2025-12-01 cs.CV cs.AI 70%

From Illusion to Intention: Visual Rationale Learning for Vision-Language Reasoning

从幻觉到意图:用于视觉-语言推理的视觉理由学习

Changpeng Wang, Haozhe Wang, Xi Chen, Junhan Liu, Taofeng Xue, Chong Peng, Donglian Qi, Fangzhen Lin, Yunfeng Yan

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学) Meituan(美团)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出视觉理由学习(ViRL),通过将视觉动作作为核心推理元素,提升视觉-语言推理模型的透明度和可信度。

Comments 19 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01533 2025-11-21 cs.CR cs.CY 70%

LightDefense: A Lightweight Uncertainty-Driven Defense against Jailbreaks via Shifted Token Distribution

LightDefense: 一种基于不确定性驱动的轻量级对抗劫持防御方法通过移位词分布

Zhuoran Yang, Yanyong Zhang

专题命中 幻觉与事实性 :safety(abstract);jailbreak(abstract);分类 cs.CY

AI总结 LightDefense通过调整词元分布和利用模型不确定性,提供了一种轻量级的对抗劫持防御方法,有效提升LLM的安全性同时保持对正常查询的有用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10205 2025-11-19 cs.AI 70%

PIXEL: Adaptive Steering Via Position-wise Injection with eXact Estimated Levels under Subspace Calibration

Manjiang Yu, Hongji Li, Priyanka Singh, Xue Li, Di Wang, Lijie Hu

机构 * University of Queensland(昆士兰大学) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Provable Responsible AI and Data Analytics (PRADA) Lab(可证责任AI与数据分析师实验室) King Abdullah University of Science and Technology (KAUST)(国王 Abdullah 科学与技术大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI

Comments 20 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12661 2025-11-18 cs.CL 70%

Reason-KE++: Aligning the Process, Not Just the Outcome, for Faithful LLM Knowledge Editing

Yuchen Wu, Liang Ding, Li Shen, Dacheng Tao

机构 * Shanghai Jiao Tong University(上海交通大学) The University of Sydney(悉尼大学) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Nanyang Technological University(南洋理工大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00620 2025-11-04 cs.CL 70%

Certain but not Probable? Differentiating Certainty from Probability in LLM Token Outputs for Probabilistic Scenarios

Autumn Toney-Wails, Ryan Wails

机构 * SciTech Strategies, Inc.(SciTech Strategies公司) Georgetown University(乔治城大学)

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.CL

Comments To appear at the Second Workshop on Uncertainty-Aware NLP @EMNLP 2025 (UncertaiNLP '25)

详情

展开后加载摘要…

URL PDF HTML 收藏