arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1738 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 1738 篇

2606.31804 2026-07-01 cs.LG stat.ML 新提交 57%

Relational and Sequential Conformal Inference for Energy Time Series over Graphs via Foundation Models

基于基础模型的图结构能源时间序列的关系与序列共形推断

Keivan Faghih Niresi, Alice Cicirello, Olga Fink

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出STOIC框架,结合图神经网络与表格基础模型,通过零样本校准实现图结构能源时间序列的共形预测,提供可靠的不确定性估计。

Comments Under-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14171 2026-07-01 cs.AI 版本更新 57%

Paper2Rebuttal: A Multi-Agent Framework for Transparent Author Response Assistance

Paper2Rebuttal: 一种透明的作者回复辅助多智能体框架

Qianli Ma, Chang Guo, Zhiheng Tian, Siyu Wang, Jipeng Xiao, Yuanhao Yue, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 提出多智能体框架RebuttalAgent,将回复生成重构为以证据为中心的规划任务,通过分解反馈、构建混合上下文和外部搜索模块,提升覆盖度、忠实性和策略连贯性。

Comments Accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29654 2026-06-30 cs.AI cs.MA 57%

Budgeted Act-or-Defer Multi-Agent LLM Deliberation with Local Reliability Bounds

预算约束下的多智能体LLM“行动或延迟”协商与局部可靠性界限

Mengdie Flora Wang, Haochen Xie, Guanghui Wang, Devin Zhang, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) General Motors (GM)(通用汽车(GM))

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种预算约束下的“行动或延迟”决策框架,通过k近邻下置信界评估LLM协商的可靠性,在满足用户指定的错误行动预算时自动执行,否则延迟人工审核,并在六个基准上验证了有效性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26535 2026-06-26 cs.CV cs.AI 新提交 57%

From Hallucination to Grounding: Diagnosing Visual Spatial Intelligence via CRISP

从幻觉到扎根:通过CRISP诊断视觉空间智能

Zhixing Li, Yinan Yu

机构 * Chalmers University of Technology(查尔姆斯理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 提出CRISP诊断范式,通过一致性评估解耦感知与推理,揭示闭源模型存在度量估计不准确和未利用隐式结构表示的问题,开源模型则受限于多跳组合推理能力。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15490 2026-06-25 cs.CV cs.LG eess.IV 版本更新 57%

Improving Factuality of 3D Brain MRI Report Generation with Paired Image-domain Retrieval and Text-domain Augmentation

通过配对图像域检索和文本域增强提高3D脑MRI报告生成的事实准确性

Junhyeok Lee, Yujin Oh, Dahyoun Lee, Hyon Keun Joh, Minchul Kim, Chul-Ho Sohn, Sung Hyun Baik, Cheol Kyu Jung, Jung Hyun Park, Kyu Sung Choi, Byung-Hoon Kim, Jong Chul Ye

机构 * Cancer Biology, Seoul National University College of Medicine, Korea(首尔国立大学医学院癌症生物学系,韩国) Radiology, Massachusetts General Hospital(麻省总医院放射科) Harvard Medical School(哈佛医学院) Biomedical Systems Informatics, Yonsei University College of Medicine, Korea(延世大学医学院生物医学系统信息学系,韩国) Graduate School, Yonsei University, Korea(延世大学研究生院,韩国) Radiology, Seoul National University College of Medicine, Korea(首尔国立大学医学院放射科,韩国) Radiology, Seoul National University Hospital, Korea(首尔国立大学医院放射科,韩国) Radiology, Seoul National University Bundang Hospital, Korea(首尔国立大学 Bundang 医院放射科,韩国) Radiology, SMG-SNU Boramae Medical Center, Korea(SMG-SNU Boramae 医疗中心放射科,韩国) Psychiatry, Yonsei University College of Medicine, Korea(延世大学医学院精神病学系,韩国) Behavioral Sciences in Medicine, Yonsei University College of Medicine, Korea(延世大学医学院医学行为科学系,韩国) Yonsei Institute for Digital Health, Korea(延世大学数字健康研究院,韩国) Kim Jaechul Graduate School of AI, KAIST, Korea(金 Jaechul人工智能研究生院,韩国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出PIRTA框架,通过检索相似3D DWI/ADC图像并利用其配对报告指导LLM生成,避免显式跨模态对齐,显著提高缺血区域准确性。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22775 2026-06-24 stat.ME cs.LG 新提交 57%

Target-Aware Linear Regression Under Distribution Shift

分布漂移下的目标感知线性回归

Zhewen Hou, Tian Zheng

机构 * Department of Statistics(统计学系) Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 针对训练与部署间的分布漂移,提出混合损失估计器作为目标感知基准,并开发了约束矩匹配和两阶段估计两种计算可行方案,推导渐近均方误差并比较性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11973 2026-06-23 cs.CV cs.LG 版本更新 57%

Confidence-Uncertainty Boundary Calibration for Bayesian Deep Learning in Medical Image Analysis

医学图像分析中贝叶斯深度学习的置信-不确定性边界校准

Hua Xu, Julián D. Arias-Londoño, Juan I. Godino-Llorente

机构 * Escuela Técnica Superior de Ingenieros de Telecomunicación Universidad Politécnica de Madrid(电信工程高级学院马德里理工大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 提出基于贝叶斯深度学习的概率优化框架,通过置信-不确定性边界曲线(CUBC)和边界损失(CUB-Loss)校准预测置信与不确定性,并引入双温度缩放(DTS)进行后处理,在肺炎、糖尿病视网膜病变和皮肤病变三个医学图像任务上验证了有效性。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21607 2026-06-23 cs.DB cs.LG 57%

Beyond Accuracy: An Empirical Study of Uncertainty Estimation in Imputation

超越准确性:对缺失数据填补中不确定性估计的实证研究

Zarin Tahia Hossain, Mostafa Milani

机构 * Department of Computer Science Western University London, Ontario, Canada(计算机科学系 温哥华大学 安大略省伦敦市 加拿大)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文通过实证研究比较了三种主要填补方法家族的不确定性估计,发现高重建准确性并不一定意味着可靠的不确定性,提出了选择不确定性感知填补器的指导方针。

Comments To appear in conference proceedings

Journal ref Proceedings of the 2025 IEEE International Conference on Big Data, BigData 2025, Macau, China, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06917 2026-06-23 cs.LG eess.SP 57%

Efficient Unsupervised Domain Adaptation Regression for Spatial-Temporal Sensor Fusion

高效无监督领域适应回归用于空间-时间传感器融合

Keivan Faghih Niresi, Ismail Nejjar, Olga Fink

机构 * Intelligent Maintenance and Operations Systems Laboratory, EPFL(智能维护与操作系统实验室,瑞士联邦理工学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种针对回归任务的高效无监督领域适应方法,通过整合空间-时间图神经网络和源目标域扰动逆Gram矩阵对齐,实现无标注数据下的可扩展领域适应,验证于空气质量监测和EEG信号重建任务,取得最佳性能。

Comments Accepted to IEEE Internet of Things Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 57%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19569 2026-06-19 cs.LG 新提交 57%

On the QUEST for Uncertainty Quantification via Highest Density Regions

论基于最高密度区域的量化不确定性探索

Sam Goring, Tom Kuipers, Nicola Paoletti, David S. Watson

机构 * Northeastern University London(东北大学伦敦校区)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 针对概率机器学习中回归问题的不确定性量化,提出基于最高密度区域体积的QUEST框架,满足单调性和平移不变性公理,在选择性预测基准上优于方差和微分熵。

Comments 27 pages, of which 10 are main text. Contains 7 figures, 4 tables, 1 algorithm in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18068 2026-06-17 cs.AI 新提交 57%

Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications

基于Agentic AI的框架:缓解医疗应用中的过早诊断交接和无声幻觉

Divyansh Srivastava, Shreya Ghosh, Anshul Verma, Rajkumar Buyya

机构 * Distributed Systems (qCLOUDS) Lab, School of Computing Information Systems, The University of Melbourne, Australia 2Department of Computer Science Engineering, School of Electrical Computer Sciences (SECS), Indian Institute of Technology Bhubaneswar, India 3Department of Computer Science Banaras Hindu University, Varanasi, India

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出多智能体框架,通过确定性编排约束和两个安全机制(神经符号状态跟踪门和语义熵不确定性量化门)解决LLM在医疗对话中的过早诊断交接和无声幻觉问题,诊断精度提升11.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17666 2026-06-17 cs.SE cs.AI 新提交 57%

FacProcessTwin: An LLM-Based System for Process Twin Development

FacProcessTwin: 一种基于LLM的流程孪生开发系统

Yash Pulse, Yong-Bin Kang, Abhik Banerjee, Prem Prakash Jayaraman

机构 * Swinburne University of Technology(斯winburne大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出FacProcessTwin系统,利用大语言模型从工厂文档和操作员自然语言输入中自动生成流程模型并绑定实时数据,通过交互式流程图实现人机协同治理,在食品制造案例中准确率达95.2%,开发时间缩短至人工的1/6。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17234 2026-06-17 cs.CL 新提交 57%

Speaking in Self-Assessing Tongues: On the Verbalized Confidence of LLMs in Machine Translation

自评之言:论大语言模型在机器翻译中的口头化置信度

Ali Marashian, Alexis Palmer, Katharina von der Wense

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Johannes Gutenberg University Mainz(美因茨约翰内斯·古腾堡大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 本研究设计了五种无需内部信号的口头化方法提取LLM逐词置信度,并与内部确定性信号比较,发现两者在细粒度错误检测和校准上表现相似但相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17203 2026-06-17 cs.SE cs.AI 新提交 57%

Trust-Aware Multi-Agent Traceability: Confidence-Calibrated Knowledge Graphs for Consistent Software Artifact Management

信任感知的多智能体可追溯性:用于一致软件工件管理的置信度校准知识图谱

Mohamed Essam, Kareem Wael, Azza Hassan, Ahmed Haitham, Mahmoud Soliman, Samer Saber, Ibrahim Habib

机构 * CairoMotive Cairo, Egypt(开罗动力埃及)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出一种信任感知协调框架,通过共享知识图谱和校准置信度分数,结合嵌入检索与LLM多准则分析的两阶段可追溯性链接预测管道,解决多智能体系统中错误传播问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00330 2026-06-17 cs.LG 版本更新 57%

Conformalized Quantum DeepONet Ensembles for Scalable Operator Learning with Distribution-Free Uncertainty

conformalized 量子 deeponet 集团用于具有分布自由不确定性的可扩展操作学习

Purav Matlia, Christian Moya, Guang Lin

机构 * Department of Computer Science(计算机科学系) Purdue University(普渡大学) Department of Mathematics(数学系) Department of Mechanical Engineering(机械工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种结合量子正交神经网络和适应性置信预测的框架,解决高维动态系统运算学习中的二次推断复杂度和不确定性量化问题,通过压缩多个模型到单个电路实现高效并行计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16710 2026-06-16 cs.MA cs.CL 新提交 57%

Misinformation Propagation in Benign Multi-Agent Systems

良性多智能体系统中的错误信息传播

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(德国哥廷根大学) LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) Shared last authorship(共同通讯作者)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16558 2026-06-16 cs.AI cs.RO cs.SY eess.SY 新提交 57%

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。

Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14758 2026-06-16 cs.CV cs.AI 新提交 57%

Disentangling Hallucinations: Orthogonal Semantic Projection for Robust Interpretability

解构幻觉:正交语义投影实现鲁棒可解释性

Emirhan Bilgiç, Baptiste Caramiaux, Zhi Yan, Gianni Franchi

机构 * U2IS, ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院ENSTA学院U2IS实验室) ISIR, Université Sorbonne, Pierre et Marie Curie(索邦大学皮埃尔和玛丽·居里分校ISIR实验室) AMIAD, Pôle Recherche(AMIAD研究部)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 针对视觉语言模型解释中的语义幻觉问题,提出线性语义归因(LSA)理论框架,并引入正交语义投影(OSP)方法,通过正交化查询向量消除共享特征干扰,最小化幻觉。

Comments 41 pages in total. 5 figures, and 2 tables in the main paper; 10 figures and 17 tables in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08090 2026-06-16 cs.DB cs.AI 新提交 57%

Fast LLM-Based Semantic Filtering: From a Unified Framework to an Adaptive Two-Phase Method

基于LLM的快速语义过滤:从统一框架到自适应两阶段方法

Kyoungmin Kim, Martin Catheland, Anastasia Ailamaki

机构 * EPFL(瑞士联邦理工学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出自适应两阶段语义过滤框架,结合无模型聚类与在线代理,利用LLM的置信度作为软标签训练代理,并通过稀疏感知校准降低级联成本,在90%准确率目标下速度提升1.6-2.0倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30208 2026-06-16 cs.SE cs.AI 版本更新 57%

Automating Low-Risk Code Review at Meta: RADAR, Risk Calibration, and Review Efficiency

自动化低风险代码审查在Meta:RADAR、风险校准与审查效率

Chris Adams, Arjun Singh Banga, Parveen Bansal, Souvik Bhattacharya, Payal Bhuptani, Rujin Cao, Pedro Canahuati, Nate Cook, Brian Ellis, Prabhakar Goyal, Gurinder Grewal, Tianyu He, Matt Labunka, Alex Manners, David Molnar, Ging Cee Ng, Vishal Parekh, Jiefu Pei, Frederic Sagnes, James Saindon, Will Shackleton, Sid Sidhu, Gursharan Singh, Karthik Chengayan Sridhar, Matt Steiner, Pratibha Udmalpet, Sean Xia, Stacey Yan, Audris Mockus, Peter Rigby, Nachiappan Nagappan

机构 * Meta USA, UK, Canada(Meta美国、英国、加拿大)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出RADAR系统,通过多阶段漏斗对代码差异进行风险分层自动化审查,在Meta部署后显著提升审查效率并降低风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14780 2026-06-16 cs.MA cs.CY cs.RO cs.SY eess.SY 版本更新 57%

ROSA: Roundabout Optimized Speed Advisory with Multi-Agent Trajectory Prediction in Multimodal Traffic

ROSA: 多模式交通中基于多智能体轨迹预测的环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * IEEE

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY

AI总结 提出ROSA系统,结合Transformer多智能体轨迹预测与协调速度引导,提升环岛多模式混合交通的效率与安全,预测精度优于前人工作。

Comments 8 pages, 1 figure, 4 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2025 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14219 2026-06-15 cs.RO cs.AI 新提交 57%

Selective Agentic Recovery for UAV Autonomy with a Persistent Mission Runtime

面向无人机自主性的选择性代理恢复与持久任务运行时

Taewoo Park, Kyeonghyun Yoo, Seunghyun Yoo, Hwangnam Kim

机构 * Department of Electrical and Electronic Engineering, Korea University(高丽大学电气与电子工程系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出持久任务运行时(PMR)框架,通过选择性调用外部代理推理器实现无人机恢复,引入学习型调用认知价值(learned-CVI)门控机制,在Gazebo/PX4基准测试中将硬/模糊场景成功率从5.0%提升至95.0%,同时减少16.7%的远程调用和29.2%的令牌消耗。

Comments 17 pages, 2 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12040 2026-06-12 cs.AI cs.GR 新提交 57%

A Lightweight Multi-Agent Framework for Automated Concrete Barrier Design

一种用于自动混凝土护栏设计的轻量级多智能体框架

Wanting Wang, Xiye Ma, Yuyang He, Minghui Cheng, Ran Cao

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil and Architectural Engineering, University of Miami(迈阿密大学土木与建筑系) School of Architecture, University of Miami(迈阿密大学建筑学院)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 提出基于AutoGen的“生成-评估-优化”闭环多智能体框架,实现混凝土护栏自动设计,准确率超98%,且8B参数轻量模型可优于631B旗舰模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19072 2026-06-12 cs.SE cs.AI 版本更新 57%

HalluJudge: A Reference-Free Hallucination Detection for Context Misalignment in Code Review Automation

HalluJudge: 代码审查自动化中上下文错位的无参考幻觉检测

Kla Tantithamthavorn, Hong Yi Lin, Patanamon Thongtanunam, Wachiraphan Charoenwet, Minwoo Jeong, Ming Wu

机构 * Monash University Australia(墨尔本大学澳大利亚) The University of Melbourne Australia(墨尔本大学澳大利亚) Atlassian USA(Atlassian美国)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 提出无参考幻觉检测方法HalluJudge,通过上下文对齐评估生成评论的根基性,采用多分支推理策略,在F1=0.85且成本$0.009下与开发者偏好67%一致。

Comments Accepted at FSE'26: Industry Track, Full-Length, Peer-Reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12210 2026-06-11 cs.CL 新提交 57%

Can News Predict the Market? Limits of Zero-Shot Financial NLP and the Role of Explainable AI

新闻能否预测市场?零样本金融自然语言处理的局限性与可解释人工智能的作用

Ali M Karaoglu, Shreyank N Gowda

机构 * University of Nottingham(诺丁汉大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL

AI总结 本研究通过零样本自然语言处理框架,结合时间聚合与多层次可解释性,发现零样本方法无法超越简单基线,但可解释性信号能区分可靠与不可靠预测,强调透明性和不确定性感知在决策支持中的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04717 2026-06-11 cs.CR cs.CY 版本更新 57%

Auditing CoT Answer-Hijack Patches: Source-Control Certificates with Type-I Guarantees

链式思维答案劫持的选择感知诊断

Jianwei Tai

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CY

AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10777 2026-06-10 cs.LG 新提交 57%

Can we trust our models? Epistemic calibration in second-order classification

我们能信任我们的模型吗?二阶分类中的认知校准

Arthur Hoarau

机构 * Université de Lorraine, CentraleSupélec Loria, CNRS(洛林大学,中央理工-高等电力学院洛里亚实验室,法国国家科学研究中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 提出认知校准准则,衡量认知不确定性估计是否可靠,并证明其比经典校准更严格,通过EECE指标实验揭示不同不确定性量化方法的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14463 2026-06-10 cs.CL 版本更新 57%

An Industrial-Scale Insurance LLM Achieving Verifiable Domain Mastery and Hallucination Control without Competence Trade-offs

一个工业级保险大语言模型,实现可验证的领域掌握与幻觉控制,无能力权衡

Qian Zhu, Xinnan Guo, Jingjing Huo, Jun Li, Pan Liu, Wenyan Yang, Wanqing Xu, Xuan Lin

机构 * Ant Group(蚂蚁集团)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 提出INS-S1保险专用大语言模型,通过可验证数据合成系统和渐进式SFT-RL课程框架,在领域任务上达到SOTA,同时保持通用能力并实现0.6%的低幻觉率。

Comments 21 pages, 12 figures, 17 tables

Journal ref ICLR 2026 Workshop Advances in Financial AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08552 2026-06-09 cs.AI cs.MA cs.NE physics.data-an 新提交 57%

Quantitative Promise Theory: Intentionality and Inference in Autonomous Agents

定量承诺理论:自主智能体中的意向性与推理

Mark Burgess

机构 * ChiTek-i AS

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出将贝叶斯概率与信息论优化(包括主动推理)融入承诺语义,以解决概率计算中的非局部协调、校准和归一化问题,并利用边界条件作为承诺约束状态与决策阈值,实现可扩展的意图定义。

详情

展开后加载摘要…

URL PDF HTML 收藏