arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 152 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 152 篇

2608.13317 2026-08-14 cs.AI 新提交 74%

StateBridge: Training-free Hidden-state Alignment for Latent Communication in LLM Multi-Agent Systems

StateBridge:面向大语言模型多智能体系统潜在通信的无训练隐藏状态对齐

Yanwen Peng, Delvin Ce Zhang, Xi Wang, Nikolaos Aletras

机构 * School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 StateBridge 是一种无训练的潜在通信方法,通过闭式正交变换对齐大语言模型多智能体的隐藏状态,在 26 个模型-任务对中 22 个取得最优或并列最优性能,优于基线。

Comments 18 pages, 3 figures, 4 tables, accepted by COLM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16583 2026-06-16 cs.CL 新提交 74%

Uncertainty Is Not a Safety Net for Clinical VQA, but Can It Anticipate Model Failure?

不确定性并非临床VQA的安全网,但它能预测模型失败吗?

Arnisa Fazla, Alberto Testoni, Ameen Abu-Hanna, Barbara Plank, Iacer Calixto

机构 * Amsterdam University Medical Center, University of Amsterdam(阿姆斯特丹大学医学中心) Amsterdam Public Health(阿姆斯特丹公共卫生) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 幻觉与事实性 :safety(title);分类 cs.CL

AI总结 研究临床视觉语言模型的不确定性估计是否可靠,发现其质量随模型准确率变化,在模型脆弱时失效,但能预测扰动下的性能崩溃。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06972 2026-06-08 cs.AI 新提交 74%

Accounting for Context: Shaping Moral Credences for Value Alignment

考虑情境:塑造道德信念以实现价值对齐

Jazon Szabo, Sanjay Modgil

机构 * University of Oxford(牛津大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文针对价值对齐中道德多元性问题,提出在聚合道德评估时必须考虑情境因素,并形式化道德不确定性下的决策,揭示弱帕累托原则的违反是辛普森悖论的一种变体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29062 2026-08-03 cs.AI 新提交 70%

On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

论用于思维链忠实性的引导向量的泛化性

Matthew Nguyen, Kyle Cox, Austin Meek, Iván Arcuschin

机构 * University of Virginia(弗吉尼亚大学) University of Delaware(特拉华大学) Poseidon Research(波塞冬研究院)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13596 2026-07-16 cs.CR cs.AI 新提交 70%

Protective Capacity Hallucination: When Large Language Models Claim Nonexistent Capabilities

保护能力幻觉:当大语言模型声称具备不存在的能力时

Eunna Lee, Jungpyo Nam, Sunjun Hwang

机构 * Korea Cyber University(韩国网络大学) Yonsei University(延世大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究大语言模型的保护能力幻觉现象,通过三阶段研究发现其受情境严重程度和交互形式影响,体现了角色分配与能力边界规范的差距,提出能力边界的部署端规范是缓解该问题的目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02569 2026-07-07 cs.CV cs.LG 新提交 70%

Uncertainty-Aware Last-Layer Adaptation of RETFound for Referable Diabetic Retinopathy Screening Under Dataset Shift

数据集偏移下用于可参考糖尿病视网膜病变筛查的RETFound不确定性感知最后一层自适应

Karim Mardhani

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 用RETFound对糖尿病视网膜病变筛查的不确定性感知最后一层自适应进行以安全为中心的实证评估,比较多种方法,在APTOS上不确定性感知操作点改善了敏感性等,在DDR上结果有差异,强调安全评估的价值。

Comments 12 pages, 8 tables, 6 figures. Code available at https://github.com/kmardhani/uncertainty-aware-retfound

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31916 2026-07-01 cs.CL 新提交 70%

Theory of Mind and Persuasion Beyond Conversation: Assessing the Capacity of LLMs to Induce Belief States via Planning and Action

超越对话的心智理论与说服:通过规划与行动评估LLMs诱导信念状态的能力

Ben Slater, Matteo G. Mecattaf, Lucy G. Cheke, John Burden, Winnie Street

机构 * Leverhulme Centre for the Future of Intelligence(勒沃霍姆未来智能中心) Prolific Google, Paradigms of Intelligence Team(谷歌智能范式团队)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 提出非对话式规划心智理论(NCP-ToM)框架,评估LLMs通过行动而非对话诱导他人信念状态的能力,发现GPT-5在80%任务中优于人类,但鲁棒性不足。

Comments 29 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 70%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18259 2026-06-18 cs.HC cs.AI 新提交 70%

Caring Without Feeling: Affective Dynamics as the Control Layer of Human-AI Agent Collaboration

无感关怀:情感动态作为人-AI智能体协作的控制层

Junjie Xu, Xingjiao Wu, Zihao Zhang, Yujia Xu, Yuzhe Yang, Jin Zhu, Luwei Xiao, Wen Wu, Liang He

机构 * East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文综述情感动态在人-AI智能体协作中的作用,提出将情感视为协调层而非AI内部属性,用于校准信任、委托和治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03528 2026-07-07 cs.LG cs.AI cs.CL 新提交 69%

Aligning Language Models with Selective Prediction

通过选择性预测使语言模型对齐

Gaoxiang Luo, Yifan Wu, Sinian Zhang, Aryan Deshwal, Ju Sun

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Bioinformatics and Computational Biology Program(生物信息学与计算生物学项目) Division of Biostatistics and Health Data Science(生物统计学与健康数据科学部) University of Minnesota Twin Cities(明尼苏达大学双城分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG;safety(comments)

AI总结 研究聚焦提升语言模型可靠性,采用选择性预测策略,在模型训练后对齐阶段,提出基于强化学习的框架RLSR,以风险-覆盖曲线下面积为目标,在域内域外任务中风险-覆盖权衡表现更好。

Comments Accepted by ICML 2026 Agents in the Wild: Safety, Security, and Beyond Workshop, Project Page: https://sun-umn.github.io/RLSR

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 67%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05909 2026-08-07 cs.CR 新提交 67%

MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration

MMAligner:通过表示校准保护多模态大语言模型

Shenyi Zhang, Keyan Guo, Zihao Wang, Xuebin Li, Lingchen Zhao, Hongxin Hu, Chao Shen, Qian Wang

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract)

AI总结 MMAligner通过校准多模态大语言模型的表示,将不安全多模态输入的拒绝率提升至99%,仅造成不足2%的效用下降,显著优化了安全与效用的权衡。

Comments To Appear in the Proceedings of The ACM Conference on Computer and Communications Security (CCS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 67%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 67%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12336 2026-07-15 cs.CL cs.AI cs.CY cs.ET cs.HC 新提交 67%

Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)

评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)

Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabassum Binte Hossain

机构 * Western Sydney University(西悉尼大学) Microsoft(微软公司) Excelsia College(埃克塞尔西亚学院) Faulconbridge Health Centre(福尔康布里奇健康中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12257 2026-07-15 cs.AI cs.CL cs.IR cs.LG 新提交 67%

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率

Vinay Kumar Chaganti

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。

Comments 13 pages, 2 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02089 2026-07-03 cs.CV cs.AI cs.CL cs.LG cs.MM 新提交 67%

ESC: Emotional Self-Correction for Reliable Vision-Language Models

ESC:面向可靠视觉语言模型的情感自我纠正

Tien-Huy Nguyen, Minh-Nhat Nguyen, Nguyen Nhat Huy, Hung Viet Nguyen, Huy Nguyen Minh Nhat, Thanh-Huy Nguyen, Cuong Tuan Nguyen, Hoang M. Le, Dat Nguyen, Phat Kim Huynh, Min Xu, Ulas Bagci

机构 * 1 GenAI4E Lab 2 University of Information Technology, Ho Chi Minh City, Vietnam 3 Universit\"at Trier, Germany 4 Ho Chi Minh University of Technology, Ho Chi Minh City, Vietnam 5 PAMI Lab, Vietnamese German University, Vietnam 6 Vietnam National University, Ho Chi Minh City, Vietnam 7 Carnegie Mellon University, USA 8 Omoshiroi AI, USA 9 Harvard University, USA 10 Basis Research Institute 11 PASSIO Laboratory, North Carolina A\&T State University, USA 12 Mohamed bin Zayed University of Artificial Intelligence, UAE 13 Northwestern University, USA [4pt] Equal contribution. Corresponding author

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出训练无关的ESC框架,通过外部验证器检测错误初始响应并注入情感反馈,促使VLM自我纠正,提升安全、幻觉、感知和多模态推理等任务的可靠性。

Comments ECCV Main Track 2026 (113 pages, 15 tables, 65 figures). Project Page: https://genai4e.github.io/ESC/?

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25760 2026-06-25 cs.LG cs.AI cs.CL cs.CV 新提交 67%

Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets

计算机使用代理的不确定性量化:跨视觉语言模型和GUI基础数据集的基准测试

Divake Kumar, Sina Tayebati, Devashri Naik, Amanda Sofie Rios, Nilesh Ahuja, Omesh Tickoo, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Intel Labs(英特尔实验室) Capital One AI Labs(Capital One AI实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨机制基准Argus,评估27种后验不确定性量化方法在4个VLM代理和4个数据集上的表现,发现UQ排名在固定模型内跨数据集稳定,但跨模型类别和接口时下降,隐藏状态和密度方法最稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12900 2026-06-12 cs.AI cs.CL cs.LG 新提交 67%

Zero-source LLM Hallucination Detection with Human-like Criteria Probing

零源大语言模型幻觉检测:类人类标准探测

Jiahao Yang, Shuhai Zhang, Hailong Kang, Feng Liu, Qi Chen, Mingkui Tan

机构 * South China University of Technology(华南理工大学) The University of Melbourne(墨尔本大学) Pazhou Laboratory(帕乔实验室) Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HCPD范式,通过类人类标准探测机制模拟人类评估者的多面推理,结合奖励对齐和多样本聚合,实现零源条件下的有效可解释幻觉检测。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09856 2026-06-10 cs.CL cs.AI cs.LG stat.ML 新提交 67%

Using Probabilistic Programs to Train Inductive Reasoning in Large Language Models

使用概率程序训练大型语言模型的归纳推理

Liyi Zhang, Akshay K. Jagadish, Brenden M. Lake, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) Princeton AI Lab(普林斯顿人工智能实验室)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于程序的后验训练(PPT)方法,利用LLM生成概率程序场景,通过推理产生分布目标,微调模型以提升归纳推理准确性、与人类判断的一致性及校准能力。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11280 2026-08-13 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Uncertainty-Aware and Explainable Ensemble Deep Learning Framework for Multi-Class Skin Lesion Classification

用于多类皮肤病变分类的不确定性感知且可解释的集成深度学习框架

Rofiqul Islam, Lilatul Ferdouse

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

Comments 5 pages, 3 figures, IEEE AIBThings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07520 2026-08-11 cs.CY cs.AI 新提交 62%

KumbhDoot: A Scale-Ready, LLM-Bounded Architecture for Mass-Gathering Public-Service Assistants

KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构

Saurabh Sakalkar, Abhishek Singh, Ramesh Raskar

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 62%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 62%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20529 2026-07-24 cs.LG cs.AI 新提交 62%

Uncertainty-Aware Trust Estimation for Multi-LLM Systems via Structured Expert Judgement

通过结构化专家判断对多语言模型系统进行不确定性感知信任估计

Jiawei Zheng, Jiazhen Zhang

机构 * DigitLab, University of Exeter(数字实验室,埃克塞特大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究多语言模型聚合问题,核心方法是采用结构化专家判断,通过上下文感知校准问题及库克式对数加权估计专家可靠性,主要贡献是在异构和受污染情况下实现更好的准确性-可靠性平衡,强调聚合时需校准信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18725 2026-07-22 cs.CL cs.AI cs.CR 新提交 62%

Find Before You Fine-Tune: A Diagnostic Study of Small LLMs for Cybersecurity QA

在微调之前进行评估:针对网络安全问答的小型语言模型诊断研究

Shaswata Mitra, Subash Neupane, Trisha Chakraborty, Himanshu Tripathi, Sudip Mittal, Aritran Piplai, Shahram Rahimi

机构 * The University of Alabama(阿拉巴马大学) Meharry Medical College(梅哈里医学院) Mississippi State University(密西西比州立大学) The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全问答选择小型语言模型难的问题,提出FiT诊断框架,从三方面刻画模型。通过对五个模型在两种微调模式下研究发现微调利弊因模式而异,预微调FiT分数可预测变化,能筛选模型、避免不必要微调,支持安全部署。

Comments 8 pages, 5 figures, 4 tables, IEEE ICMLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10517 2026-07-14 cs.LG cs.AI 新提交 62%

Conditional Optimal Bridge for Riemannian Activation Steering

用于黎曼激活控制的条件最优桥

Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理时激活控制问题,提出\textsc{Cobras}方法,将其视为残差流超球面上的薛定谔桥,从优化问题推导控制目标,使控制方向查询自适应,实验显示该方法性能优于基线且避免分布外性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02182 2026-07-03 cs.LG cs.CL 新提交 62%

Bayesian Sparse Low-Rank Adaptation for Large Language Model Uncertainty Estimation

贝叶斯稀疏低秩自适应用于大语言模型不确定性估计

Jijie Zhang, Zhe Ren, Quan Zhang, Dandan Guo

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Michigan State University(密歇根州立大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 提出DALorRA,一种变分贝叶斯稀疏框架,通过随机掩码低秩适应中的秩维度实现模型容量正则化和校准,在不牺牲推理精度下提升LLM校准性能。

Comments Preprint. 16 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32032 2026-07-01 cs.CL cs.AI 新提交 62%

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

基于元认知反馈的强化学习引发LLM忠实的不确定性表达

Gabrielle Kaili-May Liu, Avi Caciularu, Gal Yona, Idan Szpektor, Arman Cohan

机构 * Yale University(耶鲁大学) Google Research(谷歌研究院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出强化学习与元认知反馈(RLMF)和元认知数据选择方法,通过模型自我判断质量优化偏好学习,实现忠实校准(FC),在保持准确性的同时显著提升LLM不确定性表达的忠实度。

Comments Code: https://github.com/yale-nlp/RLMF

详情

展开后加载摘要…

URL PDF HTML 收藏