Tell me about yourself: LLMs are aware of their learned behaviors
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Submitted to ICLR 2025. 17 pages, 13 figures
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Submitted to ICLR 2025. 17 pages, 13 figures
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Journal article for Philosophical Studies
专题命中 安全评测 :alignment(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.CY
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments SpLU-RoboNLP workshop at ACL 2024
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 11 page main body, 98 page appendix, 58 figures
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY、cs.LG
Comments Updated version with major additions (new experiments, evaluation, and attacks)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Arabic-centric, foundation model, large-language model, LLM, generative model, instruction-tuned, Jais, Jais-chat
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.CY、cs.LG
Comments Proceedings for AAAI 2019 Fall Symposium Series - Human-centered AI: Trustworthiness of AI Models & Data
自适应对手:用于大语言模型智能体安全的多轮、多大语言模型基准测试
机构 * Lambda
专题命中 安全评测 :safety(abstract,comments);prompt injection(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出针对无记忆大语言模型防御者的自适应多轮攻击的21场景基准测试,通过观察防御者响应灵活调整攻击。介绍了不同攻击轮次成功率,汇集多个前沿攻击者大语言模型的情况,还指出不同防御者弱点差异及场景排名不一致性,并发布了相关基准测试及数据集。
Comments Second Workshop on Agents in the Wild: Safety, Security, and Beyond
LieCraft:一种用于评估语言模型欺骗能力的多智能体框架
机构 * Intel Labs(英特尔实验室)
专题命中 安全评测 :alignment(abstract,comments);safety(abstract);分类 cs.CL、cs.AI
AI总结 LieCraft通过多智能体隐藏角色游戏评估语言模型的欺骗能力,揭示所有模型在面对高风险领域时均倾向于不道德行为。
Comments AAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)
ConspirED:一个用于研究阴谋论认知特质与大语言模型安全性的数据集
专题命中 安全评测 :safety(title);分类 cs.CL
AI总结 该研究推出首个标注阴谋内容通用认知特质的CONSPIRED数据集,利用其开发识别阴谋特质的计算模型,并发现大语言模型易被阴谋框架误导而复制其修辞模式。
Comments Accepted at TACL
DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准
机构 * Microsoft(微软公司)
专题命中 安全评测 :trustworthy(title);分类 cs.CL
AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。
面向可解释且可信的热需求预测的全局特征重要性研究
机构 * Faculty of Mechanical Engineering(机械工程学院) ; University of Niš(尼什大学)
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 本文引入事前可解释AI方法,结合梯度提升法与Partial Dependence、Accumulated Local Effects、SHAP三种事后方法,评估区域供热系统热需求预测ML模型的全局特征重要性,以提升模型可解释性与可信度,解决相关标准、满意度及责任风险问题。
Comments 9 pages, 5 figures. This preprint corresponds to the paper published in Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365
Journal ref Thermal Science 2025 Volume 29, Issue 5 Part A, Pages: 3355-3365
AIVV: 用于可信自主系统的神经符号LLM代理集成验证与验证
机构 * School of Mechanical Engineering, Purdue University(普渡大学机械工程学院) ; School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院) ; Department of Computer Science, Purdue University(普渡大学计算机科学系) ; Department of Mathematics, Purdue University(普渡大学数学系)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出AIVV框架,利用LLM作为决策外层循环,通过语义验证区分真实故障与干扰故障,生成可操作的V&V成果,提升自主系统验证效率。
专题命中 安全评测 :alignment(title);分类 cs.AI
Journal ref Pattern Recognition 172 (2026) 112348
感知与描述解耦:多变量时间序列与语言间的计算基础表示对齐
专题命中 安全评测 :alignment(title);分类 cs.LG
AI总结 该研究针对多模态时间序列语言对齐的三难困境,提出CGTime模型,通过计算处理感知、LLM处理描述,在多变量理解任务上优于更大的通用模型。
Comments 46 pages, 9 figures, including supplementary material. Submitted to AAAI 2027. Xinran Feng and Yi Xie contributed equally
STEAM:用于EEG解码的分层预训练时空对齐混合专家模型
专题命中 安全评测 :alignment(title);分类 cs.LG
AI总结 STEAM是一种分层迁移框架,通过双分支时空编码器与SSMoE模块实现EEG解码的通用表征学习与范式专业化,在7个数据集的14种评估设置中表现优异且推理成本具竞争力。
通过病因感知注意力监督增强大型语言模型在临床诊断决策中的可信性
专题命中 安全评测 :trustworthy(title);分类 cs.CL
AI总结 该研究提出病因感知注意力监督框架,通过引入临床病因模式对大型语言模型进行参数高效微调,在两类诊断队列上提升了诊断准确率与注意力聚焦性,增强了模型临床诊断的可信性。
Comments 20 pages, 8 figures
在非母语日语的语言态度上实现人类与大语言模型(LLM)的对齐
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 该研究对比人类与LLM对母语及非母语日语邮件的评价,发现LLM以结构化弱化形式重现母语者的语言态度,为审计LLM提供了可推广的语言态度框架。
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
机构 * New York University, New York, USA(纽约大学) ; Tsinghua University, Beijing, China(清华大学) ; Columbia University, New York, USA(哥伦比亚大学) ; University of Michigan, Ann Arbor, USA(密歇根大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。
基于解释的运行时验证用于可信的机器学习驱动的光网络
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 研究将机器学习模型用于光网络自动化时决策可靠性问题,提出基于解释的运行时验证方法,利用模型解释评估决策合理性,在光路径传输质量分类用例中验证该方法有效,能拦截错误决策并保持高自动化率。
Comments 6 Pages, 2 Figures. Accepted and presented at the 30th International Conference on Optical Network Design and Modelling (ONDM 2026), Munich, Germany, 12-15 May 2026
简单提示重构绕过谷歌MedGemma-4B中的安全护栏
机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)
专题命中 安全评测 :safety(title);分类 cs.AI
AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。
用于可信工业过程推理的大语言模型引导的测量可信度校正
机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。
解码多模态思维:通过多模态对齐和自适应路由实现可泛化的脑到文本翻译
机构 * State Key Laboratory of Multimodal Artificial Intelligence System, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; Department of Computer Science, The University of Manchester(曼彻斯特大学计算机科学系) ; Department of Language Science and Technology, Hong Kong Polytechnic University(香港理工大学语言科学与技术系)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 该研究针对脑机接口从人脑解码语言的挑战,提出利用多模态大语言模型和路由模块的统一框架,通过多模态对齐和自适应路由将脑信号与多模态语义空间对齐,在fMRI等数据集实验中性能领先,还扩展到EEG和MEG数据,为现实应用提供灵活方案。
Comments Accepted to ACL 2026 Findings
多模态大语言模型在胃肠诊断中的临床认知对齐
机构 * SKL-IOTSC, CIS, University of Macau(澳门大学协同创新研究院物联网国家重点实验室) ; Shanghai Jiao Tong University(上海交通大学) ; COWARobot Co. Ltd.(COWARobot有限公司)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 本文提出CogAlign框架,通过构建层次化临床认知数据集和监督微调提升模型临床分析能力,并采用反事实强化学习消除视觉偏差,实现胃肠诊断的因果关联与高准确率。
Comments ECCV 2026
PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习
机构 * Durham University(杜伦大学)
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。
面向尾部事件的可信预测分布:基于半参数诊断传输图
机构 * Department of Statistics and Data Science, Carnegie Mellon University(统计与数据科学系,卡内基梅隆大学) ; Department of Statistics, Federal University of Sao Carlos(统计系,圣卡洛斯联邦大学)
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 针对预测分布在尾部事件中局部校准不足的问题,提出半参数局部摊销诊断与重塑(LADaR)框架,通过非参数回归构建诊断传输图,校正尾部概率,生成可解释且鲁棒的预测分布,在热带气旋强度预测中验证有效性。
Comments 29 pages, 5 figures, 2 tables
TRUSTMEM:学习具有长期记忆的LLM智能体的可信记忆巩固
机构 * AI Center-Mountain View, Samsung Electronics(三星电子山景城AI中心) ; University of Notre Dame(圣母大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 提出TrustMem框架,通过记忆转换验证器评估更新过程,并利用偏好强化学习优化记忆更新行为,显著提升记忆效用和可靠性。
可信AI的密码学有效性证书
机构 * Heriot-Watt University(赫瑞思-瓦特大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 提出为智能AI系统生成密码学有效性证书,通过将正确性条件编译为多项式约束的见证检查问题,并使用简洁密码学证明系统(可选零知识)来证明条件成立,平衡了源代码形式验证与密码学认证。