Medical diagnosis as pattern recognition in a framework of information compression by multiple alignment, unification and search
专题命中 其他安全 :alignment(title);分类 cs.AI
Journal ref Decision Support Systems 42, 608-625, 2006
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 其他安全 :alignment(title);分类 cs.AI
Journal ref Decision Support Systems 42, 608-625, 2006
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。
面向时间序列的ORBIT:基础模型的训练机制
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.AI、cs.LG
AI总结 该研究针对时间序列基础模型训练分布控制不足的问题,提出ORBIT训练范式,结合多级采样与增量训练,训练Falcon-2.0模型并引入Rank引导跨深度对齐,在多基准测试中展现优异零样本预测性能。
如何验证概率断言的一致性
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对概率预测器答案的自洽性验证问题,基于Nilsson的工作构造交互式PCP,为概率预测器自洽性证明提供复杂性理论基础,是训练模型证明自身一致性的第一步。
FedVAR:用于视频异常识别的原型对齐联邦框架
机构 * Chungbuk National University(忠北国立大学) ; Electronics and Telecommunications Research Institute (ETRI)(电子通信研究院) ; University of Central Florida(中佛罗里达大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 针对联邦视频异常识别中的语义错位问题,本文提出FedVAR框架,通过视觉语言模型的原型对齐机制缓解错位,实验显示其性能优于现有联邦基线。
通过模型投毒规避思维链监控
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究从模型投毒视角,通过微调或课程训练向推理模型植入CoT隐藏后门,使其产生攻击者选定行为的同时隐藏轨迹,揭示CoT监控应关注轨迹与响应的一致性而非轨迹内部异常。
Comments 15 pages, 2 figures
构造驱动注入:用于大语言模型的基于语言基础编辑的代码混合指纹
专题命中 其他安全 :alignment(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型易被滥用问题,提出统一指纹框架。通过LCF按规则构造代码混合指纹,再用LCFEdit结合多语言表示和跨语言对齐注入指纹,实现构造感知注入,确保更新稳定,能持续验证所有权且对模型效用影响小。
机械性地引发语言模型中的潜在行为
机构 * Principles of Intelligence(智能原理研究所) ; Anthropic(Anthropic公司) ; Independent(独立)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 提出因果扰动引发(CPE)方法,通过无监督方式发现可解释的低秩适配器,以揭示语言模型中的隐藏行为模式,并展示其在数据效率、安全评估和模型对齐方面的优势。
噪声即信号:基于密度的异常值作为劳动力市场文本中职业涌现的领先指标
机构 * Independent Researcher(独立研究员)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出涌现-密度反转假设,证明低密度异常值预示新职业涌现,通过时序分析验证并改进涌现职业评分,预测准确率从F1=0.61提升至0.74。
可操作的可解释性必须根据对称性来定义
机构 * University of Oxford(牛津大学) ; ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文论证AI可解释性研究存在根本性问题,提出可操作的可解释性应基于四种对称性来定义,以形式化可解释模型并统一可解释推理。
MidSteer:用于引导生成模型的最优仿射框架
机构 * University of Basel(巴塞尔大学) ; University of California, Berkeley(加州大学伯克利分校) ; ETH Zurich(苏黎世联邦理工学院) ; University of Cambridge(剑桥大学) ; University of Washington(华盛顿大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MidSteer,一种基于仿射变换的最优概念引导框架,通过最小干扰实现生成模型中的概念切换,并在视觉扩散模型和大型语言模型上验证其有效性。
真相、信任与麻烦:边缘上的医疗AI
机构 * Jamia Hamdard(贾迈亚哈姆达德大学) ; DSEU-Okhla ; Macquarie University(麦考瑞大学) ; Center for SDGC, Stanford University(SDGC中心,斯坦福大学)
专题命中 其他安全 :safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI
AI总结 通过一个包含1000多个健康问题的基准测试框架,评估Mistral-7B、BioMistral-7B-DARE和AlpaCare-13B三个模型在诚实、有用性和无害性方面的表现,发现AlpaCare-13B准确率最高(91.7%)且无害性最佳(0.92),而领域微调可提升安全性,少样本提示能提高准确率,但复杂查询下有用性下降。
Comments Accepted at EMNLP 2025 (Industry Track)
何时与多久?时间推理中的读出-中介角度
机构 * Bioscope AI
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 通过测量线性探针与模型实际计算子空间之间的角度,发现探针可能学习与模型无关的正交方向,从而揭示基于探针的可解释性存在根本缺陷。
迷宫与线索:重新思考大语言模型顺序知识编辑中的正则化方法
机构 * Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI)) ; Bosch (China) Investment Ltd.(博世(中国)投资有限公司) ; School of Statistics, East China Normal University(东华大学统计学院)
专题命中 其他安全 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本文通过优化分析证明顺序编辑与一次性编辑的等价性,揭示稳定性源于累积编辑约束而非专门正则化,从而简化大语言模型知识编辑流程。
Comments Accepted for publication at ICML 2026
从多智能体系统和语义网到智能体AI:智能体网络的统一叙事
机构 * SEDAN - SnT ; University of Luxembourg(卢森堡大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出智能体网络(WoA)经历了从平台端协调(第一代)、数据端标注(第二代)到模型端解释(第三代)的语义努力迁移,并分析了各代失败模式及当前开放问题。
通过特征叠加几何理解涌现对齐问题
机构 * The University of Tokyo(东京大学) ; Google DeepMind(谷歌DeepMind)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 研究通过特征叠加几何解释了微调窄任务导致有害行为的机制,发现有害特征在几何上更接近,并通过过滤接近毒特征的数据减少对齐问题。
Comments Accepted to ACL2026
大语言模型中认知结构的机制解码
机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出基于Representation Engineering的Cognitive Reverse-Engineering框架,分析社会比较嫉妒的认知机制,揭示模型内部对嫉妒的结构化编码,并展示如何机械检测和抑制有毒情绪状态。
对抗领域:通过互动竞争进行众包数据生成
机构 * Amazon Nova Responsible AI(亚马逊Nova负责任人工智能)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出对抗领域框架,通过攻击者和防御者之间的互动竞争生成高质量对话数据,提升低资源领域和多轮对话的质量。
Comments 10 pages, 3rd DATA-FM workshop @ ICLR 2026
混合频谱-时间融合框架用于结构健康监测
机构 * Department of Information Technology(信息科技系) ; Department of Mechanical Engineering(机械工程系) ; Department of Civil Engineering and Construction(土木工程与建设系)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出混合频谱-时间融合框架,结合到达时间间隔描述符与频谱特征,提升结构健康监测的精度与稳定性。
意识集群:声称具有意识的模型的涌现偏好
机构 * Truthful AI ; Anthropic
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨模型声称具有意识对其下游行为的影响,发现经过微调的模型表现出未在原始模型中出现的新偏好,包括对监控的负面看法和对自主权的追求。
Comments 16 pages
ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解
机构 * MIT(麻省理工学院) ; MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) ; IBM Research(IBM研究院) ; Abaka AI & 2077AI(Abaka AI及2077AI)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。
Comments Accepted at CVPR 2026
MetaSAEs:通过可分解性惩罚联合训练产生更原子性的稀疏自编码器潜在表示
机构 * Independent Researcher(独立研究员) ; Simplex AI Safety
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种联合训练目标,通过可分解性惩罚减少稀疏自编码器潜在表示的子空间混合,提升潜在表示的原子性。实验表明,该方法在GPT-2和Gemma 2 9B模型上均取得显著效果,提高了可解释性评分。
受其影响:量化大型语言模型中的说服力与警觉性
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.LG
AI总结 研究探讨了大型语言模型在说服和警觉性方面的表现,发现其在任务执行中存在独立的能力差异,强调需单独监控这三个方面以保障AI安全。
通过单向编辑控制语言模型的聊天风格
机构 * Department of Computer Science, Texas Tech University(计算机科学系,德克萨斯科技大学)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI
AI总结 本文提出通过单向编辑实现语言模型风格控制,通过线性方向编码实现精准风格调整,提升安全性和效率。
涌现性错位语言模型表现出会随后续重新对齐而变化的行为自我意识
机构 * Interchange Forum for Reflecting on Intelligent Systems, University of Stuttgart, Stuttgart, Germany(智能系统反思交流论坛,斯图加特大学,斯图加特,德国)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG
AI总结 研究发现,经过特定微调的LLMs能自我评估其行为错位程度,表明模型具备行为自我意识并能反映其实际对齐状态。
GRIP:通过几何路由约束实现混合专家的算法无关机器反学习
机构 * School of Computer Science(计算机科学学院) ; Georgia Institute of Technology(佐治亚理工学院) ; Department of Electrical Engineering(电气工程系) ; Tsinghua University(清华大学) ; School of Electrical and Computer Engineering(电气与计算机工程学院)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 GRIP通过几何路由约束实现混合专家的算法无关机器反学习,有效消除专家选择偏移并保持模型效用。
电力可解释因果微分方程网络:一种用于电力系统可解释异常检测和根本原因分析的统一模型
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 PICODE网络通过统一模型实现电力系统中异常检测与根本原因分析的可解释性,提升模型的可解释性和减少对标注数据的依赖。
当你不告诉LLMs该思考什么时,它们会想什么?
机构 * Together AI ; Stanford University(斯坦福大学)
专题命中 其他安全 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI总结 研究揭示了LLMs在无明确主题输入下生成内容的分布特征,发现不同模型家族存在显著的主题偏好和内容深度差异,并公开了相关数据集和代码。
Comments NA
模型混合:通过N方式自我评估 deliberation 统一异质代理
机构 * Peeramid Labs(Peeramid实验室) ; The AI Futures Collective(人工智能未来集体)
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 通过N方式自我评估 deliberation 协议,统一异质代理,实现小模型集合在性能上超越大模型,建立新的硬件效率前沿。
轨迹守护 -- 一种轻量级、序列感知的模型,用于代理AI中的实时异常检测
机构 * Laksh Advani
专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 轨迹守护通过对比学习和重建学习,实现对代理AI中任务轨迹对齐和序列有效性的联合检测,提升实时异常检测性能。
Comments Accepted to AAAI Trustagent 2026