Where Do Models Find Happiness? Emotion Vectors in Open-Source LLMs
模型在哪里找到幸福?开源大语言模型中的情感向量
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
模型在哪里找到幸福?开源大语言模型中的情感向量
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。
HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减
机构 * ByteDance(字节跳动)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。
激进AI可解释性
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 借鉴激进解释哲学和机械可解释性工具,提出将AI系统解释为智能体的框架,解决如何从计算事实推断信念、欲望和意义的问题,并建立成功标准。
Comments Draft of manuscript to appear as Cambridge Element in the Philosophy of Artificial Intelligence
GCT-MARL: 基于图对比迁移的样本高效合作多智能体强化学习
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出GCT-MARL框架,利用多视图图对比学习和自适应加权对齐损失,结合两阶段训练协议,实现跨不同规模和组成群体的高效迁移,显著加速目标任务收敛。
Comments Accepted at The Continual RL Workshop, RLC 2026
基于LLM的两阶段Transformer框架用于跨域轴承故障诊断与有限数据
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出知识引导的两阶段迁移学习框架,使用轻量级GPT-2风格Transformer提取振动信号层次特征,通过原型知识调制和分类自适应实现跨域故障诊断,在仅10%标注数据下达到92.61%准确率。
Comments Accepted as a conference article of AIM 2026
PRIDE: 特权信息增强的共情对话生成蒸馏方法
机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。
自回归视觉模型的免训练语义校正
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。
旧小说,新皮肤:评估LLM在医疗保健中的操纵能力
机构 * ILINA Program(ILINA项目) ; Haki AI
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。
Comments 28 pages, 4 figures
测量持续存在的内容:AI智能体身份的调节机制与几何框架
机构 * Anisotrope AI
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。
Comments 29 pages, 6 figures, 8 tables
通过稀疏自编码器提取和分析视觉语言模型中的多模态概念
机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。
Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua
scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) ; School of Engineering, Westlake University(西湖大学工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。
Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。
双通道接地世界建模 (DCGWM):通过异构外部接地与内向梯度流结构性防止目标干扰崩溃
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出双通道接地世界建模(DCGWM),通过分区潜空间和内向梯度流,结构性防止联合嵌入预测架构中多目标接地导致的目标干扰崩溃。
Comments Position paper. Experimental validation in progress
通过智能体轨迹剖析模型行为
机构 * AWS AI Labs(AWS人工智能实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出“意图-执行差距”概念,并设计Simple Strands Agent(SSA)框架,通过分析138k条轨迹揭示模型在自主问题解决中的行为差异。
Comments 106 pages, 50 Figures, 16 Tables
注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用
机构 * National University of Singapore(新加坡国立大学) ; Center for AI Research, VinUniversity(Vin大学人工智能研究中心) ; Independent Researcher(独立研究者) ; Technical University of Munich(慕尼黑技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。
Comments Published at the International Conference on Machine Learning (ICML 2026)
基于上下文学习的深度学习工作负载迁移智能体框架
机构 * Google(谷歌)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。
Cloze:一个用于研究心理健康背景下人机对话的开放研究平台
机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) ; University College London(伦敦大学学院) ; Division of Digital Psychiatry(数字精神病学部)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY
AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。
Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0
AI素养工作坊成果与深度伪造参与中的性别差异
机构 * University of New South Wales(新南威尔士大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本研究通过统计回归分析澳大利亚中学生AI素养工作坊前后数据,发现男性在STEM职业兴趣上显著更高,女性更常使用AI工具,且工作坊后女性在AI知识和职业兴趣上提升更大,部分缩小了性别差距。
CAF-Gen: 一种用于丰富论证结构的多智能体系统
机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。
Comments Accepted for publication in the proceedings of ICCCI 2026
音频模型中解释的感知脆弱性:在预测不变的情况下操纵归因
机构 * University of Warsaw(华沙大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出一种心理声学框架,通过优化不可听扰动来解耦模型归因与分类,证明在音频深度伪造检测中可系统扭曲解释热图而保持预测标签不变。
Comments Accepted to the ICML 2026 Workshop on Machine Learning for Audio: 5 pages, 4 figures
假设冗余下的发现:发现瓶颈的几何理论
机构 * School of Economics and Management, Tsinghua University(清华大学经济管理学院) ; Platform & Content Group, Tencent(腾讯平台与内容事业群)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出搜索压缩假说,通过谱压缩、正交逃逸和残差信号对齐三个几何条件解释混合发现系统的优势,实验表明仅新颖性不足,需预测对齐。
Comments 23 pages, 1 figure, 27 tables
LLMs 能更好地捕捉人类判断——使用合适的提示
机构 * Complexity Science Hub, Vienna(维也纳复杂科学中心) ; The Ohio State University(俄亥俄州立大学) ; University of Cambridge(剑桥大学) ; University of Chicago(芝加哥大学) ; Microsoft Research(微软研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 通过简单提示策略,LLMs 能恢复人类反应的完整分布,并减少对措辞变化的敏感性,提升 AI-人类对齐。
PermDoRA -- 理解语言模型中的适配器干扰:参数空间几何的局限性
机构 * Independent Researcher(独立研究员)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究适配器组合中的干扰是否源于线性参数更新重叠,通过DoRA-RBAC框架和几何感知合并策略实验,发现参数空间几何不是干扰主因,而是共享非线性表示中的交互。
Comments 18 Pages, COLM 2026
人机协调区域:设计具有代理性AI的人机协同体验框架
机构 * Amazon Web Services(亚马逊网络服务)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 提出人机协调框架,通过显著性、参与度和活动三个维度定义协调区域,并提供输入分类、协调曲线和设计模式,用于生成、分析和沟通人机交互体验。
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
贡献权重:自注意力Transformer的几何分析
机构 * University of Cambridge(剑桥大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出基于投影的贡献权重度量,结合注意力权重、值向量大小和方向对齐,更准确识别关键令牌,并揭示注意力汇的主动抑制功能。
桥接传统可解释性方法与多模态多语言模型:基于XAI的分析
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出多模态Shapley值框架,结合频谱图引导的音素对齐(SGPA)预处理方法,实现文本与音频特征的可解释性归因,并开源计算包与可视化工具。
Comments Bachelor's thesis
mllm-shap:面向文本-音频多模态大语言模型的Shapley值可解释性平台
机构 * Warsaw University of Technology(华沙理工大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出mllm-shap框架,通过模态感知掩码、多轮对话追踪和音素对齐分组技术,将Shapley值可解释性扩展到文本-音频多模态大语言模型,并实现10-50倍的计算加速。
Comments Submitted to ACL2026
SV-Detect: 基于引导向量的AI生成文本检测
机构 * Independent Researcher(独立研究者) ; Queen Mary University of London(伦敦女王学院)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出从冻结语言模型的隐藏表示中提取引导向量,通过层间投影特征训练轻量分类器,实现跨域、跨模型和编辑攻击下的机器生成文本检测。
通过潜在视角评估LLM中的多元主义
机构 * University of Helsinki(赫尔辛基大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 其他安全 :alignment(abstract,comments);分类 cs.CL
AI总结 提出一种领域无关的多层无监督框架,从LLM生成文本中提取潜在视角,评估多元主义差距,发现稀有视角仍被不成比例地低估。
Comments Pluralistic Alignment Workshop @ ICML 2026