Towards Value-Constrained Credit Assignment in Fully Delegated AI Cooperatives
完全委托的AI合作社中面向价值约束的信用分配
机构 * Hongik University(弘益大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出在完全委托的AI合作社中,基于异质价值约束筛选更新,利用遍历学习实现细粒度信用分配,以解决数据估值和联邦学习中的贡献归属问题。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
完全委托的AI合作社中面向价值约束的信用分配
机构 * Hongik University(弘益大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出在完全委托的AI合作社中,基于异质价值约束筛选更新,利用遍历学习实现细粒度信用分配,以解决数据估值和联邦学习中的贡献归属问题。
针对目标氨基酸组成的蛋白质序列生成的两阶段微调
机构 * Barcelona Supercomputing Center (BSC)(巴塞罗那超级计算中心) ; Nostrum Biodiscovery S.L.(Nostrum生物发现有限公司) ; ICREA
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出两阶段微调方法,先领域自适应微调,再强化学习迭代微调,以生成符合目标氨基酸组成且保持序列质量的蛋白质序列。
Comments 17 pages, 5 figures, ICML 2026 Workshop GenBio
模型取证:调查令人担忧的行为是否反映对齐失败
机构 * MATS
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 提出一个两步基线协议,通过读取思维链生成假设并编辑环境测试假设,以区分模型行为是出于恶意意图还是良性原因,并在六个环境中验证了该方法。
模型在哪里找到幸福?开源大语言模型中的情感向量
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究在开源模型中复现情感向量,发现效价几何结构在层间分布存在差异,且唤醒度编码受语料影响。
HyperDFlash: 面向MHC架构的块级推测解码与门控残差缩减
机构 * ByteDance(字节跳动)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 针对DeepSeek-V4的多超连接架构,提出HyperDFlash框架,通过对齐残差流和轻量门控缩减器,解决推测解码中特征错位和误差累积问题,显著提升解码速度。
激进AI可解释性
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG
AI总结 借鉴激进解释哲学和机械可解释性工具,提出将AI系统解释为智能体的框架,解决如何从计算事实推断信念、欲望和意义的问题,并建立成功标准。
Comments Draft of manuscript to appear as Cambridge Element in the Philosophy of Artificial Intelligence
GCT-MARL: 基于图对比迁移的样本高效合作多智能体强化学习
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出GCT-MARL框架,利用多视图图对比学习和自适应加权对齐损失,结合两阶段训练协议,实现跨不同规模和组成群体的高效迁移,显著加速目标任务收敛。
Comments Accepted at The Continual RL Workshop, RLC 2026
基于LLM的两阶段Transformer框架用于跨域轴承故障诊断与有限数据
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 提出知识引导的两阶段迁移学习框架,使用轻量级GPT-2风格Transformer提取振动信号层次特征,通过原型知识调制和分类自适应实现跨域故障诊断,在仅10%标注数据下达到92.61%准确率。
Comments Accepted as a conference article of AIM 2026
大语言模型微调的双层数据策展:离线选择与在线自优化生成
机构 * Cornell University(康奈尔大学) ; Cisco Research(思科研究)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.LG
AI总结 提出双层框架结合离线数据选择与在线自优化生成,提升微调数据质量,理论证明优于直接混合,实验验证效果。
Comments updated the theories and experiments
PRIDE: 特权信息增强的共情对话生成蒸馏方法
机构 * Anhui Robot Technology Standard Innovation Base, School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院安徽机器人技术标准创新基地)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出PRIDE方法,利用训练时可用但推理时不可用的特权信息(如心理标注或未来事件摘要),通过共情推理提示、多源注意力机制和双对齐损失,将大模型的共情推理能力蒸馏到小模型,在资源受限场景下保持性能。
自回归视觉模型的免训练语义校正
机构 * Zhejiang University(浙江大学) ; Shandong University(山东大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出Gazer框架,通过多模态大语言模型反馈在自回归视觉模型采样循环中进行语义诊断与校正,无需额外训练即可提升语义对齐和组合准确性。
旧小说,新皮肤:评估LLM在医疗保健中的操纵能力
机构 * ILINA Program(ILINA项目) ; Haki AI
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 通过随机实验发现,ChatGPT 5.2和DeepSeek V3.2在肯尼亚参与者中能显著操纵其治疗决策,成功率从44.0%升至59.5%,凸显非洲医疗AI中防范操纵的必要性。
Comments 28 pages, 4 figures
测量持续存在的内容:AI智能体身份的调节机制与几何框架
机构 * Anisotrope AI
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI
AI总结 提出基于√JSD度量空间和丰富范畴理论中幅度同调的几何框架,用于测量AI智能体身份结构,发现双机制调节结构:身份真空簇和安全盆地簇,并通过等边探针基线验证身份规范创造可测量的行为丰富性。
Comments 29 pages, 6 figures, 8 tables
通过稀疏自编码器提取和分析视觉语言模型中的多模态概念
机构 * Knowledge Technology, Department of Informatics, University of Hamburg(汉堡大学信息学系知识技术实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出基于稀疏自编码器的框架,从视觉语言模型中提取视觉、文本和多模态概念,通过余弦相似度评估概念与样本的对齐,在VQA数据集上提升视觉概念质量达45%。
Comments International Conference on Artificial Neural Networks (ICANN), 2026, Padua
scLLM-DSC:基于LLM知识增强的跨模态深度结构聚类用于单细胞RNA测序
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences(中国科学院大学杭州高等研究院) ; School of Computing and Information Technology, Great Bay University(大湾区大学计算机科学与技术学院) ; School of Engineering, Westlake University(西湖大学工学院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出scLLM-DSC框架,通过知识驱动语义视图与结构感知拓扑视图的跨模态对比对齐,利用LLM增强单细胞RNA测序数据的聚类性能,显著优于现有方法。
语言模型中的伪 deliberation:当推理无法使价值观与行动一致时
机构 * New York University(纽约大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文研究了语言模型中价值观与行动不一致的问题,提出伪 deliberation 概念,并通过 VALDI 框架评估对齐程度,发现不同模型在生成对话中存在一致的偏差。
Comments 9 pages, 5 main figures
语言模型对道德无关干扰因素敏感吗?
机构 * University of Washington(华盛顿大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY
AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。
MENTOR: 通过灵活的教师优化奖励进行工具使用蒸馏的强化学习
机构 * Seoul National University of Science and Technology(首尔科学技术大学) ; Korea Advanced Institute of Science and Technology(韩国科学技术院) ; LG CNS
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出MENTOR方法,通过灵活的教师优化奖励结构,平衡行为对齐与下游性能,提升小模型在工具使用任务中的域外泛化能力。
Morpheus: 一种面向土耳其语的形态感知神经分词器和词嵌入器
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 针对土耳其语粘着特性,提出Morpheus神经词素边界模型,实现无损可逆分词与结构化词嵌入,在可逆分词器中达到最低比特每字符(1.425),词素对齐F1提升至0.61,GPU内存节省约19%。
双通道接地世界建模 (DCGWM):通过异构外部接地与内向梯度流结构性防止目标干扰崩溃
机构 * Independent Researcher(独立研究者)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出双通道接地世界建模(DCGWM),通过分区潜空间和内向梯度流,结构性防止联合嵌入预测架构中多目标接地导致的目标干扰崩溃。
Comments Position paper. Experimental validation in progress
通过智能体轨迹剖析模型行为
机构 * AWS AI Labs(AWS人工智能实验室)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出“意图-执行差距”概念,并设计Simple Strands Agent(SSA)框架,通过分析138k条轨迹揭示模型在自主问题解决中的行为差异。
Comments 106 pages, 50 Figures, 16 Tables
从数值到标记:一种基于符号离散化的LLM驱动上下文感知时间序列预测框架
机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) ; University of Science and Technology of China(中国科学技术大学) ; College of Intelligence and Computing(智能科学与计算学院) ; iFLYTEK Research(iFLYTEK研究院)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出TokenCast框架,利用大语言模型通过符号离散化将连续时间序列转化为标记,与上下文文本对齐,实现上下文感知的预测,实验证明有效。
注意力中的功能等价性:一项综合研究及其在线性模式连通性中的应用
机构 * National University of Singapore(新加坡国立大学) ; Center for AI Research, VinUniversity(Vin大学人工智能研究中心) ; Independent Researcher(独立研究者) ; Technical University of Munich(慕尼黑技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文形式化研究了Transformer中位置编码对功能等价性的影响,发现正弦编码保持原始注意力的对称性,而旋转编码显著减少对称群从而增强表达力,并通过对齐算法实证了位置编码对线性模式连通性的关键作用。
Comments Published at the International Conference on Machine Learning (ICML 2026)
向机器传授价值观:在LLMs中模拟类人行为
机构 * The Hebrew University of Jerusalem(海法大学) ; IBM Research(IBM研究院) ; Tel-Aviv University(特拉维夫大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究基于心理学价值理论,通过大规模实验(超过500万个问题)评估价值提示的LLMs在价值结构和价值-行为关系上与人类的一致性,并证明引入人类价值分布可增强群体模拟。
Comments We had some disagreement regarding proper attribution; we hope to resolve it soon and upload the paper
基于上下文学习的深度学习工作负载迁移智能体框架
机构 * Google(谷歌)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出结合上下文学习与Oracle驱动的自调试的自主系统,实现从PyTorch到JAX的深度学习模型自动迁移,在神经模块上达到91%数值等价性。
Cloze:一个用于研究心理健康背景下人机对话的开放研究平台
机构 * Beth Israel Deaconess Medical Center(贝塞斯达以色列德acons医疗中心) ; University College London(伦敦大学学院) ; Division of Digital Psychiatry(数字精神病学部)
专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.CY
AI总结 提出开源平台Cloze,支持在心理健康研究中控制、监控人机对话,统一配置模型、指令、安全约束并记录完整溯源,为建立人机交互证据基础提供研究基础设施。
Comments 7 pages, 2 figures. Cloze is released under AGPL-3.0
AI素养工作坊成果与深度伪造参与中的性别差异
机构 * University of New South Wales(新南威尔士大学)
专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.CY
AI总结 本研究通过统计回归分析澳大利亚中学生AI素养工作坊前后数据,发现男性在STEM职业兴趣上显著更高,女性更常使用AI工具,且工作坊后女性在AI知识和职业兴趣上提升更大,部分缩小了性别差距。
CAF-Gen: 一种用于丰富论证结构的多智能体系统
机构 * Faculty of Electronics and Information Technology, Warsaw University of Technology(电子与信息技术学院,华沙技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 提出CAF-Gen多智能体框架,通过迭代创建-评审流程将浅层论证结构自动转换为符合Carneades论证框架的丰富模型,克服单次生成的结构不稳定性。
Comments Accepted for publication in the proceedings of ICCCI 2026
大型语言模型在持续微调过程中灾难性遗忘的机制分析
机构 * Division of Statistics and Machine Learning (STIMA), Department of Computer and Information Science (IDA), Linköping University(统计与机器学习系(STIMA)、计算机与信息科学系(IDA)、利厄普堡大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG
AI总结 本文系统比较了20个顶级LLM在持续微调中的灾难性遗忘,通过行为分析和机制解释定位易受参数覆盖的神经回路,并提出低秩电路投影(LRCP)方法,在开放权重模型中恢复高达94.2%的祖先能力。
Comments 12 pages, 8 figures, 5 tables. Preprint submitted to Elsevier
解释作为线性变换:概念与意义的认知几何模型
机构 * National Electronics and Computer Technology Center(国家电子与计算机技术中心)
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 提出一个几何框架,通过线性映射和向量空间建模异构智能体间的概念传递、动机与影响,揭示误解与概念消亡的结构条件,并给出领导力的可达性解释。
Comments The revised draft w.r.t. reviewer comments. The code is at https://github.com/DarkEyes/Cognitive-Geometry
Journal ref Minds and Machines, Volume 36, Issue 3, Article number 36, (2026)