PLURAL: A Global Dataset for Value Alignment
PLURAL:一个用于价值对齐的全球数据集
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
PLURAL:一个用于价值对齐的全球数据集
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究针对大语言模型反映西方价值观问题,引入基于IVS的PLURAL数据集,通过两阶段管道生成偏好三元组,经三种方式评估,结果显示其含价值引导可学习信号,能为多元对齐提供资源。
精神病院:一个用于评估精神科临床问诊的虚拟环境
机构 * School of Computer Science, Chongqing University(重庆大学计算机科学学院) ; School of Computer Science, Hunan University(湖南大学计算机科学学院)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI
AI总结 研究针对大语言模型在精神科临床问诊评估不足的问题,引入MentalHospital虚拟环境,实例化S.O.A.P.工作流程,用双轨协议评估,开发MentalEval,经测试其具有临床保真度且与专家高度一致,指出大语言模型在精神状态评估上落后临床医生。
对齐合理性:确保医疗保健领域人工智能的新标准
专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.AI
AI总结 研究探讨大语言模型在医疗保健领域的安全问题,提出需在价值规范、训练、监督三层面进行对齐以实现结构安全,进而产生对齐合理性这一监管结构,为论证AI与健康结果的关系提供方式。
Comments 8 pages, 1 figure
当你只有合成语音时:最好调用GRPO
专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究基于大语言模型的ASR在受监管领域因隐私问题受限,转向强化学习,用GRPO方法处理合成语音,相比监督微调,GRPO能大幅降低WER,还分析了GRPO的优势及收益来源,表明合成语音为主时强化学习更优。
Comments Submitted to SLT 2026
说服攻击会降低思维链监测的有效性
机构 * LASR Labs(LASR实验室) ; University College London(伦敦大学学院) ; Google DeepMind(谷歌DeepMind)
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究 CoT 监测在对抗性说服攻击下的有效性,设计评估框架发现其单独使用不足以抵御攻击,引入事实核查监测框架,不同模型家族配对可有效减少违反政策行动批准,为 CoT 监测抗攻击提供有力缓解措施。
Comments 25 pages, 10 figures
强化多模态掩码扩散模型的生成顺序
机构 * University of California, Los Angeles(加州大学洛杉矶分校) ; AGI Foundations for AWS(AWS强化人工智能基础)
专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 研究文本到图像合成及多模态理解中生成顺序的优化,引入经组相对策略优化训练的可学习控制模块,提升了DLMs的文本到图像对齐和多模态理解能力,在相关基准测试中取得显著改进。
谁来分析分析器?使用结构化元安全分析过程的自验证大语言模型风险分析
专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG
AI总结 研究针对大语言模型辅助安全分析工具自身缺乏分析的问题,提出结构化元安全分析过程,通过运行元安全分析过程推导治理章程,包含21条工具原则和8条元安全原则,还报告了自推导等四个发现。
从提示到契约:用于可审计企业大语言模型代理的 harness 工程
机构 * AI Leadership Research Center(人工智能领导力研究中心)
专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI
AI总结 研究针对企业大语言模型应用从原型到产品化的需求,提出 harness 工程方法,在韩国企业数据切片上实例化并评估三个问题,包括契约保留、模型替换检查及代码执行效果,形成可将原型转为可审计应用的工程模式。
Comments 32 pages, 6 figures, 16 tables. Reference implementation and evaluation artifacts: https://github.com/hammerbaki/enterprise-llm-agent-harness (archived at https://doi.org/10.5281/zenodo.21269426)
提炼学生的走向:用于英语-证据跨语言检索增强生成的教师正则化强化学习
机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程系) ; Ant International, Ant Group(蚂蚁集团蚂蚁国际) ; Shanghai Innovation Institute(上海创新研究院) ; Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)
专题命中 安全训练 :safety(abstract);分类 cs.CL
AI总结 研究英语证据跨语言检索增强生成中的问题,提出教师正则化强化学习方法TR-RAG,结合奖励优化与策略内蒸馏,引入奖励分解,在多基准测试中提升语言依从性和证据正确性。
Comments 42 pages, 19 figures, 16 tables
OmniOPSD:面向情感计算的理性特权在线自蒸馏
机构 * Shenzhen University(深圳大学) ; Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; University of Science and Technology of China(中国科学技术大学) ; Shenzhen Technology University(深圳技术大学) ; Tongji University(同济大学) ; Huawei(华为)
专题命中 安全训练 :safety(abstract)
AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。
通过内部归因图对大语言模型越狱进行机制性可解释性研究
机构 * Department of Computer Science, University of South Dakota(南达科他大学计算机科学系) ; School of Information and Artificial Intelligence, Yangzhou University(扬州大学信息与人工智能学院)
专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI
AI总结 研究大语言模型越狱漏洞,通过构建内部计算图揭示对抗攻击引发的内部推理转变,提出统一框架实现因果诊断,实验证明计算图偏差与不安全行为相关,干预可提升模型鲁棒性。
Prismata:限制Web代理中的跨站提示注入
机构 * UC Berkeley(加州大学伯克利分校)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 研究针对Web代理跨站提示注入问题,提出Prismata防御机制,通过动态信任推导生成权限标签,结合机械限制执行标签,无需开发者注释,能有效降低攻击成功率并保留良性任务效用。
人类与大语言模型集合的对抗性社会认识论
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 研究人类与大语言模型集合在密集互动交流场景中的信息问题,提出对抗性社会认识论,借助语言、机制及基于认知网络的 machinery 来分析、破坏信任并审计纠正信任违规。
Comments 50 pages
用于在与语言模型交互中保护敏感数据隐私的多智能体防火墙架构
机构 * Universidad Carlos III de Madrid(卡洛斯三世大学)
专题命中 隐私与版权 :prompt injection(abstract);分类 cs.AI
AI总结 针对大语言模型集成到工作流程中缺乏保障措施的风险,提出开源多智能体防火墙架构,结合浏览器扩展和代理拦截流量,通过混合方法防止数据泄漏,分层架构可跨异构环境部署,最佳配置下F1分数达94.93%。
反馈操纵正则化:实现用于模仿学习的离线智能体对齐
专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI、cs.LG
AI总结 研究聚焦强化学习智能体行为与人类价值观对齐。提出反馈操纵正则化算法,利用评估反馈校正模仿学习策略。通过改编安全体育馆环境测试,该方法能提升适应性、减少对齐错误,在有限数据下也保持稳健。
大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器
专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。
Journal ref IEEE Transactions on Affective Computing (2026)
一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架
机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) ; Università degli Studi di Trieste(的里雅斯特大学) ; Vanderbilt University(范德堡大学)
专题命中 安全评测 :safety(title,abstract);分类 cs.AI
AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持
可扩展且可信的地球观测基础模型
机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。
Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods
从组合优化视角看可信机器学习:综述与研究展望
机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)
专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG
AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。
Comments 67 pages, 16 mathematical highlights
使用任务向量进行功能和安全代码生成
机构 * KTH Royal Institute of Technology(皇家理工学院)
专题命中 安全评测 :alignment(abstract);harmlessness(abstract);trustworthy(abstract);分类 cs.LG
AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。
论非 GPU 人工智能加速器在大模型推理中的局限性:基于华为昇腾的 MoE 和多模态服务的实地研究
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 研究非 GPU 人工智能加速器在大模型推理中的局限性,通过在华为昇腾系统上部署两个大型推理工作负载进行实地研究,总结平台八类限制及原因,量化相关指标,为评估或操作此类加速器的团队提供可重复参考。
通过八卦和虚拟投票实现安全的去中心化联邦学习
机构 * Columbia University(哥伦比亚大学)
专题命中 安全评测 :safety(abstract);分类 cs.LG
AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。
迈向肝细胞癌的精准治疗:用于风险分层和治疗指导的临床推理大语言模型
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI
AI总结 研究针对肝细胞癌治疗问题,提出HCC-STAR临床推理大语言模型。通过处理电子病历叙述输出风险分层、治疗方案等。经多中心队列验证,性能领先,能助医生决策,是可靠的肝细胞癌风险分层和精准治疗决策支持系统。
重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。
Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing
代理创建,我们验证:用于代理工件生成的轻量级框架
机构 * Microsoft(微软)
专题命中 安全评测 :alignment(abstract);分类 cs.AI
AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。
用于开放词汇量内镜组合式指称分割的属性检索
机构 * Virginia Commonwealth University(弗吉尼亚联邦大学) ; King’s College London(伦敦国王学院) ; University at Buffalo(纽约州立大学布法罗分校) ; Harvard Medical School(哈佛医学院)
专题命中 安全评测 :alignment(abstract)
AI总结 该研究针对内镜图像指称分割面临的挑战,引入ReferEndoscopy基准,提出AR-ERIS框架,利用属性检索进行开放词汇量内镜组合式指称分割,在模拟和真实内镜数据上实现最优性能且泛化能力强。
分析师如何在高风险犯罪关联中使用人工智能:一项行业研究
专题命中 安全评测 :trustworthy(abstract)
AI总结 研究探讨分析师在高风险犯罪关联中如何用AI,通过与英国执法机构合作开发工具并进行混合方法可用性研究,发现分析师有选择地用AI预测且常验证,还关注模型特征,强调AI决策支持工具要整合解释与传统方法及现场评估的重要性。
Comments 12 pages, 6 figures, FSE Industry
UniRef-UAV:无人机图像通用指称的多模态基准测试
机构 * School of Automation, Northwestern Polytechnical University(自动化学院,西北工业大学) ; College of Missile Engineering, Rocket Force University of Engineering(导弹工程学院,火箭兵工程大学) ; School of Artificial Intelligence, Chongqing University of Posts and Telecommunications(人工智能学院,重庆邮电大学)
专题命中 安全评测 :alignment(abstract)
AI总结 该研究针对无人机视觉定位面临的问题,引入通用指称任务,构建UniRef-UAV多模态基准测试,提出UAV-URNet检测式基线方法。实验表明该基线稳定可重复,多模态查询能减少模糊性,相关资源将公开助力可重复研究。
从应用层模拟到原生元架构:结构张力作为异构人工智能进化的内生驱动因素
机构 * Shanghai Lixin University of Accounting and Finance(上海立信会计金融大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 研究针对大语言模型无状态需应用层模拟的问题,提出理论框架,引入结构张力、离线循环回路、推理时可塑性三种机制,使模型实例能演化出不同拓扑结构,构成异构智能生态,重新定位治理为架构智能主要标准。
Comments 17 pages, 1 equation, no figures
Aleena:用于研究软件工程协作的对齐代理
机构 * eScience Institute(eScience研究院) ; University of Washington(华盛顿大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.AI
AI总结 研究软件协作中决策易失依据致相关人员心智模型不同,提出智能AI可支持对齐与跟踪。介绍开源的Aleena,以GitHub为协作平台,转化交互为结构化记录,揭示风险等,还阐述其动机、设计、原型及场景。
Comments 8 pages, 5 figures. AgenticSE @ KDD '26: Agentic Software Engineering (SE 3.0): The Rise of AI Teammates, KDD 2026 Workshop