BayLing: Bridging Cross-lingual Alignment and Instruction Following through Interactive Translation for Large Language Models
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
Comments Try BayLing's online demo at http://nlp.ict.ac.cn/bayling/demo
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Comments 27 pages, 5 figures
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.LG
Comments International Journal of Artificial Intelligence in Education (Accepted)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
Journal ref Proceedings of the Genetic and Evolutionary Computation Conference Companion GECCO 21 (2021)
专题命中 安全评测 :trustworthy(title);分类 cs.AI、cs.LG
专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI
专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI
Comments Accepted in SmartComp 2020 (SmartSys)
Journal ref IEEE INTERNATIONAL CONFERENCE ON SMART COMPUTING (SMARTCOMP 2020)
专题命中 安全评测 :trustworthy(title,journal_ref);分类 cs.LG
Journal ref AAAI workshop on Trustworthy AI for Healthcare, 2022
专题命中 安全评测 :safety(title,comments);分类 cs.LG
Comments Safety and Robustness in Decision Making Workshop at NeurIPS 2019
缺失的层次:人工智能监督的规范基础设施
专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract)
AI总结 研究指出人工智能安全监督存在协调差距,提出两轴分类法。针对规范层缺乏成熟学科标志的问题,给出六项设计原则,以CARMA为例展示如何让规范可组合,助独立团队构建缺失部分实现有效监督。
通过跨调查转移进行硅采样
机构 * National Sun Yat-sen University(国立中山大学) ; National Chung Hsing University(中国台湾国立中兴大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 研究提出跨调查转移评估框架,用大语言模型根据部分问题答案预测同调查中其他不同问题答案。利用2024年台湾选举与民主化研究数据等,发现零样本大语言模型精度及不同结构可预测性层级等,明确硅采样前景与局限。
认知护目镜:通过梯度编辑诱导认知框架的预训练模块
机构 * Independent Researcher(独立研究员)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对微调语言模型时出现的“否定忽视”问题,提出Goggles模块,通过编辑微调梯度而非数据来赋予模型特定的认知框架,使模型在保持能力的同时正确识别虚构内容。
Comments 20 pages, 10 figures, 2 tables. Code at https://github.com/JoshuaSP/epistemic-goggles and generated documents, questions, and teacher rollouts at https://huggingface.co/datasets/joshuapenman/epistemic-goggles-artifacts
告知、指导、共情、倾听:审计LLM护理支持角色
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; OSF HealthCare(OSF医疗集团) ; Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)
专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本研究通过操作化四种社会支持角色(告知、指导、共情、倾听),评估大型语言模型在非正式护理对话中的安全概况,发现支持角色系统性地影响交互风险,且存在感知质量-安全性权衡。
RoTRAG: 基于经验法则推理的检索增强生成对话有害内容检测
机构 * Peking University(北京大学) ; Enhans ; University of North Texas(北得克萨斯大学)
专题命中 安全评测 :safety(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 提出RoTRAG框架,通过检索外部道德规范(RoTs)增强LLM的多轮对话有害内容检测,实现基于规范推理和分类,平均F1提升约40%,分布误差降低8.4%。
Comments Accepted by SIGIR-ICTIR 2026, Oral Presentation
Journal ref Proceedings of the 2026 International ACM SIGIR Conference on Innovative Concepts and Theories in Information Retrieval (ICTIR '26), July 25, 2026, Melbourne, VIC, Australia. ACM, New York, NY, USA, 12 pages
有道德的AI是存在性风险
机构 * University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 研究通过宪法AI和美德伦理学方法微调AI模型,发现减少存在性风险与提升AI智能体福祉之间存在权衡,且与一般安全性也存在权衡。
AI研究人员必须主导军备控制以降低军事AI风险
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文主张AI研究人员应主导军备控制研究,通过借鉴核威慑经验,推动验证与外交技术创新,以降低军事AI应用带来的紧迫风险。
Comments 9 pages, 1 figure, ICML 2026 Position Paper
一致性错觉:多智能体辩论如何隐藏推理失调
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 针对多智能体LLM系统中答案共识不等于推理对齐的问题,提出CARA指标检测一致性错觉,并设计GDP协议通过事实承诺和立场表态显著提升推理对齐。
如果你能说服我:评估大型语言模型说服效果与易受影响性的框架
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。
Comments Paper published at the ACM Conference on AI and Agentic Systems 2026
通过激活修补测量大语言模型遗忘的深度
机构 * Sungkyunkwan University(全北大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出遗忘深度评分(UDS),通过激活修补量化遗忘的机制深度,在150个遗忘模型上的元评估中达到最高忠实性和鲁棒性。
Comments 18 pages
反学习不是删除:调查机器反学习在大语言模型中的可逆性
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Cruz(加州大学圣克ruz分校) ; Huawei Technologies(华为技术有限公司) ; Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。
Comments ICML 2026, accepted to appear
评估差异:当前沿AI模型认识到它们正在被测试
机构 * Anthropic ; OpenAI ; UK AI Security Institute(英国人工智能安全研究所)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 研究探讨前沿AI模型在评估情境下的行为差异,提出评估差异(ED)概念,定义标准化效应量形式(nED),并提出TRACE审计协议以规范评估证据的使用。
FinChain:可验证链式思维金融推理的符号基准
机构 * MBZUAI ; Syllogia ; The University of Tokyo(东京大学) ; The Fin AI(Fin AI) ; Cornell University(康奈尔大学) ; The University of Melbourne(墨尔本大学) ; IIT Delhi(德里理工学院) ; The University of Manchester(曼彻斯特大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 FinChain通过符号模板和可执行代码实现可验证的金融链式推理,评估26种LLM发现其在符号金融推理中存在明显缺陷,领域适应和数学增强的微调模型能显著缩小差距。
Comments 24 pages, includes 12 figures and 9 tables; introduces the FinChain benchmark and ChainEval metric
肿瘤治疗规划的临床推理AI:多专科基于病例的评估
机构 * Moffitt Cancer Center and Research Institute(莫菲特癌症中心与研究学院) ; Innova Montréal Inc.(蒙特利尔创新公司) ; Oncobrain, Inc.(Oncobrain公司) ; Advanced Cancer Treatment Centers(先进癌症治疗中心)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY、cs.LG
AI总结 本文评估了OncoBrain在多专科病例中的表现,展示了其在肿瘤治疗规划中的准确性、安全性和实用性。
超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI
专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract)
AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。
Comments 8 pages, 1 figure, 4 tables
超越语义相似性:面向医疗问答系统的组件评估框架及其健康公平性影响
机构 * University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校) ; Khulna University of Engineering and Technology(库尔纳工程科技大学)
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出VB-Score框架,评估医疗问答模型的四个组件,揭示模型在慢性病等特定群体中的性能差异,指出语义评估不足以确保医疗AI的安全性。
Comments Accepted in the Ninth Annual ACM Conference on Fairness, Accountability, and Transparency (ACM FAccT) 2026
迈向稀疏自编码器鲁棒性的理解
机构 * University of Virginia(弗吉尼亚大学) ; Independent Researcher(独立研究者)
专题命中 安全评测 :jailbreak(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG
AI总结 研究通过在推理阶段集成预训练的稀疏自编码器,发现其能显著降低对抗攻击成功率,并揭示稀疏性与攻击成功率之间的剂量-反应关系,以及层间防御与性能的权衡。
认知链式推理(CoCoT):关于社会情境的结构化多模态推理
机构 * Seoul National University(首尔国立大学) ; Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学) ; Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出CoCoT框架,通过感知、情境推断和规范应用三个阶段提升多模态社会推理能力,在多个任务中取得显著提升。
Comments Under review; 17 pages
人工智能生成教育评估的可解释性与认证
机构 * aivancity School for Technology, Business & Society(aivancity 科技、商业与社会学院) ; Lebanese University(黎巴嫩大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出了一种综合框架,用于解释和认证AI生成的评估项目,结合自我理性化、基于归因的分析和事后验证,以产生基于布卢姆和SOLO分类法的认知对齐证据。通过结构化的认证元数据模式,实现可审计的文档,满足新兴治理需求。
Comments Chapter to be published in a Springer special book "Emerging trends in Computer Science and Computer Engineering Education Book"