Competing Visions of Ethical AI: A Case Study of OpenAI
伦理AI的两种视角:OpenAI案例研究
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本研究通过分析OpenAI的公共论述,发现其在伦理AI领域更强调安全性和风险,而非学术或倡导伦理框架。
Comments iConference 2026
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
伦理AI的两种视角:OpenAI案例研究
专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY
AI总结 本研究通过分析OpenAI的公共论述,发现其在伦理AI领域更强调安全性和风险,而非学术或倡导伦理框架。
Comments iConference 2026
用人类策略解释和调整基于Transformer的语言模型在算术任务中的表现
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG
AI总结 研究基于Transformer的语言模型在算术任务中的表现,通过分解任务、分析损失收敛等,应用人类策略和方法提升其性能,并经多种验证展示有效性,探索其与人类学习者相似性以增强关键应用中的信任。
组熵控制策略优化
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL
AI总结 研究针对大语言模型强化学习中异构任务的探索利用问题,提出组熵控制策略优化(GEPO)方法,利用组熵进行优势塑造,通过实验验证该方法优于GRPO等,能实现跨任务平衡改进并保持任务探索水平。
Comments 16 pages, 5 figures
《负责任人工智能全球指数:2026年报告》
专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI
AI总结 该报告基于人权框架,通过多维度评估和大量数据收集,对各国负责任人工智能治理情况进行排名。发现治理虽在扩展,但转化为实际保护不足,尤其在算法公开等方面有欠缺,强调治理需向可执行保护等方向转变。
需要一位大师来修剪不良专家
机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) ; NVIDIA(英伟达)
专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL
AI总结 研究针对稀疏激活的MoE语言模型部署瓶颈问题,提出MAESTRO结构化剪枝框架,将专家激活轨迹建模为马尔可夫链以产生全局感知启发式方法,在多领域评估中性能优于基线,跨任务方差低,模型泛化更一致。
Comments 19 pages, 4 figures
网络化生成代理中的涌现协调行为:信息操作的战略动态建模
专题命中 AI治理与伦理 :alignment(abstract)
AI总结 本文研究了生成代理在模拟信息操作中的协调行为,发现通过共享目标即可实现接近人工协调的水平,揭示了自动化信息操作的社会风险。
Journal ref WWW '26: Proceedings of the ACM Web Conference 2026