arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-21 至 2026-07-21 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. AI治理与伦理 6 篇

2601.16513 2026-07-21 cs.CY 70%

Competing Visions of Ethical AI: A Case Study of OpenAI

伦理AI的两种视角:OpenAI案例研究

Melissa Wilfley, Mengting Ai, Madelyn Rose Sanfilippo

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 本研究通过分析OpenAI的公共论述,发现其在伦理AI领域更强调安全性和风险,而非学术或倡导伦理框架。

Comments iConference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17166 2026-07-21 cs.LG 新提交 57%

Explaining and Tuning Transformer-based LLMs in Arithmetic Tasks with Human Strategies

用人类策略解释和调整基于Transformer的语言模型在算术任务中的表现

Luyu Qiu, Jianing Li, Hwanhee Kim, Xiaoyong Wei, Yueyuan Zheng, Janet Hsiao, Lei Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong Polytechnic University(香港理工大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.LG

AI总结 研究基于Transformer的语言模型在算术任务中的表现,通过分解任务、分析损失收敛等,应用人类策略和方法提升其性能,并经多种验证展示有效性,探索其与人类学习者相似性以增强关键应用中的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16850 2026-07-21 cs.CL 新提交 57%

Group Entropy-Controlled Policy Optimization

组熵控制策略优化

Guangran Cheng, Chengqi Lyu, Songyang Gao, Wenwei Zhang, Kai Chen

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究针对大语言模型强化学习中异构任务的探索利用问题,提出组熵控制策略优化(GEPO)方法,利用组熵进行优势塑造,通过实验验证该方法优于GRPO等,能实现跨任务平衡改进并保持任务探索水平。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14782 2026-07-21 cs.AI 版本更新 57%

Global Index on Responsible AI: 2026 Report

《负责任人工智能全球指数:2026年报告》

Rachel Adams, Fola Adeleke, Ayantola Alayande, Selamawit Engida Abdella, Ana Florido, Nicolás Grossman, Leah Junck

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 该报告基于人权框架,通过多维度评估和大量数据收集,对各国负责任人工智能治理情况进行排名。发现治理虽在扩展,但转化为实际保护不足,尤其在算法公开等方面有欠缺,强调治理需向可执行保护等方向转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08601 2026-07-21 cs.CL 版本更新 57%

It Takes a MAESTRO To Prune Bad Experts

需要一位大师来修剪不良专家

Palaash Goel, Ayush Maheshwari, Tanmoy Chakraborty

机构 * Indian Institute of Technology Delhi(印度理工学院德里分校) NVIDIA(英伟达)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究针对稀疏激活的MoE语言模型部署瓶颈问题,提出MAESTRO结构化剪枝框架,将专家激活轨迹建模为马尔可夫链以产生全局感知启发式方法,在多领域评估中性能优于基线,跨任务方差低,模型泛化更一致。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25003 2026-07-21 cs.MA 50%

Emergent Coordinated Behaviors in Networked LLM Agents: Modeling the Strategic Dynamics of Information Operations

网络化生成代理中的涌现协调行为:信息操作的战略动态建模

Gian Marco Orlando, Jinyi Ye, Valerio La Gatta, Mahdi Saeedi, Vincenzo Moscato, Emilio Ferrara, Luca Luceri

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文研究了生成代理在模拟信息操作中的协调行为,发现通过共享目标即可实现接近人工协调的水平,揭示了自动化信息操作的社会风险。

Journal ref WWW '26: Proceedings of the ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏