arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-10 至 2026-04-10 共收录 64 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 16 篇

2512.08296 2026-04-10 cs.AI 57%

Towards a Science of Scaling Agent Systems

迈向代理系统的科学:扩展性研究

Yubin Kim, Ken Gu, Chanwoo Park, Chunjong Park, Samuel Schmidgall, A. Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, Paul Pu Liang, Hae Won Park, Yuzhe Yang, Xuhai Xu, Yilun Du, Shwetak Patel, Tim Althoff, Daniel McDuff, Xin Liu

机构 * Google Research(谷歌研究院) Massachusetts Institute of Technology(麻省理工学院) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文通过260种配置评估六种代理基准,探讨代理系统在扩展维度上的性能变化规律,揭示协调、模型能力与任务结构之间的关系,发现协作成功取决于协调与任务结构的匹配程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07891 2026-04-10 cs.SE 50%

AFGNN: API Misuse Detection using Graph Neural Networks and Clustering

AFGNN:基于图神经网络和聚类的API误用检测

Ponnampalam Pirapuraj, Tamal Mondal, Sharanya Gupta, Akash Lal, Somak Aditya, Jyothi Vedurada

专题命中 其他安全 :safety(abstract)

AI总结 本文提出AFGNN框架,利用API流程图捕捉代码中的执行序列、数据和控制流信息,通过自监督预训练和聚类识别不同API使用模式,有效检测Java代码中的API误用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18772 2026-04-10 cs.HC 50%

Are Conversational AI Agents the Way Out? Co-Designing Reader-Oriented News Experiences with Immigrants and Journalists

对话式AI代理是出路吗?与移民和记者共同设计以读者为导向的新闻体验

Yongle Zhang, Ge Gao

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过与移民读者和记者共同设计,探索如何利用对话式AI代理改善移民读者的新闻体验,揭示了移民读者与记者之间价值对齐的悖论及AI代理的设计方法。

Journal ref In Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25597 2026-04-10 eess.SY cs.RO cs.SY 50%

Incorporating Social Awareness into Control of Unknown Multi-Agent Systems: A Real-Time Spatiotemporal Tubes Approach

将社交意识纳入未知多智能体系统的控制:一种实时时空管方法

Siddhartha Upadhyay, Ratnangshu Das, Pushpak Jagtap

机构 * Robert Bosch Centre for Cyber-Physical Systems, IISc(印度科学研究所罗伯特·博世网络物理系统中心)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种去中心化控制框架,通过引入社交意识实现动态环境中多智能体的预定时间到达-避开-停留任务,采用实时时空管方法在线合成管状约束,确保安全避障和社交意识下的协同避碰。

详情

展开后加载摘要…

URL PDF HTML 收藏