arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

2026-07-23 至 2026-07-23 共收录 3
2607.19595 2026-07-23 cs.CR cs.CL 新提交

Twin Agent: Context Residual Compression for Privilege Separated Agents

孪生智能体:用于特权分离智能体的上下文残差压缩

Zhanhao Hu, Dennis Jacob, Xiao Huang, Zhaorun Chen, Bo Li, David Wagner

机构 * University of California, Berkeley(加州大学伯克利分校) University of Chicago(芝加哥大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07746 2026-07-23 stat.ML cs.LG cs.SY eess.SY 版本更新

Any-Time Regret-Guaranteed Algorithm for Control of Linear Quadratic Systems

用于线性二次系统控制的随时保证遗憾值的算法

Jafar Abbaszadeh Chekan, Cedric Langbort

机构 * Coordinated Science Laboratory University of Illinois Urbana-Champaign(协调科学实验室 伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出用于线性二次系统控制的算法,基于SDP框架,通过调整正则化等构建置信椭球并设计输入扰动机制。开发两个变体,分析状态放大与遗憾值权衡,放宽顺序稳定性要求得最优遗憾值,还无需DARE解范数先验界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05518 2026-07-23 cs.CR cs.AI 版本更新

Matching Ranks Over Probability Yields Truly Deep Safety Alignment

概率匹配排名实现真正深度的安全对齐

Jason Vega, Gagandeep Singh

机构 * Siebel School of Computing and Data Science(塞比尔计算与数据科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 研究开源大语言模型安全问题,针对预填充攻击及相关防御,提出排名辅助预填充(RAP)攻击,又通过匹配令牌排名提出PRESTO方法,提升了模型在RAP攻击下的安全性,为安全开源模型发展助力。

详情

展开后加载摘要…

URL PDF HTML 收藏