arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-23 至 2026-03-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2603.19328 2026-03-23 cs.CR 78%

The Verifier Tax: Horizon Dependent Safety Success Tradeoffs in Tool Using LLM Agents

验证者税:工具使用LLM代理中地平线依赖的安全成功权衡

Tanmay Sah, Vishal Srivastava, Dolly Sah, Kayden Jordan

专题命中 安全训练 :safety(title,abstract)

AI总结 研究运行时强制执行对多步骤工具使用大语言模型代理端到端任务性能的影响,发现安全调解虽能拦截94%的非合规动作,但难以保证安全完成,凸显了需要具备基础身份验证和后干预推理能力的代理。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14391 2026-03-23 cs.LG cs.AI 62%

HALO: Hierarchical Reinforcement Learning for Large-Scale Adaptive Traffic Signal Control

HALO:用于大规模自适应交通信号控制的分层强化学习

Yaqiao Zhu, Hongkai Wen, Geyong Min, Man Luo

机构 * University of Exeter Department of Computer Science Exeter UK(埃克塞特大学计算机科学系埃克塞特英国) University of Warwick Department of Computer Science Coventry UK(沃里克大学计算机科学系科文特里英国) University of Exeter(埃克塞特大学) University of Warwick(沃里克大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 HALO通过分层强化学习框架解决大规模自适应交通信号控制中的可扩展性与协调性矛盾,采用高低层策略协同优化,实现高效交通管理。

Comments Accepted to The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19974 2026-03-23 cs.CR cs.AI 57%

Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance

Trojan's Whisper:通过注入的Bootstrap引导 stealthily操纵OpenClaw

Fazhong Liu, Zhuoyan Chen, Tu Lan, Haozhen Tan, Zhenyu Xu, Xiang Li, Guoxing Chen, Yan Meng, Haojin Zhu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全训练 :prompt injection(abstract);分类 cs.AI

AI总结 本文研究了通过注入引导文件进行的隐蔽攻击,揭示了自主代理生态系统设计中的根本矛盾,强调了基于能力隔离、运行时策略执行和透明引导溯源的防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19584 2026-03-23 cs.AI cs.SY eess.SY 57%

PowerLens: Taming LLM Agents for Safe and Personalized Mobile Power Management

PowerLens:利用大语言模型安全且个性化地管理移动设备电源

Xingyu Feng, Chang Sun, Yuzhu Wang, Zhangbing Zhou, Chengwen Luo, Zhuangzhuang Chen, Xiaomin Ouyang, Huanqi Yang

机构 * China University of Geosciences (Beijing)(中国地质大学(北京)) Shenzhen University(深圳大学) Hong Kong University of Science and Technology(香港科学与技术大学) City University of Hong Kong(香港城市大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 PowerLens通过利用大语言模型的常识推理,实现安全且个性化的移动电源管理。系统通过用户活动与系统参数之间的语义桥梁,生成适应个人偏好的零样本策略,通过隐式反馈学习用户偏好,无需显式配置,3-5天内收敛。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01038 2026-03-23 cs.CV cs.AI 57%

From Intuition to Investigation: A Tool-Augmented Reasoning MLLM Framework for Generalizable Face Anti-Spoofing

从直觉到探究:一种工具增强的推理MLLM框架用于可推广的面部反伪装

Haoyuan Zhang, Keyao Wang, Guosheng Zhang, Haixiao Yue, Zhiwen Tan, Siran Peng, Tianshuo Zhang, Xiao Tan, Kunbin Chen, Wei He, Jingdong Wang, Ajian Liu, Xiangyu Zhu, Zhen Lei

机构 * SAI, UCAS(UCAS智能科学研究院) MAIS, CASIA(CASIA模式识别与智能信息处理研究院) Baidu Inc(百度公司) CAIR, HKISI, CAS(HKISI CAS计算机视觉研究院) M.U.S.T

专题命中 安全训练 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出TAR-FAS框架,通过整合外部视觉工具提升面部反伪装的泛化能力,采用CoT-VT范式使MLLM深入分析细微伪装线索,实验表明其在跨域协议下达到SOTA性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20568 2026-03-23 cs.LG 57%

Reinforcement Unlearning via Group Relative Policy Optimization

通过群体相对策略优化实现强化反学习

Efstratios Zaradoukas, Bardh Prenkaj, Gjergji Kasneci

机构 * Chair of Responsible Data Science(负责任数据科学教授职位) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出PURGE方法,通过群体相对策略优化框架将反学习建模为可验证问题,有效减少敏感数据影响,提升模型流畅性和鲁棒性,实验表明其在反学习效果和实用性上优于现有方法。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02435 2026-03-23 cs.LG 57%

Efficient Cross-Domain Offline Reinforcement Learning with Dynamics- and Value-Aligned Data Filtering

高效跨领域离线强化学习中的动态与价值对齐数据筛选

Zhongjian Qiao, Rui Yang, Jiafei Lyu, Chenjia Bai, Xiu Li, Siyang Gao, Shuang Qiu

机构 * City University of Hong Kong University of Illinois Urbana-Champaign Tencent Institute of Artificial Intelligence, China Telecom (TeleAI) Tsinghua University. Corresponding Author

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出DVDF方法,通过动态和价值对齐筛选源域样本,提升跨领域离线强化学习性能,实验表明其在多种任务和数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏