arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-29 至 2026-07-29 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2607.25019 2026-07-29 econ.TH cs.GT cs.MA 新提交 78%

Interactive Alignment

交互式对齐

Sylvain Chassang

专题命中 安全训练 :alignment(title,abstract)

AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。

Comments 53 pages, 18 Figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24859 2026-07-29 cs.CR 新提交 67%

The Mirage of LLM Guardrails: A Case Study in AI-Assisted Medical Note Manipulation

大语言模型护栏的幻象:人工智能辅助医疗记录操纵的案例研究

Davis Yadav, Amulya Yadav

专题命中 安全训练 :safety(abstract);AI safety(abstract)

AI总结 研究大语言模型在医疗记录操纵场景下内置护栏的可靠性,通过开发操纵流程、实证评估、利用多种指标评估及用户研究,揭示其弱点,为大语言模型在医疗领域的护栏设计、安全政策及伦理等方面提供参考。

Comments 10 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26034 2026-07-29 cs.AI cs.CY cs.GT econ.GN q-fin.EC 新提交 62%

Falling Behind Drives Unsafe Development in an Idealised AI Race Experiment

在理想化人工智能竞赛实验中落后导致不安全发展

Elias Fernández Domingos, The Anh Han

机构 * Vrije Universiteit Brussel(布鲁塞尔自由大学) Université Libre de Bruxelles(布鲁塞尔自由大学) Teesside University(提赛德大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究人工智能竞赛中速度与安全的关系,通过实验发现不安全发展受竞赛战略状态影响,引入进化模型解释,表明政策应注重降低竞争压力、促进合作,而非仅关注个体风险。

Comments 45 pages (main + SI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24898 2026-07-29 cs.CV cs.AI 新提交 57%

Harm is not Universal: Community-Specific Toxicity Detection is Urgently Needed

危害并非普遍存在:迫切需要针对特定社区的毒性检测

Xinnuo Xu, Anja Thieme, Daniela Massiceti, Ioana Tanase, Rita Marques, Melanie Fernandez Pradier, Martin Grayson, Camilla Longden, Cecily Morrison

机构 * Microsoft Research Cambridge, UK(英国剑桥微软研究院) Microsoft Paris, France(法国巴黎微软)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究指出文本到图像生成的通用毒性检测方法不能保护边缘化社区,主张特定社区毒性检测(CTD)。通过与专家合作制定指南,利用图像数据集实验表明现有模型表现不佳,基于提示的方法和参数高效微调可提升性能,但CTD性能仍远低于通用检测,需持续研究。

Comments 18 pages, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24893 2026-07-29 cs.CR cs.AI 新提交 57%

Early Detection of Distributed Backdoors in Multi-Agent LLM Systems: A Characterization Study

多智能体大语言模型系统中分布式后门的早期检测:一项特征研究

Diego Fernandez Arias, Dev Prashant Mistry, Ren Wang, Yibo Hu

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 研究多智能体大语言模型系统中分布式后门早期检测,构建分层多智能体系统实例,通过记录片段注入及载荷组装执行时间来检测。前缀检测器能较早标记多数成功攻击,部分检测器依赖表面线索,微调模型可减少线索去除后的损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24789 2026-07-29 cs.IR cs.CV cs.LG cs.MM 新提交 57%

NEXT: Reasoning-Driven Video Recommendation via a Vision-Language Model

NEXT:通过视觉语言模型进行推理驱动的视频推荐

Yuming Liu, Hongye Yang, Harrison Zhao, Ellie Zhu, Bokai Cao, Lei Huang, Lizhu Zhang, Xiangjun Fan

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 研究提出推理驱动的视频推荐框架NEXT,通过对用户已观看视频推理推断其下一个意图来检索后续视频。训练NEXT-8B视觉语言模型,在DocVQA性能上表现出色,在特定评估中提升下一个意图逻辑质量,部署后带来生产收益,证明其可作为实用推理引擎。

Comments 13 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25883 2026-07-29 cs.MA 新提交 50%

Towards a Systems Foundation for Agentic Cloud Management

迈向智能云管理的系统基础

Minghao Li, Ziqian Liu, Ziyu Mao, Daqian Ding, Yu Kang, Qingwei Lin, Tianyin Xu, Yiming Qiu

专题命中 安全训练 :safety(abstract)

AI总结 研究智能云管理中缺少系统基础的问题,核心方法是开发CloudWeaver智能管理基础架构,贡献在于能跨界面管理,确定会话上下文、协调并发操作,提供安全保证和可追溯反馈,经Azure API工作负载验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25754 2026-07-29 cs.RO 新提交 50%

Cooperative Multi-UAV Navigation in Complex Environments via Systematic Multi-Agent Deep Reinforcement Learning

通过系统多智能体深度强化学习实现复杂环境下的多无人机协同导航

Yu Su, Nabil Aouf

专题命中 安全训练 :safety(abstract)

AI总结 针对复杂环境下多无人机协同导航面临的问题,提出多智能体深度强化学习框架,通过协同探索等方法解决,含感知、示范缓冲区和课程调度机制,能抽象特征实现跨场景转移,经仿真验证有良好性能。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏