Deep Reinforcement Learning: From First Principles to Reasoning Models
深度强化学习:从第一性原理到推理模型
专题命中 安全训练 :safety(abstract)
AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
深度强化学习:从第一性原理到推理模型
专题命中 安全训练 :safety(abstract)
AI总结 本书介绍深度强化学习从经典方法到各类算法及多领域应用的演进,融合基础与研究视角,面向具备相关基础的学生、研究者和工程师。
打破舍入陷阱:保护LLM免受量化条件后门攻击
专题命中 安全训练 :alignment(abstract)
AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。
形式化监视器为何失效:攻击分布熵作为基于LTL的LLM智能体安全的覆盖边界
专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究揭示基于LTL的LLM智能体安全监视器覆盖差异源于攻击分布熵,提出熵-覆盖边界并验证,引入部署前熵测试,可预测监视器覆盖并支持架构感知选择。
Comments 6 pages, 1 figure. Accepted at the 13th IEEE International Conference on Intelligent Systems (IS'26), Varna, Bulgaria, 2026
大型音频语言模型综述:通用性、可信度与展望
机构 * Nanyang Technological University(南洋理工大学) ; Independent Researcher(独立研究者) ; The University of Melbourne(墨尔本大学) ; North China Electric Power University(华北电力大学) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; University of Chinese Academy of Sciences(中国科学院大学) ; University of Science and Technology of China(中国科学技术大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Shanghai AI Laboratory(上海人工智能实验室) ; Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Fortemedia Singapore(富媒体新加坡) ; Tencent(腾讯) ; Fudan University(复旦大学) ; Wuhan University(武汉大学) ; Chinese University of Hong Kong(香港中文大学) ; Chongqing University of Posts and Telecommunications(重庆邮电大学) ; University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中 越狱攻击 :trustworthy(abstract,abstract_cn);alignment(abstract);safety(abstract)
AI总结 本文综述了大型音频语言模型的通用性、可信度及未来发展方向,探讨了其架构创新、对齐算法及安全风险,并提出了防御深入、因果音频世界建模等策略以提升音频智能的可信度。
小型语言模型能否可靠抵御越狱攻击?一项综合评估
专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI
AI总结 本文通过评估59个SLMs对12种越狱方法的抵御能力,发现多数SLMs存在高ASR,漏洞与训练细节相关,且现有防御效果有限,凸显SLM需采用设计即安全的方法。
Comments Accepted by ACM CCS 2026
MENTOR: 一种元认知驱动的自我进化框架,用于发现和缓解大语言模型中的隐式领域风险
机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) ; Shanghai AI Lab, Shanghai Innovation Institute(上海人工智能实验室,上海创新研究院)
专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型在特定领域(如教育、金融、管理)中存在的隐式安全风险,提出基于元认知自我评估和动态规则知识图谱的MENTOR框架,通过激活级引导信号有效降低攻击成功率。
安全智能体AI:从单步行动检查到轨迹保障
机构 * Purdue University(普渡大学) ; University of Texas at Dallas(德克萨斯大学达拉斯分校)
专题命中 越狱攻击 :safety(abstract);trustworthy(abstract);分类 cs.AI
AI总结 该研究围绕自主智能体安全领域,梳理了单智能体、多智能体及宏观层面的各类安全挑战,提出安全需成为智能体架构等的可验证属性,为可信自主智能体部署提供路线图。
Comments 6 pages. Accepted to the ACM AI Leadership Summit 2026 (Visionary Track)
QShield: 通过量子电路安全神经网络对抗对抗性攻击
机构 * Emory University(埃默里大学)
专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG
AI总结 QShield通过结合传统CNN和量子处理模块,提升经典深度学习模型的对抗鲁棒性,实验表明其在多种数据集上有效降低攻击成功率并提高预测准确性。
SoK:面向意图的多轮大语言模型越狱系统化研究
专题命中 越狱攻击 :safety(abstract)
AI总结 本研究提出面向意图的多轮LLM越狱分类法,发现攻击有效性取决于意图组织精细度,推动检测范围升级,表明轮级安全机制不足,需对应层级评估协议。
OpenART:通过开放式环境演化扩展智能体红队演练规模
机构 * Fudan University(复旦大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; XSafeAI
专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL
AI总结 本研究针对现有智能体安全基准无法捕捉累积风险的问题,推出开放式智能体红队演练平台OpenART,并提出EMHA攻击方法,在75种智能体模型配置上实现85.0%的汇总攻击成功率,为复杂环境下的智能体安全研究提供可扩展基础。
OTora:一种用于LLM代理推理层面拒绝服务攻击的统一红队框架
机构 * Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系) ; Department of Computer Science, University of Oxford(牛津大学计算机科学系) ; Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中 红队测试 :red teaming(title);分类 cs.LG
AI总结 OTora是首个统一的两阶段红队框架,用于实现推理层面拒绝服务攻击,通过优化对抗触发器和生成代理感知的推理负载,提升推理token数量和延迟,同时保持任务准确性。
Comments Accepted to ICML 2026
质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) ; School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) ; Southern University of Science and Technology(南方科技大学)
专题命中 红队测试 :safety(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。
认知控制架构(CCA):一种用于鲁棒对齐AI代理的生命周期监督框架
机构 * Sichuan University(四川大学)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出认知控制架构(CCA),通过全生命周期认知监督框架,有效应对复杂IPI攻击,实现安全、功能与效率的平衡。
CrackedPDFs:用于PDF中隐藏提示注入的受控基准测试
机构 * University of California, Berkeley(加利福尼亚大学伯克利分校)
专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI
AI总结 研究针对PDF中隐藏提示注入问题,引入CrackedPDFs基准测试,评估多种检测方法,如PromptGuard、结构学习模型等,结果显示文档感知混合检测在受控配对评估下有效,但缺乏现实世界鲁棒性和跨家族泛化能力。
Comments Revised author metadata to include Karthik Subramanian; corrected paired-metric terminology; added code, dataset, reproduction, and archival information. Code: https://github.com/volkthienpreecha/crackedpdfs/releases/tag/v1.0.0-paper ; Dataset: https://huggingface.co/datasets/volkthienpreecha/crackedpdfs ; Archive: https://doi.org/10.5281/zenodo.21735803
通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化
机构 * China University of Petroleum (East China)(中国石油大学(华东)) ; Shanghai Jiao Tong University(上海交通大学) ; Wuhan University(武汉大学) ; Great Wall Motor(长城汽车) ; Nanyang Technological University(南洋理工大学) ; The University of Hong Kong(香港大学)
专题命中 提示注入 :alignment(abstract);prompt injection(abstract)
AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。
Comments This paper has been accepted by ACM MM 2026
通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉
机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)
专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.AI
AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。
Comments 29 pages, 9 figures
MedUPS:利用大语言模型辅助罕见医疗病例的诊断
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。
Comments 13 pages, 6 figures
MambaGaze: 通过显式缺失数据建模的双向Mamba用于从眼动追踪数据中评估认知负荷
机构 * Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校) ; Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校) ; Department of Neuroscience, Developmental and Regenerative Biology, College of Sciences, The University of Texas at San Antonio(神经科学系,发育与再生生物学系,科学学院,德克萨斯大学圣安东尼奥分校)
专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG
AI总结 本文提出MambaGaze,通过XMD编码和双向Mamba-2框架,解决眼动追踪数据中频繁缺失和长时序依赖建模的问题,实验证明其在认知负荷评估中的优越性能和边缘部署可行性。
用于缓解基于语言模型的文本转语音中幻觉的经验校准对比解码
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG
AI总结 该研究针对基于语言模型的文本转语音的语音幻觉问题,提出无训练的经验校准对比解码方法,在多数据集上显著降低错误率并提升听辨质量,为解码时缓解语音幻觉提供新方向。
Comments Work in progress
光子贝叶斯神经网络的约束协同设计
专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG
AI总结 针对经典神经网络的过度自信预测缺陷,研究人员将光子概率计算与贝叶斯神经网络结合,通过约束随机变分推理得出协同设计指南,验证了硬件感知训练可恢复性能及不确定性质量。
CultureVidBench:文本到视频生成中的文化理解基准测试
机构 * Nanyang Technological University(南洋理工大学) ; Centrale Supélec(中央高等电力学院) ; Singapore Management University(新加坡管理大学) ; University of Cambridge(剑桥大学)
专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL
AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。
Comments Project page:https://hanxjing.github.io/CultureVidBench/
平均偏差:人类忠实性标注并非局部忠实
机构 * Stony Brook University(石溪大学)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL
AI总结 该研究发现文本摘要忠实性基准的人类全局标注存在平均偏差,即标注者接受大部分句子忠实的摘要,而非严格合取规则要求的所有句子都忠实,需改进人类标注设计。
用特定上下文知识增强大语言模型以缓解中小企业的错误信息:一种基于RAG的建模与分析
机构 * School of Science, Edith Cowan University(伊迪斯科文大学理学院)
专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI
AI总结 该研究针对中小企业使用LLM时面临的错误信息问题,提出VectorRAG与GraphRAG方法,在LLaMA等模型上验证RAG可提升响应质量,助力可靠决策。
面向目标的基于逻辑的语义通信及用于自动驾驶的神经符号推理
专题命中 幻觉与事实性 :safety(abstract)
AI总结 本文针对自动驾驶场景,提出基于一阶逻辑的目标导向语义通信方法,通过选择关键证据传输实现安全决策,在相同通信预算下优于均匀证据选择。
FabriVLA:用于精确多任务操作的轻量级视觉-语言-动作模型
专题命中 幻觉与事实性 :safety(abstract)
AI总结 研究提出FabriVLA模型,结合视觉-语言主干与流匹配动作头,经单阶段联合优化训练。在Meta-World MT50基准测试中,该模型基于1B规模VLM,不依赖数十亿参数主干,实现90.0%平均成功率,展现强大性能。
RH-RAG:适用于隐私受限场景的可信长文本生成
机构 * Indian Institute of Technology, Roorkee(鲁尔基印度理工学院)
专题命中 隐私与版权 :trustworthy(title,abstract);alignment(abstract);分类 cs.CL
AI总结 该研究针对隐私受限场景下的长文本生成难题,提出基于本地语言模型的多智能体框架RH-RAG,通过三阶段协同生成与双层检索索引提升生成质量,且兼顾数据隐私。
Comments accepted in KDD 2026 SeT-LLM Workshop
重新思考联邦图基础模型:基于图-语言对齐的方法
机构 * Sun Yat-sen University, Guangzhou, China(中山大学) ; Beijing Institute of Technology, Beijing, China(北京理工大学)
专题命中 隐私与版权 :alignment(title,abstract);分类 cs.LG
AI总结 FedGALA通过图-语言对齐解决联邦图基础模型中的语义-结构正交性问题,提升多任务适应性与效率
Comments Under Review
版权是头条,能力是盲区:2025年11月—2026年8月图书出版行业媒体中的人工智能技术
专题命中 隐私与版权 :prompt injection(abstract);分类 cs.CY
AI总结 本研究通过分析多国行业媒体的89篇文章,指出图书出版领域AI报道存在能力盲区,提出设立常设AI报道板块等改进建议。
Comments 7 pages, 2 figures. 15-page Supplemental Information, coded 89-item corpus, crosstabs, BibTeX database, and citation audit included as ancillary files
与知己还是公司聊天?AI伴侣的隐私管理
专题命中 隐私与版权 :safety(abstract);分类 cs.CY
AI总结 基于沟通隐私管理理论和水平-垂直隐私框架,通过访谈Replika和Character.AI用户,发现用户融合人际习惯与机构意识,采用分层策略管理隐私,但拟人化设计导致边界模糊和隐私动荡。
Journal ref Journal of Computer-Mediated Communication, 2026
从网络自动化到大语言模型(LLM)时代的可信自主网络:网络控制智能视角
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract)
AI总结 本文以网络控制智能(NCI)为框架,梳理网络控制系统三阶段演进,提出可信自主网络定义及参考架构,明确LLM赋能运营的集成模式与相关研究议程。