Verifying Intent and Harm: A Unified Defense Against LLM-Generated Threats
验证意图与危害:针对LLM生成威胁的统一防御
专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract)
AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
验证意图与危害:针对LLM生成威胁的统一防御
专题命中 测试时计算 :reasoning(abstract);CoT(abstract);verifier(abstract)
AI总结 提出一种联合验证用户提示意图和模型响应危害的防御框架,通过专门分析器与裁决器协同工作,在五个威胁类别上平均F1提升至0.95,攻击成功率降至4.1%。
验证地平线:编码智能体奖励没有银弹
机构 * Qwen Team(Qwen团队)
专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI
AI总结 本文指出,随着编码智能体能力增强,验证解决方案比生成更难,并沿可扩展性、忠实性和鲁棒性三个维度分析验证信号质量,通过四种奖励构建实验表明验证必须与生成器共同进化。
Comments Authors are listed alphabetically by their first names
何时可能答案正确?关于LLM中的序列概率与正确性
机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; ELLIS Institute Tübingen(图宾根ELLIS研究所) ; AI Center Tübingen(图宾根人工智能中心) ; University of Tübingen(图宾根大学) ; IMPRS-IS(图宾根马克斯·普朗克研究所)
专题命中 测试时计算 :verifier(abstract);分类 cs.LG
AI总结 研究大型语言模型中序列概率与正确性的关系,发现序列概率在固定数据集内预测正确性有效,但通过改变解码方法或超参数提高概率并不稳定提升准确率,且对同一提示的多次响应中概率不是正确性的良好指标。
Comments 38 pages, including 10 pages of main text and 28 pages of appendix, preprint
令人惊讶的简单自蒸馏方法提升代码生成能力
机构 * Apple(苹果公司)
专题命中 测试时计算 :verifier(abstract);分类 cs.CL
AI总结 提出简单自蒸馏(SSD)方法,仅利用模型自身输出进行微调,无需验证器或强化学习,显著提升代码生成性能,并揭示其通过重塑token分布解决精度-探索冲突的机制。