arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-13 至 2026-07-13 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 3 篇

2502.12446 2026-07-13 cs.CL cs.AI cs.LG 版本更新 67%

Multi-Attribute Steering of Language Models via Targeted Intervention

通过目标干预对语言模型进行多属性引导

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何对语言模型进行多属性引导,提出MAT-Steer框架,通过对齐目标学习引导向量,减少属性间冲突,在问答和生成任务中评估,该框架优于现有方法。

Comments ACL 2025 camera-ready, code link: https://github.com/duykhuongnguyen/MAT-Steer

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18043 2026-07-13 cs.CL cs.AI cs.CV 版本更新 62%

GrAInS: Gradient-based Attribution for Inference-Time Steering of LLMs and VLMs

GrAInS:基于梯度的大语言模型和视觉语言模型推理时引导方法

Duy Nguyen, Archiki Prasad, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究针对推理时引导LLMs和VLMs的方法局限,提出GrAInS。该方法基于梯度归因识别关键令牌构建引导向量,推理时调整激活。实验显示其性能优于微调及现有基线,能在保持模型流畅性和通用能力的同时提升多项指标。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2004.04663 2026-07-13 cs.CE math.ST stat.TH 50%

The ICSCREAM methodology: Identification of penalizing configurations in computer experiments using screening and metamodel -- Applications in thermal-hydraulics

ICSCREAM方法:利用筛查和元模型识别计算机实验中的惩罚配置——热力学-流体力学应用

A. Marrel, Bertrand Iooss, V Chabridon

专题命中 幻觉与事实性 :safety(abstract)

AI总结 ICSCREAM方法通过全局敏感性分析和元模型技术,高效识别热力学-流体力学事故模拟中的临界配置,减少计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏