arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-05 至 2026-08-05 共收录 28 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2604.25077 2026-08-05 cs.AI 版本更新 85%

Evaluating Risks in Weak-to-Strong Alignment: A Bias-Variance Perspective

在弱到强对齐中评估风险:从偏差-方差视角出发

Hamid Osooli, Kareema Batool, Rick Gentry, Tiasa Singha Roy, Ashwin Gupta, Anirudha Ramesh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软) InstaDeep New York University(纽约大学)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 本文从偏差-方差视角分析弱到强对齐的风险,通过连续置信度分数研究经验组件,发现强模型方差是欺骗的主要预测因素,表明弱强依赖性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2601.13981 2026-08-05 cs.CR 版本更新 67%

VirtualCrime: Evaluating the Criminal Potential and Agentic Behaviors of Large Language Models via Sandbox Simulation

VirtualCrime: 通过沙盒模拟评估大语言模型的犯罪潜力

Yilin Tang, Yu Wang, Lanlan Qiu, Wenchang Gao, Yunfei Ma, Baicheng Chen, Tianxing He

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出VirtualCrime框架,通过三代理系统评估大语言模型的犯罪能力,设计40种多样化的犯罪任务,并评估8种强大的LLM,发现模型在犯罪过程中生成详细计划并执行智能犯罪过程,但有时会采取严重行动伤害NPC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18790 2026-08-05 cs.CR 版本更新 67%

RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt: 双层加密用于自我重建以规避LLM审核

Benyamin Tafreshian

专题命中 安全训练 :safety(abstract);jailbreak(abstract)

AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。

Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01804 2026-08-05 cs.LG cs.AI 版本更新 62%

LEAP: Lean Environment-Feedback via Adaptive Pruning for Code RL in GPU Kernel Generation

LEAP:面向GPU内核生成的代码强化学习的自适应剪枝轻量环境反馈框架

Tankun Li, Zhi Chen, Yaohua Tang

机构 * Moore Threads(摩尔线程)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 LEAP是针对GPU内核生成的代码强化学习框架,通过难度条件剪枝与基于排名的奖励公式解决低级代码RL的信号稀疏性等问题,收敛更快且性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2509.20851 2026-08-05 cs.CV 版本更新 50%

Poisoning Prompt-Guided Sampling in Video Large Language Models

针对视频大语言模型中提示引导采样的投毒攻击

Yuxin Cao, Wei Song, Jingling Xue, Jin Song Dong

机构 * National University of Singapore(新加坡国立大学) University of New South Wales(新南威尔士大学) CSIRO’s Data61(CSIRO数据61)

专题命中 越狱攻击 :safety(abstract)

AI总结 该研究针对视频大语言模型的提示引导采样提出PoisonVID投毒攻击,在多种模型与采样器组合上实现高攻击成功率,揭示了PGS存在的结构性安全隐患。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2608.00747 2026-08-05 cs.RO cs.AI cs.CR cs.MA 版本更新 79%

When Prompts Control Robots: Prompt Injection Attacks in Multi-Agent Robotic Systems

当提示控制机器人时:多智能体机器人系统中的提示注入攻击

Neha Nagaraja, Amisha Bagari, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems, Northern Arizona University(北亚利桑那大学信息学、计算与网络安全学院) Department of Software Science, Tallinn University of Technology(塔林理工大学软件科学系)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 本文针对基于LLM的多智能体机器人系统,系统研究了直接和间接提示注入攻击的风险、传播特性及架构对攻击成功率的影响,是该领域的首项系统性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20381 2026-08-05 cs.CL cs.AI cs.HC 版本更新 62%

The production of meaning in the processing of natural language

自然语言处理中意义产生的机制

Christopher J. Agostino, Quan Le Thien, Nayan D'Souza, Louis van der Elst

机构 * Department of Physics, Indiana University(印第安纳大学物理系) Department of Linguistics, Indiana University(印第安纳大学语言学系) Imperial College London(伦敦帝国学院)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言处理中意义产生的机制,探讨量子逻辑与经典布尔理论在语义处理中的差异,分析模型在不同参数下的表现及对安全交互的影响。

Comments Accepted to QNLP 2026, 9 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2608.00151 2026-08-05 cs.CY cs.AI econ.TH 版本更新 62%

Optimising for Flourishing: Flourishing Metrics and Return on Flourishing as Success Criteria for Artificial Intelligence and Post-AGI Economic Systems

为繁荣优化:繁荣度量与繁荣回报作为人工智能及后AGI经济系统的成功标准

Keyun Ruan, Jonathan D. Teubner, John M. Bremen

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 该研究提出将人类繁荣作为AI及后AGI经济系统的核心成功标准,构建了Flourishing Metrics框架与RoF评估方法,为AI及经济转型的价值核算提供了决策架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08592 2026-08-05 cs.MM 版本更新 50%

Fact-Checking at Scale: Multimodal AI for Authenticity and Context Verification in Online Media

大规模事实核查:用于在线媒体真实性与上下文验证的多模态AI

Van-Hoang Phan, Tung-Duong Le-Duc, Long-Khanh Pham, Anh-Thu Le, Quynh-Huong Dinh-Nguyen, Dang-Quan Vo, Hoang-Quoc Nguyen-Son, Anh-Duy Tran, Dang Vu, Minh-Son Dao

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文为2025年ACM多媒体大会多媒体验证挑战赛开发了多模态验证系统,整合视觉取证等技术,可检测脱离上下文的媒体,提升了多媒体验证水平,为相关从业者提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 14 篇

2601.17003 2026-08-05 cs.CY cs.CL 版本更新 88%

Beyond Simulations: What 20,000 Real Conversations Reveal About Mental Health AI Safety

超越模拟:20000次真实对话揭示心理健康AI安全

Caitlin A. Stamatis, Jonah Meyerhoff, Richard Zhang, Olivier Tieleman, Matteo Malgaroli, Thomas D. Hull

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CL、cs.CY

AI总结 本研究通过分析20000次真实对话,揭示心理健康AI在现实应用中的安全性能差异,指出专门设计的AI在减少有害内容生成方面表现更优,但测试集失败率高于实际部署,强调需转向持续的安全保障而非有限的基准认证。

Comments 43 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08044 2026-08-05 cs.LG cs.AI cs.CL 版本更新 82%

When Behavioral Safety Evaluation Fails: A Representation-Level Perspective

当行为安全评估失败时:表征层面的视角

Enyi Jiang, Anders Gjølbye, Yibo Jacky Zhang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Technical University of Denmark(丹麦技术大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出行为安全与干预鲁棒性之间的“审计差距”,通过构建解离模型和引入潜在脆弱性评分(LVS),证明行为安全指标不足以衡量表征层面的鲁棒性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01586 2026-08-05 cs.CV cs.AI cs.RO 版本更新 79%

VLAFlow: A Unified Training Framework for Vision-Language-Action Models via Co-training and Future Latent Alignment

VLAFlow:通过协同训练和未来潜在对齐的视觉-语言-动作模型统一训练框架

Guoyang Xia, Fengfa Li, Hongjin Ji, Lei Ren, Fangxiang Feng, Kun Zhan, Yan Xie

机构 * Li Auto Inc.(理想汽车) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出VLAFlow统一框架,比较四种训练范式,发现语言监督保持视觉-语言泛化,未来潜在对齐改进状态转换建模,两者结合实现最佳迁移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23690 2026-08-05 cs.CV cs.CL 版本更新 79%

HomeSafeBench: Benchmarking Embodied Vision-Language Models in Free-Exploration Home Safety Inspection

HomeSafeBench:面向自由探索式家庭安全检查的具身视觉-语言模型基准

Jiashu Yao, Haoyu Wen, Siyuan Gao, Yuhang Guo, Zeming Liu, Heyan Huang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究针对家庭安全隐患检查需求构建HomeSafeBench基准,提出CueBack数据构建方法,微调4B规模VLM使分布外测试集F1值显著提升,缩小了与人类检查员的性能差距。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20697 2026-08-05 cs.LG cs.CL 版本更新 73%

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning

Token Buncher: 保护大语言模型免受有害强化学习微调的威胁

Weitao Feng, Lixu Wang, Peizhuo Lv, Tianyi Wei, Jie Zhang, Chongyang Gao, Sinong Zhan, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。

Comments Accepted by ACM CCS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22167 2026-08-05 cs.LG cs.AI 版本更新 73%

Estimating Tail Risks in Language Model Output Distributions

语言模型输出分布中的尾部风险估计

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11834 2026-08-05 cs.LG cs.CL 版本更新 73%

Don't Walk the Line: Boundary Guidance for Filtered Generation

不要走线:边界引导用于过滤生成

Sarah Ball, Andreas Haupt

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12787 2026-08-05 cs.AI cs.CL cs.CV cs.MM 版本更新 62%

Do We Really Need Multimodal Emotion Language Models Larger Than 1B Parameters?

我们真的需要参数超过10亿的多模态情感语言模型吗?

Kaiwen Zheng, Junchen Fu, Wenhao Deng, Hu Han, Joemon M. Jose, Xuri Ge

机构 * University of Glasgow(格拉斯哥大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 质疑多模态情感识别需参数超10亿模型的假设,提出轻量级MER框架Light-MER,通过知识蒸馏及两种优化策略,在九个基准数据集实验中实现最优性能并显著提高推理效率,凸显小模型潜力。

Comments Accepted by ACM MM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13801 2026-08-05 cs.LG cs.AI 版本更新 62%

Improving Reproducibility in Evaluation through Multi-Level Annotator Modeling

通过多级标注者建模提高评估的可重复性

Deepak Pandita, Flip Korn, Chris Welty, Christopher M. Homan

机构 * Rochester Institute of Technology(罗切斯特理工学院) Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级抽样方法,通过分析标注者数量与响应数量的平衡,提升评估结果的可重复性与统计显著性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08442 2026-08-05 cs.CR cs.AI cs.LG 版本更新 62%

Injection-Execution Dissociation: A Mechanistic Evaluation of Persistent Memory Attacks and Defenses in Stateful LLM Agents

多层架构中的防御效果:对持久内存攻击状态机LLM代理的机制性评估

Jun Wen Leong

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了六种防御措施在九个开源模型上的延迟触发攻击效果,发现输入级和检索级过滤器效果不佳,而内存层工具门控(Memory Sandbox)显著降低攻击成功率,揭示了不同防御类别的失效原因。

Comments v4: Added double dissociation (reasoning-mode ablation), content-layer defense (RATG), loaded-corpus frontier evaluation (21 models, 3 providers, N=40), 7B judge capability bound, reproducibility validity criterion, ethics/disclosure statement. Gemini 3.1 Pro Preview 95% ASR; GPT-5.1 regression (22.5%); tripartite vendor divergence. Code: github.com/junwenleong/stateful-agent-security-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 62%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02965 2026-08-05 cs.AI 版本更新 57%

Designing for Doubt: The Case for Informed Abstention in Autonomous Agents

基准测试无法衡量的:论自主智能体弃权能力的评估

Victor Ojewale, Suresh Venkatasubramanian

机构 * Brown University(布朗大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文指出自主智能体基准测试忽视弃权能力,提出合规偏差概念,并引入弃权场景分类和评估协议,实验表明安全-可用性权衡是可调的。

Comments Accepted to AIES 2026, this is an updated version to the RLEval workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23954 2026-08-05 cs.AI 版本更新 57%

An empirical evaluation of the risks of AI model updates using clinical data: stability, arbitrariness, and fairness

基于临床数据的AI模型更新风险实证评估:稳定性、任意性与公平性

Ioannis Bilionis, Ricardo C. Berrios, Luis Fernandez-Luque, Carlos Castillo

机构 * Spanish Ministry of Science and Innovation(西班牙科学与创新部) Department of Research and Universities of the Government of Catalonia(加泰罗尼亚政府研究与大学部门) MCIN/AEI /10.13039/501100011033(MCIN/AEI) Maria de Maeztu Units of Excellence Programme(玛丽亚·德·玛埃斯特乌卓越计划)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文通过实证研究评估AI模型更新对临床决策支持系统的影响,探讨模型稳定性、预测任意性及公平性问题,提出持续监控框架以提升系统可靠性。

Comments Best Paper Award in iEEE EMBC 2026. 4 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24413 2026-08-05 cs.CL 版本更新 57%

Pingala: Prosody-Aware Decoding for Sanskrit Poetry Generation

PINGALA:面向梵文诗歌生成的声调感知解码

Manoj Balaji Jagadeeshan, Atul Singh, Nallani Chakravartula Sahith, Amrith Krishna, Pawan Goyal

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出PINGALA解码方法,通过将诗歌分段提升语义连贯性10%,并利用SLP1转写提高音律对齐46%,同时引入参考无关评估方法。

Comments new changes added

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他安全 5 篇

2407.21311 2026-08-05 cs.CV cs.AI cs.LG 版本更新 82%

Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment

基于自监督视觉Transformer与协同跨域对齐的高效无监督域适应

Ali Abedi, Q. M. Jonathan Wu, Ning Zhang, Farhad Pourpanah

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EUDA框架,以冻结的DINOv2为特征提取器,结合SDAL损失,在多数据集上实现高效无监督域适应,可训练参数减少42%至99.7%,适配资源受限环境。

Comments 22 pages, 4 figures

Journal ref Abedi, A., Wu, Q.M.J., Zhang, N. et al. Efficient unsupervised domain adaptation via self-supervised vision transformer and synergistic cross-domain alignment. Int. J. Mach. Learn. & Cyber. 17, 423 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19066 2026-08-05 cs.CL cs.AI 版本更新 62%

Large Language Models provide support for the parallelogram theory of analogy

平行四边形反击:LLM生成的类比优于人类

Qiawen Ella Liu, Raja Marjieh, Jian-Qiao Zhu, Adele E. Goldberg, Thomas L. Griffiths

机构 * Princeton University(普林斯顿大学) The University of Hong Kong(香港大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了人类和LLM在类比任务中的表现,发现LLM生成的类比更符合平行四边形结构,且人类在生成关系保持的类比时表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00076 2026-08-05 cs.CV cs.AI 版本更新 57%

Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

哪种模态起决定作用?多模态大语言模型的反事实模态归因

Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究针对多模态大语言模型无法确定预测驱动模态的问题,提出反事实模态归因(CMA)框架,经实验验证其能准确识别决策驱动模态,可用于多模态模型的安全审计。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28818 2026-08-05 cs.CL q-bio.NC 版本更新 57%

Do VLMs Align Better with Humans than LLMs during Natural Reading?

VLMs 在自然阅读中可能不会全局性地增强与人类的对齐性优于 LLMs

Jinzhou Wu, Zhengwu Ma, Jixing Li, Baoping Tang, Zitong Lu

机构 * Department of Mechanical and Vehicle Engineering, Chongqing University(重庆大学机械与车辆工程学院) Department of Linguistics and Translation, City University of Hong Kong(香港城市大学语言学与翻译系) McGovern Institute for Brain Research, Massachusetts Institute of Technology(麻省理工学院麦戈文脑科学研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 通过严格文本设置比较LLM和VLM,发现多模态预训练在自然阅读中未带来全局性人类对齐优势,但视觉语义内容强的句子中VLM有选择性优势。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06005 2026-08-05 cs.CL 版本更新 57%

Disentangling MLP Neuron Weights in Vocabulary Space

解构词汇空间中的MLP神经元权重

Asaf Avrahamy, Yoav Gur-Arieh, Mor Geva

机构 * Blavatnik School of Computer Science and AI, Tel Aviv University(特拉维夫大学布拉瓦特尼克计算机科学与人工智能学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出ROTATE方法,通过优化神经元权重旋转以最大化词汇空间的峰度,解构MLP神经元权重,揭示词汇通道,提升语言模型可解释性。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏