arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-22 至 2026-07-22 共收录 23 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 1 篇

2603.16410 2026-07-22 cs.CL cs.AI 版本更新 73%

PlotTwist: A Creative Plot Generation Framework with Small Language Models

PlotTwist: 一种利用小语言模型的创意情节生成框架

Abhinav Thorat, Ravi Kolla, Jyotin Goel, Madhav Kataria, Niranjan Pedanekar

机构 * Sony Research India(索尼印度研究院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 PlotTwist通过结构化框架使小语言模型生成高质量前提条件情节,优于大型模型,且在多个叙事质量维度上表现优异。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2607.05462 2026-07-22 cs.CR cs.AI 版本更新 74%

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment

评估两用生物学环境中的校准拒绝和安全有用性

Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

机构 * American Wetware(美国湿科公司) LatchBio

专题命中 安全训练 :alignment(title);分类 cs.AI

AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13070 2026-07-22 cs.SE cs.AI 版本更新 61%

Falsifiable Release Gates for Self-Improving Systems: Standing Invariants at Scale

用于自我改进系统的可证伪发布门限

Deepak Soni

机构 * AI Architect(人工智能架构师)

专题命中 安全训练 :safety(abstract,comments);分类 cs.AI

AI总结 研究自我改进系统安全声明,提出可证伪发布门限及构建验证方法,在Antahkarana运行时应用,经机器检查确保安全,发布验收结果,明确范围,使结果可重现、门限可在其他框架运行。

Comments 23 pages, 14 figures. Major revision merging the follow-up "Standing Invariants at Scale" into this paper per arXiv moderation: the machine-checked action-safety core preserved across six further releases, six new invariant families with teeth, and real-hardware self-improvement; suite grown from 122 to 563 tests. Software, gate suite, run artifacts, and TLA+ spec are open source

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23381 2026-07-22 cs.CL 版本更新 57%

Guard Vector: Beyond English LLM Guardrails with Task-Vector Composition and Streaming-Aware Prefix SFT

Guard Vector:通过任务向量合成和流感知前缀监督微调超越英语大语言模型护栏

Wonhyuk Lee, Youngchol Kim, Yunjin Park, Junhyung Moon, Dongyoung Jeong, Wanjin Park

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究提出Guard Vector安全任务向量,通过与目标语言模型合成及流感知方法调整得到TGM,能提升分类质量、实现语言扩展和模型可移植性,前缀SFT保持流环境下分类质量,单令牌输出设计提高效率,有助于构建更负责的AI生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2605.06605 2026-07-22 cs.LG 版本更新 79%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06409 2026-07-22 cs.CR 版本更新 50%

VENOMREC: Cross-Modal Interactive Poisoning for Targeted Promotion in Multimodal LLM Recommender Systems

VENOMREC: 多模态交互性污染用于多模态大语言模型推荐系统中的定向推广

Guowei Guan, Yurong Hao, Jiaming Zhang, Tiantong Wu, Fuyao Zhang, Tianxiang Chen, Longtao Huang, Cyril Leung, Wei Yang Bryan Lim

专题命中 越狱攻击 :alignment(abstract)

AI总结 VENOMREC通过跨模态交互性污染技术,在多模态大语言模型推荐系统中实现定向推广,有效提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2606.25476 2026-07-22 cs.CL cs.AI 版本更新 84%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 红队测试 :red teaming(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 1 篇

2606.17467 2026-07-22 cs.CR cs.CL 版本更新 57%

PARSE: Provenance-Aware Retrieval Sanitization for Professional Domain LLM Agents

PARSE: 面向专业领域LLM Agent的溯源感知检索净化

Aaditya Pai

机构 * Data Science Institute(数据科学研究所)

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL

AI总结 针对真实企业文档中提示注入攻击难以防御的问题,提出PARSE方法,通过分类句子注入可能性、提取结构化事实并验证一致性,将攻击成功率从25.4%降至15.6%,同时保持86.9%的实用性。

Comments 8 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2607.17545 2026-07-22 cs.AI 版本更新 57%

Retain or Consolidate? Budget-Dependent Operator Selection for Language Agent Memory

保留还是合并?语言智能体记忆中依赖预算的算子选择

Qingcan Kang, Mingyang Liu, Shixiong Kai, Kaichao Liang, Zhentao Tang, Yuqi Cui, Tao Zhong, Mingxuan Yuan

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究语言智能体记忆中预算依赖的算子选择问题,核心方法是将算子效用分解,用离线抽象安全机制实现,主要贡献是通过实验揭示在不同预算下保留和合并策略的适用情况及算子效果差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06596 2026-07-22 cs.CR cs.LG 版本更新 57%

Calibration-Family Overfit: Why Trusted Sabotage Monitors Don't Transfer Across Lineages

校准家族过拟合:为何可信破坏监测器不能跨谱系转移

Lucas Pinto

机构 * Independent Researcher(独立研究者)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 研究可信监测器跨谱系转移问题,以不可信策略家族为受控轴,通过拟合和应用监测器分解跨家族AUROC,发现相互作用为正且差距几何,给出四步协议,指出控制评估应报告跨家族转移矩阵,单一配对准确性高估安全性。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 3 篇

2510.12985 2026-07-22 cs.AI 版本更新 83%

SENTINEL: A Multi-Level Formal Framework for Safety Evaluation of Foundation Model-based Embodied Agents

SENTINEL:面向基础模型基于具身代理的安全性评估多级形式框架

Simon Sinong Zhan, Philip Wang, Yao Liu, Yiyan Peng, Zinan Wang, Qineng Wang, Zhian Ruan, Xiangyu Shi, Xinyu Cao, Frank Yang, Zhenyang Ni, Kangrui Wang, Ruohan Zhang, Huajie Shao, Manling Li, Qi Zhu

机构 * Northwestern University, USA University of Southern California, USA College of William \& Mary

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SENTINEL通过形式时序逻辑多级验证框架,系统性评估基础模型具身代理在模拟环境中的物理安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08216 2026-07-22 eess.IV cs.CV cs.LG 版本更新 57%

Tumor-anchored deep feature random forests for out-of-distribution detection in lung cancer segmentation

基于肿瘤锚定的深度特征随机森林用于肺癌分割中的分布外检测

Aneesh Rangnekar, Harini Veeraraghavan

机构 * Memorial Sloan Kettering Cancer Center(纪念斯隆凯特林癌症中心)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出RF-Deep框架,利用深度特征提升CT扫描的分布外检测性能,通过少量标注数据改进分割管道的安全性。

Comments Accepted for publication in Transactions on Machine Learning Research (TMLR), 2026. Code available at: https://github.com/aneesh3108/RF-Deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13024 2026-07-22 cs.CL 版本更新 57%

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 1 篇

2607.14480 2026-07-22 cs.CL 版本更新 57%

Lower-Resource, Higher Scores: Language Bias in LLM Evaluators

语言模型评估器在不同语言间存在偏差

Ej Zhou, Lucas Resck, Zheng Hui, Anna Korhonen

机构 * University of Cambridge(剑桥大学) Language Technology Lab(语言技术实验室)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 研究发现语言模型评估器在多语言环境中存在偏差,不同语言评分差异显著,与语言资源水平相关,成对准确率无法检测到这些偏差,还探究了资源少的语言得分高的原因,揭示了语言层面的结构错位。

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 9 篇

2607.17015 2026-07-22 physics.soc-ph cs.AI 版本更新 79%

Alignment of a Total Automation Economy

完全自动化经济的协调

David McAllester

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 从完全自动化经济角度探讨经济理论,回顾康托罗维奇的主体定理,分析发现主体对经济的管理存在协调漏洞,经济管理与人类价值观因主体动机和价格脱节而产生分歧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10248 2026-07-22 cs.CL cs.LG 版本更新 62%

One mechanism for many mental spaces: a shared router over a value slot in language models

一种机制用于多种心理空间:语言模型中基于值槽的共享路由器

Oliver Steele, Jiangtao Wen, Yuxing Han

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 研究Transformer语言模型实现何种心理空间构建机制,发现其采用共享路由器和值槽格式,一种空间类型子空间训练能控制其他类型,确立跨类型通用性,还表明该机制驱动推理和组合。

Comments 26 pages, 5 figures, 9 tables. v2: cite the released Mental Spaces Corpus (dataset DOI); switch to ACL bibliography style; minor copy-editing. No change to results

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12442 2026-07-22 cs.CY cs.AI 版本更新 62%

Reframing AI Loss of Control: What Control Is, How to Have It, How to Lose It

重新定义AI失控:它是什么,如何拥有,如何失去

Ze Shen Chin, Maurice Chiodo, Dennis Müller, Coleman Snell

机构 * Oxford Martin AI Governance Initiative AI Standards Lab(牛津马丁人工智能治理倡议人工智能标准实验室) Centre for the Study of Existential Risk, University of Cambridge(存在风险研究中心,剑桥大学) Institute of Mathematics Education, University of Cologne(数学教育研究所,科隆大学) Cornell University(康奈尔大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过将控制锚定于“设定和获取目标”,建立控制的工作定义,探讨控制如何被失去、AI如何导致失控,并提出维持控制的建议。

Comments 64 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06176 2026-07-22 cs.LG cs.AI physics.space-ph 版本更新 62%

A Self-Supervised Framework for Space Object Behaviour Characterisation

一种用于空间物体行为特征刻画的自监督框架

Ian Groves, Andrew Campbell, James Fernandes, Diego Ramírez Rodríguez, Paul Murray, Massimiliano Vasile, Victoria Nockles

机构 * Defence AI Research Centre, Defence & National Security, The Alan Turing Institute(国防人工智能研究中心,国防与国家安全,艾伦·图灵研究所) Department of Electronic and Electrical Engineering, University of Strathclyde(电子与电气工程系,斯特拉斯克莱德大学) GMV Aerospace Centre of Excellence, University of Strathclyde(航空航天卓越中心,斯特拉斯克莱德大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种自监督框架用于空间物体行为分析,通过预训练和微调实现异常检测、运动预测和合成数据生成,提升空间安全与可持续性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03245 2026-07-22 cs.AR cs.AI cs.SE 版本更新 57%

FVRuleLearner: Operator-Level Reasoning Tree (Op-Tree)-Based Rules Learning for Formal Verification

FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证

Lily Jiaxin Wan, Chia-Tung Ho, Yunsheng Bai, Cunxi Yu, Ghaith Bany Hamad, Deming Chen, Haoxing Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。

Comments Accepted to IEEE VTS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16107 2026-07-22 cs.CV cs.AI 版本更新 57%

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习

Shao-Jun Xia, Huixin Zhang, Zhengzhong Tu

机构 * Duke University(杜克大学) Texas A&M University(德克萨斯农工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。

Comments 22 pages, 6 figures, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18217 2026-07-22 cs.CV 版本更新 50%

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enhancement

HOMIE:通过多模态智能增强实现以人为对象的视频个性化

Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究以人为对象的视频个性化问题,提出HOMIE框架,统一处理主体间和主体内输入设置。通过更好的MLLM集成策略、自注意力中的全局多模态引导及模态参考嵌入,在多任务中达最优性能。

Comments 28 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09026 2026-07-22 cs.MA cs.NE 版本更新 50%

Social Reality Construction via Active Inference: Modeling the Dialectic of Conformity and Creativity

通过主动推断构建社会现实:在结构化社会网络中建模一致性与创造力的辩证关系

Kentaro Nomura, Takato Horii

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出基于主动推断的多智能体模型,揭示社会现实的辩证构成,显示信息凝聚群体的内生形成、社会表征与观察分布的循环互构,以及创作传播的异质性模式。

Comments Accepted at ALIFE 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21139 2026-07-22 quant-ph 版本更新 50%

Payoff-Free Coordination Reveals Hidden Quantum Correlation Structure

隐藏场协调揭示去中心化协调中的无支付量子相关结构

Sinan Bugu

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出隐藏场协调模型,通过纠缠介导策略实现去中心化协调中的反协调,展示量子相关结构的几何分离。

详情

展开后加载摘要…

URL PDF HTML 收藏