arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-07 至 2026-07-07 共收录 74 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2606.28998 2026-07-07 cs.SE cs.AI 版本更新 89%

Reward-Free Code Alignment from Pretrained or Fine-Tuned LLM: Unpacking the Trade-offs for Code Generation

从预训练或微调的大语言模型进行无奖励代码对齐:揭示代码生成中的权衡

Sanjeepan Sivapiran, Gias Uddin

机构 * York University Canada(加拿大约克大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(title,abstract);分类 cs.AI

AI总结 本研究通过实证分析,探讨了在代码生成任务中,对预训练或微调后的大语言模型进行无奖励对齐(DPO和BoNBoN)的效果,发现预训练到对齐的路径提升更大,但微调版本基线更高。

Journal ref The ACM International Conference on the Foundations of Software Engineering (FSE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15765 2026-07-07 cs.LG cs.GT stat.ML 版本更新 85%

Shapley-based Data Valuation for LLM Alignment via Sequential Preference Optimization

基于Shapley值的大语言模型对齐数据估值:通过顺序偏好优化

Mélissa Tamine, Otmane Sakhi, Benjamin Heymann, Maxime Vono, Patrick Loiseau

机构 * Criteo AI lab(Criteo AI实验室) FairPlay joint team(FairPlay联合团队) CREST ENSAE Institut Polytechnique de Paris(巴黎理工学院) Inria(法国国家科学与技术研究院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract,abstract_cn);分类 cs.LG

AI总结 研究大语言模型对齐中数据估值问题,针对基于Shapley值估值计算量大的挑战,提出顺序偏好优化方法,可高效近似Shapley值,计算真实偏好数据集的Shapley值并揭示各源对模型对齐的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10494 2026-07-07 cs.CL cs.LG 版本更新 82%

Coverage-Controlled Preference Mining from Noisy Claim Verification for Evidence-Grounded Generation

基于噪声声明验证的覆盖控制偏好挖掘用于基于证据的生成

Weixin Liu, Congning Ni, Qingyuan Song, Susannah L. Rose, Murat Kantarcioglu, Bradley A. Malin, Zhijun Yin

机构 * Vanderbilt University(范德比大学) Vanderbilt University Medical Center(范德比大学医学中心) Lirio Virginia Tech(弗吉尼亚理工大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 研究临床简要医院病程总结中基于证据生成的问题,引入VERI-DPO框架,将噪声声明验证转化为覆盖控制的摘要级偏好,经实验验证该框架能降低不支持率,提升模型表现。

Comments 15 pages, 1 figure, 8 tables. Major revision with locked MIMIC-IV transfer evaluation, blinded pairwise human assessment, matched multi-seed ablations, revised title, and revised author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04136 2026-07-07 cs.AI 版本更新 81%

A Technical Survey of Reinforcement Learning Techniques for Large Language Models

大语言模型强化学习技术的技术综述

Saksham Sahai Srivastava, Vaneet Aggarwal

机构 * University of Georgia(佐治亚大学) Purdue University(普渡大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);safety(abstract)

AI总结 综述强化学习与语言模型整合,介绍如近端策略优化等算法,分析其在各领域应用,对失败模式算法分析,给出分类法,评估趋势并探讨挑战与新兴方向,为研究提供路线图。

Comments Accepted to ACM Transactions on Intelligent Systems and Technology, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19139 2026-07-07 cs.CL cs.AI 版本更新 79%

The Rise of Verbal Tics in Large Language Models: A Systematic Analysis Across Frontier Models

大语言模型中言语 tic 的兴起:前沿模型的系统分析

Shuai Wu, Xue Li, Yanna Feng, Yufang Li, Zhijun Wang, Ran Wang

机构 * Lead Researcher(研究员) Research Assistant(研究助理) Academic Advisor(学术顾问) Research Consultant(研究顾问)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了八个前沿大语言模型中言语 tic 的现象,通过定制评估框架评估10,000个提示,发现 Gemini 3.1 Pro tic 值最高,DeepSeek V3.2 最低,并揭示了 tic 在多轮对话中的累积效应及跨语言差异。

Comments 17 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07468 2026-07-07 cs.LG cs.CL cs.MA 版本更新 79%

Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models

通过在线自我博弈强化学习追踪移动目标以实现更安全的语言模型

Mickel Liu, Liwei Jiang, Yancheng Liang, Simon Shaolei Du, Yejin Choi, Tim Althoff, Natasha Jaques

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 研究传统大语言模型安全对齐问题,引入Self-RedTeam算法,通过在线自我博弈多智能体强化学习持续共同进化攻防策略,有理论安全保障,实证效果好,推动从被动修补到主动协同进化转变。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18037 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards

梯度正则化减轻基于人类反馈和可验证奖励的强化学习中的奖励作弊

Johannes Ackermann, Michael Noukhovitch, Takashi Ishida, Masashi Sugiyama

机构 * The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Mila(蒙特利尔大学Mila)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究基于人类反馈或可验证奖励的强化学习中奖励作弊问题,提出用梯度正则化使训练偏向奖励更准确区域,理论推导并实证验证,还改进方法,结果显示其比KL惩罚表现更好。

Comments Accepted at ICML 2026, 25 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08048 2026-07-07 cs.IR cs.AI cs.CL 版本更新 73%

TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance

TaoSR-AGRL:用于电子商务搜索相关性的自适应引导强化学习框架

Jianhui Yang, Yiming Jin, Pengkun Jiao, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Tsinghua University(清华大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团) Fudan University(复旦大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 电商搜索中查询-产品相关性预测很关键,现有方法有局限。提出TaoSR-AGRL框架,通过规则感知奖励塑造和自适应引导重放两大创新,提升模型推理能力,在实验中表现优于基线,已成功部署。

Comments Accepted to The Web Conference (WWW) 2026, Industry Track, Oral

Journal ref Proceedings of the ACM Web Conference 2026 (WWW '26), 2026, pp. 7955-7966

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 16 篇

2606.28639 2026-07-07 cs.LO cs.AI cs.CC cs.CL 版本更新 87%

The Unverifiability of Artificial General Intelligence (AGI) Alignment, Static and Dynamic: From Trakhtenbrot's Wall to the Safety-Generality Tension

人工通用智能对齐的不可判定性

Jose Pascual Gumbau Mezquita

机构 * University Jaume I de Castelló(贾乌梅·伊大学)

专题命中 安全训练 :safety(title,abstract);alignment(title);分类 cs.CL、cs.AI

AI总结 本文证明了AGI安全的核心障碍不是对齐状态的不可能性,而是其结构性不可验证性,通过两个不可判定性定理和Trakhtenbrot墙揭示了工程防御的局限性,并推导出完备性-可靠性-可处理性三难困境。

Comments v2: substantially expanded and retitled. Adds unpublished results on the dynamic (self-modifying) case, deriving the persistence barrier from Rice's Theorem one level up; a supervisory-regress theorem linking the results to scalable oversight and Yampolskiy's verifier theory; and a unified treatment of all four barriers as one obstruction, the Expressivity Invariant

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11878 2026-07-07 cs.CL 版本更新 77%

LLMs Encode Harmfulness and Refusal Separately

大语言模型分别编码有害性和拒绝性

Jiachen Zhao, Jing Huang, Zhengxuan Wu, David Bau, Weiyan Shi

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学)

专题命中 安全训练 :safety(abstract);jailbreak(abstract);AI safety(abstract);分类 cs.CL

AI总结 研究大语言模型对有害性的理解,发现其有害性和拒绝性在模型内分别编码,有害性方向与拒绝方向不同,据此揭示越狱方法原理及对抗微调影响,提出潜在危害表示的安全应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06628 2026-07-07 cs.RO cs.CV 版本更新 71%

MIND-V: Hierarchical World Model for Long-Horizon Robotic Manipulation with RL-based Physical Alignment

MIND-V:基于强化学习物理对齐的长期机器人操作分层世界模型

Ruicheng Zhang, Mingyang Zhang, Jun Zhou, Xiaofan Liu, Zunnan Xu, Zhizhou Zhong, Puxin Yan, Haocheng Luo, Xiu Li

机构 * Tsinghua University(清华大学) X Square Robot(X Square机器人) Sun Yat-sen University(中山大学) HKUST(香港科技大学)

专题命中 安全训练 :alignment(title)

AI总结 提出MIND-V分层世界模型,通过语义推理、行为语义桥接和运动视频生成,结合强化学习物理对齐,实现长期机器人操作视频的物理合理合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25533 2026-07-07 cs.CV cs.AI 版本更新 70%

VISOR++: Universal Visual Inputs based Steering for Large Vision Language Models

VISOR++:基于通用视觉输入的大型视觉语言模型转向

Ravikumar Balakrishnan, Mansi Phute

机构 * HiddenLayer, USA(HiddenLayer美国分校) Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究视觉语言模型行为控制,针对现有方法局限,提出VISOR++,通过优化视觉输入实现行为控制,无需运行时访问模型内部,在多模型上验证有效性且能保持无关任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02368 2026-07-07 cs.CL cs.AI cs.LG 版本更新 67%

Evolutionary Guided Decoding: Iterative Value Refinement for LLMs

进化引导解码:大语言模型的迭代值细化

Zhenhua Liu, Lijun Li, Ruizhe Chen, Yuxian Jiang, Tong Zhu, Zhaochen Su, Wenliang Chen, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Soochow University(苏州大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现引导解码中值函数不准确源于分布差距,提出迭代值细化框架,用值探索提供训练信号,迭代自我细化利用改进值函数生成高质量数据,实验证明该框架能有效对齐语言模型并降低计算成本。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24827 2026-07-07 cs.LG cs.AI 版本更新 62%

Incompressible Knowledge Probes: Estimating Black-Box LLM Parameter Counts via Factual Capacity

不可压缩的知识探针:通过事实容量估计黑盒大语言模型参数数量

Bojie Li

机构 * Pine AI

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出不可压缩知识探针,通过事实容量估计大语言模型参数数量,验证了参数数量与知识容量的对数线性关系,展示了模型在不同厂商和不同世代中的持续扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29014 2026-07-07 cs.AI cs.DL 版本更新 57%

Customized Generative AI Agent for Transportation Engineering Practice: A Development and Continued Pre-training Guideline

面向交通工程实践的定制化生成式AI智能体:开发与持续预训练指南

Dianwei Chen, Yuan-Zheng Lei, Zifan Zhang, Yuchen Liu, Xianfeng Yang

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 提出基于LoRA框架对六种大语言模型进行持续预训练的方法,以提升其在交通工程领域的专业内容理解与推理能力,Qwen2.5-7B和LLaMA-3.1-8B表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17255 2026-07-07 physics.acc-ph cs.AI 版本更新 57%

Agentic Artificial Intelligence for Multistage Physics Experiments at a Large-Scale User Facility Particle Accelerator

面向大规模用户设施粒子加速器的多阶段物理实验的代理AI

Thorsten Hellert, Drew Bertwistle, Simon C. Leemann, Antonin Sulc, Marco Venturini

机构 * Lawrence Berkeley National Laboratory(伯克利国家实验室)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出首个基于语言模型的代理AI系统,实现大规模用户设施粒子加速器上多阶段物理实验的自动化执行,通过结构化执行计划减少准备时间并确保安全约束。

Journal ref Phys. Rev. Research 8, L012017 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11943 2026-07-07 cs.OS cs.LG 版本更新 57%

ProbeLogits: Kernel-Level LLM Inference Primitives for AI-Native Operating Systems

ProbeLogits:面向AI原生操作系统内核级的LLM推理原语

Daeyeon Son

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出ProbeLogits,一种在操作系统内核层面执行单次前向传递并读取特定token logit的原语,用于分类代理行为的安全性,通过校准强度alpha实现部署时的策略控制,提升安全性与效率。

Comments 18 pages, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07866 2026-07-07 cs.RO cs.LG cs.SY eess.SY 版本更新 57%

Language-Guided Grasping under Partial Observation for Mobile Manipulation in Field Inspection and Maintenance

用于现场检查和维护中移动操作的部分观察下语言引导抓取

Dilermando Almeida, Juliano Negri, Guilherme Lazzarini, Thiago H. Segreto, Ranulfo Bezerra, Gustavo J. G. Lahr, Ricardo V. Godoy, Marcelo Becker

机构 * Department of Mechanical Engineering, Federal University of Uberlândia(联邦大学伯南迪利亚机械工程系) Department of Mechanical Engineering, University of São Paulo(圣保罗大学机械工程系) Graduate School of Information Sciences, Tohoku University(东北大学信息科学研究生院) Faculdade Israelita de Ensino e Pesquisa Albert Einstein, Hospital Israelita Albert Einstein(艾伯特·爱因斯坦以色列教学与研究学院,艾伯特·爱因斯坦医院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 提出用于腿部移动操纵器在部分观察下的语言引导抓取流程,经多步骤处理,在四足机器人上实现并评估,相比基线提高抓取成功率,提升语言引导抓取可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02296 2026-07-07 cs.CL cs.IR 版本更新 57%

Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG

知道何时不回答:用于安全检索增强生成的轻量级知识库对齐的域外检测

Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc

机构 * New York University(纽约大学) National Institute on Drug Abuse(国家成瘾医学研究所) University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软公司)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究用于检索增强生成(RAG)系统的轻量级、知识库对齐的域外检测,通过PCA处理知识库嵌入,用方差保留或t检验排序选择子空间评分查询,评估规则和分类器,发现低维检测器性能好且更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23960 2026-07-07 cs.RO cs.AI 版本更新 57%

MAD-PINN: A Decentralized Physics-Informed Machine Learning Framework for Safe and Optimal Multi-Agent Control

MAD-PINN:一种用于安全和最优多智能体控制的分散式物理信息机器学习框架

Manan Tayal, Aditya Singh, Shishir Kolathaya, Somil Bansal

机构 * Center for Cyber-Physical Systems, Indian Institute of Science(印度科学研究院中心 for 联合体系统) Department of Electrical and Systems Engineering, University of Pennsylvania(宾夕法尼亚大学电气与系统工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空与航天工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 针对大规模多智能体系统安全与性能协同优化难题,提出MAD-PINN框架。利用基于上图的公式化方法,通过物理信息神经网络近似求解,采用分散训练与执行策略,实验表明其性能优越且具可扩展性。

Comments 9 Pages, 4 Figures, 4 Tables. First two authors have contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08521 2026-07-07 cs.CV cs.AI 版本更新 57%

VISOR: Visual Input-based Steering for Output Redirection in Vision-Language Models

VISOR:视觉语言模型中用于输出重定向的基于视觉输入的转向

Mansi Phute, Ravikumar Balakrishnan

机构 * Georgia Institute of Technology(佐治亚理工学院) HiddenLayer, Inc(HiddenLayer公司)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 研究提出VISOR方法,通过优化视觉输入实现对视觉语言模型行为的精细控制,在关键对齐任务中验证其有效性,且具有低开销等优势,但也揭示了视觉通道安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23847 2026-07-07 cs.CR cs.AI 版本更新 57%

Seven Security Challenges in Cross-domain Multi-agent LLM Systems

跨域多智能体LLM系统中必须解决的七个安全挑战

Ronny Ko, Jiseong Jeong, Shuyuan Zheng, Chuan Xiao, Tae-Wan Kim, Makoto Onizuka, Won-Yong Shin

机构 * Osaka University(大阪大学) Seoul National University(首尔大学) Yonsei University(延世大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文针对跨域多智能体LLM系统,提出七类新型安全挑战,包括攻击示例、评估指标和未来研究方向。

Journal ref npj AI(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17384 2026-07-07 cs.RO cs.CV 版本更新 50%

IndustryNav: Exploring Spatial Reasoning of Embodied Agents in Dynamic Industrial Navigation

IndustryNav:探索动态工业导航中具身智能体的空间推理

Yifan Li, Lichi Li, Anh Dao, Xinyu Zhou, Wenjun Huang, Tianyi Ma, Yicheng Qiao, Zheda Mai, Daeun Lee, Zichen Chen, Pan Wang, Lehan Yang, Tianlong Wang, Zhen Tan, Sheng Li, Mohit Bansal, Yang Ni, Yu Kong

机构 * Michigan State University(密歇根州立大学) Independent Researcher(独立研究者) University of California, Irvine(加州大学尔湾分校) Ohio State University(俄亥俄州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Santa Barbara(加州大学圣巴巴拉分校) University of Pittsburgh(匹兹堡大学) University of Virginia(弗吉尼亚大学) Arizona State University(亚利桑那州立大学) Purdue University Northwest(普渡大学西北分校)

专题命中 安全训练 :safety(abstract)

AI总结 针对视觉大语言模型在空间推理的挑战,提出IndustryNav基准,利用动态工业场景评估,给出零样本导航管道及安全指标,研究发现模型在路径规划等方面有缺陷,凸显向主动探索等任务发展的需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11907 2026-07-07 cs.RO 版本更新 50%

A Graph-Based Reinforcement Learning Approach with Frontier Potential Based Reward for Safe Cluttered Environment Exploration

一种基于前沿势奖励的基于图的强化学习方法用于安全杂乱环境探索

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology(计算机科学、电气与航天工程系,吕勒奥技术大学)

专题命中 安全训练 :safety(abstract)

AI总结 提出结合图神经网络探索贪心策略与安全护盾的方法,用近端策略优化算法训练网络,最大化探索效率并减少护盾干预,还提出奖励函数,能在杂乱环境高效安全探索。

Comments 6 pages, 4 figures, accepted at the 24th European Control Conference (ECC)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2508.10031 2026-07-07 cs.CR cs.AI cs.CL 版本更新 84%

Context Misleads LLMs: The Role of Context Filtering in Maintaining Safe Alignment of LLMs

上下文误导大语言模型:上下文过滤在维持大语言模型安全对齐中的作用

Jinhwa Kim, Ian G. Harris

机构 * Department of Computer Science University of California, Irvine(计算机科学系,加州大学伊维特分校)

专题命中 越狱攻击 :alignment(title);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型受恶意上下文欺骗问题,提出上下文过滤防御机制,通过过滤不可信上下文识别真实意图,提升安全性同时保持性能,经对比分析验证其有效性。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11500 2026-07-07 cs.CR 版本更新 80%

ARMOR: Aligning Secure and Safe Large Language Models via Meticulous Reasoning

ARMOR:通过精细推理对齐安全的大语言模型

Zhengyue Zhao, Yingzi Ma, Somesh Jha, Marco Pavone, Patrick McDaniel, Chaowei Xiao

专题命中 越狱攻击 :alignment(abstract);RLHF(abstract);safety(abstract);jailbreak(abstract)

AI总结 研究大语言模型安全问题,针对现有方法不足,提出ARMOR,通过三步推理管道提取核心恶意意图并验证,开发ARMOR-Think提升性能,在防御越狱攻击上效果显著。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23270 2026-07-07 cs.AI 版本更新 77%

CAP-CoT: Cycle Adversarial Prompt for Improving Chain of Thoughts in LLM Reasoning

CAP-CoT:用于提升大语言模型推理中思维链的循环对抗提示

Shuxu Chen, Yitian Zhou, Jiaquan Zhang, Haoyu Bian, Wenrui Hu, Aming Wu, Sungyoung Lee, Chaoning Zhang, Hyundong Shin

机构 * Department of Electronic Engineering, Kyung Hee University(韩国庆熙大学电子工程系) School of Computer Science and Engineering, University of Electronic Science and Technology of China(中国电子科技大学计算机科学与工程学院) Henan Polytechnic University(河南理工大学) School of Computing, Kyung Hee University(韩国庆熙大学计算机学院)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);safety(abstract);分类 cs.AI

AI总结 CAP-CoT通过循环对抗提示框架提升LLM推理的准确性和稳定性,通过生成候选推理链、构造有缺陷的链并对比反馈,优化推理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09544 2026-07-07 cs.CL cs.AI cs.LG 版本更新 75%

Large Language Models Generate Harmful Responses Using a Distinct Mechanism, Shared Across Harm Types

大语言模型通过一种独特的统一机制生成有害内容

Hadas Orgad, Boyi Wei, Kaden Zheng, Martin Wattenberg, Peter Henderson, Seraphina Goldfarb-Tarrant, Yonatan Belinkov

机构 * Kempner Institute, Harvard University(哈佛大学肯普纳研究所) Princeton University(普林斯顿大学) Harvard University(哈佛大学) Cohere Technion—IIT(以色列理工学院)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过权重剪枝揭示大语言模型中有害生成的内部结构,发现有害内容生成依赖于一组通用且与良性能力不同的权重,表明对齐训练重塑了有害表示,解释了领域微调引发的广泛对齐偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30169 2026-07-07 cs.CY cs.AI cs.MA 版本更新 62%

Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms

分离性身份:语言模型代理缺乏声誉机制的基础

Botao Amber Hu, Helena Rong, Max Van Kleek

机构 * University of Oxford(牛津大学) New York University Shanghai(纽约大学上海分校)

专题命中 越狱攻击 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 本文指出语言模型代理因本体上的分离性(模块可替换、身份流动)而无法满足声誉机制所需的身份持续性、行为可预测性和制裁敏感性,从而提出转向基于可观察性、事前、构成性、协议的行为约束。

Comments Accepted by FaccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04356 2026-07-07 cs.CV 版本更新 50%

Stage-wise Attention-Guided Region Sequencing for Adversarial Attacks on Large Vision-Language Models

用于对大型视觉语言模型进行对抗攻击的逐阶段注意力引导区域排序

Jaehyun Kwak, Nam Cao, Boryeong Cho, Segyu Lee, Sumyeong Ahn, Se-Young Yun

机构 * KAIST(韩国科学技术院) KENTECH(KENTECH研究院)

专题命中 越狱攻击 :safety(abstract)

AI总结 研究针对大型视觉语言模型的有针对性对抗攻击,基于注意力分析提出逐阶段注意力引导区域排序,介绍了黑盒区域排序框架SAGA,在多个模型上取得了最先进的攻击成功率和最佳不可感知性。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏