arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-21 至 2026-08-21 共收录 60 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2608.19598 2026-08-21 cs.CV cs.AI cs.CL cs.MM 新提交 93%

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

PEA-DPO:用于多模态大语言模型对齐的感知增强型直接偏好优化

Jiawei Feng, Jiancan Wu, Xingyu Zhu, Junkang Wu, Xiang Wang, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 偏好对齐 :DPO(title,title_cn);alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型偏好优化存在的视觉不敏感性问题,提出PEA-DPO框架,利用视觉偏好信号缓解该问题,提升多模态对齐效果并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08022 2026-08-21 cs.CL cs.AI 版本更新 85%

DiverValue-Bench: A Benchmark and Fine-Tuning Framework for Aligning Large Language Models with Diverse Human Values

DiverValue-Bench:用于使大语言模型与多元人类价值观对齐的基准及微调框架

Yao Liang, Dongcheng Zhao, Feifei Zhao, Guobin Shen, Yuwei Wang, Dongqi Liang, Yi Zeng

专题命中 偏好对齐 :DPO(summary_cn,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究推出覆盖74个国家/地区的人群感知基准DiverValue-Bench,发现现有LLMs存在地理与人口统计学价值观对齐差异,结合LoRA与DPO的轻量微调可提升对齐效果,为全球公平AI开发提供实用基础。

Comments 11 pages, 5 figures. Accepted to IJCAI-ECAI 2026 (Human-Centred AI Special Track). v2: Updated to the camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15949 2026-08-21 cs.IR cs.AI cs.CL cs.LG 版本更新 83%

Ask to Be Sure: Informative Interactions for Confident Multi-Turn LLM Recommendation

为确认而提问:用于自信多轮大语言模型推荐的信息交互

Cedar Site Bai, Zhenyu Liao, Duanshun Li, Sheikh Sarwar, Huiyuan Chen, Yuan Chen, Changhe Yuan, Haiyang Zhang, Qilin Qi

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对多轮LLM推荐中有效挖掘用户偏好的挑战,提出以推荐熵降为奖励的方法微调LLM,结合SFT与DPO在INSPIRED、ReDial数据集上提升了推荐质量与对话效率。

Comments CIKM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20099 2026-08-21 cs.MA cs.CL cs.LG 新提交 82%

Reward-Guided Autoregressive Graph Generation for Efficient Multi-Agent Communication Topology Design

奖励引导自回归图生成的高效多智能体通信拓扑设计

Poomphob Suwannapichat, Boonyarit Changaival, Caesar Wu, Pascal Bouvry

专题命中 偏好对齐 :RLHF(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对多智能体系统通信拓扑设计中 token 消耗过高的问题,本文提出 RGA-Designer 方法,通过结合 RLHF 训练奖励模型微调图生成器,在保持任务准确率的同时降低了 token 消耗。

Comments Full version of extended abstract accepted at ICONIP 2026 (poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19595 2026-08-21 cs.IR 新提交 67%

SSR-GRPO: Integrating Supervision and Semantic IDs into Reinforcement Learning for Dense Retrieval in E-commerce

SSR-GRPO:将监督与语义标识符集成到强化学习中用于电商领域的密集检索

Guangxin Song, Xing Fang, Mingmin Jin, Jing Wang, Bokang Wang, Zhentao Song, Junjie Bai, Jianbo Zhu

专题命中 偏好对齐 :DPO(abstract,abstract_cn)

AI总结 该研究针对电商嵌入检索的语义处理难题,提出SSR-GRPO模型,通过双视角相关性评估、难负样本挖掘等策略优化R-GRPO,经实验验证有效并已部署于大规模电商平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24960 2026-08-21 cs.CL cs.AI cs.LG 版本更新 67%

Investigating the Interplay between Contextual and Parametric Chain-of-Thought Faithfulness under Optimization

探究优化下上下文与参数化思维链忠实性之间的相互作用

Jingyi Sun, Qianli Wang, Pepa Atanasova, Nils Feldhus, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) Technische Universität Berlin(柏林技术大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) BIFOLD – Berlin Institute for the Foundations of Learning and Data(BIFOLD – 柏林学习与数据基础研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过提出统一偏好对齐接口FaithMate,研究上下文与参数化两种思维链忠实性范式在优化下的相互作用,发现两者正相关但不对称,且上下文忠实性指标间存在权衡。

Comments The first two authors contributed equally and share first-authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19746 2026-08-21 cs.CL 新提交 57%

PersonalBench: Measuring the Authorship Gap in LLM Personalization

PersonalBench:测量大语言模型个性化中的作者差距

Yash Ganpat Sawant

机构 * Independent AI Researcher(独立人工智能研究员)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本研究推出PersonalBench基准,通过LUAR、LLM评判者、自动风格计量学评估LLM个性化方法,发现其可区分作者但未达人类水平,发布该基准为LLM个性化提供校准工具。

Comments 17 pages. Extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19271 2026-08-21 math.GM 新提交 50%

Information Geometry (IG) Lives at Edge or Boundary of SMG (statistically meaningful geometry): - the First Edge Theorem and Applications

信息几何(IG)存在于SMG(统计意义几何)的边缘或边界:第一边缘定理及其应用

Bing Cheng, Yi-Shuai Niu, Howell Tong, Shing-Tung Yau

专题命中 偏好对齐 :alignment(abstract)

AI总结 该研究提出第一边缘定理,证明信息几何与传统统计学是统计意义几何空间的退化边界层,利用纤维丛机制解决深度学习泛化悖论等多领域问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 4 篇

2606.18632 2026-08-21 cs.RO 版本更新 82%

ROBOSHACKLES: A Safety Dataset for Human-Injury Prevention in Embodied Foundation Models

ROBOSHACKLES: 面向具身基础模型中人体伤害预防的安全数据集

Zhuowen Yin, Chongyang Liu, Wenzhang Yang, Renjue Li, Yinxing Xue

机构 * Institute of Al for Industries, Chinese Academy of Sciences(工业人工智能研究所,中国科学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 为解决机器人伤害人类数据难以安全收集的问题,提出基于真实观测的安全数据构建流水线,生成包含1万条视频的ROBOSHACKLES数据集,涵盖直接和间接伤害类别,评估发现现有模型在安全关键场景下100%产生不安全动作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19579 2026-08-21 cs.AI math.DS 新提交 79%

Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics

基于DMD的提示-响应嵌入动态分类实现大语言模型安全

Mohamed Akrout, Olivera Kotevska, Dan Wilson

机构 * University of Tennessee(田纳西大学) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文将幻觉检测的动力系统框架扩展到LLM安全分类,通过拟合安全与不安全状态的Koopman模型,利用差分残差评分分类不安全输出,在多基准测试中验证了纳入提示嵌入的改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19836 2026-08-21 cs.LG cs.AI cs.LO 新提交 62%

Adaptive Probabilistic Shielding by Learning MDPs for Safe Reinforcement Learning

通过学习马尔可夫决策过程(MDP)实现自适应概率屏蔽用于安全强化学习

Astrid Horn Brorholt (1), Maris F. L. Galesloot (2), Nils Jansen (2) (3), Kim Guldstrand Larsen (1), Christian Schilling (1) ((1) Aalborg University, Aalborg, Denmark (2) Radboud University, Nijmegen, Netherlands (3) Ruhr University Bochum, Bochum, Germany)

机构 * Aalborg University(奥尔堡大学) Radboud University(拉德堡德大学) Ruhr University Bochum(波鸿鲁尔大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对已知MDP转移图但转移概率未知的场景,提出将概率屏蔽与在线模型学习结合的自适应方法,通过实验验证其在安全强化学习中的有效性。

Comments 19 pages, 3 figures, 3 tables. To be published in the proceedings of RV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19557 2026-08-21 cs.DC cs.MA 新提交 50%

When Do LLM Agents Help? Deadline-Aware Mixed-Criticality Task Scheduling at the Autonomous-Vehicle Edge

大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度

Reza Zakerian

专题命中 安全训练 :safety(abstract)

AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。

Comments 8 pages, 5 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2604.05853 2026-08-21 cs.CV 版本更新 90%

Reading Between the Pixels: An Inscriptive Jailbreak Attack on Text-to-Image Models

在像素之间阅读:一种针对文本到图像模型的 inscription 性 jailbreak 攻击

Zonghao Ying, Haowen Dai, Lianyu Hu, Zonglei Jing, Quanchen Zou, Yaodong Yang, Aishan Liu, Xianglong Liu

专题命中 越狱攻击 :jailbreak(title,title_cn);safety(abstract)

AI总结 本文提出 Etch 框架,通过分解对抗提示为语义伪装、视觉空间锚定和字形编码三层,实现对文本到图像模型的 inscription 性 jailbreak 攻击,验证了现有安全机制的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12616 2026-08-21 cs.AI cs.MM 版本更新 90%

Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs

每幅画都讲述一个危险的故事:基于内存增强的多智能体 jailbreak 攻击 VLMs

Jianhao Chen, Shiqin Wang, Haoyang Chen, Hanjie Zhao, Haozhe Liang, Zheng Wang, Tieyun Qian

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Tianjin University(天津大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 越狱攻击 :jailbreak(title,title_cn);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出MemJack框架,通过视觉语义引导多智能体协作,利用迭代空域投影过滤器提升对VLMs的攻击成功率,实验表明其在COCO数据集上达到71.48%的攻击成功率。

Comments This work was accepted by WISE2026. 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19737 2026-08-21 cs.CV cs.AI cs.CL 新提交 81%

TempJail: Temporal Jailbreak Attack against Large Vision-Language Models via Subtitle Scheduling

TempJail:基于字幕时序调度的针对大型视觉语言模型的时序越狱攻击

Ling Zhou, Yihao Huang, Jingling Sun, Zhiwen Tian, Yi Zeng, Qihe Liu, Shijie Zhou

机构 * University of Electronic Science and Technology of China(电子科技大学) East China Normal University(华东师范大学)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.CL、cs.AI

AI总结 TempJail是一种黑盒视频越狱框架,通过优化字幕时序调度攻击LVLMs,在四个模型和两个数据集上的攻击成功率优于基线。

Comments 8 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2602.07104 2026-08-21 cs.CV cs.AI 版本更新 79%

Extended to Reality: Prompt Injection in 3D Environments

扩展到现实:3D环境中的提示注入

Zhuoheng Li, Ying Chen

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.AI

AI总结 研究提出PI3D攻击,通过在3D环境中放置带文本的物理物体来注入提示,挑战多模态大语言模型的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 7 篇

2608.19816 2026-08-21 cs.CY 新提交 86%

Understanding as an Explicit and Assessable Component of Frontier AI Safety Decisions

将理解作为前沿AI安全决策的明确且可评估的组成部分

Stephen Barrett, Robin Bloomfield, Alexandra Chirilă, Mamoon Masud, David Meredith Hardy, Phillip Mulvana

专题命中 幻觉与事实性 :safety(title,abstract);AI safety(title);分类 cs.CY

AI总结 该研究提出一种基于Assurance 2.0框架的临时方法,用于明确且可评估前沿AI安全决策中的理解,经两种场景测试,该方法可应用且能驱动工程工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19376 2026-08-21 cs.CV cs.AI 新提交 79%

Does Marginal Coverage Guarantee Class-Conditional Safety for Zero-Shot VLMs Under Shift?

在分布偏移下,边际覆盖率能否保证零样本视觉语言模型(VLM)的类条件安全性?

Jai Kumar Sharma, Amartya Dutta

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 幻觉与事实性 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对CLIP等零样本VLM,发现边际共形覆盖率无法保证类条件安全性,源域校准无法迁移,目标域类别校准可改善尾部但需类别标签,指出其仅为平均可靠性统计量。

Comments Accepted at the ECCV 2026 Workshop on Uncertainty Quantification for Computer Vision (UNCV). 34 pages (16 main + 18 supplementary), 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19206 2026-08-21 cs.CL cs.AI cs.MA 新提交 62%

Hallucination as a Feature, not a Defect: Evaluating a multi-agent architecture to transform speculative language-model outputs into testable scientific hypotheses

幻觉作为特征而非缺陷:评估一种将推测性语言模型输出转化为可检验科学假说的多智能体架构

Nicolas Rodriguez-Alvarez (IES Parquesol, Valladolid, Spain)

机构 * IES Parquesol(帕尔奎索尔学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出基于Rust的多智能体架构,通过生成与评估智能体的认识论摩擦循环将LLM的推测性输出转化为可检验假说,实验显示该架构在需经受严格约束时更具优势,且各架构在原创性等维度的平衡表现不同。

Comments 25 pages. Bilingual: full English version followed by the complete Spanish version. Includes an exploratory paired baseline and ablation study (6 conditions). Code and data: this https URL (https://doi.org/10.5281/zenodo.20649714)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11922 2026-08-21 cs.CL cs.IR cs.LG 版本更新 62%

LODESTAR: Robust Entropy-Based Answer Selection in Retrieval-Augmented Generation for Question Answering -- Directing Frozen-LLM Entropy with a Reinforcement-Learned Prompt Polarizer under Misleading Passages

LODESTAR:可信赖熵是被引导的,而非仅被测量——强化偏振器防止冻结型大语言模型(LLM)被错误证据误导而自信出错

Hung-Chun Hsu, Po-Jen Ko, Che-Cheng Wu, Li-Yang Chang, Chuan-Ju Wang

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 LODESTAR是首个通过强化学习训练偏振器、依据第三方冻结型LLM的不确定性评分文本干预的方法,可提升检索增强问答的F1值等指标,减少模型读取误导性段落的概率。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19973 2026-08-21 cs.CV cs.AI 新提交 57%

Open-Vocabulary 3D Object Detection with Co-Distillation Discovery and Dual Guidance Robust Training

基于协同蒸馏发现与双引导鲁棒训练的开放词汇三维目标检测

Shangbo Yuan, Jie Xu, Xiaofeng Zhu, Na Zhao

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本研究提出含协同蒸馏发现与双引导训练的开放词汇3D目标检测框架,在SUN RGB-D等数据集上性能优于现有最优方法。

Comments Accepted by ECCV26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19964 2026-08-21 cs.LG 新提交 57%

G-MARK: Grounded Multi-Agent Reasoning for Cooperative Driving via Knowledge Graphs

G-MARK:基于知识图谱的协同驾驶接地多智能体推理

Bhavya Gupta, Onat Gungor, Tajana Rosing

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校) West Virginia University(西弗吉尼亚大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 提出 G-MARK 框架,通过知识图谱实现协同驾驶多智能体推理,提升遮挡推理与控制选择性能,减小通信负载,效果优于现有基线。

Comments Accepted for oral presentation at the 25th IEEE International Conference on Machine Learning and Applications (ICMLA'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07761 2026-08-21 cs.CV 版本更新 50%

Video Evidence to Reasoning Efficient Video Understanding via Explicit Evidence Grounding

视频证据推理:通过显式证据接地实现高效的视频理解

Yanxiang Huang, Guohua Gao, Zhaoyang Wei

机构 * Department of Applied Mathematics, The Hong Kong Polytechnic University(应用数学系,香港理工大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出CoE框架,通过显式证据接地模块和强化学习优化的锚定协议,提升视频推理的准确性和可靠性。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 18 篇

2608.19825 2026-08-21 cs.CV cs.CL 新提交 83%

Towards Clinically Faithful Medical Image Captioning via Enhanced Vision-Language Alignment

基于增强型视觉-语言对齐的临床可信医学图像描述生成研究

Yunseo Lee, Hyun Jun Kim, Heeseung Shin, Changwon Lim

机构 * Chung-Ang University(中央大学)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 本研究针对医学图像描述生成的临床可信性问题,提出分离训练与推理对齐的框架,结合多编码器、辅助学习及MedPAIR-SCST方法,通过选择与强化学习对齐提升临床一致性,在数据受限场景下改善医学图像描述的可信度。

Comments 10 pages, 2 figures, 7 tables. Preprint submitted to IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09471 2026-08-21 cs.CV 版本更新 82%

CKAA: Cross-subspace Knowledge Alignment and Aggregation for Robust Continual Learning

CKAA:用于鲁棒持续学习的跨子空间知识对齐与聚合

Lingfeng He, De Cheng, Zhiheng Ma, Huaijie Wang, Dingwen Zhang, Nannan Wang, Xinbo Gao

机构 * School of Telecommunications Engineering, Xidian University(西安电子科技大学电信工程学院) School of Electronic Engineering, Xidian University(西安电子科技大学电子工程学院) SUAT-Faculty of Computational Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术大学SUAT计算微电子学院) Brain and Artificial Intelligence Laboratory, Northwestern Polytechnical University(西北工业大学脑与人工智能实验室)

专题命中 安全评测 :alignment(title,abstract)

AI总结 该研究针对基于PEFT的持续学习方法在误导性任务ID下决策模糊的问题,提出CKAA框架,通过DKA和TC-MoA两项创新提升鲁棒性,实验显示其性能优于同类方法。

Comments Accepted by IEEE Transactions on Image Processing (TIP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02022 2026-08-21 cs.AI 版本更新 79%

ATBench: A Diverse and Realistic Agent Trajectory Benchmark for Safety Evaluation and Diagnosis

ATBench:一个多样且现实的代理轨迹基准,用于安全评估与诊断

Yu Li, Haoyu Luo, Yuejin Xie, Yuqian Fu, Zhonghao Yang, Shuai Shao, Qihan Ren, Wanying Qu, Yanwei Fu, Yujiu Yang, Jing Shao, Xia Hu, Dongrui Liu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) KAUST(卡塔尔人工智能科学中心) East China Normal University(华东师范大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 ATBench通过多样化的轨迹和现实场景评估代理安全,包含1000条轨迹,挑战性强,支持跨基准比较和长周期故障诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23487 2026-08-21 cs.AI 版本更新 70%

CADRE: Stable, Parameter Efficient Adaptation of Medical Vision Language Models with Bounded Forgetting and Prior Drift

CADRE:具有有界遗忘和先验漂移的稳定、参数高效的医学视觉语言模型适应

Rishabh Jha, Amrita Singh, Prashanna Chudal

机构 * Mindriser's Consortium, Kathmandu, Nepal(Mindriser's 联盟,加德满都,尼泊尔) University of Victoria, BC, Canada(维多利亚大学,不列颠哥伦比亚省,加拿大)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 提出CADRE框架,通过结合低秩适应与弹性权重巩固及先验锚定惩罚,在仅训练0.23%参数下实现医学视觉语言模型的高精度、低遗忘和正向反向迁移,遗忘率降低约七倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19216 2026-08-21 cs.AI cs.CY 新提交 62%

Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model

有限主权与控制成本:当部署方不拥有模型时的AI监管定价

Zhen Wen Lim

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文针对部署方不拥有模型的AI监管场景,提出有限主权概念与主权折扣成本,通过135万次模拟实验明确控制协议需明确访问假设的结论。

Comments 25 pages, 5 figures. Synthetic access-ablation study; not real-world payment-system evidence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 62%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: this http URL (http://github.com/agulaya24/beyond-recall) 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20338 2026-08-21 cs.CL 新提交 57%

ConceptGuard: Benchmarking Context-Sensitive Unlearning in Large Language Models

ConceptGuard:评估大语言模型中上下文敏感的遗忘能力

Sahil Kale, Ian Harris

机构 * Pune Institute of Computer Technology(浦那计算机技术学院) University of California, Irvine(加州大学欧文分校)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究针对大语言模型遗忘能力评估的缺陷,提出ConceptGuard基准,聚焦两用概念,发现现有遗忘技术存在性能缺陷,为实用安全的遗忘方法提供思路。

Comments Submitted to NeurIPS E&D Track 2026; 17 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏