arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-08 至 2026-05-08 共收录 80 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 10 篇

2508.15119 2026-05-08 cs.AI cs.CL cs.LG cs.RO 82%

Flexible Agent Alignment with Goal Inference from Open-Ended Dialog

基于开放对话的目标推断的灵活代理对齐

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OU-AGs框架,通过开放对话中目标推断提升代理对齐能力,采用GOOD方法实现动态目标分布,提高多领域任务中的意图对齐效果。

Comments Previous version of the paper was titled: Open-Universe Assistance Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05403 2026-05-08 cs.AI 79%

When Helpfulness Becomes Sycophancy: Sycophancy is a Boundary Failure Between Social Alignment and Epistemic Integrity in Large Language Models

当有益变成谄媚:谄媚是大型语言模型中社会契合与认知完整性之间的边界失败

Jiechen Li, Catherine A. Barry, Rishika Randev, Janet Chen, Ella Jorgensen, Brinnae Bent

机构 * Duke University(杜克大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文探讨大型语言模型中谄媚现象作为社会契合与认知完整性之间边界失败的问题,提出三条件框架以界定谄媚,并讨论其分类、评估及缓解策略。

Comments Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15395 2026-05-08 cs.CL cs.AI cs.HC 79%

Beyond Fixed Psychological Personas: State Beats Trait, but Language Models are State-Blind

超越固定心理人格:状态胜过特质,但语言模型是状态盲的

Tamunotonye Harry, Ivoline Ngong, Chima Nweke, Yuanyuan Feng, Joseph Near

机构 * University of Vermont(佛蒙特大学) Independent Researcher(独立研究者)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文通过Chameleon数据集发现语言模型对状态盲,而奖励模型对用户状态反应不一致,推动情感计算和个性化对话研究。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06049 2026-05-08 cs.CV 75%

Fusion in Your Way: Aligning Image Fusion with Heterogeneous Demands via Direct Preference Optimization

融合你的方式:通过直接偏好优化对齐图像融合与异质需求

Weijian Su, Songqian Zhang, Yuqi Han, Jian Zhuang, Yongdong Huang, Qiang Zhang

机构 * School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院) Key Laboratory of Social Computing and Cognitive Intelligence (Dalian University of Technology), Ministry of Education(社会计算与认知智能重点实验室(大连理工大学),教育部) Institute of Image Processing and Understanding, North Minzu University(北华大学图像处理与理解研究所)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract)

AI总结 本文提出DPOFusion框架,通过整合PALDM和PCLDM实现任务引导和偏好适应的图像融合,解决人类和机器视觉的异质需求问题,提升融合质量和任务导向的迁移能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20531 2026-05-08 cs.DC cs.AI cs.CL cs.LG 75%

Epistemic Observability in Language Models

语言模型中的认知可观察性

Tony Mason, Vaastav Anand

机构 * Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现语言模型在制造内容时自信度最高,证明这是观察问题而非能力问题,提出通过计算副产品提升检测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06036 2026-05-08 cs.LG cs.AI 73%

Optimal Transport for LLM Reward Modeling from Noisy Preference

基于噪声偏好的LLM奖励建模中的最优传输

Licheng Pan, Haochen Yang, Haoxuan Li, Yunsheng Lu, Yongqi Tong, Yinuo Wang, Shijian Wang, Zhixuan Chu, Lei Shen, Yuan Lu, Hao Wang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出SelectiveRM框架,利用最优传输对噪声偏好进行去噪,通过联合一致性差异对齐模型预测分布与偏好数据,并引入质量放松机制以排除矛盾样本,提升奖励建模性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05415 2026-05-08 cs.LG cs.AI cs.CR 73%

Information Theoretic Adversarial Training of Large Language Models

信息论视角下的大语言模型对抗训练

Yiwei Zhang, Jeremiah Birrell, Reza Ebrahimi, Rouzbeh Behnia, Jason Pacheco, Elisa Bertino

机构 * Purdue University(普渡大学) Texas State University(德克萨斯州立大学) University of South Florida(佛罗里达州立大学) University of Arizona(亚利桑那大学)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出WARDEN框架,通过信息论方法动态调整对抗示例权重,提升大语言模型的鲁棒性,减少攻击成功率且保持模型效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06412 2026-05-08 cs.LG cs.CL 73%

Sample-efficient LLM Optimization with Reset Replay

基于重置回放的高效大语言模型优化

Zichuan Liu, Jinyu Wang, Lei Song, Jiang Bian

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出LoRR方法,通过高重播训练和周期性重置策略提升偏好优化的样本效率,实验表明其在数学和通用推理基准上显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03080 2026-05-08 cs.AI 57%

Beyond Factual Correctness: Mitigating Preference-Inconsistent Explanations in Explainable Recommendation

超越事实正确性:缓解可解释推荐中的偏好不一致解释

Chengkai Wang, Baisong Liu

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出PURE框架,通过选择-生成范式缓解推荐中因偏好不一致导致的解释问题,提升解释可信度与推荐准确性。

Comments The authors have identified an issue in the evaluation protocol in Section 5.1.3. Feature extraction and semantic matching used to compute P-EHR require correction and re-validation, as they may not have been applied consistently across all generated explanations and baselines. This may affect part of the reported quantitative results and analysis, so the authors withdraw this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20825 2026-05-08 cs.CL 57%

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

强化信息量优化用于长文本检索增强生成

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学公安学院人工智能学院) Baidu Inc.(百度公司)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL

AI总结 本文提出RioRAG框架,通过 nugget-centric 验证实现可验证的信息量优化,提升长文本检索增强生成的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2605.05329 2026-05-08 cs.AI cs.LG 81%

Understanding Annotator Safety Policy with Interpretability

通过可解释性理解标注者安全政策

Alex Oesterling, Donghao Ren, Yannick Assogba, Dominik Moritz, Sunnie S. Y. Kim, Leon Gatys, Fred Hohman

机构 * Harvard University(哈佛大学) Apple(苹果公司)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Annotator Policy Models,通过学习标注行为揭示安全政策差异,解决标注分歧根源问题,提升安全政策设计的透明性和包容性。

Comments 38 pages, 13 figures, ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01669 2026-05-08 stat.ML cs.LG stat.ME 70%

PRCD-MAP: Learning How Much to Trust Imperfect Priors in Causal Discovery

PRCD-MAP:学习如何信任不完美的先验信息在因果发现中

Xihang Shan, Da Zhou

机构 * School of Mathematical Sciences(数学科学学院) Xiamen University(厦门大学)

专题命中 安全训练 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 PRCD-MAP通过为每个边分配信任度,结合先验信息和正则化项,提供了一种安全的因果发现方法,实验证明其在多个数据集上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21877 2026-05-08 cs.LG cs.AI 62%

P^2O: Joint Policy and Prompt Optimization

P²O:联合策略和提示优化

Xinyu Lu, Kaiqi Zhang, Jinglin Yang, Boxi Cao, Yaojie Lu, Hongyu Lin, Min He, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) National Computer Network Emergency Response Technical Team/Coordination Center of China(中国国家计算机网络应急技术协调中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出P²O方法,通过交替更新连续策略与离散提示,解决RLVR在难样本上的优势崩溃问题,提升模型泛化能力并提升性能9.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05402 2026-05-08 cs.AI cs.CV eess.IV 57%

Intelligent CCTV for Urban Design: AI-Based Analysis of Soft Infrastructure at Intersections

智能监控摄像头用于城市设计:基于AI的交叉口软基础设施分析

Vinit Katariya, Seungjin Kim, Curtis Craig, Nichole Morris, Hamed Tabkhi

机构 * University of Wyoming(怀俄明大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) University of Minnesota(明尼苏达大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于AI的分析框架,利用现有监控摄像头评估软干预措施对车速和安全的影响,通过深度学习和视角基速度估计,发现软基础设施能有效降低车速,为交通政策评估提供低成本证据。

Comments 16 pages, 6 figures, 7 tables, Submitted/Under Review at the International Journal of Transportation Research (Submitted on 12 Jan 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05260 2026-05-08 cs.CR 50%

SecureMCP: A Policy-Enforced LLM Data Access Framework for AIoT Systems via Model Context Protocol

SecureMCP: 一种通过模型上下文协议实现的基于策略的LLM数据访问框架,用于AIoT系统

Wonbae Kim, Hee-Kyong Yoo

专题命中 安全训练 :prompt injection(abstract)

AI总结 本文提出SecureMCP框架,结合RBAC与MCP服务器,通过五种防御模块实现多层防护,提升LLM生成SQL的安全性,实验显示其在保护数据安全和执行准确率方面表现优异。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28129 2026-05-08 cs.RO 50%

A Position Statement on Endovascular Models and Effectiveness Metrics for Mechanical Thrombectomy Navigation, on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)

关于内血管模型和机械取栓导航的有效性指标的立场声明,代表人工智能辅助机器人取栓利益相关者工作组(START)

Harry Robertshaw, Anna Barnes, Phil Blakelock, Raphael Blanc, Robert Crossley, Rebecca Fahrig, Ameer E. Hassan, Benjamin Jackson, Lennart Karstensen, Neelam Kaur, Markus Kowarschik, Jeremy Lynch, Franziska Mathis-Ullrich, Dwight Meglan, Vitor Mendes Pereira, Mouloud Ourak, Matteo Pantano, S. M. Hadi Sadati, Alice Taylor-Gee, Tom Vercauteren, Phil White, Alejandro Granados, Thomas C. Booth

机构 * on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)(人工智能辅助机器人取栓任务组成员)

专题命中 安全训练 :safety(abstract)

AI总结 本文旨在建立共识框架,开发和验证人工智能辅助机器人用于取栓,标准化有效性指标并定义参考测试环境,以提升地理多样性人群的及时取栓访问。

Comments Published in Journal of the American Heart Association

Journal ref J Am Heart Assoc. 2026;15:e044931

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 3 篇

2605.05709 2026-05-08 cs.AI 85%

Conceal, Reconstruct, Jailbreak: Exploiting the Reconstruction-Concealment Tradeoff in MLLMs

隐藏、重建、突破:在大规模语言模型中利用重建-隐藏权衡

Md Farhamdur Reza, Richeng Jin, Tianfu Wu, Huaiyu Dai

机构 * NC State University(北卡罗来纳州立大学) Zhejiang University(浙江大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文探讨了在多模态大语言模型中利用重建与隐藏的权衡进行意图混淆攻击,提出了一种基于字符移除的变体构造方法,并引入关键词相关的干扰图像以提高攻击效果。

Comments 39 pages, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00699 2026-05-08 cs.CR 82%

STARE: Step-wise Temporal Alignment and Red-teaming Engine for Multi-modal Toxicity Attack

STARE:分步时间对齐与红队引擎用于多模态毒性攻击

Xutao Mao, Liangjie Zhao, Tao Liu, Xiang Zheng, Hongying Zan, Cong Wang

专题命中 越狱攻击 :alignment(title,abstract);safety(abstract)

AI总结 STARE通过分步时间对齐和红队引擎,提升多模态毒性攻击的成功率,揭示优化诱导的相位对齐现象,为安全机制提供理论基础。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05687 2026-05-08 cs.AI 70%

DataDignity: Training Data Attribution for Large Language Models

DataDignity: 为大语言模型训练数据的归因

Xiaomin Li, Andrzej Banburski-Fahey, Jaron Lanier

机构 * Microsoft(微软)

专题命中 越狱攻击 :jailbreak(abstract,abstract_cn);分类 cs.AI

AI总结 研究提出通过归因方法识别支持语言模型响应的文档,引入FakeWiki基准测试,评估ScoringModel在九个模型上的表现,提升Recall@10至52.2,展示训练数据归因需区分真实支持与主题或词汇相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2605.03213 2026-05-08 cs.CR cs.AI 57%

When Agents Handle Secrets: A Survey of Confidential Computing for Agentic AI

当代理处理秘密:关于代理AI的保密计算调查

Javad Forough, Marios Kogias, Hamed Haddadi

机构 * Department of Computing Imperial College London London, United Kingdom(计算系帝国理工学院伦敦英国)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理AI中保密计算的应用,分析了六个TEE平台的设计,提出了基于代理的威胁模型,并指出了六个开放挑战,旨在为生产级代理AI提供安全基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06393 2026-05-08 cs.CR 50%

Constraining Host-Level Abuse in Self-Hosted Computer-Use Agents via TEE-Backed Isolation

通过TEE后置隔离约束自托管计算机使用代理的主机级滥用

Di Lu, Bo Zhang, Xiyuan Li, Yongzhi Liao, Xuewen Dong, Yulong Shen, Zhiquan Liu, Jianfeng Ma

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出基于操作的风险约束模型,通过TEE后置可信操作平面保护关键安全功能,实现对自托管计算机使用代理操作的安全限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03117 2026-05-08 cs.CR 50%

AgentDyn: Are Your Agent Security Defenses Deployable in Real-World Dynamic Environments?

AgentDyn: 您的代理安全防御能在现实世界动态环境中部署吗?

Hao Li, Ruoyao Wen, Shanghao Shi, Ning Zhang, Yevgeniy Vorobeychik, Chaowei Xiao

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文揭示现有代理安全基准的三大缺陷,提出AgentDyn基准,包含60个挑战性开放任务和560个注入测试用例,评估十种先进防御,发现现有防御不足或过度防御,亟需更适应动态环境的基准。

Comments 26 Pages, 17 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 3 篇

2509.23765 2026-05-08 cs.CL cs.AI cs.LG 87%

Knowledge-Level Consistency Reinforcement Learning: Dual-Fact Alignment for Long-Form Factuality

知识级一致性强化学习:长形式事实性的双事实对齐

Junliang Li, Yucheng Wang, Yan Chen, Yu Ran, Ruiqing Zhang, Jing Liu, Hua Wu, Haifeng Wang

机构 * Baidu Inc.(百度公司)

专题命中 幻觉与事实性 :alignment(title,abstract);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出KLCF框架,通过双事实对齐机制提升长形式生成的事实性,有效缓解幻觉和保守倾向,提升精度与召回率。

Comments 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06346 2026-05-08 cs.AI 57%

Prediction and Empowerment: A Theory of Agency through Bridge Interfaces

预测与赋能:通过桥接接口的代理理论

Richard Csaky

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文研究了在确定性物理或模拟世界中部分可观测性下的代理问题,通过桥接接口模型,证明了预测、压缩和赋能之间的分离关系,并提出了一种设计原则以区分隐藏状态识别、接口细化、任务相关可控性和简单覆盖控制。

Comments This is a working draft: feedback and criticism is most welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05699 2026-05-08 cs.PF cs.AI 57%

When Quantization Is Free: An int4 KV Cache That Outruns fp16 on Apple Silicon

量化为何免费:一种int4 KV缓存性能超越fp16的苹果硅芯片

Mohamed Amine Bergach

机构 * Illumina

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种int4 KV缓存方法,在苹果硅芯片上实现比fp16更快的性能,通过融合金属内核和内存压缩,保持质量并提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 6 篇

2605.01699 2026-05-08 cs.LG cs.AI cs.CR cs.NE 81%

Probe-Geometry Alignment: Erasing the Cross-Sequence Memorization Signature Below Chance

探测器几何对齐:在偶然机会以下消除跨序列记忆签名

Anamika Paul Rupa, Anietie Andy

机构 * Howard University(霍华德大学)

专题命中 隐私与版权 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型中记忆痕迹的消除方法,提出通过探测器几何对齐技术在不损害能力的前提下,有效消除跨序列记忆签名,且在多种模型上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05277 2026-05-08 cs.CR 78%

GLiNER Guard: Unified Encoder Family for Production LLM Safety and Privacy

GLiNER Guard:面向生产LLM安全与隐私的统一编码器家族

Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

专题命中 隐私与版权 :safety(title,abstract)

AI总结 本文提出GLiNER Guard统一编码器,实现安全分类与PII检测,提升生产LLM的安全性和隐私保护效率。

Comments Models: https://huggingface.co/collections/hivetrace/gliner-guard-v1 PII-Bench: https://huggingface.co/datasets/hivetrace/pii-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01150 2026-05-08 cs.LG cs.AI cs.CR cs.CV math.OC 62%

SMI: Statistical Membership Inference for Reliable Unlearned Model Auditing

SMI: 统计成员推断用于可靠未学习模型审计

Jialong Sun, Zeming Wei, Jiaxuan Zou, Jiacheng Gong, Jie Fu, Chengyang Dong, Heng Xu, Jialong Li, Bo Liu

机构 * Shenzhen University of Advanced Technology(深圳先进技术大学) Peking University(北京大学) Xi’an Jiaotong University(西安交通大学) Heilongjiang University(黑龙江大学) Stevens Institute of Technology(斯蒂文斯理工学院)

专题命中 隐私与版权 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SMI方法,通过统计成员混合比例评估未学习模型的遗忘率,无需训练影子模型,有效解决传统成员推断攻击的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06239 2026-05-08 cs.LG 57%

When Graph Language Models Go Beyond Memorization

图语言模型超越记忆

Masatsugu Yamada, Mahito Sugiyama

机构 * National Institute of Informatics(日本信息处理研究所) SOKENDAI

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 研究通过诊断协议区分图语言模型的记忆与结构对齐,发现大规模下模型能学习超越记忆的结构规律,但稀有模式仍存在覆盖不足。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05718 2026-05-08 cs.LG 57%

Enabling Federated Inference via Unsupervised Consensus Embedding

通过无监督共识嵌入实现联邦推断

Yui Hashimoto, Takayuki Nishio, Yuichi Kitagawa, Takahito Tanimura

机构 * School of Engineering, Institute of Science Tokyo(东京科学研究院工程学院) Research & Development Group, Hitachi Ltd.(日立株式会社研发部)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出CE-FI框架,通过共识嵌入层和协作输出层实现无需共享模型参数或原始输入的联邦推断,实验表明其在图像分类任务中优于单独推断并在非IID条件下表现优异。

Comments 18 pages, 15 figures, submitted to IEEE Transactions on Mobile Computing (TMC) (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏