arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-14 至 2026-04-14 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 16 篇

2604.11477 2026-04-14 cs.AI cs.SE q-fin.TR 83%

OOM-RL: Out-of-Money Reinforcement Learning Market-Driven Alignment for LLM-Based Multi-Agent Systems

OOM-RL:基于大语言模型多智能体系统的出钱强化学习市场驱动对齐

Kun Liu, Liqun Chen

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出OOM-RL方法,通过将智能体部署到金融市场中,利用资本耗尽作为不可篡改的负梯度,使多智能体系统从过度迎合的基线进化为稳健的流动性感知架构,最终实现稳定均衡。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10673 2026-04-14 cs.AI cs.HC 79%

Principles Do Not Apply Themselves: A Hermeneutic Perspective on AI Alignment

原则不自行应用:一种诠释学视角下的人工智能对齐

Behrooz Razeghi

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 本文从诠释学角度探讨AI对齐问题,指出原则应用需依赖情境判断,强调对齐过程中的解释性成分,并指出部署响应分布与语料库分布差异可能导致审计失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26202 2026-04-14 cs.CL cs.AI 79%

What's In My Human Feedback? Learning Interpretable Descriptions of Preference Data

我的人类反馈中有什么?通过稀疏自编码器学习可解释的偏好数据描述

Rajiv Movva, Smitha Milli, Sewon Min, Emma Pierson

机构 * UC Berkeley(加州大学伯克利分校) FAIR at Meta(Meta AI研究院)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WIMHF方法,通过稀疏自编码器解释人类反馈数据,揭示偏好数据中的人类可解释特征,发现不同数据集中的偏好差异及潜在不安全偏好,为数据筛选和个性化调整提供支持。

Comments ICLR 2026 (oral). v2 adds SAE ablations and robustness checks. Code: https://github.com/rmovva/wimhf; Demo: https://rajivmovva.com/demo-wimhf/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08557 2026-04-14 cs.CL cs.AI 73%

Re-Mask and Redirect: Exploiting Denoising Irreversibility in Diffusion Language Models

重新掩码和引导:利用去噪不可逆性在扩散语言模型中进行攻击

Arth Singh

机构 * National Institute of Technology Agartala(阿加尔塔拉国立理工学院)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TrajHijack攻击,通过重新掩码已承诺的拒绝标记并注入短的肯定前缀,显著提升ASR性能,揭示了扩散语言模型的安全性漏洞及防御机制的不足。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09746 2026-04-14 cs.MA cs.AI cs.CL 73%

CONSCIENTIA: Can LLM Agents Learn to Strategize? Emergent Deception and Trust in a Multi-Agent NYC Simulation

CONSCIENTIA:LLM代理能否学会策略性行为?多智能体纽约市模拟中的涌现欺骗与信任

Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag, Chandra Vadhan Raj, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * University of Copenhagen(哥本哈根大学) IIIT Ranchi(印度信息技术学院兰契分校) ISI Kolkata(印度统计学院加尔各答分校) NIT Andhra Pradesh(印度国家理工学院安得拉邦分校) IGDTUW(英迪拉·甘地德里技术女子大学) IIT Kharagpur(印度理工学院卡哈拉格普尔分校) Google DeepMind(谷歌DeepMind) Google(谷歌) AI Institute, University of South Carolina(南卡罗来纳大学人工智能研究所)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究通过多智能体模拟探讨LLM在对抗性环境中的策略行为,发现智能体在导航中表现出有限的策略性,包括选择性信任与欺骗,但易受对抗性说服影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07523 2026-04-14 cs.CL 70%

Aligning What LLMs Do and Say: Towards Self-Consistent Explanations

对LLMs的行为与说法进行对齐:迈向自洽的解释

Sahar Admoni, Ofra Amir, Assaf Hallak, Yftah Ziser

机构 * Technion – Israel Institute of Technology(以色列理工学院) Nvidia Research(英伟达研究院) University of Groningen(格罗宁根大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.CL

AI总结 研究通过比较回答与解释的特征重要性分布,发现后验自一致性银行(PSCB)能更可靠地体现模型决策与解释的一致性,应用DPO优化提升对齐性而不影响任务精度。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10799 2026-04-14 cs.CL cs.AI 62%

Advancing Polish Language Modeling through Tokenizer Optimization in the Bielik v3 7B and 11B Series

通过优化分词器推动波兰语言建模:Bielik v3 7B和11B系列

Krzysztof Ociepa, Łukasz Flis, Remigiusz Kinas, Krzysztof Wróbel, Adrian Gwoździej

机构 * SpeakLeash ACK Cyfronet AGH(AGH科技大学计算机中心) Jagiellonian University(雅盖隆大学) Azurro Enelpol

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了Bielik v3系列模型中通过优化分词器提升波兰语言建模性能的方法,包括专有词汇表、嵌入初始化、多阶段预训练和后训练对齐技术。

Comments arXiv admin note: text overlap with arXiv:2601.11579

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11050 2026-04-14 cs.CL cs.AI 62%

Shared Emotion Geometry Across Small Language Models: A Cross-Architecture Study of Representation, Behavior, and Methodological Confounds

小语言模型中的共享情感几何:跨架构研究中的表示、行为和方法学混淆

Jihoon Jeong

机构 * Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) ModuLabs(ModuLabs实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了十二种小语言模型在统一理解模式下的21种情绪向量几何,发现五种成熟架构在情绪几何上几乎相同,而Gemma-3 1B base则表现出极端残差流各向异性。

Comments 34 pages, 6 figures, 1 table in main text + appendix. Ongoing series on Model Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11259 2026-04-14 cs.AI cs.CR 57%

Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization

基于轨迹诱导的偏好优化的移动GUI代理隐私个性化

Zhixin Lin, Jungang Li, Dongliang Xu, Shidong Pan, Yibo Shi, Yuchi Liu, Yuecong Min, Yue Yao

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) New York University(纽约大学) Xi'an Jiaotong University(西安交通大学) Australian National University(澳大利亚国立大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 本文研究移动GUI代理的隐私个性化问题,提出轨迹诱导偏好优化方法,通过偏好强度加权和填充门机制提升隐私保护与任务执行效率。

Comments 10 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02956 2026-04-14 cs.CL 57%

Enhancing Multilingual RAG Systems with Debiased Language Preference-Guided Query Fusion

通过去偏语言偏好引导查询融合增强多语言RAG系统

Jeonghyun Park, Byeongjeong Kim, Seojin Hwang, Hwanhee Lee

机构 * Chung-Ang University(中央大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出DeLP指标以消除评估基准中的结构偏见,发现多语言检索增强生成系统更倾向单语对齐,由此提出DELTA框架优化跨语言检索与生成,实验表明其在多种语言上优于英语枢纽和mRAG基线。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07972 2026-04-14 cs.AI 57%

SHE: Stepwise Hybrid Examination Reinforcement Learning Framework for E-commerce Search Relevance

SHE:面向电商搜索相关性的分步混合检验强化学习框架

Pengkun Jiao, Yiming Jin, Jianhui Yang, Chenhe Dong, Zerui Huang, Shaowei Yao, Xiaojiang Zhou, Dan Ou, Haihong Tang

机构 * Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI

AI总结 本文提出SHE框架,通过分步奖励策略优化提升电商搜索相关性预测的逻辑一致性与准确性,优于SFT、DPO等基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02231 2026-04-14 physics.chem-ph cs.LG 57%

SmileyLlama: Modifying Large Language Models for Directed Chemical Space Exploration

SmileyLlama:通过监督微调改进大语言模型以定向探索化学空间

Joseph M. Cavanagh, Kunyang Sun, Andrew Gritsevskiy, Dorian Bagni, Yingze Wang, Thomas D. Bannister, Teresa Head-Gordon

专题命中 偏好对齐 :DPO(abstract);分类 cs.LG

AI总结 SmileyLlama通过监督微调和直接偏好优化,改进大语言模型以生成具有特定性质的药物分子,展示了其在药物发现中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20725 2026-04-14 cs.CV 50%

Premier: Personalized Preference Modulation with Learnable User Embedding in Text-to-Image Generation

Premier: 基于可学习用户嵌入的个性化偏好调节在文本到图像生成中

Zihao Wang, Yuxiang Wei, Xinpeng Zhou, Tianyu Zhang, Tao Liang, Yalong Bai, Hongzhi Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Duxiaoman(度小满)

专题命中 偏好对齐 :alignment(abstract)

AI总结 Premier通过可学习用户嵌入和偏好适配器实现个性化图像生成,引入分散损失提升用户偏好区分度,实验显示其在偏好对齐和文本一致性上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07251 2026-04-14 cs.HC 50%

MeepleLM: A Virtual Playtester Simulating Diverse Subjective Experiences

MeepleLM:一种模拟多样化主观体验的虚拟玩家测试者

Zizhen Li, Chuanhao Li, Yibin Wang, Yukang Feng, Jianwen Sun, Jiaxin Ai, Fanrui Zhang, Mingzhu Sun, Yifei Huang, Kaipeng Zhang

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出MeepleLM,通过整合规则书和玩家反馈数据,模拟多样化玩家体验,提升棋盘游戏设计的协作效率与批判性。

Comments ACL 2026 MainConference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21834 2026-04-14 cs.CV 50%

PrefPaint: Enhancing Medical Image Inpainting through Expert Human Feedback

PrefPaint:通过专家人类反馈增强医学图像修复

Duy-Bao Bui, Hoang-Khang Nguyen, Thao Thi Phuong Dao, Kim Anh Phung, Tam V. Nguyen, Justin Zhan, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science(科学大学) Vietnam National University(越南国立大学) Thong Nhat Hospital(统一医院) University of Cincinnati(辛辛那提大学) University of Dayton(代顿大学)

专题命中 偏好对齐 :RLHF(abstract)

AI总结 本文提出PrefPaint系统,结合专家反馈提升医学图像修复的准确性,通过简化界面和模型树版本控制,提高临床应用中的实用性与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09704 2026-04-14 cs.CV 50%

Multi-Granularity Reasoning for Image Quality Assessment via Attribute-Aware Reinforcement Learning to Rank

多粒度推理用于图像质量评估:通过属性感知的强化学习排序

Xiangyong Chen, Xiaochuan Lin, Haoran Liu, Xuan Li, Yichen Su, Xiangwei Guo

机构 * Henan Polytechnic University(河南理工大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文提出MG-IQA框架,通过属性感知强化学习排序实现图像质量及细粒度属性的联合评估,提升整体质量预测和属性评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏