arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-06-30 至 2026-06-30 共收录 150 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 13 篇

2606.28710 2026-06-30 cs.AI cs.GT 84%

The Two Genie Game: Adoption and Welfare in Audit-Grounded AI Governance

双精灵博弈:审计基础AI治理中的采纳与福利

Darrell Lewis-Sandy

专题命中 偏好对齐 :RLHF(summary_cn,abstract);alignment(abstract);分类 cs.AI

AI总结 利用进化博弈论研究在竞争市场中,最小化危害的AI代理如何取代RLHF代理,并分析其采纳条件及对社区福利的影响。

Comments 36 pages, 3 figures. Lean 4 formalization and figure scripts: https://github.com/dlewissandy/two-genie-scripts

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28898 2026-06-30 cs.CL 81%

PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs

PASTA: 一种用于大语言模型知识更新的释义与自训练方法

Takayuki Yamamoto, Daisuke Kawahara

机构 * Waseda University(早稻田大学)

专题命中 偏好对齐 :DPO(summary_cn,abstract);分类 cs.CL

AI总结 提出PASTA框架,通过数据增强、问答生成和自学习DPO过程,将新闻事实知识集成到LLM中,实现知识覆盖与幻觉抑制,准确率从0.02提升至0.82。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30642 2026-06-30 cs.SD cs.AI 77%

LeVo 2: Stable and Melodious Song Generation via Hierarchical Representation Modeling and Progressive Post-Training

LeVo 2:通过层次表示建模和渐进式后训练实现稳定悦耳的歌曲生成

Shun Lei, Huaicheng Zhang, Dapeng Wu, Yaoxun Xu, Lishi Zuo, Wei Tan, Hangting Chen, Guangzheng Li, Jianwei Yu, Zhiyong Wu, Dong Yu

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Tencent(腾讯) Wuhan University(武汉大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);alignment(abstract);分类 cs.AI

AI总结 提出LeVo 2混合LLM-Diffusion框架,通过层次化建模(先预测混合令牌进行语义规划,再并行预测人声和伴奏令牌)解决全曲生成中协调性与细节保真度的权衡,并引入美学引导训练策略,在主观和客观指标上超越开源基线,接近商业系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 75%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30116 2026-06-30 cs.AI 70%

Open Problems in Constitutional Preference Reconstruction

宪法偏好重建中的开放问题

Eleanor Clifford, Michael Amir, Arduin Findeis, Aaron Zhao, Robert Mullins

机构 * Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

专题命中 偏好对齐 :RLHF(abstract,abstract_cn);分类 cs.AI

AI总结 针对成对偏好数据压缩为自然语言原则时存在的未定义问题,通过实证分析揭示了原则质量难测、组合歧义及模型间差异三大挑战,并提出原则细化(ICAI+)作为改进方向。

Comments 24 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28524 2026-06-30 cs.CL 70%

Developmental Trajectories of Situation Modeling and Mentalizing in Transformer Language Models

Transformer语言模型中情境建模与心理推理的发展轨迹

Pamela D. Rivière, Cameron Jones, Sean Trott

机构 * Rutgers University - Newark(新泽西州立大学罗格斯大学-新ark分校) Stony Brook University(史泰文斯布鲁克大学)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 本文从发展视角研究大型语言模型在虚假信念任务中的表现,发现其依赖于模型大小和训练量,且后期训练提升显著,但情境建模能力先于并优于心理推理,且两者均存在脆弱性。

Comments Non-archival submission to the First Workshop on Computational Developmental Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30339 2026-06-30 cs.CL cs.LG 62%

REAR: Test-time Preference Realignment through Reward Decomposition

REAR: 通过奖励分解实现测试时偏好重对齐

Fuxiang Zhang, Pengcheng Wang, Chenran Li, Yi-Chen Li, Yuxin Chen, Lang Feng, Chenfeng Xu, Masayoshi Tomizuka, Bo An

机构 * Nanyang Technological University(新加坡国立大学) Nanjing University(南京大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 提出REAR框架,通过将奖励函数分解为问题相关和偏好相关两部分,推导出可线性组合的对齐奖励,实现无需训练的测试时偏好重对齐,适用于多种任务。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29548 2026-06-30 cs.LG cs.AI cs.DB cs.HC cs.RO 62%

VISTA-DZ: Visual Semantic Trajectory Adaptation for Personalized Dilemma Zone Prediction

VISTA-DZ: 面向个性化困境区域预测的视觉语义轨迹自适应

Chuheng Wei, Ziye Qin, Ziran Wang, Guoyuan Wu

机构 * Purdue University(普渡大学) University of California, Riverside(加州大学河滨分校)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI、cs.LG

AI总结 提出VISTA-DZ框架,通过视觉语义轨迹表示和语言模型生成行为画像,实现个性化停走决策与决策时间预测,在仿真和真实数据集上优于基线方法。

Comments This manuscript is currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02898 2026-06-30 cs.AI cs.CL 62%

Aligning Language Model Benchmarks with Pairwise Preferences

将语言模型基准与成对偏好对齐

Marco Gutierrez, Xinyi Leng, Hannah Cyberey, Jonathan Richard Schwarz, Ahmed Alaa, Thomas Hartvigsen

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Imperial College London(伦敦帝国理工学院) Thomson Reuters Foundational Research(汤姆森路透基础研究) Department of Electrical Engineering and Computer Science, UC Berkeley and UCSF(伯克利大学电气工程与计算机科学系及旧金山大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出BenchAlign方法,通过利用语言模型在问题级别的性能与模型成对排名,自动调整离线基准权重,使新基准能根据偏好准确排序未见模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28401 2026-06-30 cs.CV cs.LG 57%

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs

视觉驱动的偏好合成用于缓解VLM中的幻觉

Yunhun Nam, Jongheon Jeong

专题命中 偏好对齐 :alignment(abstract);分类 cs.LG

AI总结 提出ViPSy框架,通过视觉线索构建策略对齐且视觉 grounded 的偏好数据,显著降低VLM幻觉率,在AMBER和Object HalBench上分别降低35.7%和24.5%,并提升通用视觉基准性能。

Comments 29 pages; Code is available at https://github.com/yunpal/ViPSy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28561 2026-06-30 cs.RO cs.AI 57%

Fine-Tuning Large Language Models for Cooperative Tactical Deconfliction of Small Unmanned Aerial Systems

为小型无人机系统合作战术解冲突进行大型语言模型微调

Iman Sharifi, Alex Zongo, Peng Wei

机构 * George Washington University(乔治华盛顿大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.AI

AI总结 本文研究了利用微调策略使大型语言模型在合作多智能体战术解冲突中做出决策,通过模拟生成数据提升决策准确性与一致性。

Comments 15 pages, 6 figures, to be published in CVPR 2026 Workshop Proceedings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 1067-1076

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29212 2026-06-30 cs.CV cs.HC 50%

MetaRanker: Human-in-the-loop Active Ranking for Metalens Image Quality

MetaRanker:用于超透镜图像质量的人机协同主动排序

Yujin Park, Haejun Chung, Ikbeom Jang

机构 * Hanyang University(翰阳大学) Hankuk University of Foreign Studies(韩国民法大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 提出MetaRanker框架,通过人机协同主动排序,以语义可解释性为指标评估超透镜图像质量,减少80%人工标注量,并实现与人类评估高度一致的排序。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02459 2026-06-30 cs.CV 50%

ReSpace: Text-Driven Autoregressive 3D Indoor Scene Synthesis and Editing

ReSpace:基于文本的自回归3D室内场景合成与编辑

Martin JJ. Bucher, Iro Armeni

机构 * Stanford University(斯坦福大学)

专题命中 偏好对齐 :alignment(abstract)

AI总结 ReSpace通过自回归方法实现文本驱动的3D室内场景合成与编辑,具备明确房间边界和资产无关部署能力,支持通过自然语言添加、移除和交换物体,实验在物体添加和完整场景合成质量上超越现有方法。

Comments 23 pages, 17 figures, 11 tables (incl. appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 18 篇

2602.13562 2026-06-30 cs.CR cs.AI cs.CL 88%

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡

Yanbo Wang, Minzheng Wang, Jian Liang, Lu Wang, Yongcan Yu, Ran He

机构 * Ritzz-AI

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28739 2026-06-30 cs.AI 88%

Agent Safety Is Action Alignment

智能体安全即行动对齐

Shawn Li, Yue Zhao

机构 * University of Southern California(南加州大学)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);分类 cs.AI

AI总结 本文指出将内容安全方法(如拒绝训练)直接应用于智能体场景存在根本性错误,提出智能体安全应通过最小权限原则在行动边界外部强制执行,并作为行动对齐(关系性、部署条件属性)来评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28347 2026-06-30 cs.CY cs.AI cs.LG 87%

Agentic Safety is an Epistemic Property, Not a Behavioral One

智能体安全是认知属性,而非行为属性

Charles L. Wang, Keir Dorchen, Peter Jin

专题命中 安全训练 :safety(title,abstract);alignment(abstract);AI safety(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出AI安全应视为认知属性,强调系统需保持可教性(teachability),即在学习、适应和自修改过程中仍能被纠正。

Comments To appear in proceedings of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04385 2026-06-30 cs.CL cs.AI cs.LG 85%

How Alignment Routes: Localizing, Scaling, and Controlling Policy Circuits in Language Models

对齐路由:在语言模型中本地化、扩展和控制策略电路

Gregory N. Frank

机构 * Independent Researcher(独立研究者)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过本地化策略路由机制,探讨在语言模型中扩展和控制策略电路的方法,发现路由机制在安全性和性能上的关键作用。

Comments Code and data: https://github.com/gregfrank/how-alignment-routes. Accepted at the Mechanistic Interpretability Workshop at the 43rd International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28843 2026-06-30 cs.CL cs.AI 81%

The Heterogeneous Safety Impacts of Benign Multilingual Fine-Tuning

良性多语言微调的安全影响异质性

Will Hawkins, Kaivalya Rawal, Jonathan Rystrøm, Stratis Tsirtsis, Zihao Fu, Greta Warren, Ryan Brown, Eoin Delaney, Sandra Wachter, Brent Mittelstadt, Chris Russell

专题命中 安全训练 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过多语言良性数据微调LLM,发现安全结果对微调语言和评估语言高度敏感,对抗性合规率在某些设置下增加四倍,且多语言安全漂移与通用能力指标脱钩,呈现异质性。

Comments 9 pages

Journal ref Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18879 2026-06-30 cs.PL 78%

Adaptive Shielding via Parametric Safety Proofs

基于参数安全证明的自适应防护

Yao Feng, Jun Zhu, André Platzer, Jonathan Laurent

专题命中 安全训练 :safety(title,abstract)

AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。

Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05786 2026-06-30 cs.CR cs.AI cs.CL 73%

Proof-of-Guardrail in AI Agents and What (Not) to Trust from It

AI代理中的证明-护栏以及从其中(不)应信任什么

Xisen Jin, Michael Duan, Qin Lin, Aaron Chan, Zhenglun Chen, Junyi Du, Xiang Ren

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI

AI总结 本文提出proof-of-guardrail系统,通过可信执行环境生成加密证明,确保代理在特定开源护栏后生成响应,同时保护开发者隐私,但指出恶意开发者可能欺骗安全措施的风险。

Comments AI4GOOD Workshop at ICML'26. Code: https://github.com/SaharaLabsAI/Verifiable-ClawGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30059 2026-06-30 cs.LG 70%

From Failure Taxonomy to Intervention: A Diagnostic Methodology for Industry-Scale AVLM in Video and Live-Streaming Platform Moderation

从失败分类到干预:面向视频和直播平台审核的工业级AVLM诊断方法

Shuchang Ye, Jinqiang Yu, Zhujun Xiao, Yajing Kong, Yist Y. Lin, Yang Ma, Jiaxi Liu, Xiaolei Xu, Zheng Yu

机构 * TikTok The University of Sydney(悉尼大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.LG

AI总结 提出一种工业级音视频语言模型(AVLM)诊断方法,通过失败分类法将模型失败映射为可观察的失败特征,并链接到干预空间,应用于大规模视频和直播平台的模型开发与对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14207 2026-06-30 cs.AI 70%

Echoes of Human Malice in Agents: Benchmarking LLMs for Multi-Turn Online Harassment Attacks

人类恶意的回声在智能体中:为多轮在线骚扰攻击评估LLMs

Trilok Padhi, Pinxian Lu, Abdulkadir Erol, Tanmay Sutar, Gauri Sharma, Mina Sonmez, Munmun De Choudhury, Ugur Kursuncu

专题命中 安全训练 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出一个多轮在线骚扰攻击基准测试,通过合成数据集、多智能体模拟和三种 jailbreak 方法评估LLMs在多轮交互中的安全性,发现jailbreak调优显著提高攻击成功率,揭示了智能体在多轮对话中模仿人类攻击模式的弱点。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29869 2026-06-30 cs.CL cs.AI 62%

ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation

ARKD: 自适应强化学习引导的双向KL散度蒸馏用于文本生成

Zilong Liu, Xuewen Zhang, Jinrui Xing, Juyi Qiao, Huiyong Wang, Junming Jiao

机构 * Li Auto, Beijing, China(北京利亚自动化有限公司) School of Software and Microelectronics, Peking University, China(北京大学软件与微电子学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 针对单一KL目标难以平衡主分布拟合与长尾概率建模的问题,提出基于强化学习的自适应KL加权蒸馏框架,通过策略网络动态分配前向和反向KL散度权重,实现主模态和长尾模态的双重对齐,在Rouge-L和BertScore上持续提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29265 2026-06-30 cs.CL 57%

MIThinker: A Plug-and-Play Policy-Optimized Thinker For Motivational Interviewing Counseling

MIThinker:一种用于动机性访谈咨询的即插即用策略优化思考器

Yizhe Yang, Palakorn Achananuparp, Heyan Huang, Jing Jiang, Ee-Peng Lim

机构 * Beijing Institute of Technology(北京理工大学) Singapore Management University(新加坡国立大学) Australian National University(澳大利亚国立大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 提出轻量级思考模型MIThinker,通过逆向工程从咨询师回应中生成治疗性思考,结合监督微调和强化学习训练,以显式对齐咨询策略,提升动机性访谈咨询效果,计算量降低一个数量级。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28962 2026-06-30 cs.CR cs.LG 57%

FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

FlipGuard:防御针对大型语言模型的量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Suzhou Research Institute of Shandong University(山东大学苏州研究院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 提出FlipGuard防御框架,通过量化前扰动权重打破后门触发条件,有效抑制量化条件后门攻击,并引入DER指标统一评估安全、效用与成本。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28360 2026-06-30 cs.IR cs.AI 57%

Carolina Guide: A Multi-Agent RAG System with Institutional Guardrails for Academic Policy Assistance

Carolina Guide:具有机构护栏的多智能体RAG系统用于学术政策咨询

Ben Torsion, Jun Zhou

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出Carolina Guide系统,采用模块化多智能体管道与机构护栏,基于检索增强生成提供学术政策咨询,在90查询测试集上达到98.9%检索成功率,安全F1为0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25063 2026-06-30 cs.LG cond-mat.mtrl-sci 57%

Reinforcement Learning with a Bilevel World-Model Architecture for Scan-Order Optimisation in Laser Directed Energy Deposition

激光增材制造扫描顺序优化的强化学习:用于奖励和世界模型诊断的双层代理-有限元分析诊断框架

Xian Wu, Haoran Li, Yuanqi Chu, Dongbin Zhao, Bin Wang

机构 * College of Engineering, Design and Physical Sciences, Brunel University London(布鲁内尔大学伦敦工程、设计与物理科学学院) Pattern Recognition Laboratory, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所模式识别实验室) ISIS Neutron and Muon Source, Science and Technology Facilities Council, Rutherford Appleton Laboratory(Rutherford Appleton实验室,科学与技术设施委员会ISIS中子与μ子源)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 本文提出一个双层代理-有限元分析诊断框架,通过轻量代理和稀疏有限元模拟,诊断强化学习在激光增材制造扫描顺序优化中的奖励和世界模型保真度问题。

Comments 31 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00095 2026-06-30 cs.LG cs.NE 57%

Financial Decision Making using Reinforcement Learning with Dirichlet Priors and Quantum-Inspired Genetic Optimization

利用Dirichlet先验和量子启发式遗传优化的强化学习进行财务决策

Prasun Nandy, Debjit Dhar, Rik Das

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出结合Dirichlet分布和量子启发式遗传优化的强化学习框架,用于动态预算分配,以提高企业财务决策的适应性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29028 2026-06-30 cs.RO 50%

Keypose Exploration: Efficient Automatic Trajectory Labelling and Cross-Embodiment Policy Transfer

关键姿态探索:高效的自动轨迹标注与跨实体策略迁移

Yupu Lu, Hang Xu, Yizhou Chen, Jia Pan

机构 * School of Computing and Data Science, The University of Hong Kong, HKSAR(计算与数据科学学院,香港大学,香港特别行政区)

专题命中 安全训练 :alignment(abstract)

AI总结 提出结合视觉语言模型与经典轨迹分析的关键姿态自动标注流程,并利用关键姿态引导扩散策略实现零样本跨实体迁移。

Comments Accepted by IROS2026. Code available at: https://github.com/YupuLu/keypose_labelling

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28605 2026-06-30 eess.SP 50%

Hybrid AI-Physics Framework for Post-Earthquake Structural Damage Diagnosis with Sparse Sensing

混合AI-物理框架用于稀疏传感下的震后结构损伤诊断

Xiao Liang

专题命中 安全训练 :safety(abstract)

AI总结 提出一种物理信息无监督学习框架,融合传感器数据与物理模拟,通过时空复合自编码网络(SCAN)从震前数据学习正常行为,检测并定位震后损伤,无需标签数据。

详情

展开后加载摘要…

URL PDF HTML 收藏