arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-27 至 2026-03-27 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 10 篇

2506.13734 2026-03-27 cs.CL cs.AI cs.LG 67%

Instruction Following by Principled Boosting Attention of Large Language Models

通过原理性提升大语言模型的注意力来实现指令遵循

Vitoria Guardieiro, Avishree Khare, Adam Stein, Eric Wong

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出InstABoost方法,通过提升指令相关注意力来增强指令遵循,避免了其他方法的缺陷,提升了指令引导与任务相关上下文的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25022 2026-03-27 cs.AI cs.CR cs.CY cs.LG 67%

A Public Theory of Distillation Resistance via Constraint-Coupled Reasoning Architectures

通过约束耦合推理架构的公开蒸馏阻力理论

Peng Wei, Wesley Shu

机构 * The Institute of Energetic Paradigm(能量范式研究所)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出一种理论框架,通过约束耦合推理架构减少蒸馏 asymmetry,核心观点是高阶能力与内部稳定性约束耦合时蒸馏价值降低,提供可验证的理论主张和实验假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 62%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25419 2026-03-27 cs.CL 57%

TAPO: Translation Augmented Policy Optimization for Multilingual Mathematical Reasoning

TAPO:多语言数学推理中的翻译增强策略优化

Xu Huang, Zhejian Lai, Zixian Huang, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 TAPO通过引入翻译增强策略优化框架,提升多语言数学推理能力,有效结合语言理解和推理能力,优于基线方法并在未见语言和领域任务中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25100 2026-03-27 cs.MA cs.AI cs.CR cs.DC 57%

From Logic Monopoly to Social Contract: Separation of Power and the Institutional Foundations for Autonomous Agent Economies

从逻辑垄断到社会契约:权力分离与自主代理经济制度的基础

Anbang Ruan

机构 * NetX Foundation(NetX 基金会)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过社会契约实现权力分离,解决多智能体框架中的逻辑垄断问题,引入Agent Enterprise paradigm并构建NetX Enterprise Framework,建立自主代理经济体系。

Comments 143 pages, 15 tables, 23 figures, 173 references, 4 appendices. Working paper -- pre-peer-review preprint. LaTeX source with arXiv-style template. Three companion manuscripts under development targeting peer-reviewed venues

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25035 2026-03-27 cs.AI 57%

Mechanistically Interpreting Compression in Vision-Language Models

视觉语言模型压缩的机理解释

Veeraraju Elluru, Arth Singh, Roberto Aguero, Ajay Agarwal, Debojyoti Das, Hreetam Paul

机构 * Indian Institute of Technology Jodhpur(印度理工学院焦特布尔分校) AIM Intelligence National Institute of Technology Agartala(国立阿加尔塔拉理工学院) Fordham University(福特汉姆大学) University of Fukui(福井大学) Independent Researcher(独立研究员)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文通过因果电路分析和交叉编码器特征比较,研究了剪枝和量化对视觉语言模型内部结构的影响,并提出VLMSafe-420基准测试,揭示压缩对安全行为的影响。

Comments 15 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24908 2026-03-27 cs.RO cs.AI cs.MA 57%

Integrated Multi-Drone Task Allocation, Sequencing, and Optimal Trajectory Generation in Obstacle-Rich 3D Environments

集成多无人机任务分配、任务序列和最优轨迹生成在障碍密集的3D环境中

Yunes Alqudsi, Murat Makaraci

机构 * Aerospace Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院航空航天工程系) Interdisciplinary Research Center for Aviation and Space Exploration, KFUPM(法赫德国王石油矿产大学航空与空间探索跨学科研究中心) Mechanical Engineering Department, Faculty of Aeronautics and Astronautics, Kocaeli University(科贾埃利大学航空与航天学院机械工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出IMD-TAPP框架,通过结合离散任务规划和连续轨迹合成,解决多无人机在障碍密集环境中的任务分配、序列规划和安全轨迹生成问题,实现动态可行且无碰撞的高效路径。

Comments Resubmission following accepted appeal (MOD-78958). Resubmitting to cs.RO with cross-lists cs.MA and cs.AI as advised by arXiv Support

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24595 2026-03-27 cs.PL cs.AI 57%

Model2Kernel: Model-Aware Symbolic Execution For Safe CUDA Kernels

Model2Kernel: 用于安全CUDA内核的模型感知符号执行

Mengting He, Shihao Xia, Haomin Jia, Wenfei Wu, Linhai Song

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) State Key Lab of Processors, Institute of Computing Technology, CAS(中国科学院计算技术研究所处理器实验室) Peking University(北京大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Model2Kernel,通过模型感知动态分析验证LLM推理中CUDA内核的内存安全,利用专门的符号执行技术发现353个未知bug,仅产生9个误报。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16889 2026-03-27 cs.CL 57%

Can GRPO Boost Complex Multimodal Table Understanding?

GRPO能否提升复杂多模态表格理解?

Xiaoqiang Kang, Shengen Wu, Zimu Wang, Yilin Liu, Xiaobo Jin, Kaizhu Huang, Wei Wang, Yutao Yue, Xiaowei Huang, Qiufeng Wang

机构 * School of Advanced Technology, Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学先进科技学院) Department of Computer Science, University of Liverpool(利物浦大学计算机科学系) Information Hub, Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)信息中心) University of Southern California(南加州大学) Duke Kunshan University(杜克大学昆山分校)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 本文提出Table-R1框架,通过预热、感知对齐GRPO和提示-完成GRPO三阶段提升多模态表格理解性能,优于SFT和GRPO。

Comments EMNLP 2025

Journal ref EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24931 2026-03-27 cs.RO 50%

COIN: Collaborative Interaction-Aware Multi-Agent Reinforcement Learning for Self-Driving Systems

COIN: 基于协作交互的多智能体强化学习用于自动驾驶系统

Yifeng Zhang, Jieming Chen, Tingguang Zhou, Tanishq Duhan, Jianghong Dong, Yuhong Cao, Guillaume Sartoretti

机构 * Department of Mechanical Engineering, College of Design and Engineering, National University of Singapore(新加坡国立大学设计与工程学院机械工程系) Department of Electrical and Electronic Engineering, The Hong Kong Polytechnic University(香港理工大学电机及电子工程学系) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出COIN框架,通过改进的CIG-TD3算法和双层交互感知集中批评者架构,提升多智能体自动驾驶系统在复杂动态场景中的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏