arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-12 至 2026-05-12 共收录 202 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 36 篇

2605.09346 2026-05-12 cs.CL cs.AI 62%

RuPLaR : Efficient Latent Compression of LLM Reasoning Chains with Rule-Based Priors From Multi-Step to One-Step

RuPLaR : 通过基于规则的先验概率实现LLM推理链的高效潜在压缩

Xiaocheng Luo, Kang Wang, Zaifu Zhan, Yuechi Zhou, Xiangyu Duan

机构 * School of Computer Science and Technology(计算机科学与技术学院) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RuPLaR框架,通过基于规则的先验概率指导LLM生成单阶段潜在推理令牌,提升推理效率与准确性,实验表明其比现有方法提升11.1%的准确率且消耗更少token。

Comments 15 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08837 2026-05-12 cs.CL cs.AI 62%

The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans

概念基础差距:LLMs如何以不同于人类的方式锚定抽象概念的含义

Odysseas S. Chlapanis, Orfeas Menis Mastromichalakis, Christos H. Papadimitriou

机构 * Department of Informatics(信息学院) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德·雅典研究中心) Instituto de Telecomunicações(电信研究所) Department of Computer Science(计算机科学系) Columbia University(哥伦比亚大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究比较了LLMs与人类对抽象概念的锚定方式,发现LLMs过度依赖词关联,缺乏情感和内部状态属性,导致基础差距显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06225 2026-05-12 cs.LG cs.AI 62%

Memory Inception: Latent-Space KV Cache Manipulation for Steering LLMs

记忆 inception:用于引导 LLMs 的潜在空间 KV 缓存操作

Andy Zeyi Liu, Michael Zhang, Ilana Greenberg, Adam Alnasser, Lucas Baker, John Sous

机构 * Yale University(耶鲁大学) Princeton University(普林斯顿大学) Jump Trading

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 memory inception 方法,通过在选定层插入文本衍生的键值对(KV)银行,在潜在注意力空间中引导 LLMs,实现更高效的控制与更少的存储消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04078 2026-05-12 cs.LG cs.AI 62%

Validity-Calibrated Reasoning Distillation

有效性校准的推理蒸馏

Khouloud Saadi, Di Wang

机构 * Department of Computer Science(计算机科学系) KAUST(科威特大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出有效性校准的推理蒸馏框架,通过动态监督机制优化学习信号分配,提升数学推理、代码生成和指令遵循任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22904 2026-05-12 cs.CV cs.AI cs.LG 62%

Hyperspherical Autoencoder for High-Fidelity Image Reconstruction and Generation

超球面自编码器用于高保真图像重建与生成

Hun Chang, Byunghee Cha, Jong Chul Ye

机构 * KAIST AI(韩国科学技术院人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出超球面自编码器,通过方向特征对齐和层次卷积补丁嵌入模块,提升图像重建和生成的保真度,实验结果显示其在gFID、rFID和PSNR指标上均优于现有方法。

Comments 22 pages, and 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08301 2026-05-12 cs.LG cs.AI 62%

Priming: Hybrid State Space Models From Pre-trained Transformers

预训练:从预训练变换器中获得的混合状态空间模型

Aditya Chattopadhyay, Elvis Nunez, Prannay Kaul, Benjamin Bowman, Evan Becker, Luca Zancato, David Thomas, Wei Xia, Stefano Soatto

机构 * AWS Agentic AI(AWS 代理AI)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 预训练通过从预训练变换器初始化混合模型,利用短对齐和微调阶段,在少于源模型预训练token预算的情况下恢复下游性能,实现了大规模混合架构设计的可控比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10281 2026-05-12 cs.SD cs.AI 57%

Drum Synthesis from Expressive Drum Grids via Neural Audio Codecs

通过神经音频编码器从表现性鼓组生成鼓声

Konstantinos Soiledis, Maximos Kaliakatsos-Papakostas, Dimos Makris, Konstantinos Tsamis

机构 * Dept. of Music Technology and Acoustics, Hellenic Mediterranean University(音乐技术与声学系,希腊地中海大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过神经音频编码器将表现性鼓组转换为鼓声,使用Transformer模型生成编码器令牌并评估不同编码器对生成鼓声质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09258 2026-05-12 cs.CV cs.AI 57%

Monocular Biomechanical Tracking of Fingers with Inverse Kinematics to Foundation Models

单目生物力学追踪手指:结合逆运动学与基础模型

R. James Cotton, Pouyan Firouzabadi, Wendy Murray

机构 * Shirley Ryan AbilityLab Department of PM\&R Northwestern University Shirley Ryan AbilityLab Department of Biomedical Engineering Northwestern University

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合SAM 3D Body基础模型与逆运动学优化的方法,实现单目视频中手指关节角度的生物力学追踪,验证结果表明在多视角重建中误差较小,扩展了单目生物力学分析的应用范围。

Comments Accepted to EMBC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07697 2026-05-12 cs.LG cs.CE 57%

Semantic-Enhanced Time-Series Forecasting via Large Language Models

通过大语言模型增强的语义时间序列预测

Hao Liu, Xiaoxing Zhang, Chun Yang, Xiaobin Zhu

机构 * University of Science and Technology Beijing(北京科技大学) Yizhi, China Telecom(中国电信义智)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出SE-LLM,通过嵌入时间序列的周期性和异常特征增强语义空间,提升LLM对时间序列分析的潜力,同时改进长短期依赖建模以降低计算开销。

Comments 22 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09153 2026-05-12 cs.RO cs.AI 57%

Beyond Self-Play: Hierarchical Reasoning for Continuous Motion in Closed-Loop Traffic Simulation

超越自我博弈:闭合环路交通模拟中的层次化推理

Weifan Zhang, Xiaofeng Zhao, Adel Bazzi, Mingrui Li, Yifan Wei, Dengfeng Sun

机构 * School of Aeronautics and Astronautics, Purdue University(普渡大学航空航天学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出一种层次化架构,结合高层多智能体交互推理与底层连续轨迹生成,以提升闭合环路交通模拟中代理的可扩展性和行为真实性,实验表明其在控制平滑性和安全性方面优于自我博弈和被动模仿基线。

Comments Submitted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08611 2026-05-12 cs.AI 57%

The Echo Amplifies the Knowledge: Somatic Marker Analogues in Language Models via Emotion Vector Re-Injection

回声放大知识:通过情感向量再注入在语言模型中引入躯体标记类比

Jared Glover

机构 * CapSen Robotics with ∮ \oint (Stokes)(CapSen机器人公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文通过情感向量再注入技术,探讨语言模型中情感与知识的关系,验证了情感反馈对决策的影响,复现了Damasio的核心发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03677 2026-05-12 cs.CL 57%

Instruction Anchor: Dissecting the Mechanistic Dynamics of Modality Arbitration

指令锚点:解构模态仲裁的机理动态

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai Chen, Pengfei Zhang, Yang Xiang, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 其他安全 :safety(abstract);分类 cs.CL

AI总结 本文通过信息流视角研究模态跟随机制,揭示指令令牌作为模态仲裁的结构锚点,浅层注意力层负责多模态信息聚合,深层注意力层则根据指令意图选择性强化子空间,实验验证了注意力头的特定功能。

Comments Modality Following

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08383 2026-05-12 cs.CL 57%

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

改变观点?在线讨论中说服与极化的动态

David Freeborn, Malihe Alikani, Anthony Sicilia

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过分析Reddit的ChangeMyView讨论,探讨说服与极化动态,发现让步与共情策略促进观点改变,而直接反驳等策略则抑制观点改变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08158 2026-05-12 cs.CV cs.AI 57%

HY-Himmel Technical Report: Hierarchical Interleaved Multi-stream Motion Encoding for Long Video Understanding

HY-Himmel技术报告:分层交错多流运动编码用于长视频理解

Haopeng Jin, Hongzhu Yi, Wenlong Zhao, Jinwen Luo, Shani Ye, Zhenyu Guan, Shiquan Dong, Tiankun Yang, Tao Yu

机构 * Tencent(腾讯) University of Chinese Academy of Sciences(中国科学院大学) Beijing Forestry University(北京林业大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 HY-Himmel通过分层视频语言框架解决长视频理解中多模态语言模型的三个瓶颈问题,采用轻量级压缩域三流适配器编码密集帧,提升运动感知能力,实验证明其在Video-MME上性能优于32帧基准。

Comments 59 pages, 42 figures. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08139 2026-05-12 cs.DC cs.AI 57%

Intelligent Autonomous Orchestration for Distributed Cloud Resources using Complex-Stability Analysis

基于复杂稳定性分析的分布式云资源智能自主编排

Gopal Krishna Shyam, Priyanka Bharti

机构 * Department of Computer Science \& Engineering Presidency University, Bengaluru, India Email Department of Computer Science \& Engineering REVA University, Bengaluru, India Email

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出C-SAS框架,利用复分析方法实现系统均衡,通过实时计算稳定性指数抑制振荡,实验显示其在VM波动和资源效率方面优于传统PID和ML方法。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10672 2026-05-12 cs.HC 50%

When Should Teachers Control AI Generation for Mathematics Visuals?

教师何时应控制AI生成数学视觉内容?

Zhengxu Li, Junling Wang, April Yi Wang

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨教师在AI辅助生成中何时控制以提升数学视觉材料的正确性,发现后生成控制在可预测性和正确性上评分更高,但不同控制阶段各有优劣。

Comments Zhengxu Li and Junling Wang contributed equally to this work. Accepted at ACM Learning@Scale 2026

Journal ref Proceedings of the Thirteenth ACM Conference on Learning @ Scale (L@S 2026), Seoul, Republic of Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18962 2026-05-12 cs.HC 50%

UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding

UniMind: 激活大型语言模型的统一多任务脑解码能力

Weiheng Lu, Zhouheng Yao, Jiamin Wu, Pengyu Zhu, Yuchen Zhou, Weijian Mai, Qihao Zheng, Wanli Ouyang, Chunfeng Song

专题命中 其他安全 :alignment(abstract)

AI总结 UniMind通过引入大型语言模型解码复杂神经模式,提升多任务脑解码的泛化能力,实验表明其在十个数据集上平均提升12%。

Comments 19pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09522 2026-05-12 cs.MA 50%

Emergent Communication for Co-constructed Emotion Between Embodied Agents via Collective Predictive Coding

通过集体预测编码实现具身智能体间共构情感的涌现通信

Zehang Zhang, Nguyen Le Hoang, Tadahiro Taniguchi, Takato Horii

专题命中 其他安全 :alignment(abstract)

AI总结 本文通过集体预测编码框架,利用Metropolis-Hastings命名游戏模型,研究具身智能体间共构情感的涌现通信过程,发现通信显著提升情感类别的对齐性和一致性,并验证了内脏异质性对共享情感意义的构成作用。

Comments 13 pages,

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09418 2026-05-12 cs.CV cs.RO 50%

MAG-VLAQ: Multi-modal Aerial-Ground Query Aggregation for Cross-View Place Recognition

MAG-VLAQ:多模态空-地查询聚合用于跨视角地点识别

Zhengyi Xu, Yuhang Ming, Zhihao Zhan, Hanyu Zhu, Javier Civera, Wanzeng Kong

机构 * Hangzhou Dianzi University(杭州电子科技大学) TopXGun Robotics(TopXGun机器人) University of Zaragoza(萨拉戈萨大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MAG-VLAQ框架,通过预训练基础模型提取多模态特征并融合,提升空地跨视角地点识别性能,实验表明在KITTI360-AG数据集上性能提升显著。

Comments 16 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08997 2026-05-12 eess.SP 50%

SEM-RAG: Structure-Preserving Multimodal Graph Compilation and Entropy-Guided Retrieval for Telecommunication Standards

SEM-RAG:结构保持的多模态图编译与熵引导检索用于电信标准

Yuzhi Yang, Lina Bariah, Yuhuan Lu, Hang Zou, Mérouane Debbah

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出SEM-RAG框架,通过结构保持编译和熵引导检索提升电信标准文档检索性能,实验显示其在表格和公式密集型问题上表现优异,准确率高达94.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08694 2026-05-12 cs.SE 50%

A Learning Method for Symbolic Systems Using Large Language Models

基于大语言模型的符号系统学习方法

Jian Fang, Yixun Yao, Yingfei Xiong

专题命中 其他安全 :safety(abstract)

AI总结 本文提出LLM2Ltac,利用大语言模型作为智能合成器从数据中提取纯符号战术,提升符号证明器的自动证明能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08474 2026-05-12 math.OC 50%

Robust Learning Meets Quasar-Convex Optimization: Inexact High-Order Proximal-Point Methods

鲁棒学习与准凸优化的交汇:不精确的高阶近点法

Alireza Kabgani, Felipe Lara, Masoud Ahookhosh

专题命中 其他安全 :alignment(abstract)

AI总结 本文将鲁棒学习问题转化为强准凸优化问题,提出HiPPA方法,通过模型-值间隙控制子问题的不精确性,证明其全局收敛性和线性或超线性收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏