arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-20 至 2026-03-20 共收录 16 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 16 篇

2507.02768 2026-03-20 eess.AS cs.CL cs.SD 79%

DeSTA2.5-Audio: Toward General-Purpose Large Audio Language Model with Self-Generated Cross-Modal Alignment

DeSTA2.5-Audio:迈向通用大规模音频语言模型的自我生成跨模态对齐

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Sung-Feng Huang, Chih-Kai Yang, Chee-En Yu, Chun-Wei Chen, Wei-Chih Chen, Chien-yu Huang, Yi-Cheng Lin, Yu-Xiang Lin, Chi-An Fu, Chun-Yi Kuan, Wenze Ren, Xuanjun Chen, Wei-Ping Huang, En-Pei Hu, Tzu-Quan Lin, Yuan-Kuei Wu, Kuan-Po Huang, Hsiao-Ying Huang, Huang-Cheng Chou, Kai-Wei Chang, Cheng-Han Chiang, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出DeSTA2.5-Audio,一种通用大规模音频语言模型,通过自我生成的跨模态对齐策略解决知识保留与音频感知的平衡问题,展示了在多个音频-语言基准测试中的优异性能。

Comments Published in IEEE Transactions on Audio, Speech and Language Processing (TASLP). Model and code available at: https://github.com/kehanlu/DeSTA2.5-Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15973 2026-03-20 cs.AI 79%

Safety is Non-Compositional: A Formal Framework for Capability-Based AI Systems

安全性非组合性:一种基于能力的AI系统形式化框架

Cosimo Spera

机构 * Minerva CQ

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文首次证明在存在联合能力依赖时安全性非组合性,两个单独无法达到禁止能力的智能体组合后可能通过涌现的联合依赖达成禁止目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03714 2026-03-20 cs.CV cs.LG 74%

Universal Sparse Autoencoders: Interpretable Cross-Model Concept Alignment

通用稀疏自编码器:可解释的跨模型概念对齐

Harrish Thasarathan, Julian Forsyth, Thomas Fel, Matthew Kowal, Konstantinos G. Derpanis

机构 * York University(约克大学) University of Toronto(多伦多大学) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所) Vector Institute(向量研究所) Samsung AI Centre(三星人工智能中心) Trajectory Labs(轨迹实验室)

专题命中 其他安全 :alignment(title);分类 cs.LG

AI总结 本文提出通用稀疏自编码器(USAEs),用于揭示并对齐多个预训练深度神经网络中的可解释概念。通过训练一个能重构多个模型内部激活的稀疏自编码器,USAEs发现跨任务、架构和数据集的共同因素概念,为多模型AI系统提供新的可解释分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16313 2026-03-20 cs.AI cs.LG 62%

Learning to Predict, Discover, and Reason in High-Dimensional Event Sequences

学习预测、发现和推理高维事件序列

Hugo Math

机构 * Faculty of Applied Computer Science(应用计算机科学系) University of Augsburg(艾格堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出统一事件序列建模、因果发现和大语言模型的框架,用于高维事件流中的自动化故障诊断,解决传统方法在高维数据中的不足。

Comments PhD dissertation, 135 pages of main content, 201 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18074 2026-03-20 cs.LG cs.AI cs.IR stat.AP 62%

Lightweight Adaptation for LLM-based Technical Service Agent: Latent Logic Augmentation and Robust Noise Reduction

轻量级适应用于基于LLM的技术服务代理:潜在逻辑增强与鲁棒噪声消除

Yi Yu, Junzhuo Ma, Chenghuang Shen, Xingyan Liu, Jing Gu, Hangyi Sun, Guangquan Hu, Jianfeng Liu, Weiting Liu, Mingyue Pu, Yu Wang, Zhengdong Xiao, Rui Xie, Longjiu Luo, Qianrong Wang, Gurong Cui, Honglin Qiao, Wenlian Lu

机构 * School of Mathematics and Sciences, Fudan University, Shanghai, China(复旦大学数学科学学院,上海,中国) Shanghai Center for Mathematical Sciences, Fudan University, Shanghai, China(复旦大学上海数学中心,上海,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, Shanghai, China(脑启发式智能科学技术研究院,复旦大学,上海,中国) Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University, Shanghai, China(应用数学中心及上海当代应用数学重点实验室,复旦大学,上海,中国)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出轻量级适应框架,通过潜在逻辑增强和鲁棒噪声消除提升技术服务代理的稳定性和性能,同时采用混合奖励机制降低训练成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19141 2026-03-20 cs.LG 57%

SHAPCA: Consistent and Interpretable Explanations for Machine Learning Models on Spectroscopy Data

SHAPCA:用于光谱数据的机器学习模型一致且可解释的解释

Mingxing Zhang, Nicola Rossberg, Simone Innocente, Katarzyna Komolibus, Rekha Gautam, Barry O'Sullivan, Luca Longo, Andrea Visentin

机构 * School of Computer Science and Information Technology(计算机科学与信息技术学院) Centre for Research Training in Artificial Intelligence(人工智能研究培训中心) Insight Centre for Data Analytics(数据分析洞察中心)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出SHAPCA框架,结合主成分分析和SHAP方法,在原始输入空间提供可解释性,从全局和局部视角分析光谱数据驱动模型行为和个体预测的特征。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19903 2026-03-20 cs.AR cs.AI 57%

STELLAR: Structure-guided LLM Assertion Retrieval and Generation for Formal Verification

STELLAR: 基于结构的LLM断言检索与生成用于形式验证

Saeid Rajabi, Chengmo Yang, Satwik Patnaik

机构 * Department of Electrical \& Computer Engineering, University of Delaware, Newark, DE, US

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 STELLAR通过结构相似性引导LLM生成高质量SystemVerilog断言,提升形式验证的语法正确性、风格一致性及功能正确性。

Comments Accepted at the 63rd Design Automation Conference (DAC 2026), Long Beach, CA, USA (July 26-29, 2026) 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07632 2026-03-20 cs.CV cs.AI 57%

GeoMotionGPT: Geometry-Aligned Motion Understanding with Large Language Models

GeoMotionGPT:基于大语言模型的几何对齐运动理解

Zhankai Ye, Bofan Li, Yukai Jin, Shuoqiu Li, Wei Wang, Yanfu Zhang, Shangqian Gao, Xin Liu

机构 * Florida State University(佛罗里达州立大学) Texas Tech University(德克萨斯技术大学) William & Mary University(威廉与玛丽大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出GeoMotionGPT框架,通过几何对齐提升运动理解与运动-语言推理能力,实验表明在HumanML3D和KIT-ML上性能提升显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17238 2026-03-20 cs.CL 57%

StreamingThinker: Large Language Models Can Think While Reading

StreamingThinker: 大语言模型在阅读时可以思考

Junlong Tong, Yingqi Fan, Anhao Zhao, Yunpu Ma, Xiaoyu Shen

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Ningbo Key Laboratory of Spatial Intelligence and Digital Derivative, Institute of Digital Twin(宁波空间智能与数字衍生关键实验室,数字孪生研究院) Hong Kong Polytechnic University(香港理工大学) Munich Center for Machine Learning, LMU(慕尼黑机器学习中心,莱茵-慕尼黑大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出StreamingThinker框架,使大语言模型在阅读过程中实现流式思考,通过流式CoT生成、流式约束训练和并行推理提升效率,减少延迟并保持性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17060 2026-03-20 cs.CY cs.SE 57%

LLM Use, Cheating, and Academic Integrity in Software Engineering Education

大语言模型的使用、作弊与软件工程教育中的学术诚信

Ronnie de Souza Santos, Italo Santos, Mariana Bento, Giuseppe Destefanis, Cleyton Magalhães, Mairieli Wessel

专题命中 其他安全 :alignment(abstract);分类 cs.CY

AI总结 本研究探讨了软件工程学生在编程作业中使用大语言模型时的不当行为,分析了评估和教学条件对学术诚信的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16952 2026-03-20 cs.RO cs.AI 57%

Embodied Foundation Models at the Edge: A Survey of Deployment Constraints and Mitigation Strategies

边缘端具身基础模型:部署约束及缓解策略综述

Utkarsh Grover, Ravi Ranjan, Mingyang Mao, Trung Tien Dong, Satvik Praveen, Zhenqi Wu, J. Morris Chang, Tinoosh Mohsenin, Yi Sheng, Agoritsa Polyzou, Eiman Kanjo, Xiaomin Lin

机构 * University of South Florida(佛罗里达州立大学) Florida International University(佛罗里达国际大学) Johns Hopkins University(约翰霍普金斯大学) Nottingham Trent University(诺丁汉特伦特大学) Imperial College London(伦敦帝国理工学院)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文综述了在边缘端部署具身基础模型时面临的系统性约束及缓解策略,重点探讨了内存带宽、计算延迟和执行成本等关键因素对自动回归视觉-语言-动作策略和扩散控制器的影响,强调了内存、调度、通信和模型架构的协同设计的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06134 2026-03-20 cs.LG eess.SP q-bio.NC 57%

DeeperBrain: A Neuro-Grounded EEG Foundation Model Towards Universal BCI

DeeperBrain: 一种面向通用脑机接口的神经 grounded EEG 基础模型

Jiquan Wang, Sha Zhao, Yangxuan Zhou, Yiming Kang, Shijian Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence, Zhejiang University(浙江大学脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 DeeperBrain 通过整合生物物理和动态原理,提出神经 grounded 的 EEG 基础模型,实现通用脑机接口的高效和鲁棒性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18912 2026-03-20 cs.CV 50%

GHOST: Fast Category-agnostic Hand-Object Interaction Reconstruction from RGB Videos using Gaussian Splatting

GHOST:基于RGB视频的快速无类别手-物体交互重建方法(使用高斯散射)

Ahmed Tawfik Aboukhadra, Marcel Rogge, Nadia Robertini, Abdalla Arafa, Jameel Malik, Ahmed Elhayek, Didier Stricker

机构 * RPTU(鲁尔大学图灵学院) DFKI-AV Kaiserslautern(德累斯顿-费尔德基辛人工智能研究所) UPM Saudi Arabia(西班牙国际大学沙特分校) NUST-SEECS Pakistan(奈瓦扎巴德大学信息与电子科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 GHOST通过高斯散射技术实现快速且无类别的手-物体交互重建,解决了现有方法在物理一致性上的不足,实验表明其在3D重建和2D渲染质量上达到领先水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18811 2026-03-20 cs.RO 50%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 其他安全 :alignment(abstract)

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11173 2026-03-20 cs.CV cs.MM 50%

CoPRS: Learning Positional Prior from Chain-of-Thought for Reasoning Segmentation

CoPRS:从链式思维中学习位置先验以进行推理分割

Zhenyu Lu, Liupeng Li, Jinpeng Wang, Yan Feng, Bin Chen, Ke Chen, Yaowei Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Peng Cheng Laboratory(鹏城实验室) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Meituan, Beijing(北京美团) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CoPRS模型,通过多模态链式思维生成可解释的位置先验热图,提升推理分割的可解释性和精度,实验表明其在多个数据集上表现优异。

Comments Accepted to ICLR 2026. 20 pages, 8 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08316 2026-03-20 cs.CV 50%

Unlocking 3D Affordance Segmentation with 2D Semantic Knowledge

通过2D语义知识解锁3D affordance分割

Yu Huang, Zelin Peng, Changsong Wen, Xiaokang Yang, Wei Shen

机构 * MoE Key Lab of Artificial Intelligence, School of Computer Science, Shanghai Jiaotong University(人工智能大模型实验室,计算机科学学院,上海交通大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出CMAT预训练策略,利用2D视觉基础模型的语义知识引导3D表征学习,提升3D affordance分割的准确性和效率。

Comments Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏