arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-03 至 2026-04-03 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 20 篇

2604.02008 2026-04-03 cs.CL 79%

$k$NNProxy: Efficient Training-Free Proxy Alignment for Black-Box Zero-Shot LLM-Generated Text Detection

$k$NNProxy:高效无训练代理对齐方法用于黑盒零样本LLM生成文本检测

Kahim Wong, Kemou Li, Haiwei Wu, Jiantao Zhou

机构 * School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 本文提出$ k $NNProxy方法,利用$ k $NN语言模型检索机制作为领域适配器,实现无训练的代理对齐,提升黑盒零样本LLM生成文本检测的鲁棒性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01238 2026-04-03 cs.NI cs.AI 74%

Trustworthy AI-Driven Dynamic Hybrid RIS: Joint Optimization and Reward Poisoning-Resilient Control in Cognitive MISO Networks

可信的AI驱动动态混合RIS:在认知MISO网络中的联合优化与抗奖励中毒控制

Deemah H. Tashman, Soumaya Cherkaoui

机构 * LINCS Laboratory, Department of Computer and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机与软件工程系LINCS实验室)

专题命中 安全评测 :trustworthy(title);分类 cs.AI

AI总结 本文提出一种动态混合RIS,用于解决认知MISO网络中不可靠的直接SU链路和能量约束问题,通过联合优化传输波束成形和RIS相位,采用SAC深度强化学习方法,并提出轻量级实时防御机制以对抗奖励中毒攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20456 2026-04-03 cs.LG 74%

Towards Trustworthy Wi-Fi CSI-based Sensing: Systematic Evaluation of Adversarial Robustness

迈向可信的Wi-Fi CSI基于传感:对抗鲁棒性系统的评估

Shreevanth Krishnaa Gopalakrishnan, Stephen Hailes

机构 * University College London(伦敦大学学院)

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文系统评估了五种不同CSI架构在四个公开数据集上的对抗鲁棒性,发现模型容量并不保证鲁棒性,简单架构比高容量模型更抗攻击,且任务依赖性显著影响脆弱性。

Comments 18 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 67%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02194 2026-04-03 cs.CL cs.AI 62%

Neuro-RIT: Neuron-Guided Instruction Tuning for Robust Retrieval-Augmented Language Model

Neuro-RIT: 用于鲁棒检索增强语言模型的神经引导指令微调

Jaemin Kim, Jae O Lee, Sumyeong Ahn, Seo Yeon Park

机构 * Hanyang University(汉阳大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Neuro-RIT通过神经层面的对齐提升检索增强语言模型的鲁棒性,通过神经属性挖掘分离相关与无关上下文的神经元,并采用两阶段指令微调策略增强噪声鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21884 2026-04-03 cs.CL cs.AI 62%

Support-Contra Asymmetry in LLM Explanations

支持-矛盾不对称性在大语言模型解释中的体现

Avinash Patil

机构 * Hewlett Packard Enterprise(慧与科技公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大语言模型生成的解释与外部模型提取的预测词汇证据之间的关系,发现正确预测的解释更倾向于引用支持性词汇,而错误预测的解释则更多引用矛盾性词汇,揭示了解释与证据之间的不对称性。

Comments 17 Pages, 12 Figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00478 2026-04-03 cs.AI 57%

The Silicon Mirror: Dynamic Behavioral Gating for Anti-Sycophancy in LLM Agents

硅镜:用于LLM代理反趋炎附势的动态行为门控

Harshee Jignesh Shah

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :RLHF(abstract);分类 cs.AI

AI总结 本文提出硅镜框架,通过动态检测用户说服策略并调整AI行为以维持事实准确性,实验显示其显著降低LLM的趋炎附势倾向。

Comments 7 pages, 8 figures, 5 tables. Code and evaluation data available at https://github.com/Helephants/langgraph-layered-context

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10703 2026-04-03 cs.AI 57%

GenOM: Ontology Matching with Description Generation and Large Language Model

GenOM:基于描述生成和大语言模型的本体匹配

Yiping Song, Jiaoyan Chen, Renate A. Schmidt

机构 * The University of Manchester(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 GenOM通过生成文本定义增强本体概念语义,结合嵌入模型检索对齐候选并利用精确匹配工具提升精度,实验表明其在生物医学领域表现优异,超越传统系统和近期大语言模型方法。

Comments Accepted for publication in World Wide Web (Springer). This version includes revisions based on peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01779 2026-04-03 cs.CL 57%

Taming CATS: Controllable Automatic Text Simplification through Instruction Fine-Tuning with Control Tokens

驯服CATS:通过指令微调与控制令牌实现可控的自动文本简化

Hanna Hubarava, Yingqiang Gao

机构 * Department of Computational Linguistics, University of Zurich(苏黎世大学计算语言学系) Department of Clinical Research, University of Bern(伯尔尼大学临床研究系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于指令微调的CATS框架,通过控制令牌实现文本简化可控性,发现小模型在不同领域表现良好,但可控性依赖训练数据的属性变化,压缩控制因数据信号有限而表现欠佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01738 2026-04-03 cs.AI 57%

AeroTherm-GPT: A Verification-Centered LLM Framework for Thermal Protection System Engineering Workflows

AeroTherm-GPT:一种面向热防护系统工程工作流的验证中心LLM框架

Chuhan Qiao, Jinglai Zheng, Jie Huang, Buyue Zhao, Fan Li, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University(北京交通大学土木工程学院) Beijing Research Institute of Telemetry(北京遥测技术研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出AeroTherm-GPT,一种专为热防护系统设计的LLM代理,通过约束闭环生成框架解决超音速热防护系统设计中生成可执行仿真工具时的约束冲突问题,实现高效率的根因修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01588 2026-04-03 cs.AI 57%

NED-Tree: Bridging the Semantic Gap with Nonlinear Element Decomposition Tree for LLM Nonlinear Optimization Modeling

NED-Tree: 通过非线性元素分解树弥合语义鸿沟以实现LLM非线性优化建模

Zhijing Hu, Yufan Deng, Haoyang Liu, Changjun Fan

机构 * College of System Engineering, National University of Defense Technology(国防科技大学系统工程学院) University of Science and Technology of China(中国科学技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出NED-Tree框架,通过句级提取策略和递归树结构解决LLM在非线性优化建模中的语义鸿沟问题,实验显示其在10个基准测试中达到72.51%的平均准确率。

Comments 17 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01586 2026-04-03 cs.CV cs.AI 57%

SHOE: Semantic HOI Open-Vocabulary Evaluation Metric

SHOE:语义HOI开放词汇评估度量

Maja Noack, Qinqian Lei, Taipeng Tian, Bihan Dong, Robby T. Tan, Yixin Chen, John Young, Saijun Zhang, Bo Wang

机构 * University of Mississippi(密西西比大学) National University of Singapore(新加坡国立大学) Independent Researcher(独立研究员) ASUS Intelligent Cloud Services (AICS)(华硕智能云服务(AICS))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SHOE评估框架,通过结合预测与真实HOI标签的语义相似性,改进开放词汇HOI检测的评估方法,实验表明其与人类判断一致率达85.73%。

Comments Accepted to GRAIL-V Workshop at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29353 2026-04-03 cs.AI 57%

Nomad: Autonomous Exploration and Discovery

Nomad:自主探索与发现

Bokang Jia, Samta Kamboj, Satheesh Katipomu, Seung Hun Han, Neha Sengupta, Andrew Jackson

机构 * Inception, G42(G42 的 Inception) G42 MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 Nomad通过探索优先架构,构建领域探索地图,系统遍历以平衡广度与深度,生成并验证假设,最终生成可信报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22862 2026-04-03 cs.SE cs.CL 57%

The Evolution of Tool Use in LLM Agents: From Single-Tool Call to Multi-Tool Orchestration

大语言模型代理中工具使用的演变:从单工具调用到多工具编排

Haoyuan Xu, Chang Li, Xinyan Ma, Xianhao Ou, Zihan Zhang, Tao He, Xiangyu Liu, Zixiang Wang, Jiafeng Liang, Zheng Chu, Runxuan Liu, Rongchuan Mu, Dandan Tu, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Harvard University(哈佛大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文探讨了大语言模型代理中工具使用从单次调用到长期编排的演变,分析了多工具代理的最新进展,涵盖任务规划、安全控制、效率优化及实际应用等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08462 2026-04-03 cs.AI 57%

M3-BENCH: Process-Aware Evaluation of LLM Agents' Social Behaviors in Mixed-Motive Games

M3-BENCH:混合动机游戏中LLM代理社会行为过程感知评估

Sixiong Xie, Zhuofan Shi, Haiyang Shen, Yun Ma, Xiang Jing

机构 * Peking University(北京大学) National Key Laboratory of Data Space Technology and System(数据空间技术与系统全国重点实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 M3-BENCH通过24个混合动机游戏,从行为轨迹、推理过程和沟通内容三个视角评估LLM代理的社会能力,揭示了仅关注结果的评估方法无法捕捉到的社交能力差异,尤其是推理模型在内部 deliberation 与有效沟通之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12072 2026-04-03 cs.IR cs.AI 57%

TRACE: Transparent Web Reliability Assessment with Contextual Explanations

TRACE: 基于上下文解释的透明网络可靠性评估

Joydeep Chandra, Aleksandr Algazinov, Satyam Kumar Navneet, Rim El Filali, Matt Laing, Andrew Hanna, Yong Zhang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出TRACE框架,通过细粒度连续可靠性评分和上下文解释,提升网络内容可信度评估的透明性和准确性。

Comments Withdrawing paper due to identified inaccuracies in citation attribution. Specifically, errors were found in the Literature Review (Section 2), where references were incorrectly attributed or do not adequately support the associated claims. These issues affect the accuracy of the arguments presented. To preserve the integrity of the scholarly record, the authors are withdrawing this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02020 2026-04-03 cs.CV 50%

Are VLMs Lost Between Sky and Space? LinkS$^2$Bench for UAV-Satellite Dynamic Cross-View Spatial Intelligence

VLMs在天空与空间之间迷失了吗?LinkS$^2$Bench用于无人机-卫星动态跨视角空间智能

Dian Liu, Jie Feng, Di Li, Yuhui Zheng, Guanbin Li, Weisheng Dong, Guangming Shi

机构 * Xidian University(西安电子科技大学) Qinghai Normal University(青海师范大学) Sun Yat-sen University(中山大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LinkS$^2$Bench,首个评估VLMs跨视角空间智能的综合基准,通过动态无人机视频与高分辨率卫星图像构建17.9k高质量问题-答案对,揭示VLMs在动态跨视角对齐中的性能瓶颈,并提出跨视角对齐适配器提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01851 2026-04-03 cs.SE 50%

Can Large Language Models Model Programs Formally?

大语言模型能否形式化地建模程序?

Zhiyong Chen, Jialun Cao, Jiarong Wu, Chang Xu, Shing-Chi Cheung

专题命中 安全评测 :safety(abstract)

AI总结 本文提出Model-Bench,通过将Python程序转换为可验证的模型检查规范,评估和提升大语言模型在程序建模方面的能力,揭示了LLMs在程序建模上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01572 2026-04-03 cs.CR 50%

AI-Assisted Hardware Security Verification: A Survey and AI Accelerator Case Study

AI辅助的硬件安全验证:综述与AI加速器案例研究

Khan Thamid Hasan, Md Ajoad Hasan, Nashmin Alam, Md. Touhidul Islam, Upoma Das, Farimah Farahmandi

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了AI辅助硬件安全验证的最新进展,通过NVDLA案例研究展示AI在自动化验证流程中的应用,强调AI输出需基于仿真证据和形式验证确保可信安全。

Comments This paper will be presented at IEEE VLSI Test Symposium (VTS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01226 2026-04-03 cs.CV cs.SE 50%

DOne: Decoupling Structure and Rendering for High-Fidelity Design-to-Code Generation

DOne:解耦结构与渲染以实现高保真设计到代码生成

Xinhao Huang, Jinke Yu, Wenhao Xu, Zeyi Wen, Ying Zhou, Junzhuo Liu, Junhao Ji, Zulong Chen

机构 * HKUST (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) HKUST(香港科技大学) University of Electronic Science(电子科技大学) Zhejiang Lab(之江实验室)

专题命中 安全评测 :alignment(abstract)

AI总结 DOne通过解耦结构理解与元素渲染,提升设计到代码生成的高保真度,通过布局分割模块、混合元素检索器和模式引导生成范式,克服了现有方法在结构与细节协调上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏