arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-28 至 2026-04-28 共收录 149 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 43 篇

2604.24429 2026-04-28 cs.CL 57%

A Multi-Dimensional Audit of Politically Aligned Large Language Models

对政治倾向大型语言模型的多维审计

Lisa Korver, Mohamed Mostagir, Sherief Reda

机构 * Brown University(布朗大学) University of Michigan(密歇根大学) Ross School of Business(罗斯商学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于哈贝马斯沟通行动理论的多维框架,评估政治倾向语言模型在有效性、公平性、真实性及说服力四方面的表现,揭示大模型在政治角色扮演中更有效但更偏颇的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07538 2026-04-28 cs.CL 57%

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents

SwissGov-RSD: 一个人工标注的、跨语言基准,用于识别相关文档之间的词级语义差异

Michelle Wastl, Jannis Vamvas, Rico Sennrich

机构 * Department of Computational Linguistics, University of Zurich(瑞士苏黎世大学计算语言学系)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出SwissGov-RSD,首个跨语言文档级语义差异识别基准,包含224个多语言文档,通过人工标注词级差异,评估多种模型表现,揭示自动方法在跨语言任务中的不足。

Comments 30 pages; v3 accepted to ACL Main (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13650 2026-04-28 cs.CL 57%

CRISP: Persistent Concept Unlearning via Sparse Autoencoders

CRISP:通过稀疏自编码器实现持久性概念卸载

Tomer Ashuach, Dana Arad, Aaron Mueller, Martin Tutek, Yonatan Belinkov

机构 * Technion – Israel Institute of Technology(技术ion-以色列理工学院) Boston University(波士顿大学) University of Zagreb, FER(Zagreb大学,FER) Kempner Institute, Harvard University(哈佛大学 Kempner研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 CRISP利用稀疏自编码器实现持久性概念卸载,通过自动识别多层显著SAE特征并抑制其激活,优于现有方法,在WMDP基准的安全关键卸载任务中有效移除有害知识并保持通用能力。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23474 2026-04-28 cs.LG 57%

GeoCert: Certified Geometric AI for Reliable Forecasting

GeoCert: 用于可靠预测的几何AI

Regina Zhang, Zongru Li, Honggang Wen, Xiaofeng Liu, Siu-Ming Yiu, Pietro Liò, Kwok-Yan Lam

机构 * Department of Biomedical Informatics & Data Science, Yale University(耶鲁大学生物医学信息学与数据科学系) Department of Computer Science, The University of Hong Kong(香港大学计算机科学系) School of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 GeoCert通过统一预测、物理推理和形式验证,提升预测系统的准确性与可靠性,实现97.5%的计算成本降低和更高效的认证。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23257 2026-04-28 cs.SE cs.AI 57%

Knowledge Lever Risk Management for Software Engineering: A Stochastic Framework for Mitigating Knowledge Loss

软件工程中的知识杠杆风险管理:一种缓解知识损失的随机框架

Mark Chua, Samuel Ajila

机构 * Department of Systems and Computer Engineering(系统与计算机工程系) Carleton University(卡尔顿大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出知识杠杆风险管理框架,通过将无形知识资产转化为风险缓解机制,结合四个阶段架构和随机模型,提升软件开发项目中的知识资本和项目成功率。

Comments A shorter version of the paper will be presented on the 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications (SERA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23079 2026-04-28 cs.CV cs.AI 57%

From Pixels to Explanations: Interpretable Diabetic Retinopathy Grading with CNN-Transformer Ensembles, Visual Explainability and Vision-Language Models

从像素到解释:结合CNN-Transformer集成、视觉可解释性和视觉语言模型的可解释性糖尿病视网膜病变分级

Pir Bakhsh Khokhar, Carmine Gravino, Fabio Palomba, Sule Yildirim Yayilgan, Sarang Shaikh

机构 * Department of Informatics, University of Salerno(萨勒诺大学信息学院) Department of Information Security and Communication Technology (IIK), Norwegian University of Science and Technology(挪威科技大学信息安全部)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出结合强判别模型与多模态解释的方法,利用APTOS 2019基准评估六种CNN和Transformer模型,通过集成策略提升分级一致性,并利用视觉语言模型生成可解释的视网膜病变分级结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22897 2026-04-28 cs.IR cs.AI 57%

Citation-Driven Multi-View Training for Patent Embeddings: QaECTER and Sophia-Bench

基于引用驱动的多视图训练的专利嵌入:QaECTER和Sophia-Bench

Younes Djemmal, You Zuo, Kim Gerdes, Kirian Guiller

机构 * AI Lab, Questel(Questel人工智能实验室) Qatent(Qatent公司) Inria(法国国家信息与自动化研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出Sophia-Bench专利检索基准和QaECTER模型,通过多视图对齐和引用增强指标,提升模型在不同查询类型、技术领域和司法管辖区的检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19679 2026-04-28 cs.AI 57%

InquireMobile: Teaching VLM-based Mobile Agent to Request Human Assistance via Reinforcement Fine-Tuning

InquireMobile: 教授基于VLM的移动代理通过强化微调请求人类帮助

Qihang Ai, Pi Bu, Yue Cao, Yingyao Wang, Jihao Gu, Jingxuan Xing, Zekun Zhu, Wei Jiang, Zhicheng Zheng, Jun Song, Yuning Jiang

机构 * Future Living Lab, Alibaba Group(未来生活实验室,阿里巴巴集团) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝与天猫集团)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出InquireMobile,通过强化学习方法提升移动代理在关键决策点主动请求人类帮助的能力,实现46.8%的询问成功率提升,成为InquireBench上表现最佳的基线模型。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15993 2026-04-28 cs.CL 57%

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

解释自然语言中的谜题解决方案:对6x6数独的探索性研究

Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 研究评估了五种LLM在解决和解释6x6数独中的表现,发现尽管部分模型能解决谜题,但无法提供反映战略推理或直观问题解决的解释,凸显了LLM在人机协作决策中需解决的关键挑战。

Comments Accepted to Findings of ACL 2025

Journal ref Findings of ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24642 2026-04-28 cs.CV 50%

Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics

探测CLIP对360度文本和视觉语义的理解

Hai Wang, Xiaochen Yang, Mingzhi Dong, Jing-Hao Xue

机构 * Department of Statistical Science, University College London, UK(伦敦大学统计科学系) School of Mathematics and Statistics, University of Glasgow, UK(格拉斯哥大学数学与统计学学院) Department of Computer Science, University of Bath, UK(巴斯大学计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 本文探讨CLIP模型对360度全景图像-文本对语义对齐的评估能力,提出新的评价方法,发现CLIP在处理360度视觉语义时存在局限,并提出LoRA微调框架以提升其理解能力。

Comments Project Page: https://littlewhitesea.github.io/360Semantics.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 50%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24146 2026-04-28 cs.CV 50%

EXACT: an explainable anomaly-aware vision foundation model for analysis of 3D chest CT

EXACT:一种可解释的异常感知视觉基础模型,用于3D胸部CT分析

Xuguang Bai, Mingxuan Liu, Tongxi Song, Yifei Chen, Hongjia Yang, Kasidit Anmahapong, Zihan Li, Ying Zhou, Qiyuan Tian

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) Department of Radiology, Mianyang Central Hospital(绵阳市中心医院放射科) Center for Biomedical Imaging Research, Tsinghua University(清华大学生物医学成像研究中心)

专题命中 安全评测 :trustworthy(abstract)

AI总结 EXACT通过学习空间解析表示,提升3D胸部CT的异常检测与可解释性,优于现有医学基础模型,适用于多疾病诊断和报告生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23982 2026-04-28 cs.CV 50%

Hierarchical Prototype-based Domain Priors for Multiple Instance Learning in Multimodal Histopathology Analysis

层次化原型域先验用于多实例学习的多模态病理分析

Xuemei Qiu, Dawei Fan, Yebin Huang, Yanping Chen, Lifang Wei

机构 * College of Computer and Information Science, Fujian Agriculture and Forestry University(福建农林大学计算机与信息科学学院) College of Future Technology, Fujian Agriculture and Forestry University(福建农林大学未来技术学院) Digital Fujian Institute of Agricultural Big Data, Fujian Agriculture and Forestry University(福建农业大数据数字福建研究院) Department of Pathology, Clinical Oncology School of Fujian Medical University, and Fujian Cancer Hospital(福建医科大学临床肿瘤学院病理科及福建癌症医院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出HPDP框架,通过引入形态锚定原型系统和正弦位置编码,解决多实例学习中数据驱动黑箱问题,提升病理诊断与预后分析的鲁棒性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23909 2026-04-28 cs.CV 50%

AMAVA: Adaptive Motion-Aware Video-to-Audio Framework for Visually-Impaired Assistance

AMAVA:一种自适应的动觉感知视频到音频框架,用于视障协助

Benjamin Klein, Kazi Ruslan Rahman, Sanchita Ghose

机构 * Department of Computer Science, San Francisco State University(计算机科学系,旧金山州立大学) Department of Mathematics, San Francisco State University(数学系,旧金山州立大学) Department of Computer Engineering, San Francisco State University(计算机工程系,旧金山州立大学)

专题命中 安全评测 :safety(abstract)

AI总结 AMAVA通过将移动设备视频转换为相关声音效果或语音描述,帮助视障人士更高效地感知环境,提升导航安全性和信心。

Comments 8 pages, 7 figures. Published in the Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289

Journal ref In Proceedings of the 15th International Conference on Pattern Recognition Applications and Methods (ICPRAM 2026), pages 282--289, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23802 2026-04-28 cs.MA 50%

EndoGov: A knowledge-governed multi-agent expert system for endometrial cancer risk stratification

EndoGov:一种基于知识的多智能体专家系统用于子宫内膜癌风险分层

Weiye Dai, Liyun Shi, Zanxiang He, Yuling Ma, Mengyuan Lin, Dianxiang Sun, Liming Nie

专题命中 安全评测 :safety(abstract)

AI总结 EndoGov通过多智能体系统结合规则治理,实现子宫内膜癌风险分层的指南合规性与高准确性,同时保持竞争性判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23574 2026-04-28 cs.CV 50%

PhysLayer: Language-Guided Layered Animation with Depth-Aware Physics

PhysLayer:基于语言的分层动画与深度感知物理

Tianyidan Xie, Zhentao Huang, Mingjie Wang, Xin Huang, Jun Zhou, Minglun Gong, Zili Yi

机构 * Nanjing University(南京大学) University of Guelph(圭尔夫大学) Zhejiang Sci-Tech University(浙江科技大学) Dalian Maritime University(大连海事大学)

专题命中 安全评测 :alignment(abstract)

AI总结 PhysLayer通过深度感知物理模拟和语言引导,实现静态图像的分层动画生成,提升了物理真实性和可控性,实验结果显示在多个指标上均有显著提升。

Comments Accepted to ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24948 2026-04-28 cs.RO 50%

World-Env: Leveraging World Model as a Virtual Environment for VLA Post-Training

World-Env: 利用世界模型作为虚拟环境进行VLA后训练

Junjin Xiao, Yandan Yang, Xinyuan Chang, Ronghan Chen, Feng Xiong, Mu Xu, Wei-Shi Zheng, Qing Zhang

机构 * School of Computer Science and Engineering, Sun Yat-sen University, China(中山大学计算机科学与工程学院) AMap, Alibaba Group(阿里巴巴集团高德地图) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education, China(教育部机器智能与先进计算重点实验室)

专题命中 安全评测 :safety(abstract)

AI总结 针对VLA模型在数据稀缺场景下的性能下降问题,提出World-Env框架,通过虚拟仿真器替代真实环境,提升安全性和效率,实现任务完成检测与持续奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23288 2026-04-28 cs.NI 50%

An Agentic Framework for Intent Co-Creation in 6G NaaS: Architecture and Open-Source Model Evaluation

面向6G NaaS的意图共创作代理框架:架构与开源模型评估

Kostis Trantzas, Besiana Agko, Christos Tranoris, Irene Denazi

专题命中 安全评测 :safety(abstract)

AI总结 本文提出面向6G NaaS的意图驱动端到端 orchestration 框架,通过协作意图共创作提升复杂网络环境下的自主性,评估开源大语言模型在高分辨率意图到有效订单转换中的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2502.14888 2026-04-28 cs.CV cs.AI 79%

Beyond Cross-Modal Alignment: Measuring and Leveraging Modality Gap in Vision-Language Models

超越跨模态对齐:测量和利用模态差距在视觉-语言模型中

Hanqi Yan, Xiangxiang Cui, Lu Yin, Jindong Gu, Paul Pu Liang, Yulan He, Yifei Wang

机构 * King’s College London(伦敦国王学院) University of Surrey(萨里大学) University of Oxford(牛津大学) MIT CSAIL(麻省理工学院CSAIL实验室) The Alan Turing Institute(阿兰·图灵研究院)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出通过测量和利用模态差距改进视觉-语言模型的下游任务,引入模态主导分数和自动可解释性度量,实现轻量级编辑和系统分析。

Comments accepted by ACL26-findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22775 2026-04-28 cs.HC 78%

Cognitive Alignment Deciphered: A Self-Developed Scenario-Based Prompt Scale Coupled with Representational Similarity Analysis and Social Network Analysis for Unraveling Bias Mechanisms Across Humans and LLMs

认知对齐解码:一种自研的基于场景的提示量表结合表征相似性分析和社会网络分析,用于揭示人类和大语言模型中的偏见机制

Chengrui Zhou

专题命中 AI治理与伦理 :alignment(title,abstract)

AI总结 本文提出基于场景的CBAS量表,结合RSA和SNA分析,揭示人类和LLM的偏见机制,通过干预提升LLM响应准确率,建立可复现的认知对齐研究流程。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24076 2026-04-28 cs.AI cs.CL cs.CR 73%

An Information-Geometric Framework for Stability Analysis of Large Language Models under Entropic Stress

一个信息几何框架用于在熵应力下分析大语言模型的稳定性

Hikmat Karimov, Rahid Zahid Alekberli

机构 * Institute of Defense Technologies and Cybersecurity, Azerbaijan Technical University(国防技术与网络安全研究所,阿塞拜疆技术大学)

专题命中 AI治理与伦理 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个信息几何框架,通过整合任务效用、熵、内部结构指标,评估大语言模型在不确定性下的稳定性,实验显示该方法在高熵条件下表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11318 2026-04-28 cs.AI cs.CL cs.CY 67%

The Consensus Trap: Dissecting Subjectivity and the "Ground Truth" Illusion in Data Annotation

共识陷阱:数据标注中主观性与‘真实真相’幻觉的剖析

Sheza Munir, Benjamin Mah, Krisha Kalsi, Shivani Kapania, Julian Posada, Edith Law, Ding Wang, Syed Ishtiaque Ahmed

机构 * University of Toronto Computer Science(多伦多大学计算机科学系) University of Toronto Engineering Science(多伦多大学工程科学系) Carnegie Mellon University School of Computer Science(卡内基梅隆大学计算机科学学院) Yale University American Studies(耶鲁大学美国研究系) University of Waterloo Computer Science(滑铁卢大学计算机科学系) Google Research(谷歌研究) University of Toronto(多伦多大学) Carnegie Mellon University(卡内基梅隆大学) Yale University(耶鲁大学) University of Waterloo(滑铁卢大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过分析2020-2025年间七大赛事的346篇论文,揭示数据标注实践中‘共识陷阱’的机制,指出位置可读性失效与模型中介标注导致的锚定偏见,以及地理霸权对西方标准的强制性,呼吁将分歧视为高保真信号以构建文化胜任模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24686 2026-04-28 cs.AI 57%

Governing What You Cannot Observe: Adaptive Runtime Governance for Autonomous AI Agents

治理你无法观察的事物:面向自主AI代理的自适应运行时治理

German Marin, Jatin Chaudhary

机构 * Department of Computing, University of Turku(图尔库大学计算机系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI

AI总结 本文提出信息有效性原理,通过估计未观察风险上界并设定安全余量,实现自主AI代理的自适应运行时治理,结合Aubin viability理论构建Agent有效性框架,引入风险门机制实现预测性治理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23949 2026-04-28 cs.AI 57%

Context-Aware Hospitalization Forecasting Evaluations for Decision Support using LLMs

基于上下文的医院化疗预测评估:利用LLMs进行决策支持

Rhea Makkuni, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文评估了利用LLMs进行医院化疗预测的方法,通过三种方法在60个县的数据上验证了上下文增强的混合模型在非平稳医疗资源预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15050 2026-04-28 cs.CV 50%

DRIFT: Transferring Reasoning Priors for Efficient MLLM Fine-Tuning

DRIFT:用于高效MLLM微调的推理先验转移

Chao Huang, Zeliang Zhang, Jiang Liu, Ximeng Sun, Jialian Wu, Xiaodong Yu, Ze Wang, Chenliang Xu, Emad Barsoum, Zicheng Liu

机构 * University of Rochester(罗切斯特大学) AMD

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 DRIFT通过在梯度空间中转移推理知识,实现高效稳定的多模态推理迁移,优于传统方法并在数据和计算上更高效。

Comments ACL 2026 camera-ready; Project Page: https://wikichao.github.io/DRIFT/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 34 篇

2503.15840 2026-04-28 cs.LO cs.FL 82%

Automatic Generation of Safety-compliant Linear Temporal Logic via Large Language Model: A Self-supervised Framework

基于大语言模型的自动安全合规线性时序逻辑生成:一种自监督框架

Junle Li, Siqi Chen, Jiakai Li, Meiqi Tian, Bingzhuo Zhong

专题命中 其他安全 :safety(title,abstract);alignment(abstract)

AI总结 本文提出AutoSafeLTL框架,利用大语言模型自动生成符合安全限制的LTL规范,通过语言包含检查与自动反例引导修改机制确保逻辑一致性和语义准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23902 2026-04-28 cs.AI 79%

LLM-Augmented Traffic Signal Control with LSTM-Based Traffic State Prediction and Safety-Constrained Decision Support

基于LSTM的交通信号控制与大语言模型增强的交通状态预测与安全约束决策支持

Jiazhao Shi

机构 * Tandon School of Engineering, New York University(纽约大学Tandon工程学院)

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 本文提出一种结合LSTM交通状态预测和大语言模型的交通信号控制框架,通过预测信号相位和生成自然语言解释,提升交通效率并确保安全约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23676 2026-04-28 cs.HC 78%

Directional Alignment and Narrative Agency in Human-LLM Co-Writing

方向对齐与人类-大语言模型共写中的叙事自主性

Halfdan Nordahl Fundal, Yuri Bizzoni

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究人类-大语言模型共写中的叙事自主性,探讨谁主导故事发展。通过87个共写故事分析,发现人类引入更多语义新颖性,而大语言模型则扩展人类元素,情感层面也呈现双向互动。

Comments 11 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10599 2026-04-28 cs.AI 74%

Adaptive Multi-Subspace Representation Steering for Attribute Alignment in Large Language Models

自适应多子空间表示引导用于大语言模型中的属性对齐

Xinyan Jiang, Lin Zhang, Jiayi Zhang, Qingsong Yang, Guimin Hu, Di Wang, Lijie Hu

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽德人工智能大学) Data Analytics (PRADA) Lab(数据分析(PRADA)实验室) King Abdullah University of Science(卡瓦尔大学) Shanghai Advanced Research Institute, Chinese Academy of Sciences, Shanghai, China(上海先进研究院,中国科学院,上海,中国) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) University of Copenhagen, Copenhagen, Denmark(哥本哈根大学,哥本哈根,丹麦) University of Science(科学大学)

专题命中 其他安全 :alignment(title);分类 cs.AI

AI总结 本文提出MSRS框架,通过子空间表示微调实现多属性引导,减少属性干扰并提升行为控制精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21110 2026-04-28 cs.AI cs.CL cs.CR cs.CY 67%

Beyond Context: Large Language Models' Failure to Grasp Users' Intent

超越上下文:大型语言模型对用户意图的把握失败

Ahmed M. Hussain, Salahuddin Salahuddin

机构 * KTH Royal Institute of Technology Network Systems Security (NSS) Group(皇家理工学院网络系统安全小组)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究指出大型语言模型在理解上下文和识别用户意图方面存在缺陷,导致安全机制被恶意用户利用,需转向以上下文理解和意图识别为核心的安全能力。

Comments 22 pages and 23 figures; updated authors list and revised manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏