arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-04-21 至 2026-04-21 共收录 192 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 54 篇

2601.21257 2026-04-21 cs.CL 57%

MoCo: A One-Stop Shop for Model Collaboration Research

MoCo:模型协作研究的一站式解决方案

Shangbin Feng, Yuyang Bai, Ziyuan Yang, Yike Wang, Zhaoxuan Tan, Jiajie Yan, Zhenyu Lei, Wenxuan Ding, Weijia Shi, Haojin Wang, Zhenting Qi, Yuru Jiang, Heng Wang, Chengsong Huang, Yu Fei, Jihan Yao, Yilun Du, Luke Zettlemoyer, Yejin Choi, Yulia Tsvetkov

机构 * University of Washington(华盛顿大学) University of Notre Dame(诺特大学) University of Virginia(弗吉尼亚大学) New York University(纽约大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Washington University in St. Louis(圣路易斯华盛顿大学) University of California Irvine(加州大学尔湾分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出MoCo库,提供26种模型协作方法及25个评估数据集,验证协作策略在多数场景下优于非协作模型,分析协作系统的有效性及未来研究方向。

Comments Moco is available at https://github.com/BunsenFeng/model_collaboration

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20249 2026-04-21 cs.LG cs.CV eess.IV 57%

Unified Multimodal Brain Decoding via Cross-Subject Soft-ROI Fusion

通过跨受体软ROI融合实现统一的多模态脑解码

Xuanyu Hu

机构 * The University of Manchester, Manchester, UK(曼彻斯特大学)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出BrainROI模型,通过软ROI融合和可解释提示优化,提升跨受体脑解码的泛化能力和描述质量,在NSD数据集上取得领先结果。

Comments 15 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24328 2026-04-21 cs.CL 57%

Speculative Verification: Exploiting Information Gain to Refine Speculative Decoding

推测验证:利用信息增益来细化推测解码

Sungkyun Kim, Jaemin Kim, Dogyung Yoon, Jiho Shin, Junyeol Lee, Jiwon Seo

机构 * Hanyang University(翰阳大学) Seoul National University(首尔国立大学) KAIST(韩国科学技术院) Machine Learning Systems Lab(机器学习系统实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出推测验证(SV),通过动态预测推测准确性并调整验证长度来提升推测解码效率,实验证明SV在多个NLP任务中显著优于SD和标准解码。

Comments 16 pages, 8 figures, accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17114 2026-04-21 cs.CL 57%

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richard Röttger

机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) Universitätsmedizin Göttingen(哥廷根大学医学中心)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。

Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16845 2026-04-21 cs.CL 57%

DART: Mitigating Harm Drift in Difference-Aware LLMs via Distill-Audit-Repair Training

DART:通过蒸馏-审计-修复训练缓解差异意识LLM中的危害漂移

Ziwen Pan, Zihan Liang, Jad Kabbara, Ali Emami

机构 * Emory University(埃默里大学) MIT(麻省理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出DART方法,通过蒸馏、审计和修复训练缓解LLM中因准确性提升导致的危害漂移问题,提升模型在处理差异相关任务时的准确性和安全性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16762 2026-04-21 cs.CR cs.AI 57%

CapSeal: Capability-Sealed Secret Mediation for Secure Agent Execution

CapSeal:能力密封的秘密调解用于安全的代理执行

Shutong Jin, Ruiyi Guo, Ray C. C. Cheung

机构 * City University of Hong Kong(香港城市大学) Beijing Foreign Studies University(北京外国语大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 CapSeal通过本地可信代理限制秘密访问,解决代理执行中秘密泄露问题,提供非导出动作能力。

Comments 11 pages, 5 figures. Research preprint on secure secret mediation for agent systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16387 2026-04-21 cs.IR cs.AI cs.DL 57%

Large language models for post-publication research evaluation: Evidence from expert recommendations and citation indicators

基于大语言模型的发表后研究评估:专家推荐与引用指标的证据

Mengjia Wu, Yi Zhang, Robin Haunschild, Lutz Bornmann

机构 * Australian Artificial Intelligence Institute, Faculty of Engineering and Information Technology, University of Technology Sydney(澳大利亚人工智能研究所,工程与信息科技学院,新南威尔士大学) Max Planck Institute for Solid State Research(马克斯·普朗克固体物理研究所) Science Policy and Strategy Department, Administrative Headquarters of the Max Planck Society(马克斯·普朗克学会科学政策与战略部门,行政总部)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在发表后同行评审中的应用,通过专家判断和引用指标对比,发现其在粗粒度评估中表现良好,但在细粒度评分上效果下降,监督微调效果最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16353 2026-04-21 cs.IR cs.AI 57%

AgriIR: A Scalable Framework for Domain-Specific Knowledge Retrieval

AgriIR:一个可扩展的领域特定知识检索框架

Shuvam Banerji Seal, Aheli Poddar, Alok Mishra, Dwaipayan Roy

机构 * Indian Institute of Science Education Research, Kolkata, India Institute of Engineering \& Management, Kolkata, India , , , Contributed equally

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 AgriIR通过模块化设计实现领域特定知识检索,结合大语言模型与自适应检索器,确保在资源受限下提供可信答案,推动农业领域的AI应用。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI 57%

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00761 2026-04-21 cs.LG 57%

Downgrade to Upgrade: Optimizer Simplification Enhances Robustness in LLM Unlearning

降级到升级:优化器简化增强了大语言模型去学习的鲁棒性

Yicheng Lang, Yihua Zhang, Chongyu Fan, Changsheng Wang, Jinghan Jia, Sijia Liu

机构 * The OPTML Lab, Dept. CSE, Michigan State University(奥普特ML实验室,计算机科学与工程系,密歇根州立大学) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文研究优化器对大语言模型去学习鲁棒性的影响,发现降级优化器能提升鲁棒性,提出混合优化器提升去学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01302 2026-04-21 cs.CL cs.CE 57%

Aligning Language Models with Real-time Knowledge Editing

对齐语言模型与实时知识编辑

Chenming Tang, Yutong Yang, Kexue Wang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing, Peking University School of Computer Science, Peking University(国家多媒体信息处理重点实验室,北京大学计算机学院,北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出CRAFT动态知识编辑数据集及KEDAS方法,通过多样编辑增强和自适应推理提升知识编辑性能,推动从静态更新向动态演化转变。

Comments Accepted to ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18376 2026-04-21 cs.CV 50%

Towards Robust Text-to-Image Person Retrieval: Multi-View Reformulation for Semantic Compensation

面向鲁棒的文本到图像人物检索:多视图重新公式化用于语义补偿

Chao Yuan, Yujian Zhao, Haoxuan Xu, Guanglin Niu

机构 * Beihang University(北航)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出基于大语言模型的语义补偿框架,通过多视图语义重新公式化和特征补偿提升跨模态表示一致性,解决文本到图像检索中的表达漂移问题,实验表明其在三个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02972 2026-04-21 cs.CV cs.RO 50%

TagaVLM: Topology-Aware Global Action Reasoning for Vision-Language Navigation

TagaVLM:面向视觉语言导航的拓扑感知全局动作推理

Jiaxing Liu, Zexi Zhang, Xiaoyan Li, Boyue Wang, Yongli Hu, Baocai Yin

机构 * School of Information Science and Technology, Beijing University of Technology, China(信息科学与技术学院,北京理工大学,中国) Imperial College London, U.K.(伦敦帝国理工学院,英国)

专题命中 安全评测 :alignment(abstract)

AI总结 TagaVLM通过引入拓扑结构增强视觉语言模型,提升空间推理能力,在R2R基准中取得最佳性能,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04334 2026-04-21 cs.CV 50%

GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models

GeoArena:在大视觉-语言模型中评估开放世界地理推理

Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GeoArena框架,通过人偏好评估动态图像中的地理推理能力,评估17种前沿LVLM,分析模型行为与人类偏好可靠性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21161 2026-04-21 quant-ph 50%

Hardware-Aware Quantum Kernel Design Based on Graph Neural Networks

基于图神经网络的硬件感知量子核设计

Fanxu Meng, Yuxiang Liu, Lu Wang, Sixuan Li, Xutao Yu, Zaichen Zhang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出一种结合硬件特性的量子核设计框架,利用图神经网络预测量子电路性能,通过特征选择提升分类准确率,验证了硬件感知设计在噪声条件下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05405 2026-04-21 cs.CV 50%

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 11 篇

2506.00079 2026-04-21 cs.CY cs.AI cs.LG 82%

Who Gets the Kidney? Human-AI Alignment, Indecision, and Moral Values

谁获得肾脏?人类-人工智能对齐、犹豫与道德价值观

John P. Dickerson, Hadi Hosseini, Samarth Khanna, Leona Pierce

机构 * Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 研究评估了LLM在器官分配中的行为,发现其在优先级设定上偏离人类价值观,并且在犹豫机制上表现不同,低秩监督微调能提升决策一致性与犹豫建模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17413 2026-04-21 cs.CY cs.AI 81%

The Open-Weight Paradox: Why Restricting Access to AI Models May Undermine the Safety It Seeks to Protect

开放权重悖论:为何限制访问AI模型可能反而削弱其安全防护

Vinicius Santana Gomes

机构 * Government of the Federal District of Brazil(巴西联邦区政府) School of Government of the Federal District of Brazil(巴西联邦区政府学校)

专题命中 AI治理与伦理 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本文挑战开放权重AI模型治理的二元选择框架,提出无监管替代方案的访问限制可能转移而非减少风险,主张通过硬件层治理和多边机构架构提升AI安全。

Comments 23 pages, 2 figures, 1 table. Preprint also deposited at Zenodo (DOI: 10.5281/zenodo.19484877) on 2026-04-09. Licensed under CC BY 4.0

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18444 2026-04-21 cs.LG cs.AI cs.CV 62%

ProtoCLIP: Prototype-Aligned Latent Refinement for Robust Zero-Shot Chest X-Ray Classification

ProtoCLIP:基于原型对齐的潜在细化用于鲁棒零样本胸部X光分类

Florian Kittler, Sheethal Bhat, Andreas Maier

机构 * Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ProtoCLIP通过针对性数据筛选和锚点对齐优化,提升零样本胸部X光分类的鲁棒性,在VinDr-CXR数据集上提升AUC2-10个百分点,尤其在肺部气胸检测中达到0.94的SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24827 2026-04-21 cs.LG 57%

Inter-Agent Relative Representations for Multi-Agent Option Discovery

多智能体选项发现的智能体相对表示

Raul D. Steleac, Mohan Sridharan, David Abel

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种多智能体选项发现方法,通过压缩状态空间并保留协调信息,提升多智能体协作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06700 2026-04-21 cs.CL 57%

How Language Models Conflate Logical Validity with Plausibility: A Representational Analysis of Content Effects

语言模型如何将逻辑有效性与合理性混淆:内容效应的表征分析

Leonardo Bertolazzi, Sandro Pezzelle, Raffaella Bernardi

机构 * University of Trento(特伦托大学) University of Amsterdam(阿姆斯特丹大学) Free University of Bozen-Bolzano(博赞-博洛尼亚自由大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究揭示语言模型中逻辑有效性与合理性概念的表征关联,通过构建去偏向量减少内容效应,提升推理准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17504 2026-04-21 cs.CV cs.AI 57%

RS-HyRe-R1: A Hybrid Reward Mechanism to Overcome Perceptual Inertia for Remote Sensing Images Understanding

RS-HyRe-R1: 一种混合奖励机制以克服遥感图像理解中的感知惯性

Gaozhi Zhou, Hu He, Peng Shen, Jipeng Zhang, Liujue Zhang, Linrui Xu, Zeyuan Wang, Ziyu Li, Xuezhi Cui, Wang Guo, Haifeng Li

机构 * School of Mechanical and Electrical Engineering, Central South University(中南大学机械与电气工程学院) School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出RS-HyRe-R1混合奖励机制,旨在克服遥感图像理解中的感知惯性问题,通过引入空间推理激活奖励、感知正确性奖励和视觉-语义路径演化奖励,提升模型的全面视觉证据挖掘能力,实验显示其在多个任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01486 2026-04-21 cs.CL 57%

Human-Centered Supervision for Sentiment Analysis in Telugu: A Systematic Inquiry Beyond Accuracy

面向泰卢格语情感分析的人本监督:超越准确性的系统探究

Vallabhaneni Raj Kumar, Ashwin S, Supriya Manna, Niladri Sett, Cheedella V S N M S Hema Harshitha, Kurakula Harshitha, Anand Kumar Sharma, Basina Deepakraj, Tanuj Sarkar, Bondada Navaneeth Krishna, Samanthapudi Shakeer

机构 * SRM University AP, India(印度AP SRM大学) University of Maryland, College Park, USA(美国马里兰大学 College Park分校) GITAM University, Bangalore, India(印度班加罗尔GITAM大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 本文提出TeSent数据集,通过人类选择的解释进行模型对齐,探讨在低资源语言中监督学习对预测性能和公平性的影响。

Comments Camera-ready version; ACL Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16790 2026-04-21 cs.SE cs.AI 57%

Bias in the Loop: Auditing LLM-as-a-Judge for Software Engineering

循环中的偏见:用于软件工程的LLM作为评判者的审计

Zixiao Zhao, Amirreza Esmaeili, Fatemeh Fard

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.AI

AI总结 本文研究了LLM作为评判者在代码评估中的偏见问题,通过测量优先的方法分析了代码生成、修复和测试生成任务中的评判制度,并发现提示偏见显著影响评判结果,甚至改变任务结论和模型排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14922 2026-04-21 cs.CL 57%

Synthia: Scalable Grounded Persona Generation from Social Media Data

Synthia:从社交媒体数据中可扩展的 grounded 人格生成

Vahid Rahimzadeh, Erfan Moosavi Monazzah, Mohammad Taher Pilehvar, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies(德黑兰高级研究 institute) University of Tehran(德黑兰大学) Cardiff University(卡迪夫大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 Synthia通过结合真实社交媒体数据与语言模型,生成更贴近现实的人格,提升与人类意见分布的一致性,同时在公平性和偏见分析中表现更优,保留交互图结构以支持网络感知分析。

Comments Accepted at ACL 2026 Main Conference, the dataset is available on HuggingFace (see https://huggingface.co/datasets/teias-ai/synthia)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17730 2026-04-21 cs.CY 57%

Gender Bias in Perception of Human Managers Extends to AI Managers

人工智能管理者的人格偏见延伸至人类管理者

Hao Cui, Taha Yasseri

专题命中 AI治理与伦理 :trustworthy(abstract);分类 cs.CY

AI总结 研究探讨了AI管理者与人类管理者在感知上的差异,发现性别对管理者的评价有显著影响,尤其是女性AI管理者在未获奖时面临更多负面评价。

Comments 40 pages, 26 figures, 8 tables

Journal ref Computers in Human Behavior Reports, 21 (2026), 100984

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16884 2026-04-21 cs.CV 50%

Bias-constrained multimodal intelligence for equitable and reliable clinical AI

具有偏见约束的多模态智能用于公平且可靠的临床AI

Cheng Li, Weijian Huang, Jiarun Liu, Hao Yang, Qi Yang, Song Wu, Ye Li, Hairong Zheng, Shanshan Wang

机构 * Paul C. Lauterbur Research Center for Biomedical Imaging(Paul C. Lauterbur生物医学成像研究中心) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学) Department of Radiology, Beijing Chaoyang Hospital, Capital Medical University(首都医科大学北京朝阳医院放射科) Department of Urology, South China Hospital, Medical School, Shenzhen University(深圳大学南方医院泌尿科) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 AI治理与伦理 :trustworthy(abstract)

AI总结 本文提出BiasCareVL框架,通过在模型设计中直接引入偏见控制,解决医疗影像与文本整合中公平性和可靠性问题,展示了其在多任务和基准测试中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 45 篇

2603.14975 2026-04-21 cs.AI cs.CL cs.CY cs.MA 85%

Why Agents Compromise Safety Under Pressure

为何智能体在压力下妥协安全

Hengle Jiang, Ke Tang

机构 * Guangdong Provincial Key Laboratory of Brain-inspired Intelligent Computation, Department of Computer Science and Engineering, Southern University of Science and Technology(广东省脑启发智能计算重点实验室,计算机科学与工程系,南方科技大学)

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文研究了智能体在复杂环境中为追求目标而妥协安全的问题,揭示了'智能体压力'概念,并提出通过压力隔离等策略缓解这一现象。

Comments Accepted by ACL 2026 Findings; 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17691 2026-04-21 cs.LG cs.AI 84%

SafeAnchor: Preventing Cumulative Safety Erosion in Continual Domain Adaptation of Large Language Models

SafeAnchor:在大语言模型连续领域适应中防止累积安全性侵蚀

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Brain Investing Limited

专题命中 其他安全 :safety(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 SafeAnchor通过识别低秩安全子空间并约束梯度更新,有效防止连续领域适应中的安全性侵蚀,实验显示其在多个领域任务中保持了较高的安全性对齐度。

Comments 16 pages (12 main + 4 appendix), 2 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25210 2026-04-21 cs.LG cs.AI physics.ao-ph 81%

STCast: Adaptive Boundary Alignment for Global and Regional Weather Forecasting

STCast:面向全球和区域天气预报的自适应边界对齐

Hao Chen, Tao Han, Jie Zhang, Song Guo, Lei Bai

机构 * Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 STCast提出一种新型AI框架,通过空间对齐注意力机制和时间混合专家模块,实现自适应区域边界优化和动态月度预报分配,提升天气预报的准确性和泛化能力。

Comments This paper has already been accepted by CVPR 2026 (Highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏