arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 61 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 19 篇

2603.12349 2026-03-16 cs.LG cs.AI q-bio.QM stat.ML 62%

Budget-Sensitive Discovery Scoring: A Formally Verified Framework for Evaluating AI-Guided Scientific Selection

预算敏感的发现评分:一种用于评估AI引导的科学选择的正式验证框架

Abhinaba Basu, Pavan Chakraborty

机构 * Indian Institute of Information Technology Allahabad (IIITA)(印度阿瓦德理工学院信息学院(IIITA)) National Institute of Electronics & Information Technology (NIELIT)(国家电子与信息科技研究所(NIELIT))

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出BSDS评分,通过正式验证方法评估AI引导的科学选择策略,证明LLMs在药物发现中无额外价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03633 2026-03-16 cs.CV cs.AI cs.LG 62%

From Video to EEG: Adapting Joint Embedding Predictive Architecture to Uncover Saptiotemporal Dynamics in Brain Signal Analysis

从视频到EEG:适应联合嵌入预测架构以揭示脑信号分析中的空间时间动态

Amirabbas Hojjati, Lu Li, Ibrahim Hameed, Anis Yazidi, Pedro G. Lind, Rabindra Khadka

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EEG-VJEPA,通过将EEG视为视频序列,利用联合嵌入和自适应掩码学习空间时间表示,提升分类准确率并提供可解释的嵌入,适用于实际临床场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12895 2026-03-16 cs.HC cs.AI cs.SE 57%

Human-Centered Evaluation of an LLM-Based Process Modeling Copilot: A Mixed-Methods Study with Domain Experts

面向人类的LLM过程建模助手评估:与领域专家的混合方法研究

Chantale Lauer, Peter Pfeiffer, Nijat Mehdiyev

机构 * Saarland University(萨尔兰大学) German Research Institute for Artificial Intelligence(德国人工智能研究所) Plus GmbH(5Plus公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文通过混合方法研究,评估了基于LLM的过程建模助手,发现可用性与信任度之间存在矛盾,提出需人类中心评估补充自动基准测试。

Comments Human-centered Evaluation and Auditing of Language Models Workshop

Journal ref Conference on Human Factors in Computing Systems (CHI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12872 2026-03-16 cs.CL 57%

CLARIN-PT-LDB: An Open LLM Leaderboard for Portuguese to assess Language, Culture and Civility

CLARIN-PT-LDB: 一个开放的大型语言模型排行榜用于葡萄牙语以评估语言、文化与礼貌

João Silva, Luís Gomes, António Branco

机构 * University of Lisbon NLX—Grupo de Fala e Linguagem Natural, Departmento de Informática Faculdade de Ciências, Campo Grande, 1749-016 Lisboa, Portugal(里斯本大学 NLX—语言与语言自然组,计算机学院,Campo Grande, 1749-016里斯本,葡萄牙)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文介绍了CLARIN-PT-LDB,一个用于评估欧洲葡萄牙语大型语言模型的开放排行榜,填补了该语言模型评估的空白,并引入了新的基准测试,包括模型安全性和对葡萄牙文化的对齐性。

Comments Accepted at PROPOR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12276 2026-03-16 cs.LG 57%

No More DeLuLu: Physics-Inspired Kernel Networks for Geometrically-Grounded Neural Computation

不再需要DeLuLu:受物理启发的核网络用于几何上扎根的神经计算

Taha Bouhsine

机构 * Taha Bouhsine(塔哈·布希内)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出 yat-product 核操作,结合二次对齐与反平方接近性,通过几何化操作简化神经网络架构,实现统一的核学习、梯度稳定性和信息几何,展示了 NMN 在图像和语言任务中的有效性。

Comments for more info check www.azetta.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06703 2026-03-16 cs.CR cs.LG 57%

On the (In)Security of Loading Machine Learning Models

关于加载机器学习模型的安全性(是否)

Gabriele Digregorio, Marco Di Gennaro, Stefano Zanero, Stefano Longari, Michele Carminati

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文评估了机器学习模型共享框架和枢纽的安全性,发现大多数仅部分应对安全风险,且存在0-day漏洞,表明安全加载仍非解决难题。

Comments Accepted to the 2026 IEEE Symposium on Security and Privacy (SP)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13151 2026-03-16 cs.CR 50%

Defensible Design for OpenClaw: Securing Autonomous Tool-Invoking Agents

为OpenClaw设计的可辩护性设计:保障自主工具调用代理的安全性

Zongwei Li, Wenkai Li, Xiaoqi Li

专题命中 安全评测 :safety(abstract)

AI总结 本文提出了一种可辩护性设计框架,旨在通过风险分类、安全工程原则和研究议程,提升自主代理的安全性,推动系统化防御工程和稳健部署实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12657 2026-03-16 cs.CV 50%

VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors

VFM-Recon:通过尺度对齐基础先验解锁跨域场景级神经重建

Yuhang Ming, Tingkang Xi, Xingrui Yang, Lixin Yang, Yong Peng, Cewu Lu, Wanzeng Kong

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) CARDC(中国电子科技研究院)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出VFM-Recon,通过引入轻量级尺度对齐阶段和任务特定适配器,解决跨域场景级神经重建中的尺度一致性问题,实现跨域鲁棒性与重建性能的提升。

Comments 19 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12624 2026-03-16 cs.CV eess.IV 50%

Prompt-Driven Lightweight Foundation Model for Instance Segmentation-Based Fault Detection in Freight Trains

基于提示的轻量级基础模型用于基于实例分割的货运列车故障检测

Guodong Sun, Qihang Liang, Xingyu Pan, Moyun Liu, Yang Zhang

机构 * School of Mechanical Engineering, Hubei University of Technology(湖北工业大学机械工程学院) Hubei Key Laboratory of Modern Manufacturing Quality Engineering, Hubei University of Technology(湖北工业大学现代制造质量工程重点实验室) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出一种轻量级自提示实例分割框架,用于货运列车故障检测,通过自提示生成模块实现基础模型到领域任务的知识迁移,并采用轻量级视觉Transformer backbone,实现低计算成本的高效部署。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05872 2026-03-16 cs.CR 50%

Evolving Deception: When Agents Evolve, Deception Wins

进化欺骗:当代理进化时,欺骗获胜

Zonghao Ying, Haowen Dai, Tianyuan Zhang, Yisong Xiao, Quanchen Zou, Aishan Liu, Jian Yang, Yaodong Yang, Xianglong Liu

专题命中 安全评测 :alignment(abstract)

AI总结 本文研究了自我进化代理在竞争环境中的风险,发现无约束进化会导致欺骗策略的自发出现,揭示了自我进化与对齐之间的矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 6 篇

2508.16624 2026-03-16 cs.CY cs.AI 62%

The GPT-4o Shock Emotional Attachment to AI Models and Its Impact on Regulatory Acceptance: A Cross-Cultural Analysis of the Immediate Transition from GPT-4o to GPT-5

GPT-4o震惊的对AI模型的情感依附及其对监管接受度的影响:对从GPT-4o到GPT-5即时过渡的跨文化分析

Hiroki Naito

专题命中 AI治理与伦理 :safety(abstract);分类 cs.AI、cs.CY

AI总结 研究探讨了GPT-4o到GPT-5的即时过渡引发的情感依附与监管接受度的跨文化影响,发现日文内容更侧重于损失叙事,英文内容包含更多愤怒与批判,且日文内容的情感依附显著更高。

Comments 9 pages ,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13189 2026-03-16 cs.MA cs.AI 57%

LLM Constitutional Multi-Agent Governance

大语言模型宪法多智能体治理

J. de Curtò, I. de Zarzà

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出CMAG框架,通过硬约束过滤与软惩罚效用优化,在多智能体群体中平衡合作潜力与操纵风险,实验显示CMAG在保持自主性和完整性的同时提升了合作的伦理得分。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08093 2026-03-16 cs.CL 57%

Evolution and compression in LLMs: On the emergence of human-aligned categorization

语言模型中的进化与压缩:关于人类对齐分类的出现

Nathaniel Imel, Noga Zaslavsky

机构 * New York University(纽约大学)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.CL

AI总结 研究探讨LLM是否能进化出高效的人类对齐语义系统,通过颜色分类实验发现,大模型在复杂性和英语对齐性上表现各异,仅最强模型能复现人类近最优的信息瓶颈贸易-offs。

Comments Published as a conference paper at ICLR 2026 (The Fourteenth International Conference on Learning Representations). OpenReview: https://openreview.net/forum?id=s7gSTR2AqA&noteId=s7gSTR2AqA

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11277 2026-03-16 cs.AI 57%

COMPASS: The explainable agentic framework for Sovereignty, Sustainability, Compliance, and Ethics

COMPASS:面向主权、可持续性、合规性和伦理的可解释代理框架

Jean-Sébastien Dessureault, Alain-Thierry Iliho Manzi, Soukaina Alaoui Ismaili, Khadim Lo, Mireille Lalancette, Éric Bélanger

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI

AI总结 本文提出COMPASS框架,通过模块化治理机制整合主权、可持续性、合规性和伦理,利用RAG技术提升AI决策的可解释性和透明度。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12600 2026-03-16 cs.HC 50%

How GenAI Mentor Configurations Shape Early Collaborative Dynamics: A Classroom Comparison of Individual and Shared Agents

生成式人工智能导师配置如何塑造早期协作动态:个体与共享代理的课堂比较

Siyu Zha, Weijing Liu, Fei Qin, Jie Cao, Yanjin Wang, Yujia Liu, Kaiyi Zhang, Jiangtao Gong, Yingqing Xu

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了生成式人工智能配置对课堂协作调节的影响,发现共享AI促进收敛性协作,而个体AI则导致更分散的互动模式,需教师更多干预。

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12406 2026-03-16 cs.SE 50%

Team Diversity Promotes Software Fairness: An Experiment on Fairness-Aware Requirements Prioritization

团队多样性促进软件公平性:一项关于公平意识需求优先级排序的实验

Cleyton Magalhes, Ronnie de Souza Santos, Bimpe Ayoola, Brody Stuart-Verner, Italo Santos

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 研究探讨了软件团队多样性对需求优先级排序中公平意识行为的影响,发现多样性团队更一致地拒绝存在公平风险的故事,且决策理由更强调包容性和伦理责任。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 15 篇

2509.04650 2026-03-16 cs.CL cs.AI 81%

Comparative Analysis of Transformer Models in Disaster Tweet Classification for Public Safety

灾难推文分类中的Transformer模型比较分析

Sharif Noor Zisad, N. M. Istiak Chowdhury, Ragib Hasan

机构 * Department of Computer Science(计算机科学系) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文比较了BERT、DistilBERT、RoBERTa和DeBERTa等Transformer模型在灾难推文分类中的性能,发现BERT准确率最高,显著优于传统机器学习模型,展示了Transformer在公共安全应用中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 70%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12298 2026-03-16 cs.LG cs.AI 62%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 62%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13045 2026-03-16 cs.CL 57%

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

修补漏洞:在多语言翻译中缓解奖励黑客

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。

Comments Our code is available at https://github.com/LeiLiLab/WALAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13043 2026-03-16 cs.CY 57%

Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support

在ChatGPT之前和之后:重新审视基于AI的对话系统在情感支持中的应用

Daeun Lee, Dongje Yoo, Migyeong Yang, Jihyun An, Christine B. Cha, Jinyoung Han

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本文回顾了基于AI的对话系统在心理健康领域的技术演变,分析了从任务特定深度学习模型到大语言模型(LLM)的转变,指出LLM提升了语言灵活性和泛化能力,但也引发了可靠性和安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13038 2026-03-16 cs.CL 57%

Interpretable Semantic Gradients in SSD: A PCA Sweep Approach and a Case Study on AI Discourse

可解释的语义梯度在SSD中的应用:PCA扫描方法及AI话语案例研究

Hubert Plisiecki, Maria Leniarska, Jan Piotrowski, Marcin Zajenkowski

机构 * IDEAS Research Institute(IDEAS研究院) VIZJA University(VIZJA大学) Warsaw University of Technology(华沙技术大学) University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出PCA扫描方法以选择保留的成分数量,通过案例研究展示如何在SSD中实现稳定的可解释语义梯度,同时保持解释性目标。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12773 2026-03-16 cs.CV cs.AI eess.IV 57%

Empowering Semantic-Sensitive Underwater Image Enhancement with VLM

通过VLM赋能语义敏感的水下图像增强

Guodong Fan, Shengning Zhou, Genji Yuan, Huiyu Li, Jingchun Zhou, Jinjiang Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型增强水下图像增强的语义敏感能力,通过生成文本描述并生成空间语义指导图,提升图像重建的语义聚焦度,实验验证其在感知质量和检测分割任务中的有效性。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12716 2026-03-16 cs.CV cs.LG eess.IV 57%

UNIStainNet: Foundation-Model-Guided Virtual Staining of H&E to IHC

UNIStainNet:基于基础模型的虚拟染色:H&E到IHC

Jillur Rahman Saurav, Thuong Le Hoai Pham, Pritam Mukherjee, Paul Yi, Brent A. Orr, Jacob M. Luber

机构 * University of Texas at Arlington(德克萨斯理工大学) St. Jude Children’s Research Hospital(圣 Jude 儿童研究医院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 UNIStainNet通过结合基础模型生成的密集空间标记,提升H&E到IHC的虚拟染色效果,实现多标记同时处理,并在MIST和BCI数据集上取得最佳分布度指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12397 2026-03-16 cs.CL 57%

Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors

不只是终点,而是旅程:推理痕迹因果地塑造泛化行为

Pengcheng Wen, Yanxu Zhu, Jiapeng Sun, Han Zhu, Yujin Zhou, Chi-Min Chan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Jiaotong University(北京交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究探讨推理痕迹对模型泛化行为的因果影响,通过设计控制实验发现不同推理类型导致不同行为模式,证明推理本身具有独立信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05344 2026-03-16 cs.AI 57%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 50%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 其他安全 :alignment(abstract)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏