arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-16 至 2026-03-16 共收录 15 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 15 篇

2509.04650 2026-03-16 cs.CL cs.AI 81%

Comparative Analysis of Transformer Models in Disaster Tweet Classification for Public Safety

灾难推文分类中的Transformer模型比较分析

Sharif Noor Zisad, N. M. Istiak Chowdhury, Ragib Hasan

机构 * Department of Computer Science(计算机科学系) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)

专题命中 其他安全 :safety(title,abstract);分类 cs.CL、cs.AI

AI总结 本文比较了BERT、DistilBERT、RoBERTa和DeBERTa等Transformer模型在灾难推文分类中的性能,发现BERT准确率最高,显著优于传统机器学习模型,展示了Transformer在公共安全应用中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 70%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12298 2026-03-16 cs.LG cs.AI 62%

Global Evolutionary Steering: Refining Activation Steering Control via Cross-Layer Consistency

全局进化引导:通过跨层一致性精炼激活引导控制

Xinyan Jiang, Wenjing Yu, Di Wang, Lijie Hu

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GER-steer框架,通过利用网络表示演化的几何稳定性,精炼激活引导向量,有效分离稳健语义意图与正交噪声,提升模型对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 62%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13045 2026-03-16 cs.CL 57%

Mending the Holes: Mitigating Reward Hacking in Reinforcement Learning for Multilingual Translation

修补漏洞:在多语言翻译中缓解奖励黑客

Yifeng Liu, Siqi Ouyang, Yatish Hosmane Revanasiddappa, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出WALAR方法,通过单语文本提升低资源语言翻译能力,同时保持高资源语言性能。通过词对齐和语言对齐技术缓解现有质量评估模型的漏洞,实验显示在Flores-101数据集上优于LLaMAX。

Comments Our code is available at https://github.com/LeiLiLab/WALAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13043 2026-03-16 cs.CY 57%

Before and After ChatGPT: Revisiting AI-Based Dialogue Systems for Emotional Support

在ChatGPT之前和之后:重新审视基于AI的对话系统在情感支持中的应用

Daeun Lee, Dongje Yoo, Migyeong Yang, Jihyun An, Christine B. Cha, Jinyoung Han

专题命中 其他安全 :safety(abstract);分类 cs.CY

AI总结 本文回顾了基于AI的对话系统在心理健康领域的技术演变,分析了从任务特定深度学习模型到大语言模型(LLM)的转变,指出LLM提升了语言灵活性和泛化能力,但也引发了可靠性和安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13038 2026-03-16 cs.CL 57%

Interpretable Semantic Gradients in SSD: A PCA Sweep Approach and a Case Study on AI Discourse

可解释的语义梯度在SSD中的应用:PCA扫描方法及AI话语案例研究

Hubert Plisiecki, Maria Leniarska, Jan Piotrowski, Marcin Zajenkowski

机构 * IDEAS Research Institute(IDEAS研究院) VIZJA University(VIZJA大学) Warsaw University of Technology(华沙技术大学) University of Warsaw(华沙大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出PCA扫描方法以选择保留的成分数量,通过案例研究展示如何在SSD中实现稳定的可解释语义梯度,同时保持解释性目标。

Comments Submitted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12773 2026-03-16 cs.CV cs.AI eess.IV 57%

Empowering Semantic-Sensitive Underwater Image Enhancement with VLM

通过VLM赋能语义敏感的水下图像增强

Guodong Fan, Shengning Zhou, Genji Yuan, Huiyu Li, Jingchun Zhou, Jinjiang Li

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文提出利用视觉语言模型增强水下图像增强的语义敏感能力,通过生成文本描述并生成空间语义指导图,提升图像重建的语义聚焦度,实验验证其在感知质量和检测分割任务中的有效性。

Comments Accepted as an Oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12716 2026-03-16 cs.CV cs.LG eess.IV 57%

UNIStainNet: Foundation-Model-Guided Virtual Staining of H&E to IHC

UNIStainNet:基于基础模型的虚拟染色:H&E到IHC

Jillur Rahman Saurav, Thuong Le Hoai Pham, Pritam Mukherjee, Paul Yi, Brent A. Orr, Jacob M. Luber

机构 * University of Texas at Arlington(德克萨斯理工大学) St. Jude Children’s Research Hospital(圣 Jude 儿童研究医院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 UNIStainNet通过结合基础模型生成的密集空间标记,提升H&E到IHC的虚拟染色效果,实现多标记同时处理,并在MIST和BCI数据集上取得最佳分布度指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12414 2026-03-16 cs.LG cs.CR 57%

SpectralGuard: Detecting Memory Collapse Attacks in State Space Models

SpectralGuard: 在状态空间模型中检测内存崩溃攻击

Davi Bonetto

机构 * Independent Researcher(独立研究者)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 研究针对状态空间模型中的内存崩溃攻击问题,提出SpectralGuard方法,通过监测谱稳定性提升模型安全性,实现高检测率和低延迟。

Comments 24 pages, 10 figures. Code, dataset, and demo: https://github.com/DaviBonetto/spectralguard

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12397 2026-03-16 cs.CL 57%

Not Just the Destination, But the Journey: Reasoning Traces Causally Shape Generalization Behaviors

不只是终点,而是旅程:推理痕迹因果地塑造泛化行为

Pengcheng Wen, Yanxu Zhu, Jiapeng Sun, Han Zhu, Yujin Zhou, Chi-Min Chan, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Beijing Jiaotong University(北京交通大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究探讨推理痕迹对模型泛化行为的因果影响,通过设计控制实验发现不同推理类型导致不同行为模式,证明推理本身具有独立信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05344 2026-03-16 cs.AI 57%

Building Effective AI Coding Agents for the Terminal: Scaffolding, Harness, Context Engineering, and Lessons Learned

构建高效的AI编码代理:支架、驾驭、上下文工程及经验教训

Nghi D. Q. Bui

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出OPENDEV,一种基于命令行的开源编码代理,通过安全控制、高效上下文管理及自适应压缩技术,实现终端优先的自主软件工程支持。

Comments Work in progress, new versions will be updated continuously

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22954 2026-03-16 cs.AI 57%

Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents

达尔文戈德尔机器:自我改进代理的开放性进化

Jenny Zhang, Shengran Hu, Cong Lu, Robert Lange, Jeff Clune

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出达尔文戈德尔机器,通过迭代修改自身代码并验证改进,实现自我提升,提升代码能力并在多个基准测试中取得显著成绩。

Comments Code at https://github.com/jennyzzt/dgm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12829 2026-03-16 cs.CV 50%

coDrawAgents: A Multi-Agent Dialogue Framework for Compositional Image Generation

coDrawAgents:一种用于组合图像生成的多智能体对话框架

Chunhan Li, Qifeng Wu, Jia-Hui Pan, Ka-Hei Hui, Jingyu Hu, Yuming Jiang, Bin Sheng, Xihui Liu, Wenjuan Gong, Zhengzhe Liu

机构 * Lingnan University(岭南大学) CMU(卡内基梅隆大学) CUHK(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) SJTU(上海交通大学) HKU(香港大学) China University of Petroleum(中国石油大学)

专题命中 其他安全 :alignment(abstract)

AI总结 coDrawAgents通过四类智能体协作提升复杂场景中多对象生成的准确性与属性保持,实验表明其在文本-图像对齐、空间准确性和属性绑定方面表现更优。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12708 2026-03-16 cs.CV 50%

FSDAM: Few-Shot Driving Attention Modeling via Vision-Language Coupling

FSDAM:通过视觉-语言耦合实现少样本驾驶注意力建模

Kaiser Hamid, Can Cui, Khandakar Ashrafi Akbar, Ziran Wang, Nade Liang

机构 * Texas Tech University(德克萨斯理工大学) Purdue University(普渡大学) Towson University(托逊大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出FSDAM框架,通过90个标注示例实现驾驶注意力预测与结构化解释生成,利用视觉-语言耦合减少标注需求,提升自动驾驶中的人机协作可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏