arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-05-05 至 2026-05-05 共收录 22 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 22 篇

2506.24056 2026-05-05 cs.CR cs.CL cs.LG 88%

Logit-Gap Steering: A Forward-Pass Diagnostic for Alignment Robustness

Logit-Gap Steering:一种对齐鲁棒性的前向传递诊断

Tung-Ling Li, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络)

专题命中 安全评测 :alignment(title,abstract);RLHF(abstract,abstract_cn);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出logit-gap steering方法,通过前向传递发现短的分布内后缀以关闭对齐间隙,验证了当前对齐边距的薄且可测量,强调防御策略需考虑分布内后缀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01266 2026-05-05 cs.CV 78%

Exploring Prompt Alignment with Clinical Factors in Zero-Shot Segmentation VLMs for NSCLC Tumor Segmentation

探索临床因素在零样本分割VLMs中的提示对齐用于NSCLC肿瘤分割

Suraj Pai, Thibault Heintz, Cosmin Ciausu, Marion Tonneau, Hugo Aerts, Raymond Mak

机构 * Artificial Intelligence in Medicine Program, Mass General Brigham, Harvard Medical School, USA(麻省总医院布里奇沃特医学中心人工智能医学项目,哈佛医学院,美国)

专题命中 安全评测 :alignment(title,abstract)

AI总结 研究通过分析VoxTell在NSCLC肿瘤数据集上的提示对齐方向,发现解剖位置主导空间注意力,零样本分割VLMs在NSCLC肿瘤分割中表现优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01567 2026-05-05 cs.SE cs.CL cs.LG 76%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 安全评测 :safety(title);分类 cs.CL、cs.LG

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20055 2026-05-05 cs.CL cs.AI 73%

VERGE: Formal Refinement and Guidance Engine for Verifiable LLM Reasoning

VERGE:可验证LLM推理的正式细化和指导引擎

Vikash Singh, Darion Cassel, Nathaniel Weir, Nick Feng, Sam Bayless

机构 * Case Western Reserve University(凯斯西储大学) Amazon Web Services(亚马逊网络服务)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 VERGE结合LLM与SMT求解器,通过迭代细化生成验证引导答案。其通过分解LLM输出为原子声明,自动形式化为一阶逻辑,并利用自动定理证明验证逻辑一致性。引入多模型共识、语义路由和精确逻辑错误定位等创新,提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01647 2026-05-05 cs.CL 70%

Beyond Perplexity: Character Distribution Signatures and the MDTA Benchmark for AI Text Detection

超越困惑度:字符分布签名与AI文本检测的MDTA基准

Priyadarshan Narayanasamy, Swastik Agrawal, Klint Faber, Fardina Fathmiul Alam

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 安全评测 :RLHF(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出基于字符分布签名的AI文本检测方法,通过MDTA基准验证其有效性,显示与困惑度方法低相关性,并在特定领域取得显著提升。

Comments 11 figures, 10 tables, 24 pages, Under Review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01100 2026-05-05 cs.AI 70%

A Knowledge-Driven LLM-Based Decision-Support System for Explainable Defect Analysis and Mitigation Guidance in Laser Powder Bed Fusion

基于知识的LLM决策支持系统:用于激光粉末床融合的可解释缺陷分析与缓解指导

Basit Mahmud Shahriar, Md Habibor Rahman

机构 * Department of Mechanical Engineering, University of Massachusetts Dartmouth(达特茅斯大学机械工程系)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一种整合结构化缺陷知识与LLM推理的知识驱动决策支持系统,用于制造业中激光粉末床融合的可解释缺陷诊断与缓解指导。系统基于包含27种已知缺陷类型的知识库,支持模糊自然语言查询、文献支持的缺陷解释及基于编码工艺知识的缺陷原因和缓解策略指导。

Comments 28 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00877 2026-05-05 cs.MM cs.AI cs.CL cs.CV cs.LG 67%

OceanPile: A Large-Scale Multimodal Ocean Corpus for Foundation Models

OceanPile:一个大规模多模态海洋语料库用于基础模型

Yida Xue, Ningyu Zhang, Tingwei Wu, Zhe Ma, Daxiong Ji, Zhao Wang, Guozhou Zheng, Huajun Chen

机构 * College of Computer Science and Technology, Zhejiang University, Hangzhou 310027, China(浙江大学计算机科学与技术学院) ZJU-Hangzhou Global Scientific and Technological Innovation Center, Hangzhou 311200, China(浙江大学杭州全球科技创新中心) School of Software Technology, Zhejiang University, Ningbo 315048, China(浙江大学软件学院) Ocean College, Zhejiang University, Zhoushan 316021, China(浙江大学海洋学院) State Key Laboratory of Ocean Sensing, Hangzhou 311200, China(杭州海洋传感国家重点实验室) Ocean Research Center of Zhoushan, Zhejiang University, Zhoushan 316021, China(舟山海洋研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出OceanPile,一个用于海洋基础模型的多模态语料库,整合了声呐数据、水下图像、海洋科学图像和科学文本,通过高质量指令数据集和评估基准提升海洋领域模型性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20605 2026-05-05 cs.CL cs.AI cs.DL cs.LG 67%

TF1-EN-3M: Three Million Synthetic Moral Fables for Training Small, Open Language Models

TF1-EN-3M:三百万合成道德寓言用于训练小型开放语言模型

Mihai Nadas, Laura Diosan, Andrei Piscoran, Andreea Tomescu

机构 * Babeș-Bolyai University(巴纳德-波耶亚大学) KlusAI Labs(KlusAI实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TF1-EN-3M数据集,包含三百万英文寓言,用于训练小型开放语言模型,展示通过指令微调模型生成高质量寓言的方法,验证了无需大模型即可实现大规模道德叙事的可能性。

Comments 18 pages, 6 tables, 1 figure. v2: revised evaluation with open-weight LLM judge panel, expanded citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01555 2026-05-05 cs.CL cs.AI cs.HC 62%

Automated Interpretability and Feature Discovery in Language Models with Agents

在语言模型中通过代理实现自动化可解释性和特征发现

Arnau Marin-Llobet, Javier Ferrando

机构 * Harvard University(哈佛大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一个自主多代理框架,用于自动化大型语言模型的内部特征发现与解释,通过两个耦合循环提升解释精度和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01091 2026-05-05 cs.CY cs.AI cs.MA 62%

Governing What the EU AI Act Excludes: Accountability for Autonomous AI Agents in Smart City Critical Infrastructure

欧盟人工智能法案所排除的治理:自主AI代理在智能城市关键基础设施中的问责制

Talal Ashraf Butt, Muhammad Iqbal, Razi Iqbal

机构 * Higher Colleges of Technology(高等技术学院) Central Michigan University(中央密歇根大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文探讨了欧盟人工智能法案在智能城市关键基础设施中自主AI代理问责制的不足,提出AgentGov-SC治理架构以弥补监管空白。

Comments 24 pages, 3 figures, 8 tables. Submitted to Computer Law & Security Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00907 2026-05-05 cs.CV cs.AI cs.LG 62%

TRIP-Evaluate: An Open Multimodal Benchmark for Evaluating Large Models in Transportation

TRIP-Evaluate: 一个用于评估交通领域大模型的开放多模态基准

Han Gong, Zhen Zhou, Yunyang Shi, Yan Tan, Jinbiao Huo, Qi Hong, Zhiyuan Liu

机构 * School of Transportation(交通学院) Southeast University(东南大学) School of Artificial Intelligence and Computer Science(人工智能与计算机科学学院) Jiangnan University(江南大学) Department of Civil and Environmental Engineering(土木与环境工程系) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 TRIP-Evaluate是首个开放多模态交通评估基准,通过837项任务覆盖车辆、交通管理、旅行者和规划设计功能,提供能力、模态和难度标签,支持跨模态诊断,揭示大模型在多步工程计算、规则约束推理和多模态场景理解方面的不足。

Comments 19 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00839 2026-05-05 cs.AI cs.LG 62%

2026 Roadmap on Artificial Intelligence and Machine Learning for Smart Manufacturing

2026 年人工智能与机器学习在智能制造中的路线图

Jay Lee, Hanqi Su, Marco Macchi, Adalberto Polenghi, Wei Wu, Zhiheng Zhao, George Q. Huang, Kiva Allgood, Devendra Jain, Benedikt Gieger, Vibhor Pandhare, Soumyabrata Bhattacharjee, Ram Mohril, Lingbao Kong, Qiyuan Wang, Xinlan Tang, Sungjong Kim, Chan Hee Park, Byeng D. Youn, Guo Dong Goh, Xi Huang, Wai Yee Yeong, Yung C Shin, He Zhang, Zitong Wang, Fei Tao, Jagjit Singh Srai, Satyandra K. Gupta, Byung Gun Joung, Albin John, John W. Sutherland, Sang Won Lee, Olga Fink, Vinay Sharma, Faez Ahmed, Wei Chen, Mark Fuge, Arild Waaler, Martin G. Skjæveland, Dimitris Kyritsis, Wei Chen, VispiNevile Karkaria, Yi-Ping Chen, Ying-Kuan Tsai, Joseph Cohen, Xun Huan, Jing Lin, Liangwei Zhang, Gregory W. Vogl, Aaron W. Cornelius, Xiaodong Jia, Dai-Yan Ji, Takanobu Minami, Ruoxin Wang

机构 * Center for Industrial Artificial Intelligence, Department of Mechanical Engineering, University of Maryland, College Park(工业人工智能中心,机械工程系,马里兰大学College Park分校) Department of Management, Economics and Industrial Engineering, Politecnico di Milano(管理、经济与工业工程系,米兰理工学院) Department of Industrial and Systems Engineering, The Hong Kong Polytechnic University(工业与系统工程系,香港理工大学) Centre for Advanced Manufacturing & Supply Chains, World Economic Forum(先进制造与供应链研究中心,世界经济论坛) Department of Mechanical Engineering, Indian Institute of Technology Indore(机械工程系,印度理工学院Indore分校) Future Information Innovative College, Fudan University(未来信息创新学院,复旦大学) Department of Mechanical Engineering, Seoul National University(机械工程系,首尔国立大学) Department of Mechanical and Information Engineering, University of Seoul(机械与信息工程系,首尔大学) Onepredict Corp.(Onepredict公司) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学) Singapore Centre for 3D Printing, Nanyang Technological University(新加坡3D打印中心,南洋理工大学) Mechanical Engineering, Purdue University(机械工程系,普渡大学) Digital Twin International Research Center, International Institute for Interdisciplinary and Frontiers, Beihang University(数字孪生国际研究中心, interdisciplinary and Frontiers 国际研究院,北京航空航天大学) School of Automation Science and Electrical Engineering, Beihang University(自动化科学与电气工程学院,北京航空航天大学) Department of Engineering, University of Cambridge(工程系,剑桥大学) Center for Advanced Manufacturing, University of Southern California(先进制造中心,南加州大学) School of Sustainability Engineering and Environmental Engineering, Purdue University(可持续工程与环境工程系,普渡大学) School of Mechanical Engineering, Sungkyunkwan University(机械工程系,全南大学) Intelligent Maintenance and Operations Systems, EPFL(智能维护与运营系统,苏黎世联邦理工学院) Department of Mechanical Engineering, Massachusetts Institute of Technology(机械工程系,麻省理工学院) J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66 机械工程系,德克萨斯A&M大学) Department of Mechanical and Process Engineering, ETH Zürich(机械与工艺工程系,苏黎世联邦理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨人工智能与机器学习在智能制造中的发展现状与未来方向,涵盖基础理论、应用领域及新兴技术,旨在推动创新与产业应用。

Comments This paper has been accepted for publication in the Journal Machine Learning: Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05534 2026-05-05 cs.LG cs.AI 62%

A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima

稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值

Yiming Tang, Harshvardhan Saini, Zhaoqian Yao, Zheng Lin, Yizhen Liao, Jingyi Cui, Yisen Wang, Mengnan Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Indian Institute of Technology, Dhanbad(印度德里理工学院) Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01611 2026-05-05 cs.CY cs.AI cs.LG 60%

The Case for ESM3 as a General-Purpose AI Model with Systemic Risk Under the EU AI Act

ESM3作为具有系统性风险的通用人工智能模型在欧盟人工智能法案中的案例

Taro Qureshi, Jacob Griffith, Koen Holtman, Marcel Mir Teijeiro, Ze Shen Chin, Rokas Gipiškis

机构 * AI Standards Lab(人工智能标准实验室) Vilnius University(维尔纽斯大学) Northeastern University London(伦敦东北大学) London School of Economics(伦敦政治经济学院)

专题命中 安全评测 :分类 cs.AI、cs.CY、cs.LG;safety(comments);AI safety(comments)

AI总结 本文探讨ESM3等前沿生物基础模型在欧盟人工智能法案下的监管问题,分析其是否受通用人工智能模型系统性风险义务约束,并提出改进建议。

Comments 8 pages, 1 figure, Technical AI Safety Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01546 2026-05-05 cs.NI cs.AI 57%

6G Needs Agents: Toward Agentic AI-Native Networks for Autonomous Intelligence

6G需要智能体:迈向面向自主智能的智能体AI原生网络

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿联酋大学) Research Institute for Digital Future, Khalifa University, UAE(数字未来研究院,哈利法大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的智能体架构,用于构建AI原生6G网络,通过分层推理和分布式多智能体系统平衡性能与效率,揭示了模型异构部署和量化影响的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01483 2026-05-05 cs.CV cs.AI 57%

Research on Vision-Language Question Answering Models for Industrial Robots

工业机器人中视觉-语言问答模型的研究

Ping Li, Bartlomiej Brzozka

机构 * Shandong Management University(山东管理大学) Maria Curie-Sklodowska University(玛丽·居里-斯洛多夫斯卡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出一种层次交叉模态融合模型,解决工业机器人中语义模糊、复杂环境布局和领域术语的问题,通过多级特征融合提升问答可靠性。

Comments 8 Pages, 5 figures

Journal ref Brzozka,B.Machine Learning Algorithms in Predicting College Students' Grades:A Review.Journal of Applied Automation Technologies,2025,3,1-12

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01302 2026-05-05 cs.CL cs.IR 57%

Beyond Semantic Relevance: Counterfactual Risk Minimization for Robust Retrieval-Augmented Generation

超越语义相关性:为鲁棒检索增强生成的反事实风险最小化

Peiyang Liu, Qiang Yan, Ziqiang Cui, Di Liang, Xi Wang, Wei Ye

机构 * National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学) City University of Hong Kong(香港城市大学) Tencent Technology(腾讯科技) Peking University(北京大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文提出CoRM-RAG框架,通过因果干预模拟用户偏差来提升检索鲁棒性,在对抗性场景中优于传统检索器和重排序器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00957 2026-05-05 cs.IR cs.AI 57%

"I Don't Know" -- Towards Appropriate Trust with Certainty-Aware Retrieval Augmented Generation

我不知道--迈向具有确定性意识的适当信任

Daan Di Scala, Maaike de Boer, Pınar Yolum

机构 * TNO Netherlands Organisation for Applied Scientific Research, Department Data Science(荷兰应用科学研究院,数据科学部门) Utrecht University, Department of Information and Computing Sciences(乌得勒支大学,信息与计算科学系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出CERTA系统,通过结合问题、上下文和答案的相关性来反映不确定性,以建立适当的信任。研究创建了Certainty Benchmark,并通过实验验证了CERTA在减少过度同意和提供谨慎行为方面的有效性。

Comments To be published in VALE 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27033 2026-05-05 cs.LG eess.SP 57%

Cross-Subject Generalization for EEG Decoding: A Survey of Deep Learning Methods

跨受体解码的通用性:深度学习方法的综述

Taida Li, Yujun Yan, Fei Dou, Wenzhan Song, Xiang Zhang

机构 * Department of Computer Science, University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校计算机科学系) Department of Computer Science, Dartmouth College(达特茅斯学院计算机科学系) School of Computing, University of Georgia(佐治亚大学计算科学学院) School of Electrical and Computer Engineering, University of Georgia(佐治亚大学电气与计算机工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文综述了深度学习方法在跨受体解码中的应用,分析了多源领域问题的评估协议,并系统分类了特征对齐、对抗学习等方法,探讨了理论限制和EEG基础模型的发展。

Comments Accepted manuscript in Progress in Biomedical Engineering. Minor update: corrected author affiliation in comment

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24814 2026-05-05 cs.CV cs.AI 57%

Deep Feature Optimization for Enhanced Fish Freshness Assessment

深度特征优化用于增强鱼类新鲜度评估

Phi-Hung Hoang, Nam-Thuan Trinh, Van-Manh Tran, Thi-Thu-Hong Phan

机构 * Department of Artificial Intelligence, FPT University(人工智能系,FPT大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种三阶段框架,通过优化深度特征提升鱼类新鲜度评估的准确性与可靠性,实验表明其在鱼类眼睛新鲜度数据集上达到85.99%的准确率。

Comments 39 pages; 10 tables; 9 figures

Journal ref Ecological Informatics, 95, 103711, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.05284 2026-05-05 cs.LG 57%

Analyzing Adversarial Inputs in Deep Reinforcement Learning

分析深度强化学习中的对抗输入

Davide Corsi, Guy Amir, Guy Katz, Alessandro Farinelli

机构 * University of California, Irvine, USA(加州大学尔布雷特分校) Cornell University, USA(康奈尔大学) The Hebrew University of Jerusalem, Israel(特拉维夫大学) University of Verona, Italy(威尼斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文通过形式验证方法分析深度强化学习中对抗输入的特性,提出Adversarial Rate指标,用于评估对抗输入对DRL策略的影响,并提供工具和算法以缓解训练DRL网络的脆弱性。

Comments Accepted to AISoLA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00927 2026-05-05 q-bio.OT 50%

BioVeil MATRIX: Uncovering and categorizing vulnerabilities of agentic biological AI scientists

BioVeil MATRIX: 洞察和分类代理生物AI科学家中的漏洞

Kimon Antonios Provatas, Avery Self, Ioannis Mouratidis, Ilias Georgakopoulos-Soares

专题命中 安全评测 :safety(abstract)

AI总结 研究探讨了代理生物AI科学家在多学科科学流程中的应用,指出现有安全评估无法覆盖双用途应用风险,提出BioVeil MATRIX作为防御分类体系,用于系统化分类生物安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏