arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 930 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 930 篇

2608.08785 2026-08-11 eess.SY cs.SY 新提交 50%

Robust Fault Detection and Classification in Power Systems via Physics-Informed and Data-Driven Learning

基于物理信息与数据驱动学习的电力系统鲁棒故障检测与分类

Biswash Basnet, Varsha Sen

专题命中 安全评测 :safety(abstract)

AI总结 本文提出结合物理信息与数据驱动学习的智能框架,基于SMOTE平衡数据集训练PINN等模型,实现电力系统故障的鲁棒检测与分类,在噪声及训练数据占比波动下仍保持高准确率,可用于电网实时保护与广域监测控制。

Comments 19 pages, published journal article

Journal ref Journal of Electrical Engineering and Automation 7(3), 241-259 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 50%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08280 2026-08-11 quant-ph 新提交 50%

Machine Learning for Specialized QKD Aspects: A Survey of Adaptive Protocols, Free-Space Links, 6G Integration, and Steerability-Aware Security

面向量子密钥分发(QKD)特定场景的机器学习:自适应协议、自由空间链路、6G集成及可操纵性感知安全综述

Hasan Abbas Al-Mohammed, Afnan S. Al-Ali

专题命中 安全评测 :trustworthy(abstract)

AI总结 该综述聚焦自适应、非地面及应用集成QKD系统,梳理了ML、RL及QML在QKD多类特定场景的应用,分析了各主题的问题、方案与增益,并指出了相关开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06705 2026-08-10 cs.SE 新提交 50%

Translation Tag Team: Formal Rules and LLMs Translate More Macros Together than Apart

翻译搭档团队:形式化规则与大语言模型协同翻译宏比单独翻译更有效

Brent Pappas, Joseph Zalusky, Zachary Burkett, Paul Gazzillo

专题命中 安全评测 :safety(abstract)

AI总结 该研究提出形式化翻译器MerC,结合MerC与大语言模型(LLMs)的搭档方法,在宏翻译任务中比单独使用任一技术更优,可降低失败率并提升翻译覆盖率。

Comments 13 pages, 7 figures, 2 tables, 8 listings, conference. To be published in ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06662 2026-08-10 cond-mat.mtrl-sci cond-mat.mes-hall physics.comp-ph 新提交 50%

Cross-Geometry Transferability Assessment of Universal Machine Learning Interatomic Potentials: From Bulk Materials to Atomic Nanowires

通用机器学习原子间势的跨几何可迁移性评估:从块体材料到原子纳米线

Pedro H. M. Zanineli, Bruno Focassio, Gabriel R. Schleder

专题命中 安全评测 :alignment(abstract)

AI总结 该研究评估通用机器学习原子间势的跨几何可迁移性,构建ZrO₂多构型数据集,测试26个预训练模型,发现零样本预测存在几何依赖型误差,对比不同训练策略,指出适配低配位离子纳米结构需多样目标数据与物理验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06287 2026-08-07 cs.SE 新提交 50%

Automatic Translation of Unstructured Requirements into Linear Temporal Logic through Large Language Models

基于大语言模型将非结构化需求自动翻译为线性时序逻辑

Alexandra Newcomb, Omar Ochoa

专题命中 安全评测 :safety(abstract)

AI总结 本文评估6种大语言模型,通过少样本提示策略在含15个需求的基准上生成线性时序逻辑公式,验证通用LLMs无需微调即可完成非结构化自然语言转LTL任务,可作为半自动化形式化工作流的前端助手。

Comments Copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05956 2026-08-07 cs.MA cs.SY eess.SY 新提交 50%

Certifying Collective Reasoning in Multi-Agent Systems via Koopman Spectral Analysis

基于Koopman谱分析的多智能体系统集体推理验证

Nuzhat Khan, Indrakshi Dey

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出基于Koopman算子理论的框架,通过分析多智能体集体的Koopman转移算子谱,实现对其推理收敛时间、派系及决策的可验证,在注意力共识模型上验证了方法的有效性,且运行高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05855 2026-08-07 cs.DC 新提交 50%

RepoOMP: Repository-Aware Hotspot OpenMP Parallelization via Dependency-Aware Context Reduction

RepoOMP:基于仓库感知的热点OpenMP并行化方法——通过依赖感知的上下文缩减

Yongjie Qian, Ke Gao, Zhibin Zhang, Shaohui Peng, Ling Li

专题命中 安全评测 :safety(abstract)

AI总结 RepoOMP是一种混合框架,通过构建MAP和STC,在951个热点上实现平均加速比8.23×至8.96×,降低智能体令牌成本,为仓库热点并行化提供证据引导的工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05614 2026-08-07 cs.HC 新提交 50%

Toward Resilient Human-AI Collaboration: A Lifecycle Taxonomy of Sociotechnical Risks and Cascading Failures

面向弹性人机协作:社会技术风险与级联故障的生命周期分类

Md Foysal Ahmed, Isaac Kobby Anni, Md Main Uddin Rony

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出人机协作风险的生命周期分类框架,识别六大跨领域风险集群,构建交互模型揭示风险级联机制,为设计更具弹性的人机协作系统提供基础。

Comments 11 pages, 2 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05485 2026-08-07 cs.CV 新提交 50%

VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing

VideoArgus:基于智能体评分规则的视频生成与编辑统一评估框架

Ziyun Zeng, Zixuan Wang, Yongsheng Yu, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对现有视频评估基准的局限,本文提出VideoArgus框架,构建含1026个实例的VideoArgus-Bench,其在与人类判断的相关性上优于基准特定评估器,且模型排名稳定。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 50%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 安全评测 :safety(abstract)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05184 2026-08-07 cs.IT cs.MM eess.IV math.IT 新提交 50%

Media Meets Communication in 6G: Fundamentals, Key Technologies, and Applications

6G中的媒体与通信:基础、关键技术及应用

Bingyan Xie, Longyu Zhou, Zihan Chen, Shunpu Tang, Mingyang Shi, Yu Tian, Guo Lu, Yongpeng Wu, Tianhao Liang, Tony Q. S. Quek, Guangtao Zhai, Wenjun Zhang

专题命中 安全评测 :trustworthy(abstract)

AI总结 该文针对6G视觉通信的媒体通信技术开展系统性综述,提出含四大维度的统一框架,涵盖AI驱动媒体技术与感知媒体的无线传输等内容,为6G媒体通信研究提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04006 2026-08-05 cs.HC 新提交 50%

Calibrating Trustworthiness: Co-Designing Metrics and Visualizations for Evaluating LLMs in Education

校准可信度:为教育领域评估大型语言模型(LLM)协同设计指标与可视化方案

Adam Coscia, Sujata Duwal, Langdon Holmes, Scott Crossley, Alex Endert

专题命中 安全评测 :alignment(abstract)

AI总结 本研究针对教育领域LLM响应的教学适配性评估缺口,通过与学习工程师协同设计可信度指标与可视化工具,提升了评估信度,为相关工具提出设计准则。

Comments Under review. 48 pages, 22 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03392 2026-08-05 cs.SE 新提交 50%

Self-Evolving Coding Agents

自进化编码智能体

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本综述系统梳理自进化编码智能体领域,明确其与传统智能体的区别,提出分类法,分析该领域的挑战,为设计更优智能系统奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03337 2026-08-05 cs.SE 新提交 50%

Assessing Behavioral Validation in UI Component Test Suites Using Inferred Metamorphic Relations

利用推断的变形关系评估UI组件测试套件中的行为验证

Yu Pei, Cunming Zhang, Jeongju Sohn, Mike Papadakis

专题命中 安全评测 :alignment(abstract)

AI总结 该研究提出基于推断变形关系(MR)的框架,可补充执行类指标,用于评估UI组件测试套件的行为验证,发现现有测试存在行为缺口,且MR覆盖率具备实际应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 50%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00647 2026-08-04 q-fin.TR q-fin.CP q-fin.RM 新提交 50%

Axient: On-Chain Credit and Loss Allocation for Leveraged Event Markets: A Venue-Agnostic Protocol for Traders, Credit Providers, Market Makers, and Liquidation Backstops

Axient:杠杆事件市场的链上信用与损失分配——面向交易者、信用提供者、做市商及清算后援的场所无关协议

Maksym Nechepurenko

专题命中 安全评测 :safety(abstract)

AI总结 Axient是面向多角色的场所无关链上信用协议,通过形式化架构与内生模型实现损失分配等机制,实验验证其分层保护等特性,为杠杆事件市场提供解决方案。

Comments 90 pages, 17 figures. Formal protocol design and fixed-seed synthetic agent-based validation; no live Axient or venue data

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00279 2026-08-04 eess.IV cs.CV 新提交 50%

Learning to See Locally and Align Clinically with Pathology Semantics for Radiology Report Generation

学习局部感知并与病理学语义临床对齐的放射学报告生成方法

Xuan Cuong Ngo

专题命中 安全评测 :alignment(abstract)

AI总结 针对放射学视觉-语言模型的图像-文本对齐缺陷,提出病理学感知对齐框架PALM,结合共享病理学原型与掩码证据建模,在多数据集上提升报告生成与异常鲁棒性

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02320 2026-08-04 cs.RO cs.CV 新提交 50%

TravKAN: Fast and Interpretable Nonlinear Traversability Analysis with Kolmogorov-Arnold Networks

TravKAN:基于Kolmogorov-Arnold网络的快速可解释非线性可通行性分析

Daniel Fusaro, Simone Mosco, Wanmeng Li, Alberto Pretto

专题命中 安全评测 :safety(abstract)

AI总结 本文提出基于Kolmogorov-Arnold网络的TravKAN框架,结合LiDAR反射率手工特征,在公开数据集上性能优于传统深度模型,兼具可解释性与高效性,适用于安全关键的机器人可通行性分析。

Comments This paper has been accepted for publication at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01938 2026-08-04 cs.CR 新提交 50%

D-MUTRA: DLT-based MUTual Remote Attestation for Multi-Agent Systems

D-MUTRA:面向多智能体系统的基于分布式账本(DLT)的相互远程证明

Adam Zahir, Vincent Lefebvre, Mark Angoustures, Milan Groshev, Carlos J. Bernardos

专题命中 安全评测 :trustworthy(abstract)

AI总结 针对多智能体系统传统远程证明的局限,本文提出基于区块链的D-MUTRA框架,实现智能体间的持续相互证明,可检测恶意软件修改,且扩展时开销可忽略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01759 2026-08-04 cs.CR 新提交 50%

Benign Alone, Harmful Together: Exploiting Experience Composition in Self-Evolving LLM Agents

单独无害,联合有害:在自进化大语言模型智能体中利用经验组合

Bingyu Yan, Xiaoming Zhang, Chaozhuo Li, Ziyi Zhou, Yirui Qi, Litian Zhang

专题命中 安全评测 :safety(abstract)

AI总结 本研究提出EvoBreak攻击,利用自进化LLM智能体的良性经验组合,结合BreakGym生成训练目标,在保持高无害性的同时优于现有攻击,揭示了新的安全风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01592 2026-08-04 cs.SE 新提交 50%

How Well Do LLMs Generate Taxonomies in the SE Domain? A Multi-perspective Evaluation Framework

大型语言模型在软件工程领域生成分类体系的表现如何?一个多视角评估框架

Sota Nakashima, Yuta Ishimoto, Masanari Kondo, Tao Xiao, Yasutaka Kamei

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出首个SE领域自动化分类体系生成的多视角评估框架,对比TnT-LLM与CLIMB两种方法及5种LLM,揭示二者在质量、效率上的权衡,为SE领域应用该技术提供了可操作见解。

Comments 13 pages, Accepted at the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE 2026), Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01451 2026-08-04 cs.SE 新提交 50%

Doc2CI: A Multi-Service Study of CI Configuration Generation Using Large Language Models

Doc2CI:基于大语言模型的CI配置生成多服务研究

Taher A. Ghaleb

专题命中 安全评测 :alignment(abstract)

AI总结 本文通过构建DOC2CI基准评估LLM生成CI配置的能力,发现其结构有效性不足,提出无需训练的模式引导修复方法提升有效性,为相关工具开发提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00692 2026-08-04 cs.SE 新提交 50%

Vul4Py: Benchmarking Automated Vulnerability Repair in Python with Paired Exploit and Functional Oracles

Vul4Py:利用配对漏洞利用与功能预言机对Python自动化漏洞修复进行基准测试

Tan Bui, Ting Zhang, Ferdian Thung, Yunpeng Xiong, Penghao Jiang, Xin Zhou, David Lo

专题命中 安全评测 :trustworthy(abstract)

AI总结 本研究提出Vul4Py基准测试,含100个Python真实漏洞及配对预言机,对比三类AVR方法,发现智能体OpenHands修复漏洞数远超同类方法,配对预言机保障结果可信。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00624 2026-08-04 cs.SE 新提交 50%

Can Perplexity Serve as a Cognitive Signal for Code Understandability?

困惑度能否作为代码可理解性的认知信号?

Xiaokai Rong, Mohammadali Sefidi Esfahani, Aashish Yadavally, Rigby Peter, Tien N. Nguyen

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过实证发现,词元级困惑度的简单片段级聚合与人类代码可理解性相关性不可靠,明确其仅适用于局部代码困惑,需经特定分析才能用于可靠的代码可理解性测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00072 2026-08-04 cs.CV 新提交 50%

Volcanic Clouds Detection through QCNN and Geostationary Satellite Multispectral Imagery

基于QCNN与静止卫星多光谱影像的火山云检测

Federica Torrisi, Claudia Corradino, Alessandro Grilli, Tommaso Catuogno, Mattia Verducci, Elisabetta Paladino, Luigi Giannelli, Alessandro Sebastianelli

机构 * Istituto Nazionale di Geofisica e Vulcanologia (INGV)(国家地球物理与火山学研究所) Thales Alenia Space Italia(泰雷兹阿莱尼亚空间意大利公司) Euro-Mediterranean Center on Climate Change(欧亚地中海气候变化中心) Università di Catania(卡塔尼亚大学) INFN(国家核物理研究所)

专题命中 安全评测 :safety(abstract)

AI总结 本研究探讨混合量子卷积神经网络(QCNN)对含火山云的卫星图像分类的潜力,对比不同量子比特数QCNN与纯经典架构的性能,以解决火山云检测难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27674 2026-07-31 cs.SE 新提交 50%

Can Large Language Models Resolve Real Java Merge Conflicts? An Evaluation with a Calibrated LLM-as-Judge

大语言模型能否解决真实的Java合并冲突?一项使用校准后的LLM作为评判者的评估

Bowen Shen

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对真实Java合并冲突,构建仅用推理信号的LLM求解器,经校准的LLM评判者评估发现,其解决冲突的覆盖和匹配开发者方案的表现优于传统工具AutoMerge,但结构正确性仍需确定性检查保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 50%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 安全评测 :safety(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27182 2026-07-30 cs.HC 新提交 50%

GraphQAG: A Knowledge-Graph-Guided Visual Analytics Framework for Question-Answer Pairs Generation

GraphQAG:一种用于问答对生成的知识图谱引导型可视分析框架

Yize Li, Ruiqi Yu, Tianya Pan, Ningxin Li, Songyue Li, Xiangyang Wu, Jinchang Li, Zhiguang Zhou

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对长文档知识碎片化的问题,提出GraphQAG知识图谱引导型可视分析框架,经评估可帮助用户优化问答对集合,提升问答对的全面性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26451 2026-07-30 cs.SE 新提交 50%

ExplainBench: Evaluating Code Explanations from Agents

ExplainBench:评估智能体生成的代码解释

Zhiyuan Pan, Sungmin Kang, Imam Nur Bani Yusuf, Abhik Roychoudhury

专题命中 安全评测 :trustworthy(abstract)

AI总结 该研究针对智能体代码解释缺乏评估基准的问题,提出ExplainBench基准,实验发现其对智能体的排名与SWE-bench Verified不同,还实现了解释审核智能体,可提升智能体解释的可信度。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏