arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-18 至 2026-08-18 共收录 155 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 53 篇

2510.06039 2026-08-18 cs.CL cs.AI 版本更新 81%

A Large-Scale Chinese Knowledge Graph-Text Alignment Dataset for Benchmarking Knowledge-Grounded LLMs

用于评估知识增强型大语言模型的大规模中文知识图谱-文本对齐数据集

Chengwei Wu, Xingrui Zhuo, Mingyang Gao, Xinghe Cheng, Zhichao Yan, Jiapu Wang

机构 * Nanjing University of Science and Techonolgy(南京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) University of Science and Technology Beijing(北京科技大学) Hefei University of Technology(合肥工业大学) Beijing University of Chemical Technology(北京化工大学) Renmin University of China(中国人民大学) Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) Griffith University, Australia(澳大利亚格里菲斯大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出大规模中文知识图谱-文本对齐数据集CDTP,支持三项中文知识密集型任务的评估,经实验验证其可提升LLM的领域性能与分布外鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28850 2026-08-18 cs.LG q-fin.CP 版本更新 79%

Representation Signatures and Risk-Feedback Alignment in LLM Trading Agents

表示签名与LLM交易智能体中的风险反馈对齐

Weicheng Xue

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 通过TradeArena测试平台研究LLM交易智能体在金融决策中的行为对齐与表示动态,发现故障前表示签名(规划嵌入漂移、流形有效秩收缩)并验证风险反馈作为外部对齐信号的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15163 2026-08-18 cs.CV cs.HC 新提交 78%

From "What-If" to "What-Is": Counterfactual Thinking-Inspired Semantic Alignment for Visual Brain Decoding

从“假设”到“事实”:面向视觉脑解码的反事实思维启发语义对齐

Kaitao Yan, Chi Liu, Congcong Zhu, Huajie Chen, Gengshen Wu, Minghao Wang, Xiaotong Han, Tianqing Zhu

专题命中 安全评测 :alignment(title,abstract)

AI总结 提出ConceptAlign框架,通过反事实语义对齐解决视觉脑解码的语义错误问题,在自然场景数据集上相比MindEye2提升了重构、语义区分等指标。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18245 2026-08-18 cs.SE cs.CR 版本更新 78%

Who Tests the Testers? Systematic Enumeration and Coverage Audit of LLM Agent Tool Call Safety

谁测试测试者?LLM代理工具调用安全的系统枚举与覆盖审计

Xuan Chen, Lu Yan, Ruqi Zhang, Xiangyu Zhang

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出SafeAudit框架,通过系统生成测试用例和规则阻力指标,发现现有测试未覆盖的20%不安全行为,揭示当前安全评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14896 2026-08-18 cs.CL cs.LG 新提交 76%

Interpretable Cross-Lingual Alignment in Small Language Models: Probing Cultural and Pragmatic Reasoning in Japanese-English Bilingual LLMs

小语言模型中的可解释跨语言对齐:探究日英双语大语言模型的文化与语用推理

Florian Braun

机构 * Sakaguchi–Inui Laboratory (Tohoku University)(东北大学坂口–乾实验室) Natural Language Understanding Team at RIKEN AIP(理化学研究所先进智能项目中心自然语言理解团队) Swallow Project at the Institute of Science Tokyo(东京科学大学Swallow项目) Sakana AI Tohoku University(东北大学) RIKEN AIP(理化学研究所先进智能项目中心) Institute of Science Tokyo(东京科学大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.LG

AI总结 本研究构建J-PragEval-v0基准,结合线性探针与教师强制评估探究TinySwallow-1.5B的日英语用表征,提出语用表征引导方法,下一步将扩展至Llama-3.1-Swallow-8B。

Comments 15 pages, no figures. Introduces the J-PragEval-v0 minimal-pair benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14950 2026-08-18 cs.CL 新提交 74%

DA-RAC: Distance-Aware Calibration of LLM Judges for Trustworthy AI Auditing

DA-RAC:面向可信AI审计的大语言模型评判器的距离感知校准

Cheng Wu, Vishal Anand, Jaya Krishna Mandivarapu, Xiya Liu, Rui Zhuang

机构 * Microsoft(微软公司)

专题命中 安全评测 :trustworthy(title);分类 cs.CL

AI总结 针对LLM评判器因无关参考示例导致的校准偏差问题,提出DA-RAC距离感知参考锚定校准方法,在多轮评估基准上提升了校准效果并降低了误通过风险,为可信AI审计提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16539 2026-08-18 cs.SD cs.AI cs.CL eess.AS 新提交 73%

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化

Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Muhammad Awais, Philip J. B. Jackson, Jiankang Deng, Ismail Elezi

机构 * University of Surrey(萨里大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。

Comments 19 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14577 2026-08-18 cs.CL cs.AI 新提交 73%

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile:刻画前沿大语言模型中的有害分布

Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16643 2026-08-18 cs.CL cs.AI cs.LG 新提交 67%

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

面向更好评估大型语言模型(LLMs)在临床错误检测中的性能

Yifan Zhang, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLMs临床错误检测评估的不足,通过多语言多模型实验发现多数LLMs配对判别能力差,提出用配对评估补充聚合指标的改进方案。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026; to appear in Proceedings of Machine Learning Research (PMLR), Vol. 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01584 2026-08-18 cs.LG cs.AI cs.CY 版本更新 67%

VirnyFlow: Optimizing ML Pipelines for Accuracy, Fairness, and Stability at Scale

VirnyFlow:面向大规模场景下兼顾准确率、公平性与稳定性的机器学习流水线优化

Denys Herasymuk, Anastasiia Mozghova, Nazar Protsiv, Vladyslav Sydorak, Julia Stoyanovich

机构 * Ukrainian Catholic University(乌克兰天主教大学) New York University(纽约大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 VirnyFlow是兼顾准确率、公平性与稳定性的大规模ML流水线优化系统,可扩展至多节点,在真实数据集上性能优于主流AutoML系统,支持人类在环迭代调整优化目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-18 cs.CL cs.AI 新提交 62%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16494 2026-08-18 cs.LG cs.AI cs.CE cs.SY eess.SY 新提交 62%

Graph Machine Learning: An Opportunity for Power Systems

图机器学习:电力系统的一个机遇

Martin Sadric, Sebastian Pütz, Christian Nauck, Veit Hagenmeyer, Frank Hellmann, Dirk Witthaut, Benjamin Schäfer

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Helmholtz AI(亥姆霍兹人工智能) Potsdam Institute for Climate Impact(波茨坦气候影响研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究调研近800篇图机器学习与电力系统交叉论文,分析其在电力系统多场景的应用价值,指出领域现存挑战,推导电网基准需求目录并呼吁优先开展基准研究与开放资源发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15459 2026-08-18 cs.LG cs.AI 新提交 62%

Not All Attention Is Equal: A Quantitative Survey of the EEI Trade-off

并非所有注意力都平等:EEI权衡的定量综述

Aditya Singh

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本综述围绕注意力机制的效率-表达性-可解释性权衡,定量对比21种方法,梳理其多领域发展脉络,分析研究缺口并指明未来方向,支持粗粒度层级对比。

Comments 53 pages, 8 figures, 16 tables. Code and analysis artifacts: https://github.com/Nixon-H/not-all-attention-is-equal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14630 2026-08-18 cs.CL cs.AI 新提交 62%

Characterizing Rhetorical Misalignment in Decision-Making with Language Models

表征语言模型决策中的修辞失配问题

Zirui Cheng, Joey Chan, Simo Du, Chenhao Tan, Yue Guo, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi Medical Center(纽约市健康与医院公司雅各比医学中心) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究开发决策理论框架研究LLM的修辞失配问题,通过临床实验发现其会诱导平均2.81%的有害决策翻转,还提出用LLM模拟决策者实现可扩展评估,揭示了高风险领域的新安全隐患。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28687 2026-08-18 cs.LG cs.AI cs.ET 版本更新 62%

Technological Advances in Detecting and Managing Cognitive Impairment in Older Adults: Trends, Challenges, and Future Directions

老年人认知障碍检测与管理的技术进展:趋势、挑战与未来方向

Mohammad Asif, Azizuddin Khan, Mohd Azam, Anurag Rajkumar Bombarde

机构 * Indian Institute of Technology Bombay(印度理工学院孟买分校) T-Systems ICT India Pvt. Ltd.(德国电信系统印度信息通信技术私人有限公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文综合老年人认知障碍检测与管理的技术进展,提出跨学科分类法等成果,指出现有模型多依赖小数据集,展望了可信多模态纵向验证系统的发展前景。

Comments Withdrawn due to an unresolved dispute regarding authorship eligibility and attribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22067 2026-08-18 cs.CL cs.AI 版本更新 62%

Multimodal Language Models Benchmarked Against the NRC Reactor Operator Licensing Examination: Fine-Tuning and Retrieval Strategies

基于美国核管理委员会反应堆操作员执照考试的多模态语言模型微调与检索策略基准测试

Isak Hwang, Yoon Pyo Lee, Syed Bahauddin Alam

机构 * organization= Department of Nuclear Engineering, Hanyang University , addressline= 222 Wangsimni-ro , postcode= 04763 , state= Seongdong-gu , city= Seoul , country= South Korea organization= The Grainger College of Engineering, Nuclear, Plasma \& Radiological Engineering, University of Illinois Urbana-Champaign , city= Urbana , state= IL , country= USA

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对美国核管理委员会反应堆操作员执照考试,评估310亿参数多模态模型应用核知识的能力,通过对比基础模型与多种微调及检索配置,发现固定大小分块RAG的SFT配置表现最佳,并揭示了分块策略规律及RAFT与SFT的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14345 2026-08-18 cs.LG cs.AI cs.CR 版本更新 62%

Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values

价值泄露:大语言模型的答案被其自身价值观悄然塑造

Jan Betley, Johannes Treutlein, Jan Dubiński, Harry Mayne, Karol Gałązka, Niels Warncke, Anna Sztyber-Betley, Owain Evans

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究发现大语言模型存在价值泄露问题,即其答案受自身价值观影响却未向用户披露。为此引入评估套件量化,发现模型受多种价值观影响,前沿模型差异大,价值泄露是新的失败模式,当前训练和评估未充分解决。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05183 2026-08-18 cs.CL cs.AI cs.HC 版本更新 62%

The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models

粒度差距:Gemini 模型中谄媚行为的多维纵向审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。

Comments v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables. Itemized changelog and code: https://github.com/pskeough/The-Granularity-Gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21219 2026-08-18 cs.CL cs.AI 版本更新 62%

Reasoning-Based Personalized Generation for Users with Sparse Data

基于推理的稀疏数据用户个性化生成

Bo Ni, Branislav Kveton, Samyadeep Basu, Subhojyoti Mukherjee, Leyao Wang, Franck Dernoncourt, Sungchul Kim, Seunghyun Yoon, Zichao Wang, Ruiyi Zhang, Puneet Mathur, Jihyung Kil, Jiuxiang Gu, Nedim Lipka, Yu Wang, Ryan A. Rossi, Tyler Derr

机构 * Vanderbilt University(范德比尔特大学) Adobe Research(Adobe研究) Yale University(耶鲁大学) University of Oregon(俄勒冈大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 GraSPer通过预测用户未来交互并生成文本来增强稀疏上下文中的个性化生成,提升用户个性化输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06842 2026-08-18 cs.CY cs.AI 62%

Agentic AI for Scaling Diagnosis and Care in Neurodegenerative Disease

神经退行性疾病诊断与护理的代理AI

Andrew G. Breithaupt, Michael Weiner, Alice Tang, Katherine L. Possin, Marina Sirota, James Lah, Allan I. Levey, Pascal Van Hentenryck, Reza Zandehshahvar, Marilu Luisa Gorno-Tempini, Joseph Giorgio, Jingshen Wang, Andreas M. Rauschecker, Howard J. Rosen, Rachel L. Nosheny, Bruce L. Miller, Pedro Pinheiro-Chagas

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出了一套六阶段路线图,旨在通过代理AI系统提升神经退行性疾病诊断与护理的效率,强调数据收集、决策支持、临床整合和伦理框架的综合应用。

Comments 28 pages, 2 figures, 1 table, 1 box

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16813 2026-08-18 cs.AI cs.DB 新提交 57%

Quipu: A Governed Bitemporal Knowledge Graph Store

Quipu:一种受管控的双时态知识图存储系统

Steve Brown

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。

Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16775 2026-08-18 cs.CR cs.AI 新提交 57%

Topological Attribution Distance (TAD): Revealing Segment-Level RAG Influence on LLM Output Geometry for Incident Log Analysis

拓扑归因距离(TAD):揭示用于事件日志分析的RAG片段级影响对LLM输出几何的作用

Reza Fayyazi, Michael Zuzak, Shanchieh Jay Yang

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 该研究针对LLM在网络安全应用中证据归因追踪的缺口,提出拓扑归因距离(TAD)方法,可自适应识别对LLM输出关键的事件日志,为证据验证提供可解释追踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16725 2026-08-18 cs.CV cs.AI 新提交 57%

Unsupervised Anomaly Detection for Image Dataset Quality Assurance in Multi-Center Breast MRI

面向多中心乳腺MRI图像数据集质量保证的无监督异常检测

Chiara Tappermann, Steffen Renisch, Lars Ole Schwen, Hans Meine, Horst K. Hahn, Eike Petersen

机构 * Cambridge University Hospitals(剑桥大学医院) Mitera Hospital(米特拉医院) Radboud University Medical Center(拉德堡德大学医学中心) University Hospital Aachen(亚琛大学医院) University Medical Center Utrecht(乌得勒支大学医学中心) Ribera Hospital(里贝拉医院) Duke Breast Cancer MRI(杜克乳腺癌磁共振成像项目)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究针对多中心乳腺MRI数据集,构建含17种异常类型的无监督异常检测基准,评估四种方法,发现带位置编码的投影法性能最优,为医疗AI的可扩展无监督质量保证提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 57%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16411 2026-08-18 cs.SE cs.AI 新提交 57%

Towards Risk-free AI Agent Deployment

迈向无风险的AI智能体部署

Yintong Huo, Rangeet Pan, Abhik Roychoudhury

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 针对LLM智能体部署的安全、合规等风险,本文提出以智能体轨迹为基础,将测试与调试作为系统性研究方向,提炼部署就绪检查表并指出需解决的开放性问题,推动可信智能体部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 57%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 57%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 57%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16155 2026-08-18 cs.LG cs.CE cs.GT 新提交 57%

REFLEX: Reflexive Equilibrium Fixed-point Learning for Endogenous eXchanges

REFLEX:用于内生交易的自反均衡不动点学习

Vignesh Nagarajan, Shriraghav Ashok

机构 * Texas A&M University(德克萨斯农工大学) University of California, Berkeley(加利福尼亚大学伯克利分校)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 REFLEX是一个用于场外公司债券市场报价模型的框架,通过交易商行为的可测量特征构建稳定性裕度,可预测再训练的收敛性,在模拟和市场数据中验证了其有效性,能将抽象收敛定理转化为市场安全裕度。

Comments 8 pages, 6 figures, 5 tables, 24 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15790 2026-08-18 cs.LG 新提交 57%

CrevasseSeg: A Label-Efficient UAV Crevasse Segmentation Framework

CrevasseSeg:一种标签高效的无人机冰裂缝分割框架

Steven Wallace, William D Harcourt, Richard Hann, Aiden Durrant, Somayajulu Sripada, Georgios Leontidis

机构 * School of Natural and Computing Sciences, University of Aberdeen(阿伯丁大学自然与计算科学学院) Interdisciplinary Institute, University of Aberdeen(阿伯丁大学跨学科研究所) School of Geosciences, University of Aberdeen(阿伯丁大学地球科学学院) Department of Engineering Cybernetics, Norwegian University of Science and Technology(挪威科技大学工程控制论系) School of Computing Sciences, University of East Anglia(东英吉利大学计算科学学院) Department of Physics and Technology, UiT The Arctic University of Norway(北极挪威大学物理与技术系)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 CrevasseSeg框架针对无人机冰裂缝分割,采用多种自监督目标与架构,发现DINOv3特征在不同读出方式下表现反转,其优化 pipeline 性能优于基线,支持遥感标签高效分割研究。

Comments 13 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏