arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-22 至 2026-07-22 共收录 63 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 63 篇

2606.25476 2026-07-22 cs.CL cs.AI 版本更新 92%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18068 2026-07-22 cs.NI cs.AI 版本更新 92%

Human Grounded Evaluation of Large Language Models for Optical Network Automation

用于光网络自动化的大语言模型的人工基础评估

Kiarash Rezaei, Omran Ayoub, Paolo Monti, Carlos Natalino

机构 * University of Applied Sciences and Arts of Southern Switzerland(瑞士南瑞士应用科学与艺术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对光网络自动化中LLMs输出质量和成本差异大的问题,提出HuGLEN评估管道,结合LLM评判器和专家评级,用QES排名,用于转换XAI模型输出,结果显示中等规模LLM的QES最高,减轻人工标注负担,助力模型选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06605 2026-07-22 cs.LG 版本更新 92%

How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation

需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配

Shai Feldman, Yaniv Romano

机构 * Department of Computer Science(计算机科学系) Technion, Israel(技术ion, 以色列) Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出DAPRO框架,通过动态预算分配在多轮LLM交互中提供事件发生时间的界限,解决静态方法效率低的问题,实验表明其在覆盖性和方差方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20324 2026-07-22 cs.MA cs.AI 版本更新 90%

When Agents Disagree: The Selection Bottleneck in Multi-Agent LLM Pipelines

当代理人意见不一致:多代理LLM流水线中的选择瓶颈

Artem Maryanskyy, Dmitry Budnikov, Alibek T. Kaliyev

机构 * Uber

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究多代理LLM流水线中团队多样性对输出质量的影响,提出选择瓶颈概念,通过数学公式确定多样性帮助或损害的临界点,并通过实验验证选择机制的重要性。

Comments v2: Updated author list to match the published version. Published in Applied Sciences (MDPI) 2026, DOI: 10.3390/app1010000

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 88%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19219 2026-07-22 cs.CL cs.AI 新提交 88%

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

超越分数预测:基于强化学习和评分标准奖励的基于大语言模型的作文评分与反馈生成

Xuefeng Jin, Jiashuo Zhang, Teng Cao, Bin Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究基于大语言模型的作文评分与反馈生成,提出RLAES框架,通过强化学习联合优化。引入RFE评估框架,提出AGFO和ACR方法。实验表明RFE能捕捉一致性,RLAES-AGFO在评分性能上最佳,保持反馈质量同时避免反馈退化。

Comments 12 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18485 2026-07-22 cs.CR cs.AI 新提交 87%

Trusted Credentials, Untrusted Behavior: Benchmarking LLM-Agent Security in High-Performance Computing

可信凭证,不可信行为:高性能计算中语言模型代理安全性基准测试

Jie Li

机构 * Texas Tech University(德克萨斯技术大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究高性能计算中语言模型代理安全性,定义其威胁模型,识别攻击面及当前控制不足,提出研究议程和TaskBound实证基准测试计划,以应对代理按用户凭证运行时可能出现的劫持授权代理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00262 2026-07-22 cs.SE 版本更新 87%

LLM-Driven Cost-Effective Requirements Change Impact Analysis

基于大语言模型的低成本需求变更影响分析

Romina Etezadi, Sallam Abualhaija, Chetan Arora, Lionel Briand

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ProReFiCIA方法,利用大语言模型自动识别需求变更影响,实验显示其在未见过的工业数据集上召回率达85.7%,且成本低,仅需审查3%的需求。

Comments 33 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18360 2026-07-22 cs.CR cs.AI cs.LG 新提交 86%

HALLMARK: Diagnosing Three Failure Modes in LLM Citation Verifiers

HALLMARK:诊断大语言模型引用验证器中的三种失败模式

Patrik Reizinger, Wieland Brendel

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型引用验证器的失败模式,通过HALLMARK基准测试评估多种验证器,发现误报率决定验证器是否可部署,并具体指出三种失败模式,强调误报率是部署瓶颈,未检测到的伪造对科学记录代价更高。

Comments 59 pages, 7 figures, 40 tables. Benchmark and code: https://github.com/rpatrik96/hallmark (v1.2.0); verification tool: https://github.com/rpatrik96/bibtexupdater (v1.5.0)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28965 2026-07-22 cs.AI 版本更新 85%

Frontier LLM-based agents can overcome the ontology curation bottleneck for natural phenotypes

基于前沿LLM的智能体可以克服自然表型的本体策展瓶颈

James P. Balhoff, Hilmar Lapp

机构 * Renaissance Computing Institute, University of North Carolina(北卡罗来纳大学雷丁计算研究所) Neuromatch, USA(美国Neuromatch)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文使用前沿大型语言模型作为智能体策展人,在自包含工作空间中利用本体和注释指南进行表型注释,其性能达到人类策展人之间的变异性范围,显著优于传统NLP工具。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07673 2026-07-22 cs.LG 版本更新 84%

How Benchmark Prediction from Fewer Data Misses the Mark

从较少数据进行基准预测如何失准

Guanhua Zhang, Florian E. Dorner, Moritz Hardt

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型基准预测方法,通过对11种方法在19个基准上评估,发现现有方法依赖模型相似性,新模型出现时效果不佳。提出受增强逆倾向加权启发的新方法,虽能改进但提升有限,揭示基准预测在评估前沿失效的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18983 2026-07-22 cs.CL cs.AI cs.HC 新提交 84%

AutoJourn: Multi-Perspective Summarisation, Bias Detection and Bias Neutralisation for LLM-Generated News in Automated Journalism

AutoJourn:自动新闻中基于大语言模型生成的新闻的多视角摘要、偏差检测与偏差中和

Himel Ghosh, Ahmed Mosharafa, Georg Groh

机构 * Technical University of Munich(慕尼黑工业大学) Sapienza University of Rome(罗马第一大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AutoJourn系统旨在应对自动新闻中多视角新闻生成及偏差问题,通过整合提示工程与检索增强等,产生多样视角集,经多视角摘要模块和偏差分析套件,实现不同视角提取、平衡摘要生成及偏差检测与中和,评估显示其优于基线且保持内容保真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05554 2026-07-22 cs.CL cs.AI 版本更新 84%

Prompt Robustness Is Task-Dependent: Comparing Objective and Belief-Style Questions in LLM Evaluation

提示鲁棒性取决于任务:在大语言模型评估中比较客观和信念风格问题

Sadia Kamal, Arefa Patwary, Anthony Marchiafava, Sagnik Ray Choudhury, Atriya Sen

机构 * Oklahoma State University(俄克拉荷马州立大学) University of North Texas(北德克萨斯大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型评估中提示鲁棒性,比较客观与主观问题,在多个数据集上评估四个模型家族,通过多种提示更改及特定方程分析,发现提示鲁棒性取决于问题类型、提示变化和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24592 2026-07-22 cs.CV 版本更新 83%

GH-ESD: Grounded Hypothesis-Driven Error Slice Discovery for Instance-Level Vision Tasks

GH-ESD:基于假设驱动的实例级视觉任务错误切片发现

Wei Zhang, Chaoqun Wang, Zixuan Guan, Ping Sheng Kao, Pengfei Zhao, Peng Wu, Sifeng He

机构 * Apple(苹果公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract)

AI总结 提出GH-ESD框架,通过LLM生成假设与视觉语言模型验证,在实例级任务中自动发现空间关系错误切片,并构建GESD基准,显著提升检测和分割任务的错误切片发现精度。

Comments Accepted by ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18819 2026-07-22 cs.CV 新提交 82%

In-Context Learning for Wound Classification with Small Multimodal Language Models

使用小型多模态语言模型进行伤口分类的上下文学习

George Martvel, Oskar Gustafsson, John Pavia, Ernst Ahlberg

机构 * Jönköping University(延雪平大学) Halmstad University(哈尔姆斯塔德大学) Mölnlycke Health Care(墨尼克医疗保健公司) Centre for Reliable Machine Learning, Royal Holloway, University of London(伦敦大学皇家霍洛威学院可靠机器学习中心)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract)

AI总结 研究评估小型多模态语言模型能否通过基于检索的上下文学习为伤口分类提供免训练替代方案,使用两个数据集和多种方法实验,结果显示查询条件下的上下文学习效果较好,Qwen 3.5 27B搭配kNN+MMR表现最佳,该方法可实现适应性伤口图像分类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18665 2026-07-22 cs.AI 新提交 81%

SciHazard: A Benchmark for Measuring Scientific Safety Risks with Decomposed Harm Scoring

SciHazard:一种通过分解危害评分来衡量科学安全风险的基准

Chunxiao Li, Yuan Xiong, Lijun Li, Tianyi Du, Wenlong Zhang, Lei Bai, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大型语言模型可能传播有害科学知识的问题,引入SciHazard基准及评估框架,含多学科问题。开发分解评估程序计算DeHarm-Score,经专家验证和模型测试,显示该方法能有效衡量风险,还发现深度研究代理存在安全盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18252 2026-07-22 cs.AI cs.NE 新提交 81%

MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

Jinbiao Nie, Kewei Feng, Xiaoyuan Zhang, Shan Yin, Zizhuo Wang, Bin Dong

机构 * BUPT(北京邮电大学) BZA(未提及具体中文名,推测可能是某个机构简称) BIT(北京理工大学) CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18246 2026-07-22 cs.AI cs.SE 新提交 81%

Phionyx: A Deterministic AI Runtime Architecture with Structured State Management and Pre-Response Governance

Phionyx:一种具有结构化状态管理和响应前治理的确定性人工智能运行时架构

Ali Toygar Abak

机构 * Phionyx Research(Phionyx研究公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出Phionyx确定性人工智能运行时架构,源于Echoism框架,以治理为先。通过结构化状态向量实现确定性状态演化,集成三层架构。实验验证其在单实例部署中可降低计算开销、提高数据保留率,还介绍了架构及实验证据,分布式或多租户部署待后续研究。

Comments 27 pages, 4 figures, 5 tables. Reference implementation, reproducibility pack, and evaluation artifacts available via GitHub (https://github.com/halvrenofviryel/phionyx-research) and Zenodo (DOI: 10.5281/zenodo.20027534)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06936 2026-07-22 cs.AR cs.AI cs.MA 版本更新 81%

Bridging the Last Mile of Circuit Design: PostEDA-Bench, a Hierarchical Benchmark for PPA Convergence and DRC Fixing

跨越电路设计的最后一英里:PostEDA-Bench,一个用于PPA收敛和DRC修复的分层基准

Pengju Liu, Nuo Xu, Jinwei Tang, Yu Cao, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出PostEDA-Bench分层基准,包含145个任务,覆盖DRC修复和PPA优化,实验发现现有LLM代理在复杂DRC推理和多目标PPA优化上表现不佳,视觉增强可提升DRC性能,权衡推理是PPA多目标瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13024 2026-07-22 cs.CL 版本更新 81%

Tears or Cheers? Benchmarking LLMs via Culturally Elicited Distinct Affective Responses

眼泪还是欢呼?通过文化诱发的差异情感反应基准测试LLMs

Chongyuan Dai, Yaling Shen, Zihan Gao, Jia Li, Yishun Jiang, Yaxiong Wang, Liu Liu, Zongyuan Ge, Jinpeng Hu

机构 * Hefei University of Technology(合肥工业大学) Monash University(墨尔本大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CEDAR基准,通过文化诱发的差异情感反应评估LLMs,揭示语言一致性和文化契合度之间的脱节,展示文化根植的情感理解仍是模型的重大挑战。

Comments ACL 2026 SAC Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18454 2026-07-22 cs.LG cs.AI 新提交 81%

Estimating Rare Events in Language Models with Proper Evaluation

用适当评估估计语言模型中的罕见事件

Nikita Y. Parulekar, Anqi Liu

机构 * Johns Hopkins University(约翰·霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中罕见事件概率估计难题,提出梯度激活自适应多级分裂方法及移位幂布雷格曼损失,通过实验揭示偏差 - 方差权衡,强调估计器与部署上下文匹配,确立激活空间为易处理域。

Comments 37 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18305 2026-07-22 cs.LG cs.AI 新提交 81%

The Information Shadow: Measuring Structural Limits on What Language Models Can Learn

信息阴影:衡量语言模型学习的结构限制

Priyansh Srivastava, Romit Chatterjee

机构 * Sirena Ai(Sirena人工智能公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型学习的结构限制,引入信息阴影概念,包含语言无法表达的结构等三类。通过语言压缩残差等探针测试,揭示不同类型限制,发布探针套件并探讨其对基准设计等方面的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11945 2026-07-22 cs.CL cs.LG 版本更新 81%

Belief-reality separation lives in routing over a shared value slot in language models

信念与现实的分离存在于语言模型中共享值槽的路由中

Oliver Steele, Jiangtao Wen, Yuxing Han

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型中信念与现实分离的位置,核心方法是通过通用值槽和查询位置路由器,表明其基于两个可分离机制处于两个位置,结果在三种架构及多个模型家族成立,深入研究了信念 - 现实轴且该格式在多语境共享。

Comments 21 pages, 6 figures, 6 tables. v2: cite the released Mental Spaces Corpus (dataset DOI); switch to ACL bibliography style; minor copy-editing. No change to results

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06931 2026-07-22 cs.CV cs.AI cs.CL 81%

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

通过真实照片生成面部-only反事实来衡量视觉语言模型中的社会偏见

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu

机构 * School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) School of Information Science and Engineering, Ningbo University(宁波大学信息科学与工程学院) School of Information Science and Technology, University of Science and Technology of China(中国科学技术大学信息科学与技术学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过真实照片生成面部-only反事实来评估视觉语言模型中的社会偏见,构建了FOCUS数据集和REFLECT基准,发现严格视觉控制下仍存在种族性别差异,强调了反事实审计和任务设计的重要性。

Comments 18 pages, 18 figures, and 3 tables

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 39963-39987, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.18121 2026-07-22 cs.CL cs.AI 版本更新 81%

Saving the legacy of Hero Ibash: Evaluating Four Language Models for Aminoacian

拯救伊巴什英雄的遗产:评估四种用于氨基语的语言模型

Yunze Xiao, Yiyang Pan

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究评估四种前沿语言模型在氨基语中的表现,审视其在文本生成等方面的适应性等,揭示低资源语言中模型性能见解,为自然语言处理未来发展奠基,推动语言模型在类似语言环境中应用。

Comments arXiv admin note: This submission has been withdrawn due to violation of arXiv policies for acceptable submissions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19211 2026-07-22 cs.CY 新提交 80%

Do LLMs Ask the Right Questions? Evaluating GPT-Generated Surveys as Instruments for Measuring Social Attitudes

大语言模型提出的问题正确吗?评估GPT生成的调查问卷作为衡量社会态度的工具

Tina Behzad, Wenbo Li, Reuben Kline, Klaus Mueller

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究对比GPT生成的调查问卷和既定调查基线在三个社会领域的情况,发现GPT生成的问卷与人工设计工具能捕捉相同主要态度划分,但有差异,适合探索性和大规模分析,可补充专家设计工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18254 2026-07-22 cs.AI cs.LG cs.PL 新提交 80%

Cross-Dialect Generalization Without Retraining: Benchmarks and Evaluation of Schema-Derived Constrained Decoding for MLIR

无需重新训练的跨方言泛化:MLIR 的模式派生约束解码基准测试与评估

Plawan Kumar Rath

机构 * Meta

专题命中 评测与基准 :SLM(abstract,abstract_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究在 MLIR 中能否用从方言操作定义规范派生的推理时先验替代梯度适应,发布跨三种方言的基准测试集,构建三层模式派生约束栈,实验表明在部分方言上新模式能让模型在速度和验证有效率上超越其他模型,并发布相关资源。

Comments 27 pages (9 main + bibliography + appendix), 9 figures, 9 tables. Code, benchmarks, and reproducibility Docker image at https://github.com/plawanrath/slm-to-mlir-constrained-emitter

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18826 2026-07-22 cs.CR cs.AI 新提交 79%

Cross-Agent Campaign Attribution: Linking Asynchronous Attacks Across LLM Agents

跨智能体活动归因:关联大语言模型智能体间的异步攻击

SangJin Park, Myungsub Choi, Jineok Kim, Minseung Kang

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究跨大语言模型智能体的异步攻击归因问题,提出异步归因指纹向量($A^2FV$)协议,构建SCD-v1基准,实验表明$A^2FV$在活动关联上表现良好,确立跨智能体活动归因作为保护大语言模型智能体的独特评估层。

Comments 22 pages, 5 figures. Accepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18659 2026-07-22 cs.CR cs.AI cs.MA 新提交 79%

Broken Gates: Re-evaluating Web Bot Defenses in the Age of LLM Agents

破碎的大门:在大语言模型代理时代重新评估网络机器人防御

Behzad Ousat, Nikita Turkmen, Lalchandra Rampersaud, Dillan Bailey, Amin Kharraz

机构 * Florida International University(佛罗里达国际大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究在大语言模型代理时代网络机器人防御的有效性,通过系统测量研究评估基于交互式挑战与非交互式信任的防御对商业验证码解决服务和大语言模型代理的弹性,发现非交互式防御安全边界在环境层,影响机器人管理系统设计评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18261 2026-07-22 cs.AI 新提交 79%

When JSON Is Not Enough: Semantic Reliability of Schema-Constrained LLM Ordering Agents

当JSON不足够时:模式约束的大语言模型排序代理的语义可靠性

Yin Li

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究大语言模型代理作事务编译器时JSON模式等结构化输出的语义可靠性问题,引入OrderBench基准,通过对四个开放模型测试发现模式有效输出仍有语义错误率,强调结构化输出是必要接口层,不能替代域验证和故障封闭执行。

Comments 7 pages, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏