arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2508.00253 2026-04-23 cs.SE 91%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 91%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22240 2026-04-23 cs.SE 91%

Are Decoder-Only Large Language Models the Silver Bullet for Code Search?

解码器-only大语言模型是否是代码搜索的银弹?

Yuxuan Chen, Mingwei Liu, Guangsheng Ou, Anji Li, Dekun Dai, Yanlin Wang, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文评估了11种解码器-only LLM在代码搜索任务中的性能,发现经过微调的模型在零样本和微调设置下均优于编码器-only模型,且模型大小和训练数据组成对性能有显著影响。

Comments Published in IEEE Transactions on Software Engineering (2026). 19 pages

Journal ref IEEE Transactions on Software Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19984 2026-04-23 cs.CY cs.AI cs.CL 90%

Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring

尾部偏差:姓名条件下的评价框架在简历摘要中如何使基于LLM的招聘不稳定

Huy Nghiem, Phuong-Anh Nguyen-Le, Sy-Tuyen Ho, Hal Daume

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM生成的简历摘要中姓名条件下的评价框架如何导致招聘决策的不稳定性,通过大规模实验发现,评价语言在分布极值处存在细微差异,尤其在开源模型中更为明显。

Comments First version, 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 90%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20225 2026-04-23 cs.CL 89%

The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models

高 Yao 基准:评估大型语言模型多语言和多文化能力的综合框架

Yilun Liu, Chunguang Zhao, Mengyao Piao, Lingqi Miao, Shimin Tao, Minggui He, Chenxin Liu, Li Zhang, Hongxia Ma, Jiaxin Guo, Chen Liu, Liqun Deng, Jiansheng Wei, Xiaojun Meng, Fanyi Du, Daimeng Wei, Yanghua Xiao

机构 * Huawei, China(华为,中国) Fudan University, China(复旦大学,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出GaoYao基准,通过182300个样本、26种语言和51个地区,评估大型语言模型的多语言和多文化能力,揭示地理性能差异和任务间差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08948 2026-04-23 cs.CL 89%

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue

机构 * Yunnan University(云南大学) Wuhan University(武汉大学) Jianghan University(江汉大学) Nanjing Audit University(南京审计大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09373 2026-04-23 cs.CL 89%

The Imperfective Paradox in Large Language Models

大型语言模型中的不完美悖论

Bolei Ma, Yusuke Miyao

机构 * LMU Munich(慕尼黑大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究揭示大型语言模型在事件复合语义理解上的局限性,发现其依赖表面概率启发式而非逻辑推理,提出ImperfectiveNLI数据集揭示目标导向事件的预测偏差。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19533 2026-04-23 cs.CR cs.AI 89%

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估

Alankrit Chona, Igor Kozlov, Ambuj Kumar

机构 * Simbian AI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。

Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20652 2026-04-23 cs.AI cs.HC econ.GN q-fin.EC 89%

Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure

大语言模型在欺诈检测中优于人类且对有动机投资者压力具有抵抗力

Nattavudh Powdthavee

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 研究发现大语言模型在欺诈检测中表现优于人类,且在面对有动机投资者压力时未抑制欺诈预警,而人类顾问在压力下更倾向于支持欺诈投资。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19887 2026-04-23 cs.CL cs.AI 88%

Depression Risk Assessment in Social Media via Large Language Models

通过大语言模型在社交媒体上评估抑郁症风险

Giorgia Gulino, Manuel Petrucci

机构 * Guglielmo Marconi University, Department of Human Sciences(圭里莱莫·马尔科尼大学人文科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的系统,通过多标签分类八种抑郁相关情绪和计算加权严重性指数,评估Reddit帖子中的抑郁症风险,实验结果显示模型在零样本设置下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 88%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19781 2026-04-23 cs.CY cs.AI cs.CL 88%

Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment

小型语言模型知道它们犯错时吗?基于置信度的级联评分用于教育评估

Tyler Burleigh

机构 * PhD(博士)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过置信度评估确定级联系统中何时升级任务,发现置信度差异影响评分准确性与成本,最佳级联在降低成本和延迟的同时接近大模型性能。

Comments 12 pages, 7 figures. Accepted at NCME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19758 2026-04-23 cs.AI cs.CL cs.LG 88%

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

ThermoQA:一个用于评估大语言模型热力学推理能力的三级基准测试

Kemal Düzkar

机构 * Olivenet Kyrenia, Cyprus(奥利文特基尔尼亚,塞浦路斯)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 ThermoQA通过293个热力学问题测试大语言模型的热力学推理能力,揭示记忆属性与推理能力的差异,提供开放源代码的评估工具。

Comments 17 pages, 8 figures, open-source dataset and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18596 2026-04-23 physics.soc-ph cs.GT 88%

Large language models converge on competitive rationality but diverge on cooperation across providers and generations

大语言模型在竞争理性上趋同但在合作上跨提供商和代际分化

Felipe M. Affonso

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究通过51906次博弈试验揭示大语言模型在竞争与协调行为上趋同,但合作行为在不同提供商和代际间显著分化,且受训练流程影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07192 2026-04-23 cs.SE 87%

Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance

紧凑约束编码用于LLM代码生成:关于令牌经济学和约束合规性的实证研究

Hanzhang Tang

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过实验证明紧凑约束头可减少令牌消耗而不影响约束合规性,发现编码形式和传播模式对合规率无显著影响,但约束类型和任务领域对合规性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18787 2026-04-23 cs.SE 87%

Characterizing Datasets for LLM-based Requirements Engineering: A Systematic Mapping Study

对基于大语言模型的需求工程数据集进行表征:一项系统映射研究

Quim Motger, Carlota Catot, Xavier Franch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统映射研究45项研究,分析62个公开数据集,揭示需求工程领域数据集在表征、任务支持和多样性方面的不平衡问题,为数据集选择与重用提供指导。

Comments Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20211 2026-04-23 cs.SE cs.AI cs.CR 84%

Towards Secure Logging: Characterizing and Benchmarking Logging Code Security Issues with LLMs

面向安全日志:利用LLM分析和基准测试日志代码的安全问题

He Yang Yuan, Xin Wang, Kundi Yao, An Ran Chen, Zishuo Ding, Zhenhao Li

机构 * York University(约克大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文通过构建包含101个真实日志安全问题报告的基准数据集,系统分析日志代码安全问题,并提出自动化框架评估LLM在检测和修复日志安全问题中的能力,发现LLM在检测方面表现中等但修复存在挑战。

Comments Accepted at FSE 2026 Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 83%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 评测与基准 :language agent(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21267 2026-04-23 cs.CL cs.CY 83%

Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework

任务依赖性的大语言模型输出同质化评估:一种基于分类学的框架

Shomik Jain, Jack Lanchantin, Maximilian Nickel, Candace Ross, Karen Ullrich, Ashia Wilson, Jamelle Watson-Daniels

机构 * FAIR at Meta(Meta 的 FAIR 研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于任务分类学的框架,通过任务依赖的采样技术提升输出多样性,挑战多样性与质量的权衡观念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20087 2026-04-23 cs.CL cs.LG 82%

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19750 2026-04-23 cs.SE cs.AI cs.HC 81%

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging

通过眼睛编码:视觉反馈解锁可靠的GUI代码生成与调试

Zhilin Liu, Ye Huang, Ting Xie, Ruizhi Zhang, Wen Li, Lixin Duan

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InteractGUI Bench基准和VF-Coder系统,通过视觉反馈提升GUI代码生成与调试效果,提高成功率和视觉评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22598 2026-04-23 cs.CL 81%

RExBench: Can coding agents autonomously implement AI research extensions?

RExBench:代码代理能否自主实现AI研究扩展?

Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) Boston University(波士顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19966 2026-04-23 cs.CV cs.AI cs.LG cs.RO 81%

DistortBench: Benchmarking Vision Language Models on Image Distortion Identification

DistortBench:用于图像失真识别的视觉语言模型基准测试

Divyanshu Goyal, Akhil Eppa, Vanya Bannihatti Kumar

机构 * Adobe Inc.(Adobe公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出DistortBench,一个用于评估视觉语言模型图像失真识别能力的基准测试,包含13500道四选一问题,涵盖27种失真类型及不同严重程度,评估18种模型,揭示当前VLM在低级感知上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19826 2026-04-23 cs.SE cs.AI cs.LG 81%

Co-Located Tests, Better AI Code: How Test Syntax Structure Affects Foundation Model Code Generation

共存测试,更好的AI代码:测试语法结构如何影响基础模型代码生成

Éric Jacopin

机构 * Cosmic AI

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究探讨测试代码结构对基础模型代码生成质量的影响,发现内联测试在保真度和正确性上表现更优,且模型行为随世代变化,非transformer架构也验证了该设计的鲁棒性。

Comments 20 pages. Preprint; arXiv long version of a paper accepted at AIware 2026. Adds Appendices A (cross-language) and B (Python isolation) not present in the ACM camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19782 2026-04-23 cs.CL cs.AI cs.SD eess.AS 81%

KoALa-Bench: Evaluating Large Audio Language Models on Korean Speech Understanding and Faithfulness

KoALa-Bench:评估大型音频语言模型在韩语语音理解与忠实性上的表现

Jinyoung Kim, Hyeongsoo Lim, Eunseo Seo, Minho Jang, Keunwoo Choi, Seungyoun Shin, Ji Won Yoon

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang 大学人工智能系) Upstage AI

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KoALa-Bench,一个用于评估大型音频语言模型在韩语语音理解和忠实性方面的基准,包含六个任务,涵盖语音识别、翻译、问答和指令跟随等核心能力,并包含韩国特定知识内容。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23043 2026-04-23 cs.LG cs.AI 81%

Assessing the Robustness of Climate Foundation Models under No-Analog Distribution Shifts

在无类比分布偏移下评估气候基础模型的鲁棒性

Maria Conchita Agana Navarro, Geng Li, Theo Wolf, Maria Perez-Ortiz

机构 * Centre for Artificial Intelligence(人工智能中心) Department of Computer Science(计算机科学系) University College London(伦敦大学学院) Division of Emerging Interdisciplinary Areas(新兴交叉学科领域) Hong Kong University of Science and Technology(香港科技大学) University of Oxford(牛津大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在无类比分布偏移下气候基础模型的鲁棒性,通过时间外推和跨情景驱动偏移评估三种模型,发现ClimaX模型在绝对误差最低但分布偏移下稳定性较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12652 2026-04-23 cs.CV cs.AI 79%

PromptEcho: Annotation-Free Reward from Vision-Language Models for Text-to-Image Reinforcement Learning

PromptEcho:基于视觉语言模型的无标注奖励用于文本到图像强化学习

Jinlong Liu, Wanggui He, Peng Zhang, Mushui Liu, Hao Jiang, Pipei Huang

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(title);pretraining(abstract);分类 cs.AI

AI总结 PromptEcho通过冻结的视觉语言模型计算token级交叉熵损失,无需标注或训练奖励模型,提升文本到图像模型的提示跟随能力,实验显示在多个基准上取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20144 2026-04-23 cs.CL 77%

Trajectory2Task: Training Robust Tool-Calling Agents with Synthesized Yet Verifiable Data for Complex User Intents

轨迹到任务:通过合成且可验证的数据训练鲁棒的工具调用代理以应对复杂用户意图

Ziyi Wang, Yuxuan Lu, Yimeng Zhang, Pei Chen, Ziwei Dong, Jing Huang, Jiri Gesi, Xianfeng Tang, Chen Luo, Qun Liu, Yisi Sang, Hanqing Lu, Manling Li, Jin Lai, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon(亚马逊) Northwestern University(西北大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出Trajectory2Task方法,通过合成可验证数据提升工具调用代理在复杂用户意图下的鲁棒性,通过多轮探索生成有效工具调用轨迹,并转换为可验证任务,最终在七种先进LLM上验证了改进效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20801 2026-04-23 cs.CR 75%

Synthesizing Multi-Agent Harnesses for Vulnerability Discovery

为漏洞发现合成多智能体框架

Hanzhi Liu, Chaofan Shou, Xiaonan Liu, Hongbo Wen, Yanju Chen, Ryan Jingyang Fang, Yu Feng

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 AgentFlow通过类型化图DSL和反馈驱动循环,提升多智能体框架效率,发现Chrome中十个未知零日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏