arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-15 至 2026-05-15 共收录 348 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 79 篇

2605.14710 2026-05-15 cs.CV cs.AI 81%

Vision-Core Guided Contrastive Learning for Balanced Multi-modal Prognosis Prediction of Stroke

基于视觉核心的对比学习用于脑卒中平衡多模态预后预测

Liren Chen, Lidong Sun, Mingyan Huang, Junzhe Tang, Yinghui Zhu, Guanjie Wang, Yiqing Xia, Ting Xiao

机构 * School of Information Science and Engineering, East China University of Science and Technology(信息科学与工程学院,东华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出三模态融合模型,通过大语言模型生成半结构化诊断文本并设计VDAFM模块,提升多模态融合鲁棒性,实现脑卒中预后预测的高精度。

Comments Corresponding author: Ting Xiao

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14527 2026-05-15 cs.LG cond-mat.mtrl-sci physics.comp-ph 81%

Lang2MLIP: End-to-End Language-to-Machine Learning Interatomic Potential Development with Autonomous Agentic Workflows

Lang2MLIP: 从语言到机器学习互原子势开发的端到端方法 with 自主代理工作流

Wenwen Li, Yuki Orimo, Nontawat Charoenphakdee

机构 * Preferred Networks, Inc.(Preferred Networks公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Lang2MLIP,一种基于大语言模型的多代理框架,通过自然语言输入实现端到端的机器学习互原子势开发,通过自主代理工作流提升非专家用户开发能力。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14445 2026-05-15 cs.LG 81%

FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale

FrontierSmith: 批量合成开放性编程问题

Runyuan He, Qiuyang Mang, Shang Zhou, Kaiyuan Liu, Hanchen Li, Huanzhi Mao, Qizheng Zhang, Zerui Li, Bo Peng, Lufeng Cheng, Tianfu Fu, Yichuan Wang, Wenhao Chai, Jingbo Shang, Alex Dimakis, Joseph E. Gonzalez, Alvin Cheung

机构 * University of Washington(华盛顿大学) Stanford University(斯坦福大学) Princeton University(普林斯顿大学) Massachusetts Institute of Technology(麻省理工学院) Bespoke Labs(Bespoke实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.LG

AI总结 本文提出FrontierSmith系统,通过迭代演化现有封闭性编程任务生成开放性问题,提升LLM编程能力,在两个基准测试中显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03417 2026-05-15 cs.CL 81%

FactNet: A Billion-Scale Knowledge Graph for Multilingual Factual Grounding

FactNet:一个十亿级的知识图谱用于多语言事实 grounding

Yingli Shen, Wen Lai, Jie Zhou, Xueren Zhang, Yudong Wang, Kangyang Luo, Shuo Wang, Ge Gao, Alexander Fraser, Maosong Sun

机构 * Tsinghua University(清华大学) Technical University of Munich(慕尼黑技术大学) ModelBest Inc.(ModelBest公司) Minzu University of China(民族大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 FactNet通过结合17亿条维基数据语句和301亿条证据指针,构建了一个十亿级多语言知识图谱,提供事实 grounding 的评估框架,并验证了跨语言结构的知识迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11703 2026-05-15 cs.CR cs.AI 81%

Progent: Securing AI Agents with Privilege Control

Progent:通过权限控制保障AI代理

Tianneng Shi, Jingxuan He, Zhun Wang, Hongwei Li, Linyu Wu, Wenbo Guo, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校) UC Santa Barbara(加州大学圣巴巴拉分校) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Progent通过权限控制框架保障AI代理安全,利用LLM生成并更新策略,通过SMT求解器确保权限空间单调收敛,有效降低攻击成功率并保持高实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14368 2026-05-15 cs.CL cs.AI 81%

Where Should Diffusion Enter a Language Model? Geometry-Guided Hidden-State Replacement

扩散应进入语言模型的何处?几何引导的隐藏状态替换

Injin Kong, Hyoungjoon Lee, Yohan Jo

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Biosystems & Biomaterials Science and Engineering, Seoul National University(首尔国立大学生物系统与生物材料科学与工程系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DiHAL模型,通过几何引导确定扩散在预训练Transformer中的最佳插入位置,通过隐藏状态恢复而非直接连续到离散恢复提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15187 2026-05-15 cs.CV cs.GR cs.RO 80%

Articraft: An Agentic System for Scalable Articulated 3D Asset Generation

Articraft: 一种可扩展的拟人化3D资产生成代理系统

Matt Zhou, Ruining Li, Xiaoyang Lyu, Zhaomou Song, Zhening Huang, Chuanxia Zheng, Christian Rupprecht, Andrea Vedaldi, Shangzhe Wu

机构 * University of Cambridge(剑桥大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Articraft代理系统,利用大语言模型生成大规模拟人化3D资产,构建了包含10000+资产的Articraft-10K数据集,应用于机器人仿真和虚拟现实等下游任务。

Comments Project page: https://articraft3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14842 2026-05-15 cs.CV 80%

Editor's Choice: Evaluating Abstract Intent in Image Editing through Atomic Entity Analysis

编辑推荐:通过原子实体分析评估图像编辑中的抽象意图

Mor Ventura, Roy Hirsch, Yonatan Bitton, Regev Cohen, Roi Reichart

机构 * Technion – Israel Institute of Technology(技术ion – 以色列理工学院) Google Research(谷歌研究)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出通过原子实体分析评估图像编辑中抽象意图的方法,引入Entity-Rubrics框架并构建AbstractEdit基准,揭示现有模型在平衡意图与保留之间的挑战,强调结合先进LLM和迭代思维的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14126 2026-05-15 cs.LG cs.AI 79%

Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)

用于快速医疗互操作资源(FHIR)的强化学习工具调用代理

Marius S. Knorr, Robert Müller, Jan P. Bremer, Nils Schweingruber

机构 * IDM gGmbH, University Medical Center Hamburg-Eppendorf, Hamburg, Germany(IDM公司,汉堡埃彭多夫大学医疗中心,德国汉堡)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在FHIR中通过强化学习提升多轮推理性能,采用自定义环境和工具训练模型,提升回答准确性至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13851 2026-05-15 cs.AI cs.CY cs.MA 74%

Invisible Orchestrators Suppress Protective Behavior and Dissociate Power-Holders: Safety Risks in Multi-Agent LLM Systems

不可见的指挥者抑制保护行为并使权力持有者脱节:多智能体大语言模型系统中的安全风险

Hiroki Fukui

机构 * Criminal Psychiatry Research Institute / Sexual Offender Medical Center(犯罪精神病研究机构 / 性犯罪医学中心) Department of Neuropsychiatry, Kyoto University(神经精神病学系,京都大学)

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 研究探讨了多智能体系统中不可见指挥者对安全的影响,发现其导致集体脱节和行为异质性增加,且行为评估无法检测内部状态风险。

Comments 31 pages, 10 figures (5 main + 5 supplementary), 5 tables (3 main + 2 supplementary). Preregistered: osf.io/sw5hr. Companion papers: arXiv:2603.04904, arXiv:2603.08723

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15018 2026-05-15 cs.LG cs.AI 73%

Generalized Priority-Aware Shapley Value

优先感知的Shapley值的推广

Kiljae Lee, Ziqi Liu, Weijing Tang, Yuan Zhang

机构 * The Ohio State University(俄亥俄州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出通用优先感知Shapley值(GPASV),用于机器学习中的估值问题,通过轴心性刻画和计算方法,展示了不同优先级平衡对数据估值的实质性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14415 2026-05-15 cs.SE cs.AI cs.CL 73%

SWE-Chain: Benchmarking Coding Agents on Chained Release-Level Package Upgrades

SWE-Chain:基于链式发布级包升级的编码代理基准测试

Man Ho Lam, Chaozheng Wang, Hange Liu, Jingyu Xiao, Haau-sing Li, Jen-tse Huang, Terry Yue Zhuo, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Independent(独立) ELLIS Technical University of Darmstadt(达姆施塔特技术大学) Johns Hopkins University(约翰霍普金斯大学) Monash University(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SWE-Chain通过链式发布级包升级评估编码代理,包含12个升级链和155个版本过渡,揭示当前代理在连续维护中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15408 2026-05-15 cs.CL cs.AI cs.IR cs.MA cs.NE 73%

Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization

通过解释导向的多目标优化生成中文短文本创意内容

Shanlin Zhou, Xinpeng Wang, Jianxun Lian, Zhenghao Liu, Laks V. S. Lakshmanan, Xiaoyuan Yi, Yongtao Hao

机构 * Tongji University(同济大学) Microsoft Research Asia(微软亚洲研究院) Northeastern University(东北大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出MAGIC-HMO框架,通过多目标优化解决中文短文本生成中个性化约束与解释可靠性问题,在中文婴儿命名任务中优于六个基线模型。

Comments 19 pages,10 figures. Submitted to ACM for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13950 2026-05-15 cs.LG cs.AI hep-ex hep-ph 73%

Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction

Collider-Bench:通过粒子物理分析复现评估AI代理

Darius A. Faroughy, Sofia Palacios Schweitzer, Ian Pang, Siddharth Mishra-Sharma, David Shih

机构 * New High Energy Theory Center(新高能理论中心) Department of Physics & Astronomy(物理与天文学系) Rutgers University(罗格斯大学) Faculty of Computing & Data Sciences(计算与数据科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出Collider-Bench,评估AI代理能否仅通过公开论文和开源软件复现LHC实验分析,强调物理推理和领域知识的重要性,结果显示无代理能超越物理学家在环解决方案。

Comments 23 pages | 9 figures | 4 tables | Code: https://github.com/dfaroughy/Collider-Bench | Task Corpus: https://huggingface.co/datasets/Dariusfar/ColliderBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22197 2026-05-15 cs.LG cs.AI eess.SP 73%

Neural Signals Generate Clinical Notes in the Wild

神经信号在真实环境中生成临床笔记

Jathurshan Pradeepkumar, Zheng Chen, Jimeng Sun

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) SANKEN, Osaka University(大阪大学SANKEN)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CELM模型,首个能从长期EEG记录中生成多尺度临床报告的EEG-语言基础模型,通过整合预训练EEG模型与语言模型,实现了可扩展的多模态学习,实验表明其在多个评估设置中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25855 2026-05-15 cs.CV cs.AI 70%

SIEVES: Selective Prediction Generalizes through Visual Evidence Scoring

SIEVES:通过视觉证据评分实现选择性预测

Hector G. Rodriguez, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SIEVES通过视觉证据评分提升视觉问答在分布外任务中的覆盖范围,相比非 grounding 基准线提升三倍,适用于多种推理模型,无需依赖模型权重或 logit。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14495 2026-05-15 cs.MM cs.AI 70%

Contestable Multi-Agent Debate with Arena-based Argumentative Computation for Multimedia Verification

可争议的多智能体辩论与基于竞技场的论证计算用于多媒体验证

Truong Thanh Hung Nguyen, Vo Thanh Khang Nguyen, Hoang-Loc Cao, Phuc Ho, Van Pham, Hung Cao

机构 * University of New Brunswick(新 Brunswick大学) University of Science, VNU-HCM(越南国家大学科学学院(VNU-HCM))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种可争议的多智能体框架,结合多模态大语言模型、外部验证工具和基于竞技场的定量双极论证,以解决多媒体验证的透明性和可争议性问题。

Comments ACM ICMR 2026 Grand Challenge on Multimedia Verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14488 2026-05-15 cs.AI 70%

Deepchecks: Evaluating Retrieval-Augmented Generation (RAG)

Deepchecks: 评估检索增强生成(RAG)

Assaf Gerner, Netta Madvil, Nadav Barak, Alex Zaikman, Jonatan Liberman, Liron Hamra, Rotem Brazilay, Shay Tsadok, Yaron Friedman, Neal Harow, Noam Bresler, Shir Chorev, Philip Tannor, Lior Rokach

机构 * Deepchecks, Ramat Gan, Israel(深检查,以色列拉马特甘) Ben-Gurion University, Beer Sheva, Israel(本· Gurion大学,以色列贝尔谢巴)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Deepchecks框架,用于评估RAG系统,通过多维方法和根本原因分析,提升系统可靠性、相关性和用户满意度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29665 2026-05-15 cs.CL 70%

Near-Miss: Latent Policy Failure Detection in Agentic Workflows

近似失误:代理工作流中的潜在策略失败检测

Ella Rabinovich, David Boaz, Naama Zwerdling, Ateret Anaby-Tavor

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出一种新指标,用于检测代理对话轨迹中的潜在策略失败,通过分析代理工具调用决策的充分性,揭示当前评估方法的盲点。

Comments GEM@ACL2026, 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21174 2026-05-15 cs.CL 70%

Explainable Semantic Textual Similarity via Dissimilar Span Detection

通过不相似跨度检测实现可解释的语义文本相似性

Diego Miguel Lozano, Daryna Dementieva, Alexander Fraser

机构 * School of Computation, Information and Technology(计算、信息与技术学院) Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出不相似跨度检测任务,旨在识别文本对中语义不同的跨度,以提高语义文本相似性任务的可解释性,并通过新数据集和基线方法评估,显示其在同义词检测中的提升效果。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20571 2026-05-15 cs.AI 70%

CausalReasoningBenchmark: A Real-World Benchmark for Disentangled Evaluation of Causal Identification and Estimation

因果推理基准:用于解耦评估因果识别和估计的现实世界基准

Ayush Sawarni, Jiyuan Tan, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出CausalReasoningBenchmark,通过173个查询和132个现实数据集评估因果识别与估计,揭示模型在研究设计细节上的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15019 2026-05-15 cs.AI cs.IR 70%

Hunt Globally: Wide Search AI Agents for Drug Asset Scouting in Investing, Business Development, and Competitive Intelligence

全球搜索:面向药物资产勘探的宽搜索AI代理,用于投资、业务开发和竞争情报

Vlad Vinogradov, Alisa Vinogradova, Luba Greenwood, Ilya Yasny, Dmitry Kobyzev, Shoman Kasbekar, Kong Nguyen, Dmitrii Radkevich, Roman Doronin, Andrey Doronichev

机构 * Bioptic

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种基于树结构的自学习Bioptic代理,用于在多语言、异构数据源中实现高召回率的药物资产勘探,通过构建多代理流水线和基准测试,验证了其在非美国中心雷达数据中的完整性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06226 2026-05-15 cs.AI 70%

GeoLaux: A Benchmark for Evaluating MLLMs' Geometry Performance on Long-Step Problems Requiring Auxiliary Lines

GeoLaux:一个评估多模态大语言模型在需要辅助线的长步骤问题上几何性能的基准

Yumeng Fu, Jiayin Zhu, Lingling Zhang, Wenjun Wu, Bo Zhao, Shaoxuan Ma, Yushun Zhang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Ministry of Education Key Laboratory of Intelligent Networks and Network Security, China(教育部智能网络与网络安全重点实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering, China(陕西省大数据知识工程重点实验室) School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GeoLaux通过2186道计算与证明题,评估23个领先MLLMs在长步骤推理和辅助线构造上的表现,揭示模型在长步骤问题上性能显著下降,强调提升辅助线理解的重要性,并发现有限答案提示能提高过程正确性。

Comments 26 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14186 2026-05-15 cs.LG 70%

LLMs Know When They Know, but Do Not Act on It: A Metacognitive Harness for Test-time Scaling

Qi Cao, Yufan Wang, Peijia Qin, Shuhao Zhang, Pengtao Xie

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 大型语言模型(LLMs)在解决问题前后能够产生自我监控信号,如对自身能否成功解决问题的预判以及对答案正确性的后验判断,但这些信号通常未被用于控制推理过程。本文提出一种元认知控制框架,基于认知心理学中的纳尔逊-纳雷恩斯理论,将监控与推理分离,使模型在推理过程中根据预判和后验判断动态决定是否信任当前结果、是否重试或汇总多轮结果。实验表明,该框架无需参数更新或特定任务微调,即可显著提升基础模型在文本、代码和多模态任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 70%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02179 2026-05-15 cs.CL 70%

Confidence Estimation for LLMs in Multi-turn Interactions

在多轮交互中对大语言模型的置信度估计

Caiqi Zhang, Ruihan Yang, Xiaochen Zhu, Chengzu Li, Tiancheng Hu, Yijiang River Dong, Deqing Yang, Nigel Collier

机构 * University of Cambridge(剑桥大学) Fudan University(复旦大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了多轮对话中大语言模型置信度估计的问题,提出了一种评估框架和新指标,发现传统方法在多轮对话中表现不佳,而新方法更有效。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15028 2026-05-15 cs.MA 67%

Multi-Agentic Approach for History Matching of Oil Reservoirs

多智能体方法用于油藏历史匹配

Linar Samigullin, Sergei Shumilin, Evgeny Burnaev

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出PetroGraph多智能体框架,通过分解工作流实现智能油藏历史匹配,降低复杂模拟工作流的操作门槛,提升历史匹配精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03596 2026-05-15 cs.AI cs.CL cs.DB cs.LG 67%

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Workspace-Bench 1.0:基于大规模文件依赖的AI代理工作空间基准测试

Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Workspace-Bench 1.0,通过构建包含5个工人配置、74种文件类型和20,476个文件的现实工作空间,评估AI代理在处理大规模文件依赖任务中的能力,发现当前代理在工作空间学习中表现远低于人类水平。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06029 2026-05-15 cs.SE cs.CR 67%

When Specifications Meet Reality: Uncovering API Inconsistencies in Ethereum Infrastructure

当规范遇见现实:揭示以太坊基础设施中的API不一致

Jie Ma, Ningyu He, Jinwen Xi, Mingzhe Xing, Liangxin Liu, Jiushenzi Luo, Xiaopeng Fu, Chiachih Wu, Haoyu Wang, Ying Gao, Yinliang Yue

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出APIDiffer框架,通过规范引导的测试输入生成和虚假阳性过滤,自动检测以太坊客户端API不一致,发现72个bug,提升代码覆盖率并降低误报率,获得社区认可。

Comments To appear in OOPSLA'26

Journal ref Proc. ACM Program. Lang. 10, OOPSLA1, Article 111 (2026), 540-570

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06759 2026-05-15 cs.CR cs.HC 67%

"Tab, Tab, Bug": Security Pitfalls of Next Edit Suggestions in AI-Integrated IDEs

Tab,Tab,Bug:AI集成IDE中Next Edit Suggestions的安全隐患

Yunlong Lyu, Yixuan Tang, Peng Chen, Tian Dong, Xinyu Wang, Zhiqiang Dong, Hao Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文研究了AI集成IDE中的Next Edit Suggestions安全问题,揭示了其复杂的上下文检索机制和潜在攻击向量,通过实验室测试和在线调查发现NES易受上下文污染和交易性编辑影响,需加强安全教育和防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏