arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 215 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 35 篇

2607.12786 2026-07-15 cs.CV 新提交 78%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12621 2026-07-15 cs.CV cs.IR 新提交 78%

Towards Vision-Free CIR: Attribute-Augmented Scoring and LLM-Based Reranking for Zero-Shot Composed Image Retrieval

迈向无视觉的合成图像检索:基于属性增强评分和基于大语言模型的重排的零样本合成图像检索

Ryotaro Shimada, Yu-Chieh Lin, Yuji Nozawa, Youyang Ng, Osamu Torii, Yusuke Matsui

机构 * The University of Tokyo(东京大学) Kioxia Corporation(铠侠株式会社)

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 研究如何让无视觉方法有效处理合成图像检索任务,通过属性增强混合评分和基于大语言模型的重排两项关键技术构建框架,在开放域CIRR数据集实验中优于现有零样本方法,在FashionIQ上凸显语义推理与视觉匹配权衡,消融研究验证技术有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12319 2026-07-15 cs.CV 新提交 78%

DM-KG: A Novel Method for Boosting Spatial Cognition of Vision-Language Models in Street View Imagery

DM-KG:一种提升街景图像中视觉语言模型空间认知的新方法

Xinyue Xu, Zheng Zhang, Kunyang Ma, Ge Zhu, Lianshuai Cao, Lei Wang, Zixuan Li, Yi Cheng

机构 * Institute of Surveying and Mapping, Information Engineering University(信息工程大学测绘学院) Institute of Geographic Sciences and Natural Resources Research, Chinese Academy of Sciences(中国科学院地理科学与资源研究所)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 研究针对视觉语言模型在街景图像空间认知方面的不足,提出DM-KG框架,通过提取实体关系、结合全景分割与深度估计计算坐标并编码知识图,有效提升模型空间推理准确性,降低误差,为地理视觉问答提供新框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09008 2026-07-15 cs.CL cs.AI cs.LG cs.LO 版本更新 75%

A Neurosymbolic Approach to Natural Language Formalization and Verification

一种用于自然语言形式化和验证的神经符号方法

Chenyang An, Sam Bayless, Stefano Buliani, Darion Cassel, Byron Cook, Duncan Clough, Rémi Delmas, Nafi Diallo, Ferhat Erata, Nick Feng, Dimitra Giannakopoulou, Aman Goel, Aditya Gokhale, Joe Hendrix, Victor Heorhiadi, Marc Hudak, Dejan Jovanović, Andrew M. Kent, Benjamin Kiesl-Reiter, Jeffrey J. Kuna, Nadia Labai, Joseph Lilien, Divya Raghunathan, Zvonimir Rakamarić, Niloofar Razavi, Michael Tautschnig, Ali Torkamani, Nathaniel Weir, Michael W. Whalen, Jianan Yao

机构 * Amazon Web Services(亚马逊网络服务) University College London(伦敦大学学院) University of Toronto(多伦多大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12733 2026-07-15 cs.AI cs.LG 新提交 73%

LLMs Can See the Smoke but not the Fire: Evaluating Abductive Reasoning with Elenchos

大语言模型能看到烟雾却看不到火焰:用Elenchos评估溯因推理

Julius Steiglechner, Lucas Mahler, Gabriele Lohmann

机构 * Max-Planck-Institute for Biological Cybernetics(马克斯·普朗克生物控制论研究所) University Hospital Tübingen(图宾根大学医院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型的溯因推理能力,引入Elenchos评估框架,通过给定形式系统及变异对应物,让智能体判断变异并推断规则修改,发现模型存在检测-归因分离问题,相互作用变异下性能降,推理时间收益递减。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12443 2026-07-15 cs.CL cs.DS cs.LG 新提交 73%

Language Identification with Succinct Machine-Independent Traces

基于简洁的与机器无关的迹进行语言识别

Moses Charikar, Jon Kleinberg, Chirag Pabbaraju

机构 * Stanford University(斯坦福大学) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文受大语言模型启发,针对语言识别的Gold-Angluin模型相关问题,解决能否用小字母表迹及能否直接从语言定义迹的问题,给出肯定答案,展示了如何定义计算迹实现极限识别,所用字母表与语言定义字母表大小成线性关系且与语言其他属性无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24267 2026-07-15 cs.CL cs.AI 版本更新 73%

Pigeonholing: how bad prompts hurt models, causing collapse and mistakes

鸽笼效应:不良提示导致模型崩溃和犯错

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究不良上下文导致大语言模型性能下降和模式崩溃的“鸽笼效应”,发现重复错误答案、收敛于狭窄答案集等问题,并提出RLVR合成错误缓解方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01113 2026-07-15 cs.LG cs.AI cs.DS 版本更新 73%

Efficiently Learning Branching Networks for Multitask Algorithmic Reasoning

高效学习用于多任务算法推理的分支网络

Dongyue Li, Zhenshuo Zhang, Minxuan Duan, Edgar Dobriban, Hongyang R. Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在实现多任务算法推理,提出分支神经网络架构,通过递归树状划分任务,利用基于梯度的亲和度聚类,降低搜索复杂度。经实验验证,在多个基准测试中性能优于现有方法,减少运行时和内存使用,还可用于重叠社区检测。

Comments 31 pages. Modified the experiments section and improved exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12723 2026-07-15 cs.CR cs.AI cs.SE 新提交 70%

Bulkhead: Automated Semantic Detection and Remediation of Container Escape Vulnerabilities

舱壁:容器逃逸漏洞的自动语义检测与修复

Qiyuan Fan, Zhi Li, Junjie Li, XiaoFeng Wang, Bin Yuan, Deqing Zou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究容器逃逸漏洞,提出舱壁框架,集成大语言模型与形式化方法,利用多智能体系统通过多维知识模式识别修复漏洞,检测管道找漏洞并生成利用程序,补丁管道验证确保修复正确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12605 2026-07-15 cs.SE cs.AI 新提交 70%

Multi-Perspective Agentic Program Repair via Code Property Graphs and Temporal Execution Graphs

通过代码属性图和时间执行图进行多视角智能程序修复

Zhili Huang, Ling Xu, Hongyu Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型在自动程序修复中的局限,提出CT-Repair框架,通过代码属性图和时间执行图表示证据,利用三阶段过滤管道及多视角智能体分析错误并生成修复策略,实验证明该方法能有效提高修复有效性。

Comments 12 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12455 2026-07-15 cs.AI cs.CE 新提交 70%

EVOQUANT: Self-Evolving Verifier-Guided Strategy Optimization for Robust Quantitative Trading

EVOQUANT:用于稳健量化交易的自进化验证器引导策略优化

Jie Mao, Changlun Li, Xiang Li, Qiqi Duan, Jinhui Yuan, Xiang Liu, Yuyu Luo, Jing Tang, Xiaowen Chu, Nan Tang

机构 * HKUST(GZ)(香港科技大学(广州)) Paradoox AI Research(悖论人工智能研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对量化策略优化多依赖人工且易出错的问题,提出EVOQUANT框架,利用大语言模型诊断瓶颈、生成候选编辑,经多阶段验证选最佳策略,能提炼经验持续改进,实验表明该方法有效提升夏普比率,为金融策略研究提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12058 2026-07-15 cs.SE cs.AI cs.CR 新提交 70%

AutoTrace: From Patches to Triggers via Agentic Interprocedural Exploration

AutoTrace:通过智能过程间探索从补丁到触发器

Arastoo Zibaeirad, Marco Vieira, Thomas Zimmermann

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对修复漏洞提交的触发器定位难题,提出AutoTrace智能管道逐层探索代码属性图定位漏洞触发器,并构建SinkTrace - Bench数据集。AutoTrace在基准测试中表现出色,还揭示了前沿语言模型在因果推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20963 2026-07-15 cs.LG 版本更新 70%

When and Why Does Multi-Agent Debate Fail and Does It Really Underperform?

多智能体辩论何时以及为何失败,它真的表现不佳吗?

Yongqiang Chen, Gang Niu, James Cheng, Bo Han, Masashi Sugiyama

机构 * The Chinese University of Hong Kong(香港中文大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院高级智能项目中心) Hong Kong Baptist University(香港 Baptist大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多智能体辩论(MAD)失败原因及表现,分析竞争型和寻求共识型MAD范式问题,提出协作协议ColMAD,经实验验证其在错误检测等任务上比之前协议高出10个百分点,且优于单智能体方法,凸显协议设计对MAD潜力实现的关键作用。

Comments Preprint, ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交 67%

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11875 2026-07-15 cs.LG cs.AI 版本更新 62%

Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

归纳推理任务中Transformer的不变学习动态

Tiberiu Musat, Tiago Pimentel, Nicolas Zucchet, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出理论框架解释Transformer语言模型归纳推理能力,研究广义归纳任务,证明其训练动态可限制在低维不变流形,刻画数据统计对学习竞争的影响,探讨初始化作用并展示坐标框架用途,向Transformer学习预测理论迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12856 2026-07-15 cs.LG 新提交 57%

Verifier-Based Reinforcement Fine-Tuning of Reasoning Models for Thermal Energy Storage Control

基于验证器的热能存储控制推理模型强化微调

Takumi Shioda, Kohei Terashima, Tatsuo Nagai

机构 * The University of Tokyo(东京大学) Tokyo University of Science(东京理科大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.LG

AI总结 研究针对建筑物热能存储控制中模型难以扩展的问题,采用基于可验证奖励的强化学习,通过强化微调训练开放权重推理模型,在简单办公楼TES基准测试中取得较好效果,明确了规划模式转移情况,推动了相关测试与验证器发展。

Comments 29 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 57%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12316 2026-07-15 cs.CR 新提交 50%

Antiproof: Synthesizing Vulnerability Detectors and Proofs of Exploitability

反证法:合成漏洞检测器与可利用性证明

Alon Shakevsky, Corban Villa, Ion Stoica, Raluca Ada Popa

专题命中 推理与问题求解 :LLM(abstract)

AI总结 研究旨在在不过高成本下实现高召回率漏洞发现与可靠自动验证。核心方法是结合神经符号检测器合成与可利用性预言机的反证法系统。主要贡献是在多数据集和系统扫描中表现出色,发现大量未知漏洞并获多个CVE编号。

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00333 2026-07-15 cs.CR 版本更新 50%

(A)I Sees What You Don't: Exploiting New Attack Surfaces in Third-Party Mobile Agents

(AI)看见你看不见的:利用第三方移动代理中的新攻击面

Zidong Zhang, Zhentao Xie, Wenrui Diao, Jianliang Wu

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文识别了第三方移动代理在屏幕感知和通道滥用方面的两种新攻击面,并设计了七种具体攻击,证明恶意应用可在无权限下劫持代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27706 2026-07-15 cs.MM 版本更新 50%

MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation

MAR3:多智能体识别、推理与反思用于参考音频视觉分割

Yuan Zhao, Zhenqi Jia, Yongqiang Zhang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08010 2026-07-15 cs.CV 版本更新 50%

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

CASHEW: 通过迭代轨迹聚合稳定多模态推理

Chaoyu Li, Fei Tao, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学) NewsBreak

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 56 篇

2606.17253 2026-07-15 cs.AR 版本更新 91%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23781 2026-07-15 cs.CR 版本更新 91%

Leveraging Large Language Models for Trustworthiness Assessment of Web Applications

利用大语言模型评估网络应用的可信度

Oleksandr Yarotskyi, José D'Abruzzo Pereira, João R. Campos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出利用大语言模型自动评估网络应用的可信度,通过比较不同提示工程技术,提出基于逻辑偏好分数的分层质量模型,实验表明规则提示能提高评估可靠性。

Comments Accepted for publication in the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12260 2026-07-15 cs.LG 新提交 90%

From Many to Meaningful: Feature-Guided Zero-Shot Chronic Kidney Disease Screening Using Large Language Models

从众多到有意义:使用大语言模型进行特征引导的零样本慢性肾病筛查

Muhammad Ashad Kabir, Sirajam Munira

机构 * School of Computing, Mathematics and Engineering, Charles Sturt University(查尔斯·斯特尔特大学计算、数学与工程学院) Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究探讨用大语言模型进行零样本慢性肾病筛查的可行性,提出特征引导零样本框架,通过特征选择、序列化患者记录实现。实验表明该框架能提升模型性能,在多数据集有良好泛化性,为CKD筛查提供新方法。

Comments Author-prepared preprint. The Version of Record was published in AIME 2026, Springer, and is available via the DOI

Journal ref Proceedings of the Artificial Intelligence in Medicine (AIME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26052 2026-07-15 cs.CL 版本更新 90%

From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models

从提示风险到响应风险:大型语言模型安全行为的配对分析

Mengya Hu, Qiong Wei, Sandeep Atluri

机构 * Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01311 2026-07-15 cs.CL 版本更新 90%

Catalyst-Agent: Autonomous heterogeneous catalyst screening with an LLM Agent

Catalyst-Agent:基于LLM Agent的自主异质催化剂筛选

Achuth Chandrasekhar, Janghoon Ock, Amir Barati Farimani

机构 * Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学机械工程系,匹兹堡,PA 15213,USA) Department of Chemical and Biomolecular Engineering, University of Nebraska--Lincoln, Lincoln, NE 68588, USA(内布拉斯加大学林肯分校化学与生物分子工程系,林肯,NE 68588,USA)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出Catalyst-Agent,一种基于MCP服务器和LLM的AI代理,通过OPTIMADE API探索材料数据库、利用UMA模型计算吸附能,实现闭环自主催化剂筛选,在ORR、NRR和CO2RR反应中成功率达33-41%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12467 2026-07-15 cs.SE 新提交 89%

Understanding before Naming! Enhancing LLM-based Method Name Prediction with Code Summarization

命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测

Wei Liu, Weisong Sun, Tingting Xu, Hanwei Qian, Yi Zhao, Chunrong Fang, Xia Feng

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 89%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16304 2026-07-15 cs.CR cs.SE 版本更新 89%

An Evaluation of Large Language Models for Detection of Malicious Python Packages

注意差距:评估LLMs在高层面恶意包检测与细粒度指标识别中的表现

Ahmed Ryan, Ibrahim Khalil, Abdullah Al Jahid, Md Erfan, Sungbin Park, Akond Ashfaque Ur Rahman, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了LLMs在恶意包检测与细粒度指标识别中的性能差异,发现通用模型在过滤威胁方面表现优异,但专用编码模型在识别严格结构的攻击时更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏