arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2608.07688 2026-08-11 cs.AI cs.CL cs.CR cs.HC cs.MA 新提交 85%

IntelliAudit: Using Large Language Models to Evaluate Audit Controls

IntelliAudit:使用大语言模型评估审计控制

Allison Wilson, Sina Moradi Sabet, Diar Shakimov, Panteha Shahrivar, Mohammad Reza Bagheri, Dean Konenkamp, Mohammad A. Tayebi

机构 * Coca-Cola(可口可乐公司) Telus(德达斯电信公司)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出基于检索的多智能体系统IntelliAudit,用于辅助IT审计证据评估,在ISO/IEC 27001上的评估显示其可支持审计工作,需作为决策支持工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04339 2026-08-06 cs.CL cs.AI cs.CE stat.ML 新提交 85%

Equitable System-Prompt Selection via Constrained Mixed-Strategy GroupDRO

基于约束混合策略GroupDRO的公平系统提示选择

Mengyu Xu, Qiaoxin Yang, Zhihan Liu, Ruiyao Xu, Zachary Liu, Kezhen Chen, Chongyang Gao

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM不同表述问题的答案质量不均问题,提出约束混合策略GroupDRO框架选择系统提示,在双语医疗和消费金融基准上使LLM的最差损失平均降低13.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13036 2026-07-16 cs.CL cs.AI 新提交 85%

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

诊断前先询问:Safe-Psych,一种用于精神病学领域大语言模型的顺序评估基准

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国立科技大学) Psychiatric Hospital Doctor Gheorghe Preda(格奥尔基·普雷达医生精神病医院) Oslo Metropolitan University(奥斯陆都市大学) Kristiania University of Applied Sciences(克里斯蒂亚尼亚应用科学大学) SimulaMet(SimulaMet公司) Lucian Blaga University of Sibiu(锡比乌卢西安·布拉加大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在精神病学决策支持中处理证据不完整问题,引入顺序评估基准Safe-Psych,通过模拟真实临床记录及精神科医生行动标签,评估多个模型,发现模型存在过早诊断等问题,揭示其局限性,为改善模型安全性研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00918 2026-07-02 cs.CL cs.AI cs.MA 新提交 85%

From Personas to Plot: Character-Grounded Multi-Agent Story Generation for Long-Form Narratives

从角色到情节:基于角色的多智能体长篇小说生成

Aayush Aluru, Chloe Ho, Muhammad Hammouri, Kerry Luo, Myra Malik, Ryan Lagasse, Arjun Bahuguna, Vasu Sharma

机构 * Pocket FM Princeton University(普林斯顿大学) University of Michigan(密歇根大学) University of Maryland(马里兰大学) Universitat Pompeu Fabra(庞培法布拉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出MAGNET多智能体叙事引擎和ATLAS幻觉检测管线,通过角色代理和世界状态追踪,在100页故事中减少41%注释和50%幻觉,实现连贯长篇小说生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31522 2026-07-02 cs.CL cs.AI 新提交 85%

FinPersona-Bench: A Benchmark for Longitudinal Psychometric Stability of Autonomous Financial Agents

FinPersona-Bench: 自主金融代理纵向心理测量稳定性的基准

Muhammad Usman Safder, Ayesha Gull, Rania Elbadry, Fan Zhang, Yankai Chen, Xueqing Peng, Xue, Liu, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) The University of Tokyo(东京大学) McGill University(麦吉尔大学) The Fin AI(Fin AI公司) Kyoto University(京都大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出FinPersona-Bench基准,通过合成市场分离价格与价值,评估LLM金融代理在长期部署中指令显著性衰减现象,发现指令重固化的效果因代理类型和市场环境而异。

Comments 29 pages, includes figures and tables; formalizes Mandate Salience Decay and introduces FinPersona-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30887 2026-07-01 cs.CL cs.AI cs.MA 新提交 85%

Training Therapeutic Judges and Multi-Agent Systems for Human-Aligned Mental Health Support

训练治疗性评判者与多智能体系统以实现人类对齐的心理健康支持

Mizanur Rahman, Abeer Badawi, Elahe Rahimi, Laleh Seyyed-Kalantari, Frank Rudzicz, Enamul Hoque, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) Connected Minds Dalhousie University(达尔豪斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一个框架,通过两阶段训练(TheraJudge评判者与TheraAgent多智能体系统)将治疗性响应生成转化为决策优化问题,显著提升心理健康LLM的治疗质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30790 2026-07-01 cs.CL cs.AI 新提交 85%

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

Indi-RomCoM:评估LLM在罗马化印度语-英语混合指令上的基准测试

Avisha Das, Mihir Parmar, Mohana Ramnath, Pulkit Verma

机构 * Shiv Nadar University Chennai(金奈希夫·纳达尔大学) Google Cloud AI Research(谷歌云人工智能研究) IIT Madras(印度理工学院马德拉斯分校)

专题命中 评测与基准 :LLM(title_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出Indi-RomCoM基准,用于评估大语言模型在罗马化印度语-英语混合指令上的表现,涵盖7个任务、4种语言和3种混合强度,发现模型性能随混合密度增加而下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24950 2026-06-25 cs.LG cs.AI 新提交 85%

MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios

MacroLens:宏观经济情景下的多任务上下文金融推理基准

Patara Trirat, Jin Myung Kwak, Jay Heo, Heejun Lee, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对金融决策中价格、基本面、宏观和文本四信号联合评估的缺失,构建了涵盖4426只美股、七个任务、1130个宏观事件的基准,评估19种方法,揭示上下文特征的重要性。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24523 2026-06-24 cs.CL cs.AI 新提交 85%

Poster: Exploring the Limits of Audio-Based Detection of Turkish Phone Call Scams

海报:探索基于音频的土耳其电话诈骗检测的极限

Arda Eren, Micheal Cheung, Youqian Zhang, Grace Ngai, Eugene Yujun Fu

机构 * The Hong Kong Polytechnic University(香港理工大学) The Education University of Hong Kong(香港教育大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对土耳其语电话诈骗,构建首个多模态数据集(100对音频-文本),评估7个LLM在三种输入条件下的检测性能,发现基于文本的输入优于直接音频处理。

Comments Poster paper accepted at 47th IEEE Security & Privacy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交 85%

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交 85%

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18636 2026-06-18 cs.CL cs.AI 新提交 85%

PEC-Home: Interpretation of Progressively Elliptical Commands in Smart Homes

PEC-Home:智能家居中渐进式省略命令的解释

Yingyu Shan, Zeming Liu, Silin Li, Boao Qian, Jiashu Yao, Yuhang Guo, Haifeng Wang

机构 * Beijing Institute of Technology(北京理工大学) Beihang University(北京航空航天大学) Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对智能家居中用户因共享上下文而使用渐进式省略命令导致的指代和意图歧义问题,提出首个模拟家庭数据集PEC-Home,实验表明现有LLM助手难以准确执行省略命令。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10064 2026-06-10 cs.LG cs.AI 新提交 85%

Bittensor Agent Arenas as a Trajectory Primitive: Distilling a Shopping Agent from ShoppingBench Subnet Traces

Bittensor 智能体竞技场作为轨迹基元:从 ShoppingBench 子网轨迹中蒸馏购物智能体

Shardul Bansal, Seth Schilbe, Jarrod Barnes

机构 * ORO AI Dynamical Systems(动力系统)

专题命中 评测与基准 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI、cs.LG

AI总结 针对小模型后训练缺乏多轮轨迹数据的问题,利用 Bittensor 子网 SN15 的竞技机制生成激励对齐的轨迹,通过结构质量过滤提取智能体轨迹,后训练 Qwen3-4B 模型在 ShoppingBench 上达到 42.7% ASR,接近合成数据基线。

Comments 10 pages, 4 figures, Data and Models available at: https://huggingface.co/collections/oro-ai/shoppingbench-sn15-trajectory-primitive

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07520 2026-06-09 cs.CL cs.LG 新提交 85%

TinyJudge: Unverifiable Constraint Alignment via Lightweight Specialist Ensembles

TinyJudge: 通过轻量级专家集成实现不可验证约束对齐

Yirong Zeng, Yufei Liu, Xiao Ding, Yutai Hou, Yuxian Wang, Wu Ning, Haonan Song, Dandan Tu, Qixun Zhang, Yuxiang He, Bibo Cai, Ting Liu

机构 * Harbin Institute of Technology SCIR Lab(哈尔滨工业大学SCIR实验室) Peking University(北京大学) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对LLM遵循不可验证约束时奖励黑客和计算开销大的问题,提出TinyJudge框架,利用多个小型语言模型集成提供奖励,在五个基准上平均性能提升约10%,奖励精度提升12%,训练速度提升3倍。

Comments ACL 2026 Main Conference;15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03874 2026-08-05 cs.AI cs.CL cs.LG 新提交 85%

ContinualSkillBench: Can LLM Agents Truly Evolve Their Capabilities?

ContinualSkillBench:大语言模型智能体真的能发展其能力吗?

Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi Li, Muhan Zhang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出动态评估框架ContinualSkillBench,发现大语言模型智能体顺序执行可提升任务性能,上下文学习与显式技能维护效果相当,弱模型易积累零散技能,当前机制仍难整合经验为稳健可迁移技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00895 2026-08-04 cs.CR 新提交 85%

Multi-LLM Consensus Framework for Evaluating Banking-Sector NIDS Dataset Coverage of MITRE ATT&CK Techniques

用于评估银行领域NIDS数据集对MITRE ATT&CK技术覆盖度的多大型语言模型(Multi-LLM)共识框架

Sanjida Khanom, Sadia Afrin Khan, Adrita Rahman Tory, Md. Ahsan Habib, Khondokar Fida Hasan

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 该研究提出多大型语言模型共识框架,评估NIDS基准数据集对银行领域MITRE ATT&CK技术的覆盖度,发现UNSW-NB15覆盖得分最高、CIC-DDoS2019盲区大,为行业化NIDS评估奠定基础并推动银行原生数据集研发。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28801 2026-08-03 cs.CL cs.AI cs.LG 新提交 85%

Benchmarks Are Not Monolithic: Sample-Level Auditing and Orchestration for LLM Evaluation

基准并非单一整体:面向大语言模型评估的样本级审计与编排

Philipp D. Siedler, Jordan Sassoon

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出样本级审计的元评估框架,标注五大基准的内部异质性,可编排复合基准子集实现模型能力针对性评估,为基准重组提供原则性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27421 2026-07-31 cs.CL cs.AI cs.LG 新提交 85%

Selecting Open-Weight Language Models for Zero-Shot Intent Classification: A Systematic Evaluation of 41 Models

选择用于零样本意图分类的开放权重语言模型:41种模型的系统评估

Parishruthi Ganesh, Gerry Dozier, Cheryl Seals

专题命中 评测与基准 :language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究通过系统评估41种开放权重语言模型,为意图分类场景下选择符合计算、延迟等约束的模型提供了实用指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24854 2026-07-29 cs.AR cs.PL 新提交 85%

VClare: Resolving Imperfect Specifications in LLM-Based Verilog Generation

VClare:解决基于大语言模型的Verilog生成中的不完美规范

Zhuorui Zhao, Bing Li, Yu Li, Zheyu Yan, Ulf Schlichtmann

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的Verilog生成中不完美规范问题,提出VClare框架,通过规范级和仿真级两种修复范式修复缺陷,利用新基准数据集实验,单模块任务使设计通过率提高12.7%,多模块任务提高13.7%,提升了大语言模型在硬件设计中的应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23505 2026-07-28 cs.NE 新提交 85%

Benchmarking Zero-Shot LLM-Generated Parent Selection in Genetic Programming for Symbolic Regression

用于符号回归的遗传编程中零样本大语言模型生成的亲本选择基准测试

Hengzhe Zhang, Qi Chen, Bing Xue, Wolfgang Banzhaf, Mengjie Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究符号回归遗传编程中零样本大语言模型生成亲本选择算子,在标准框架内对八个模型进行基准测试,比较不同模型生成算子在多个回归基准上的表现,发现Claude Sonnet~4.6和Gemini~3.1 Pro表现出色,证明零样本合成是可行方法。

Comments Accepted at PPSN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23308 2026-07-28 cs.SE 新提交 85%

Towards LLM-assisted High-Quality Property Generation for Solidity Smart Contracts

迈向用于Solidity智能合约的大语言模型辅助的高质量属性生成

Muhammad Wahid, Shahzaib Khan, Mashhood Ali, Muhammad Hassan, Muhammad Naiman Jalil, Affan Rauf

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究利用大语言模型为Solidity智能合约生成高质量属性,通过变异测试衡量属性质量,评估多种提示技术,发现Gemini Pro 1.5结合提示链平均变异得分高,个别合约表现突出,显示大语言模型在属性生成上有潜力达专家水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18144 2026-07-21 cs.LG cs.AI cs.CL 新提交 85%

Do Language Models Dream of Binding Molecules? Benchmarking LLMs under Spatial Constraints

语言模型能否设计出结合分子?在空间约束下对语言模型进行基准测试

Thomas MacDougall, Maksim Kuznetsov, Roman Schutski, Rim Shayakhmetov, Maxim Malkov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

专题命中 评测与基准 :language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨通用语言模型在3D分子设计中应对复杂空间约束的能力,引入3D - Fit评估策略,发现语言模型虽落后于先进方法,但有潜力同时处理多种空间约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14493 2026-07-17 cs.CR 新提交 85%

Context Contamination in LLM Analysis of Network Security Logs: Poison with Passive Prompt Injection and Mitigation Evaluation

网络安全日志的大语言模型分析中的上下文污染:通过被动提示注入进行中毒攻击及缓解评估

Rabimba Karanjai, Yang Lu, Hemanth Hegadehalli Madhavarao, Lei Xu, Weidong Shi

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究网络安全日志大语言模型分析中的上下文污染问题(被动提示注入漏洞),提出LogInject框架评估威胁,通过实验得出攻击成功率等数据,引入上下文拼接技术,评估分层防御效果,揭示需深度防御架构和人工监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11517 2026-07-14 cs.CR 新提交 85%

Graph-Based Structural Evaluation of LLM-Translated Adversary Emulation Procedures

基于图的大语言模型翻译的对手模拟程序结构评估

Ahmed M. Elmisery

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型翻译对手模拟程序的评估问题,核心方法是基于图的结构评估(GBSE),将程序建模为有向属性图并计算归一化图编辑距离,主要贡献是应用于跨平台计划评估,揭示技术差异,框架含多种工具和规则且结果可重现验证。

Comments This technical contribution supports the MITRE white paper titled: Evaluating LLMs for Impact-Faithful Translation of Adversary Behavior Across Operating Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09524 2026-07-13 cs.SE 新提交 85%

Balancing Usefulness and Naturalness: An LLM-based Curation Pipeline for Code Review Comments

平衡有用性和自然性:基于大语言模型的代码审查评论整理管道

Oussama Ben Sghaier, Martin Weyssow, Houari Sahraoui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对现有代码审查数据集质量问题限制大语言模型在代码审查任务中效用的情况,提出两种整理管道。一种用大语言模型重述评论生成CuREV数据集,另一种以高质量示例为指导增强评论真实性和多样性,提升了代码审查数据集质量和下游任务效果。

Comments arXiv admin note: substantial text overlap with arXiv:2502.03425

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06039 2026-07-08 cs.SE 新提交 85%

Automating Quality Assessment with NLP of LLM-Generated Defeaters

利用自然语言处理对大语言模型生成的反驳进行质量评估自动化

Tihomir Rohlinger, Daniel Ratiu, Stefan Wagner

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型生成的反驳质量评估依赖人工且主观的问题,提出结合保证案例图结构特征、语义嵌入和元分类器的自动化评估方法,经案例研究验证,该方法能减少主观差异,为保证案例审查提供决策支持。

Comments 10 pages, 2 figures. Author preprint version of a paper published at ICSRS 2025

Journal ref 2025 9th International Conference on System Reliability and Safety (ICSRS), Turin, Italy, 2025, pp. 101 110

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04374 2026-07-07 eess.SY cs.SY 新提交 85%

An End-to-End Explainable AI Framework with Automated LLM-Based Natural Language Explanation Generation for Energy Systems

一种用于能源系统的基于大语言模型自动生成自然语言解释的端到端可解释人工智能框架

Venkata Sesha Sai Raj Nanduri, Akthar Hussain, Van-Hai Bui

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出端到端可解释人工智能框架,结合预测、解释生成、评估并转化为自然语言文本。用XAI算法生成局部和全局解释,经评估后转化为结构化输入给大语言模型,在能源系统数据集测试,提升黑箱模型可解释性。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04092 2026-07-07 cs.SE 新提交 85%

SEDCoT: Enhancing LLM-Based COBOL Code Translation via Symbolic Execution and Delta Debugging

SEDCoT:通过符号执行和增量调试增强基于大语言模型的COBOL代码翻译

Phillip Entin, Wenchao Gu, Alexander Knapp, Chunyang Chen

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对COBOL代码翻译难题,提出SEDCoT框架。先利用大语言模型初译,再结合符号执行与大语言模型指导生成测试套件修复语义差异,最后用增量调试最小化失败测试,提升翻译性能与可读性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04058 2026-07-07 cs.SE cs.PL 新提交 85%

Kaizen: Metamorphic Fuzzing and Differential Testing for LLM-Translated HPC Applications

Kaizen:用于大语言模型翻译的高性能计算应用的变质模糊测试和差分测试

Oscar Ludwig, Ninad Anklesaria, Zheming Jin, Swaroop Pophale, Kausar Moshood, Christian J. DeVore, Brandon Gill, Cassius Villareal, Keita Teranishi, Manish Motwani

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型驱动的高性能计算应用代码翻译的正确性评估,提出用变质模糊测试和差分测试框架Kaizen,经源码变异、语法输入模糊等生成等价程序,暴露语义差异,评估揭示了编译成功与正确性的关系。

Comments Manuscript under-review at the ACM Transactions on Software Engineering and Methodology (TOSEM) journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03014 2026-07-07 cs.SE 新提交 85%

Detection of LLM-assisted Code Plagiarism Using k-gram Software Birthmarks

使用k-gram软件特征检测大语言模型辅助的代码抄袭

Nikolay Fedorov, Akito Monden, Hiroki Inayoshi, Haruaki Tamada, Masateru Tsunoda

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型辅助下代码抄袭问题,用基于Java操作码唯一k-gram的软件特征,结合三个当代大语言模型及五个相似度度量进行检测,证明其对检测此类抄袭有效。

Comments 11 pages, 4 figures, submitted to the 8th World Symposium on Software Engineering (WSSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏