arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2607.07739 2026-07-10 cs.CR 新提交 89%

Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers

针对基于大语言模型的网络流量分类器的可控性感知对抗样本

Zhenpeng Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01855 2026-07-03 cs.SE 新提交 89%

Regression Accumulation in Multi-Turn LLM Programming Conversations

多轮LLM编程对话中的回归累积

Yonghui, Huang, Lin Ma, Amjed Tahir, Qian Zhang, Liwen Xiao, Lysa Xiao

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01277 2026-07-03 cs.CR 新提交 89%

Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety

认知防火墙:一种主动、零信任、多门控的LLM安全框架

Michele Guida, Ruslan Shikhhamzayev, Sindhuja Penchala, Stefano Iannucci, Jiacheng Li, Shahram Rahimi, Noorbakhsh Amiri Golilarz

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 89%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00910 2026-07-02 cs.MA 新提交 89%

Calibrating the Instrument: Controllability of an LLM-Driven Synthetic Population

校准仪器:LLM驱动的合成人群的可控性

Mirko Degli Esposti

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00555 2026-07-02 cs.SE 新提交 89%

Rise From The Ashes: LLM-based Static Analysis for Deep Learning Framework Bugs

从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析

Shaoyu Yang, Haifeng Lin, Chunrong Fang, Xiang Chen, Wei Cheng, Jiawei Liu, Yiyu Zhang, Hongyu Liu, Zhenyu Chen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32034 2026-07-01 cs.LG cs.AI cs.CL 新提交 89%

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents

QVal:廉价评估长周期LLM智能体的密集监督信号

Sergio Hernández-Gutiérrez, Matteo Merler, Ilze Amanda Auzina, Joschka Strüber, Ameya Prabhu, Matthias Bethge

机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。

Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27666 2026-06-29 cs.AR 新提交 89%

MultModLM: A multi-modal benchmark for Large-Language Model based hardware schematic generation

MultModLM:基于大语言模型的硬件原理图生成的多模态基准

Dhruv Kulkarni, Sai Manoj Pudukotai Dinkarrao

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)

AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27650 2026-06-29 cs.MA 新提交 89%

GenWorld: Empirically Grounded Urban Simulation Infrastructure for Scalable LLM-Agent Studies

GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施

Gen Li, Jieyuan Lan, Pengcheng Xu, Zongyuan Wu, Masaki Ogura, Tao Feng

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。

Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26978 2026-06-26 cs.SE 新提交 89%

To Run or Not to Run: Analyzing the Cost-Effectiveness of Code Execution in LLM-Based Program Repair

运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益

Zhihao Lin, Junhua Zhu, Mingyi Zhou, Xin Wang, Zhensu Sun, Renyu Yang, David Lo, Li Li

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。

Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26937 2026-06-26 cs.HC 新提交 89%

Continuous Behavioral Synthesis for Adaptive Health Dashboards: An LLM-Mediated Architecture Integrating Explicit Preference, Spatial Reorganization, and Attention Allocation Signals

自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构

Tiziano Santilli, Mina Alipour, Mahyar T. Moghaddam

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。

Comments 33 pages, Accepted EICS2026 Patras, Greece

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25296 2026-06-25 cs.AR 新提交 89%

SafeGen: LLM-Driven Assertion Generation and Fault Criticality Evaluation for Functional Safety

SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估

Xuanyi Tan, Arjun Chaudhuri, Rubin Parekhji, Krishnendu Chakrabarty

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。

Comments Accepted by DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24689 2026-06-24 cs.SE 新提交 89%

Automated Summarization of Software Documents: An LLM-based Multi-Agent Approach

软件文档的自动摘要:一种基于LLM的多智能体方法

Duc S. H. Nguyen, Minh T. Nguyen, Phuong T. Nguyen, Juri Di Rocco, Davide Di Ruscio

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出基于大语言模型的多智能体系统Metagente,采用师生架构协作生成软件文档摘要,在真实数据集上优于基线方法,提升需求分析和技术文档的摘要效果。

Comments Paper has been accepted for publication with the Automated Software Engineering journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22961 2026-06-23 cs.IR 新提交 89%

LLM-as-a-Judge for Reliable and Explainable Offline Evaluation in Top-K Recommendation

LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估

Yue Que, Junyi Zhou, Xiaokun Zhang, Haiming Jin, Qiao Xiang, Chen Ma

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21658 2026-06-23 hep-ex astro-ph.IM hep-ph 新提交 89%

Towards LLM-Powered Automation of a Dark Matter Constraint Repository

基于大语言模型的暗物质约束库自动化

Lanqing Yuan, Karthik Ramanathan

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17707 2026-06-17 cs.IR 新提交 89%

Do Generative Recommenders Deepen the Information Cocoon? A Closed-Loop Simulation with LLM-powered User Simulators

生成式推荐器会加深信息茧房吗?基于LLM用户模拟器的闭环仿真

Jiyuan Yang, Gengxin Sun, Mengqi Zhang, Lingjie Wang, Yuanzi Li, Hongxi Cui, Xin Xin, Pengjie Ren

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出闭环仿真框架RecLoop,利用LLM用户代理比较生成式与传统推荐器,发现生成式推荐器在暴露层面不易形成信息茧房,但反馈循环仍会导致编码空间集中,且茧房严重程度取决于分词策略和模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16839 2026-06-16 cs.SE 新提交 89%

Towards LLM Accelerated Rapid Reviews for Software Tool Discovery -- Case for Log Anomaly Detection

面向软件工具发现的LLM加速快速综述——以日志异常检测为例

Jesse Nyyssölä, Hamza Bin Mazhar, Alexander Bakhtin, Matteo Esposito, Nana Reinikainen, Yuqing Wang, Ying Song, Davide Taibi, Mika Mäntylä

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。

Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04828 2026-08-06 cs.CL 新提交 89%

Skill-Use: Can LLMs Actually Use Skills in Agentic Harnesses?

技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?

Jinyi Han, Yuanjian Xu, Ying Liao, Xinyi Wang, Zishang Jiang, Zixiang Di, Fanyang Lu, Zhichao Hu, Yanghua Xiao

机构 * East China Normal University(华东师范大学) Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Tencent Hunyuan(腾讯混元)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03512 2026-08-05 cs.AI 新提交 89%

Reversing Arrows in Large Language Models

反转大语言模型中的箭头

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。

Comments The preprint is under review in a venue

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03154 2026-08-05 cs.CL 新提交 89%

ANCHOR-RE: An Agentic Neuro-Symbolic Framework for Grounded Biomedical Relation Extraction

ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架

Shufan Ming, Yikun Han, Gibong Hong, Rui Zhang, Halil Kilicoglu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。

Comments Submitted to Journal of Biomedical Informatics (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 89%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28137 2026-07-31 cs.CY cs.AI 新提交 89%

Asymmetric Communication: Large Language Models and Language Games

非对称通信:大语言模型与语言游戏

Enzo Fenoglio

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25620 2026-07-29 cs.AI cs.HC 新提交 89%

Beyond Epistemia: Epistemic Schizologia and Large Language Models as Techno-Semiotic Machines

超越认知:认知分裂症与作为技术符号机器的大语言模型

Federico Cabitza, Gianluca Colombo

机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25375 2026-07-29 cs.CL 新提交 89%

Inspect India Evals: An Open Benchmarking Framework for Evaluating Large Language Models in the Indian Linguistic and Cultural Context

印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架

Abhishek Kumar Singh, Shrey Nag, Sachita, Lipi Goel, Rajeshwar Singh Janwar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。

Comments 19 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23538 2026-07-28 cs.CL 新提交 89%

Guiding Language Models to Be More Empathetic: Culturally Sensitive Mental Health Advice Generation Through Human-LLM Collaboration

引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议

Fatema Tuj Johora Faria, Mukaffi Bin Moin, Md. Mahfuzur Rahman, Khan Md Hasib, Jubayer Al Mahmud, M. F. Mridha

机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) Bangladesh University of Business and Technology(孟加拉国商业与技术大学) The University of New South Wales(新南威尔士大学) Jashore University of Science and Technology(贾绍尔科技大学) American International University - Bangladesh(孟加拉国美国国际大学)

专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)

AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20471 2026-07-24 cs.AI 新提交 89%

Benchmarking the Personalization Capabilities of Large Language Models

大型语言模型个性化能力的基准测试

Ashutosh Srivastava, Siddharth Yedlapati, Vinay Aggarwal, Yaman Kumar Singla, Shashwat Dixit, Jitendra Ajmera, Balaji Krishnamurthy

机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20463 2026-07-24 cs.AI 新提交 89%

ClickGuard: Detecting and Spoiling Clickbait News with Informativeness Measures and Large Language Models

ClickGuard:利用信息性度量和大语言模型检测和揭露标题党新闻

Wojciech Michaluk, Tymoteusz Urban, Mateusz Kubita, Soveatin Kuntur, Anna Wróblewska

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文利用信息性度量和大语言模型开发了名为ClickGuard的浏览器扩展,采用混合机器学习架构,结合Transformer嵌入、语言特征和“诱饵性”分数,基于XGBoost建模,能在用户访问前后预警标题党文章,给出可能性分数并解释,还提供文章剧透。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20410 2026-07-23 cs.CL 新提交 89%

LKValues: Aligning Large Language Models with Sri Lankan Societal Values

LKValues:使大语言模型与斯里兰卡社会价值观保持一致

Nethmi Muthugala, Supryadi, Surangika Ranathunga, Nisansa de Silva, Ruijie Tao, Ovindu Gunatunga, Pengyun Zhu, Shaowei Zhang, Jingting Zheng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) Department of Computer Science & Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) Johns Hopkins University(约翰霍普金斯大学) School of Computing, University of Colombo(科伦坡大学计算机学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 研究针对大语言模型价值对齐存在西方文化偏见问题,以斯里兰卡为例,提出LKValues资源套件,通过调查得出社会价值观,构建语料库和评估基准,经实验发现其能改善模型表现,为低资源国家价值对齐提供可复制流程。

Comments 37 pages, 10 figures, and 15 tables. Includes appendices. Datasets are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15517 2026-07-20 cs.CV cs.AI 新提交 89%

SLAPBench: Benchmarking Multimodal Large Language Models for Four-Finger SLAP Fingerprint Verification

SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试

Bibesh Pyakurel, M. G. Sarwar Murshed

机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。

Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14816 2026-07-17 cs.SE cs.AI 新提交 89%

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究

Saima Afrin, Alessandro Midolo, Camilo Escobar-Velásquez, Mario Linares-Vásquez, Weiyuan Ding, Bowen Xu, Massimiliano Di Penta, Antonio Mastropaolo

机构 * University of Catania(卡塔尼亚大学) North Carolina State University(北卡罗来纳州立大学) University of Sannio(萨尼奥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。

详情

展开后加载摘要…

URL PDF HTML 收藏