arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2604.25737 2026-04-29 cs.SE cs.AI 62%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04978 2026-04-29 cs.SE cs.AI cs.CR 62%

Measuring the Permission Gate: A Stress-Test Evaluation of Claude Code's Auto Mode

衡量许可之门:对Claude Code自动模式的压测评估

Zimo Ji, Zongjie Li, Wenyuan Jiang, Yudong Gao, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文通过AmPermBench评估Claude Code自动模式在模糊授权场景下的表现,发现其误判率显著高于生产环境,揭示了系统在处理模糊任务时的覆盖边界问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16419 2026-04-28 cs.SE cs.LG 62%

Can LLMs Find Bugs in Code? An Evaluation from Beginner Errors to Security Vulnerabilities in Python and C++

LLMs能否发现代码中的错误?对Python和C++中初级错误到安全漏洞的评估

Akshay Mhatre, Noujoud Nader, Patrick Diehl, Deepti Gupta

机构 * 1 Dept. of Computer Information Systems, Texas A\&M University - Central Texas, TX, 76549 USA. 2 LSU Center for Computation \& Technology, Louisiana State University, Baton Rouge, LA, 70803 USA. 3 Department of Physics Astronomy, Louisiana State University, Baton Rouge, LA, 70803 USA. 4 Applied Computer Science (CCS-7), Los Alamos National Laboratory, Los Alamos, NM 87545 USA.

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.LG

AI总结 本文评估了三个主流LLM在检测Python和C++中基础错误、经典安全漏洞及生产级bug的有效性,发现其在语法和语义问题上表现良好,但在复杂安全漏洞和大规模代码中性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05984 2026-04-28 cs.LG cs.AI cs.IR 62%

Explainable AI for Mental Disorder Detection via Social Media: A survey and outlook

通过社交媒体进行精神障碍检测的可解释AI:调查与展望

Yusif Ibrahimov, Tarique Anwar, Tommy Yuan

机构 * Department of Computer Science, University of York, Heslington, United Kingdom(英国约克大学计算机科学系) French-Azerbaijani University under Azerbaijan State Oil and Industry University(阿塞拜疆国家石油和工业大学下的法语-阿塞拜疆大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文调查了数据科学、人工智能与心理健康护理的交叉领域,探讨了通过在线社交媒体检测精神障碍的最新进展,并强调了可解释AI在医疗AI中的重要性。

Comments Accepted for publication in IEEE Transactions on Artificial Intelligence. \c{opyright} 2026 IEEE (To appear)

Journal ref IEEE Transactions on Artificial Intelligence, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 62%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18224 2026-04-21 cs.SE cs.AI 62%

WebCompass: Towards Multimodal Web Coding Evaluation for Code Language Models

WebCompass:迈向多模态网络编码评估的代码语言模型

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu

机构 * Nanjing University(南京大学) Kuaishou Technology(快手科技)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 WebCompass提出一个多模态基准测试,用于评估代码语言模型在网络工程中的能力,涵盖生成、编辑和修复三种任务类型,通过多阶段人机协作流程,发现闭源模型在编辑和修复方面表现更优,但美学仍是开放源模型的主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16586 2026-04-21 cs.LG cs.AI q-bio.QM 62%

A Systematic Survey and Benchmark of Deep Learning for Molecular Property Prediction in the Foundation Model Era

在基础模型时代对深度学习用于分子性质预测的系统调查和基准测试

Zongru Li, Xingsheng Chen, Honggang Wen, Regina Qianru Zhang, Ming Li, Xiaojin Zhang, Hongzhi Yin, Qiang Yang, Kwok-Yan Lam, Pietro Lio, Siu-Ming Yiu

机构 * The University of Hong Kong, Hong Kong SAR(香港大学) Nanyang Technological University, Singapore(南洋理工大学) University of Cambridge, United Kingdom(剑桥大学) Zhejiang Normal University, China(浙江师范大学) The Hong Kong University of Science and Technology, Hong Kong SAR(香港科学与技术大学) The University of Queensland(昆士兰大学) The Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文系统调查了深度学习在分子性质预测中的应用,探讨了四种互补范式,并提出了未来三个发展方向,包括物理感知学习、可信推理的基础模型和整合计算与实验数据的基准生态系统。

Comments 32 pages. It is just accepted by Journal of Chemical Theory and Computation 2026

Journal ref Journal of Chemical Theory and Computation 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI 62%

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 62%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11518 2026-04-14 cs.SE cs.AI 62%

From Translation to Superset: Benchmark-Driven Evolution of a Production AI Agent from Rust to Python

从翻译到超集:面向生产AI代理的基准驱动演进:从Rust到Python

Jinhua Wang, Biswa Sengupta

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 本文提出一种基于LLM的持续代码翻译方法,将Rust生产代码库迁移至Python,通过基准驱动迭代优化,实现功能扩展与性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09564 2026-04-14 cs.DC cs.AI cs.SE 62%

ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness

ACE-Bench:一个轻量级的评估 Azure SDK 使用正确性的基准测试

Wenxing Zhu, Simeng Qi, Junkui Chen, Yan Xie, Min Huang, Jingkan He, Xiao Wang, Cheng Chen, Sijing Meng, Tianqi Zhang

机构 * Microsoft(微软)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 ACE-Bench通过将官方文档示例转化为自包含编码任务,提供快速可重复的通过或失败信号,评估基于LLM的编码代理是否正确使用Azure SDK,同时减少评估成本并提高可重复性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08293 2026-04-10 cs.SE cs.AI 62%

CIAO - Code In Architecture Out - Automated Software Architecture Documentation with Large Language Models

CIAO - 代码输入,架构输出 - 利用大语言模型实现自动化软件架构文档生成

Marco De Luca, Tiziano Santilli, Domenico Amalfitano, Anna Rita Fasolino, Patrizio Pelliccione

机构 * University of Naples Federico II(那不勒斯腓特烈二世大学) University of Southern Denmark(南丹麦大学) Gran Sasso Science Institute(格兰萨索科学研究所)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出CIAO方法,利用大语言模型从GitHub仓库自动生成系统级架构文档,基于ISO/IEC/IEEE标准模板,评估显示文档被开发者认为有价值且准确,但存在图表质量和高层次上下文建模的局限。

Comments Manuscript accepted for the 23rd International Conference on Software Architecture (ICSA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04192 2026-04-08 cs.CV cs.AI cs.LG 62%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23448 2026-04-08 cs.SE cs.AI 62%

Code Review Agent Benchmark

代码审查代理基准

Yuntong Zhang, Zhiyuan Pan, Imam Nur Bani Yusuf, Haifeng Ruan, Ridwan Shariffdeen, Abhik Roychoudhury

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出c-CRAB基准,用于评估代码审查代理的能力,发现现有代理仅能解决40%的任务,揭示了未来研究的潜力及人机协作的可能性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02648 2026-04-06 cs.SE cs.AI 62%

GBQA: A Game Benchmark for Evaluating LLMs as Quality Assurance Engineers

GBQA:用于评估LLM作为质量保证工程师的博弈基准

Shufan Jiang, Chios Chen, Zhiyang Chen

机构 * The University of Hong Kong(香港大学) Independent Researcher(独立研究者) Westlake University(西湖大学) Datawhale Org(Datawhale组织)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出GBQA基准,通过30款游戏和124个经人类验证的bug测试LLM自主发现软件缺陷的能力,实验表明最佳模型仅能识别48.39%的bug。

Comments Accepted as a workshop paper at the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02382 2026-04-06 cs.SE cs.AI 62%

Ambig-IaC: Multi-level Disambiguation for Interactive Cloud Infrastructure-as-Code Synthesis

Ambig-IaC:交互式云基础设施即代码合成的多级消歧

Zhenning Yang, Kaden Gruizenga, Tongyuan Miao, Patrick Tser Jern Kon, Hui Guan, Ang Chen

机构 * University of Michigan(密歇根大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 本文提出Ambig-IaC框架,通过多级消歧方法提升IaC配置生成的准确性,针对IaC配置的不可逆性,设计了基于结构分歧的评估框架,在结构和属性评估上分别提升18.4%和25.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01021 2026-04-06 cs.LG cs.AI 62%

Transfer learning for nonparametric Bayesian networks

非参数贝叶斯网络的迁移学习

Rafael Sojo, Pedro Larrañaga, Concha Bielza

机构 * Aingura IIoT Universidad Politécnica de Madrid, Departamento de Inteligencia Artificial(马德里理工大学人工智能系)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出两种非参数贝叶斯网络迁移学习方法,PC-stable-transfer学习和hill climbing transfer学习,通过约束和评分方法提升模型性能,同时引入特定指标解决负迁移问题,最终通过统计检验证明方法有效性。

Comments An earlier version was previously posted on SSRN. This version includes improvements in experiments and evaluation metrics following reviewer comments. Revision submitted to Knowledge-Based Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00059 2026-03-31 cs.LG cs.AI 62%

TextBFGS: A Case-Based Reasoning Approach to Code Optimization via Error-Operator Retrieval

TextBFGS:通过错误-操作符检索的基于案例的推理代码优化方法

Zizheng Zhang, Yuyang Liao, Chen Chen, Jian He, Dun Wu, Qianjin Yu, Yanqin Gao, Jin Yang, Kailai Zhang, Eng Siong Chng, Xionghu Zhong

机构 * Zhongxing Telecom Equipment (ZTE)(中兴通讯股份有限公司) China Mobile(中国移动) Nanyang Technological University (NTU)(南洋理工大学) Hunan University(湖南大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 TextBFGS采用基于案例的推理方法,通过检索历史错误-操作符修正轨迹来优化代码生成,相比无状态方法更高效,显著提升了代码优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27333 2026-03-31 cs.SE cs.AI 62%

ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair

ComBench:一个面向编译错误修复的仓库级真实世界基准

Jia Li, Zeyang Zhuang, Zhuangbin Chen, Yuxin Su, Wei Meng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Sun Yat-sen University(中山大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本文提出ComBench,首个面向C/C++编译错误修复的仓库级真实世界基准,通过自动化框架系统挖掘GitHub CI历史中的真实失败案例,评估12种现代LLM在直接和代理修复设置下的表现,揭示模型在语法正确性与语义正确性上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20637 2026-03-24 cs.SE cs.AI cs.CR 62%

AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing

AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理

Sen Fang, Weiyuan Ding, Zhezhen Cao, Zhou Yang, Bowen Xu

机构 * NC State University(北卡罗来纳州立大学) University of Alberta(阿尔伯塔大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。

Comments 29 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19273 2026-03-23 cs.CL cs.AI 62%

LSR: Linguistic Safety Robustness Benchmark for Low-Resource West African Languages

LSR:低资源西非语言的语言安全鲁棒性基准

Godwin Abuh Faruna

机构 * Fagmart Lab(法格马特实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 LSR是首个评估跨语言拒绝退化现象的基准,针对西非语言中的有害意图表达,发现模型拒绝率从英语的90%降至35-55%,其中Igala语言退化最严重。

Comments 6 pages. Reference implementation: https://huggingface.co/spaces/Faruna01/lsr-dashboard. Dataset: https://huggingface.co/datasets/Faruna01/lsr-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18089 2026-03-20 cs.CV cs.AI cs.LG 62%

CytoSyn: a Foundation Diffusion Model for Histopathology -- Tech Report

CytoSyn:一种用于病理学的基准扩散模型——技术报告

Thomas Duboudin, Xavier Fontaine, Etienne Andrier, Lionel Guillou, Alexandre Filiot, Thalyssa Baiocco-Rodrigues, Antoine Olivier, Alberto Romagnoni, John Klein, Jean-Baptiste Schiratti

机构 * Owkin, Inc(Owkin公司)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CytoSyn,一种先进的潜在扩散模型,用于生成高真实性和多样性的病理H&E染色图像,通过改进方法和训练策略,对比PixCell模型,展示了对预处理细节的敏感性。

Comments 21 pages, 5 figures, tech report, model page: https://huggingface.co/Owkin-Bioptimus/CytoSyn

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14870 2026-03-17 cs.LG cs.AI 62%

IgPose: A Generative Data-Augmented Pipeline for Robust Immunoglobulin-Antigen Binding Prediction

IgPose:一种生成式数据增强管道,用于鲁棒的免疫球蛋白-抗原结合预测

Tien-Cuong Bui, Injae Chung, Wonjun Lee, Junsu Ko, Juyong Lee

机构 * Arontier Co., Ltd.(阿罗尼尔公司) Department of Molecular Medicine and Biopharmaceutical Sciences(分子医学与生物制药科学系) Graduate School of Convergence Science and Technology(融合科学与技术研究生院) Seoul National University(首尔国立大学) Research Institute of Pharmaceutical Science, College of Pharmacy(药学研究 institute,药学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 IgPose通过生成式数据增强管道和结合等效图神经网络等方法,提升免疫球蛋白与抗原结合预测的鲁棒性,实现高通量抗体发现。

Comments 11 pages, 4 figures, Bioinformatics

Journal ref Bioinformatics 42 (2026) btag076

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13287 2026-03-17 cs.LG cs.AI 62%

From Stochastic Answers to Verifiable Reasoning: Interpretable Decision-Making with LLM-Generated Code

从随机答案到可验证推理:利用LLM生成代码的可解释决策

Anirudh Jaidev Mahesh, Ben Griffin, Fuat Alican, Joseph Ternasky, Zakari Salifu, Kelvin Amoaba, Yagiz Ihlamur, Aaron Ontoyin Yin, Aikins Laryea, Afriyie Samuel, Yigit Ihlamur

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Oxford(牛津大学) Vela Research(Vela研究公司) Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 本文提出将LLM视为代码生成器而非实例评估器,通过生成可执行决策逻辑提升决策可解释性与可重复性,在创业资本创始人筛选中实现更高精度与可验证性。

Comments 12 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13903 2026-03-13 cs.CL cs.AI 62%

Let's Verify Math Questions Step by Step

逐步验证数学问题

Chengyu Shen, Zhen Hao Wong, Runming He, Hao Liang, Meiyi Qiang, Zimo Meng, Zhengyang Zhao, Bohan Zeng, Zhengzhou Zhu, Bin Cui, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 ValiMath是一个包含2147个经过人类验证的数学问题的基准测试集,MathQ-Verify是用于验证数学问题正确性的流程,能有效提升数学数据集的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08245 2026-03-12 cs.CL cs.AI cs.HC 62%

Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement

大语言模型心理测量学:评估、验证与增强的系统综述

Haoran Ye, Jing Jin, Yuhang Xie, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了大语言模型的心理测量学,通过整合心理测量工具和理论,提升LLM的评估、理解和增强能力,推动以人类为中心的AI发展。

Comments 400+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.11014 2026-03-12 cs.LG cs.AI 62%

An Updated Assessment of Reinforcement Learning for Macro Placement

宏观布线强化学习的最新评估

Chung-Kuan Cheng, Andrew B. Kahng, Sayak Kundu, Yucheng Wang, Zhiang Wang

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了Google Brain在宏观布线中的深度强化学习方法,展示了更新的CT实现,并分析了预训练指导和基准测试结果。

Comments There are total sixteen pages and two pages for the appendix. It includes six figures and eleven tables. This paper has been accepted and published in IEEE Transactions on CAD

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08806 2026-03-11 cs.SE cs.AI 62%

Test-Driven AI Agent Definition (TDAD): Compiling Tool-Using Agents from Behavioral Specifications

基于行为规范的AI代理定义(TDAD):从行为规范编译工具使用代理

Tzafrir Rehan

机构 * Fiverr Labs(Fiverr 实验室)

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.AI

AI总结 TDAD通过编译行为规范生成可执行测试,确保工具使用代理在生产环境中的行为合规性,提升测试质量和回归安全性。

Comments 9 pages, 2 figures, open benchmark at https://github.com/f-labs-io/tdad-paper-code

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23488 2026-03-10 cs.AI cs.CL 62%

Mapping Overlaps in Benchmarks through Perplexity in the Wild

通过在野 perplexity 映射重叠关系

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06617 2026-03-10 cs.LG cs.AI 62%

Evo: Autoregressive-Diffusion Large Language Models with Evolving Balance

Evo:具有进化平衡的自回归-扩散大语言模型

Junde Wu, Minhao Hu, Jiayuan Zhu, Yuyuan Liu, Tianyi Zhang, Kang Li, Jingkun Chen, Jiazhen Pan, Min Xu, Yueming Jin

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Technical University of Munich(慕尼黑技术大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI、cs.LG

AI总结 Evo通过进化平衡机制,结合自回归和扩散模型,实现高效且高质量的语言生成。

详情

展开后加载摘要…

URL PDF HTML 收藏