arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 1722 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 1722 篇

2603.19185 2026-05-14 cs.LG 57%

MIDST Challenge at SaTML 2025: Membership Inference over Diffusion-models-based Synthetic Tabular data

MIDST挑战赛在SaTML 2025: 基于扩散模型的合成表格数据的成员推断

Masoumeh Shafieinejad, Xi He, Mahshid Alinoori, John Jewell, Sana Ayromlou, Wei Pang, Veronica Chatrath, Gauri Sharma, Deval Pandya

机构 * Vector Institute

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文探讨了基于扩散模型生成的合成表格数据在隐私保护方面的有效性,重点评估其对成员推断攻击的抗性,并开发了针对这些模型的新型攻击方法。

Comments 4 page, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13171 2026-05-14 cs.AI 57%

Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics

形式猜想:一个开放且不断演进的数学验证发现基准

Moritz Firsching, Paul Lezeau, Salvatore Mercuri, Miklós Z. Horváth, Yaël Dillies, Calle Sönne, Eric Wieser, Fred Zhang, Thomas Hubert, Blaise Agüera y Arcas, Pushmeet Kohli

机构 * Google DeepMind(谷歌DeepMind) Imperial College London(帝国理工学院伦敦分校) Stockholms universitet(斯德哥尔摩大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 Formal Conjectures提供2615个形式化的数学问题,包含1029个开放猜想和836个已解决问题,用于评估自动化推理系统的能力,并通过协作项目确保正确性,推动数学证明发现的进展。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12882 2026-05-14 cs.CL cs.CV 57%

CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

CiteVQA:可信赖文档智能的证据归因基准测试

Dongsheng Ma, Jiayu Li, Zhengren Wang, Yijie Wang, Jiahao Kong, Weijun Zeng, Jutao Xiao, Jie Yang, Wentao Zhang, Bin Wang, Conghui He

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 CiteVQA通过要求模型返回元素级边界框引用,评估文档理解中的证据归因,揭示了现有评估方法的可靠性缺口,主要贡献是引入Strict Attributed Accuracy指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12673 2026-05-14 cs.AI cs.CR 57%

Do Androids Dream of Breaking the Game? Systematically Auditing AI Agent Benchmarks with BenchJack

安卓会为打破游戏而做梦吗?通过BenchJack系统性审计AI代理基准

Hao Wang, Hanchen Li, Qiuyang Mang, Alvin Cheung, Koushik Sen, Dawn Song

机构 * UC Berkeley(加州大学伯克利分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出BenchJack系统,通过自动化红队系统审计AI代理基准,发现219种奖励黑客漏洞,提升基准鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11269 2026-05-13 gr-qc astro-ph.HE astro-ph.IM cs.AI 57%

gwBenchmarks: Stress-Testing LLM Agents on High-Precision Gravitational Wave Astronomy

gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试

Tousif Islam, Digvijay Wadekar, Zihan Zhou

机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10890 2026-05-12 cs.SE 57%

CppPerf: An Automated Pipeline and Dataset for Performance-Improving C++ Commits

CppPerf:一个用于性能改进C++提交的自动化流水线和数据集

Tommy Ho, Khashayar Etemadi, Zhendong Su

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出CppPerf-Mine流水线,通过结合结构化提交过滤、LLM分类器和容器化构建测试阶段,挖掘改进执行时间的补丁,并构建包含347个手动验证补丁的CppPerf-DB数据集,评估仓库级修复工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10159 2026-05-12 cs.LG cs.NA math.NA physics.comp-ph 57%

jNO: A JAX Library for Neural Operator and Foundation Model Training

jNO:用于神经算子和基础模型训练的JAX库

Leon Armbruster, Rathan Ramesh, Georg Kruse, Christopher Straub

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 jNO是一个基于JAX的神经算子库,支持数据驱动和物理引导的训练,通过统一的符号语言编译优化流程,实现算子回归、网格感知残差评估和PDE约束训练的无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09636 2026-05-12 cs.AI 57%

PDEAgent-Bench: A Multi-Metric, Multi-Library Benchmark for PDE Solver Generation

PDEAgent-Bench: 一个多指标、多库的PDE求解器生成基准

Zhen Hang, Yushan Yashengjiang, Junhui Li, Huanshuo Dong, Yang Wei, Zhezheng Hao, Jiangtao Ma, Songlin Bai, Haozhong Kai, Xihang Yue, Gangzong Si, Dongming Jiang, Chao Yao, Zhanhua Hu, Jiangqing Zhang, Pengwei Liu, Yaomin Shen, Xingyu Ren, Lei Liu, Zikang Xu, Han Li, Qingsong Yao, Hande Dong, Hong Wang

机构 * University of Science and Technology of China(中国科学技术大学) Tencent(腾讯) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Texas at Dallas(德克萨斯大学达拉斯分校) Arizona State University(亚利桑那州立大学) Rice University(里士满大学) Technical University of Munich(慕尼黑技术大学) Stanford University(斯坦福大学) Alibaba Group(阿里巴巴集团)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 PDEAgent-Bench是首个针对PDE求解器生成的多指标、多库基准,包含645个实例,涵盖6类数学问题和11种PDE家族,评估生成求解器的可执行性、数值精度和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09408 2026-05-12 cs.LG cs.SI stat.ML 57%

GravityGraphSAGE: Link Prediction in Directed Attributed Graphs

GravityGraphSAGE:有向属性图中的链接预测

Riccardo Porcedda, Francesca Chiaromonte, Fabrizio Lillo, Andrea Vandin

机构 * Department of Excellence L’EMbeDS, Sant’Anna School of Advanced Studies(卓越部门L’EMbeDS,圣安娜高级研究学校) Department of Computer Science, University of Pisa(比萨大学计算机科学系) Department of Statistics and Huck Institutes of the Life Sciences, The Pennsylvania State University(统计学与生命科学学院,宾夕法尼亚州立大学) Class of Science, Scuola Normale Superiore(科学班级,正规大学) DTU Technical University of Denmark(丹麦技术大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出Gravity-GraphSAGE模型,通过改进GraphSAGE实现有向链接预测,优于现有图深度学习方法,在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18344 2026-05-01 cs.SE 57%

Forecasting the Maintained Score from the OpenSSF Scorecard: A Study of GitHub Repositories Linked to PyPI Packages

基于OpenSSF评分卡的维护分数预测:对与PyPI包关联的GitHub仓库的研究

Alexandros Tsakpinis, Efe Berk Ergüleç, Emil Schwenger, Alexander Pretschner

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文研究如何通过机器学习和深度学习模型预测OpenSSF评分卡中的维护分数,发现聚合表示如分桶分数和趋势类型能实现较高准确率。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 57%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09408 2026-05-01 cs.AI 57%

HiL-Bench (Human-in-Loop Benchmark): Do Agents Know When to Ask for Help?

HiL-Bench (Human-in-Loop Benchmark): 代理何时该请求帮助?

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto Montoya, Nandan Marwaha, Yannis He, Charles Wang, Fernando Crabedo, Alessa Castilo, Bing Liu

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 HiL-Bench通过评估代理在任务中何时请求帮助的能力,揭示了当前基准测试的不足。核心指标Ask-F1衡量代理在请求与猜测之间的平衡,证明判断力可通过强化学习提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 57%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25109 2026-04-29 cs.CR cs.AI 57%

Structured Security Auditing and Robustness Enhancement for Untrusted Agent Skills

结构化安全审计与不信任代理技能的鲁棒性增强

Lijia Lv, Xuehai Tang, Jie Wen, Jizhong Han, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出SkillGuard-Robust,通过角色感知证据提取、选择性语义验证和一致性保持裁决,解决代理技能预加载审计中语义保持重写下恶意意图识别不一致的问题,实验结果显示其在不同数据集上的高准确率和召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24621 2026-04-28 cs.SE 57%

Evaluation of LLM-Based Software Engineering Tools: Practices, Challenges, and Future Directions

评估基于大语言模型的软件工程工具:实践、挑战与未来方向

Utku Boran Torun, Veli Karakaya, Ali Babar, Eray Tüzün

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 本文探讨了基于大语言模型的软件工程工具的评估问题,分析了现有评估方法的局限性,并提出了未来研究方向以提升评估的可靠性与可扩展性。

Comments Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22871 2026-04-28 cs.CR cs.AI cs.MA 57%

AutoRISE: Agent-Driven Strategy Evolution for Red-Teaming Large Language Models

AutoRISE:面向大语言模型的代理驱动策略进化

Tanmay Gautam, Alireza Bahramali, Sandeep Atluri

机构 * Responsible AI, Microsoft(微软责任人工智能)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 本文提出AutoRISE,通过代理编辑攻击策略并评估,实现攻击策略的进化,提升了对抗成功率。

Comments 36 pages, 6 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22840 2026-04-28 cs.CV cs.CL cs.MM 57%

AeSlides: Incentivizing Aesthetic Layout in LLM-Based Slide Generation via Verifiable Rewards

AeSlides:通过可验证奖励激励基于大语言模型的幻灯片生成中的美观布局

Yiming Pan, Chengwei Hu, Xuancheng Huang, Can Huang, Mingming Zhao, Yuean Bi, Xiaohan Zhang, Aohan Zeng, Linmei Hu

机构 * Beijing Institute of Technology(北京理工大学) Zhipu AI (Z.ai)(智谱AI)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 本文提出AeSlides框架,通过可验证奖励优化幻灯片生成的美观布局,实验表明其在布局合规性、空格减少、元素碰撞和视觉平衡方面均优于现有方法。

Comments 21 pages, 25 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22834 2026-04-28 cs.CV cs.LG 57%

WebSerial Vision Training for Microcontrollers: A Browser-Based Companion to On-Device CNN Training

为微控制器的WebSerial视觉训练:一种浏览器基于的设备端CNN训练配套工具

Jeremy Ellis

机构 * High School Robotics Educator(高中机器人教育者)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出webmcu-vision-web,一种浏览器应用,用于在Seeed Studio XIAO ESP32-S3 Sense上端到端训练和部署TinyML视觉模型,提供本地机器学习流程,无需软件安装,支持实时激活可视化,实现快速训练部署。

Comments 29 pages, 16 figures, 5 tables. Paper 2 of the webmcu-ai series. All source code and supplemental results available at: https://github.com/webmcu-ai/webmcu-vision-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22454 2026-04-27 cs.SE 57%

Gamifying Architectural Governance to Reduce Organizational Coupling in Microservice Systems

通过游戏化实现建筑治理以减少微服务系统中的组织耦合

Xiaozhou Li

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 本文提出通过游戏化手段影响开发者行为,减少微服务系统中的组织耦合,采用游戏化框架持续挖掘代码库数据以检测架构边界违规,提升架构可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21095 2026-04-24 cs.DC cs.SE q-bio.GN 57%

TorchGWAS : GPU-accelerated GWAS for thousands of quantitative phenotypes

TorchGWAS:用于数千种定量表型的GPU加速GWAS

Xingzhong Zhao, Ziqian Xie, Islam, Sheikh Muhammad Saiful, Tian Xia, Chen, Cheng, Degui Zhi

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 TorchGWAS通过GPU加速实现大规模表型面板的高通量关联测试,显著提升处理效率,适用于需高效评估数千种定量性状的场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13697 2026-04-23 cs.LG 57%

Splitting criteria for ordinal decision trees: an experimental study

序数决策树的分裂标准:一项实证研究

Rafael Ayllón-Gavilán, Francisco José Martínez-Estudillo, David Guijo-Rubio, César Hervás-Martínez, Pedro Antonio Gutiérrez

机构 * Department of Clinical-Epidemiological Research in Primary Care, IMIBIC(初级保健临床流行病学研究部门,IMIBIC) Department of Quantitative Methods, Universidad Loyola Andalucía(定量方法部门,洛伊亚安达卢西亚大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文通过实验证明序数分裂标准在决策树中的有效性,发现Ordinal Gini在减少均方误差方面表现最佳,同时提供了可复现的研究资源。

Comments 33 pages, 4 figures, 6 tables

Journal ref Pattern Recognition, Volume 171, Part B, March 2026, 112273

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18148 2026-04-21 cs.CV cs.LG 57%

Attention-ResUNet for Automated Fetal Head Segmentation

基于注意力机制的ResUNet用于自动胎儿头部分割

Ammar Bhilwarawala, Mainak Bandyopadhyay

机构 * School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(计算机工程学院,KIIT大学,比哈尔邦,印度)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本文提出Attention-ResUNet,通过残差学习与多尺度注意力机制提升胎儿头部分割精度,实验表明其在HC18数据集上Dice得分达99.30%,优于其他基线模型。

Comments Accepted and Presented at ANTIC 2025, IIITM Gwalior (5th International Conference on Advanced Network Technologies and Intelligent Computing) on 23rd December 2025. Presented with the best paper award in Image Processing Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13099 2026-04-21 cs.CL 57%

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

Alexandria:一个多领域方言阿拉伯语机器翻译数据集,用于文化包容和语言多样性的LLM

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan Saadie, Hamzah Alsayadi, Nadia Ghezaiel Hammouda, Alshima Alkhazimi, Aya Hamod, Al-Yas Al-Ghafri, Wesam El-Sayed, Asila Al sharji, Mohamad Ballout, Anas Belfathi, Karim Ghaddar, Serry Sibaee, Alaa Aoun, Areej Asiri, Lina Abureesh, Ahlam Bashiti, Majdal Yousef, Abdulaziz Hafiz, Yehdih Mohamed, Emira Hamedtou, Brakehe Brahim, Rahaf Alhamouri, Youssef Nafea, Aya El Aatar, Walid Al-Dhabyani, Emhemed Hamed, Sara Shatnawi, Fakhraddin Alwajih, Khalid Elkhidir, Ashwag Alasmari, Abdurrahman Gerrio, Omar Alshahri, AbdelRahim A. Elmadany, Ismail Berrada, Amir Azad Adli Alkathiri, Fadi A Zaraket, Mustafa Jarrar, Yahya Mohamed El Hadj, Hassan Alhuzali, Muhammad Abdul-Mageed

机构 * The University of British Columbia(不列颠哥伦比亚大学) Canada Research Chair in NLP and ML(自然语言处理和机器学习研究主席) Mohammed VI Polytechnic University(穆莱·阿卜杜勒阿齐兹国王理工学院) Birzeit University(比尔泽特大学) Western Michigan University(西部密歇根大学) Tuwaiq Academy(图瓦伊克学院) King Khalid University(国王卡利德大学) American University of Beirut(贝鲁特美国大学) Ibb University(伊卜大学) University of Hail(海勒大学) University of Technology and Applied Sciences(技术与应用科学大学) Arab Open University(阿拉伯开放大学) Minia University(米尼亚大学) Nantes University(南特大学) Prince Sultan University(沙特王子大学) Umm Al-Qura University(乌姆·阿勒·卡拉大学) University of Nouakchott(努尔人大学) Fatabyyano(法塔比亚诺) Independent Researcher(独立研究者) Hadhramout University(哈德拉姆大学) Cairo University(开罗大学) Misurata University(米斯拉塔大学) Al-Balqa Applied University(巴勒斯坦应用大学) University of Khartoum(喀土穆大学) Sultan Qaboos Higher Centre for Culture and Science(穆罕默德·本·拉希德·阿勒马克图姆文化与科学高级中心) Arab Center for Research and Policy Studies(阿拉伯研究中心) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Institut Supérieur du Numérique(数字高级学院)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Alexandria数据集通过多领域方言阿拉伯语对话数据,提升LLM在不同阿拉伯方言中的翻译能力,揭示现有模型在方言翻译中的挑战。

Comments Accepted to ACL 2026 Main; Project resources will be available here: https://github.com/UBC-NLP/Alexandria

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12782 2026-04-21 cs.AI 57%

HeroBench: A Benchmark for Long-Horizon Planning and Structured Reasoning in Virtual Worlds

HeroBench:一个用于虚拟世界中长horizon规划和结构化推理的基准测试

Petr Anokhin, Roman Khalikov, Stefan Rebrikov, Viktor Volkov, Artyom Sorokin, Vincent Bissonnette

机构 * Artyom Sorokin(AXXX) Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学) Higher School of Economics(高等经济学院) Kurchatov Institute(库尔斯克研究所) Independent Researcher(独立研究者)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文提出HeroBench,用于评估在复杂RPG-inspired虚拟世界中长horizon分层规划和结构化推理的能力,通过模拟评估可执行计划,揭示了现有大型语言模型在长horizon自主规划中的性能差异和挑战。

Comments Code is available at https://github.com/stefanrer/HeroBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15151 2026-04-17 cs.CL 57%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 代码评测 :code generation(abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14828 2026-04-17 cs.CL 57%

Pangu-ACE: Adaptive Cascaded Experts for Educational Response Generation on EduBench

Pangu-ACE:适应性级联专家用于EduBench教育响应生成

Dinghao Li, Wenlong Zhou, Zhimin Chen, Yuehan Peng, Hong Ni, Chengfu Zou, Guoyu Shi, Yaochen Li

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 Pangu-ACE通过级联专家系统提升教育响应质量,在EduBench基准上实现更高效的计算分配,改进确定性和格式有效性,同时保持较低的直接请求比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13413 2026-04-16 cs.LG 57%

Dataset-Level Metrics Attenuate Non-Determinism: A Fine-Grained Non-Determinism Evaluation in Diffusion Language Models

数据层面指标削弱非确定性:扩散语言模型中的细粒度非确定性评估

Zhengyu Fang, Zhimeng Jiang, Huiyuan Chen, Xiaoge Zhang, Tianyi Li, Kaiyu Tang, Xiao Li, Jing Li

机构 * Department of Computer Data Sciences, Case Western Reserve University, Cleveland, USA Department of Computer Science \& Engineering, Texas A\&M University, College Station, USA Department of Biochemistry, Case Western Reserve University, Cleveland, USA Center for RNA Science Therapeutics, Case Western Reserve University, Cleveland, USA Department of Biomedical Engineering, Case Western Reserve University, Cleveland, USA

专题命中 代码评测 :code generation(abstract);分类 cs.LG

AI总结 本文研究了扩散语言模型中非确定性问题,指出数据层面指标限制了对模型行为变化的洞察,并提出基于样本级预测差异的细粒度评估方法,揭示了非确定性在代码生成中的高敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12978 2026-04-15 cs.CL cs.CV 57%

GlotOCR Bench: OCR Models Still Struggle Beyond a Handful of Unicode Scripts

GlotOCR Bench: OCR模型在超过少数Unicode脚本之外仍面临困难

Amir Hossein Kargaran, Nafiseh Nikeghbal, Jana Diesner, François Yvon, Hinrich Schütze

机构 * LMU Munich(慕尼黑大学) TU Munich(慕尼黑工业大学) MCML Sorbonne Université & CNRS, ISIR(索邦大学与CNRS,ISIR)

专题命中 代码评测 :repository(abstract);分类 cs.CL

AI总结 GlotOCR Bench评估OCR在100+Unicode脚本上的泛化能力,发现大多数模型在少于十种脚本上表现良好,最强模型也难以泛化到三十种以上脚本,表明当前OCR系统依赖语言模型预训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12902 2026-04-15 cs.PL cs.DC cs.PF 57%

Towards a Linear-Algebraic Hypervisor

向线性代数虚拟机迈进

Breandan Considine

专题命中 代码评测 :program synthesis(abstract);分类 cs.PL

AI总结 本文提出一种并行虚拟机,通过评估数百万个并发数组程序,发现其在相对传统顺序评估的情况下可达到147倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12875 2026-04-15 cs.AI 57%

AISafetyBenchExplorer: A Metric-Aware Catalogue of AI Safety Benchmarks Reveals Fragmented Measurement and Weak Benchmark Governance

AISafetyBenchExplorer:一个基于指标的AI安全基准目录揭示了测量碎片化和弱基准治理

Abiodun A. Solanke

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本文提出AISafetyBenchExplorer,通过多表结构记录195个AI安全基准的元数据、指标定义等,揭示当前基准体系中测量标准化滞后于基准繁衍的问题,强调碎片化而非稀缺性是领域的主要失败模式。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏