arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

共收录 865 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 111 篇

2607.06796 2026-07-09 cs.LG cs.AI 新提交 62%

Enhancing deep learning models for time series classification via knowledge distillation

通过知识蒸馏增强用于时间序列分类的深度学习模型

Javidan Abdullayev, Maxime Devanne, Jonathan Weber, Germain Forestier

机构 * IRIMAS, University of Haute Alsace(IRIMAS,法国高等教育高级阿列省大学) Faculty of IT, Monash University(信息技术学院,莫纳什大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 研究知识蒸馏用于时间序列分类的有效性,在FCN、Inception和ConvTran三种架构上评估,修改组件后在UCR Archive数据集测试,发现对中等复杂度学生模型效果最佳,不同模型经蒸馏有不同程度参数减少和性能提升,并提供实现代码。

Comments Published version. Open access under CC BY 4.0. 24 pages, 11 figures

Journal ref Knowledge and Information Systems, Volume 68, Article 215, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06505 2026-07-08 cs.SE cs.AI cs.DB 新提交 62%

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

使用北美行业分类系统(NAICS)对GitHub仓库进行行业分类

Kevin Xu, Alexander Quispe

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究利用北美行业分类系统对GitHub仓库进行行业分类,提出结合多种技术的检索与验证管道生成标签,构建NAICS-GH语料库,测试表明标签精度高,还对预训练编码器进行基准测试,相关数据和代码开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06125 2026-07-08 cs.SE cs.AI cs.CR 新提交 62%

Evaluating Fine-Tuning and Metrics for Neural Decompilation of Dart AOT Binaries

评估Dart AOT二进制文件神经反编译的微调与指标

Raafat Abualazm, Ayman AboElhassan, Amr G. Wassal

机构 * Cairo University Computer Engineering Department, Faculty of Engineering(开罗大学计算机工程系,工程学院)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 研究针对Dart AOT二进制文件神经反编译,在新基准上用三个指标评估六种微调模型变体,发现无微调配置能显著提升pass@k,存在跨语言干扰及指标差异,指出汇编序列长度是任务难度关键预测指标,贡献新基准等并明确pass@k为主要评估指标。

Comments Under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 62%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05443 2026-07-08 cs.IR cs.AI cs.SE 新提交 62%

Scientific Code Search at Scale: A Multi-Domain Dataset and Benchmark

大规模科学代码搜索:多领域数据集与基准测试

Nishan Pantha, Pranath Reddy Kumbam, Sajil Awale, Pushwitha Krishnappa, Muthukumaran Ramasubramanian, Nidhi Jha, Emily Foshee, Ankur Kumar, Rachel Slank, Ashkbiz Danehkar, Rahul Ramachandran

机构 * The University of Alabama in Huntsville (UAH)(阿拉巴马大学亨茨维尔分校) Universities Space Research Association (USRA)(大学空间研究协会) NASA Marshall Space Flight Center(美国国家航空航天局马歇尔太空飞行中心)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对科学家在众多GitHub库中找相关软件难的问题,构建含多领域科学存储库的语料库,引入存储库搜索及代码片段检索两个基准测试,揭示不同领域性能差异,相关数据集和基准已公开,助力科学工具发现研究。

Comments Datasets and benchmarks publicly released on HuggingFace. Code released on GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14948 2026-07-08 cs.SE cs.AI 新提交 62%

Beyond Correctness: Enhancing Architectural Reasoning in Code LLMs via Scalable Labeling with Agentic Judgment

超越正确性:通过可扩展的智能体判断标注增强代码大模型的架构推理能力

Kirill Vasilevski, Ximing Dong, Benjamin Rombaut, Milad Soltany, Ruochen Deng, Jiahuei Lin, Arthur Leung, Dayi Lin, Boyuan Chen, Shaowei Wang, Ahmed E. Hassan

机构 * Centre for Software Excellence, Huawei Canada(华为加拿大软件卓越中心) Department of Computer Science, University of Manitoba, Canada(曼尼托巴大学计算机科学系) School of Computing, Queen’s University, Canada(皇后大学计算科学学院)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 针对代码大模型缺乏架构理解的问题,提出智能体判断流水线,利用强LLM作为专家架构评估的代理,通过两个判断器(ACJ和AQJ)实现可扩展标注,微调模型在SWE-bench上提升高达540%,并展现跨语言泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04912 2026-07-07 cs.CV cs.AI cs.LG 新提交 62%

Graph Representation Learning of Longitudinal Medical Imaging Trajectories for Treatment Response Prediction

用于治疗反应预测的纵向医学影像轨迹的图表示学习

Johannes Kiechle, Richard Osuala, Daniel M. Lang, Stefan M. Fischer, Ivana Janíčková, Karim Lekadir, Julia A. Schnabel, Jan C. Peeken

机构 * Technical University of Munich(慕尼黑工业大学) TUM University Hospital Rechts der Isar(慕尼黑工业大学伊萨尔河右岸大学医院) Helmholtz Munich(慕尼黑亥姆霍兹中心) Universitat de Barcelona(巴塞罗那大学) Medical University of Vienna(维也纳医科大学) King’s College London(伦敦国王学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 代码评测 :repository(abstract);分类 cs.AI、cs.LG

AI总结 针对乳腺癌患者新辅助化疗治疗反应预测难题,提出基于影像的3D时空框架,集成图神经网络及时空交互关系建模与新自监督目标,实验表明该方法性能优越,还建立了预测基准并评估相关影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03377 2026-07-07 cs.CL cs.AI 新提交 62%

Spectral Signatures of Large Language Models

大语言模型的频谱特征

Zhuoying Zhang, Ishan V. Prasad, Yuanzhe Hu, Zihang Liu, Hengrui Luo, Pu Ren, Yaoqing Yang

机构 * Rice University(莱斯大学) Dartmouth College(达特茅斯学院) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 针对大规模管理和量化大语言模型的挑战,采用基于重尾自正则化理论的频谱形状指标,以权重经验谱密度形状信息为模型频谱特征,可用于模型谱系追踪等,还构建语料库进行基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 62%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31179 2026-07-01 cs.AI cs.CL cs.CV 新提交 62%

HealthAgentBench: A Unified Benchmark Suite of Realistic Agentic Healthcare Environments for Challenging Frontier AI Agents

HealthAgentBench:面向挑战性前沿AI代理的统一真实医疗环境基准套件

Qianchu Liu, Sheng Zhang, Guanghui Qin, Jeya Maria Jose Valanarasu, Maximilian Rokuss, Mingyu Lu, Timothy Ossowski, Juan Manuel Zambrano Chaves, Cliff Wong, Peniel Argaw, Yashna Hasija, Mu Wei, Wen-wai Yim, Qin Liu, Zilin Jing, Jason Entenmann, Naoto Usuyama, Tristan Naumann, Hoifung Poon

机构 * Microsoft(微软)

专题命中 代码评测 :code model(abstract);分类 cs.CL、cs.AI

AI总结 提出包含54个医疗任务的基准套件HealthAgentBench,评估AI代理在真实临床工作流中的端到端多步推理能力,最强代理Codex GPT-5.5仅达42%成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27679 2026-06-29 cs.CL cs.AI 新提交 62%

From Signals to Transfer: A Factorised Study of Probe-Based Uncertainty Estimation in Large Language Models

从信号到迁移:基于探针的大语言模型不确定性估计的分解研究

Ponhvoan Srey, Xiaobao Wu, Cong-Duy Nguyen, Quang Minh Nguyen, Duc Anh Vu, Anh Tuan Luu

机构 * Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学) VinUniversity KAIST(韩国科学技术院)

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 通过分解研究,发现原始隐藏状态和注意力特征在域内表现优异,但结构化压缩特征在分布偏移下更鲁棒,提示和标签构建显著影响探针行为,并训练出可迁移的预训练探针。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26859 2026-06-29 cs.AI cs.CL cs.IR 新提交 62%

AgentX: Towards Agent-Driven Self-Iteration of Industrial Recommender Systems

AgentX:迈向智能体驱动的工业推荐系统自迭代

Changxin Lao, Fei Pan, Guozhuang Ma, Han Li, Huihuang Lin, Jijun Shi, Kangzhi Zhao, Kun Gai, Mo Zhou, Qinqin Zhou, Quan Chen, Ruochen Yang, Shifu Bie, Shijie Yi, Shuang Yang, Shuo Yang, Wenhao Li, Wentao Xie, Xiao Lv, Xuming Wang, Yijun Wang, Yiming Chen, Yusheng Huang, Zhongyuan Wang, Zibo Zhao, Zijie Zhuang, Baoning Xia, Chao Liu, Chaoyi Ma, Chubo He, Dawei Cong, Feng Jiang, Gang Wang, Guilin Xia, Hanwen Xu, Jiahong Xie, Jiahui Qiao, Jian Liang, Jiangfan Yue, Jing Wang, Jinghan Yang, Jinghui Jia, Kan Qin, Lei Wang, Ming Li, Peilin Song, Pengbo Xu, Qiang Luo, Ruiming Tang, Shiyang Liu, Shuxian Jin, Tao Wang, Tao Zhang, Xiang Gao, Xianghan Li, Yingsong Luo, Yiwen Ning, Yongcheng Liu, Yueyang Liu, Yuan Guo, Zhaojie Liu, Zhenkai Cui

专题命中 代码评测 :repository(abstract);分类 cs.CL、cs.AI

AI总结 提出AgentX多智能体系统,通过闭环迭代自动生成、实施、评估推荐实验,实现工业推荐系统的自进化,突破人工瓶颈。

Comments Authors are listed alphabetically by their first name

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26852 2026-06-26 cs.AI cs.SE 新提交 62%

Context-Aware Synthesis of Optimization Pipelines for Warehouse Optimization

面向仓库优化的上下文感知优化流水线合成

Janik Bischoff, Anne Meyer, Uta Mohring, Fabian Dunke, Maximilian Barlang, Özge Nur Subas, Hadi Kutabi, Stefan Nickel, Kai Furmans

机构 * Institute for Information Management in Engineering, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院信息管理工程研究所) Department of Business Administration, University of Zurich(苏黎世大学工商管理系) Institute for Operations Research, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院运筹学研究所)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出CASOP框架,通过模块化算法库、语义卡片、问题分类、流水线合成与评估,自动生成并评估针对特定仓库上下文的优化流水线,在7个基准集上验证了1063044条有效流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22906 2026-06-23 cs.SE cs.AI 新提交 62%

From Fragments to Paths: Task-Level Context Recovery for Large Industrial Codebases

从片段到路径:大型工业代码库的任务级上下文恢复

Jiawei He, Weisong Sun, Mengyu Shi, Jie Jia, Tong Bian, Xikai Yang, Dong Sun

机构 * AMAP, Alibaba Group(阿里集团AMAP) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) University of Cambridge(剑桥大学)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 提出DeepDiscovery方法,通过两阶段定位-推理框架在预算约束下恢复任务级上下文,显著提升大型工业代码库的文件检索和下游软件工程任务性能。

Comments 12 pages, 3figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 62%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16988 2026-06-16 cs.SE cs.LG 新提交 62%

Agent trajectories as programs: fingerprinting and programming coding-agent behavior

智能体轨迹作为程序:编码智能体行为的指纹识别与编程

Hamidah Oderinwale

机构 * McGill University(麦吉尔大学) Taste Labs

专题命中 代码评测 :coding agent(abstract);分类 cs.SE、cs.LG

AI总结 提出通过程序性表示分析智能体行为模式,实现轨迹指纹识别(85.7%准确率),并开发ProcGrep库用于审计和评估智能体任务处理过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交 62%

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI、cs.LG

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 62%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 代码评测 :code generation(abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09800 2026-06-09 cs.SE cs.AI cs.MA 新提交 62%

FASE: Fast Adaptive Semantic Entropy for Code Quality

FASE: 用于代码质量的快速自适应语义熵

Shizhe Lin, Ladan Tahvildari

机构 * University of Waterloo(滑铁卢大学)

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 提出快速自适应语义熵(FASE),通过最小生成树近似功能正确性,在HumanEval和BigCodeBench上相比现有语义熵方法在Spearman相关性和ROCAUC上分别提升25%和19%,且计算开销仅为传统方法的0.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08840 2026-06-09 cs.AI cs.SE 新提交 62%

Beyond Pass Rate: A Multilingual, Execution-Grounded Evaluation of Open Code LLMs

超越通过率:开放代码大语言模型的多语言、执行基础评估

Sayed Erfan Arefin

机构 * Sayed Erfan Arefin

专题命中 代码评测 :code generation(abstract);分类 cs.SE、cs.AI

AI总结 针对12种编程语言的2707道LeetCode问题,评估9个开放代码LLM,发现最佳模型Yi-Coder-9B-Chat的正确率仅23.64%,远低于人类57.2%的基准,且排名因问题难度和语言而异,编译错误占失败原因的63.25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06413 2026-07-08 stat.ME cs.AI 新提交 61%

An Experimental Design Approach to Evaluating Agentic AI's Autonomous Model Discovery

一种评估智能体人工智能自主模型发现的实验设计方法

Hao He, Xueying Liu, Chris J. Kuhlman, Xinwei Deng

机构 * Department of Statistics, Virginia Tech(统计学系,弗吉尼亚理工学院) Department of Statistical Science, Baylor University(统计科学系,贝勒大学) Advanced Research Computing, Virginia Tech(高级研究计算,弗吉尼亚理工学院)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI;repository(comments)

AI总结 研究大型语言模型编码智能体自主模型发现行为,提出实验设计与分析框架,将智能体视为随机模型发现算子,在多种受控因素下研究Codex和Claude Code两个算子,进行回归模型和推理,开发规范分解,通过网络造词游戏测试平台得出相关深刻发现。

Comments 39 pages, 11 figures, 6 tables. Data and code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13928 2026-08-17 cs.CR cs.SE 新提交 57%

CoSA: Context-Aware Severity Assessment via Context Analysis with Large Language Models

CoSA:基于大语言模型的上下文分析实现上下文感知的漏洞严重程度评估

Jinfeng Jiang, Yikun Li, Chengran Yang, Ting Zhang, Wen Bin Leow, Yide Yin, Eng Lieh Ouh, Lwin Khin Shar, David Lo

专题命中 代码评测 :repository(abstract);分类 cs.SE

AI总结 CoSA是一种基于大语言模型的上下文感知漏洞严重程度评估方法,通过两阶段仓库剪枝策略与Transformer预测器,在6816个CVSS标注实例上较最优基线提升了14.4%准确率与15.3% Macro-F1

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13077 2026-08-14 cs.SE 新提交 57%

How Powerful are LLMs in Generating Formal Program Specifications?

大型语言模型在生成形式化程序规约方面的能力有多强?

Fanpeng Yang, Xing Li, Shuling Wang, Jie An, Zeyu Sun, Shenghua Feng, Wenhan Wang, Weiyi Wang, Naijun Zhan, Fanjiang Xu

专题命中 代码评测 :code generation(abstract);分类 cs.SE

AI总结 该研究引入基于Rocq的Coins评估框架,在HumanEval数据集上开展大规模研究,发现LLMs生成形式化程序规约仍具挑战,准确的规约评估是理解其能力的核心。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12805 2026-08-14 cs.LG 新提交 57%

CoMedBench: A Multi-Source Benchmark of Synthetic Medical Data Fidelity and Downstream Utility

CoMedBench:合成医疗数据保真度与下游效用的多源基准

Akanta Das, Al Amin Farhad, Mrinmoy Sarkar Anto, David Rehkopf, Ayin Vala, Tanmoy Sarkar Pias

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 CoMedBench是涵盖多源合成医疗数据的可复现基准,评估多生成器在静态表格和时序ICU任务上的保真度与下游效用,实验显示合成数据可保留多数下游信号,不同生成器表现存在差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12262 2026-08-13 cs.CV cs.AI 新提交 57%

Diagram-MMU: A Multi-Modal Benchmark for Scientific Diagrams

Diagram-MMU:面向科学图表的多模态基准测试

Weihao Bo, Shan Zhang, Yanpeng Sun, Jie Liu, Yongke Yao, Jinhao Du, Wei He, Kai Zou, Zechao Li, Jingdong Wang

机构 * Nanjing University of Science and Technology(南京理工大学) Baidu Inc(百度公司) AIML, Adelaide University(阿德莱德大学AIML) SUTD(新加坡科技设计大学) Southeast University(东南大学) East China Normal University(华东师范大学) University of Oxford(牛津大学)

专题命中 代码评测 :code generation(abstract);分类 cs.AI

AI总结 本文构建了多模态基准测试Diagram-MMU,评估MLLMs的科学图表解析与理解能力,发现图表转代码任务更具挑战,Claude-4.6 Opus在智能体场景下表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11216 2026-08-13 cs.AI 新提交 57%

AutoWorldModel-Bench: A State-Centric Benchmark for Automated World-Model Research

AutoWorldModel-Bench:面向自动化世界模型研究的以状态为中心的基准

Marjan Moodi, Xuankang Zhu, Fernando De Mesentier Silva, Harold Chaput, Mohammad Reza Taesiri

机构 * Electronic Arts(美国艺电公司) Simon Fraser University(西蒙菲莎大学)

专题命中 代码评测 :coding agent(abstract);分类 cs.AI

AI总结 AutoWorldModel-Bench是面向AI编码智能体的闭环基准,涵盖8个游戏环境,采用结构化状态表征,64次会话中多数智能体通过研究式修改改进了世界模型,可评估智能体的开放式研究能力。

Comments Project page: https://electronicarts.github.io/AutoWorldModelBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10145 2026-08-12 cs.LG 新提交 57%

The Evaluation Protocol Determines the Result: An Independent Reproduction of LeWorldModel on TwoRoom

评估协议决定结果:在TwoRoom上独立复现LeWorldModel

Joyjeet Singh

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。

Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08184 2026-08-11 cs.AI 新提交 57%

Large Multimodal Agents for Intelligent Transportation Systems: Architectures, Evidence, and Deployment Challenges

面向智能交通系统的大型多模态智能体:架构、证据与部署挑战

Muhammad Ayub Sabir, Shaohong Zheng, Zhiyu Qu, Fatima Ashraf, Junbiao Pang

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 本综述梳理2023-2026年42个LMAs研究家族,评估其在ITS中的多模态性、性能与部署情况,支持有限编排而非替代,提供评估协议与部署路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06183 2026-08-07 cs.AI 新提交 57%

MicroEvo: Knowledge-Guided LLM Sampling for Efficient Microarchitecture Design Space Exploration

MicroEvo:知识引导的大语言模型采样用于高效微架构设计空间探索

Jia Xiong, Runkai Li, Chenxu Niu, Guangyuan Gao, Changwen Xing, Yifan Zhang, Xinlai Wan, Jieran Cui, Chen Bai, Yusheng Hua, Ying Wang, Ming Ling, Xi Wang, Tao Xie

机构 * Southeast University(东南大学) National Center of Technology Innovation for EDA(国家EDA技术创新中心) NVIDIA Corporation(英伟达公司) Fudan University(复旦大学) Nanjing University of Posts and Telecommunications(南京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Peking University(北京大学)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 MicroEvo是结合LLM与MCTS的知识引导框架,用于多目标微架构优化,可提升帕累托前沿质量与搜索效率,具备工业级可扩展性。

Comments Accepted by ICCAD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03482 2026-08-05 cs.LG stat.ML 新提交 57%

Beyond the Gegenbauer Paradigm: q-Orthogonal Kernels for Machine Learning

超越盖根鲍尔范式:面向机器学习的q正交核

Álvaro Sánchez-Paniagua Ríos, Juan P. Llerena, Alberto Lastra, Nuria Torrado, Edmundo J. Huertas

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 该研究提出基于q-厄米特I多项式的新型q正交核,其在20个基准数据集上的性能与经典核及其他正交多项式核相当,且数值稳定性和计算简便性更优,为核设计提供了新方向。

Comments 27 pages, 4 figures, 9 tables. Source code and experimental pipeline available at https://github.com/Kokechacho/SVMs-QSVMs

详情

展开后加载摘要…

URL PDF HTML 收藏