arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 33 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2605.31446 2026-06-01 cs.CL cs.AI 84%

Fine-grained Verification via Diagnostic Reasoning Supervision for Aspect Sentiment Triplet Extraction

面向方面情感三元组抽取的诊断推理监督细粒度验证

Wenna Lai, Haoran Xie, Guandong Xu, Qing Li, S. Joe Qin

机构 * The Hong Kong Polytechnic University(香港理工大学) Lingnan University(岭南大学) Education University of Hong Kong(香港教育大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出FiVeD框架,通过诊断推理监督进行细粒度验证,利用质量评分和错误分类等辅助任务提升ASTE三元组抽取的可靠性。

Comments 25 pages, 13 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17145 2026-06-01 cs.LG cs.AI 82%

REAL: Regression-Aware Reinforcement Learning for LLM-as-a-Judge

REAL: 面向LLM评判的回归感知强化学习

Yasi Zhang, Tianyu Chen, Mingyuan Zhou, Oscar Leong, Ying Nian Wu, Michal Lukasik

机构 * University of California, Los Angeles(加州大学洛杉矶分校) The University of Texas at Austin(得克萨斯大学奥斯汀分校) Google Research Now at Google DeepMind(谷歌研究 现在在谷歌深Mind)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出REAL框架,通过广义策略梯度将回归目标融入强化学习,优化LLM作为评分器的数值评估,在多个规模模型上超越SFT和标准RL方法。

Comments Accepted to ICML 2026. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31572 2026-06-01 cs.CV 82%

nuReasoning: A Reasoning-Centric Dataset and Benchmark for Long-Tail Autonomous Driving

nuReasoning:面向长尾自动驾驶的推理中心数据集与基准

Zhiyu Huang, Johnson Liu, Rui Song, Zewei Zhou, Ruining Yang, Yun Zhang, Tianhui Cai, Hanyin Zhang, Mingxuan Gao, Valeria Xu, Jiali Chen, Yishan Shen, Yiluan Guo, Tony, Qi, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Motional

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 提出nuReasoning数据集,包含2万段20秒长尾驾驶场景的推理标注,支持空间、决策和反事实推理评估,并证明推理监督可提升VLM和VLA的驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16940 2026-06-01 cs.CV cs.CR 82%

MultiPriv: Benchmarking Individual-Level Privacy Reasoning in Vision-Language Models

MultiPriv: 视觉语言模型中个体级隐私推理的基准测试

Xiongtao Sun, Hui Li, Jiaming Zhang, Yujie Yang, Kaili Liu, Ruxin Feng, Wen Jun Tan, Wei Yang Bryan Lim

机构 * Xidian University(西安电子科技大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 针对视觉语言模型通过层次化链式推理关联多模态数据识别个体的隐私风险,提出首个系统评估个体级隐私推理的基准MultiPriv,包含隐私感知与推理框架、双语多模态数据集和九项挑战任务,对50多个开源和商业模型评估发现60%的模型能以高达80%的准确率进行个体级隐私推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20732 2026-06-01 cs.LG cs.AI cs.SE 81%

FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs

FEM-Bench:评估代码生成大语言模型的结构化科学推理基准

Saeed Mohammadzadeh, Erfan Hamdi, Joel Shor, Emma Lejeune

机构 * Boston University(波士顿大学) Move37 Labs(Move37实验室) Department of Mechanical Engineering(机械工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出FEM-Bench基准,通过有限元方法相关编程任务评估大语言模型在科学计算中的结构化推理能力,实验表明现有模型尚不能稳定解决所有任务。

Comments 45 pages, 5 figures, 9 tables, 7 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31410 2026-06-01 cs.AI 79%

FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

FAM-Bench:面向条件感知的“食物即药物”推理的多模态基准

Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover, Tanvir Ibrahim, Wenyan Li, Tingting Zhang, Xiaomin Lin

机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Muma College of Business, University of South Florida(佛罗里达州立大学Muma商学院) Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FAM-Bench多模态基准,包含2500个营养专家验证的实例,通过菜肴适宜性评估和比较分析两个任务,测试模型在特定健康状况下对食物选择的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 79%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31031 2026-06-01 cs.AI 79%

GraphARC: A Comprehensive Benchmark for Graph-Based Abstract Reasoning

GraphARC:基于图的抽象推理综合基准

Saku Peltonen, August Bøgh Rønberg, Andreas Plesner, Roger Wattenhofer

机构 * ETH Z\"urich Z\"urich Switzerland ETH Z\"urich

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出GraphARC基准,将抽象推理扩展到图结构数据,通过少样本变换学习任务评估模型在局部、全局和层次图变换上的泛化能力,并揭示语言模型的理解-执行差距和规模扩展障碍。

Comments Accepted at KDD 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 79%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19923 2026-06-01 cs.CV cs.CL 79%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30802 2026-06-01 cs.MA cs.AI 70%

Design and Evaluation of Multi-Agent AI Oracle Systems for Prediction Market Resolution

用于预测市场决议的多智能体AI预言机系统的设计与评估

Tarun Kota

机构 * Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本研究设计并评估了多智能体LLM架构作为预测市场决议的预言机,通过独立聚合与协商共识两种机制,在KalshiBench数据集上对比单模型基线,发现置信度加权投票的独立聚合达到83.43%准确率,而协商共识因错误传播性能下降,并提出了混合AI-人类预言机的路由标准。

Comments 34 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30358 2026-06-01 cs.LG quant-ph 70%

QASM-Eval: A Dataset to Train and Evaluate LLMs on OpenQASM-3 Beyond Quantum Circuits

QASM-Eval:用于训练和评估LLM在超越量子电路的OpenQASM-3上的数据集

Zhenxiao Fu, Lei Jiang, Fan Chen

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.LG

AI总结 针对LLM在OpenQASM-3硬件级编程上的训练与评估空白,构建了包含专家验证测试集和训练集的数据集,覆盖经典逻辑、时序调度、脉冲控制等,并通过扩展验证器自动验证,实验表明微调后LLM性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00349 2026-06-01 cs.AI 70%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 67%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-06-01 cs.CL cs.AI cs.CV cs.MM 62%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30654 2026-06-01 cs.CL cs.AI cs.HC 62%

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

EUDAIMONIA: 评估AI中的不良动态

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30599 2026-06-01 cs.LG cs.CL 62%

AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis

AMNESIA: 一个大规模医学遗忘基准套件与疾病知情分析

Saeedeh Davoudi, Reihaneh Iranmanesh, Ophir Frieder, Nazli Goharian

机构 * IR Lab, Computer Science Department, Georgetown University, Washington D.C.(信息检索实验室,计算机科学系,乔治·华盛顿大学,华盛顿特区)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出AMNESIA,首个大规模开源医学遗忘基准,包含70,560个问答对,评估四种遗忘方法,发现个体遗忘会侵蚀同病患者的其他知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30589 2026-06-01 cs.CL cs.AI 62%

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

ImmigrationQA: 一个基于来源的数据集及面向美国移民法的小型模型适配

Nazarii Shportun

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文构建了基于来源的问答数据集ImmigrationQA(17,058对,覆盖13个移民子领域),并通过参数高效LoRA微调Llama 3.2 3B Instruct模型,在程序性子领域取得显著提升,但复杂法律推理仍较弱。

Comments 12 pages, 4 tables. Dataset (17,058 QA pairs), fine-tuned model, and code are publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 62%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 62%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02060 2026-06-01 cs.AI cs.LG 62%

ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection

ReTabAD: 恢复表格异常检测中语义上下文的基准

Sanghyu Yoon, Dongmin Kim, Suhee Yoon, Ye Seul Sim, Seungdong Yoa, Hye-Seung Cho, Soonyoung Lee, Hankook Lee, Woohyung Lim

机构 * LG AI Research, Seoul, South Korea(LG人工智能研究实验室,首尔,韩国) Sungkyunkwan University, Suwon, South Korea(成均馆大学,水原,韩国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有表格异常检测基准缺乏语义上下文的问题,提出ReTabAD基准,通过丰富结构化文本元数据并集成零样本LLM框架,验证了语义上下文能提升检测性能和可解释性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31478 2026-06-01 cs.SE cs.CL cs.SY eess.SY 57%

Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation

知识边界探测与需求引导干预:面向基于LLM的电力系统代码生成

Hui Wu, Xiaoyang Wang, Zhong Fan

机构 * Department of Engineering, University of Exeter(工程系,埃克塞特大学) Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM在电力系统代码生成中因API知识边界错误导致失败的问题,提出PowerCodeBench基准、L0-L3文档驱动探测和边界感知干预方法,显著提升模型准确率。

Comments 43 pages, 12 figures, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30459 2026-06-01 cs.CL 57%

Can LLM Teams Play What? Where? When?

LLM 团队能玩“什么?哪里?何时?”吗?

Anastasia Kotelnikova, Viktor Byzov, Maria Dolzhenkova, Evgeny Kotelnikov

机构 * Vyatka State University(维yatka国立大学) European University at St. Petersburg(圣彼得堡欧洲大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究基于团队的交互策略(投票、静默团队、健谈团队)能否提升大语言模型在“什么?哪里?何时?”问答游戏中的表现,实验表明团队策略优于单模型基线,准确率最高提升20个百分点,最佳团队达到44.23%,接近人类水平。

Comments Accepted for Dialogue-2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 57%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28646 2026-06-01 cs.CR cs.CL 57%

MaskClaw: Edge-Side Personalized Privacy Arbitration for GUI Agents with Behavior-Driven Skill Evolution

MaskClaw: GUI代理的边端个性化隐私仲裁与行为驱动技能进化

Yanqiu Zhao, Dongying Zheng, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MaskClaw,一种在边端进行隐私仲裁的GUI代理框架,通过本地视觉证据提取、策略记忆检索和沙箱门控的技能进化,在截图离开信任环境前决定允许、遮蔽或询问,解决了静态PII检测和云端推理的隐私边界问题。

Comments Preprint. Submitted to EMNLP 2026. 21 pages, including appendices; 5 figures Under review. Yanqiu Zhao and Dongying Zheng contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16922 2026-06-01 cs.AI 57%

ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis

ClimAgent:基于大语言模型的自主开放式气候科学分析智能体

Hao Wang, Jindong Han, Wei Fan, Hao Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ClimAgent框架,通过统一工具使用环境和严格推理协议,实现端到端建模与分析,在ClimaBench基准上相比原始LLM方案提升40.21%。

Comments It was submitted without the full consent of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08721 2026-06-01 cs.AR cs.LG cs.SE 57%

KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware

KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试

Jiayi Nie, Haoran Wu, Yao Lai, Zeyu Cao, Cheng Zhang, Binglei Lou, Erwei Wang, Jianyi Cheng, Timothy M. Jones, Robert Mullins, Rika Antonova, Yiren Zhao

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10441 2026-06-01 cs.CL 57%

Goldfish: Monolingual Language Models for 350 Languages

Goldfish: 面向350种语言的单语语言模型

Tyler A. Chang, Catherine Arnett, Zhuowen Tu, Benjamin K. Bergen

机构 * Department of Cognitive Science(认知科学系) Department of Linguistics(语言学系) Department of Computer Science(计算机科学系) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对低资源语言,发现大型多语言模型在基本语法生成上不如双元模型,而小规模单语模型在困惑度和语法性基准上表现更优,并发布了覆盖350种语言的1000多个单语模型套件Goldfish。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22971 2026-06-01 cs.AI 57%

SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy

SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试

Peiyao Xiao, Xiaogang Li, Xinyi Gao, Chengliang Xu, Ben Wang, Zichao Chen, Zeyu Wang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13812 2026-06-01 cs.DB cs.AI cs.MA 57%

DTBench: A Synthetic Benchmark for Document-to-Table Extraction

DTBench:文档到表格提取的合成基准

Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DTBench合成基准,通过反向Table2Doc范式和多智能体合成流程生成文档,系统评估LLM在文档到表格提取中的多种能力。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏