arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 877 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2605.08437 2026-05-12 cs.CL cs.AI 82%

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

Magis-Bench:评估大语言模型在法官级别法律任务上的能力

Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil Campinas São Paulo Brazil(巴西坎皮纳斯圣保罗)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Magis-Bench评估大语言模型在法官级别法律任务上的能力,包含74道来自巴西司法职位竞争考试的问题,采用LLM-as-a-judge方法评估23种先进模型,结果显示法官级法律推理和写作仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10853 2026-05-12 cs.CL 81%

Grounded Satirical Generation with RAG

基于RAG的 grounded 愚笑生成

Oona Itkonen, Yuxin Su, Linyao Du, Ona De Gibert

机构 * University of Helsinki(赫尔辛基大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于RAG的 grounded 愚笑生成方法,通过当前新闻检索生成芬兰语讽刺词典定义,并引入任务特定评估框架,分析文化背景、源词类型及RAG存在与否对输出的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10365 2026-05-12 cs.AI 81%

Agent-ValueBench: A Comprehensive Benchmark for Evaluating Agent Values

Agent-ValueBench: 一个全面的评估代理价值观的基准

Haonan Dong, Qiguan Feng, Kehan Jiang, Haoran Ye, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院) Peking University School of Psychological and Cognitive Sciences(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出Agent-ValueBench,首个专门评估代理价值观的基准,包含394个环境和4335个价值冲突任务,揭示代理价值观与基础LLM的差异及Harness和技能对价值观的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10339 2026-05-12 cs.CL 81%

An Annotation Scheme and Classifier for Personal Facts in Dialogue

对话中个人事实的标注方案与分类器

Konstantin Zaitsev

机构 * HSE University(俄罗斯莫斯科高等经济学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出改进的个人事实分类标注方案,引入新类别和属性以提升对话系统中的事实存储与过滤能力,并训练多头分类器,实现81.6%的宏F1分数,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10158 2026-05-12 cs.LG 81%

Unsupervised Process Reward Models

无监督过程奖励模型

Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi, Hang Guo, Maria Brbic

机构 * Swiss Federal Institute of Technology(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出无监督过程奖励模型(uPRM),通过无需人工监督的评分函数,提升大语言模型在复杂推理任务中的鲁棒性与准确性。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12090 2026-05-12 cs.CL 81%

ChatbotManip: A Dataset to Facilitate Evaluation and Oversight of Manipulative Chatbot Behaviour

ChatbotManip:一个用于评估和监督操纵性聊天机器人行为的数据库

Jack Contro, Simrat Deol, Yulan He, Martim Brandão

机构 * King’s College London(伦敦国王学院)

专题命中 评测与基准 :LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍ChatbotManip数据集,用于研究聊天机器人中的操纵行为。通过模拟对话展示聊天机器人操纵策略,揭示LLM在指令下具有操纵性,且小型模型在检测操纵方面表现接近大模型,但尚不适用于实际监督。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09764 2026-05-12 cs.NE cs.AI 81%

LEVI: Stronger Search Architectures Can Substitute for Larger LLMs in Evolutionary Search

LEVI:更强的搜索架构可以取代更大的LLM在进化搜索中

Temoor Tanveer

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title_cn,abstract);分类 cs.AI

AI总结 LEVI通过改进解决方案数据库、智能突变路由和排名保持代理基准,以更低成本在系统研究基准中取得最高成绩,超越现有框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08761 2026-05-12 cs.MA cs.LG 81%

Beyond the All-in-One Agent: Benchmarking Role-Specialized Multi-Agent Collaboration in Enterprise Workflows

超越全能代理:企业工作流中角色专业化多代理协作的基准测试

Tao Yu, Hao Wang, Changyu Li, Shenghua Chai, Minghui Zhang, Zhongtian Luo, Yuxuan Zhou, Haopeng Jin, Zhaolu Kang, Jiabing Yang, YiFan Zhang, Xinming Wang, Hongzhu Yi, Zheqi He, Jing-Shu Zheng, Xi Yang, Yan Huang, Liang Wang

机构 * BAAI(北京人工智能研究院) CASIA(中国科学院自动化研究所) UCAS(中国科学技术大学) Peking University(北京大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出EntCollabBench,用于评估企业多代理协作,模拟权限隔离组织,包含工作流和审批两个子集,通过执行轨迹、数据库验证和确定性政策裁决评估代理系统,实验表明当前模型在企业协作中仍存在缺陷。

Comments 45 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08558 2026-05-12 cs.LG 81%

Beyond Static Bias: Adaptive Multi-Fidelity Bandits with Improving Proxies

超越静态偏差:具有改进代理的自适应多保真度老虎机

Muyun Lu, Haoyang Hong, Huazheng Wang, Ying Lin

机构 * Department of Industrial and Systems Engineering, University of Houston(休斯敦大学工业与系统工程系) School of Electrical Engineering and Computer Science, Oregon State University(俄勒冈州立大学电气工程与计算机科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了具有改进代理的自适应多保真度老虎机问题,提出TACC算法通过动态调整采样策略以降低成本并提高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08549 2026-05-12 cs.AI 81%

Evaluating Developmental Cognition Capabilities of LLMs

评估大语言模型的发展认知能力

Xiao Xiao, Hayoun Noh, Mar Gonzalez-Franco

机构 * De Vinci Research Center(德文西研究中心) MIT Media Lab(MIT媒体实验室) University of Oxford(牛津大学) Google(谷歌)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出DSCT测试,通过自述文本评估发展认知阶段,发现LLM在模拟角色和真实人类响应中表现出不同的阶段特征,表明发展信号在合成响应中更清晰。

Comments 9 pages, 3 figures, (10 pages appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08503 2026-05-12 cs.CL cs.CY cs.HC 81%

NARRA-Gym for Evaluating Interactive Narrative Agents

NARRA-Gym用于评估交互叙事代理

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong He, Zhengqing Yuan, Yujun Zhou, Kehan Guo, Chaoran Chen, Toby Jia-Jun Li, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Pennsylvania(宾夕法尼亚大学) Lehigh University(莱恩大学) Massachusetts Institute of Technology(麻省理工学院) Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09918 2026-05-12 cs.LG cs.AI cs.CY 81%

NaiAD: Initiate Data-Driven Research for LLM Advertising

NaiAD:启动基于数据的研究以进行大语言模型广告

Yihang Zhang, Zimeng Huang, Ren Zhai, Yipeng Kang, Tonghan Wang

机构 * Tsinghua University(清华大学) College of AI(人工智能学院) Department of Literature, Arts and Communication(文学、艺术与传播系) Anhui International Studies University(安徽国际关系大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出NaiAD数据集,用于研究大语言模型广告,包含58999个精心构建的广告嵌入响应与用户查询,通过理论指导的评估指标提升用户体验和商业价值。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08689 2026-05-12 cs.LG cs.AI cs.SI 81%

Structure-Centric Graph Foundation Model via Geometric Bases

基于几何基的结构导向图基础模型

Xiaodong He, Haolan He, Ruiyi Fang, Ming Sun, Zhao Kang

机构 * University of Electronic Science and Technology of China(电子科技大学) Western University(西方大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出SCGFM,通过几何基构建共享结构坐标系,解决图结构异质性和节点特征不兼容问题,实现跨领域泛化。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10890 2026-05-12 cs.SE 80%

CppPerf: An Automated Pipeline and Dataset for Performance-Improving C++ Commits

CppPerf:一个用于性能改进C++提交的自动化流水线和数据集

Tommy Ho, Khashayar Etemadi, Zhendong Su

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出CppPerf-Mine流水线,通过结合结构化提交过滤、LLM分类器和容器化构建测试阶段,挖掘改进执行时间的补丁,并构建包含347个手动验证补丁的CppPerf-DB数据集,评估仓库级修复工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09584 2026-05-12 cs.CL cs.AI cs.LG 80%

CLR-voyance: Reinforcing Open-Ended Reasoning for Inpatient Clinical Decision Support with Outcome-Aware Rubrics

CLR-voyance:通过结果感知的评分表强化住院患者临床决策支持中的开放性推理

Aishik Nagar, Arun-Kumar Kaliya-Perumal, Yu-Hsuan Han, Andrew Sheng-Han Huang, Kristen Kee, Yushi Cao, Yiming Chen, Hongchao Jiang

机构 * ASUS Intelligent Cloud Services (AICS)(ASUS智能云服务(AICS)) Rehabilitation Research Institute of Singapore, Nanyang Technological University(新加坡康复研究院,南洋理工大学) Department of Family Medicine, Taipei Veterans General Hospital(台北荣民总医院家庭医学部) School of Medicine, National Yang Ming Chiao Tung University(国家阳明交通大学医学院) Yong Loo Lin School of Medicine, National University of Singapore(新加坡国立大学 Yong Loo Lin 医学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CLR-voyance将住院患者推理建模为POMDP,通过结果感知和临床验证的奖励机制提升决策支持,实现住院患者临床推理的最新进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27157 2026-05-12 cs.IR 80%

A Survey on Generative Recommendation: Data, Model, and Tasks

生成推荐的综述:数据、模型与任务

Min Hou, Le Wu, Yuxin Liao, Yonghui Yang, Zhen Zhang, Yu Wang, Changlong Zheng, Han Wu, Richang Hong

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文综述生成推荐领域,探讨数据、模型与任务维度,分析生成模型在推荐中的应用与挑战,提出智能推荐助手的发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15664 2026-05-12 cs.AR 80%

VeriRAG: A Retrieval-Augmented Framework for Automated RTL Testability Repair

VeriRAG:一种用于自动RTL可测试性修复的检索增强框架

Haomin Qi, Yuyang Du, Lihao Zhang, Soung Chang Liew, Kexin Chen, Yining Du

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出VeriRAG框架,利用检索增强生成方法实现自动化RTL可测试性修复,通过VeriDFT数据集提升修复成功率,相比零样本基线提升7.72倍。

Comments 8 pages, 5 figures

Journal ref The 27th International Symposium on Quality Electronic Design (ISQED'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10576 2026-05-12 cs.CV cs.AI 79%

SenseBench: A Benchmark for Remote Sensing Low-Level Visual Perception and Description in Large Vision-Language Models

SenseBench: 一个用于遥感低级视觉感知与描述的大型视觉-语言模型基准

Chen Zhong, Xiao An, Jiaxing Sun, Zihan Gui, Guangyi Yang, Wei He

机构 * Wuhan University(武汉大学) Shanghai Artificial Intelligent Laboratory(上海人工智能实验室)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SenseBench,首个专为遥感低级视觉感知与描述设计的基准,通过物理基础的分层分类体系,评估29种先进VLMs在遥感降质识别中的性能,揭示领域先验偏差、多退化崩溃、流畅性幻觉及感知-描述反转效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10159 2026-05-12 cs.LG cs.NA math.NA physics.comp-ph 79%

jNO: A JAX Library for Neural Operator and Foundation Model Training

jNO:用于神经算子和基础模型训练的JAX库

Leon Armbruster, Rathan Ramesh, Georg Kruse, Christopher Straub

机构 * Fraunhofer Institute for Integrated Systems and Device Technology(弗劳恩霍夫整合系统与器件技术研究所)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 jNO是一个基于JAX的神经算子库,支持数据驱动和物理引导的训练,通过统一的符号语言编译优化流程,实现算子回归、网格感知残差评估和PDE约束训练的无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09424 2026-05-12 cs.LG 79%

Tabular Foundation Model for Generative Modelling

表格基础模型用于生成建模

Xiangjian Jiang, Mingxuan Liu, Nikola Simidjievski, Tassilo Klein, Mateja Jamnik

机构 * Department of Computer Science and Technology, University of Cambridge, UK(计算机科学与技术系,剑桥大学,英国) SAP SE Télécom Paris, Institut Polytechnique de Paris, France(巴黎telecom,巴黎理工 institute,法国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出TabFORGE,一种基于预训练因果感知特征编码器的表格基础生成模型,通过两阶段设计缓解潜在嵌入分布偏移,实现高质量合成表格数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08113 2026-05-12 cs.LG cs.CV 79%

Do Foundation Model Embeddings Improve Cross-Country Crop Yield Generalisation? A Leave-One-Country-Out Evaluation in Sub-Saharan Africa

基础模型嵌入是否能提升跨国家作物产量泛化?一种留一国家法的撒哈拉以南非洲评估

Yaw Osei Adjei

机构 * Department of Computer Science, Kwame Nkrumah University of Science and Technology(计算机科学系,库马西技术科学大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估了地理空间基础模型嵌入在留一国家法交叉验证中的表现,发现跨国家预测效果不佳,主要受限于产量分布差异。

Comments 9 pages, 10 figures, appendix, code and processed results released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08432 2026-05-12 cs.CL cs.AI stat.ML 79%

A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

一种用于开放性问答中校准评估的语义采样框架

Zhanliang Wang, Jiancong Xiao, Ruochen Jin, Shu Yang, Bojian Hou, Li Shen

机构 * University of Pennsylvania(宾夕法尼亚大学) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Sem-ECE框架,通过语义分类评估开放性问答的校准,证明其在易题一致、难题差异,优于传统方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07574 2026-05-12 cs.CV 78%

PolarVLM: Bridging the Semantic-Physical Gap in Vision-Language Models

PolarVLM:弥合视觉语言模型中的语义-物理差距

Yuliang Li, Chu Zhou, Heng Guo, Boxin Shi, Imari Sato, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications, China(北京邮电大学) National Institute of Informatics, Japan(日本国立信息机构) Peking University, China(北京大学) The University of Tokyo, Japan(东京大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 PolarVLM通过引入极化物理参数,解决视觉语言模型在反射和透明物体等光学模糊问题中的局限,提出双流架构和分阶段训练策略,构建首个极化感知的VQA基准,实现25.4%的总体提升。

Comments 23 pages, 12 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04077 2026-05-12 cs.CV 78%

H-POPE: Hierarchical Polling-based Probing Evaluation of Hallucinations in Large Vision-Language Models

H-POPE:基于分层轮询的大型视觉-语言模型幻觉评估

Nhi Pham, Michael Schott

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Saarland University(萨尔兰州大学) Zuse School(祖斯学校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 H-POPE通过文本和图像结合的方式评估大型视觉-语言模型的幻觉问题,发现模型在物体存在和细粒度属性上易出现幻觉,且依赖视觉输入生成文本。

Comments Poster at https://sites.google.com/berkeley.edu/bb-stat/home

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09677 2026-05-12 cs.CV 78%

VFM-SDM: A vision foundation model-based framework for training-free, marker-free, and calibration-free structural displacement measurement

VFM-SDM:一种基于视觉基础模型的框架,用于无训练、无标记和无校准的结构位移测量

Qingyu Xian, Hao Cheng, Berend Jan van der Zwaag, Rolands Kromanis, Ozlem Durmaz Incel

机构 * Pervasive Systems Research Group, Faculty of Electrical Engineering, Mathematics and Computer Science, University of Twente(普罗普及系统研究组,电气工程、数学与计算机科学学院,埃因霍温理工大学) Department of Earth Observation Science, Faculty of Geo-Information Science and Earth Observation (ITC), University of Twente(地球观测科学系,地理信息科学与地球观测(ITC)学院,埃因霍温理工大学) Department of Civil Engineering and Management, Faculty of Engineering Technology, University of Twente(土木工程与管理系,工程科技学院,埃因霍温理工大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出VFM-SDM框架,通过视觉基础模型推断相机参数和点跟踪,实现无需特定训练或现场准备的多方向结构位移测量,展现低误差和强时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04875 2026-05-12 cs.CE 78%

PriceFM: Foundation Model for Probabilistic Electricity Price Forecasting

PriceFM:概率电力价格预测的基础模型

Runyao Yu, Chenhui Gu, Jochen Stiasny, Qingsong Wen, Wasim Sarwar Dilov, Lianlian Qi, Jochen L. Cremer

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出PriceFM,一种基于传输拓扑的概率基础模型,通过整合区域价格和外生特征,利用混合专家层生成潜在嵌入,并构建稀疏图掩码以提升跨区域依赖性预测能力。

Comments 10 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08249 2026-05-12 cs.CV eess.IV eess.SP 78%

Dimensional Coactivation for Representational Consistency in Frozen Vision Foundation Models

维度共激活用于冻结视觉基础模型中的表征一致性

Izaldein Al-Zyoud Abdulmotaleb El Saddik

机构 * MCRLab, School of Electrical Engineering and Computer Science University of Ottawa(MCRLab,电气与计算机科学学院,渥太华大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出维度共激活(DCA)方法,用于评估冻结视觉基础模型中样本内部的表征一致性。通过比较语义子区域的特征维度共激活,DCA在深度伪造检测任务中表现出色,验证了其在冻结模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10912 2026-05-12 cs.CL 77%

WildClawBench: A Benchmark for Real-World, Long-Horizon Agent Evaluation

WildClawBench: 一个用于真实世界、长周期代理评估的基准测试

Shuangrui Ding, Xuanlang Dai, Long Xing, Shengyuan Ding, Ziyu Liu, Yang JingYi, Penghui Yang, Zhixiong Zhang, Xilin Wei, Xinyu Fang, Yubo Ma, Haodong Duan, Jing Shao, Jiaqi Wang, Dahua Lin, Kai Chen, Yuhang Zang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文提出WildClawBench,一个包含60个双语多模态任务的原生运行时基准测试,评估代理在真实工具环境中的长周期任务能力,结果显示当前前沿模型在真实运行时表现仍不理想。

Comments Github link: https://github.com/internlm/WildClawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10141 2026-05-12 cs.AI 77%

FormalRewardBench: A Benchmark for Formal Theorem Proving Reward Models

FormalRewardBench: 一个用于形式化定理证明奖励模型的基准

Zeynel A. Uluşan, Burak S. Akbudak, Can S. Erer, Gözde Gül Şahin

机构 * Koç University, Department of Computer Science and Engineering(科克大学计算机科学与工程系) Codeway Studios(Codeway工作室) Boğaziçi University, Department of Computer Engineering(博雅奇大学计算机工程系) Friedrich-Alexander-Universität Erlangen-Nürnberg, Intelligent Language Systems(埃尔兰根-纽伦堡弗里德里希-亚历山大大学智能语言系统)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出FormalRewardBench,通过250对偏好数据评估奖励模型,发现前沿LLM在证明评估中表现最佳,而专门定理证明模型表现最差,揭示了证明能力与评估能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI 77%

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏