arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-19 至 2026-05-19 共收录 717 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 160 篇

2605.18696 2026-05-19 cs.LG cs.AI 81%

Ensembling Tabular Foundation Models - A Diversity Ceiling And A Calibration Trap

表格基础模型的集成——多样性上限与校准陷阱

Aditya Tanna, Yash Desai, Pratinav Seth, Mohamed Bouadi, Nassim Bouarour, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了表格基础模型(TFMs)的集成方法,发现尽管集成通常能提升性能,但现代TFMs的集成池近似冗余,且某些集成策略在准确率和校准上表现不佳,建议采用贪心选择作为实用默认方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18423 2026-05-19 cs.RO cs.CY 80%

REBAR: Reference Ethical Benchmark for Autonomy Readiness

REBAR:自主性准备的参考伦理基准

Jonathan Diller, David Barnes, Rebekah Bogdanoff, Rhett Collier, Roddy Collins, Keith Fieldhouse, Yonatan Gefen, Cameron Johnson, Anuriha Kodali, Brad Kriel, Varun Murali, James Niehaus, Mish Sukharev, Joseph VanPelt, Anthony Hoogs, Vijay Kumar, Arslan Basharat

机构 * University of Pennsylvania(宾夕法尼亚大学) David Barnes, LLC(大卫·巴恩斯公司) Kitware, Inc.(Kitware公司) Duality Robotics, Inc.(Duality机器人公司) Texas A&M University(德克萨斯大学) Charles River Analytics(查尔斯河分析公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出REBAR框架,通过严谨测试提供可计算的自主性准备等级,以量化伦理性能并解决现有伦理AI框架的不足。

Comments To be presented at the 2026 Workshop on Robot Ethics - Ethical, Legal and User Perspectives in Robotics and Automation (WOROBET)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18397 2026-05-19 cs.DC 80%

Duet instrumentation: An Agentic Approach to Improving Sensitivity in Cloud Service Benchmarking

双人乐器:一种改进云服务基准测试灵敏度的代理方法

Sebastian Koch, Nils Japke, David Bermbach

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种名为duet instrumentation的新基准测试方法,利用大型语言模型的代码理解能力,通过分析两个连续应用版本之间的代码变更,提高云服务基准测试的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16964 2026-05-19 eess.AS 80%

SemaVoice: Semantic-Aware Continuous Autoregressive Speech Synthesis

SemaVoice: 基于语义的连续自回归语音合成

Huimeng Wang, Hui Lu, Jiajun Deng, Haoning Xu, Youjun Chen, Xueyuan Chen, Zhaoqing Li, Shuhai Peng, Shiyin Kang, Xunying Liu

专题命中 评测与基准 :foundation model(summary_cn,abstract)

AI总结 本文提出SemaVoice,一种语义感知的连续自回归语音合成框架,旨在解决零样本文本到语音合成中语义-语音建模与重建驱动的连续语音表示之间的不匹配问题,通过引入Speech Foundation Model(SFM)引导对齐机制提升语音合成的高质量和语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17826 2026-05-19 cs.CV cs.AI 79%

CounterCount: A Diagnostic Framework for Counting Bias in Vision Language Models

CounterCount: 一种用于视觉语言模型计数偏差诊断的框架

Reem Alzahrani, Hassan Alshanqiti, Bushra Bin Hemid, Zaid Alyafeai, Abdelrahman Eldesokey, Bernard Ghanem

机构 * KAUST(卡尔斯鲁德大学) University of Edinburgh(爱丁堡大学) King Abdullah University of Science and Technology(国王阿卜杜勒-阿齐兹大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出CounterCount框架,通过对比事实性与反事实性图像来诊断视觉语言模型在计数任务中的偏差问题,揭示模型对物体级先验知识的依赖,并提出统一的注意力调节策略提升反事实计数准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24238 2026-05-19 cs.LG 79%

Time Series Foundation Models as Strong Baselines in Transportation Forecasting: A Large-Scale Benchmark Analysis

时间序列基础模型在交通预测中的强大基准作用:一项大规模基准分析

Javier Yanes-Pulido, Filipe Rodrigues

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文通过在十个真实世界数据集上评估最新时间序列模型Chronos-2的零样本性能,证明了通用时间序列基础模型在交通预测中的有效性,展示了其在多数数据集上达到或超越传统统计基线和专用深度学习架构的准确性,尤其在长预测范围内表现突出。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17045 2026-05-19 eess.SY cs.LG cs.SY 79%

Empirical evaluation of Time Series Foundation Models for Day-ahead and Imbalance Electricity Price Forecasting in Belgium

时间序列基础模型的实证评估:用于比利时日前提前和不平衡电力价格预测

Chi Bui, Maria Margarida Mascarenhas, Arnaud Verstraeten, Hussain Kazmi

机构 * ELECTA-ESAT (KU Leuven)(ELECTA-ESAT(比利时列日大学)) Gridual Leuven, Belgium(Gridual(比利时列日)) Leuven, Belgium(列日,比利时) KU Leuven(比利时列日大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文评估了时间序列基础模型在比利时日前提前和不平衡电力价格预测中的应用,发现Chronos-2在ARX模式下表现最佳,其在日前提前市场中的预测误差比其他方法低5%,但在不平衡市场中误差较高,但模型仍表现出真正的零样本预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16864 2026-05-19 cs.CV cs.AI 79%

Metric-Guided Feature Fusion of Visual Foundation Models for Segmentation Tasks

基于度量的视觉基础模型特征融合用于分割任务

Yachan Guo, JoseLuis Gomez Zurita, Danna Xue, Yi Xiao, AntonioManuel Lopez Pena

机构 * Universitat Autònoma de Barcelona(巴塞罗那自治大学) Computer Vision Center(计算机视觉中心) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳研究院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于度量的特征融合方法,通过评估不同视觉基础模型的特征空间,选择并聚合互补特征以提升密集预测任务的性能。

Comments Accepted to the CVPR 2026 Findings Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13322 2026-05-19 cs.CV cs.LG 79%

KamonBench: A Grammar-Based Dataset for Evaluating Compositional Factor Recovery in Vision-Language Models

KamonBench:一种基于语法规则的数据集,用于评估视觉-语言模型中的组合因子恢复

Richard Sproat, Stefano Peluchetti

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 KamonBench通过20000个合成复合徽章及辅助组件示例,提供评估视觉-语言模型中稀疏组合识别和因子恢复的可控测试环境,支持程序代码因子度量和可控因子对重组。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17382 2026-05-19 cs.AI cs.CL cs.GR 79%

QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI

QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估

Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri

机构 * AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室) Department of Computer Engineering and Information Technology(计算机工程与信息科技系) Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系) University of Genoa(热那亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出QQJ框架,通过专家设计的多维评分标准和高质量标注集校准大语言模型评估器,实现与人类判断一致的可扩展评估方法,验证了结构化定性判断在大规模应用中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17079 2026-05-19 cs.CL cs.AI cs.CY 79%

Can LLMs Think Like Consumers? Benchmarking Crowd-Level Reaction Reconstruction with ConsumerSimBench

LLMs能否像消费者一样思考?通过ConsumerSimBench进行大众级反应重建的基准测试

Tianyu Wang, Jiajun Li, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出ConsumerSimBench基准,通过1553个真实中国社交媒体话题和23122个原子化、规则审核过的标准,评估LLM在模拟消费者反应方面的能力,揭示了前沿模型在预测高语境中文消费者讨论中实际关心内容方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17489 2026-05-19 cs.CV 78%

Employing Vision-Language Models for Face Image Quality Assessment

利用视觉-语言模型进行人脸图像质量评估

Erdi Sarıtaş, Eren Onaran, Vitomir Štruc, Hazım Kemal Ekenel

机构 * Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系) Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程系) Division of Engineering, NYU Abu Dhabi(纽约大学阿布扎克分校工程系)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文研究了利用现成的视觉-语言模型(VLMs)在零样本设置下进行人脸图像质量评估(FIQA)的潜力,通过综合评估框架评估VLM性能,并发现模型架构对生物识别效用性能有显著影响,VLMs的输出与传统方法一致,但生成的分数可能因提示而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17225 2026-05-19 eess.AS 78%

Can Large Audio Language Models Ignore Multilingual Distractors? An Evaluation of Their Selective Auditory Attention Capabilities

大型音频语言模型能否忽略多语言干扰?对其选择性听觉注意力能力的评估

Heejoon Koo

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文通过引入MUSA多语言基准测试,评估了大型音频语言模型在多语言干扰下的选择性听觉注意力能力,发现单阶段性能强并不意味着在复杂环境下具有鲁棒性,分离技术虽减少声音重叠但无法解决源归属问题。

Comments 2 figures, 9 tables, and 12 pages total, with 4 pages of main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17070 2026-05-19 cs.CV 78%

EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models

EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准

Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju

机构 * X-Humanoid Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) University of Manchester(曼彻斯特大学) Monash University(墨尔本大学) Celonis AI University of New South Wales(新南威尔士大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10408 2026-05-19 cs.SE cs.RO 78%

VISOR: A Vision-Language Model-based Test Oracle for Testing Robots

VISOR:基于视觉-语言模型的机器人测试 oracle

Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini

机构 * Simula Research Laboratory(Simula研究实验室) Oslo Metropolitan University(奥斯陆理工大学) Mondragon University(蒙dragon大学) National Institute of Informatics(国立信息研究所)

专题命中 评测与基准 :language model(title,abstract)

AI总结 VISOR 提出基于视觉-语言模型的自动化测试 oracle 方法,解决机器人测试中任务正确性评估难题,通过两个模型在多个任务上验证,展现高召回率和高精确度,但不确定性与正确性相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18111 2026-05-19 cs.CL cs.CV 77%

How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

LLMs在回答孟加拉语医学视觉问题方面的表现如何?数据集与基准测试

Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

机构 * Penta Global Limited Center for Computational & Data Sciences, Independent University(独立大学计算与数据科学中心)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出BanglaMedVQA数据集,用于评估当前基础模型在孟加拉语医学视觉问答任务中的表现,发现其性能显著低于英语基准,揭示了低资源语言在医学推理中的挑战。

Comments 14 pages, 7 figures, 5 tables, Proceedings of The Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16282 2026-05-19 cs.CY cs.AI 77%

Taxonomy and Consistency Analysis of Safety Benchmarks for AI Agents

AI代理安全基准的分类与一致性分析

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Heba Ismail, Farkhund Iqbal

机构 * McGill University(麦吉尔大学) Kean University(凯恩大学) Zayed University(扎耶德大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 本文分析了AI代理安全基准的分类与一致性问题,揭示了方法学选择对安全结论的影响,指出基准选择可能导致矛盾的安全结论,且指标碎片化限制了比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18663 2026-05-19 cs.AI cs.CL cs.LG 75%

GIM: Evaluating models via tasks that integrate multiple cognitive domains

GIM:通过整合多个认知领域的任务评估模型

Rohit Patel, Alexandre Rezende, Steven McClain

机构 * Meta Superintelligence Labs(Meta超智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIM基准测试,通过整合多个认知领域的任务来评估模型,其核心方法是设计820个原创问题,结合广泛的知识和多种认知操作,从而保持推理在现实任务中的基础性,同时通过2PL IRT模型校准能力估计,发布涵盖22个模型和47种测试配置的综合排行榜,并深入研究了测试时计算与模型能力之间的权衡。

Comments 56 pages, 27 figures, 4 tables. Code: https://github.com/facebookresearch/gim ; Dataset: https://huggingface.co/datasets/facebook/gim

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17960 2026-05-19 cs.CR 75%

From Detection to Response: A Deep Learning and Retrieval-Augmented Generation Framework for Network Intrusion Mitigation

从检测到响应:一种基于深度学习和检索增强生成的网络入侵缓解框架

Md Navid Bin Islam, Sajal Saha, Senior Member

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出了一种统一的端到端框架,通过深度学习和检索增强生成技术,解决网络入侵检测与可操作响应之间的差距。该框架首先利用三个独立训练的二分类深度神经网络对网络流量进行分类,其次通过检索增强生成技术生成带有解释的提示,检索相关指导并生成结构化的缓解报告。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16819 2026-05-19 cs.CL cs.AI cs.LG 75%

AgentKernelArena: Generalization-Aware Benchmarking of GPU Kernel Optimization Agents

AgentKernelArena: GPU核优化代理的通用化意识基准测试

Sharareh Younesian, Wenwen Ouyang, Sina Rafati, Mehdi Rezagholizadeh, Sharon Zhou, Ji Liu, Yue Liu, Yuchen Yang, Hao Li, Ziqiong Liu, Dong Li, Vikram Appia, Zhenyu Gu, Emad Barsoum

机构 * AMD

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentKernelArena,一个用于评估GPU核优化代理的开源基准,通过隔离工作区和统一评分机制,测试代理在不同任务和硬件目标上的性能和通用化能力,发现大多数任务在正确性和编译效率上表现优异,但在PyTorch到HIP的转换任务中存在显著的正确性下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26904 2026-05-19 cs.CL cs.AI cs.LG 75%

ClawGym: A Scalable Framework for Building Effective Claw Agents

ClawGym:一种构建有效Claw代理的可扩展框架

Fei Bai, Huatong Song, Shuang Sun, Daixuan Cheng, Yike Yang, Chuan Hao, Renyuan Li, Feng Chang, Yuan Wei, Ran Tao, Bryan Dai, Jian Yang, Wayne Xin Zhao, Ji-Rong Wen

机构 * Gaoling School of Artificial Intelligence(人工智能学院) Renmin University of China(中国人民大学) IQuest Research(IQuest研究) Beihang University(北航)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出ClawGym框架,用于构建Claw式个人代理的全生命周期,通过合成可验证训练数据和强化学习方法提升代理效能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02406 2026-05-19 cs.CY 75%

Evaluating AI-Generated Images of Cultural Artifacts with Community-Informed Rubrics

基于社区指导的评估文化文物AI生成图像

Nari Johnson, Deepthi Sudharsan, Hamna, Samantha Dalal, Theo Holroyd, Anja Thieme, Hoda Heidari, Daniela Massiceti, Jennifer Wortman Vaughan, Cecily Morrison

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文通过三个社区案例研究,探讨如何将社区经验融入AI生成图像的文化适当性评估体系,提出基于多模态LLM的自动化测量方法及挑战。

Comments Published at ACM FAccT 2026. 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16831 2026-05-19 cs.CL cs.AI cs.CR cs.LG 75%

Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs

反学习不是删除:调查机器反学习在大语言模型中的可逆性

Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Santa Cruz(加州大学圣克ruz分校) Huawei Technologies(华为技术有限公司) Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究揭示大语言模型反学习的可逆性问题,提出表示层面分析框架,通过PCA相似度、CKA和Fisher信息等指标评估表示漂移,发现四种遗忘模式,指出数据来源影响重学效率,揭示不可逆遗忘的挑战。

Comments ICML 2026, accepted to appear

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14009 2026-05-19 cs.RO 73%

GRaD-Nav++: Vision-Language Model Enabled Visual Drone Navigation with Gaussian Radiance Fields and Differentiable Dynamics

GRaD-Nav++: 基于视觉-语言模型的视觉无人机导航:高斯辐射场与可微动力学

Qianzhong Chen, Naixiang Gao, Suning Huang, JunEn Low, Timothy Chen, Jiankai Sun, Mac Schwager

机构 * Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系) Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)

专题命中 评测与基准 :language model(title,journal_ref)

AI总结 GRaD-Nav++提出一种轻量级视觉-语言-动作框架,通过可微强化学习在3D高斯点云模拟器中训练,实现基于自然语言指令的实时无人机导航,展示在多任务和多环境下的高效导航能力。

Comments Published in: IEEE Robotics and Automation Letters ( Volume: 11, Issue: 2, February 2026)

Journal ref Chen, Qianzhong, et al. "Grad-nav++: Vision-language model enabled visual drone navigation with gaussian radiance fields and differentiable dynamics." IEEE Robotics and Automation Letters 11.2 (2025): 1418-1425

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18548 2026-05-19 cs.CL cs.AI 73%

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

STT-Arena:一种更现实的工具使用环境,包含时空动态

Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao

机构 * Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学) Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学) Beijing University of Posts and Telecommunications(北京邮电大学) Li Auto Inc.(李汽有限公司) Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出STT-Arena基准测试,旨在评估大型语言模型在面对时空动态变化时的适应性规划能力,发现现有模型在处理此类动态问题时存在显著不足,并提出改进方法STT-Agent-4B以提升性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18229 2026-05-19 cs.LG cs.AI 73%

Are Sparse Autoencoder Benchmarks Reliable?

稀疏自编码基准测试是否可靠?

David Chanin

机构 * Decode Research, MATS, UCL(Decode研究、MATS、伦敦大学学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究评估了稀疏自编码(SAE)基准测试的可靠性,发现其中两个指标在多个角度下表现不佳,其他指标也未能达到预期效果,表明需要改进SAE基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02262 2026-05-19 cs.SE cs.AI cs.CL 73%

OmniCode: A Benchmark for Evaluating Software Engineering Agents

OmniCode: 一个评估软件工程代理的基准

Atharv Sonwane, Eng-Shen Tu, Wei-Chung Lu, Claas Beger, Carter Larsen, Debjit Dhar, Simon Alford, Rachel Chen, Ronit Pattanayak, Tuan Anh Dang, Guohao Chen, Gloria Geng, Kevin Ellis, Saikat Dutta

机构 * Cornell University(康奈尔大学) Independent contributor(独立贡献者) UC Santa Barbara(加州大学圣巴巴拉分校) Jadavpur University(贾瓦伊普尔大学) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出OmniCode,一个涵盖更广泛任务类别的软件工程基准,旨在评估软件代理在不同软件开发方面的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17442 2026-05-19 cs.CL cs.AI cs.IR 73%

Beyond Catalogue Counts: the Dataset Visibility Asymmetry in Low-Resource Multilingual NLP

超越目录计数:低资源多语言NLP中的数据集可见性不对称

Zhiyin Tan, Changxu Duan

机构 * L3S Research Center, Leibniz University Hannover(莱布尼茨汉诺威大学L3S研究中心) Technische Universität Darmstadt(达姆施塔特技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究探讨了多语言NLP中数据集可见性不对称问题,通过结合目录基准和文献证据,提出了资源密度指数(RDI)来衡量语言的数据集可见性,揭示了大量语言在目录记录中数据贫乏但文献中存在明显数据集活动的现象。

Comments Accepted at the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20917 2026-05-19 cs.CL cs.AI 73%

MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation

MediQAl: 一个用于知识和推理评估的法语医学问答数据集

Adrien Bazoge

机构 * Data Clinic, University Hospital of Nantes, France(南特大学医院数据诊所,法国) Nantes Université, École Centrale Nantes, CNRS, LS2N, France(南特大学,中央理工学院南特分校,国家科学研究中心,LS2N,法国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MediQAl数据集,用于评估语言模型在事实性医学记忆和现实临床场景推理方面的能力,包含32,603个法语医学问题,涵盖41个医学科目,包含三种任务,通过14个大型语言模型的评估发现事实记忆与推理任务之间存在显著性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17072 2026-05-19 cs.AI cs.CL 73%

RAGA: Reading-And-Graph-building-Agent for Autonomous Knowledge Graph Construction and Retrieval-Augmented Generation

RAGA:用于自主知识图谱构建和检索增强生成的阅读与图构建代理

Chengrui Han, Zesheng Cheng

机构 * Qingdao University(青岛大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出RAGA框架,通过结合阅读、搜索、验证和构建的认知约束,提升知识图谱构建与检索增强生成的效率和准确性,实现了知识图谱的全生命周期管理。

详情

展开后加载摘要…

URL PDF HTML 收藏