arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-21 至 2026-05-21 共收录 337 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 95 篇

2605.20759 2026-05-21 cs.CR 87%

Rethinking Fraud Safety Evaluation: Multi-Round Attacks Reveal Safety-Utility Tradeoffs in Graph-Context LLM Defenders

重新思考欺诈安全评估:多轮攻击揭示图上下文LLM防御中的安全与效用权衡

Laura Jiang, Reza Ryan, Qian Li, Nasim Ferdosian

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过多轮攻击评估欺诈防御系统,发现图上下文防御在早期安全拒绝方面优于纯文本基线,但同时产生更多的良性误报,揭示了安全与效用之间的权衡。

Comments 19 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20368 2026-05-21 cs.CR cs.AI 86%

Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System

使用微调的本地大语言模型进行安全文档分类:基准数据和开源系统

Ivan Dobrovolskyi

机构 * MS in AI & ML Engineering, Independent Researcher, Sunnyvale, CA, USA(人工智能与机器学习工程硕士,独立研究员,美国加利福尼亚州圣何塞)

专题命中 评测与基准 :large language model(title);language model(title);prompting(abstract);分类 cs.AI

AI总结 本研究提出TorchSight开源系统,利用微调后的Qwen 3.5 27B模型对安全文档进行分类,展示了其在78,358个样本和GPT-4合成数据上的高分类准确率,并验证了本地模型在安全文档分类中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07122 2026-05-21 cs.SE 86%

RepoZero: Can LLMs Generate a Code Repository from Scratch?

RepoZero: LLMs能否从零开始生成代码仓库?

Zhaoxi Zhang, Yiming Xu, Jiahui Liang, Weikang Li, Xiaoshuai Chen, Liwei Qian, Xin Pei, Jizhou Huang, Run Sun, Yunfang Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出RepoZero基准测试,通过自动化执行验证实现从零开始生成代码仓库的严格评估,展示了Agentic Code-Test Evolution框架在多模型上的实验结果,揭示了当前LLM在代码生成能力与实际需求之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13053 2026-05-21 cs.IR 86%

A Standardized Re-evaluation of Conversational Recommender Systems on the ReDial Dataset

对ReDial数据集上对话推荐系统的一次标准化重新评估

Ivica Kostric, Krisztian Balog

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文针对ReDial数据集上对话推荐系统的评估问题,通过标准化条件重新评估了三种架构家族中的七种主流方法,揭示了细粒度排名对实现细节的高度敏感性,以及重复捷径对准确性报告的显著影响,同时指出LLM基础能力对性能提升的影响大于架构创新,最后通过用户导向的指标证明传统召回率可能高估系统对话效果。

Comments Accepted to Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), July 20--24, 2026, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20351 2026-05-21 cs.CR 86%

Refusal Evaluation in Coding LLMs and Code Agents: A Systematic Review of Thirteen Malicious-Code Prompt Corpora (2023-2025)

对编码LLM和代码代理的拒绝评估:十三个恶意代码提示语料库的系统综述(2023-2025)

Richard J. Young, Gregory D. Moody

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了十三个恶意代码提示语料库,分析了其构建方法、提示构造分类、可重复性和许可条款,并指出了方法学上的三个主要缺口。

Comments 30 pages, 6 figures, 2 tables. PRISMA-style systematic review covering thirteen publicly released refusal corpora (AdvBench, CyberSecEval family, RMCBench, RedCode, MCGMark, JailbreakBench, CySecBench, MalwareBench, CIRCLE, MOCHA, ASTRA, Scam2Prompt, JAWS-Bench)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21465 2026-05-21 cs.CL cs.SE 84%

Leveraging LLMs for Grammar Adaptation: A Study on Metamodel-Grammar Co-Evolution

利用大语言模型进行语法适应:关于元模型-语法共演的研究

Weixing Zhang, Bowen Jiang, Rahul Sharma, Regina Hebig, Daniel Strüber

机构 * Universität Rostock(罗斯托克大学) Chalmers University of Technology and University of Gothenburg(皇家理工学院和哥德堡大学) Radboud University(拉德堡德大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了如何利用大语言模型自动适应语法,通过学习先前版本的语法适应来实现自动适应,同时探讨了在复杂语法场景下的优势与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21338 2026-05-21 cs.CL 84%

Text Analytics Evaluation Framework: A Case Study on LLMs and Social Media

文本分析评估框架:基于LLM和社交媒体的案例研究

Yuefeng Shi, Nedjma Ousidhoum, Jose Camacho-Collados

机构 * School of Computer Science and Informatics, Cardiff University(计算机科学与信息学学院,卡迪夫大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 本文提出了一种基于问题的评估框架,通过470个手工整理的问题来评估LLM在处理聚合文本数据时的语义理解和推理能力,揭示了LLM在处理大规模文本数据时的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21086 2026-05-21 cs.CL 84%

LoCar: Localization-Aware Evaluation of In-Vehicle Assistants through Fine-Grained Sociolinguistic Control

LoCar: 通过细粒度社会语言学控制评估车载助手的本地化

Seogyeong Jeong, Kiwoong Park, Seyoung Song, Eunsu Kim, Ken E. Friedl, Jaeho Kim, Alice Oh

机构 * KAIST(韩国科学技术院) BMW Group(宝马集团)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种新的车载助手评估框架,专注于韩语本地化,揭示了当前LLM在细粒度韩语敬语控制方面的不稳定性以及策略性对话指标上的表现不足,强调了汽车AI需要向精确语言定制和可靠安全交互管理发展。

Comments To appear in ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19362 2026-05-21 cs.HC cs.AI 83%

Toward User Comprehension Supports for LLM Agent Skill Specifications

向LLM代理技能规范提供用户理解支持

Zikai Alex Wen

机构 * University of Washington, Tacoma School of Engineering \& Technology Tacoma, Washington, USA University of Washington, Tacoma School of Engineering \& Technology

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 研究探讨了技能规范是否有助于用户形成对技能消耗、产生和覆盖范围的有限预期,并通过分析878个网络安全技能的文本线索,发现仅少数规范包含必要的提示,强调应将规范视为面向用户的能劾示范而非仅执行指令的容器。

Comments To appear at ACM CAIS Workshop Agent Skill 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19320 2026-05-21 cs.CL cs.AI 82%

Anatomy of Agentic Memory: Taxonomy and Empirical Analysis of Evaluation and System Limitations

代理记忆的解剖结构:评估和系统限制的分类与实证分析

Dongming Jiang, Yi Li, Songtao Wei, Jinxin Yang, Ayushi Kishore, Alysa Zhao, Dingyi Kang, Xu Hu, Feng Chen, Qiannan Li, Bingzhe Li

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) University of California Davis(加州大学戴维斯分校) Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过分类和实证分析,探讨了代理记忆系统的架构和系统限制,揭示了现有系统在基准饱和效应、指标有效性、模型依赖性和内存维护开销等方面的问题,并提出了更可靠的评估方法和可扩展的系统设计方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20915 2026-05-21 cs.CL cs.AI cs.LG 82%

Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models

校准与决策制定:重新审视未学习语言模型中的可靠性悖论

Divyaksh Shukla, Ashutosh Modi

机构 * Indian Institute of Technology Kanpur (IIT Kanpur)(印度理工学院坎浦尔学院(IIT坎浦尔))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了生成语言模型中校准与决策可靠性之间的差距,通过TOFU基准测试中的多项选择问答评估协议,发现经过微调的模型在校准误差较低,而未学习后的模型在校准误差仍低,但依赖于相关性特征的决策规则增加,扩展了可靠性悖论到机器未学习领域。

Comments Accepted at SRW, ACL 2026; 17 pages (9 + 2 + 6)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20477 2026-05-21 cs.LG cs.AI cs.CL 82%

Training Language Agents to Learn from Experience

训练语言代理以从经验中学习

Yuval Shalev, Zifeng Ding, Mateja Jamnik

机构 * University of Cambridge(剑桥大学)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种名为In-context Training(ICT)的任务框架,用于评估语言代理在跨任务中的自我改进能力,并通过基于强化学习的训练管道直接从经验中学习反思,从而在多个基准任务中优于基线模型,展示了从经验中学习的能力本身可以被学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21097 2026-05-21 cs.CL 81%

WCXB: A Multi-Type Web Content Extraction Benchmark

WCXB:一个多类型网络内容提取基准

Murrough Foley

机构 * Murrough Foley

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出WCXB基准,包含2008个网页,涵盖七种结构不同的页面类型,通过五阶段流程生成真实标注,评估13种提取系统,发现现有文章-only基准无法发现结构化页面的盲区。

Comments Dataset: github.com/Murrough-Foley/web-content-extraction-benchmark, doi.org/10.5281/zenodo.19316874. Leaderboard: webcontentextraction.org. Preprint also deposited at doi.org/10.5281/zenodo.19664685

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20729 2026-05-21 cs.CL 81%

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

MTR-Suite: 一个用于评估和合成对话检索基准的框架

Junhao Ruan, Abudukeyumu Abudula, Bei Li, Yongjing Yin, Xinyu Liu, Kechen Jiao, Xin Chen, Jingang Wang, Xunliang Cai, Tong Xiao, Jingbo Zhu

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Meituan Inc.(美团公司) NiuTrans Research(牛译研所) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出MTR-Suite框架,通过LLM审计、多智能体系统生成和通用领域基准,解决对话检索基准评估和合成中的成本高、标注稀疏和自动化方法僵化的问题。

Comments Accepted to ACL 2026 (main conference). 28 pages. Code and data: https://github.com/rangehow/mtr-suite

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20684 2026-05-21 cs.CL 81%

Beyond Semantic Similarity: A Two-Phase Non-Parametric Retrieval Workflow for Corporate Credit Underwriting

超越语义相似性:一种用于企业信贷审批的双阶段非参数检索流程

Linus Ng Junjia, Ezekiel Tee Kongquan, Kelvin Heng, Kenneth Zhu Ke, Zhao Jing Yuan

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出了一种双阶段非参数检索架构,旨在解决信贷审批中检索结果与决策有用性之间的差距问题,通过结合词法和密集多语言检索构建候选池,并利用LLM作为判断机制对文档进行实用性评分,从而提高检索效率和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00933 2026-05-21 cs.SE cs.AI 81%

MCP-Atlas: A Large-Scale Benchmark for Tool-Use Competency with Real MCP Servers

MCP-Atlas:一个大规模的工具使用能力基准测试,使用真实的MCP服务器

Chaithanya Bandi, Razvan-Gabriel Dumitru, Ben Hertzberg, Divyansh Agarwal, Geobio Boo, Tejas Polakam, Sami Hassaan, Jeff Da, HiJae Kim, Vipul Gupta, Manasi Sharma, Andrew Park, Martin Dimakis, Ernesto Gabriel Hernandez Montoya, Dan Rambado, Ivan Salazar, Rafael Cruz, MohammadHossein Rezaei, Chetan Rane, Ben Levin, Daniel Yue Zhang, Brad Kenstler, Bing Liu

机构 * National University of Singapore(新加坡国立大学) Scale AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MCP-Atlas,一个用于评估工具使用能力的基准测试,基于真实MCP服务器,包含1000个由人类专家编写和验证的任务,覆盖36个真实MCP服务器和220种工具,通过任务级别的评估发现模型在工具调用和认知能力上的表现。

Comments 25 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20204 2026-05-21 cs.HC cs.AI 81%

RealUserSim: Bridging the Reality Gap in Agent Benchmarking via Grounded User Simulation

RealUserSim: 通过基于现实的用户模拟弥合代理评估中的现实差距

Ming Zhu, Juntao Tan, Rithesh Murthy, Jielin Qiu, Liangwei Yang, Wenting Zhao, Silvio Savarese, Shelby Heinecke, Huan Wang

机构 * Salesforce AI Research(Salesforce AI研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出RealUserSim,一种基于真实行为数据的用户模拟框架,通过提取大量真实人类与LLM对话数据,提升模拟用户与真实人类的匹配率,从而改进代理评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20203 2026-05-21 cs.HC cs.AI 81%

GrandGuard: Taxonomy, Benchmark, and Safeguards for Elderly-Chatbot Interaction Safety

GrandGuard:面向老年人与聊天机器人交互安全的分类、基准及防护措施

Changxuan Fan, Xi Yang, Yueyuan Zheng, Bin Zhou, Yuanping Wang, Wenbin Hu, Huihao Jing, Ki Sen Hung, Dazhao Du, Haoran Li, Janet Hui-wen Hsiao, Yangqiu Song

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出GrandGuard框架,用于评估和缓解LLM交互中的老年人特定风险,通过建立包含50种细粒度风险类型的三级分类体系,构建了10,404个标注提示和响应的基准,展示了主流LLM在处理老年人特定情境风险时的不足,并通过两种防护措施实现了高达96.2%和90.9%的不安全提示检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21374 2026-05-21 cs.HC 80%

Combating Harms of Generative AI in CS1 with Code Review Interviews and a Flipped Classroom

用代码审查面试和翻转课堂对抗生成AI在CS1中的负面影响

Peter Fowles, Erik Falor, Sulove Bhattarai, John Edwards, Seth Poulsen

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文通过每周的口头代码审查评估和翻转课堂方法,探讨如何减少生成式AI对学生学习的负面影响,并发现学生在使用AI工具的情况下仍能保持良好的学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21443 2026-05-21 cs.CV cs.AI 79%

TempGlitch: Evaluating Vision-Language Models for Temporal Glitch Detection in Gameplay Videos

TempGlitch: 评估视觉-语言模型在游戏视频中检测时间故障的能力

Yakun Yu, Ashley Wiens, Adrián Barahona-Ríos, Benedict Wilkins, Saman Zadtootaghaj, Nabajeet Barman, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学) Sony Interactive Entertainment(索尼互动娱乐)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出TempGlitch基准测试,用于评估视觉-语言模型在游戏视频中检测时间故障的能力,发现现有模型在处理时间故障时表现不佳,且更密集的帧采样和更大的模型尺寸并不能有效解决这些问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20837 2026-05-21 cs.CV cs.AI 79%

ArchSIBench: Benchmarking the Architectural Spatial Intelligence of Vision-Language Models

ArchSIBench: 评估视觉-语言模型的建筑空间智能

Qirui Shen, Wenda Wang, Jiachen Lu, Zilong Huang, Jin Bai, Lei He, Hongxuan Chen, Weixin Huang

机构 * School of Architecture, Tsinghua University(清华大学建筑学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出ArchSIBench,一个基于建筑学、认知科学和心理学视角的建筑空间智能评估基准,通过17个细粒度子任务和3000个问题-答案对,评估多种VLMs在建筑空间感知、推理、导航、转换和配置方面的性能,发现大多数模型在空间转换和配置推理上仍与有建筑训练的人类评估者存在差距。

Comments 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28103 2026-05-21 cs.DL cs.AI cs.IR 79%

Transcription and Recognition of Italian Parliamentary Speeches Using Vision-Language Models

使用视觉-语言模型进行意大利议会演讲的转录与识别

Luigi Curini, Alfio Ferrara, Giovanni Pagano, Sergio Picascia

机构 * Università degli Studi di Milano(米兰大学) Department of Social and Political Sciences(社会科学系) Department of Literary Studies, Philology and Linguistics(文学研究、语言学与语言学系) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出基于视觉-语言模型的 pipeline,用于自动转录、语义分割和实体链接意大利议会演讲,提升转录质量和发言者标注。

Comments to be published in: ParlaCLARIN V: Interoperability, Multilinguality, and Multimodality in Parliamentary Corpora, organized within the 15th Language Resource and Evaluation Conference (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08482 2026-05-21 cs.CV cs.CL 79%

The Visual Iconicity Challenge: Evaluating Vision-Language Models on Sign Language Form-Meaning Mapping

视觉象征性挑战:在手语形式-意义映射上评估视觉-语言模型

Onur Keleş, Aslı Özyürek, Gerardo Ortega, Kadir Gökgöz, Esam Ghaleb

机构 * Multimodal Language Department(多模态语言部门) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Department of Linguistics(语言学系) Boğaziçi University(博多伊奇大学) Donders Institute for Brain Cognition and Behaviour(多纳尔斯脑认知与行为研究所) Radboud University(拉德堡德大学) Department of Linguistics and Communication(语言学与沟通系) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出一个新颖的视频基准测试,用于评估视觉-语言模型在手语形式-意义映射上的表现,通过心理语言学测量来评估三种任务:语音学手语形式预测、透明度和渐进象征性评分,并发现模型在语音形式预测上表现较好但整体仍低于人类表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06925 2026-05-21 cs.CV cs.AI 79%

Are Vision-Language Models Ready for Dietary Assessment? Exploring the Next Frontier in AI-Powered Food Image Recognition

视觉-语言模型是否准备好进行饮食评估?探索AI驱动的食品图像识别的下一个前沿

Sergio Romero-Tapiador, Ruben Tolosana, Blanca Lacruz-Pleguezuelos, Laura Judith Marcos Zambrano, Guadalupe X. Bazán, Isabel Espinosa-Salinas, Julian Fierrez, Javier Ortega-Garcia, Enrique Carrillo de Santa Pau, Aythami Morales

机构 * Biometrics and Data Pattern Analytics Lab, Universidad Autonoma de Madrid(生物度量与数据模式分析实验室,马德里自治大学) IMDEA Food, CEI UAM+CSIC(IMDEA食品,CEI UAM+CSIC)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文评估了六种先进的视觉-语言模型在不同层次上的食品识别能力,提出了一个新的评估指标,并展示了FoodNExTDB数据库在饮食评估中的应用潜力。

Comments Accepted at IEEE/CVF Computer Vision and Pattern Recognition Conference workshops 2025 (CVPRw) 10 pages, 4 figures, 2 tables

Journal ref 2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2025, pp. 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10784 2026-05-21 cs.AI 79%

TorchUMM: A Unified Multimodal Model Codebase for Evaluation, Analysis, and Post-training

TorchUMM: 一个用于评估、分析和训练后处理的统一多模态模型代码库

Yinyi Luo, Wenwen Wang, Hayes Bai, Hongyu Zhu, Hao Chen, Pan He, Marios Savvides, Sharon Li, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Auburn University(阿肯色大学欧文分校) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :post-training(title,abstract);分类 cs.AI

AI总结 本文提出TorchUMM,一个统一的多模态模型代码库,用于评估、分析和训练后处理,涵盖多种多模态模型架构、任务和数据集,通过统一接口和标准化评估协议,促进异构模型的公平比较和深入理解,推动更强大的统一多模态系统的发展。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07731 2026-05-21 cs.CL cs.AI 79%

Benchmarking EngGPT2-16B-A3B against Comparable Italian and International Open-source LLMs

对可比的意大利和国际开源大语言模型进行EngGPT2-16B-A3B的基准测试

Andrea Sassella, Andrea Chizzola, Tommaso Bianchi, Luca Alessandrelli, Mark James Carman

机构 * AIRIC, Politecnico di Milano(AIRIC,米兰理工大学) DEIB, Politecnico di Milano(DEIB,米兰理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了EngGPT2-16B-A3B在多个基准测试中的性能,与同等规模的开源MoE和密集模型进行比较,展示了其在国际和意大利基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06750 2026-05-21 cs.CV 78%

How Well Do Vision-Language Models Understand Sequential Driving Scenes? A Sensitivity Study

视觉-语言模型对连续驾驶场景的理解有多好?一项敏感性研究

Roberto Brusnicki, Mattia Piccinini, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems(自动驾驶系统教授职位) TUM School of Engineering and Design(技术大学慕尼黑工程与设计学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文通过系统分析视觉-语言模型(VLMs)在连续驾驶场景中的表现,揭示了输入配置对模型性能的影响,发现即使顶级模型在连续驾驶场景中的准确率仅为57%,远低于人类在相似约束下的65%,并暴露了VLMs在理解车辆动态和时间关系上的显著差距。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00520 2026-05-21 cs.CV 78%

CardioBench: Do Echocardiography Foundation Models Generalize Beyond the Lab?

CardioBench: 心脏超声基础模型是否能超越实验室?

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫莫德·本·扎耶德人工智能大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出CardioBench,一个用于评估心脏超声基础模型的基准,通过统一多个公开数据集,评估不同模型在零样本、探测和对齐协议下的性能,揭示通用模型在功能任务上表现优异,但细粒度区分任务上存在不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21168 2026-05-21 cs.CL cs.AI cs.LG 75%

Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question

多样化的大语言模型还是多样化的问题解释?那是集成的问题

Rafael Rosales, Santiago Miret

机构 * Intel Labs(英特尔实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文比较了使用大语言模型回答二元问题的两种多样性方法:模型多样性和问题解释多样性,并发现问题解释多样性在集成准确性上表现更优。

Journal ref Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026), pages 5116-5128

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10139 2026-05-21 cs.CL cs.AI cs.CC cs.FL 73%

The Generation-Recognition Asymmetry: Six Dimensions of a Fundamental Divide in Formal Language Theory

生成-识别不对称性:形式语言理论中根本分裂的六个维度

Romain Peyrichou

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了生成和识别在形式语言理论中的不对称性,通过六个维度分析生成和识别之间的差异,并指出生成和识别在计算复杂性、歧义性、方向性、信息可用性、语法推断和时间性等方面存在显著差异。

Comments Submitted to Information and Computation. 32 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏