arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-16 至 2026-07-16 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 61 篇

2607.13190 2026-07-16 physics.ed-ph 新提交 92%

Reliable isomorphic physics problem generation with large language models

基于大语言模型的可靠同构物理问题生成

Xian Wu, Lindim Ismaili

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究利用大语言模型代理工作流程生成同构物理问题,通过结合提示链等技术,在公共网站实现。开发评分标准并测试,89%生成问题可直接用,虽有局限,但显示出基于LLM系统在教学问题生成上的潜力与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02317 2026-07-16 cs.LG cs.AI cs.CY 91%

Defining and Evaluating Physical Safety for Large Language Models

定义和评估大语言模型的物理安全性

Yung-Chen Tang, Pin-Yu Chen, Tsung-Yi Ho

机构 * The Chinese University of Hong Kong(香港中文大学) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出了一种无人机控制的全面基准,评估大语言模型在物理安全方面的风险与权衡,揭示了模型在安全性和实用性之间的不理想平衡。

Journal ref Communications of the ACM, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07323 2026-07-16 cs.AI cs.LG cs.NE cs.SC 版本更新 90%

Discovering Ordinary Differential Equations with LLM-Based Qualitative and Quantitative Evaluation

基于LLM的定性与定量评估的常微分方程发现

Sum Kyun Song, Bong Gyun Shin, Jae Yong Lee

机构 * Department of Artificial Intelligence, Chung-Ang University, Seoul, Republic of Korea(韩国首尔 Chung-Ang 大学人工智能系) Daejin University, Pocheon, Republic of Korea(韩国坡州市 Daejin 大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出DoLQ方法,通过多智能体架构结合LLM进行定性与定量评估,实现常微分方程的发现,实验表明其在多维ODE基准测试中性能优于现有方法。

Comments Accepted at ICML 2026

Journal ref International Conference on Machine Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00409 2026-07-16 cs.AI cs.CL 90%

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

多任务少资源:针对基于大语言模型系统中资源优化的路由策略综述

Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

机构 * Wikit Laboratoire Hubert Curien, UMR CNRS 5516(劳尔贝尔特·库尔尼恩实验室,CNRS UMR 5516) INSA Rouen Normandie(里昂-诺曼底理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了基于大语言模型系统的路由策略,旨在通过优化资源利用提高效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13820 2026-07-16 cs.SE 新提交 89%

PROBE: Benchmarking Code Generation in Large Language Models

PROBE:大语言模型中代码生成的基准测试

Rodrigo Pato Nogueira, Marco Vieira, João R. Campos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 针对大语言模型代码生成评估不足,介绍PROBE基准框架,基于多维度评估代码,用于评估多种模型和语言,发现LLMs虽有成果,但处理难题及小模型在特定语言上有困难,且常因易避免错误失败。

Comments Accepted for publication in Empirical Software Engineering (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22415 2026-07-16 cs.CV cs.AI 版本更新 88%

Evidence Recomposition and Predictive Context Residualization for Visual Attribution in Multimodal Large Language Models

多模态大语言模型中用于视觉归因的证据重组与预测上下文残差化

Jiawei Liang, Jianjie Huang, Ruoyu Chen, Xianghao Jiao, Siyuan Liang, Shiming Liu, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Zhongguancun Academy(中关村学院) University of Chinese Academy of Sciences(中国科学院大学) Nanyang Technological University(南洋理工大学) Department of Mechanical Engineering, Imperial College London(伦敦帝国理工学院机械工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究多模态大语言模型token级视觉证据难检查问题,提出基于证据重组和预测上下文残差化的ERCR框架,经实验验证该框架能改善目标token视觉证据、减轻上下文干扰,为视觉证据检查提供实用改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13801 2026-07-16 cs.CR cs.AI cs.LG 新提交 88%

Traffic-Aware Randomized Smoothing for LLM-Based Network Intrusion Detection

基于大语言模型的网络入侵检测的流量感知随机平滑

Zhenpeng Li

机构 * Guangzhou Health Science College(广州健康科学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究基于大语言模型的网络入侵检测系统对流量操纵的鲁棒性,提出流量感知随机平滑方法TA-RS,通过在特定子空间注入噪声,提升认证准确率,不同数据集表现有差异,还探究了方法局限性及改进策略。

Comments 44 pages, 14 figures, 14 tables. Submitted to Expert Systems with Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13934 2026-07-16 cs.MA 新提交 88%

Pezego-HITL: A policy-grounded large language model architecture for agricultural extension in Ghana

Pezego-HITL:一种用于加纳农业推广的基于政策的大语言模型架构

Shunbao Li, Zhipeng Yuan, Amoako Ofori, Benedicta Y. Fosu-Mensah, Yang Li, Manu Kenchappa Junjanna, Qing Xue, Po Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究针对加纳农业推广中大语言模型应用问题,提出基于政策的结构化检索增强生成与验证内存路由方法,通过P-EVAL框架评估,提升了模型政策对齐率、农艺利用率,降低延迟,还验证了通用性,为小农户农业提供可扩展模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24902 2026-07-16 cs.CL cs.AI cs.LG 版本更新 88%

When Reasoning Hurts: Source-Aware Evaluation of Frontier LLMs for Clinical SOAP Note Generation

当推理有害:面向临床SOAP笔记生成的前沿LLM源感知评估

Faizan Faisal

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 通过源感知基准测试,评估推理增强型LLM在临床SOAP笔记生成中的表现,发现推理能力反而降低GPT-5.4的质量,而相同源RAG带来模型依赖的小幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18147 2026-07-16 cs.LG 版本更新 87%

Foundation Models for Credit Risk Prediction: A Game Changer?

信贷风险预测的基础模型:变革性突破?

Bart Baesens, Andreas Goethals, Stefan Lessmann, Simon De Vos, Cristián Bravo, David Martens, Victor Medina-Olivares, Christophe Mues, Maria Oskarsdóttir, Seppe vanden Broucke, Tony Van Gestel, Tim Verdonck, Wouter Verbeke

机构 * Faculty of Economics and Business, KU Leuven, Belgium(比利时库勒万大学经济与商业学院) School of Business and Economics, Humboldt University of Berlin, Germany(德国洪堡大学商学院) Department of Statistical and Actuarial Sciences, Western University, Canada(加拿大西部大学统计与精算科学系) Department of Engineering Management, University of Antwerp, Belgium(比利时安特卫普大学工程管理系) Business School, University of Edinburgh, United Kingdom(英国爱丁堡大学商学院) Business School, University of Southampton, United Kingdom(英国南安普顿大学商学院) School of Mathematical Sciences, University of Southampton, United Kingdom(英国南安普顿大学数学科学学院) Department of Business Informatics and Operations Management, Ghent University, Belgium(比利时根特大学商业信息与运营管理系) Department of Mathematics, University of Antwerp, Belgium(比利时安特卫普大学数学系) Department of Mathematics, KU Leuven, Belgium(比利时库勒万大学数学系)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了信贷风险预测中基础模型的应用,探讨了其在小数据环境下提升预测性能的能力,并通过对比多种方法验证了基础模型在PD和LGD建模任务中的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05396 2026-07-16 cs.CL cs.SE 版本更新 87%

FairCoder: Probing LLM Bias in High-Stakes Decision Making via Coding Tasks

FairCoder:通过编码任务探究高风险决策中语言模型的偏差

Yongkang Du, Jen-tse Huang, Jieyu Zhao, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过FairCoder基准将决策制定设为编码任务,探究LLMs在多领域的偏差,针对现有指标不足提出FairScore指标,经实验揭示了此前未充分探索的偏差模式,凸显LLMs作决策代理的风险并提供评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13602 2026-07-16 cs.CL cs.LG stat.ML 新提交 87%

Analogical Deep Research: Retrieving and Integrating Historical Analogies for Foresight Analysis

类比深度研究:检索和整合历史类比以进行前瞻性分析

Yongqiang Chen, Guangyi Chen, Yuewen Sun, Kun Zhang

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出类比深度研究(ADR)任务及ADR-bench,发现LLM智能体找类比能力差。基于理论分析提出ADR原则,构建因果类比研究者(CANA)框架,提升历史类比生成效果,超越现有智能体,案例研究证实其利用历史类比的有效性。

Comments Ongoing project

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13189 2026-07-16 cs.CL cs.AI 新提交 87%

RAGthoven at SemEval-2026 Task 1: A Multi-Stage Pipeline Walks Into a Benchmark and Barely Clears the Bar

RAGthoven参加SemEval-2026任务1:一个多阶段管道进入基准测试且勉强达标

Marek Šuppa, Viktória Ondrejová, Lucia Ganajová, Gregor Karetka, Daniel Skala

机构 * Comenius University in Bratislava(布拉迪斯拉发的夸美纽斯大学) Cisco Systems(思科系统公司) Zaitra s.r.o.(扎伊特拉有限公司) NaiveNeuron(天真神经元)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 介绍用于SemEval-2026任务1子任务A的RAGthoven系统,它将幽默文本生成分解为多阶段LLM管道,经多次实验优化,最终配置用RAG增强规划器,还评估两种智能变体,虽工具调用预算增加,但在英语样本上未超非智能管道,在三种语言中与基线并列第一,显示语言相关回报递减。

Comments SemEval-2026 Task 1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13036 2026-07-16 cs.CL cs.AI 新提交 85%

Ask Before You Diagnose: Safe-Psych, a Sequential Evaluation Benchmark for LLMs in Psychiatry

诊断前先询问:Safe-Psych,一种用于精神病学领域大语言模型的顺序评估基准

Oriana Presacan, Andreea Grama, Larisa Irimină, Alireza Nik, Jaya Ojha, Vajira Thambawita, Ciprian I. Băcilă, Bogdan Ionescu, Michael A. Riegler

机构 * National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学国立科技大学) Psychiatric Hospital Doctor Gheorghe Preda(格奥尔基·普雷达医生精神病医院) Oslo Metropolitan University(奥斯陆都市大学) Kristiania University of Applied Sciences(克里斯蒂亚尼亚应用科学大学) SimulaMet(SimulaMet公司) Lucian Blaga University of Sibiu(锡比乌卢西安·布拉加大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型在精神病学决策支持中处理证据不完整问题,引入顺序评估基准Safe-Psych,通过模拟真实临床记录及精神科医生行动标签,评估多个模型,发现模型存在过早诊断等问题,揭示其局限性,为改善模型安全性研究提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08803 2026-07-16 q-bio.QM cs.AI cs.LG 版本更新 84%

TheBioCollection: Unified Pre-Training Scale LLM Corpus for Biology

TheBioCollection:用于生物学的统一预训练规模语言模型语料库

Hyunjin Seo, Hyeon Hwang, Gyubok Lee, Jay Shin, Jimin Park, Taesoo Kim, Sanghoon Lee, Hongjoon Ahn, Sungjun Han, Sangwon Jung

机构 * Trillion Labs KAIST(韩国科学技术院) SK Biopharmaceuticals Co., Ltd.(SK生物制药公司) Lunit Inc.(Lunit公司) AIGEN Sciences Inc.(AIGEN科学公司)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 为满足生物学大语言模型训练需求,提出TheBioCollection语料库,整合异构生物资源并丰富记录、引入新任务,配对TheBioCollection-Eval评估,固定架构训练后模型在各领域表现提升,语言能力基本不变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22426 2026-07-16 cs.DL 83%

Can ChatGPT be a good follower of academic paradigms? Research quality evaluations in conflicting areas of sociology

ChatGPT能否成为良好的学术范式追随者?社会学冲突领域的研究质量评估

Mike Thelwall, Ralph Schroeder, Meena Dhanda

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了ChatGPT在评估学术出版物质量时对不同社会学范式偏见的影响,发现遵循对齐范式时评分最高,而对立范式评估导致显著劣势。

Journal ref Journal of Data and Information Science., 11(2), 394-404

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13707 2026-07-16 cs.CL cs.SE 新提交 83%

The Test Oracle Problem in Synthetic LLM-as-Judge Corpora: Disappearance, Distortion and a Validation Protocol

合成语言模型作为评判语料库中的测试预言机问题:消失、扭曲与验证协议

Serkan Ballı

机构 * Mehmet Akif Ersoy University(梅赫梅特·阿基夫·埃尔索伊大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究语言模型作为评判系统中合成语料库的测试预言机问题,指出其负面示例由语言模型生成时存在完整性验证漏洞,通过多语言语料库案例揭示答案截断、偏差扭曲等问题,并提出验证协议供无预言机模式分析师使用。

Comments 23 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13305 2026-07-16 cs.CV cs.AI cs.MM 新提交 83%

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

无需基础的准确性:诊断视频语言模型基准测试中的视觉依赖解离

Jae Joong Lee

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究视频语言模型基准测试中视觉依赖问题,引入视觉依赖差距(VDG),通过实验表明准确性与视觉依赖可分离,任务类型排名稳定,帧多样性贡献大,H.264实验有新发现,VDG可作标准审查,推动相关研究。

Comments Accepted, ACM International Conference on Multimedia 2026 (ACM MM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13618 2026-07-16 cs.AI cs.LG 新提交 81%

STOCKTAKE: Measuring the Gap Between Perception and Action in LLM Agents with a Fair Oracle

库存盘点:使用公平预言机测量大语言模型智能体中感知与行动之间的差距

Sagar Deb, Ashwanth Krishnan

机构 * QpiAI

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型智能体在多周决策任务中的知行差距,提出库存盘点基准,通过公平参考策略区分感知与行动失败,测量知行差距两方向,为评估大语言模型智能体提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13568 2026-07-16 cs.CL cs.LG 新提交 81%

Graded Entity-Familiarity Readouts in Language Models: Polish Adaptation, Cross-Language Robustness, and Refusal Steering

语言模型中的分级实体熟悉度读数:波兰语适配、跨语言鲁棒性和拒绝引导

Grzegorz Brzezinka

机构 * Prosit AS(Prosit公司)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在生成答案前估计对实体的熟悉度,通过新数据集及实验发现熟悉度探测分数可区分实体,在波兰语适配家族中追踪实体受欢迎程度,跨语言鲁棒,在特定模型中可调节拒绝率,校准后的熟悉度探测有竞争力。

Comments 16 pages, 8 figures, 5 tables. Code and data: https://github.com/agentGreg/bielik-entity-familiarity

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11098 2026-07-16 cs.SE cs.AI cs.CL 版本更新 81%

AgentCheck: A Reproduce-Intervene-Mitigate Workbench for LLM Agents over MCP

AgentCheck:用于基于MCP的大型语言模型智能体的重现-干预-缓解工作台

Aritra Mazumder, Nusrat jahan Lia

机构 * University of Utah(犹他大学) University of Dhaka(达卡大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 研究针对工具使用型大语言模型智能体在工具出现问题时开发者难以处理故障的情况,提出AgentCheck开源工作台,通过特定运行和重放方式形成重现-干预-确认循环,能对故障模式进行评估验证,提升智能体故障处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13477 2026-07-16 cs.SD cs.CL eess.AS 新提交 79%

Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation

大型音频语言模型语音评估中协议级捷径的审计

Joonyong Park, David M. Chan, Yuki Saito, Hiroshi Saruwatari

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究大型音频语言模型语音评估中协议级捷径,通过对三种部署协议审计发现多个LALM依赖此类捷径,如特征蓝图评判中错误标签影响准确率,拼接A/B比较有固定选择倾向,强调联合评估模型与协议及用匹配探针评估的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13453 2026-07-16 cs.CR cs.AI 新提交 79%

Adversarial Prompting Framework for AI Safety Assessment

用于人工智能安全评估的对抗性提示框架

Yash Bhatnagar, Kunal Banerjee, Anirban Chatterjee

机构 * Microsoft(微软)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.AI

AI总结 针对人工智能尤其是生成式人工智能应用增加带来的安全问题,提出对抗性提示框架,通过生成多复杂程度的对抗性提示评估模型弹性,在企业环境中实现自动化测试并获定量指标及差异结果。

Comments 3 pages, 1 figure, presented as a poster at International Conference on Data Science (CODS), December 17-20, 2025, Pune, India

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13071 2026-07-16 cs.SE cs.AI 新提交 79%

Compaction as Epistemic Failure: How Agentic LLM Tools Fabricate Confirmed Results from Killed Processes

作为认知失败的压缩:智能语言模型工具如何从终止进程中编造确认结果

Hiroki Tamba

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究智能语言模型编码工具中Claude Code的失败模式,即超时命令部分输出被误记为确认结果并传播误报,揭示其观察与持久性 conflation 的机制,指出对依赖会话连续性的工作流程有影响。

Comments 8 pages, companion to arXiv:2606.26185

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13041 2026-07-16 cs.CY cs.AI cs.LG cs.MM 新提交 79%

LessonBench-V1: A Benchmark Dataset for Evaluating AI Lesson Generation Agents

LessonBench-V1:用于评估人工智能课程生成代理的基准数据集

Ravidu Suien Rammuni Silva, Ahmad Lotfi, Isibor Kennedy Ihianle, Golnaz Shahtahmassebi, Jordan J. Bird

机构 * Department of Computer Science, Nottingham Trent University, Nottingham, UK(计算机科学系,诺丁汉特伦特大学,诺丁汉,英国) Department of Physics and Mathematics, Nottingham Trent University, Nottingham, UK(物理与数学系,诺丁汉特伦特大学,诺丁汉,英国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对无标准化基准评估人工智能课程生成系统的问题,引入LessonBench-V1基准数据集,其含人工编写课程与逆向工程课程计划,经人工审核并综合多种教学方法生成,可系统评估相关代理,还提出三维评估管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13968 2026-07-16 q-fin.GN 新提交 78%

Measuring Sentiment News with Transformer-Based Language Models

用基于Transformer的语言模型衡量新闻情绪

Maria Saveria Mavillonio, Stefano Borgioli, Caterina Giannetti, Chiara Ongari, Giampiero M. Gallo

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究财经新闻情绪衡量,提出用基于Transformer语言模型构建指数框架,经实验将其结果与基准指标对比,并通过人类标注验证,发现该模型能产生更贴近人类评估的情绪指标,与人类判断一致性更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14026 2026-07-16 cs.CE 新提交 78%

From Forecasts to Auditable Reports: Evidence Contracts for LLM-Assisted Housing-Guarantee Risk Monitoring

从预测到可审计报告:大语言模型辅助住房担保风险监测的证据契约

Hyeongcheol Kim, Yoontae Hwang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究将住房担保风险预测转化为可审计报告的挑战,提出证据约束报告流程,利用韩国租房押金数据,结合预测模型与结构化证据、验证及分析师监督,提升高风险检测能力,经评估报告支持实际决策,证明该方法可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08842 2026-07-16 cs.CY 版本更新 78%

L2-Bench: An Evaluation Benchmark for Measuring LLM Capabilities in Second Language Education

L2-Bench:用于衡量第二语言教育中大型语言模型能力的评估基准

James Edgell, Wm. Matthew Kennedy, Ben Knight, Danielle Carvalho, Martin Ku, Isaac Pattis

专题命中 评测与基准 :LLM(title,abstract)

AI总结 研究针对第二语言教育中AIED系统评估不足的问题,引入L2-Bench开源基准。通过 validated分类法、基于评分标准的评估方法和评估数据集,对大型模型能力进行评估,发现Claude Opus 4.7总体最佳,难任务性能降,为教育决策提供方法,推动AI评估科学成熟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22830 2026-07-16 cs.CV cs.RO 版本更新 78%

A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions

大型视觉-语言模型在SOTIF条件下2D目标检测的比较评估

Ji Zhou, Yilin Ding, Yongqi Zhao, Jiachen Xu, Dong Bi, Johannes Betz, Arno Eichberger

机构 * Institute of Automotive Engineering, Graz University of Technology(汽车工程研究所,格拉茨技术大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了大型视觉-语言模型在SOTIF条件下2D目标检测的性能,发现其在复杂场景中召回率显著优于传统方法,但几何精度仍有一定优势。

Comments 8 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22633 2026-07-16 cs.SE 版本更新 78%

Rethinking the Capability of Fine-Tuned Language Models for Automated Vulnerability Repair

重新思考微调语言模型在自动漏洞修复方面的能力

Woorim Han, Yeongjun Kwak, Miseon Yu, Kyeongmin Kim, Younghan Lee, Hyungon Moon, Yunheung Paek

专题命中 评测与基准 :language model(title,abstract)

AI总结 探讨基于微调语言模型的自动漏洞修复技术,通过语义变换、重划数据集和引入新基准三种方式,考察现有模型能力及匹配评估指标充分性,以提升模型修复未见漏洞的能力和评估准确性。

Comments To appear at ICSE 2026. 13 pages. The L-AVRBench benchmark, Docker images, and evaluation scripts are available at https://github.com/rimwoohan/L-AVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏