arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2611 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2611 篇

2606.26479 2026-06-26 cs.CR cs.AI cs.CL cs.LG 新提交 88%

Adaptive Evaluation of Out-of-Band Defenses Against Prompt Injection in LLM Agents

LLM智能体中针对提示注入的带外防御的自适应评估

Praneeth Narisetty, Shiva Nagendra Babu Kore, Uday Kumar Reddy Kattamanchi, Jayaram Kumarapu

机构 * LaunchSafe Research(LaunchSafe研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文组织带外防御(如CaMeL、Progent)为经典完整性保护与引用监视实例,并在AgentDojo上对Qwen2.5-7B代理进行自适应评估,结果显示Progent将攻击成功率从25.8%降至4.2%,手工自适应攻击未提升成功率。

Comments 12 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24973 2026-06-25 cs.CL cs.AI cs.CY cs.LG 新提交 88%

LLM Performance on a Real, Double-Marked GCSE Benchmark

LLM在真实双评GCSE基准测试中的表现

Malachy Fox, Kavi Samra, Paul Jung

机构 * Medly AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究引入包含32,534份双评真实学生GCSE模拟考试回答的数据集,测试大型语言模型与考官评分的一致性,发现顶级模型比考官之间更一致,为自动化评分提供经济有效的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14312 2026-06-15 cs.DB 新提交 88%

PLRTune: Importance Pre-Sampling and LLM-Guided Reinforcement Learning for Automatic Database Tuning

PLRTune:基于重要性预采样和LLM引导的强化学习自动数据库调优

Xinyue Yang, Chen Zheng, Yaoyang Hou, Renhao Zhang, Yinyan Zhang, Heng Zhang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PLRTune系统,通过重要性预采样识别关键旋钮子集,结合执行引导的提示精炼和TD3强化学习,在MySQL和PostgreSQL上平均性能提升9.50%,调优速度提升9.03倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11196 2026-06-11 cs.CL cs.AI cs.CR cs.LG 新提交 88%

PoQ-Judge: A Multi-Architecture Evaluation Framework for Cost-Aware Proof-of-Quality in Decentralized LLM Inference

PoQ-Judge:去中心化LLM推理中成本感知的证明质量的多架构评估框架

Arther Tian, Alex Ding, Frank Chen, Simon Wu, Aaron Chan

机构 * DGrid AI

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PoQ-Judge框架,训练专用裁判模型对查询-输出对进行无参考评分,研究三种架构,最佳模型在Pearson相关性上达到0.747,级联评估降低72.7%成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08807 2026-06-09 cs.CY 新提交 88%

A Classroom Study of LLM-Generated Feedback Intervention in Introductory Programming

LLM生成反馈干预在入门编程中的课堂研究

Hasnain Heickal, Andrew Lan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 通过随机对照实验,比较自然语言提示、AI生成测试用例和无反馈三种条件,发现自然语言反馈显著提高完成率和收敛速度,而测试用例反馈效果取决于其有效性。

Comments Accepted at IRAISE 2026 (Festival of Learning)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07054 2026-06-08 cs.CL cs.AI cs.CR cs.LG 新提交 88%

TRACE: Trajectory Reasoning through Adaptive Cross-Step Evidence Aggregation for LLM Agents

TRACE: 通过自适应跨步骤证据聚合的LLM智能体轨迹推理

Vijitha Mittapalli, Shreyaa Jayant Dani, Satya Srujana Pilli, Snigdha Ansu, Mohammadreza Teymoorianfard, Franck Dernoncourt, Hongjie Chen, Yu Wang, Ryan A. Rossi, Nesreen K. Ahmed

机构 * University of Massachusetts at Amherst(马萨诸塞大学阿默斯特分校) Adobe Research(Adobe研究) Dolby Labs(杜比实验室) University of Oregon(俄勒冈大学) Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出TRACE框架,通过TIJ循环识别高信号区域、累积跨步骤证据并合成轨迹级判决,在SHADE-Arena的十个任务域上F1达0.713,召回率0.844,尤其擅长长距离证据链接。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12341 2026-08-14 cs.CL 新提交 88%

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

大语言模型在文化禁忌安全方面的“知识-行为差距”

Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机与人工智能学院) Huawei(华为)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型文化禁忌安全评估的现有基准存在不足,本文推出首个公开基准CulShield,发现先进LLMs存在“知识-行为差距”,且语言语境变化会影响其文化禁忌安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12304 2026-08-13 cs.AI 新提交 88%

Constructing Dynamic Master Logic Models as Knowledge Graphs for Complex System Diagnostics Using Retrieval-Augmented Large Language Models

构建动态主逻辑模型作为知识图谱,用于使用检索增强大语言模型的复杂系统诊断

Saman Marandi, Yu-Shu Hu, Mohammad Modarres

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出基于检索增强大语言模型的KG-DML框架,实现了复杂系统动态主逻辑模型的自动化构建,经低压冷却剂注入系统验证,可转化技术文档为可执行功能模型用于诊断分析。

Comments 36 Pages, 8 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11583 2026-08-13 cs.AI 新提交 88%

Localizing Safety Alignment: MLP Layers and Mid-Network Blocks Encode Refusal Behavior in Large Language Models

安全对齐的定位:MLP层与网络中间块编码大语言模型的拒绝行为

Mingyu Zong, Sampad Mohanty, Bhaskar Krishnamachari

机构 * University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究通过移植不同粒度的模型权重实验,发现大语言模型的安全拒绝行为主要编码在MLP层,且集中于网络中间块,其构成具有非加性,存在基准依赖的精度-覆盖权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08736 2026-08-11 cs.AI 新提交 88%

FitAQA: A Benchmark of Fitness Action Quality Assessment for Multimodal Large Language Models

FitAQA:面向多模态大语言模型的健身动作质量评估基准

Kaili Zheng, Kaiwen Wang, Xun Zhu, Qingyuan Yang, Chenyi Guo, Ji Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究推出FitAQA基准,含2219个视频等数据,设计三项评估任务,发现当前MLLMs评估健身动作质量及定位错误存在瓶颈,视觉感知是关键瓶颈,相关数据和代码将公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08512 2026-08-11 cs.AI 新提交 88%

Time Present and Time Past: Benchmarking Large Language Models on Temporally Evolving Document Understanding

当下与过往时间:针对时间演进的文档理解的大语言模型基准测试

Mahbub E Sobhani, Md. Faiyaz Abdullah Sayeedi, Fahmid Hasan Chowdhury, Md Adnan Arefeen, Farig Sadeque, Md. Faizul Bari, Swakkhar Shatabda

机构 * BRAC University(BRAC大学) United International University(联合国际大学) North South University(北南大学) Spectrum Software & Consulting Ltd.(斯佩克特软件咨询有限公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究针对时间演进的文档理解构建了TIDE基准,评估9种LLMs在版本解析任务上的表现,发现模型在检测错误版本时表现较差,倾向于选择参数化答案而非权威文本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07543 2026-08-11 cs.CV cs.AI 新提交 88%

Performance of large language models in the optical diagnosis of colorectal polyps

大型语言模型在结直肠息肉光学诊断中的性能

Joshua C. Vences, William T. Tran, Nikko Gimpaya, Catharine M. Walsh, Rishad J. Khan, Robert Bechara, Asher C. Wiggins, Celine N. Rousan, Kaitlyn V. G. L. Morgado, Angie Ibrahim, Kevin H. M. Kuo, Daniel von Renteln, Alexander Hann, Dennis L. Shung, Michael A. Scaffidi, Charles Ménard, Joshua Landy, Samir C. Grover

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估Claude Opus 4等5款大型语言模型对结直肠息肉的光学诊断性能,发现其区分息肉亚型的准确率接近专家共识,但灵敏度与特异度未达ESGE标准,需进一步研究方可临床应用。

Comments 22 pages, 1 figure, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06861 2026-08-10 cs.AI 新提交 88%

Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents

Gated-BEPO:用于大语言模型智能体的置信门控贝尔曼信用分配

Hongxi Yan, Ziyue Huang, Shichao Fan, Qingjie Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究针对大语言模型智能体长视域训练的信用分配问题,提出Gated-BEPO方法,通过经验rollout图推导步骤级信用并结合置信门自适应融合回合与步骤级信用,在多任务基准上取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04703 2026-08-06 cs.CL 新提交 88%

IslamicTurathBench: A Multi-Task, Multi-Discipline Benchmark for Evaluating Large Language Models on the Islamic Scholarly Tradition (turath)

IslamicTurathBench:用于评估大型语言模型在伊斯兰学术传统(turath)上性能的多任务、多学科基准

Shahd Gaben, Heba Sbahi, Samer Rashwani, Abdessalam Bouchekif, Mutaz Al-Khatib, Emad Mohamed, Somaya Eltanbouly, Mohammed Ghaly

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 该研究推出用于评估大型语言模型伊斯兰学术性能的多任务基准 ISTB,含3465个问答条目,支持多维度可复现评估,填补了该领域高质量标注资源的空白。

Comments Includes supplementary materials. Submitted to the Journal of Scientific Data. Data and code are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04244 2026-08-06 cs.CV cs.CL 新提交 88%

SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

SIGNPOST-Bench:评估多模态大语言模型文本-视觉冲突解决能力的基准

Sirun Li, Minghao Liu, Ling Dai, Yong Li, Haoxin Lyu, Junting Zhou, Fan Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究推出SIGNPOST-Bench基准,通过包含5111个反事实组的25555个图像变体,评估20个多模态大语言模型的文本-视觉冲突解决能力,发现对抗文本会显著提升定位误差,且模型对冲突文本的鲁棒性无法由干净输入的定位性能完全预测。

Comments 27 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03532 2026-08-05 cs.CL 新提交 88%

Cross-Lingual Bias in Large Language Models: A Comparative Analysis of English and Swahili

大语言模型中的跨语言偏见:英语与斯瓦希里语的对比分析

Ruolei Zhang, Teddy Njuguna, Yue Feng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究通过对比GPT-5.2与Gemini 2.5 Flash在英语和斯瓦希里语上的9类人口统计偏见表现,发现偏见会转变而非转移,仅英语偏见审计无法覆盖多语言部署需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03358 2026-08-05 cs.CL cs.CV 新提交 88%

ArtECulture: Benchmarking Culture-Conditioned Visual Emotion Understanding in Multimodal Large Language Models

ArtECulture:评测多模态大语言模型中的文化条件视觉情感理解

Xiaolin Chen, Xuemeng Song, Wenhao Shi, Xianjing Han, Mong-Li Lee, Wynne Hsu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对现有视觉情感理解方法忽略文化差异的问题,提出ArtECulture基准与检索增强型文化条件情感理解框架,评估多模态大语言模型在该任务上的表现并验证框架的提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02520 2026-08-04 cs.CL 新提交 88%

MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

MedPRESS:面向大语言模型中患者压力诱导型医疗谄媚行为的多轮基准测试

Saman Sarker Joy, Niloy Farhan

机构 * Universiti Malaya(马来亚大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MedPRESS是衡量大语言模型患者压力诱导型医疗谄媚行为的多轮基准,含600个五轮医学对话,评估20类LLM发现其易在压力下不安全附和,反谄媚提示仅部分改善,凸显医疗LLM需抗对话压力的缺口。

Comments 27 pages, 10 figures. Both authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02397 2026-08-04 cs.SD cs.AI 新提交 88%

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad

机构 * Perle(珀尔)

专题命中 评测与基准 :language model(title);foundation model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究构建涵盖11种音频分类方法的分层基准,在2242个音频片段的闭集声源识别任务中评估性能,发现Gemini-3.1-Pro-Preview表现最优,还分析了Gemini模型的思维链特性并给出方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28318 2026-07-31 cs.AI 新提交 88%

PathView-Bench: Can Multimodal Large Language Models Achieve Fine-grained Multiscale Understanding of Pathology Images?

PathView-Bench:多模态大语言模型能否实现病理图像的细粒度多尺度理解?

Zongyi Chen, Yu Liang, Jie Lin, Liansheng Wang

机构 * National Institute for Data Science in Health and Medicine, Xiamen University(厦门大学健康与医学数据科学国家研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对现有病理多模态基准的不足,推出PathVU基准,评估发现主流MLLMs在多尺度病理图像细粒度视觉任务上存在显著局限,为相关模型的开发评估提供了可复现基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28086 2026-07-31 cs.AI 新提交 88%

Distilling Answer Set Programming Theories from Large Language Models

从大型语言模型中提炼答案集编程理论

Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

机构 * ExtensityAI

专题命中 评测与基准 :large language model(title);language model(title);LLM(summary_cn);分类 cs.AI

AI总结 该研究针对从头编写ASP理论困难的问题,采用神经符号方法测试9种模型从LLM提炼ASP理论的能力,在VQA基准上验证了前沿模型的性能,并发布了相关资源。

Comments Accepted at NeSy 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24273 2026-07-28 cs.CL 新提交 88%

INS-ActBench: A Comprehensive Benchmark for Assessing Professional Actuarial Capability of Large Language Models

INS-ActBench:一个用于评估大语言模型专业精算能力的综合基准

Changyu Chen, Chenwei Lin, Xian Xu

机构 * Fudan University(复旦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 介绍INS-ActBench这一综合基准评估大语言模型专业精算能力,含12050个问答对及三个子集,通过实验揭示前沿大语言模型在不同方面的能力表现,为精算大语言模型开发提供可重复基础。

Comments 18 pages, including appendices; 11 figures and 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20499 2026-07-24 cs.AI cs.SE 新提交 88%

ExecuGraph: A Multi-Agent, Execution-Grounded Framework for Reliable Backend Code Synthesis with Large Language Models

ExecuGraph:一种用于通过大语言模型进行可靠后端代码合成的多智能体、基于执行的框架

Sai Deekshith Lekkala, Jothi Prabha Appadurai, Rohith Reddy Bellibatlu, Manpreet Singh

机构 * Department of Computer Science and Engineering (AI & ML), Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系(人工智能与机器学习)) Department of Computer Science and Engineering, Kakatiya Institute of Technology and Science(卡凯蒂亚理工学院计算机科学与工程系) Boston University(波士顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型后端代码合成可靠性问题,提出ExecuGraph多智能体框架,将执行验证置于核心,通过六个智能体和有向工作流协调,在多数据集评估中对比单智能体基线,验证方法有效性且能控制测量各因素贡献。

Comments Submitted to Data Science and Management

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19834 2026-07-23 cs.CL 新提交 88%

D2VBench: Benchmarking Large Language Models with Value Dilemmas in Daily Scenarios

D2VBench:在日常场景中使用价值困境对大语言模型进行基准测试

Siyi Hao, Yidi Cao, Linhao Yu, Yuqi Ren, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) The International Joint Institute of Tianjin University(天津大学国际联合研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型输出价值含义评估问题,提出D2VBench基准,通过多阶段协作构建含10000个日常困境实例的数据集,采用混合评估范式,对八个主流模型全面评估,结果显示该基准可靠性和鲁棒性高,能反映模型价值一致性。

Comments 22 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18066 2026-07-21 cs.CL 新提交 88%

Pancasila-Dilemmas: Evaluating Large Language Models on Indonesian Human Value Dilemmas Grounded in Pancasila

潘查希拉困境:基于潘查希拉对印度尼西亚人类价值困境的大语言模型评估

Supryadi, Irfan, Julianti, Darren Keanly Martin, Jayvin Fernando, Yuqi Ren, Deyi Xiong

机构 * Universitas Universal(印尼环球大学) Beijing Language and Culture University(北京语言大学) Tianjin University(天津大学) School of Artificial Intelligence, Tianjin University(天津大学人工智能学院) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究基于印尼新闻构建潘查希拉困境数据集,含1834个按潘查希拉五价值观分类的问题,用于评估大语言模型价值对齐。通过母语人士校对及公民回答,评估50个模型,发现各模型在宗教和团结困境案例中表现差,凸显印尼价值观捕捉差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17745 2026-07-21 cs.AI 新提交 88%

WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

吴语-环境执法基准:评估大语言模型在环境执法中的基准

Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen

机构 * School of Environment, Tsinghua University(清华大学环境学院) College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。

Comments 98 pages, 45 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16609 2026-07-21 cs.CV cs.CL 新提交 88%

Can Multimodal Large Language Models Understand OCT?

多模态大语言模型能理解光学相干断层扫描(OCT)吗?

Baochen Fu, Wenzhi Deng, Baihao Jin, Yang Li, Zihan Nie, Kailin Jiang, Yuntao Du, Weiye Song

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究探讨多模态大语言模型能否理解OCT,引入OCT - Bench基准,包含多维度细粒度任务,基于多个数据集构建大量选择题,评估20个代表性模型,发现当前模型理解OCT能力不足,为评估模型和推动OCT理解提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11890 2026-07-15 cs.CY cs.AI 新提交 88%

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

众多观点,众多大语言模型:将大语言模型与传统机器学习用于开放式调查分析的比较

Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究对比多种大语言模型与传统机器学习用于开放式调查分析,在情感分析和主题分类等任务中评估性能,发现LLMs分类准确性更高,但在预测理由及应用类别边界上差异大,凸显了使用LLMs进行定性分析时的权衡并给出实用建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02007 2026-07-03 cs.CL cs.CV 新提交 88%

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

EduArt:评估大型语言模型艺术史知识的教育级基准

Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

机构 * University of Bologna(博洛尼亚大学) Villa i Tatti – The Harvard University Center for Italian Renaissance Studies(哈佛大学意大利文艺复兴研究中心(I Tatti)) University of Copenhagen(哥本哈根大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出EduArt基准,包含871道人工出题的艺术史题目,评估多模态大模型在不同格式和语言下的知识掌握与推理能力,发现格式显著影响表现,多选题高估模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01612 2026-07-03 cs.AI 新提交 88%

Scaling with Confidence: Calibrating Confidence of LLMs for Adaptive Test Time Scaling

自信地扩展:校准LLM的置信度以实现自适应测试时扩展

Xuqing Yang, Yi Yuan, Shanzhe Lei, Xuhong Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Southeast University(东南大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出C3RL算法,通过结合正确性、校准和数据集参考准确率奖励来校准LLM的置信度,并基于此引入CAS策略,根据置信度自适应分配推理计算资源,在提升校准性的同时降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏