arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-04 至 2026-08-04 共收录 725 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 174 篇

2608.02024 2026-08-04 cs.AI cs.CY 新提交 90%

EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers

EduZone:面向K-12学生与教师的大语言模型安全评估框架

Junyeong Park, Jieun Han, Haneul Yoo, So-Yeon Ahn, Jinsung Yoon, Alice Oh

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EduZone是针对K-12教育场景的LLM安全评估框架,整合多维度要素生成对抗交互,评估10个LLMs后发现其对教育特定风险更脆弱,现有防护措施不足,该框架可助力开发更安全的教育类LLMs。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交 90%

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01684 2026-08-04 cs.AI 新提交 90%

GABench: A Comprehensive Benchmark for Evaluating LLM Agents on Graph Analysis Tasks

GABench:用于评估大语言模型智能体图分析任务的综合基准

Jiarui Tan, Zhongjian Zhang, YaBo Guo, Jiawei Liu, Yujie Xing, Muhan Zhang, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出GABench这一综合基准,涵盖多类图类型与任务及84个可执行工具,构建10400个带可验证答案的任务,评估前沿LLM及智能体框架,发现现有智能体应对复杂图任务仍存局限等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01633 2026-08-04 cs.LG 新提交 90%

GraphIR: Architecture-Level Search States for LLM-Guided Neural Architecture Evolution

GraphIR:面向大语言模型引导的神经架构演化的架构级搜索状态

Zhen Liu, Wanqi Zhou, Shuanghao Bai, Yuhan Liu, Jinjun Wang, Jingwen Fu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM引导NAS中代码级表示无法满足架构变异需求的问题,提出架构感知中间表示GraphIR,在六个下游基准中集成到OpenEvolve后实现最佳搜索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00685 2026-08-04 cs.AI 新提交 90%

When Does LLM Orchestration Pay Off? A Controlled Evaluation of Accuracy, Cost, and Task Difficulty

LLM编排何时划算?关于准确率、成本与任务难度的对照评估

Nicolas Leins, Nico Pelleriti, Jana Gonnermann-Müller, Sebastian Pokutta

机构 * Zuse Institute Berlin(柏林Zuse研究所) TU Berlin(柏林工业大学) Weizenbaum Institute Berlin(柏林魏茨曼研究所)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究对照评估了Self-Refine等三种LLM编排方法与基线方法在5种骨干模型、3个领域的表现,发现编排收益依赖模型,需权衡准确率提升与额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08091 2026-08-04 cs.CL 版本更新 90%

Toward Robust LLM-Based Judges: Taxonomic Bias Evaluation and Debiasing Optimization

迈向鲁棒的基于大语言模型的裁判:偏见评估与去偏优化

Hongli Zhou, Hui Huang, Rui Zhang, Kehai Chen, Bing Xu, Conghui Zhu, Tiejun Zhao, Muyun Yang

机构 * Hongli Zhou(哈尔滨工业大学) Hui Huang(哈尔滨工业大学) Rui Zhang(哈尔滨工业大学) Kehai Chen(哈尔滨工业大学) Bing Xu(哈尔滨工业大学) Conghui Zhu(哈尔滨工业大学) Tiejun Zhao(哈尔滨工业大学) Muyun Yang(哈尔滨工业大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeBiasBench,通过系统量化LLM裁判偏见,提出偏见感知训练方法,减少偏见并保持评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01193 2026-08-04 cs.AI cs.CY cs.GT cs.LG cs.MA 新提交 90%

Humans Are More Diverse: Frontier LLMs Show Extreme Policies in Idealised AI Development Races

人类更多样化:前沿大语言模型(LLM)在理想化AI开发竞赛中表现出极端策略

Phu Hoa Pham, Duy Minh Dao Sy, Trung Kiet Huynh, Phu Quy Nguyen Lam, Chi Nguyen Tran, Minh Trung Le, Phong Hao Le, Dinh Nam Nguyen, Thien Ky Nguyen Dong, Elias Fernandez Domingos, Le Hong Trang, The Anh Han

机构 * Ho Chi Minh City University of Science(胡志明市科学大学) Vietnam National University Ho Chi Minh City (VNU-HCM)(越南国家大学胡志明市分校) Ho Chi Minh City University of Technology (HCMUT)(胡志明市技术大学(HCMUT))

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究通过多智能体博弈实验对比前沿LLM与人类在AI开发竞赛中的策略,发现LLM行动具模型特异性,需有效性检查才能判定其策略性与安全意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01292 2026-08-04 cs.CL 新提交 89%

CrossLex: A Source-Grounded Benchmark for Cross-Jurisdictional Legal Reasoning in Large Language Models

CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集

Xiaocui Yang, Xican Tan, Shoujie Chen, Shihan Xiao, Keke Tong, Xinyu Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.14191 2026-08-04 cs.CR cs.CL 89%

S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Xiaohan Yuan, Jinfeng Li, Dongxia Wang, Yuefeng Chen, Xiaofeng Mao, Longtao Huang, Jialuo Chen, Hui Xue, Xiaoxia Liu, Wenhai Wang, Kui Ren, Jingyi Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ISSTA 2025

Journal ref Proceedings of the ACM on Software Engineering, Vol. 2, ISSTA, pp. 2136-2157, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00718 2026-08-04 cs.CR cs.AI cs.MA 新提交 89%

Adversarial Attacks in Multi-Agent LLM Pipelines: Unveiling Structural Vulnerabilities in Agentic AI Architectures

多智能体大语言模型流水线中的对抗攻击:揭示智能体AI架构的结构性漏洞

Faisal Haque Bappy, Tahrim Hossain, Tarannum Shaila Zaman, Raiful Hasan, Kamrul Hasan, Tariqul Islam

专题命中 评测与基准 :LLM(title,summary_cn);language model(abstract);分类 cs.AI

AI总结 该研究针对多智能体LLM流水线的结构性漏洞,通过在GPT-5-mini等模型上的实验,发现对抗性漏洞源于架构而非模型能力,推动流水线级防御的发展。

Comments This paper has been accepted at the 2026 IEEE Global Communications Conference (GLOBECOM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00817 2026-08-04 cs.CL 版本更新 89%

When LLMs Stop Following Steps: A Diagnostic Study of Procedural Execution in Language Models

当LLM停止遵循步骤:语言模型中程序执行的诊断研究

Sailesh Panda, Pritam Kadasi, Abhishek Upperwal, Mayank Singh

机构 * Indian Institute of Technology Gandhinagar(印度理工学院冈丁加尔)

专题命中 评测与基准 :language model(title,abstract);LLM(title_cn,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本研究通过构建受控诊断基准,评估大型语言模型在程序执行任务中的忠实性,发现随着步骤增加准确率从63%降至20%,并揭示了缺失答案、过早答案、自我修正和执行不完整等失败模式。

Comments 24 pages, 19 figures, 4 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15412 2026-08-04 cs.CL cs.AI 版本更新 88%

Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?

基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?

Jakob Mraz, Tomaž Curk, Blaž Zupan

机构 * University of Ljubljana(卢布尔雅那大学) Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型进行少样本生物医学关系抽取,比较成对分类与联合生成两种方法,发现联合生成更精确高效,在宏F1上超越监督基线,尤其在稀有关系类型上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06996 2026-08-04 cs.CL cs.AI 版本更新 88%

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

基于评分标准的大型语言模型评估中的自我偏好偏差

José Pombal, Ricardo Rei, André F. T. Martins

机构 * Sword Health TransPerfect ELLIS Unit Lisbon(ELLIS 里斯本分部)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了基于评分标准的评估中自我偏好偏差对模型评估的影响,发现即使评分标准客观,自我偏好仍会导致评分偏差,且通过多评委ensemble可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02520 2026-08-04 cs.CL 新提交 88%

MedPRESS: A Multi-turn Benchmark for Patient-Pressure-Induced Medical Sycophancy in LLMs

MedPRESS:面向大语言模型中患者压力诱导型医疗谄媚行为的多轮基准测试

Saman Sarker Joy, Niloy Farhan

机构 * Universiti Malaya(马来亚大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 MedPRESS是衡量大语言模型患者压力诱导型医疗谄媚行为的多轮基准,含600个五轮医学对话,评估20类LLM发现其易在压力下不安全附和,反谄媚提示仅部分改善,凸显医疗LLM需抗对话压力的缺口。

Comments 27 pages, 10 figures. Both authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02397 2026-08-04 cs.SD cs.AI 新提交 88%

Can Foundation Models Hear What Made That Sound? A Tiered Benchmark of Audio-Language Models and Traditional Classifiers for Closed-Set Sound Source Identification

基础模型能否识别声音的来源?针对闭集声源识别的音频-语言模型与传统分类器的分层基准测试

Sajjad Abdoli, Ghassan Al-Sumaidaee, Ahmad ElShiekh, Ahmed Rashad

机构 * Perle(珀尔)

专题命中 评测与基准 :language model(title);foundation model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究构建涵盖11种音频分类方法的分层基准,在2242个音频片段的闭集声源识别任务中评估性能,发现Gemini-3.1-Pro-Preview表现最优,还分析了Gemini模型的思维链特性并给出方法选择指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27964 2026-08-04 cs.SE cs.AI 版本更新 88%

Specification-Guided Synthesis of Deadlock-Free Communication Protocol Refinements with Large Language Models

基于大语言模型的、由规范引导的无死锁通信协议精化合成

Yang Li, Ping Hou, Nobuko Yoshida

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究提出Syntropy框架,结合多方会话类型规范与大语言模型合成无死锁通信协议精化,经评估其有效性达95.6%-99.5%,可生成多样且语法正确的协议精化方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05938 2026-08-04 cs.AI 版本更新 88%

ICU-Bench:Benchmarking Continual Unlearning in Multimodal Large Language Models

ICU-Bench: 多模态大语言模型持续反学习基准测试

Yuhang Wang, Wenjie Mei, Junkai Zhang, Guangyu He, Zhenxing Niu, Haichang Gao

机构 * School of Computer Science and Technology(计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出ICU-Bench,用于评估多模态大语言模型在持续隐私删除中的性能,包含1000个敏感资料和9500张图像,引入新指标分析遗忘效果与稳定性,揭示现有方法在持续场景下的局限。

Comments 21 pages, 11 figures, and 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16949 2026-08-04 cs.LG cs.AI 88%

Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning

突破探索瓶颈:面向通用大语言模型推理的Rubric引导强化学习

Yang Zhou, Sunzhu Li, Shunyu Liu, Wenkai Fang, Kongcheng Zhang, Jiale Zhao, Jingwen Yang, Yihe Zhou, Jianwei Lv, Tongya Zheng, Hengtong Lu, Wei Chen, Yan Xie, Mingli Song

机构 * Zhejiang University(浙江大学) Li Auto Inc.(力汽车公司) Nanyang Technological University(南洋理工大学) The Chinese University of Hong Kong(香港中文大学) Hangzhou City University(杭州市大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Rubric-Scaffolded Reinforcement Learning,通过引入检查表式评分标准作为探索和利用的指导框架,突破通用大语言模型推理的探索瓶颈,提升推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00357 2026-08-04 cs.HC 新提交 88%

Dynamic Surveys: Using LLMs to Blend Qualitative Depth,Quantitative Structure, and Collaborative Interaction

动态调查:利用大语言模型(LLM)融合质性深度、定量结构与协作互动

Kehua Lei, Aidan Ladenburg, Zahra Petiwala, Zili Wang, Dishita Jhawar, Ipsita Bisht, Ansh Kumar, David T. Lee

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出动态调查平台,利用LLM实时聚类质性回答并引出定量内容,经93名参与者的两项实地研究验证,其能提供更丰富见解并提升参与度。

Comments 27 pages, 6 figures

Journal ref Proc. ACM Hum.-Comput. Interact., Vol. 9, No. CSCW, Article 405 (November 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26483 2026-08-04 cs.CY 88%

A systematic comparison of Large Language Models for automated assignment assessment in programming education: Exploring the importance of architecture and vendor

Marcin Jukiewicz

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01645 2026-08-04 cs.AI 新提交 87%

GISAgentBench: A Practitioner-Sourced Benchmark for Evaluating LLM Agents on GIS Tasks

GISAgentBench:面向GIS任务的、由从业者提供的用于评估大语言模型智能体的基准测试

Abhinav Pothuri, Zhe Jiang, Zelin Xu, Di Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有GIS智能体基准缺乏真实输出等问题,推出由从业者提供的GISAgentBench基准,含349项多步骤GIS任务,评估显示最佳智能体仅完成32.7%的任务,凸显真实GIS工作流的挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01322 2026-08-04 cs.CL cs.CY 新提交 87%

Can Language Models Identify Shadow Trading Targets? An NLP Evaluation of SEC Enforcement Theory

语言模型能否识别影子交易标的?对SEC执法理论的NLP评估

Sarah Wilson, Michael MacKay, Anthony Marello, Trinav Bhattacharyya

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title);分类 cs.CL

AI总结 本研究通过两阶段LLM管道分析SEC 10-K文件,发现NLP无法有效识别影子交易关联公司,对SEC影子交易执法的经验前提提出质疑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00100 2026-08-04 cs.CV cs.AI 新提交 87%

SPARC-Rad: A Multimodal Benchmark Dataset and Evaluation Pipeline for Spatial and Anatomical Reasoning in Radiology Vision-Language Models

SPARC-Rad:面向放射学视觉语言模型的空间与解剖推理多模态基准数据集及评估流程

Satvik Tripathi, Mustafa Ege Seker, Kristian Quevada, Ebubechukwu D Enwerem, Pratham Khandelwal, Emine Meltem, Bera Koca, Shahriar Faghani, Jacinta Arnold, Dania Daye, Tessa S. Cook

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 该研究开发了SPARC-Rad多模态基准数据集及评估流程,用于评估放射学VLMs的空间与解剖推理能力,为相关模型的开发与部署前评估提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08262 2026-08-04 cs.AI 版本更新 87%

FinToolBench: Evaluating LLM Agents for Real-World Financial Tool Use

FinToolBench:评估LLM代理在真实金融工具使用中的表现

Jiaxuan Lu, Kong Wang, Yemin Wang, Qingmei Tang, Hongwei Zeng, Xiang Chen, Jiahao Pi, Shujian Deng, Lingzhi Chen, Yi Fu, Kehua Yang, Xiao Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Hunan University(湖南大学) Xiamen University(厦门大学) Tencent(腾讯) UCAS(中国科学技术大学) Tongji University(同济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FinToolBench是首个评估金融工具学习代理真实世界表现的基准,通过760个可执行金融工具和295个严格查询,评估时效性、意图类型和合规性等关键维度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 87%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15230 2026-08-04 econ.EM 版本更新 87%

EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data

EnergyAgentBench: 在实时能源基础设施数据上评估LLM代理的基准测试

Eliseo Curcio

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出EnergyAgentBench,首个基于实时电力市场数据的LLM代理基准测试,评估数据中心选址、长期投资组合优化等任务,九种模型在1414次运行中表现各异,Claude Sonnet 4.6在整体得分上领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00006 2026-08-04 cs.AI 新提交 86%

Enhancing LLMs with Context-Specific Knowledge for Mitigating Misinformation in SMEs: A RAG-based Modeling and Analysis

用特定上下文知识增强大语言模型以缓解中小企业的错误信息:一种基于RAG的建模与分析

Md. Samiul Islam, Iqbal H. Sarker, Chadni Islam, Ahmad Mohsin, Ahmed Ibrahim, Helge Janicke

机构 * School of Science, Edith Cowan University(伊迪斯科文大学理学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对中小企业使用LLM时面临的错误信息问题,提出VectorRAG与GraphRAG方法,在LLaMA等模型上验证RAG可提升响应质量,助力可靠决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15974 2026-08-04 cs.CL 版本更新 86%

A Large-Scale Multi-Dimensional Empirical Study of LLMs for Conversation Summarization

面向对话摘要的大规模多维度LLM实证研究

Weixiao Zhou, Gengyao Li, Junnan Zhu, Xianfu Cheng, Feifei Zhai, Zhoujun Li

机构 * CCSE, Beihang University(北京航空航天大学CCSE) MAIS, CASIA(中国科学院自动化研究所MAIS) Fanyu AI Laboratory(帆禹AI实验室)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 提出OmniCSEval基准,包含1800个跨六场景的对话,评估28个LLM在对话摘要中的完整性、简洁性和忠实性,揭示推理能力与模型规模的影响。

Comments 21 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21079 2026-08-04 cs.CL 版本更新 86%

SoM-1K: A Thousand-Problem Benchmark Dataset for Strength of Materials

SoM-1K:用于材料力学能力的千题基准数据集

Qixin Wan, Zilong Wang, Jingwen Zhou, Wanting Wang, Ziheng Geng, Jiachen Liu, Ran Cao, Lu Cheng

机构 * College of Civil Engineering, Hunan University(湖南大学土木工程学院) Department of Civil & Architectural Engineering, University of Miami(迈阿密大学土木与建筑工程系) Department of Electrical and Computer Engineering, University of Miami(迈阿密大学电气与计算机工程系) School of Architecture, University of Miami(迈阿密大学建筑学院) Department of Computer Science, University of Illinois Chicago(伊利诺伊大学芝加哥分校计算机科学系)

专题命中 评测与基准 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);foundation model(abstract);prompting(abstract)

AI总结 该研究推出含1065道题的SoM-1K多模态基准,评估8种基础模型的材料力学能力,提出DoI提示策略,发现当前模型表现差,LLMs配DoI优于VLMs配图像,为工程AI提供基准并强调多模态推理需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28128 2026-08-04 cs.CL cs.AI cs.CY 版本更新 86%

Rethinking LLM-Judged Helpfulness as a Pedagogy Signal: A Pre-Registered Audit Across Tutor Models

将大语言模型评判的有用性重思为教学信号:一项针对导师模型的预注册审计

Shuyi Fan, Boyuan Deng, Mengyu Xu, Jiale Liu, Hongyang Zhang, Qiaoxin Yang, Chongyang Gao

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.AI

AI总结 本研究通过预注册审计发现,通用LLM有用性评分标准无法作为可靠教学信号,其排序具有评判者依赖性,而教学评分标准可有效区分策略,故导师评估应采用教学针对性评分标准与确定性过程测量。

Comments 24 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏