arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2603.28972 2026-04-01 cs.CR cs.AI 89%

Privacy Guard & Token Parsimony by Prompt and Context Handling and LLM Routing

通过提示和上下文处理及LLM路由实现隐私保护与令牌节约

Alessio Langiu

机构 * National Research Council of Italy - Institute of Marine Sciences (CNR-ISMAR)(意大利国家研究委员会海洋科学研究所(CNR-ISMAR))

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出隐私守护机制,结合上下文管理和LLM路由,通过自动提示优化减少云服务成本和敏感信息泄露风险,实验证明在隐私保护与成本节约之间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15925 2025-11-19 cs.CV cs.AI 89%

MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Classification and Detection

Andrea Moglia, Elia Clement Nastasio, Luca Mainardi, Pietro Cerveri

机构 * Department of Electronics, Information, and Bioengineering(电子、信息与生物工程系) Polytechnic University of Milan(米兰理工学院) Department of Industrial, and Information Engineering(工业与信息工程系) University of Pavia(帕维亚大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Journal ref Moglia, A., Nastasio, E.C., Mainardi, L. et al. MiniGPT-Pancreas: Multimodal Large Language Model for Pancreas Cancer Observation and Localization in CT Images. J Healthc Inform Res (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23081 2025-11-05 cs.CL 89%

A Survey on LLM Mid-Training

Chengying Tu, Xuemiao Zhang, Rongxiang Weng, Rumei Li, Chen Zhang, Yang Bai, Hongfei Yan, Jingang Wang, Xunliang Cai

机构 * Peking University(北京大学) Meituan(美团)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11689 2025-09-09 cs.CL 89%

Improve LLM-as-a-Judge Ability as a General Ability

Jiachen Yu, Shaoning Sun, Xiaohui Hu, Jiaxu Yan, Kaidong Yu, Xuelong Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16982 2025-08-26 cs.CL 89%

Decoding Alignment: A Critical Survey of LLM Development Initiatives through Value-setting and Data-centric Lens

Ilias Chalkidis

机构 * Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments This is a working paper and will be updated with new information or corrections based on community feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20700 2025-07-29 cs.CL 89%

When Scale Meets Diversity: Evaluating Language Models on Fine-Grained Multilingual Claim Verification

Hanna Shcharbakova, Tatiana Anikina, Natalia Skachkova, Josef van Genabith

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);small language model(abstract)

Comments Published at the FEVER Workshop, ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.08425 2025-07-14 cs.CL 89%

A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities

Lu Xiang, Yang Zhao, Yaping Zhang, Chengqing Zong

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Journal ref Lu XIANG, Yang ZHAO, Yaping ZHANG, Chengqing ZONG, "A Survey of Large Language Models in Discipline-specific Research: Challenges, Methods and Opportunities", Studies in Informatics and Control, ISSN 1220-1766, vol. 34(1), pp. 5-24, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22959 2025-05-30 cs.CL 89%

LLM-based HSE Compliance Assessment: Benchmark, Performance, and Advancements

Jianwei Wang, Mengqi Wang, Yinsi Zhou, Zhenchang Xing, Qing Liu, Xiwei Xu, Wenjie Zhang, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Data61, CSIRO

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11353 2025-01-22 cs.CL 89%

THaMES: An End-to-End Tool for Hallucination Mitigation and Evaluation in Large Language Models

Mengfei Liang, Archish Arun, Zekun Wu, Cristian Munoz, Jonathan Lutch, Emre Kazim, Adriano Koshiyama, Philip Treleaven

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);分类 cs.CL

Comments NeurIPS 2024 SoLaR (Socially Responsible Language Modelling Research ) Workshop

Journal ref NeurIPS Workshop on Socially Responsible Language Modelling Research 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05249 2026-06-05 cs.SE 89%

SWE-InfraBench: Evaluating Language Models on Cloud Infrastructure Code

SWE-InfraBench:评估语言模型在云基础设施代码上的表现

Natalia Tarasova, Enrique Balp-Straffon, Aleksei Iancheruk, Yevhenii Sielskyi, Nikita Kozodoi, Liam H. Byrne, Jack Butler, Dayuan Jiang, Marcin Czelej, Andrew Ang, Yash Shah, Roi Blanco, Sergei Ivanov

专题命中 评测与基准 :language model(title,abstract);LLM(summary_cn,abstract_cn);large language model(abstract)

AI总结 提出SWE-InfraBench基准,通过AWS CDK仓库中的真实代码修改任务评估LLM在云基础设施即代码(IaC)上的能力,发现当前最先进模型成功率仅34%。

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20320 2026-08-21 cs.AI cs.CL 新提交 88%

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

一种用于主动数据收集、出行行为建模及天气敏感需求预测的智能体方法

Narges Ahmadi, Yubo Jiao, Jônatas Augusto Manzolli, Jiangbo Yu, Luis Miranda-Moreno

机构 * McGill University(麦吉尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究提出三智能体工作流,结合对话式调查、传统建模与多模态LLM预测,基于学生通勤数据实现天气敏感出行需求预测,视觉配置模型准确率达71.5%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18158 2026-08-20 cs.CL cs.AI 新提交 88%

When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators

大语言模型(LLM)何时真正有用?评估LLM作为数据质量标注者的表现

Praphulla Lal Shrestha

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究对比测试LLM与基于规则方法在两项电商数据质量任务中的表现,发现LLM在需背景知识的任务中更具优势,且判断高度一致,小型样本提示评估可能存在误导。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05177 2026-08-18 cs.CL cs.AI eess.AS 版本更新 88%

MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models

MCBench:面向全能大语言模型的多上下文安全评估基准

Manh Luong, Tamas Abraham, Junae Kim, Amar Kaur, Rollin Omari, Gholamreza Haffari, Trang Vu, Lizhen Qu, Dinh Phung

机构 * Monash University(墨尔本大学) Defence Science and Technology Group(国防科学与技术集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有多模态安全基准仅处理视觉输入的局限,提出MCBench基准,包含1196个跨四类安全场景的测试,要求整合多模态信息进行安全评估,揭示当前全能大语言模型在跨模态安全推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00890 2026-08-18 econ.EM cs.CL cs.LG 版本更新 88%

Macroeconomic Forecasting with Large Language Models

基于大型语言模型的宏观经济预测

Andrea Carriero, Davide Pettenuzzo, Shubhranshu Shekhar

机构 * School of Economics and Finance, Queen Mary University of London(伦敦大学女王学院经济与金融学院) School of Business and Economics, Brandeis University(布兰迪大学商学院与经济学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文以FRED-MD数据库为基础,对比评估大型语言模型与传统宏观时间序列预测方法的准确性,明确了LLMs在宏观经济预测中的优劣势及现实适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14107 2026-08-18 cs.CL cs.AI 版本更新 88%

DiagnosisArena: Benchmarking Diagnostic Reasoning for Large Language Models

DiagnosisArena:面向大型语言模型的诊断推理基准测试

Yakun Zhu, Zhongzhen Huang, Linjie Mu, Yutong Huang, Wei Nie, Jiaji Liu, Shaoting Zhang, Pengfei Liu, Xiaofan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) SII SPIRAL Lab(SPIRAL实验室) Generative AI Research Lab (GAIR)(生成式AI研究实验室) Shanghai Chest Hospital(上海胸科医院) Beijing Anzhen Hospital, Capital Medical University(北京安贞医院,首都医科大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出DiagnosisArena基准,评估大型语言模型的临床诊断推理能力,发现顶尖模型准确率仅最高51.12%,凸显其泛化瓶颈,旨在推动AI诊断推理进步。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12342 2026-08-14 cs.CL cs.LG 新提交 88%

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17244 2026-08-13 cs.CL cs.AI 版本更新 88%

DORA Explorer: Improving the Exploration Ability of LLMs Without Training

DORA Explorer: 无需训练提升大语言模型的探索能力

Priya Gurjar, Md Farhan Ishmam, Kenneth Marino

机构 * Kahlert School of Computing, University of Utah(犹他大学计算学院Kahlert学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出DORA Explorer框架,通过生成多样化动作候选并利用token log-probabilities评分,提升LLM在序列决策任务中的探索能力,实验显示在MAB和TALES环境中性能显著提升。

Comments 17 pages, 6 Figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06227 2026-08-12 cs.CL cs.LG 版本更新 88%

Automated Data Enrichment using Confidence-Aware Fine-Grained Debate among Open-Source LLMs for Mental Health and Online Safety

基于开源LLM的自信意识细粒度辩论用于心理健康和在线安全的自动化数据增强

Junyu Mao, Anthony Hills, Talia Tseriotou, Maria Liakata, Aya Shamir, Dan Sayda, Dana Atzil-Slonim, Natalie Djohari, Pamela Ugwudike, Mahesan Niranjan, Stuart E. Middleton

机构 * University of Southampton, UK(英国南安普顿大学) Queen Mary University of London, UK(伦敦大学玛丽女王学院) The Alan Turing Institute, UK(阿兰·图灵研究所) Bar Ilan University, Israel(巴伊兰大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出CFD框架,利用开源LLM的细粒度辩论实现心理健康和在线安全领域的自动化数据增强,通过实验验证其在多标签增强任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08652 2026-08-11 cs.LG cs.AI 新提交 88%

LegoLM: Structured Weight Sharing for Large Language Models

LegoLM:面向大语言模型的结构化权重共享压缩框架

Joseph Bingham

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LegoLM针对大语言模型全局权重共享的两种失效模式,提出三种无数据适配策略,在GPT-2 small和Mistral-7B上实现优于PTQ-8bit的压缩效果与精度,证实选择性替换是核心机制。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07535 2026-08-11 cs.LG cs.AI cs.CY 新提交 88%

Evolving Safety Landscape of Multi-modal Large Language Models: A Survey of Emerging Threats and Safeguards

多模态大语言模型的演进安全态势:新兴威胁与防护措施综述

Xi Li, Shu Zhao, Xiaohan Zou, Fei Zhao, Fuxiao Liu, Yusen Zhang, Cheng Han, Yushun Dong, Jiaqi Wang

机构 * University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) NVIDIA(英伟达公司) Penn State University(宾夕法尼亚州立大学) Columbia University(哥伦比亚大学) University of Missouri-Kansas City(密苏里大学堪萨斯分校) Florida State University(佛罗里达州立大学) Auburn University(奥本大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本综述针对多模态大语言模型(MLLMs)的新型安全威胁,提出多模态安全威胁分类法,梳理安全策略进展,探讨未来安全机制的研究方向。

Comments Accepted at the ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03750 2026-08-07 cs.CR cs.AI cs.CL 版本更新 88%

CREBench: Evaluating Large Language Models in Cryptographic Binary Reverse Engineering

CREBench:评估大语言模型在密码二进制逆向工程中的能力

Baicheng Chen, Yu Wang, Ziheng Zhou, Xiangru Liu, Juanru Li, Yilei Chen, Tianxing He

机构 * Shanghai Qi Zhi Institute(上海期智研究院) Institute of Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Xiongan AI Institute(雄安人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CREBench基准,通过432个基于密码算法的挑战评估大语言模型在密码二进制逆向工程中的性能,发现GPT-5.4在该任务中表现优异,人类专家仍具优势。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20351 2026-08-07 cs.CL cs.AI 版本更新 88%

When Large Language Models Know the Table: A Framework for Assessing Data Contamination in Tabular Datasets

评估大型语言模型中公共表格数据集的潜在知识

Matteo Silvestri, Fabiano Veglianti, Flavio Giorgi, Fabrizio Silvestri, Gabriele Tolomei

机构 * Sapienza University of Rome(罗马大学) tellmewAI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出评估表格数据集污染的框架,通过生成控制查询和比较评估,发现四个数据集中存在污染,影响下游任务性能可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16217 2026-08-05 cs.CL cs.AI 版本更新 88%

ChiEngMixBench: Evaluating Large Language Models on Expert-Style Chinese-English Terminology Mixing

ChiEngMixBench: 评估大型语言模型在自发和自然的中英混合生成中的能力

Qingyan Yang, Tongxi Wang, Yunsheng Luo

机构 * School of Future Technology(未来技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ChiEngMixBench通过评估中英混合生成的自发性和自然性,揭示多语言模型与人类交流的结构化认知对齐

Comments 15 pages, 2 figures, 8 tables. Substantially revised version

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15412 2026-08-04 cs.CL cs.AI 版本更新 88%

Few-Shot Biomedical Relation Extraction with Large Language Models: A Viable Alternative to Supervised Learning?

基于大语言模型的少样本生物医学关系抽取:监督学习的可行替代方案?

Jakob Mraz, Tomaž Curk, Blaž Zupan

机构 * University of Ljubljana(卢布尔雅那大学) Baylor College of Medicine(贝勒医学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型进行少样本生物医学关系抽取,比较成对分类与联合生成两种方法,发现联合生成更精确高效,在宏F1上超越监督基线,尤其在稀有关系类型上表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06996 2026-08-04 cs.CL cs.AI 版本更新 88%

Self-Preference Bias in Rubric-Based Evaluation of Large Language Models

基于评分标准的大型语言模型评估中的自我偏好偏差

José Pombal, Ricardo Rei, André F. T. Martins

机构 * Sword Health TransPerfect ELLIS Unit Lisbon(ELLIS 里斯本分部)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了基于评分标准的评估中自我偏好偏差对模型评估的影响,发现即使评分标准客观,自我偏好仍会导致评分偏差,且通过多评委ensemble可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05792 2026-07-28 cs.AI cs.LG cs.LO cs.SE 88%

Can LLMs Write Correct TLA+ Specifications? Evaluating Natural-Language-to-TLA+ Generation

LLM 能写出正确的 TLA+ 规范吗?自然语言到 TLA+ 生成的评估

Arslan Bisharat, Brian Ortiz, Eric Spencer, Khushboo Bhadauria, TaiNing Wang, George K. Thiruvathukal, Konstantin Laufer, Mohammed Abuhamad

机构 * Department of Computer Science, Loyola University Chicago(洛约奈大学芝加哥分校计算机科学系)

专题命中 评测与基准 :LLM(title_cn,summary_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估基于 LLM 从自然语言合成 TLA+ 规范的能力,发现模型在语义正确性上仅达 8.6%,且成功依赖于渐进式提示,揭示了模型大小与质量无关、代码专用模型表现不佳等关键发现。

Comments 12 pages, 11 tables. Accepted at the 21st International Conference on Software Technologies (ICSOFT 2026); Recommended as Best Paper Award Candidate

Journal ref ICSOFT 2026, pp. 39-50, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20476 2026-07-24 cs.AI cs.CL 新提交 88%

Benchmarking Large Language Models on Multi-Sensor Physical Hazard Assessment

在多传感器物理危害评估中对大语言模型进行基准测试

Faizan Iqbal

机构 * Lovely Professional University(可爱专业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究五个大语言模型对多传感器物理危害数据的评估,通过1800次API调用测试60个场景,发现模型在多传感器场景表现不佳,单传感器场景表现良好,且结构化表格格式优势不明显,为从业者提供了模型应用参考。

Comments 14 pages, 6 figures. Benchmark dataset, evaluation code, and raw results publicly available at: https://github.com/Faizaniqbal52/PhysicalHazardBenchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20454 2026-07-24 cs.CL cs.AI 新提交 88%

Response drift across frontier large language models

前沿大语言模型中的响应漂移

Mohammed Aledhari, Ali Aledhari, Fatimah Aledhari, Gowtham Venkat Eathamokkala, Mohamed Rahouti

机构 * University of North Texas(北德克萨斯大学) Fordham University(福特汉姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究前沿大语言模型的响应漂移问题,通过47名参与者对十个模型的62个多领域问题进行盲测评估,发现各模型漂移程度不同,依赖领域和问题,且自动指标解释方差低,揭示需以人类评估了解漂移情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18421 2026-07-22 cs.CL cs.AI 版本更新 88%

TReB: A Comprehensive Benchmark for Evaluating Table Reasoning Capabilities of Large Language Models

TReB:评估大语言模型表格推理能力的综合基准

Ce Li, Xiaofan Liu, Zhiyan Song, Ce Chi, Boshen Shi, Chen Zhao, Guanguang Chang, Zhendong Wang, Kexin Yang, Xing Wang, Chao Deng, Junlan Feng

机构 * JIUTIAN Research(天研机构)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型处理表格数据推理能力评估基准缺失的问题,提出TReB基准,用分类法涵盖26个子任务,经数据处理构建高质量数据集,设计含三种推理模式的评估框架,揭示现有模型在表格任务上有改进空间,且数据和框架均公开。

Comments published by SIGIR 2026

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval, 2026, 3267-3275

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16777 2026-07-21 cs.CL cs.AI 新提交 88%

JOR-Bench: Japanese Operations Research Benchmarks for Large Language Models

JOR-Bench:用于大语言模型的日语运筹学基准测试

Yuu Jinnai

机构 * CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 JOR-Bench是用于评估大语言模型解决运筹学问题能力的日语基准测试集,涵盖多种规划问题。通过评估七个LLMs的英文和日语版本,发现多语言模型的OR制定能力语言中立,但存在跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏