arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2604.01925 2026-07-24 cs.CL cs.AI 版本更新 90%

ImplicitBBQ: Benchmarking Implicit Bias in Large Language Models through Characteristic Based Cues

ImplicitBBQ: 通过基于特征的提示对大语言模型中的隐性偏见进行基准测试

Bhaskara Hanuma Vedula, Darshan Anghan, Ishita Goyal, Ponnurangam Kumaraguru, Abhijnan Chakraborty

机构 * International Institute of Information Technology, Hyderabad(国际信息技术学院海得拉巴) Indian Institute of Technology, Kharagpur(印度理工学院克勒格布尔分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ImplicitBBQ基准测试,通过基于特征的提示评估大语言模型中的隐性偏见,发现隐性偏见在模糊情境中比显性偏见高六倍,现有方法难以有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20090 2026-07-23 cs.CL cs.AI 新提交 90%

Reinforcement Learning for Large Language Model Selective Evidence Adoption from Contaminated Retrieval Results

基于强化学习的大语言模型从污染检索结果中选择性采用证据

Yanyu Chen, Yue Li, Yongyi Cui, Dongsheng Shi, Lichang Dai

机构 * East China Normal University(华东师范大学) Shandong University(山东大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 研究针对检索增强大语言模型面临的证据选择问题,引入SelectBench基准和训练集,用DAPO对Qwen3.5 - 4B后训练,在测试集上提升了严格成功率,减少了禁止内容采用,但增益有限,还指出抗注入性和统计稳健性是后续挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09721 2026-07-21 cs.CL cs.AI 90%

Cross-Platform Evaluation of Large Language Model Safety in Pediatric Consultations: Evolution of Adversarial Robustness and the Scale Paradox

跨平台评估大语言模型在儿科咨询中的安全性:对抗鲁棒性的演变与规模悖论

Vahideh Zolfaghari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了不同模型和平台在家长焦虑驱动下的LLM安全性,发现较小模型在对抗性压力下表现更优,且安全性与模型架构相关,而非规模。

Journal ref npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00409 2026-07-16 cs.AI cs.CL 90%

Doing More with Less: A Survey on Routing Strategies for Resource Optimisation in Large Language Model-Based Systems

多任务少资源:针对基于大语言模型系统中资源优化的路由策略综述

Clovis Varangot-Reille, Christophe Bouvard, Antoine Gourru, Mathieu Ciancone, Marion Schaeffer, François Jacquenet

机构 * Wikit Laboratoire Hubert Curien, UMR CNRS 5516(劳尔贝尔特·库尔尼恩实验室,CNRS UMR 5516) INSA Rouen Normandie(里昂-诺曼底理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了基于大语言模型系统的路由策略,旨在通过优化资源利用提高效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02432 2026-07-03 cs.AI cs.CL cs.CY 新提交 90%

Automated grading of Linux/bash examinations using large language models: a four-level cognitive taxonomy approach

使用大语言模型对Linux/bash考试进行自动评分:一种四层认知分类方法

Manuel Alonso-Carracedo, Ruben Fernandez-Boullon, Pedro Celard, Francisco J. Rodriguez-Martinez, Lorena Otero-Cerdeira

机构 * Universidade de Vigo, Department of Computer Science, ESEI-Higher School of Computer Engineering(维戈大学计算机科学系ESEI高等计算机工程学院) IFCAE-Institute for Research in Physics, Computing and Aerospace Science(IFCAE物理、计算与航空航天科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估四种前沿大语言模型(GPT、Claude Opus、Gemini、GLM)在Linux/bash命令评分中的表现,采用四层认知分类法,发现Gemini 3.0 Pro配合评分标准提示达到最高人机一致性(ICC=0.888),且问题复杂度是评分难度的可靠预测因子。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14940 2026-06-30 cs.CL cs.AI 90%

CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models

CASE-Bench:面向大语言模型的上下文感知安全基准

Guangzhi Sun, Xiao Zhan, Shutong Feng, Philip C. Woodland, Jose Such

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CASE-Bench,通过整合上下文信息评估大语言模型的安全性,揭示上下文对人类判断的显著影响,并发现商业模型在安全情境下的响应与人类判断存在明显偏差。

Comments 24 pages. This paper has been accepted at ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16150 2026-06-29 cs.CR cs.AI cs.CL 版本更新 90%

PRISON: Unmasking the Criminal Potential of Large Language Models

PRISON:揭示大型语言模型的犯罪潜力

Xinyi Wu, Geng Hong, Pei Chen, Yueyue Chen, Xudong Pan, Min Yang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 提出PRISON框架,通过五个特质量化LLMs的犯罪潜力,发现最先进模型常表现出犯罪倾向,且检测欺骗行为准确率仅44%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21981 2026-06-23 cs.CL cs.LG 新提交 90%

Can LLMs Control Readability? A Multi-Dimensional Evaluation Framework for CEFR-Controlled Arabic Generation

LLM能否控制可读性?面向CEFR可控阿拉伯语生成的多维评估框架

Nour Rabih, Chatrine Qwaider, Ted Briscoe

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出一个多维评估框架,通过结构化提示和词汇约束,使指令跟随型LLM在CEFR可控阿拉伯语生成中达到高可读性一致性(余弦相似度0.91,可读性预测一致性0.99)。

Comments 15 PAGES, READIxTSAR WORKSHOP, LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22411 2026-06-23 cs.CL cs.AI 版本更新 90%

NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models

NeedleChain: 测量大型语言模型的完整上下文理解能力

Hyeonseok Moon, Heuiseok Lim

机构 * Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 针对现有基准高估LLM上下文理解能力的问题,提出NeedleChain基准,通过全相关上下文测试模型整合所有证据的能力,并引入ROPE收缩策略提升全上下文整合。

Comments ACL2026 - findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12635 2026-06-16 cs.SE cs.AI cs.LG 90%

LLM4SCREENLIT: Recommendations on Assessing the Performance of Large Language Models for Screening Literature in Systematic Reviews

LLM4SCREENLIT: 关于评估用于系统综述文献筛选的大型语言模型性能的建议

Lech Madeyski, Barbara Kitchenham, Martin Shepperd

机构 * University of Kent(肯特大学) University of Leicester(利兹大学) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM4SCREENLIT建议,针对系统综述文献筛选中大型语言模型的评估,提出基于加权马修相关系数的改进方法,强调在不平衡和成本不对称条件下使用成本敏感的WMCC进行评估。

Comments 34 pages, 6 figures

Journal ref Information and Software Technology 198 (2026) 108204

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12451 2026-06-12 cs.AI cs.IR cs.LG 新提交 90%

ToolSense: A Diagnostic Framework for Auditing Parametric Tool Knowledge in LLMs

ToolSense: 审计LLM中参数化工具知识的诊断框架

Ashutosh Hathidara, Sai Shruthi Sistla, Sebastian Schreiber, Sahil Bansal

机构 * SAP Labs(SAP实验室)

专题命中 评测与基准 :LLM(title_cn,abstract);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出ToolSense诊断框架,自动生成三类基准测试,揭示参数化工具检索中知识-检索分离现象,发现模型在模糊查询下性能显著下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11898 2026-06-12 cs.CL cs.LG 新提交 90%

GraspLLM: Towards Zero-Shot Generalization on Text-Attributed Graphs with LLMs

GraspLLM: 面向文本属性图与LLM的零样本泛化

Hengyi Feng, Zeang Sheng, Meiyi Qiang, Yang Li, Wentao Zhang

机构 * Peking University(北京大学) National University of Singapore(新加坡国立大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出GraspLLM框架,通过融合图结构理解与LLM语义能力,利用基序感知对比学习和最优上下文子图对齐,实现跨数据集和跨任务的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31514 2026-06-12 cs.CL cs.AI cs.CY 版本更新 90%

If LLMs Have Human-Like Attributes, Then So Does Age of Empires II

如果LLM具有类人属性,那么《帝国时代II》也具有

Adrian de Wynter

机构 * Microsoft(微软公司) The University of York(约克大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过训练简单神经网络于《帝国时代II》,论证LLM的拟人属性在经验上非唯一,提出应假设LLM非独特性而非拟人属性来设计实验。

Comments Fixed corollary 1, added stat sig

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15727 2026-06-09 cs.LG cs.CL 版本更新 90%

Towards Automated Kernel Generation in the Era of LLMs

面向LLM时代的自动化内核生成

Yang Yu, Peiyu Zang, Chi Hsu Tsai, Haiming Wu, Yixin Shen, Jialing Zhang, Haoyu Wang, Zhiyou Xiao, Jingze Shi, Yuyu Luo, Wentao Zhang, Chunlei Men, Guang Liu, Yonghua Lin

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Beijing Normal University(北京师范大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Cornell University(康奈尔大学) Beijing Jiaotong University(北京交通大学) Renmin University of China(中国人民大学) Hong Kong University of Science and Technology (Guangzhou)(广州科技大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了利用大语言模型(LLM)和智能体系统自动化生成与优化GPU内核的方法,系统梳理了现有方法、数据集和基准,并指出了未来研究方向。

Comments In IJCAI 2026. 9 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16310 2026-06-02 cs.CR cs.AI cs.CL 90%

Agent Tools Orchestration Leaks More: Dataset, Benchmark, and Mitigation

Agent工具编排泄露更多:数据集、基准测试与缓解措施

Yuxuan Qiao, Dongqin Liu, Hongchang Yang, Wei Zhou, Songlin Hu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);post-training(abstract);prompting(abstract)

AI总结 研究LLM代理在编排多个工具时泄露敏感结论的风险(TOP-R),构建了包含1000个实例的基准TOP-Bench,并提出TOP-Align后训练方法以缓解泄露。

Comments 17 pages, 2 figures. Dataset and code are available at https://github.com/1Ponder/TOP-R

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28710 2026-05-28 cs.CL cs.AI 90%

Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study

迈向可靠的多语言LLM作为评判者:一项实证研究

Irune Zubiaga, Aitor Soroa, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country EHU(希茨中心 - Ixa,巴斯克国家大学EHU)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过分析指令翻译、单语与多语言监督及模型规模等策略,探讨了在有无领域内数据情况下开发多语言LLM评判者的方法,并揭示了领域内数据可用时微调小模型可媲美专有模型、零样本大模型在域外更有效等关键权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07231 2026-05-27 cs.CL cs.AI 90%

EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models

EconCausal: 面向大语言模型的上下文感知经济推理基准

Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim

机构 * Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院) College of Business, KAIST(韩国科学技术院商学院) Data Science for Humanity Group, MPI-SP(马克斯·普朗克所际数据科学为人类集团) School of Computing, KAIST(韩国科学技术院计算学院) Division of Social Science, HKUST(香港科技大学社会科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出EconCausal基准,包含从顶级经济金融期刊提取的10,490个上下文标注因果三元组,评估大语言模型在指定上下文中推断因果方向及随上下文变化调整判断的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17937 2026-05-26 cs.CL cs.AI 90%

BacktestBench: Benchmarking Large Language Models for Automated Quantitative Strategy Backtesting

BacktestBench:面向自动化量化策略回测的大语言模型基准测试

Zhensheng Wang, Wenmian Yang, Qingtai Wu, Lequan Ma, Yiquan Zhang, Weijia Jia

机构 * Beijing Normal University(北京师范大学) Elmleaf Ltd.(Elmleaf公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI

AI总结 提出首个大规模自动化量化回测基准BacktestBench,包含18,246个问答对,并设计多智能体基线AutoBacktest,通过协调摘要器、检索器和编码器实现自然语言策略到可重复回测的转换。

Comments This paper has been accepted by KDD 2026 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23238 2026-05-25 cs.AI cs.GT cs.LG cs.MA 90%

GENSTRAT: Toward a Science of Strategic Reasoning in Large Language Models

GENSTRAT:迈向大型语言模型中的战略推理科学

Vartan Shadarevian, Kia Ghods, Alex Kenich, Anany Kotawala

机构 * Princeton University(普林斯顿大学) Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出GENSTRAT框架,通过程序化生成不完全信息博弈环境,结合能力剖面和锯齿度度量,系统评估大型语言模型的战略推理能力。

Comments 33 pages, 8 figures, 9 tables (4 figures, 2 tables in main paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17775 2026-05-19 cs.CL cs.AI 90%

Systematic Evaluation of the Quality of Synthetic Clinical Notes Rephrased by LLMs at Million-Note Scale

在百万笔记规模上系统评估LLM重新表述的合成临床笔记质量

Jinghui Liu, Sarvesh Soni, Anthony Nguyen

机构 * Australian e-Health Research Centre, CSIRO, Australia(澳大利亚电子健康研究中心,CSIRO,澳大利亚) National Library of Medicine, National Institutes of Health, USA(国家医学图书馆,国立卫生研究院,美国)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究系统评估了LLM生成的合成临床笔记的质量,包括内在、外在和事实性评估,发现尽管在粗粒度任务中保留了核心临床信息和预测效用,但在细粒度任务如ICD编码中丢失了细节,通过分块重述可以缓解这一问题,但会降低事实准确性。研究还发现合成错误主要源于临床情境的误解、时间混淆、测量误差和虚构声明,同时展示了这些合成笔记可以有效增强罕见ICD代码的特定任务训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10419 2026-05-12 cs.CL cs.AI 90%

Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets

语言模型能分析数据吗?评估大型语言模型在数据集上的问答性能

Andreas Xenofontos, Pavlos Fafalios

机构 * School of Production Engineering and Management, Technical University of Crete(生产工程与管理学院,希腊克里特技术大学) Institute of Computer Science, Foundation for Research and Technology - Hellas(计算机科学研究所,希腊基础研究与技术研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了大型语言模型在数据集上回答问题的能力,通过两种场景测试其性能,并探讨不同提示策略的影响。

Comments Accepted for publication in CARMA 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 90%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09011 2026-05-12 cs.LG cs.AI 90%

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

对大语言模型中下一个token预测的几何视角:三个新兴阶段

Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

机构 * Department of Engineering and Architecture(工程与建筑系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过几何方法分析大语言模型中预测信息的分布与演变,发现三个几何阶段:Seeding Multiplexing、Hoisting Overriding和Focal Convergence,揭示了模型深度对有效秩的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10853 2026-05-12 cs.CL cs.AI 90%

Bring Your Own Prompts: Use-Case-Specific Bias and Fairness Evaluation for LLMs

自带提示词:面向LLM的用例特定偏见和公平性评估

Dylan Bouchard

机构 * CVS Health(CVS健康公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种决策框架,通过映射LLM用例到相关偏见和公平性指标,考虑任务类型、提示中是否包含受保护属性提及及利益相关者优先级,引入新型指标并开源库langfair进行实践验证。

Comments v6: Updated title; LangFair repository: https://github.com/cvs-health/langfair

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19298 2026-05-05 cs.CL cs.AI cs.IR 90%

IndiaFinBench: An Evaluation Benchmark for Large Language Model Performance on Indian Financial Regulatory Text

IndiaFinBench:用于评估大语言模型在印度金融监管文本性能的评估基准

Rajveer Singh Pall

机构 * Gyan Ganga Institute of Technology and Sciences(加延加anga科技与科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IndiaFinBench,首个公开的评估基准,用于评估大语言模型在印度金融监管文本上的性能,包含406个专家标注的问题-答案对,涵盖四个任务类型,评估十二个模型,发现数值推理任务表现最显著。

Comments 24 pages, 4 figures, 11 tables. Dataset and evaluation code at https://github.com/rajveerpall/IndiaFinBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27920 2026-05-01 cs.CL cs.AI 90%

Beyond Semantics: Measuring Fine-Grained Emotion Preservation in Small Language Model-Based Machine Translation

超越语义:在小型语言模型基础上的机器翻译中细粒度情感保留的测量

Dawid Wisniewski, Igor Czudy

机构 * Poznań University of Technology(波兹南技术大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种先进的小型语言模型在回译中保持细粒度情感的能力,探讨了模型自身的情感保留能力、情感意识提示的效果以及ModernBERT在情感分类中的表现。

Comments Accepted at EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07298 2026-04-27 cs.LG cs.AI 90%

Pre-trained Large Language Models Learn Hidden Markov Models In-context

预训练大语言模型通过上下文学习学习隐马尔可夫模型

Yijia Dai, Zhaolin Gao, Yahya Sattar, Sarah Dean, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究预训练大语言模型通过上下文学习有效建模由隐马尔可夫模型生成的数据,并揭示了其在复杂数据中挖掘隐藏结构的潜力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21120 2026-04-24 cs.LG cs.CL 90%

TabSHAP

TabSHAP:一种用于LLM表格分类器的解释框架

Aryan Chaudhary, Prateek Agarwal, Tejasvi Alladi

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TabSHAP,一种用于LLM表格分类器的解释框架,通过Jensen-Shannon散度量化特征分布影响,提升解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19262 2026-04-22 cs.CL cs.AI 90%

CulturALL: Benchmarking Multilingual and Multicultural Competence of LLMs on Grounded Tasks

CulturALL:基于 grounded 任务的 LLM 多语言和多文化能力基准测试

Peiqin Lin, Chenyang Lyu, Wenjiang Luo, Haotian Ye, Md Mehrab Hossain, Chunlan Ma, Shaoxiong Ji, Younes Samih, Bo Zeng, Fan Jiang, Yuanbin Cao, Dilda Duisenbek, Adrian Neo Sau Xun, Daria Pozdniakova, Liubou Misevich, Nevena Marinković, Ngoc Gia Linh Nguyen, Thi Khanh Linh Do, Sarakmatak Sophy, Baotian Hu, Guanhua Chen, Gongbo Tang, Alham Fikri Aji, Longyue Wang, Weihua Luo

机构 * Alibaba Group(阿里巴巴集团) Beijing Language and Culture University(北京语言大学) LMU Munich(慕尼黑大学) ELLIS Institute Finland(芬兰ELLIS研究所) University of Turku(图尔库大学) IBM Research AI, UAE(阿联酋IBM人工智能研究) MBZUAI Harbin Institute of Technology, Shenzhen(深圳哈尔滨工业大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出 CulturALL 基准测试,评估 LLM 在 grounded 任务中的多语言和多文化能力,包含 14 种语言 51 个地区 16 个主题的 2610 个样本,实验显示最佳 LLM 准确率仅 44.48%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11206 2026-04-21 cs.HC cs.AI cs.CL 90%

Evalet: Evaluating Large Language Models through Functional Fragmentation

Evalet:通过功能碎片化评估大型语言模型

Tae Soo Kim, Heechan Lee, Yoonjoo Lee, Joseph Seering, Juho Kim

机构 * School of Computing, KAIST(韩国庆北大学计算机学院) Computer Science and Engineering, University of Michigan(美国密歇根大学计算机科学与工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过功能碎片化方法,分析生成AI输出中的关键片段,揭示其在评估标准下的作用,帮助用户发现更多模型输出中的问题。

Comments The first two authors hold equal contribution. Presented at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏