arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2603.18007 2026-03-20 cs.CL cs.AI 88%

Do Large Language Models Possess a Theory of Mind? A Comparative Evaluation Using the Strange Stories Paradigm

大型语言模型具备心智理论吗?使用奇怪故事范式进行比较评估

Anna Babarczy, Andras Lukacs, Peter Vedres, Zeteny Bujka

机构 * ELTE Research Centre for Linguistics(ELTE语言学研究中心) Department of Cognitive Science, Faculty of Natural Sciences, Budapest University of Technology and Economics(布达佩斯技术与经济大学自然科学学院认知科学系) Institute of Mathematics, Eötvös Lóránd University(欧多布雷尼大学数学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过奇怪故事范式评估了大型语言模型是否具备心智理论能力,发现GPT-4o在复杂条件下表现接近人类,而早期小型模型易受相关线索影响且易受无关信息干扰。

Comments 19 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16197 2026-03-18 cs.AI cs.CL 88%

Are Large Language Models Truly Smarter Than Humans?

大语言模型真的比人类更聪明吗?

Eshwar Reddy M, Sourav Karmakar

机构 * Applied AI Scientist, Health Vectors(应用人工智能科学家,健康向量) Senior AI Scientist, Intuit India(高级人工智能科学家,Intuit印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过三个实验评估六种前沿大语言模型的评估数据污染问题,发现STEM领域污染率最高,且部分模型存在记忆偏差。

Comments 15 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06533 2026-03-18 cs.AI cs.CL 88%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14173 2026-03-17 cs.LG cs.AI cs.IR 88%

Hybrid Intent-Aware Personalization with Machine Learning and RAG-Enabled Large Language Models for Financial Services Marketing

混合意图感知个性化:结合机器学习和RAG增强的大语言模型用于金融服务营销

Akhil Chandra Shanivendra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合架构,结合传统机器学习与RAG增强的大语言模型,用于金融服务营销中的个性化营销,通过时间编码器、潜在表示和多任务分类提高个性化准确性。

Comments 18 pages, 5 figures, 3 tables. Applied ML systems paper. The contribution is architectural rather than algorithmic

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11597 2026-03-13 cs.CL cs.AI 88%

Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese

开源大语言模型在协助日文病历报告写作中的性能评估

Masataka Kawai, Singo Sakashita, Shumpei Ishikawa, Shogo Watanabe, Anna Matsuoka, Mikio Sakurai, Yasuto Fujimoto, Yoshiyuki Takahara, Atsushi Ohara, Hirohiko Miyake, Genichiro Ishii

机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。

Comments 9 pages (including bibliography), 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 88%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09985 2026-03-12 cs.CL cs.AI 88%

The Dunning-Kruger Effect in Large Language Models: An Empirical Study of Confidence Calibration

大型语言模型中的邓宁-克鲁格效应:对置信度校准的实证研究

Sudipta Ghosh, Mrityunjoy Panday

机构 * Cognizant Technology Solutions(Cognizant技术解决方案)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型在置信度校准上存在类似邓宁-克鲁格效应的过度自信现象,通过实验证明低性能模型更易高估自身能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05503 2026-03-12 cs.LG cs.AI 88%

Over-Searching in Search-Augmented Large Language Models

搜索增强型大语言模型中的过度搜索

Roy Xie, Deepak Gopinath, David Qiu, Dong Lin, Haitian Sun, Saloni Potdar, Bhuwan Dhingra

机构 * Apple(苹果公司) Duke University(杜克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了搜索增强型大语言模型中的过度搜索问题,提出TPC指标量化其性能与成本的权衡,并探讨了缓解方法。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04664 2026-03-11 cs.CL cs.AI 88%

CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models

CRANE: 多语言大语言模型中语言特异性神经元的因果相关性分析

Yifan Le, Yunliang Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CRANE通过神经元层面的干预分析,揭示多语言大模型中语言特异性神经元的因果相关性,更精确地分离语言特异性组件。

Comments 10 pages, 6 figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07792 2026-03-10 cs.CL cs.AI cs.CY 88%

Dual-Metric Evaluation of Social Bias in Large Language Models: Evidence from an Underrepresented Nepali Cultural Context

大语言模型中社会偏见的双指标评估:来自少数族裔尼泊尔文化背景的证据

Ashish Pandey, Tek Raj Chhetri

机构 * Center for Artificial Intelligence Research Nepal(尼泊尔人工智能研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过双指标评估框架,分析了大语言模型在尼泊尔文化背景下对性别、种族和社会文化刻板印象的偏见,揭示了显性一致性偏见与隐性生成偏见的关系及影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06225 2026-03-09 cs.CY cs.AI cs.CL 88%

Classroom AI: Large Language Models as Grade-Specific Teachers

教室AI:大型语言模型作为按年级教师

Jio Oh, Steven Euijong Whang, James Evans, Jindong Wang

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) University of Chicago(芝加哥大学) William & Mary(威廉与玛丽学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种框架,通过微调大型语言模型生成适合不同年级学生的教育内容,显著提升年级匹配度,同时保持响应准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 88%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03047 2026-03-04 cs.CL cs.AI 88%

TrustMH-Bench: A Comprehensive Benchmark for Evaluating the Trustworthiness of Large Language Models in Mental Health

TrustMH-Bench: 一个用于评估大语言模型在心理健康领域可信度的综合基准

Zixin Xiong, Ziteng Wang, Haotian Fan, Xinjie Zhang, Wenxuan Wang

机构 * Renmin University of China, China(中国人民大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) Hefei University of Technology, China(合肥工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 TrustMH-Bench提出了一种综合基准,用于评估大语言模型在心理健康领域的可信度,揭示了现有模型在关键维度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.12843 2026-03-04 cs.CL cs.AI 88%

NutriBench: A Dataset for Evaluating Large Language Models on Nutrition Estimation from Meal Descriptions

NutriBench:一个用于评估大语言模型从餐食描述中估算营养的基准数据集

Andong Hua, Mehak Preet Dhaliwal, Laya Pullela, Ryan Burke, Yao Qin

机构 * University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 NutriBench通过评估大语言模型在餐食描述中估算营养的能力,为营养估算提供了新的研究方向和应用可能性。

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00051 2026-03-03 cs.DL cs.AI cs.LG 88%

LitBench: A Graph-Centric Large Language Model Benchmarking Tool For Literature Tasks

LitBench: 一种面向文献任务的图中心大型语言模型基准评估工具

Andreas Varvarigos, Ali Maatouk, Jiasheng Zhang, Ngoc Bui, Jialin Chen, Leandros Tassiulas, Rex Ying

机构 * Yale University(耶鲁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 LitBench是一种用于评估领域特定文献任务的大型语言模型基准工具,通过生成领域特定的文献子图和任务集,提升模型在文献相关任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03716 2026-03-02 cs.CL cs.LG hep-th 88%

FeynTune: Large Language Models for High-Energy Theory

FeynTune:用于高能理论的大型语言模型

Paul Richmond, Prarit Agarwal, Borun Chowdhury, Vasilis Niarchos, Constantinos Papageorgakis

机构 * Centre for Theoretical Physics, Department of Physics and Astronomy, Queen Mary University of London(伦敦大学玛丽女王学院理论物理中心,物理与天文学系) ITCP & CCTP, Department of Physics, University of Crete(希腊克里特大学物理系ITCP与CCTP) Meta Amazon(亚马逊公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 FeynTune通过微调Llama-3.1模型,为高能理论物理开发了专门的大型语言模型,并在多个领域数据集上进行了性能比较。

Comments 16 pages; v2: Human evaluation discussion updated, additional training hyperparameters and inference settings included and references added

Journal ref Mach. Learn.: Sci. Technol. 7 025012 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02529 2026-02-20 cs.SE cs.AI cs.CL 88%

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

自动化网页应用测试:基于大语言模型和屏幕转换图的端到端测试用例生成

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型和屏幕转换图的自动化网页应用测试系统,用于生成端到端测试用例,提升测试覆盖率和鲁棒性。

Comments Published in the Proceedings of JSAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16201 2026-02-19 cs.CL cs.AI cs.CY 88%

Long-Tail Knowledge in Large Language Models: Taxonomy, Mechanisms, Interventions and Implications

大语言模型中的长尾知识:分类、机制、干预与影响

Sanket Badhe, Deep Shah, Nehal Kathrotia

机构 * Google(谷歌)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大语言模型中长尾知识的定义、机制、干预及影响,提出统一框架以理解其表现和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01055 2026-02-17 cs.LG cs.AI q-bio.BM q-bio.QM 88%

FGBench: A Dataset and Benchmark for Molecular Property Reasoning at Functional Group-Level in Large Language Models

FGBench: 一个用于大语言模型中功能基团级分子属性推理的数据集和基准

Xuan Liu, Siru Ouyang, Xianrui Zhong, Jiawei Han, Huimin Zhao

机构 * Department of Chemical and Biomolecular Engineering, University of Illinois Urbana-Champaign(化学与生物分子工程系,伊利诺伊大学厄巴纳-香槟分校) Department of Computer Science, University of Illinois Urbana-Champaign(计算机科学系,伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FGBench通过构建包含功能基团级信息的数据集,提升大语言模型在分子属性推理任务中的能力。

Comments NeurIPS 2025 (Datasets and Benchmarks Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10664 2026-02-13 cs.CL cs.AI 88%

Evaluating Modern Large Language Models on Low-Resource and Morphologically Rich Languages:A Cross-Lingual Benchmark Across Cantonese, Japanese, and Turkish

评估现代大语言模型在低资源和形态丰富的语言上的表现:跨语言基准测试在粤语、日语和土耳其语之间

Chengxuan Xia, Qianye Wu, Hongbin Guan, Sixuan Tian, Yilun Hao, Xiaoyu Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了七种先进LLMs在粤语、日语和土耳其语上的表现,发现专有模型在多语言任务中表现优异,但文化理解和形态泛化仍有不足。

Comments This paper requires XeLaTeX for proper Unicode rendering of Japanese and Cantonese text

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10354 2026-02-12 cs.CL cs.LG 88%

Physically Interpretable AlphaEarth Foundation Model Embeddings Enable LLM-Based Land Surface Intelligence

可解释的AlphaEarth基础模型嵌入使基于大语言模型的地表智能成为可能

Mashrekur Rahman

机构 * Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title,abstract);foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 基于AlphaEarth基础模型的可解释嵌入,通过检索增强生成实现地表智能,验证了卫星嵌入在环境决策中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03444 2026-02-10 cs.CL cs.AI 88%

Taxation Perspectives from Large Language Models: A Case Study on Additional Tax Penalties

大语言模型的税收视角:关于附加税收罚金的案例研究

Eunkyung Choi, Youngjin Suh, Siun Lee, Hongseok Oh, Juheon Kang, Won Hur, Hun Park, Wonseok Hwang

机构 * University of Seoul(首尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型在税收领域的能力,通过PLAT基准测试发现其在复杂法律推理任务中表现有限。

Comments 9 pages

Journal ref EACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07020 2026-02-04 cs.CL cs.AI 88%

TurkBench: A Benchmark for Evaluating Turkish Large Language Models

TurkBench:评估土耳其大型语言模型的基准测试

Çağrı Toraman, Ahmet Kaan Sever, Ayse Aysu Cengiz, Elif Ecem Arslan, Görkem Sevinç, Mete Mert Birdal, Yusuf Faruk Güldemir, Ali Buğra Kanburoğlu, Sezen Felekoğlu, Osman Gürlek, Sarp Kantar, Birsen Şahin Kütük, Büşra Tufan, Elif Genç, Serkan Coşkun, Gupse Ekin Demir, Muhammed Emin Arayıcı, Olgun Dursun, Onur Gungor, Susan Üsküdarlı, Abdullah Topraksoy, Esra Darıcı

机构 * Computer Sci. Dpt., Bilkent Uni.(计算机科学系,比尔肯特大学) Mathematics Dpt., Middle East Technical University(数学系,中东部技术大学) Turkcell AI(Turkcell人工智能) Sociology Dpt., Hacettepe University(社会学系,哈恰塔尔佩大学) Computer Engineering Dpt., Bogazici University(计算机工程系,博资基大学) Linguistics Dpt., Istanbul University(语言学系,伊斯坦布尔大学) Turkish Lang. Dpt., Middle East Technical University(土耳其语言系,中东部技术大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 TurkBench是一个用于评估土耳其大型语言模型能力的综合基准测试,包含21个子任务和6大类别,旨在帮助研究人员改进模型性能。

Comments Accepted by EACL 2026 SIGTURK

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22921 2026-02-02 cs.CR cs.AI cs.LG 88%

Evaluating Large Language Models for Security Bug Report Prediction

评估大型语言模型用于安全漏洞报告预测

Farnaz Soltaniani, Shoaib Razzaq, Mohammad Ghafari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文评估了基于提示和微调方法在预测安全漏洞报告中的性能,发现提示方法在召回率上表现更好但精度较低,而微调方法在精度上更优但召回率下降,且推理速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19616 2026-01-30 cs.LG cs.AI cs.CV 88%

Diagnosing and Mitigating Modality Interference in Multimodal Large Language Models

多模态大语言模型中模态干扰的诊断与缓解

Rui Cai, Bangzheng Li, Xiaofei Wen, Muhao Chen, Zhe Zhao

机构 * Department of Computer Science, University of California-Davis, Davis, CA, United States(计算机科学系,加州大学戴维斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一的微调框架,通过结合启发式和对抗性扰动的数据增强与输出一致性正则化,有效缓解多模态大语言模型中的模态干扰问题,提升模型的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03762 2026-01-30 cs.CL cs.AI 88%

Brain in a Vat: On Missing Pieces Towards Artificial General Intelligence in Large Language Models

虚拟大脑:迈向大型语言模型中人工通用智能的缺失部件

Yuxi Ma, Chi Zhang, Song-Chun Zhu

机构 * Beijing Insitute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型中人工通用智能的缺失部件,提出智能代理应具备无限任务执行、任务生成、价值系统和现实世界模型等特征,并强调知与行的统一对智能发展的重要性。

Journal ref Proceedings of the Annual Meeting of the Cognitive Science Society, 47 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 88%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12132 2026-01-21 cs.CL cs.AI 88%

Bengali Text Classification: An Evaluation of Large Language Model Approaches

孟加拉语文本分类:大型语言模型方法的评估

Md Mahmudul Hoque, Md Mehedi Hassain, Md Hojaifa Tanvir, Rahul Nandy

机构 * Dept. of Computer Science \& Engineering, CCN University of Science

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在孟加拉语文本分类中的有效性,发现Qwen 2.5模型在体育类别中表现最佳,准确率达72%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11776 2026-01-21 cs.CL cs.AI 88%

Cleansing the Artificial Mind: A Self-Reflective Detoxification Framework for Large Language Models

净化人工智能:一种用于大型语言模型的自反思净化框架

Kaituo Zhang, Zhimeng Jiang, Na Zou

机构 * University of Houston(休斯顿大学) Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种自反思净化框架,利用LLMs自身能力检测并纠正有毒内容,提升文本生成的安全性和连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14408 2026-01-13 cs.CL cs.AI 88%

From Implicit to Explicit: Enhancing Self-Recognition in Large Language Models

从隐式到显式:提升大语言模型的自我认知能力

Yinghan Zhou, Weifeng Zhu, Juan Wen, Wanli Peng, Zhengxian Wu, Yiming Xue

机构 * College of Information and Electrical Engineering, China Agricultural University(信息与电气工程学院,中国农业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CoSur框架,通过改进大语言模型的隐式自我认知能力,在个体呈现范式下提升其自我识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏