arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2604.17366 2026-04-21 cs.CL cs.AI 90%

ArgBench: Benchmarking LLMs on Computational Argumentation Tasks

ArgBench:对计算论证任务的LLM基准测试

Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArgBench,首个用于评估LLM在计算论证任务中性能的基准,涵盖33个数据集,评估五种LLM家族在46种任务中的泛化能力,分析少样本示例、推理步骤、模型大小和训练技能对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI 90%

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06201 2026-04-21 cs.CL cs.AI 90%

Beyond Facts: Benchmarking Distributional Reading Comprehension in Large Language Models

超越事实:大型语言模型分布式阅读理解基准测试

Pei-Fu Guo, Ya-An Tsai, Chun-Chia Hsu, Kai-Xin Chen, Yun-Da Tsai, Kai-Wei Chang, Nanyun Peng, Mi-Yen Yeh, Shou-De Lin

机构 * National Taiwan University(国立台湾大学) University of California, Los Angeles(加州大学洛杉矶分校) Academia Sinica, Taiwan(台湾“中央研究院”) NTU AI-CoRE(国立清华大学AI研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出Text2DistBench基准测试,评估LLM从自然语言中推断分布知识的能力,通过真实YouTube评论数据,测试模型在估计评论比例和识别高频主题方面的表现,揭示LLM在分布式阅读理解中的能力和局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16846 2026-04-21 cs.AI cs.CL 90%

BASIL: Bayesian Assessment of Sycophancy in LLMs

BASIL:大型语言模型中趋炎附势行为的贝叶斯评估

Katherine Atwell, Pedram Heydari, Anthony Sicilia, Malihe Alikhani

机构 * Northeastern University(东北大学) Johns Hopkins University(约翰霍普金斯大学) West Virginia University(西弗吉尼亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出BASIL框架,通过贝叶斯方法区分LLM中的趋炎附势行为与理性信念更新,评估模型在不确定任务中的理性表现,展示校准和微调策略能有效减少贝叶斯不一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14158 2026-04-17 cs.CL cs.AI 90%

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

MemGround:用于大型语言模型在游戏化场景中的长期记忆评估套件

Yihang Ding, Wanke Xia, Yiting Zhao, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) CASIA

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 MemGround通过游戏化交互场景评估LLM的长期记忆能力,提出三级框架和多维指标,揭示先进模型在动态跟踪和复杂推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10182 2026-04-14 cs.CL cs.AI 90%

A Survey of Inductive Reasoning for Large Language Models

大型语言模型归纳推理的综述

Kedi Chen, Dezhao Ruan, Yuhao Dan, Yaoting Wang, Siyu Yan, Xuecheng Wu, Yinqi Zhang, Qin Chen, Jie Zhou, Liang He, Biqing Qi, Linyang Li, Qipeng Guo, Xiaoming Shi, Wei Zhang

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Xi’an Jiaotong University(西安交通大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中归纳推理的方法与评估,分为训练后改进、测试时扩展和数据增强三大类,并提出统一的评估方法,为未来研究奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11871 2026-04-14 cs.CL cs.AI 90%

MegaFake: A Theory-Driven Dataset of Fake News Generated by Large Language Models

MegaFake:一种由大型语言模型生成的理论驱动的虚假新闻数据集

Lionel Z. Wang, Ka Chung Ng, Yiming Ma, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MegaFake数据集,通过理论框架指导生成虚假新闻,提升虚假新闻检测的理论和实践能力。

Comments Decision Support Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08559 2026-04-13 cs.CL cs.AI 90%

Medical Reasoning with Large Language Models: A Survey and MR-Bench

基于大语言模型的医学推理:综述与MR-Bench

Xiaohan Ren, Chenxiao Fan, Wenyin Ma, Hongliang He, Chongming Gao, Xiaoyan Zhao, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The First Affiliated Hospital of USTC(中国科学技术大学附属第一医院) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型在医学推理中的应用,提出MR-Bench基准测试,揭示了考试级性能与真实临床任务准确性之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 90%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15281 2026-03-27 cs.RO cs.AI cs.CL cs.HC 90%

LLM4AD: Large Language Models for Autonomous Driving -- Concept, Review, Benchmark, Experiments, and Future Trends

LLM4AD:大型语言模型在自动驾驶中的应用——概念、综述、基准测试、实验与未来趋势

Can Cui, Yunsheng Ma, Sung-Yeon Park, Zichong Yang, Yupeng Zhou, Peiran Liu, Juanwu Lu, Juntong Peng, Jiaru Zhang, Ruqi Zhang, Lingxi Li, Yaobin Chen, Jitesh H. Panchal, Amr Abdelraouf, Rohit Gupta, Kyungtae Han, Ziran Wang

机构 * Purdue University(普渡大学) Institute for Physical Artificial Intelligence (IPAI), Purdue University(普渡大学物理人工智能研究所) Department of Computer Science, Purdue University(普渡大学计算机科学系) InfoTech Labs, Toyota Motor North America(丰田北美信息技术实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了将大型语言模型应用于自动驾驶的潜力,提出LLM4AD概念,构建了评估框架,并通过实验和未来趋势分析揭示了挑战与发展方向。

Comments The paper was accepted by the Proceedings of the IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24846 2026-03-27 cs.CV cs.AI cs.LG 90%

NeuroVLM-Bench: Evaluation of Vision-Enabled Large Language Models for Clinical Reasoning in Neurological Disorders

NeuroVLM-Bench:评估用于神经系统疾病临床推理的视觉增强大语言模型

Katarina Trojachanec Dineva, Stefan Andonov, Ilinka Ivanoska, Ivan Kitanovski, Sasho Gramatikov, Tamara Kostova, Monika Simjanoska Misheva, Kostadin Mishev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了视觉增强大语言模型在神经疾病临床推理中的性能,通过多模态模型在MRI和CT数据集上进行基准测试,发现影像属性基本解决,但诊断推理仍具挑战性。

Comments 53 pages, 12 figures. Manuscript submitted to the BMC Medical Informatics and Decision Making journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23529 2026-03-26 cs.CL cs.AI 90%

Konkani LLM: Multi-Script Instruction Tuning and Evaluation for a Low-Resource Indian Language

科尼语LLM:为低资源印度语言的多脚本指令微调与评估

Reuben Chagas Fernandes, Gaurang S. Patkar

机构 * Don Bosco College Of Engineering(东邦工程学院)

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title);large language model(abstract);language model(abstract)

AI总结 本文提出Konkani-Instruct-100k数据集,通过Gemini 3生成,开发了优化区域特色的科尼语LLM,并构建多脚本评估基准,提升低资源语言在机器翻译中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21910 2026-03-26 cs.CL cs.AI 90%

AutoSCORE: Enhancing Automated Scoring with Multi-Agent Large Language Models via Structured Component Recognition

AutoSCORE: 通过结构化组件识别提升多智能体大语言模型的自动评分

Yun Wang, Zhaojun Ding, Xuansheng Wu, Siyue Sun, Ninghao Liu, Xiaoming Zhai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AutoSCORE通过多智能体大语言模型和结构化组件识别提升自动评分的准确性与可解释性,在多个基准数据集上表现出色,尤其在复杂评分标准下效果显著。

Comments 9 pages, 2 figures

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(48), 40898-40906, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22214 2026-03-24 cs.CR cs.AI cs.LG 90%

Evaluating the Reliability and Fidelity of Automated Judgment Systems of Large Language Models

评估大型语言模型自动判断系统的可靠性和准确性

Tom Biskupski, Stephan Kleber

机构 * Ravensburg-Weingarten University of Applied Sciences(拉文堡-魏金根应用科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了大型语言模型作为自动质量评估器的适用性,通过测试37种不同规模的对话型LLM与5种不同判断提示的组合,展示了其在特定任务中与人类评估的高相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17561 2026-03-24 cs.CL cs.AI 90%

LexInstructEval: Lexical Instruction Following Evaluation for Large Language Models

LexInstructEval: 用于大语言模型的词汇指令遵循评估

Huimin Ren, Yan Liang, Baiqiao Su, Chaobo Sun, Hengtong Lu, Kaike Zhang, Chen Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LexInstructEval,通过形式化规则语法系统,系统生成多样化数据集并提供透明评估工具,以评估大语言模型对复杂词汇指令的遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19247 2026-03-23 cs.CL cs.AI 90%

When Prompt Optimization Becomes Jailbreaking: Adaptive Red-Teaming of Large Language Models

当提示优化成为劫持:大型语言模型的自适应红队测试

Zafir Shamsi, Nikhil Chekuru, Zachary Guzman, Shivank Garg

机构 * Algoverse AI Research(Algoverse AI研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);small language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在对抗性提示优化下的安全性漏洞,通过自适应红队测试发现开源小模型的安全保障显著降低,表明静态评估无法准确反映真实风险。

Comments EACL SRW 2026, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13207 2026-03-23 cs.CR cs.AI cs.LG 90%

LISAA: A Framework for Large Language Model Information Security Awareness Assessment

LISAA:大型语言模型信息安全意识评估框架

Ofir Cohen, Gil Ari Agmon, Asaf Shabtai, Rami Puzis

机构 * Computer and Information Science Ben-Gurion University of the Negev(计算机与信息科学贝纳尔·戈里翁大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LISAA框架,用于评估大型语言模型的信息安全意识,通过100个真实场景测试其安全知识、态度和行为,揭示当前模型在信息安全方面的普遍漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02951 2026-03-20 cs.CL cs.AI 90%

SQLBench: A Comprehensive Evaluation for Text-to-SQL Capabilities of Large Language Models

SQLBench: 一种全面评估大型语言模型文本到SQL能力的综合评估

Bin Zhang, Yuxiao Ye, Guoqing Du, Xiaoru Hu, Zhishuai Li, Chi Harold Liu, Zhiwei Xu, Guoliang Fan, Rui Zhao, Ziyue Li, Hangyu Mao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) SenseTime Research(商汤科技研究院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Technical University of Munich, Heilbronn Data Science Center, Munich Data Science Institute(慕尼黑技术大学,海德堡数据科学中心,慕尼黑数据科学研究所) Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SQLBench,通过构建新数据集和五个评估任务,全面评估不同模型在文本到SQL任务中的性能差异,并提出针对各任务的最优上下文学习方案。

Comments 25pages, 10figures, 14tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17067 2026-03-19 cs.CL cs.AI 90%

Evaluating Ill-Defined Tasks in Large Language Models

评估大型语言模型中的模糊任务

Yi Zhou, Basel Shbita

机构 * IBM Research San Jose, CA(IBM研发San Jose分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文分析了现有评估基准在处理模糊任务时的不足,通过复杂指令跟随和自然语言到Mermaid序列图的案例研究,揭示了评估方法的不稳定性与非诊断性,推动更稳健的评估设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10969 2026-03-17 cs.LG cs.CL cs.CR cs.SE 90%

TOSSS: a CVE-based Software Security Benchmark for Large Language Models

TOSSS: 基于CVE的软件安全基准用于大语言模型

Marc Damie, Murat Bilgehan Ertan, Domenico Essoussi, Angela Makhanu, Gaëtan Peter, Roos Wensveen

机构 * University of Twente(特文特大学) CWI Amsterdam(阿姆斯特丹信息与计算科学研究所) Erasmus University Rotterdam(埃因霍温大学 Rotterdam分校) Modat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TOSSS基准,用于评估大语言模型在选择安全与易受攻击代码片段能力,通过CVE数据库提供可扩展框架,评估14种模型在C/C++和Java代码中的安全得分,范围0.48至0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00691 2026-03-17 cs.CL cs.LG 90%

Labels Generated by Large Language Models Help Measure People's Empathy in Vitro

由大型语言模型生成的标签有助于在体外测量人们的共情能力

Md Rakibul Hasan, Yue Yao, Md Zakir Hossain, Aneesh Krishna, Imre Rudas, Shafin Rahman, Tom Gedeon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了利用大型语言模型生成的标签提升主流模型监督训练的潜力,通过噪声标签校正和训练数据增强策略,提高了共情计算任务的准确性,并在公开数据集上取得了显著成果。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Journal of Selected Topics in Signal Processing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13691 2026-03-17 cs.CL cs.AI 90%

QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models

QuarkMedBench: 一个基于现实场景的基准测试,用于评估大型语言模型

Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma, Shuting Xu, Xuehai Wang, Yuxuan Jiang, Tingting Yu, Yunqing Hong, Jiayi Liu, Rianzhe Huang, Shuxin Zhao, Haiping Hu, Wen Shang, Jian Xu, Guanjun Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 QuarkMedBench通过构建大规模医疗数据集和自动评分框架,评估LLM在真实医疗查询中的表现,揭示传统考试指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 90%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10068 2026-03-12 cs.CR cs.AI cs.CL 90%

ADVERSA: Measuring Multi-Turn Guardrail Degradation and Judge Reliability in Large Language Models

ADVERSA:测量大型语言模型中多轮护栏退化和裁判可靠性

Harry Owiredu-Ashley

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ADVERSA通过连续合规轨迹评估大型语言模型在多轮对抗中的护栏退化及裁判可靠性,揭示早期轮次更易成功突破。

Comments 12 pages, 12 figures. Independent research. Code and artifacts: https://github.com/Harry-Ashley/adversa-guardrail-degradation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00359 2026-03-12 cs.CL cs.LG 90%

How Large Language Models Get Stuck: Early structure with persistent errors

大语言模型为何陷入停滞:早期结构与持续性错误

Alokesh Manna, William Snyder, Whitney Tabor

机构 * Department of Statistics(统计学系) University of Connecticut, Storrs(康涅狄格大学斯托尔分校) Department of Linguistics(语言学系) Department of Psychological Sciences(心理学科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型在训练早期可能因大写统计偏差而陷入错误固化,提出双元组假设以解释这一现象并提出测试方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08245 2026-03-12 cs.CL cs.AI cs.HC 90%

Large Language Model Psychometrics: A Systematic Review of Evaluation, Validation, and Enhancement

大语言模型心理测量学:评估、验证与增强的系统综述

Haoran Ye, Jing Jin, Yuhang Xie, Xin Zhang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(一般人工智能国家重点实验室,智能科学与技术学院,北京大学) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) Key Laboratory of Machine Perception (Ministry of Education), Peking University(机器感知重点实验室(教育部),北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文系统综述了大语言模型的心理测量学,通过整合心理测量工具和理论,提升LLM的评估、理解和增强能力,推动以人类为中心的AI发展。

Comments 400+ references

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08275 2026-03-10 cs.CL cs.AI 90%

AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型

Hankun Kang, Di Lin, Zhirong Liao, Pengfei Bai, Xinyi Zeng, Jiawei Jiang, Yuanyuan Zhu, Tieyun Qian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15701 2026-03-10 cs.AR cs.CL cs.LG 90%

HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databases

HDLxGraph: 通过HDL图数据库连接大型语言模型和HDL仓库

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Niraj Chitla, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang, Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 HDLxGraph通过整合HDL图特性与RAG,提升LLM在HDL任务中的搜索、调试和完成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12945 2026-03-10 cs.CL cs.LG 90%

A Component-Based Survey of Interactions between Large Language Models and Multi-Armed Bandits

基于组件的大型语言模型与多臂老虎机交互调研

Siguang Chen, Chunli Lv, Miao Xie

机构 * College of Information and Electrical Engineering, China Agricultural University, Beijing 100083, China(信息与电气工程学院,中国农业大学,北京) Key Laboratory of Agricultural Machinery Monitoring and Big Data Application, Ministry of Agriculture and Rural Affairs, Beijing 100083, China(农业机械监测与大数据应用重点实验室,农业农村部,北京)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文调研了大型语言模型与多臂老虎机在组件层面的双向交互,分析了两者在解决对方挑战中的协同作用及未来研究方向。

Comments 25 pages, 6 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06066 2026-03-09 cs.CL cs.AI 90%

Evaluating Austrian A-Level German Essays with Large Language Models for Automated Essay Scoring

利用大型语言模型评估奥地利A级德语作文

Jonas Kubesch, Lena Huber, Clemens Havas

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文利用大型语言模型评估奥地利A级德语作文,发现其在评分一致性上存在显著不足,无法替代人类评分。

Comments To be presented at the SAC2026 and published in its symposium proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏