arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2605.28108 2026-05-29 cs.CL 91%

Ask Now, Use Later: Benchmarking the Proactivity Gap in Long-Lived LLM Agents

现在询问,以后使用:评估长期 LLM 代理中的主动性差距

Bin Wu, Guanyun Zou, Bingbing Wang, Huan Zhao, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Noumena AI

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 针对长期 LLM 代理在跨会话中未能主动获取用户偏好而导致的主动性差距,提出 Ask-to-Remember (ATR) 基准 ATRBench,通过隐藏用户偏好作为真实值来量化该差距,并诊断出获取环节是瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26730 2026-05-28 cs.CL 91%

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

PRISM:评估LLM同行评审员的多维基准

Ngoc Phan Phuoc Loc, Toan Huynh La Viet, Thanh Tran Khanh, Duy A Nguyen, Tuan Anh Nguyen Pham, Thanh Nguyen, Nitesh V. Chawla, Wray Buntine, Kok-Seng Wong, Khoa D. Doan, Binh T. Nguyen

机构 * VinUniversity(Vin大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Notre Dame(诺丁汉大学) Monash University(莫纳什大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 提出PRISM基准,从分析深度、新颖性评估、缺陷识别与主要问题排序、多维建设性四个维度评估LLM评审质量,发现LLM在单维度上可媲美甚至超越人类,但无系统在所有维度上一致平衡,表明LLM评审员更适合作为人类评审的针对性补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13626 2026-05-27 cs.LG 91%

Benchmark Leakage Trap: Can We Trust LLM-based Recommendation?

基准泄露陷阱:我们能信任基于LLM的推荐吗?

Mingqiao Zhang, Qiyao Peng, Yinghui Wang, Hongtao Liu, Yumeng Wang

机构 * Nanjing University(南京大学) Tianjin University(天津大学) Beijing Institute of Control and Electronic Technology(北京控制与电子技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文识别并研究了基于大语言模型的推荐系统中基准数据泄露问题,通过模拟多种泄露场景揭示了泄露对性能评估的误导性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06580 2026-05-27 cs.CL 91%

Stylistic Evolution and LLM Neutrality in Singlish Language

新加坡英语中的文体演变与LLM中立性

Linus Tze En Foo, Weihan Angela Ng, Wenkai Li, Lynnette Hui Xian Ng

机构 * Independent Researcher(独立研究者) ETH Zürich(苏黎世联邦理工学院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过分析十年间非正式数字信息的文体变化,研究大型语言模型(LLM)能否生成时间中立的输出,发现文体可分离性随时间距离增加,且LLM在真实性和时间中立性之间存在结构性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04916 2026-05-21 q-bio.QM cs.CL 91%

AFD-INSTRUCTION: A Comprehensive Antibody Instruction Dataset with Functional Annotations for LLM-Based Understanding and Design

AFD-INSTRUCTION: 一个全面的抗体指令数据集,具有功能注解,用于基于LLM的理解和设计

Ling Luo, Wenbin Jiang, Hongyuan Chang, Xinkang Wang, Xushi Zhang, Yueting Xiong, Mengsha Tong, Rongshan Yu

机构 * National Institute for Data Science in Health and Medicine(健康医学数据科学国家研究院) Institute of Artificial Intelligence(人工智能研究院) School of Life Sciences(生命科学学院) School of Informatics(信息学院) State Key Laboratory of Vaccines for Infectious Diseases(传染病疫苗国家重点实验室) Xiang An Biomedicine Laboratory(翔安生物医学实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出AFD-INSTRUCTION数据集,通过功能注解提升LLM在抗体理解与设计中的性能,为抗体建模和治疗发现提供新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17281 2026-05-19 cs.SE cs.AI 91%

ContractBench: Can LLM Agents Preserve Observation Contracts?

ContractBench: LLM Agents能否保持观察契约?

Jicheng Wang, Yifeng He, Zili Wang, Hanwen Xing, Arkaprava De, Hao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(title,title_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出ContractBench基准测试,用于评估LLM代理在保持观察契约(如时间有效性及字节完整性)方面的能力,发现现有模型在该任务上仍存在显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13368 2026-05-14 cs.CL 91%

What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation

LLM精细化实际提升了什么?对文档级文学翻译的系统研究

Shaomu Tan, Dawei Zhu, Ke Tran, Michael Denkowski, Sony Trenous, Bill Byrne, Leonardo Ribeiro, Felix Hieber

机构 * University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本文系统研究了文档级文学翻译中LLM精细化的效果,发现文档级MT后接段级精细化能带来稳定提升,而文档级精细化效果有限。通用精细化提示优于特定错误提示和评估后精细化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 91%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05711 2026-05-08 cs.CV cs.GR cs.HC cs.LG cs.MM 91%

Closing the Loop: Unified 3D Scene Generation and Immersive Interaction via LLM-RL Coupling

闭环:通过LLM-RL耦合实现统一的3D场景生成与沉浸式交互

Anh H. Vo, Sungyo Lee, Phil-Joong Kim, Soo-Mi Choi, Yong-Guk Kim

机构 * Department of Computer Engineering, Sejong University(全州大学计算机工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种统一框架,通过LLM-RL耦合实现语言驱动的3D场景生成与沉浸式交互的闭环,提升互动多媒体系统的适应性和沉浸感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23452 2026-05-05 cs.CL cs.DL 91%

CiteAudit: You Cited It, But Did You Read It? A Benchmark for Verifying Scientific References in the LLM Era

CiteAudit:你引用了它,但你读过它吗?LLM时代验证科学参考的基准

Kaiwen Shi, Weixiang Sun, Zheyuan Zhang, Lichao Sun, Nitesh V. Chawla, Yanfang Ye

机构 * University of Notre Dame(诺丁汉大学) Lehigh University(莱恩大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CiteAudit基准,用于验证LLM时代科学引用的真实性,通过多代理验证流程和大规模人工验证数据集,实现优于现有模型的引用验证性能。

Comments We have further refined the benchmark construction and reference verification pipeline to improve clarity and consistency. The revised version includes updated results and additional details to better align the evaluation with the intended setup. These changes provide a more precise presentation of the experimental findings, with conclusions and contributions remaining unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 91%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23255 2026-04-28 cs.HC cs.AI cs.CY 91%

Scalable LLM-based Coding of Dialogue in Healthcare Simulation: Balancing Coding Performance, Processing Time, and Environmental Impact

可扩展的基于LLM的医疗模拟对话编码:在编码性能、处理时间和环境影响之间取得平衡

Kiyoshige Garces, Gloria Milena Fernandez-Nieto, Linxuan Zhao, Sachini Samaraweera, Dragan Gasevic, Roberto Martinez-Maldonado, Vanessa Echeverria

机构 * RMIT University(皇家墨尔本理工大学) Monash University(墨尔本大学) Adelaide University(阿德莱德大学) The University of Hong Kong(香港大学) ESPOL University(ESPOL大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文探讨了如何通过优化提示设计和批量策略,在医疗模拟复盘中平衡编码准确性、处理时间和环境影响,展示了LLM在对话分析中的可行性及实际应用价值。

Comments 12 pages, 6 figures. Accepted at the Learning at Scale Conference (L@S) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17966 2026-04-21 cs.AI 91%

TPS-CalcBench: A Benchmark and Diagnostic Evaluation Framework for LLM Analytical Calculation Competence in Hypersonic Thermal Protection System Engineering

TPS-CalcBench: 一种用于高超音速热防护系统工程中LLM分析计算能力的基准和诊断评估框架

Jinglai Zheng, Chuhan Qiao, Haiming Huang

机构 * School of Civil Engineering, Beijing Jiaotong University, Beijing 100044, China(北京交通大学土木工程学院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文提出TPS-CalcBench,首个针对高超音速气动学和高温气体动力学中闭式解析计算的诊断基准,通过领域导向任务分类、双轨评估和人类-AI数据管道,建立安全关键工程LLM部署评估的完整诊断-评估-干预框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17178 2026-04-21 cs.CL 91%

Cognitive Policy-Driven LLM for Diagnosis and Intervention of Cognitive Distortions in Emotional Support Conversation

认知驱动的LLM用于情绪支持对话中认知扭曲的诊断与干预

Lin Zhong, Renjin Zhu, Shujuan Ma, Jinhao Cui, Lingzhi Wang, Hao Chen, Qing Liao

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) City University of Macau, Macao SAR, China(澳门城市大学) Peng Cheng Laboratory, Shenzhen, China(鹏城实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CogBiasESC数据集和CoPoLLM框架,用于提升LLM在情绪支持对话中识别和干预认知扭曲的能力,实验显示其在诊断准确性和安全性方面优于现有方法。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16542 2026-04-21 cs.CR cs.CL 91%

TWGuard: A Case Study of LLM Safety Guardrails for Localized Linguistic Contexts

TWGuard:LLM安全护栏在本地化语言环境中的案例研究

Hua-Rong Chu, Kuan-Chun Wang, Yao-Te Huang

机构 * Chunghwa Telecom Laboratories(中华电信实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出通过定制数据集优化语言环境特定的LLM安全护栏模型,以解决语言和文化差异导致的性能与实际效果差距问题,TWGuard在F1指标上提升显著,并在误报率上表现优异。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14969 2026-04-17 cs.AI 91%

Discovering Novel LLM Experts via Task-Capability Coevolution

通过任务能力共进化发现新型大语言模型专家

Andrew Dai, Boris Meinardus, Ciaran Regan, Yingtao Tian, Yujin Tang

机构 * Sakana AI

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AC/DC框架,通过模型合并和合成数据生成实现大语言模型与任务的共进化,发现超越大模型能力的新型LLM,无需显式优化基准,在多智能体最佳N选择中提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05096 2026-04-16 cs.CL 91%

RAG or Learning? Understanding the Limits of LLM Adaptation under Continuous Knowledge Drift in the Real World

RAG还是学习?在现实世界中连续知识漂移下理解LLM适应的极限

Hanbing Liu, Lang Cao, Yang Li

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) School of Artificial Intelligence, Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(深圳 ubiquitous 数据赋能重点实验室,清华大学深圳国际研究生院,清华大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一个现实世界动态事件基准,评估模型在连续知识漂移下的适应能力,揭示现有方法如RAG和学习方法的局限性,并提出时间感知检索基线Chronos以提升时序一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12545 2026-04-15 cs.AI cs.CY 91%

Cross-Cultural Simulation of Citizen Emotional Responses to Bureaucratic Red Tape Using LLM Agents

跨文化模拟公民对官僚繁文缛节的情感反应使用LLM代理

Wanchun Ni, Jiugeng Sun, Yixian Liu, Mennatallah El-Assady

机构 * ETH Zurich(苏黎世联邦理工学院) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI

AI总结 本文通过LLM代理模拟不同文化背景下公民对官僚繁文缛节的情感反应,发现模型在东方文化中表现较弱,提出RAMO交互界面以改进模型性能。

Comments To appear in the CHI 2026 Workshop on PoliSim

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08704 2026-03-10 cs.AI 91%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03827 2026-01-30 cs.AI 91%

What Would an LLM Do? Evaluating Large Language Models for Policymaking to Alleviate Homelessness

LLM会怎么做?评估大型语言模型在缓解贫困中的政策制定应用

Pierre Le Coz, Jia An Liu, Debarun Bhattacharjya, Georgina Curto, Serge Stinckwich

机构 * United Nations University Institute in Macau(联合国大学澳门研究所) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文评估LLMs在缓解贫困中的政策建议一致性,提出基于能力方法的基准,并探讨LLMs与专家结合使用在政策制定中的潜在价值。

Comments Added a 2nd expert's local-scenario annotations (Table 1 updated with inter-expert consensus); strengthened motivation & domain-expert engagement; expanded related work; replaced ROUGE-L with Sentence-BERT semantic similarity for justification analysis; clarified evaluation non-circularity (Sec. 4.1); deepened results analysis (local context responsiveness/bias); refined limitations & future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18302 2025-11-25 cs.AI 91%

The Catastrophic Paradox of Human Cognitive Frameworks in Large Language Model Evaluation: A Comprehensive Empirical Analysis of the CHC-LLM Incompatibility

人类认知框架在大语言模型评估中的灾难性悖论:对CHC-LLM不兼容性的全面实证分析

Mohan Reddy

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本研究揭示了人类认知框架与大语言模型评估之间的不兼容性悖论,指出模型在结晶知识任务上的低准确率与高IQ评分的矛盾,提出发展原生机器认知评估框架的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15899 2025-10-21 cs.AR cs.LG 91%

LLM-VeriPPA: Power, Performance, and Area Optimization aware Verilog Code Generation with Large Language Models

Kiran Thorat, Jiahui Zhao, Yaotian Liu, Amit Hasan, Hongwu Peng, Xi Xie, Bin Lei, Caiwen Ding

机构 * Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19510 2025-05-30 cs.CL 91%

LLM Meets Scene Graph: Can Large Language Models Understand and Generate Scene Graphs? A Benchmark and Empirical Study

Dongil Yang, Minjin Kim, Sunghwan Kim, Beong-woo Kwak, Minjun Park, Jinseok Hong, Woontack Woo, Jinyoung Yeo

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Metaverse, KAIST(元宇宙研究生院,韩国科学技术院) Graduate School of Culture Technology, KAIST(文化科技研究生院,韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13044 2025-05-30 cs.CL 91%

Do we still need Human Annotators? Prompting Large Language Models for Aspect Sentiment Quad Prediction

Nils Constantin Hellwig, Jakob Fehle, Udo Kruschwitz, Christian Wolff

机构 * Media Informatics Group University of Regensburg(媒体信息学组德国雷根萨大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13038 2025-04-18 cs.CY cs.CL 91%

How Large Language Models Are Changing MOOC Essay Answers: A Comparison of Pre- and Post-LLM Responses

Leo Leppänen, Lili Aunimo, Arto Hellas, Jukka K. Nurminen, Linda Mannila

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09008 2025-01-15 cs.CL 91%

LLM Reading Tea Leaves: Automatically Evaluating Topic Models with Large Language Models

Xiaohao Yang, He Zhao, Dinh Phung, Wray Buntine, Lan Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments Forthcoming in Transactions of the Association for Computational Linguistics (TACL) published by MIT Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22660 2024-10-31 cs.CL 91%

Linguistics Theory Meets LLM: Code-Switched Text Generation via Equivalence Constrained Large Language Models

Garry Kuwanto, Chaitanya Agarwal, Genta Indra Winata, Derry Tanti Wijaya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04927 2024-10-03 cs.CL eess.AS 91%

Just ASR + LLM? A Study on Speech Large Language Models' Ability to Identify and Understand Speaker in Spoken Dialogue

Junkai Wu, Xulin Fan, Bo-Ru Lu, Xilin Jiang, Nima Mesgarani, Mark Hasegawa-Johnson, Mari Ostendorf

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(title);分类 cs.CL

Comments Accepted to IEEE SLT 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.12100 2024-05-21 cs.CL 91%

DOP: Diagnostic-Oriented Prompting for Large Language Models in Mathematical Correction

Hao Chen, Biaojie Zeng, Xin Lin, Liang He, Aimin Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01230 2024-04-02 cs.CL 91%

LLM as a Mastermind: A Survey of Strategic Reasoning with Large Language Models

Yadong Zhang, Shaoguang Mao, Tao Ge, Xun Wang, Adrian de Wynter, Yan Xia, Wenshan Wu, Ting Song, Man Lan, Furu Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏