arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 11618 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2798 篇

2606.08769 2026-06-09 cs.CL cs.AI 新提交 87%

RadOT-Eval: Auditable Structured-Evidence Transport for Radiology Report Evaluation

RadOT-Eval:用于放射学报告评估的可审计结构化证据传输

Weixin Liu, Juming Xiong, Yang Li, Qingyuan Song, Susannah Rose, Murat Kantarcioglu, Bradley Malin, Zhijun Yin

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出RadOT-Eval框架,通过最优传输对齐结构化临床证据,在独立测试集上实现与错误负担的高斯皮尔曼相关,优于标准指标和基于LLM的评估器。

Comments 10 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 87%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 评测与基准 :language model(title,abstract);large language model(title);分类 cs.CL;LLM(journal_ref)

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17105 2026-08-19 cs.CY 新提交 87%

Language Models Reproduce Human Reductionist Bias and Decision Inconsistency in Neurodevelopmental Disorders Assessment

语言模型在神经发育障碍评估中再现了人类的简化主义偏差与决策不一致性

Maciej Wodziński, Joanna Wodzińska, Kacper Dudzic, Marcin Moskalewicz

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 研究通过对比人类与7个LLMs,发现LLMs虽表现出更高智力谦逊,却再现了人类在神经发育障碍评估中的简化主义偏差与决策不一致性,强调需审查AI的神经多样性操作化概念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04341 2026-08-06 cs.MA 新提交 87%

Continuous Improvement and Parallel Autonomous Exploration: An LLM-Agent Framework for Searching Large Solution Spaces

持续改进与并行自主探索:用于搜索大型解空间的大语言模型智能体框架

Dulmini Hettiarachchi, Andre Rusli, Julio Christian Young, Sho Akiyama

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出一种LLM智能体框架,含持续改进奖励循环与并行自主探索机制,在产品到目录匹配任务中,5个并行智能体的合格覆盖度较单智能体及基线显著提升。

Comments 5 pages, ACM KDD'26 Workshop on SciSoc Agents & LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04270 2026-08-06 cs.SE cs.MA 新提交 87%

CURATE: Leveraging LLM Agents to Compose, Catalog, and Deploy Reproducible Workflows

CURATE:利用大语言模型智能体构建、编目和部署可复现工作流

Nolan Cutler, Chia-Chen Kuo, Nanda Velugoti, Kathryn Newhart, Renato Figueiredo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 该研究提出CURATE多智能体系统,覆盖工作流全生命周期,通过模块目录支持FAIR原则,用Claude Opus 4.8原型验证,完成6项含基准工作流复现及环境工程工作流开发的实验。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03078 2026-08-05 cs.CV 新提交 87%

LDU-Bench: Multimodal LLM Evaluation for Lithography Defect Understanding under Layout-Varying Circuit Backgrounds

LDU-Bench:面向不同布局电路背景下光刻缺陷理解的多模态大语言模型评估基准

Huanglong Ji, Botong Zhao, Shujing Lv, Yue Lv

专题命中 评测与基准 :LLM(title);large language model(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出LDU-Bench这一多模态基准,将光刻审查工作流程分解为四项任务,评估发现现有多模态大语言模型的缺陷分类能力无法稳定迁移至下游审查阶段,为工业MLLM评估提供了统一平台。

Comments 12 pages, 3 figures, and 5 tables, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02693 2026-08-05 cs.SE cs.CR 新提交 87%

PRWeaver: Evaluating LLM-Based Code Auditors against Long-Horizon Malicious Pull Requests

PRWeaver:针对基于大语言模型的代码审计工具对抗长周期恶意拉取请求的评估

Yuekun Wang, Mingfei Cheng, Xiaofei Xie

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提出PRWeaver基准,评估基于LLM的代码审计工具对长周期恶意PR的可靠性,发现特定评审策略会降低检测率,为优化代码审计工具提供了依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00012 2026-08-04 cs.CL cs.AI cs.CY cs.LG 新提交 87%

Obshazard-bench: Benchmarking Multimodal Foundation Models for Real-Time Disaster Intelligence from Raw Earth Observation Streams

Obshazard-bench:面向原始地球观测流的实时灾害情报多模态基础模型基准测试

Fengxiang Wang, Qiuyang Yu, Yueying Li, Mingshuo Chen, Chengchi Fei, Kaiyi Xu, Lixin Gu, Wangxu Wei, Junchao Gong, Lipeng Ma, Jiong Wang, Fenghua Ling, Wenlong Zhang, Xue Yang, Wenjing Yang, Ben Fei, Long Lan

机构 * National University of Defense Technology(国防科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出Obshazard-bench基准测试,评估多模态基础模型的实时灾害情报能力,发现现有模型在将原始多通道物理观测转化为符合决策需求的灾害推理方面存在显著局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27942 2026-07-31 cs.MA 新提交 87%

Scaling LLM-Driven Multi-Agent Systems: Design Principles and Architectural Scalability Analysis

扩展大语言模型驱动的多智能体系统:设计原则与架构可扩展性分析

Linus Sander, Fengjunjie Pan, Vahid Zolfaghari, Andre Schamschurko, Nenad Petrovic, Alois Knoll

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 该研究提炼出可扩展多智能体系统的四项设计原则,构建参考架构并在基准任务上评估,发现LLM超能力阈值时扩展可提升准确率但成本近似线性增长,性能在中等复杂度达峰,一致性是核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27294 2026-07-31 cs.SE 新提交 87%

AgentS4D: Benchmarking Runtime Risks across the Execution Lifecycle of LLM-Based Workspace Agents

AgentS4D:基于大语言模型的工作空间智能体执行生命周期内运行时风险基准

Jiajun Zhou, Zhaoxuan Ke, Jihang Ye, Xuanze Chen, Shanqing Yu, Qi Xuan

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究推出AgentS4D基准,评估20种智能体配置在328个风险案例中的表现,发现任务完成不代表安全,需跨风险条件完整评估智能体配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24174 2026-07-28 cs.CR 新提交 87%

Just Testing, Move Along: Evasion of LLM-based System Log Interpretation by Prompt Injection

只是测试,继续前进:通过提示注入规避基于大语言模型的系统日志解释

Max Landauer, Florian Skopik, Markus Wurzenberger, Franciszek Górski, Mateusz Krzysztoń

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的系统日志解释中提示注入攻击问题,提出评估框架,利用真实攻击日志痕迹创建对抗示例,证明攻击可致恶意日志误分类,且LLMs解释含对抗指标可用于检测攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23515 2026-07-28 cs.RO 新提交 87%

LEACL: LLM-Enhanced Automatic Curriculum Learning for Reinforcement Learning in Long-Horizon Manipulation Tasks

LEACL:用于长时程操作任务强化学习的大语言模型增强自动课程学习

Faraz Heravi, James Ouyang, Zifan Xu, Arjun Kumar, Yoonchang Sung, Peter Stone

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) Sony AI(索尼人工智能)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对长时程操作任务强化学习挑战,提出LEACL框架,结合大语言模型与自动课程学习,用大语言模型分解任务并生成规范,由自动课程学习算法仅依稀疏奖励信号指导学习,在相关任务上取得更好渐近性能。

Comments 8 pages, 4 figures, Published in the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19682 2026-07-23 cs.SE 新提交 87%

Context Matters: Improving the Practical Reliability of LLM-Based Unit Test Generation

上下文很重要:提高基于大语言模型的单元测试生成的实际可靠性

Junjie Chen, Ziqi Wang, Lin Yang, Chen Yang, Xiao Chu, Jianyi Zhou, Guangtai Liang, Qianxiang Wang, Dong Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的单元测试生成在实际应用中的问题,提出上下文感知工作流程CATGen,通过明确依赖、稳定框架、静态分析等改进设计,经评估在实际项目和基准测试中提升编译成功率与覆盖率,减少生成时间和消耗。

Comments 23 pages, 5 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18108 2026-07-21 cs.CR 新提交 87%

GARAGE: Characterizing the Automation Boundary in LLM-based Attack Graph Generation

GARAGE:基于大语言模型的攻击图生成中自动化边界的特征描述

Daekwon Pi, Sangho Lee, Young Hun Lee, Huy Kang Kim

专题命中 评测与基准 :LLM(title,summary_cn)

AI总结 研究针对现代车辆安全CTI合成难题,提出GARAGE框架,通过RAG技术将碎片化CTI转化为特定领域知识库用于攻击图生成,经实验验证能准确转移安全知识,还可作为TARA支持工具提供性价比分析以指导在各LLM层级部署。

Comments 22 pages, 10 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09091 2026-07-13 cs.CV 新提交 87%

Beyond Time Shifts: Adapting Omni-LLM as a Reference-Free Evaluator for Generative Audio-Visual Models

超越时间偏移:将全能语言模型(Omni-LLM)适配为生成式视听模型的无参考评估器

Yijie Qian, Juncheng Wang, Chao Xu, Huihan Wang, Yuxiang Feng, Yang Liu, Baigui Sun, Yong Liu, Shujun Wang

机构 * Zhejiang University(浙江大学) The Hong Kong Polytechnic University(香港理工大学) IROOTECH TECHNOLOGY(易路泰克科技)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究针对视听生成模型跨模态同步评估难题,提出框架解决人类与自动化评估指标的矛盾。通过引入数据集、适配模型及提出优化方法,实现先进的人类偏好对齐,建立标准化基准推动评估从信号相关性到因果关系发展。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07481 2026-07-09 cs.SE 新提交 87%

The Poisoned Chalice of LLM Evaluation Report

大语言模型评估报告的毒圣杯

Jonathan Katzy, Ali Al-Kaswan, Razvan Mihai Popescu, Zhou Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究大语言模型评估中因数据污染致结果不可靠的问题,通过举办竞赛将污染检测设为白盒成员推理任务,提供相关资源,报告竞赛设置与结果,推动软件工程中可信大语言模型评估社区发展。

Comments Report of the competition hosted at FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05290 2026-07-07 cs.CV 新提交 87%

ChatImage: Navigating Long-Form LLM Answers through Interactive Images

ChatImage:通过交互式图像导航大语言模型的长文本回答

Wencan Jiang, Jiangning Zhang, Yong Liu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM长文本答案难以细粒度浏览的问题,ChatImage将其转为带点击热点的交互图像,支持局部查询,提升内容与交互区域的一致性,还开源实现并发布多格式评测基准。

Comments Project:https://wencanjiang.github.io/ChatImage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31314 2026-07-01 eess.SY cs.SY 新提交 87%

A Novel Method for Differential-Algebraic Dynamic Model Discovery in Power Systems: An LLM-Based Multi-Agent Collaborative Framework

一种电力系统微分代数动态模型发现的新方法:基于LLM的多智能体协作框架

Xinming Wang, Fan Tang, Yingli Wei, Yakun He, Zhe Liu, Ping Jiang, Haoyu Wu, Zihan Guo, Chao Shen

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对电力系统强非线性、多时间尺度耦合及黑箱控制逻辑导致的模型发现难题,提出基于大语言模型的多智能体协作框架,通过并行生成候选方程结构并联合恢复状态动态、代数约束和关键中间变量,在同步发电机和构网型逆变器案例中优于单智能体方法和传统符号回归。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20138 2026-06-19 cs.AI cs.CL cs.HC cs.LG 新提交 87%

Learning to Prompt: Improving Student Engagement with Adaptive LLM-based High-School Tutoring

学习提示:基于自适应LLM的高中辅导提升学生参与度

Po-Chin Chang, Nicholas Hogan, Aske Plaat, Michiel T. van der Meer

机构 * Leiden University(莱顿大学) FutureWhiz

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种基于14个教学特征的主题感知提示路由模型,通过模拟训练和在线A/B测试,在高中辅导中实现自适应策略切换,提高教学效率并减少交互轮次。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 87%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17573 2026-06-17 cs.OS cs.CR 新提交 87%

Cordon: Semantic Transactions for Tool-Using LLM Agents

Cordon: 工具使用型LLM代理的语义事务

Zheng Chen, Hanqing Liu, Duling Xu, Dong Dong, Jialin Li, Bangzheng Pu, Jidong Zhai

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出Cordon事务运行时系统,通过语义事务边界实现多步代理工作流的提交、回滚、恢复和审计,减少不可逆效应失败并暴露跨步违规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11375 2026-06-11 cs.CL cs.AI cs.LG 新提交 87%

When Probing Accuracy Saturates, Fragility Resolves: A Complementary Metric for LLM Pre-Training Analysis

当探测精度饱和时,脆弱性揭示问题:LLM预训练分析的互补度量

Orion Reblitz-Richardson

机构 * Distiller Labs

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对线性探测在预训练中精度快速饱和的问题,提出脆弱性度量,通过激活噪声水平衡量探测鲁棒性,揭示精度无法捕捉的表示结构演化。

Comments 22 pages, 5 figures. Code and datasets at https://github.com/deepsteer/deepsteer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07085 2026-06-08 cs.SE 新提交 87%

Porting Declarative UI to HarmonyOS: A Heuristic-guided LLM Approach

将声明式UI移植到鸿蒙:一种启发式引导的LLM方法

Kunwu Zheng, Pengyu Xue, Zhen Yang, Xiran Lyu, Peishi Lai, Mengying Zhao, Yutian Tang, Huizhi Zhang, Xianhang Li, Linhao Wu, Chengyi Wang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 针对鸿蒙系统从Android/iOS迁移声明式UI的需求,提出ArkTrans方法,通过启发式构建骨架和模式匹配修复语法错误,实现高编译成功率和视觉保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16508 2026-08-18 cs.CR cs.LG cs.NI 新提交 86%

LLMs for Zero-Shot Threat Detection via Structured Risk Indicators

基于结构化风险指标的零样本威胁检测大语言模型

Abdullah Alghamdi, Siamak Layeghy, Marius Portmann

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出两阶段LLM框架,结合RAG从异构安全日志零样本检测内部威胁与APT,在两个基准数据集上优于现有模型,风险指标质量是性能关键驱动因素

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16286 2026-08-18 cs.CL 新提交 86%

Clause Encounters of the Third Kind: Can LLMs Replace Language Teachers?

条款式的第三类接触:大型语言模型能否替代语言教师?

Kristina Šekrst, Ana Kovačić

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究评估了LLM替代语言教师提供教学反馈与解释的能力,发现其纠错能力出色但教学解释不足,AI辅助语言学习热情或超出对其教学能力的认知。

Journal ref Oxford Intersections: AI in Society (Oxford, online edn, Oxford Academic, 20 Mar. 2025 - )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16196 2026-08-18 cs.AI cs.HC 新提交 86%

Beyond Asking: A Pipeline for Personalized Game Generation that Reads Players from Behavior

超越询问:一种从玩家行为读取数据的个性化游戏生成流水线

Yifan Lu, Xiaopeng Yuan, Haohan Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了带真实特质的合成玩家基准,提出机会感知决策时刻表示,对比了LLM等方法的推断效果,将推断画像用于游戏难度自适应并开展人类研究验证。

Comments 16 pages, 3 figures, 6 tables. Includes technical appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15055 2026-08-18 cs.AI 新提交 86%

TAHB: A Comprehensive Benchmark for Text-Attributed Hypergraph Learning

TAHB:面向文本属性超图学习的综合基准

David Yoon Suk Kang, JungHyun Kim, Juhyun Jeon, Sang-Wook Kim

机构 * Chungbuk National University(忠北国立大学) Hanyang University(汉阳大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出首个整合超图结构与文本属性的公开基准TAHB,含10个跨领域数据集,证实LLM增强文本语义可提升超图学习性能,为交叉领域研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15012 2026-08-18 cs.CR cs.AI cs.MA 新提交 86%

SysEvolve: An AI-native, safe, autonomous adversarial attack-defense co-evolutionary system

SysEvolve:一种原生AI、安全且自主的对抗攻防协同进化系统

Yuhan Meng, Shaofei Li, Jionghao Huang, Jiandong Jin, Puyi Wang, Hanlin Jiang, Anis Yusof, Peng Jiang, Zhenkai Liang, Yao Guo, Ding Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对网络安全攻防不对称问题,提出SysEvolve协同进化系统,含三个组件,实验验证其攻防性能,还揭示了LLM智能体能力的三项关键发现。

Comments Technical Report For SysEvolve System

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14161 2026-08-17 cs.AI 新提交 86%

BiasTrace: Linking Reasoning Behaviours to Biased Outputs in LLMs

BiasTrace:将大语言模型(LLM)中的推理行为与有偏输出关联起来

Varsha Ramineni, Hossein A. Rahmani, Jerome Ramos, Karin Sevegnani, Emine Yilmaz

机构 * University College London(伦敦大学学院) NVIDIA(英伟达)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本研究提出BiasTrace标注方案,将LLM的推理行为与有偏输出关联,构建大型标注数据集,发现有偏输出多源于微妙推理行为,且该方案可提升偏见检测与推理时缓解效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12894 2026-08-14 cs.CL 新提交 86%

BavGround: A Benchmark for Regional Cultural Grounding and Dialect Competence in Bavarian

BavGround:巴伐利亚区域文化接地与方言能力基准

Jophin John, Michael Hoffmann, Jan Fillies, Michael A. Hedderich, Barbara Plank

机构 * Stanford University(斯坦福大学) Freie Universität Berlin(柏林自由大学) Center for Information and Language Processing, LMU Munich(慕尼黑大学信息与语言处理中心) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Leibniz Supercomputing Centre (LRZ)(莱布尼茨超级计算中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 该研究推出BavGround基准,评估LLM的巴伐利亚区域文化接地与方言能力,发现多语言模型在巴伐利亚语及源接地问题上表现欠佳,且评估协议会显著影响结论。

详情

展开后加载摘要…

URL PDF HTML 收藏