arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2607.15414 2026-07-20 cs.LG cs.AI q-fin.CP 新提交 88%

AI Trading: Evaluating Large Language Models for Technical Market Analysis

人工智能交易:评估用于技术市场分析的大语言模型

Geofrey Ntale

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文系统比较评估五个大语言模型用于技术市场分析的能力,涵盖四项任务,采用多种定量指标。实验发现GPT-4 Turbo在通用模型中年化回报和夏普比率最高,FinGPT经领域微调表现出色,二者均超标准普尔500指数基准,还识别出模型存在的问题及得出相关结论。

Comments Master's research paper, Georgia Institute of Technology. 31 pages, 4 figures

Journal ref Georgia Institute of Technology, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09653 2026-07-17 cs.CL cs.AI 88%

The Heap: A Contamination-Free Multilingual Code Dataset for Evaluating Large Language Models

The Heap:一个无污染的多语言代码数据集,用于评估大型语言模型

Jonathan Katzy, Razvan Mihai Popescu, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 The Heap是一个无污染的多语言代码数据集,用于公平评估大型语言模型,覆盖57种编程语言并去重以减少数据清洗需求。

Comments Camera-ready. Accepted to FORGE 2025 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11059 2026-07-14 cs.SE cs.AI cs.CL 版本更新 88%

SWE-MERA: A Dynamic Benchmark for Agenticly Evaluating Large Language Models on Software Engineering Tasks

SWE-MERA:一种用于在软件工程任务中对大型语言模型进行代理评估的动态基准测试

Pavel Adamenko, Mikhail Ivanov, Aidar Valeev, Rodion Levichev, Pavel Zadorozhny, Ivan Lopatin, Dmitry Babaev, Alena Fenogenova, Valentin Malykh

机构 * GigaCode ITMO University(ITMO大学) MWS AI(MWS人工智能) IITU university(IITU大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有软件工程基准测试局限性,提出SWE-MERA动态基准测试,通过自动收集GitHub问题及严格验证确保质量,最小化污染风险,利用Aider编码代理评估多个大型语言模型,展示了其强大区分能力及模型性能表现。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06940 2026-07-09 cs.CL cs.AI 新提交 88%

Comprehensive Evaluation of Large Language Model Responses: A Multi-Factor Scoring System

大语言模型回答的综合评估:一种多因素评分系统

Yiming Gai, Junde Lu, Xuefei Huang

机构 * School of Computer Science and Engineering, Beihang University, Beijing, China(北京航空航天大学计算机科学与工程学院) Data Science and Intelligent Computing Laboratory, Hangzhou International Innovation Institute, Beihang University, Hangzhou, Zhejiang(北京航空航天大学杭州国际创新研究院数据科学与智能计算实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型回答质量评估,提出多因素评分范式,融合准确性等多方面因素,通过图形用户界面可视化结果,在TruthfulQA数据集上评估揭示模型优缺点,为知识工程和模型优化提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19185 2026-07-07 cs.CL cs.AI 88%

SCURank: Ranking Multiple Candidate Summaries with Summary Content Units for Enhanced Summarization

SCURank: 基于摘要内容单元的多候选摘要排序以提升摘要生成

Bo-Jyun Wang, Ying-Jia Lin, Hung-Yu Kao

机构 * Department of Computer Science and Information Engineering, National Cheng Kung University(国立成功大学计算机科学与资讯工程系) Artificial Intelligence Research Center, Chang Gung University(长庚大学人工智能研究中心) Department of Artificial Intelligence, Chang Gung University(长庚大学人工智能系) Department of Computer Science, National Tsing Hua University(国立清华大学计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 SCURank通过摘要内容单元提升摘要生成,优于传统指标和LLM排序方法,验证了信息导向排序在多LLM蒸馏中的优势。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01548 2026-07-03 cs.LG cs.AI 新提交 88%

Evolutionary Feature Engineering for Structured Data

结构化数据的进化特征工程

Ege Onur Taga, Yilin Zhuang, M. Emrullah Ildiz, Petros Mol, Abhimanyu Das, Karthik Duraisamy, Samet Oymak

机构 * University of Michigan(密歇根大学) Google Research(谷歌研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出基于LLM进化的特征工程框架EFE,通过Python程序表示变换,利用数据集上下文和验证集性能反馈优化,在时间序列和表格预测任务中提升准确性和可解释性。

Comments 9 page main content, 41 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29228 2026-07-02 cs.CL cs.LG 版本更新 88%

Understanding Evaluation Illusion in Diffusion Large Language Models

理解扩散大语言模型中的评估幻觉

Hengxiang Zhang, Jiaxi Ren, Renchunzi Xie, Hongxin Wei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 发现扩散大语言模型的解码方法排名对提示模板高度敏感,单模板评估会产生性能无损失的幻觉,实际并行解码方法无法突破速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02471 2026-06-25 cs.CL 88%

Hengqin-RA-v1: Advanced Large Language Model for Diagnosis and Treatment of Rheumatoid Arthritis with Dataset based Traditional Chinese Medicine

Hengqin-RA-v1: 针对类风湿性关节炎诊断与治疗的先进大语言模型基于传统中医数据集

Yishen Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Hengqin-RA-v1,专为中医诊断和治疗类风湿性关节炎设计,结合古籍和现代文献构建的RA数据集,实验显示其性能超越现有模型,甚至在某些情况下超越中医专家。

Comments arXiv admin note: This paper has been withdrawn by arXiv due to unverifiable authorship and affiliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10971 2026-06-24 cs.CL cs.AI 版本更新 88%

Rule2Text: A Framework for Generating and Evaluating Natural Language Explanations of Knowledge Graph Rules

Rule2Text:知识图谱规则的自然语言解释生成与评估框架

Nasim Shirvani-Mahdavi, Chengkai Li

机构 * University of Texas at Arlington(德克萨斯理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出Rule2Text框架,利用大语言模型将知识图谱挖掘的逻辑规则转化为自然语言解释,通过人类评估和LLM-as-a-judge验证,微调开源模型显著提升解释质量。

Comments arXiv admin note: text overlap with arXiv:2507.23740

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19788 2026-06-19 cs.AI cs.CL 新提交 88%

CombEval: A Framework for Evaluating Combinatorial Counting in Large Language Models

CombEval:评估大语言模型中组合计数的框架

Yuxu Zhou, Ondřej Kuželka, Yuyi Wang, Yuanhong Wang, Yi Chang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Czech Technical University in Prague(捷克布拉格理工大学) CRRC Zhuzhou Institute(中车株洲研究所) Tengen Intelligence Institute(天元智能研究院) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出CombEval动态基准,通过类型化Cofola规范生成组合计数问题,评估11个大语言模型在直接和代码增强设置下的表现,发现模型在有序对象、不可区分元素、相对位置约束和嵌套对象依赖上存在脆弱性。

Comments under review. Code: https://github.com/YuxuZhou-CN/combination-problem-generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04306 2026-06-19 cs.CL cs.AI 版本更新 88%

DeFrame: Debiasing Large Language Models Against Framing Effects

DeFrame: 消除大语言模型中的框架效应偏差

Kahee Lim, Soyeon Kim, Steven Euijong Whang

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型在语义等价但不同表述的提示下产生不一致偏见的问题,提出框架感知的去偏方法,通过量化框架差异并增强跨框架一致性,有效降低整体偏见并提升鲁棒性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17474 2026-06-17 cs.CL cs.AI 新提交 88%

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估

Jiahui Niu, Huizi Yu, Wenkong Wang, Guangxin Dai, Jingxian He, Xiang Li, Zhiying Liang, Xinxin Lin, Kent CY So, Bryan YP Yan, Yun Kwok Wing, Yanqiu Xing, Xin Ma, Lizhou Fan

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学) Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学) Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院) Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学) Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学) Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出AIPatient Arena框架,通过电子健康记录构建患者知识图谱,在多轮医患交互中评估大语言模型的八项临床能力,发现模型在信息覆盖、诊断推理等方面存在不足,强调过程评估的重要性。

Comments 49 pages, 12 figues, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15792 2026-06-17 cs.CY cs.AI cs.CL 版本更新 88%

A Multifaceted Analysis of Social Biases in Large Language Models

大型语言模型中偏见的系统分析

Xulang Zhang, Rui Mao, Erik Cambria

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文系统分析了四种广泛使用的大型语言模型在政治、意识形态、联盟、语言和性别等维度上的偏见,通过多项实验揭示了模型在中立性、意识形态倾向、地缘政治倾向、多语言故事完成中的偏见以及性别倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16240 2026-06-16 cs.CL cs.LG 新提交 88%

Creative Collision: Directorial Persona Steering and Competition in Large Language Models

创意碰撞:大型语言模型中的导演人格引导与竞争

Subramanyam Sahoo, Justin Shenk

机构 * AI Safety Camp(AI安全训练营)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究通过叠加两种语义相反的导演人格向量(斯皮尔伯格与斯科塞斯)来引导语言模型生成,发现斯皮尔伯格向量主导道德倾向,中间点提升连贯性,且两者在特定层共享道德基调基底。

Comments Accepted at ICML 2026 Workshop on Human-AI Co-Creativity

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19225 2026-06-11 cs.CE cs.AI cs.CL cs.IR q-fin.CP 版本更新 88%

FinTradeBench: A Financial Reasoning Benchmark for LLMs

FinTradeBench: 面向LLM的金融推理基准

Yogesh Agrawal, Aniruddha Dutta, Md Mahadi Hasan, Santu Karmaker, Aritra Dutta

机构 * University of Central Florida(佛罗里达中央大学)

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出FinTradeBench基准,通过结合公司基本面与交易信号,评估大语言模型在金融推理中的表现,发现检索增强对数值和时间序列推理帮助有限。

Comments 9 pages main text, 31 pages total (including references and appendix). 5 figures, 16 tables. Preprint under review. Code and data will be made available upon publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07532 2026-06-10 cs.CL cs.AI 版本更新 88%

Durable Evaluation Framework: Adversarial Arbitration for Sycophancy Reduction in Large Language Models

原则性智能体辩论:针对大型语言模型谄媚减少的对抗性仲裁

Sam Ryan

机构 * Novel Systems Engineering LLC(新型系统工程有限公司)

专题命中 评测与基准 :large language model(title);language model(title);RLHF(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出原则性智能体辩论(PAD)多智能体架构,通过仲裁两个对立倾向的模型并盲评其论点,在SycophancyEval上显著降低谄媚偏差,最佳变体准确率达48.5%。

Comments 25 pages, 3 figures. Code and data available at github.com/NovelSystems/CANDOR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08381 2026-06-09 cs.CL cs.AI 新提交 88%

Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard

审计大型语言模型中的专有对齐:一种无需真实标准的比较框架

Alireza Arbabi, Florian Kerschbaum

机构 * University of Waterloo(滑铁卢大学) Vector Institute(向量研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种统计框架,通过比较目标模型与基线模型在共享语义空间中的响应偏差,检测黑盒语言模型中的专有对齐行为,无需真实标准即可实现外部审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07696 2026-06-09 cs.LG cs.AI 新提交 88%

Adversarial Robustness of Activation Steering in Large Language Models

大型语言模型中激活引导的对抗鲁棒性

Kien Le, Thai Le

机构 * Independent Researcher(独立研究员) Indiana University(印第安纳大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究激活引导在对抗性文本扰动下的鲁棒性,发现所有方法、模型和设置中方向鲁棒性下降高达64%,置信度崩溃,层选择脆弱,揭示其结构性脆弱性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03160 2026-06-08 cs.AI cs.CL 版本更新 88%

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

VALUEFLOW:迈向大语言模型中多元化和可引导的基于价值的对齐

Woojin Kim, Sieun Hyeon, Jusang Oh, Jaeyoung Do

机构 * Department of Electrical and Computer Engineering, Seoul National University(首尔国立大学电气与计算机工程系) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能交叉学科项目)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出VALUEFLOW框架,通过分层价值嵌入、强度标注数据库和锚定评估器,实现大语言模型在价值强度上的可控对齐,解决现有方法在提取、评估和引导方面的不足。

Comments Accepted in ICML 2026 (Oral). Code available at https://github.com/AIDASLab/VALUEFLOW

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05486 2026-06-05 cs.CL cs.LG 88%

Localizing Prompt Ambiguity in Large Language Models with Probe-Targeted Attribution

通过探针目标归因定位大型语言模型中的提示歧义

Govind Ramesh, Yao Dou, Wei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出PRIG方法,利用线性探针和梯度归因,通过中间表示而非输出层定位提示中的歧义位置,在合成和人工基准上取得高AUROC。

Comments 23 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03057 2026-06-03 cs.LG cs.AI 88%

Rethinking Molecular Text Representations for LLMs: An Empirical Study

重新思考用于大语言模型的分子文本表示:一项实证研究

Arun Raja, Garrett M. Morris, Kian Ming A. Chai

机构 * University of Oxford(牛津大学) DSO National Laboratories(DSO国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过系统基准测试,评估了9种分子表示和8种化学任务下16个LLM的性能,发现表示选择强烈影响结果,结构化文本表示(CML、MolJSON)在结构任务中占优,IUPAC在语义任务中占优,而SMILES很少最优。

Comments 25 pages, 11 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02111 2026-06-02 cs.CV cs.AI cs.CL 88%

Jailbreaking Multimodal Large Language Models using Multi-Clip Video

使用多片段视频破解多模态大语言模型

Choongwon Kang, Seungjong Sun, Hyunmin Jun, Jang Hyun Kim

机构 * Department of Applied Artificial Intelligence, Sungkyunkwan University(应用人工智能系,成均馆大学) Department of Human-Artificial Intelligence Interaction, Sungkyunkwan University(人机交互系,成均馆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MCV SafetyBench数据集,通过多片段视频评估多模态大语言模型的安全漏洞,发现视频模态比图像更脆弱,动态和多样化上下文增加攻击成功率,并基于图像模态的鲁棒性提出防御策略。

Comments 27 pages, 20 figures, Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01845 2026-06-02 cs.CL cs.AI 88%

Unveiling the Limits of Large Language Models in Inferring Pragmatic Meaning from Non-Verbal Responses

揭示大型语言模型在推断非语言回应中的语用意义的局限性

Sugyeong Eo, Heuiseok Lim

机构 * Department of Software, Yonsei University Mirae Campus(燕山大学软件系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究首次系统评估大型语言模型(LLMs)从纯非语言回应对话中推断语用意义的能力,发现其准确率相比语言回应下降高达60%,并表明上下文学习有助于语用推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24069 2026-06-02 cs.LG cs.AI 88%

Can LLMs Reason Structurally? Benchmarking via the Lens of Data Structures

LLM 能否进行结构性推理?通过数据结构视角进行基准测试

Yu He, Yingxi Li, Colin White, Ellen Vitercik

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 DSR-Bench 基准,通过 20 种数据结构、35 种操作和 4140 个问题实例评估 LLM 的结构性推理能力,发现顶级模型在挑战性实例上仅得 0.46/1,且在空间数据、上下文丰富场景及自身代码推理上表现不佳。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 88%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04661 2026-06-01 cs.CL cs.AI 88%

Beyond Memorization: Assessing Semantic Generalization in Large Language Models Using Phrasal Constructions

超越记忆:使用短语结构评估大型语言模型中的语义泛化

Wesley Scivetti, Melissa Torgbi, Austin Blodgett, Mollie Shichman, Taylor Hudson, Claire Bonial, Harish Tayyar Madabushi

机构 * Georgetown University(乔治城大学) University of Bath(巴斯大学) DEVCOM U.S. Army Research Laboratory(美国陆军研究实验室) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);pretraining(abstract)

AI总结 通过构式语法构建诊断评估,测试大型语言模型在低频但人类易理解的短语结构上的语义理解与泛化能力,发现模型在句法相同但语义不同的构式上性能下降超40%。

Comments Camera Ready: AACL-IJCNLP (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29357 2026-05-29 cs.AI cs.LG cs.PL 88%

PassNet: Scaling Large Language Models for Graph Compiler Pass Generation

PassNet: 为图编译器通生成扩展大型语言模型

Yiqun Liu, Yingsheng Wu, Ruqi Yang, Enrong Zheng, Honglei Qiu, Sijun He, Tai Liang, Jingjing Wu, Yuhan Zhou, Yiwei Zhang, Dongyan Chen, Weihan Yi, Xinqi Li, Siqi Bao

机构 * Baidu, Inc.(百度公司)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对编译器默认优化在长尾子图上性能不佳的问题,提出PassNet生态系统,包含大规模数据集和基准测试,通过微调小模型在少量轨迹上即可接近前沿模型性能。

Comments Code and data available at https://github.com/PaddlePaddle/PassNet

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27805 2026-05-28 cs.CL cs.AI 88%

ChildEval: When large language models meet children's personalities

ChildEval:当大语言模型遇到儿童个性

Yanyan Luo, Xue Han, Chunxu Zhao, Ruiqiao Bai, Yaxing Zhang, Qian Hu, Lijun Mei, Junlan Feng

机构 * JIUTIAN Research(九天研究院) China Mobile(中国移动) Beijing, China(北京,中国)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出ChildEval基准,通过合成3-6岁儿童个性档案和偏好(显式或隐式表达),评估大语言模型在长对话中推断并遵循儿童偏好的能力,实验表明微调可提升儿童中心性能。

Comments 8 pages of main text (ACL Findings format), with references and appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25601 2026-05-26 cs.CL cs.AI 88%

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

面向大语言模型可控模拟不完美学生的基准

Alexander Apartsin, Omri Sason, Yehudit Aperstein

机构 * Holon Institute of Technology(霍隆理工学院) Afeka Tel Aviv Academic College of Engineering(阿法卡特拉维夫工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一个基准框架,通过提示控制语言模型模拟具有指定技能轮廓的学生,并评估其可控性,为教师教育中的刻意练习提供支持。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22769 2026-05-26 cs.CL cs.AI 88%

Understanding Data Temporality Impact on Large Language Models Pre-training

理解数据时间性对大型语言模型预训练的影响

Hippolyte Pilchen, Romain Fabre, Franck Signe Talla, Patrick Perez, Edouard Grave

机构 * Kyutai

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究预训练数据顺序对大型语言模型获取时间敏感事实知识的影响,通过构建包含7000多个时间相关问题的基准并训练60亿参数模型,发现按时间顺序训练比随机打乱训练能产生更及时和精确的知识。

详情

展开后加载摘要…

URL PDF HTML 收藏