DelayPTC-LLM: Metro Passenger Travel Choice Prediction under Train Delays with Large Language Models
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
Comments 15 pages,4 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
Comments 15 pages,4 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)
Comments TACL, pre-MIT Press publication version
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)
Comments 16 pages, Accepted at the 1st International Tutorial and Workshop on Responsible Knowledge Discovery in Education
EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架
机构 * Erciyes University(埃里切耶大学) ; Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。
Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2025 Oral. Project page: https://github.com/deep-symbolic-mathematics/llm-srbench , Benchmark page: https://huggingface.co/datasets/nnheui/llm-srbench
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Paper was accepted at R0-FoMo: Robustness of Few-shot and Zero-shot Learning in Foundation Models, NeurIPS-2023. Please find the links: accepted-papers?authuser=0" target="_blank" rel="noopener">https://sites.google.com/view/r0-fomo/accepted-papers?authuser=0 and https://neurips.cc/virtual/2023/workshop/66517
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to ACL 2023 (main conference); Project website: https://yuchenlin.xyz/LLM-Blender/ V3 update: fix a few typos and update a few citations; V2 update: The experiments on summarization, translation, and constrained generation tasks in the prior version have been moved to the appendix
从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者
机构 * Netflix(网飞公司)
专题命中 评测与基准 :LLM(title,summary_cn);prompting(title);large language model(abstract);language model(abstract)
AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。
基于大语言模型的因果智能体
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。
从价值到基准:评估用于荷兰政府场景的大型语言模型
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。
Comments Accepted at AIES 2026
MedUPS:利用大语言模型辅助罕见医疗病例的诊断
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)
AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。
Comments 13 pages, 6 figures
质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成
机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) ; School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) ; Southern University of Science and Technology(南方科技大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。
基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。
Comments 16 pages, 4 figures
面向可扩展的可靠自动化评估:基于大语言模型
机构 * KIT(卡尔斯鲁厄理工学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。
Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025
Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025
语言模型群体的智慧:语言模型集成中的聚合与污染
机构 * SND / CNRS / Sorbonne University(SND / 法国国家科学研究中心 / 索邦大学)
专题命中 评测与基准 :LLM(title,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG
AI总结 研究探讨大语言模型群体是否有群体智慧,通过让15个LLMs对254个二元预测市场问题进行概率估计,评估经典和学习型聚合方法,发现学习型聚合器表现优,训练截止污染影响结果,表明LLM群体有群体智慧效应,但可靠评估需无污染评估。
大型语言模型的红队框架:以忠实性评估为例
机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) ; Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) ; SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。
Comments Preprint submitted to SQJ
SAGE:面向自由形式问答的大语言模型的搜索增强评估
机构 * Dalhousie University(达尔豪斯大学) ; Emory University(埃默里大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 提出SAGE框架,通过主动检索和综合外部证据评估LLM输出的事实性,无需固定参考答案,在多个自由问答基准上实现与人类评估的高度一致。
绘制社会-物理人机交互(spHRI)的增长:由小型语言模型增强的系统综述流程
机构 * MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Case Western Reserve University(凯斯西储大学)
专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对社会-物理人机交互领域术语碎片化和方法不一致的问题,本文评估了小型语言模型(<1.5B参数)在标题和摘要筛选中的辅助能力,发现其虽未达到人类水平,但能快速筛选并发现人类遗漏的论文,表明SLM可增强而非取代专家评审。
Comments 5 pages, 3 figures, 2 tables, Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction
小型语言模型在阿拉伯语处理中的评估
机构 * Naseej Innovation Lab(纳赛伊创新实验室) ; Naseej for Technology(纳赛伊技术)
专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)
AI总结 本文评估了12种小型语言模型在阿拉伯语自然语言处理任务上的表现,构建了涵盖8个领域和10种语言技能的240项测试基准,发现模型大小并非决定因素,阿拉伯语对齐和指令遵循能力更关键。
大型语言模型值得模拟多少人意见?从不确定性量化角度出发
机构 * Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系) ; Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营分校) ; Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系及数据科学研究所)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文从不确定性量化角度出发,提出了一种框架,将LLM模拟的响应转换为人类响应总体参数的可靠置信集,通过量化人类-LLM不一致带来的不确定性。关键设计是模拟响应的数量:过多会导致置信集过窄且覆盖性差,过少则导致置信集过宽且信息不足。本文提出了一种数据驱动的方法,自适应选择模拟样本量以实现名义平均覆盖性,无论LLM的模拟保真度或置信集构建过程如何。所选样本量进一步反映了LLM能代表的有效人类人口规模,提供了其模拟保真度的定量度量。实验表明不同LLM和领域存在异质性模拟保真度。
Comments 63 pages, 13 figures
OpenCompass:大型语言模型的通用评估平台
机构 * OpenCompass Team(OpenCompass团队) ; Shanghai AI Laboratory(上海人工智能实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出OpenCompass,一个模块化、高兼容性、灵活且高并发的通用LLM评估平台,支持多种任务场景和主流基准数据集。
微调大型语言模型用于漏洞检测
机构 * Sber AI Lab(Sber AI实验室) ; Huawei Russian Research Institute(华为俄罗斯研究院) ; Satbayev University(萨特拜耶夫大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文通过微调WizardCoder模型,优化训练流程并处理类别不平衡,在漏洞检测任务上提升了ROC AUC和F1指标,展示了预训练LLM在源代码分析中的迁移学习潜力。
利用大语言模型和信息论量化天体物理方法的可重建性:光谱重建的案例研究
机构 * Department of Physics, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学物理系) ; Michigan Institute for Data and AI in Society, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学数据与人工智能在社会中的研究所) ; Independent Researcher, Taiwan(台湾独立研究员)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)
AI总结 提出信息论框架,通过大语言模型生成的概率分布和香农熵、JS散度,量化文本描述对算法重建的约束力,以海王星外天体光谱重建为例,发现文本虽能明确算法结构但无法消除实现级方差,存在“熵下限”,且LLM无法推断隐性专家知识。
Comments 26 pages, 6 figures, Accepted for publication in PASP
有限标注下的大语言模型选择
机构 * TU Delft(代尔夫特理工大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG
AI总结 提出SELECT-LLM框架,通过基于期望信息增益的查询选择规则,在有限标注下高效识别最佳大语言模型,显著降低标注成本。
Comments 33 pages, 5 figures, 4 tables
LLARS:促进领域专家与开发者协作的LLM提示、生成与评估系统
机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图恩-努尔堡技术大学乔治·西蒙·奥姆学院) ; Faculty of Computer Science, Centre for Artificial Intelligence (KIZ)(计算机科学学院,人工智能中心(KIZ)) ; Faculty of Social Sciences, Institute for E-Counselling(社会科学学院,电子咨询研究所)
专题命中 评测与基准 :LLM(title,title_cn);prompting(title);分类 cs.CL、cs.AI
AI总结 LLARS通过整合协同提示工程、批量生成和混合评估模块,为构建LLM系统提供端到端流程,提升跨学科协作效率与准确性。
Comments Accepted at IJCAI-ECAI 2026 Demonstrations Track. Demo video: https://youtu.be/3QaKouwr4gU
CFDLLMBench: 一个用于评估大型语言模型在计算流体力学中的性能的基准套件
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; University of California, San Diego(加州大学圣地亚哥分校) ; National Laboratory of the Rockies(落基山国家实验室) ; Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出CFDLLMBench,通过三个互补组件评估LLM在计算流体力学中的能力,包括CFDQuery、CFDCodeBench和FoamBench,旨在测试LLM在流体力学知识、数值与物理推理以及上下文依赖的实现能力。
Comments 40 pages
Journal ref Journal of Data-Centric Machine Learning Research, 2026
用于市场研究的大型语言模型:一种数据增强方法
机构 * Naveen Jindal School of Management, The University of Texas at Dallas(内维恩·金达管理学院,德克萨斯大学达拉斯分校) ; Olin School of Business, Washington University in St. Louis(奥林商学院,圣路易斯华盛顿大学) ; W. P. Carey School of Business, Arizona State University(W.P.凯里商学院,亚利桑那州立大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种数据增强方法,结合LLM生成数据与真实数据,提升市场研究中联合分析的统计稳健性,减少误差并降低成本。
机构 * Northeastern University, China(东北大学) ; Alibaba Group, Hangzhou, China(阿里巴巴集团)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,comments);LLM(abstract)
Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF