arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31748 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31748 篇

2410.00052 2024-10-02 cs.LG 92%

DelayPTC-LLM: Metro Passenger Travel Choice Prediction under Train Delays with Large Language Models

Chen Chen, Yuxin He, Hao Wang, Jingjing Chen, Qin Luo

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 15 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13769 2024-05-24 cs.CL 92%

Do Language Models Enjoy Their Own Stories? Prompting Large Language Models for Automatic Story Evaluation

Cyril Chhun, Fabian M. Suchanek, Chloé Clavel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments TACL, pre-MIT Press publication version

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02003 2024-03-22 cs.CR cs.AI 92%

A Survey on Large Language Model (LLM) Security and Privacy: The Good, the Bad, and the Ugly

Yifan Yao, Jinhao Duan, Kaidi Xu, Yuanfang Cai, Zhibo Sun, Yue Zhang

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13733 2024-03-08 cs.CL 92%

Enhancing Large Language Models Against Inductive Instructions with Dual-critique Prompting

Rui Wang, Hongru Wang, Fei Mi, Yi Chen, Boyang Xue, Kam-Fai Wong, Ruifeng Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.16338 2023-08-01 cs.CL 92%

Distractor generation for multiple-choice questions with predictive prompting and large language models

Semere Kiros Bitew, Johannes Deleu, Chris Develder, Thomas Demeester

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract)

Comments 16 pages, Accepted at the 1st International Tutorial and Workshop on Responsible Knowledge Discovery in Education

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30219 2026-08-03 cs.AI cs.CL cs.LG cs.SE 版本更新 92%

EvalSafetyGap: A Hybrid Survey and Conceptual Framework for LLM Evaluation-Safety Failures

EvalSafetyGap:LLM评估-安全失败的混合调查与概念框架

Buğra Alperen Uluırmak, Rifat Kurban

机构 * Erciyes University(埃里切耶大学) Abdullah Gül University(阿卜杜勒拉赫曼·古尔大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM评估与AI安全中基准分数与潜在属性不一致的测量问题,提出混合调查与概念框架,并通过十模型审计揭示能力与鲁棒性关联不显著、安全差距主要由治理因素驱动。

Comments 74 pages, 2 figures, 4 tables. Hybrid systematic survey and conceptual framework on LLM evaluation and AI-safety failures, synthesizing 373 primary studies (2018-2026). Introduces the EvalSafetyGap framework (Instability Decomposition, Alignment Trilemma) and reports an exploratory ten-model audit. Submitted as a review/survey article; not currently under consideration elsewhere

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10415 2025-06-10 cs.CL cs.AI cs.LG 92%

LLM-SRBench: A New Benchmark for Scientific Equation Discovery with Large Language Models

Parshin Shojaee, Ngoc-Hieu Nguyen, Kazem Meidani, Amir Barati Farimani, Khoa D Doan, Chandan K Reddy

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2025 Oral. Project page: https://github.com/deep-symbolic-mathematics/llm-srbench , Benchmark page: https://huggingface.co/datasets/nnheui/llm-srbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.11866 2024-08-23 cs.CL cs.AI cs.LG q-bio.BM 92%

Crossing New Frontiers: Knowledge-Augmented Large Language Model Prompting for Zero-Shot Text-Based De Novo Molecule Design

Sakhinana Sagar Srinivas, Venkataramana Runkana

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Paper was accepted at R0-FoMo: Robustness of Few-shot and Zero-shot Learning in Foundation Models, NeurIPS-2023. Please find the links: accepted-papers?authuser=0" target="_blank" rel="noopener">https://sites.google.com/view/r0-fomo/accepted-papers?authuser=0 and https://neurips.cc/virtual/2023/workshop/66517

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.02561 2023-07-04 cs.CL cs.AI cs.LG 92%

LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion

Dongfu Jiang, Xiang Ren, Bill Yuchen Lin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL 2023 (main conference); Project website: https://yuchenlin.xyz/LLM-Blender/ V3 update: fix a few typos and update a few citations; V2 update: The experiments on summarization, translation, and constrained generation tasks in the prior version have been moved to the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 92%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 评测与基准 :LLM(title,summary_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06849 2026-08-13 cs.AI cs.CL 版本更新 92%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09925 2026-08-11 cs.CL cs.AI 新提交 92%

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

从价值到基准:评估用于荷兰政府场景的大型语言模型

Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01012 2026-08-04 cs.CL cs.AI 新提交 92%

MedUPS: Towards Diagnostic Assistance in Uncommon Medical Cases with Large Language Models

MedUPS:利用大语言模型辅助罕见医疗病例的诊断

Ofir Ben Shoham, Oriel Perets, Nir Grinberg, Nadav Rappoport

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn)

AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07121 2026-08-04 cs.LG cs.AI cs.NE 版本更新 92%

Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models

质量-多样性红队测试:针对大语言模型的高质量多样化攻击者自动生成

Ren-Jian Wang, Ke Xue, Zeyu Qin, Ziniu Li, Sheng Tang, Hao-Tian Li, Shengcai Liu, Zhi Yu, Yuanpeng Tan, Chao Qian

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家实验室,南京大学) School of Artificial Intelligence, Nanjing University(人工智能学院,南京大学) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong, Shenzhen(香港大学深圳校区) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QDRT框架,通过训练多专用攻击者生成高质量多样化攻击,提升LLM安全评估的多样性与有效性,支持LLM负责任部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29064 2026-08-03 cs.LG cs.AI 新提交 92%

Benchmarking Frontier Large Language Models Against Official Crash Database Coding Using Police Crash Narratives

基于警方事故叙述文本,对比前沿大语言模型与官方事故数据库编码的基准测试

Sudhir Bharati, Rajendra K C Khatri, Sudip Bharati

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究以阿肯色州2015-2025年的致命事故数据为对象,对比6种前沿大语言模型与官方事故数据库的编码效果,为事故编码领域的LLM应用提供了基准评估依据。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28282 2026-07-31 cs.CL cs.LG 新提交 92%

(Towards) Scalable Reliable Automated Evaluation with Large Language Models

面向可扩展的可靠自动化评估:基于大语言模型

Bertil Braun, Martin Forell

机构 * KIT(卡尔斯鲁厄理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究提出一种基于多LLM两两比较与Elo评分的自动化评估框架,可近似专家评估,减少人工干预,实现对LLM输出的高效可靠评估。

Comments 17 pages. Published in the Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2) at ACL 2025

Journal ref Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM2), pages 320-336, Association for Computational Linguistics, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18269 2026-07-24 cs.AI cs.LG 版本更新 92%

Wisdom of LLM Crowds: Aggregation and Contamination in Language Model Ensembles

语言模型群体的智慧:语言模型集成中的聚合与污染

Igor Douven

机构 * SND / CNRS / Sorbonne University(SND / 法国国家科学研究中心 / 索邦大学)

专题命中 评测与基准 :LLM(title,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨大语言模型群体是否有群体智慧,通过让15个LLMs对254个二元预测市场问题进行概率估计,评估经典和学习型聚合方法,发现学习型聚合器表现优,训练截止污染影响结果,表明LLM群体有群体智慧效应,但可靠评估需无污染评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25476 2026-07-22 cs.CL cs.AI 版本更新 92%

A Red Teaming Framework for Large Language Models: A Case Study on Faithfulness Evaluation

大型语言模型的红队框架:以忠实性评估为例

Abrar Alotaibi, Raed Mughus, Moataz Ahmed

机构 * King Fahd University of Petroleum & Minerals(法赫德国王石油矿产大学) Imam Abdulrahman Bin Faisal University(伊玛目阿卜杜勒拉赫曼·本·费萨尔大学) SDAIA-KFUPM Joint Research Center for Artificial Intelligence(沙特数据与人工智能局-法赫德国王石油矿产大学人工智能联合研究中心)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种多角色红队框架,通过攻击者和陪审模型暴露LLM的不忠实问题,在问答任务中攻击成功率提升7.9%,并揭示结构约束和架构设计对安全性的影响。

Comments Preprint submitted to SQJ

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07385 2026-07-01 cs.CL cs.AI 版本更新 92%

SAGE: A Search-AuGmented Evaluation of Large Language Models on Free-Form QA

SAGE:面向自由形式问答的大语言模型的搜索增强评估

Sher Badshah, Ali Emami, Hassan Sajjad

机构 * Dalhousie University(达尔豪斯大学) Emory University(埃默里大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出SAGE框架,通过主动检索和综合外部证据评估LLM输出的事实性,无需固定参考答案,在多个自由问答基准上实现与人类评估的高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26382 2026-06-26 cs.CL cs.AI cs.DL cs.HC cs.RO 新提交 92%

Charting the Growth of Social-Physical HRI (spHRI): A Systematic Review Pipeline Augmented by Small Language Models

绘制社会-物理人机交互(spHRI)的增长:由小型语言模型增强的系统综述流程

Mayumi Mohan, Ju-Hung Chen, Alexis E. Block

机构 * MPI for Intelligent Systems(马克斯·普朗克智能系统研究所) Case Western Reserve University(凯斯西储大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对社会-物理人机交互领域术语碎片化和方法不一致的问题,本文评估了小型语言模型(<1.5B参数)在标题和摘要筛选中的辅助能力,发现其虽未达到人类水平,但能快速筛选并发现人类遗漏的论文,表明SLM可增强而非取代专家评审。

Comments 5 pages, 3 figures, 2 tables, Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21460 2026-06-23 cs.CL cs.AI 新提交 92%

Evaluation of Small Language Models for Arabic Language Processing

小型语言模型在阿拉伯语处理中的评估

Jumana Alsubhi, Ahmed Alhusayni, Abdulrahman Gharawi, Israa Hamdine, Alshaymaa Allahim, Lamees Alhumaid, Ahmad Shabana, Rafik Madani

机构 * Naseej Innovation Lab(纳赛伊创新实验室) Naseej for Technology(纳赛伊技术)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn)

AI总结 本文评估了12种小型语言模型在阿拉伯语自然语言处理任务上的表现,构建了涵盖8个领域和10种语言技能的240项测试基准,发现模型大小并非决定因素,阿拉伯语对齐和指令遵循能力更关键。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17773 2026-06-17 stat.ME cs.AI cs.LG 92%

How Many Human Survey Respondents is a Large Language Model Worth? An Uncertainty Quantification Perspective

大型语言模型值得模拟多少人意见?从不确定性量化角度出发

Chengpiao Huang, Yuhang Wu, Kaizheng Wang

机构 * Department of IEOR, Columbia University(哥伦比亚大学工业工程与运筹学系) Decision, Risk, and Operations Division, Columbia Business School(哥伦比亚商学院决策、风险与运营分校) Department of IEOR and Data Science Institute, Columbia University(哥伦比亚大学工业工程与运筹学系及数据科学研究所)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文从不确定性量化角度出发,提出了一种框架,将LLM模拟的响应转换为人类响应总体参数的可靠置信集,通过量化人类-LLM不一致带来的不确定性。关键设计是模拟响应的数量:过多会导致置信集过窄且覆盖性差,过少则导致置信集过宽且信息不足。本文提出了一种数据驱动的方法,自适应选择模拟样本量以实现名义平均覆盖性,无论LLM的模拟保真度或置信集构建过程如何。所选样本量进一步反映了LLM能代表的有效人类人口规模,提供了其模拟保真度的定量度量。实验表明不同LLM和领域存在异质性模拟保真度。

Comments 63 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19276 2026-06-09 cs.CL cs.LG 版本更新 92%

OpenCompass: A Universal Evaluation Platform for Large Language Models

OpenCompass:大型语言模型的通用评估平台

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Zhiwei Fei, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi Lyu, Han Lyu, Ningsheng Ma, Zerun Ma, Yu Sun, Zhiyong Wu, Linchen Xiao, Zhuozhi Xiong, Jun Xu, Haochen Ye, Zhaohui Yu, Yike Yuan, Songyang Zhang, Yufeng Zhao, Fengzhe Zhou, Peiheng Zhou, Dongsheng Zhu, Lin Zhu, Jingming Zhuo

机构 * OpenCompass Team(OpenCompass团队) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出OpenCompass,一个模块化、高兼容性、灵活且高并发的通用LLM评估平台,支持多种任务场景和主流基准数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17010 2026-06-02 cs.CR cs.AI cs.LG 92%

Finetuning Large Language Models for Vulnerability Detection

微调大型语言模型用于漏洞检测

Alexey Shestov, Rodion Levichev, Ravil Mussabayev, Evgeny Maslov, Anton Cheshkov, Pavel Zadorozhny

机构 * Sber AI Lab(Sber AI实验室) Huawei Russian Research Institute(华为俄罗斯研究院) Satbayev University(萨特拜耶夫大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文通过微调WizardCoder模型,优化训练流程并处理类别不平衡,在漏洞检测任务上提升了ROC AUC和F1指标,展示了预训练LLM在源代码分析中的迁移学习潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11154 2026-05-28 astro-ph.IM cs.AI cs.LG 92%

Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

利用大语言模型和信息论量化天体物理方法的可重建性:光谱重建的案例研究

Hsing Wen Lin, Zong-Fu Sie

机构 * Department of Physics, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学物理系) Michigan Institute for Data and AI in Society, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学数据与人工智能在社会中的研究所) Independent Researcher, Taiwan(台湾独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 提出信息论框架,通过大语言模型生成的概率分布和香农熵、JS散度,量化文本描述对算法重建的约束力,以海王星外天体光谱重建为例,发现文本虽能明确算法结构但无法消除实现级方差,存在“熵下限”,且LLM无法推断隐性专家知识。

Comments 26 pages, 6 figures, Accepted for publication in PASP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24981 2026-05-26 cs.CL cs.LG 92%

Large Language Model Selection with Limited Annotations

有限标注下的大语言模型选择

Yavuz Durmazkeser, Patrik Okanovic, Andreas Kirsch, Torsten Hoefler, Nezihe Merve Gürel

机构 * TU Delft(代尔夫特理工大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出SELECT-LLM框架,通过基于期望信息增益的查询选择规则,在有限标注下高效识别最佳大语言模型,显著降低标注成本。

Comments 33 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10593 2026-05-12 cs.AI cs.CL cs.HC cs.SE 92%

LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation

LLARS:促进领域专家与开发者协作的LLM提示、生成与评估系统

Philipp Steigerwald, Mara Stieler, Jennifer Burghardt, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图恩-努尔堡技术大学乔治·西蒙·奥姆学院) Faculty of Computer Science, Centre for Artificial Intelligence (KIZ)(计算机科学学院,人工智能中心(KIZ)) Faculty of Social Sciences, Institute for E-Counselling(社会科学学院,电子咨询研究所)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);分类 cs.CL、cs.AI

AI总结 LLARS通过整合协同提示工程、批量生成和混合评估模块,为构建LLM系统提供端到端流程,提升跨学科协作效率与准确性。

Comments Accepted at IJCAI-ECAI 2026 Demonstrations Track. Demo video: https://youtu.be/3QaKouwr4gU

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20374 2026-04-28 cs.CL cs.AI 92%

CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics

CFDLLMBench: 一个用于评估大型语言模型在计算流体力学中的性能的基准套件

Nithin Somasekharan, Ling Yue, Yadi Cao, Weichao Li, Patrick Emami, Pochinapeddi Sai Bhargav, Anurag Acharya, Xingyu Xie, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of California, San Diego(加州大学圣地亚哥分校) National Laboratory of the Rockies(落基山国家实验室) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFDLLMBench,通过三个互补组件评估LLM在计算流体力学中的能力,包括CFDQuery、CFDCodeBench和FoamBench,旨在测试LLM在流体力学知识、数值与物理推理以及上下文依赖的实现能力。

Comments 40 pages

Journal ref Journal of Data-Centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19363 2026-04-20 cs.AI cs.LG stat.ME stat.ML 92%

Large Language Models for Market Research: A Data-augmentation Approach

用于市场研究的大型语言模型:一种数据增强方法

Mengxin Wang, Dennis J. Zhang, Heng Zhang

机构 * Naveen Jindal School of Management, The University of Texas at Dallas(内维恩·金达管理学院,德克萨斯大学达拉斯分校) Olin School of Business, Washington University in St. Louis(奥林商学院,圣路易斯华盛顿大学) W. P. Carey School of Business, Arizona State University(W.P.凯里商学院,亚利桑那州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种数据增强方法,结合LLM生成数据与真实数据,提升市场研究中联合分析的统计稳健性,减少误差并降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04638 2025-09-09 cs.CL cs.CY 92%

Affective Computing in the Era of Large Language Models: A Survey from the NLP Perspective

Yiqun Zhang, Xiaocui Yang, Xingle Xu, Zeran Gao, Yijie Huang, Shiyi Mu, Shi Feng, Daling Wang, Yifei Zhang, Kaisong Song, Ge Yu

机构 * Northeastern University, China(东北大学) Alibaba Group, Hangzhou, China(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract,comments);LLM(abstract)

Comments Compared with the previous version, reinforcement learning has been added (as a new section), including RLHF, RLVR, and RLAIF

详情

展开后加载摘要…

URL PDF HTML 收藏