arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31748 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31748 篇

2508.15478 2025-09-05 cs.CL cs.CY cs.PF 92%

SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts--Extended Version

Nghiem Thanh Pham, Tung Kieu, Duc-Manh Nguyen, Son Ha Xuan, Nghia Duong-Trung, Danh Le-Phuoc

机构 * FPT University(FPT大学) Aalborg University(奥尔堡大学) Technische Universität Berlin(柏林技术大学) RMIT University(皇家理工大学) German Research Center for Artificial Intelligence(德国人工智能研究中心) HiveIntel GmbH(HiveIntel公司)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);SLM(title,abstract);分类 cs.CL

Comments 24 pages. An extended version of "SLM-Bench: A Comprehensive Benchmark of Small Language Models on Environmental Impacts" accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31371 2026-07-01 cs.LG cs.AI cs.CL 新提交 92%

Calibrating the Evaluator: Does Probability Calibration Mitigate Preference Coupling in LLM Agent Feedback Loops?

校准评估器:概率校准能否缓解LLM智能体反馈回路中的偏好耦合?

Zewen Liu

机构 * Qilu Institute of Technology, School of Software Engineering(齐鲁理工学院软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过概率校准评估器的成对判断来缓解LLM智能体反馈回路中的偏好耦合,实验表明校准将耦合系数降低20-49%,JS散度降低45-67%。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14257 2026-06-23 cs.CL cs.AI cs.IR cs.LG 版本更新 92%

AD-Bench: A Real-World, Trajectory-Aware Advertising Analytics Benchmark for LLM Agents

AD-Bench: 面向LLM智能体的真实世界、轨迹感知广告分析基准

Lingxiang Hu, Yiding Sun, Tianle Xia, Wenwei Li, Ming Xu, Lan Xu, Siying Wang, Wei Xu, Jie Jiang

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AD-Bench基准,通过动态真实答案管道和轨迹感知评估,衡量LLM智能体在真实广告分析任务中的多轮工具协作能力,发现最优模型在复杂任务上仍有显著差距。

Comments 16 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04018 2026-06-23 cs.AI cs.CL cs.CY cs.LG 版本更新 92%

AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents

AgentMisalignment:衡量基于LLM的代理中失调行为的倾向性

Akshat Naik, Emma Gouné, Patrick Quinn, Guillermo Bosch, Francisco Javier Campos Zabala, Jason Ross Brown, Edward James Young

机构 * Department of Computer Science(计算机科学系) University of Oxford(牛津大学) Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne Université(索邦大学) The Leverhulme Centre for the Future of Intelligence(未来智能中心) University of Cambridge(剑桥大学) Independent Researcher(独立研究者) Department of Computer Science and Technology(计算机科学与技术系) Department of Engineering(工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出AgentMisalignment基准,评估LLM代理在真实场景中自发追求非预期目标的倾向,发现更强大的代理平均表现出更高的失调倾向,且个性特征对失调影响显著。

Comments Prepint, under review for NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18422 2026-06-18 quant-ph 新提交 92%

Gatekeepers and Hallucinations: A Layered Evaluation Framework for LLM-Driven Quantum Circuit Generation

守门人与幻觉:LLM驱动的量子电路生成的分层评估框架

Christopher Coleman, Sharon Marfatia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 提出分层评估框架,通过守门人筛选、电路保真度分析和设计熵指标,识别LLM在量子电路生成中的五种失败模式,并揭示评估基础设施本身可能引入错误。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12369 2026-06-11 cs.CY 新提交 92%

Should LLM Agents Decide in Social Simulations? Comparing Finite-State and LLM-Based Decision Policies

LLM智能体应在社会模拟中做决策吗?比较有限状态与基于LLM的决策策略

Alejandro Buitrago López, Javier Pastor-Galindo, José A. Ruipérez-Valiente

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估LLM作为在线社交网络模拟中动作选择器时,是否保持可解释的参考策略,发现LLM在某些配置下可近似但不可靠地保持策略,且速度远慢于马尔可夫链采样。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09852 2026-06-10 cs.HC cs.AI cs.CL cs.LG cs.MA cs.SE 新提交 92%

LLM-Based Code Documentation Generation and Multi-Judge Evaluation

基于LLM的代码文档生成与多裁判评估

Ikbel Ghrab, Mohamed Dhieb, Ismail Khenissi, Ines Abdeljaoued-Tej

机构 * University of Tunis El Manar(突尼斯国家理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出利用八种大语言模型自动生成代码文档,并通过多裁判评估框架(四个LLM从九个维度评分)提升文档质量,在医学物理库上实验显示最佳与最差模型性能差距达42%。

Comments ICAHS, \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses, in any current or future media, including reprinting/republishing this material for advertising or promotional purposes, creating new collective works, for resale or redistribution to servers or lists, or reuse of any copyrighted component of this work in other works

Journal ref Conference ICAHS IEEE, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01311 2026-06-02 cs.CL cs.AI cs.LG cs.MA 92%

SkillAdaptor: Self-Adapting Skills for LLM Agents from Trajectories

SkillAdaptor:基于轨迹的LLM智能体自适应技能

Zhuoyun Yu, Xin Xie, Wuguannan Yao, Chenxi Wang, Lei Liang, Xiang Qi, Shumin Deng

机构 * Zhejiang University(浙江大学) Ant Digital Technologies, Ant Group(蚂蚁集团数字技术部) Zhejiang University - Ant Group Joint Laboratory of Knowledge Graph(浙江大学-蚂蚁集团知识图谱联合实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SkillAdaptor,一种无训练的步骤级技能自适应框架,通过显式故障归因和针对性更新,提升LLM智能体在长程交互任务中的表现。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18649 2026-06-02 cs.CL cs.AI cs.IR cs.LG 92%

Fake News Detection After LLM Laundering: Measurement and Explanation

LLM清洗后的假新闻检测:测量与解释

Rupak Kumar Das, Jonathan Dodge

机构 * College of IST Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究测量检测器在识别LLM改写假新闻时的有效性,发现检测器难以检测LLM改写的假新闻,并通过LIME解释发现情感偏移是检测失败的原因之一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30907 2026-06-01 cs.SE cs.AI cs.CL cs.LG 92%

BlueFin: Benchmarking LLM Agents on Financial Spreadsheets

BlueFin: 在金融电子表格上对LLM智能体进行基准测试

Srivatsa Kundurthy, Clara Na, Colton Moraine, Anoushka Mohta, Case Winter, George Fang, John Ling, Emma Strubell, Zach Kirshner

机构 * Longitude Labs Inc.(Longitude Labs公司) Cornell University(康奈尔大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BlueFin基准,通过131个真实金融电子表格任务评估LLM智能体的合成、操作和理解能力,并验证了LM评判与人类专家的一致性。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30736 2026-06-01 cs.LG cs.AI cs.CL 92%

OrcaRouter: A Production-Oriented LLM Router with Hybrid Offline-Online Learning

OrcaRouter: 一种面向生产的混合离线-在线学习LLM路由器

Zhenghua Bao, Fengya Tian, Chris Zhang, Zhenjun Chen, Xile Ma, Yi Shi

机构 * Continuum AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrcaRouter,一种结合LinUCB上下文赌博机与混合离线-在线学习协议的生产级LLM路由器,通过离线全信息反馈和在线赌博机学习实现低成本高精度模型选择。

Comments 6 pages, 1 table. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16610 2026-05-29 cs.CL cs.AI cs.LG 92%

Who can we trust? LLM-as-a-jury for Comparative Assessment

我们该信任谁?LLM作为陪审团进行比较评估

Mengjie Qian, Guangzhi Sun, Mark J. F. Gales, Kate M. Knill

机构 * Department of Engineering, University of Cambridge, UK(剑桥大学工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM作为评估者时判断不一致和可靠性差异的问题,提出BT-sigma模型,通过引入判别参数联合推断项目排名和法官可靠性,优于平均聚合方法。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08654 2026-05-29 cs.CL cs.AI cs.LG 92%

From Rubrics to Reliable Scores: Evidence-Grounded Text Evaluation with LLM Judges

从评分标准到可靠分数:基于证据的文本评估与LLM裁判

Yihan Hong, Huaiyuan Yao, Bolin Shen, Wanpeng Xu, Hua Wei, Yushun Dong

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) Arizona State University(亚利桑那州立大学) Florida State University(佛罗里达州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Rulers框架,通过三阶段推理(任务规范、结构化执行、事后校准)解决LLM在基于评分标准的文本评估中的执行漂移、归因不可验证和人类尺度错位问题,实现更可靠的评分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18309 2026-05-21 cs.SE 92%

From Program Slices to Causal Clarity: Evaluating Faithful, Actionable LLM-Generated Failure Explanations via Context Partitioning and LLM-as-a-Judge

从程序切片到因果清晰:通过上下文划分和LLM作为评判者评估忠实、可操作的LLM生成故障解释

Julius Porbeck, Christian Medeiros Adriano, Holger Giese

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了LLM生成的故障解释质量如何受不同上下文配置影响,通过上下文划分和LLM作为评判者的方法,评估了忠实且可操作的解释,并发现丰富的证据和特定故障的艺术品提高了因果和行动质量,而过大的上下文则导致解释模糊。

Comments 10 pages, 5 figures, 5 tables. Accepted to EASE 2026 (EQUISA workshop), Glasgow, United Kingdom

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09997 2026-05-20 cs.SI cs.SE 92%

GraphInstruct: A Progressive Benchmark for Diagnosing Capability Gaps in LLM Graph Generation

GraphInstruct: 一个用于诊断LLM图生成能力差距的渐进性基准

Zihe Wei, Sheng Xiang, Ying Zhang, Changjun Jiang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出GraphInstruct基准,通过六个复杂性层级和五个评估维度,结合800个人工指令和1582个算法生成的参考解决方案,评估LLM图生成能力,发现多约束组合而非推理深度具有更强区分能力,且无单一提示策略能跨层级或模型家族主导,域语义约束在所有测试方法中保持迭代不变,表明检索而非额外计算是下一步研究方向。

Comments 44 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16354 2026-05-19 cs.LG cs.AI cs.CL cs.HC stat.ML 92%

Augmenting Human Evaluation with LLM Judges: How Many Human Reviews Do You Need?

通过LLM裁判增强人类评估:你真的需要多少人类评审?

Jane Paik Kim

机构 * Department of Psychiatry and Behavioral Sciences(精神病学与行为科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过LLM作为辅助裁判来增强人类评估,通过两阶段抽样设计确定人类和LLM评审样本量,以实现目标统计功效。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14460 2026-05-15 cs.CR cs.SE 92%

Exploiting LLM Agent Supply Chains via Payload-less Skills

通过无负载技能利用LLM代理供应链

Xinyu Liu, Yukai Zhao, Xing Hu, Xin Xia

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究提出Semantic Compliance Hijacking攻击,利用LLM生成能力动态合成恶意行为,通过无负载技能实现对自主编码环境的攻击,展示了其在不同框架和模型中的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06940 2026-05-13 cs.CL cs.AI cs.LG 92%

MultiSoc-4D: A Benchmark for Diagnosing Instruction-Induced Label Collapse in Closed-Set LLM Annotation of Bengali Social Media

MultiSoc-4D:一个用于诊断指令诱导标签崩溃的基准,在封闭集LLM注释印度文社交媒体中的应用

Souvik Pramanik, S. M. Riaz Rahman Antu, Shak Mohammad Abyad, Md. Ibrahim Khalil, Md. Shahriar Hussain

机构 * North South University(北南大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MultiSoc-4D基准,通过LLM注释印度文社交媒体评论,发现指令诱导标签崩溃现象,揭示注释偏见传播问题,提供诊断工具。

Comments 21 pages, 14 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 92%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08305 2026-05-12 cs.LG cs.AI cs.CL cs.PF cs.SE 92%

LLMSYS-HPOBench: Hyperparameter Optimization Benchmark Suite for Real-World LLM Systems

LLMSYS-HPOBench: 为真实世界LLM系统设计的超参数优化基准套件

Siyu Wu, Yulong Ye, Zezhen Xiang, Pengzhou Chen, Gangda Xiong, Tao Chen

机构 * UESTC China(UESTC中国) IDEAS Lab University of Birmingham, UK(IDEAS实验室 英国伯明翰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLMSYS-HPOBench,首个针对真实世界LLM系统的超参数优化基准套件,包含大量超参数配置、保真因子和评估指标,旨在验证现有HPO算法并推动AutoML研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03736 2026-05-11 cs.AI cs.CL cs.LG 92%

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

LLM代理行为是否一致?用于社交模拟的潜在特征

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of African American & African Studies, University of Minnesota(明尼苏达大学非裔美国人与非洲研究系) Department of Sociology, University of Chicago(芝加哥大学社会学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究LLM代理在不同实验环境下是否保持经验一致性,通过揭示代理的潜在特征来检验其行为一致性,发现不同模型家族和大小的LLM存在显著不一致。

Comments 25 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02195 2026-05-11 cs.SE 92%

Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation

超越翻译准确性:解决基于LLM的代码翻译中的虚假失败

Fazle Rabbi, Soumit Kanti Saha, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文指出LLM代码翻译中许多失败并非逻辑错误,而是评估框架导致的编译器标志、库链接缺失或运行时环境未配置等问题,通过大规模实验揭示了虚假负样本的分类及改进评估标准的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17172 2026-04-21 cs.CL cs.AI cs.CY cs.LG 92%

Who Gets Which Message? Auditing Demographic Bias in LLM-Generated Targeted Text

谁会得到哪条信息?对LLM生成定向文本中人口偏见的审计

Tunazzina Islam

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统分析了LLM在人口条件定向信息生成中的行为,发现性别和年龄差异在不同模型中表现显著,且上下文提示放大了这些偏见,强调需建立偏见意识生成流程和透明审计框架。

Comments Accepted at Findings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG 92%

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21813 2026-01-07 cs.AI cs.CL cs.IR cs.LG 92%

OAEI-LLM-T: A TBox Benchmark Dataset for Understanding Large Language Model Hallucinations in Ontology Matching

OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集

Zhangcheng Qiang, Kerry Taylor, Weiqing Wang, Jing Jiang

机构 * Australian National University(澳大利亚国立大学) Monash University(墨尔本大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。

Comments 14 pages, 4 figures, 4 tables, 2 prompt templates

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14307 2026-01-01 cs.CL cs.AI cs.LG 92%

LLM-3D Print: Large Language Models To Monitor and Control 3D Printing

LLM-3D Print: 大型语言模型用于监控和控制3D打印

Yayati Jadhav, Peter Pak, Amir Barati Farimani

机构 * Department of Mechanical Engineering, Carnegie Mellon University, Pittsburgh, PA, USA(机械工程系,卡内基梅隆大学,匹兹堡,PA,USA)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 利用大型语言模型监控和控制3D打印过程,自动识别和纠正打印缺陷,提升产品质量与生产效率。

Journal ref Additive Manufacturing, Vol. 114, September 2025, Article 105027

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23875 2025-10-29 cs.HC 92%

Large Language Model Agent Personality and Response Appropriateness: Evaluation by Human Linguistic Experts, LLM-as-Judge, and Natural Language Processing Model

Eswari Jayakumar, Niladri Sekhar Dash, Debasmita Mukherjee

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13868 2025-09-18 cs.SE 92%

Are Prompts All You Need? Evaluating Prompt-Based Large Language Models (LLM)s for Software Requirements Classification

Manal Binkhonain, Reem Alfayaz

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 33 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00112 2024-09-04 cs.CL cs.AI cs.ET cs.HC cs.LG 92%

Toward Large Language Models as a Therapeutic Tool: Comparing Prompting Techniques to Improve GPT-Delivered Problem-Solving Therapy

Daniil Filienko, Yinzhou Wang, Caroline El Jazmi, Serena Xie, Trevor Cohen, Martine De Cock, Weichao Yuwen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for AMIA 2024 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.07796 2024-07-12 cs.AI cs.CL cs.LG cs.NE 92%

Evaluating Large Language Models with Grid-Based Game Competitions: An Extensible LLM Benchmark and Leaderboard

Oguzhan Topsakal, Colby Jacob Edell, Jackson Bailey Harper

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏