arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-17 至 2026-04-17 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 77 篇

2604.15151 2026-04-17 cs.CL 92%

QuantCode-Bench: A Benchmark for Evaluating the Ability of Large Language Models to Generate Executable Algorithmic Trading Strategies

QuantCode-Bench: 一个用于评估大型语言模型生成可执行算法交易策略能力的基准

Alexey Khoroshilov, Alexey Chernysh, Orkhan Ekhtibarov, Nini Kamkia, Dmitry Zmitrovich

机构 * Lime

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出QuantCode-Bench,通过多阶段流程评估现代LLM生成Backtrader框架策略的能力,包含400个不同难度任务,分析模型在交易逻辑、API使用和任务语义方面的局限性。

Comments 12 pages, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04578 2026-04-17 cs.CL 92%

LexGenius: An Expert-Level Benchmark for Large Language Models in Legal General Intelligence

LexGenius:一种大型语言模型在法律通用智能方面的专家级基准

Wenjin Liu, Haoran Luo, Xin Feng, Xiang Ji, Lijuan Zhou, Rui Mao, Jiapu Wang, Shirui Pan, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Nanjing University of Science and Technology(南京理工大学) Griffith University(格里菲斯大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出LexGenius,一个涵盖七个维度、十一项任务和二十项能力的中文法律基准,用于评估大型语言模型的法律通用智能,发现LLM在法律智能能力上存在显著差异,甚至优于人类法律专业人士。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14199 2026-04-17 q-fin.CP cs.AI cs.LG 92%

PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data

PolyBench:基于实时预测市场数据的LLM预测与交易能力基准测试

Pu Cheng, Juncheng Liu, Yunshen Long

机构 * College of Electrical Engineering, Sichuan University(四川大学电气工程学院) School of Economics, Sichuan University(四川大学经济学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolyBench基准测试,通过实时预测市场数据评估七种先进LLM的预测与交易能力,发现仅两种模型在严格市场状态下实现正收益,揭示了语言流畅性与真实概率推理之间的差距。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI 92%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10101 2026-04-17 cs.CL 92%

Who Wrote This Line? Evaluating the Detection of LLM-Generated Classical Chinese Poetry

是谁写的这行诗?评估LLM生成古典中文诗歌的检测

Jiang Li, Tian Lan, Shanshan Wang, Dongxing Zhang, Dianqing Lin, Guanglai Gao, Derek F. Wong, Xiangdong Su

机构 * College of Computer Science, Inner Mongolia University, China(内蒙古大学计算机学院,中国) National & Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, China(蒙古语智能信息处理技术国家与地方联合工程研究中心,中国) NLP²CT Lab, Department of Computer and Information Science, University of Macau, China(澳门大学计算机与信息科学学院NLP²CT实验室,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ChangAn基准,用于评估AI检测器对LLM生成的古典中文诗歌的检测能力,揭示现有工具的局限性。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23578 2026-04-17 cs.CL cs.SD 92%

Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models

风格失忆:多轮对话中 spoken language models 的说话风格退化与缓解研究

Yu-Xiang Lin, Cheng-Han Chiang, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立交通大学人工智能卓越研究中心(NTU AI-CoRE))

专题命中 评测与基准 :language model(title,title_cn);SLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了多轮对话中 spoken language models 无法维持指定说话风格的问题,发现模型在后续对话中无法保持一致性,通过实验表明模型在被提示时可回忆风格指令但无法正确表达,需改进以提升风格一致性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14969 2026-04-17 cs.AI 91%

Discovering Novel LLM Experts via Task-Capability Coevolution

通过任务能力共进化发现新型大语言模型专家

Andrew Dai, Boris Meinardus, Ciaran Regan, Yingtao Tian, Yujin Tang

机构 * Sakana AI

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出AC/DC框架,通过模型合并和合成数据生成实现大语言模型与任务的共进化,发现超越大模型能力的新型LLM,无需显式优化基准,在多智能体最佳N选择中提升性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14509 2026-04-17 cs.SE cs.AI cs.CL 91%

E2Edev: Benchmarking Large Language Models in End-to-End Software Development Task

E2EDev:端到端软件开发任务中大语言模型的基准测试

Jingyao Liu, Chen Huang, Zhizhao Guan, Wenqiang Lei, Yang Deng

机构 * College of Computer Science, Sichuan University(四川大学计算机学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所) CHAT NLP Group, Singapore Management University(新加坡国立管理大学CHAT NLP组) Engineering Research Center of Machine Learning and Industry Intelligence, Ministry of Education, China(教育部长机器学习与产业智能工程研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出E2EDev基准,基于行为驱动开发原则,通过模拟真实用户交互评估端到端软件开发框架的能力,揭示现有方法在解决复杂任务中的不足。

Comments Accepted to ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15302 2026-04-17 cs.AI cs.CL cs.LG 90%

Diagnosing LLM Judge Reliability: Conformal Prediction Sets and Transitivity Violations

LLM评判可靠性诊断:符合预测集与传递性违反

Manan Gupta, Dhruv Kumar

机构 * BITS Pilani, Pilani Campus, India(比斯理工学院,帕利尼校区,印度)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SummEval中诊断LLM评判可靠性的双管工具,通过传递性分析和分割符合预测集揭示文档不一致性及评判可靠性,发现相关性比其他标准更可靠。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15124 2026-04-17 cs.CL 90%

Blinded Multi-Rater Comparative Evaluation of a Large Language Model and Clinician-Authored Responses in CGM-Informed Diabetes Counseling

盲评大型语言模型与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询

Zhijun Guo, Alvina Lai, Emmanouil Korakas, Aristeidis Vagenas, Irshad Ahamed, Christo Albor, Hengrui Zhang, Justin Healy, Kezhi Li

机构 * Institute of Health Informatics, University College London(健康信息学研究所,伦敦大学学院) University College London Hospitals NHS Foundation Trust(伦敦大学学院医院 NHS 基础信托) Dartford and Gravesham NHS Foundation Trust(达特福德和格拉夫萨姆 NHS 基础信托) Royal Free London NHS Foundation Trust(伦敦皇家自由 NHS 基础信托)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过盲评评估了基于检索的大型语言模型对话代理与临床医生撰写的回应在连续葡萄糖监测指导下的糖尿病咨询中的表现,发现对话代理在同理心和可操作性方面得分更高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11227 2026-04-17 cs.CL cs.CY 90%

Language of Thought Shapes Output Diversity in Large Language Models

语言形态影响大语言模型的输出多样性

Shaoyang Xu, Wenxuan Zhang

机构 * iNLP Lab, Singapore University of Technology and Design(新加坡科技设计大学iNLP实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究了语言形态对大语言模型输出多样性的影响,通过多语言思考策略提升输出多样性,并在实际应用中展现文化知识的广泛覆盖。

Comments acl2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15915 2026-04-17 cs.LG cs.CL 90%

AccelOpt: A Self-Improving LLM Agentic System for AI Accelerator Kernel Optimization

AccelOpt:一种自我改进的LLM代理系统,用于AI加速器内核优化

Genghan Zhang, Shaowei Zhu, Anjiang Wei, Zhenyu Song, Allen Nie, Zhen Jia, Nandita Vijaykumar, Yida Wang, Kunle Olukotun

机构 * Anonymous Authors(匿名作者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 AccelOpt通过迭代生成探索内核优化空间,利用优化记忆库提升AI加速器内核性能,实验证明其能力随时间提升,且成本效益高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14414 2026-04-17 cs.CL 90%

The Autocorrelation Blind Spot: Why 42% of Turn-Level Findings in LLM Conversation Analysis May Be Spurious

自相关盲区:为什么LLM对话分析中42%的回合级发现可能是虚假的

Ferdinand M. Schessl

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文研究了LLM对话分析中回合级指标的自相关性,发现42%的显著关联在集群稳健校正后不显著,提出两阶段校正框架以减少统计显著性膨胀。

Comments 14 pages, 3 figures, 5 tables, 1 algorithm. Code and synthetic demonstration data: https://github.com/ferdinandschessl-boop/autocorrelation-correction

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14158 2026-04-17 cs.CL cs.AI 90%

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

MemGround:用于大型语言模型在游戏化场景中的长期记忆评估套件

Yihang Ding, Wanke Xia, Yiting Zhao, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) CASIA

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 MemGround通过游戏化交互场景评估LLM的长期记忆能力,提出三级框架和多维指标,揭示先进模型在动态跟踪和复杂推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09643 2026-04-17 cs.ET cs.AI 89%

MM-tau-p$^2$: Persona-Adaptive Prompting for Robust Multi-Modal Agent Evaluation in Dual-Control Settings

MM-tau-p$^2$: 人格自适应提示用于双控制设置中多模态代理的鲁棒性评估

Anupam Purwar, Aditya Choudhary

机构 * Sprinklr AI

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(title,comments);language model(abstract);分类 cs.AI

AI总结 本文提出MM-tau-p$^2$基准,通过12个新指标评估多模态代理在双控制环境中的鲁棒性,结合用户输入解决查询,并展示即使使用前沿LLM,多模态鲁棒性等指标仍需考虑。

Comments A benchmark for evaluating multimodal both voice and text LLM agents in dualcontrol settings. We introduce persona adaptive prompting and 12 new metrics to assess robustness safety efficiency and recovery in customer support scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02135 2026-04-17 cs.CL 89%

Graph-Based Alternatives to LLMs for Human Simulation

基于图的LLM替代方案:人类模拟

Joseph Suh, Suhong Moon, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了多种封闭式模拟任务,提出图神经网络可匹配或超越LLM方法,GEMS模型在三个数据集上表现优异,参数更少且透明。

Comments Conference: ACL 2026 Long Main Code: https://github.com/schang-lab/gems

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.23657 2026-04-17 cs.SE 89%

Secret Leak Detection in Software Issue Reports using LLMs: A Comprehensive Evaluation

利用LLM在软件问题报告中检测秘密泄露:全面评估

Sadif Ahmed, Md Nafiu Rahman, Zahin Wahab, Gias Uddin, Rifat Shahriyar

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文通过大规模分析和实用检测流程,评估了GitHub问题中泄露秘密的检测方法,结合正则表达式和LLM进行分类,提升检测精度与召回率。

Comments Accepted at the International Conference on Mining Software Repositories (MSR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14161 2026-04-17 cs.CL cs.AI cs.LG 89%

Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning

大语言模型能检测方法学缺陷吗?基于深度学习的无人机救援操作中的手势识别证据

Domonkos Varga

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否独立检测研究中的方法学缺陷,通过分析手势识别论文发现模型能识别数据泄露问题,证明其在提升可重复性中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14793 2026-04-17 q-fin.CP 88%

LR-Robot: An Human-in-the-Loop LLM Framework for Systematic Literature Reviews with Applications in Financial Research

LR-Robot:一种人机协同的LLM框架用于系统性文献综述及其在金融研究中的应用

Wei Wei, Jin Zheng, Zining Wang, Weibin Feng

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对传统系统性文献综述在金融研究中难以应对大规模复杂文献的问题,提出LR-Robot框架,结合领域专家定义的分类体系与大语言模型进行高效分类,并通过人机协同评估确保可靠性,支持时间演化跟踪和增强引用网络分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09363 2026-04-17 cs.AI cs.SY eess.SY 88%

BarrierBench: Evaluating Large Language Models for Safety Verification in Dynamical Systems

BarrierBench: 评估大型语言模型在动态系统安全验证中的性能

Ali Taheri, Alireza Taban, Sadegh Soudjani, Ashutosh Trivedi

机构 * Isfahan University of Technology(伊斯法罕技术大学) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出BarrierBench基准,评估大型语言模型在动态系统安全验证中的能力,通过100个动态系统案例测试语言模型在生成安全证书和协调策略中的有效性。

Comments 8th Annual Learning for Dynamics & Control Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15602 2026-04-17 cs.CV 88%

TennisTV: Do Multimodal Large Language Models Understand Tennis Rallies?

TennisTV: 多模态大语言模型能否理解网球发球?

Zhongyuan Bao, Lejun Zhang

机构 * New York University(纽约大学) Tandon School of Engineering(坦顿工程学院) Shanghai, China(上海,中国) New York, USA(纽约,美国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 TennisTV是首个全面评估网球视频理解的基准,通过模拟发球过程中的连续击球事件,评估17种大语言模型在网球视频理解中的表现,发现帧采样密度需平衡且需提升时间定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16761 2026-04-17 cs.CL 87%

Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions

基于扩展调查数据的语言模型微调以预测公众意见分布

Joseph Suh, Erfan Jahanparast, Suhong Moon, Minwoo Kang, Serina Chang

机构 * University of California, Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL

AI总结 本文通过微调大型语言模型,利用调查数据的结构特性提升对公众意见分布的预测能力,实验显示在多种子群体中模型预测与人类响应的匹配度显著提高,且能泛化到未见过的调查和子群体。

Comments ACL 2025 Long Main (https://aclanthology.org/2025.acl-long.1028/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14644 2026-04-17 cs.CL cs.LG 86%

CURaTE: Continual Unlearning in Real Time with Ensured Preservation of LLM Knowledge

CURaTE:在实时中实现连续反学习以确保大语言模型知识的保留

Seyun Bae, Seokhan Lee, Eunho Yang

机构 * KT Corporation(KT公司) KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CURaTE方法,通过训练句子嵌入模型实现实时连续反学习,有效提升遗忘效果并保持知识完整性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10166 2026-04-17 cs.MM 86%

Fact-Checking with Contextual Narratives: Leveraging Retrieval-Augmented LLMs for Social Media Analysis

基于上下文叙述的事实核查:利用检索增强的LLM进行社交媒体分析

Arka Ujjal Dey, Muhammad Junaid Awan, Georgia Channing, Christian Schroeder de Witt, John Collomosse

专题命中 评测与基准 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 CRAVE框架整合检索增强的大语言模型与聚类技术,通过多模态证据检索和聚类分析,提升社交媒体事实核查的准确性和解释性。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14664 2026-04-17 cs.SD eess.AS 86%

SpeechLLM-as-Judges: Towards General and Interpretable Speech Quality Evaluation

SpeechLLM-as-Judges: 向通用和可解释的语音质量评估迈进

Hui Wang, Jinghua Zhao, Yifan Yang, Shujie Liu, Junyang Chen, Yanzhe Zhang, Shiwan Zhao, Jinyu Li, Jiaming Zhou, Haoqin Sun, Yan Lu, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Microsoft Corporation(微软公司) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SpeechLLM-as-Judges框架,利用大语言模型进行结构化语音质量评估,构建了包含多语言语音片段的SpeechEval数据集,并开发了SQ-LLM模型,在多种任务和语言上表现出色。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14829 2026-04-17 cs.AI 84%

Beyond Literal Summarization: Redefining Hallucination for Medical SOAP Note Evaluation

超越字面总结:重新定义医疗SOAP笔记评估中的幻觉

Bhavik Vachhani, Kush Shrisvastava, Pranshu Nema, Sai Chiranthan

机构 * Augnito Research(Augnito研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出通过校准提示和基于医学本体的检索,重新定义医疗SOAP笔记评估中的幻觉,发现传统评估方法高估了幻觉率,影响模型评估。

Comments 12 pages, 2 figures,3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14448 2026-04-17 cs.CL 84%

MARCA: A Checklist-Based Benchmark for Multilingual Web Search

MARCA:基于检查表的多语言网络搜索基准

Thales Sales Almeida, Giovana Kerche Bonás, Ramon Pires, Celio Larcher, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Rodrigo Nogueira, Thiago Laitz

机构 * Maritaca AI Jusbrasil

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MARCA是一个双语(英语和葡萄牙语)基准,用于评估LLM在基于网络的信息检索中的能力,通过手动编写的多实体问题和检查表式评分标准,评估答案的完整性和正确性,并发现任务分解框架能提升覆盖范围,模型在英语到葡萄牙语的迁移中存在显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14602 2026-04-17 cs.CL cs.AI 84%

CausalDetox: Causal Head Selection and Intervention for Language Model Detoxification

CausalDetox:语言模型去毒化的因果头部选择与干预

Yian Wang, Yuen Chen, Agam Goyal, Hari Sundaram

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CausalDetox框架,通过因果分析识别并干预导致有毒生成的特定注意力头,利用PNS方法隔离必要且充分的头部,结合局部推理干预和PNS引导微调策略,有效提升去毒效果并保持语言流畅性。

Comments Accepted to ACL 2026. 22 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14321 2026-04-17 cs.CL 83%

LLM Predictive Scoring and Validation: Inferring Experience Ratings from Unstructured Text

LLM预测评分与验证:从非结构化文本推断体验评分

Jason Potteiger, Andrew Hong, Ito Zapata

机构 * Dimension Labs

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 研究利用GPT-4.1预测棒球迷对游戏日体验的评分,发现预测结果与实际评分高度一致,但整体评分普遍低于自报评分,揭示了两者在评估维度上的差异。

Comments 29 pages, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23121 2026-04-17 cs.CL cs.AI 82%

Uncovering the Fragility of Trustworthy LLMs through Chinese Textual Ambiguity

通过中文文本歧义揭示可信大语言模型的脆弱性

Xinwei Wu, Haojie Li, Hongyu Liu, Xinyu Ji, Ruohan Li, Yule Chen, Yigeng Zhang

机构 * Chalmers University of Technology(楚德斯技术大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在处理中文歧义文本时的脆弱性,通过创建基准数据集发现模型在歧义处理上存在显著缺陷,影响实际应用。

Comments Accepted at KDD workshop on Evaluation and Trustworthiness of Agentic and Generative AI Models (Agentic & GenAI Evaluation Workshop KDD '25)

详情

展开后加载摘要…

URL PDF HTML 收藏