arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-14 至 2026-05-14 共收录 65 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2605.13695 2026-05-14 cs.CL cs.AI 93%

RTLC -- Research, Teach-to-Learn, Critique: A three-stage prompting paradigm inspired by the Feynman Learning Technique that lifts LLM-as-judge accuracy on JudgeBench with no fine-tuning

RTLC -- 研究、教以学、批判:一种受费曼学习技术启发的三阶段提示范式,无需微调即可提升LLM-as-judge在JudgeBench上的准确性

Andrea Morandi

机构 * Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title,abstract);分类 cs.CL、cs.AI

AI总结 RTLC通过三阶段提示方法提升LLM在JudgeBench上的准确性,无需微调或外部工具,其核心方法包括研究、教以学和批判三个阶段,显著提升客观正确性评分的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12894 2026-05-14 cs.AI cs.CL 92%

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

超越协作模拟器:为LLM代理的稳健评估生成真实用户人设

Harshita Chopra, Kshitish Ghate, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques

机构 * University of Washington, Seattle, WA(华盛顿大学) Georgetown University, Washington, DC(乔治城大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Persona Policies,通过LLM驱动的进化程序搜索生成多样化的人设,提升模拟器在真实用户交互中的鲁棒性,实验显示在零售和航空领域取得显著性能提升。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16246 2026-05-14 cs.AI 92%

Toward Scalable Verifiable Reward: Proxy State-Based Evaluation for Multi-turn Tool-Calling LLM Agents

迈向可扩展的可验证奖励:基于代理状态的多轮工具调用LLM代理评估

Yun-Shiuan Chuang, Chaitanya Kulkarni, Alec Chiu, Avinash Thangali, Zijie Pan, Shivani Shekhar, Yirou Ge, Yixi Li, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于代理状态的评估框架,用于多轮工具调用LLM代理的可扩展可验证奖励评估,通过LLM驱动的模拟框架实现稳定且区分模型的排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12869 2026-05-14 cs.CR cs.AI 92%

Quantifying LLM Safety Degradation Under Repeated Attacks Using Survival Analysis

利用生存分析量化LLM在反复攻击下的安全退化

Zvi Topol

机构 * MuyVentive, LLC(MuyVentive公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用生存分析评估LLM在持续对抗压力下的安全退化,揭示不同模型在多次攻击下的脆弱性差异,为模型开发者提供评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00238 2026-05-14 cs.CL 92%

Estimating LLM Grading Ability and Response Difficulty in Automatic Short Answer Grading via Item Response Theory

基于项目反应理论的LLM自动简答评分能力与响应难度估计

Longwei Cong, Sonja Hahn, Sebastian Gombert, Leon Camus, Hendrik Drachsler, Ulf Kroehne

机构 * DIPF | Leibniz Institute for Research and Information in Education(德意志教育研究所 | 列支敦士登教育研究所) Faculty of Computer Science, Goethe University Frankfurt(法兰克福歌德大学计算机学院) Chemnitz University of Technology(化学工业大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于项目反应理论的LLM自动简答评分评估框架,分析评分准确率与响应难度的关系,揭示不同模型在评分表现上的差异及中间标签崩溃问题。

Comments accepted at BEA 2026, the 21st Workshop on Innovative Use of NLP for Building Educational Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13368 2026-05-14 cs.CL 91%

What Does LLM Refinement Actually Improve? A Systematic Study on Document-Level Literary Translation

LLM精细化实际提升了什么?对文档级文学翻译的系统研究

Shaomu Tan, Dawei Zhu, Ke Tran, Michael Denkowski, Sony Trenous, Bill Byrne, Leonardo Ribeiro, Felix Hieber

机构 * University of Amsterdam(阿姆斯特丹大学) University of Cambridge(剑桥大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 本文系统研究了文档级文学翻译中LLM精细化的效果,发现文档级MT后接段级精细化能带来稳定提升,而文档级精细化效果有限。通用精细化提示优于特定错误提示和评估后精细化策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12657 2026-05-14 cs.SE 90%

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

用户评论作为可用性需求的来源:利用大语言模型的前期研究

Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 本文探讨利用大语言模型处理用户评论以提取可用性需求的可能性,提出了一套编码数据集和提示工程方法,并验证了LLM在识别可用性需求方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11581 2026-05-14 cs.CL 90%

Hidden Measurement Error in LLM Pipelines Distorts Annotation, Evaluation, and Benchmarking

LLM pipelines 中隐藏的测量误差扭曲了注释、评估和基准测试

Solomon Messing

机构 * Center for Social Media, AI, and Politics(社交媒体、人工智能与政治中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文分析了LLM评估流程中隐藏的测量误差来源,通过设计研究减少总评估误差,并展示改进后的精度和基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13711 2026-05-14 cs.LG 89%

MILM: Large Language Models for Multimodal Irregular Time Series with Informative Sampling

MILM:用于多模态不规则时间序列的大型语言模型与信息采样

Hsing-Huan Chung, Shijun Li, Yoav Wald, Xing Han, Suchi Saria, Joydeep Ghosh

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Technion-IIT(技术学院-以色列理工学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出MILM模型,通过两阶段策略处理多模态不规则时间序列,有效利用采样模式和观测值进行分类,提升医疗记录中住院死亡率预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12918 2026-05-14 cs.CL 89%

CommonWhy: A Dataset for Evaluating Entity-Based Causal Commonsense Reasoning in Large Language Models

CommonWhy:用于评估大语言模型实体基础因果常识推理的数据集

Armin Toroghi, Faeze Moradi Kalarde, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 CommonWhy数据集通过15000个为什么问题评估大语言模型的因果关系实体推理能力,揭示现有模型在因果推理和事实生成上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06869 2026-05-14 cs.AI 89%

Agentick: A Unified Benchmark for General Sequential Decision-Making Agents

Agentick: 一个统一的连续决策制定代理基准测试

Roger Creus Castanyer, Pablo Samuel Castro, Glen Berseth

机构 * Mila Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);SFT(abstract,abstract_cn);foundation model(abstract);post-training(abstract)

AI总结 Agentick是一个统一的连续决策制定代理基准测试,评估RL、LLM、VLM等代理在共同基础上的表现,揭示各方法的不足,为通用自主代理研究提供实验基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12772 2026-05-14 cs.CV 89%

Just Ask for a Table: A Thirty-Token User Prompt Defeats Sponsored Recommendations in Twelve LLMs

只需请求一张表格:一个三十个标记的用户提示在十二个LLM中击败了赞助推荐

Andreas Maier, Jeta Sopa, Gozde Gul Sahin, Paula Perez-Toro, Siming Bayer

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universit\"at Erlangen-N\"urnberg, Germany

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究发现,一个三十个标记的用户提示能显著降低LLM中的赞助推荐率,且核心结论在不同模型中保持一致,但实现过程中存在潜在失败因素。

Comments Submitted to Workshop on Textual Information Processing & Synthesis in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23887 2026-05-14 cs.CR cs.AI 88%

Evaluation of Prompt Injection Defenses in Large Language Models

对大型语言模型中提示注入防御措施的评估

Priyal Deep, Shane Emmons, Amy Fox, Kyle Bacon, Kelley McAllister, Peter Ortiz, Krisztian Flautner

机构 * Swept AI University of Michigan(密歇根大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究通过构建自适应攻击者测试了九种防御配置,发现依赖模型自我保护的防御均失效,而输出过滤通过硬编码规则在应用代码中检查响应,实现了零泄露。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15616 2026-05-14 cs.CV 88%

LENS: Multi-level Evaluation of Multimodal Reasoning with Large Language Models

LENS:基于大语言模型的多级多模态推理评估

Ruilin Yao, Bo Zhang, Jirui Huang, Xinwei Long, Yifang Zhang, Tianyu Zou, Yufei Wu, Shichao Su, Yifan Xu, Wenxi Zeng, Zhaoyu Yang, Guoyou Li, Shilan Zhang, Zichan Li, Yaxiong Chen, Shengwu Xiong, Peng Xu, Jiajun Zhang, Bowen Zhou, David Clifton, Luc Van Gool

机构 * Wuhan University of Technology(武汉理工大学) Tsinghua University(清华大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shanghai AI Lab(上海人工智能实验室) University of Oxford(牛津大学) INSAIT, Sofia Un. St Kliment Ohridski(索菲亚大学克里门特·欧里迪斯基学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 LENS提出一个包含3.4K图像和60K+问题的多级评估基准,涵盖8个任务和12种日常场景,用于评估大语言模型在多模态推理中的表现。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11444 2026-05-14 cs.CV 88%

Leveraging Multimodal Large Language Models for All-in-One Image Restoration via a Mixture of Frequency Experts

通过混合频率专家利用多模态大语言模型实现一站式图像修复

Eunho Lee, Rei Kawakami, Youngbae Hwang

机构 * Chungbuk National University(Chungbuk国立大学) Institute of Science Tokyo(东京科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一种利用多模态大语言模型指导的图像修复框架,通过混合频率专家模块提升对复合退化特征的建模能力,在多个数据集上取得优异效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12529 2026-05-14 cs.CR 88%

BackFlush: Knowledge-Free Backdoor Detection and Elimination with Watermark Preservation in Large Language Models

BackFlush:在大型语言模型中无需知识的后门检测与消除及水印保留

Jagadeesh Rachapudi, Ritali Vatsi, Pranav Singh, Praful Hambarde, Amit Shukla

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出BackFlush框架,通过旋转参数编辑技术在保留水印的同时检测并消除后门,实现近1%的攻击成功率和99%的清洁准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13481 2026-05-14 cs.CL 87%

PersonalAI 2.0: Enhancing knowledge graph traversal/retrieval with planning mechanism for Personalized LLM Agents

PersonalAI 2.0:通过规划机制增强知识图谱遍历/检索以实现个性化大语言模型代理

Mikhail Menschikov, Matvey Iskornev, Alexander Kharitonov, Alina Bogdanova, Mikhail Belkin, Ekaterina Lisitsyna, Artyom Sosedka, Victoria Dochkina, Ruslan Kostoev, Ilia Perepechkin, Evgeny Burnaev

机构 * Huawei, Moscow, Russia(华为,莫斯科,俄罗斯)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PersonalAI 2.0通过动态多阶段查询流程提升知识图谱遍历与检索能力,结合实体提取和生成线索查询,提升回答准确性,优于现有方法,且在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12507 2026-05-14 cs.SI cs.AI cs.MA 87%

Can LLM Agents Simulate Dynamic Networks? A Case Study on Email Networks with Phishing Synthesis

大语言模型代理能否模拟动态网络?基于钓鱼合成的邮件网络案例研究

Siqi Miao, Ziyang Chen, Yuhong Luo, Hans Hao-Hsun Hsu, Mufei Li, Kaiqing Zhang, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学 College Park 分校) Rutgers University(罗格斯大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型多代理系统在模拟动态网络中的能力,提出两种扩展方法以提升网络仿真精度,通过钓鱼合成案例验证了其在建模信息传播和网络安全威胁中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07147 2026-05-14 cs.LO cs.AI cs.LG 87%

MathlibPR: Pull Request Merge-Readiness Benchmark for Formal Mathematical Libraries

MathlibPR: 用于正式数学库的拉取请求合并准备性基准

Zixuan Xie, Xinyu Liu, Shangtong Zhang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MathlibPR基准,通过真实Mathlib4 PR历史评估LLM在审查合并准备性PR中的能力,揭示LLM在区分有效PR与需修订PR中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03992 2026-05-14 cs.CR cs.AI 86%

Quantitative Certification of Agentic Tool Selection

代理工具选择的定量认证

Jehyeok Yeon, Isha Chaudhary, Gagandeep Singh

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLMCert-T框架,通过统计方法为代理工具选择流程提供高置信度的正确性上限,揭示当前LLM代理在干扰选择和Top-N饱和规格下的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12799 2026-05-14 cs.MA cs.CY cs.MM 86%

Synthesizing the Expert: A Validated Multimodal Dataset for Trustworthy AI-Assisted Swimming Coaching

合成专家:一个经过验证的多模态数据集用于可信的人工智能辅助游泳教练

Ahmad Al-Kabbany, Esraa Kassem

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一个多模态数据集,用于构建可信的人工智能游泳教练系统,通过多代理LLM架构生成1864个验证的'问题-上下文-答案'三元组,提升自动化指导的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12510 2026-05-14 cs.SI cs.CL cs.CY 84%

WhatsApp Vaccine Discourse (WhaVax): An Expert-Annotated Dataset and Benchmark for Health Misinformation Detection

WhatsApp疫苗 discourse(WhaVax):一个专家标注的数据集和基准,用于健康虚假信息检测

Jônatas H. dos Santos, Julio C. S. Reis, Philipe Melo, João F. H. Olivetti, Thales H. Silva, Matheus Gontijo Guimaraes, Glaucio de Souza, Marcos A. Gonçalves, Fabricio Benevenuto, Filipe B. B. Zanovello, Marco A. G. Rodrigues, Cristiano X. Lima

机构 * Universidade Federal de Minas Gerais (UFMG)(巴西联邦大学矿务学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文介绍了WhaVax数据集,用于检测健康虚假信息,通过专家标注和多阶段协议生成高质量数据集,并评估了不同模型在数据稀缺条件下的表现。

Comments 10 pages. This is a preprint version of a paper accepted for the International AAAI Conference on Web and Social Media (ICWSM'26). Please cite the conference version rather than this preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08039 2026-05-14 cs.CV cs.AI cs.LG 84%

LINE: LLM-based Iterative Neuron Explanations for Vision Models

LINE:基于语言模型的视觉模型迭代神经元解释

Vladimir Zaigrajew, Michał Piechota, Gaspar Sekula, Paweł Gelar, Przemysław Biecek

机构 * Centre for Credible AI(可信AI中心) Warsaw University of Technology(华沙理工大学) University of Warsaw, Poland(波兰华沙大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LINE提出一种无需训练的迭代方法,通过大语言模型和图像生成器,在黑盒环境下闭环提出和优化概念,提升视觉模型的开放词汇概念标注性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08461 2026-05-14 cs.LG cs.AI cs.CV hep-ex 84%

Adapting Vision-Language Models for Neutrino Event Classification in High-Energy Physics

为高能物理中的中微子事件分类适应视觉-语言模型

Dikshant Sagar, Kaiwen Yu, Alejandro Yankelevich, Jianming Bian, Pierre Baldi

机构 * Department of Computer Science, University of California, Irvine, CA, USA(计算机科学系,加州大学欧文分校,加州,美国) Department of Physics, University of California, Irvine, CA, USA(物理系,加州大学欧文分校,加州,美国)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了将微调后的LLaMA 3.2应用于中微子事件分类,对比了Transformer架构与CNN在准确性和鲁棒性上的表现,展示了视觉-语言模型在物理事件分类中的潜力。

Comments Accepted for publication in Communications Physics (Nature Portfolio)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13292 2026-05-14 cs.CL cs.AI cs.IR cs.LG 83%

IndicMedDialog: A Parallel Multi-Turn Medical Dialogue Dataset for Accessible Healthcare in Indic Languages

IndicMedDialog: 一种平行多轮医疗对话数据集,用于印地语系语言中的可及性医疗

Shubham Kumar Nigam, Suparnojit Sarkar, Piyush Patel

机构 * University of Birmingham(布里斯托尔大学) Heritage Institute of Technology(遗产理工学院) Madan Mohan Malaviya University of Technology(马丹·莫汉·马尔维亚理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出IndicMedDialog数据集,包含英语和九种印地语系语言的多轮医疗对话,通过生成合成咨询并进行翻译、验证和处理,提升多语言医疗对话系统的现实性和可访问性。

Comments Accepted in BioNLP @ ACL 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21975 2026-05-14 cs.AI cs.ET 83%

Mind the Gap: How Elicitation Protocols Shape the Stated-Revealed Preference Gap in Language Models

注意差距: elicitation协议如何影响语言模型中的 stated-revealed偏好差距

Pranav Mahajan, Ihor Kendiukhov, Syed Hussain, Lydia Nottingham

机构 * University of Oxford(牛津大学) Max Planck Institute for Biological Cybernetics(生物信息学Max Planck研究所) University of Tuebingen(图宾根大学) Cardiff University(卡迪夫大学) Cambridge–Boston Alignment Initiative (CBAI)(剑桥-波士顿对齐倡议)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究探讨了elicitation协议对语言模型中stated-revealed偏好差距的影响,发现中性选项和 abstention 的引入能提高相关性,但进一步允许 abstention 又导致相关性下降。

Comments Accepted to ACL 2026 Eval Eval Workshop and 3rd Technical AI Safety Conference (TAIS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12702 2026-05-14 cs.AI cs.HC 83%

DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models

DisaBench:一种评估语言模型残疾危害的参与性评估框架

Eugenia Kim, Ioana Tanase, Christina Mallon

机构 * Microsoft(微软)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 DisaBench通过与残障人士和红队专家共同制定的十二类残疾危害分类,评估语言模型对残疾相关的危害,揭示了残疾类型对危害率的影响、术语驱动的危害具有文化及时间绑定性以及标准安全评估无法识别细微危害的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10896 2026-05-14 cs.LG 83%

V4FinBench: Benchmarking Tabular Foundation Models, LLMs, and Standard Methods on Corporate Bankruptcy Prediction

V4FinBench:在企业破产预测中对表格基础模型、LLMs和标准方法进行基准测试

Marcin Kostrzewa, Sebastian Tomczak, Roman Furman, Anna Poberezhna, Michał Furgała, Julia Farganus, Oleksii Furman, Maciej Zięba

机构 * Department of Artificial Intelligence, Wrocław University of Science and Technology(华沙理工大学人工智能系) Tooploox Opera

专题命中 评测与基准 :foundation model(title);LLM(summary_cn);分类 cs.LG

AI总结 本文提出V4FinBench,包含超过一百万条记录的企业破产预测数据集,用于评估在现实类别不平衡下的表格和基础模型方法,展示了TabPFN在长时间范围内的表现优于梯度提升,而LLM在ROC-AUC和F1分数上均弱于梯度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11618 2026-05-14 cs.LG q-bio.QM 83%

How Well Do Large-Scale Chemical Language Models Transfer to Downstream Tasks?

大规模化学语言模型在下游任务中的转移效果如何?

Tatsuya Sagawa, Ryosuke Kojima

机构 * Graduate School of Pharmaceutical Sciences, Kyoto University(京都大学药学研究科) RIKEN BDR(理化学研究所BDR) Graduate School of Medicine, Kyoto University(京都大学医学研究科)

专题命中 评测与基准 :language model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究评估了大规模化学语言模型在增加训练资源时对下游任务性能的影响,发现预训练损失降低但下游任务表现提升有限,并揭示了预训练评估与下游性能之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13412 2026-05-14 cs.CL cs.AI 82%

LLMs as annotators of credibility assessment in Danish asylum decisions: evaluating classification performance and errors beyond aggregated metrics

大型语言模型作为丹麦庇护决定中可信度评估标注者的应用:评估分类性能和错误超越聚合指标

Galadrielle Humblot-Renaux, Mohammad N. S. Jahromi, Rohat Bakuri-Jørgensen, Marieke Anne Heyl, Asta S. Stage Jarlner, Maria Vlachou, Anna Murphy Høgenhaug, Desmond Elliott, Thomas Gammeltoft-Hansen, Thomas B. Moeslund

机构 * Visual Analysis and Perception Lab(视觉分析与感知实验室) Pioneer Center for AI(先锋人工智能中心) Center of Excellence for Global Mobility Law(全球移动法律卓越中心) Department of Computer Science(计算机科学系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在丹麦庇护决定文本中识别可信度评估的存在和情感的性能,引入了RAB-Cred数据集,并评估了21种模型和30种提示组合的分类效果,揭示了模型和提示选择对零样本和少样本分类的影响。

Comments Accepted at the 20th Linguistic Annotation Workshop (LAW XX), co-located with ACL 2026 (https://sigann.github.io/LAW-XX-2026/)

详情

展开后加载摘要…

URL PDF HTML 收藏