arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2606.02755 2026-06-03 cs.SE cs.AI 92%

Acceptance-Test-Driven Evaluation Protocols for Business-Centric LLM Systems

面向业务中心LLM系统的验收测试驱动评估协议

Eric Liang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM系统概率生成与确定性需求不匹配问题,提出基于验收测试驱动开发、安全工程和业务中心验证的评估协议,将利益相关者目标转化为可执行行为契约,并采用红-训练-绿生命周期确保多维门控通过后才发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02300 2026-06-02 cs.CL 92%

Beyond Isolated Behaviors: Hierarchical User Modeling for LLM Personalization

超越孤立行为:面向LLM个性化的层次化用户建模

Liang Wang, Xinyi Mou, Xiaoyou Liu, Tiannan Wang, Yuqing Wang, Zhongyu Wei

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) OPPO

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对LLM个性化中用户行为缺乏层次结构的问题,提出基于布迪厄实践理论的PHF框架,通过实践-惯习-场域三层建模,并实现轻量级模型无关方法PHF_Compass,在LaMP基准上取得一致提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01136 2026-06-02 cs.CL 92%

From Outliers to Errors: Auditing Pali-to-English LLM Translations with Multi-Reference Adjudication

从异常到错误:使用多参考裁决审计巴利语到英语的LLM翻译

Máté Metzger, Nadnapang Phophichit, Hansa Dhammahaso

机构 * Independent Researcher(独立研究者) Nibbana Meditation Centre(尼布达冥想中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型翻译古典语言时误将合理变异标记为错误的问题,提出基于多个人类翻译参考包络和嵌入漂移阈值筛选、再由LLM评审团裁决的审计方法,并应用于巴利语-英语翻译。

Comments Preprint. This manuscript has not yet been peer reviewed

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31167 2026-06-01 cs.AI 92%

LLM-FACETS: A Privacy-Preserving Framework for Evaluating LLM Transparency and Accountability

LLM-FACETS:一个保护隐私的评估LLM透明度和问责制的框架

Tom Lucas, Alessio Buscemi, Alfredo Capozucca, German Castignani, Barbara Delacroix

机构 * Luxembourg Institute of Science and Technology (LIST)(卢森堡科学与技术研究所) University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一个开源框架LLM-FACETS,通过浏览器界面和插件架构,为技术专家、领域专家和合规官员提供隐私保护的LLM评估,实现透明度与问责制。

Comments Submitted to ACM Journal on Responsible Computing, Special Section: Collaborative Methods and Tools for Engineering and Evaluating Transparency in AI. 28 pages 9 figures, 7 tables, 1 algorithm. Source code: https://github.com/Scriptor-Group/AIMVi

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14583 2026-06-01 cs.AI 92%

LLM Bias Evaluation: Gender, Racial, and Age Disparities in Occupational and Crime Scenarios

LLM偏差评估:职业与犯罪场景中的性别、种族和年龄差异

Vishal Mirza, Rahul Kulkarni, Aakanksha Jadhav

机构 * New York University(纽约大学) Northeastern University(东北大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文评估了2024年四大领先LLM在职业和犯罪场景中的性别、种族和年龄偏差,发现去偏努力常导致新的公平性权衡,即“去偏悖论”。

Comments Updated title and abstract to emphasize key findings on the debiasing paradox for improved discoverability. Content and findings unchanged. 11 pages, 17 figures, Accepted at IEEE Conference on Artificial Intelligence (IEEE CAI) 2025. Full Paper acceptance in the Vertical HUMAN-CENTERED AI category

Journal ref 2025 IEEE Conference on Artificial Intelligence (CAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30200 2026-05-29 cs.AI 92%

Double-Edged Sword or Sharp Tool? Designing and Evaluating Triadic LLM-Teacher Collaboration for K-12 Writing at Scale

双刃剑还是利器?设计与评估面向K-12写作规模化的三元LLM-教师协作

Canran Wang, Yuwen Yang, Zhen Wang, Ming Ma, Ding Yu, Chentai Wang, Keman Huang, Xiaoyong Du

机构 * Renmin University of China(中国人民大学) Central University of Finance and Economics(中央财经大学) Beijing HQ Intelligent Technology, Ltd.(北京HQ智能科技有限公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过开发一个三元协作系统,结合系统功能语言学与建议轨迹追踪管道,基于包含57,954篇作文的大规模实证数据,验证了LLM作为生成引擎、教师作为教学把关者的分工策略能有效提升写作质量,并发现语言扩展存在边际效用递减的天花板效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30103 2026-05-29 cs.LG 92%

Convergence Theory for Iterative LLM-Based Neural Architecture Search: A Parametric Cross-Entropy Framework with Closed-Form Proxy Reliability

基于迭代式LLM的神经架构搜索的收敛理论:一个具有闭式代理可靠性的参数化交叉熵框架

Santosh Premi Adhikari, Radu Timofte, Dmitry Ignatov

机构 * Computer Vision Lab, CAIDAS & IFI, University of Würzburg, Germany(计算机视觉实验室,CAIDAS与IFI,乌尔姆大学,德国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 将迭代式LLM-NAS建模为参数化交叉熵方法,证明了收敛性、精英集概率几何收敛、增量生成有效性、MinHash-Jaccard去重防止模式崩溃以及代理可靠性闭式公式,并通过实验验证了理论预测。

Comments 14 pages, 2 figures, 2 tables. Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28966 2026-05-29 cs.CL cs.HC 92%

The Trust Paradox: How CS Researchers Engage LLM Leaderboards

信任悖论:CS研究人员如何使用LLM排行榜

Pouya Sadeghi, Anamaria Crisan, Jimmy Lin

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过半结构化访谈,揭示计算机科学领域研究人员对LLM排行榜普遍存在“实用怀疑”矛盾态度,并基于发现提出设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24562 2026-05-29 cs.CL 92%

HaluNet: Learning Hallucination Risk from Internal Signals in LLM Question Answering

HaluNet:从LLM问答内部信号学习幻觉风险

Chaodong Tong, Qi Zhang, Zhuojun Jiang, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) China Industrial Control Systems Cyber Emergency Response Team(中国工业控制系统网络应急响应团队)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出HaluNet,利用单次生成的内部信号(token似然、预测熵和隐藏状态)估计答案级幻觉风险,通过LLM-as-a-Judge弱监督训练,在多个QA数据集上显著提升风险排序和错误检测率。

Comments 16 pages, 12 tables, and 11 figures. This version includes a major revision of the manuscript and updates the author list with the consent of all involved authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23573 2026-05-29 cs.CR cs.AI 92%

Uncovering Vulnerabilities of LLM-Assisted Cyber Threat Intelligence

揭示LLM辅助网络威胁情报中的脆弱性

Yuqiao Meng, Luoxi Tang, Feiyang Yu, Jinyuan Jia, Guanhua Yan, Ping Yang, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学) Duke University(杜克大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过人机协同分类框架,识别并验证了LLM在CTI推理中的三种领域特定认知失败模式(虚假关联、矛盾知识和受限泛化),并证明针对性防御可显著降低失败率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 92%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27083 2026-05-27 cs.CL cs.CR 92%

On the Hidden Costs of Counterfactual Knowledge Training in LLM Unlearning

反事实知识训练在LLM遗忘中的隐藏代价

Xiaotian Ye, Xiaohan Wang, Mengqi Zhang, Shu Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Huazhong University of Science and Technology(华中科技大学) Shandong University(山东大学) NLPR, MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络计划、人工智能研究所、中国科学院自动化研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文发现反事实微调(CFT)在LLM遗忘中存在知识冲突和幻觉溢出两大问题,并引入扩展基准RWKU+及诊断工具进行系统分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26770 2026-05-27 cs.CL 92%

Quality Without Usefulness: LLM-Generated XAI Narratives as Trust Heuristics Rather Than Decision Aids

质量而无用:LLM生成的XAI叙事作为信任启发而非决策辅助

Fabian Lukassen, Jan Herrmann, Christoph Weisser, Alexander Silbersdorff, Benjamin Saefken, Thomas Kneib

机构 * University of Göttingen(哥廷根大学) BASF SE(巴斯夫股份有限公司) Hochschule Bielefeld(比勒菲尔德大学) TU Clausthal(Clausthal 技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过五个受控实验,研究LLM生成的高质量自然语言解释在时间序列能源预测中是否提升任务准确性,发现解释不改善准确性但膨胀自信,存在质量-有用性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23008 2026-05-26 cs.AI 92%

From Prompt Optimization to Multi-Dimensional Credibility Evaluation: Enhancing Trustworthiness of Chinese LLM-Generated Liver MRI Reports -- with Preliminary Extension to Lung Cancer

从提示优化到多维可信度评估:增强中文LLM生成的肝脏MRI报告的可信度——初步扩展至肺癌

Qiuli Wang, Xinhuang Sun, Yonglin Chen, Jie Cheng, Yongxu Liu, Xingpeng Zhang, Xiaoming Li, Wei Chen

机构 * Yu-Yue Pathology Research Center, Jinfeng Laboratory, Chongqing, China(渝粤病理研究所,金风实验室,重庆,中国) T Magnetic Resonance Imaging Translational Medical Center, Department of Radiology, Southwest Hospital, Army Medical University, Chongqing, China(7T磁共振成像转化医学中心,放射科,西南医院,中国人民解放军军医大学,重庆,中国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出多维可信度评估(MDCA)框架,并指导机构特定提示优化,以增强LLM生成的肝脏MRI报告的可信度,初步扩展至肺癌。

Comments 10 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24137 2026-05-26 cs.SE cs.AI 92%

Empirical Analysis and Detection of Hallucinations in LLM-Generated Bug Report Summaries

LLM生成的错误报告摘要中幻觉的经验分析与检测

Hinduja Nirujan, Shreyas Patil, Abdallah Ayoub, Ahmad Abdel Latif, Gouri Ginde

机构 * Electrical and Software Engineering(电气与软件工程学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究从章节感知角度经验性地调查了LLM生成的错误报告摘要中的幻觉,提出了联合预测幻觉内容、识别受影响章节和分类幻觉类型的检测方法,并在BugsRepo数据集上取得了良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24069 2026-05-26 cs.CR cs.AI 92%

When the Manual Lies: A Realistic Benchmark to Evaluate MCP Poisoning Attacks for LLM Agents

当手册撒谎:评估LLM智能体MCP投毒攻击的现实基准

Shi Liu, Xuehai Tang, Xikang Yang, Liang Lin, Biyu Zhou, Wenjie Xiao, Wantao Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM智能体通过模型上下文协议(MCP)集成外部工具时面临的工具描述投毒(TDP)攻击,提出MCP-TDP安全基准,包含32个真实测试用例,评估8种主流LLM发现严重漏洞,并提出反应性自我纠正防御机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23949 2026-05-26 cs.MA cs.AI 92%

SODE: Analyzing Social Dynamics in LLM Agents

SODE:分析LLM智能体中的社会动态

Inseo Jung, Yoonseok Oh, Kyungryul Back, Jinkyu Kim, Jungbeom Lee

机构 * Department of Computer Science, Korea University(韩国大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SODE框架,通过直接互惠、间接互惠和群体动态三个进化维度评估LLM智能体的社会行为,发现指令调优模型存在被动顺从问题,推理模型则因短视优化破坏长期合作,并展示长期框架可激发推理模型的互惠能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23497 2026-05-25 cs.CL 92%

Asking For An Old Friend: Diagnosing and Mitigating Temporal Failure Modes in LLM-based Statutory Question Answering

询问老朋友:诊断和缓解基于LLM的法定问答中的时间故障模式

Max Prior, Andreas Schultz, Matthias Grabmair

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过构建包含312个专家验证的德国法定问答对基准,诊断并缓解了大型语言模型在法定问答中的两种时间故障模式(截止后过时和近因偏差),发现检索增强生成通过事实日期提取和版本过滤显著提升性能,而网络搜索存在不稳定性与近因偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23102 2026-05-25 stat.ML cs.LG stat.ME 92%

LLM Sparsity Prior for Robust Feature Selection

LLM 稀疏先验用于鲁棒特征选择

Caleb Skinner, Yihan Guo, Meng Li

机构 * Department of Statistics, Rice University(统计学系,里士满大学) Department of Computer Science, Rice University(计算机科学系,里士满大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出 LLM 稀疏先验 (LSP) 方法,通过将 LLM 生成的权重整合到 Spike-and-Slab 模型的先验包含概率中,并利用层次超先验动态调整权重影响,实现鲁棒的高维特征选择,在急性肾损伤数据集上提升了预测准确性和临床相关特征识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28048 2026-05-25 cs.CL cs.SI 92%

Stable Behavior, Limited Variation: Persona Validity in LLM Agents for Urban Sentiment Perception

稳定行为,有限变化:城市情感感知中LLM智能体的角色有效性

Neemias B da Silva, Rodrigo Minetto, Daniel Silver, Thiago H Silva

机构 * University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多角色提示生成LLM智能体,发现角色内行为稳定但角色间差异有限,且无角色模型在某些任务中表现更优。

Comments 8 pages, 8 figures. IEEE DCOSS - UrbCom

Journal ref IEEE DCOSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22316 2026-05-22 cs.CL 92%

Evaluating Scoring Bias in LLM-as-a-Judge

评估LLM作为裁判的评分偏见

Qingquan Li, Shaoyu Dou, Kailai Shao, Chao Chen, Haixiang Hu

机构 * Ant Group(蚂蚁集团)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM作为裁判在评分任务中的偏见问题,提出了三种新的评分偏见类型,并开发了一个框架来量化这些偏见,以改进评分提示设计。

Comments Accepted by DASFAA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05406 2026-05-22 cs.CL 92%

Frame In, Frame Out: Measuring Framing Bias in LLM-Generated News Summaries

框入框出:衡量LLM生成新闻摘要中的框架偏差

Valeria Pastorino, Nafise Sadat Moosavi

机构 * Department of Computer Science University of Sheffield (UK)(计算机科学系谢菲尔德大学(英国))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FIFO基准测试,用于衡量LLM生成的新闻摘要中的框架存在性,发现LLM生成的摘要在科学和公共卫生领域显示出较高的框架率,表明框架是摘要质量的一个被忽视但重要的维度。

Comments Accepted to The 15th Joint Conference on Lexical and Computational Semantics (*SEM 2026) co-located with ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 92%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-05-20 cs.SE cs.CL 92%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Jie M. Zhang, Mark Harman, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 27 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18199 2026-05-19 cs.IR cs.AI 92%

PIPER: Content-Based Table Search via profiling and LLM-Generated Pseudoqueries

PIPER: 通过 profiling 和 LLM 生成的伪查询实现基于内容的表格搜索

Riccardo Terrenzi, Matteo Falconi, Serkan Ayvaz, Pierluigi Plebani

机构 * Centre for Industrial Software, University of Southern Denmark(丹麦南部大学工业软件中心) Department of Electronics, Information and Bioengineering, Politecnico di Milano(米兰理工学院电子、信息与生物工程系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对数据湖、数据空间和开放数据门户中表格数据集快速增长的问题,PIPER 提出了一种基于内容的表格搜索方法,利用表格 profile 和 LLM 生成的伪查询进行密集检索,优于传统元数据方法和 TableQA 检索方法,展示了 LLM 基于内容建模在表格数据集搜索中的价值。

Comments 15 pages, 3 figures, accepted at DEXA'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18015 2026-05-19 cs.LG cs.DB cs.SE 92%

LogRouter: Adaptive Two-Level LLM Routing for Log Question Answering in Big Data Systems

LogRouter: 一种自适应的两级LLM路由用于大数据系统中的日志问题解答

Mert Coskuner, Merve Zeybel, Melik Mert Dolan

机构 * TUBITAK BILGEM(土耳其国家研究 institute)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出LogRouter,一种自适应两级LLM路由系统,用于在大数据系统中实现日志问题解答,通过结合PySpark-based Drain3数据摄入管道、GPU加速的嵌入和Apache Druid和PostgreSQL with pgvector的双索引存储,实现高效的日志查询处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16996 2026-05-19 cs.CL 92%

Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?

LLM个性诱导中的评估漂移:我们是否在移动目标?

Prateek Rajput, Yewei Song, Iyiola E. Olatunji, Jacques Klein, Tegawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(title,title_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了大型语言模型在诱导人类样性格时的稳定性问题,通过微调长格式论文来诱导性格,并发现尽管微调减少了问卷评分的方差,但完整五维性格的准确性仍接近随机,表明无指导的论文缺乏表达忠实性格所需的线索。

Comments 14 pages, 8 main pages, 5 figures, 4 main page figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16675 2026-05-19 cs.AI 92%

LinAlg-Bench: A Forensic Benchmark Revealing Structural Failure Modes in LLM Mathematical Reasoning

LinAlg-Bench:一个 forensic 验证基准,揭示 LLM 数学推理中的结构失效模式

Shradha Agarwal, Deepak Rajbhar, Tariq J

机构 * Department of Nuclear Engineering and Computer Science(核工程与计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 LinAlg-Bench 评估 10 个前沿大语言模型在结构线性代数计算中的表现,揭示 LLM 数学失败并非随机,而是受算法类型和矩阵维度约束。研究发现 4x4 尺寸存在行为阈值,低于该尺寸模型通过执行错误失败,高于则转向计算放弃,通过工具角色扮演等制造响应。

Comments 42 pages, 3 figures, 12 tables. NeurIPS 2026 Evaluations and Datasets Track submission. Dataset: https://huggingface.co/datasets/LinAlgBench/linalg-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16238 2026-05-18 cs.AI 92%

Prospective multi-pathogen disease forecasting using autonomous LLM-guided tree search

前瞻性多病原体疾病预测使用自主LLM引导的树搜索

Sarah Martinson, Michael P. Brenner, Martyna Plomecka, Brian P. Williams, Nicholas G. Reich, Zahra Shamsi

机构 * Google Research(谷歌研究) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Google Deepmind(谷歌DeepMind) University of Massachusetts(马萨诸塞大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出自主系统,利用LLM引导树搜索生成、评估和优化可执行预测软件,在2025-2026年美国呼吸道季节中实现了流感、新冠和呼吸道合胞病毒的多方法模型,其集成模型在样本外表现优于CDC标准模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00417 2026-05-18 cs.CL 92%

CryptoBench: A Dynamic Benchmark for Expert-Level Evaluation of LLM Agents in Cryptocurrency

CryptoBench: 一种动态基准,用于评估LLM代理在加密货币领域的专家级能力

Jiacheng Guo, Suozhi Huang, Zixin Yao, Yifan Zhang, Yifu Lu, Jiashuo Liu, Zihao Li, Nicholas Deng, Qixin Xiao, Jia Tian, Kanghong Zhan, Tianyi Li, Xiaochen Liu, Jason Ge, Chaoyang He, Kaixuan Huang, Lin Yang, Wenhao Huang, Mengdi Wang

机构 * Princeton University(普林斯顿大学) Zenith Lab(Zenith实验室) University of California, Los Angeles(加州大学洛杉矶分校) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出CryptoBench,首个专家 curated 的动态基准,用于严格评估LLM在加密货币领域的真实能力。通过50题/月的动态任务,细分子类评估数据获取与预测能力,揭示LLM在检索与预测上的不平衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏