arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-12 至 2026-05-12 共收录 190 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 190 篇

2605.10593 2026-05-12 cs.AI cs.CL cs.HC cs.SE 92%

LLARS: Enabling Domain Expert & Developer Collaboration for LLM Prompting, Generation and Evaluation

LLARS:促进领域专家与开发者协作的LLM提示、生成与评估系统

Philipp Steigerwald, Mara Stieler, Jennifer Burghardt, Eric Rudolph, Jens Albrecht

机构 * Technische Hochschule Nürnberg Georg Simon Ohm(图恩-努尔堡技术大学乔治·西蒙·奥姆学院) Faculty of Computer Science, Centre for Artificial Intelligence (KIZ)(计算机科学学院,人工智能中心(KIZ)) Faculty of Social Sciences, Institute for E-Counselling(社会科学学院,电子咨询研究所)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);分类 cs.CL、cs.AI

AI总结 LLARS通过整合协同提示工程、批量生成和混合评估模块,为构建LLM系统提供端到端流程,提升跨学科协作效率与准确性。

Comments Accepted at IJCAI-ECAI 2026 Demonstrations Track. Demo video: https://youtu.be/3QaKouwr4gU

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08486 2026-05-12 cs.CY 92%

Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability

教师对AI在教育中的感知益处与风险:对LLM对齐与可控性的审计

Yan Tao, Olga Viberg, Deepak Varuvel Dennison, Zhikun Wu, René F. Kizilcec

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过分析55国教师对AI的感知益处与风险,评估LLM在教育领域应用的对齐与可控性,揭示模型输出与现实差异,警示LLM不能替代教师直接反馈。

Comments Accepted as full paper to the 13th ACM Conference on Learning @ Scale (L@S'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08305 2026-05-12 cs.LG cs.AI cs.CL cs.PF cs.SE 92%

LLMSYS-HPOBench: Hyperparameter Optimization Benchmark Suite for Real-World LLM Systems

LLMSYS-HPOBench: 为真实世界LLM系统设计的超参数优化基准套件

Siyu Wu, Yulong Ye, Zezhen Xiang, Pengzhou Chen, Gangda Xiong, Tao Chen

机构 * UESTC China(UESTC中国) IDEAS Lab University of Birmingham, UK(IDEAS实验室 英国伯明翰大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LLMSYS-HPOBench,首个针对真实世界LLM系统的超参数优化基准套件,包含大量超参数配置、保真因子和评估指标,旨在验证现有HPO算法并推动AutoML研究发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10176 2026-05-12 cs.CR cs.AI 92%

When Prompts Become Payloads: A Framework for Mitigating SQL Injection Attacks in Large Language Model-Driven Applications

当提示成为载荷:一种缓解大型语言模型驱动应用中SQL注入攻击的框架

Farzad Nourmohammadzadeh Motlagh, Mehrdad Hajizadeh, Mehryar Majd, Pejman Najafi, Feng Cheng, Christoph Meinel

机构 * Hasso Plattner Institute, University of Potsdam, Germany(波茨坦大学霍斯曼-普拉特研究所, 德国) Chemnitz University of Technology, Chemnitz, Germany(Chemnitz技术大学, Chemnitz, 德国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种多层安全框架,通过提示清洗、威胁检测和签名控制层缓解LLM介导的SQL注入攻击,实验表明其在检测精度和误报率方面表现优异。

Comments 11 pages

Journal ref ICAART 2026, 18th Int. Conf. on Agents and Artificial Intelligence, pp. 1380-1390, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26680 2026-05-12 cs.CL cs.AI 92%

AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment

AlpsBench: 一个面向真实对话记忆与偏好对齐的LLM个性化基准

Jianfei Xiao, Xiang Yu, Chengbing Wang, Wuqiang Zheng, Xinyu Lin, Kaining Liu, Hongxun Ding, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AlpsBench通过真实人类与LLM对话数据构建,包含2500个长期交互序列及验证的记忆,评估个性化信息提取、更新、检索与利用等核心任务,揭示LLM在记忆管理中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09610 2026-05-12 cs.MA cs.AI cs.CE cs.LG cs.PL cs.SE 92%

SmartEval: A Benchmark for Evaluating LLM-Generated Smart Contracts from Natural Language Specifications

SmartEval:一个评估从自然语言规范生成的LLM智能合约质量的基准

Abhinav Goel, Agostino Capponi, Alfio Gliozzo, Chaitya Shah

机构 * Columbia University(哥伦比亚大学) IBM T.J. Watson Research Center(IBM T.J. Watson研究院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SmartEval通过9000个生成合约与专家编写的真实实现,结合五维评估标准,验证LLM生成智能合约的质量,并发现逻辑遗漏、状态转换错误等典型故障模式,展示了生成合约在综合评分上比真实实现高出8.29分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16025 2026-05-12 cs.CV cs.MM eess.IV 92%

Context and Pixel Aware Large Language Model for Video Quality Assessment

基于上下文和像素的大型语言模型用于视频质量评估

Wen Wen, Yaohong Wu, Yue Sheng, Neil Birkbeck, Balu Adsumilli, Yilin Wang

机构 * City University of Hong Kong(香港城市大学) Google Inc.(谷歌公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出CP-LLM,通过双视觉编码器和语言解码器同时生成视频质量评分和可解释描述,提升对像素失真敏感度,实验显示其在视频质量评估基准上表现优异。

Comments Accepted to ICIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10531 2026-05-12 cs.AI 92%

A Reflective Storytelling Agent for Older Adults: Integrating Argumentation Schemes and Argument Mining in LLM-Based Personalised Narratives

为老年人设计的反思性叙事代理:在基于LLM的个性化叙事中整合论证方案和论证挖掘

Jayalakshmi Baskar, Vera C. Kaelin, Kaan Kilic, Helena Lindgren

机构 * Umeå University, Department of Computing Science(乌尔姆大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了基于知识驱动的LLM叙事是否能支持老年人与数字伴侣的有意义互动。通过整合知识图谱、用户建模、论证理论和论证挖掘,系统在生成叙事时提供指导和检查。研究发现,论证质量与清晰度相关,文化相关性影响使用意愿,而高幻觉风险指标的叙事常被感知为不一致。

Comments Submitted to ACM Transactions on Intelligent Systems and Technology (TIST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10286 2026-05-12 cs.AI 92%

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

AgentRx: 一种针对多模态临床预测任务的LLM代理基准研究

Baraa Al Jorf, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了LLM代理在多模态临床预测任务中的表现,发现单代理框架在处理多模态数据和校准方面优于多代理系统,强调了改进多代理协作的重要性。

Comments Accepted at the AHLI Conference on Health, Inference, and Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09350 2026-05-12 cs.AI 92%

CHAINTRIX: A multi-pipeline LLM-augmented framework for automated smart-contract security auditing

CHAINTRIX:一个多管道LLM增强框架用于自动化智能合约安全审计

Gabriela Dobrita, Simona-Vasilica Oprea, Adela Bara

机构 * Bucharest University of Economic Studies(布加勒斯特经济大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CHAINTRIX通过结合LLM与确定性结构表示,提升智能合约审计效率,检测86/120高危漏洞,召回率71.7%,优于现有基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09227 2026-05-12 cs.CL 92%

Two Ways to De-Bias an LLM-as-a-Judge: A Continuous-Score Comparison of Hierarchical Bayesian Calibration and Neural-ODE Score Transport

用LLM作为裁判的两种去偏方法:对分层贝叶斯校准和神经ODE分数传输的连续分数比较

Andrea Morandi

机构 * Cisco(思科)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文比较了两种校正方法以减少LLM作为裁判的偏见,发现数据预算决定了方法选择,两种方法在不同锚点数量下表现各异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23025 2026-05-12 cs.CL cs.AI 91%

LENS: LLM-Enabled Narrative Synthesis for Mental Health by Aligning Multimodal Sensing with Language Models

LENS:通过对齐多模态传感与语言模型实现LLM赋能的叙事合成用于心理健康

Wenxuan Xu, Arvind Pillai, Subigya Nepal, Amanda C Collins, Daniel M Mackin, Michael V Heinz, Tess Z Griffin, Nicholas C Jacobson, Andrew Campbell

机构 * Dartmouth College(达特茅斯学院) University of Virginia(弗吉尼亚大学) Massachusetts General Hospital(麻省总医院) Harvard Medical School(哈佛医学院)

专题命中 评测与基准 :LLM(title,title_cn);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LENS框架,通过将多模态传感数据与语言模型对齐,生成临床相关的心理健康叙述。该方法构建大规模数据集并训练补丁级编码器,提升对长时序传感器数据的处理能力,实验显示其在自然语言处理指标和症状严重性准确性上优于基线模型。

Comments Camera-ready version. Additional experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08590 2026-05-12 cs.HC cs.AI cs.CL cs.CY 91%

Causal Stories from Sensor Traces: Auditing Epistemic Overreach in LLM-Generated Personal Sensing Explanations

从传感器轨迹中生成因果故事:审计LLM生成的个人传感解释中的知识过度延伸

Shanshan Zhu, Han Zhang, J. Doris Chi, Subigya Nepal, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Chicago(芝加哥大学) Yale University(耶鲁大学) University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM生成个人传感解释时的知识过度延伸问题,通过分析不同数据集中的异常日场景,发现LLM在缺乏足够证据时仍会做出因果归因,且丰富的上下文无法有效减少这种过度延伸。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10323 2026-05-12 cs.IR 90%

Every Preference Has Its Strength: Injecting Ordinal Semantics into LLM-Based Recommenders

每种偏好都有其强度:将序数语义注入基于LLM的推荐系统

Jiwon Jeong, Donghee Han, Sungrae Hong, Woosung Kang, Mun Yong Yi

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出OSA框架,通过建模用户反馈来显式整合偏好强度,保留序数语义以提升推荐系统性能。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09360 2026-05-12 cs.LG cs.AI cs.CL cs.SE 90%

Your Simulation Runs but Solves the Wrong Physics: PDE-Grounded Intent Verification for LLM-Generated Multiphysics Simulation Code

你的模拟运行但解错了物理:基于PDE的意图验证用于LLM生成的多物理场模拟代码

Zhenghan Song, Yulong Liu, Cheng Wan, Chenjun Li, Lingfu Liu, Yunyi Li, Congcong Yuan

机构 * Cornell University(康奈尔大学) Columbia University(哥伦比亚大学) Harvard University(哈佛大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于PDE的意图验证方法,用于检查LLM生成的多物理场模拟代码是否符合预期物理,通过确定性重构和比较PDE结构提升代码的意图保真度。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01022 2026-05-12 econ.GN cs.AI q-fin.EC 90%

Calibrating Behavioral Parameters with Large Language Models

用大语言模型校准行为参数

Brandon Yee, Pairie Koh

机构 * Management Sciences Lab(管理科学实验室) Yee Collins Research Group(Yee Collins研究组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用大语言模型校准行为参数,发现其存在系统性理性偏差,并通过校准方法提升参数稳定性与理论一致性,验证了校准参数在资产定价模型中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02184 2026-05-12 cs.AI cs.DC cs.PL cs.SE 90%

Leveraging LLMs to Automate Energy-Aware Refactoring of Parallel Scientific Codes

利用LLM自动化能源感知的并行科学代码重构

Matthew T. Dearing, Yiheng Tao, Xingfu Wu, Zhiling Lan, Valerie Taylor

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究LLM能否在经验执行反馈指导下生成能源高效的并行科学代码,提出LASSI-EE框架,通过多阶段迭代方法结合运行时功耗分析、能源感知提示、自纠正反馈循环和LLM作为裁判代理,实现代码重构。

Comments 12 pages, 5 figures, version under review at a peer-reviewed conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10805 2026-05-12 cs.AI cs.CL stat.ML 90%

Reasoning Is Not Free: Robust Adaptive Cost-Efficient Routing for LLM-as-a-Judge

推理并非免费:面向LLM-as-a-Judge的鲁棒自适应成本高效路由

Wenbo Zhang, Lijinghua Zhang, Liner Xiang, Hengrui Cai

机构 * Department of Statistics, University of California, Irvine, USA(加州大学伊维特分校统计学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比推理与非推理法官,发现推理在结构验证任务中提升准确性,但成本高。提出RACER方法,通过分布鲁棒优化动态选择推理或非推理法官,实现成本效率的最优平衡。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21362 2026-05-12 cs.AI cs.CL 90%

AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning

AdaRubric:面向可靠LLM代理评估和奖励学习的任务自适应评分标准

Liang Ding

机构 * The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 AdaRubric通过自适应生成任务特定评分标准,结合置信度加权评分和密集奖励信号,提升LLM代理评估的准确性与可靠性,实验表明其在多个基准测试中表现优异。

Comments KnowFM @ ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08448 2026-05-12 cs.AI cs.CL 90%

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

基于大语言模型的半监督方法用于社交媒体危机数据分类

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型引导的半监督学习在社交媒体危机数据分类中的应用,比较了VerifyMatch和LLM引导的协同训练方法,发现LLM引导的协同训练在低资源环境下表现优异,同时验证了知识迁移的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06047 2026-05-12 cs.AI cs.CL 90%

DSGBench: A Diverse Strategic Game Benchmark for Evaluating LLM-based Agents in Complex Decision-Making Environments

DSGBench:一种多样化的战略游戏基准,用于评估基于大语言模型的代理在复杂决策环境中的能力

Wenjie Tang, Yuan Zhou, Erqiang Xu, Keyan Cheng, Minne Li, Liquan Xiao

机构 * College of Computer, National University of Defense Technology(国防科技大学计算机学院) Intelligent Game and Decision Lab (IGDL)(智能博弈与决策实验室)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 DSGBench通过六个复杂战略游戏评估LLM代理在复杂决策环境中的能力,采用细粒度评分系统和自动决策追踪机制,揭示不同LLM模型的优劣与系统限制。

Comments 43 pages, 5 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08321 2026-05-12 cs.LG cs.AI cs.CY cs.HC cs.MA 90%

LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight

LLM卫士:通过第三方对话监督缓解对抗说服

Lennart Wachowiak, Scott D. Blain, David Williams-King, Samuele Marro

机构 * University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 研究通过引入第三方LLM卫士模型,降低对抗性LLM对用户的操纵成功率,实验显示卫士模型使对手成功率从65.4%降至30.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10779 2026-05-12 cs.CR cs.CL 90%

LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments

LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试

Chiyu Zhang, Huiqin Yang, Bendong Jiang, Xiaolei Zhang, Yiran Zhao, Ruyi Chen, Lu Zhou, Xiaogang Xu, Jiafei Wu, Liming Fang, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10405 2026-05-12 cs.LG 90%

Valid Best-Model Identification for LLM Evaluation via Low-Rank Factorization

通过低秩分解实现LLM评估中的最佳模型识别

Elad Tolochinsky, Yaniv Tenzer, Yaniv Romano

机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院) Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出结合多臂老虎机与低成本预测评分的框架,通过低秩分解减少方差,构建有效的置信区间,实现实验结果的准确识别与计算成本的降低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04956 2026-05-12 cs.LG cs.PF 90%

KernelBenchX: A Comprehensive Benchmark for Evaluating LLM-Generated GPU Kernels

KernelBenchX: 一个全面的评估LLM生成GPU内核的基准测试

Han Wang, Jintao Zhang, Kai Jiang, Haoxu Wang, Jianfei Chen, Jun Zhu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG

AI总结 本文提出KernelBenchX基准测试,通过176个任务的分类评估,揭示LLM生成GPU内核在正确性和硬件效率上的表现,发现任务结构比方法设计更重要,迭代优化提升正确性但不改善性能,正确性不等于效率,量化问题仍未解决。

Comments minor textual revision; no changes to technical content or results

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22919 2026-05-12 cs.CL 90%

ER-Reason: A Benchmark Dataset for LLM Clinical Reasoning in the Emergency Room

ER-Reason:用于急诊科大型语言模型临床推理的基准数据集

Nikita Mehandru, Niloufar Golchini, Namrata Garg, Kathy T. LeSaint, Christopher J. Nash, Anu Ramachandran, Travis Zack, Liam G. McCoy, Adam Rodman, David Bamman, Melanie Molina, Ahmed Alaa

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Duke University(杜克大学) University of Alberta(阿尔伯塔大学) Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) UC Berkeley and UCSF(伯克利大学和旧金山分校)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 90%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10419 2026-05-12 cs.CL cs.AI 90%

Can Language Models Analyze Data? Evaluating Large Language Models for Question Answering over Datasets

语言模型能分析数据吗?评估大型语言模型在数据集上的问答性能

Andreas Xenofontos, Pavlos Fafalios

机构 * School of Production Engineering and Management, Technical University of Crete(生产工程与管理学院,希腊克里特技术大学) Institute of Computer Science, Foundation for Research and Technology - Hellas(计算机科学研究所,希腊基础研究与技术研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了大型语言模型在数据集上回答问题的能力,通过两种场景测试其性能,并探讨不同提示策略的影响。

Comments Accepted for publication in CARMA 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 90%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09011 2026-05-12 cs.LG cs.AI 90%

A Geometric Perspective on Next-Token Prediction in Large Language Models: Three Emerging Phases

对大语言模型中下一个token预测的几何视角:三个新兴阶段

Gianfranco Lombardo, Giuseppe Trimigno, Stefano Cagnoni

机构 * Department of Engineering and Architecture(工程与建筑系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 研究通过几何方法分析大语言模型中预测信息的分布与演变,发现三个几何阶段:Seeding Multiplexing、Hoisting Overriding和Focal Convergence,揭示了模型深度对有效秩的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏