arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2603.02482 2026-03-04 cs.LG cs.CL cs.CV cs.SD eess.AS 90%

MUSE: A Run-Centric Platform for Multimodal Unified Safety Evaluation of Large Language Models

MUSE:一种面向多模态统一安全评估的运行导向平台

Zhongxi Wang, Yueqian Lin, Jingyang Zhang, Hai Helen Li, Yiran Chen

机构 * Duke University(杜克大学) Virtue AI

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 MUSE提出一种多模态统一安全评估平台,通过多轮攻击和跨轮模态切换技术,评估大型语言模型在不同模态下的安全性能。

Comments Submitted to ACL 2026 System Demonstration Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01343 2026-03-03 cs.CL cs.AI 90%

PanCanBench: A Comprehensive Benchmark for Evaluating Large Language Models in Pancreatic Oncology

PanCanBench: 用于评估大型语言模型在胰腺肿瘤学中的综合基准

Yimin Zhao, Sheela R. Damle, Simone E. Dekker, Scott Geng, Karly Williams Silva, Jesse J Hubbard, Manuel F Fernandez, Fatima Zelada-Arenas, Alejandra Alvarez, Brianne Flores, Alexis Rodriguez, Stephen Salerno, Carrie Wright, Zihao Wang, Pang Wei Koh, Jeffrey T. Leek

机构 * Department of Biostatistics, University of Washington(华盛顿大学生物统计学系) Clinical Research Division, Fred Hutch Cancer Center(Fred Hutch癌症中心临床研究部) Division of Hematology and Oncology, Department of Medicine, University of Washington(华盛顿大学医学系血液学与肿瘤学分会) Allen Institute for AI(Allen人工智能研究所) Department of Computer Science and Engineering, University of Washington(华盛顿大学计算机科学与工程系) Public Health Sciences, Biostatistics, Fred Hutchinson Cancer Center(Fred Hutchinson癌症中心公共卫生科学与生物统计学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PanCanBench通过评估22种LLM在胰腺肿瘤学问题上的表现,揭示了模型在事实准确性、临床完整性和网络搜索整合方面的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16191 2026-02-19 cs.AI cs.HC cs.LG 90%

Large Language Models for Water Distribution Systems Modeling and Decision-Making

大型语言模型在水分配系统建模与决策中的应用

Yinon Goldshtein, Gal Perelman, Assaf Schuster, Avi Ostfeld

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LLM-EPANET框架,利用大型语言模型实现与EPANET的自然语言交互,提升水分配系统建模与决策的效率和透明度。

Comments Accepted to EWRI Congress 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15812 2026-02-18 cs.AI cs.CL 90%

ErrorMap and ErrorAtlas: Charting the Failure Landscape of Large Language Models

误差图与误差图谱:大型语言模型失败景观的绘制

Shir Ashury-Tahan, Yifan Mai, Elron Bandel, Michal Shmueli-Scheuer, Leshem Choshen

机构 * IBM Research(IBM研究院) Stanford University(斯坦福大学) MIT(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ErrorMap和ErrorAtlas通过分析LLM失败原因,揭示模型弱点,为模型改进和评估提供更深入的洞察。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12185 2026-02-17 cs.SE cs.CL cs.LG 90%

EVALOOOP: A Self-Consistency-Centered Framework for Assessing Large Language Model Robustness in Programming

EVALOOOP:一种以自一致性为中心的大型语言模型编程鲁棒性评估框架

Sen Fang, Weiyuan Ding, Mengshi Zhang, Zihao Chen, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 EVALOOOP通过自一致性反馈循环评估LLM在编程任务中的鲁棒性,利用ASL度量揭示模型在持续自指代转换中的语义保持能力。

Comments 27 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14045 2026-02-16 cs.LG cs.AI 90%

LTSM-Bundle: A Toolbox and Benchmark on Large Language Models for Time Series Forecasting

LTSM-Bundle: 一个用于时间序列预测的大型语言模型工具包和基准

Yu-Neng Chuang, Songchen Li, Jiayi Yuan, Guanchu Wang, Kwei-Herng Lai, Joshua Han, Zihang Xu, Songyuan Sui, Leisheng Yu, Sirui Ding, Chia-Yuan Chang, Alfredo Costilla Reyes, Daochen Zha, Xia Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 LTSM-Bundle提出了一种用于时间序列预测的大型语言模型工具包和基准,通过模块化和多维度基准测试,结合最优设计选择,提升了零样本和少量样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07904 2026-02-10 cs.LG cs.AI 90%

Adaptive Acquisition Selection for Bayesian Optimization with Large Language Models

基于大语言模型的贝叶斯优化自适应获取选择

Giang Ngo, Dat Phan Trong, Dang Nguyen, Sunil Gupta, Svetha Venkatesh

机构 * Applied Artificial Intelligence Initiative(应用人工智能计划) Deakin University(德肯大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LMABO框架,利用预训练大语言模型作为自适应策略,通过结构化状态表示选择最优获取函数,提升贝叶斯优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11090 2026-02-10 cs.CL cs.AI 90%

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

SafeDialBench: 一种用于多轮对话中大型语言模型安全评估的细粒度基准,针对多样化对抗攻击

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Boyan Wang, Jiaheng Liu, Tianpei Yang, Jing Huo, Yang Gao, Fanyu Meng, Xi Yang, Chao Deng, Junlan Feng

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) University of Liverpool(利物浦大学) City University of Hong Kong(香港城市大学) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) China Mobile Research Institute(中国移动研究院) China Mobile (Suzhou) Software Technology Co., Ltd(中国移动苏州软件技术有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 SafeDialBench提出了一种细粒度基准,用于评估大型语言模型在多轮对话中面对多样化对抗攻击时的安全性,通过多维度分类和对抗攻击策略提升评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12144 2026-02-10 cs.CL cs.AI 90%

Automatic Item Generation for Personality Situational Judgment Tests with Large Language Models

基于大语言模型的人格情境判断测试自动题目生成

Chang-Jin Li, Jiyuan Zhang, Yun Tang, Jian Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究利用大语言模型开发自动生成人格情境判断测试的框架,通过三项实验验证了其在内容效度、可重复性和心理测量特性上的有效性。

Comments Accepted by Computers in Human Behavior Reports. The supplementary materials, data, and items are available at https://osf.io/jbvq7/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05656 2026-02-10 cs.LG cs.AI 90%

Alignment Verifiability in Large Language Models: Normative Indistinguishability under Behavioral Evaluation

大语言模型对齐的可验证性:行为评估下的规范不可区分性

Igor Santos-Grueiro

机构 * Igor Santos-Grueiro(独立研究者)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大语言模型对齐的可验证性,指出行为评估无法唯一确定潜在对齐,提出了规范不可区分性概念,并通过实验验证了在评估意识下行为基准的局限性。

Comments 10 pages. Theoretical analysis of behavioral alignment evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06260 2026-02-09 cs.CL cs.AI 90%

Can One-sided Arguments Lead to Response Change in Large Language Models?

单方面论点能否引导大语言模型产生回应变化?

Pedro Cisneros-Velarde

机构 * VMware Research(VMware研究)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了通过单方面论点是否能引导大语言模型改变其回应观点,发现不同模型和主题下均存在观点引导现象,而转向其他论点可减少这种影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01741 2026-02-06 cs.SE cs.AI cs.CL 90%

How Toxic Can You Get? Search-based Toxicity Testing for Large Language Models

你能有多有毒?基于搜索的大型语言模型毒性测试

Simone Corbo, Luca Bancale, Valeria De Gennaro, Livia Lestingi, Vincenzo Scotti, Matteo Camilli

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 EvoTox通过迭代进化策略评估LLM的毒性倾向,有效检测毒性水平并控制成本开销。

Journal ref IEEE Transactions on Software Engineering, Nov. 2025, pp. 3056-3071, vol. 51

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02497 2026-02-04 cs.CL cs.AI 90%

STEMVerse: A Dual-Axis Diagnostic Framework for STEM Reasoning in Large Language Models

STEMVerse: 一种用于大型语言模型中STEM推理的双轴诊断框架

Xuzhao Li, Xuchen Li, Jian Zhao, Shiyu Hu

机构 * NTU(国立科技大学) ZGCA(智能计算协会) ZGCI(智能计算研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 STEMVerse通过双轴诊断框架系统分析LLM在STEM领域的推理能力,揭示其结构失败模式,提供科学推理的深入理解。

Comments Preprint, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22911 2026-02-02 cs.CL cs.AI 90%

ElectriQ: A Benchmark for Assessing the Response Capability of Large Language Models in Power Marketing

ElectriQ:一个评估大型语言模型在电力营销中响应能力的基准

Jinzhi Wang, Qingke Peng, Haozhou Li, Zeyuan Zeng, Jiangbo Zhang, Kaixuan Yang, Ningyong Wu, Qinfeng Song, Ruimeng Li, Biyi Zhou

机构 * Systems Engineering Institute, Xi’an Jiaotong University(系统工程研究所,西安交通大学) State Key Laboratory of Multiphase Flow in Power Engineering, School of Energy and Power Engineering, Xi’an Jiaotong University(电力工程多相流国家重点实验室,能源与动力工程学院,西安交通大学) School of Electronic Science and Engineering, Xi'an Jiaotong University(电子科学与工程学院,西安交通大学) Organizational Management Department, School of Management, Xi’an Jiaotong University(组织管理部,管理学院,西安交通大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 ElectriQ是一个用于评估大型语言模型在电力营销中响应能力的基准,通过结合人类评分、自动指标和合规测试,提出SEEK-RAG方法提升领域知识注入,实现高效且合规的电力营销助手部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21505 2026-01-30 cs.AI cs.CL cs.HC 90%

The Effectiveness of Style Vectors for Steering Large Language Models: A Human Evaluation

风格向量对大型语言模型的控制效果:一项人类评估

Diaoulé Diallo, Katharina Dworatzyk, Sophie Jentzsch, Peer Schütt, Sabine Theis, Tobias Hecking

机构 * German Aerospace Center (DLR), Institute of Software Technology(德国航空航天中心(DLR)软件技术研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过人类评估验证了激活引导在控制大型语言模型情绪输出中的有效性,发现中等强度引导能显著增强目标情绪并保持文本可理解性,且模型升级后效果更稳定。

Journal ref IEEE Access 13 (2025) 191443-191457

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19925 2026-01-29 cs.CL cs.AI 90%

Evaluating Large Language Models for Abstract Evaluation Tasks: An Empirical Study

评估大型语言模型用于抽象评估任务:一项实证研究

Yinuo Liu, Emre Sezgin, Eric A. Youngstrom

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了大型语言模型在摘要评估任务中的表现,发现其在客观标准上与人类评审员一致,但在主观维度上表现较弱,表明AI可作为补充工具。

Comments 17 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17312 2026-01-27 cs.CL cs.AI 90%

Meta-Judging with Large Language Models: Concepts, Methods, and Challenges

元评判与大型语言模型:概念、方法与挑战

Hugo Silva, Mateus Mendes, Hugo Gonçalo Oliveira

机构 * University of Coimbra, CISUC/LASI – Centre for Informatics and Systems of the University of Coimbra, Department of Informatics Engineering(科英布拉大学,CISUC/LASI——科英布拉大学信息与系统研究中心,信息工程系) Polytechnic University of Coimbra, Rua da Misericórdia, Lagar dos Cortiços, S. Martinho do Bispo, 3045-093 Coimbra, Portugal(科英布拉理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了LLM-as-a-Meta-Judge在提升自动化评估稳定性与可信度方面的潜力,同时指出需解决的成本、提示敏感性及共享偏差等挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16753 2026-01-26 cs.CL cs.AI 90%

Standardizing Longitudinal Radiology Report Evaluation via Large Language Model Annotation

通过大型语言模型标注标准化纵向放射学报告评估

Xinyi Wang, Grazziela Figueredo, Ruizhe Li, Xin Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大型语言模型的标注方法,用于标准化放射学报告中的纵向信息评估,通过对比实验验证了其在疾病进展检测和跟踪方面的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16349 2026-01-26 cs.CL cs.AI 90%

Regional Bias in Large Language Models

大语言模型中的区域偏见

M P V S Gopinadh, Kappara Lakshmi Sindhu, Soma Sekhar Pandu Ranga Raju P, Yesaswini Swarna

机构 * Vishnu Institute of Technology(维斯努技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过FAZE框架评估了大语言模型中的区域偏见,发现不同模型在区域偏好上有显著差异,揭示了地理偏见对LLM输出公平性和包容性的影响。

Comments 8 pages, 1 figure. Presented at the Second International Conference on Advanced Computing, Machine Learning, Robotics and Internet Technologies (AMRIT 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15267 2026-01-22 cs.CY cs.AI cs.CL 90%

Evaluation of Large Language Models in Legal Applications: Challenges, Methods, and Future Directions

评估大型语言模型在法律应用中的表现:挑战、方法与未来方向

Yiran Hu, Huanghai Liu, Chong Wang, Kunran Li, Tien-Hsuan Wu, Haitao Li, Xinran Xu, Siqing Huo, Weihang Su, Ning Zheng, Siyuan Zheng, Qingyao Ai, Yun Liu, Renjun Bian, Yiqun Liu, Charles L. A. Clarke, Weixing Shen, Ben Kao

机构 * Tsinghua University(清华大学) The University of Hong Kong(香港大学) University of Waterloo(多伦多大学) Shanghai Jiaotong University(上海交通大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22936 2026-01-21 cs.CL cs.AI cs.CE cs.HC q-fin.CP 90%

Evaluating Large Language Models (LLMs) in Financial NLP: A Comparative Study on Financial Report Analysis

评估大型语言模型(LLMs)在金融NLP中的表现:对财务报告分析的比较研究

Md Talha Mohsin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了五种基于transformer的LLMs在财务报告分析中的表现,发现模型在不同评估维度上表现各异,需考虑人类主观性和行为差异性。

Comments 23 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.08464 2026-01-21 cs.CL cs.LG cs.SI 90%

Large Language Models Meet Stance Detection: A Survey of Tasks, Methods, Applications, Challenges and Future Directions

大语言模型与立场检测:任务、方法、应用、挑战与未来方向的综述

Lata Pangtey, Anukriti Bhatnagar, Shubhi Bansal, Shahid Shafi Dar, Nagendra Kumar

机构 * Department of Computer Science and Engineering, Indian Institute of Technology (IIT) Indore, Indore 453552, India(计算机科学与工程系,印度理工学院(IIT)印多尔,印多尔453552,印度)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了大语言模型在立场检测中的任务、方法、应用及挑战,提出分类框架并探讨未来发展方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02650 2026-01-21 cs.CL cs.AI 90%

Undesirable Memorization in Large Language Models: A Survey

大语言模型中的不良记忆现象:综述

Ali Satvaty, Suzan Verberne, Fatih Turkmen

机构 * University of Groningen(Groningen大学) Leiden University(莱顿大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型中记忆化现象的文献,探讨了其分类、度量方法、成因及缓解策略,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15304 2026-01-19 cs.CL cs.AI 90%

Adversarial Poetry as a Universal Single-Turn Jailbreak Mechanism in Large Language Models

对抗性诗歌作为大型语言模型中的通用单轮绕过机制

Piercosma Bisconti, Matteo Prandi, Federico Pierucci, Francesco Giarrusso, Marcantonio Bracale Syrnikov, Marcello Galisai, Vincenzo Suriani, Olga Sorokoletova, Federico Sartore, Daniele Nardi

机构 * DEXAI – Icaro Lab(DEXAI–Icaro实验室) Sapienza University of Rome(罗马Sapienza大学) Sant’Anna School of Advanced Studies(Sant’Anna高级研究学校) VU Amsterdam(阿姆斯特丹VU)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 对抗性诗歌被证明能有效绕过大型语言模型的安全机制,其攻击成功率显著高于传统方法,揭示了现有安全措施的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07153 2026-01-13 cs.CL cs.AI 90%

Can Large Language Models Understand, Reason About, and Generate Code-Switched Text?

大语言模型能否理解、推理并生成混合语言文本?

Genta Indra Winata, David Anugraha, Patrick Amadeus Irawan, Anirban Das, Haneul Yoo, Paresh Dashore, Shreyas Kulkarni, Ruochen Zhang, Haruki Sakajo, Frederikus Hudi, Anaelia Ovalle, Syrielle Montariol, Felix Gaschi, Michael Anugraha, Rutuj Ravindra Puranik, Zawad Hayat Ahmed, Adril Putra Merin, Emmanuele Chersoni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过CodeMixQA基准测试评估大语言模型在理解、推理和生成混合语言文本方面的能力,揭示了模型在混合语言环境中的局限性,并提供了改进多语言LLMs的见解。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06937 2026-01-13 cs.AI cs.LG 90%

mind_call: A Dataset for Mental Health Function Calling with Large Language Models

mind_call: 一个用于大语言模型心理健康新功能调用的数据集

Fozle Rabbi Shafi, M. Anwar Hossain, Salimur Choudhury

机构 * School of Computing, Queen’s University Kingston(计算学院,女王大学金斯顿)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 mind_call数据集通过合成功能调用任务,为大语言模型在心理健康领域的应用提供支持,涵盖多种自然语言查询与标准化API调用的映射,促进意图识别和可靠功能调用的研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10662 2026-01-13 cs.CL cs.AI 90%

Evaluation of the Automated Labeling Method for Taxonomic Nomenclature Through Prompt-Optimized Large Language Model

通过提示优化的大型语言模型评估自动标注方法在分类学命名中的应用

Keito Inoshita, Kota Nojiri, Haruto Sugeno, Takumi Taga

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文通过提示优化的大型语言模型评估了自动标注方法在分类学命名中的可行性,发现其在形态、地理和人名类别中表现良好,但在生态与行为及文化背景类别中存在挑战。

Comments This paper was accepted by IEEE IAICT

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04534 2026-01-09 cs.CL cs.AI 90%

BanglaLorica: Design and Evaluation of a Robust Watermarking Algorithm for Large Language Models in Bangla Text Generation

BanglaLorica: 大型语言模型在孟加拉语文本生成中的鲁棒水印算法设计与评估

Amit Bin Tariqul, A N M Zahid Hossain Milkan, Sahab-Al-Chowdhury, Syed Rifat Raiyan, Hasan Mahmud, Md Kamrul Hasan

机构 * Systems and Software Lab (SSL) Department of Computer Science and Engineering(系统与软件实验室(SSL)计算机科学与工程系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出分层水印策略,提升孟加拉语LLM在RTT攻击下的检测精度,实现3-4倍的相对提升。

Comments Under review, 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02404 2026-01-07 cs.CL cs.AI 90%

PCEval: A Benchmark for Evaluating Physical Computing Capabilities of Large Language Models

PCEval: 一个评估大型语言模型物理计算能力的基准

Inpyo Song, Eunji Jeon, Jangwon Lee

机构 * Department of Immersive Media Engineering(沉浸媒体工程系) Sungkyunkwan University(成均馆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 PCEval是一个评估大型语言模型物理计算能力的基准,通过自动评估电路生成和硬件交互能力,揭示LLMs在物理布局设计中的不足。

Comments Code and Dataset available at https://github.com/Null99-Dog/PCEval-Dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01812 2025-12-30 cs.CL cs.LG 90%

SelfCheck-Eval: A Multi-Module Framework for Zero-Resource Hallucination Detection in Large Language Models

SelfCheck-Eval: 一个用于大型语言模型中零资源幻觉检测的多模块框架

Diyana Muhammed, Giusy Giulia Tuccari, Gollam Rabby, Sören Auer, Sahar Vahdati

机构 * Department of Mathematics and Computer Science, University of Catania(卡塔尼亚大学数学与计算机科学系) L3S Research Center, Leibniz University Hannover(汉诺威莱布尼茨大学L3S研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 SelfCheck-Eval提出了一种多模块框架,专门用于检测大型语言模型在数学推理中的幻觉问题,通过三个独立模块提升检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏