arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2604.21377 2026-04-24 cs.RO cs.HC 91%

A Replicable Robotics Awareness Method Using LLM-Enabled Robotics Interaction: Evidence from a Corporate Challenge

一种利用LLM增强的机器人交互方法进行可复制的机器人意识:来自企业挑战的证据

S. A. Prieto, M. A. Gopee, Y. Ben Arab, B. García de Soto, J. Esteba, P. Olivera Brizzio

机构 * KINESIS Core Technology Platform, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校KINESIS核心科技平台) S.M.A.R.T. Construction Research Group, Division of Engineering, New York University Abu Dhabi (NYUAD)(纽约大学阿布扎比分校S.M.A.R.T.建筑研究小组) AD Ports Group, Corporate Innovation Department(AD Ports集团企业创新部)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于挑战的机器人意识方法,通过LLM增强的人形机器人与阿德港集团员工的互动,展示了在工业环境中提升机器人意识的可行性与可复制性。

Comments 10 pages, 8 Figures, to be submitted for journal per-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20310 2026-04-23 cs.HC 91%

Odor Maps from the LLM-derived similarity scores

从LLM衍生的相似性得分生成气味图

Yuki Harada, Manuel Aleixandre, Manabu Okumura, Takamichi Nakamoto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过比较LLM生成的气味相似性与原始数据距离,验证了LLM在气味图生成中的潜力,展示了精油在气味图中的分布与人类评价的一致性。

Comments 9 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00253 2026-04-23 cs.SE 91%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17750 2026-04-21 cs.CR cs.PL 91%

SDLLMFuzz: Dynamic-static LLM-assisted greybox fuzzing for structured input programs

SDLLMFuzz: 动-静态LLM辅助灰盒模糊测试用于结构化输入程序

Yihao Zou, Tianming Zheng, Futai Zou, Yue Wu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出SDLLMFuzz框架,结合LLM生成结构化输入并利用静态崩溃分析,通过动态-静态反馈机制提升模糊测试效率,实验表明其在漏洞发现和时间效率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17699 2026-04-21 cs.SE 91%

SelfHeal: Empirical Fix Pattern Analysis and Bug Repair in LLM Agents

SelfHeal:LLM代理中故障修复模式的实证分析与故障修复

Niful Islam, Muhammad Anas Raza, Mohammad Wardat

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究LLM代理中的故障修复模式,提出首个基准数据集AgentDefect,并设计SelfHeal多智能体系统,利用ReAct代理结合内部和外部知识实现高效故障修复。

Comments Accepted at EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17093 2026-04-21 cs.CR 91%

HarmChip: Evaluating Hardware Security Centric LLM Safety via Jailbreak Benchmarking

HarmChip:通过禁用基准测试评估以硬件安全为中心的LLM安全

Zeng Wang, Minghao Shao, Weimin Fu, Prithwish Basu Roy, Xiaolong Guo, Ramesh Karri, Muhammad Shafique, Johann Knechtel, Ozgur Sinanoglu

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HarmChip基准测试,评估LLM在硬件安全领域的禁用脆弱性,涵盖16个领域、120种威胁和360个提示,揭示了先进LLM在安全查询与伪装攻击间的矛盾表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02592 2026-04-15 cs.CY 91%

AI Fact-Checking in the Wild: A Field Evaluation of LLM-Written Community Notes on X

在野中的AI事实核查:在X平台上的LLM生成社区笔记现场评估

Haiwen Li, Michiel A. Bakker

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文首次在X平台现场评估LLM生成的社区笔记,通过三个月的测试发现LLM笔记在不同政治立场的评价者中获得更高正面评分,证明其在事实核查中的广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11438 2025-11-17 cs.CV 91%

VP-Bench: A Comprehensive Benchmark for Visual Prompting in Multimodal Large Language Models

Mingjie Xu, Jinpeng Chen, Yuzhi Zhao, Jason Chun Lok Li, Yue Qiu, Zekang Du, Mengyang Wu, Pingping Zhang, Kun Li, Hongzheng Yang, Wenao Ma, Jiaheng Wei, Qinbin Li, Kangcheng Liu, Wenqiang Lei

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

Comments This is the extended version of the paper accepted at AAAI 2026, which includes all technical appendices and additional experimental details

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09724 2025-09-15 cs.CL cs.AI cs.LG 91%

DiTTO-LLM: Framework for Discovering Topic-based Technology Opportunities via Large Language Model

Wonyoung Kim, Sujeong Seo, Juhyun Lee

机构 * Department of Library and Information Science(图书馆与信息科学系) Chung-Ang University(Chung-Ang 大学) Insurance Strategy Planning Team(保险战略规划团队) Postal Savings & Insurance Development Institute(邮政储蓄与保险发展研究所) Future Technology Analysis Center(未来技术分析中心) Korea Institute of Science and Technology Information(韩国科学技术信息院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.CL、cs.AI、cs.LG

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16456 2025-07-23 eess.AS cs.SD 91%

An approach to measuring the performance of Automatic Speech Recognition (ASR) models in the context of Large Language Model (LLM) powered applications

Sujith Pulikodan, Sahapthan K, Prasanta Kumar Ghosh, Visruth Sanka, Nihar Desai

机构 * Department of Mathematics(数学系) Department of Electrical Engineering(电气工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted at INTERSPEECH 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00853 2025-05-05 cs.CY 91%

LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models

Junfeng Jiao, Saleh Afroogh, Abhejay Murali, Kevin Chen, David Atkinson, Amit Dhurandhar

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11070 2024-12-17 cs.CV 91%

HC-LLM: Historical-Constrained Large Language Models for Radiology Report Generation

Tengfei Liu, Jiapu Wang, Yongli Hu, Mingjie Li, Junfei Yi, Xiaojun Chang, Junbin Gao, Baocai Yin

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted by AAAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13596 2024-12-02 cs.CV 91%

EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing

Wei Zhang, Miaoxin Cai, Tong Zhang, Jun Li, Yin Zhuang, Xuerui Mao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.04987 2024-09-10 cs.HC 91%

How to Align Large Language Models for Teaching English? Designing and Developing LLM based-Chatbot for Teaching English Conversation in EFL, Findings and Limitations

Jaekwon Park, Jiyoung Bae, Unggi Lee, Taekyung Ahn, Sookbun Lee, Dohee Kim, Aram Choi, Yeil Jeong, Jewoong Moon, Hyeoncheol Kim

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.21593 2024-08-01 cs.HC 91%

LLM-for-X: Application-agnostic Integration of Large Language Models to Support Personal Writing Workflows

Lukas Teufelberger, Xintong Liu, Zhipeng Li, Max Moebus, Christian Holz

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11007 2024-06-18 cs.CR cs.SE 91%

Threat Modelling and Risk Analysis for Large Language Model (LLM)-Powered Applications

Stephen Burabari Tete

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.05469 2024-05-10 cs.CR 91%

PLLM-CS: Pre-trained Large Language Model (LLM) for Cyber Threat Detection in Satellite Networks

Mohammed Hassanin, Marwa Keshk, Sara Salim, Majid Alsubaie, Dharmendra Sharma

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.12785 2023-11-22 cs.SE 91%

Prompting Frameworks for Large Language Models: A Survey

Xiaoxia Liu, Jingyi Wang, Jun Sun, Xiaohan Yuan, Guoliang Dong, Peng Di, Wenhai Wang, Dongxia Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.11515 2023-07-26 cs.SE 91%

Large Language Models are Few-shot Testers: Exploring LLM-based General Bug Reproduction

Sungmin Kang, Juyeon Yoon, Shin Yoo

专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted to IEEE/ACM International Conference on Software Engineering 2023 (ICSE 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07281 2023-04-28 cs.CL cs.AI cs.LG 91%

GrIPS: Gradient-free, Edit-based Instruction Search for Prompting Large Language Models

Archiki Prasad, Peter Hase, Xiang Zhou, Mohit Bansal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG

Comments EACL 2023 (20 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16712 2026-06-23 cs.CL cs.AI 版本更新 91%

The Chameleon Nature of LLMs: Quantifying Multi-Turn Stance Instability in Search-Enabled Language Models

LLM的变色龙本质:量化搜索增强语言模型中的多轮立场不稳定性

Shivam Ratnakar, Sanjay Raghavendra

机构 * University of Southern California(美国南加州大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 提出变色龙基准数据集和两个度量指标,揭示搜索增强LLM在多轮对话中因知识多样性不足而严重依赖查询框架,导致立场频繁摇摆。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MTI-LLM @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12343 2026-08-17 cs.CL 版本更新 91%

Lost in Historical Time? A Polish History Matura Benchmark for Large Language Models

大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试

Adrian Trzoss, Kacper Dudzic, Wiktor Werner, Marcin Moskalewicz

机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) IDEAS Research Institute(IDEAS研究院) AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) Poznań University of Medical Sciences(波兹南医科大学) Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) WSB Merito University(WSB梅里托大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL

AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08143 2026-08-11 cs.IR cs.CL 新提交 91%

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型

Anthony Miyaguchi, Conor Johnston

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。

Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03983 2026-08-05 cs.PL cs.AI 新提交 91%

Can Large Language Models Recover Semantic Optimization Opportunities That Compilers Miss?

大语言模型能否恢复编译器遗漏的语义优化机会?

Hailong Jiang, Feng Yu, Emran Hossain, Jianfeng Zhu, Mengfei Ren, Qiang Guan, Chunwei Xia

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文探究大语言模型能否恢复编译器遗漏的语义优化机会,推出含多类案例的可执行基准SeGaBench,实验显示最强模型生成的工件可实现较高正确率与加速比,证实LLM可作为编译器的补充语义提议者。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25425 2026-07-29 cs.AI cs.CR cs.CY 新提交 91%

The Disruptive Impact of Large Language Models on Capture the Flag Competitions and the Path Toward Fair Play

大语言模型对夺旗赛的颠覆性影响及公平竞赛之路

Michael Macaulay, Harmony Bouabid, Guo Gen Ang, Sasha Shaw

机构 * WMG, University of Warwick(华威大学制造工程学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究大语言模型对夺旗赛的影响,通过混合方法绘制人机能力边界,发现社区对AI参赛分歧源于竞赛目的不明。为此提出含分层分组、抗LLM挑战设计等的保障框架及决策工具,其适用于网络安全中以结果证能力的场景。

Comments 20 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29520 2026-06-30 cs.SE cs.AI cs.DB 91%

SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

SAKE:大型语言模型的软件架构知识评估基准

Tiziano Santilli, Francesco Daghero, Mayhar Tourchi Moghaddam

机构 * University of Southern Denmark(丹麦南方大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出SAKE基准,包含2154道专家策划的多选题,评估LLM在八个架构类别和四种上下文长度下的架构知识,揭示专业实践中的能力差距。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26541 2026-06-26 cs.LG cs.CY 新提交 91%

Can Large Language Models Reliably Code Qualitative Humanitarian Data? A Benchmark Study Against Human Expert Adjudication

大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究

Jerome Marston, Tino Kreutzer, Salomé Garnier, Ella Boone, Phuong N Pham, Patrick Vinck

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。

Comments 34 pages, 4 tables, 3 Annexes

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22797 2026-06-23 cs.AI cs.CY cs.GT econ.GN q-fin.EC 新提交 91%

Measuring Behavior Portability in Large Language Models

测量大型语言模型中的行为可移植性

Tianjia Dong, Nadav Kunievsky, James A. Evans

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Data Science Institute Department of Sociology University of Chicago(芝加哥大学数据科学研究所社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出一个形式化框架,通过拟合可解释行为模型并评估其在目标环境中的预测性能,量化LLM在不同支付等价决策环境中的行为可移植性,实验发现显著且系统的可移植性损失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17702 2026-06-23 cs.CV cs.AI 新提交 91%

SegTME-UNI2: A Foundation Model-Based Framework for Generalisable Multiclass Cell Segmentation and LLM-Driven Tumour Microenvironment Characterisation in Histopathology

SegTME-UNI2: 一种基于基础模型的可泛化多类细胞分割框架及LLM驱动的组织微环境表征在组织病理学中的应用

Wan Siti Halimatul Munirah Wan Ahmad, Faris Syahmi Samidi, Mohammad Badal Ahmmed, Vimal Angela Thiviyanathan, Selvam Thavaraj, Anwar P. P. Abdul Majeed

机构 * Department of Data Science and Artificial Intelligence, School of Computing and Artificial Intelligence, Faculty of Engineering and Technology, Sunway University(双威大学工程与技术学院计算与人工智能学院数据科学与人工智能系) Faculty of Dentistry, Universiti Malaya(马来亚大学牙科学院)

专题命中 评测与基准 :LLM(title,title_cn);foundation model(title,abstract);分类 cs.AI

AI总结 提出SegTME-UNI2框架,结合UNI2-H病理基础模型与双头UperNet解码器实现六类语义分割和核实例分割,通过三阶段伪标签课程学习解决标注不足问题,并利用LLM生成临床可解释的TME报告。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13104 2026-06-12 cs.LG 新提交 91%

Authority, Truth, and Citation Bias: A Large-Scale Multi-Domain Benchmark for Studying Epistemic Susceptibility in Large Language Models

权威、真实性与引文偏差:研究大语言模型认知易感性的大规模多领域基准

Aryan Khurana, Aravind Ramana RN, Dhruv Kumar

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 提出AuthorityBench基准,通过2x2因子设计隔离引文权威信号对LLM认知行为的影响,发现引文存在(无论真假)均提高幻觉率,真声明搭配假引文时幻觉率上升3-22个百分点。

Comments 10 pages, 5 figures. Accepted to AI4GOOD and EIML at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏