arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2602.15063 2026-02-18 cs.RO cs.HC 89%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13941 2026-02-17 cs.HC 89%

Avoiding Social Judgment, Seeking Privacy: Investigating why Mothers Shift from Facebook Groups to Large Language Models

避免社会评判,寻求隐私:探究母亲为何从Facebook群组转向大型语言模型

Shayla Sharmin, Sadia Afrin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨母亲为何从Facebook群组转向LLM,发现社会评判和隐私需求驱动这一转变,LLM提供即时且安全的支持替代方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11588 2026-02-13 cs.CV 89%

A Large Language Model for Disaster Structural Reconnaissance Summarization

一种用于灾害结构侦察总结的大型语言模型

Yuqing Gao, Guanren Zhou, Khalid M. Mosalam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种基于大型语言模型的灾害结构侦察总结框架,通过整合视觉数据与文本元数据,提升灾后结构评估的效率和准确性。

Comments 8 pages, 4 figures. Presented at the 18th World Conference on Earthquake Engineering (18WCEE 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11022 2026-02-12 cs.IT math.IT 89%

Information Abstraction for Data Transmission Networks based on Large Language Models

基于大语言模型的数据传输网络中的信息抽象

Haoyuan Zhu, Haonan Hu, Jie Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出信息抽象度(DIA)作为衡量信息压缩与语义保留的度量,通过大语言模型引导的视频传输实验,展示了DIA在降低传输开销和保持语义保真方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10119 2026-02-12 cs.LG cs.AI cs.CL cs.CY 89%

Large Language Models Predict Functional Outcomes after Acute Ischemic Stroke

大型语言模型预测急性缺血性中风后的功能结局

Anjali K. Kapoor, Anton Alyakin, Jin Vivian Lee, Eunice Yang, Annelene M. Schulze, Krithik Vishwanath, Jinseok Lee, Yindalon Aphinyanaphongs, Howard Riina, Jennifer A. Frontera, Eric Karl Oermann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型在预测急性缺血性中风后功能结局中的有效性,发现微调后的Llama模型在准确率上表现优异,可替代传统结构化数据方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08192 2026-02-10 cs.SE 89%

Adoption of Large Language Models in Scrum Management: Insights from Brazilian Practitioners

大语言模型在Scrum管理中的应用:来自巴西实践者的洞察

Mirko Perkusich, Danyllo Albuquerque, Allysson Allex Araújo, Matheus Paixão, Rohit Gheyi, Marcos Kalinowski, Angelo Perkusich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了大语言模型在Scrum管理中的应用,发现其在提升生产率和减少手动工作方面有显著益处,但同时也面临输出准确性和保密性等风险。

Comments Accepted for publication at the 27th International Conference on Agile Software Development (XP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05401 2026-02-06 cs.CR 89%

BadTemplate: A Training-Free Backdoor Attack via Chat Template Against Large Language Models

BadTemplate: 一种通过聊天模板进行的无训练后门攻击针对大语言模型

Zihan Wang, Hongwei Li, Rui Zhang, Wenbo Jiang, Guowen Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 BadTemplate通过在系统提示中植入恶意指令实现无训练后门攻击,有效提升攻击成功率并引发严重安全风险。

Comments This paper includes biased content that may be disturbing or offensive to certain readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04358 2026-02-05 cs.SE 89%

Generative AI in Systems Engineering: A Framework for Risk Assessment of Large Language Models

生成式AI在系统工程中的应用:大型语言模型风险评估框架

Stefan Otten, Philipp Reis, Philipp Rigoll, Joshua Ransiek, Tobias Schürmann, Jacob Langner, Eric Sax

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于评估大型语言模型在系统工程中应用风险的框架,通过自主性和影响两个维度分类,帮助组织实现安全透明的部署。

Comments Accepted at IEEE SysCon 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02712 2026-02-05 cs.CL cs.AI cs.LG 89%

Time-To-Inconsistency: A Survival Analysis of Large Language Model Robustness to Adversarial Attacks

时间到不一致:大型语言模型对对抗攻击鲁棒性的生存分析

Yubo Li, Ramayya Krishnan, Rema Padman

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过生存分析方法评估大型语言模型在多轮对话中的鲁棒性,发现语义漂移对不一致风险的影响,并提出轻量级模型用于提前检测失败对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06276 2026-02-04 cs.SE cs.CR 89%

Automated Generation of Accurate Privacy Captions From Android Source Code Using Large Language Models

基于大语言模型的Android源代码中准确隐私描述的自动化生成

Vijayanta Jain, Sepideh Ghanavati, Sai Teja Peddinti, Collin McMillan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出PCapGen方法,利用大语言模型自动从Android源代码生成准确、简洁的隐私描述,有效解决现有方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15567 2026-02-03 cs.CR cs.SE 89%

MalCVE: Malware Detection and CVE Association Using Large Language Models

MalCVE: 使用大语言模型进行恶意软件检测与CVE关联

Eduard Andrei Cristea, Petter Molnes, Jingyue Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 MalCVE利用大语言模型检测恶意软件并关联CVE,实现高准确率的恶意软件识别和漏洞关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21877 2026-02-03 cs.NE 89%

Evolution of Benchmark: Black-Box Optimization Benchmark Design through Large Language Model

基准的演变:通过大语言模型进行黑盒优化基准设计

Chen Wang, Sijie Ma, Zeyuan Ma, Yue-Jiao Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EoB,一种基于大语言模型的自动黑盒优化基准设计师,通过双目标优化提升基准的多样性和算法区分能力,适用于多维应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11708 2026-02-03 cs.SE 89%

From Evaluation to Enhancement: Large Language Models for Zero-Knowledge Proof Code Generation

从评估到增强:大型语言模型在零知识证明代码生成中的应用

Zhantong Xue, Pingchuan Ma, Zhaoyu Wang, Yuguang Zhou, Xiaoqin Zhang, Shuai Wang, Juergen Rahmel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出ZK-Eval和ZK-Coder,通过评估和增强大型语言模型在零知识证明代码生成中的能力,显著提高了ZK程序的生成成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20879 2026-01-30 cs.SE 89%

A Survey on Large Language Model Impact on Software Evolvability and Maintainability: the Good, the Bad, the Ugly, and the Remedy

对大型语言模型对软件可变性与可维护性影响的综述:好坏优劣及解决方法

Bruno Claudino Matias, Savio Freire, Juliana Freitas, Felipe Fronchetti, Kostadin Damevski, Rodrigo Spinola

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型对软件可变性与可维护性的影响,分析了其带来的积极影响、潜在风险及缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20727 2026-01-29 cs.CY 89%

Audit Trails for Accountability in Large Language Models

为大型语言模型问责制设计的审计追踪

Victor Ojewale, Harini Suresh, Suresh Venkatasubramanian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出了一种用于大型语言模型的审计追踪机制,通过生命周期框架和参考架构,实现持续问责,提供可重用的开源实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18945 2026-01-28 cs.DL 89%

Large Language Models for Departmental Expert Review Quality Scores

大型语言模型用于部门专家评审质量评分

Liv Langfeldt, Dag W. Aksnes, Henrik Karlstrøm, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了大型语言模型在内部部门评审中预测学术文章质量评分的能力,发现其与专家评分存在中等相关性,但报告质量低于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09493 2026-01-27 cs.IR 89%

Evaluating Conversational Recommender Systems via Large Language Models: A User-Centric Framework

通过大语言模型评估对话推荐系统:一种以用户为中心的框架

Nuo Chen, Quanyu Dai, Xiaoyu Dong, Piaohong Wang, Qinglin Jia, Zhaocheng Du, Zhenhua Dong, Xiao-Ming Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出CoRE框架,通过大语言模型评估对话推荐系统,结合用户评价和多代理辩论,提升用户体验评估的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13118 2026-01-21 cs.SE 89%

Guidelines to Prompt Large Language Models for Code Generation: An Empirical Characterization

为大型语言模型生成代码的指南:实证分析

Alessandro Midolo, Alessandro Giagnorio, Fiorella Zampetti, Rosalia Tufano, Gabriele Bavota, Massimiliano Di Penta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文通过实证分析提出10条提示优化指南,帮助开发者改进代码生成提示,提升LLM辅助软件开发工具的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10194 2026-01-16 quant-ph physics.chem-ph 89%

Autonomous Quantum Simulation through Large Language Model Agents

通过大语言模型代理实现自主量子模拟

Weitang Li, Jiajun Ren, Lixue Cheng, Cunxi Gong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大语言模型代理实现自主量子模拟,通过上下文学习和多代理架构提升模拟效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07290 2026-01-13 cs.CV 89%

VideoLoom: A Video Large Language Model for Joint Spatial-Temporal Understanding

VideoLoom:一种用于联合空间-时间理解的视频大语言模型

Jiapeng Shi, Junke Wang, Zuyao You, Bo He, Zuxuan Wu

机构 * Fudan University(复旦大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 VideoLoom是一种用于联合空间-时间理解的视频大语言模型,通过LoomData-8.7k数据集和LoomBench基准测试,在多个视频理解任务中取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02533 2026-01-13 cs.SE 89%

Meta-Fair: AI-Assisted Fairness Testing of Large Language Models

Meta-Fair: 大型语言模型的AI辅助公平性测试

Miguel Romero-Arjona, José A. Parejo, Juan C. Alonso, Ana B. Sánchez, Aitor Arrieta, Sergio Segura

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 Meta-Fair通过元测试法和LLM能力,实现大型语言模型的自动化公平性测试,揭示偏见并提高评估一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.08637 2026-01-12 cs.CL cs.AI cs.LG 89%

An Evaluation on Large Language Model Outputs: Discourse and Memorization

对大型语言模型输出的评估:论述与记忆

Adrian de Wynter, Xun Wang, Alex Sokolov, Qilong Gu, Si-Qing Chen

机构 * Microsoft Corporation(微软公司) University of York(约克大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文评估了大型语言模型输出的质量,发现记忆内容与输出质量相关,并探讨了减少记忆输出的缓解策略。

Comments Final version at Natural Language Processing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16070 2026-01-09 cs.SE 89%

LLM4Perf: Large Language Models Are Effective Samplers for Multi-Objective Performance Modeling

LLM4Perf: 大语言模型在多目标性能建模中的有效性

Xin Wang, Zhenhao Li, Zishuo Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 LLM4Perf通过大语言模型实现多目标性能建模,展现了其在配置空间修剪和反馈优化方面的有效性,提升了性能建模的准确性。

Comments ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05319 2026-01-08 cs.CV cs.CR 89%

$\mathbf{S^2LM}$: Towards Semantic Steganography via Large Language Models

$S^2LM$:通过大语言模型实现语义隐写术

Huanqi Wu, Huangbiao Xu, Runfeng Xie, Jiaxin Cai, Kaixin Zhang, Xiao Ke

机构 * College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院) College of Computer Science, Beijing University of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 S^2LM通过大语言模型实现语义隐写术,能够将任意句级信息嵌入图像并实现恢复。

Comments 30 Pages, 24 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04214 2026-01-06 cs.CR 89%

Can Large Language Models Automate the Refinement of Cellular Network Specifications?

大语言模型能否自动化细胞网络规范的细化?

Jianshuo Dong, Yuanjie Li, Jun Liu, Hewu Li, Han Qiu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大语言模型在自动化细胞网络规范细化中的应用,通过CR-Eval基准测试验证了模型的有效性,并展示了LLM专业化在提升性能方面的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14716 2026-01-06 cs.LG cs.AI cs.CL 89%

A Systematic Survey on Large Language Models for Algorithm Design

大型语言模型在算法设计中的系统性调研

Fei Liu, Yiming Yao, Ping Guo, Zhiyuan Yang, Zhe Zhao, Xi Lin, Xialiang Tong, Kun Mao, Zhichao Lu, Zhenkun Wang, Mingxuan Yuan, Qingfu Zhang

机构 * City University of Hong Kong(香港城市大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Xi'an Jiaotong University(西安交通大学) Huawei Cloud EI Service Product Dept.(华为云EI服务产品部) Southern University of Science(南方科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文系统性地综述了大型语言模型在算法设计中的应用,提出分类法分析其角色并指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24518 2026-01-01 cs.CV 89%

Using Large Language Models To Translate Machine Results To Human Results

利用大型语言模型将机器结果转换为人类结果

Trishna Niraula, Jonathan Stubblefield

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用YOLOv5和YOLOv8结合大型语言模型生成胸部X光图像的自然语言放射学报告,验证了AI生成报告与人类报告的语义相似性及临床准确性。

Comments 11 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24058 2026-01-01 cs.CL cs.AI cs.LG 89%

Beyond Hallucinations: A Composite Score for Measuring Reliability in Open-Source Large Language Models

超越幻觉:一种衡量开源大语言模型可靠性的综合评分

Rohit Kumar Salla, Manoj Saravanan, Shrikar Reddy Kota

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出综合可靠性评分(CRS)用于评估开源大语言模型的可靠性,通过实验发现最可靠的系统在准确率、鲁棒性和校准不确定性间取得平衡。

Comments 5 pages, 4 tables, accepted at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.03297 2025-12-29 cs.HC 89%

"It's the only thing I can trust": Envisioning Large Language Model Use by Autistic Workers for Communication Assistance

只有一件事我可信任:面向自闭症工作者的大型语言模型在沟通辅助中的应用展望

JiWoong Jang, Sanika Moharana, Patrick Carrington, Andrew Begel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨自闭症工作者在工作中使用LLM进行沟通辅助的现象,发现参与者更倾向LLM,但专家对其建议持质疑态度,提出需关注自闭症体验的设计考量。

Comments 19 pages, 6 figure, CHI '24 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21439 2025-12-29 cs.CL cs.AI cs.LG 89%

Morality is Contextual: Learning Interpretable Moral Contexts from Human Data with Probabilistic Clustering and Large Language Models

道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型

Geoffroy Morlat, Marceau Nahon, Augustin Chartouny, Raja Chatila, Ismael T. Freire, Mehdi Khamassi

机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) Sorbonne University(索邦大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。

Comments 11 pages, 5 figures, +24 pages of Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏