arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2604.14161 2026-04-17 cs.CL cs.AI cs.LG 89%

Can Large Language Models Detect Methodological Flaws? Evidence from Gesture Recognition for UAV-Based Rescue Operation Based on Deep Learning

大语言模型能检测方法学缺陷吗?基于深度学习的无人机救援操作中的手势识别证据

Domonkos Varga

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否独立检测研究中的方法学缺陷,通过分析手势识别论文发现模型能识别数据泄露问题,证明其在提升可重复性中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13504 2026-04-16 cs.LG cs.AI cs.CL cs.MA cs.RO 89%

Chain of Uncertain Rewards with Large Language Models for Reinforcement Learning

基于大语言模型的强化学习中不确定奖励链

Shentong Mo

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoUR框架,利用大语言模型优化强化学习中的奖励函数设计,通过不确定性量化和贝叶斯优化提升效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07273 2026-04-10 stat.ME stat.AP 89%

Impact of Label Noise from Large Language Models Generated Annotations on Evaluation of Diagnostic Model Performance

大型语言模型生成标注的标签噪声对诊断模型性能评估的影响

Mohammadreza Chavoshi, Hari Trivedi, Janice Newsome, Aawez Mansuri, Chiratidzo Rudado Sanyika, Rohan Satya Isaac, Frank Li, Theo Dapamede, Judy Gichoya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了大型语言模型生成的标签噪声对诊断模型性能评估的影响,通过模拟框架分析了标签误差对模型表现的敏感性,并指出在不同疾病患病率下,标签质量对性能估计的系统性偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07705 2026-04-10 cs.RO 89%

Vision-Language Navigation for Aerial Robots: Towards the Era of Large Language Models

面向大语言模型时代的空中机器人视觉-语言导航

Xingyu Xia, Lekai Zhou, Yujie Tang, Xiaozhou Zhu, Hai Zhu, Wen Yao

机构 * Defense Innovation Institute, Chinese Academy of Military Sciences(军事科学院国防创新研究院) Intelligent Game and Decision Laboratory(智能博弈与决策实验室) Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了空中机器人视觉-语言导航领域,分析了大语言模型与视觉-语言模型的整合,归纳了五类架构方法,指出了评估体系的不足,并提出了七个开放性问题。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06048 2026-04-08 cond-mat.mtrl-sci 89%

Large Language Model Assisted Discovery of Optimal Dopants for Enhanced Thermoelectric Performance in CoSb$_3$ Based Skutterudites

基于大语言模型的优化掺杂剂发现以提高CoSb$_3$基硫化物的热电性能

Yagnik Bandyopadhyay, Dylan Noel Serrao, Houlong L. Zhuang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出一种数据驱动方法,利用大语言模型加速发现高性能CoSb$_3$基硫化物,通过训练回归头预测热电优值,降低均方误差,并通过密度泛函理论和分子动力学计算验证预测的掺杂剂性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11548 2026-04-08 cs.CR 89%

Copyright Protection for Large Language Models: A Survey of Methods, Challenges, and Trends

大型语言模型的版权保护:方法、挑战与趋势的综述

Zhenhua Xu, Xubin Yue, Zhebo Wang, Haobo Zhang, Qichen Liu, Xixiang Zhao, Jingxuan Zhang, Wenjun Zeng, Wengpeng Xing, Dezhang Kong, Changting Lin, Meng Han

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文综述了大型语言模型版权保护现状,重点探讨了模型指纹技术,涵盖文本水印与模型水印的关联、多种文本水印技术对比、模型指纹分类、指纹转移与去除技术及评估指标,揭示了开放挑战与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 89%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10656 2026-04-06 cs.SE 89%

Precision or Peril: A PoC of Python Code Quality from Quantized Large Language Models

精度与危险:从量化大语言模型中Python代码质量的证明概念

Eric L. Melin, Adam J. Torek, Nasir U. Eisty, Casey Kennington

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了小型LLM的代码生成性能及量化影响,发现生成代码存在质量和可维护性问题,强调在软件项目中需谨慎验证LLM生成的代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00677 2026-04-02 cs.CV 89%

CL-VISTA: Benchmarking Continual Learning in Video Large Language Models

CL-VISTA:视频大语言模型持续学习基准测试

Haiyang Guo, Yichen Shi, Fei Zhu, Wenzhuo Liu, Hongbo Zhao, Fanhu Zeng, Shijie Ma, Da-Han Wang, Xu-Yao Zhang

机构 * School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学前沿交叉科学学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) FKLPRIU, School of Computer and Information Engineering, Xiamen University of Technology(厦门理工学院计算机与信息工程学院福建省模式识别与图像理解重点实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 CL-VISTA通过8个多样化任务诱导分布偏移,评估持续学习方法在性能、效率和内存方面的权衡,揭示无单一最优解的特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00075 2026-04-02 q-bio.GN 89%

Large Language Models for Variant-Centric Functional Evidence Mining

基于变体的函数证据挖掘的大型语言模型

Ali Saadat, Jacques Fellay

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出利用大型语言模型挖掘变体功能证据,通过基准测试评估两种模型在文献筛选和证据提取中的表现,开发了AcmGENTIC管道以提升功能证据整理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15738 2026-04-01 cs.NE 89%

EvoDR: Evolving Dispatching Rules via Large Language Model for Dynamic Flexible Assembly Flow Shop Scheduling

EvoDR:基于大语言模型的动态柔性装配流水车间调度的进化调度规则

Junhao Qiu, Haoyang Zhuang, Fei Liu, Jianjun Liu, Qingfu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出EvoDR框架,利用大语言模型的语义理解能力,通过双专家共演化机制生成适应动态特征的调度规则,实验表明其在降低平均延误和鲁棒性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28374 2026-03-31 cs.CY 89%

Using Games to Learn How Large Language Models Work

通过游戏学习大语言模型的工作原理

Allison Chen, Isabella Pu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出两款游戏,通过游戏化方式展示大语言模型的工作原理与数据使用方法,旨在提升AI素养。

Comments CHI Conference on Human Factors in Computing Systems Workshop on Data Literacy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26142 2026-03-31 cs.HC 89%

Simulating Novice Students Using Machine Unlearning and Relearning in Large Language Models

利用机器去学习和再学习在大语言模型中模拟新手学生

Jiajia Song, Zhihan Guo, Jionghao Lin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于机器去学习的知识级模拟方法,通过转换知识丰富的LLM为新手级AI学生,评估其通过教学对话重新学习知识的能力,揭示了学生行为随时间的变化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24484 2026-03-26 cs.CV 89%

Video-Only ToM: Enhancing Theory of Mind in Multimodal Large Language Models

视频-only ToM:增强多模态大语言模型的理论思维

Siqi Liu, Xinyang Li, Bochao Zou, Junbao Zhuo, Huimin Ma, Jiansheng Chen

机构 * University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出VisionToM框架,通过视觉干预增强多模态大语言模型的理论思维能力,改进模型在多模态任务中的推理和问答性能。

Comments 20 pages, 7 figures, accepted at CVPR 2026, project page: see https://founce.github.io/VisionToM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01754 2026-03-26 cs.CL cs.AI cs.LG 89%

Evaluation of Large Language Models via Coupled Token Generation

通过耦合标记生成评估大语言模型

Nina Corvelo Benz, Stratis Tsirtsis, Eleni Straitouri, Ivi Chatzi, Ander Artola Velasco, Suhas Thejaswi, Manuel Gomez-Rodriguez

机构 * Max Planck Institute of Biochemistry(马克斯·普朗克生物化学研究所) Hasso Plattner Institute(哈索·platzer研究所) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所) Aalto University(阿尔托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过耦合自回归生成评估大语言模型,发现其在基准数据集和人机对比中产生不同排名,表明生成过程中的随机性可能影响评估结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15093 2026-03-24 eess.SP cs.IT math.IT 89%

Beam Prediction Based on Multimodal Large Language Models

基于多模态大语言模型的波束预测

Tianhao Mao, Le Liang, Jie Yang, Xiao Li, Shi Jin, Geoffrey Ye Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于多模态大语言模型的波束预测框架,通过融合RGB图像和LiDAR点云等异构数据,提升动态环境下波束预测精度与通信性能,实验表明其在波束准确性和通信性能上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14565 2026-03-17 cs.DL 89%

Can Large Language Models Evaluate Grant Proposal Quality? Revisiting the Wennerås and Wold Peer Review Data

大型语言模型能否评估项目申请质量?重新审视文纳斯和沃尔德同行评审数据

Ulf Sandström, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了大型语言模型在评分项目申请方面的准确性,发现其与专家评分的相关性较低,但可能在筛选或打破平局时有应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17113 2026-03-13 stat.ME stat.CO 89%

A systematic assessment of Large Language Models for constructing two-level fractional factorial designs

对大型语言模型构建两级分数因子设计的系统评估

Alan R. Vazquez, Kilian M. Rother, Marco V. Charles-Gonzalez

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文系统评估了GPT和Gemini模型在构建不同规模的两级分数因子设计中的性能,展示了其在优化设计生成中的有效性。

Comments 31 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03114 2026-03-12 cs.SE 89%

PromCopilot: Simplifying Prometheus Metric Querying in Cloud Native Online Service Systems via Large Language Models

PromCopilot: 通过大型语言模型简化云原生在线服务系统的Prometheus指标查询

Chenxi Zhang, Bicheng Zhang, Dingyu Yang, Xin Peng, Miao Chen, Senyu Xie, Gang Chen, Wei Bi, Wei Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PromCopilot通过大型语言模型简化云原生在线服务系统的Prometheus指标查询,首次提出文本到PromQL框架,准确率达69.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07602 2026-03-12 cs.SE 89%

OODEval: Evaluating Large Language Models on Object-Oriented Design

OODEval: 对象导向设计上评估大型语言模型

Bingxu Xiao, Yunwei Dong, Yiqi Tang, Manqing Zhang, Yifan Zhou, Chunyan Ma, Yepang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract)

AI总结 OODEval评估了29个大型语言模型在面向对象设计任务上的表现,揭示了LLMs在语义上的不足,并提出了CLUE度量集以评估类图生成质量。

Comments 32 pages,8 figures,10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03621 2026-03-06 cs.CV 89%

PhysLLM: Harnessing Large Language Models for Cross-Modal Remote Physiological Sensing

PhysLLM:利用大语言模型进行跨模态远程生理传感

Yiping Xie, Bo Zhao, Mingtong Dai, Jian-Ping Zhou, Yue Sun, Tao Tan, Weicheng Xie, Linlin Shen, Zitong Yu

机构 * Shenzhen University(深圳大学) Great Bay University(大鹏大学) National Engineering Laboratory for Big Data System Computing Technology(大数据系统计算技术国家工程实验室) Dongguan Key Laboratory for Intelligence and Information Technology(东莞智能与信息技术重点实验室) Guangdong Medical University(广东医科大学) Southern Medical University (Dongguan People’s Hospital)(南方医科大学(东莞人民医院)) Macao Polytechnic University(澳门理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 PhysLLM通过结合大语言模型与领域特定的rPPG组件,利用跨模态学习提升远程生理传感的准确性和鲁棒性。

Comments Accepted by International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04306 2026-03-05 stat.CO 89%

Theory Discovery in Social Networks: Automating ERGM Specification with Large Language Models

社交网络中的理论发现:利用大语言模型自动化ERGM规范

Yidan Sun, Mayank Kejriwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出Forge框架,利用大语言模型自动化ERGM规范,通过验证可行性与稳定性约束,提升社交网络形成机制的建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01341 2026-03-03 cs.SI 89%

Structural Hallucination in Large Language Models: A Network-Based Evaluation of Knowledge Organization and Citation Integrity

大语言模型中的结构幻觉:基于网络的对知识组织与引用完整性的评估

Moses Boudourides

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出基于网络的结构幻觉压力测试,评估大语言模型在知识组织与引用完整性方面的表现,发现其在不同领域存在显著的结构偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02185 2026-03-03 cs.CV cs.AI cs.CL cs.LG 89%

Vision-DeepResearch Benchmark: Rethinking Visual and Textual Search for Multimodal Large Language Models

视觉-深度研究基准:重新思考多模态大语言模型的视觉和文本搜索

Yu Zeng, Wenxuan Huang, Zhen Fang, Shuang Chen, Yufan Shen, Yishuo Cai, Xiaoman Wang, Zhenfei Yin, Lin Chen, Zehui Chen, Shiting Huang, Yiming Zhao, Xu Tang, Yao Hu, Philip Torr, Wanli Ouyang, Shaosheng Cao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Vision-DeepResearch基准,通过精心设计的问题评估多模态大语言模型的视觉与文本搜索能力,并引入多轮裁剪搜索流程提升实际检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06939 2026-02-27 cs.SE 89%

FeedbackEval: A Benchmark for Evaluating Large Language Models in Feedback-Driven Code Repair Tasks

FeedbackEval: 一个用于评估大型语言模型在反馈驱动的代码修复任务中的基准

Dekun Dai, MingWei Liu, Anji Li, Jialun Cao, Yanlin Wang, Chong Wang, Xin Peng, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 FeedbackEval通过系统性基准评估LLMs在反馈驱动的代码修复任务中的表现,揭示了不同反馈类型和提示结构对修复效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18935 2026-02-24 cs.DL cs.SE 89%

Responsible Intelligence in Practice: A Fairness Audit of Open Large Language Models for Library Reference Services

实践中的负责任智能:开放大型语言模型在图书馆参考服务中的公平性审计

Haining Wang, Jason Clark, Angelica Peña

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了三个开源大型语言模型在图书馆参考服务中的公平性,发现无显著种族差异,但存在轻微性别差异,强调持续监测的重要性。

Comments Invited chapter for the edited volume Artificial Intelligence and Social Justice Intersections in Library and Information Studies: Challenges and Opportunities (Emerald Group Publishing, in preparation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17791 2026-02-23 cs.CY 89%

The Digital Divide in Generative AI: Evidence from Large Language Model Use in College Admissions Essays

生成式AI的数字鸿沟:来自大学录取文书使用大型语言模型的证据

Jinsook Lee, Conrad Borchers, AJ Alvero, Thorsten Joachims, Rene F. Kizilcec

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究探讨了生成式AI在大学录取文书中的使用差异及其对录取结果的影响,发现低社会经济地位学生更依赖AI写作工具,但其录取成功率下降更明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02129 2026-02-20 cs.CE 89%

Benchmarking Large Language Models for Polymer Property Predictions

评估大型语言模型在聚合物性质预测中的表现

Sonakshi Gupta, Akhlak Mahmood, Shivank Shukla, Rampi Ramprasad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本研究评估了LLM在聚合物性质预测中的表现,发现LLaMA-3在性能上优于GPT-3.5,但整体预测准确性和效率仍低于传统方法,且单任务学习更有效。

Comments 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.06428 2026-02-18 cs.SE cs.CR 89%

Large Language Models for Secure Code Assessment: A Multi-Language Empirical Study

用于安全代码评估的大型语言模型:多语言实证研究

Kohei Dozono, Tiago Espinha Gasiba, Andrea Stocco

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文研究了多语言环境下大型语言模型在安全代码评估中的有效性,通过实验发现GPT-4o在漏洞检测和CWE分类中表现最佳,并开发了CODEGUARDIAN工具提升开发人员的漏洞检测效率。

Comments Accepted for publication at the 7th International Workshop on Deep Learning for Testing and Testing for Deep Learning (DeepTest 2026), co-located with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15063 2026-02-18 cs.RO cs.HC 89%

How Do We Research Human-Robot Interaction in the Age of Large Language Models? A Systematic Review

在大语言模型时代如何研究人机交互?一项系统综述

Yufeng Wang, Yuan Xu, Anastasia Nikolova, Yuxuan Wang, Jianyu Wang, Chongyang Wang, Xin Tong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Zhejiang University(浙江大学) Savannah College of Art and Design(萨凡纳艺术设计学院) West China Hospital, Sichuan University(四川大学华西医院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文系统综述了大语言模型时代人机交互的研究现状,揭示了LLMs对HRI基本原理的影响及当前研究的探索性特征,提出了未来研究的设计考虑与挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏