arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31906 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31906 篇

2606.28615 2026-06-30 cs.LG cs.AI cs.CL stat.ML 90%

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 23 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23571 2026-06-24 cond-mat.mtrl-sci 新提交 90%

INCARBench: A Benchmark for Scientific Configuration in VASP INCAR by Large Language Models

INCARBench: 大型语言模型在VASP INCAR科学配置中的基准测试

Bin Shao, Jixiang Li, Xinyue Zhang, Baishun Yang, Zhiyang Liu, Weichao Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn)

AI总结 提出INCARBench基准,通过配置生成与修复任务评估LLM在VASP输入配置上的能力,发现参数级正确性不保证科学有效性,错误集中在DFT+U、磁性和关联材料等物理耦合设置中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20603 2026-06-23 cs.CY 新提交 90%

A Survey of Large Language Models for Perception and Measurement of Human Psychology

大型语言模型在人类心理感知与测量中的综述

Yudong Li, Xiaoyi Chen, Jiawei Cai, Zehao Zhong, Haoyang Yang, Huajin Tang, Linlin Shen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文系统综述了大型语言模型(LLMs)作为人类心理测量工具的应用,从理论可行性、测量方法和应用效果三个维度构建分析框架,探讨其在人格评估和心理健康评价中的有效性及局限。

Comments Accepted by IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15334 2026-06-17 cs.NE 新提交 90%

Large Language Model-Driven Cooperative Operator Ensemble Evolution for Permutation Flow Shop Scheduling

大语言模型驱动的合作算子集成进化用于置换流水车间调度

Rui Xu, Yufan Liao, Haoze Lv, Shengcai Liu, Yi Mei, Ke Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对置换流水车间调度问题中经典迭代贪婪算法因单一破坏算子导致搜索停滞的问题,提出多算子IG算法IG-DOE,通过停滞触发的顺序切换机制增强探索,并引入大语言模型辅助框架SCOE自动构建高质量破坏算子集成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15152 2026-06-09 cs.CL cs.AI cs.LG 90%

What Level of Automation is "Good Enough"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction

什么是‘足够’的自动化水平?大型语言模型在元分析数据提取中的基准测试

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院) Massey University(梅西大学) Auckland, New Zealand(新西兰奥克兰)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文评估了三种大型语言模型在医疗领域数据提取中的性能,发现定制提示能显著提升召回率,提出三层次指南以平衡自动化与专家监督。

Journal ref Research Synthesis Methods (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02208 2026-06-02 cs.HC 90%

Context-Aware Workflow Decomposition for Automated Mobile UI Annotation Using Multimodal Large Language Models

基于多模态大语言模型的上下文感知工作流分解用于自动移动界面标注

Athar Parvez, Muhammad Jawad Mufti, Muqaddas Gull, Omar Hammad

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出一种将标注任务分解为多个上下文感知阶段的工作流方法,通过结构化提示、模式约束JSON输出和元素特定指令,在MUIAnno数据集上评估不同分解策略,发现两步工作流在精度上最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16654 2026-05-27 cs.CL cs.AI cs.LG 90%

Omanic: Towards Step-wise Evaluation of Multi-hop Reasoning in Large Language Models

Omanic:迈向大语言模型多跳推理的逐步评估

Xiaojie Gu, Sherry T. Tong, Aosong Feng, Sophia Simeng Han, Jinghui Lu, Yingjian Chen, Yusuke Iwasawa, Yutaka Matsuo, Chanjun Park, Rex Ying, Irene Li

机构 * The University of Tokyo(东京大学) Yale University(耶鲁大学) Stanford University(斯坦福大学) Xiaomi EV(小米EV) Soongsil University(顺天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型在多跳问答中中间步骤推理失败难以诊断的问题,提出Omanic基准,通过分解为单跳子问题并分析步骤级错误,揭示后期跳数瓶颈、事实知识下限和错误传播,微调后提升多个推理基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23465 2026-05-25 cs.CY 90%

IyàwóBench: A Benchmark for Evaluating Large Language Model Clinical Triage Accuracy on Undifferentiated Febrile Illness in Nigerian Primary Health Settings

IyàwóBench: 评估大型语言模型在尼日利亚初级卫生机构中对未分化发热性疾病的临床分诊准确性的基准

Anthonio Oladimeji Gabriel, Dimeji Abdulsobur Olawuyi, Oloruntoba Ajayi, Temiloluwa Aderemi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 针对西非初级卫生机构中未分化发热性疾病,构建了基于真实患者数据的合成临床病例基准IyàwóBench,评估六种LLM的分诊准确性和安全性,发现所有模型安全性达100%但准确性差异大,嵌入WHO指南的临床工程系统表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01253 2026-05-25 cs.SE 90%

TraceLLM: Leveraging Large Language Models with Prompt Engineering for Enhanced Requirements Traceability

TraceLLM:利用大型语言模型与提示工程增强需求可追溯性

Nouf Alturayeif, Irfan Ahmad, Jameleddine Hassine

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出TraceLLM框架,通过提示工程和示例选择,利用大型语言模型在零样本和少样本设置下提升需求可追溯性,在多个基准数据集上取得最优F2分数。

Journal ref Requirements Eng 31, 6 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12657 2026-05-14 cs.SE 90%

User Reviews as a Source for Usability Requirements: A Precursor Study on Using Large Language Models

用户评论作为可用性需求的来源:利用大语言模型的前期研究

Cedric Wellhausen, Laura Reinhardt, Kurt Schneider

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title)

AI总结 本文探讨利用大语言模型处理用户评论以提取可用性需求的可能性,提出了一套编码数据集和提示工程方法,并验证了LLM在识别可用性需求方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21682 2026-05-08 cs.CL cs.AI cs.CR cs.LG 90%

FIT to Forget: Robust Continual Unlearning for Large Language Models

FIT to Forget: 为大语言模型设计的鲁棒持续遗忘机制

Xiaoyu Xu, Minxin Du, Kun Fang, Yaxin Xiao, Zhicong Huang, Cheng Hong, Qingqing Ye, Haibo Hu

机构 * The Hong Kong Polytechnic University(香港理工大学) Ant Group(蚂蚁集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FIT框架,解决大语言模型持续删除请求中的遗忘与恢复问题,通过冗余过滤、重要性自适应算法选择和目标层归因机制,实现高效持续遗忘与性能保持。

Comments 26 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07794 2026-05-08 cs.IR 90%

Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey

预训练和大语言模型时代的问题扩展:综述

Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, Guodong Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文综述了预训练和大语言模型时代的问题扩展方法,探讨了不同模型家族如何实现新的扩展行为,并分析了四种设计维度下的最新技术,总结了应用模式和部署考虑,指出了未来挑战和方向。

Comments 42 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27666 2026-05-01 cs.CR 90%

VOW: Verifiable and Oblivious Watermark Detection for Large Language Models

VOW:用于大型语言模型的可验证且 oblivious 水印检测

Xiaokun Luan, Yihao Zhang, Pengcheng Su, Feiran Lei, Meng Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 VOW 提出一种隐私保护且可验证的水印检测协议,通过安全多方计算和可验证 oblivious 假随机函数实现高效检测,提升水印对抗现代改写攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25650 2026-04-29 cs.SE cs.SY eess.SY 90%

Using Large Language Models for Black-Box Testing of FMU-Based Simulations

利用大型语言模型对基于FMU的仿真进行黑盒测试

Abdullah Mughees, Gaadha Sudheerbabu, Tanwir Ahmad, Dragos Truscan, Mikael Manngård, Kristian Klemets

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出利用大型语言模型生成动态仿真模型的测试场景,通过结构化目标减少手动工作量并提高结果可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02537 2026-04-29 cs.DB 90%

Large Language Model-Enhanced Relational Operators: Taxonomy, Benchmark, and Analysis

大语言模型增强的关系运算符:分类、基准测试与分析

Yunxiang Su, Tianjing Zeng, Zhongjun Ding, Yin Lin, Rong Zhu, Zhewei Wei, Bolin Ding, Jingren Zhou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出统一的关系运算符分类,设计全面的基准测试,并评估不同实现下的运算符性能,以指导复杂语义查询系统的设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19111 2026-04-22 cs.HC 90%

Revisiting Framing Codebooks with AI: Employing Large Language Models as Analytical Collaborators in Deductive Content Analysis

重新审视框架代码本:利用大语言模型作为分析合作者进行演绎内容分析

Diego Gomez-Zara, Hernán Valdivieso, Jorge Pérez, Denis Parra, Sebastián Valenzuela

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出利用大语言模型辅助创建和优化框架代码本,通过结合理论框架与数据驱动探索,揭示潜在模式并支持迭代修订,提升分析方法的创造力同时保持研究者的解释权威。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18943 2026-04-22 cs.AI cs.CL cs.HC cs.IR cs.LG 90%

Personalized Benchmarking: Evaluating LLMs by Individual Preferences

个性化基准测试:通过个体偏好评估LLM

Cristina Garbacea, Heran Wang, Chenhao Tan

机构 * University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出个性化LLM基准测试,通过ELO评分和Bradley-Terry系数分析115名用户对LLM的排名差异,发现个体偏好与聚合排名差异显著,强调开发个性化基准的重要性。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13528 2026-04-16 eess.AS cs.SD 90%

Few-Shot and Pseudo-Label Guided Speech Quality Evaluation with Large Language Models

基于少量样本和伪标签的语音质量评估方法

Ryandhimas E. Zezario, Dyah A. M. G. Wisnu, Szu-Wei Fu, Sabato Marco Siniscalchi, Hsin-Min Wang, Yu Tsao

机构 * Academia Sinica, National Chengchi University, NVIDIA, University of Palermo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出GatherMOS框架,利用大语言模型作为元评估器整合多种信号进行质量预测,通过零样本和少样本学习展示了其在不同条件下的优越性能。

Comments Accepted to IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02578 2026-04-14 cs.CL cs.AI cs.HC cs.LG 90%

How Controllable Are Large Language Models? A Unified Evaluation across Behavioral Granularities

大型语言模型有多可控?跨行为细粒度的统一评估

Ziwen Xu, Kewei Xu, Haoming Xu, Haiwen Hong, Longtao Huang, Hui Xue, Ningyu Zhang, Yongliang Shen, Guozhou Zheng, Huajun Chen, Shumin Deng

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SteerEval基准,从语言特征、情感和个性三个领域评估LLM可控性,揭示细粒度控制效果下降问题,提供安全可控的LLM行为框架。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18931 2026-04-14 cs.AI cs.CL cs.LG 90%

Can Large Language Models Infer Causal Relationships from Real-World Text?

大语言模型能否从现实文本中推断因果关系?

Ryan Saklad, Aman Chadha, Oleg Pavlov, Raha Moraffah

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Apple(苹果公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨大语言模型能否从现实文本中推断因果关系,构建了首个现实世界数据集,发现最佳模型在因果推断上的F1分数仅为0.535。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02754 2026-04-06 cs.SE 90%

An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models

基于小型语言模型的提示驱动测试脚本生成的实证研究

Pragati Kumari, Novarun Deb

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文通过HumanEval基准和适应性提示变体,实证分析小型语言模型在测试脚本生成中的环境与性能权衡,揭示提示结构与模型选择对环境和性能的影响。

Comments 6 pages. arXiv admin note: substantial text overlap with arXiv:2602.18012

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.04472 2026-04-01 cs.IR cs.AI cs.CL cs.LG 90%

EventChat: Implementation and user-centric evaluation of a large language model-driven conversational recommender system for exploring leisure events in an SME context

EventChat: 一种基于大语言模型的对话推荐系统在中小企业休闲活动探索中的实现与用户导向评估

Hannes Kunstmann, Joseph Ollier, Joel Persson, Florian von Wangenheim

机构 * Swiss Federal Institute of Technology, Zurich(苏黎世联邦理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于大语言模型的对话推荐系统,通过客观指标和用户评价评估其在中小企业场景下的性能,揭示了系统在用户体验和商业可行性方面的挑战。

Comments Just accepted version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27504 2026-03-31 cs.CV 90%

Transferring Physical Priors into Remote Sensing Segmentation via Large Language Models

通过大语言模型将物理先验转移到遥感分割中

Yuxi Lu, Kunqi Li, Zhidong Li, Xiaohan Su, Biao Wu, Chenya Huang, Bin Liang

机构 * University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出PriorSeg模型,利用物理先验提升遥感图像分割的准确性与物理合理性,通过构建物理中心知识图谱和异构数据集Phy-Sky-SA,无需重新训练即可提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23611 2026-03-26 cs.SE cs.AI cs.CL cs.LG 90%

LLMORPH: Automated Metamorphic Testing of Large Language Models

LLMORPH:大型语言模型的自动化形变测试

Steven Cho, Stefano Ruberto, Valerio Terragni

机构 * University of Auckland(奥克兰大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LLMORPH通过形变测试技术自动检测大型语言模型输出不一致问题,无需人工标注数据,适用于多种NLP任务和模型评估。

Comments Accepted for publication in the 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025). This arXiv version is the authors' accepted manuscript. DOI: 10.1109/ASE63991.2025.00385 Code: github.com/steven-b-cho/llmorph

Journal ref 40th IEEE/ACM International Conference on Automated Software Engineering (ASE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00026 2026-03-25 cs.LG cs.AI cs.CL cs.CY 90%

RedTopic: Toward Topic-Diverse Red Teaming of Large Language Models

RedTopic:迈向大语言模型的课题多样化红队测试

Jiale Ding, Xiang Zheng, Yutao Wu, Cong Wang, Wei-Bin Lee, Ling Pan, Xingjun Ma, Yu-Gang Jiang

机构 * Fudan University(复旦大学) City University of Hong Kong(香港城市大学) Deakin University(德克萨斯大学) Hon Hai Research Institute(鸿海研究室) Hong Kong University of Science and Technology(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RedTopic框架,通过上下文生成管道、聚合奖励设计和多目标RL训练循环,生成多样化对抗提示,提升红队测试的适应性和课题多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21022 2026-03-24 cs.AI cs.CL cs.LG 90%

Knowledge Boundary Discovery for Large Language Models

大型语言模型的知识边界发现

Ziquan Wang, Zhongqi Lu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出KBD框架,通过强化学习探索LLM的知识边界,通过自动生成可答与不可答问题识别边界,验证了方法的有效性。

Comments 9 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18898 2026-03-20 cs.IR 90%

Comparative Analysis of Large Language Models in Generating Telugu Responses for Maternal Health Queries

大型语言模型在生成母体健康问题Telugu回应中的比较分析

Anagani Bhanusree, Sai Divya Vissamsetty, K VenkataKrishna Rao, Rimjhim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 研究比较了ChatGPT-4o、GeminiAI和Perplexity AI在母体健康问题中的Telugu回应表现,通过语义相似性指标和专家评估发现Gemini在准确性与连贯性上表现最佳,Perplexity在Telugu提示下表现良好,ChatGPT需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19240 2026-03-13 cs.CL cs.AI cs.LG 90%

LLLMs: A Data-Driven Survey of Evolving Research on Limitations of Large Language Models

LLMs: 一种数据驱动的关于大语言模型局限性研究演变的调查

Aida Kostikova, Zhipin Wang, Deidamea Bajri, Ole Pütz, Benjamin Paaßen, Steffen Eger

机构 * University of Bielefeld(比勒菲尔德大学) University of Technology Nuremberg(纽伦堡技术大学) University of Mannheim(曼海姆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过数据驱动的方法分析了大语言模型局限性研究的演变趋势,揭示了推理、泛化等关键问题的热点及研究进展。

Comments ACM Computing Surveys (CSUR); 56 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09100 2026-03-11 cs.SE 90%

Class Model Generation from Requirements using Large Language Models

基于大型语言模型的需求生成类模型

Jackson Nguyen, Rui En Koe, Fanyu Wang, Chetan Arora, Alessio Ferrari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在自动从自然语言需求生成UML类图方面的有效性,通过双验证框架评估模型生成的准确性和一致性。

Comments Accepted by The Eighth Workshop on Modeling and Simulation of Software-Intensive Systems (MSSiS 2026), ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21833 2026-02-26 cs.SE 90%

From Restructuring to Stabilization: A Large-Scale Experiment on Iterative Code Readability Refactoring with Large Language Models

从重构到稳定:基于大语言模型的迭代代码可读性重构大规模实验

Norman Peitek, Julia Hess, Sven Apel

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文通过大规模实验研究大语言模型在迭代代码重构中的能力,揭示了重构过程的收敛趋势及可读性提升的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏