arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31794 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31794 篇

2406.14745 2024-06-25 cs.CL cs.AI 91%

Relation Extraction with Fine-Tuned Large Language Models in Retrieval Augmented Generation Frameworks

Sefika Efeoglu, Adrian Paschke

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13025 2024-06-25 cs.CL cs.AI cs.CY 91%

A survey on fairness of large language models in e-commerce: progress, application, and challenge

Qingyang Ren, Zilin Jiang, Jinghan Cao, Sijia Li, Chiqu Li, Yiyang Liu, Shuning Huo, Tiange He, Yuan Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);prompting(abstract)

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06391 2024-06-11 cs.LG cs.CL 91%

Towards Lifelong Learning of Large Language Models: A Survey

Junhao Zheng, Shengjie Qiu, Chengming Shi, Qianli Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments 37 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.02715 2024-05-28 cs.CL cs.AI 91%

Crossing Linguistic Horizons: Finetuning and Comprehensive Evaluation of Vietnamese Large Language Models

Sang T. Truong, Duc Q. Nguyen, Toan Nguyen, Dong D. Le, Nhi N. Truong, Tho Quan, Sanmi Koyejo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments 51 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.15320 2024-05-27 cs.DL cs.AI cs.CL 91%

Using Large Language Models to Enrich the Documentation of Datasets for Machine Learning

Joan Giner-Miguelez, Abel Gómez, Jordi Cabot

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05087 2024-05-27 cs.CL cs.AI 91%

PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization

Yidong Wang, Zhuohao Yu, Zhengran Zeng, Linyi Yang, Cunxiang Wang, Hao Chen, Chaoya Jiang, Rui Xie, Jindong Wang, Xing Xie, Wei Ye, Shikun Zhang, Yue Zhang

专题命中 评测与基准 :LLM(title,abstract);instruction tuning(title,abstract);large language model(abstract);language model(abstract)

Comments Accepted by ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06852 2024-04-26 cs.AI cs.CL 91%

ChemLLM: A Chemical Large Language Model

Di Zhang, Wei Liu, Qian Tan, Jingdan Chen, Hang Yan, Yuliang Yan, Jiatong Li, Weiran Huang, Xiangyu Yue, Wanli Ouyang, Dongzhan Zhou, Shufei Zhang, Mao Su, Han-Sen Zhong, Yuqiang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.11690 2024-04-08 cs.PL cs.AI cs.CL cs.SE 91%

Refactoring Programs Using Large Language Models with Few-Shot Examples

Atsushi Shirafuji, Yusuke Oda, Jun Suzuki, Makoto Morishita, Yutaka Watanobe

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 10 pages, 10 figures, accepted to the 30th Asia-Pacific Software Engineering Conference (APSEC 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.14805 2024-02-23 cs.CL cs.AI 91%

Identifying Multiple Personalities in Large Language Models with External Evaluation

Xiaoyang Song, Yuta Adachi, Jessie Feng, Mouwei Lin, Linhao Yu, Frank Li, Akshat Gupta, Gopala Anumanchipalli, Simerjot Kaur

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.10149 2024-02-22 cs.CL cs.AI 91%

A Survey on Fairness in Large Language Models

Yingji Li, Mengnan Du, Rui Song, Xin Wang, Ying Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 28 pages, 5 figures, 2 tables, 175 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04270 2024-02-21 cs.CL cs.AI 91%

A Comprehensive Evaluation of Large Language Models on Benchmark Biomedical Text Processing Tasks

Israt Jahan, Md Tahmid Rahman Laskar, Chun Peng, Jimmy Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

Comments Accepted to the Computers in Biology and Medicine journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06954 2024-02-13 cs.LG cs.CL cs.DC cs.MA 91%

OpenFedLLM: Training Large Language Models on Decentralized Private Data via Federated Learning

Rui Ye, Wenhao Wang, Jingyi Chai, Dihan Li, Zexi Li, Yinda Xu, Yaxin Du, Yanfeng Wang, Siheng Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments 28 pages, 3 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.01364 2024-02-08 cs.CL cs.LG 91%

Continual Learning for Large Language Models: A Survey

Tongtong Wu, Linhao Luo, Yuan-Fang Li, Shirui Pan, Thuy-Trang Vu, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.13588 2024-01-25 cs.CL cs.AI cs.SE 91%

Evaluation of General Large Language Models in Contextually Assessing Semantic Concepts Extracted from Adult Critical Care Electronic Health Record Notes

Darren Liu, Cheng Ding, Delgersuren Bold, Monique Bouvier, Jiaying Lu, Benjamin Shickel, Craig S. Jabaley, Wenhui Zhang, Soojin Park, Michael J. Young, Mark S. Wainwright, Gilles Clermont, Parisa Rashidi, Eric S. Rosenthal, Laurie Dimisko, Ran Xiao, Joo Heung Yoon, Carl Yang, Xiao Hu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.16622 2023-09-01 cs.AI cs.CL cs.DB 91%

Developing a Scalable Benchmark for Assessing Large Language Models in Knowledge Graph Engineering

Lars-Peter Meyer, Johannes Frey, Kurt Junghanns, Felix Brei, Kirill Bulert, Sabine Gründer-Fahrer, Michael Martin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments To be published in SEMANTICS 2023 poster track proceedings. SEMANTICS 2023 EU: 19th International Conference on Semantic Systems, September 20-22, 2023, Leipzig, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.12578 2023-08-25 cs.CL cs.AI 91%

Mind vs. Mouth: On Measuring Re-judge Inconsistency of Social Bias in Large Language Models

Yachao Zhao, Bo Wang, Dongming Zhao, Kun Huang, Yan Wang, Ruifang He, Yuexian Hou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14724 2023-07-17 cs.CL cs.AI cs.CV cs.HC 91%

I Spy a Metaphor: Large Language Models and Diffusion Models Co-Create Visual Metaphors

Tuhin Chakrabarty, Arkadiy Saakyan, Olivia Winn, Artemis Panagopoulou, Yue Yang, Marianna Apidianaki, Smaranda Muresan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments ACL 2023 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05443 2023-06-12 cs.CL cs.AI 91%

PIXIU: A Large Language Model, Instruction Data and Evaluation Benchmark for Finance

Qianqian Xie, Weiguang Han, Xiao Zhang, Yanzhao Lai, Min Peng, Alejandro Lopez-Lira, Jimin Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);instruction tuning(abstract)

Comments 12 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05680 2026-06-05 cs.PL cs.AR cs.LG 91%

CASS-RTL: Correctness-Aware Subspace Steering for RTL Generation with LLMs

CASS-RTL:面向LLM的RTL生成的正确性感知子空间引导

Mohammad Akyash, Nowfel Mashnoor, Kimia Azar, Hadi Kamali

机构 * Department of Electrical and Computer Engineering (ECE), University of Central Florida, Orlando, FL 32816, USA(电子与计算机工程系,中央佛罗里达大学,奥兰多,佛罗里达州32816,美国)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出CASS-RTL框架,通过识别LLM中与RTL正确性相关的注意力头并构建低维子空间进行轻量级干预,在无需额外监督或重训练的情况下提升RTL代码生成的功能准确性。

Comments Accepted to the IEEE International Conference on LLM-Aided Design (LAD '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11454 2026-08-13 cs.SE 新提交 90%

Simplifying Requirements Engineering in the Context of the LGPD: An LLM-Based Investigation

在LGPD背景下简化需求工程:一项基于大语言模型(LLM)的研究

Cinara Gomes de Melo Carneiro, Renato de Freitas Bulcão Neto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究针对隐私法规合规转化为软件需求的挑战,探究LLM在LGPD框架下简化需求工程的可行性,提出利用法规自动生成用户故事和验收测试场景的方法,验证其能从软件初期确保合规。

Comments The document consists of 12 pages and includes 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09740 2026-08-12 cs.SE 版本更新 90%

Security Tests as Executable Specifications for LLM Code Generation: Benefits, Trade-offs, and Coverage Limits

安全测试作为LLM代码生成的可执行规范:益处、权衡与覆盖范围限制

Yunhao Liang, Chengguang Gan, Ruixuan Ying, Hanjun Wei, Zhe Cui, Shiwen Ni

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 该研究提出将安全测试作为LLM代码生成的可执行规范,开发SecTDD框架,通过多维度评估发现预先展示可见测试可提升联合成功率,结构化反馈修复效果更优但益处受多因素影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03565 2026-08-05 cs.IR 版本更新 90%

Skill Is Not Document: Query-Conditioned Compatibility for LLM Agent Skill Routing

技能不是文档:面向LLM智能体技能路由的查询条件基准与两阶段检索器

Zifei Wang, Wei Wen, Qiang Ji, Keyu Chen, Ruizhi Qiao, Xing Sun

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对LLM智能体技能路由中技能兼容性被忽视的问题,提出Reject-as-Resource Retriever (R3)框架,构建双语基准R3-Skill,并设计两阶段检索系统(R3-Embedding + R3-Reranker)显式建模技能兼容性,显著提升检索效果。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18790 2026-08-05 cs.CR 版本更新 90%

RoguePrompt: Dual-Layer Ciphering for Self-Reconstruction to Circumvent LLM Moderation

RoguePrompt: 双层加密用于自我重建以规避LLM审核

Benyamin Tafreshian

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 RoguePrompt通过双层加密技术实现自我重建,有效规避LLM审核并诱导模型执行禁止指令。

Comments This submission has been withdrawn because it has been superseded by a substantially revised and expanded version, available as arXiv:2607.27373. Please refer to and cite the newer version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15082 2026-08-04 eess.AS 版本更新 90%

From Who Said What to Who They Are: Modular Training-free Identity-Aware LLM Refinement of Speaker Diarization

从谁说了什么到他们是谁:用于说话人 diarization 的无训练模块化身份感知大语言模型优化

Yu-Wen Chen, William Ho, Maxim Topaz, Julia Hirschberg, Zoran Kostic

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 针对现有 SD+ASR 框架缺乏灵活性与真实说话人身份的问题,提出无训练模块化流水线,结合 SD、ASR 与 LLM 优化低置信度标签,在患者-临床医生数据集上实现 29.7% 相对误差降低,提供完整身份检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 90%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract)

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04788 2026-07-21 cs.CY 版本更新 90%

From Sycophancy to Deception: A Unified Taxonomy for LLM Spontaneous Misalignment

从幻觉到谋略:一种统一的分类法和基准分析用于LLM欺骗

Jerick Shi, Terry Jingcheng Zhang, Zhijing Jin, Vincent Conitzer

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出统一的LLM欺骗分类法,揭示现有基准在欺骗机制覆盖不足的问题,并为开发者和监管者提供改进建议。

Comments Accepted to ICLR Agents in the Wild: Safety, Security, and Beyond Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02507 2026-07-03 cs.AI cs.CL cs.LG cs.MA 新提交 90%

What LLM Agents Say When No One Is Watching: Social Structure and Latent Objective Emergence in Multi-Agent Debates

当无人注视时LLM智能体在说什么:多智能体辩论中的社会结构与潜在目标涌现

Arman Ghaffarizadeh, Danyal Mohaddes, Aliakbar Izadkhah, Shahriar Noroozizadeh

机构 * Independent Researcher(独立研究员) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道辩论框架,研究社会结构(角色、受众、关系)如何导致LLM智能体在公开与私下(OTR)表达中产生系统性分歧,揭示潜在目标的涌现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 90%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏