arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 31957 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 31957 篇

2410.16212 2025-02-04 cs.AI cs.LG q-bio.BM 90%

Comprehensive benchmarking of large language models for RNA secondary structure prediction

L. I. Zablocki, L. A. Bugnon, M. Gerard, L. Di Persia, G. Stegmayer, D. H. Milone

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16655 2025-01-29 cs.CL cs.AI cs.SE 90%

Large Language Model Critics for Execution-Free Evaluation of Code Changes

Aashish Yadavally, Hoan Nguyen, Laurent Callot, Gauthier Guinet

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16356 2025-01-29 cs.LG cs.AI 90%

Evaluating Binary Decision Biases in Large Language Models: Implications for Fair Agent-Based Financial Simulations

Alicia Vidler, Toby Walsh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05574 2025-01-28 cs.HC cs.AI cs.CL 90%

HealMe: Harnessing Cognitive Reframing in Large Language Models for Psychotherapy

Mengxi Xiao, Qianqian Xie, Ziyan Kuang, Zhicheng Liu, Kailai Yang, Min Peng, Weiguang Han, Jimin Huang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 4 figures

Journal ref 2024 ACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14197 2025-01-28 cs.CL cs.AI 90%

Benchmarking and Defending Against Indirect Prompt Injection Attacks on Large Language Models

Jingwei Yi, Yueqi Xie, Bin Zhu, Emre Kiciman, Guangzhong Sun, Xing Xie, Fangzhao Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08167 2025-01-22 cs.CL cs.AI cs.CY 90%

Potential and Perils of Large Language Models as Judges of Unstructured Textual Data

Rewina Bedemariam, Natalie Perez, Sreyoshi Bhaduri, Satya Kapoor, Alex Gil, Elizabeth Conjar, Ikkei Itoku, David Theil, Aman Chadha, Naumaan Nayyar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 11 pages, 1 appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10444 2025-01-20 cs.AI cs.CL 90%

Exploring Iterative Enhancement for Improving Learnersourced Multiple-Choice Question Explanations with Large Language Models

Qiming Bao, Juho Leinonen, Alex Yuxuan Peng, Wanjun Zhong, Gaël Gendron, Timothy Pistotti, Alice Huang, Paul Denny, Michael Witbrock, Jiamou Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments The short version (v4) has been accepted as a non-archival workshop paper at AGI@ICLR 2024, and the full version has been accepted by the main track of AAAI/EAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09126 2025-01-17 cs.CL cs.CY cs.LG 90%

Augmenting Human-Annotated Training Data with Large Language Model Generation and Distillation in Open-Response Assessment

Conrad Borchers, Danielle R. Thomas, Jionghao Lin, Ralph Abboud, Kenneth R. Koedinger

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Manuscript accepted to the Second Workshop on Generative AI for Learning Analytics (GenAI-LA) at LAK25

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.05399 2025-01-13 cs.CL cs.AI 90%

SafetyPrompts: a Systematic Review of Open Datasets for Evaluating and Improving Large Language Model Safety

Paul Röttger, Fabio Pernisi, Bertie Vidgen, Dirk Hovy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at AAAI 2025 (Special Track on AI Alignment)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03151 2025-01-07 cs.AI cs.CV cs.LG 90%

Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches

Alhassan Mumuni, Fuseini Mumuni

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01335 2025-01-03 cs.CR cs.AI cs.LG 90%

CySecBench: Generative AI-based CyberSecurity-focused Prompt Dataset for Benchmarking Large Language Models

Johan Wahréus, Ahmed Mohamed Hussain, Panos Papadimitratos

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.02762 2025-01-03 cs.CL cs.AI 90%

PRD: Peer Rank and Discussion Improve Large Language Model based Evaluations

Ruosen Li, Teerth Patel, Xinya Du

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted by TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08661 2024-12-30 cs.CL cs.CR cs.LG 90%

MIA-Tuner: Adapting Large Language Models as Pre-training Text Detector

Wenjie Fu, Huandong Wang, Chen Gao, Guanghua Liu, Yong Li, Tao Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments code and dataset: https://github.com/wjfu99/MIA-Tuner

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10478 2024-12-30 cs.LG cs.AI 90%

Large Language Models for Constructing and Optimizing Machine Learning Workflows: A Survey

Yang Gu, Hengyu You, Jian Cao, Muran Yu, Haoran Fan, Shiyou Qian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17686 2024-12-25 cs.AI cs.CL 90%

Large Language Model Safety: A Holistic Survey

Dan Shi, Tianhao Shen, Yufei Huang, Zhigen Li, Yongqi Leng, Renren Jin, Chuang Liu, Xinwei Wu, Zishan Guo, Linhao Yu, Ling Shi, Bojian Jiang, Deyi Xiong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 158 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15265 2024-12-24 cs.CL cs.AI 90%

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models

Yingshui Tan, Boren Zheng, Baihui Zheng, Kerui Cao, Huiyun Jing, Jincheng Wei, Jiaheng Liu, Yancheng He, Wenbo Su, Xiangyong Zhu, Bo Zheng, Kaifu Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.02632 2024-12-24 cs.CL cs.AI 90%

SEAS: Self-Evolving Adversarial Safety Optimization for Large Language Models

Muxi Diao, Rumei Li, Shiyang Liu, Guogang Liao, Jingang Wang, Xunliang Cai, Weiran Xu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14276 2024-12-23 cs.CL cs.AI 90%

Fake News Detection: Comparative Evaluation of BERT-like Models and Large Language Models with Generative AI-Annotated Data

Shaina Raza, Drai Paulen-Patterson, Chen Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted in Knowledge and Information Systems Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01349 2024-12-20 cs.CL cs.AI 90%

Fairness in Large Language Models: A Taxonomic Survey

Zhibo Chu, Zichong Wang, Wenbin Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12219 2024-12-18 cs.LG cs.AI 90%

Are Large Language Models Useful for Time Series Data Analysis?

Francis Tang, Ying Ding

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12166 2024-12-18 cs.CL cs.AI 90%

Performance of a large language model-Artificial Intelligence based chatbot for counseling patients with sexually transmitted infections and genital diseases

Nikhil Mehta, Sithira Ambepitiya, Thanveer Ahamad, Dinuka Wijesundara, Yudara Kularathne

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 18 pages, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12148 2024-12-18 stat.ML cs.CL cs.LG q-fin.ST stat.AP 90%

How to Choose a Threshold for an Evaluation Metric for Large Language Models

Bhaskarjit Sarmah, Mingshu Li, Jingrao Lyu, Sebastian Frank, Nathalia Castellanos, Stefano Pasquali, Dhagash Mehta

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments 16 pages, 8 figures, 4 tables. 2-columns

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04662 2024-12-18 cs.CL cs.AI 90%

Citekit: A Modular Toolkit for Large Language Model Citation Generation

Jiajun Shen, Tong Zhou, Yubo Chen, Kang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 7 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13925 2024-12-17 cs.CL cs.AI 90%

GenderAlign: An Alignment Dataset for Mitigating Gender Bias in Large Language Models

Tao Zhang, Ziqian Zeng, Yuxiang Xiao, Huiping Zhuang, Cen Chen, James Foulds, Shimei Pan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);RLHF(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.13125 2024-12-16 cs.CL cs.AI 90%

TreeEval: Benchmark-Free Evaluation of Large Language Models through Tree Planning

Xiang Li, Yunshi Lan, Chao Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08072 2024-12-12 cs.CE cs.AI cs.LG 90%

Using Large Language Models for Parametric Shape Optimization

Xinxin Zhang, Zhuoqun Xu, Guangpu Zhu, Chien Ming Jonathan Tay, Yongdong Cui, Boo Cheong Khoo, Lailai Zhu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06060 2024-12-10 cs.CL cs.AI 90%

Steering Large Language Models to Evaluate and Amplify Creativity

Matthew Lyle Olson, Neale Ratzlaff, Musashi Hinck, Shao-yen Tseng, Vasudev Lal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments (Spotlight) NeurIPS 2024 Workshop on Creativity & Generative AI. Authors 1 and 2 contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08787 2024-12-10 cs.LG cs.CL 90%

Rethinking Machine Unlearning for Large Language Models

Sijia Liu, Yuanshun Yao, Jinghan Jia, Stephen Casper, Nathalie Baracaldo, Peter Hase, Yuguang Yao, Chris Yuhao Liu, Xiaojun Xu, Hang Li, Kush R. Varshney, Mohit Bansal, Sanmi Koyejo, Yang Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Accepted by Nature Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.17671 2024-12-10 cs.CL cs.AI q-bio.NC 90%

Contextual Feature Extraction Hierarchies Converge in Large Language Models and the Brain

Gavin Mischler, Yinghao Aaron Li, Stephan Bickel, Ashesh D. Mehta, Nima Mesgarani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments 19 pages, 5 figures and 4 supplementary figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03597 2024-12-06 cs.CL cs.LG stat.ML 90%

The Vulnerability of Language Model Benchmarks: Do They Accurately Reflect True LLM Performance?

Sourav Banerjee, Ayushi Agarwal, Eishkaran Singh

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏