arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32006 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32006 篇

2506.12338 2025-06-17 cs.CL 89%

Investigating the Effects of Cognitive Biases in Prompts on Large Language Model Outputs

Yan Sun, Stanley Kok

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19824 2025-06-17 cs.AR cs.AI cs.SE 89%

AnalogXpert: Automating Analog Topology Synthesis by Incorporating Circuit Design Expertise into Large Language Models

Haoyi Zhang, Shizhao Sun, Yibo Lin, Runsheng Wang, Jiang Bian

机构 * School of Integrated Circuits, Peking University(集成电路学院,北京大学) Institute of EDA, Peking University(EDA研究院,北京大学) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路先进创新中心) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02050 2025-06-16 cs.CL 89%

JBBQ: Japanese Bias Benchmark for Analyzing Social Biases in Large Language Models

Hitomi Yanaka, Namgi Han, Ryoma Kumon, Jie Lu, Masashi Takeshita, Ryo Sekizawa, Taisei Kato, Hiromi Arai

机构 * The University of Tokyo(东京大学) Riken(理化学研究所) Hokkaido University(北海道大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to the 6th Workshop on Gender Bias in Natural Language Processing (GeBNLP2025) at ACL2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10282 2025-06-13 cs.LG 89%

Graph-MLLM: Harnessing Multimodal Large Language Models for Multimodal Graph Learning

Jiajin Liu, Dongzhe Fan, Jiacheng Shen, Chuanhao Ji, Daochen Zha, Qiaoyu Tan

机构 * New York University Shanghai(纽约大学上海校区) University of Chinese Academy of Sciences(中国科学院大学) Rice University(德克萨斯大学里德学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10264 2025-06-13 cs.AI 89%

WGSR-Bench: Wargame-based Game-theoretic Strategic Reasoning Benchmark for Large Language Models

Qiyue Yin, Pei Xu, Qiaozhe Li, Shengda Liu, Shengqi Shen, Tong Wang, Yihong Han, Xiaonan Zhao, Likun Yang, Shiyue Cao, Shiyu Qiu, Yuxuan Liu, Shizhao Yu, Lei Cui, Chengxin Yan, Jie Sun, Xiangquan Tang, Kaiqi Huang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments 15 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08430 2025-06-13 cs.CL cs.MA 89%

CAF-I: A Collaborative Multi-Agent Framework for Enhanced Irony Detection with Large Language Models

Ziqi. Liu, Ziyang. Zhou, Mingxuan. Hu

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19726 2025-06-13 cs.AI 89%

Position: Theory of Mind Benchmarks are Broken for Large Language Models

Matthew Riemer, Zahra Ashktorab, Djallel Bouneffouf, Payel Das, Miao Liu, Justin D. Weisz, Murray Campbell

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09227 2025-06-12 cs.LG cs.CR 89%

SoK: Machine Unlearning for Large Language Models

Jie Ren, Yue Xing, Yingqian Cui, Charu C. Aggarwal, Hui Liu

机构 * Michigan State University(密歇根州立大学) IBM T. J. Watson Research Center(IBM 托马斯·J·沃森研究中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08907 2025-06-11 cs.CL 89%

Dialect Normalization using Large Language Models and Morphological Rules

Antonios Dimakis, John Pavlopoulos, Antonios Anastasopoulos

机构 * Archimedes, Athena Research Center, Greece(阿基米德,雅典娜研究中心,希腊) Department of Informatics and Telecommunications, NKUA(信息与电信系,NKUA) Department of Informatics, Athens University of Economics and Business, Greece(信息系,雅典经济与商业大学,希腊) Department of Computer Science, George Mason University(计算机科学系,乔治·梅森大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 19 pages, 18 figures, to be published in the Findings of the Association for Computational Linguistics 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08593 2025-06-11 cs.CL 89%

Hateful Person or Hateful Model? Investigating the Role of Personas in Hate Speech Detection by Large Language Models

Shuzhou Yuan, Ercong Nie, Mario Tawfelis, Helmut Schmid, Hinrich Schütze, Michael Färber

机构 * ScaDS.AI and TU Dresden(ScaDS.AI 和 梵高大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05142 2025-06-10 cs.CL 89%

Do Large Language Models Judge Error Severity Like Humans?

Diege Sun, Guanyi Chen, Zhao Fan, Xiaorong Cheng, Tingting He

机构 * School of Psychology(心理学系) Hubei Provincial Key Laboratory of Artificial Intelligence and Smart Learning(湖北省人工智能与智能学习重点实验室) National Language Resources Monitor and Research Center for Network Media(网络媒体语言资源监测与研究中心) School of Computer Science(计算机科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06636 2025-06-10 cs.CL 89%

SafeLawBench: Towards Safe Alignment of Large Language Models

Chuxue Cao, Han Zhu, Jiaming Ji, Qichao Sun, Zhenghao Zhu, Yinyu Wu, Juntao Dai, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted to ACL2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06390 2025-06-10 cs.CY cs.AI 89%

Benchmarking Large Language Models on Homework Assessment in Circuit Analysis

Liangliang Chen, Zhihao Qin, Yiming Guo, Jacqueline Rohde, Ying Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.08793 2025-06-10 cs.CR cs.CL cs.HC 89%

JailbreakLens: Visual Analysis of Jailbreak Attacks Against Large Language Models

Yingchaojie Feng, Zhizhang Chen, Zhining Kang, Sijia Wang, Haoyu Tian, Wei Zhang, Minfeng Zhu, Wei Chen

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Laboratory of Art and Archaeology Image (Zhejiang University), Ministry of Education(浙江大学艺术与考古图像实验室(教育部)) Hangzhou City University(杭州市大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.12394 2025-06-09 cs.CY cs.LG 89%

ELEVATE-GenAI: Reporting Guidelines for the Use of Large Language Models in Health Economics and Outcomes Research: an ISPOR Working Group on Generative AI Report

Rachael L. Fleurence, Dalia Dawoud, Jiang Bian, Mitchell K. Higashi, Xiaoyan Wang, Hua Xu, Jagpreet Chhatwal, Turgay Ayer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

Comments 4 Tables, 1 Figure, Supplemental Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14971 2025-06-06 cs.CL cs.CY 89%

DECASTE: Unveiling Caste Stereotypes in Large Language Models through Multi-Dimensional Bias Analysis

Prashanth Vijayaraghavan, Soroush Vosoughi, Lamogha Chiazor, Raya Horesh, Rogerio Abreu de Paula, Ehsan Degan, Vandana Mukherjee

机构 * IBM Research, San Jose, CA, USA(IBM研究院,美国加利福尼亚州圣何塞) Dartmouth College, Hanover, NH, USA(达特茅斯学院,美国新罕布什尔州汉诺威) IBM Research, Hursley, Winchester, UK(IBM研究院,英国赫里福德郡温切斯特) IBM Thomas J. Watson Research Center, Yorktown Heights, NY, USA(IBM托马斯·J·沃森研究中心,美国纽约州亚当斯) IBM Research, Sao Paulo, Brazil(IBM研究院,巴西圣保罗)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments 7 (content pages) + 2 (reference pages) + 5 (Appendix pages), 5 figures, 6 Tables, IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14425 2025-06-06 cs.CL 89%

A Survey on Data Contamination for Large Language Models

Yuxing Cheng, Yi Chang, Yuan Wu

机构 * College of Software, Jilin University(吉林大学软件学院) School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(知识驱动人机智能工程研究中心,教育部,中国) International Center of Future Science, Jilin University(未来科学国际中心,吉林大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03619 2025-06-05 cs.CL 89%

Do Large Language Models Know Folktales? A Case Study of Yokai in Japanese Folktales

Ayuto Tsutsumi, Yuu Jinnai

机构 * Tokyo Metropolitan University(东京 Metropolitan 大学) CyberAgent

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.16270 2025-06-05 cs.AI 89%

Reflection-Bench: Evaluating Epistemic Agency in Large Language Models

Lingyu Li, Yixu Wang, Haiquan Zhao, Shuqi Kong, Yan Teng, Chunbo Li, Yingchun Wang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

Comments 29 pages, 19 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02295 2025-06-04 cs.CL 89%

Explicit vs. Implicit: Investigating Social Bias in Large Language Models through Self-Reflection

Yachao Zhao, Bo Wang, Yan Wang, Dongming Zhao, Ruifang He, Yuexian Hou

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) AI Lab, China Mobile Communication Group Tianjin Co., Ltd.(中国移动通信集团天津有限公司人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.12974 2025-06-04 cs.CL 89%

BenchmarkCards: Standardized Documentation for Large Language Model Benchmarks

Anna Sokol, Elizabeth Daly, Michael Hind, David Piorkowski, Xiangliang Zhang, Nuno Moniz, Nitesh Chawla

机构 * University of Notre Dame(诺特尔大学) IBM Research Ireland(IBM爱尔兰研究院) IBM Research NY, USA(IBM纽约研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10672 2025-06-04 cs.CL 89%

Large Language Model Evaluation via Matrix Nuclear-Norm

Yahan Li, Tingyu Xia, Yi Chang, Yuan Wu

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Key Laboratory of Symbolic Computation and Knowledge Engineering, Jilin University(吉林大学符号计算与知识工程重点实验室) International Center of Future Science, Jilin University(吉林大学未来科学国际中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15186 2025-06-04 cs.CL 89%

A Survey on Employing Large Language Models for Text-to-SQL Tasks

Liang Shi, Zhengju Tang, Nan Zhang, Xiaotong Zhang, Zhi Yang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) SINGDATA CLOUD PTE. LTD(SINGDATA CLOUD 股份有限公司)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted by ACM Computing Surveys (CSUR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01587 2025-06-03 cs.CL 89%

Unified Large Language Models for Misinformation Detection in Low-Resource Linguistic Settings

Muhammad Islam, Javed Ali Khan, Mohammed Abaker, Ali Daud, Azeem Irshad

机构 * College of Science and Engineering(科学与工程学院) Department of Computer Science(计算机科学系) University of Hertfordshire(赫特福德郡大学) Applied College, King Khalid University(国王·卡利德大学应用学院) Faculty of Resilience(韧性学院) Faculty of Computer Science(计算机科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00777 2025-06-03 cs.CL 89%

Improving Automatic Evaluation of Large Language Models (LLMs) in Biomedical Relation Extraction via LLMs-as-the-Judge

Md Tahmid Rahman Laskar, Israt Jahan, Elham Dolatabadi, Chun Peng, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) Vector Institute Toronto(多伦多向量研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Accepted at ACL 2025 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13169 2025-06-03 cs.CL 89%

Algorithmic Fidelity of Large Language Models in Generating Synthetic German Public Opinions: A Case Study

Bolei Ma, Berk Yoztyurk, Anna-Carolina Haensch, Xinpeng Wang, Markus Herklotz, Frauke Kreuter, Barbara Plank, Matthias Assenmacher

机构 * LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Maryland, College Park(马里兰大学学院市分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.19318 2025-06-03 cs.SE cs.CL 89%

Calibration of Large Language Models on Code Summarization

Yuvraj Virk, Premkumar Devanbu, Toufique Ahmed

机构 * UC Davis(加州大学戴维斯分校) IBM Research(IBM研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18194 2025-06-02 eess.SP cs.AI cs.CV 89%

Large Language Model-Driven Distributed Integrated Multimodal Sensing and Semantic Communications

Yubo Peng, Luping Xiang, Bingxin Zhang, Kun Yang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Intelligent Software and Engineering, Nanjing University (Suzhou Campus)(智能软件与工程学院,南京大学(苏州校区))

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23838 2025-06-02 cs.CL cs.IR 89%

Exploring the Landscape of Text-to-SQL with Large Language Models: Progresses, Challenges and Opportunities

Yiming Huang, Jiyu Guo, Wenxin Mao, Cuiyun Gao, Peiyi Han, Chuanyi Liu, Qing Ling

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Sun Yat-sen University(中山大学) Great Bay University(广东医科大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments Submitted to ACM Computing Surveys (CSUR). Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23477 2025-05-30 cs.CL 89%

Evaluating the performance and fragility of large language models on the self-assessment for neurological surgeons

Krithik Vishwanath, Anton Alyakin, Mrigayu Ghosh, Jin Vivian Lee, Daniel Alexander Alber, Karl L. Sangwon, Douglas Kondziolka, Eric Karl Oermann

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments 22 pages, 3 main figures, 3 supplemental figures

详情

展开后加载摘要…

URL PDF HTML 收藏