arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2406.13945 2025-06-03 cs.AI cs.CL cs.LG 89%

CityBench: Evaluating the Capabilities of Large Language Models for Urban Tasks

Jie Feng, Jun Zhang, Tianhui Liu, Xin Zhang, Tianjian Ouyang, Junbo Yan, Yuwei Du, Siqi Guo, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系、北京理工大学、清华大学) School of Electronic and Information Engineering, Beijing Jiaotong University(电子信息工程学院、北京交通大学) Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院、清华大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by KDD 2025 D&B Track, https://github.com/tsinghua-fib-lab/CityBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23817 2025-06-02 cs.CR 89%

System Prompt Extraction Attacks and Defenses in Large Language Models

Badhan Chandra Das, M. Hadi Amini, Yanzhao Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21931 2025-05-29 eess.SY cs.SY 89%

Large Language Models for Solving Economic Dispatch Problem

Sina Mohammadi, Ali Hassan, Rouzbeh Haghighi, Van-Hai Bui, Wencong Su

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 5 pages, 3 figures, Accepted, 2025 IEEE Energy Conversion Conference and Expo (ECCE 2025), Philadelphia, PA

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13398 2025-05-28 cs.LG cs.AI cs.CL physics.chem-ph q-bio.QM 89%

GeLLMO: Generalizing Large Language Models for Multi-property Molecule Optimization

Vishal Dey, Xiao Hu, Xia Ning

机构 * Department of Computer Science and Engineering, The Ohio State University, USA(计算机科学与工程系,俄亥俄州立大学) Translational Data Analytics Institute, The Ohio State University, USA(转化数据分析研究所,俄亥俄州立大学) Department of Biomedical Informatics, The Ohio State University, USA(生物医学信息学系,俄亥俄州立大学) College of Pharmacy, The Ohio State University, USA(药学院,俄亥俄州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ACL Main 2025. Vishal Dey and Xiao Hu contributed equally to this paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12786 2025-05-28 cs.NI 89%

Forewarned is Forearmed: A Survey on Large Language Model-based Agents in Autonomous Cyberattacks

Minrui Xu, Jiani Fan, Xinyu Huang, Conghao Zhou, Jiawen Kang, Dusit Niyato, Shiwen Mao, Zhu Han, Xuemin, Shen, Kwok-Yan Lam

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16990 2025-05-27 cs.CV 89%

Dimple: Discrete Diffusion Multimodal Large Language Model with Parallel Decoding

Runpeng Yu, Xinyin Ma, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18412 2025-05-27 cs.CV cs.HC 89%

Rehabilitation Exercise Quality Assessment and Feedback Generation Using Large Language Models with Prompt Engineering

Jessica Tang, Ali Abedi, Tracey J. F. Colella, Shehroz S. Khan

机构 * KITE Research Institute(KITE研究 institute) Toronto Rehabilitation Institute(多伦多康复研究所) University Health Network(大学健康网络) Faculty of Applied Science and Engineering(应用科学与工程学院) University of Toronto(多伦多大学) College of Engineering and Technology(工程与技术学院) American University of the Middle East(中东美国大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 16 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17586 2025-05-26 cs.CR 89%

Large Language Models in the IoT Ecosystem -- A Survey on Security Challenges and Applications

Kushal Khatiwada, Jayden Hopper, Joseph Cheatham, Ayan Joshi, Sabur Baidya

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15633 2025-05-22 cs.CL cs.AI cs.LG 89%

Listen to the Context: Towards Faithful Large Language Models for Retrieval Augmented Generation on Climate Questions

David Thulke, Jakob Kemmler, Christian Dugast, Hermann Ney

机构 * Machine Learning and Human Language Technology, RWTH Aachen University, Germany(机器学习与人类语言技术,亚琛工业大学,德国) AppTek GmbH, Aachen, Germany(AppTek GmbH,亚琛,德国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at the ClimateNLP 2025 Workshop at ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12194 2025-05-20 cs.RO 89%

Spatial-LLaVA: Enhancing Large Language Models with Spatial Referring Expressions for Visual Understanding

Xuefei Sun, Doncey Albin, Cecilia Mauceri, Dusty Woods, Christoffer Heckman

机构 * Autonomous Robotics and Perception Group in the Computer Science Department at the University of Colorado Boulder(科罗拉多大学波德分校计算机科学系自主机器人与感知小组)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11200 2025-05-19 cs.SD cs.AI cs.CL cs.HC cs.LG eess.AS 89%

Audio Turing Test: Benchmarking the Human-likeness of Large Language Model-based Text-to-Speech Systems in Chinese

Xihuai Wang, Ziyi Zhao, Siyu Ren, Shao Zhang, Song Li, Xiaoyu Li, Ziwen Wang, Lin Qiu, Guanglu Wan, Xuezhi Cao, Xunliang Cai, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07360 2025-05-13 cs.SE 89%

BinMetric: A Comprehensive Binary Analysis Benchmark for Large Language Models

Xiuwei Shang, Guoqiang Chen, Shaoyin Cheng, Benlong Wu, Li Hu, Gangyang Li, Weiming Zhang, Nenghai Yu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 23 pages, 5 figures, to be published in IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06774 2025-05-13 cs.SE 89%

The First Prompt Counts the Most! An Evaluation of Large Language Models on Iterative Example-Based Code Generation

Yingjie Fu, Bozhou Li, Linyi Li, Wentao Zhang, Tao Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by ISSTA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14851 2025-05-12 cs.CL cs.AI cs.LG cs.LO 89%

JustLogic: A Comprehensive Benchmark for Evaluating Deductive Reasoning in Large Language Models

Michael K. Chen, Xikun Zhang, Dacheng Tao

机构 * College of Computing \& Data Science, Nanyang Technological University, Singapore

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10565 2025-05-07 cs.SE 89%

Large Language Models as Robust Data Generators in Software Analytics: Are We There Yet?

Md. Abdul Awal, Mrigank Rochan, Chanchal K. Roy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted to the AI Model/Data Track of the Evaluation and Assessment in Software Engineering (EASE) 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00976 2025-05-05 cs.CR cs.AI cs.CL cs.LG 89%

Attack and defense techniques in large language models: A survey and new perspectives

Zhiyu Liao, Kang Chen, Yuanguo Lin, Kangkang Li, Yunxuan Liu, Hefeng Chen, Xingwang Huang, Yuanhui Yu

机构 * School of Computer Engineering, Jimei University, Xiamen, China(集美大学计算机工程学院) College of Science, Mathematics and Technology, Wenzhou-Kean University, Wenzhou, China(温州市凯恩大学科学、数学与技术学院) School of Smart Education, Jiangsu Normal University, Xuzhou, China(江苏师范大学智能教育学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19423 2025-04-30 cs.HC 89%

MER 2025: When Affective Computing Meets Large Language Models

Zheng Lian, Rui Liu, Kele Xu, Bin Liu, Xuefei Liu, Yazhou Zhang, Xin Liu, Yong Li, Zebang Cheng, Haolin Zuo, Ziyang Ma, Xiaojiang Peng, Xie Chen, Ya Li, Erik Cambria, Guoying Zhao, Björn W. Schuller, Jianhua Tao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18369 2025-04-28 cs.CR cs.SE 89%

ThreMoLIA: Threat Modeling of Large Language Model-Integrated Applications

Felix Viktor Jedrzejewski, Davide Fucci, Oleksandr Adamov

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12234 2025-04-17 cs.SE 89%

MOS: Towards Effective Smart Contract Vulnerability Detection through Mixture-of-Experts Tuning of Large Language Models

Hang Yuan, Lei Yu, Zhirong Huang, Jingyuan Zhang, Junyi Lu, Shiqi Cheng, Li Yang, Fengjun Zhang, Jiajia Ma, Chun Zuo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00698 2025-04-15 cs.CL cs.AI cs.LG 89%

Command A: An Enterprise-Ready Large Language Model

Team Cohere, :, Aakanksha, Arash Ahmadian, Marwan Ahmed, Jay Alammar, Milad Alizadeh, Yazeed Alnumay, Sophia Althammer, Arkady Arkhangorodsky, Viraat Aryabumi, Dennis Aumiller, Raphaël Avalos, Zahara Aviv, Sammie Bae, Saurabh Baji, Alexandre Barbet, Max Bartolo, Björn Bebensee, Neeral Beladia, Walter Beller-Morales, Alexandre Bérard, Andrew Berneshawi, Anna Bialas, Phil Blunsom, Matt Bobkin, Adi Bongale, Sam Braun, Maxime Brunet, Samuel Cahyawijaya, David Cairuz, Jon Ander Campos, Cassie Cao, Kris Cao, Roman Castagné, Julián Cendrero, Leila Chan Currie, Yash Chandak, Diane Chang, Giannis Chatziveroglou, Hongyu Chen, Claire Cheng, Alexis Chevalier, Justin T. Chiu, Eugene Cho, Eugene Choi, Eujeong Choi, Tim Chung, Volkan Cirik, Ana Cismaru, Pierre Clavier, Henry Conklin, Lucas Crawhall-Stein, Devon Crouse, Andres Felipe Cruz-Salinas, Ben Cyrus, Daniel D'souza, Hugo Dalla-Torre, John Dang, William Darling, Omar Darwiche Domingues, Saurabh Dash, Antoine Debugne, Théo Dehaze, Shaan Desai, Joan Devassy, Rishit Dholakia, Kyle Duffy, Ali Edalati, Ace Eldeib, Abdullah Elkady, Sarah Elsharkawy, Irem Ergün, Beyza Ermis, Marzieh Fadaee, Boyu Fan, Lucas Fayoux, Yannis Flet-Berliac, Nick Frosst, Matthias Gallé, Wojciech Galuba, Utsav Garg, Matthieu Geist, Mohammad Gheshlaghi Azar, Ellen Gilsenan-McMahon, Seraphina Goldfarb-Tarrant, Tomas Goldsack, Aidan Gomez, Victor Machado Gonzaga, Nithya Govindarajan, Manoj Govindassamy, Nathan Grinsztajn, Nikolas Gritsch, Patrick Gu, Shangmin Guo, Kilian Haefeli, Rod Hajjar, Tim Hawes, Jingyi He, Sebastian Hofstätter, Sungjin Hong, Sara Hooker, Tom Hosking, Stephanie Howe, Eric Hu, Renjie Huang, Hemant Jain, Ritika Jain, Nick Jakobi, Madeline Jenkins, JJ Jordan, Dhruti Joshi, Jason Jung, Trushant Kalyanpur, Siddhartha Rao Kamalakara, Julia Kedrzycki, Gokce Keskin, Edward Kim, Joon Kim, Wei-Yin Ko, Tom Kocmi, Michael Kozakov, Wojciech Kryściński, Arnav Kumar Jain, Komal Kumar Teru, Sander Land, Michael Lasby, Olivia Lasche, Justin Lee, Patrick Lewis, Jeffrey Li, Jonathan Li, Hangyu Lin, Acyr Locatelli, Kevin Luong, Raymond Ma, Lukáš Mach, Marina Machado, Joanne Magbitang, Brenda Malacara Lopez, Aryan Mann, Kelly Marchisio, Olivia Markham, Alexandre Matton, Alex McKinney, Dominic McLoughlin, Jozef Mokry, Adrien Morisot, Autumn Moulder, Harry Moynehan, Maximilian Mozes, Vivek Muppalla, Lidiya Murakhovska, Hemangani Nagarajan, Alekhya Nandula, Hisham Nasir, Shauna Nehra, Josh Netto-Rosen, Daniel Ohashi, James Owers-Bardsley, Jason Ozuzu, Dennis Padilla, Gloria Park, Sam Passaglia, Jeremy Pekmez, Laura Penstone, Aleksandra Piktus, Case Ploeg, Andrew Poulton, Youran Qi, Shubha Raghvendra, Miguel Ramos, Ekagra Ranjan, Pierre Richemond, Cécile Robert-Michon, Aurélien Rodriguez, Sudip Roy, Sebastian Ruder, Laura Ruis, Louise Rust, Anubhav Sachan, Alejandro Salamanca, Kailash Karthik Saravanakumar, Isha Satyakam, Alice Schoenauer Sebag, Priyanka Sen, Sholeh Sepehri, Preethi Seshadri, Ye Shen, Tom Sherborne, Sylvie Shang Shi, Sanal Shivaprasad, Vladyslav Shmyhlo, Anirudh Shrinivason, Inna Shteinbuk, Amir Shukayev, Mathieu Simard, Ella Snyder, Ava Spataru, Victoria Spooner, Trisha Starostina, Florian Strub, Yixuan Su, Jimin Sun, Dwarak Talupuru, Eugene Tarassov, Elena Tommasone, Jennifer Tracey, Billy Trend, Evren Tumer, Ahmet Üstün, Bharat Venkitesh, David Venuto, Pat Verga, Maxime Voisin, Alex Wang, Donglu Wang, Shijian Wang, Edmond Wen, Naomi White, Jesse Willman, Marysia Winkels, Chen Xia, Jessica Xie, Minjie Xu, Bowen Yang, Tan Yi-Chern, Ivan Zhang, Zhenyu Zhao, Zhoujie Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments 55 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06145 2025-04-15 cs.SE 89%

ClassEval-T: Evaluating Large Language Models in Class-Level Code Translation

Pengyu Xue, Linhao Wu, Zhen Yang, Chengyi Wang, Xiang Li, Yuxiang Zhang, Jia Li, Ruikai Jin, Yifei Pei, Zhaoyan Shen, Xiran Lyu, Jacky Wai Keung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06536 2025-04-10 cs.CL cs.AI cs.LG 89%

Lugha-Llama: Adapting Large Language Models for African Languages

Happy Buzaaba, Alexander Wettig, David Ifeoluwa Adelani, Christiane Fellbaum

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07800 2025-04-10 cs.SE 89%

Using Large Language Models to Develop Requirements Elicitation Skills

Nelson Lojo, Rafael González, Rohan Philip, José Antonio Parejo, Amador Durán Toro, Armando Fox, Pablo Fernández

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03543 2025-04-09 cs.SE cs.AI cs.CL cs.LG 89%

CodeEditorBench: Evaluating Code Editing Capability of Large Language Models

Jiawei Guo, Ziming Li, Xueling Liu, Kaijing Ma, Tianyu Zheng, Zhouliang Yu, Ding Pan, Yizhi LI, Ruibo Liu, Yue Wang, Shuyue Guo, Xingwei Qu, Xiang Yue, Ge Zhang, Wenhu Chen, Jie Fu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04534 2025-04-08 cs.CL cs.AI cs.LG 89%

An Empirical Comparison of Text Summarization: A Multi-Dimensional Evaluation of Large Language Models

Anantharaman Janakiraman, Behnaz Ghoraani

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01404 2025-04-03 cs.SE 89%

LLM4SZZ: Enhancing SZZ Algorithm with Context-Enhanced Assessment on Large Language Models

Lingxiao Tang, Jiakun Liu, Zhongxin Liu, Xiaohu Yang, Lingfeng Bao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18930 2025-04-03 cs.CV 89%

Hallucination of Multimodal Large Language Models: A Survey

Zechen Bai, Pichao Wang, Tianjun Xiao, Tong He, Zongbo Han, Zheng Zhang, Mike Zheng Shou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

Comments 228 references

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23024 2025-04-01 cs.CV 89%

Empowering Large Language Models with 3D Situation Awareness

Zhihao Yuan, Yibo Peng, Jinke Ren, Yinghong Liao, Yatong Han, Chun-Mei Feng, Hengshuang Zhao, Guanbin Li, Shuguang Cui, Zhen Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22345 2025-03-31 cs.HC 89%

Using a Large Language Model as Design Material for an Interactive Museum Installation

Maria Padilla Engstrøm, Anders Sundnes Løvlie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18648 2025-03-25 cs.CV 89%

Multimodal Large Language Models for Image, Text, and Speech Data Augmentation: A Survey

Ranjan Sapkota, Shaina Raza, Maged Shoman, Achyut Paudel, Manoj Karkee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 52 pages

详情

展开后加载摘要…

URL PDF HTML 收藏