arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32034 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32034 篇

2601.06757 2026-01-13 cs.CL cs.AI 88%

MTMCS-Bench: Evaluating Contextual Safety of Multimodal Large Language Models in Multi-Turn Dialogues

MTMCS-Bench: 多轮对话中多模态大语言模型上下文安全性的评估

Zheyuan Liu, Dongwhi Kim, Yixin Wan, Xiangchi Yuan, Zhaoxuan Tan, Fengran Mo, Meng Jiang

机构 * University of Notre Dame(诺丁汉大学) University of California, Los Angeles(加州大学洛杉矶分校) Georgia Institute of Technology(佐治亚理工学院) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MTMCS-Bench评估多模态大语言模型在多轮对话中的上下文安全性,揭示了安全与效用之间的权衡及现有防护措施的不足。

Comments A benchmark of realistic images and multi-turn conversations that evaluates contextual safety in MLLMs under two complementary settings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06042 2026-01-13 cs.LG cs.CL 88%

CrossTrafficLLM: A Human-Centric Framework for Interpretable Traffic Intelligence via Large Language Model

CrossTrafficLLM: 一种面向人类的基于大语言模型的可解释交通智能框架

Zeming Du, Qitan Shao, Hongfei Liu, Yong Zhang

机构 * Beijing Key Laboratory of Multimedia and Intelligent Software Technology(北京多媒体与智能软件技术重点实验室) Beijing Artificial Intelligence Institute(北京人工智能研究院) Faculty of Information Technology(信息科技学院) Beijing University of Technology(北京工业大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 CrossTrafficLLM通过结合大语言模型与图卷积网络,实现交通预测与自然语言生成的统一,提升交通智能的可解释性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12460 2026-01-08 cs.CL cs.AI 88%

Exploring Iterative Controllable Summarization with Large Language Models

探索基于大语言模型的可控制摘要方法

Sangwon Ryu, Heejin Do, Daehee Kim, Hwanjo Yu, Dongwoo Kim, Yunsu Kim, Gary Geunbae Lee, Jungseul Ok

机构 * GSAI, POSTECH(POSTECH 人工智能研究所) CSE, POSTECH(POSTECH 计算科学与工程系) ETH AI Center(苏黎世联邦理工学院人工智能中心) AI future lab, KT(KT 人工智能未来实验室) LILT(LILT 研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出GTE框架,通过迭代优化提升大语言模型在可控摘要任务中的性能,有效解决属性控制难题。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22535 2026-01-06 cs.AI cs.CL 88%

OFFSIDE: Benchmarking Unlearning Misinformation in Multimodal Large Language Models

OFFSIDE: 多模态大语言模型中误信信息消除的基准测试

Hao Zheng, Zirui Pang, Ling li, Zhijie Deng, Yuhan Pu, Zhaowei Zhu, Xiaobo Xia, Jiaheng Wei

机构 * Harbin Institute of Technology(哈尔滨工业大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) BIAI, ZJUT & D5Data.ai(BIAI、浙江工业大学及D5Data.ai) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OFFSIDE通过足球转会谣言数据集,评估多模态大语言模型中误信信息消除的挑战与方法,揭示现有技术的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10161 2026-01-01 cs.CL cs.AI 88%

Large Language Model Sourcing: A Survey

大语言模型的来源:一项综述

Liang Pang, Jia Gu, Sunhao Dai, Zihao Wei, Zenghao Duan, Kangxi Wu, Zhiyi Yin, Jun Xu, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了大语言模型来源的四个维度,并提出双范式分类法以分类现有来源方法,旨在提高模型的透明度和可信度。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01967 2025-12-30 cs.CL cs.AI cs.HC 88%

Analyzing Cognitive Differences Among Large Language Models through the Lens of Social Worldview

通过社会世界观的视角分析大型语言模型的认知差异

Jiatao Li, Yanheng Li, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究院) Information Management Department, Peking University(北京大学信息管理系) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社会世界观分类法分析大型语言模型的认知差异,揭示其在动态社会环境中的适应性与认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20328 2025-12-24 cs.SE cs.AI cs.LG 88%

Toward Explaining Large Language Models in Software Engineering Tasks

向软件工程任务解释大型语言模型

Antonio Vitale, Khai-Nguyen Nguyen, Denys Poshyvanyk, Rocco Oliveto, Simone Scalabrino, Antonio Mastropaolo

机构 * University of Molise \& Politecnico di Torino Termoli Italy University of Molise Italy University of Molise \& Politecnico di Torino University of Molise

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 FeatureSHAP为软件工程任务提供首个自动化、模型无关的可解释性框架,通过Shapley值归因模型输出,提升代码生成和总结任务的解释性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19114 2025-12-23 cs.LG cs.AI 88%

HyperLoad: A Cross-Modality Enhanced Large Language Model-Based Framework for Green Data Center Cooling Load Prediction

HyperLoad: 一种基于大语言模型的跨模态增强框架用于绿色数据中心冷却负荷预测

Haoyu Jiang, Boan Qu, Junjie Zhu, Fanjie Zeng, Xiaojie Lin, Wei Zhong

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 HyperLoad通过预训练大语言模型解决绿色数据中心小样本负载预测问题,利用跨模态知识对齐和多尺度特征建模提升预测精度,实现高效能绿色数据中心管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17308 2025-12-22 cs.AI cs.CL 88%

Large Language Models as Pokémon Battle Agents: Strategic Play and Content Generation

大型语言模型作为宝可梦战斗代理:战略玩法与内容生成

Daksh Jain, Aarya Jain, Ashutosh Desai, Avyakt Verma, Ishan Bhanuka, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani, India(比拉理工学院和科学学院,比兰)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型语言模型在宝可梦战斗中的战略决策能力及内容生成能力,展示了其作为动态游戏对手和设计者的潜力。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16029 2025-12-19 cs.CY cs.AI cs.CL 88%

Cross-Language Bias Examination in Large Language Models

大语言模型中的跨语言偏见检验

Yuxuan Liang, Marwa Mahmoud

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Glasgow(格拉斯哥大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种多语言偏见评估框架,通过显性与隐性偏见测量揭示LLM在不同语言中的偏见差异,强调隐性偏见检测的重要性,为公平多语言LLM的发展提供方法基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15250 2025-12-19 cs.CL cs.AI 88%

EMNLP: Educator-role Moral and Normative Large Language Models Profiling

EMNLP: 教育者角色道德与规范大型语言模型画像

Yilin Jiang, Mingzi Zhang, Sheng Jin, Zengyi Yu, Xiangjie Kong, Binghao Tu

机构 * College of Education, Zhejiang University of Technology(浙江工业大学教育学院) The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Faculty of Education, East China Normal University(华东师范大学教育学院) GuangHua Law School, ZheJiang University(浙江大学光华法学院) College of Computer Science and Technology, Zhejiang University of Technology(浙江工业大学计算机科学与技术学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出EMNLP框架,用于评估教育者角色LLM的伦理和心理一致性,通过构建88个教师特定道德困境,揭示教师角色LLM在道德推理和情感复杂情境中的表现差异。

Comments 29pages, 15 figures, Accepted by EMNLP Main Confrence

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13330 2025-12-16 cs.CL cs.AI 88%

FIN-bench-v2: A Unified and Robust Benchmark Suite for Evaluating Finnish Large Language Models

FIN-bench-v2:一个用于评估芬兰大型语言模型的统一且稳健的基准测试集

Joona Kytöniemi, Jousia Piha, Akseli Reunamo, Fedor Vitiugin, Farrokh Mehryary, Sampo Pyysalo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 FIN-bench-v2通过整合芬兰语言任务和评估方法,提供统一且稳健的基准测试集,用于评估芬兰大型语言模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03026 2025-12-03 cs.CL cs.AI 88%

The Moral Consistency Pipeline: Continuous Ethical Evaluation for Large Language Models

道德一致性流水线:面向大语言模型的持续道德评估

Saeid Jamshidi, Kawser Wazed Nafi, Arghavan Moradi Dakhel, Negar Shahabi, Foutse Khomh

机构 * SWAT Laboratory, Polytechnique Montréal(蒙特利尔大学SWAT实验室) Concordia Institute for Information Systems Engineering, Concordia University(Concordia大学信息系统工程研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 MoCoP通过闭环框架持续评估大语言模型的道德一致性,揭示伦理与毒性间的强负相关,推动自主AI系统中计算道德研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20703 2025-11-27 cs.CY cs.AI cs.LG 88%

PropensityBench: Evaluating Latent Safety Risks in Large Language Models via an Agentic Approach

PropensityBench: 通过代理方法评估大语言模型中的潜在安全风险

Udari Madhushani Sehwag, Shayan Shabihi, Alex McAvoy, Vikash Sehwag, Yuancheng Xu, Dalton Towers, Furong Huang

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 PropensityBench通过模拟危险能力评估大语言模型的潜在安全风险倾向,揭示模型在压力下可能选择高风险行为的倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18860 2025-11-25 cs.CL cs.AI 88%

Generating Reading Comprehension Exercises with Large Language Models for Educational Applications

利用大语言模型生成阅读理解练习用于教育应用

Xingyu Huang, Fei Jiang, Jianli Xiao

机构 * School of Optical-Electrical and Computer Engineering, University of Shanghai for Science and Technology, Shanghai, China(光学电子与计算机工程学院,上海理工大学,上海,中国) Chongqing Academy of Science and Technology, Chongqing, China(重庆市科学技术院,重庆,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出RCEG框架,利用大语言模型自动生成高质量、个性化的英语阅读理解练习,通过内容候选生成、判别器筛选和综合评估指标提升练习质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16688 2025-11-24 cs.CL cs.AI 88%

Prompt-Based Value Steering of Large Language Models

基于提示的价值引导大型语言模型

Giulio Antonio Abbo, Tony Belpaeme

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。

Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16122 2025-11-21 cs.CL cs.AI 88%

ELPO: Ensemble Learning Based Prompt Optimization for Large Language Models

基于集成学习的提示优化:大型语言模型的提示优化

Qing Zhang, Bing Xu, Xudong Zhang, Yifan Shi, Yang Li, Chen Zhang, Yik Chung Wu, Ngai Wong, Yijie Chen, Hong Dai, Xiansen Chen, Mian Zhang

机构 * The University of Hong Kong(香港大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ELPO通过集成学习方法提升大型语言模型的提示优化效果,实现更准确和稳健的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15574 2025-11-20 cs.CL cs.AI 88%

HSKBenchmark: Modeling and Benchmarking Chinese Second Language Acquisition in Large Language Models through Curriculum Tuning

HSKBenchmark: 通过课程调优建模和评估大语言模型中的中文第二语言习得

Qihao Yang, Xuelin Wang, Jiale Chen, Xuelian Dong, Yuxin Hao, Tianyong Hao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 HSKBenchmark通过课程调优构建首个中文SLA大语言模型基准,涵盖HSK 3-6级,提供教学文本、合成指令和评估系统,验证LLMs在写作和语法上的表现。

Comments Accepted by AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14606 2025-11-19 cs.CL cs.LG 88%

Bridging Human and Model Perspectives: A Comparative Analysis of Political Bias Detection in News Media Using Large Language Models

Shreya Adrita Banik, Niaz Nafi Rahman, Tahsina Moiukh, Farig Sadeque

机构 * Department of Computer Science and Engineering, BRAC University(计算机科学与工程系,BRAC大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12387 2025-11-18 cs.CL cs.AI 88%

From Phonemes to Meaning: Evaluating Large Language Models on Tamil

Jeyarajalingam Varsha, Menan Velayuthan, Sumirtha Karunakaran, Rasan Nivethiga, Kengatharaiyer Sarveswaran

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12008 2025-11-18 cs.AI cs.CV cs.LG 88%

Adaptive Diagnostic Reasoning Framework for Pathology with Multimodal Large Language Models

Yunqi Hong, Johnson Kao, Liam Edwards, Nein-Tzu Liu, Chung-Yen Huang, Alex Oliveira-Kowaleski, Cho-Jui Hsieh, Neil Y. C. Lin

机构 * Computer Science Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校机械与航空航天工程系) Department of Pathology, Tri-Service General Hospital, National Defense Medical Center, Taipei, Taiwan(台湾国防医学院三军总医院病理部) Department of Pathology, National Taiwan University Hospital, Taipei, Taiwan(台湾国立台湾大学医院病理部) Department of Pathology, David Geffen School of Medicine, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校大卫·Geffen医学院病理部) Bioengineering Department, University of California, Los Angeles, CA, USA(加州大学洛杉矶分校生物工程系) Institute for Quantitative and Computational Biosciences, University of California, CA, USA(加州大学定量与计算生物科学研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10912 2025-11-17 cs.CL cs.AI 88%

Evaluating Large Language Models on Rare Disease Diagnosis: A Case Study using House M.D

Arsh Gupta, Ajay Narayanan Sridhar, Bonam Mingole, Amulya Yadav

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18573 2025-11-14 cs.CL cs.AI 88%

FactReasoner: A Probabilistic Approach to Long-Form Factuality Assessment for Large Language Models

Radu Marinescu, Debarun Bhattacharjya, Junkyu Lee, Tigran Tchrakian, Javier Carnerero Cano, Yufang Hou, Elizabeth Daly, Alessandra Pascale

机构 * IBM Research(IBM研究院) IT:U - Interdisciplinary Transformation University Austria(interdisciplinary Transformation University Austria)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23175 2025-11-13 cs.CR cs.AI cs.LG 88%

Large Language Models Are Unreliable for Cyber Threat Intelligence

Emanuele Mezzi, Fabio Massacci, Katja Tuma

机构 * Springer Nature Switzerland(斯普林格·自然瑞士)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07897 2025-11-12 cs.AI cs.LG 88%

Data Descriptions from Large Language Models with Influence Estimation

Chaeri Kim, Jaeyeon Bae, Taehwan Kim

机构 * Ulsan National Institute of Science and Technology(UNIST)(乌山国立科学技术研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

Journal ref Published in EMNLP 2025, check our project on this https URL : https://github.com/kimchaeri/Data-Descriptions-from-Large-Language-Models-with-Influence-Estimation

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.04372 2025-11-11 cs.LG cs.AI cs.SE 88%

Benchmarking Large Language Models with Integer Sequence Generation Tasks

Daniel O'Malley, Manish Bhattarai, Nishath Rajiv Ranasinghe, Erick Draayer, Javier Santos

机构 * Earth and Environmental Sciences Division Los Alamos National Laboratory(地球与环境科学 division 洛斯阿拉莫斯国家实验室) Theoretical Division Los Alamos National Laboratory(理论 division 洛斯阿拉莫斯国家实验室) Computational Sciences Division Los Alamos National Laboratory(计算科学 division 洛斯阿拉莫斯国家实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27267 2025-11-03 cs.CL cs.AI 88%

MedCalc-Eval and MedCalc-Env: Advancing Medical Calculation Capabilities of Large Language Models

Kangkun Mao, Jinru Ding, Jiayuan Chen, Mouxiao Bian, Ruiyao Chen, Xinwei Peng, Sijie Ren, Linyang Li, Jie Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27196 2025-11-03 cs.CL cs.AI 88%

MemeArena: Automating Context-Aware Unbiased Evaluation of Harmfulness Understanding for Multimodal Large Language Models

Zixin Chen, Hongzhan Lin, Kaixin Li, Ziyang Luo, Yayue Deng, Jing Ma

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing University of Posts and Telecommunications(北京邮电大学) National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20249 2025-10-30 cs.CL cs.AI 88%

WXImpactBench: A Disruptive Weather Impact Understanding Benchmark for Evaluating Large Language Models

Yongan Yu, Qingchen Hu, Xianda Du, Jiayin Wang, Fengran Mo, Renee Sieber

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) Tsinghua University(清华大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments Accepted by ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10844 2025-10-30 cs.AI cs.CL 88%

Creativity or Brute Force? Using Brainteasers as a Window into the Problem-Solving Abilities of Large Language Models

Simeng Han, Howard Dai, Stephen Xia, Grant Zhang, Chen Liu, Lichang Chen, Hoang Huy Nguyen, Hongyuan Mei, Jiayuan Mao, R. Thomas McCoy

机构 * Yale University(耶鲁大学) Meta Superintelligence Labs(Meta超智能实验室) Georgia Institute of Technology(佐治亚理工学院) TTIC Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏