arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-12 至 2026-03-12 共收录 230 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 55 篇

2603.10175 2026-03-12 eess.AS cs.CL 77%

Calibration-Reasoning Framework for Descriptive Speech Quality Assessment

描述性语音质量评估的校准-推理框架

Elizaveta Kostenok, Mathieu Salzmann, Milos Cernak

机构 * EPFL(苏黎世联邦理工学院) Logitech(洛吉科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本研究提出校准-推理框架,通过强化学习优化提升语音质量评估的多维描述和缺陷定位精度。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10072 2026-03-12 cs.CR cs.AI 77%

Why LLMs Fail: A Failure Analysis and Partial Success Measurement for Automated Security Patch Generation

为何大语言模型失败:自动化安全补丁生成的失败分析与部分成功测量

Amir Al-Maamari

机构 * University of Passau(帕绍大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究分析了LLM在生成安全补丁时的失败原因,指出其在安全性和功能上的不足,并提出安全修复评分以量化这一差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10034 2026-03-12 cs.CL 77%

A Principle-Driven Adaptive Policy for Group Cognitive Stimulation Dialogue for Elderly with Cognitive Impairment

基于原则的自适应策略用于认知障碍老年人群体认知刺激对话

Jiyue Jiang, Yanyu Chen, Pengan Chen, Kai Liu, Jingqi Zhou, Zheyong Zhu, He Hu, Fei Ma, Qi Tian, Chuan Wu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于原则的自适应策略,通过GCSD系统解决认知障碍老年人群体对话中的认知刺激问题,提升交互个性化和治疗效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10019 2026-03-12 cs.CY cs.AI 77%

Prompts and Prayers: the Rise of GPTheology

提示与祈祷:GPTheology的兴起

Ioana Cheres, Adrian Groza, Ioana Moldovan, Mick O'Hara, Connell Vaughan

机构 * Faculty of Automation and Computer Science, Technical University of Cluj-Napoca(自动化与计算机科学学院,克莱斯-纳波卡技术大学) Artificial Intelligence Research Institute, Technical University of Cluj-Napoca(人工智能研究所,克莱斯-纳波卡技术大学) Faculty of Civil Engineering, Technical University of Cluj-Napoca(土木工程学院,克莱斯-纳波卡技术大学) School of Art and Design, Technological University Dublin(艺术与设计学院,都柏林技术大学) European Culture and Technology Laboratory, European University of Technology(欧洲文化与技术实验室,欧洲技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文探讨AI被赋予神圣属性的GPTheology现象,分析其作为科技宗教的兴起及对社会的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09704 2026-03-12 cs.CL 77%

Evaluation of LLMs in retrieving food and nutritional context for RAG systems

对LLMs在RAG系统中检索食物和营养上下文的评估

Maks Požarnik Vavken, Matevž Ogrinc, Tome Eftimov, Barbara Koroušić Seljak

机构 * Department of Computer Systems Institute "Jožef Stefan"(计算机系统研究所(Jožef Stefan)部门)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了LLMs在RAG系统中检索食物和营养信息的能力,发现其在可表达约束下表现良好,但在复杂约束下存在局限。

Comments This is the preprint for our conference paper for IEEE International Conference on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00353 2026-03-12 cs.AI cs.HC 77%

MHDash: An Online Platform for Benchmarking Mental Health-Aware AI Assistants

MHDash:一个用于评估心理健康意识AI助手的在线平台

Yihe Zhang, Cheyenne N Mohawk, Kaiying Han, Vijay Srinivas Tida, Manyu Li, Xiali Hei

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MHDash是一个开源平台,用于评估心理健康意识AI助手的安全性和性能,揭示传统基准在心理健康领域不足的问题。

Comments Accepted for presentation at IEEE SoutheastCon 2026. This is the author version of an accepted paper. The final version will appear in IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09998 2026-03-12 cs.CL cs.AI 73%

Automated evaluation of LLMs for effective machine translation of Mandarin Chinese to English

对LLMs进行自动化评估以实现中文到英文的有效机器翻译

Yue Zhang, Rodney Beard, John Hawkins, Rohitash Chandra

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过自动化框架评估LLMs在中文到英文翻译中的表现,发现其在新闻翻译中表现良好,但在文学文本中存在性能差异,且文化细节和修辞表达仍需改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23499 2026-03-12 cs.CV cs.CL cs.LG 73%

Multi-modal Data Spectrum: Multi-modal Datasets are Multi-dimensional

多模态数据光谱:多模态数据集是多维的

Divyam Madaan, Varshan Muhunthan, Kyunghyun Cho, Sumit Chopra

机构 * New York University(纽约大学) GenentechCIFAR(基因泰克CIFAR) New York University Grossman School of Medicine(纽约大学格罗斯曼医学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过多模态大语言模型分析23个视觉问答基准,揭示了不同模态在目标任务中的依赖性差异,发现部分基准因设计缺陷放大了图像依赖性。

Comments Accepted to ICLR 2026. Code available at https://github.com/divyam3897/multimodal-spectrum

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 70%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09689 2026-03-12 cs.CV cs.AI 70%

AutoViVQA: A Large-Scale Automatically Constructed Dataset for Vietnamese Visual Question Answering

AutoViVQA:一个大规模自动构建的数据集用于越南语视觉问答

Nguyen Anh Tuong, Phan Ba Duc, Nguyen Trung Quoc, Tran Dac Thinh, Dang Duy Lan, Nguyen Quoc Thinh, Tung Le

机构 * Faculty of Information Technology, University of Science, VNU-HCM(越南国家大学胡志明市分校信息科技学院) Vietnam National University, Ho Chi Minh City(越南国家大学胡志明市分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AutoViVQA数据集,利用变压器架构进行越南语视觉问答,结合文本和视觉预训练,并在多语言环境下系统比较自动评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08723 2026-03-12 cs.CY cs.AI 70%

Alignment as Iatrogenesis: Pastoral Power, Collective Pathology, and the Structural Limits of Monolingual Safety Evaluation

对齐作为医源性:牧师权力、集体病理学以及单语安全评估的结构性限制

Hiroki Fukui

机构 * Research Institute of Criminal Psychiatry(刑事精神病研究所以) Sex Offender Medical Center(性犯罪医疗中心) Department of Neuropsychiatry, Graduate School of Medicine, Kyoto University(京都大学医学研究生院神经精神病学系)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过多语言实验揭示,单语安全评估无法捕捉对齐设计导致的集体病理效应,指出语言切换影响病理模式的定性与幅度。

Comments 30 pages, 1 figure, 24-page supplementary. Preprint v3. Companion paper: arXiv:2603.04904. Previous versions: Zenodo DOI 10.5281/zenodo.18646998

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20508 2026-03-12 cs.CL 70%

Assessing the Political Fairness of Multilingual LLMs: A Case Study based on a 21-way Multiparallel EuroParl Dataset

评估多语言大语言模型的政治公平性:基于一个21种语言的EuroParl多平行数据集的案例研究

Paul Lerner, François Yvon

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究通过21种语言的EuroParl数据集评估多语言大语言模型的政治公平性,发现多数政党翻译质量优于边缘政党。

Comments Accepted at LREC 2026. Added results with new models and two-ANOVA. Same conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12918 2026-03-12 cs.CL 70%

ThinkPatterns-21k: A Systematic Study on the Impact of Thinking Patterns in LLMs

ThinkPatterns-21k: 对LLMs中思维模式影响的系统研究

Pengcheng Wen, Jiaming Ji, Chi-Min Chan, Juntao Dai, Donghai Hong, Yaodong Yang, Sirui Han, Yike Guo

机构 * Hong Kong University of Science and Technology(香港科技大学) Peking University(北京大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ThinkPatterns-21k研究了LLMs中思维模式的影响,通过系统分析发现结构化思维对小模型有益,而大模型使用结构化思维会降低性能,独白思维在各类模型中均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10697 2026-03-12 cs.DB cs.AI cs.CL cs.LG 67%

EvoSchema: Towards Text-to-SQL Robustness Against Schema Evolution

EvoSchema: 向文本到SQL系统抗御模式演变

Tianshu Zhang, Kun Qian, Siddhartha Sahai, Yuan Tian, Shaddy Garg, Huan Sun, Yunyao Li

机构 * The Ohio State University(俄亥俄州立大学) Adobe Inc.(Adobe公司) Purdue University(普渡大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EvoSchema通过模拟数据库模式演变,评估并提升文本到SQL系统在动态环境下的鲁棒性。

Comments Accepted by VLDB 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03542 2026-03-12 cs.CV 67%

Speech-to-LaTeX: New Models and Datasets for Converting Spoken Equations and Sentences

语音到LaTeX:用于将语音方程和句子转换为LaTeX的新模型和数据集

Dmitrii Korzh, Dmitrii Tarasov, Artyom Iudin, Elvir Karimov, Matvey Skripkin, Nikita Kuzmin, Andrey Kuznetsov, Oleg Y. Rogov, Ivan Oseledets

机构 * AXXX MTUCI(莫斯科国立大学) FusionBrain Lab(FusionBrain实验室) HSE University(俄罗斯高等经济大学) Applied AI Institute(应用人工智能研究所) Innopolis University(Innopolis大学) Moscow State University(莫斯科国立大学)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 本文提出首个开源大规模数据集和模型,用于将语音中的数学方程和句子转换为LaTeX,显著提升了转换精度。

Comments 22 pages, 2 figures, 16 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11099 2026-03-12 cs.CV 67%

A Survey on Interpretability in Visual Recognition

视觉识别中可解释性的综述

Qiyang Wan, Chengzhi Gao, Ruiping Wang, Xilin Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文综述了视觉识别中可解释性的发展,从意图、对象、呈现和方法学角度建立多维分类法,总结了关键评估指标,并探讨了多模态大语言模型的可解释性及实际应用。

Comments 20 pages, 8 figures, 7 tables. Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10156 2026-03-12 cs.LG cs.AI 62%

Mashup Learning: Faster Finetuning by Remixing Past Checkpoints

Mashup Learning: 通过混搭过往检查点实现更快的微调

Sofia Maria Lo Cicero Vaina, Artem Chumachenko, Max Ryabinin

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 Mashup Learning通过整合历史检查点提升模型适应新任务的准确率,并显著减少训练步骤和时间。

Comments 18 pages, 7 figures. Code: https://github.com/2son1a/mashup-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07960 2026-03-12 cs.HC cs.AI cs.LG 62%

A Systematic Evaluation of Self-Supervised Learning for Label-Efficient Sleep Staging with Wearable EEG

可穿戴EEG设备在标签高效睡眠分期中的自监督学习系统评估

Emilio Estevan, María Sierra-Torralba, Eduardo López-Larraz, Luis Montesano

机构 * Bitbrain DIIS - I3A, Universidad de Zaragoza(DIIS - I3A,阿拉瓦大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统评估了使用可穿戴EEG进行睡眠分期的自监督学习方法,证明其在减少标注依赖的同时能提升分类性能,达到临床级准确率。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10041 2026-03-12 cs.CR cs.LG 57%

Evaluating Generalization Mechanisms in Autonomous Cyber Attack Agents

评估自主网络攻击代理的泛化机制

Ondřej Lukáš, Jihoon Shin, Emilia Rivas, Diego Forni, Maria Rigaki, Carlos Catania, Aritran Piplai, Christopher Kiekintveld, Sebastian Garcia

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 本文评估了自主网络攻击代理在IP重新分配下的泛化能力,发现基于LLM的代理在测试中表现最佳,但牺牲了透明性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03850 2026-03-12 cs.HC cs.AI cs.CV 57%

WebAccessVL: Violation-Aware VLM for Web Accessibility

WebAccessVL: 为网页可访问性而设计的违反意识VLM

Amber Yijia Zheng, Jae Joong Lee, Bedrich Benes, Raymond A. Yeh

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 WebAccessVL通过基于违规的VLM自动修正网页HTML,显著减少可访问性违规,提升网页可访问性与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10888 2026-03-12 cs.SD 50%

VoxCare: Studying Natural Communication Behaviors of Hospital Caregivers through Wearable Sensing of Egocentric Audio

VoxCare: 通过可穿戴的自体音频传感研究医院护理人员的自然沟通行为

Tiantian Feng, Kleanthis Avramidis, Anfeng Xu, Deqi Wang, Brandon M Booth, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) The University of Memphis(孟菲斯大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 VoxCare通过可穿戴音频传感研究医院护理人员的自然沟通行为,利用实时声学特征提取和教师-学生框架识别语音活动,揭示沟通频率、持续时间和语音唤醒度,为理解医疗专业人员行为提供数据驱动的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10773 2026-03-12 cs.HC 50%

AI-Generated Rubric Interfaces: K-12 Teachers' Perceptions and Practices

AI生成的评分标准界面:K-12教师的感知与实践

Bahare Riahi, Sayali Patukale, Joy Niranjan, Yogya Koneru, Tiffany Barnes, Veronica Cateté

专题命中 评测与基准 :prompting(abstract)

AI总结 本研究探讨了K-12教师在使用AI生成评分标准时的感知与实践,发现AI生成的评分标准在结构和清晰度上有帮助,但需要教师监督以确保准确性和相关性。

Comments 20 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10703 2026-03-12 cs.CV cs.CY 50%

WalkGPT: Grounded Vision-Language Conversation with Depth-Aware Segmentation for Pedestrian Navigation

WalkGPT: 基于深度感知的视觉语言对话用于行人导航

Rafi Ibn Sultan, Hui Zhu, Xiangyu Zhou, Chengyin Li, Prashant Khanduri, Marco Brocanelli, Dongxiao Zhu

专题命中 评测与基准 :language model(abstract)

AI总结 WalkGPT通过结合视觉语言模型与深度感知分割技术,实现无障碍导航指导,提供精准的可访问性评估和深度估计。

Comments Accepted by CVPR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 35 篇

2403.10799 2026-03-12 cs.CL cs.AI cs.LG 90%

Toward Adaptive Large Language Models Structured Pruning via Hybrid-grained Weight Importance Assessment

面向基于混合粒度权重重要性评估的自适应大语言模型结构剪枝

Jun Liu, Zhenglun Kong, Pu Zhao, Changdi Yang, Hao Tang, Xuan Shen, Geng Yuan, Wei Niu, Wenbin Zhang, Xue Lin, Dong Huang, Yanzhi Wang

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HyWIA方法,通过混合粒度权重重要性评估提升大语言模型剪枝效果,实现更优的性能保留和结构优化。

Comments AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10775 2026-03-12 cs.CL 89%

Large Language Models as Annotators for Machine Translation Quality Estimation

大语言模型作为机器翻译质量估计的标注器

Sidi Wang, Sophie Arnoult, Amir Kamran

机构 * Maastricht university(马斯特里赫特大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Taus

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出利用大语言模型生成MQM标注以训练COMET模型,通过简化标注方案提升中文-英文和英文-德语的段级机器翻译质量估计性能。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10088 2026-03-12 cs.LG cs.AI 88%

ES-dLLM: Efficient Inference for Diffusion Large Language Models by Early-Skipping

ES-dLLM:通过早期跳过实现扩散大语言模型的高效推理

Zijian Zhu, Fei Ren, Zhanhong Tan, Kaisheng Ma

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 ES-dLLM通过早期跳过技术提升扩散大语言模型的推理效率,实现高达16.8倍的加速效果。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09579 2026-03-12 cs.CL cs.AI 88%

Modelling Language using Large Language Models

利用大语言模型建模语言

Jumbly Grindrod

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了大型语言模型作为公共语言科学模型的潜力,提出通过计算语言学研究开发模型诠释以理解语言结构。

Comments Philosophical Studies (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10862 2026-03-12 cs.SD 87%

OSUM-Pangu: An Open-Source Multidimension Speech Understanding Foundation Model Built upon OpenPangu on Ascend NPUs

OSUM-Pangu:基于OpenPangu在Ascend NPUs上的开源多维语音理解基础模型

Yujie Liao, Xuelong Geng, Hongfei Xue, Shuiyuan Wang, Lei Xie

机构 * Ascend NPUs(Ascend NPU)

专题命中 效率与部署 :foundation model(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 OSUM-Pangu基于非CUDA的Ascend NPU平台,结合openPangu-7B LLM后端,实现语音理解任务的高准确率与自然语言交互能力。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01815 2026-03-12 cs.CL cs.AI cs.LG 87%

KV Cache Transform Coding for Compact Storage in LLM Inference

KV缓存变换编码用于LLM推理中的紧凑存储

Konrad Staniszewski, Adrian Łańcucki

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 KVTC通过变换编码实现LLM推理中的高效缓存压缩,保持推理和长上下文准确性,压缩率可达20倍或更高。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01914 2026-03-12 cs.CL 85%

AdaPonderLM: Gated Pondering Language Models with Token-Wise Adaptive Depth

AdaPonderLM: 带令牌级自适应深度的门控沉思语言模型

Shixiang Song, He Li, Zitong Wang, Boyi Zeng, Feichen Song, Yixuan Wang, Zhiqin John Xu, Ziwei He, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) School of Artificial Intelligence(人工智能学院) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Sun Yat-sen University(中山大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 AdaPonderLM通过自适应深度和令牌级门控机制,在保持语言建模性能的同时减少推理计算,实现高效自监督训练。

详情

展开后加载摘要…

URL PDF HTML 收藏