arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2510.13884 2026-03-17 cs.CL 89%

Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation

观点过于开放?在大型语言模型中拥抱开放性以进行社会模拟

Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了在大型语言模型中采用开放性文本进行社会模拟的重要性,强调其在提升测量、探索意外观点和减少偏差方面的价值。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13317 2026-03-17 cs.LG cs.HC 89%

Evaluating Large Language Models for Gait Classification Using Text-Encoded Kinematic Waveforms

利用文本编码的运动学波形评估大语言模型用于步态分类

Carlo Dindorf, Jonas Dully, Rebecca Keilhauer, Michael Lorenz, Michael Fröhlich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究评估了将连续步态运动学波形编码为文本数值序列时,通用大语言模型在步态分类中的性能,并与传统机器学习方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14565 2026-03-17 cs.DL 89%

Can Large Language Models Evaluate Grant Proposal Quality? Revisiting the Wennerås and Wold Peer Review Data

大型语言模型能否评估项目申请质量?重新审视文纳斯和沃尔德同行评审数据

Ulf Sandström, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了大型语言模型在评分项目申请方面的准确性,发现其与专家评分的相关性较低,但可能在筛选或打破平局时有应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14173 2026-03-17 cs.LG cs.AI cs.IR 88%

Hybrid Intent-Aware Personalization with Machine Learning and RAG-Enabled Large Language Models for Financial Services Marketing

混合意图感知个性化:结合机器学习和RAG增强的大语言模型用于金融服务营销

Akhil Chandra Shanivendra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合架构,结合传统机器学习与RAG增强的大语言模型,用于金融服务营销中的个性化营销,通过时间编码器、潜在表示和多任务分类提高个性化准确性。

Comments 18 pages, 5 figures, 3 tables. Applied ML systems paper. The contribution is architectural rather than algorithmic

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22827 2026-03-17 cs.CL cs.LG 86%

TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models

TARAZ:波斯短答案问题基准用于语言模型的文化评估

Reihaneh Iranmanesh, Saeedeh Davoudi, Pasha Abrishamchian, Ophir Frieder, Nazli Goharian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一个评估框架,用于评估大型语言模型在波斯语中的文化能力,通过结合规则基于的形态学归一化和混合语法和语义相似性模块,改进评分一致性。

Comments 12 pages, 6 figures, Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16457 2026-03-17 cs.HC cs.AI cs.CL 86%

Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality

将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述

Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。

Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23329 2026-03-17 cs.AI cs.CL cs.CR cs.CY cs.HC 86%

LLM Novice Uplift on Dual-Use, In Silico Biology Tasks

大语言模型在双用途生物任务中的新手提升

Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael

机构 * Scale AI SecureBio University of Oxford(牛津大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。

Comments 59 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 85%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 85%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 85%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 85%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02569 2026-03-17 cs.CR cs.AI 85%

DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems

DECEIVE-AFC:针对具有搜索功能的基于大语言模型的事实核查系统的对抗性声明攻击

Haoran Ou, Kangjie Chen, Gelei Deng, Hangcheng Liu, Jie Zhang, Tianwei Zhang, Kwok-Yan Lam

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DECEIVE-AFC框架,通过新型声明级攻击策略和对抗性声明有效性评估原则,研究对抗性声明攻击对基于大语言模型的事实核查系统的影响,实验表明攻击显著降低验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20074 2026-03-17 cs.AI cs.CL 85%

Reason2Decide: Rationale-Driven Multi-Task Learning

Reason2Decide: 基于理由的多任务学习

H M Quamran Hasan, Housam Khalifa Bashier, Jiayi Dai, Mi-Young Kim, Randy Goebel

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Reason2Decide框架,通过两阶段训练解决自理据问题,提升预测准确性和解释一致性,在医疗数据集上优于基线模型,且模型规模更小。

Comments Uploaded the camera-version of the paper accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14172 2026-03-17 cs.LG cs.AI cs.NE 84%

Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI

自改进语言模型用于进化编程合成:ARC-AGI的案例研究

Julien Pourcel, Cédric Colas, Pierre-Yves Oudeyer

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOAR方法,通过将语言模型融入自改进进化循环中,提升编程合成性能,在ARC-AGI基准上实现显著改进。

Comments update related work

Journal ref Proceedings of the 42 nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 84%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19420 2026-03-17 cs.CV cs.LG 83%

CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models

CircuitProbe: 跟踪视频语言模型中的视觉时间证据流

Yiming Zhang, Zhuokai Zhao, Chengzhang Yu, Kun Wang, Zhendong Chu, Qiankun Li, Zihan Chen, Yang Liu, Zenghui Ding, Yining Sun, Qingsong Wen

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 83%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 82%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14236 2026-03-17 cs.RO cs.DC 82%

AeroGen: Agentic Drone Autonomy through Single-Shot Structured Prompting & Drone SDK

AeroGen:通过单次结构提示与无人机SDK实现代理无人机自主性

Kautuk Astu, Yogesh Simmhan

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract)

AI总结 本文提出AeroGen框架,通过结构化提示和AeroDaaS SDK实现无人机自主控制程序的可靠生成,验证了其在多种环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15523 2026-03-17 cs.CL cs.AI 81%

SlovKE: A Large-Scale Dataset and LLM Evaluation for Slovak Keyphrase Extraction

SlovKE:一个大规模数据集和LLM评估用于斯洛伐克关键词提取

David Števaňák, Marek Šuppa

机构 * University of Vienna, Austria(维也纳大学) Faculty of Mathematics, Physics and Informatics, Comenius University in Bratislava(布拉迪斯拉发comenius大学数学物理与信息学系) Cisco Systems, Inc.(思科系统公司) NaiveNeuron

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文构建了包含227432篇科学摘要的斯洛伐克关键词提取数据集,评估了三种无监督基线方法和KeyLLM方法,发现形态学不匹配是统计方法的主要失败模式。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 81%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 81%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13696 2026-03-17 cs.CL cs.LG 81%

Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models

无排斥性重复:儿童语言模型中指称机制的规模敏感性

Jon-Paul Cacioli

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究评估了文本模型中排斥性机制的规模敏感性,发现基于儿童对话训练的模型在指称抑制方面表现不敏感,且重复素有增强效应,挑战了传统排斥性假设。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 80%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08448 2026-03-17 cs.HC cs.AI cs.CL cs.LG 80%

A prospective clinical feasibility study of a conversational diagnostic AI in an ambulatory primary care clinic

前瞻性临床可行性研究:一种对话式诊断AI在门诊初级保健诊所中的应用

Peter Brodeur, Jacob M. Koshy, Anil Palepu, Khaled Saab, Ava Homiar, Roma Ruparel, Charles Wu, Ryutaro Tanno, Joseph Xu, Amy Wang, David Stutz, Wei-Hung Weng, Hannah M. Ferrera, David Barrett, Lindsey Crowley, Jihyeon Lee, Spencer E. Rittner, Ellery Wulczyn, Selena K. Zhang, Elahe Vedadi, Christine G. Kohn, Kavita Kulkarni, Vinay Kadiyala, Sara Mahdavi, Wendy Du, Jessica M. Williams, David Feinbloom, Renee Wong, Tao Tu, Petar Sirkovic, Alessio Orlandi, Christopher Semturs, Yun Liu, Juraj Gottweis, Dale R. Webster, Joëlle Barral, Katherine Chou, Pushmeet Kohli, Avinatan Hassidim, Yossi Matias, James Manyika, Rob Fields, Jonathan X. Li, Marc L. Cohen, Vivek Natarajan, Mike Schaekermann, Alan Karthikesalingam, Adam Rodman

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了基于大语言模型的对话式AI在真实临床环境中的可行性,评估了其安全性、质量和临床推理能力,并展示了AI在初级保健中的初步应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15513 2026-03-17 cs.CL 79%

ViX-Ray: A Vietnamese Chest X-Ray Dataset for Vision-Language Models

ViX-Ray: 一个用于视觉-语言模型的越南胸部X光数据集

Duy Vu Minh Nguyen, Chinh Thanh Truong, Phuc Hoang Tran, Hung Tuan Le, Nguyen Van-Thanh Dat, Trung Hieu Pham, Kiet Van Nguyen

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出ViX-Ray数据集,包含5400张越南胸部X光图像,用于评估和推动视觉-语言模型在越南临床领域的应用,发现现有模型在印象生成上存在低精度和过度幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14769 2026-03-17 cs.CV cs.CL 79%

Frame Sampling Strategies Matter: A Benchmark for small vision language models

帧采样策略至关重要:小视觉语言模型的基准测试

Marija Brkic, Anas Filali Razzouki, Yannis Tevissen, Khalil Guetari, Mounim A. El Yacoubi

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出首个小规模视频视觉语言模型的帧准确基准测试,揭示了不同帧采样策略对模型性能的影响,强调了标准化采样策略的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14456 2026-03-17 cs.CL cs.SD 79%

PARSA-Bench: A Comprehensive Persian Audio-Language Model Benchmark

PARSA-Bench:一个全面的波斯语音-语言模型基准

Mohammad Javad Ranjbar Kalahroodi, Mohammad Amini, Parmis Bathayan, Heshaam Faili, Azadeh Shakery

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 PARSA-Bench是首个针对波斯语言和文化评估大音频-语言模型的基准,包含16个任务和8000多个样本,涵盖语音理解、语篇分析和文化语音理解,揭示模型在文化相关任务中的局限性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14030 2026-03-17 cs.LG 79%

Benchmarking Open-Source PPG Foundation Models for Biological Age Prediction

对基于开放源代码的PPG基础模型进行基准测试以预测生物年龄

N. Brag

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 研究比较了三种PPG模型在预测生物年龄上的性能,发现特定任务模型在不同临床群体中表现不佳,而通用基础模型在相同数据上表现更优,探讨了其原因及对PPG生物年龄预测的意义。

Comments 11 pages, 4 figures, 3 tables. Code available at https://github.com/Misterbra/ppg-age-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06348 2026-03-17 cs.CV cs.AI 79%

GazeVLM: A Vision-Language Model for Multi-Task Gaze Understanding

GazeVLM:一种多任务眼动理解的视觉-语言模型

Athul M. Mathew, Haithem Hermassi, Thariq Khalid, Arshad Ali Khan

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出GazeVLM,一种多任务眼动理解的视觉-语言模型,通过融合视觉和文本模态,实现目标检测、眼动目标检测和眼动物体识别,取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏