arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 110 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 110 篇

2505.16643 2026-03-17 cs.CV cs.AI 90%

From Evaluation to Defense: Advancing Safety in Video Large Language Models

从评估到防御:推进视频大语言模型的安全性

Yiwei Sun, Peiqi Jiang, Chuanbin Liu, Luohao Lin, Zhiying Lu, Hongtao Xie

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出VideoSafety-R1框架,通过创新方法提升视频大语言模型的安全性,实验显示其在多个安全数据集上取得显著提升。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10969 2026-03-17 cs.LG cs.CL cs.CR cs.SE 90%

TOSSS: a CVE-based Software Security Benchmark for Large Language Models

TOSSS: 基于CVE的软件安全基准用于大语言模型

Marc Damie, Murat Bilgehan Ertan, Domenico Essoussi, Angela Makhanu, Gaëtan Peter, Roos Wensveen

机构 * University of Twente(特文特大学) CWI Amsterdam(阿姆斯特丹信息与计算科学研究所) Erasmus University Rotterdam(埃因霍温大学 Rotterdam分校) Modat

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TOSSS基准,用于评估大语言模型在选择安全与易受攻击代码片段能力,通过CVE数据库提供可扩展框架,评估14种模型在C/C++和Java代码中的安全得分,范围0.48至0.89。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00691 2026-03-17 cs.CL cs.LG 90%

Labels Generated by Large Language Models Help Measure People's Empathy in Vitro

由大型语言模型生成的标签有助于在体外测量人们的共情能力

Md Rakibul Hasan, Yue Yao, Md Zakir Hossain, Aneesh Krishna, Imre Rudas, Shafin Rahman, Tom Gedeon

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文探讨了利用大型语言模型生成的标签提升主流模型监督训练的潜力,通过噪声标签校正和训练数据增强策略,提高了共情计算任务的准确性,并在公开数据集上取得了显著成果。

Comments This work has been submitted to the IEEE for possible publication

Journal ref IEEE Journal of Selected Topics in Signal Processing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13691 2026-03-17 cs.CL cs.AI 90%

QuarkMedBench: A Real-World Scenario Driven Benchmark for Evaluating Large Language Models

QuarkMedBench: 一个基于现实场景的基准测试,用于评估大型语言模型

Yao Wu, Kangping Yin, Liang Dong, Zhenxin Ma, Shuting Xu, Xuehai Wang, Yuxuan Jiang, Tingting Yu, Yunqing Hong, Jiayi Liu, Rianzhe Huang, Shuxin Zhao, Haiping Hu, Wen Shang, Jian Xu, Guanjun Jiang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 QuarkMedBench通过构建大规模医疗数据集和自动评分框架,评估LLM在真实医疗查询中的表现,揭示传统考试指标的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13305 2026-03-17 cs.LG cs.AI 90%

Evidence-based Distributional Alignment for Large Language Models

基于证据的分布对齐用于大语言模型

Viet-Thanh Pham, Lizhen Qu, Zhuang Li, Gholamreza Haffari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Evi-DA方法,通过检索世界价值观调查数据预测国家条件下的答案分布,提升大语言模型在领域和文化变化下的分布估计精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14313 2026-03-17 cs.CL 89%

Mind the Shift: Decoding Monetary Policy Stance from FOMC Statements with Large Language Models

注意偏移:利用大语言模型从FOMC声明中解码货币政策立场

Yixuan Tang, Yi Yang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出Delta-Consistent Scoring框架,通过联合建模绝对立场和会议间相对变化,无需标注即可从FOMC声明中解码货币政策立场,实现时间一致的立场轨迹,提升分类准确率并具有经济意义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13884 2026-03-17 cs.CL 89%

Too Open for Opinion? Embracing Open-Endedness in Large Language Models for Social Simulation

观点过于开放?在大型语言模型中拥抱开放性以进行社会模拟

Bolei Ma, Yong Cao, Indira Sen, Anna-Carolina Haensch, Frauke Kreuter, Barbara Plank, Daniel Hershcovich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文探讨了在大型语言模型中采用开放性文本进行社会模拟的重要性,强调其在提升测量、探索意外观点和减少偏差方面的价值。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13317 2026-03-17 cs.LG cs.HC 89%

Evaluating Large Language Models for Gait Classification Using Text-Encoded Kinematic Waveforms

利用文本编码的运动学波形评估大语言模型用于步态分类

Carlo Dindorf, Jonas Dully, Rebecca Keilhauer, Michael Lorenz, Michael Fröhlich

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究评估了将连续步态运动学波形编码为文本数值序列时,通用大语言模型在步态分类中的性能,并与传统机器学习方法进行比较。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14565 2026-03-17 cs.DL 89%

Can Large Language Models Evaluate Grant Proposal Quality? Revisiting the Wennerås and Wold Peer Review Data

大型语言模型能否评估项目申请质量?重新审视文纳斯和沃尔德同行评审数据

Ulf Sandström, Mike Thelwall

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文评估了大型语言模型在评分项目申请方面的准确性,发现其与专家评分的相关性较低,但可能在筛选或打破平局时有应用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14173 2026-03-17 cs.LG cs.AI cs.IR 88%

Hybrid Intent-Aware Personalization with Machine Learning and RAG-Enabled Large Language Models for Financial Services Marketing

混合意图感知个性化:结合机器学习和RAG增强的大语言模型用于金融服务营销

Akhil Chandra Shanivendra

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种混合架构,结合传统机器学习与RAG增强的大语言模型,用于金融服务营销中的个性化营销,通过时间编码器、潜在表示和多任务分类提高个性化准确性。

Comments 18 pages, 5 figures, 3 tables. Applied ML systems paper. The contribution is architectural rather than algorithmic

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22827 2026-03-17 cs.CL cs.LG 86%

TARAZ: Persian Short-Answer Question Benchmark for Cultural Evaluation of Language Models

TARAZ:波斯短答案问题基准用于语言模型的文化评估

Reihaneh Iranmanesh, Saeedeh Davoudi, Pasha Abrishamchian, Ophir Frieder, Nazli Goharian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一个评估框架,用于评估大型语言模型在波斯语中的文化能力,通过结合规则基于的形态学归一化和混合语法和语义相似性模块,改进评分一致性。

Comments 12 pages, 6 figures, Fifteenth biennial Language Resources and Evaluation Conference (LREC) 2026 (to appear)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16457 2026-03-17 cs.HC cs.AI cs.CL 86%

Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality

将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述

Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了利用大语言模型驱动虚拟现实中的数字人类人格塑造方法,探讨了零样本、少样本和微调等技术,并指出计算需求、延迟及多模态交互评估框架缺乏等挑战。

Comments Revised and expanded version of the survey published in Findings of EMNLP 2025. Includes 14 pages and 2 figures

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, 9519--9532

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23329 2026-03-17 cs.AI cs.CL cs.CR cs.CY cs.HC 86%

LLM Novice Uplift on Dual-Use, In Silico Biology Tasks

大语言模型在双用途生物任务中的新手提升

Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael

机构 * Scale AI SecureBio University of Oxford(牛津大学) UC Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨大语言模型是否能提升新手在生物任务中的表现,通过多模型多基准测试发现LLM显著提升准确性,并指出单用途LLM可能超越辅助新手的表现。

Comments 59 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15372 2026-03-17 cs.SE cs.AI cs.CR 85%

SKILLS: Structured Knowledge Injection for LLM-Driven Telecommunications Operations

SKILLS: 为基于LLM的电信运维进行结构化知识注入

Ivo Brett

机构 * independent.academia.edu(独立学术教育)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨LLM在电信运维中执行API流程的可靠性,提出SKILLS框架,通过结构化知识指导提升模型性能,实验显示技能增强效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15121 2026-03-17 cs.LG stat.ML 85%

Establishing Construct Validity in LLM Capability Benchmarks Requires Nomological Networks

在LLM能力基准中建立构念效度需要规范网络

Timo Freiesleben

机构 * Munich Center for Mathematical Philosophy(慕尼黑数学哲学中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文探讨了通过规范网络框架建立LLM能力基准的效度问题,指出该框架比因果和推断框架更适合当前研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22680 2026-03-17 cs.AI 85%

Toward Personalized LLM-Powered Agents: Foundations, Evaluation, and Future Directions

迈向个性化大语言模型驱动的代理:基础、评估与未来方向

Yue Xu, Qian Chen, Zizhan Ma, Dongrui Liu, Wenxuan Wang, Xiting Wang, Li Xiong, Wenjie Wang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨个性化LLM代理的基础、评估及未来方向,分析了四个核心能力:用户画像建模、记忆、规划与行动执行,并总结了评估指标和应用场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21071 2026-03-17 cs.HC cs.AI 85%

FingerTip 20K: A Benchmark for Proactive and Personalized Mobile LLM Agents

FingerTip 20K: 一个用于主动和个性化移动大语言模型代理的基准测试

Qinglong Yang, Haoming Li, Haotian Zhao, Xiaokai Yan, Jingtao Ding, Fengli Xu, Yong Li

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FingerTip 20K基准测试,通过收集20000个真实用户多步骤Android交互演示,评估主动任务建议和个性化任务执行的挑战,展示基于用户信息的移动LLM代理的潜力。

Comments ICLR 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02569 2026-03-17 cs.CR cs.AI 85%

DECEIVE-AFC: Adversarial Claim Attacks against Search-Enabled LLM-based Fact-Checking Systems

DECEIVE-AFC:针对具有搜索功能的基于大语言模型的事实核查系统的对抗性声明攻击

Haoran Ou, Kangjie Chen, Gelei Deng, Hangcheng Liu, Jie Zhang, Tianwei Zhang, Kwok-Yan Lam

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DECEIVE-AFC框架,通过新型声明级攻击策略和对抗性声明有效性评估原则,研究对抗性声明攻击对基于大语言模型的事实核查系统的影响,实验表明攻击显著降低验证性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20074 2026-03-17 cs.AI cs.CL 85%

Reason2Decide: Rationale-Driven Multi-Task Learning

Reason2Decide: 基于理由的多任务学习

H M Quamran Hasan, Housam Khalifa Bashier, Jiayi Dai, Mi-Young Kim, Randy Goebel

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出Reason2Decide框架,通过两阶段训练解决自理据问题,提升预测准确性和解释一致性,在医疗数据集上优于基线模型,且模型规模更小。

Comments Uploaded the camera-version of the paper accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14172 2026-03-17 cs.LG cs.AI cs.NE 84%

Self-Improving Language Models for Evolutionary Program Synthesis: A Case Study on ARC-AGI

自改进语言模型用于进化编程合成:ARC-AGI的案例研究

Julien Pourcel, Cédric Colas, Pierre-Yves Oudeyer

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SOAR方法,通过将语言模型融入自改进进化循环中,提升编程合成性能,在ARC-AGI基准上实现显著改进。

Comments update related work

Journal ref Proceedings of the 42 nd International Conference on Machine Learning, Vancouver, Canada. PMLR 267, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00823 2026-03-17 cs.CL cs.AI 84%

A Comprehensive Evaluation of LLM Unlearning Robustness under Multi-Turn Interaction

大语言模型多轮交互下LLM去学习鲁棒性综合评估

Ruihao Pan, Suhang Wang

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究多轮交互环境下LLM去学习的稳定性,发现静态评估可能高估实际效果,强调需确保交互场景下的稳定遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19420 2026-03-17 cs.CV cs.LG 83%

CircuitProbe: Tracing Visual Temporal Evidence Flow in Video Language Models

CircuitProbe: 跟踪视频语言模型中的视觉时间证据流

Yiming Zhang, Zhuokai Zhao, Chengzhang Yu, Kun Wang, Zhendong Chu, Qiankun Li, Zihan Chen, Yang Liu, Zenghui Ding, Yining Sun, Qingsong Wen

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 研究提出CircuitProbe框架,通过视觉审计和语义追踪分析视频语言模型中的时间证据流,设计针对性干预提升时间理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13262 2026-03-17 cs.SD cs.AI 83%

Evaluation of Audio Language Models for Fairness, Safety, and Security

音频语言模型的公平性、安全性和安全性评估

Ranya Aloufi, Srishti Gupta, Soumya Shaw, Battista Biggio, Lea Schönherr

机构 * Computer Science, Taibah University, Saudi Arabia(塔布大学计算机科学系,沙特阿拉伯) La Sapienza, University of Rome, Rome, Italy(罗马大学拉·萨皮恩扎分校,意大利) CISPA Helmholtz Center for Information Security, Saarbrücken, Germany(信息安全赫尔姆霍茨研究中心,德国萨尔布吕肯) University of Cagliari, Cagliari, Italy(卡利亚里大学,意大利卡利亚里)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文提出一种结构化分类方法,评估音频语言模型在公平性、安全性和安全性方面的表现,揭示音频信息整合对语义推理的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13173 2026-03-17 cs.AI cs.CL 82%

Semantic Invariance in Agentic AI

代理AI中的语义不变性

I. de Zarzà, J. de Curtò, Jordi Cabot, Pietro Manzoni, Carlos T. Calafate

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出一种元测试框架,评估大语言模型代理在语义等效输入变化下的推理稳定性,发现模型规模与鲁棒性无正相关,较小的Qwen3-30B-A3B表现出最高稳定性。

Comments Accepted for publication in 20th International Conference on Agents and Multi-Agent Systems: Technologies and Applications (AMSTA 2026), to appear in Springer Nature proceedings (KES Smart Innovation Systems and Technologies). The final authenticated version will be available online at Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14236 2026-03-17 cs.RO cs.DC 82%

AeroGen: Agentic Drone Autonomy through Single-Shot Structured Prompting & Drone SDK

AeroGen:通过单次结构提示与无人机SDK实现代理无人机自主性

Kautuk Astu, Yogesh Simmhan

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract)

AI总结 本文提出AeroGen框架,通过结构化提示和AeroDaaS SDK实现无人机自主控制程序的可靠生成,验证了其在多种环境下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15523 2026-03-17 cs.CL cs.AI 81%

SlovKE: A Large-Scale Dataset and LLM Evaluation for Slovak Keyphrase Extraction

SlovKE:一个大规模数据集和LLM评估用于斯洛伐克关键词提取

David Števaňák, Marek Šuppa

机构 * University of Vienna, Austria(维也纳大学) Faculty of Mathematics, Physics and Informatics, Comenius University in Bratislava(布拉迪斯拉发comenius大学数学物理与信息学系) Cisco Systems, Inc.(思科系统公司) NaiveNeuron

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文构建了包含227432篇科学摘要的斯洛伐克关键词提取数据集,评估了三种无监督基线方法和KeyLLM方法,发现形态学不匹配是统计方法的主要失败模式。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06594 2026-03-17 cs.CL cs.AI 81%

A Coin Flip for Safety: LLM Judges Fail to Reliably Measure Adversarial Robustness

安全性的硬币翻转:LLM裁判无法可靠地衡量对抗鲁棒性

Leo Schwinn, Moritz Ladenburger, Tim Beyer, Mehrnaz Mofakhami, Gauthier Gidel, Stephan Günnemann

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文指出现有LLM裁判框架在评估对抗鲁棒性时存在分布偏移问题,提出ReliableBench和JudgeStressTest以提升评估可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05791 2026-03-17 cs.RO cs.AI cs.LG 81%

VLAD-Grasp: Zero-shot Grasp Detection via Vision-Language Models

VLAD-Grasp:基于视觉-语言模型的零样本抓取检测

Manav Kulshrestha, S. Talha Bukhari, Damon Conover, Aniket Bera

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VLAD-Grasp,一种基于视觉-语言模型的零样本抓取检测方法,通过生成目标图像、预测深度和分割、对齐点云来恢复可执行抓取姿态,无需训练数据,性能与最新方法相当。

Comments 8 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13696 2026-03-17 cs.CL cs.LG 81%

Repetition Without Exclusivity: Scale Sensitivity of Referential Mechanisms in Child-Scale Language Models

无排斥性重复:儿童语言模型中指称机制的规模敏感性

Jon-Paul Cacioli

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究评估了文本模型中排斥性机制的规模敏感性,发现基于儿童对话训练的模型在指称抑制方面表现不敏感,且重复素有增强效应,挑战了传统排斥性假设。

Comments 13 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14951 2026-03-17 cs.CV 80%

GT-PCQA: Geometry-Texture Decoupled Point Cloud Quality Assessment with MLLM

GT-PCQA: 一种基于多模态大语言模型的几何-纹理解耦点云质量评估方法

Guohua Zhang, Jian Jin, Meiqin Liu, Chao Yao, Weisi Lin, Yao Zhao

机构 * Beijing Jiaotong University(北京交通大学) Nanyang Technological University(南洋理工大学) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);instruction tuning(abstract);pretraining(abstract)

AI总结 本文提出GT-PCQA框架,通过2D-3D联合训练和几何-纹理解耦策略,解决点云质量评估中数据量少和模型对几何退化不敏感的问题,实现高效且泛化能力强的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏