arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-11 至 2026-03-11 共收录 57 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2603.09100 2026-03-11 cs.SE 90%

Class Model Generation from Requirements using Large Language Models

基于大型语言模型的需求生成类模型

Jackson Nguyen, Rui En Koe, Fanyu Wang, Chetan Arora, Alessio Ferrari

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文研究了大型语言模型在自动从自然语言需求生成UML类图方面的有效性,通过双验证框架评估模型生成的准确性和一致性。

Comments Accepted by The Eighth Workshop on Modeling and Simulation of Software-Intensive Systems (MSSiS 2026), ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09884 2026-03-11 cs.CL cs.CY 89%

Benchmarking Political Persuasion Risks Across Frontier Large Language Models

在前沿大语言模型中评估政治说服风险基准

Zhongren Chen, Joshua Kalla, Quan Le

机构 * Yale University(耶鲁大学) Department of Statistics & Data Science(统计与数据科学系) Coefficient Giving

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本研究评估了前沿大语言模型在政治说服方面的风险,发现Claude模型说服力最强,Grok最弱,且信息提示效果因模型而异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04664 2026-03-11 cs.CL cs.AI 88%

CRANE: Causal Relevance Analysis of Language-Specific Neurons in Multilingual Large Language Models

CRANE: 多语言大语言模型中语言特异性神经元的因果相关性分析

Yifan Le, Yunliang Li

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 CRANE通过神经元层面的干预分析,揭示多语言大模型中语言特异性神经元的因果相关性,更精确地分离语言特异性组件。

Comments 10 pages, 6 figures. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09452 2026-03-11 cs.CR cs.CL 88%

CyberThreat-Eval: Can Large Language Models Automate Real-World Threat Research?

CyberThreat-Eval: 大型语言模型能否自动化现实中的威胁研究?

Xiangsen Chen, Xuan Feng, Shuo Chen, Matthieu Maitre, Sudipto Rakshit, Diana Duvieilh, Ashley Picone, Nan Tang

机构 * Microsoft Research(微软研究院) Microsoft(微软)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 CyberThreat-Eval通过专家标注的基准测试评估大型语言模型在威胁情报工作流程中的实际表现,揭示其在复杂细节处理和信息区分上的不足。

Comments Accepted at TMLR

Journal ref Transactions on Machine Learning Research (2025), ISSN 2835-8856

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09533 2026-03-11 cs.AI cs.CL 88%

Enhancing Debunking Effectiveness through LLM-based Personality Adaptation

通过基于大语言模型的人格适应增强反驳效果

Pietro Dell'Oglio, Alessandro Bondielli, Francesco Marcelloni, Lucia C. Passaro

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究通过基于LLM的人格适应技术生成个性化虚假新闻反驳信息,发现开放性特质提升说服力,神经质降低说服力,并探讨了多模型评估的必要性及伦理问题。

Comments In: Computational Intelligence. IJCCI 2025. Springer, Cham (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09535 2026-03-11 cs.MM cs.AI cs.CL cs.DL 86%

AI Blob! LLM-Driven Recontextualization of Italian Television Archives

AI Blob!:基于大型语言模型的意大利电视档案再上下文化

Roberto Balestri

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AI Blob!利用大型语言模型和语义技术对意大利电视档案进行再上下文化,通过自动语音识别和向量数据库实现动态检索与叙事重构。

Comments Preprint

Journal ref 16th Media Mutations International Conference (pp. 123-133) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08999 2026-03-11 cs.CR cs.AI 85%

MCP Bridge: A Lightweight, LLM-Agnostic RESTful Proxy for Model Context Protocol Servers

MCP Bridge:一种轻量级、LLM无关的RESTful代理,用于模型上下文协议服务器

Arash Ahmadi, Sarah Sharif, Yaser M. Banad

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MCP Bridge是一种轻量级RESTful代理,通过统一API连接多个MCP服务器,支持任意后端,提升安全性和跨平台兼容性,优化模型在MCPToolBench++上取得73.0%的F1分数。

Comments 42 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22706 2026-03-11 cond-mat.mtrl-sci 85%

LLM-driven discovery for carbon allotropes with bond-network entropy

基于大语言模型的碳同素异形体发现及其键网络熵

Yuzhou Hao, Yujie Liu, Xuejie Li, Turab Lookman, Xiangdong Ding, Jun Sun, Zhibin Gao

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 利用大语言模型和机器学习势能结合,发现具有混合sp-sp³杂化的新型碳同素异形体,展现极端热各向异性和超硬特性。

Journal ref Appl. Phys. Lett. 128, 102202 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09155 2026-03-11 cs.CL cs.AI 84%

OPENXRD: A Comprehensive Benchmark Framework for LLM/MLLM XRD Question Answering

OPENXRD:一个全面的基准框架用于LLM/MLLM XRD问答

Ali Vosoughi, Ayoub Shahnazari, Yufeng Xi, Zeliang Zhang, Griffin Hess, Chenliang Xu, Niaz Abdolrahim

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OPENXRD是一个用于评估LLM和MLLM在晶体学问答中性能的综合基准框架,通过专家审核材料验证内容质量对模型性能的关键影响。

Comments Accepted at Digital Discovery (Royal Society of Chemistry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09821 2026-03-11 cs.CL 83%

One-Eval: An Agentic System for Automated and Traceable LLM Evaluation

One-Eval: 一个用于自动化和可追溯的LLM评估代理系统

Chengyu Shen, Yanheng Hou, Minghui Pan, Runming He, Zhen Hao Wong, Meiyi Qiang, Zhou Liu, Hao Liang, Peichao Lai, Zeang Sheng, Wentao Zhang

机构 * Peking University(北京大学) Beijing Institute of Technology(北京理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 One-Eval通过自动化和可追溯的评估流程,提升大语言模型评估的效率和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00184 2026-03-11 cs.CV cs.AI 83%

Zero-Shot and Supervised Bird Image Segmentation Using Foundation Models: A Dual-Pipeline Approach with Grounding DINO~1.5, YOLOv11, and SAM~2.1

基于基础模型的零样本和监督鸟类图像分割:结合Grounding DINO~1.5、YOLOv11和SAM~2.1的双管道方法

Abhinav Munagala

专题命中 评测与基准 :foundation model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出基于基础模型的双管道方法,利用Grounding DINO、YOLO和SAM实现零样本和监督的鸟类图像分割,提升分割精度并简化领域适应过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09940 2026-03-11 cs.LG 79%

SignalMC-MED: A Multimodal Benchmark for Evaluating Biosignal Foundation Models on Single-Lead ECG and PPG

SignalMC-MED: 一种用于评估单导联ECG和PPG上生物信号基础模型的多模态基准

Fredrik K. Gustafsson, Xiao Gu, Mattia Carletti, Patitapaban Palo, David W. Eyre, David A. Clifton

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 SignalMC-MED是一个用于评估单导联ECG和PPG上生物信号基础模型的多模态基准,展示了多模态融合和长时信号在提升模型性能上的优势。

Comments Code is available at https://github.com/fregu856/SignalMC-MED

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09043 2026-03-11 cs.AI 79%

Time, Identity and Consciousness in Language Model Agents

时间、身份与语言模型代理的意识

Elija Perrier, Michael Timothy Bennett

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出一种基于时间间隙的框架,用于评估语言模型代理的身份持续性,通过分离成分发生与共存,建立身份形态空间并提供保守的评估工具。

Comments Accepted at AAAI 2026 Spring Symposium - Machine Consciousness: Integrating Theory, Technology, and Philosophy

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08930 2026-03-11 cs.CV cs.AI 79%

Using Vision Language Foundation Models to Generate Plant Simulation Configurations via In-Context Learning

利用视觉语言基础模型通过上下文学习生成植物模拟配置

Heesup Yun, Isaac Kazuo Uyehara, Earl Ranario, Lars Lundqvist, Christine H. Diepenbrock, Brian N. Bailey, J. Mason Earles

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 评测与基准 :foundation model(title);language model(abstract);分类 cs.AI

AI总结 本文利用视觉语言基础模型通过上下文学习生成植物模拟配置,解决高复杂度和低吞吐量的问题,提供可扩展的农业数字孪生框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08852 2026-03-11 cs.AI cs.MA cs.SE 79%

LDP: An Identity-Aware Protocol for Multi-Agent LLM Systems

LDP:一种面向多智能体LLM系统的身份感知协议

Sunil Prakash

机构 * Indian School of Business(印度管理学院)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 LDP是一种面向多智能体LLM系统的身份感知协议,通过五种机制提升委托效率与可控性。

Comments 16 pages, 9 figures, 8 tables, 4 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09160 2026-03-11 cs.CV cs.AI cs.LG 79%

RubiCap: Rubric-Guided Reinforcement Learning for Dense Image Captioning

RubiCap:基于评分标准的强化学习用于密集图像描述

Tzu-Heng Huang, Sirajul Salekin, Javier Movellan, Frederic Sala, Manjot Bilkhu

机构 * Apple(苹果公司) University of Wisconsin—Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 RubiCap通过基于评分标准的强化学习方法,在密集图像描述任务中实现了更高的胜率和词效,优于监督蒸馏和传统RL方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09826 2026-03-11 cs.CV 78%

VLM-Loc: Localization in Point Cloud Maps via Vision-Language Models

基于视觉-语言模型的点云地图定位

Shuhao Kang, Youqi Liao, Peijie Wang, Wenlong Liao, Qilin Zhang, Benjamin Busam, Xieyuanli Chen, Yun Liu

专题命中 评测与基准 :language model(title,abstract)

AI总结 VLM-Loc通过视觉-语言模型的空间推理能力,实现了更准确的文本到点云定位,提升了复杂环境中的定位鲁棒性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09471 2026-03-11 cs.CV 78%

OmniEarth: A Benchmark for Evaluating Vision-Language Models in Geospatial Tasks

OmniEarth:一个评估遥感任务中视觉-语言模型的基准

Ronghao Fu, Haoran Liu, Weijie Zhang, Zhiwen Lin, Xiao Yang, Peng Zhang, Bo Yang

机构 * Jilin University(吉林大学) Chang Guang Satellite Technology(长光卫星技术)

专题命中 评测与基准 :language model(title,abstract)

AI总结 OmniEarth是一个评估遥感任务中视觉-语言模型性能的基准,通过多维任务和严格测试协议,揭示现有模型在复杂地理任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25896 2026-03-11 cs.CV 78%

LLaVAShield: Safeguarding Multimodal Multi-Turn Dialogues in Vision-Language Models

LLaVAShield: 保障视觉语言模型中的多模态多轮对话安全

Guolei Huang, Qinzhi Peng, Gan Xu, Yao Huang, Yuxuan Lu, Yongjun Shen

机构 * Southeast University(东南大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Zhejiang University of Technology(浙江工业大学) Tsinghua University(清华大学) RealAI

专题命中 评测与基准 :language model(title,abstract)

AI总结 LLaVAShield通过构建MMDS数据集和MMRT框架,有效提升多模态多轮对话的安全性,优于现有VLMs和内容审查工具,揭示了主流模型的安全漏洞。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09044 2026-03-11 cs.CR cs.SE 78%

Synergistic Directed Execution and LLM-Driven Analysis for Zero-Day AI-Generated Malware Detection

协同引导执行与LLM驱动分析用于零日AI生成恶意软件检测

George Edwards, Mahdi Eslamimehr

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出了一种结合协同执行与LLM驱动分析的框架,用于高效检测零日AI生成恶意软件,通过改进的路径优先级和反馈机制提升检测准确率。

Comments 18 pages, CRIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09157 2026-03-11 cs.AI 77%

Real-Time Trust Verification for Safe Agentic Actions using TrustBench

基于TrustBench的安全代理行为实时信任验证

Tavishi Sharma, Vinayak Sharma, Pragya Sharma

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 TrustBench通过双模式框架在代理行动前验证安全性,有效减少有害行为,提升自主代理的可信度

Comments Accepted at the AAAI 2026 Workshop on Trust and Control in Agentic AI (TrustAgent)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07191 2026-03-11 cs.CR cs.AI 77%

Governance Architecture for Autonomous Agent Systems: Threats, Framework, and Engineering Practice

自主代理系统治理架构:威胁、框架与工程实践

Yuxu Ge

机构 * University of York(约克大学) Department of Computer Science(计算机科学系) York United Kingdom(约克英国)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出分层治理架构LGA,通过四层框架有效拦截恶意工具调用,实验表明其在不同部署场景下均表现出高拦截率和低虚警率。

Comments 22 pages, 2 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07968 2026-03-11 cs.CL 77%

SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge

SimpleQA Verified: 一个可靠的事实性基准以衡量参数知识

Lukas Haas, Gal Yona, Giovanni D'Antonio, Sasha Goldshtein, Dipanjan Das

机构 * Google(谷歌)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SimpleQA Verified 是一个用于衡量大规模语言模型事实性的可靠基准,通过改进过滤流程和评分提示,提升了评估的准确性与挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08718 2026-03-11 cs.AR cs.AI 77%

CktEvo: Repository-Level RTL Code Benchmark for Design Evolution

CktEvo: 用于设计演化的仓库级RTL代码基准

Zhengyuan Shi, Jingxin Wang, Tairan Cheng, Changran Xu, Weikang Qian, Qiang Xu

机构 * The Chinese University of Hong Kong(中国香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CktEvo提出一个用于仓库级RTL代码演化的基准和框架,通过闭环框架实现PPA改进,无需人工干预。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00718 2026-03-11 cs.CL cs.SE 74%

SkillCraft: Can LLM Agents Learn to Use Tools Skillfully?

SkillCraft: 能否让大语言模型代理学会灵活使用工具?

Shiqi Chen, Jingze Gai, Ruochen Zhou, Jinghan Zhang, Tongyao Zhu, Junlong Li, Kangrui Wang, Zihan Wang, Zhengyu Chen, Klara Kaleb, Ning Miao, Siyang Gao, Cong Lu, Manling Li, Junxian He, Yee Whye Teh

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 SkillCraft基准通过测试代理形成和重用高阶工具组合的能力,评估大语言模型在工具使用中的效率提升与技能积累。

Comments 21 pages. Code: https://github.com/shiqichen17/SkillCraft ; Project page: https://skillcraft-website.github.io/page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09434 2026-03-11 cs.CL cs.AI 73%

Common Sense vs. Morality: The Curious Case of Narrative Focus Bias in LLMs

常识与道德:LLMs中叙述焦点偏见的奇特案例

Saugata Purkayastha, Pranav Kushare, Pragya Paramita Pal, Sukannya Purkayastha

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLMs在道德困境中优先道德推理而非常识理解的偏见,提出CoMoral数据集并揭示了模型在识别常识矛盾时的叙述焦点偏见问题。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08936 2026-03-11 cs.SD cs.AI cs.CL cs.MM eess.AS 73%

VoxEmo: Benchmarking Speech Emotion Recognition with Speech LLMs

VoxEmo:基于语音大语言模型的语音情感识别基准测试

Hezhao Zhang, Huang-Cheng Chou, Shrikanth Narayanan, Thomas Hain

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Signal Analysis and Interpretation Laboratory (SAIL), Ming Hsieh Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, CA 90089, USA(美国南加州大学电气与计算机工程系信号分析与解释实验室(SAIL))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VoxEmo是一个基于语音大语言模型的语音情感识别基准测试,通过提供多样化的提示复杂度和分布感知的软标签协议,评估模型在真实世界中的情感识别能力。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08173 2026-03-11 cs.RO cs.AI cs.CL cs.CV 73%

NavSpace: How Navigation Agents Follow Spatial Intelligence Instructions

NavSpace: 导航代理如何遵循空间智能指令

Haolin Yang, Yuxing Long, Zhuoyuan Yu, Zihan Yang, Minghan Wang, Jiapeng Xu, Yihan Wang, Ziyan Yu, Wenzhe Cai, Lei Kang, Hao Dong

机构 * CFCS, School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 NavSpace基准测试通过评估导航代理的空间感知与推理能力,提出SNav模型在指令遵循任务中表现优异,为具身智能研究提供新基准。

Comments ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09070 2026-03-11 cs.RO 71%

3D UAV Trajectory Estimation and Classification from Internet Videos via Language Model

通过语言模型从互联网视频中估计和分类3D无人机轨迹

Haoxiang Lei, Daotong Wang, Shenghai Yuan, Jianbo Su

专题命中 评测与基准 :language model(title)

AI总结 本文提出通过语言模型从互联网视频中估计和分类无人机3D轨迹,无需人工标注,实现了高效的数据采集与轨迹推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09853 2026-03-11 cs.SD cs.AI 70%

SCENEBench: An Audio Understanding Benchmark Grounded in Assistive and Industrial Use Cases

SCENEBench:一个基于辅助和工业用例的音频理解基准测试

Laya Iyer, Angelina Wang, Sanmi Koyejo

机构 * Stanford University(斯坦福大学) Cornell Tech(康奈尔科技)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SCENEBench通过评估音频理解的四个现实场景,揭示了现有LALMs在不同任务中的性能差异,为改进模型能力提供指导。

Comments Accepted to EACL 2026 (Main Conference). 10 pages, 10 figures. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏