arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-09 至 2026-03-09 共收录 219 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 60 篇

2603.04992 2026-03-09 cs.CL 85%

ThaiSafetyBench: Assessing Language Model Safety in Thai Cultural Contexts

ThaiSafetyBench: 评估泰语文化背景下语言模型的安全性

Trapoom Ukarapol, Nut Chukamphaeng, Kunat Pipatanakul, Pakhapoom Sarapat

机构 * SCB DataX(SCB数据X) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) SCBX R&D(SCBX研发部) SCB 10X

专题命中 评测与基准 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL

AI总结 本研究提出ThaiSafetyBench,通过泰语文化背景下的恶意提示评估语言模型安全性,发现闭源模型安全性更强,同时揭示了文化特定攻击的高风险。

Comments ICLR 2026 Workshop on Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05519 2026-03-09 cs.CL cs.HC cs.IR 83%

Verify as You Go: An LLM-Powered Browser Extension for Fake News Detection

边验证边检测:一种基于大语言模型的浏览器扩展用于假新闻检测

Dorsaf Sallami, Esma Aïmeur

机构 * Department of Computer Science and Operations Research, University of Montreal(计算机科学与运筹学系,蒙特利尔大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Aletheia通过结合RAG和大语言模型,提供基于证据的假新闻检测和用户互动功能,提升透明度和用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07658 2026-03-09 cs.CL 83%

From Raw Corpora to Domain Benchmarks: Automated Evaluation of LLM Domain Expertise

从原始语料到领域基准:对LLM领域专业知识的自动化评估

Nitin Sharma, Thomas Wolfers, Çağatay Yıldız

机构 * Department of Psychiatry and Psychotherapy(精神病学与心理学系) University Hospital Tübingen(图宾根大学医院) Laboratory for Mental Health Mapping(心理健康图谱实验室) Carl Zeiss Professor for AI in Neural Systems Imaging(神经系统成像人工智能教授职位) Friedrich Schiller University Jena(耶拿弗里德里克·施勒格尔大学) Cluster of Excellence Machine Learning for Science(卓越中心:科学机器学习) University of Tübingen(图宾根大学)

专题命中 评测与基准 :LLM(title,abstract);pretraining(abstract);分类 cs.CL

AI总结 本文提出了一种自动化流程,将原始语料转换为完成式领域基准,以评估LLM在特定领域的专业知识,避免了污染和人工标注的需要。

Comments 36 pages, 24 figures. Third version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21835 2026-03-09 cs.CV 82%

UniVBench: Towards Unified Evaluation for Video Foundation Models

UniVBench:迈向统一评估视频基础模型

Jianhui Wei, Xiaotian Zhang, Yichen Li, Yuan Wang, Yan Zhang, Ziyi Chen, Zhihang Tang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动) Zhejiang Lab(浙江实验室)

专题命中 评测与基准 :foundation model(title,abstract);prompting(abstract)

AI总结 UniVBench通过统一评估系统和多任务视频任务,首次提供衡量视频基础模型综合能力的框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08730 2026-03-09 cs.CL cs.LG 81%

How Reliable is Language Model Micro-Benchmarking?

语言模型微基准测试的可靠性如何?

Gregory Yauney, Shahzaib Saqib Warraich, Swabha Swayamdipta

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究探讨了微基准测试在不同规模下的可靠性,发现需至少250个示例才能一致排序模型,随机抽样在某些情况下与现有方法相当。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08087 2026-03-09 cs.LG cs.AI 81%

Performance Assessment Strategies for Language Model Applications in Healthcare

医疗领域语言模型应用的性能评估策略

Victor Garcia, Mariia Sidulova, Aldo Badano

机构 * U.S. Food and Drug Administration(美国食品药品监督管理局) Medtronic(美敦力)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了医疗领域语言模型应用的性能评估策略,分析了定量基准的局限性,并提出利用人类专业知识和低成本计算模型的评估方法。

Journal ref Artificial Intelligence in the Life Sciences. 2026;9:100162

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06148 2026-03-09 cs.CV cs.AI 79%

VLM-RobustBench: A Comprehensive Benchmark for Robustness of Vision-Language Models

VLM-RobustBench: 一种全面的视觉语言模型鲁棒性基准

Rohit Saxena, Alessandro Suglia, Pasquale Minervini

机构 * University of Edinburgh, UK(爱丁堡大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 VLM-RobustBench评估了视觉语言模型在不同图像失真下的鲁棒性,发现低严重性空间扰动对性能影响更大,提示需改进鲁棒性评估和训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05895 2026-03-09 cs.CL 79%

Building an Ensemble LLM Semantic Tagger for UN Security Council Resolutions

构建用于联合国安理会决议的集成大语言模型语义标注器

Hussein Ghaly

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出了一种基于集成大语言模型的语义标注方法,通过引入内容保留率和标签规范性指标,提高联合国安理会决议的标注准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05578 2026-03-09 cs.SE cs.AI 79%

Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent

Tool-Genesis: 一种以任务为导向的工具创建基准,用于自进化语言代理

Bowei Xia, Mengkang Hu, Shijian Wang, Jiarui Jin, Wenxiang Jiao, Yuan Lu, Kexin Li, Ping Luo

机构 * The University of Hong Kong(香港大学) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.AI

AI总结 Tool-Genesis提出一种任务驱动的工具创建基准,用于评估自进化语言代理在无预定义规范下构建任务相关工具的能力及下游性能。

Comments 25 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11247 2026-03-09 cs.CR cs.AI 79%

Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection

峰值+累积:多轮LLM攻击检测的代理层评分公式

J Alex Corll

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 提出一种基于峰值和累积的代理层评分公式,用于多轮LLM攻击检测,实现高召回率和低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14591 2026-03-09 cs.HC cs.AI cs.CL 79%

Just-In-Time Objectives: A General Approach for Specialized AI Interactions

即时目标:一种专门化人工智能交互的一般方法

Michelle S. Lam, Omar Shaikh, Hallie Xu, Alice Guo, Diyi Yang, Jeffrey Heer, James A. Landay, Michael S. Bernstein

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出即时目标方法,通过动态目标诱导提升AI交互的专门化性能,实验表明其在任务处理和质量评估上优于常规LLM。

Comments Accepted at CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05980 2026-03-09 cs.AI 78%

An Interactive Multi-Agent System for Evaluation of New Product Concepts

一个用于新产品概念评估的交互式多智能体系统

Bin Xuan, Ruo Ai, Hakyeon Lee

专题命中 评测与基准 :LLM(abstract,comments);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大型语言模型的多智能体系统,用于自动化评估新产品概念的技术可行性和市场可行性,通过结构化讨论和专业数据微调,验证概念并提升判断准确性。

Comments 46 pages, 3 figures + This paper proposes an LLM-based multi-agent system (MAS) for automated evaluation of new product concepts, incorporating retrieval-augmented generation (RAG) and cross-functional virtual agents to assess technical and market feasibility

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06166 2026-03-09 cs.CV 78%

FreeOcc: Training-free Panoptic Occupancy Prediction via Foundation Models

FreeOcc: 通过基础模型实现无训练的全景占用预测

Andrew Caunes, Thierry Chateau, Vincent Fremont

机构 * Logiroad, Nantes, France(法国南特Logiroad) LS2N - Ecole Centrale de Nantes, France(法国南特中央理工LS2N)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 FreeOcc通过基础模型实现无训练的全景占用预测,无需学习3D模型即可生成实例感知的3D场景表示。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06141 2026-03-09 cs.CV 78%

Spatial Colour Mixing Illusions as a Perception Stress Test for Vision-Language Models

空间色彩混合错觉作为视觉-语言模型的感知压力测试

Nicoleta-Nina Basoc, Adrian Cosma, Emilian Radoi

机构 * National University of Science and Technology POLITEHNICA Bucharest(波兰布加勒斯特技术大学) IDSIA, The Dalle Molle Institute for Artificial Intelligence(达摩信息技术研究所)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究通过空间色彩混合错觉测试视觉-语言模型的感知鲁棒性,发现模型在结构化色彩扭曲下表现下降,而人类表现更优,预处理步骤可提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22212 2026-03-09 cs.CL 77%

DETECT: Determining Ease and Textual Clarity of German Text Simplifications

DETECT:确定德语文本简化程度和文本清晰度

Maria Korobeynikova, Alessia Battisti, Lukas Fischer, Yingqiang Gao

机构 * University of Zurich(苏黎世大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DETECT是首个针对德语的文本简化评估指标,通过合成数据和LLM技术全面评估简化质量,提升与人类判断的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20047 2026-03-09 cs.IR cs.AI cs.DB 77%

HCT-QA: A Benchmark for Question Answering on Human-Centric Tables

HCT-QA:一种用于人类中心表格问答的基准测试

Mohammad S. Ahmad, Zan A. Naeem, Michaël Aupetit, Ahmed Elmagarmid, Mohamed Eltabakh, Xiaosong Ma, Mourad Ouzzani, Chaoyi Ruan, Hani Al-Sayeh

机构 * Meta

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 HCT-QA提出了一种用于人类中心表格问答的基准测试,包含大量真实和合成表格数据及对应的问答对,旨在评估和比较基于LLM和VLM的查询性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06422 2026-03-09 cs.CR 75%

Before You Hand Over the Wheel: Evaluating LLMs for Security Incident Analysis

在交出轮子之前:评估LLMs用于安全事件分析

Sourov Jajodia, Madeena Sultana, Suryadipta Majumdar, Adrian Taylor, Grant Vandenberghe

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SIABENCH框架,通过构建首个涵盖安全事件分析两大类任务的数据集,并实现自主执行SIA任务的代理,对11种LLM进行基准测试,以评估其在动态安全事件分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06181 2026-03-09 cs.CV 75%

Towards Motion Turing Test: Evaluating Human-Likeness in Humanoid Robots

迈向运动图灵测试:评估人形机器人的人性化

Mingzhe Li, Mengyin Liu, Zekai Wu, Xincheng Lin, Junsheng Zhang, Ming Yan, Zengye Xie, Changwang Zhang, Chenglu Wen, Lan Xu, Siqi Shen, Cheng Wang

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University(福建城市智能感知与计算重点实验室,厦门大学) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, School of Informatics, Xiamen University(多媒体可信感知与高效计算重点实验室,中华人民共和国教育部,信息学院,厦门大学) National Institute for Data Science in Health and Medicine, Xiamen University(医学数据科学国家研究院,厦门大学) OPPO Research Institute(OPPO研究院) ShanghaiTech University(上海科技大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出运动图灵测试框架,通过HHMotion数据集评估人形机器人动作的人性化程度,并展示基线模型在预测人性化的有效性。

Comments 13 pages, 10 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05515 2026-03-09 cs.HC 75%

Enhancing Tool Calling in LLMs with the International Tool Calling Dataset

通过国际工具调用数据集增强大语言模型的工具调用能力

Zuoyu Zhang, Yancheng Zhu

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出国际工具调用数据集ITC,用于提升大语言模型在多语言、多地区工具调用场景中的性能与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01646 2026-03-09 cs.CL cs.AI cs.LG 75%

ESGenius: Benchmarking LLMs on Environmental, Social, and Governance (ESG) and Sustainability Knowledge

ESGenius:对环境、社会和治理(ESG)及可持续性知识的LLM基准测试

Chaoyue He, Xin Zhou, Yi Wu, Xinjia Yu, Yan Zhang, Lei Zhang, Di Wang, Shengfei Lyu, Hong Xu, Xiaoqiao Wang, Wei Liu, Chunyan Miao

机构 * Alibaba-NTU Global e-Sustainability CorpLab (ANGEL)(阿里巴巴-NTU全球可持续性公司实验室) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ESGenius是首个针对LLM在ESG及可持续性知识评估的综合问答基准,通过RAG方法显著提升模型性能。

Comments EMNLP'25 Main Oral (42 pages, 10 figures, 11 tables), Nominations for Resource Award & Theme Paper Award

Journal ref In Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pages 14612-14653

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15735 2026-03-09 cs.AI cs.LG stat.ML 73%

ContextBench: Modifying Contexts for Targeted Latent Activation

ContextBench: 为定向激活潜在特征修改上下文

Robert Graham, Edward Stevinson, Leo Richter, Alexander Chia, Joseph Miller, Joseph Isaac Bloom

机构 * Imperial College London(帝国理工学院伦敦校区) University College London(伦敦大学学院) University of Oxford(牛津大学) UK AI Security Institute(英国人工智能安全研究所)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ContextBench通过上下文修改方法提升语言模型触发特定潜在特征的能力,结合LLM辅助和扩散模型实现最佳平衡效果。

Comments Published at ICLR 2026

Journal ref Proceedings of the International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13531 2026-03-09 cs.CY cs.AI cs.CL 73%

AdAEM: An Adaptively and Automated Extensible Measurement of LLMs' Value Difference

AdAEM:一种自适应和自动扩展的大型语言模型价值差异测量方法

Jing Yao, Shitong Duan, Xiaoyuan Yi, Dongkuan Xu, Peng Zhang, Tun Lu, Ning Gu, Zhicheng Dou, Xing Xie

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AdAEM是一种自适应和自动扩展的LLMs价值差异测量方法,通过自动生成和扩展测试问题,提高评估的多样性和信息性。

Comments This paper is accepted by ICLR 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05890 2026-03-09 cs.CL cs.AI 73%

Lost in Stories: Consistency Bugs in Long Story Generation by LLMs

迷失在故事中:由LLMs生成长篇故事中的不一致错误

Junjie Li, Xinrui Guo, Yuhao Wu, Roy Ka-Wei Lee, Hongzhi Li, Yutao Xie

机构 * Microsoft(微软公司) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ConStory-Bench通过评估长篇故事生成中的叙述一致性,揭示了LLMs在事实和时间维度上的不一致错误趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05553 2026-03-09 cs.SE cs.AI cs.CL 73%

EigenData: A Self-Evolving Multi-Agent Platform for Function-Calling Data Synthesis, Auditing, and Repair

EigenData: 一个自演化多智能体平台用于函数调用数据合成、审计与修复

Jiaao Chen, Jingyuan Qi, Mingye Gao, Wei-Chen Wang, Hanrui Wang, Di Jin

机构 * Eigen AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EigenData通过自演化多智能体平台实现函数调用数据的合成、审计与修复,提升基准测试的准确性和模型排名的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.06204 2026-03-09 cs.CL cs.AI cs.HC 73%

The Generative AI Paradox on Evaluation: What It Can Solve, It May Not Evaluate

生成AI悖论:它能解决什么,它可能无法评估

Juhyun Oh, Eunsu Kim, Inha Cha, Alice Oh

机构 * School of Computing, KAIST Daejeon, Republic of Korea(韩国釜山国立大学计算机学院) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了生成AI在评估任务中的局限性,发现LLMs在生成任务中表现优异,但在评估任务中却存在不忠实的问题,揭示了生成能力与评估能力之间的悖论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06256 2026-03-09 cs.CV cs.AI 70%

GazeMoE: Perception of Gaze Target with Mixture-of-Experts

GazeMoE:基于专家混合的注视目标感知

Zhuangzhuang Dai, Zhongxi Lu, Vincent G. Zakka, Luis J. Manso, Jose M Alcaraz Calero, Chen Li

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 GazeMoE通过MoE模块结合多模态线索,实现对注视目标的高精度识别,优于现有方法。

Comments 8 pages, 3 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06090 2026-03-09 cs.CV cs.CL 70%

DeepSight: Bridging Depth Maps and Language with a Depth-Driven Multimodal Model

DeepSight: 通过深度驱动的多模态模型连接深度图与语言

Hao Yang, Hongbo Zhang, Yanyan Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DeepSight通过深度驱动的多模态模型提升三维场景理解,利用深度图像特性增强空间推理能力,并通过新数据集和模型改进实现了深度感知和任务性能的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06025 2026-03-09 cs.IR cs.AI 70%

Sensitivity-Aware Retrieval-Augmented Intent Clarification

敏感性感知的检索增强意图澄清

Maik Larooij

机构 * ICAI OpenGov Lab x IRLab, University of Amsterdam, The Netherlands(ICAI开放政府实验室 x IRLab,阿姆斯特丹大学,荷兰)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种敏感性感知的检索增强意图澄清方法,旨在保护敏感信息的同时提升对话系统的性能。

Comments Accepted to CoSCIN@ECIR2026 (Workshop on Conversational Search for Complex Information Needs)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05923 2026-03-09 cs.CL cs.HC 70%

Learning Next Action Predictors from Human-Computer Interaction

从人机交互中学习下一步动作预测器

Omar Shaikh, Valentin Teutschbein, Kanishk Gandhi, Yikun Chi, Nick Haber, Thomas Robinson, Nilam Ram, Byron Reeves, Sherry Yang, Michael S. Bernstein, Diyi Yang

机构 * Stanford University(斯坦福大学) Hasso Plattner Institute(哈索普拉特纳研究所) New York University(纽约大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出LongNAP模型,通过结合参数化和上下文学习,从用户行为的完整上下文中预测下一步动作,显著优于传统方法。

Comments 32 pages, 10 figures, see https://generalusermodels.github.io/nap

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05750 2026-03-09 cs.CL 70%

NERdME: a Named Entity Recognition Dataset for Indexing Research Artifacts in Code Repositories

NERdME:一个用于代码仓库中索引研究制品的命名实体识别数据集

Genet Asefa Gesese, Zongxiong Chen, Shufan Jiang, Mary Ann Tan, Zhaotai Liu, Sonja Schimmler, Harald Sack

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) IRIT, UT, CNRS, Toulouse INP(IRIT、UT、CNRS、图卢兹INP)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 NERdME是一个用于代码仓库中研究制品索引的命名实体识别数据集,通过标注README文件中的实体类型,提升学术信息提取的准确性与实用性。

Comments To be published (Accepted at WWW'26)

详情

展开后加载摘要…

URL PDF HTML 收藏