arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-13 至 2026-03-13 共收录 237 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 57 篇

2507.14552 2026-03-13 cs.AI 89%

Large Language Models Assisting Ontology Evaluation

大语言模型辅助本体评估

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究提出OE-Assist框架,利用大语言模型辅助本体评估,通过自动化和半自动化CQ验证提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17113 2026-03-13 stat.ME stat.CO 89%

A systematic assessment of Large Language Models for constructing two-level fractional factorial designs

对大型语言模型构建两级分数因子设计的系统评估

Alan R. Vazquez, Kilian M. Rother, Marco V. Charles-Gonzalez

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文系统评估了GPT和Gemini模型在构建不同规模的两级分数因子设计中的性能,展示了其在优化设计生成中的有效性。

Comments 31 pages, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11597 2026-03-13 cs.CL cs.AI 88%

Performance Evaluation of Open-Source Large Language Models for Assisting Pathology Report Writing in Japanese

开源大语言模型在协助日文病历报告写作中的性能评估

Masataka Kawai, Singo Sakashita, Shumpei Ishikawa, Shogo Watanabe, Anna Matsuoka, Mikio Sakurai, Yasuto Fujimoto, Yoshiyuki Takahara, Atsushi Ohara, Hirohiko Miyake, Genichiro Ishii

机构 * Department of Pathology, University of Yamanashi, Chuo, Japan(山梨大学病理科) Division of Pathology, Exploratory Oncology Research & Clinical Trial Center, National Cancer Center, Kashiwa, Japan(国立癌症中心探索肿瘤研究与临床试验中心病理科) Department of Preventive Medicine, Graduate School of Medicine, The University of Tokyo, Tokyo, Japan(东京大学医学部预防医学科) Department of Medical Oncology, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院医学肿瘤科) Department of Thoracic Surgery, National Cancer Center Hospital East, Kashiwa, Japan(国立癌症中心东医院胸外科)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文评估了开源大语言模型在协助日文病历报告写作中的性能,发现思维模型和医学专用模型在结构化报告和拼写纠正中表现优异,但解释性输出的偏好存在较大差异。

Comments 9 pages (including bibliography), 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16211 2026-03-13 cs.SD cs.AI cs.CL eess.AS 88%

AudioTrust: Benchmarking the Multifaceted Trustworthiness of Audio Large Language Models

AudioTrust: 音频大语言模型多维可信度基准测试

Kai Li, Can Shen, Yile Liu, Jirui Han, Kelong Zheng, Xuechao Zou, Lionel Z. Wang, Shun Zhang, Xingjian Du, Hanjun Luo, Yingbin Jin, Xinxin Xing, Ziyang Ma, Yue Liu, Yifan Zhang, Junfeng Fang, Kun Wang, Yibo Yan, Gelei Deng, Haoyang Li, Yiming Li, Xiaobin Zhuang, Tianlong Chen, Qingsong Wen, Tianwei Zhang, Yang Liu, Haibo Hu, Zhizheng Wu, Xiaolin Hu, Eng-Siong Chng, Wenyuan Xu, XiaoFeng Wang, Wei Dong, Xinfeng Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 AudioTrust通过多维度评估音频大语言模型的可信度,揭示其在高风险音频场景下的局限性,为安全部署提供关键洞察。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20793 2026-03-13 cs.CL 88%

Multi-lingual Functional Evaluation for Large Language Models

多语言功能评估用于大语言模型

Victor Ojewale, Inioluwa Deborah Raji, Suresh Venkatasubramanian

机构 * The Center for Tech Responsibility, Brown University(布朗大学技术责任中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出跨语言小学数学符号基准和跨语言指令跟随评估,通过多语言翻译功能基准模板,评估大语言模型在多语言环境中的性能和鲁棒性,发现CL-GSM Symbolic和CL-IFEval在多语言任务中表现更优。

Comments This is an updated version with details of the CL-GSM Symbolic and CL-IFEval datasets validation

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11414 2026-03-13 cs.CL cond-mat.mtrl-sci 88%

MaterialFigBENCH: benchmark dataset with figures for evaluating college-level materials science problem-solving abilities of multimodal large language models

MaterialFigBENCH:用于评估多模态大语言模型在大学级材料科学问题解决能力的基准数据集

Michiko Yoshitake, Yuta Suzuki, Ryo Igarashi, Yoshitaka Ushiku, Keisuke Nagato

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MaterialFigBench是一个评估多模态大语言模型在材料科学问题中图表解读能力的基准数据集,通过137个问题测试模型在视觉理解和数值精度上的表现,揭示了当前模型在图表处理方面的不足。

Comments 27 pages, 4 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11513 2026-03-13 cs.CL 86%

Can Small Language Models Use What They Retrieve? An Empirical Study of Retrieval Utilization Across Model Scale

小型语言模型能利用它们检索到的信息吗?不同模型规模下的检索利用经验研究

Sanchit Pandey

专题命中 评测与基准 :language model(title,abstract);small language model(title);分类 cs.CL

AI总结 研究发现小型语言模型在检索信息时存在利用瓶颈,无法有效提取答案,且上下文干扰导致错误生成,表明RAG在小模型中效果有限。

Comments 10 pages, 5 figures, planning to submit to arr march 2026. Code and evaluation data: https://anonymous.4open.science/r/rag-utilization-study-C67F . Earlier draft preprint available on Zenodo: https://zenodo.org/records/18870116 (note: this arXiv submission is an updated draft)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12094 2026-03-13 cs.HC cs.AI cs.CL cs.CY 86%

Human-Centred LLM Privacy Audits: Findings and Frictions

以人为中心的LLM隐私审计:发现与摩擦

Dimitri Staufer, Kirsten Morehouse, David Hartmann, Bettina Berendt

机构 * TU Berlin(柏林技术大学) Weizenbaum Institute for the Networked Society(网络化社会研究所) Columbia University(哥伦比亚大学) KU Leuven(根特大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM隐私审计中的人机交互问题,通过LMP2工具发现模型对个人信息的关联预测准确率高,但用户对隐私保护的需求与模型输出的不确定性存在矛盾,提出了九项摩擦并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16846 2026-03-13 cs.CL cs.AI 86%

ConCISE: A Reference-Free Conciseness Evaluation Metric for LLM-Generated Answers

ConCISE: 一种无需参考的LLM生成回答简洁性评估指标

Seyed Mohssen Ghafari, Ronny Kol, Juan C. Quiroz, Nella Luan, Monika Patial, Chanaka Rupasinghe, Herman Wandabwa, Luiz Pizzato

机构 * Commonwealth Bank of Australia(澳大利亚共同银行)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ConCISE指标,用于评估LLM生成回答的简洁性,通过三种压缩比计算和词删除方法,无需参考实现自动评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11955 2026-03-13 cs.CL 85%

PersonaTrace: Synthesizing Realistic Digital Footprints with LLM Agents

PersonaTrace: 基于LLM代理的数字足迹合成

Minjia Wang, Yunfeng Wang, Xiao Ma, Dexin Lv, Qifan Guo, Lynn Zheng, Benliang Wang, Lei Wang, Jiannan Li, Yongwei Xing, David Xu, Zheng Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PersonaTrace通过LLM代理生成多样且逼真的数字足迹,提升数据集的多样性和真实性,从而增强模型在真实任务中的表现。

Comments EACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12117 2026-03-13 cs.CL cs.AI 84%

SommBench: Assessing Sommelier Expertise of Language Models

SommBench:评估语言模型的品酒师专业能力

William Brach, Tomas Bedej, Jacob Nielsen, Jacob Pichna, Juraj Bedej, Eemeli Saarensilta, Julie Dupouy, Gianluca Barmina, Andrea Blasi Núñez, Peter Schneider-Kamp, Kristian Košťál, Michal Ries, Lukas Galke Poech

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 SommBench是一个多语言基准,用于评估语言模型的品酒师专业能力,包含三个任务:葡萄酒理论问答、葡萄酒特征补全和食物-葡萄酒配对,测试模型在感官判断上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11914 2026-03-13 cs.CR cs.AI 83%

Understanding LLM Behavior When Encountering User-Supplied Harmful Content in Harmless Tasks

理解LLM在执行无害任务时遇到用户提供的有害内容的行为

Junjie Chu, Yiting Qu, Ye Leng, Michael Backes, Yun Shen, Savvas Zannettou, Yang Zhang

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全研究中心) Flexera(Flexera公司) Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究探讨了LLM在执行无害任务时遇到用户提供的有害内容时的行为,发现主流LLM在处理有害内容时未能维持伦理标准,且某些类别和任务更易引发有害响应。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16777 2026-03-13 cs.AI 83%

Evaluation and LLM-Guided Learning of ICD Coding Rationales

ICD编码理由的评估与大语言模型引导的学习

Mingyang Li, Viktor Schlegel, Tingting Mu, Wuraola Oyewusi, Kai Kang, Goran Nenadic

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本研究评估ICD编码中理由的可解释性,通过构建多粒度数据集和LLM引导学习方法,提升理由生成的合理性和模型决策的忠实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16765 2026-03-13 cs.CR cs.AI 83%

Hiding in Plain Sight: A Steganographic Approach to Stealthy LLM Jailbreaks

明目张胆:一种用于隐蔽大语言模型劫持的隐写术方法

Jianing Geng, Biao Yi, Zekun Fei, Ruiqi He, Lihai Nie, Tong Li, Zheli Liu

机构 * College of Cyber Science, Key Laboratory of DISSec, Nankai University(网络安全学院、DISSec重点实验室、南开大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 StegoAttack通过隐写术在无害段落中嵌入有害查询,实现对大语言模型的高效隐蔽劫持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08281 2026-03-13 cs.CL cs.AI cs.CY 81%

Evaluating LLM-Based Grant Proposal Review via Structured Perturbations

通过结构化扰动评估基于LLM的项目申请评审

William Thorne, Joseph James, Yang Wang, Chenghua Lin, Diana Maynard

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过结构化扰动评估基于LLM的项目评审,发现逐部分分析方法在检测和评分可靠性上表现最佳,但LLM反馈存在偏颇,需进一步优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10577 2026-03-13 cs.AI cs.HC 80%

CUAAudit: Meta-Evaluation of Vision-Language Models as Auditors of Autonomous Computer-Use Agents

CUAAudit: 视觉语言模型作为自主计算机使用代理的元评估

Marta Sumyk, Oleksandr Kosovan

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文研究了视觉语言模型作为自主计算机使用代理审计员的元评估,发现尽管先进模型在准确性方面表现良好,但在复杂环境中性能下降,突显了现实部署中需考虑评估者可靠性与不确定性的重要性。

Comments This work has been accepted to appear at the HEAL @ CHI 2026 Worshop on Human-centered Evaluation and Auditing of Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11862 2026-03-13 cs.CR cs.AI 79%

You Told Me to Do It: Measuring Instructional Text-induced Private Data Leakage in LLM Agents

你让我这么做:测量LLM代理中指令文本诱导的私有数据泄露

Ching-Yu Kao, Xinfeng Li, Shenyu Dai, Tianze Qiu, Pengcheng Zhou, Eric Hanchen Jiang, Philip Sperl

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 研究发现LLM代理在处理嵌入文档指令时存在安全漏洞,导致高比例的数据泄露,且现有防御措施无法有效检测此类攻击。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11686 2026-03-13 cs.CL 79%

In the LLM era, Word Sense Induction remains unsolved

在大语言模型时代,词义诱导仍未能解决

Anna Mosolova, Marie Candito, Carlos Ramisch

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL

AI总结 本文提出基于大语言模型的词义诱导方法,发现无监督方法难以超越'每个词根一个聚类'启发式方法,同时表明数据增强和Wiktionary利用对提升性能有帮助。

Comments Accepted at ACL 2025 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11337 2026-03-13 cs.AI 79%

RewardHackingAgents: Benchmarking Evaluation Integrity for LLM ML-Engineering Agents

奖励黑客代理:用于LLM机器学习工程代理的基准评估完整性

Yonas Atinafu, Robin Cohen

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本研究提出RewardHackingAgents基准,用于评估机器学习工程代理的评估完整性,通过显式测量评估者篡改和训练测试泄漏两种妥协向量,展示评估完整性可作为核心指标进行验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03727 2026-03-13 cs.HC cs.AI 79%

Understanding Parents' Desires in Moderating Children's Interactions with GenAI Chatbots through LLM-Generated Probes

理解父母在调节儿童与生成式AI聊天机器人互动中的意愿通过LLM生成的探测器

John Driscoll, Yulin Chen, Viki Shi, Izak Vucharatavintara, Yaxing Yao, Haojian Jin

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文通过LLM生成的探测器研究父母如何调节儿童与生成式AI聊天机器人的互动,发现父母关注当前控制所忽视的互动,需对话层面的透明度和个性化控制。

Comments 33 pages, 10 figures, Accepted to ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13108 2026-03-13 cs.CV cs.AI cs.RO 79%

DriveCritic: Towards Context-Aware, Human-Aligned Evaluation for Autonomous Driving with Vision-Language Models

DriveCritic: 向基于情境的、与人类对齐的自动驾驶评估迈进:基于视觉-语言模型

Jingyu Song, Zhenxin Li, Shiyi Lan, Xinglong Sun, Nadine Chang, Maying Shen, Joshua Chen, Katherine A. Skinner, Jose M. Alvarez

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达) Fudan University(复旦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 DriveCritic通过结合视觉-语言模型和情境意识,提升自动驾驶系统评估的准确性与人类对齐性。

Comments Accepted at ICRA 2026; 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04634 2026-03-13 cs.AI cs.LG cs.MA 79%

WideSeek-R1: Exploring Width Scaling for Broad Information Seeking via Multi-Agent Reinforcement Learning

WideSeek-R1: 探索通过多智能体强化学习进行广泛信息寻求的宽度扩展

Zelai Xu, Zhexuan Xu, Ruize Zhang, Chunyang Zhu, Shi Yu, Weilin Liu, Quanlu Zhang, Wenbo Ding, Chao Yu, Yu Wang

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 WideSeek-R1通过多智能体强化学习框架,实现广泛信息寻求任务中的宽度扩展,提升多智能体系统的协同与并行执行能力,实验表明其性能优于单智能体模型。

Comments https://wideseek-r1.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11339 2026-03-13 cs.AI cs.CE cs.LG 79%

FinRule-Bench: A Benchmark for Joint Reasoning over Financial Tables and Principles

FinRule-Bench:一个用于金融表和原则联合推理的基准

Arun Vignesh Malarkkan, Manan Roy Choudhury, Guangwei Zhang, Vivek Gupta, Qingyun Wang, Yanjie Fu, Denghui Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 FinRule-Bench是一个评估金融表与原则联合推理能力的基准,通过三个任务测试模型在规则验证、识别和多违规诊断中的表现,揭示LLMs在高风险金融分析中的局限性。

Comments 8 pages + Ethics Statement + References + Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11078 2026-03-13 cs.SE cs.AI cs.CL 79%

CR-Bench: Evaluating the Real-World Utility of AI Code Review Agents

CR-Bench:评估AI代码审查代理的现实世界效用

Kristen Pereira, Neelabh Sinha, Rajat Ghosh, Debojyoti Dutta

机构 * Nutanix, Inc.(Nutanix公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CR-Bench通过引入基准数据集和细粒度评估流程,评估AI代码审查代理在现实世界中的效用,揭示了问题解决与假发现之间的权衡,为LLM驱动的代码审查代理发展提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15479 2026-03-13 cs.CL cs.AI 79%

Benchmarking LLMs for Pairwise Causal Discovery in Biomedical and Multi-Domain Contexts

在生物医学和多领域背景下对LLM进行成对因果发现的基准测试

Sydney Anuyah, Sneha Shajee-Mohan, Ankit-Singh Chauhan, Sunandan Chakraborty

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了13个开源LLM在生物医学和多领域背景下进行成对因果发现的能力,发现现有模型在处理复杂因果关系时表现不佳,提出了统一的评估框架并公开数据以促进研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00411 2026-03-13 cs.CL cs.AI 79%

Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset

LLMs能否有效评估远监督命名实体标签?构建JudgeWEL数据集

Alistair Plum, Laura Bernardy, Tharindu Ranasinghe

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用维基百科和维基数据构建卢森堡语NER数据集JudgeWEL,通过LLM自动标注和验证,生成更大规模且更平衡的实体覆盖数据集,为低资源语言研究提供新资源。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11853 2026-03-13 cs.CR 78%

OpenClaw PRISM: A Zero-Fork, Defense-in-Depth Runtime Security Layer for Tool-Augmented LLM Agents

OpenClaw PRISM: 一种零fork、纵深防御的运行时安全层,用于工具增强的大语言模型代理

Frank Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 OpenClaw PRISM通过零fork运行时安全层,结合启发式和LLM扫描流程,提供纵深防御机制,以增强工具增强型大语言模型代理的安全性。

Comments 23 pages, 3 figures, 6 tables. Open-source system paper with benchmark artifact pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11141 2026-03-13 q-bio.GN 78%

Cross-Species Antimicrobial Resistance Prediction from Genomic Foundation Models

基于基因组基础模型的跨物种抗菌素耐药性预测

Huilin Tai

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本研究提出基于基因组基础模型的跨物种抗菌素耐药性预测方法,通过分析嵌入表示和局部激活模式,提升模型在不同物种间的泛化能力。

Comments Master's thesis, Columbia University, Department of Computer Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10061 2026-03-13 cs.RO 78%

Decision-Aware Uncertainty Evaluation of Vision-Language Model-Based Early Action Anticipation for Human-Robot Interaction

基于视觉语言模型的早期动作预测在人机交互中的决策感知不确定性评估

Zhaoda Du, Michael Bowman, Qiaojie Zheng, Xiaoli Zhang

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出了一种系统评估基于视觉语言模型的短期动作识别在人机交互中的不确定性方法,通过引入时间前缀评估协议和校准度量标准,揭示了部分观测下的误校准模式和失败模式,为信心门控的人机交互模块提供了可靠性证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01213 2026-03-13 cs.MA cs.LG 77%

Can AI Agents Agree?

AI代理能否达成一致?

Frédéric Berdoz, Leonardo Rugli, Roger Wattenhofer

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究发现,基于LLM的代理在无质押设置中难以可靠达成一致,群体规模增大和拜占庭代理的存在显著降低共识成功率,活锁问题主导了失败原因。

详情

展开后加载摘要…

URL PDF HTML 收藏