arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-21 至 2026-04-21 共收录 803 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 186 篇

2604.16342 2026-04-21 cs.HC 87%

SAGE: Sensor-Augmented Grounding Engine for LLM-Powered Sleep Care Agent

SAGE:基于传感器的地面引擎用于LLM驱动的睡眠护理代理

Hansoo Lee, Yoonjae Cho, Sonya S. Kwak, Rafael A. Calvo

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 SAGE通过整合传感器数据,解决睡眠护理中数据与行动之间的鸿沟问题,提升个性化和信任度。

Comments Accepted to the Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26). 6 pages

Journal ref Extended Abstracts of the 2026 CHI Conference on Human Factors in Computing Systems (CHI EA '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16321 2026-04-21 cs.SE 87%

LLM-Based Multi-Agent Systems for Code Generation: A Multi-Vocal Literature Review

基于大语言模型的多智能体系统用于代码生成:多声调文献综述

Zeeshan Rasheeda, Muhammad Waseema, Kai-Kristian Kemella, Mika Saari, Pekka Abrahamsson

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过多声调文献综述分析了大语言模型多智能体系统在代码生成中的应用,总结了其动机、模型、挑战及未来方向。

Comments 34 pages, 2 Figures, Table 11

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18389 2026-04-21 cs.CL 86%

Understanding the Prompt Sensitivity

理解提示敏感性

Yang Liu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过泰勒展开分析LLM输出对输入提示的敏感性,推导出log概率差的上界,并发现LLM不像小网络那样聚类相似输入,导致提示敏感性难以降低至零。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI 86%

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05453 2026-04-21 cs.AI 86%

Conversational Process Model Redesign

对话过程模型重设计划

Nataliia Klievtsova, Timotheus Kampik, Juergen Mangler, Stefanie Rinderle-Ma

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨利用LLM通过迭代方式帮助领域专家进行过程模型创建与重设计,提出CPMR方法,通过识别文献中的过程变更模式并应用到模型中,同时评估LLM处理模式的能力,建议混合方法以提高用户输入质量。

Journal ref Int. J. Coop. Info. Syst. 2650004 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17778 2026-04-21 cs.LG 86%

TeleEmbedBench: A Multi-Corpus Embedding Benchmark for RAG in Telecommunications

TeleEmbedBench: 一种面向电信领域的多语料嵌入基准

Pranshav Gajjar, Vijay K Shah

机构 * NextG Wireless Lab, North Carolina State University, Raleigh, USA(NextG无线实验室,北卡罗来纳州立大学,拉斐特,美国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出TeleEmbedBench,首个针对电信领域RAG任务的多语料嵌入基准,评估八种嵌入模型在检索准确性和抗跨域干扰能力上的表现,发现LLM嵌入器性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17288 2026-04-21 cs.AR cs.AI 86%

Clover: A Neural-Symbolic Agentic Harness with Stochastic Tree-of-Thoughts for Verified RTL Repair

Clover:一种基于随机树-of-thoughts的神经符号代理体系用于验证RTL修复

Zizhang Luo, Yansong Xu, Runlin Guo, Fan Cui, Kexing Zhou, Mile Xia, Hongyuan Hou, Yuhao Luo, Yun Liang

机构 * Peking University(北京大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Clover通过结构化搜索代码操作解决RTL修复问题,结合LLM和符号求解器动态调度任务,实现高可靠性修复,修复率高达96.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17102 2026-04-21 cs.AR cs.AI 86%

Configuration Over Selection: Hyperparameter Sensitivity Exceeds Model Differences in Open-Source LLMs for RTL Generation

配置胜过选择:在开源LLM用于RTL生成中,超参数敏感性超过模型差异

Minghao Shao, Zeng Wang, Weimin Fu, Xiaolong Guo, Johann Knechtel, Ozgur Sinanoglu, Ramesh Karri, Muhammad Shafique

机构 * NYU Tandon School of Engineering(纽约大学坦顿工程学院) NYU Abu Dhabi(纽约大学阿布扎比分校) Kansas State University(堪萨斯州立大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 研究通过对比26个开源LLM在VerilogEval和RTLLM上的表现,发现超参数配置对RTL生成效果影响显著,优于模型选择,揭示了配置优化的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16753 2026-04-21 cs.AI 86%

Know When to Trust the Skill: Delayed Appraisal and Epistemic Vigilance for Single-Agent LLMs

何时信任技能:单智能体LLM的延迟评估与认知警惕

Eren Unlu

机构 * Globeholder Paris, France(巴黎Globeholder机构)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MESA-S框架,通过延迟评估和认知警惕机制提升单智能体LLM的可靠性,减少供应链漏洞并防止自信膨胀。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16394 2026-04-21 cs.IR cs.AI 86%

A Reference Architecture for Agentic Hybrid Retrieval in Dataset Search

面向数据集搜索的代理混合检索参考架构

Riccardo Terrenzi, Phongsakon Mark Konrad, Tim Lukas Adam, Serkan Ayvaz

机构 * Centre for Industrial Software University of Southern Denmark(工业软件中心 欧洲南部大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种结合BM25和嵌入检索的代理混合检索架构,通过LLM代理规划查询并融合RRF算法,引入元数据增强减少语义偏差,分析单代理与多代理架构的权衡。

Comments 7 pages, 3 figures, accepted at SAML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05403 2026-04-21 cs.CL 86%

Same Claim, Different Judgment: Benchmarking Scenario-Induced Bias in Multilingual Financial Misinformation Detection

同一条主张,不同判断:多语言金融虚假信息检测中情境诱导偏见的基准测试

Zhiwei Liu, Yupen Cao, Yuechen Jiang, Mohsinul Kabir, Polydoros Giannouris, Chen Xu, Ziyang Xu, Tianlei Zhu, Md. Tariquzzaman, Triantafillos Papadopoulos, Yan Wang, Lingfei Qian, Xueqing Peng, Zhuohan Xie, Ye Yuan, Saeed Almheiri, Abdulrazzaq Alnajjar, Mingbin Chen, Harry Stuart, Paul Thompson, Prayag Tiwari, Alejandro Lopez-Lira, Xue Liu, Jimin Huang, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stevens Institute of Technology(史蒂文斯理工学院) The Fin AI(Fin AI) Columbia University(哥伦比亚大学) Islamic University of Technology(伊斯兰科技大学) Athens University of Economics and Business(雅典经济与商业大学) Archimedes, Athena Research Center(阿基米德,亚特兰蒂斯研究中心) MBZUAI McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Dubai Police(迪拜警察) University of Melbourne(墨尔本大学) Halmstad University(哈姆斯塔德大学) University of Florida(佛罗里达大学) ELLIS Manchester(曼彻斯特ELLIS)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MFMDScen基准,用于评估LLM在多语言金融虚假信息检测中的情境诱导偏见,通过构建三种复杂金融场景并整合虚假信息主张,系统评估22种主流LLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11137 2026-04-21 cs.AI cs.LG 85%

From Answers to Arguments: Toward Trustworthy Clinical Diagnostic Reasoning with Toulmin-Guided Curriculum Goal-Conditioned Learning

从答案到论证:通过托尔金引导的课程目标条件学习实现可信的临床诊断推理

Chen Zhan, Xiaoyu Tan, Gengchen Ma, Yu-Jie Xiong, Xiaoyan Jiang, Xihe Qiu

机构 * School of Electronic and Electrical Engineering, Shanghai University of Engineering Science(上海工程技术大学电子与电气工程学院) Tencent Youtu Lab(腾讯优图实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出托尔金引导的课程目标条件学习框架,通过逐步训练LLM生成符合托尔金结构的诊断论证,提升临床诊断的透明性和可靠性。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05336 2026-04-21 cs.CL cs.AI 85%

WeatherArchive-Bench: Benchmarking Retrieval-Augmented Reasoning for Historical Weather Archives

WeatherArchive-Bench: 基于历史天气档案的检索增强推理基准测试

Yongan Yu, Xianda Du, Qingchen Hu, Jiahao Liang, Jingwei Ni, Dan Qiang, Kaiyu Huang, Grant McKenzie, Renee Sieber, Fengran Mo

机构 * McGill University(麦吉尔大学) University of Waterloo(滑铁卢大学) ETH Zurich(苏黎世联邦理工学院) Beijing Jiaotong University(北京交通大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WeatherArchive-Bench,用于评估检索增强生成系统在处理历史天气档案中的能力,揭示密集检索器在历史术语上的不足及LLM对社会脆弱性与韧性概念的误判问题。

Comments accepted to the Resource Track of SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18328 2026-04-21 cs.CL 84%

FregeLogic at SemEval 2026 Task 11: A Hybrid Neuro-Symbolic Architecture for Content-Robust Syllogistic Validity Prediction

FregeLogic在SemEval 2026任务11中的应用:一种混合神经符号架构用于内容鲁棒的三段论有效性预测

Adewale Akinfaderin, Nafi Diallo

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出FregeLogic系统,结合多个LLM分类器与Z3 SMT求解器,通过形式逻辑验证减少内容偏差,提升三段论有效性预测的准确率和鲁棒性。

Comments Camera-ready version to appear at The 20th International Workshop on Semantic Evaluation (SemEval-2026), ACl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12047 2026-04-21 cs.AI cs.SE 84%

ContractEval: A Benchmark for Evaluating Contract-Satisfying Assertions in Code Generation

ContractEval:一个用于评估代码生成中合同满足断言的基准测试

Soohan Lim, Joonghyuk Hahn, Hyunwoo Park, Sang-Ki Ko, Yo-Sub Han

机构 * Yonsei University(延世大学) University of Seoul(首尔大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 ContractEval通过显式陈述合同,评估生成代码是否满足合同要求,揭示当前LLM在合同满足上的不足。

Comments 18 pages, 10 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16398 2026-04-21 cs.CY cs.AI 84%

A Framework for Human-AI Q-Matrix Refinement: A NeuralCDM Evaluation

人类-人工智能Q矩阵精炼框架:NeuralCDM评估

Ying Zhang, Ningxi Cheng, Yizhu Gao, Hongmei Li, Lehong Shi, Nicholas Young, Geng Yuan, Xiaoming Zhai

机构 * AI4STEM Education Center, University of Georgia(AI4STEM教育中心,佐治亚大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出人类-人工智能协同的Q矩阵精炼框架,利用大语言模型生成候选矩阵并结合NeuralCDM进行评估,通过热力学评估数据集验证,迭代优化的Q矩阵性能优于专家基准,本地部署模型性能与云端API相当。

Comments Accepted at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06296 2026-04-21 cs.PL cs.AI 84%

VeriEquivBench: An Equivalence Score for Ground-Truth-Free Evaluation of Formally Verifiable Code

VeriEquivBench:一种无需真实地面真相的正式可验证代码评估等价分数

Lingfei Zeng, Fengdi Che, Xuhan Huang, Fei Ye, Xu Xu, Binhang Yuan, Jie Fu

机构 * Huazhong University of Science and Technology(华中科技大学) University of Alberta(阿尔伯塔大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Hong Kong University of Science and Technology(香港科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出VeriEquivBench,通过2389个复杂算法问题评估正式可验证代码的生成与推理能力,揭示当前LLM在生成正式规范和代码方面的挑战,推动可扩展可靠编码代理的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17707 2026-04-21 cs.CL cs.AI 84%

Before You Interpret the Profile: Validity Scaling for LLM Metacognitive Self-Report

在解释轮廓之前:大型语言模型元认知自我报告的有效性缩放

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过有效性缩放框架评估大型语言模型的元认知自我报告,识别出四款模型构造无效,两款模型存在异常,研究揭示了有效性指标与模型性能的关系。

Comments 14 pages, 6 figures. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04043 2026-04-21 cs.CL 83%

When Helpers Become Hazards: A Benchmark for Analyzing Multimodal LLM-Powered Safety in Daily Life

当助手变成危险:一个多模态大语言模型在日常生活中的安全分析基准

Xinyue Lou, Jinan Xu, Jingyi Yin, Xiaolong Wang, Zhaolu Kang, Youwei Liao, Yixuan Wang, Xiangyu Shi, Fengran Mo, Su Yao, Kaiyu Huang

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) School of Computer Science and Technology, Beijing Jiaotong University(计算机科学与技术学院,北京交通大学) Tsinghua University(清华大学) Peking University(北京大学) University of Montreal(蒙特利尔大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SaLAD基准,通过2013个真实世界图像-文本样本评估多模态大语言模型在日常生活中的安全影响,揭示模型在识别危险行为方面的局限性。

Comments Accepted by ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17233 2026-04-21 cs.CV cs.AI 83%

Enhancing Zero-shot Personalized Image Aesthetics Assessment with Profile-aware Multimodal LLM

通过基于资料的多模态大语言模型增强零样本个性化图像审美评估

Chun Wang, Chenfeng Wei, Chenyang Liu, Weihong Deng

机构 * Mashang Consumer Finance Co., Ltd.(马莎消费金融有限公司) Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出P-MLLM,通过用户资料引导的多模态大语言模型实现零样本个性化图像审美评估,实验表明其在无历史数据情况下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17803 2026-04-21 cs.AI cs.LG 82%

Adversarial Arena: Crowdsourcing Data Generation through Interactive Competition

对抗领域:通过互动竞争进行众包数据生成

Prasoon Goyal, Sattvik Sahai, Michael Johnston, Hangjie Shi, Yao Lu, Shaohua Liu, Anna Rumshisky, Rahul Gupta, Anna Gottardi, Desheng Zhang, Lavina Vaz, Leslie Ball, Lucy Hu, Luke Dai, Samyuth Sagi, Maureen Murray, Sankaranarayanan Ananthakrishnan

机构 * Amazon Nova Responsible AI(亚马逊Nova负责任人工智能)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出对抗领域框架,通过攻击者和防御者之间的互动竞争生成高质量对话数据,提升低资源领域和多轮对话的质量。

Comments 10 pages, 3rd DATA-FM workshop @ ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17020 2026-04-21 cs.CL cs.AI 82%

Beyond Static Benchmarks: Synthesizing Harmful Content via Persona-based Simulation for Robust Evaluation

超越静态基准:基于人设的模拟合成有害内容以实现稳健评估

Huije Lee, Jisu Shin, Hoyun Song, Changgeon Ko, Jong C. Park

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于人设的模拟合成有害内容框架,通过整合人口统计信息与主题兴趣,生成多样化且情境相关的有害交互,验证了其在有害性、挑战性和多样性方面的有效性,为评估检测系统提供更鲁棒的测试工具。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16980 2026-04-21 cs.LG cs.AI 82%

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本

Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院) Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所) Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了十个前沿多模态大语言模型在住院诊断中的真实世界性能,发现尽管成本差异大,模型表现紧密聚集,且在安全性和诊断准确性上均优于常规护理。

Comments 17 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL 82%

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24942 2026-04-21 cs.LG cs.AI cs.CL 82%

Finding Culture-Sensitive Neurons in Vision-Language Models

在视觉-语言模型中寻找文化敏感神经元

Xiutian Zhao, Rochelle Choenni, Rohit Saxena, Ivan Titov

机构 * University of Edinburgh(爱丁堡大学) University of Amsterdam(阿姆斯特丹大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究视觉-语言模型处理文化相关信息的神经元特性,通过CVQA基准验证文化敏感神经元的存在及其分布,提出ConAct方法提升识别效果。

Comments Accepted to EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18240 2026-04-21 cs.AI 81%

AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

AJ-Bench:用于环境感知评估的代理作为裁判基准测试

Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su, Qi Gu, Hui Su, Xunliang Cai, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AJ-Bench通过三个领域155个任务评估代理作为裁判的能力,揭示了基于代理的验证方法在信息获取和过程验证中的性能提升及挑战。

Comments Accepted to ACL 2026 Findings. 43 pages total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15841 2026-04-21 cs.CL 81%

Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

探索大型语言模型在掌握中文Chouxiang语言中的能力边界

Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

机构 * College of Computer Science, Inner Mongolia University, China(内蒙古大学计算机学院,中国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过设计Mouse基准测试,探讨大型语言模型在Chouxiang语言自然语言处理任务中的能力限制,揭示SOTA模型在多任务中的不足,并分析其在Chouxiang翻译中的关键影响因素。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12320 2026-04-21 cs.CV cs.AI cs.MM 81%

EgoEsportsQA: An Egocentric Video Benchmark for Perception and Reasoning in Esports

EgoEsportsQA:一种用于电子竞技感知与推理的视角视频基准

Jianzhe Ma, Zhonghao Cao, Shangkui Chen, Yichen Xu, Wenxuan Wang, Qin Jin

机构 * Renmin University of China(中国人民大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EgoEsportsQA基准,通过六阶段流程收集1745对高质量问答对,评估视频大语言模型在虚拟环境中的感知与推理能力,揭示模型在战术推理和微操作方面的不足。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28166 2026-04-21 cs.CR cs.AI 81%

Evaluating Privilege Usage of Agents with Real-World Tools

评估具有现实工具的代理的特权使用

Quan Zhang, Lianhang Fu, Lvsi Lian, Gwihwan Go, Yujue Wang, Chijin Zhou, Yu Jiang, Geguang Pu

机构 * Xinjiang University(新疆大学) Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 本文提出GrantBox,一个用于评估代理特权使用的安全沙盒,通过集成真实工具和允许LLM代理调用真实特权,评估代理在提示注入攻击下的安全能力,发现LLM在面对复杂攻击时平均攻击成功率高达84.80%。

Comments Accepted to the FSE 2026 Ideas, Visions, and Reflections track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17658 2026-04-21 cs.MA cs.CL 81%

Towards Self-Improving Error Diagnosis in Multi-Agent Systems

迈向多智能体系统中的自改进错误诊断

Jiazheng Li, Emine Yilmaz, Bei Chen, Dieu-Thu Le

机构 * King’s College London(伦敦国王学院) Amazon Alexa AI(亚马逊Alexa AI) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ErrorProbe框架,通过三阶段流程实现多智能体系统的语义故障归因,利用验证记忆提升跨领域迁移能力,在TracerTraj和Who&When基准测试中表现优异。

Comments 15 pages, 3 figures; accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏