arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 265 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2604.27891 2026-05-01 cs.AI cs.LG 84%

In-Context Prompting Obsoletes Agent Orchestration for Procedural Tasks

上下文提示使代理协调在过程性任务中过时

Simon Dennis, Michael Diamond, Rivaan Patil, Kevin Shabahang, Hao Guo

机构 * University of Melbourne(墨尔本大学)

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过对比实验表明,对于过程性任务,将整个流程置于系统提示中让模型自主协调优于传统的外部代理协调框架。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 82%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27093 2026-05-01 cs.CL cs.AI 82%

Useless but Safe? Benchmarking Utility Recovery with User Intent Clarification in Multi-Turn Conversations

无用却安全?在多轮对话中通过用户意图澄清基准测试恢复效用

Mingqian Zheng, Malia Morgan, Liwei Jiang, Carolyn Rose, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute for AI(人工智能联盟研究所) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CarryOnBench,首个交互式基准测试,评估LLM在多轮对话中是否能修正用户意图并恢复效用,同时保持安全。通过398个看似有害但实际无害的查询,生成5970次对话,评估14个模型的意图对齐效用和安全性能,发现模型在意图澄清后恢复效用存在不同失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12476 2026-05-01 cs.CL cs.AI 82%

When Personalization Tricks Detectors: The Feature-Inversion Trap in Machine-Generated Text Detection

当个性化技巧欺骗检测器:机器生成文本检测中的特征反向陷阱

Lang Gao, Xuhui Li, Chenxi Wang, Mingzhe Li, Wei Liu, Zirui Song, Jinghui Zhang, Rui Yan, Preslav Nakov, Xiuying Chen

机构 * MBZUAI ByteDance(字节跳动) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种检测器在个性化文本中性能变化的预测方法,揭示了特征反向陷阱对检测器鲁棒性的影响,并通过实验验证了该方法的有效性。

Comments Oral of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 82%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 评测与基准 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26953 2026-05-01 cs.IR cs.CY 82%

A Randomized Controlled Trial and Pilot of Scout: an LLM-Based EHR Search and Synthesis Platform

一项随机对照试验和试点:Scout:一种基于大语言模型的电子健康记录搜索与综合平台

Michael Gao, Suresh Balu, William Knechtle, Kartik Pejavara, William Jeck, Matthew Ellis, Jason Thieling, Blake Cameron, Jason Tatreau, Tareq Aljurf, Henry Foote, Michael Revoir, Marshall Nichols, Matthew Gardner, William Ratliff, Bradley Hintze, Angelo Milazzo, Sreekanth Vemulapalli

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本研究开发了Scout平台,利用大语言模型提升电子健康记录的数据检索效率,通过随机对照试验发现Scout能显著减少任务完成时间及工作负荷,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27846 2026-05-01 cs.CL 81%

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

多层级叙事评估在心理健康预测中优于词法特征

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu

机构 * Institute for Artificial Intelligence(人工智能研究院) School of Psychological and Cognitive Sciences(心理学与认知科学学院) School of Intelligence Science and Technology(智能科学与技术学院) State Key Laboratory of General AI(通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health(北京行为与心理健康重点实验室) PKU-Changsha Institute for Computing and Digital Economy(北京大学长沙计算与数字经济研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出多层级框架,通过830篇中文治疗文本验证,宏观层面的LLM叙事评估在心理健康预测中表现最佳,挑战了词频统计为主的传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27780 2026-05-01 cs.AR cs.AI 81%

RuC: HDL-Agnostic Rule Completion Benchmark Generation

RuC:HDL无关的规则补全基准生成

Arnau Ayguadé Domingo, Miquel Alberti-Binimelis, Cristian Gutierrez-Gomez, Emanuele Parisi, Razine Moundir Ghorab, Miquel Moreto, Gokcen Kestor, Dario Garcia-Gasulla

机构 * Barcelona Supercomputing Center(巴塞罗那超级计算中心) Universitat Politècnica de Catalunya(加泰罗尼亚理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 RuC通过语法驱动的方法生成HDL无关的规则补全基准,用于评估模型在RTL开发中的代码理解能力,结果显示提示策略对性能影响显著。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27637 2026-05-01 cs.AI 81%

Optimization before Evaluation: Evaluation with Unoptimised Prompts Can be Misleading

优化优先于评估:未经优化的提示进行评估可能是误导的

Nicholas Sadjoli, Tim Siefken, Atin Ghosh, Yifan Mai, Daniel Dahlmeier

机构 * SAP(SAP公司) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了提示优化对大语言模型评估的影响,发现优化显著影响模型排名,强调在评估中应针对每个模型进行优化以选择最佳模型。

Comments Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 6: Industry Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27547 2026-05-01 cs.LG 81%

Diagnosing Capability Gaps in Fine-Tuning Data

诊断微调数据中的能力差距

Saeid Asgari Taghanaki, Rakshanda Agarwal, Bruce Sun, Rohan Jha, Elias Stengel-Eskin, Sara Malvar, Rui Ying, Yifei Xu, Guilherme Potje, Tusher Chakraborty, Leonardo de Oliveira Nunes, Ranveer Chandra, Emre Kiciman

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出GoalCover框架,通过交互式目标分解和自动化覆盖评估,帮助检测微调数据集的能力缺口,通过实验验证其在不同领域和任务中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27358 2026-05-01 cs.AI 81%

Safe Bilevel Delegation (SBD): A Formal Framework for Runtime Delegation Safety in Multi-Agent Systems

安全双层委托(SBD):一种用于多智能体系统运行时委托安全性的正式框架

Yuan Sun

机构 * Jilin University(吉林大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SBD框架,通过双层优化问题在运行时动态调整安全与效率的权衡,理论证明了安全单调性、内政策收敛性和责任传播界,应用于医疗AI、金融风险控制和教育代理监督领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20577 2026-05-01 cs.SE cs.LG 81%

Evaluating Assurance Cases as Text-Attributed Graphs for Structure and Provenance Analysis

评估作为文本属性图的保证案例用于结构和来源分析

Fariz Ikhwantri, Dusica Marijan

机构 * Simula Research Laboratory(Simula研究实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出基于图诊断框架分析保证案例的结构和来源,通过链接预测和图分类检测偏见,实验表明GNN在链接预测和来源检测中表现优异。

Comments 10 pages, 4 figures, 8 tables. Accepted to EASE 2026 AI Models / Data track, Glasgow, United Kingdom Fix the captions of tables 7 and 8

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27914 2026-05-01 cs.CL cs.LG 81%

Geometry-Calibrated Conformal Abstention for Language Models

Rui Xu, Yi Chen, Sihong Xie, Hui Xiong

机构 * Information Hub, AI Thrust(信息中心,人工智能方向)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27491 2026-05-01 cs.CV 80%

Uni-HOI:A Unified framework for Learning the Joint distribution of Text and Human-Object Interaction

Uni-HOI: 一种学习文本与人-物交互联合分布的统一框架

Mengfei Zhang, Jinlu Zhang, Zhigang Tu

机构 * Wuhan University(武汉大学) Peking University(北京大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentcourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Uni-HOI框架,通过结合大语言模型和VQ-VAE,统一建模文本、人体运动和物运动的联合分布,解决多模态交互任务中的数据异质性问题。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27105 2026-05-01 cs.CV 80%

Automated Detection of Mutual Gaze and Joint Attention in Dual-Camera Settings via Dual-Stream Transformers

通过双流Transformer实现双摄像头设置中互视与联合注意的自动检测

Jakub Kosmydel, Paweł Gajewski, Arkadiusz Białek

机构 * AGH University(AGH大学) Jagiellonian University(雅盖隆大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出双流Transformer架构,用于从同步双摄像头记录中自动检测互视与联合注意,通过冻结的注视感知骨干网络和自定义令牌融合机制,有效提升了多摄像头实验室环境下的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26990 2026-05-01 cs.SE 80%

UCSC-NLP at SemEval-2026 Task 13: Multi-View Generalization and Diagnostic Analysis of Machine-Generated Code Detection

UCSC-NLP在SemEval-2026任务13中的表现:机器生成代码检测的多视角泛化与诊断分析

Kargi Chauhan, Sadiba Nusrat Nur

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出多视角训练框架提升代码生成检测性能,针对多类别属性任务解决类别不平衡问题,通过加权训练策略提升F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00380 2026-05-01 cs.SE 80%

Knowledge-Graph-Driven Data Synthesis for Low-Resource Software Development: A HarmonyOS Case Study

基于知识图谱的数据合成用于低资源软件开发:一个HarmonyOS案例研究

Mingwei Liu, Zheng Pei, Yanlin Wang, Zihao Wang, Zikang Li, Enci Lin, Xin Peng, Zibin Zheng

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出APIKG4Syn框架,利用API知识图谱生成API导向的问题-代码对,提升低资源框架下的代码生成性能,通过HarmonyOS案例验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27533 2026-05-01 cs.CL 79%

Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition

语言模型在自动语音识别中的定性评估

Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa, Richard Dufour

机构 * LS2N - Nantes University (France)(南特大学LS2N研究所(法国)) LIA - Avignon University (France)(阿维尼昂大学LIA研究所(法国)) LIUM - Le Mans University (France)(勒曼大学LIUM研究所(法国))

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出通过引入POSER和EmbER等指标,评估语言模型对自动语音识别转录错误的语义和句法影响,弥补WER的不足。

Comments 3968--3972

Journal ref Interspeech 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27043 2026-05-01 cs.CL 79%

CL-bench Life: Can Language Models Learn from Real-Life Context?

CL-bench Life: 语言模型能否从真实生活情境中学习?

Shihan Dou, Yujiong Shen, Chenhao Huang, Junjie Ye, Jiayi Chen, Junzhe Wang, Qianyu He, Shichun Liu, Changze Lv, Jiahang Lin, Jiazheng Zhang, Ming Zhang, Shaofan Liu, Tao Ji, Zhangyue Yin, Cheng Zhang, Huaibing Xie, Jianglu Hu, Jingcheng Deng, Lincheng Li, Minda Hu, Shaolei Wang, Syrus Zhao, Weichao Wang, Yan Lei, Yang Liu, Yanling Xiao, Yiting Liu, Zenan Xu, Zhen Guo, Ziliang Zhao, Pluto Zhou, Tao Gui, Qi Zhang, Xuanjing Huang, Yu-Gang Jiang, Di Wang, Shunyu Yao

机构 * Hunyuan Team, Tencent(文生图团队,腾讯) Fudan University(复旦大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 CL-bench Life通过405个情境-任务对和5348条验证标准,评估语言模型处理真实生活场景的能力,发现现有模型在复杂、混乱的真实情境推理上仍面临巨大挑战。

Comments 50 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27766 2026-05-01 cs.CL cs.AI 79%

Instruction-Guided Poetry Generation in Arabic and Its Dialects

基于指令的阿拉伯语诗歌生成及其方言

Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov, Fajri Koto

机构 * Mohamed bin Zayed University of Artificial Intelligence(Mohamed bin Zayed人工智能大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于指令的阿拉伯语诗歌生成方法,通过构建大规模指令数据集,实现诗歌创作、修改和延续,并通过实验验证模型生成诗歌的能力。

Comments ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14289 2026-05-01 cs.CL cs.AI 79%

RPC-Bench: A Fine-grained Benchmark for Research Paper Comprehension

RPC-Bench: 一项针对研究论文理解的细粒度基准测试

Yelin Chen, Fanjin Zhang, Suping Sun, Yunhe Pang, Yuanchun Wang, Jian Song, Xiaoyan Li, Lei Hou, Shu Zhao, Jie Tang, Juanzi Li

机构 * Xinjiang University(新疆大学) Renmin University of China(中国人民大学) Anhui University(安徽大学) Sun Yat-sen University(中山大学) Tsinghua University(清华大学) University of Southampton(南安普顿大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RPC-Bench,通过高质量计算机科学论文的评审反驳交流构建,包含15000对人工验证的问答对,设计细粒度分类评估模型在学术场景中理解并回答为何、什么和如何问题的能力,揭示即使最强模型在精确学术论文理解上仍有显著差距。

Comments ACL'26, 12 pages, 23 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14988 2026-05-01 cs.CV 78%

Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation

在细粒度图像任务上评估大型视觉-语言模型:全面评估

Hong-Tao Yu, Yuxin Peng, Serge Belongie, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, School of Intelligence Science and Engineering and Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, China(东南大学计算机科学与工程学院、智能科学与工程学院及新一代人工智能技术及其跨学科应用关键实验室,中国) Wangxuan Institute of Computer Technology, Peking University, China(北京大学王轩计算机技术研究所,中国) University of Copenhagen, Denmark(丹麦哥本哈根大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出FG-BMK基准,通过101万问题和33万张图像评估LVLMs的语义识别与细粒度特征表示能力,揭示训练范式、模态对齐等对性能的影响,为未来模型设计提供指导。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27553 2026-05-01 cs.CV 78%

Revealing the Impact of Visual Text Style on Attribute-based Descriptions Produced by Large Visual Language Models

揭示视觉文本风格对大型视觉语言模型生成的基于属性的描述的影响

Xiaomeng Wang, Martha Larson, Zhengyu Zhao

机构 * Radboud University(拉博德大学) Xi'an Jiaotong University(西安交通大学)

专题命中 评测与基准 :language model(title,abstract)

AI总结 研究视觉文本风格如何影响大型视觉语言模型对概念属性的描述,发现即使正确识别概念,文本风格仍会影响模型输出,推动风格感知评估与缓解。

Comments Accepted by ICMR 2026. Code is available at https://github.com/XiaomengWang-AI/The-Impact-of-Visual-Text-style-on-Attribute-based-Descriptions-Produced-by-LVLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27131 2026-05-01 cs.IR 78%

LLM-Enhanced Topical Trend Detection at Snapchat

基于大语言模型的Snapchat话题趋势检测

Hangqi Zhao, Jay Li, Abhiruchi Bhattacharya, Cong Ni, Jason Yeung, Jinchao Ye, Kai Yang, Akshat Malu, Manish Malik

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出一个大规模系统,利用多模态主题提取、时间序列爆发检测和大语言模型进行整合与丰富,实现Snapchat上新兴话题趋势的准确及时发现,首次在短视频平台实现生产级话题趋势检测系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06033 2026-05-01 cs.CV 78%

Analysis of Blood Report Images Using General Purpose Vision-Language Models

使用通用视觉-语言模型分析血检报告图像

Nadia Bakhsheshi, Hamid Beigy

机构 * Sharif University of Technology(谢里夫理工学院)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文探讨了通用视觉-语言模型在自动分析血检报告图像中的应用,通过比较三种模型在100张不同血检图像上的表现,验证了其在初步分析中的潜力。

Comments 4 pages , 3 figures , This paper has been submitted to the IEEE-affiliated ICBME Conference (Iran), 2025, and is currently under review. DOR number: [20.1001.2.0425023682.1404.10.1.440.7]

Journal ref Proc. 2025 32nd ICBME, IEEE, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09881 2026-05-01 cs.CL 77%

Do What I Say: A Spoken Prompt Dataset for Instruction-Following

我说的话:用于指令跟随的语音提示数据集

Maike Züfle, Sara Papi, Fabian Retkowski, Szymon Mazurek, Marek Kasztelnik, Alexander Waibel, Luisa Bentivogli, Jan Niehues

机构 * Karlsruhe Institute of Technology, Germany(卡尔斯鲁厄理工学院,德国) Fondazione Bruno Kessler, Italy(布鲁诺·凯瑟尔基金会,意大利) ACC Cyfronet AGH, Poland(AGH计算机科学与技术学院,波兰) AGH University of Krakow, Poland(克拉科夫AGH大学,波兰) Carnegie Mellon University, U.S.(卡内基梅隆大学,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出DOWIS数据集,用于评估语音指令下的SLLM性能,发现文本提示在低资源和跨语言任务中表现更优,但语音输出任务中语音提示能缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02768 2026-05-01 cs.CL 77%

MultiBLiMP 1.0: A Massively Multilingual Benchmark of Linguistic Minimal Pairs

MultiBLiMP 1.0:一种大规模多语言语言最小对基准

Jaap Jumelet, Leonie Weissweiler, Joakim Nivre, Arianna Bisazza

机构 * University of Groningen(格罗宁根大学) Uppsala University(乌普萨拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 MultiBLiMP 1.0通过101种语言和两种主谓一致类型,包含超过128,000对最小对,评估LLM在多语言能力上的表现,并揭示现有最先进模型在低资源语言建模中的不足。

Comments Published in TACL, MIT Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27340 2026-05-01 cs.AI 77%

Investigating More Explainable and Partition-Free Compositionality Estimation for LLMs: A Rule-Generation Perspective

探究更可解释且无分区的组合性估计方法:从规则生成的角度

Ziyao Xu, Cong Wang, Houfeng Wang

机构 * National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(国家多媒体信息处理重点实验室,计算机学院,北京大学) OPPO AI Center(OPPO人工智能中心)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出从规则生成角度评估LLM组合性的新方法,解决现有测试的局限性,通过字符串到网格任务实验揭示LLM的组合性特征与不足。

Comments Accepted at ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27419 2026-05-01 cs.AI cs.CL 73%

InteractWeb-Bench: Can Multimodal Agent Escape Blind Execution in Interactive Website Generation?

InteractWeb-Bench: 多模态代理能否在交互式网站生成中避免盲目执行?

Qiyao Wang, Haoran Hu, Longze Chen, Hongbo Wang, Hamid Alinejad-Rokny, Yuan Lin, Min Yang

机构 * Shenzhen Institute of Advanced Technology Chinese Academy of Sciences(深圳先进技术研究院中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Dalian University of Technology(大连理工大学) UNSW Sydney(悉尼大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InteractWeb-Bench,首个针对非专家低代码用户的多模态交互基准,通过模拟用户行为中的模糊性、冗余性和矛盾性,揭示前沿多模态大语言模型在意图识别和适应性交互上的局限。

Comments 21 pages, 13 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28138 2026-05-01 cs.OS cs.AI 70%

Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

Crab:一种语义感知的检查点/恢复运行时用于智能体沙盒

Tianyuan Wu, Chaokun Chang, Lunxi Cao, Wei Gao, Wei Wang

机构 * HKUST(香港科技大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Crab通过桥接智能体与操作系统间的语义鸿沟,提升检查点恢复的准确性,减少检查点流量,提高执行效率。

Comments 15 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏