arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-20 至 2026-05-20 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 61 篇

2605.18464 2026-05-20 cs.CV 50%

PERL: Parameter Efficient Reasoning in CLIP Latent Space

PERL:在CLIP潜在空间中实现参数高效的推理

Simone Carnemolla, Salvatore Calcagno, Daniela Giordano, Concetto Spampinato, Matteo Pennisi

机构 * University of Catania(卡塔尼亚大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出PERL,一种在CLIP潜在空间中通过迭代潜在推理实现参数高效适应的框架,该方法在多个基准测试中表现出最佳的参数-性能权衡,仅需约6K可训练参数即可实现强的新型类别准确率和竞争性的迁移性能。

Comments Submitted to NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 93 篇

2605.19357 2026-05-20 cs.CL 93%

SciCustom: A Framework for Custom Evaluation of Scientific Capabilities in Large Language Models

SciCustom: 一个用于大型语言模型科学能力定制评估的框架

Yiyang Gu, Junwei Yang, Junyu Luo, Ye Yuan, Bin Feng, Yingce Xia, Shufang Xie, Kaili Liu, Bohan Wu, Qi Shi, Haoran Li, Beier Xiao, Zhiping Xiao, Xiao Luo, Weizhi Zhang, Philip S. Yu, Zequn Liu, Ming Zhang

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, PKU-Anker LLM Lab, Peking University(多媒体信息处理国家重点实验室,计算机学院,PKU-Anker LLM实验室,北京大学) Zhongguancun Academy(中关村学院) IDEA Xidian University(西安电子科技大学) Peking University(北京大学) University of Washington(华盛顿大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出SciCustom框架,通过从大规模科学数据中自定义构建基准,评估LLM在特定科学任务中的能力,无需专家标注或合成问题生成,展示了细粒度科学能力差异。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09997 2026-05-20 cs.SI cs.SE 92%

GraphInstruct: A Progressive Benchmark for Diagnosing Capability Gaps in LLM Graph Generation

GraphInstruct: 一个用于诊断LLM图生成能力差距的渐进性基准

Zihe Wei, Sheng Xiang, Ying Zhang, Changjun Jiang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出GraphInstruct基准,通过六个复杂性层级和五个评估维度,结合800个人工指令和1582个算法生成的参考解决方案,评估LLM图生成能力,发现多约束组合而非推理深度具有更强区分能力,且无单一提示策略能跨层级或模型家族主导,域语义约束在所有测试方法中保持迭代不变,表明检索而非额外计算是下一步研究方向。

Comments 44 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19229 2026-05-20 cs.AI 92%

Can Large Language Models Revolutionize Survey Research? Experiments with Disaster Preparedness Responses

大型语言模型能否革新调查研究?与灾害准备响应的实验

Yan Wang, Ziyi Guo, Christopher McCarty

机构 * Dept. of Urban and Regional Planning & Florida Institute for Built Environment Resilience, University of Florida(城市与区域规划系及佛罗里达环境韧性研究所,佛罗里达大学) College of Liberal Arts and Sciences, Bureau of Economic and Business Research, University of Florida(文理学院及经济与商业研究局,佛罗里达大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型在调查研究中的应用,通过实验验证了其在灾害准备响应中的有效性,提出了一个五阶段框架,涵盖问卷设计、样本选择、试点测试、缺失数据填补和事后分析,并介绍了基于保护动机理论的协同出现知识图谱和七种LLM配置。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15518 2026-05-20 cs.CL 92%

DetectRL-X: Towards Reliable Multilingual and Real-World LLM-Generated Text Detection

DetectRL-X: 向可靠多语言和真实世界LLM生成文本检测迈进

Junchao Wu, Yefeng Liu, Chenyu Zhu, Hao Zhang, Zeyu Wu, Tianqi Shi, Yichao Du, Longyue Wang, Weihua Luo, Jinsong Su, Derek F. Wong

机构 * NLP2 CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学学院NLP2 CT实验室) Alibaba Group(阿里巴巴集团) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DetectRL-X,一个综合性的多语言基准,用于评估先进检测器在8个维度上的性能,通过8种常见商业语言和6种易受LLM滥用的领域人类文本,结合4种流行商业LLM生成文本及润色、扩展和缩写等AI辅助写作操作,分析不同语言、领域、生成器、攻击策略、文本长度和润色操作对检测器性能的影响,以强化多语言和语言特定检测器。

Comments ACL 2026 Main. Code and data are available at https://github.com/AIDC-AI/Marco-LLM/tree/main/DetectRL-X

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19595 2026-05-20 cs.CV cs.AI 92%

A novel YOLO26-MoE optimized by an LLM agent for insulator fault detection considering UAV images

一种由LLM代理优化的YOLO26-MoE新型模型用于考虑无人机图像的绝缘子故障检测

João Pedro Matos-Carvalho, Laio Oriel Seman, Stefano Frizzo Stefenon, Mohammad Khalaf Mohammad Khreasat, Gabriel Villarrubia González

机构 * Department of Automation and Systems Engineering, Federal University of Santa Catarina, Florianópolis, Brazil(自动化与系统工程系,圣卡塔琳娜联邦大学,巴西弗洛里安波利斯) Applications Lab, Faculty of Science, University of Salamanca, Plaza de los Caídos s/n, 37008 Salamanca, Spain(应用实验室,科学学院,萨拉曼卡大学,西班牙萨拉曼卡)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种优化的YOLO26-MoE模型,通过在YOLO26检测器的高分辨率分支中集成稀疏的混合专家(MoE)模块,以适应细微和多样的故障模式,同时保持单阶段检测框架的效率,利用LLM代理进行超参数优化,最终在无人机图像上实现了99.00 mAP@0.5和95.15 mAP@0.5:0.95的性能,优于最新版本的YOLO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22202 2026-05-20 cs.SE cs.CL 92%

Library Hallucinations in LLM-Generated Code: A Risk Analysis Grounded in Developer Queries

LLM生成代码中的库幻觉:基于开发者查询的风险分析

Lukas Twist, Jie M. Zhang, Mark Harman, Helen Yannakoudakis

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了LLM生成代码中库幻觉的风险,通过分析用户提示变化对库幻觉的影响,揭示了系统性漏洞,并提出了LibHalluBench基准测试以评估这些幻觉。

Comments 27 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19110 2026-05-20 cs.CE 91%

IterSIMP-σ: Evaluating LLM-Assisted Spatial Interventions in Stress-Aware Topology Optimization

IterSIMP-σ:评估LLM辅助的应力感知拓扑优化中的空间干预

Shaoliang Yang, Jun Wang, Yunsheng Wang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究多模态大语言模型(LLM)是否能作为可检查的空间提案模块用于应力感知拓扑优化。IterSIMP-σ保持SIMP优化器作为最小化合规性的有限元求解器,并在其周围放置一个确定性的应力传递、门控评估器和混合LLM/规则解释器。每次求解后,密度和von Mises应力场被渲染;解释器提出排名的空间干预;确定性的安全措施接受、拒绝或停止每个动作。主要动作是软密度种子,所选元素在下一次求解前被初始化为高密度,但在最优标准更新时仍保持自由。我们评估该循环在16问题2D控制器-政策基准、6问题探索性3D扩展、被动固体和输入消融、应力阈值敏感性以及固定体积归因研究中,比较LLM提案与确定性最大应力热点种子、随机应力区域种子和基于规则的控制。2D控制器-政策基准显示保留合规性差异较小(软种子LLM的几何均值低1.9%),但此诊断不显著(W=33,双侧p=0.382)且不是固定体积可行最终比较。在固定体积研究中,LLM条件完成了44/48次尝试评估;25/44次完成评估产生了全部门通过的保留状态。与基于规则的控制的可行最终评分分为4/4/1,确定性精确热点种子仍具竞争力。接受的LLM空间动作有每步记录的平均归一化种子到热点距离为0.221。结果支持IterSIMP-σ作为可检查的LLM辅助设计自动化框架用于空间干预,但尚未作为证据表明LLM视觉推理能改进应力约束优化。

Comments 44 pages, 19 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19999 2026-05-20 cs.LG cs.AI cs.CR 91%

LLM Benchmark Datasets Should Be Contamination-Resistant

LLM基准数据集应具备抗污染性

Ali Al-Lawati, Jason Lucas, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University, University Park, PA, USA(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM基准数据集应具备抗污染性,提出通过改进数据集设计和架构来提高其可靠性和通用性。

Comments Accepted to ICML 2026 Position Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.20238 2026-05-20 cs.CL cs.AI 91%

A Survey of Large Language Models for Arabic Language and its Dialects

阿拉伯语言及其方言大型语言模型综述

Malak Mashaabi, Shahad Al-Khalifa, Hend Al-Khalifa

机构 * iWAN Research Group(iWAN研究组) College of Computer and Information Sciences(计算机与信息科学学院) King Saud University(沙特国王大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.CL、cs.AI

AI总结 本文综述了针对阿拉伯语言及其方言设计的大型语言模型,涵盖关键架构、预训练数据集以及单语、双语和多语模型在下游任务中的性能,同时讨论了阿拉伯LLM的开放性及其对未来研究的挑战与机遇。

Comments Submitted to ACM Transactions on Asian and Low-Resource Language Information Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19711 2026-05-20 cs.CL 90%

Can Large Language Models Reliably Correct Errors in Low-Resource ASR? A Contamination-Aware Case Study on West Frisian

大型语言模型能否可靠地纠正低资源语音识别中的错误?一项考虑数据污染的西弗里西语案例研究

Yun Hao, Reihaneh Amooie, Wietse de Vries, Rik van Noord, Martijn Wieling

机构 * University of Groningen(Groningen大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究探讨了大型语言模型在低资源语言(如西弗里西语)中通过生成性错误纠正(GER)提升语音识别(ASR)性能的效果,发现GER在大多数设置中提升了ASR性能,并通过详细的错误分析揭示了模型的纠正模式。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18882 2026-05-20 cs.LG cs.AI 90%

To Call or Not to Call: Diagnosing Intrinsic Over-Calling Bias in LLM Agents

叫还是不叫:诊断LLM代理中的内在过度调用偏差

Wei Shi, Ziheng Peng, Sihang Li, Xiting Wang, Xiang Wang, Mengnan Du, Na Zou

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) The Chinese University of Hong Kong Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文研究了LLM代理中过度调用现象,提出内在偏差假说,通过稀疏自编码器恢复行为对齐的特征基,减少到带符号激活边距,并估计偏移量,从而修正过度调用问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13793 2026-05-20 cs.CL 90%

An LLM-Based System for Argument Mining

基于LLM的论证挖掘系统

Paulo Pirozelli, Victor Hugo Nascimento Rocha, Fabio G. Cozman, Douglas Aldred

机构 * Universidade de São Paulo Center for Artificial Intelligence (C4AI)(圣保罗大学人工智能中心(C4AI)) Instituto Mauá de Tecnologia Núcleo de Sistemas Eletrônicos Embarcados (NSEE)(马乌阿技术研究所电子系统嵌入核(NSEE))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一个基于大语言模型的端到端系统,用于从自然语言文本中提取论证并构建抽象论证图,通过多阶段流程识别论证组件、选择相关元素并揭示其逻辑关系,实验表明该系统能有效恢复论证结构并在不同标注方案下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19529 2026-05-20 cs.AI 90%

Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

生成-评估一致性:为LLM赋能的自适应评估的必要有效性标准

Grandee Lee, Yue Wang, Che Yee Lye, Luke Peh

机构 * Singapore University of Social Sciences(新加坡社会科学研究大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出生成-评估一致性(GEA)作为LLM赋能自适应评估的有效性标准,通过测量LLM评分函数是否能恢复其生成函数所指示的技能水平,发现其在不同技能层面的有效性存在差异,并提出细粒度、技能分解的评分标准作为提升GEA的主要方法。

Comments BEA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19518 2026-05-20 cs.AI 90%

BLINKG: A Benchmark for LLM-Integrated Knowledge Graph Generation

BLINKG:一个用于集成大语言模型的知识图谱生成基准

Carla Castedo, Enrique Iglesias, Manuel Lama, Alberto Bugarin-Diz, Maria-Esther Vidal, David Chaves-Fraga

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学智能技术研究中心(CiTIUS)) L3S Research Center Germany, Hannover, Germany(德国汉诺威L3S研究中心) TIB Leibniz Information Centre for Science and Technology, Hannover, Germany(德国汉诺威TIB莱比锡信息科学与技术研究中心) Leibniz University, Hannover, Germany(德国汉诺威莱比锡大学) Departamento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(圣地亚哥-德孔波斯特拉大学电子与计算系)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLINKG基准,用于评估大语言模型在从异构数据源生成知识图谱中的映射能力,通过复杂度递增的场景和实验评估,揭示了LLM在知识图谱构建中的潜力与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19337 2026-05-20 cs.AI 90%

Agentic Trading: When LLM Agents Meet Financial Markets

代理交易:当大语言模型代理与金融市场相遇

Yihan Xia, Panpan You, Taotao Wang, Fang Liu, Han Qi, Xiaoxiao Wu, Shengli Zhang

机构 * College of Electronic and Information Engineering, Shenzhen University, Shenzhen, China(深圳大学电子与信息工程学院) Shenzhen Audencia Financial Technology Institute, Shenzhen University, Guangdong, People's Republic of China(深圳大学审计金融科技研究所)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了如何将大语言模型(LLM)作为交易系统中的代理,感知市场信息、检索上下文、进行决策推理、发出可交易动作并适应市场反馈。研究通过分析77项研究,发现协议不可比性是主要问题,提出证据日志、可重复性审计和报告检查表作为主要贡献。

Comments 59 pages, 15 figures, 27 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19196 2026-05-20 cs.CL 90%

Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?

时间到REFLECT:我们能否信任LLM裁判来评估基于证据的研究代理?

Leyao Wang, Yanan He, Peng Chen, Asaf Yehudai, Yixin Liu, Rex Ying, Michal Shmueli-Scheuer, Arman Cohan

机构 * Yale University(耶鲁大学) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文提出REFLECT基准,用于评估LLM裁判在代理环境中的细粒度失败检测,揭示当前LLM裁判在推理、工具使用和报告质量上的可靠性不足,为构建更可靠的评估流程提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19127 2026-05-20 cs.AI 90%

POLAR-Bench: A Diagnostic Benchmark for Privacy-Utility Trade-offs in LLM Agents

POLAR-Bench: 一个用于LLM代理隐私-效用权衡的诊断基准

Qiaoyuan Zheng, Yiqu Yang, Qi Gao, Imanol Schlag

机构 * ETH Zurich(苏黎世联邦理工学院) ETH AI Center(ETH人工智能中心)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出POLAR-Bench基准,用于评估LLM代理在隐私和效用之间的权衡。通过在10个领域和7,852个样本上进行测试,该基准通过确定性集合成员hip评分隐私和效用,并在两个正交轴上变化隐私策略维度和攻击策略,生成5x5的诊断表面。结果揭示了当前前沿模型在保护属性上隐瞒超过99%,而较小的开放权重模型在1-30B范围内表现更差,泄露率高达一半。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07777 2026-05-20 cs.MA cs.GT 89%

Talk, Judge, Cooperate: Gossip-Driven Indirect Reciprocity in Self-Interested LLM Agents

谈话、评判、合作:在自利LLM代理中基于 gossip 的间接互惠

Shuhui Zhu, Yue Lin, Shriya Kaistha, Wenhao Li, Baoxiang Wang, Hongyuan Zha, Gillian K. Hadfield, Pascal Poupart

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出ALIGN框架,通过策略性分享开放式 gossip 实现去中心化代理的声誉形成、信任评估和社会规范协调,从而提升间接互惠并抵御恶意入侵,发现LLM的更强推理能力促进更激励对齐的合作,而聊天模型容易过度合作。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19043 2026-05-20 cs.CY cs.AI cs.HC 89%

Automated Grading of Handwritten Mathematics Using Vision-Capable LLMs

使用具备视觉能力的LLM进行手写数学自动评分

Jacob Levine, Miguel Aenlle, Craig Zilles, Matthew West, Mariana Silva

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了使用具备视觉能力的LLM对手写数学作业进行自动评分,通过对比AI评分与人工评分,发现大多数错误源于转录失败而非评分标准应用错误,揭示了LLM在手写数学评分中的潜力与局限。

Comments To be published in the International Conference on AI in Education (AIED), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18805 2026-05-20 cs.IR cs.AI cs.LG 88%

RecoAtlas: From Semantic Plausibility to Set-Level Utility in LLM Recommendation Agents

RecoAtlas: 从语义合理性到集级效用在LLM推荐代理中

Imad Aouali, Flavian Vasile, Otmane Sakhi, Alexandre Gilotte, Benjamin Heymann

机构 * Criteo AI Lab(Criteo人工智能实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出RecoAtlas,一个用于评估购物代理的基准和工具包,通过行为基础的度量标准来评估推荐代理的性能,揭示语义合理性并不一定代表行为基础的效用。

Comments Benchmark on LLM Recommendation Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10075 2026-05-20 cs.AI 88%

Active Testing of Large Language Models via Approximate Neyman Allocation

通过近似奈曼分配主动测试大型语言模型

Zeli Liu, Jiancheng Zhang, Cong Liu, Yinglun Zhu

机构 * University of California, Riverside(加州大学河滨分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种针对生成任务的主动测试算法,利用语义熵进行分层并基于代理模型提取的信号进行近似奈曼分配,从而在多个语言和多模态基准测试中显著提升性能,实现高达28%的均方误差降低和22.9%的预算节省。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19377 2026-05-20 cs.LG cs.AI 88%

The Evaluation Game: Beyond Static LLM Benchmarking

评估游戏:超越静态LLM基准测试

Paul Wang, Jade Garcia-Bourrée, Anne-Marie Kermarrec, Vincent Corruble

机构 * Sorbonne Université, CNRS, LIP6(索邦大学,国家科学研究中心,LIP6实验室) École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于博弈论的框架,用于评估大型语言模型的安全性,通过数据增强的群作用结构分析评估者与训练者之间的互动,揭示了对抗性测试中局部泛化和记忆补丁的区别。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18801 2026-05-20 cs.AI cs.IR cs.LG 88%

Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance

位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能

Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji

机构 * Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系) Technical University of Munich, Germany(慕尼黑技术大学) Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过开发数据探针系统方法生成合成序列,以揭示数据特性对大语言模型性能、泛化能力和鲁棒性的影响,从而超越经验启发式方法。

Comments Accepted to ICML 2026 Position Paper Track

Journal ref Link to ICML record: https://icml.cc/virtual/2026/poster/67154

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19307 2026-05-20 cs.CV 88%

MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems

MetaRA: 多模态大语言模型基于视觉问答系统的元形态鲁棒性评估

Quanxing Xu, Yuhao Tian, Ling Zhou, Xian Zhong, Xiaohua Huang, Rubing Huang, Chia-Wen Lin

机构 * School of Computer Science and Engineering, Macau University of Science and Technology, Macao SAR(澳门科学技术大学计算机科学与工程学院) Hubei Key Laboratory of Transportation Internet of Things, School of Computer Science and Artificial Intelligence, Wuhan University of Technology(湖北省交通物联网重点实验室,武汉理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出MetaRA,一种基于元形态测试的框架,用于评估多模态大语言模型基于视觉问答系统的鲁棒性,通过生成受控的图像-问题输入变体,揭示模型在语言扰动、视觉线索依赖和多模态推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19815 2026-05-20 cs.CL cs.AI 87%

LP-Eval: Rubric and Dataset for Measuring the Quality of Legal Proposition Generation

LP-Eval: 用于衡量法律命题生成质量的评估标准和数据集

Shanshan Xu, Johan Lindholm, Amogh Raina, Henrik Palmer Olsen, Daniel Hershcovich

机构 * University of Copenhagen(哥本哈根大学) Umeå University(乌梅拉大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LP-Eval,一种与法律专家共同设计的三步评估标准,用于评估法律命题的质量,通过专家标注的100个LLM生成的法律命题数据集,展示了LLM生成的命题质量较高,但专家评估发现基于经典案例的命题质量更高,同时发现基于评估标准的LLM判断更接近专家评估,但缺乏对细粒度区别的敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14778 2026-05-20 cs.CL cs.AI cs.CY 86%

A Geometric Analysis of Small-sized Language Model Hallucinations

小尺寸语言模型幻觉的几何分析

Emanuele Ricco, Elia Onofri, Lorenzo Cima, Stefano Cresci, Roberto Di Pietro

机构 * Engineering (CEMSE) division, King Abdullah University of Science and Technology (KAUST)(卡塔尔科技大学工程学院(CEMSE)) Istituto di Informatica e Telematica (IIT), National Research Council of Italy (CNR)(意大利国家研究理事会信息与电信研究所(IIT)) Department of Information Engineering, University of Pisa(比萨大学信息工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从几何角度分析小尺寸语言模型幻觉问题,提出APORIA框架,通过句子嵌入空间研究重复提示下的响应,发现真实响应比幻觉响应更紧密聚类,并通过APORIA-LP方法实现高效分类,同时发布SOCRATES-300K数据集以支持进一步研究。

Comments 30 pages, 12 figures, 14 tables, accepted as regular paper at ICML'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19399 2026-05-20 cs.AR 86%

HSCO-Bench: An Agent-Driven End-to-End Hardware-Software Co-design Benchmark for Systems-on-Chip

HSCO-Bench: 一种由智能体驱动的端到端硬件软件协同设计基准,用于片上系统

Pei-Huan Tsai, Kuan-Lin Chiu, William Baisi, Pin-Yu Chen, Luca P. Carloni

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出HSCO-Bench,一个用于评估大型语言模型在端到端硬件软件协同设计能力的基准,通过评估LLM在资源约束下生成高效SoC原型的能力,揭示了当前模型在硬件加速方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20165 2026-05-20 cs.CV 85%

CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models

CaMo:基于摄像机运动的视觉-语言模型评估与训练

Hsiang-Wei Huang, Junbin Lu, Kuang-Ming Chen, Jianxu Shangguan, Cheng-Yen Yang, Jenq-Neng Hwang

机构 * Department of Electrical and Computer Engineering, University of Washington, Seattle, USA(华盛顿大学电气与计算机工程系)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出了一种基于摄像机运动的视觉-语言模型评估与训练方法CaMo,通过要求模型生成显式的空间叙述并进行推理,揭示了现有空间视觉-语言模型在空间认知方面的不足,并展示了CaMo在空间叙述评估和直接空间问题回答准确性上的一致表现。

Comments Code and model available at https://github.com/hsiangwei0903/CaMo

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19141 2026-05-20 cs.LG cs.AI cs.CL cs.CY cs.HC 83%

GRASP: Deterministic argument ranking in interaction graphs

GRASP:交互图中的确定性论证排名

Diganta Misra, Antonio Orvieto, Rediet Abebe, Volkan Cevher

机构 * MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所) Eberhard Karls Universität Tübingen(图宾根埃伯哈德·卡尔斯大学) LIONS, EPFL(EPFL的LIONS实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GRASP框架,通过聚合稳定的局部交互判断生成全局排名,以解决大语言模型作为裁判时整体评判不一致的问题,强调结构充分性而非说服力或修辞吸引力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏