arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-11 至 2026-05-11 共收录 102 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 102 篇

2605.07422 2026-05-11 cs.SE cs.AI 92%

Prompt Engineering Strategies for LLM-based Qualitative Coding of Psychological Safety in Software Engineering Communities: A Controlled Empirical Study

基于LLM的软件工程社区心理安全定性编码的提示工程策略:一项受控实证研究

Moaath Alshaikh, Tasneem Alshaher, Ricardo Vieira, Beatriz Santana, Clelio Xavier, Jose Amancio, Glauco Carneiro, Julio Leite, Savio Freire, Manoel Mendonca

机构 * Federal University of Bahia(巴伊亚联邦大学) State University of Feira de Santana(费拉德桑塔纳州立大学) Federal University of Sergipe(塞格皮联邦大学) Federal Institute of Ceara(塞阿拉联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文通过对比三种LLM在零样本和多样本提示策略下的表现,验证了多样本提示能提升编码一致性,但对部分模型效果有限,同时发现模型在某些类别上存在系统性偏差。

Comments 9 pages, 5 figures. Accepted at the 1st International Workshop on Prompt Engineering for Software Engineering (PROMPT-SE 2026), co-located with the 30th International Conference on Evaluation and Assessment in Software Engineering (EASE 2026), Glasgow, Scotland, United Kingdom, June 9--12, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03736 2026-05-11 cs.AI cs.CL cs.LG 92%

Are LLM Agents Behaviorally Coherent? Latent Profiles for Social Simulation

LLM代理行为是否一致?用于社交模拟的潜在特征

James Mooney, Josef Woldense, Zheng Robert Jia, Shirley Anugrah Hayati, My Ha Nguyen, Vipul Raheja, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(明尼苏达大学计算机科学与工程系) Department of African American & African Studies, University of Minnesota(明尼苏达大学非裔美国人与非洲研究系) Department of Sociology, University of Chicago(芝加哥大学社会学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究LLM代理在不同实验环境下是否保持经验一致性,通过揭示代理的潜在特征来检验其行为一致性,发现不同模型家族和大小的LLM存在显著不一致。

Comments 25 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02195 2026-05-11 cs.SE 92%

Beyond Translation Accuracy: Addressing False Failures in LLM-Based Code Translation

超越翻译准确性:解决基于LLM的代码翻译中的虚假失败

Fazle Rabbi, Soumit Kanti Saha, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文指出LLM代码翻译中许多失败并非逻辑错误,而是评估框架导致的编译器标志、库链接缺失或运行时环境未配置等问题,通过大规模实验揭示了虚假负样本的分类及改进评估标准的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 92%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06910 2026-05-11 cs.CR 92%

Benchmarking Large Language Models for IoC Recovery under Adversarial Code Obfuscation and Encryption

对对抗性代码混淆和加密下大型语言模型进行IoC恢复的基准测试

Jaime Morales, Sergio Pastrana, Juan Tapiador

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出一个系统性基准测试,评估LLM在对抗性代码转换下恢复隐藏的IoC能力,发现加密技术显著降低检测性能,揭示LLM在代码分析中的局限性及改进方向。

Comments 11 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01535 2026-05-11 cs.SE 91%

Assessing, Exploiting, and Mitigating Syntactic Robustness Failures in LLM-Based Code Generation

评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障

Laboni Sarker, Mara Downing, Achintya Desai, Tevfik Bultan

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);foundation model(journal_ref)

AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。

Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same

Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14823 2026-05-11 physics.ed-ph 91%

Using an LLM to Investigate Students' Explanations on Conceptual Physics Questions

利用LLM探究学生对概念物理问题的解释

Sean Savage, N. Sanjay Rebello

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文利用LLM评估学生对能量与动量概念问题的书面解释,发现其评估结果与人类评分者一致,且能揭示不同错误解释类别,为教学提供更深入的理解。

Comments 5 pages, 3 figures and Physics Education Research Conference 2025

Journal ref 2025 PERC Proceedings, pp. 399-404 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02215 2026-05-11 cs.SE 91%

HEJ-Robust: A Robustness Benchmark for LLM-Based Automated Program Repair

HEJ-Robust:基于LLM的自动程序修复的鲁棒性基准

Fazle Rabbi, Jinqiu Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出HEJ-Robust基准,通过八种语义保持的代码转换生成1450个实例,评估五种微调LLM,在多种转换下模型性能下降超50%,揭示当前LLM修复模型缺乏对细微语法变化的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07247 2026-05-11 cs.AI 91%

EnvSimBench: A Benchmark for Evaluating and Improving LLM-Based Environment Simulation

EnvSimBench:一个评估和改进基于LLM的环境模拟的基准

Yi Liu, TingFeng Hui, Wei Zhang, Li Sun, Ningxin Su, Jian Wang, Sen Su

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.AI

AI总结 本文提出EnvSimBench,通过400个样本覆盖167种多样环境的严格基准,揭示了LLM在环境模拟中的关键能力缺口,并设计了约束驱动的模拟流程以提升效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07046 2026-05-11 stat.ML cs.AI cs.LG 91%

An Interpretable and Scalable Framework for Evaluating Large Language Models

用于评估大语言模型的可解释且可扩展的框架

Xinhao Qu, Qiang Heng, Hao Zeng, Xiaoqian Liu

机构 * Department of Statistics, University of California, Riverside(加州大学河滨分校统计学系) School of Statistics and Data Science, Southeast University(东南大学统计与数据科学学院) Department of Statistics and Data Science, Southern University of Science and Technology(南方科技大学统计与数据科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于最大化最小化原理的可解释且可扩展框架,用于评估大语言模型,通过约束矩阵分解子问题实现稳定高效的参数估计,实验表明方法在可扩展性和可解释性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 90%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06937 2026-05-11 cs.LG 90%

A Reproducible Optimisation Protocol for Calibrating Prompt-Based Large Language Model Workflows in Evidence Synthesis

一种可重复的优化协议用于校准基于提示的大型语言模型在证据综合中的工作流程

Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出了一种可重复的校准流程,用于基于提示的大型语言模型在结构化证据综合任务中的优化。方法将定义科学任务的规则与可变的提示框架分离,并通过标记或参考示例及显式任务指标优化框架,最终保存校准的工作流程作为可检查的制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16928 2026-05-11 cs.GT cs.AI cs.MA 90%

Discovering Multiagent Learning Algorithms with Large Language Models

用大型语言模型发现多智能体学习算法

Zun Li, John Schultz, Daniel Hennes, Marc Lanctot

机构 * Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文利用AlphaEvolve框架自动发现CFR和PSRO算法,提出VAD-CFR和SHOR-PSRO,通过简化核心机制获得更高效的WOP-CFR和PM-PSRO,提升泛化能力。

Comments More experiments and analysis on algorithmic distilliation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07342 2026-05-11 cs.LG cs.AI cs.SE 90%

Mage: Multi-Axis Evaluation of LLM-Generated Executable Game Scenes Beyond Compile-Pass Rate

Mage:多轴评估LLM生成的可执行游戏场景超越编译通过率

Hugh Xuechen Liu, Kıvanç Tatar

机构 * Chalmers University of Technology and University of Gothenburg(楚尔姆斯理工大学和哥德堡大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出Mage多轴评估框架,通过编译通过率、运行通过率、结构保真度和机制符合度四个维度评估LLM生成的游戏场景,发现编译通过率与功能正确性反相关,证明多轴评估对检测领域差异的必要性。

Comments Main Content: 10 pages, 1 figure. In total 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07102 2026-05-11 cs.CL 90%

SAGE: Hierarchical LLM-Based Literary Evaluation through Ontology-Grounded Interpretive Dimensions

SAGE:基于本体的层级LLM文学评价

Tianyu Wang, Nianjun Zhou

机构 * Mercy University, Math & Computer Science Department(梅里大学数学与计算机科学系) IBM T.J. Watson Research Center(IBM 托马斯·贾维斯·沃森研究中心)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过本体引导的解释性维度对文学质量进行分层评估,利用结构化大语言模型评估和多轮迭代反思,实现98.8%的评分收敛和94%的评分者一致性,揭示了文学质量的层次结构和影响因素。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23478 2026-05-11 cs.CL 90%

JudgeSense: A Benchmark for Prompt Sensitivity in LLM-as-a-Judge Systems

JudgeSense: 一个用于评估LLM作为裁判系统提示敏感性的基准

Rohith Reddy Bellibatlu, Edward Raff, Wenbin Zhang

机构 * Florida International University(佛罗里达国际大学) CrowdStrike University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出JudgeSense基准,用于评估LLM作为裁判系统在提示重述下的稳定性,分析不同任务和架构的决策稳定性,并发现一致性不依赖模型规模。

Comments 20 pages, 2 figures, 1 table. Code: https://github.com/rohithreddybc/judgeSense. Dataset (JudgeSense Benchmark): https://huggingface.co/datasets/Rohithreddybc/judgesense-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07293 2026-05-11 cs.CR 89%

When the Ruler is Broken: Parsing-Induced Suppression in LLM-Based Security Log Evaluation

当尺子破损时:基于LLM的安全日志评估中的解析诱导抑制

Chaitanya Vilas Garware, Sharif Noor Zisad

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文揭示了基于LLM的安全日志分类器评估中因严格正则表达式解析导致的系统性误差,通过OpenSOC-AI案例显示,修正后的模糊解析可将威胁准确性从0%提升至76%,并提出SOC-Bench v0基准框架以避免解析偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09652 2026-05-11 cs.AI 89%

MiniAppBench: Evaluating the Shift from Text to Interactive HTML Responses in LLM-Powered Assistants

MiniAppBench:评估从文本到交互式HTML响应的转变

Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) Carnegie Mellon University, Pittsburgh, PA, USA(卡内基梅隆大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MiniAppBench,首个评估原理驱动交互应用生成能力的基准,通过10M+生成数据提炼500个任务,结合MiniAppEval框架评估意图、静态和动态维度,揭示LLM在生成高质量交互应用上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06623 2026-05-11 cs.AI cs.CL cs.LG cs.MA 88%

MASPO: Joint Prompt Optimization for LLM-based Multi-Agent Systems

MASPO:基于大语言模型的多智能体系统的联合提示优化

Zhexuan Wang, Xuebo Liu, Li Wang, Zifei Shan, Yutong Wang, Zhenxi Song, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MASPO框架,通过联合评估机制和数据驱动的进化束搜索,优化多智能体系统中的提示,提升整体性能,实验显示在6个任务中平均准确率提升2.9。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07635 2026-05-11 cs.CL 88%

Multi-Dimensional Evaluation of LLMs for Grammatical Error Correction

大维度评估用于语法纠错的LLM

Adnan Labib, Qiao Wang, Yixuan Huang, Zheng Yuan

机构 * King's College London(伦敦国王学院) Hosei University(Hosei大学) Waseda University(早稻田大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估最新LLM在语法纠错中的表现,发现微调后的GPT-4o在编辑精度、流畅度保持和意义保留上表现最佳,同时揭示参考基度量低估GEC性能的问题。

Comments 9 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01333 2026-05-11 cs.CL 88%

OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice

OralMLLM-Bench: 评估多模态大语言模型在牙科实践中的认知能力

Rongyang Wang, Shuang Zhou, Jiashuo Wang, Wenya Xie, Xiaoxia Che

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出OralMLLM-Bench,通过27个临床任务评估多模态大语言模型在牙科影像分析中的认知能力,揭示模型与牙科医生的性能差异及改进方向。

Comments 21 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07709 2026-05-11 cs.SE 88%

SafeTune: Search-based Harmfulness Minimisation for Large Language Models

SafeTune: 基于搜索的大型语言模型有害性最小化

Giordano d'Aloisio, David Williams, Giusy Annunziata, Zhiwei Fei, Antinisca Di Marco, Federica Sarro

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出SafeTune方法,通过超参数调优和系统提示工程降低大型语言模型的有害性并提升响应相关性。

Comments Accepted at SSBSE 2026 Challenge Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07830 2026-05-11 cs.CR cs.AI 87%

CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios

CyBiasBench:用于网络攻击场景的LLM代理偏见基准测试

Taein Lim, Seongyong Ju, Munhyeok Kim, Hyunjun Kim, Hoki Kim

机构 * Chung-Ang University(Chung-Ang大学) Myongji University(Myongji大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CyBiasBench,通过630次会话评估五个代理在三种目标和四种提示条件下的攻击偏见,揭示代理在攻击家族分配上的差异及偏见动量效应。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21582 2026-05-11 cs.CL cs.AI cs.HC 87%

VIDEE: Visual and Interactive Decomposition, Execution, and Evaluation of Text Analytics with Intelligent Agents

VIDEE:基于智能代理的文本分析可视化、交互式分解、执行与评估系统

Sam Yu-Te Lee, Chenyang Ji, Shicheng Wen, Lifu Huang, Dongyu Liu, Kwan-Liu Ma

机构 * Department of Computer Science, University of California at Davis(加州大学戴维斯分校计算机科学系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 VIDEE通过人机协作流程帮助初级分析师进行高级文本分析,包含分解、执行和评估三个阶段,结合人类反馈和LLM评估,验证了系统在非专家用户中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00780 2026-05-11 cs.SE 87%

Can Language Models Go Beyond Coding? Assessing the Capability of Language Models to Build Real-World Systems

语言模型能否超越编程?评估语言模型构建现实系统的能力

Chenyu Zhao, Shenglin Zhang, Zeshun Huang, Weilin Jin, Yongqian Sun, Dan Pei, Chaoyun Zhang, Qingwei Lin, Chetan Bansal, Saravan Rajmohan, Minghua Ma

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 本文提出Build-bench基准,评估语言模型在跨指令集架构迁移中修复构建失败的能力,发现当前模型最大成功率为63.19%,并揭示了不同模型在工具使用上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07208 2026-05-11 cs.LG 86%

FAME: Forecasting Academic Impact via Continuous-Time Manifold Evolution

FAME:通过连续时间流形演变进行学术影响预测

Jianrong Ding, Jianyuan Zhong, Zhengyan Shi, Qiang Xu

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FAME框架,通过动态流形演变模型预测科研论文的学术影响,实验显示其在多维影响预测上优于现有LLM评估器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06919 2026-05-11 cs.CL 86%

Can LLMs Take Retrieved Information with a Grain of Salt?

大语言模型能否对获取的信息持谨慎态度?

Behzad Shayegh, Mohamed Osama Ahmed, Fred Tung, Leo Feng

机构 * RBC Borealis

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文评估了八种LLM在上下文确定性服从方面的表现,发现其在不确定上下文中回忆先验知识、解释确定性表达和信任复杂上下文方面存在系统性限制,并提出结合先验提示、确定性重校准和上下文简化的方法,将服从误差降低了25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06707 2026-05-11 cs.SE cs.AI 85%

The Single-File Test: A Longitudinal Public-Interface Evaluation of First-Output LLM Web Generation with Social Reach Tracking

单文件测试:一项纵向的公共接口评估,评估首次输出LLM网页生成与社交传播跟踪

Diego Cabezas Palacios

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文通过8周的观察比较,评估了17项公共实验中收集的68个单文件HTML生成,比较了GPT、Gemini、Grok和Claude四种推理模型家族在固定公共接口协议下的表现,发现Claude在性能和一致性上表现最佳,但模型家族对代码冗余的影响大于提示词内容。

Comments 23 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06897 2026-05-11 cs.CL cs.AI cs.HC cs.MM cs.SD eess.AS 85%

MIST: Multimodal Interactive Speech-based Tool-calling Conversational Assistants for Smart Homes

MIST:面向智能家居的多模态交互语音工具调用对话助手

Maximillian Chen, Xuanming Zhang, Michael Peng, Zhou Yu, Alexandros Papangelis, Yohan Jo

机构 * Columbia University(哥伦比亚大学) Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MIST数据集,用于研究具备物理世界约束推理能力的多模态语音助手,发现开放和闭源多模态LLM在该任务上存在显著差距。

Comments Project Page: https://billyzhang24kobe.github.io/mist-smarthome/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24946 2026-05-11 cs.SE cs.LG 84%

MobileDev-Bench: A Benchmark for Issue Resolution in Mobile Application Development

MobileDev-Bench: 一个用于移动应用开发中问题解决的基准

Moshood A. Fakorede, Krishna Upadhyay, A. B. Siddique, Umar Farooq

机构 * Louisiana State University(路易斯安那州立大学) University of Kentucky(肯塔基大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出MobileDev-Bench,包含407个真实世界问题解决任务,涵盖Android Native、React Native和Flutter框架。通过验证的开发人员报告问题与可执行测试补丁配对,评估四个前沿LLM在移动构建环境中的端到端解决率。

Comments 30 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏