arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-30 至 2026-04-30 共收录 59 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 59 篇

2604.25934 2026-04-30 cs.CY cs.AI 94%

LLM Psychosis: A Theoretical and Diagnostic Framework for Reality-Boundary Failures in Large Language Models

LLM精神病:一种理论和诊断框架,用于大语言模型中现实边界失败

Ashutosh Raj

机构 * NeuraCare AI IIT Ropar(罗帕理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出LLM精神病理论框架,用于描述大语言模型认知崩溃现象,通过五个特征定义诊断工具LCIS,分析不同严重等级的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22063 2026-04-30 cs.LG cs.AI 92%

Reliability Auditing for Downstream LLM tasks in Psychiatry: LLM-Generated Hospitalization Risk Scores

精神科下游LLM任务中的可靠性审计:LLM生成的住院风险评分

Shevya Panda, Shinjini Bose, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了LLM在精神科住院风险评分中的可靠性问题,通过合成患者数据评估提示设计和非临床信息对预测稳定性的影响,揭示了非临床信息对模型输出的显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25933 2026-04-30 cs.CY cs.AI cs.CL 92%

A Scoping Review of LLM-as-a-Judge in Healthcare and the MedJUDGE Framework

对LLM-as-a-Judge在医疗领域的综述及MedJUDGE框架

Chenyu Li, Zohaib Akhtar, Mingu Kwak, Yuelyu Ji, Hang Zhang, Tracey Obi, Yufan Ren, Xizhi Wu, Sonish Sivarajkumar, Harold P. Lehmann, Shyam Visweswaran, Michael J. Becich, Danielle L. Mowery, Renxuan Liu, Haoyang Sun, Yanshan Wang

机构 * Department of Biomedical Informatics, School of Medicine, University of Pittsburgh(匹兹堡大学医学院生物医学信息学系) Department of Health Information Management, School of Health and Rehabilitation Sciences, University of Pittsburgh(匹兹堡大学健康与康复科学学院健康信息管理系) OpenCura, Health Innovation Consortium(OpenCura健康创新联盟) Northwestern University, Kellogg School of Management(西北大学凯洛格管理学院) Intelligent Systems Program, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院智能系统项目) Johns Hopkins University School of Medicine Biomedical Informatics and Data Science(约翰霍普金斯大学医学院生物医学信息学与数据科学) Clinical and Translational Science Institute, University of Pittsburgh(匹兹堡大学临床与转化科学研究所) Institute for Biomedical Informatics, University of Pennsylvania(宾夕法尼亚大学生物医学信息学研究所) Data Science, School of Computing and Information, University of Pittsburgh(匹兹堡大学计算与信息学院数据科学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM-as-a-Judge在医疗领域的应用现状,指出其在验证严谨性、偏见评估和治理方面存在不足,并提出MedJUDGE框架以提升医疗领域LLM-as-a-Judge系统的有效性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.00557 2026-04-30 cs.CL cs.AI cs.SE 92%

Learning to Ask: When LLM Agents Meet Unclear Instruction

学习提问:当LLM代理遇见模糊指令

Wenxuan Wang, Juluan Shi, Zixuan Ling, Yuk-Kit Chan, Chaozheng Wang, Cheryl Lee, Youliang Yuan, Jen-tse Huang, Wenxiang Jiao, Michael R. Lyu

机构 * Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Johns Hopkins University(约翰霍普金斯大学) Xiaohongshu Inc.(小红书公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AwN框架,通过让LLM在遇到模糊指令时主动提问以提升工具使用性能,并设计自动化评估工具ToolEvaluator,验证了在NoisyToolBench基准下的优越性。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04325 2026-04-30 cs.CL cs.AI cs.CV cs.LG cs.MM 92%

Beyond the Leaderboard: Rethinking Medical Benchmarks for Large Language Models

超越排行榜:重新思考大型语言模型的医疗基准

Wenting Chen, Guo Yu, Yiu-Fai Cheung, Meidan Ding, Jie Liu, Zizhan Ma, Wenxuan Wang, Linlin Shen

机构 * Stanford University(斯坦福大学) Shenzhen University(深圳大学) The Chinese University of Hong Kong(香港中文大学) City University of Hong Kong(香港城市大学) Renmin University of China(中国人民大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出MedCheck框架,用于评估医疗领域大型语言模型的基准,揭示现有基准在临床相关性、数据完整性及安全性方面的系统性问题。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25927 2026-04-30 cs.CL 91%

Information Extraction from Electricity Invoices with General-Purpose Large Language Models

从电力账单中提取信息:通用大型语言模型

Javier Gómez, Javier Sánchez

机构 * Centro de Tecnologías de la Imagen (CTIM)(图像技术中心) Instituto Universitario de Cibernética, Empresas y Sociedad (IUCES)(大学网络研究所、企业与社会) University of Las Palmas de Gran Canaria(大加那利岛大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究评估通用大型语言模型在无需特定任务微调的情况下从西班牙电力账单中提取结构化信息的能力,发现提示质量对提取精度影响显著。

Comments 13 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06198 2026-04-30 cs.CL 90%

LIT-RAGBench: Benchmarking Generator Capabilities of Large Language Models in Retrieval-Augmented Generation

LIT-RAGBench:大型语言模型检索增强生成能力的基准测试

Koki Itai, Shunichi Hasegawa, Yuta Yamamoto, Gouki Minegishi, Masaki Otsuki

机构 * neoAI Inc.(neoAI公司) Tokyo Metropolitan University(东京 Metropolitan 大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 LIT-RAGBench通过五个类别评估生成器的整合、推理、逻辑、表格和回避能力,提供统一的基准测试框架,用于评估多方面能力并指导模型选择与改进。

Comments Published as a conference paper at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22558 2026-04-30 cond-mat.mtrl-sci cs.AI 90%

aLLoyM: A large language model for alloy phase diagram prediction

aLLoyM:一种用于合金相图预测的大型语言模型

Yuna Oikawa, Guillaume Deffrennes, Taichi Abe, Ryo Tamura, Koji Tsuda

机构 * Graduate School of Frontier Sciences, The University of Tokyo(东京大学前沿科学研究院) University Grenoble Alpes, CNRS, Grenoble INP, SIMaP(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、SIMaP) Research Center for Structural Materials, National Institute for Materials Science(材料研究所结构材料研究中心) Center for Basic Research on Materials, National Institute for Materials Science(材料研究所基础材料研究中心) RIKEN Center for Advanced Intelligence Project(理化学研究所先进人工智能项目中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出aLLoyM,一种针对合金成分和温度训练的大型语言模型,通过微调Mistral模型,提升了相图问题的解答能力,并能生成新的相图,推动材料发现。

Comments 24 pages, 6 figures

Journal ref npj Computational Materials 12, 97 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20749 2026-04-30 cs.CL 90%

Can LLM Agents Simulate Multi-Turn Human Behavior? Evidence from Real Online Customer Behavior Data

LLM代理能否模拟多轮人类行为?基于真实在线客户行为数据的证据

Yuxuan Lu, Jing Huang, Yan Han, Bingsheng Yao, Sisong Bei, Jiri Gesi, Yaochen Xie, Yisi Sang, Zheshen, Wang, Qi He, Dakuo Wang

机构 * Northeastern University(东北大学) Amazon.com, Inc.(亚马逊公司)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 本文通过购物案例研究,首次对先进LLM在模拟人类行为方面的准确性进行大规模定量评估,发现基于提示的LLM仅能生成11.86%的人类行为,通过微调提升至17.26%和33.86%的F1分数,建立首个严谨的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26679 2026-04-30 cs.HC 89%

MultEval: Supporting Collaborative Alignment for LLM-as-a-Judge Evaluation Criteria

MultEval: 支持LLM-as-a-Judge评估标准的协作对齐

Charles Chiang, Simret Gebreegziabher, Annalisa Szymanski, Yukun Yang, Hyo Jin Do, Zahra Ashktorab, Werner Geyer, Toby Li, Diego Gomez-Zara

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 研究探讨了LLM-as-a-Judge评估标准的协作制定过程,提出MultEval系统支持多方协商和迭代修订标准,提升评估透明度与一致性。

Comments 17 pages, 5 figures

Journal ref Proceedings of the 5th Annual Symposium on Human-Computer Interaction for Work (CHIWORK '26), June 22--25, 2026, Linz, Austria

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26356 2026-04-30 cs.DB 89%

PiLLar: Matching for Pivot Table Schema via LLM-guided Monte-Carlo Tree Search

PiLLar:通过LLM引导的蒙特卡洛树搜索进行立方体表模式匹配

Yunjun Gao, Chuangyu Ouyang, Congcong Ge, Yifan Zhu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出PiLLar框架,通过LLM引导的蒙特卡洛树搜索实现立方体表模式匹配,解决数据敏感性和匿名化数据带来的挑战,提升匹配精度和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24405 2026-04-30 cs.HC 89%

How Personal Characteristics Shape User Exploration of Diverse Movie Recommendations with a LLM-Based Multi-Agent System

个人特征如何塑造用户探索多样化电影推荐的多智能体系统

Yufan Zhou, Yirui Huang, Zhao Wang, Yucheng Jin

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了基于LLM的多智能体系统如何支持用户探索多样化推荐,探讨个人特征对用户体验的影响,发现多智能体系统提升新颖性和多样性,性格特质和AI经验影响感知准确性与多样性。

Comments 11 pages, 2 figures. Accepted by UMAP '26 (34th ACM International Conference on User Modeling, Adaptation and Personalization)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08049 2026-04-30 cs.CL cs.AI 88%

A Survey of Process Reward Models: From Outcome Signals to Process Supervisions for Large Language Models

对过程奖励模型的调查:从结果信号到大语言模型的过程监督

Congmin Zheng, Jiachen Zhu, Zhuoying Ou, Yuxiang Chen, Kangning Zhang, Rong Shan, Zeyu Zheng, Mengyue Yang, Jianghao Lin, Yong Yu, Weinan Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) University College London(伦敦大学学院) Carnegie Mellon University(卡内基梅隆大学) University of Bristol(布里斯托大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文综述了过程奖励模型,探讨了如何生成过程数据、构建PRMs及在测试时扩展和强化学习中的应用,涵盖数学、代码、文本、多模态推理、机器人和智能体等领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22134 2026-04-30 cs.CL 88%

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

SHAPE:统一安全、帮助性和教学法以用于教育LLM

Sihang Zhao, Kangrui Yu, Youliang Yuan, Pinjia He, Hongyi Wen

机构 * Center for Data Science, New York University Shanghai(纽约大学上海数据科学中心) Courant Institute of Mathematical Sciences, New York University(纽约大学Courant数学科学研究所) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SHAPE基准,通过知识掌握图统一安全、帮助性和教学行为,改进教育LLM在对抗压力下的安全性和帮助性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25960 2026-04-30 cs.SE cs.LG cs.PL 88%

Large Language Models for Multilingual Code Intelligence: A Survey

大型语言模型用于多语言代码智能:综述

Chao Jiang, Dugang Liu, Cheng Wen, Zhiwu Xu, Hua Zheng, Muhammad Sadiq, Jawwad Ahmed Shamsi, Shengchao Qin, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University, China(深圳大学计算机科学与软件工程学院,中国) Guangzhou Institute of Technology, Xidian University, China(广州理工大学,西安电子科技大学,中国) Guangzhou University of Software, China(广州软件大学,中国) Shenzhen University of Information Technology(深圳信息大学) National University of Computer and Emerging Sciences Karachi, Pakistan(巴基斯坦卡拉奇国家计算机与新兴科学大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文综述了多语言代码生成与翻译的关键任务,探讨了现有方法、基准和评估指标,指出多语言代码智能在现实系统中的重要性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16902 2026-04-30 cs.AI 88%

Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models

超越文本主导:理解多模态大语言模型的模态偏好

Xinru Yan, Boxi Cao, Yaojie Lu, Hongyu Lin, Weixiang Zhou, Le Sun, Xianpei Han

机构 * University of Chinese Academy of Sciences(中国科学院大学) Chinese Information Processing Laboratory(中文信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文研究多模态大语言模型的模态偏好现象,通过新基准和模态选择率指标量化发现,大多数模型表现出显著的视觉偏好,并通过层间探测揭示偏好在中后期层逐步出现,进而用于诊断跨模态幻觉,提升模型可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26192 2026-04-30 cs.SE 87%

LLM-Assisted Empirical Software Engineering: Systematic Literature Review and Research Agenda

基于大语言模型的实证软件工程:系统文献综述与研究议程

Victoria Gomes, Delaney Selb, Fabio Palomba, Rodrigo Spinola, David Lo

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统文献综述分析了大语言模型在实证软件工程中的应用,揭示了其在数据处理和分析中的集中使用,指出了自动化驱动但缺乏人机协同的局限性,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12537 2026-04-30 cs.DL 87%

News Harvesting from Google News combining Web Scraping, LLM Metadata Extraction and SCImago Media Rankings enrichment: a case study of IFMIF-DONES

从谷歌新闻获取新闻:结合网络爬虫、大语言模型元数据提取和SCImago媒体排名增强:以IFMIF-DONES为例

Victor Herrero-Solana

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种系统方法,结合网络爬虫、大语言模型元数据提取和SCImago媒体排名增强,构建新闻数据集,通过IFMIF-DONES案例研究,验证了数据收集管道的有效性,并分析了方法学挑战与数据集完整性保障。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26526 2026-04-30 cs.SE 86%

Identifying and Characterizing Semantic Clones of Solidity Functions

识别和表征Solidity函数的语义克隆

Ermanno Francesco Sannini, Francesco Salzano, Simone Scalabrino, Rocco Oliveto, Remo Pareschi, Corrado Aaron Visaggio, Andrea Di Sorbo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种可扩展的方法,通过分析代码和注释识别语义等价的Solidity函数,通过手动验证和实验验证了其有效性,并探讨了LLM在文档生成中的应用,为Solidity克隆检测提供了新基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26235 2026-04-30 cs.CR cs.AI cs.CL 85%

LATTICE: Evaluating Decision Support Utility of Crypto Agents

LATTICE:评估加密代理决策支持效用的基准

Aaron Chan, Tengfei Li, Tianyi Xiao, Angela Chen, Junyi Du, Xiang Ren

机构 * Sahara AI University of Southern California(南加州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LATTICE基准,用于评估加密代理在真实用户场景中的决策支持能力,通过六个评估维度、16种任务类型和LLM评委,实现大规模可扩展评估,揭示不同代理在决策支持质量上的显著差异及权衡。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22897 2026-04-30 cs.CL 83%

VIGNETTE: Socially Grounded Bias Evaluation for Vision-Language Models

VIGNETTE:面向视觉语言模型的社会性偏见评估

Chahat Raj, Bowen Wei, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出VIGNETTE基准,通过多方向问题回答框架评估视觉语言模型的偏见,揭示模型在身份识别中的刻板印象和歧视性模式。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11614 2026-04-30 cs.CL cs.AI 82%

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI

人类风格的文本是否受到人类欢迎?多语言人类检测与对抗AI的偏好

Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Abassy, Saad El Dine Ahmed, Kareem Elozeiri, Nurkhan Laiyk, Maiya Goloburda, Tarek Mahmoud, Raj Vardhan Tomar, Alexander Aziz, Ryuto Koike, Masahiro Kaneko, Artem Shelmanov, Ekaterina Artemova, Vladislav Mikhailov, Akim Tsvigun, Alham Fikri Aji, Nizar Habash, Iryna Gurevych, Preslav Nakov

机构 * MBZUAI Nebius AI KU Leuven University of Oslo(奥斯陆大学) ISTI-CNR Toloka AI New York University Abu Dhabi(纽约大学阿布扎比分校) BKAI Research Center, Hanoi University of Science and Technology(BKAI研究所以内大学科学技术大学) Cornell University(康奈尔大学) Zewail City of Science and Technology(泽韦尔科学与技术城) TU Darmstadt(图鲁姆大学) CIC, University of Delhi(CIC,德里大学) Alexandria University(亚历山大大学) University of Florida(佛罗里达大学) Institute of Science Tokyo(东京科学研究院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过多语言多领域数据集验证人类识别AI生成文本的准确性,发现人类检测准确率达87.6%,挑战原有结论,指出人类与机器文本在具体性、文化细微差别和多样性上的差距,提示明确提示可部分弥补这些差距。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25924 2026-04-30 cs.CL cs.AI cs.IR 82%

Generative AI-Based Virtual Assistant using Retrieval-Augmented Generation: An evaluation study for bachelor projects

基于生成AI的虚拟助手:使用检索增强生成的评估研究用于本科项目

Dumitru Verşebeniuc, Martijn Elands, Sara Falahatkar, Chiara Magrone, Mohammad Falah, Martijn Boussé, Aki Härmä

机构 * Department of Advanced Computing Sciences, Maastricht University, Maastricht 6200 MD, The Netherlands(先进计算科学系,马斯特里赫特大学,马斯特里赫特6200 MD,荷兰)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种基于检索增强生成的虚拟助手,用于帮助马斯特里赫特大学学生处理项目特定规定,通过评估框架验证其在特殊教育场景下的有效性。

Comments Accepted at BNAIC/BeNeLearn 2024, to appear in Springer CCIS series. 15 pages + refs. Code and survey available at https://github.com/DikaVer/maastricht_university_generative_virtual_assistant

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02494 2026-04-30 cs.CL cs.AI cs.CV 82%

MINOS: A Multimodal Evaluation Model for Bidirectional Generation Between Image and Text

MINOS:一种用于图像与文本双向生成的多模态评估模型

Junzhe Zhang, Huixuan Zhang, Xinyu Hu, Li Lin, Mingqi Gao, Shi Qiu, Xiaojun Wan

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王萱计算机技术研究所) School of Physics, Peking University(北京大学物理学院)

专题命中 评测与基准 :SFT(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MINOS模型,通过严格质量控制策略构建Minos-57K多模态评估数据集,结合SFT和偏好对齐训练策略,在16个跨领域数据集中取得最佳性能。

Comments Accepted to the Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26118 2026-04-30 cs.SE 82%

LLM-Guided Issue Generation from Uncovered Code Segments

基于大语言模型的未覆盖代码片段问题生成

Diany Pressato, Honghao Tan, Mariam Elmoazen, Shin Hwei Tan

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出IssueSpecter工具,通过结合代码覆盖分析与大语言模型缺陷识别,生成优先级高的问题报告,验证其在Python项目中有效检测多种类型漏洞,且比传统方法在准确率和召回率上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26923 2026-04-30 cs.SE cs.CL 81%

ClassEval-Pro: A Cross-Domain Benchmark for Class-Level Code Generation

ClassEval-Pro:一个跨领域用于类级别代码生成的基准测试

Yeheng Chen, Chaoxiang Xie, Yuling Shi, Wenhao Zeng, Yongpan Wang, Hongyu Zhang, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学) Hohai University(淮海大学) Chongqing University(重庆大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 本文提出ClassEval-Pro,一个包含300个跨11个领域的类级别任务的基准测试,通过自动化三阶段流程构建,评估五种前沿LLM在五种生成策略下的表现,揭示了逻辑错误和依赖错误是核心瓶颈。

Comments Accepted to AIware 2026. Code and data available at https://github.com/ian-Kappa/ClassEval-Pro

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26607 2026-04-30 cs.AI cs.CY cs.SE 81%

Human-in-the-Loop Benchmarking of Heterogeneous LLMs for Automated Competency Assessment in Secondary Level Mathematics

带有循环的人的评估异构LLM在中学数学自动能力评估中的应用

Jatin Bhusal, Nancy Mahatha, Aayush Acharya, Raunak Regmi

机构 * Research and Incubation Center (RAIN), Sunway College Kathmandu(研究与孵化中心(RAIN),苏尼way学院加德满都)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文提出一种带有循环的人的评估框架,评估多个LLM在中学数学评估中的有效性,发现模型架构与指令约束的兼容性优于参数规模。

Comments 5 pages, 3 figures, 5 tables. Submitted to 2AI-2026-Applied AI Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04337 2026-04-30 cs.CV cs.CL 81%

Pointer-CAD: Unifying B-Rep and Command Sequences via Pointer-based Edges & Faces Selection

Pointer-CAD:通过基于指针的边与面选择统一B-Rep和命令序列

Dacheng Qi, Chenyu Wang, Jingwei Xu, Tianzhe Chu, Zibo Zhao, Wen Liu, Wenrui Ding, Yi Ma, Shenghua Gao

机构 * Transcengram Beihang University(北京航空航天大学) The University of Hong Kong(香港大学) Shenzhen Loop Area Institute(深圳河套学院) ShanghaiTech University(上海科技大学) DeepSeek University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 Pointer-CAD通过基于指针的命令序列表示,将B-Rep模型的几何信息融入顺序建模,有效生成复杂几何结构并降低分割误差,显著提升CAD生成精度。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26184 2026-04-30 cs.IR cs.AI cs.CL 81%

Auto-ARGUE: LLM-Based Report Generation Evaluation

Auto-ARGUE:基于大语言模型的报告生成评估

William Walden, Marc Mason, Orion Weller, Laura Dietz, John Conroy, Neil Molino, Hannah Recknor, Bryan Li, Gabrielle Kaili-May Liu, Yu Hou, Dawn Lawrie, James Mayfield, Eugene Yang

机构 * Johns Hopkins University(约翰霍普金斯大学) University of New Hampshire(新罕布什尔大学) IDA Center for Computing Services(IDA计算服务中心) Google(谷歌) Yale University(耶鲁大学) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Auto-ARGUE,一种基于大语言模型的报告生成评估工具,通过TREC 2024 NeuCLIR和RAG任务验证,展示了与人类判断的良好相关性,并发布ARGUE-Viz可视化工具。

Comments SIGIR 2026: Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13682 2026-04-30 cs.AI cs.CL 81%

ChinaTravel: An Open-Ended Travel Planning Benchmark with Compositional Constraint Validation for Language Agents

ChinaTravel: 一个带有组合约束验证的开放旅行规划基准,用于语言代理

Jie-Jing Shao, Bo-Wen Zhang, Xiao-Wen Yang, Baizhi Chen, Si-Yu Han, Jinghao Pang, Wen-Da Wei, Guohao Cai, Zhenhua Dong, Lan-Zhe Guo, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Noah’s Ark Lab, Huawei, China(华为诺亚实验室)

专题命中 评测与基准 :language agent(title,abstract);分类 cs.CL、cs.AI

AI总结 ChinaTravel通过开放数据集和组合通用领域语言,提升语言代理在复杂真实场景中的约束满足能力,实现37%的约束满足率,比纯神经模型提升10倍。

Comments ICLR 2026. Webpage: https://www.lamda.nju.edu.cn/shaojj/chinatravel

详情

展开后加载摘要…

URL PDF HTML 收藏