arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 70 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2502.18036 2026-04-23 cs.CL 94%

Harnessing Multiple Large Language Models: A Survey on LLM Ensemble

利用多个大语言模型:关于LLM集成的综述

Zhijun Chen, Xiaodong Lu, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Xiao Huang, Yikun Ban, Hailong Sun, Philip S. Yu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University, Beijing, China(复杂与关键软件环境国家重点实验室,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Aviation System Engineering Institute of China, Beijing, China(中国航空系统工程研究院,北京,中国) Xi’an Jiaotong University, Xi’an, China(西安交通大学,西安,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Macau, Macau SAR, China(澳门大学,澳门特别行政区,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) University of Illinois at Chicago, Chicago, USA(伊利诺伊大学香槟分校,芝加哥,美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文系统回顾了LLM集成的最新发展,介绍了分类方法,讨论了相关研究问题,并提出了未来研究方向。

Comments 12 pages, 2 figures, codebase: https://github.com/junchenzhi/Awesome-LLM-Ensemble

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00585 2026-04-23 cs.CY cs.AI 92%

Fairness Testing of Large Language Models in Role-Playing

大型语言模型在角色扮演中的公平性测试

Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu

机构 * Peking University(北京大学) Tsinghua University(清华大学) King's College London(伦敦国王学院) Nanyang Technological University(南洋理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。

Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 92%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20131 2026-04-23 cs.CL 92%

Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives

谁的故事被讲述?LLM在生命叙事中的位置性与偏见

Melanie Subbiah, Haaris Mian, Nicholas Deas, Ananya Mayukha, Dan P. McAdams, Kathleen McKeown

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Department of Psychology, Northwestern University(西北大学心理学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究LLM在生命叙事抽象分析中的伦理与有效性,提出基于总结的管道以揭示LLM在解读叙事时的偏见,识别种族和性别偏见并呼吁未来研究中使用该分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15037 2026-04-23 cs.SE cs.AI 92%

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

CircuChain: 解构LLM电路分析中的能力与合规性

Mayank Ravishankara

机构 * Independent Researcher(独立研究员) San Francisco, CA, USA(美国加州旧金山)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CircuChain通过设计控制/陷阱问题对,评估LLM在电路分析中遵循指令与物理推理能力的差异,揭示模型能力与约束对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15319 2026-04-23 cs.HC cs.AI 92%

Explainable Iterative Data Visualisation Refinement via an LLM Agent

通过LLM代理的可解释迭代数据可视化细化

Burak Susam, Tingting Mu

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM代理的自动化方法,通过结合定量评估与人类洞察,实现高维数据可视化优化,生成高质量可视化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10271 2026-04-23 cs.SE cs.AI 92%

Quality Assurance of LLM-generated Code: Addressing Non-Functional Quality Characteristics

LLM生成代码的质量保障:解决非功能性质量特性

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

机构 * Department of Computer and Information Science, Linköping University, Sweden(Linköping大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过文献综述、行业研讨会和实证分析,探讨LLM生成代码在安全、可维护性和性能效率等非功能性质量特性上的表现,揭示学术研究与行业需求的不匹配,强调需在代码生成流程中集成质量保障机制。

Journal ref Journal of Systems and Software (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20310 2026-04-23 cs.HC 91%

Odor Maps from the LLM-derived similarity scores

从LLM衍生的相似性得分生成气味图

Yuki Harada, Manuel Aleixandre, Manabu Okumura, Takamichi Nakamoto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过比较LLM生成的气味相似性与原始数据距离,验证了LLM在气味图生成中的潜力,展示了精油在气味图中的分布与人类评价的一致性。

Comments 9 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00253 2026-04-23 cs.SE 91%

Towards Explorative IRBL: Combining Semantic Retrieval with LLM-driven Iterative Code Exploration

迈向探索性IRBL:结合语义检索与LLM驱动的迭代代码探索

Moumita Asad, Rafed Muhammad Yasir, Sam Malek

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GenLoc,结合语义检索与LLM驱动的代码探索功能,通过迭代分析代码库识别故障文件,优于传统和深度学习方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20273 2026-04-23 cs.AI cs.CL 91%

ActuBench: A Multi-Agent LLM Pipeline for Generation and Evaluation of Actuarial Reasoning Tasks

ActuBench: 一个用于生成和评估精算推理任务的多智能体LLM流水线

Jan-Philipp Schmidt

机构 * TH Köln, Institut für Versicherungswesen (ivwKöln)(TH Köln保险学系(ivwKöln))

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ActuBench,一个多智能体LLM流水线,用于自动生成和评估符合国际精算协会教育大纲的高级精算评估题目。通过四个LLM角色的分工,结合成本优化的辅助代理,评估了50个模型并在两个基准上报告了三个主要发现。

Comments 19 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22240 2026-04-23 cs.SE 91%

Are Decoder-Only Large Language Models the Silver Bullet for Code Search?

解码器-only大语言模型是否是代码搜索的银弹?

Yuxuan Chen, Mingwei Liu, Guangsheng Ou, Anji Li, Dekun Dai, Yanlin Wang, Zibin Zheng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 本文评估了11种解码器-only LLM在代码搜索任务中的性能,发现经过微调的模型在零样本和微调设置下均优于编码器-only模型,且模型大小和训练数据组成对性能有显著影响。

Comments Published in IEEE Transactions on Software Engineering (2026). 19 pages

Journal ref IEEE Transactions on Software Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19984 2026-04-23 cs.CY cs.AI cs.CL 90%

Bias in the Tails: How Name-conditioned Evaluative Framing in Resume Summaries Destabilizes LLM-based Hiring

尾部偏差:姓名条件下的评价框架在简历摘要中如何使基于LLM的招聘不稳定

Huy Nghiem, Phuong-Anh Nguyen-Le, Sy-Tuyen Ho, Hal Daume

机构 * University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 研究探讨了LLM生成的简历摘要中姓名条件下的评价框架如何导致招聘决策的不稳定性,通过大规模实验发现,评价语言在分布极值处存在细微差异,尤其在开源模型中更为明显。

Comments First version, 43 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 90%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20225 2026-04-23 cs.CL 89%

The GaoYao Benchmark: A Comprehensive Framework for Evaluating Multilingual and Multicultural Abilities of Large Language Models

高 Yao 基准:评估大型语言模型多语言和多文化能力的综合框架

Yilun Liu, Chunguang Zhao, Mengyao Piao, Lingqi Miao, Shimin Tao, Minggui He, Chenxin Liu, Li Zhang, Hongxia Ma, Jiaxin Guo, Chen Liu, Liqun Deng, Jiansheng Wei, Xiaojun Meng, Fanyi Du, Daimeng Wei, Yanghua Xiao

机构 * Huawei, China(华为,中国) Fudan University, China(复旦大学,中国)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 本文提出GaoYao基准,通过182300个样本、26种语言和51个地区,评估大型语言模型的多语言和多文化能力,揭示地理性能差异和任务间差距。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08948 2026-04-23 cs.CL 89%

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue

机构 * Yunnan University(云南大学) Wuhan University(武汉大学) Jianghan University(江汉大学) Nanjing Audit University(南京审计大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09373 2026-04-23 cs.CL 89%

The Imperfective Paradox in Large Language Models

大型语言模型中的不完美悖论

Bolei Ma, Yusuke Miyao

机构 * LMU Munich(慕尼黑大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究揭示大型语言模型在事件复合语义理解上的局限性,发现其依赖表面概率启发式而非逻辑推理,提出ImperfectiveNLI数据集揭示目标导向事件的预测偏差。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19533 2026-04-23 cs.CR cs.AI 89%

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估

Alankrit Chona, Igor Kozlov, Ambuj Kumar

机构 * Simbian AI

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。

Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20652 2026-04-23 cs.AI cs.HC econ.GN q-fin.EC 89%

Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure

大语言模型在欺诈检测中优于人类且对有动机投资者压力具有抵抗力

Nattavudh Powdthavee

机构 * Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI

AI总结 研究发现大语言模型在欺诈检测中表现优于人类,且在面对有动机投资者压力时未抑制欺诈预警,而人类顾问在压力下更倾向于支持欺诈投资。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19887 2026-04-23 cs.CL cs.AI 88%

Depression Risk Assessment in Social Media via Large Language Models

通过大语言模型在社交媒体上评估抑郁症风险

Giorgia Gulino, Manuel Petrucci

机构 * Guglielmo Marconi University, Department of Human Sciences(圭里莱莫·马尔科尼大学人文科学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于大语言模型的系统,通过多标签分类八种抑郁相关情绪和计算加权严重性指数,评估Reddit帖子中的抑郁症风险,实验结果显示模型在零样本设置下表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 88%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19781 2026-04-23 cs.CY cs.AI cs.CL 88%

Do Small Language Models Know When They're Wrong? Confidence-Based Cascade Scoring for Educational Assessment

小型语言模型知道它们犯错时吗?基于置信度的级联评分用于教育评估

Tyler Burleigh

机构 * PhD(博士)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过置信度评估确定级联系统中何时升级任务,发现置信度差异影响评分准确性与成本,最佳级联在降低成本和延迟的同时接近大模型性能。

Comments 12 pages, 7 figures. Accepted at NCME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19758 2026-04-23 cs.AI cs.CL cs.LG 88%

ThermoQA: A Three-Tier Benchmark for Evaluating Thermodynamic Reasoning in Large Language Models

ThermoQA:一个用于评估大语言模型热力学推理能力的三级基准测试

Kemal Düzkar

机构 * Olivenet Kyrenia, Cyprus(奥利文特基尔尼亚,塞浦路斯)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 ThermoQA通过293个热力学问题测试大语言模型的热力学推理能力,揭示记忆属性与推理能力的差异,提供开放源代码的评估工具。

Comments 17 pages, 8 figures, open-source dataset and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18596 2026-04-23 physics.soc-ph cs.GT 88%

Large language models converge on competitive rationality but diverge on cooperation across providers and generations

大语言模型在竞争理性上趋同但在合作上跨提供商和代际分化

Felipe M. Affonso

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 研究通过51906次博弈试验揭示大语言模型在竞争与协调行为上趋同,但合作行为在不同提供商和代际间显著分化,且受训练流程影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07192 2026-04-23 cs.SE 87%

Compact Constraint Encoding for LLM Code Generation: An Empirical Study of Token Economics and Constraint Compliance

紧凑约束编码用于LLM代码生成:关于令牌经济学和约束合规性的实证研究

Hanzhang Tang

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文通过实验证明紧凑约束头可减少令牌消耗而不影响约束合规性,发现编码形式和传播模式对合规率无显著影响,但约束类型和任务领域对合规性有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18787 2026-04-23 cs.SE 87%

Characterizing Datasets for LLM-based Requirements Engineering: A Systematic Mapping Study

对基于大语言模型的需求工程数据集进行表征:一项系统映射研究

Quim Motger, Carlota Catot, Xavier Franch

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文通过系统映射研究45项研究,分析62个公开数据集,揭示需求工程领域数据集在表征、任务支持和多样性方面的不平衡问题,为数据集选择与重用提供指导。

Comments Accepted at the 30th International Conference on Evaluation and Assessment in Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20211 2026-04-23 cs.SE cs.AI cs.CR 84%

Towards Secure Logging: Characterizing and Benchmarking Logging Code Security Issues with LLMs

面向安全日志:利用LLM分析和基准测试日志代码的安全问题

He Yang Yuan, Xin Wang, Kundi Yao, An Ran Chen, Zishuo Ding, Zhenhao Li

机构 * York University(约克大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) University of Waterloo(滑铁卢大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 本文通过构建包含101个真实日志安全问题报告的基准数据集,系统分析日志代码安全问题,并提出自动化框架评估LLM在检测和修复日志安全问题中的能力,发现LLM在检测方面表现中等但修复存在挑战。

Comments Accepted at FSE 2026 Research Papers Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 83%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 评测与基准 :language agent(title,abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21267 2026-04-23 cs.CL cs.CY 83%

Task-Dependent Evaluation of LLM Output Homogenization: A Taxonomy-Guided Framework

任务依赖性的大语言模型输出同质化评估:一种基于分类学的框架

Shomik Jain, Jack Lanchantin, Maximilian Nickel, Candace Ross, Karen Ullrich, Ashia Wilson, Jamelle Watson-Daniels

机构 * FAIR at Meta(Meta 的 FAIR 研究院) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于任务分类学的框架,通过任务依赖的采样技术提升输出多样性,挑战多样性与质量的权衡观念。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20087 2026-04-23 cs.CL cs.LG 82%

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19750 2026-04-23 cs.SE cs.AI cs.HC 81%

Coding with Eyes: Visual Feedback Unlocks Reliable GUI Code Generating and Debugging

通过眼睛编码:视觉反馈解锁可靠的GUI代码生成与调试

Zhilin Liu, Ye Huang, Ting Xie, Ruizhi Zhang, Wen Li, Lixin Duan

机构 * Shenzhen Institute for Advanced Study, University of Electronic Science

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出InteractGUI Bench基准和VF-Coder系统,通过视觉反馈提升GUI代码生成与调试效果,提高成功率和视觉评分。

详情

展开后加载摘要…

URL PDF HTML 收藏