arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 602 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 143 篇

2606.30062 2026-06-30 cs.CL cs.AI 89%

Little Brains, Big Feats: Exploring Compact Language Models

小脑袋,大成就:探索紧凑型语言模型

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin

机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);small language model(abstract)

AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。

Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28618 2026-06-30 cs.SE 89%

Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework

使用突变注入框架评估LLM在Java代码片段适配上的表现

Ali Aman, Muhammad Asaduzzaman, Shaowei Wang, Chanchal K. Roy

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 通过突变注入框架构建Java代码片段数据集,研究无指令条件下LLM对代码片段的适配能力,分析适配类型难度、复杂度影响及所需上下文范围。

Comments Accepted in the 42nd IEEE International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05366 2026-06-30 cs.CL cs.AI cs.LG 89%

Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models

在执行中迷失:大型语言模型在多语言环境下的工具调用鲁棒性研究

Zheng Luo, T Pranav Kutralingam, Ogochukwu N Okoani, Wanpeng Xu, Hua Wei, Xiyang Hu

机构 * University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了多语言环境下大型语言模型工具调用的鲁棒性,通过MLCL基准测试发现参数值语言不匹配是主要失败模式,尽管策略减少错误但无法恢复英语水平性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03546 2026-06-30 cs.CL cs.AI cs.HC cs.LG 89%

Value-Action Alignment in Large Language Models under Privacy-Prosocial Conflict

大语言模型在隐私与亲社会冲突下的价值-行动对齐

Guanyu Chen, Chenxiao Yu, Xiyang Hu

机构 * Arizona State University(亚利桑那州立大学) University of Southern California(南加州大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型在隐私与亲社会冲突中的价值-行动对齐,通过多组结构方程模型分析隐私关注与亲社会性对数据共享的影响,提出价值-行动对齐率(VAAR)作为评估指标。

Comments Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30085 2026-06-30 cs.CL econ.GN q-fin.EC 89%

Not-quite-human tastes: the stylized omnivorousness of LLM survey surrogates

非完全人类品味:LLM调查替代者的程式化杂食性

Xiangyu Ma, Mengmi Zhang, Shannon Ang, Minne Chen

机构 * Nanyang Technological University Singapore(新加坡南洋理工大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL

AI总结 本研究使用多个大型语言模型生成大量调查替代者,发现其品味存在系统性正向偏差、丧失真实品味结构的复杂关系,且扭曲了品味与社会空间的关联。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29815 2026-06-30 cs.CL 88%

SrDetection: A Self-Referential Framework for Data Leakage Detection in Code Large Language Models

SrDetection: 一种用于代码大型语言模型中数据泄露检测的自参考框架

Shuaimin Li, Liyang Fan, Zeyang Li, Zhuoyue Wan, Yufang Lin, Shiwen Ni, Feiteng Fang, Hamid Alinejad-Rokny, Yuanfeng Song, Kun Jing, Chen Jason Zhang, Min Yang

机构 * Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Shenzhen University(深圳大学) University of Science and Technology of China(中国科学技术大学) PolyU(香港理工大学) East China Normal University(华东师范大学) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳大学先进技术研究院人工智能研究所) University of New South Wales(新南威尔士大学) Anhui University(安徽大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 提出自参考框架SrDetection,通过对比模型对原始样本与语义等价变体的行为差异检测数据泄露,在灰盒和黑盒设置下均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11534 2026-06-30 cs.CL cs.CY 88%

Speciesism in AI: Evaluating Discrimination Against Animals in Large Language Models

人工智能中的物种歧视:评估大型语言模型对动物的歧视

Monika Jotautaitė, Lucius Caviola, David A. Brewster, Thilo Hagendorff

机构 * Independent(独立学者) University of Cambridge(剑桥大学) Harvard University(哈佛大学) University of Stuttgart(斯图加特大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究评估大型语言模型是否表现出基于物种的歧视倾向,发现其在识别物种歧视言论方面可靠但较少谴责,且在文本生成中倾向于合理化对农场动物的伤害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.02351 2026-06-30 cs.CL 88%

Generative Large Language Models in Automated Fact-Checking: A Survey

生成式大语言模型在自动事实核查中的应用:综述

Ivan Vykopal, Matúš Pikuliak, Simon Ostermann, Marián Šimko

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文综述了生成式大语言模型在自动事实核查中的作用,分析了其在事实验证、数据生成及评估中的应用,探讨了多语言和低资源环境下的挑战与趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29719 2026-06-30 cs.LG cs.CL 88%

A Diagnostic Framework and Multi-Evaluator Audit of Evaluator-Driven Preference Dynamics in Self-Adapting LLM Agents

自适应LLM代理中评估器驱动偏好动态的诊断框架与多评估器审计

Liu Zewen

机构 * Qilu Institute of Technology, School of Software Engineering(青岛理工大学软件学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC诊断框架,包含多模态偏好崩溃指数、评估器索引耦合矩阵和JS散度,通过8个实验条件揭示GPT-4o版本漂移导致评估结论反转,证明单一快照评估研究不可靠。

Comments 9 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30610 2026-06-30 cs.SE 88%

PyMETA: A Benchmark Dataset for Hierarchical Student Code Error Classification with Python-Interpreter-Based Labels

PyMETA: 基于Python解释器标签的层次化学生代码错误分类基准数据集

Chuyue Li, Ziqi Tang, Jingyi Wang, Yu Wu, Kazuma Hashimoto, Lingyu Gao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出PyMETA数据集,包含48,646份学生提交的Python代码,采用三层层次化错误分类体系,并评估了微调模型和LLM在多级分类任务上的性能。

Comments 23 pages, 15 figures, 23 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29193 2026-06-30 cs.SE cs.AI 87%

A Multi-Dataset Benchmark for Evaluating LLM Agents in Microservice Failure Diagnosis

用于评估微服务故障诊断中LLM智能体的多数据集基准

Yuanhong Cai, Xiaohui Nie, Kanglin Yin, Changhua Pei, Yongqian Sun, Shenglin Zhang, Haibin Liu, Guiyang Liu, Xidao Wen, Fang Situ, Dan Pei

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出基于推理过程评估的基准,包含两个大规模数据集(AIOps2025和RCA100),从定位、识别和原因三个维度评估智能体诊断能力,覆盖500多个专家标注的故障案例。

Comments 10 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19971 2026-06-30 cs.HC cs.AI 87%

Semantic Prompting: Agentic Incremental Narrative Refinement through Spatial Semantic Interaction

语义提示:通过空间语义交互实现代理增量叙事优化

Xuxin Tang, Ibrahim Tahmid, Eric Krokos, Kirsten Whitley, Xuan Wang, Chris North

机构 * Department of Defense(国防部)

专题命中 评测与基准 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出语义提示框架,通过感知语义交互、推理解释意图并执行定位修订,解决现有空间-文本生成中的交互修订不一致、人机意图不一致和定制粒度不足问题,提升空间精细化调整的精度和用户交互效率。

Comments 9 pages, 7 figures, accepted by ACM AVI 2026; has updated the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28362 2026-06-30 cs.IR cs.AI cs.CL cs.CY cs.DL 87%

LUMEN: Cost-Transparent Multi-Agent Pipeline for Automated Systematic Review and Meta-Analysis

LUMEN:用于自动化系统评价和荟萃分析的成本透明多智能体流水线

Yen-Hsun Huang, Yu-Shiou Lin

机构 * Department of Education, Taipei Veterans General Hospital(台北卫生成人教育科) Department of Psychiatry, Taipei Veterans General Hospital(台北卫生成人精神医学科)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出开源多智能体流水线LUMEN,自动化系统评价与荟萃分析的六个阶段,通过11个专用LLM代理和模型路由实现,首次报告端到端成本(19-29美元)并揭示阶段依赖的架构反转。

Comments 15 pages, 5 figures. Open-source implementation and cost logs available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30556 2026-06-30 cs.CL 86%

Poller: Are LLMs Suitable for Evaluating the Poetry Understanding Task?

Poller: 大型语言模型是否适合评估诗歌理解任务?

Shanshan Wang, Derek F. Wong, Jingming Yao, Lidia S. Chao

机构 * NLP CT Lab, Department of Computer and Information Science, University of Macau(计算机与信息科学系,澳门大学CT实验室) Department of Portuguese, Faculty of Arts and Humanities, University of Macau(人文学院葡萄牙语系,澳门大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出Poller方法,让LLM扮演诗人角色模拟人类评价,在八个维度上评估诗歌理解,相比基线方法将修辞技巧和陌生化评价误差分别降低94.55%和89.53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30291 2026-06-30 cs.AI 86%

PromptGNN-sim: Deep Fusion and Alignment of GNN and LLMs for Text-Attributed Graph Learning

PromptGNN-sim:GNN与LLM的深度融合与对齐用于文本属性图学习

Zhifei Hu, Alexandra I. Cristea

机构 * Durham University(杜伦大学)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.AI

AI总结 提出PromptGNN-sim框架,通过双向结构-语义融合、图注意力网络与LLM协同,解决文本属性图中模态交互浅层化问题,在跨任务、跨数据集和稀疏扰动下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29534 2026-06-30 cs.CL eess.AS 86%

Preference-ASR: A Preference-Aware Test Set for Benchmarking ASR in the Era of Speech LLMs

Preference-ASR:面向语音LLM时代的偏好感知ASR基准测试集

Nithin Rao Koluguri, Sasha Meister, Nikolay Karpov, Piotr Zelasko, Desh Raj, Jagadeesh Balam, Boris Ginsburg

机构 * NVIDIA, USA(NVIDIA美国公司)

专题命中 评测与基准 :LLM(title_cn,summary_cn);分类 cs.CL

AI总结 针对现有ASR基准无法评估模型遵循用户输出风格偏好的问题,提出Preference-ASR测试集,通过两阶段LLM辅助流程构建,涵盖归一化、实体、不流畅和大小写四类偏好指令,揭示传统评估忽略的质量差异。

Comments Accepted at Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29997 2026-06-30 cs.CV 86%

Rigel: Self-Distilled Score Adaptation for Image and Video Captioning Evaluation

Rigel: 基于自蒸馏分数自适应的图像与视频字幕评估

Shuitsu Koyama, Kazuki Matsuda, Yuiga Wada, Shinnosuke Hirano, Daichi Yashima, Komei Sugiura

机构 * Keio University(Keio大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出Rigel评估指标,通过自蒸馏从冻结LLM提取评估专用评分头,解决大词汇语言模型与小标签集不匹配问题,在视频字幕评估中超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29459 2026-06-30 cs.LG cond-mat.mtrl-sci cs.AI cs.CL 86%

Interpretable Inverse Design of Metal-Organic Frameworks with Large Language Model Agents

可解释的金属有机框架逆向设计:基于大语言模型智能体

Kyungmin Nam, Seunghee Han, Jihan Kim

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LLM4MOF框架,利用大语言模型智能体通过化学推理、候选MOF构建和模拟测试的闭环迭代,实现可解释的逆向设计,在六项任务中高效搜索高性能结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG 85%

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30116 2026-06-30 cs.AI 84%

Open Problems in Constitutional Preference Reconstruction

宪法偏好重建中的开放问题

Eleanor Clifford, Michael Amir, Arduin Findeis, Aaron Zhao, Robert Mullins

机构 * Imperial College London(帝国理工学院伦敦分校) University of Cambridge(剑桥大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);RLHF(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 针对成对偏好数据压缩为自然语言原则时存在的未定义问题,通过实证分析揭示了原则质量难测、组合歧义及模型间差异三大挑战,并提出原则细化(ICAI+)作为改进方向。

Comments 24 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29871 2026-06-30 cs.AI 84%

AI Training Manager: Bounded Closed-Loop Control of Adaptive Training Recipes

AI训练管理器:自适应训练配方的有界闭环控制

Anjali Rao, Nikhil Kamalkumar Advani

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出一种基于LLM的有界监督控制器,通过结构化遥测和约束动作空间,动态调整学习率、正则化等超参数,解决训练中的过拟合、损失不平衡等问题,在语言建模和强化学习任务中提升性能。

Comments 12 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28570 2026-06-30 cs.CV cs.AI cs.MA 84%

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG

数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架

Deep Ghosal, Ishani Sen, Wazib Ansar, Amlan Chakrabarti

机构 * A.K. Choudhury School of Information Technology University of Calcutta(A.K.楚德里信息科技学院印度加尔各答大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);language model(abstract);分类 cs.AI

AI总结 提出基于LLM的混合智能体框架,结合计算机视觉与视觉语言模型,通过3×3智能网格分块策略降低计算开销,并引入LLM-as-a-Judge自校正循环和双持久化RAG管道,实现符合印度体育局标准的自动化整体运动员评估。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.08775 2026-06-30 cs.HC cs.AI 83%

What Should We Engineer in Prompts? Training Humans in Requirement-Driven LLM Use

提示中应工程什么?基于需求驱动的LLM使用训练

Qianou Ma, Weirui Peng, Chenyang Yang, Hua Shen, Kenneth Koedinger, Tongshuang Wu

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :LLM(title,abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出ROPE框架,通过评估和训练套件帮助用户生成清晰需求,提升LLM应用构建效果。

Comments 15 pages; TOCHI 2025

Journal ref TOCHI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02380 2026-06-30 cs.CL cs.AI 82%

SPADE-Bench: Evaluating Spontaneous Strategic Deception in Agents via Plan-Action Divergence

SPADE-Bench:通过计划-行动分歧评估智能体中的自发性策略欺骗

Yuyan Bu, Haowei Li, Qirui Zheng, Bowen Dong, Kaiyue Yang, Jiaming Ji, Yingshui Tan, Wenxin Li, Yaodong Yang, Juntao Dai

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) University of Chinese Academy of Science(中国科学院大学) Alibaba Group(阿里巴巴集团)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体在工具使用中可能出现的自发性策略欺骗(计划与行动不一致),提出SPADE-Bench基准,通过结合实际工具执行和受控压力场景,严格区分欺骗与幻觉,实验证实该问题真实且紧迫。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02320 2026-06-30 cs.CL cs.AI q-bio.BM 82%

A Large-Scale Dataset for Molecular Structure-Language Description via a Rule-Regularized Method

通过规则正则化方法构建大规模分子结构-语言描述数据集

Feiyang Cai, Guijuan He, Yi Hu, Jingjing Wang, Joshua Luo, Tianyu Zhu, Srikanth Pilla, Gang Li, Ling Liu, Feng Luo

机构 * Clemson University(克莱姆森大学) Independent Researcher(独立研究者) University of Delaware(德雷克塞尔大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种全自动标注框架,生成精确分子描述,保留完整结构细节,构建了约16.3万分子-描述对数据集,验证精度达98.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28472 2026-06-30 cs.CY 82%

From Prompting to Epistemic Proactivity: Temporal Trajectories of Student-AI Interaction in Mathematics Learning

从提示到认知主动性:学生与人工智能在数学学习中的时间轨迹

Rania Abdelghani, Peter Kaiser, Kou Murayama

专题命中 评测与基准 :prompting(title);LLM(abstract,abstract_cn)

AI总结 本研究通过分析九年级学生在数学练习中与通用大语言模型的对话,发现学生与AI的互动轨迹(从早期到晚期向认知主动性的转变)能预测其无AI环境下的表现,而静态指标则不能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30479 2026-06-30 cs.NI cs.AI cs.CR cs.MA 81%

COHORT: Collaborative Orchestration for Hardening via Offensive Replay on Emulated Topologies

COHORT: 基于仿真拓扑的对抗重放硬化协同编排

Chen Frydman, Aviram Zilberman, Rubin Krief, Abed Showgan, Andres Murillo, Sekiya Motoyoshi, Asaf Shabtai, Yuval Elovici, Rami Puzis

机构 * Ben-Gurion University of The Negev(贝内-约尔大学内盖夫分校) Jerusalem College of Technology(耶路撒冷技术学院) Fujitsu(富士通)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出COHORT框架,利用多智能体LLM在GNS3仿真器上自动生成并验证企业网络缓解措施,通过对抗重放评估有效性,46.7%的缓解措施既阻断攻击又保持连通性。

Comments Submitted to Journal of Network and Computer Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30371 2026-06-30 cs.DB cs.CL 81%

MaDI-Bench: An End-to-End Data Integration Benchmark

MaDI-Bench:一个端到端数据集成基准

Aaron Steiner, Ralph Peeters, Christian Bizer

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 提出首个端到端关系表集成基准MaDI-Bench,覆盖模式匹配、值归一化、实体匹配和冲突解决全流程,并设计任务变体缓解基准饱和,通过人工、最佳组合和基于LLM的流水线验证其有效性。

Comments 14 pages, 1 figure, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29957 2026-06-30 cs.SE cs.AI 81%

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

SWE-Together:在交互式用户会话中评估编码代理

Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

机构 * Meta

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 提出SWE-Together基准,从真实用户-代理编码会话中重建多轮交互任务,并利用基于LLM的用户模拟器评估编码代理的协作能力,发现强代理成功率更高且干预更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29955 2026-06-30 cs.SE cs.AI 81%

SpreadsheetBench 2: Evaluating Agents on End-to-End Business Spreadsheet Workflows

SpreadsheetBench 2: 评估端到端商业电子表格工作流中的智能体

Jian Zhu, Yuzheng Zhang, Zeyao Ma, Bohan Zhang, Armin Schoepf, Daniel Woloch, Peter Yiliu Wang, Guangyu Robert Yang, Samuel Jacob, Siddharth Nagisetty, Abhiram Chundru, Jean Lin, Spencer Mateega, Jing Zhang

机构 * School of Information, Renmin University of China(中国人民大学信息学院) Aptura AI Shortcut AI AfterQuery

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SpreadsheetBench 2基准,覆盖生成、调试和可视化三类任务,基于真实商业数据构建,评估前沿大模型在复杂多表工作流上的表现,发现当前系统准确率低,主要瓶颈为电子表格检查不足和目标单元格选择错误。

详情

展开后加载摘要…

URL PDF HTML 收藏