arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-28 至 2026-04-28 共收录 519 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 113 篇

2503.05587 2026-04-28 cs.CL cs.AI cs.LG 82%

Quantifying and Improving the Robustness of Retrieval-Augmented Language Models Against Spurious Features in Grounding Data

量化并提升检索增强语言模型对基础数据中虚假特征的鲁棒性

Shiping Yang, Jie Wu, Wenbiao Ding, Ning Wu, Shining Liang, Ming Gong, Hongzhi Li, Hengyuan Zhang, Angel X. Chang, Dongmei Zhang

机构 * Simon Fraser University(西蒙弗雷泽大学) Microsoft(微软) Atlassian Tongji University(同济大学) The University of Hong Kong(香港大学) Canada-CIFAR AI Chair, Amii(加拿大-CIFAR人工智能主席,Amii)

专题命中 评测与基准 :language model(title);LLM(abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究检索增强语言模型对基础数据中虚假特征的鲁棒性问题,提出SURE框架用于量化和提升鲁棒性,分析虚假特征在RAG领域的广泛性与挑战性。

Comments ACL 2026 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24525 2026-04-28 cs.SE cs.AI 81%

Understanding the Limits of Automated Evaluation for Code Review Bots in Practice

理解自动化代码审查机器人在实践中评估的极限

Veli Karakaya, Utku Boran Torun, Baykal Mehmet Uçar, Eray Tüzün

机构 * Bilkent University(比尔肯特大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究探讨了在工业环境中自动化评估LLM驱动的代码审查机器人评论的可行性及限制,发现不同模型和评估方法在与人类标签的一致性上表现不一,揭示了静态 artifacts 难以捕捉上下文约束和优先级决策的挑战。

Comments The first two authors contributed equally. Accepted to EASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24519 2026-04-28 cs.CY cs.AI cs.HC 81%

Why AI Harms Can't Be Fixed One Identity at a Time: What 5300 Incident Reports Reveal About Intersectionality

为何AI伤害无法逐个身份类别修复:5300份事件报告揭示的交叉性

Edyta Bogucka, Sanja Šćepanović, Daniele Quercia

机构 * Nokia Bell Labs(诺基亚贝尔实验室) University of Oxford(牛津大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过分析5300份AI事件报告,揭示AI伤害并非单一身份类别导致,交叉性身份类别如青少年女孩、低收入有色人种等会放大伤害,强调交叉性在AI风险评估中的重要性。

Comments 29 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24052 2026-04-28 cs.CV cs.AI 81%

QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

QEVA:一种基于多模态问答的无参考视频文本摘要评估指标

Woojun Jung, Junyeong Kim

机构 * Department of Artificial Intelligence, Chung-Ang University(Chung-Ang大学人工智能系)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出QEVA,一种无参考视频摘要评估指标,通过多模态问答直接评估候选摘要与源视频,从覆盖性、事实性和时间顺序三个维度进行评估,引入MLVU(VS)-Eval基准数据集,实验表明QEVA与人类判断的关联性更高。

Comments Accepted to Findings of EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22843 2026-04-28 cs.IR cs.AI 81%

Structure Guided Retrieval-Augmented Generation for Factual Queries

结构引导的检索增强生成用于事实查询

Miao Xie, Xiao Zhang, Yi Li, Chunli Lv

机构 * College of Information and Electrical Engineering, China Agricultural University, China(中国农业大学信息与电气工程学院) College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Key Laboratory of Agricultural Informatization Standardization, Ministry of Agriculture and Rural Affairs, China(农业信息化标准化 key laboratory, 农业农村部)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出结构引导的检索增强生成(SG-RAG),通过嵌入式子图匹配解决事实查询中的精确检索问题,实验表明其在ERQA数据集上性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16518 2026-04-28 cs.CL cs.AI 81%

CUB: Benchmarking Context Utilisation Techniques for Language Models

CUB:语言模型上下文利用技术的基准测试

Lovisa Hagström, Youna Kim, Haeun Yu, Sang-goo Lee, Richard Johansson, Hyunsoo Cho, Isabelle Augenstein

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学) Seoul National University(首尔国立大学) University of Copenhagen(哥本哈根大学) Ewha Womans University(成均馆大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出CUB基准,用于评估语言模型在不同噪声上下文下的上下文利用技术,发现现有方法在真实场景中存在不足,需更全面的测试。

Comments Accepted at ACL 2026, 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24184 2026-04-28 cs.CR 80%

Dynamic Cyber Ranges

动态网络攻防范围

Víctor Mayoral-Vilches, María Sanz-Gómez, Francesco Balassone, Maite Del Mundo De Torres, George Nicolaou, Samuel Rodriguez Borines, Almerindo Graziano, Paul Zabalegui, Endika Gil-Uriarte

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出动态网络攻防范围,通过LLM驱动的防御代理提升网络安全评估效果,减少攻击成功率,展现其在不同配置下的防护能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23515 2026-04-28 stat.CO 80%

ragR: Retrieval-Augmented Generation and RAG Assessment in R

ragR: R中检索增强生成与RAG评估

Muhammad Aimal Rehman, Zhili Lu, Chi-Kuang Yeh

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 ragR是首个在R中集成RAG系统构建与评估的框架,提供文档处理、嵌入存储、相似性检索、生成及RAGAS评估功能,支持四种核心指标评估。

Comments Preprint. Code available at the GitHub repository listed in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23153 2026-04-28 cs.NI cs.SE 80%

RANalyzer: Automated Continuous RAN Software Evaluation and Regression Analysis

RANalyzer:自动化连续RAN软件评估与回归分析

Ravis Shirkhani, Reshma Prasad, Leonardo Bonati, Tommaso Melodia, Michele Polese

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出RANalyzer框架,通过结合LLM语义提取与残差分析,量化软件更新对性能的影响,利用大规模测试数据识别代码变更导致的性能退化并实现自动化评估。

Comments 9 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29928 2026-04-28 cs.AI 79%

ScoringBench: A Benchmark for Evaluating Tabular Foundation Models with Proper Scoring Rules

ScoringBench:一个评估表格基础模型的基准,采用适当的评分规则

Jonas Landsgesell, Pascal Knoll, Tizian Wenzel

机构 * University of Stuttgart(斯图加特大学) Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 ScoringBench通过多种适当评分规则评估表格回归模型,揭示了不同评分规则对模型排名的影响,强调了评分选择对模型部署的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23767 2026-04-28 cs.LG 79%

WISE-FM:Operation-Aware, Engineering-Informed Foundation Model for Multi-Task Well Design

WISE-FM:面向多任务井设计的多任务基础模型

Carine de Menezes Rebello, Anderson Rapello dos Santos, Idelfonso B. R. Nogueira

机构 * Department of Chemical Engineering, Norwegian University of Science and Technology (NTNU)(挪威科学技术大学化学工程系)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出WISE-FM,一种结合设计意识、物理约束和多任务学习的多任务模型,用于提升井设计预测精度与完整性监控能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02629 2026-04-28 cs.CL 79%

Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models

上下文利用的高亮解释评估框架

Jingyi Sun, Pepa Atanasova, Sagnik Ray Choudhury, Sekh Mainul Islam, Isabelle Augenstein

机构 * University of Copenhagen(哥本哈根大学) University of North Texas(北卡罗来纳州立大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文提出首个高亮解释评估框架,用于评估语言模型中上下文利用的解释有效性,通过可控测试案例验证了MechLight在不同场景中的优越性,发现现有方法在长上下文和位置偏倚上存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23235 2026-04-28 cs.CL 79%

Measuring Temporal Linguistic Emergence in Diffusion Language Models

在扩散语言模型中测量时间语言涌现

Harry Lu

机构 * School of Mathematics, University of Minnesota, Minneapolis MN, United States(明尼苏达大学数学系,明尼苏达州明尼阿波利斯)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究通过分析LLaDA-8B-Base在WikiText-103上的生成轨迹,探讨不同信息在生成过程中的测量时间,发现内容类别比功能密集类别更早稳定,粗略语义标签比精确词法身份更易线性恢复,中段轨迹状态最易受干扰。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23051 2026-04-28 cs.CL 79%

Evaluating Temporal Consistency in Multi-Turn Language Models

评估多轮语言模型中的时间一致性

Yash Kumar Atri, Steven L. Johnson, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 研究多轮对话中语言模型维持和更新时间假设的能力,提出ChronoScope基准测试集,发现模型在长对话中时间一致性常被破坏,揭示单轮事实准确与序列交互中时间推理的差距。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22822 2026-04-28 cs.CV cs.AI 79%

DO-Bench: An Attributable Benchmark for Diagnosing Object Hallucination in Vision-Language Models

DO-Bench: 一种用于诊断视觉语言模型中物体幻觉的可归因基准

JiYang Wang, Jiawei Chen, Mengqi Xiao, Yu Cheng, Yangfu Li, Zhaoxia Yin

机构 * Shanghai Key Laboratory of Multidimensional Information Processing, East China Normal University(多维信息处理上海市重点实验室,东华大学) Zhongguancun Academy(中关村学院)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出DO-Bench,通过结构化多模态干预隔离错误来源,评估模型对文本先验和感知能力的鲁棒性,揭示物体幻觉的异质性失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23706 2026-04-28 cs.CV 78%

Weakly Supervised Multicenter Nancy Index Scoring in Ulcerative Colitis Using Foundation Models

基于基础模型的弱监督多实例学习在溃疡性结肠炎中进行Nancy指数评分

Adam Kukučka, Ondřej Fabián, Vít Musil, Tomáš Brázdil

机构 * Masaryk University, Faculty of Informatics, Brno, Czech Republic(马萨里克大学信息学院,布拉格,捷克共和国) Institute of Clinical and Experimental Medicine, Prague, Czech Republic(临床与实验医学研究所,布拉格,捷克共和国)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出一种弱监督多实例学习方法,利用基础模型对全切片图像进行自动评分,实现Nancy指数五级预测,验证了基础模型在多中心数据中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22829 2026-04-28 cs.CV 78%

Lost in the Vibrations: Vision Language Models Fail the Dynamic Gauges Test

迷失在振动中:视觉语言模型在动态刻度测试中失败

Tairan Fu, Francisco Javier Santos-Martín, Javier Conde, Pedro Reviriego, Elena Merino-Gómez

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文评估了最新视觉语言模型在动态刻度测试中的表现,发现其在分析高频事件和指针振动方面存在不足,无法满足计量学和不确定性量化的要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23897 2026-04-28 cs.AI econ.GN q-fin.EC 77%

MarketBench: Evaluating AI Agents as Market Participants

MarketBench:评估AI代理作为市场参与者

Andrey Fradkin, Rohit Krishnan

机构 * Boston University and the MIT Initiative on the Digital Economy(波士顿大学和MIT数字经济倡议)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文提出MarketBench基准,评估AI代理在市场中的自我评估能力与成本感知,通过软件工程基准和LLM实验发现自我校准不足,但补充信息后有所改善。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07538 2026-04-28 cs.CL 77%

SwissGov-RSD: A Human-annotated, Cross-lingual Benchmark for Token-level Recognition of Semantic Differences Between Related Documents

SwissGov-RSD: 一个人工标注的、跨语言基准,用于识别相关文档之间的词级语义差异

Michelle Wastl, Jannis Vamvas, Rico Sennrich

机构 * Department of Computational Linguistics, University of Zurich(瑞士苏黎世大学计算语言学系)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SwissGov-RSD,首个跨语言文档级语义差异识别基准,包含224个多语言文档,通过人工标注词级差异,评估多种模型表现,揭示自动方法在跨语言任务中的不足。

Comments 30 pages; v3 accepted to ACL Main (camera-ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24645 2026-04-28 cs.CL cs.AI 73%

K-MetBench: A Multi-Dimensional Benchmark for Fine-Grained Evaluation of Expert Reasoning, Locality, and Multimodality in Meteorology

K-MetBench:一个多维基准,用于细粒度评估气象学中的专家推理、局部性和多模态能力

Soyeon Kim, Cheongwoong Kang, Myeongjin Lee, Eun-Chul Chang, Jaedeok Lee, Jaesik Choi

机构 * KAIST(韩国科学技术院) INEEJI Kongju National University(康久国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出K-MetBench,一个基于韩国资格考试的多维基准,揭示了专家推理、逻辑有效性、韩国地理文化理解及领域分析四个维度的差距,发现韩国模型在本地情境中优于大模型。

Comments 39 pages, 32 figures, 14 tables, including appendices. Accepted to Findings of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22934 2026-04-28 cs.AI cs.CL 73%

PExA: Parallel Exploration Agent for Complex Text-to-SQL

PExA:复杂文本到SQL的并行探索代理

Tanmay Parekh, Ella Hofmann-Coyle, Shuyi Wang, Sachith Sri Ram Kothur, Srivas Prasad, Yunmo Chen

机构 * University of California Los Angeles(加州大学洛杉矶分校) Bloomberg(彭博)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PExA,通过软件测试覆盖视角解决文本到SQL的延迟与性能权衡问题,通过并行执行测试用例确保语义覆盖,最终生成准确的SQL。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18398 2026-04-28 cs.CL cs.AI 73%

AlphaContext: An Evolutionary Tree-based Psychometric Context Generator for Creativity Assessment

AlphaContext:一种基于进化树的心理测量情境生成器用于创造力评估

Yixuan Wang, Yue Huang, Hong Qian, Yunzhao Wei, Yifei Ding, Wenkai Wang, Zhi Liu, Zhongjing Huang, Aimin Zhou, Jiajun Guo

机构 * East China Normal University(东华大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 AlphaContext通过进化树方法生成高质量的情境,提升创造力评估的准确性与多样性,实验显示在六个质量指标上平均提升8%。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24461 2026-04-28 cs.HC cs.AI 70%

Measuring Successful Cooperation in Human-AI Teamwork: Development and Validation of the Perceived Cooperativity and Teaming Perception Scales

在人类-人工智能协作中测量成功协作:感知协作性与团队感知量表的开发与验证

Christiane Attig, Christiane Wiebel-Herboth, Patricia Wollstadt, Tim Schrills, Mourad Zoubir, Thomas Franke

机构 * Honda Research Institute Europe GmbH(本田欧洲研究院) Institute of Human-Centered Interactive Systems(人机交互系统研究所) University of Lübeck(吕贝克大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文开发并验证了感知协作性量表和团队感知量表,用于评估人类-人工智能协作的主观质量,通过三个研究验证了量表的有效性和构造效度。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24376 2026-04-28 cs.CL 70%

Learning Evidence of Depression Symptoms via Prompt Induction

通过提示诱导学习抑郁症症状证据

Eliseo Bao, Anxo Perez, David Otero, Javier Parapar

机构 * IRLab, CITIC, Universidade da Coruña(IR实验室、CITIC、科鲁纳大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过提示诱导学习方法,针对21种抑郁症症状进行细粒度分类,提出Symptom Induction方法,在BDI-Sen数据集上取得最佳F1分数,并在跨领域评估中展示出良好的泛化能力。

Comments Accepted at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24071 2026-04-28 cs.CL 70%

PeeriScope: A Multi-Faceted Framework for Evaluating Peer Review Quality

PeeriScope:一个多维度评估同行评审质量的框架

Sajad Ebrahimi, Soroush Sadeghian, Ali Ghorbanpour, Negar Arabzadeh, Sara Salamat, Seyed Mohammad Hosseini, Hai Son Le, Mahdi Bashari, Ebrahim Bagheri

机构 * Reviewerly, University of Toronto(Reviewerly大学多伦多分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出PeeriScope框架,整合结构化特征、基于评分表的大语言模型评估和监督预测,用于多维度评估同行评审质量,支持开放接口和API部署,可用于评审自评、编辑筛选和大规模审计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23815 2026-04-28 cs.CL 70%

DRACULA: Hunting for the Actions Users Want Deep Research Agents to Execute

DRACULA:寻找用户想要的行动深度研究代理执行研究

Nishant Balepur, Malachi Hamada, Varsha Kishore, Sergey Feldman, Amanpreet Singh, Pao Siangliulue, Joseph Chee Chang, Rachel Rudinger, Eunsol Choi, Jordan Lee Boyd-Graber, Doug Downey, Aakanksha Naik

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Allen Institute for Artificial Intelligence (Ai2)(人工智能研究院(Ai2))

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 DRACULA通过收集用户对中间行动的反馈,研究深度研究代理如何预测用户偏好行动,揭示了行动选择的可预测性及用户目标对行动执行的影响。

Comments In-progress Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23581 2026-04-28 cs.SE cs.CL 70%

AgentEval: DAG-Structured Step-Level Evaluation for Agentic Workflows with Error Propagation Tracking

AgentEval: 基于DAG结构的步骤级评估用于具有错误传播跟踪的代理工作流

Dongxin Guo, Jikun Wu, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学) Stellaris AI Limited(Stellaris AI有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 AgentEval通过构建评估有向无环图,实现对代理工作流中错误传播的精准追踪,提升故障检测召回率和根本原因准确性,适用于生产环境中的代理系统评估。

Comments Accepted at ACL 2026 Industry Track. 14 pages, 3 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23580 2026-04-28 cs.RO cs.AI 70%

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

PhysCodeBench: 通过自校正多代理细化进行3D场景的物理感知符号模拟基准测试

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi

机构 * Nanjing University(南京大学) Skywork AI Jilin University(吉林大学) JIUTIAN Research(JIUTIAN研究院) Tianjin University(天津大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PhysCodeBench,首个评估物理感知符号模拟的基准,包含700个手动构建的样本,通过自校正多代理框架SMRF实现67.7分的性能,优于现有模型31.4分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21277 2026-04-28 cs.AI 70%

Can MLLMs "Read" What is Missing?

LLMs能否

Jindi Guo, Chaozheng Huang, Xi Fang

机构 * DP Technology(DP技术)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 MMTR-Bench评估多模态大语言模型从视觉上下文直接重建遮蔽文本的能力,通过单页或多页输入测试,聚焦布局理解、视觉关联和知识整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17745 2026-04-28 cs.CL 70%

HiRAS: A Hierarchical Multi-Agent Framework for Paper-to-Code Generation and Execution

HiRAS:一种用于论文到代码生成与执行的分层多智能体框架

Hanhua Hong, Yizhi LI, Jiaoyan Chen, Sophia Ananiadou, Xiaoli Li, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(信息与通信研究所(I²R),A*STAR) ELLIS Manchester(曼彻斯特ELLIS) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出HiRAS,一种分层多智能体框架,通过监督管理智能体协调专业智能体完成端到端实验复现,改进了Paper2Code基准的评估方法,并验证了方法的有效性和鲁棒性。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏