arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 265 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 76 篇

2604.28093 2026-05-01 cs.AI 70%

What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design

什么样的终端-智能体基准任务是好的:为对抗性、困难和可理解的评估设计提供指南

Ivan Bercovich

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了如何设计有效的终端-智能体基准任务,指出任务应具备对抗性、难度和可理解性,以避免常见的失败模式,并通过实证证据表明超过15%的基准任务存在奖励可 hack 的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28039 2026-05-01 cs.AI 70%

SpecVQA: A Benchmark for Spectral Understanding and Visual Question Answering in Scientific Images

SpecVQA:一种用于科学图像光谱理解和视觉问答的基准测试

Jialu Shen, Han Lyu, Suyang Zhong, Hanzheng Li, Haoyi Tao, Nan Wang, Changhong Chen, Xi Fang

机构 * DP Technology(DP技术)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SpecVQA通过7种典型光谱类型和专家标注的问答对,评估多模态模型在科学光谱理解中的能力,提出光谱数据采样与插值重建方法,提升模型在科学光谱理解中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27820 2026-05-01 cs.AI cs.DB cs.IR cs.MA 70%

ObjectGraph: From Document Injection to Knowledge Traversal -- A Native File Format for the Agentic Era

ObjectGraph:从文档注入到知识遍历——面向代理时代的原生文件格式

Mohit Dubey, Open Gigantic

机构 * Open Gigantic(开放巨型)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ObjectGraph文件格式,通过将文档视为类型化有向知识图谱而非文本字符串,解决代理任务中文档处理的效率与准确性问题,实现95.3%的token减少和98.7%的内容保留。

Comments 12 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17765 2026-05-01 q-bio.QM cs.AI cs.CV 70%

Grounded Multimodal Retrieval-Augmented Drafting of Radiology Impressions Using Case-Based Similarity Search

基于案例相似性搜索的医学影像印象 grounded 多模态检索增强草稿生成

Himadri S Samanta

机构 * Independent AI Researcher(独立AI研究员)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种多模态检索增强生成系统,结合对比图像-文本嵌入、基于案例的相似性检索和引用约束草稿生成,以生成具有临床依据的医学影像印象。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08611 2026-05-01 cs.IR cs.AI cs.CV cs.MM 70%

VeriTaS: The First Dynamic Benchmark for Multimodal Automated Fact-Checking

VeriTaS:首个动态多模态自动事实核查基准

Mark Rothermel, Marcus Kornmann, Marcus Rohrbach, Anna Rohrbach

机构 * Multimodal AI Lab(多模态AI实验室) Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 为应对在线虚假信息的扩大规模,本文提出VeriTaS动态基准,通过自动化流程持续更新,涵盖104个专业机构的25000个真实声明,支持多模态事实核查评估。

Comments ACL 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27725 2026-05-01 cs.HC cs.AI 70%

AgentEconomist: An End-to-end Agentic System Translating Economic Intuitions into Executable Computational Experiments

AgentEconomist:一个端到端的代理系统,将经济直觉转化为可执行的计算实验

Jiaju Chen, Jinghua Piao, Xia Xu, Songwei Li, Tong Xia, Xiangnan He, Yong Li

机构 * Zhongguancun Academy(中关村学院) University of Science and Technology of China(中国科学技术大学) Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentEconomist通过模块化多阶段架构,将经济直觉转化为可执行的计算实验,通过文献基础假设生成、实验设计和执行阶段,结合人类与AI协作,提升研究创新性与文献相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27464 2026-05-01 cs.CR cs.AI 70%

Security Attack and Defense Strategies for Autonomous Agent Frameworks: A Layered Review with OpenClaw as a Case Study

自主代理框架的安全攻击与防御策略:以OpenClaw为案例的分层综述

Luyao Xu, Xiang Chen

机构 * School of Artificial Intelligence and Computer Science, Nantong University(人工智能与计算机科学学院,南通大学) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分层分析探讨自主代理框架的安全风险与防御策略,以OpenClaw为案例,揭示威胁跨层传播的可能性及未来研究方向。

Comments 14 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26981 2026-05-01 cs.IR cs.LG 70%

Budget-Constrained Online Retrieval-Augmented Generation: The Chunk-as-a-Service Model

预算约束下的在线检索增强生成:块即服务模型

Shawqi Al-Maliki, Ammar Gharaibeh, Mohamed Rahouti, Mohammad Ruhul Amin, Mohamed Abdallah, Junaid Qadir, Ala Al-Fuqaha

机构 * Information and Computing Technology (ICT) Division, College of Science and Engineering, Hamad Bin Khalifa University(信息与计算技术系(ICT), 科学与工程学院, 哈马德·本·卡西姆大学) School of Electrical Engineering and Information Technology, German Jordanian University(电气工程与信息科技学院, 德国约旦大学) Department of Computer and Information Sciences, Fordham University(计算机与信息科学系, 芙兰克大学) Department of Computer Science and Engineering, College of Engineering, Qatar University(计算机科学与工程系, 工程学院, 卡塔尔大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出块即服务模型,通过在线选择算法提升检索增强生成的透明性和成本效益,实验显示其在性能和预算利用上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24564 2026-05-01 cs.CL cs.IR cs.IT math.IT 70%

MEG-RAG: Quantifying Multi-modal Evidence Grounding for Evidence Selection in RAG

MEG-RAG: 多模态证据 grounding 的量化研究以提升 RAG 中的证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Quan Z. Sheng, Lina Yao

机构 * Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(巴黎- Rocquencourt 国家信息与自动化研究所) Rajiv Gandhi University(拉吉夫·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒尔研究实验室) Zhejiang University(浙江大学) Peking University(北京大学) University of New South Wales(新南威尔士大学) Macquarie University(麦考瑞大学) CSIRO’s Data61(CSIRO 数据61)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 MEG-RAG 框架,通过语义感知的多模态证据 grounding 方法提升 RAG 中的证据选择准确性与多模态一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13024 2026-05-01 cs.CL 70%

WebMall -- A Multi-Shop Benchmark for Evaluating Web Agents

WebMall -- 多店铺评估网络代理的基准

Ralph Peeters, Aaron Steiner, Luca Schwarz, Julian Yuya Caspary, Christian Bizer

机构 * Data and Web Science Group(数据与网络科学组) University of Mannheim(曼海姆大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 WebMall是首个多店铺离线基准,用于评估网络代理在复杂比较购物任务中的性能,包含四个模拟店铺和复杂检索任务。

Comments Accepted for publication at SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12022 2026-05-01 cs.AI 70%

AI Models for Depressive Disorder Detection and Diagnosis: A Review

用于抑郁症检测和诊断的AI模型:综述

Dorsa Macky Aleagha, Payam Zohari, Mostafa Haghir Chehreghani

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文综述了55项研究中的最新AI方法,提出层次分类体系,揭示图神经网络、大语言模型和多模态融合三大趋势,提供数据集和评估指标,为计算精神病学未来创新提供路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27600 2026-05-01 cs.IR 67%

Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG

净化多模态检索:用于RAG的片段级证据选择

Xihang Wang, Zihan Wang, Chengkai Huang, Cao Liu, Ke Zeng, Quan Z. Sheng, Lina Yao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出FES-RAG框架,通过片段级证据选择提升多模态检索效果,减少噪声干扰,实验显示在M2RAG基准上性能提升27%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27366 2026-05-01 cs.CV 67%

Judge, Then Drive: A Critic-Centric Vision Language Action Framework for Autonomous Driving

评判,然后驾驶:一种以评判为中心的视觉语言动作框架用于自动驾驶

Lijin Yang, Jianing Huang, Zhongzhan Huang, Shu Liu, Hao Yang

机构 * Bosch Research(博世研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出CriticVLA框架,通过多模态评估和单步优化提升自动驾驶决策质量,实验显示其在复杂场景中性能显著优于现有方法。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27148 2026-05-01 cs.SE 67%

CI-Repair-Bench: A Repository-Aware Benchmark for Automated Patch Validation via CI Workflows

CI-Repair-Bench:基于CI工作流的自动化补丁验证仓库意识基准

Rabeya Khatun Muna, Md Nakhla Rafi, Tse-Hsun, Chen

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 CI-Repair-Bench通过真实GitHub Actions执行构建,提供仓库级程序修复基准,包含567个CI失败实例,细粒度评估12种CI错误类型,揭示自动化修复在局部和工具强制失败上效果最佳,但环境依赖等问题仍具挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26971 2026-05-01 cs.IR 67%

T2S-Metrics: Unified Library for Evaluating SPARQL Queries Generated From Natural Language

T2S-Metrics: 用于评估从自然语言生成的SPARQL查询的统一库

Yousouf Taghzouti, Tao Jiang, Camille Juigné, Benjamin Navet, Fabien Gandon, Franck Michel, Louis-Felix Nothias

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出t2s-metrics,一个开源且可扩展的统一评估库,提供超过20种评估指标,涵盖词汇、语法、语义、结构、执行和排名维度,旨在系统化评估基于SPARQL的问答系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.12844 2026-05-01 cs.CV 67%

GuideDog: A Real-World Egocentric Multimodal Dataset for Blind and Low-Vision Accessibility-Aware Guidance

GuideDog: 一种用于视障和低视力者无障碍引导的现实世界单人视角多模态数据集

Junhyeok Kim, Jaewoo Park, Junhee Park, Sangeyl Lee, Jiwan Chung, Jisung Kim, Ji Hoon Joung, Youngjae Yu

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究所) Euler Robotics(Euler机器人) Seoul National University(首尔国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出GuideDog数据集,包含22K图像描述对,用于提升视障者导航能力,通过人机协同标注提升数据质量,并展示深度感知评估基准,揭示当前多模态大语言模型在深度感知方面的挑战。

Comments ACL 2026 Main. Project page: https://jun297.github.io/GuideDog/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18239 2026-05-01 q-bio.QM cs.CL cs.LG 62%

Impact of automatic speech recognition quality on Alzheimer's disease detection from spontaneous speech: a reproducible benchmark study with lexical modeling and statistical validation

自动语音识别质量对自发语音中阿尔茨海默病检测的影响:基于词汇建模和统计验证的可重复基准研究

Himadri S Samanta

机构 * Independent Researcher, Austin, Texas, USA(独立研究者,得克萨斯州奥斯汀)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文研究了自动语音识别质量对阿尔茨海默病检测的影响,通过词汇特征和统计验证,发现高质量ASR可提升分类性能,强调ASR选择在临床语音AI系统中的关键作用。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27865 2026-05-01 cs.AI 57%

KellyBench: A Benchmark for Long-Horizon Sequential Decision Making

KellyBench:一个用于长周期序列决策制定的基准测试

Thomas Grady, Kip Parker, Iliyan Zarov, Henry Course, Chengxi Taylor, Ross Taylor

机构 * General Reasoning, Inc.(通用推理公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出KellyBench,用于评估体育博彩市场中的序列决策制定。研究发现前沿模型在赛季中平均亏损,且人类基准表现更优,提示改进空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07703 2026-05-01 cs.CV cs.LG 57%

PVeRA: Probabilistic Vector-Based Random Matrix Adaptation

PVeRA:基于概率向量的随机矩阵适应

Leo Fillioux, Enzo Ferrante, Paul-Henry Cournède, Maria Vakalopoulou, Stergios Christodoulidis

机构 * IHU PRISM, National Center for Precision Medicine in Oncology, Gustave Roussy(IHU PRISM,国家精准医学肿瘤中心,古斯塔夫·罗斯-伊实验室) Institute of Computer Sciences, CONICET, Universidad de Buenos Aires(计算机科学研究所,CONICET,布宜诺斯艾利斯大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文提出PVeRA,一种基于概率的随机矩阵适应方法,通过概率方式修改VeRA中的低秩矩阵,提升模型在输入模糊性和不同采样配置下的适应能力,实验显示其在VTAB-1k基准上优于其他适配器。

Journal ref WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27543 2026-05-01 cs.CL 57%

AppTek Call-Center Dialogues: A Multi-Accent Long-Form Benchmark for English ASR

AppTek 电话客服对话:一种多口音长形式评估基准用于英语语音识别

Eugen Beck, Sarah Beranek, Uma Moothiringote, Daniel Mann, Wilfried Michel, Katie Nguyen, Taylor Tragemann

机构 * ANONYMIZED-ORG-NAME(匿名机构)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 本文提出AppTek电话客服对话数据集,用于评估英语语音识别系统在不同口音下的性能,揭示了不同口音和分段方法对识别效果的影响。

Comments Submitted to INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26986 2026-05-01 cs.CL 57%

BatteryPass-12K: The First Dataset for the Novel Digital Battery Passport Conformance Task

BatteryPass-12K:首个数字电池护照符合性任务数据集

Tosin Adewumi, Martin Karlsson, Lama Alkhaled, Marcus Liwicki

机构 * Machine Learning Group, EISLAB(机器学习组,EISLAB) Research Center for Advanced Battery Technology(先进电池技术研究中心) Luleå University of Technology(吕勒奥理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文介绍了首个数字电池护照符合性任务数据集BatteryPass-12K,评估了22种语言模型在零样本推理中的表现,发现思考模型性能最佳,少样本示例显著提升性能,且参数规模扩大并不必然提升性能。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28115 2026-05-01 cs.RO cs.CV 50%

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

FreeOcc: 无需训练的具身开放词汇占用预测

Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI

专题命中 评测与基准 :language model(abstract)

AI总结 FreeOcc通过四层流程实现无需3D标注的开放词汇占用预测,相比传统方法在EmbodiedOcc-ScanNet上提升IoU和mIoU超过2倍,并引入ReplicaOcc基准测试新环境性能。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27974 2026-05-01 cs.CV cs.DB 50%

FineState-Bench: Benchmarking State-Conditioned Grounding for Fine-grained GUI State Setting

FineState-Bench:面向细粒度GUI状态设置的状态条件化基准测试

Fengxian Ji, Jingpu Yang, Zirui Song, Yuanxi Wang, Zhexuan Cui, Yuke Li, Qian Jiang, Xiuying Chen

机构 * MBZUAI, United Arab Emirates(阿联酋MBZUAI研究院) Northeastern University, China(中国东北大学)

专题命中 评测与基准 :language model(abstract)

AI总结 FineState-Bench通过精确目标状态评估,检验智能体能否正确映射指令至UI控件,提出FineState-Metrics与VDA诊断工具,实验显示视觉接地仍有提升空间,但整体准确率不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27889 2026-05-01 cs.CV 50%

Noise2Map: End-to-End Diffusion Model for Semantic Segmentation and Change Detection

Noise2Map: 语义分割与变化检测的端到端扩散模型

Ali Shibli, Andrea Nascetti, Yifang Ban

机构 * Division of Geoinformatics, School of Architecture and Built Environment, KTH Royal Institute of Technology(地理信息学系,建筑与环境学院,皇家理工学院)

专题命中 评测与基准 :pretraining(abstract)

AI总结 本文提出Noise2Map模型,通过扩散模型的去噪过程实现端到端的语义分割和变化检测,结合任务特定的噪声调度和时间步条件,提升模型的可解释性和鲁棒性。

URL PDF HTML 收藏

2. 效率与部署 49 篇

2604.27789 2026-05-01 cs.SE cs.AI 92%

Test Before You Deploy: Governing Updates in the LLM Supply Chain

部署前测试:在LLM供应链中管理更新

Mohd Sameen Chishti, Damilare Peter Oyinloye, Jingyue Li

机构 * Department of Computer Science(计算机科学系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 本文提出了一种部署侧治理框架,通过定义模型行为规则、按部署风险分类的测试套件和兼容性门禁来管理LLM更新,解决模型演变中的兼容性问题。

Comments 4 pages, 1 figure, accepted to The 2nd International Workshop on Large Language Model Supply Chain Analysis (LLMSC2026) co-located with FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27082 2026-05-01 cs.AI cs.LG cs.SE 92%

When Your LLM Reaches End-of-Life: A Framework for Confident Model Migration in Production Systems

当你的LLM到达生命周期终点时:一种在生产系统中自信模型迁移的框架

Emma Casey, David Roberts, David Sim, Ian Beaver

机构 * Verint Systems Inc(Verint系统公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种框架,用于在底层模型生命周期终点或需替换时迁移生产基于大型语言模型(LLM)的系统。核心贡献是通过贝叶斯统计方法校准自动评估指标与人类判断,即使手动评估数据有限也能实现自信的模型比较。

Comments 12 pages with appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28056 2026-05-01 cs.AI 92%

RHyVE: Competence-Aware Verification and Phase-Aware Deployment for LLM-Generated Reward Hypotheses

RHyVE:基于能力的验证与阶段感知部署用于LLM生成的奖励假说

Feiyu Wu, Xu Zheng, Zhuocheng Wang, Yi ming Dai, Hui Li

机构 * School of Cyber Engineering, Xidian University(西安电子科技大学电子工程学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究提出RHyVE框架,通过能力感知验证和阶段感知部署提升LLM生成奖励假说的可靠性,实验显示在低能力阶段奖励排名不可靠,但经过任务依赖阈值后变得有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19221 2026-05-01 cs.AI cs.SD eess.AS 92%

UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction

UAF:面向全双工语音交互的统一音频前端LLM

Yadong Li, Guoxin Wu, Haiping Hou, Biye Li

机构 * Alibaba Inc.(阿里巴巴公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出UAF,一种统一音频前端LLM,通过将多种语音前端任务统一为序列预测问题,提升全双工语音交互的响应速度和中断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27384 2026-05-01 cs.AR 91%

RCW-CIM: A Digital CIM-based LLM Accelerator with Read-Compute/Write

RCW-CIM: 一种基于数字计算-in-内存的LLM加速器及读-计算/写架构

Yan-Cheng Guo, Tian-Sheuan Chang, Jian-Wei Su

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出RCW-CIM架构,通过减少权重更新延迟和非线性操作融合,实现LLM加速,使Llama2-7B模型解码延迟降低21.59%,并提升能效。

Comments accepted in ISCAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10140 2026-05-01 cs.SE cs.AI cs.MA 91%

Can Large Language Models Implement Agent-Based Models? An ODD-based Replication Study

大型语言模型能否实现基于主体的模型?基于ODD的复制研究

Nuno Fachada, Daniel Fernandes, Carlos M. Fernandes, João P. Matos-Carvalho

机构 * Lusófona University(卢塞佛纳大学) INESC INOV-Lab(INESC INOV实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文评估17种LLM在ODD到代码转换任务中的表现,探讨LLM能否可靠实现基于主体的模型并支持复制、验证与验证。

Comments The peer-reviewed version of this paper is published in Ecological Modelling at https://doi.org/10.1016/j.ecolmodel.2026.111624. This version is typeset by the author and differs only in pagination and typographical detail

Journal ref Ecological Modelling, 517, 111624, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏