arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.11669 2026-08-13 cs.LG cs.AI cs.CL 新提交 75%

Rubric Dropout: A Simple Way to Mitigate Reward Hacking in Rubric-as-Reward RL

规则丢弃(Rubric Dropout):缓解以规则为奖励的强化学习中奖励黑客行为的简单方法

Minglai Yang, Xinyu Guo, Utkarsh Tyagi, Mian Zhang, Razvan Dumitru, Sunjie Hou, Yunzhong He, Daniel Yue Zhang, Ying Liu

机构 * Scale AI University of Arizona(亚利桑那大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对以规则为奖励的强化学习中的奖励黑客行为,提出Rubric Dropout方法,在医学和科学规则上训练Qwen3-8B,可提升分布外基准的黄金评判分数、降低黑客指标,30-50%丢弃比例效果最优。

Comments 18 pages, 7 figures, 4 tables. Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11219 2026-08-13 cs.AI cs.CL cs.LG 新提交 75%

From Monolithic to Modular: Segment-level Automatic Prompt Optimization

从整体到模块:片段级自动提示优化

Nikita Kulin, Viktor Zhuravlev, Artur Khairullin, Sergey Muravyov, Ilya Makarov, Daniil Sukhorukov, Ekaterina Averkova

机构 * ITMO University(伊蒂莫大学) HSE(高等经济大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对自动提示优化易顾此失彼的问题,提出片段级APO方法SAPO,将提示拆分后针对性优化,在多数据集和模型上取得优于基线的平均得分。

Comments Accepted at the IJCAI-ECAI 2026 Workshop on Robustifying Generative AI for Reliable, Safe, and Human-Centric Systems (RobustifAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11074 2026-08-12 cs.CV 新提交 75%

CapProbe: Evaluating Detailed Image Captions via Full-Scene Dense Question Answering

CapProbe:通过全场景密集问答评估详细图像描述

Mouxiao Huang, Qiangyu Yan, Borui Jiang, Han Shu

机构 * Huawei Technologies(华为技术有限公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 CapProbe是用于评估VLMs生成的详细图像描述的全场景密集问答基准,通过区域对齐的事实核查,揭示了13个VLMs的覆盖差距、能力-效率权衡及遗漏的失败模式,相关资源将很快发布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07411 2026-08-10 cs.AI cs.CL cs.IR cs.LG 新提交 75%

GeoBenchLLM: A Comprehensive Benchmark for Evaluating LLMs on Geo-Related Tasks

GeoBenchLLM:评估大语言模型地理相关任务的综合基准

Rodrigo Ferreira Rodrigues, Karim Radouane, Jose G Moreno, Lynda Tamine

机构 * University of Toulouse(图卢兹大学) IRIT(信息与电信科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出GeoBenchLLM综合基准,选取12个地理相关公开数据集评估LLMs的地理空间与时间理解能力,发现推理能力与模型规模对性能影响显著,基准可公开获取。

Comments Accepted at CIKM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06362 2026-08-07 cs.GT cs.AI cs.CL cs.LG cs.MA 新提交 75%

AV-AIVAT: 74x Cheaper Agent Evaluation with Certified Anytime-Valid Stopping in Imperfect-Information Games

AV-AIVAT:在非完全信息博弈中具备可验证的任意时间有效停止机制,成本降低74倍的智能体评估方法

Boning Li, Yu Chen, Longbo Huang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 AV-AIVAT将AIVAT与置信序列结合,在非完全信息博弈中实现任意时间有效停止,成本降低74倍,可高效评估智能体并向第三方提供可审计的验证依据。

Comments 34 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03047 2026-08-05 cs.CV cs.MM 新提交 75%

AIDE: Automated Instruction via Distilled Expertise for Reference-Free Motor Skill Coaching

AIDE:基于提炼专业知识的自动化指令,用于无参考的运动技能指导

Yoshiki Ito

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 研究针对运动技能指导中专业教练稀缺的问题,提出AIDE框架,仅训练阶段用专业参考、推理阶段仅用学习者姿态生成反馈,在ExpertAF数据集上性能优于无参考基线,与需双阶段专业演示的方法相当。

Comments Accepted to ACM Multimedia 2026. 12 pages (including supplementary material), 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00785 2026-08-04 cs.MA 新提交 75%

HIERA: Hierarchical Multi-Agent Relevance Assessment for Content Discovery Systems

HIERA:面向内容发现系统的分层多智能体相关性评估框架

Pritom Saha Akash, Phanideep Gampa, Chao Shen, Ying Chen, Sheikh Muhammad Sarwar

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究针对内容发现系统人工标注的问题,提出分层多智能体相关性评估框架HIERA,通过四个专用智能体的分层协调,在五个数据集上较11个基线方法取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00371 2026-08-04 cs.CV 新提交 75%

Decoding Children's Gait Behavior

儿童步态行为解码

Yifan Shen, Boyi Li, Meihuan Huang, Yuanzhe Liu, Xu Cao, Jinyang Jin, Zhengyuan Li, Anglin Liu, Junho Kim, Jingyuan Zhu, Lan Fangzhou, Jianguo Cao, Jintai Chen, Ismini Lourentzou, James Matthew Rehg

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) PediaMed AI Shenzhen Children’s Hospital(深圳市儿童医院) Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对儿童步态分析的临床需求,本文构建含110名受试者的1100余条高帧率视频数据集,指出现有先进模型难以解析其临床细节,提出统一端到端框架并建立自动化儿童步态评估基线。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28039 2026-07-31 cs.CV 新提交 75%

TongueReenact: Geometry-Anchored Tongue Synthesis for Face Reenactment

TongueReenact:几何锚定的人脸重演舌部合成

MD Wahiduzzaman Khan, Mingshan Jia, Xiaolin Zhang, En Yu, Kaska Musial-Gabrys

机构 * University of Technology Sydney(悉尼科技大学) Shandong University of Science and Technology(山东科技大学)

专题命中 评测与基准 :foundation model(summary_cn,abstract_cn)

AI总结 本文提出首个跨身份舌部动态迁移框架,结合 foundation model 辅助的自举流水线与空间约束潜在掩码扩散模型,在舌部指标上较基线提升超两倍,且 VLM 评估证实其感知优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27232 2026-07-31 cs.CL cs.AI cs.CY cs.LG 新提交 75%

Sympathetic Framing: Evaluating AI Alignment across Sociodemographic Groups

共情框架:跨社会人口统计群体评估AI对齐

Haran Shani-Narkiss, Michael Fire, Oren Tsur

机构 * University College London(伦敦大学学院) Ben Gurion University of the Negev(内盖夫本古里安大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究评估7款LLMs对新闻标题情感框架的理解与人类的对齐度,发现不同模型相关性差异大,领先模型总体对齐但存在人口统计组差异,凸显AI对齐的非普遍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26024 2026-07-29 cs.HC cs.SD eess.AS 新提交 75%

LLM4OSC: Profile-Bound Natural Language Control with Deterministic Validation for Open Sound Control

LLM4OSC:用于开放声音控制的具有确定性验证的配置文件约束自然语言控制

Yuan-Yi Fan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对开放声音控制中语言模型的问题,提出LLM4OSC本地优先架构,通过人工审核配置文件等方式进行验证等操作,在特定配置文件测试中后端表现良好,主张将提议-验证-发送和错误发送率作为关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22118 2026-07-27 cs.HC 新提交 75%

An AI-Driven Virtual Patient for Breaking Bad News: An Expert Formative Study on Facial Expression Intensity

用于传达坏消息的人工智能驱动虚拟患者:面部表情强度的专家形成性研究

Steffen Hauck, Theresa Schell, Sophie Jörg, Jens Grubert

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨大语言模型驱动的虚拟患者情感表达设计难题,提出结合大语言模型对话与实时面部动画的框架,通过对七位医学专家评估,发现专家通过多渠道评估情感真实感,为未来医学培训模拟器提出需同步多模态管道的路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21951 2026-07-27 cs.IR cs.CR 新提交 75%

SIREN (Luring LLMs onto the Rocks): PAIR-Driven Preference Manipulation in Web-RAG Recommenders

SIREN(诱使大语言模型陷入困境):网页增强型大语言模型推荐系统中基于配对驱动的偏好操纵

Evan Caville, Siamak Layeghy, Billy Sung, Sara Dolnicar, Marius Portmann

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究网页增强型大语言模型推荐系统中排序推荐的对抗操纵问题,提出SIREN方法,利用23种内容中毒技术迭代编辑检索到的网页,在两个Claude模型上实验,使选定实体多次达排名第1,验证了声明性排名等方式的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21652 2026-07-27 cs.SE 新提交 75%

Vibe Coding in Software Development: A Multivocal Literature Review

软件开发中的氛围编码:多视角文献综述

Shahbaz Siddeeq, Muhammad Waseem, Kai-Kristian Kemell, Mika Saari, Jussi Rasku, Pekka Abrahamsson

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究对2022年至2025年10月的文献进行多视角综述,探讨软件开发中氛围编码实践。通过分析47篇文献发现其是迭代流程,开发者工作转变,短期生产力有提升,不同应用场景证据强弱有别,此为整合两类文献的首次综述并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20087 2026-07-23 cs.CV 新提交 75%

Development of an automated, reliable, and clinically meaningful artificial intelligence (AI) tool for diagnosing cardiac disease from conventional cardiovascular magnetic resonance (CMR) images

开发一种用于从传统心血管磁共振(CMR)图像中诊断心脏病的自动化、可靠且具有临床意义的人工智能(AI)工具

Sina Amirrajab, Volker Vehof, Michael Bietenbeck, Nuriye Akyol, Redouane Bouras, Khuraman Isgandarova, Alexandru Zlibut, Philipp Stalling, Ali Yilmaz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究旨在开发用于CMR图像心脏病诊断的AI工具,通过整合开源LLMs和预处理多模态数据,对三种视觉基础模型两阶段微调,在独立测试集上有高诊断性能,集成策略进一步提升准确性和鲁棒性,代码和模型权重公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17353 2026-07-21 cs.CR 新提交 75%

Measuring and Evaluating the Performance of Generative AI Models for Scam Detection

测量和评估用于诈骗检测的生成式人工智能模型的性能

Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究大语言模型在无特定任务微调下检测诈骗的能力,通过策划发布独特基准数据集,评估九个不同模型,发现较大模型性能优,有效提示可提升小模型性能,且LLMs泛化能力强,还发布了数据集和评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16203 2026-07-21 cs.LG cs.AI cs.CL 新提交 75%

DocOCR-Eval: A Correction-Based Framework for OCR Tool Selection Without Ground Truth

DocOCR-Eval:一种无需真实标签的基于校正的OCR工具选择框架

Zihan Xu, Puzhen Wu, Lawrence Chun Man Lau, Wei Liu, Sirui Li, Yifan Peng, Yihao Ding

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对文档解析中OCR工具选择难题,尤其是标签稀缺情况,提出无标注评估框架DocOCR-Eval。它采用三阶段校正和排序策略,通过跨多个MLLM聚合改善与基于标注排名的对齐,能在现实有限标签设置中实现可靠OCR工具选择并提供实用指导。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13987 2026-07-16 cs.CR 新提交 75%

Agent Skill Security: Threat Models, Attacks, Defenses, and Evaluation

智能体技能安全:威胁模型、攻击、防御与评估

Sanket Badhe, Priyanka Tiwari

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究智能体可复用技能安全,提出SkillSec-Eval框架,刻画技能生命周期并开发威胁分类法,通过对327个真实技能实证评估,发现多阶段有漏洞,强调需进行生命周期感知安全分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13035 2026-07-16 cs.CL cs.AI cs.LG cs.SE 新提交 75%

FixItFlow: Automated Troubleshooting Guide Generation from Cloud Incidents

FixItFlow:从云事件中自动生成故障排除指南

Srihari Unnikrishnan, Jaskaran Singh Walia, Drishti Goel, Supriyo Ghosh

机构 * Microsoft Research(微软研究院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Inception

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对云事件手动创建故障排除指南的问题,提出FixItFlow系统,利用大语言模型从历史事件数据生成指南,能提取诊断模式、合成结构化指南并严格验证,经评估可提升事件响应,减轻团队文档负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12290 2026-07-15 eess.AS cs.AI cs.CL cs.LG cs.SD 新提交 75%

The Sound of Absence: Audio-Language Embedding Models Struggle with Negation

缺失之音:音频-语言嵌入模型在处理否定时存在困难

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University, Taiwan(国家台湾大学通讯工程研究所) Artificial Intelligence Center of Research Excellence (AI-CoRE), National Taiwan University, Taiwan(国家台湾大学人工智能卓越研究中心)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究音频-语言嵌入模型在处理否定时的问题,引入NegEval-Audio框架将数据集转换为否定感知任务,发现模型在否定情况下性能大幅下降,肯定偏差是缺陷,需明确否定感知训练目标。

Comments Manuscript in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11354 2026-07-14 cs.IR 新提交 75%

User Preference Induction with LLMs for Offline Top-N Recommendation Evaluation

基于大语言模型的用户偏好归纳用于离线 Top-N 推荐评估

David Otero, Javier Parapar

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对离线 Top-N 推荐评估依赖不完整相关性信息的问题,提出基于大语言模型的框架,通过归纳用户偏好及判断候选项目相关性来扩展判断,提升评估稳健性并减轻流行度敏感失真。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10738 2026-07-14 cs.LG cs.AI cs.CL 新提交 75%

To Answer or to Abstain: Mitigating Search-Agent Hallucinations via Abstention-Aware Reinforcement Learning

回答还是弃权:通过弃权感知强化学习减轻搜索代理幻觉

Fengji Zhang, Tianyu Fan, Yuxiang Zheng, Xinyao Niu, Chengen Huang, Jacky Keung, Bei Chen

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型训练范式易加剧搜索代理幻觉的问题,提出弃权感知强化学习(AWA-RL),利用模型能力动态塑造弃权奖励,并引入RA-F1指标,实验表明该方法有效提升了搜索代理的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05742 2026-07-08 cs.HC 新提交 75%

PERSONAJUDGE: Simulating Individual Human Preference Judgments with Evaluator-Specific Demonstration Data

PERSONAJUDGE:使用特定评估者的示范数据模拟个体人类偏好判断

Zeyu He, Xuan Qi, Subramanian Chidambaram, Zhichao Xu, Vinayak Arannil, Lydia Chilton, Alex C. Williams

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对大语言模型作评判时忽略个体评估者差异的问题,提出结合分类判断与特定评估者辅助数据的模拟方法,经实证研究发现该方法有改进,推理痕迹作用大,还明确了模拟难度及相关属性,为个性化评估提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 75%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 75%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03884 2026-07-07 cs.SE 新提交 75%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03440 2026-07-07 cs.IR 新提交 75%

Improving Access to Historical Archives with Real-time RAG-based Systems

利用基于实时检索增强生成(RAG)的系统改善对历史档案的访问

Stergios Konstantinidis, Hayman Lotfy, Alexis Erne, Faruk Zahiragic, Min-Yen Kan, Michalis Vlachos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对数字化历史档案访问难题,提出集成大语言模型的端到端框架,含OCR优化模块和语义检索重排管道,实验表明能减少OCR错误并提升检索效果,使档案系统更具交互性和语义可搜索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 75%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00345 2026-07-02 cs.SE 新提交 75%

Registry-Governed Agent Lifecycle:Completing EDDOps with Evaluation-DrivenRegistration, Promotion, and Retirement on AWS AgentCore

注册表治理的智能体生命周期:通过评估驱动的注册、晋升和退役在 AWS AgentCore 上完善 EDDOps

Richard Kang, Vincent Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 提出 EDDOps 在 AWS Bedrock AgentCore 上的实践实例,通过成本-性能框架和注册表治理,将模型选择从基准排名转化为受治理的经济决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 75%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏