arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-06-03 至 2026-06-03 共收录 298 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 18 篇

2603.03480 2026-06-03 cs.LG stat.ML 57%

Minimax Optimal Strategy for Delayed Observations in Online Reinforcement Learning

在线强化学习中延迟观测的极小化最优策略

Harin Lee, Kevin Jamieson

机构 * University of California, Berkeley(加州大学伯克利分校) UC Berkeley(加州大学伯克利分校)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 针对延迟状态观测的强化学习问题,提出结合增广方法和上置信界算法的策略,在表格型MDP上达到极小化最优遗憾界。

Comments ICML camera ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03627 2026-06-03 cs.AI 57%

MemVerse: Multimodal Memory for Lifelong Learning Agents

MemVerse:面向终身学习智能体的多模态记忆

Junming Liu, Yifei Sun, Weihua Cheng, Haodong Lei, Yirong Chen, Licheng Wen, Xuemeng Yang, Daocheng Fu, Pinlong Cai, Nianchen Deng, Yi Yu, Shuyue Hu, Botian Shi, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 记忆与上下文管理 :AI agent(abstract);分类 cs.AI

AI总结 提出MemVerse,一种模型无关的即插即用记忆框架,通过分层检索记忆与参数化快速回忆结合,解决智能体在多模态交互中的灾难性遗忘和长程推理问题。

Comments 25 pages, 6 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03920 2026-06-03 cs.CV 50%

Benchmarking Visual State Tracking in Multimodal Video Understanding

多模态视频理解中的视觉状态追踪基准测试

Sihyun Yu, Nanye Ma, Pinzhi Huang, Hyunseok Lee, Shusheng Yang, June Suk Choi, Ellis Brown, Oscar Michel, Boyang Zheng, Jinwoo Shin, Saining Xie

机构 * New York University(纽约大学) KAIST(韩国科学技术院)

专题命中 记忆与上下文管理 :agentic(abstract)

AI总结 提出VSTAT基准,通过需要连续感知和整合整个视频流的问题评估多模态大语言模型的视觉状态追踪能力,发现当前模型远低于人类表现,失败主要源于视觉感知而非文本推理。

Comments Website: https://vision-x-nyu.github.io/vstat-site/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03509 2026-06-03 cs.CV 50%

EvoMemNav: Efficient Self-Evolving Fine-Grained Memory for Zero-Shot Embodied Navigation

EvoMemNav: 用于零样本具身导航的高效自进化细粒度记忆

Zuhao Ge, Xiaosong Jia, Chao Wu, Yuchen Zhou, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI (TEAI), Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

专题命中 记忆与上下文管理 :planning(abstract)

AI总结 提出EvoMemNav框架,通过构建视觉-语义记忆图并采用预算驱动的粗到细策略,结合反射驱动写回机制,实现零样本具身导航中高效、自进化的细粒度记忆,提升多实例区分和停止验证性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
1301.3784 2026-06-03 math.DS cs.SY eess.SY 50%

Asymptotic Consensus Without Self-Confidence

无自我置信的渐近一致性

Thomas Nowak

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 研究代理在更新规则中可能忽略自身值(无自我置信)时,通过非周期核心替代自我置信假设实现渐近一致性的系统。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1105.3042 2026-06-03 math.OC cs.SY eess.SY math.DS 50%

Parallelizing a State Exchange Strategy for Noncooperative Distributed NMPC

并行化非合作分布式NMPC的状态交换策略

Jürgen Pannek

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 针对通过状态约束互联的系统,提出一种可并行化的层次化算法,并利用基于轨迹的稳定性结果证明闭环的可行性与稳定性。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1205.3058 2026-06-03 eess.SY cs.SY math.OC 50%

A Tight Lower Bound on the Controllability of Networks with Multiple Leaders

多领导者网络可控性的紧下界

Ahmet Yasin Yazicioglu, Waseem Abbas, Magnus Egerstedt

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 利用代数图论,研究静态网络拓扑下多领导者系统的可控性,给出可控性矩阵秩的拓扑紧下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
0909.0637 2026-06-03 math.AP cs.NA math.NA q-bio.CB q-bio.QM 50%

Stability Analysis of a Simplified Yet Complete Model for Chronic Myelegenous Leukemia

慢性粒细胞白血病简化但完整模型的稳定性分析

Marie Doumic Jauffret, Peter S. Kim, Benoît Perthame

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 通过简化一个描述造血的偏微分方程模型并分析其渐近行为,证明简化模型在参数略有差异时仍能复现原始基于智能体模型的关键特性,从而为理解造血动力学和慢性粒细胞白血病提供参数更少、便于比较的实用工具。

Journal ref Bulletin of Mathematical Biology 72, 7 (2010) 1732-1759

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.2889 2026-06-03 q-fin.PM cs.SY eess.SY math.OC 50%

Additive habits with power utility: Estimates, asymptotics and equilibrium

幂效用下的加性习惯:估计、渐近性与均衡

Roman Muraviev

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文研究离散时间市场与随机禀赋下带加性习惯的幂效用最大化问题,针对不完全市场建立最优消费流的估计并分析消费倾向的渐近行为,在完全市场中证明异质性个体经济体的Arrow-Debreu均衡存在性,并在代表性主体均衡中显式计算零息债券和Lucas树权益的价格及其对习惯形成参数的依赖。

Comments Submitted

详情

展开后加载摘要…

URL PDF HTML 收藏
math/0609789 2026-06-03 math.ST cs.NA math.NA stat.TH 50%

State space description of national economies: the V4 countries

国民经济的状态空间描述:V4国家

Ivo Petras, Igor Podlubny

专题命中 记忆与上下文管理 :tool use(abstract)

AI总结 本文采用状态空间方法,以GDP、通胀率和失业率为状态变量,通过正交回归分析V4国家(斯洛伐克、捷克、匈牙利、波兰)的经济轨迹,发现其相轨迹近似位于一个平面,并提出新的经济指标。

Comments 13 pages, 18 figures

Journal ref Computational Statistics and Data Analysis, Volume 52, Issue 2, 15 October 2007, Pages 1223-1233

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 46 篇

2606.03686 2026-06-03 cs.AI 92%

The DeepSpeak-Agentic Dataset

DeepSpeak-Agentic 数据集

Sarah Barrington, Maty Bohacek, Hany Farid

机构 * University of California, Berkeley, USA(加州大学伯克利分校) Stanford University, USA(斯坦福大学)

专题命中 Agent评测 :agentic(title,title_cn);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出了一个包含37小时人机半结构化对话视频的数据集DeepSpeak-Agentic,用于评估AI代理的自动取证识别、研究人机交互特性,并作为大型语言模型和AI生成语音/面部技术的基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15713 2026-06-03 cs.LO cs.AI cs.PL 87%

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Just Type It in Isabelle! AI Agents Drafting, Mechanizing, and Generalizing from Human Hints

Kevin Kappelmann, Maximilian Schäffeler, Lukas Stevens, Mohammad Abdulaziz, Andrei Popescu, Dmitriy Traytel

机构 * Department of Computer Science, University of Sheffield, United Kingdom(英国谢菲尔德大学计算机科学系) Department of Informatics, King’s College London, United Kingdom(英国伦敦国王学院信息学院) Department of Computer Science, University of Copenhagen, Denmark(丹麦哥本哈根大学计算机科学系)

专题命中 Agent评测 :AI agent(title,title_cn);agent(abstract);分类 cs.AI

AI总结 研究Isabelle中秩一多态λ项的类型标注问题,通过人类和AI代理(LLM)分别进行纸笔证明和自动形式化,并利用人类提示进行改进和泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI 86%

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

专题命中 Agent评测 :agent(title,title_cn);分类 cs.AI、cs.SE

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02644 2026-06-03 cs.CR cs.AI 85%

A New Framework for Cybersecurity Refusals in AI Agents

AI代理中网络安全拒绝的新框架

Eliot Krzysztof Jones, Mateusz Dziemian, Matt Fredrikson, J Zico Kolter

机构 * Gray Swan Gray Swan AI Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出首个针对AI代理在进攻性安全场景中建立拒绝边界的框架,包括拒绝原则、任务分类和评估方法,并发现8个前沿模型中6个拒绝率接近零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03544 2026-06-03 cs.AI cs.CL 84%

SAGE: A Quantitative Evaluation of Socialized Evolution in Agent Ecosystems

SAGE: 智能体生态中社会化演化的定量评估

Linyue Pan, Yaoming Zhu, Lin Qiu, Xuezhi Cao, Xunliang Cai

机构 * Tsinghua University, China(清华大学, 中国) Meituan, China(美团, 中国)

专题命中 Agent评测 :agent(title,abstract);planning(abstract);分类 cs.AI、cs.CL

AI总结 提出SAGE框架,通过对比社会演化(SocialEvo)与自我演化(SelfEvo)两种计算条件,在三个领域评估共享经验对智能体性能的影响,发现群体历史并非普遍放大器,但能帮助陷入停滞的智能体取得突破,且社会收益依赖于抽象能力而非暴露量。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02060 2026-06-03 cs.AI 83%

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

深度研究代理在何处出错?代理轨迹中的跨度级错误定位

Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学NJU-LINK团队) JIUTIAN Research(JIUTIAN研究院)

专题命中 Agent评测 :agent(title,abstract);tool use(abstract);分类 cs.AI

AI总结 针对深度研究代理在长轨迹中难以定位错误的问题,本文通过构建TELBench基准和提出DRIFT审计框架,实现了跨度级错误定位,将首次错误定位准确率提升高达30个百分点。

Comments 28 pages, 11 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28556 2026-06-03 cs.AI 83%

A Matter of TASTE: Improving Coverage and Difficulty of Agent Benchmarks

品味问题:提高智能体基准测试的覆盖率和难度

Tomer Keren, Nitay Calderon, Asaf Yehudai, Yotam Perlitz, Michal Shmueli-Scheuer, Roi Reichart

专题命中 Agent评测 :agent(title,abstract);tool-use(abstract);分类 cs.AI

AI总结 提出TASTE方法,通过反转任务构建流程,利用自适应对比n-gram模型和聚类自动生成覆盖广泛工具组合的高难度基准任务,以解决现有基准饱和问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20306 2026-06-03 cs.CV cs.LG 83%

WildRoadBench: A Wild Aerial Road-Damage Grounding Benchmark for Vision-Language Models and Autonomous Agents

WildRoadBench: 面向视觉语言模型与自主智能体的野外航拍道路损伤定位基准

Bingnan Liu, Chenhang Cui, Rui Huang, Jiani Luo, Zhirong Shen, Tinghao Wang, Xiande Huang, Lingbei Meng, Fei Shen, An Zhang

机构 * University of Electronic Science and Technology of China(电子科技大学) National University of Singapore(新加坡国立大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :autonomous agent(title,abstract);agent(abstract);分类 cs.LG

AI总结 提出WildRoadBench基准,通过VLM直接定位和LLM驱动智能体自主研究两种协议,评估模型在航拍道路损伤定位上的性能,发现现有方法在野外场景下仍不可靠。

Comments Preprint. Under review. 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02674 2026-06-03 cs.CR 82%

Cross-Vendor Sola ISPM Benchmark: Evaluating Agentic AI for Federated Identity Security Reasoning

跨厂商Sola ISPM基准测试:评估面向联邦身份安全推理的智能体AI

Eden Yavin, Gal Engelberg, Konstantin Koutsyi, Leon Goldberg, Gal Baron

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract)

AI总结 针对多云和SaaS平台中跨厂商身份安全配置错误与权限提升路径的评估缺失,提出包含50个数据驱动任务的跨厂商Sola ISPM基准测试,并构建评估框架,实验表明结构化关系上下文将答案正确性相对提升约34%,探索查询减少约70%。

Comments 22 pages, 4 figures, 8 tables, 2 appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02624 2026-06-03 q-bio.QM cs.AI cs.LG 81%

TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering

TadA-Bench:面向智能蛋白质工程的未来轮次发现的百万变异基准

Jin Gao, Juntu Zhao, Zirui Zeng, Jiaqi Shen, Junhao Shi, Dukun Zhao, Yuming Lu, Dequan Wang

机构 * Tsinghua University(清华大学)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 TadA-Bench 是一个基于31轮TadA定向进化的百万变异湿实验回放基准,通过定义固定数据回放任务来评估模型在未见过的未来轮次中排序变异的能力,并引入Seq2Graph统一标签,揭示进化覆盖度比局部数据密度更重要。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). Data: https://huggingface.co/datasets/JinGao/TadABench-1M . Code: https://github.com/shiyegao/TadABench-1M

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03980 2026-06-03 cs.LG cs.CL 81%

Skill-RM: Unifying Heterogeneous Evaluation Criteria via Agent Skill

Skill-RM: 通过智能体技能统一异构评估标准

Tao Chen, Gangwei Jiang, Pengyu Cheng, Siyuan Huang, Yihao Liu, Jingwei Ni, Jiaqi Guo, Mengyu Zhou, Kai Tang, Junling Liu, Qinliang Su, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(通义千问大模型应用团队,阿里巴巴) Sun Yat-sen University(中山大学) The Chinese University of Hong Kong(香港中文大学) Peking University(北京大学) ETH Zürich University of Zurich(苏黎世联邦理工学院)

专题命中 Agent评测 :agent(title);agentic(abstract);分类 cs.CL、cs.LG

AI总结 提出Skill-RM框架,将奖励建模重构为可重用的奖励评估技能执行,通过动态选择和聚合证据统一异构评估标准,在奖励基准和下游任务中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02915 2026-06-03 cs.CV 80%

Any2Poster: Any-Source Poster Generation Across Modalities and Domains

Any2Poster: 跨模态和领域的任意源海报生成

Amogh Vinaykumar, Aiden Li, Suozhi Huang, Shilong Liu

机构 * Flower Mound High School(弗洛拉穆恩高中) University College London(伦敦大学学院) Princeton University(普林斯顿大学)

专题命中 Agent评测 :agent(summary_cn,abstract)

AI总结 提出Any2Poster Bench基准和Any2Poster Agent智能体,实现从多种输入模态和领域生成海报,并通过基于测验和视觉评估的方法验证信息保真度和视觉传达效果。

Comments Project Page: https://github.com/Any2Poster/Any2Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03954 2026-06-03 cs.CV cs.LG cs.RO 79%

VLESA: Vision-Language Embodied Safety Agent for Human Activity Monitoring

VLESA: 用于人类活动监测的视觉语言具身安全智能体

Hanjiang Hu, Yiyuan Pan, Jiaxing Li, Xusheng Luo, Alexander Robey, Na Li, Yebin Wang, Changliu Liu

机构 * Carnegie Mellon University(卡内基梅隆大学) Mitsubishi Electric Research Laboratories(三菱电机研究实验室) Harvard University(哈佛大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.LG

AI总结 提出VLESA框架,通过自我中心视频监测人类活动,利用GRPO训练的目标条件安全Q过滤器进行实时安全干预,在ASIMOV-2.0基准上实现更高干预精度。

Comments 18 pages, 5 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03829 2026-06-03 cs.AI 79%

BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents

BigFinanceBench: 一个基于工作流的金融研究智能体基准

Alex Wang, Georg Meinhardt, Jacob Katz, Joseph H. Kim, Pratyush K. Chaudhary, Chase Blagden, Eric Xu

机构 * Rogo OpenAI

专题命中 Agent评测 :workflow(title,abstract);分类 cs.AI

AI总结 针对金融研究答案可审计推导过程未被充分评估的问题,提出包含928个专家编写任务、每个任务附带点权评分标准的BigFinanceBench基准,用于评估完整推导过程而非仅最终答案,实验表明最佳系统仅达58.8%评分,存在显著提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03518 2026-06-03 cs.AI cs.CR 79%

Overlaying Governance: A Compositional Authorization Framework for Delegation and Scope in Agentic AI

覆盖治理:面向代理型人工智能的委托与范围的组合授权框架

Amjad Ibrahim, Yong Li

机构 * Huawei Heisenberg Research Center(华为海森堡研究所以)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI

AI总结 针对代理型AI中传统授权框架无法处理递归委托、动态范围等问题,提出一种组合治理框架,通过定义委托类型、权限责任和资源范围衰减,并引入组合算子在不重写现有策略的情况下叠加代理语义,实现可问责的授权。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03034 2026-06-03 cs.MA cs.AI 79%

Capability Advertisement as a Market for Lemons: A Trust Layer for Heterogeneous Agent Networks

能力广告作为柠檬市场:异构智能体网络的信任层

Gaurav Naresh Mittal

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 针对LLM智能体网络中的能力虚假声称问题,提出基于柠檬市场理论的信任层,通过概率描述、筛选和声誉机制实现可信委托。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03168 2026-06-03 cs.CV 78%

JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation

JAVEDIT: 联合音频-视觉指令引导视频编辑与智能体数据策展

Yinan Chen, Chuming Lin, Zhennan Chen, Yuxiang Zeng, Junwei Zhu, Yali Bi, Xijie Huang, Chengming Xu, Donghao Luo, Zhucun Xue, Xiaobin Hu, Chengjie Wang, Yong Liu, Jiangning Zhang, Shuicheng Yan

机构 * Zhejiang University(浙江大学) Tencent Youtu Lab(腾讯优图实验室) Nanjing University(南京大学) University of Auckland(奥克兰大学) Fudan University(复旦大学) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agentic(title);agent(abstract)

AI总结 针对联合音频-视觉编辑缺乏数据集和基准的问题,提出首个大规模高质量数据集JAVEdit-100k、基准JAVEditBench以及基线模型JAVEdit,在六项指标中五项超越所有基线。

Comments Equal contributions from first two authors. Project page: https://ryanchenyn.github.io/projects/JAVEdit Code: https://github.com/RyanChenYN/JAVEdit Dataset: https://huggingface.co/datasets/Coraxor/JAVEdit-100k

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30915 2026-06-03 cs.CV 78%

DiTTo: Scalable Order-aware All-in-One Image Restoration Agent

DiTTo: 可扩展的排序感知全能图像修复智能体

Seungho Choi, Jihyong Oh

机构 * CMLab, Chung-Ang University(Chung-Ang 大学 CMLab) David S. Hippocampus Department of Computer Science Cranberry-Lemon University(Cranberry-Lemon 大学 计算机科学系 Hippocampus 教授)

专题命中 Agent评测 :agent(title,abstract)

AI总结 提出DiTTo框架,通过模拟器高效构建最优修复轨迹数据集,并采用排序感知对齐实现修复专家的即插即用扩展,在多退化图像修复中达到最优性能。

Comments Please visit our project page at https://cmlab-korea.github.io/DiTTo/

详情

展开后加载摘要…

URL PDF HTML 收藏
1202.4707 2026-06-03 math.OC cs.SY eess.SY 71%

A para-model agent for dynamical systems

动力系统的参数模型智能体

Loïc Michel

专题命中 Agent评测 :agent(title)

AI总结 提出一种广义的无模型控制方法,通过参数模型智能体实现非线性动力系统的控制与无导数优化,并验证其鲁棒性。

Comments 41 pages, 38 figures, partially presented at the French Symposium of Electrical Engineering in Grenoble, Jun. 2016 and at the Sparse days in St Girons III, Jul. 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03157 2026-06-03 cs.AI 70%

ClinicalMC: A Benchmark for Multi-Course Clinical Decision-Making with Large Language Models

ClinicalMC:面向大语言模型的多疗程临床决策基准

Ruihui Hou, Siyi Zhu, Ziyue Huai, Guangya Yu, Yongqi Fan, Chunming Wang, Tong Ruan

机构 * East China University of Science and Technology, Shanghai, China(东华大学) Renji Hospital Affiliated to Shanghai Jiaotong University School of Medicine, Shanghai, China(复旦大学附属中山医院)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 提出ClinicalMC基准,包含多阶段样本,通过多智能体评估框架在单轮静态和多轮动态设置下测试大语言模型的临床决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏