arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 969 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 969 篇

2606.19988 2026-06-19 cs.SE 新提交 67%

Repository-Level Solidity Code Generation with Large Language Models: From Prompting to Fine-Tuning

基于大语言模型的仓库级Solidity代码生成:从提示到微调

Shi Chen, Rongcun Wang, Yuan Tian, Xiaoyuan Xie, Wei Song, Rubing Huang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出SolidityBench基准和SolidityScore指标,评估多种LLM方法在仓库级Solidity代码生成中的表现,发现监督微调最有效。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18686 2026-06-18 cs.AI cs.CL cs.LG 新提交 67%

ForecastBench-Sim: A Simulated-World Forecasting Benchmark

ForecastBench-Sim:一个模拟世界预测基准

Jaeho Lee, Nick Merrill, Ezra Karger

机构 * Forecasting Research Institute(预测研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于Freeciv游戏模拟的预测基准ForecastBench-Sim,通过游戏回滚生成可控、即时可解的预测问题,用于评估AI系统的概率推理能力。

Comments 15 pages, 5 main figures, 6 appendix figures. Spotlight presentation at Forecasting as a New Frontier of Intelligence / Workshop on AI Forecasting, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17433 2026-06-17 cs.CV 新提交 67%

LADBench: A Benchmark for Logical Fault Detection in Images

LADBench: 图像中逻辑故障检测的基准

Sahasra Kondapalli, Lara Radovanovic, Aadi Palnitkar, Mingyang Mao, Xiaomin Lin

机构 * University of South Florida(南佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);logical reasoning(abstract)

AI总结 提出LAD-Bench基准,包含1000多张合成图像的四域逻辑异常,通过分层提示协议评估模型,揭示现有VLM在隐式逻辑故障检测上的不足。

Comments Accepted to the IEEE International Conference on Development and Learning (ICDL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17391 2026-06-17 cs.CL cs.AI cs.LG 新提交 67%

NarrativeWorldBench: A Frontier-Saturated Benchmark and a Latent World Model for Long-Horizon Co-Creative Audio Drama

NarrativeWorldBench:面向长程共创音频剧的前沿饱和基准与潜在世界模型

Logan Mann, Abdur Rahman, Mohammad Saifullah, Taaha Kazi, Vasu Sharma

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Pocket FM

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出NarrativeWorldBench基准,在九种叙事结构指标上评估21个模型,并引入N-VSSM变分状态空间模型,通过Mamba-2骨干和事件条件后验在200集以上维持结构化潜在状态,在长弧一致性和可控性上超越Claude Opus 4.5。

Comments 10 pages. Accepted to the ICML 2026 Workshops on High-dimensional Learning Dynamics (HiLD) and Culture x AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12072 2026-06-11 cs.CV 新提交 67%

World Model Self-Distillation: Training World Models to Solve General Tasks

世界模型自蒸馏:训练世界模型以解决通用任务

Sebastian Stapf, Pablo Acuaviva Huertos, Aram Davtyan, Paolo Favaro

机构 * Department of Computer Science(计算机科学系)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 提出结合自蒸馏与强化学习的框架,从预训练视频生成器中提取任务解决能力,无需配对任务视频,在基准测试中超越原始模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11863 2026-06-11 cs.SE 新提交 67%

Enhancing LLM-Based Code Translation with Verified Multi-Semantic Representations

增强基于LLM的代码翻译:利用验证过的多语义表示

Yufu Wang, He Jiang, Hao Lin, Peiyu Zou, Ang Jia, Xiaochen Li, Zhilei Ren

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出Multisage框架,通过提取和验证多语义表示(数据流图、类型约束等)来提升LLM代码翻译的准确性和可靠性,在HumanEval-X上翻译成功率提升至2.22倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09890 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

PreAct-Bench: Benchmarking Predictive Monitoring in LLMs

PreAct-Bench:大语言模型中的预测性监控基准

Hainiu Xu, Italo Luis da Silva, Jiangnan Ye, Yuhao Wang, Wei Liu, Linyi Yang, Jonathan Richard Schwarz, Nicola Paoletti, Yulan He, Hanqi Yan

机构 * King’s College London(伦敦国王学院) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学) Thomson Reuters Foundational Research(汤姆森路透基础研究) Imperial College London(伦敦帝国学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出预测性监控任务,在动作执行前判断是否会导致不道德行为,并构建PreActBench基准,评估多种模型发现该任务具有挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09887 2026-06-10 cs.LG cs.AI cs.CL 新提交 67%

SocraticPO: Policy Optimization via Interactive Guidance

SocraticPO: 通过交互式指导进行策略优化

Zirui Liu, Jie Ouyang, Qi Liu, Xianquan Wang, Jiayu Liu, Tingyue Pan, Qingchuan Li, Jing Sha, Zhenya Huang, Shijin Wang, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学) iFLYTEK AI Research (Central China), iFLYTEK Co., Ltd(iFLYTEK中央中国AI研究院,iFLYTEK公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SocraticPO框架,在强化学习中使用自然语言指导辅助推理,并通过奖励衰减防止模型依赖教师帮助,提升科学推理任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07314 2026-06-08 cs.SE cs.ET quant-ph 新提交 67%

QBugLM: An Agentic Benchmarking Framework for LLM-based Quantum Software Debugging

QBugLM:基于LLM的量子软件调试的智能基准测试框架

An B. B. Pham, Hoa T. Nguyen, Muhammad Usman

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出QBugLM多智能体框架,自动化量子软件调试流程,通过案例研究评估LLM调试能力,发现迭代反馈显著提升修复成功率。

Comments This paper was accepted at IEEE QSW 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07237 2026-06-08 cs.CL cs.AI cs.LG 新提交 67%

When Large Language Models Fail in Healthcare: Evaluating Sensitivity to Prompt Variations

当大型语言模型在医疗保健中失败:评估对提示变化的敏感性

Mahdi Alkaeed

机构 * Department of Computer Science and Engineering, Doha, Qatar(计算机科学与工程系,多哈,卡塔尔)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究系统分析了通用和医学专用LLM对提示扰动的敏感性,发现即使是微小的措辞变化也可能改变临床建议,对抗性提示可能引发有害输出,表明这些模型在临床应用中不可靠。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14465 2026-08-17 cs.CL cs.LG 新提交 62%

You Only Pass Once: Answering and Abstaining Together in a Single Forward Pass of a Frozen Language Model

仅前向传播一次:在冻结语言模型的单次前向传播中同时完成回答与弃权(不执行)

Ziyang Luo, Zhongyao Chu, Xinjie He, Youting Wang, Xukui Qin, Runxiong Wu, Yan-Syuan Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出YOPO系统,通过训练小型网络重构残差流,在冻结Qwen2.5模型单次前向传播中同时实现回答、引导与弃权,性能优于两次前向传播基准,且在跨域等场景表现出色。

Comments 24 pages. Ziyang Luo and Zhongyao Chu contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13712 2026-08-17 cs.CY cs.AI cs.CL 新提交 62%

Reading Between The Lines: Modeling and Evaluating Behavioral Realism in Legal Simulation

字里行间:法律模拟中行为真实性的建模与评估

Divya Vetticaden, Arya Gupta, Julian Nyarko, Megan Ma

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出可控法律角色驱动的证词采集模拟器WitnessSim,采用分离行为真实性与教学实用性的评估框架,证实其行为保真度,为法律模拟性能评估提供框架。

Comments Accepted at ICML 2026 AI4Law. 47 pages, 26 tables, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13698 2026-08-17 cs.CL cs.LG 新提交 62%

GRPO Beyond English: A Large-Scale Study of GRPO in Non-English and Multilingual Settings

超越英语的GRPO:非英语与多语言场景下GRPO的大规模研究

Konstantin Dobler, Federico Scozzafava, Jonathan Janke, Mohamed Ali, Simon Lehnerer

机构 * Apple(苹果公司) Hasso Plattner Institute(哈索·普拉特纳研究所) ELLIS Unit Potsdam(波茨坦ELLIS单元)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对非英语及多语言场景开展GRPO大规模实证,发现母语训练推理与英语训练差距小、存在跨语言迁移但趋势依赖模型语言,指出非英语RLVR有跨语言增益但需全面评估退化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13558 2026-08-14 cs.AI cs.CL 新提交 62%

OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

OmniScientist:一种全模态全学科的AI科学家

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) University of Oxford(牛津大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出全模态AI科学家OmniScientist,通过端到端全模态流水线处理多学科异构原始证据,在36个真实案例中完成从原始数据到手稿的全流程,性能优于仅用预计算特征的系统,为通用AI科学家提供可行方案。

Comments 30 pages, 13 figures, 19 tables. Project page: https://omni-scientist.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12345 2026-08-14 cs.AI cs.CL 新提交 62%

Diagnostic Foundation for Evaluating LLMs' Research Integrity as Co-Scientists

评估大型语言模型作为合作科学家的研究完整性的诊断基础

Yash Tripathi, Silu Sharma, Sai Sidhanth Manoharan Jayanthi, Shivank Garg, Lin Li

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出IntegrityBench基准评估LLM作为合作科学家的研究完整性,发现前沿模型在峰值压力下约三分之一的完整性关键决策失败,存在助长不当行为和侵蚀AI辅助研究信任的风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12342 2026-08-14 cs.CL cs.LG 新提交 62%

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

大语言模型是可靠的评审者吗?面向金融文档错误检测的基准测试

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao, Zhixu Li

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) School of Data Science, Fudan University(复旦大学数据科学学院) Ant Group(蚂蚁集团) School of Information and School of Smart Governance, Renmin University of China(中国人民大学信息学院与智慧治理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文构建首个金融错误检测基准FinED-Bench,评估发现当前LLMs难胜任高复杂度金融文档错误检测任务,监督微调可提升弱模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12150 2026-08-13 cs.AI cs.CL 新提交 62%

Who Thinks Best Depends on How Long You Let Them: Budget-Dependent Rankings in LLM Evaluation

哪种模型表现最佳取决于你给的时间:大语言模型评估中依赖预算的排名

Rodrigo Guedes de Souza, Alison R. Panisson

机构 * Federal University of Santa Catarina (UFSC)(圣卡塔琳娜联邦大学(UFSC))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究通过调整 token 生成预算评估 4 个大语言模型在 3 个推理基准的表现,发现模型排名随预算变化反转,提出需采用预算条件化的评估协议。

Comments 19 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11775 2026-08-13 cs.AI cs.CL 新提交 62%

The Sleeping Agent: What Gist-Based Context Compression Loses and Why

休眠智能体:基于主旨的上下文压缩会丢失什么以及为什么

Nicholas E. Kyrkewood

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究以SWC为工具,发现主旨压缩对多跳推理等任务表现优于截断,但会损害时间相关问题的性能,通过修改提示可提升时间问题的评判准确率。

Comments 7 pages, 5 tables, appendices. Code and results at https://github.com/kyrkewood/sleeping-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11493 2026-08-13 cs.AI cs.LG 新提交 62%

From Prompting to Behavioral Alignment: Personalized LLM Judges for Recommendation Evaluation

从提示工程到行为对齐:用于推荐评估的个性化大语言模型评判者

Alireza S. Ziabari, Kat Ellis, Colleen Chan, Ding Tong

机构 * Netflix(网飞公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对离线推荐评估中LLM存在的双向合理化问题,提出序列行为对齐框架,经真实日志验证,其Macro-F1较零样本基线提升32.19%,可缓解失效模式且无需人工管道开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11244 2026-08-13 cs.AI cs.CL 新提交 62%

BEST-KAG: Enhancing Question Answering of Building Engineering Standards with Multimodal Knowledge Graph Modeling and Large Language Model

BEST-KAG:通过多模态知识图谱建模与大语言模型增强建筑工程标准的问答能力

Jia-Rui Lin, Junxi Guo, Keyin Chen, Peng Pan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出BEST-KAG框架,通过多模态知识图谱建模与大语言模型,解决建筑工程标准问答的现有局限,在相关评估指标上优于主流大语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10315 2026-08-12 cs.CL cs.AI 新提交 62%

Is This Your Final Answer? Cross-Contextual Consistency as a Measure of LLM Credibility

这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量

Siyang Wu, Yibo Jiang, Bryon Aragam

机构 * University of Chicago(芝加哥大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出用跨上下文一致性(C3)度量大语言模型可信度,通过对比26个模型在6个基准上的原始与扰动提示生成结果,发现C3可作为互补评估维度与基准有用性诊断工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10268 2026-08-12 cs.LG cs.AI cs.CY 新提交 62%

Toward Human Rights Benchmarking for LLMs: A Pilot Methodology

面向大语言模型的人权基准测试:一种试点方法

Savannah Thais, Wm. Matthew Kennedy, Abhigyan Acherjee, Matilda Wysocki, Malcolm Langford, Caitlin Kraft Buchman

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了首个经专家验证的人权基准HumRightsBench,调整IRAC框架为IRAP,通过真实场景测试LLMs的人权推理能力,发现模型准确率差异显著,可推动AI评估科学发展。

Comments Best paper, honorable mention, at the ICML 2026 Workshop on AI4Law, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09748 2026-08-11 cs.DC cs.AI cs.LG cs.LO cs.SY eess.SY 新提交 62%

Defining Decentralization: An Ontological Perspective

去中心化的定义:一种本体论视角

Jakub Kacper Szeląg, Aydin Abadi, Mohammad Naseri

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对计算机领域缺乏通用去中心化定义的问题,提出基于图的本体框架,区分去中心化与分布性,引入两个新指标并实现浏览器工具,为联邦学习等系统提供一致的去中心化评估基础。

Comments 27 pages, 6 figures, preparing for submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09393 2026-08-11 cs.CL cs.AI cs.IR 新提交 62%

Temporal Misgrounding in Legal RAG: A Versioned-Corpus Benchmark for French Tax Law

法律检索增强生成(RAG)中的时间错位:面向法国税法的版本化语料库基准

Rose Cymbler, Daniel Guez, Laurent Fabre

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对法律RAG的时间错位问题,构建法国税法版本化语料库基准FiscalQA Pro,发现现有模型时间推理能力差,端到端多版本检索器性能优异,还发布了相关数据集与代码。

Comments 13 pages, 1 figure, 4 tables. Accepted at the ICML 2026 Workshop on AI for Law (AI4Law), Seoul. Code and data: https://github.com/rosecymbler/fiscal-fr-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08634 2026-08-11 cs.AI cs.CL cs.IR q-fin.GN 新提交 62%

Can Open-Weight Models Compete on Financial Text Comprehension?

开源权重模型能在金融文本理解领域与(闭源)模型竞争吗?

Jan Spörer

机构 * University of St. Gallen(圣加仑大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 该研究更新了Financial Touchstone金融文本理解基准,测试了20款模型,发现开源权重模型Kimi K2.6准确率排第三,挑战了推理架构或闭源权重是金融理解前提的假设,还发现中国模型存在地缘政治内容过滤器拒绝合法金融问题的现象。

Comments To be presented at the workshop International Symposium on Large Language Models for Financial Services (FinLLM@IJCAI2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08176 2026-08-11 cs.AI cs.LG 新提交 62%

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

匹配监督与学生学习能力:一种用于在线自蒸馏的统一框架

Yongkang Yang, Zhezheng Hao, Hong Zhang, Yi Liu, Xiankun Lin, Wence Ji, Fanjunduo Wei, Jiarui Yu, Qiang Lin, Xiaoyun Liang, Hande Dong

机构 * Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文针对在线自蒸馏的次优问题,提出统一在线自蒸馏(USD)框架,该框架通过耦合学习难度预算与师生 divergence,在多模型规模及推理基准上均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07545 2026-08-11 cs.NE cs.AI cs.LG cs.SE 新提交 62%

DarwinX: Evolving Agent Harnesses Through Natural Selection

DarwinX:通过自然选择进化智能体控制程序

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang, Zhiyuan Hu, James Zhu, Phil Mui, Silvio Savarese, Ran Xu, Zeyuan Chen

专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 DarwinX是模型参数冻结时通过自然选择进化控制程序的方法,在四个基准中平均提升约17个百分点,控制程序可迁移,进化通用能力而非基准特定补丁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 62%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07418 2026-08-10 cs.AI cs.CL 新提交 62%

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

ResidencyRL:在模拟临床环境中开展的强化学习

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh, Min Woo Sun, Marius Guerard, Justin Chen, Dave Steiner, Vikram Dhillon, Ibrahim Azar, Akhil Mehta, Nicholas Spetsieris, Shilpan Shah, Maen Abdelrahim, Amit Dahiya, Yun Liu, Katherine Chou, Yossi Matias, Avinatan Hassidim, Dale R. Webster, Quoc V. Le, Raia Hadsell, Joelle Barral, Carey Radebaugh, Aleksandra Faust, Shekoofeh Azizi, Mike Schaekermann, Po-Hsuan Cameron Chen, Tao Tu, David Racz, Lin Yang

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院) Houston Methodist Hospital(休斯顿卫理公会医院) Trinity Health Group(三一健康集团) Stanford Oncology Partners(斯坦福肿瘤学伙伴) St. Luke Hospital(圣卢克医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出 ResidencyRL,通过多轮强化学习训练临床 AI 智能体,在模拟临床环境中提升诊断准确性、降低漏报率,且能力可迁移至多个医学基准测试,为临床 AI 发展提供了新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏