arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 1976 信号源:cs.CL, cs.AI, cs.LG

1. 测试时计算 1976 篇

2510.09599 2025-10-13 cs.CL cs.AI cs.LG 85%

Prompting Test-Time Scaling Is A Strong LLM Reasoning Data Augmentation

Sondos Mahmoud Bsharat, Zhiqiang Shen

机构 * MBZUAI

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Our code and data are available at https://github.com/VILA-Lab/PTTS

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21268 2025-09-26 cs.CV 85%

MMR1: Enhancing Multimodal Reasoning with Variance-Aware Sampling and Open Resources

Sicong Leng, Jing Wang, Jiaxi Li, Hao Zhang, Zhiqiang Hu, Boqiang Zhang, Yuming Jiang, Hang Zhang, Xin Li, Lidong Bing, Deli Zhao, Wei Lu, Yu Rong, Aixin Sun, Shijian Lu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15882 2025-09-26 cs.LG cs.AI cs.CL eess.SP 85%

Fractional Reasoning via Latent Steering Vectors Improves Inference Time Compute

Sheng Liu, Tianlang Chen, Pan Lu, Haotian Ye, Yizheng Chen, Lei Xing, James Zou

机构 * Stanford University(斯坦福大学)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 18 pages, 5 figures, Project website: https://shengliu66.github.io/fractreason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09864 2025-09-15 cs.LG cs.AI cs.CL 85%

Latency and Token-Aware Test-Time Compute

Jenny Y. Huang, Mehul Damani, Yousef El-Kurdi, Ramon Astudillo, Wei Sun

机构 * Department of Electrical Engineering and Computer Science, MIT(麻省理工学院电气工程与计算机科学系) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16022 2025-09-04 cs.CL cs.AI cs.LG 85%

NOVER: Incentive Training for Language Models via Verifier-Free Reinforcement Learning

Wei Liu, Siya Qi, Xinyu Wang, Chen Qian, Yali Du, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 20 pages, 5 tables, 12 figures. accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16043 2025-06-23 cs.CL cs.AI cs.LG 85%

DynScaling: Efficient Verifier-free Inference Scaling via Dynamic and Integrated Sampling

Fei Wang, Xingchen Wan, Ruoxi Sun, Jiefeng Chen, Sercan Ö. Arık

机构 * Google(谷歌)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05315 2025-05-22 cs.LG cs.AI cs.CL 85%

Scalable Chain of Thoughts via Elastic Reasoning

Yuhui Xu, Hanze Dong, Lei Wang, Doyen Sahoo, Junnan Li, Caiming Xiong

机构 * Salesforce AI Research(Salesforce人工智能研究)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02388 2024-04-02 cs.CL cs.AI cs.LG cs.SE 85%

Solution-oriented Agent-based Models Generation with Verifier-assisted Iterative In-context Learning

Tong Niu, Weihao Zhang, Rong Zhao

专题命中 测试时计算 :verifier(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Journal ref International Conference on Autonomous Agents and Multiagent Systems 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11549 2026-03-24 cs.LG cs.AI 84%

Native Reasoning Models: Training Language Models to Reason on Unverifiable Data

原生推理模型:训练语言模型在不可验证数据上进行推理

Yuanfu Wang, Zhixuan Liu, Xiangtian Li, Chaochao Lu, Chao Yang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NRT框架,通过让模型自行生成推理轨迹,无需专家示范,提升推理能力,实验证明其在复杂推理任务中表现优异,具有鲁棒性和可扩展性。

Comments Accepted at ICLR 2026. Code available at https://github.com/sharkwyf/native-reasoning-models

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15466 2025-08-19 cs.AI cs.CL 84%

Learning Adaptive Parallel Reasoning with Language Models

Jiayi Pan, Xiuyu Li, Long Lian, Charlie Snell, Yifei Zhou, Adam Yala, Trevor Darrell, Kurt Keutzer, Alane Suhr

机构 * UC Berkeley(加州大学伯克利分校) UCSF(旧金山大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

Comments Accepted at COLM 2025. Code, model, and data are available at https://github.com/Parallel-Reasoning/APR. The first three authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14004 2026-05-19 cs.CL 84%

Early Stopping Chain-of-thoughts in Large Language Models

大语言模型中的早期停止思维链

Minjia Mao, Bowen Yin, Yu Zhu, Xiao Fang

机构 * University of Delaware(德克萨斯大学) Peking University(北京大学)

专题命中 测试时计算 :CoT(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11994 2026-08-13 cs.AI cs.CL 新提交 84%

Claim-Level Reliability Assessment for Efficient Test-Time Reasoning

面向高效测试时推理的声明级可靠性评估

Sen Xu, Wei Wang, Shixi Liu, Jixin Min, Yingwei Dai, Zhibin Yin, Yirong Chen, Junlin Zhang

机构 * Sina Weibo Inc.(新浪微博公司)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无需训练的CLR框架,将测试时计算从解决方案采样重分配至声明级语义证伪,在匹配预算下于四个LLM及四个推理基准上提升了推理性能,减少了标记使用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04962 2026-08-06 cs.LG cs.CL 新提交 84%

SpecRoll: Fast-Slow Verifier-Feedback Adaptation for Speculative Reinforcement Learning Rollouts

SpecRoll:用于投机强化学习rollout的快慢校验器反馈自适应方法

Nhat Minh Pham, Duy Tung Doan, Thi Duyen Ngo, Vinh Van Nguyen, Khac-Hoai Nam Bui

机构 * VNU University of Engineering and Technology(越南国家大学河内理工大学) Viettel AI(越南电信人工智能公司)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SpecRoll是一种投机强化学习rollout引擎,通过快慢双时间尺度自适应结合相关校验机制,在5个1.5B-14B模型和3个数学推理数据集上,相比普通GRPO和FastGRPO实现了生成与端到端速度的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10139 2026-07-21 cs.LG cs.AI 版本更新 84%

LLMs as a Jury: Cross-Model Consensus Can Outperform Process Reward Models for LLM Reasoning

作为陪审团的语言模型:跨模型共识在语言模型推理方面可超越过程奖励模型

Ning Liu

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究在语言模型推理中从候选推理链选正确答案的问题,提出跨模型共识方法,将其视为语言模型陪审团,通过错误去相关机制工作,在多个基准测试中表现出色,能预先表征,有定律和下限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26366 2026-07-10 cs.AI cs.CL cs.CY 新提交 84%

Narration-of-Thought: Inference-Time Scaffolding for Defeasible Ethical Reasoning in Large Language Models

思维叙述:大型语言模型中可废止伦理推理的推理时支架

Patrick Cooper, Alvaro Velasquez

机构 * Department of Computer Science(计算机科学系) University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 测试时计算 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 针对道德困境中标准思维链的两种失败模式,提出思维叙述(NoT)系统提示,将思维链结构化为五个部分,无需训练即可大幅减少利益相关者崩溃和不确定性抑制,并通过消融实验和跨家族训练法官验证其有效性。

Comments 24 pages, 8 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12309 2026-07-01 cs.LG cs.AI stat.ML 版本更新 84%

Optimal Self-Consistency for Efficient Reasoning with Large Language Models

最优自一致性:用于大语言模型高效推理

Austin Feng, Marius Alonso, Ambroise Odonnat, Vasilii Feofanov, Ievgen Redko

机构 * Yale University(耶鲁大学) Inria(法国国家信息与自动化研究所) com(42.com)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文分析自一致性(SC)的缩放行为,提出动态分配样本的Blend-ASC变体,平均减少4.8倍样本量,实现最先进的样本效率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29225 2026-06-30 cs.AI cs.CL 84%

PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

PolicyGuard: 一种基于对话的子代理验证器,用于确保LLM代理遵循策略

Seongjae Kang, Taehyung Yu, Sung Ju Hwang

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出PolicyGuard子代理验证器,通过共享对话上下文、策略推理和可操作反馈,在tau²-BENCH航空数据集上使PASS4提升12个百分点,同时误拦率降低约一半。

Comments 20 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21777 2026-06-23 cs.CL cs.AI 新提交 84%

CalVerT: Augmenting Agents with Calibrated Verifier Telemetry Improves Action and Learning in Knowledge-Intensive Tasks

CalVerT: 通过校准验证器遥测增强智能体在知识密集型任务中的行动与学习

Ashwin Vinod, Ying Ding, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出CalVerT方法,通过向智能体状态添加校准的自信心分数和基础验证器分数,减少过度依赖参数知识或冗余检索,提升知识密集型问答的准确性和效率。

Comments Code: https://github.com/ashwinn-v/CalVerT

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12279 2026-06-16 cs.CV cs.AI cs.LG 版本更新 84%

UniT: Unified Multimodal Chain-of-Thought Test-time Scaling

UniT:统一多模态思维链测试时扩展

Leon Liangyu Chen, Haoyu Ma, Zhipeng Fan, Ziqi Huang, Animesh Sinha, Xiaoliang Dai, Jialiang Wang, Zecheng He, Jianwei Yang, Chunyuan Li, Junzhe Sun, Chu Wang, Serena Yeung-Levy, Felix Juefei-Xu

机构 * Stanford University(斯坦福大学) Meta Superintelligence Labs(Meta超级智能实验室) Nanyang Technological University(南洋理工大学)

专题命中 测试时计算 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 提出UniT框架,通过多轮推理、验证和细化实现统一多模态模型的测试时扩展,实验表明短推理轨迹可泛化到长链,顺序思维链比并行采样更高效。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09926 2026-06-10 cs.LG cs.AI 新提交 84%

Sample Where You Struggle: Sharpening Base Model Reasoning via Entropy-Guided Power Sampling

在你挣扎处采样:通过熵引导的幂采样增强基础模型推理

Hong Guo, Nianhui Guo, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institut(霍普夫纳研究所) German University of Digital Science(德国数字科学大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 提出熵引导的幂采样(EGPS),一种无需训练和验证器的采样方法,通过利用前向传播中的token级熵将MCMC移动定位到高熵区域,在多个基准上以高达12.6倍加速达到最优或并列最优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21667 2026-06-05 cs.LG cs.AI 84%

Escaping the Verifier: Learning to Reason via Demonstrations

摆脱验证者:通过示范学习推理

Locke Cai, Max Ryabinin, Ivan Provilkov

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 测试时计算 :verifier(title,abstract);reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RARO方法,通过逆强化学习从专家示范中学习强大的推理能力,无需任务特定的验证者,从而在多个评估任务中实现了显著的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03969 2026-06-03 cs.CL cs.AI 84%

Quantifying Faithful Confidence Expression in Large Reasoning Models

量化大型推理模型中的忠实置信表达

Areeb Gani, Asal Meskin, Gabrielle Kaili-May Liu, Arman Cohan

机构 * Yale University(耶鲁大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)在长链思维输出中难以忠实表达内在置信度的问题,提出基于令牌概率、隐藏状态和响应一致性的框架,系统量化其语言决断性与内部不确定性之间的对齐程度。

Comments Code: https://github.com/yale-nlp/faithful_lrm

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06960 2026-06-03 cs.CL cs.AI 84%

InftyThink+: Effective and Efficient Infinite-Horizon Reasoning via Reinforcement Learning

InftyThink+:通过强化学习实现高效且有效的无限时域推理

Yuchen Yan, Liang Jiang, Jin Jiang, Shuaicheng Li, Zujie Wen, Zhiqiang Zhang, Jun Zhou, Jian Shao, Yueting Zhuang, Yongliang Shen

机构 * Tsinghua University(清华大学)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出InftyThink+框架,通过强化学习优化迭代推理的总结时机、保留内容和恢复策略,在DeepSeek-R1-Distill-Qwen-1.5B上提升AIME24准确率21%,并降低推理延迟。

Comments ICML 2026: https://openreview.net/forum?id=tyul8kXaJU Project Page: https://zju-real.github.io/InftyThink-Plus Code: https://github.com/ZJU-REAL/InftyThink-Plus Models: https://huggingface.co/collections/yanyc/inftythink

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11374 2026-06-02 cs.LG cs.CL cs.IR 84%

Test-Time Compute for Frozen Embedding Models through Agentic Program Search

冻结嵌入模型在测试时通过智能体程序搜索的计算

Han Xiao

机构 * Jina AI by Elastic(Jina AI 由 Elastic 提供)

专题命中 测试时计算 :test-time compute(title,abstract);reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种智能体程序搜索方法,通过大语言模型编写程序操作冻结编码器API,在推理时提升小嵌入模型的检索质量,无需训练参数且跨任务迁移。

Comments 15 pages, 7 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17045 2026-06-02 cs.CV cs.AI cs.LG 84%

Video Reasoning without Training

无需训练的视频推理

Deepak Sridhar, Kartikeya Bhardwaj, Jeya Pradha Jeyaraj, Nuno Vasconcelos, Ankita Nayak, Harris Teague

机构 * Qualcomm AI Research(高通AI研究) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出V-Reason方法,利用输出分布熵作为信号,通过轻量级控制器在推理时自适应调整值缓存,无需强化学习或微调即可提升视频推理性能。

Comments CVPR Findings 2026. Project Page https://deepaksridhar.github.io/vreason.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04718 2026-06-02 cs.CL cs.AI 84%

T1: Tool-integrated Verification for Test-time Compute Scaling in Small Language Models

T1:小语言模型测试时计算扩展的工具集成验证

Minki Kang, Jongwon Jeong, Jaewoong Cho

机构 * KAIST(韩国科学技术院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) KRAFTON

专题命中 测试时计算 :test-time compute(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对小语言模型在测试时扩展中验证能力不足的问题,提出T1框架,通过外部工具过滤候选输出后由小语言模型进行最终验证,显著提升验证准确率和测试时扩展性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30343 2026-05-29 cs.CL cs.AI 84%

Unlocking the Working Memory of Large Language Models for Latent Reasoning

解锁大型语言模型的工作记忆以实现潜在推理

Lukas Aichberger, Sepp Hochreiter

机构 * ELLIS Unit Linz and LIT AI Lab, Institute for Machine Learning, Johannes Kepler University Linz, Austria(林茨ELLIS单元和LIT AI实验室,机器学习研究所,约翰·凯撒大学林茨,奥地利) NXAI GmbH, Linz, Austria(NXAI公司,林茨,奥地利)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);分类 cs.CL、cs.AI

AI总结 提出一种名为RiM的潜在推理方法,通过固定记忆块替代自回归生成中间推理步骤,在单次前向传播中实现计算高效的潜在推理。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12576 2026-05-26 cs.CL cs.AI 84%

Coupled Variational Reinforcement Learning for Language Model General Reasoning

耦合变分强化学习用于语言模型通用推理

Xueru Wen, Jie Lou, Yanjiang Liu, Hongyu Lin, Ben He, Xianpei Han, Le Sun, Yaojie Lu, Debing Zhang

机构 * Chinese Information Processing Laboratory, Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所信息处理实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 提出CoVRL方法,通过混合采样策略耦合先验和后验分布,将变分推理与强化学习结合,以解决无验证器强化学习中探索效率低和推理轨迹与答案不一致的问题,在数学和通用推理基准上提升性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08028 2026-05-21 cs.CL cs.AI 84%

Diverge to Induce Prompting: Multi-Rationale Induction for Zero-Shot Reasoning

偏离以诱导提示:多理性诱导用于零样本推理

Po-Chun Chen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University, Taiwan(国家台湾大学计算机科学与信息工程系) Institute of Information Science, Academia Sinica, Taiwan(学术院信息科学研究所) AI Research Center (AINTU), National Taiwan University, Taiwan(国家台湾大学人工智能研究中心(AINTU))

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DIP框架,通过生成多个多样化的高层理由并诱导最终计划,以提升零样本推理的准确性,克服了传统链式思考提示中推理路径不稳定的问题。

Comments Accepted to Findings of IJCNLP-AACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07292 2026-05-19 cs.AI cs.CL cs.CV 84%

EndoCogniAgent: Closed-Loop Agentic Reasoning with Self-Consistency Validation for Endoscopic Diagnosis

EndoCogniAgent: 闭环代理推理与自我一致性验证用于内窥镜诊断

Yi Tang, Kai-Ni Wang, Yang Chen, Xiaopu He, Guangquan Zhou

机构 * School of Biological Science and Medical Engineering, Southeast University(东南大学生物科学与医学工程学院) Jiangsu Key Laboratory of Biomaterials and Devices, Southeast University(江苏省生物材料与器件重点实验室) State Key Laboratory of Digital Medical Engineering, Southeast University(国家数字医学工程重点实验室) The First Affiliated Hospital of Nanjing Medical University(南京医科大学第一附属医院) Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Jiangsu Provincial Joint International Research Laboratory of Medical Information Processing(江苏省联合国际医学信息处理联合实验室) Laboratory of Image Science and Technology, the School of Computer Science and Engineering, Southeast University(图像科学与技术实验室,东南大学计算机科学与工程学院)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出EndoCogniAgent框架,通过闭环代理推理和自我一致性验证提升内窥镜诊断的准确性与可靠性,其核心方法是将诊断过程建模为受控状态更新过程,并引入EndoAgentBench基准进行评估。

Comments 10 pages, 8 figures, 2 tables. Revised version with major updates on methodology and extended evaluation on EndoAgentBench. Code and data are available at https://github.com/Tyyds-ai/EndoCogniAgent

详情

展开后加载摘要…

URL PDF HTML 收藏