arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-24 至 2026-03-24 共收录 179 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 19 篇

2603.21024 2026-03-24 cs.IR 50%

Query, Decompose, Compress: Structured Query Expansion for Efficient Multi-Hop Retrieval

查询、分解、压缩:面向高效多跳检索的结构化查询扩展

JungMin Yun, YoungBin Kim

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出DeCoR框架,通过结构化信息精炼提升多跳检索效率,采用查询分解和文档压缩技术,使小模型在复杂检索中表现优于大模型。

Comments Accepted to CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 38 篇

2603.21705 2026-03-24 cs.LG 85%

Data-Free Layer-Adaptive Merging via Fisher Information for Long-to-Short Reasoning LLMs

无需数据的层自适应融合:通过信息论实现长到短推理LLM

Tian Xia

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出FIM-Merging方法,通过计算Fisher信息矩阵来分配每层融合系数,提升长到短推理LLM的性能,减少响应长度,且无需校准数据。

Comments 14 pages, NeurIPS 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11128 2026-03-24 cs.CL cs.AI 84%

Theory-Grounded Evaluation of Human-Like Fallacy Patterns in LLM Reasoning

基于理论的LLM推理中人类似 fallacy 模式的评估

Andrew Keenan Richardson, Ryan Othniel Kearns, Sean Moss, Vincent Wang-Mascianica, Philipp Koralus

机构 * The Laboratory for Human-Centered AI, Institute for Ethics in AI, Faculty of Philosophy, University of Oxford, UK(以人为中心的人工智能实验室,人工智能伦理研究所,哲学学院,牛津大学,英国) Oxford Internet Institute, University of Oxford, UK(牛津互联网研究所,牛津大学,英国) School of Computer Science, University of Birmingham, UK(计算机科学学院,伯明翰大学,英国)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过ETR理论和PyETR工具,评估LLM推理错误是否符合人类fallacy模式,发现模型能力与错误类型相关,且反转前提顺序可减少fallacy生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13232 2026-03-24 cs.CV cs.AI 83%

What "Not" to Detect: Negation-Aware VLMs via Structured Reasoning and Token Merging

不应检测什么:通过结构化推理和标记合并的否定意识VLMs

Inha Kang, Youngsun Lim, Seonho Lee, Jiho Choi, Junsuk Choe, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能实验室) Boston University(波士顿大学) Sogang University(成均馆大学)

专题命中 推理评测 :reasoning(title);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出CoVAND数据集和NegToMe模块,通过结构化推理和标记合并解决VLMs的否定理解问题,提升检测任务的准确率和泛化能力。

Comments 56 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20637 2026-03-24 cs.SE cs.AI cs.CR 83%

AEGIS: From Clues to Verdicts -- Graph-Guided Deep Vulnerability Reasoning via Dialectics and Meta-Auditing

AEGIS:从线索到结论——通过辩证法和元审计的图引导深度漏洞推理

Sen Fang, Weiyuan Ding, Zhezhen Cao, Zhou Yang, Bowen Xu

机构 * NC State University(北卡罗来纳州立大学) University of Alberta(阿尔伯塔大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 AEGIS通过图引导的深度漏洞推理,结合辩证法和元审计,解决LLM推理不严谨的问题,实现从线索到结论的验证,提升漏洞检测的准确性与可靠性。

Comments 29 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20899 2026-03-24 cs.CL cs.AI 82%

Mitigating Shortcut Reasoning in Language Models: A Gradient-Aware Training Approach

缓解语言模型中的捷径推理:一种梯度感知的训练方法

Hongyu Cao, Kunpeng Liu, Dongjie Wang, Yanjie Fu

机构 * Arizona State University(亚利桑那州立大学) Clemson University(克莱姆森大学) University of Kansas(堪萨斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SART框架,通过梯度感知技术检测并缓解语言模型中的捷径推理,实验显示在受控推理基准上提升准确率和鲁棒性。

Comments 12 pages, 2 figures. Preprint. Experiments on synthetic reasoning benchmarks. Code available

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21720 2026-03-24 cs.CL cs.AI 81%

SemEval-2026 Task 12: Abductive Event Reasoning: Towards Real-World Event Causal Inference for Large Language Models

SemEval-2026任务12:归纳事件推理:面向大规模语言模型的现实事件因果推断

Pengfei Cao, Mingxuan Yang, Yubo Chen, Chenlong Zhang, Mingxuan Liu, Kang Liu, Jun Zhao

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院,北京,中国) School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向现实事件因果推断的归纳事件推理任务,通过多选基准测试解决分布式证据、间接背景因素和语义相关但非因果干扰等挑战,评估了122个参与者的518份提交结果。

Comments 9 pages, 3 figures, semeval 2026 task 12 description paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01547 2026-03-24 cs.CV cs.AI cs.LG 81%

Vision-language models lag human performance on physical dynamics and intent reasoning

视觉-语言模型在物理动态和意图推理上仍逊于人类表现

Tianjun Gu, Jingyu Gong, Zhizhong Zhang, Yuan Xie, Lizhuang Ma, Xin Tan, Athanasios V

机构 * East China Normal University(东华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) University of Agder(阿格德大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21447 2026-03-24 cs.CY 78%

Deliberative multi-agent large language models improve clinical reasoning in ophthalmology

协商式多智能体大语言模型提升眼科临床推理

Ehsan Misaghi, Sean T Berkowitz, Bing Yu Chen, Qingyu Chen, Renaud Duval, Pearse A Keane, Danny A Mammo, Ariel Yuhan Ong, Mertcan Sevgi, Sumit Sharma, Sunil K Srivastava, Yih Chung Tham, Fares Antaki

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本研究比较了多智能体协商系统与单一模型在眼科临床推理中的表现,发现协商系统在准确性和安全性上均优于单一模型,且能减少有害错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21104 2026-03-24 cs.RO cs.CV 78%

CounterScene: Counterfactual Causal Reasoning in Generative World Models for Safety-Critical Closed-Loop Evaluation

CounterScene: 生成世界模型中的反事实因果推理用于安全关键闭环评估

Bowen Jing, Ruiyang Hao, Weitao Zhou, Haibao Yu

机构 * Tuojing Intelligence(途京智能) King's College London(伦敦大学国王学院) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 CounterScene通过结构化反事实推理生成安全关键驾驶场景,通过因果对抗代理识别和冲突感知交互世界模型,提升长周期碰撞率并保持轨迹真实性。

Comments 28 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11026 2026-03-24 cs.CV 78%

GIR-Bench: Versatile Benchmark for Generating Images with Reasoning

GIR-Bench:用于生成图像的多功能基准

Hongxiang Li, Yaowei Li, Bin Lin, Yuwei Niu, Yuhang Yang, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) Xiaohongshu Inc.(小红书公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出GIR-Bench,从理解-生成一致性、文本到图像生成和多步骤编辑三个角度评估统一模型,揭示其在复杂视觉任务中的表现与不足。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20969 2026-03-24 cs.LG cs.CL 76%

Understanding Contextual Recall in Transformers: How Finetuning Enables In-Context Reasoning over Pretraining Knowledge

理解Transformer中的上下文回忆:微调如何使模型在预训练知识上进行上下文推理

Bhavya Vasudeva, Puneesh Deora, Alberto Bietti, Vatsal Sharan, Christos Thrampoulidis

机构 * University of Southern California(南加州大学) University of British Columbia(不列颠哥伦比亚大学) Flatiron Institute(Flatiron研究所)

专题命中 推理评测 :reasoning(title);分类 cs.CL、cs.LG

AI总结 本文研究了Transformer模型在上下文学习中如何通过微调实现对预训练知识的推理,探讨了预训练和微调对上下文回忆能力的影响及机制。

Comments 28 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21251 2026-03-24 cs.NI eess.SP 75%

WirelessBench: A Tolerance-Aware LLM Agent Benchmark for Wireless Network Intelligence

WirelessBench: 一种面向无线网络智能的容忍感知LLM代理基准

Jingwen Tong, Fang Liu, Linkai Xv, Shiliang Lu, Kangqi Li, Yiqian Zhang, Yijie Song, Zeyang Xue, Jun Zhang

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 WirelessBench提出一种容忍感知的LLM无线代理基准,通过三层认知体系和三个设计原则,解决现有基准在连续故障和灾难性错误检测上的不足,提升无线网络管理的自主性。

Comments This paper is submitted to a possiable journal for publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11404 2026-03-24 cs.CV cs.AI 70%

Patho-R1: A Multimodal Reinforcement Learning-Based Pathology Expert Reasoner

Patho-R1: 基于多模态强化学习的病理专家推理器

Wenchuan Zhang, Penghao Zhang, Jingru Guo, Tao Cheng, Jie Chen, Shuwan Zhang, Zhang Zhang, Yuhao Yi, Hong Bu

机构 * Department of Pathology, West China Hospital, Sichuan University(四川大学华西医院病理科部门) Institute of Clinical Pathology, West China Hospital, Sichuan University(四川大学华西医院临床病理科研究所) University of Toronto(多伦多大学) Business School, Sichuan University(四川大学商学院) Department of Pathology, Shengjing Hospital of China Medical University(中国医科大学盛京医院病理科部门)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Patho-R1,通过构建高质量推理导向数据集,结合三阶段训练流程提升病理推理能力,实现跨模态任务的鲁棒性能。

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(33): 28418-28426, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20225 2026-03-24 cs.CY cs.AI 70%

The Arrival of AGI? When Expert Personas Exceed Expert Benchmarks

AGI的来临?专家人设是否超越专家基准?

Drake Mullens, Stella Shen

机构 * Tarleton State University(塔尔顿州立大学) University of Texas at Tyler(德克萨斯大学泰勒分校)

专题命中 推理评测 :reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 研究探讨专家人设是否能提升语言模型性能,发现其效果受多种机制限制,通过控制实验揭示了人设在特定任务中的表现及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19220 2026-03-24 cs.CL cs.AI cs.LG 67%

Nemotron-Cascade 2: Post-Training LLMs with Cascade RL and Multi-Domain On-Policy Distillation

Nemotron-Cascade 2:基于级联强化学习和多领域在线蒸馏的后训练大语言模型

Zhuolin Yang, Zihan Liu, Yang Chen, Wenliang Dai, Boxin Wang, Sheng-Chieh Lin, Chankyu Lee, Yangyi Chen, Dongfu Jiang, Jiafan He, Renjie Pi, Grace Lam, Nayeon Lee, Alexander Bukharin, Mohammad Shoeybi, Bryan Catanzaro, Wei Ping

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Nemotron-Cascade 2是一款30B MoE模型,通过级联强化学习和多领域在线蒸馏提升推理和智能体能力,在2025年国际数学奥林匹克竞赛、国际信息学奥林匹克竞赛和ICPC世界总决赛中达到金奖水平,参数更少性能更强。

Comments We release the model and data at https://huggingface.co/collections/nvidia/nemotron-cascade-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20009 2026-03-24 cs.CL cs.AI cs.LG 67%

LinguaMap: Which Layers of LLMs Speak Your Language and How to Tune Them?

LinguaMap:哪些LLM层说你的语言以及如何调节它们?

J. Ben Tamo, Daniel Carlander-Reuterfelt, Jonathan Rubin, Dezhi Hong, Mingxian Wang, Oleg Poliannikov

机构 * Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LinguaMap方法,通过分析LLM各层的语言控制机制,发现语言一致性瓶颈并提出选择性微调策略,实现多语言适应的高效优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23455 2026-03-24 cs.LG cs.AI cs.CY 62%

The Price of Progress: Price Performance and the Future of AI

进步的价格:价格性能与AI的未来

Hans Gundlach, Jayson Lynch, Matthias Mertens, Neil Thompson

机构 * MIT FutureTech, CSAIL, Cambridge, MA, USA(麻省理工学院未来科技、计算机科学与人工智能实验室,马萨诸塞州剑桥市) MIT FutureTech, Sloan, Cambridge, MA, USA(麻省理工学院未来科技、斯隆管理学院,马萨诸塞州剑桥市)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了AI模型在基准测试中的性能与成本关系,发现价格性能显著下降,但前沿模型运行成本因模型规模和推理需求增加而上升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21415 2026-03-24 cs.AI cs.CR cs.LG 62%

Silent Commitment Failure in Instruction-Tuned Language Models: Evidence of Governability Divergence Across Architectures

指令调优语言模型中的沉默承诺失败:跨架构可控性分歧的证据

Gregory M. Ruddell

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现指令遵循模型在冲突检测中存在沉默承诺失败,可控性差异显著,且基准准确度无法预测可控性,提示可控性在预训练阶段固定。

Comments 39 pages, 5 figures, 5 tables. Preprint. Submitted to NIST CAISI (Docket NIST-2025-0035, March 2026). Also available on Zenodo: https://doi.org/10.5281/zenodo.18971110

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20799 2026-03-24 cs.CL cs.LG 62%

RLVR Training of LLMs Does Not Improve Thinking Ability for General QA: Evaluation Method and a Simple Solution

基于可验证奖励的强化学习训练不会提升大语言模型的通用问答能力:评估方法和一个简单解决方案

Kaiyuan Li, Jing-Cheng Pang, Yang Yu

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文评估了基于可验证奖励的强化学习是否能提升大语言模型在通用问答任务中的推理能力,发现其效果不如可验证任务,并提出START方法提升问答质量和回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27543 2026-03-24 cs.CL cs.AI 62%

DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models

阿拉伯方言MMLU:评估阿拉伯语和多语言模型在阿拉伯方言上的能力

Malik H. Altakrori, Nizar Habash, Abed Alhakim Freihat, Younes Samih, Kirill Chirkunov, Muhammed AbuOdeh, Radu Florian, Teresa Lynn, Preslav Nakov, Alham Fikri Aji

机构 * IBM Research AI(IBM人工智能研究院) New York University Abu Dhabi(纽约大学迪拜分校) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出阿拉伯方言MMLU基准,通过手动翻译和适应3000个多项选择题答案对至五个主要方言,评估大语言模型在阿拉伯方言上的推理和理解能力,揭示方言泛化中的持续差距。

Comments 9 pages, 10 tables, accepted to LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 57%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03235 2026-03-24 cs.AI 57%

From Five Dimensions to Many: Large Language Models as Precise and Interpretable Psychological Profilers

从五维到更多:大型语言模型作为精确且可解释的心理档案师

Yi-Fei Liu, Yi-Long Lu, Di He, Hang Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了大型语言模型能否通过少量量化输入建模人类心理特质的相关结构,发现其在零样本情况下能准确预测心理特质,揭示了LLM通过抽象和推理实现精确预测的机制。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21329 2026-03-24 cs.IR cs.AI 57%

COINBench: Moving Beyond Individual Perspectives to Collective Intent Understanding

COINBench: 超越个体视角到集体意图理解

Xiaozhe Li, Tianyi Lyu, Siyi Yang, Yizhao Yang, Yuxi Gong, Jinxuan Huang, Ligao Zhang, Zhuoyi Huang, Qingwen Liu

机构 * Tongji University(同济大学) Stanford University(斯坦福大学) CurrentsAI Research(CurrentsAI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 COINBench通过动态实时更新的基准测试,评估大语言模型在消费者领域集体意图理解能力,揭示当前模型在复杂意图合成分析深度上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21280 2026-03-24 cs.CY cs.AI 57%

WARBENCH: A Comprehensive Benchmark for Evaluating LLMs in Military Decision-Making

WARBENCH:评估大语言模型在军事决策中的综合基准

Zongjie Li, Chaozheng Wang, Yuchong Xie, Pingchuan Ma, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) Chinese University of Hong Kong(香港中文大学) Zhejiang University of Technology(浙江工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出WARBENCH基准,揭示现有大语言模型在军事决策中存在结构性缺陷,包括战术推理崩溃、法律违规率高、量化降维导致性能下降等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21248 2026-03-24 cs.CL cs.IR 57%

Graph Fusion Across Languages using Large Language Models

跨语言图融合使用大型语言模型

Kaung Myat Kyaw, Khush Agarwal, Jonathan Chan

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出利用大型语言模型进行跨语言图融合框架,通过结构线性化和语义优先级解决多语言知识图谱融合问题,展示了LLM在跨语言知识整合中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20808 2026-03-24 cs.CV cs.LG 57%

Predictive Regularization Against Visual Representation Degradation in Multimodal Large Language Models

预测正则化对抗多模态大语言模型中的视觉表征退化

Enguang Wang, Qiang Wang, Yuanchen Wu, Ke Yan, Xinbin Yuan, Shouhong Ding, Xialei Liu, Ming-Ming Cheng

机构 * NKIARI VCIP, CS, Nankai University(VCIP计算机科学系,南开大学) AAIS, Nankai University(AAIS,南开大学) Tencent Youtu Lab(腾讯优设实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文研究多模态大语言模型中的视觉表征退化问题,提出预测正则化方法以维持视觉表征,提升视觉语言性能。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20807 2026-03-24 cs.CL 57%

BenchBench: Benchmarking Automated Benchmark Generation

BenchBench:自动化基准生成的评估

Yandan Zheng, Haoran Luo, Zhenghong Lin, Wenjin Liu, Luu Anh Tuan

机构 * Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 BenchBench通过三阶段流程评估自动化基准生成能力,生成16.7K问题并评估模型-问题响应质量,揭示基准设计与回答能力的弱相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10218 2026-03-24 cs.AR cs.LG 57%

ACE-RTL: When Agentic Context Evolution Meets RTL-Specialized LLMs

ACE-RTL:当代理上下文进化与专为RTL设计的LLM相遇

Chenhui Deng, Zhongzhi Yu, Guan-Ting Liu, Nathaniel Pinckney, Brucek Khailany, Haoxing Ren

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 ACE-RTL结合代理上下文进化与专为RTL设计的LLM,通过生成器、反射器和协调器三部分提升RTL代码的正确性,实现41.02%的通过率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏