arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2602.13313 2026-02-17 cs.CV cs.AI 79%

Agentic Spatio-Temporal Grounding via Collaborative Reasoning

基于协作推理的代理时空 grounding

Heng Zhao, Yew-Soon Ong, Joey Tianyi Zhou

机构 * CFAR, IHPC, Agency for Science, Technology and Research(A*STAR)(CFAR、IHPC、新加坡科技研究局) CCDS, Nanyang Technological University(CCDS、南洋理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ASTG框架,通过协作推理实现开放世界下的时空视频grounding,提升检索效率并优于现有弱监督和零样本方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10246 2026-02-16 cs.DC cs.AI 79%

KORAL: Knowledge Graph Guided LLM Reasoning for SSD Operational Analysis

KORAL: 基于知识图谱的LLM推理用于SSD运维分析

Mayur Akewar, Sandeep Madireddy, Dongsheng Luo, Janki Bhimani

机构 * Florida International University, Miami, FL, USA(佛罗里达国际大学) Argonne National Laboratory, Lemont, IL, USA(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 KORAL结合LLM和知识图谱,实现SSD的端到端推理分析,提供专家级诊断和可解释的运维建议。

Journal ref Proc. IEEE International Parallel and Distributed Processing Symposium (IPDPS), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14746 2026-02-16 cs.LG 79%

MissionHD: Hyperdimensional Refinement of Distribution-Deficient Reasoning Graphs for Video Anomaly Detection

MissionHD: 分布匮乏的推理图超维度细化用于视频异常检测

Sanggeon Yun, Raheeb Hassan, Ryozo Masukawa, Nathaniel D. Bastian, Mohsen Imani

机构 * Department of Computer Science University of California, Irvine(计算机科学系加州大学伊维奇分校) Department of Electrical Engineering & Computer Science United States Military Academy, West Point(电气工程与计算机科学系美国军事学院西点分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 MissionHD通过超维度计算优化任务对齐的图表示,提升视频异常检测与识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12405 2026-02-16 cs.RO cs.LG 79%

Self-Refining Vision Language Model for Robotic Failure Detection and Reasoning

自适应多任务视觉语言模型用于机器人故障检测与推理

Carl Qi, Xiaojie Wang, Silong Yong, Stephen Sheng, Huitan Mao, Sriram Srinivasan, Manikantan Nambi, Amy Zhang, Yesh Dattatreya

机构 * UT Austin(德克萨斯大学) Amazon Robotics(亚马逊机器人技术) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 ARMOR是一种自适应多任务视觉语言模型,通过多任务自 refinement 过程提升机器人故障检测与推理性能,实现故障检测率提升30%和推理表现提升100%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15414 2026-02-13 cs.AI 79%

MARSHAL: Incentivizing Multi-Agent Reasoning via Self-Play with Strategic LLMs

通过战略性大语言模型的自我对战激励多智能体推理的MARSHAL

Huining Yuan, Zelai Xu, Zheyue Tan, Xiangmin Yi, Mo Guang, Kaiwen Long, Haojia Hui, Boxun Li, Xinlei Chen, Bo Zhao, Xiao-Ping Zhang, Chao Yu, Yu Wang

机构 * SIGS, Tsinghua University(清华大学信号与系统系) EE, Tsinghua University(清华大学电子工程系) Aalto University(阿alto大学) Li Auto Inc.(李汽车公司) Infinigence AI Project Page Code Models(Infinigence AI项目页面代码模型)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MARSHAL通过战略性LLM的自我对战激励多智能体推理,实现多智能体系统的性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11451 2026-02-13 cs.CL 79%

LoopFormer: Elastic-Depth Looped Transformers for Latent Reasoning via Shortcut Modulation

LoopFormer: 基于快捷键调制的弹性深度循环变换器用于潜在推理

Ahmadreza Jeddi, Marco Ciccone, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University Health Network(大学健康网络)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 LoopFormer通过弹性深度循环变换器实现基于快捷键调制的潜在推理,具备适应不同计算预算的鲁棒性与扩展性。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10787 2026-02-12 cs.SE cs.AI cs.CR cs.IR 79%

VulReaD: Knowledge-Graph-guided Software Vulnerability Reasoning and Detection

VulReaD: 基于知识图谱的软件漏洞推理与检测

Samal Mukhtar, Yinghua Yao, Zhu Sun, Mustafa Mustafa, Yew Soon Ong, Youcheng Sun

机构 * The University of Manchester(曼彻斯特大学) Agency for Science, Technology and Research(科技研究局) Singapore University of Technology and Design(新加坡科技设计大学) Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 VulReaD通过知识图谱引导的推理方法,在软件漏洞检测中实现CWE级别的分类,提升二元和多类检测性能,增强可解释性。

Comments 22 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10575 2026-02-12 cs.CV cs.AI cs.CY 79%

MetaphorStar: Image Metaphor Understanding and Reasoning with End-to-End Visual Reinforcement Learning

MetaphorStar: 基于端到端视觉强化学习的图像隐喻理解与推理

Chenhao Zhang, Yazhe Niu, Hongsheng Li

机构 * Shanghai AI Laboratory(上海人工智能实验室) Huazhong University of Science and Technology(华中科技大学) The Chinese University of Hong Kong MMLab(香港中文大学MMLab)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MetaphorStar通过端到端视觉强化学习框架提升图像隐喻理解与推理能力,显著优于现有模型。

Comments 14 pages, 4 figures, 11 tables; Code: https://github.com/MING-ZCH/MetaphorStar, Model & Dataset: https://huggingface.co/collections/MING-ZCH/metaphorstar

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10210 2026-02-12 cs.LG 79%

How Much Reasoning Do Retrieval-Augmented Models Add beyond LLMs? A Benchmarking Framework for Multi-Hop Inference over Hybrid Knowledge

检索增强模型在大语言模型之上添加多少推理能力?一种用于混合知识多跳推理的基准评估框架

Junhong Lin, Bing Zhang, Song Wang, Ziyan Liu, Dan Gutfreund, Julian Shun, Yada Zhu

机构 * Massachusetts Institute of Technology(麻省理工学院) IBM Research(IBM研究院) University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 HybridRAG-Bench通过混合知识和多跳推理评估框架,有效区分真实检索与参数回忆,为混合知识增强推理系统提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20022 2026-02-12 cs.CV cs.AI 79%

WaymoQA: A Multi-View Visual Question Answering Dataset for Safety-Critical Reasoning in Autonomous Driving

WaymoQA: 一个用于自动驾驶安全关键推理的多视角视觉问答数据集

Seungjun Yu, Seonho Lee, Namho Kim, Jaeyo Shin, Junsung Park, Wonjeong Ryu, Raehyuk Jung, Hyunjung Shim

机构 * Hanyang University(翰阳大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 WaymoQA通过多视角输入提升自动驾驶的安全关键推理能力,提供35,000个标注问题-答案对,显著增强大语言模型的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17667 2026-02-12 cs.AI 79%

PhysUniBench: A Multi-Modal Physics Reasoning Benchmark at Undergraduate Level

PhysUniBench: 一个面向本科生层面的多模态物理推理基准测试

Lintao Wang, Encheng Su, Jiaqi Liu, Pengze Li, Jiabei Xiao, Wenlong Zhang, Xinnan Dai, Xi Chen, Yuan Meng, Lei Bai, Wanli Ouyang, Shixiang Tang, Aoran Wang, Xinzhu Ma

机构 * The University of Sydney(悉尼大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Michigan State University(密歇根州立大学) Tsinghua University(清华大学) Beihang University(北航大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 PhysUniBench是一个面向本科生层面的多模态物理推理基准测试,旨在评估和提升多模态大语言模型在物理问题上的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10092 2026-02-11 cs.CL 79%

Quantum-Audit: Evaluating the Reasoning Limits of LLMs on Quantum Computing

量子审计:评估大语言模型在量子计算上的推理极限

Mohamed Afane, Kayla Laufer, Wenqi Wei, Ying Mao, Junaid Farooq, Ying Wang, Juntao Chen

机构 * Fordham University(福特汉姆大学) University of Michigan-Dearborn(密歇根大学-迪尔本分校) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 Quantum-Audit通过2700个问题评估大语言模型在量子计算概念理解上的推理能力,发现顶级模型在专家问题上表现不如LLM生成问题,且在高级主题上准确率显著下降。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09147 2026-02-11 cs.CL 79%

Overview of PAN 2026: Voight-Kampff Generative AI Detection, Text Watermarking, Multi-Author Writing Style Analysis, Generative Plagiarism Detection, and Reasoning Trajectory Detection

PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测

Janek Bevendorff, Maik Fröbe, André Greiner-Petter, Andreas Jakoby, Maximilian Mayerl, Preslav Nakov, Henry Plutz, Martin Potthast, Benno Stein, Minh Ngoc Ta, Yuxia Wang, Eva Zangerle

机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) University of Applied Sciences BFI(应用科学大学BFI) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) University of Kassel(卡塞尔大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) University of Innsbruck(因斯布鲁克大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08321 2026-02-11 cs.CL 79%

Improving Data and Reward Design for Scientific Reasoning in Large Language Models

改进大型语言模型中的数据与奖励设计以提升科学推理能力

Zijie Chen, Zhenghao Lin, Xiao Liu, Zhenzhong Lan, Yeyun Gong, Peng Cheng

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Dr. SCI数据集和后训练流程,通过探索扩展SFT、动态难度课程和SciRubric引导RL提升大型语言模型的科学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08675 2026-02-10 cs.NI cs.AI 79%

6G-Bench: An Open Benchmark for Semantic Communication and Network-Level Reasoning with Foundation Models in AI-Native 6G Networks

6G-Bench:面向AI原生6G网络的语义通信与网络级推理开放基准

Mohamed Amine Ferrag, Abderrahmane Lakas, Merouane Debbah

机构 * Department of Computer and Network Engineering, United Arab Emirates University, UAE(计算机与网络工程系,阿拉伯联合酋长国大学) G Research Center (6GRC), Khalifa University, UAE(6G研究中心(6GRC),哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 6G-Bench通过开放基准评估AI原生6G网络中的语义通信与网络级推理能力,涵盖22种基础模型,揭示了不同模型在语义推理上的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18715 2026-02-10 cs.AI 79%

HuggingR$^{4}$: A Progressive Reasoning Framework for Discovering Optimal Model Companions

HuggingR$^{4}$: 一种用于发现最优模型伙伴的渐进推理框架

Shaoyin Ma, Chenggong Hu, Huiqiong Wang, Li Sun, Mingli Song, Jie Song

机构 * Zhejiang University, Hangzhou, China(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 HuggingR$^4$通过渐进推理框架提升模型选择效率,实现更高的可行性与合理性,同时降低token消耗。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22443 2026-02-10 cs.CL 79%

Accounting Reasoning in Large Language Models: Concepts, Evaluation, and Empirical Analysis

在大型语言模型中进行会计推理:概念、评估与实证分析

Jie Zhou, Xin Chen, Jie Zhang, Zhe Li

机构 * School of Computer Engineering, Jiangsu Ocean University(计算机工程学院,江苏海洋大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了会计推理的概念、评估方法及实证分析,发现GPT-4在会计推理任务中表现最佳,但现有LLMs仍需优化以满足实际应用需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06319 2026-02-09 cs.AI 79%

Exposing Weaknesses of Large Reasoning Models through Graph Algorithm Problems

通过图算法问题揭示大推理模型的弱点

Qifan Zhang, Jianhao Ruan, Aochuan Chen, Kang Zeng, Nuo Chen, Jing Tang, Jia Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 GrAlgoBench通过图算法问题揭示大推理模型在长上下文推理和过度思考方面的不足,为改进推理研究提供严格测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05496 2026-02-06 cs.MM cs.AI cs.CV 79%

XEmoGPT: An Explainable Multimodal Emotion Recognition Framework with Cue-Level Perception and Reasoning

XEmoGPT:一种具有线索级感知与推理的可解释多模态情感识别框架

Hanwen Zhang, Yao Liu, Peiyuan Jiang, Lang Junjie, Xie Jun, Yihui He, Yajiao Deng, Siyu Du, Qiao Liu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) th Research Institute, China Electronics Technology Group Corporation(中国电子科技集团第五十四研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XEmoGPT通过专门模块和大规模数据集提升多模态情感识别的可解释性和线索级推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16048 2026-02-06 cs.AI 79%

SPhyR: Spatial-Physical Reasoning Benchmark on Material Distribution

SPhyR:基于材料分布的空间-物理推理基准

Philipp D. Siedler

机构 * Aleph Alpha Research(Aleph Alpha研究机构)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SPhyR数据集通过拓扑优化任务评估LLM在空间和物理推理方面的能力,无需模拟工具即可推断最优材料分布。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05120 2026-02-06 cs.CC cs.LG 79%

Certifiable Boolean Reasoning Is Universal

可验证的布尔推理是通用的

Wenhao Li, Anastasis Kratsios, Hrad Ghoukasian, Dennis Zvigelsky

机构 * University of Toronto(多伦多大学) McMaster University(麦基尔大学) Vector Institute(向量研究所) Scuola Normale Superiore di Pisa(比萨normal高等学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出了一种深度学习架构,能够确证性地推理并通用性地处理任何布尔任务,且在简单布尔任务中参数需求低。

Comments Submitted to COLT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 79%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04112 2026-02-05 cs.CL 79%

DELTA: Deliberative Multi-Agent Reasoning with Reinforcement Learning for Multimodal Psychological Counseling

DELTA: 基于强化学习的多智能体推理用于多模态心理辅导

Jiangnan Yang, Junjie Chen, Fei Wang, Yiqi Nie, Yuxin Liu, Zhangling Duan, Jie Chen

机构 * Anhui University(安徽大学) Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DELTA 通过强化学习和多智能体推理提升多模态心理辅导的质量与情感契合度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03340 2026-02-04 cs.AI 79%

MentalSeek-Dx: Towards Progressive Hypothetico-Deductive Reasoning for Real-world Psychiatric Diagnosis

MentalSeek-Dx: 向现实世界精神病诊断的渐进性假说-演绎推理迈进

Xiao Sun, Yuming Yang, Junnan Zhu, Jiang Zhong, Xinyu Zhou, Kaiwen Wei

机构 * School of Computer Science Chongqing University(重庆大学计算机学院) MAIS Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所MAIS研究所) The First Affiliated Hospital of Chongqing Medical University(重庆医科大学第一附属医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MentalSeek-Dx通过监督轨迹构建和课程强化学习,实现了在现实世界精神病诊断中的渐进性假说-演绎推理,以提升临床诊断的可靠性。

Comments 36 pages, 27 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 79%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16964 2026-02-04 cs.CV cs.CL 79%

MedFrameQA: A Multi-Image Medical VQA Benchmark for Clinical Reasoning

MedFrameQA: 一个多图像医学视觉问答基准用于临床推理

Suhao Yu, Haojin Wang, Juncheng Wu, Luyang Luo, Jingshen Wang, Cihang Xie, Pranav Rajpurkar, Carl Yang, Yang Yang, Kang Wang, Yannan Yu, Yuyin Zhou

机构 * University of Pennsylvania(宾夕法尼亚大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) UC Santa Cruz(加州大学圣克鲁兹分校) Harvard University(哈佛大学) UC Berkeley(加州大学伯克利分校) Emory University(埃默里大学) UC San Francisco(旧金山加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedFrameQA是一个多图像医学视觉问答基准,旨在评估多图像医学推理能力,揭示现有模型在处理复杂医学叙述时的不足。

Comments 27 pages, 15 Figures Benchmark data: https://huggingface.co/datasets/SuhaoYu1020/MedFrameQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02295 2026-02-03 cs.LG 79%

EvalQReason: A Framework for Step-Level Reasoning Evaluation in Large Language Models

EvalQReason: 一种用于大型语言模型中分步推理评估的框架

Shaima Ahmad Freja, Ferhat Ozgur Catak, Betul Yurdem, Chunming Rong

机构 * Department of Electrical Engineering and Computer Science, University of Stavanger(电子工程与计算机科学系,斯塔万格大学) Department of Electrical and Electronics Engineering, Izmir Bakircay University(电子与电气工程系,伊兹密尔巴克伊大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 EvalQReason通过分步概率分布分析评估大型语言模型的推理质量,展示了在数学和医学领域中对推理可靠性的有效评估方法。

Comments 15 pages (including appendix), 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02136 2026-02-03 cs.AI 79%

Mitigating Safety Tax via Distribution-Grounded Refinement in Large Reasoning Models

通过基于分布的细化缓解安全税在大推理模型中的影响

Yingsha Xie, Tiansheng Huang, Enneng Yang, Rui Min, Wenjie Lu, Xiaochun Cao, Naiqiang Tan, Li Shen

机构 * School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University, China(中山大学深圳校区计算机科学与技术学院) Hong Kong University of Science(香港科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出DGR方法,通过基于分布的细化缓解大推理模型中的安全税,提升推理准确性和安全性。

Comments Code will be released soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02004 2026-02-03 cs.CV cs.AI 79%

ClueTracer: Question-to-Vision Clue Tracing for Training-Free Hallucination Suppression in Multimodal Reasoning

ClueTracer: 问题到视觉线索追踪用于无训练 hallucination 抑制在多模态推理

Gongli Xi, Kun Wang, Zeming Gao, Huahui Yi, Haolang Lu, Ye Tian, Wendong Wang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) West China Biomedical Big Data Center(西京生物大数据中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ClueTracer通过问题到视觉线索追踪,无训练抑制多模态推理中的幻觉,提升推理和非推理任务性能。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01779 2026-02-03 cs.AI 79%

LingLanMiDian: Systematic Evaluation of LLMs on TCM Knowledge and Clinical Reasoning

LingLanMiDian: LLMs在中医知识与临床推理上的系统评估

Rui Hua, Yu Wei, Zixin Shu, Kai Chang, Dengying Yan, Jianan Xia, Zeyu Liu, Hui Zhu, Shujie Song, Mingzhong Xiao, Xiaodong Li, Dongmei Jia, Zhuye Gao, Yanyan Meng, Naixuan Zhao, Yu Fu, Haibin Yu, Benman Yu, Yuanyuan Chen, Fei Dong, Zhizhou Meng, Pengcheng Yang, Songxue Zhao, Lijuan Pei, Yunhui Hu, Kan Ding, Jiayuan Duan, Wenmao Yin, Yang Gu, Runshun Zhang, Qiang Zhu, Jian Yu, Jiansheng Li, Baoyan Liu, Wenjia Wang, Xuezhong Zhou

机构 * Department of Computer Science and Technology, Beijing Jiaotong University, Beijing, China(北京交通大学计算机科学与技术学院) Tianjin Tasly Digital Chinese Medicine Technology Co., Ltd.(天津塔斯丽数字中医科技有限公司) Tasly Biopharmaceuticals Co., Ltd.(塔斯丽生物医药有限公司) State Key Laboratory of Chinese Medicine Modernization, Tianjin, China(中药现代化国家工程实验室,天津,中国) Institute of Liver Diseases, Hubei Key Laboratory of the theory and application research of liver and kidney in traditional Chinese medicine, Hubei Provincial Hospital of Traditional Chinese Medicine, Wuhan, China(肝病研究所,湖北省中医肝肾理论与应用研究重点实验室,湖北省中医药研究院,武汉,中国) Affiliated Hospital of Hubei University of Chinese Medicine, Wuhan, China(湖北中医药大学附属医院,武汉,中国) Hubei Province Academy of Traditional Chinese Medicine, Wuhan, China(湖北省中医药研究院,武汉,中国) Department of Gastroenterology, Guang’anmen Hospital, China Academy of Chinese Medical Sciences, Beijing, China(消化内科,广安门医院,中国中医科学院,北京,中国) China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院,北京,中国) China Institute for History of Medicine and Medical Literature, China Academy of Chinese Medical Sciences, Beijing, China(中国中医科学院中国医学史与医学文献研究所,北京,中国) Beijing Research Institute of Chinese Medicine, Beijing University of Chinese Medicine, Beijing, China(北京中医研究院,北京中医药大学,北京,中国) Beijing University of Chinese Medicine Third Affiliated Hospital, Beijing University of Chinese Medicine, Beijing 100029, China(北京中医药大学第三附属医院,北京中医药大学,北京100029,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 LingLan基准测试系统评估了LLMs在中医知识和临床推理上的表现,揭示了当前模型与专家在专门推理上的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏