arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10440 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10440 篇

2604.22136 2026-04-27 cs.CR cs.LG 74%

Sovereign Agentic Loops: Decoupling AI Reasoning from Execution in Real-World Systems

主权代理循环:在现实系统中解耦AI推理与执行

Jun He, Deying Yu

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 本文提出Sovereign Agentic Loops,通过解耦AI推理与执行,提升系统安全性,实验显示其有效阻止93%的危险意图。

Comments 15 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17114 2026-04-21 cs.CL 74%

The Provenance Gap in Clinical AI: Evidence-Traceable Temporal Knowledge Graphs for Rare Disease Reasoning

临床AI中的溯源差距:用于罕见疾病推理的证据可追溯时间知识图谱

Md Shamim Ahmed, Maja Dusanic, Moritz Nikolai Kirschner, Elisabeth Nyoungui, Jana Zschüntzsch, Lukas Galke Poech, Richard Röttger

机构 * Department of Mathematics and Computer Science, University of Southern Denmark(丹麦南方大学数学与计算机科学系) Universitätsmedizin Göttingen(哥廷根大学医学中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出HEG-TKG系统,通过时间知识图谱提升临床推理的证据可追溯性,实现100%证据可验证性,同时保证安全性和完整性。

Comments 32 pages, 9 figures, 7 tables. Will submit to npj Digital Medicine. Supplementary materials included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28325 2026-04-15 cs.CE cs.AI 74%

Building evidence-based knowledge bases from full-text literature for disease-specific biomedical reasoning

从全文文献构建基于证据的知识库以支持疾病特定的生物医学推理

Chang Zong, Sicheng Lv, Si-tu Xue, Huilin Zheng, Jian Wan, Lei Zhang

机构 * School of Computer Science and Technology, Zhejiang University of Science and Technology(浙江理工大学计算机科学与技术学院) Institute of Medicinal Biotechnology, Chinese Academy of Medical Sciences & Peking Union Medical College(中国医学科学院药物生物技术研究所) Zhejiang Key Laboratory of Biomedical Intelligent Computing Technology(浙江省生物医学智能计算技术重点实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出EvidenceNet,一个基于全文文献构建的疾病特定知识库,通过大语言模型提取实验支持的结构化证据记录,用于生物医学推理任务。

Comments 30 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10658 2026-04-14 cs.AI cs.CY cs.MA 74%

Governed Reasoning for Institutional AI

机构AI中的受控推理

Mamadou Seck

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出Cognitive Core,通过九种类型认知原语和四层治理模型,解决机构决策中需要的AI架构问题,实现高准确率和零静默错误,引入治理性作为评估标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10570 2026-03-12 cs.CL 74%

End-to-End Chatbot Evaluation with Adaptive Reasoning and Uncertainty Filtering

端到端对话机器人评估与自适应推理和不确定性过滤

Nhi Dang, Tung Le, Huy Tien Nguyen

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究提出一种端到端自动评估器,通过生成问答对和置信度过滤,实现对话机器人评估的自动化和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12665 2026-02-16 cs.AI 74%

Evaluating Robustness of Reasoning Models on Parameterized Logical Problems

评估参数化逻辑问题上推理模型的鲁棒性

Naïm Es-sebbani, Esteban Marquer, Yakoub Salhi, Zied Bouraoui

机构 * CRIL UMR 8188, Univ Artois, CNRS, France(CRIL UMR 8188,阿维尼翁大学,法国国家科学研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出了一种针对2-SAT的诊断基准,用于评估推理模型在参数化逻辑问题上的鲁棒性,通过隔离不同能力与失败模式,揭示模型在结构干预下的性能变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11409 2026-02-13 cs.AI 74%

TRACER: Trajectory Risk Aggregation for Critical Episodes in Agentic Reasoning

TRACER:轨迹风险聚合用于代理推理中的关键事件

Sina Tayebati, Divake Kumar, Nastaran Darabi, Davide Ettori, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) AI Labs at Capital One(Capital One 人工智能实验室)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 TRACER通过轨迹级不确定性度量提升复杂对话工具使用中的不确定性检测精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07054 2026-02-10 cs.LG cs.CV cs.HC 74%

AVERE: Improving Audiovisual Emotion Reasoning with Preference Optimization

AVERE: 通过偏好优化提升音频视觉情感推理

Ashutosh Chaubey, Jiacheng Pang, Maksim Siniukov, Mohammad Soleymani

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 AVERE通过偏好优化技术提升音频视觉情感推理性能,解决情感与无关线索的虚假关联和幻觉问题,提升多模态模型在情感理解中的表现。

Comments Accepted as a conference paper at ICLR 2026. Project page: https://avere-iclr.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00352 2026-02-03 cs.CL 74%

DETOUR: An Interactive Benchmark for Dual-Agent Search and Reasoning

DETOUR:双智能体搜索与推理的交互基准

Li Siyan, Darshan Deshpande, Anand Kannappan, Rebecca Qian

机构 * Patronus AI DAP Lab(DAP实验室) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 DETOUR基准通过双智能体机制评估双智能体搜索与推理能力,揭示现有模型在模糊不明确场景下的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19299 2026-02-02 cs.AI 74%

Helios: A Foundational Language Model for Smart Energy Knowledge Reasoning and Application

Helios:一种面向智能能源知识推理与应用的基础语言模型

Haoyu Jiang, Fanjie Zeng, Boan Qu, Xiaojie Lin, Wei Zhong

机构 * College of Energy Engineering, Zhejiang University(浙江大学能源工程学院) Polytechnic Institute, Zhejiang University(浙江大学 polytechnic 院) Shanghai Institute for Advanced Study, Zhejiang University(浙江大学上海研究院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 Helios是一种专为智能能源领域设计的基础语言模型,通过构建多智能体协作框架和相关数据集,提升领域知识、任务执行准确性和与人类偏好的对齐程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21422 2026-02-02 cs.CL 74%

Automatic Reviewers Fail to Detect Faulty Reasoning in Research Papers: A New Counterfactual Evaluation Framework

自动评审员无法检测研究论文中的错误推理:一种新的反事实评估框架

Nils Dycke, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and National Research Center for Applied Cybersecurity(UKP实验室、计算机科学系和应用网络安全国家研究中心)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出一种反事实评估框架,揭示自动评审系统在检测研究论文中逻辑错误方面的不足,并提出未来研究建议。

Comments accepted to TACL 2026 (presented at EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20757 2026-01-29 cs.CL 74%

Persona Prompting as a Lens on LLM Social Reasoning

作为LLM社会推理的镜像:人格提示

Jing Yang, Moritz Hechtbauer, Elisabeth Khalilov, Evelyn Luise Brinkmann, Vera Schmitt, Nils Feldhus

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本研究探讨了人格提示对LLM社会推理的影响,发现其虽能提升分类效果,但会降低推理质量并加剧偏见。

Comments 9 Pages, EACL main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03369 2026-01-22 cs.CV cs.CL 74%

RiskCueBench: Benchmarking Anticipatory Reasoning from Early Risk Cues in Video-Language Models

RiskCueBench: 视频语言模型中早期风险信号的前瞻性推理基准测试

Sha Luo, Yogesh Prabhu, Timothy Ossowski, Kaiping Chen, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 RiskCueBench通过标注早期风险信号片段,评估视频语言模型在预测未来风险事件中的能力,揭示了现有系统在解读动态情境方面的不足。

Comments *updated author email in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16202 2026-01-06 cs.AI 74%

Multi-Agent Collaborative Reward Design for Enhancing Reasoning in Reinforcement Learning

多智能体协作奖励设计以增强强化学习中的推理

Pei Yang, Ke Zhang, Ji Wang, Xiao Chen, Yuxin Tang, Eric Yang, Lynn Ai, Bill Shi

机构 * Gradient Waseda University(早稻田大学) Columbia University(哥伦比亚大学) Hong Kong Polytechnic University(香港理工大学) Rice University(莱斯大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 多智能体协作奖励模型通过分解偏好评估和引入集中化聚合器,提升强化学习中的鲁棒性和可解释性,同时提供透明的奖励建模方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21878 2025-12-29 cs.MA cs.AI 74%

MASFIN: A Multi-Agent System for Decomposed Financial Reasoning and Forecasting

MASFIN:一种用于分解金融推理和预测的多智能体系统

Marc S. Montalvo, Hamed Yaghoobian

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 MASFIN通过整合LLMs与结构化财务指标和非结构化新闻,提出了一种模块化的多智能体系统,以提高金融预测的透明性和可重复性,实现优于基准的短期投资回报。

Comments Accepted to the NeurIPS 2025 Workshop on Generative AI in Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21431 2025-12-29 cs.SE cs.LG 74%

Cerberus: Multi-Agent Reasoning and Coverage-Guided Exploration for Static Detection of Runtime Errors

Cerberus:多智能体推理与覆盖引导探索用于运行时错误的静态检测

Hridya Dhulipala, Xiaokai Rong, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 Cerberus通过多智能体推理和覆盖引导探索,实现无执行的运行时错误静态检测,提高测试效率和错误发现能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19107 2025-12-23 cs.AI 74%

FC-MIR: A Mobile Screen Awareness Framework for Intent-Aware Recommendation based on Frame-Compressed Multimodal Trajectory Reasoning

FC-MIR:一种基于帧压缩多模态轨迹推理的移动屏幕感知框架,用于意图感知推荐

Zhe Yang, Xiaoshuang Sheng, Zhengnan Zhang, Jidong Wu, Zexing Wang, Xin He, Shenghua Xu, Guanjing Xiong

机构 * vivo AI Lab(vivo人工智能实验室) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 FC-MIR框架通过帧压缩多模态轨迹推理,提升移动设备上意图感知推荐的效率与实用性,支持轻量级部署并探索生成操作与建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12596 2025-12-16 cs.CV cs.AI 74%

Content-Aware Ad Banner Layout Generation with Two-Stage Chain-of-Thought in Vision Language Models

基于视觉语言模型的双阶段链式思考内容感知广告布局生成

Kei Yoshitake, Kento Hosono, Ken Kobayashi, Kazuhide Nakata

机构 * Institute of Science Tokyo(东京科学研究所) HAKUHODO Technologies Inc.(HAKUHODO技术公司)

专题命中 推理评测 :chain-of-thought(title);分类 cs.AI

AI总结 本文提出基于视觉语言模型的双阶段链式思考方法,用于生成高质量的广告布局,通过分析背景图像内容来提升布局质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12208 2025-12-08 cs.AI 74%

Debate over Mixed-knowledge: A Robust Multi-Agent Reasoning Framework for Incomplete Knowledge Graph Question Answering

混合知识辩论:一种用于不完整知识图谱问答的鲁棒多智能体推理框架

Jilong Liu, Pengyang Shao, Wei Qin, Fei Liu, Yonghui Yang, Richang Hong

专题命中 推理评测 :reasoning(title);分类 cs.AI

AI总结 本文提出DoM框架,通过多智能体辩论机制整合结构化和非结构化知识,解决不完整知识图谱问答中的知识互补性问题,并引入新数据集提升基准挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18177 2025-11-25 cs.CL 74%

Rethinking Retrieval: From Traditional Retrieval Augmented Generation to Agentic and Non-Vector Reasoning Systems in the Financial Domain for Large Language Models

重新思考检索:从传统检索增强生成到金融领域大语言模型中的代理和非向量推理系统

Elias Lumer, Matt Melich, Olivia Zino, Elena Kim, Sara Dieter, Pradeep Honaganahalli Basavaraju, Vamse Kumar Subbiah, James A. Burke, Roberto Hernandez

机构 * PricewaterhouseCoopers U.S.(普华永道美国公司)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 本文提出基于向量的代理RAG方法,在金融问答中优于非向量方法,通过交叉编码器重排序和小到大块检索显著提升检索精度和回答质量,但需权衡成本性能。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17267 2025-11-04 cs.CL 74%

GreekBarBench: A Challenging Benchmark for Free-Text Legal Reasoning and Citations

Odysseas S. Chlapanis, Dimitrios Galanis, Nikolaos Aletras, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(信息学院,雅典经济与商业大学) Archimedes, Athena Research Center(阿提卡研究中心-阿基米德) Athena Research Center(阿提卡研究中心) University of Sheffield(谢菲尔德大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments 19 pages, 17 figures, accepted in EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07363 2025-10-15 cs.AI 74%

L2M-AID: Autonomous Cyber-Physical Defense by Fusing Semantic Reasoning of Large Language Models with Multi-Agent Reinforcement Learning (Preprint)

Tianxiang Xu, Zhichao Wen, Xinyu Zhao, Jun Wang, Yan Li, Chang Liu

机构 * Peking University(北京大学) RWTH Aachen University(亚琛工业大学) University of Texas at Austin(德克萨斯大学奥斯汀分校) Wuhan University(武汉大学) Thales Group(泰雷兹集团) Chinese Medical Information and Big Data Association(中国医学信息与大数据协会)

专题命中 推理评测 :reasoning(title);分类 cs.AI

Comments This preprint was submitted to IEEE TrustCom 2025. The accepted version will be published under copyright 2025 IEEE

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00962 2025-10-02 cs.CL 74%

Analyzing Dialectical Biases in LLMs for Knowledge and Reasoning Benchmarks

Eileen Pan, Anna Seo Gyeong Choi, Maartje ter Hoeve, Skyler Seto, Allison Koenecke

机构 * Department of Information Science, Cornell University(康奈尔大学信息科学系) Apple(苹果公司) Cornell Tech(康奈尔科技)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments EMNLP Findings 2025, 12 pages, 11 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.02604 2025-09-26 cs.LG stat.ME 74%

Context-Aware Reasoning On Parametric Knowledge for Inferring Causal Variables

Ivaxi Sheth, Sahar Abdelnabi, Mario Fritz

机构 * CISPA Helmholtz Center for Information Security(CISPA 欧洲信息安全中心) Microsoft(微软公司)

专题命中 推理评测 :reasoning(title);分类 cs.LG

Comments EMNLP'25 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13723 2025-09-19 cs.CL 74%

DSPC: Dual-Stage Progressive Compression Framework for Efficient Long-Context Reasoning

Yaxin Gao, Yao Lu, Zongfei Zhang, Jiaqi Nie, Shanqing Yu, Qi Xuan

机构 * Institute of Cyberspace Security, Zhejiang University of Technology A STAR Amazon Binjiang Institute of Artificial Intelligence, Zhejiang University of Technology

专题命中 推理评测 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21763 2025-07-22 cs.AI 74%

THE-Tree: Can Tracing Historical Evolution Enhance Scientific Verification and Reasoning?

Xin Wang, Jiyao Liu, Yulong Xiao, Junzhi Ning, Lihao Liu, Junjun He, Botian Shi, Kaicheng Yu

机构 * Westlake University(西湖大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Fuzhou University(福州市大学) Imperial College London(伦敦帝国学院)

专题命中 推理评测 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24714 2025-06-02 cs.CL 74%

FinMME: Benchmark Dataset for Financial Multi-Modal Reasoning Evaluation

Junyu Luo, Zhizhuo Kou, Liming Yang, Xiao Luo, Jinsheng Huang, Zhiping Xiao, Jingshu Peng, Chengzhong Liu, Jiaming Ji, Xuanzhe Liu, Sirui Han, Ming Zhang, Yike Guo

机构 * State Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab(多媒体信息处理国家重点实验室,PKU-Anker LLM实验室) School of Computer Science, Peking University(北京大学计算机学院) HKUST(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments ACL 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18291 2025-05-28 cs.CV cs.CL cs.RO 74%

InstructPart: Task-Oriented Part Segmentation with Instruction Reasoning

Zifu Wan, Yaqi Xie, Ce Zhang, Zhiqiu Lin, Zihan Wang, Simon Stepputtis, Deva Ramanan, Katia Sycara

机构 * Robotics Institute, Carnegie Mellon University(机器人研究所,卡内基梅隆大学)

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments Accepted by ACL 2025 Main. Project page: https://zifuwan.github.io/InstructPart/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18341 2025-05-27 cs.RO cs.AI 74%

CrashAgent: Crash Scenario Generation via Multi-modal Reasoning

Miao Li, Wenhao Ding, Haohong Lin, Yiqi Lyu, Yihang Yao, Yuyou Zhang, Ding Zhao

机构 * Carnegie Mellon University(卡内基梅隆大学) NVIDIA Research(NVIDIA研究) Northwestern University(西北大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08498 2025-05-26 cs.CL 74%

"Reasoning" with Rhetoric: On the Style-Evidence Tradeoff in LLM-Generated Counter-Arguments

Preetika Verma, Kokil Jaidka, Svetlana Churina

专题命中 推理评测 :reasoning(title);分类 cs.CL

Comments 24 pages, 9 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏