arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2605.09544 2026-05-12 cs.AI 79%

TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning

TIDE-Bench:面向任务的工具整合推理评估

Yize Li, Junzhi Li, Jason Song, Chuxiong Sun, Rui Wang, Changwen Zheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TIDE-Bench,一个高效全面的工具整合推理评估基准,通过多样任务设置、任务感知评估协议和高质量评价集,揭示工具整合推理中的持续瓶颈。

Comments 10 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09262 2026-05-12 cs.CV cs.CL 79%

Reinforcing Multimodal Reasoning Against Visual Degradation

增强多模态推理以对抗视觉退化

Rui Liu, Dian Yu, Haolin Liu, Yucheng Shi, Tong Zheng, Runpeng Dai, Haitao Mi, Pratap Tokekar, Leoweiliang

机构 * Tencent Hunyuan(腾讯文言) University of Maryland, College Park(马里兰大学 College Park 分校) University of Virginia(弗吉尼亚大学) University of North Carolina, Chapel Hill(北卡罗来纳大学 Chapel Hill 分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ROMA框架,通过优化动态增强多模态大语言模型对视觉退化的鲁棒性,提升在多种基准测试中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00371 2026-05-12 cs.CL cs.CY cs.SE 79%

Reasoning Trajectories for Socratic Debugging of Student Code: From Misconceptions to Contradictions and Updated Beliefs

为学生代码进行苏格拉底调试的推理轨迹:从误解到矛盾与更新信念

Erfan Al-Hossami, Razvan Bunescu

机构 * University of North Carolina at Charlotte(北卡罗来纳州夏洛特大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出推理轨迹生成任务,通过标注的调试问题数据集探讨生成推理轨迹和基于LLM的苏格拉底对话方法,实验显示LLM能生成91%正确的推理轨迹和98.7%有效的对话内容。

Comments 25 pages, 2 tables, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09042 2026-05-12 cs.CL 79%

Evaluating Pragmatic Reasoning in Large Language Models: Evidence from Scalar Diversity

评估大语言模型的语用推理:来自量级多样性的证据

Ye-eun Cho

机构 * Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究通过量级多样性评估大语言模型的语用推理能力,发现不同模型和任务结构下语用行为差异显著,评价方法无法单一确定模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08755 2026-05-12 cs.LG 79%

LAQuant: A Simple Overhead-free Large Reasoning Model Quantization by Layer-wise Lookahead Loss

LAQuant: 一种简单且无开销的大型推理模型量化方法通过分层前瞻损失

Euntae Choi, Sumin Song, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出LAQuant,通过分层前瞻损失和推理领域校准,解决量化中的精度与速度问题,提升推理性能并加快解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08094 2026-05-12 cs.CY cs.AI 79%

MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction

MedThink: 通过教师引导的推理校正提升小模型的诊断准确性

Xinchun Su, Chunxu Luo, Lipeng Ma, Yixuan Li, Weidong Yang

机构 * School of Computer Science, Fudan University, Shanghai, China(复旦大学计算机学院,上海,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 MedThink通过两阶段知识蒸馏框架提升小语言模型的临床推理能力,在医疗基准测试和胃肠病数据集上均优于传统方法,提升诊断准确率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07143 2026-05-11 cs.CL 79%

Ask Patients with Patience: Enabling LLMs for Human-Centric Medical Dialogue with Grounded Reasoning

耐心询问患者:通过 grounded 推理实现面向人类的医疗对话 LLM

Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Fenglin Liu, Junde Wu

机构 * University of Oxford(牛津大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出 APP,一种基于 LLM 的医疗助手,通过 grounded 推理和透明诊断提升医疗对话的人性化体验,改进诊断准确性并增强用户参与度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07103 2026-05-11 cs.AI cs.MA 79%

ARMOR: An Agentic Framework for Reaction Feasibility Prediction via Adaptive Utility-aware Multi-tool Reasoning

ARMOR:一种通过自适应效用感知多工具推理的代理框架用于反应可行性预测

Ye Liu, Botao Yu, Xinyi Ling, Daniel Adu-Ampratwum, Xia Ning

机构 * Department of Biomedical Informatics(生物医学信息学系) Department of Computer Science and Engineering(计算机科学与工程系) Division of Medicinal Chemistry and Pharmacognosy(药物化学与药理学系) Translational Data Analytics Institute(转化数据分析研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ARMOR通过自适应效用感知多工具推理框架,有效整合多个工具的优势,提升反应可行性预测的准确性,尤其在存在工具预测冲突时表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06444 2026-05-08 cs.AI 79%

SCRuB: Social Concept Reasoning under Rubric-Based Evaluation

SCRuB:基于规则评估的社会概念推理

Jamelle Watson-Daniels, Himaghna Bhattacharjee, Skyler Wang, Brandon Handoko, Antonio Li, Anaelia Ovalle, Mahesh Pasupuleti, Candace Ross, Vidya Sarma, Arjun Subramonian, Karen Ullrich, Will van der Vaart, Yijing Xin, Maximilian Nickel

机构 * Meta McGill University(麦吉尔大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SCRuB框架,用于评估大语言模型在社会概念推理方面的能力,通过专家和模型响应对比,展示前沿模型在五个维度上优于人类专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05955 2026-05-08 cs.CL cs.CV 79%

TableVista: Benchmarking Multimodal Table Reasoning under Visual and Structural Complexity

TableVista:在视觉和结构复杂性下多模态表格推理的基准测试

Zheyuan Yang, Liqiang Shang, Junjie Chen, Xun Yang, Chenglong Xu, Bo Yuan, Chenyuan Jiao, Yaoru Sun, Yilun Zhao

机构 * Tongji University(同济大学) University of Bristol(布里斯托大学) Tianjin University(天津大学) Yale University(耶鲁大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 TableVista包含3000个高质量表格推理问题,通过多风格渲染和转换流程生成30000个多模态样本,评估29种基础模型在不同复杂性下的表现,揭示结构复杂性和视觉整合对推理一致性的影响。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05573 2026-05-08 astro-ph.IM cs.AI 79%

AstroAlertBench: Evaluating the Accuracy, Reasoning, and Honesty of Multimodal LLMs in Astronomical Classification

AstroAlertBench: 评估多模态大语言模型在天文学分类中的准确性、推理和诚实性

Claire Chen, Jiabao Sean Xiao, Shuze Daniel Liu, Facundo Perez Paolino, Luke Handley, Theophile Jegou du Laz, Ricky Nilsson, Alice Zou, Matthew Graham, Ashish Mahabal

机构 * California Institute of Technology(加州理工学院) Massachusetts Institute of Technology(麻省理工学院) Purdue University(普渡大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AstroAlertBench,通过多阶段逻辑链评估多模态大语言模型在天文学事件分类中的性能,揭示高精度与模型诚实性之间的矛盾,并引入人机协同评估协议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13310 2026-05-08 cs.CV cs.AI 79%

Visual Para-Thinker: Divide-and-Conquer Reasoning for Visual Comprehension

视觉并行思考器:用于视觉理解的分而治之推理

Haoran Xu, Hongyu Wang, Jiaze Li, Shunpeng Chen, Zizhao Tong, Jianzhong Ju, Zhenbo Luo, Jian Luan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) University of Chinese Academy of Sciences(中国科学院大学) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出视觉并行思考器,通过并行推理框架提升视觉理解能力,结合Pa-Attention和LPRoPE实现高效多模态处理,验证了并行推理在视觉领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20133 2026-04-30 cs.CL 79%

Reasoning Gets Harder for LLMs Inside A Dialogue

在对话中LLM的推理变得更难

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了在对话场景中LLM的推理能力,通过BOULDER基准测试发现,对话环境显著影响LLM性能,揭示了对话多轮交互对推理能力的挑战。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01297 2026-04-30 cs.AI 79%

RE-MCDF: Closed-Loop Multi-Expert LLM Reasoning for Knowledge-Grounded Clinical Diagnosis

RE-MCDF:闭环多专家LLM推理用于知识驱动的临床诊断

Shaowei Shen, Xiaohong Yang, Jie Yang, Lianfen Huang, Yongcai Zhang, Yang Zou, Seyyedali Hosseinalipour

机构 * School of Informatics, Xiamen University, China(厦门大学信息学系, 中国) National Institute for Data Science in Health and Medicine, Xiamen University, China(健康医学数据科学国家研究院, 厦门大学, 中国) Key Laboratory of Intelligent Manufacturing Equipment and Industrial Internet Technology, Fujian Provincial Universities, the School of Information Science and Technology, Xiamen University Tan Kah Kee College, and also with the Department of Informatics and Communication Engineering, Xiamen University, China(福建省智能制造装备与工业互联网技术重点实验室, 福建省高校, 厦门大学信息科学系, 厦门大学坦克 Kee 学院, 以及厦门大学信息与通信工程系, 中国) School of Medicine, Xiamen University, China(厦门大学医学院, 中国) School of Electronic and Information Engineering, Tongji University, China(同济大学电子与信息工程学院, 中国) department of Electrical Engineering, University at Buffalo-SUNY, Buffalo, NY, USA(University at Buffalo-SUNY 电气工程系, Buffalo, NY, 美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对神经科电子病历异质性、稀疏性和噪声问题,提出RE-MCDF框架,通过闭环架构整合三个互补组件,强化疾病间逻辑约束,提升复杂诊断场景性能。

Comments Accepted by International Joint Conference on Neural Networks (IJCNN 2026); 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 79%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 79%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00756 2026-04-29 cs.AI 79%

MPR-GUI: Benchmarking and Enhancing Multilingual Perception and Reasoning in GUI Agents

MPR-GUI:多语言感知与推理GUI代理的基准测试与增强

Ruihan Chen, Qiming Li, Xiaocheng Feng, Weihong Zhong, Xiaoliang Yang, Yuxuan Gu, Zekun Zhou, Yunfei Lu, Haoyu Ren, Kun Chen, Dandan Tu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Peng Cheng Laboratory(鹏城实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MPR-GUI-Bench,通过六种语言和八个细粒度任务评估多语言GUI代理的感知与推理能力,并提出GUI-XLI方法以缩小跨语言差距。

Comments 35pages, 15figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 79%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05425 2026-04-29 cs.CV cs.AI 79%

SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning

SIV-Bench:一种用于社会互动理解和推理的视频基准测试

Fanqi Kong, Weiqin Zu, Xinyu Chen, Yaodong Yang, Song-Chun Zhu, Xue Feng

机构 * Peking University(北京大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SIV-Bench,一个用于评估多模态大语言模型在社会场景理解、社会状态推理和社会动态预测能力的视频基准测试,揭示了现有模型在社会推理方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24589 2026-04-28 cs.AI astro-ph.GA astro-ph.IM 79%

A systematic evaluation of vision-language models for observational astronomical reasoning tasks

对视觉语言模型在观测天文学推理任务中的系统评估

Wenke Ren, Hengxiao Guo, Wenwen Zuo, Xiaoman Zhang

机构 * Shanghai Astronomical Observatory, Chinese Academy of Sciences(上海天文台,中国科学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文系统评估了视觉语言模型在观测天文学推理任务中的表现,发现模型性能依赖于模态,且物理知识 grounding 对提升准确性至关重要。

Comments 24 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23813 2026-04-28 cs.CV cs.CL 79%

ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction

ShredBench:评估多模态大语言模型在文档重建中的语义推理能力

Zichun Guo, Yuling Shi, Wenhao Zeng, Chao Hu, Haotian Lin, Terry Yue Zhuo, Jiawei Chen, Xiaodong Gu, Wenping Ma

机构 * Xidian University(西安电子科技大学) Shanghai Jiao Tong University(上海交通大学) Alibaba Qwen(阿里巴巴量子计算实验室) Old Dominion University(旧 Dominion 大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出ShredBench基准,用于评估多模态大语言模型在文档重建任务中的语义推理能力,发现现有模型在处理破碎文档时存在显著性能差距。

Comments ACL 2026 Findings. Code available at https://github.com/ythere-y/ShredBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23730 2026-04-28 cs.AI 79%

Expert Evaluation of LLM's Open-Ended Legal Reasoning on the Japanese Bar Exam Writing Task

对日本律师考试写作任务中LLM开放式法律推理的专家评估

Jungmin Choi, Keisuke Sakaguchi, Hiroaki Yamada

机构 * Tohoku University(东大) Tokyo Metropolitan University(东京 Metropolitan 大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文首次提出评估LLM在日本法律领域开放式法律推理能力的数据集,通过法律专家对模型输出的评估揭示了法律推理的局限性与挑战。

Comments 5 pages, Accepted to ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10298 2026-04-28 cs.CL 79%

On Emergent Social World Models -- Evidence for Functional Integration of Theory of Mind and Pragmatic Reasoning in Language Models

关于涌现的社会世界模型——证据显示语言模型中理论思维与语用推理的功能整合

Polina Tsvilodub, Jan-Felix Klumpp, Amir Mohammadpour, Jennifer Hu, Michael Franke

机构 * Department of Linguistics University of Tübingen(语言学系图宾根大学) Department of Cognitive Science Johns Hopkins University(认知科学系约翰霍普金斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究语言模型是否通过共享的计算机制整合一般理论思维与语言特定的语用推理,以支持语言模型是否具备涌现的社会世界模型。通过行为评估和因果机制实验,分析语言模型在七种理论思维能力子类别上的表现,发现支持功能整合假说。

Comments 39 pages, 20 figures, accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23348 2026-04-28 cs.CV cs.AI 79%

EmoTrans: A Benchmark for Understanding, Reasoning, and Predicting Emotion Transitions in Multimodal LLMs

EmoTrans:一个多模态大语言模型中情感过渡理解、推理和预测的基准测试

He Hu, Tengjin Weng, Zebang Cheng, Yu Wang, Jiachen Luo, Björn Schuller, Zheng Lian, Laizhong Cui

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence(广东人工智能与数字经济实验室) Queen Mary University of London(女王学院伦敦大学) Technical University of Munich(慕尼黑技术大学) Imperial College London(伦敦帝国学院) Tongji University(同济大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 EmoTrans旨在评估多模态视频中情感动态理解能力,包含1000个手工标注的视频片段和3000多个任务特定问题-答案对,通过四个任务形成从粗粒度检测到深度推理的评估框架,发现当前大语言模型在细粒度情感动态建模上仍存在挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18563 2026-04-28 cs.AI cs.MA econ.TH 79%

Reasonably reasoning AI agents can avoid game-theoretic failures in zero-shot, provably

合理推理的AI代理可以在零样本情况下避免博弈论失败并得到证明

Enoch Hyunwook Kang

机构 * Foster School of Business, University of Washington(华盛顿大学福斯特商学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究了AI代理在重复博弈中的稳定性,证明了基于贝叶斯后验采样的代理能趋近纳什均衡,且在未知收益情况下仍保持收敛性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI 79%

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27820 2026-04-24 cs.CL 79%

Improving Clinical Diagnosis with Counterfactual Multi-Agent Reasoning

通过反事实多智能体推理提升临床诊断

Zhiwen You, Xi Chen, Aniket Vashishtha, Simo Du, Gabriel Erion-Barner, Hongyuan Mei, Hao Peng, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Jacobi Medical Center, Albert Einstein College of Medicine(雅各布医疗中心,阿尔伯特·爱因斯坦学院) Department of Emergency Medicine, Beth Israel Deaconess Medical Center(贝斯以色列医疗中心急诊科) Leaning machines(Leanings machines)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种基于反事实推理的多智能体诊断框架,通过反事实案例编辑和反事实概率差距方法,提升诊断准确性与可解释性,尤其在复杂和模糊病例中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10312 2026-04-23 cs.LG 79%

Training-free retrieval-augmented generation with reinforced reasoning for flood damage nowcasting

无需训练的检索增强生成与强化推理用于洪水损害现在预测

Lipai Huang, Kai Yin, Chia-Fu Liu, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering(城市韧性.AI实验室,土木与环境工程系) Department of Computer Science and Engineering(计算机科学与工程系) Department of Civil, Environmental and Architectural Engineering(土木、环境与建筑工程系) Institute for a Disaster Resilient Texas(德克萨斯灾害韧性研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出R2RAG-Flood框架,通过强化推理实现无需训练的洪水损害现在预测,利用结构化预测器、文本摘要和推理轨迹构建知识库,在推理阶段通过地理邻近和自由样本支持案例推理,提升预测准确性与成本效率。

Comments 18 pages, 3 figures, 8 tables, submitted to CACAIE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19172 2026-04-22 cs.AI 79%

Reasoning-Aware AIGC Detection via Alignment and Reinforcement

基于对齐与强化的学习的推理感知AIGC检测

Zhao Wang, Max Xiong, Jianxun Lian, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Duke University(杜克大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出REVEAL框架,通过生成可解释的推理链实现AIGC检测,采用两阶段训练策略提升准确性和逻辑一致性,实验显示其在多个基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18964 2026-04-22 cs.AI cs.DB 79%

DW-Bench: Benchmarking LLMs on Data Warehouse Graph Topology Reasoning

DW-Bench:基于数据仓库图拓扑推理的大型语言模型基准测试

Ahmed G. A. H Ahmed, C. Okan Sakar

机构 * Innosol / Bahçeşehir University(Innosol / 巴赫切希尔大学) Department of Computer Engineering, Bahcesehir University, Turkey(计算机工程系,巴赫切希尔大学,土耳其)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DW-Bench评估LLM在数据仓库模式上的图拓扑推理能力,包含1046个验证正确的问题,实验显示工具增强方法在复杂组合子类型上表现稳定。

Comments 24 pages, 6 figures. Datasets and evaluation code available at GitHub

详情

展开后加载摘要…

URL PDF HTML 收藏