arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4155 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1018 篇

2607.26432 2026-07-30 cs.CV cs.AI 新提交 83%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 83%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 推理评测 :verifier(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17828 2026-07-21 cs.CL 新提交 83%

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理

Md. Asaduzzaman Shuvo

机构 * United International University(联合国际大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 83%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10748 2026-07-14 cs.LG 新提交 83%

Policy-Driven CT-Agent: Modeling Phase-Aware Diagnostic Control for Clinically Consistent CT Reasoning

策略驱动的CT智能体:为临床一致的CT推理建模阶段感知诊断控制

Yanmeng Dong, Han Li, Yujia Li, Jingsong Liu, Xun Ma, Yanzhu Hu, Zhengyang Xu, Zhicheng Li, Nassir Navab, Shaohua Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 研究针对CT诊断阶段选择协议差异及现有方法局限,提出策略驱动的CT智能体(PD-CTAgent)。通过临床结构抽象模块和知识引导诊断控制模型,实现阶段感知诊断推理,实验验证其在多数据集上的有效性与临床一致性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05131 2026-07-07 cs.AI 新提交 83%

TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios

TacReasoner:面向真实场景交互推理的动态触觉-语言框架

Kailin Lyu, Di Wu, Long Xiao, Jianning Zeng, Jianwei He, Chang Lin, Lianyu Hu, Lin Shu, Jie Hao, Ce Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongguancun Academy(北京中关村科学城) Nanyang Technological University(南洋理工大学) Guangdong Institute of Artificial Intelligence and Advanced Computing(广东省人工智能与先进计算研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对动态触觉信号建模不足、触觉基础模型易幻觉的问题,提出含动态触觉编码器的TacReasoner框架,配套构建TouchCoT-10k数据集与DynTac-Bench基准,推理性能优于主流大模型。

Comments 8 pages, 7 figures. Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18950 2026-06-19 cs.AI 新提交 83%

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

RTSGameBench: 视觉语言模型战略推理的RTS基准

San Kim, Daechul Ahn, Reokyoung Kim, Hyeonbeom Choi, Seungyeon Jwa, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16562 2026-06-16 cs.LG 新提交 83%

MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

MIRAGE: 审计前沿大语言模型在推理、智能体与时间耦合条件下的反穆斯林偏见

Noor Islam S. Mohammad, Tamim Sheikh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出MIRAGE基准,包含1200个提示,覆盖直接完成、思维链推理和模拟智能体决策三种部署场景,发现思维链放大偏见、智能体决策存在不对称性、偏见与检索新闻时间耦合,现有缓解措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 83%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 83%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09556 2026-06-09 cs.AI 新提交 83%

AI Scientists Are Only as Good as Their Evidence: A Stratified Ablation of Proprietary Data and Reasoning Skills in Drug-Asset Valuation

AI科学家的能力取决于其证据:药物资产估值中专有数据与推理技能的分层消融研究

Yinan Wang

机构 * Noah AI Research(Noah AI研究)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 通过分层消融实验,发现药物资产估值中AI科学家的决策上限由专有证据集决定,而非仅依赖推理框架;加入专有数据后决策质量显著提升。

Comments Preprint; 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08649 2026-06-09 cs.CR cs.AI 新提交 83%

Sample-Efficient LLM-Based Detection of Malicious Web Server Logs with Forensically Explainable Reasoning

基于大语言模型的恶意Web服务器日志检测与取证可解释推理的样本高效方法

Bernhard Kneip, Nhien-An Le-Khac, Hong-Hanh Nguyen-Le

机构 * University of Tuebingen(图宾根大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出CEF-Log策略,通过五步推理模板使大语言模型学习日志分析方法,在CSIC 2010数据集上仅用4个示例达到F1=0.99,样本效率提升10倍,并引入新数据集ForenWebLog。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09432 2026-08-11 cs.CL cs.AI 新提交 82%

ZetaGPT: A Reference Implementation of Positional--Encoding--Free State--Space--Attention Language Models

ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现

Róisín Luo

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22496 2026-06-23 cs.PF cs.AI cs.LG 新提交 82%

Enabling Cloud-Level Accuracy in Edge AI through IoT Data Preprocessing

通过物联网数据预处理实现边缘AI的云端级精度

Aygün Varol, Katarzyna Kołodziej, Łukasz Sobczak, Michał Romaszewski, Przemysław Głomb, Naser Hossein Motlagh, Mirka Leino, Johanna Virkki

机构 * Faculty of Information Technology and Communication Sciences, Tampere University(信息科技与通信科学学院,塔尔皮耶大学) Institute of Theoretical and Applied Informatics, Polish Academy of Sciences(理论与应用信息学研究所,波兰科学院) Department of Computer Science, University of Helsinki(计算机科学系,赫尔辛基大学) Satakunta University of Applied Sciences(萨塔昆塔应用科学大学)

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对边缘部署的紧凑型LLM在原始传感器读数下数值推理弱的问题,提出结构化提示构建框架,通过逐步丰富文本表示(原始值、阈值描述、环境摘要标志)提升局部模型精度,实验表明该方法可将局部准确率从约50%提升至80%以上,同时保持低延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12391 2026-08-14 cs.CL cs.AI cs.LG 新提交 82%

Unified Multi-Dimensional Benchmark for Complex Graph Reasoning in Large Language Models

面向大语言模型复杂图推理的统一多维度基准

Fali Wang, Ali Al-Lawati, Iliyas Bektas, Jinxuan Fang, Alek Melenski, Tianxiang Zhao, Yao Ma, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有图推理基准的局限,提出半自动框架构建含202个任务的统一多维度基准,评估LLM在不同推理模式下的表现,揭示模型局限并提供实证指导。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04434 2026-08-06 cs.CV 新提交 82%

OmniRouting: A Semantic-Coupled Multimodal Benchmark for Constraint-Aware Spatial Reasoning in PCB Routing

OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准

Taiting Lu, Kaiyuan Lin, Ziwei Dong, Sisong Bei, Haolin Ye, Yuxin Tian, Runze Liu, Mingjia Wang, Jingying Zeng, Hongxing Pan, Kai Zhang, Haoyu Wang, Guoliang Shi, Ling Ma, Yifan Yang, Jiaying Lu, Qi He, Yi-Chao Chen, Sung-Liang Chen, Yincheng Jin, Mahanth Gowda

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00200 2026-08-04 cs.AI cs.CL cs.ET cs.LG 新提交 82%

TRACE-TS: Attribution-Grounded and Traceable Sensor-Language Reasoning for Human Activity Understanding

TRACE-TS:面向人类活动理解的归因基础且可追踪的传感器-语言推理

Sparsh Rastogi, Tanmay Kumar, Baiyu Chen, Jatin Bedi, Zechen Li, Flora D. Salim

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对现有传感器-语言推理与信号关联弱、解释不可靠的问题,提出TRACE-TS框架,通过专家归因识别关键传感器区域并构建可追踪推理轨迹,在7个可穿戴基准上实现最优性能。

Comments 24 pages, 9 figures, 24 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19678 2026-07-23 cs.CL cs.AI cs.LG 新提交 82%

Reference-Free Evaluation of Reasoning in Open-Ended Question Answering

开放式问答中推理的无参考评估

Guneet Singh Kohli, Yuxiang Zhou, Michael Sejr Schlichtkrull, Gregory E Dean, Maria Liakata

机构 * Queen Mary University of London(伦敦大学玛丽皇后学院) Temple University(天普大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对高风险领域人工智能生成答案难验证问题,提出基于推理的无参考框架审核大语言模型输出,通过分解推理轨迹、标记关系并组织成超图等方法评估,在数学和医学推理设置下比直接以大语言模型为基线更可靠,强调问答评估应考虑推理关系组合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13439 2026-07-16 cs.CR cs.SE 新提交 82%

DREA: Decoupled Reasoning and Exploration Agents for Repository-Level Vulnerability Detection

DREA:用于仓库级漏洞检测的解耦推理与探索代理

Mingyang Sun, Guozhu Meng

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 研究针对大语言模型用于仓库级漏洞检测时的不足,提出DREA框架,通过规划与探索代理解耦,实现目标导向上下文获取。构建RepoPairBench评估,提升配对正确性,降低成本,还发现安全推理质量是当前大语言模型的瓶颈。

Comments Accepted for presentation at Internetware 2026. 12 pages, 4 figures, and 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13081 2026-07-16 cs.CR cs.AI cs.CL cs.LG 新提交 82%

SingGuard-NSFA: Extensible Guardrails for Agentic AI via Generative Reasoning and Real-Time Classification

SingGuard-NSFA:通过生成式推理和实时分类实现的可扩展智能体人工智能护栏

SingGuard Team

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对智能体人工智能系统操作威胁,提出NSFA分类法构建基准套件,开发双模式方法,发布四个不同参数模型,在基准测试和跨源评估中表现出色,证明方法可扩展性与通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12497 2026-07-15 cs.CV 新提交 82%

TerraLogic: A Benchmark for Hierarchical Geospatial Reasoning in Earth Observation

TerraLogic:地球观测中分层地理空间推理的基准

Yuhang Yan, Linchao Mou, Bokang Yang, Qingyu Li

机构 * The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract)

AI总结 针对遥感中认知地理空间推理研究不足的问题,引入TerraLogic基准及HieraPlan工具增强智能体,通过545个任务推动评估向认知级发展,实验显示HieraPlan在分层地理空间推理上表现出色,为相关研究提供强大基线。

Comments 8 pages, 3 figures, and 7 tables. Dataset and agent code are available at https://github.com/Ireliya/TerraLogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08093 2026-07-10 cs.AI cs.CL cs.LG 新提交 82%

CausalDS: Benchmarking Causal Reasoning in Data-Science Agents

因果DS:数据科学智能体中的因果推理基准测试

Andrej Leban, Yuekai Sun

机构 * Department of Statistics University of Michigan(统计学系密歇根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 介绍用于评估数据科学智能体因果推理的CausalDS基准,由含观测数据的结构因果模型和合成自然语言故事构成场景,导出跨越Pearl三个层级的任务,联合评估符号因果推理、数据科学等多方面能力。

Comments 55 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07708 2026-07-09 cs.CL cs.AI cs.CE cs.LG 新提交 82%

Accurate, Interdisciplinary and Transparent Structure-property Understanding with Deep Native Structural Reasoning

通过深度原生结构推理实现准确、跨学科和透明的结构-属性理解

Chen Tang, Yizhou Wang, Jianyu Wu, Lintao Wang, Shixiang Tang, Pengze Li, Encheng Su, Jun Yao, Jiabei Xiao, Yuqi Shi, Jielan Li, Hongxia Hao, Zhangyang Gao, Fang Wu, Ben Fei, Xiangyu Yue, Pan Tan, Bozitao Zhong, Jinouwen Zhang, Aoran Wang, Yan Lu, Jiaheng Liu, Xinzhu Ma, Liang Hong, Mingyue Zheng, Phil Torr, Bowen Zhou, Wanli Ouyang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) University of Sydney(悉尼大学) Nanjing University(南京大学) University of Oxford(牛津大学) The University of Science and Technology of China(中国科学技术大学) Drug Discovery and Design Center, State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences(药物发现与设计中心、国家药物研究重点实验室、上海中医药材料医学研究所、中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究聚焦利用人工智能解释结构-属性关系的挑战,提出多模态科学基础模型SciReasoner,通过离散化结构信息为可寻址单元进行推理,在多领域基准测试中表现出色,实现准确预测与可解释科学推理的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04645 2026-07-07 cs.CL cs.AI cs.CR cs.LG 新提交 82%

Retroactive Chain-of-Thought (RetroCoT): Forensic Reconstruction Prompts as a Safety Diagnostic Across Model Generations

追溯性思维链(RetroCoT):作为跨模型代际安全诊断的法证重建提示

Samira Hajizadeh

机构 * Columbia University(哥伦比亚大学)

专题命中 推理评测 :chain-of-thought(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现大语言模型安全对齐受语用寄存器影响,介绍追溯性思维链攻击RetroCoT将有害请求重构为法证重建任务,在AdvBench测试中取得一定成功率,还发现模型代际差异及新语用寄存器对模型安全对齐的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03069 2026-07-07 cs.CV 新提交 82%

SafeGuard: A Multi-Agent Perception-Reasoning Framework for Social-Risk AI-Generated Video Detection

SafeGuard:用于社会风险AI生成视频检测的多智能体感知-推理框架

Wenlin Wu, Sheng Zhou, Peipei Song, Wenhao Wang, Junbin Xiao, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) Vast Intelligence Lab(旷视智能实验室)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract)

AI总结 针对AI生成视频检测挑战,提出SafeGuard多智能体框架,通过感知求解器与验证器协作,引入SafeVid基准,实验证明其泛化性佳,提升检测准确率。

Comments Accepted to ECCV 2026, The code and dataset are publicly available at https://github.com/williamw99/SafeGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25356 2026-06-25 cs.CR cs.SE 新提交 82%

Representation Matters: An Empirical Study of Program Representations for LLM Vulnerability Reasoning

表示至关重要:LLM 漏洞推理中程序表示的实证研究

Andrew Stoltman, Johnathan Tang, Haipeng Cai

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 通过 RepBench 基准比较原始源码与基于静态分析的程序表示,发现 AST+PDG 组合准确率达 83.2%,远超原始源码的 53.5%,表明精心选择的结构化表示能提供更优的准确率-开销权衡。

Comments 34 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12169 2026-06-11 cs.CV cs.AI cs.CL cs.LG 新提交 82%

OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

OpenMedReason: 医学视觉语言模型的科学推理监督

Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi

机构 * York University(约克大学) Vector Institute(向量研究所) University of British Columbia(不列颠哥伦比亚大学) University of Toronto(多伦多大学) Unity Health Toronto / St. Michael’s Hospital(多伦多联合健康/圣迈克尔医院) University Health Network(大学健康网络) Arc Institute(弧研究所) Queen's University(女王大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OpenMedReason,一个包含约45万图像-问题-答案实例的大规模开放医学推理语料库,其推理轨迹主要来自生物医学科学文章,并配套基准OpenMedReason-Bench进行细粒度评估,在监督微调和强化对齐中有效提升模型性能。

Comments 42 pages, 9 figures, 24 tables. Dataset and code: https://huggingface.co/datasets/neginb/OpenMedReason

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11893 2026-06-11 cs.LG cs.AI cs.CL q-bio.NC 新提交 82%

Beyond representational alignment with brain-guided language models for robust reasoning

超越表征对齐:基于大脑引导的语言模型实现稳健推理

Mingqing Xiao, Kai Du, Zhouchen Lin

机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学通用人工智能国家重点实验室、智能科学与技术学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理与认知科学系) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过fMRI信号增强大型语言模型推理能力,提出脑引导框架,在10个模型上实现最高13%的准确率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09925 2026-06-10 cs.SD 新提交 82%

AudioProcessBench: Benchmark for Identifying Process Errors in Audio-Grounded Reasoning

AudioProcessBench: 音频基础推理中过程错误识别的基准

Xiangyu Zhao, Junyu Yan, Yaling Shen, Zimu Wang, Yiwen Jiang, Stephanie Fong, Qingyang Xu, Jiahe Liu, Dominic Dwyer, Zongyuan Ge

机构 * Monash University(墨尔本大学) Xi’an Jiaotong-Liverpool University(西安交通大学-利物浦大学) Orygen(Orygen研究所) University of Melbourne(墨尔本大学)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract)

AI总结 提出AudioProcessBench基准,用于评估音频-语言模型在推理步骤中的过程错误识别能力,涵盖步骤正确性、错误类型检测和链级聚合三种范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15389 2026-08-18 cs.AI 新提交 81%

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

重新审视Agentic-SQL:面向LLM文本转SQL的基于自主性的分类与实证基准分析

Changruo Zhao, Zujun Peng, Yu Tian, Yuting Liu, Yiyun Su, Huiying Zhu, Luyan Zhang, Heming Zeng

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本研究针对LLM文本转SQL领域,构建基于自主性的分类框架,通过Spider案例研究分析8B开源模型与DeepSeek-V3等基线的表现,发布工具链用于构建可追溯的基准排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏