arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2604.08788 2026-04-13 cs.CL 79%

MedConceal: A Benchmark for Clinical Hidden-Concern Reasoning Under Partial Observability

MedConceal:一个用于在部分可观测性下进行临床隐藏关切推理的基准

Yikun Han, Joey Chan, Jingyuan Chen, Mengting Ai, Simo Du, Yue Guo

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NYC Health + Hospitals/Jacobi(纽约市健康与医院管理局/雅可比医疗中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 MedConceal通过交互式患者模拟器评估医疗对话中的隐藏关切推理,包含300个案例和600个医生-LLM交互,研究确认和干预能力,发现前沿模型在确认指标上表现优异,而人类医生在干预成功率上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08615 2026-04-13 cs.CV cs.AI 79%

MARINER: A 3E-Driven Benchmark for Fine-Grained Perception and Complex Reasoning in Open-Water Environments

MARINER:一种基于3E驱动的基准,用于开放水域环境中的细粒度感知与复杂推理

Xingming Liao, Ning Chen, Muying Shu, Yunpeng Yin, Peijian Zeng, Zhuowei Wang, Nankai Lin, Lianglun Cheng

机构 * Guangdong University of Technology(广东工业大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MARINER基准,通过3E框架评估开放水域环境中的细粒度感知与复杂推理,揭示先进模型在复杂海洋场景中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07517 2026-04-13 cs.AI cs.MA 79%

When Identity Skews Debate: Anonymization for Bias-Reduced Multi-Agent Reasoning

当身份偏见引发争论:为减少偏见的多智能体推理中的匿名化

Hyeong Kyu Choi, Xiaojin Zhu, Sharon Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出了一种框架,通过去除身份标记来减少多智能体推理中的身份偏见,定义了身份偏见系数,并通过实验验证身份偏见普遍存在。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28618 2026-04-10 cs.AI 79%

Seeing with You: Perception-Reasoning Coevolution for Multimodal Reasoning

与你共见:多模态推理中的感知-推理共进化

Ziqi Miao, Haonan Jia, Lijun Li, Chen Qian, Yuan Xiong, Wenting Yan, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PRCO框架,通过分离的奖励信号提升多模态推理的感知与推理能力,在八个基准测试中平均提升7个百分点。

Comments 21 pages, 15 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06375 2026-04-09 cs.AI 79%

SymptomWise: A Deterministic Reasoning Layer for Reliable and Efficient AI Systems

SymptomWise: 一种用于可靠和高效人工智能系统的确定性推理层

Isaac Henry, Avery Byrne, Christopher Giza, Ron Henry, Shahram Yazdani

机构 * University of California Los Angeles, David Geffen School of Medicine(加州大学洛杉矶分校大卫·格芬医学院) University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SymptomWise通过分离语言理解与诊断推理,结合专家知识和确定性推理,提升AI系统可靠性与可解释性,初步验证在儿科神经病学案例中表现优异。

Comments 18 pages, 1 figure,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06264 2026-04-09 q-bio.QM cs.AI 79%

ToxReason: A Benchmark for Mechanistic Chemical Toxicity Reasoning via Adverse Outcome Pathway

ToxReason: 一个通过不良后果途径进行机理化学毒性推理的基准

Jueon Park, Wonjune Jang, Chanhwi Kim, Yein Park, Jaewoo Kang

机构 * Korea University(高丽大学) Myongji University(明知大学) University of Texas Health Science Center at Houston(德克萨斯大学休斯顿健康科学中心) AIGEN Sciences

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ToxReason基准通过整合药物-靶点相互作用证据与毒性标签,评估多器官水平的毒性推理能力,发现强预测性能不等于可靠推理,且推理意识训练能提升机理推理和毒性预测性能。

Comments Accepted to ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23158 2026-04-09 cs.CV cs.AI 79%

REVEAL: Reasoning-Enhanced Forensic Evidence Analysis for Explainable AI-Generated Image Detection

REVEAL: 基于推理的取证分析用于可解释的AI生成图像检测

Huangsen Cao, Qin Mei, Zhiheng Li, Yuxi Li, Zhan Meng, Ying Zhang, Chen Li, Zhimeng Zhang, Xin Ding, Yongwei Wang, Jing Lyu, Fei Wu

机构 * Zhejiang University(浙江大学) WeChat Vision, Tencent Inc(腾讯微信视觉) Nanjing University of Information Science and Technology(南京信息工程大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 REVEAL通过构建可验证的证据链,提升AI生成图像检测的可解释性与泛化能力,采用专家引导的强化学习训练框架,实现更准确和可信的检测结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11635 2026-04-09 cs.AI 79%

Do MLLMs Really Understand Space? A Mathematical Reasoning Evaluation

大规模语言模型真的能理解空间吗?一项数学推理评估

Shuo Lu, Jianjie Cheng, Yinuo Xu, Yongcan Yu, Lijun Sheng, Peijie Wang, Siru Jiang, Yongguan Hu, Run Ling, Yihua Shao, Ao Ma, Wei Feng, Lingxiao He, Meng Wang, Qianlong Xie, Xingxing Wang, Nicu Sebe, Ran He, Jian Liang

机构 * Meituan Inc.(美团) Northeastern University(东北大学) University of Trento(特伦托大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文通过MathSpatial数据集评估了大规模语言模型在数学空间推理上的能力,发现其在空间推理任务上表现不佳,提出该数据集有助于提升模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 79%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05135 2026-04-08 cs.CL cs.CE 79%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04570 2026-04-08 cs.CV cs.CL 79%

Thinking with Video: Video Generation as a Promising Multimodal Reasoning Paradigm

通过视频思考:视频生成作为一种有前途的多模态推理范式

Jingqi Tong, Yurong Mou, Hangcheng Li, Mingzhe Li, Yongzhuo Yang, Ming Zhang, Qiguang Chen, Tianyi Liang, Xiaomeng Hu, Yining Zheng, Xinchi Chen, Jun Zhao, Xuanjing Huang, Xipeng Qiu

机构 * Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究所) Shanghai Innovation Institute(上海创新研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海市多模态具身人工智能重点实验室) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) The Chinese University of Hong Kong(香港中文大学) Central South University(中南大学) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出'通过视频思考'范式,利用视频生成模型实现多模态推理,通过VideoThinkBench评估显示Sora-2在视觉和文本任务中均表现出色,证明视频生成模型在统一多模态理解与生成中的潜力。

Comments 34 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03660 2026-04-07 cs.AI 79%

TableVision: A Large-Scale Benchmark for Spatially Grounded Reasoning over Complex Hierarchical Tables

TableVision:一种大规模基准,用于复杂分层表格上的空间感知推理

Xiaoyu Chen, Lu Dai, Hanqing Wang, Zhuoyu Li, Wenbin Dai, Yanzong Zheng, Zhenggang Xia, Junyong Lin, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出TableVision基准,通过量化分析发现复杂表格推理中的感知瓶颈,引入轨迹感知的分层任务分类,结合确定性接地流程生成6799条高保真推理轨迹,提升多模态大语言模型的空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03587 2026-04-07 cs.CR cs.AI 79%

SecPI: Secure Code Generation with Reasoning Models via Security Reasoning Internalization

SecPI: 通过安全推理内化实现安全代码生成

Hao Wang, Niels Mündler, Mark Vero, Jingxuan He, Dawn Song, Martin Vechev

机构 * University of California, Berkeley(加州大学伯克利分校) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SecPI通过内化结构化安全推理,使推理模型在无需安全指令的情况下生成安全代码,经验证在多个安全基准测试中显著提升代码功能正确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01916 2026-04-03 cs.CL 79%

SURE: Synergistic Uncertainty-aware Reasoning for Multimodal Emotion Recognition in Conversations

SURE:用于对话中多模态情绪识别的协同不确定性推理

Yiqiang Cai, Chengyan Wu, Bolei Ma, Bo Chen, Yun Xue, Julia Hirschberg, Ziwei Gong

机构 * Guangdong Provincial Key Laboratory of Quantum Engineering and Quantum Materials(广东省量子工程与量子材料重点实验室) School of Electronic Science and Engineering (School of Microelectronics), South China Normal University(华南师范大学电子科学与工程学院(微电子学院)) Shenzhen University(深圳大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 SURE通过整合多模态信号并增强鲁棒性和上下文建模,改进了对话中情绪识别的不确定性处理和细粒度推理能力。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01711 2026-04-03 cs.CL 79%

Human-Guided Reasoning with Large Language Models for Vietnamese Speech Emotion Recognition

基于大语言模型的人机协同推理用于越南语语音情感识别

Truc Nguyen, Then Tran, Binh Truong, Phuoc Nguyen T. H

机构 * University of Information Technology, Ho Chi Minh City, Vietnam(越南胡志明市信息技术大学) Vietnam National University Ho Chi Minh City, Ho Chi Minh City, Vietnam(越南胡志明市国家大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出一种融合人类知识的语音情感识别框架,通过LLM推理处理模糊样本,提升低资源环境下的情感分类性能,达到86.59%的准确率。

Comments 6 pages, 2 figures. Dataset of 2,764 Vietnamese speech samples across three emotion classes

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01639 2026-04-03 cs.CL 79%

Fragile Reasoning: A Mechanistic Analysis of LLM Sensitivity to Meaning-Preserving Perturbations

脆弱的推理:对大语言模型对意义保持扰动敏感性的机制分析

Shou-Tzu Han, Rodrigue Rizk, KC Santosh

机构 * University of South Dakota(南达科他大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究评估了三种大语言模型在数学推理任务中的表现,发现其对意义保持的表面扰动敏感,提出MPD框架分析失败机制,提出三种故障分类并验证修复效果。

Comments Preprint. Under review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08640 2026-04-03 cs.SE cs.AI 79%

Automating Android Build Repair: Bridging the Reasoning-Execution Gap in LLM Agents with Domain-Specific Tools

自动化Android构建修复:通过领域特定工具弥合LLM代理中的推理-执行差距

Ha Min Son, Huan Ren, Xin Liu, Zhe Zhao

机构 * University of California, Davis(加州大学戴维斯分校) CodeDroid LLC(CodeDroid有限责任公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出AndroidBuildBench基准和GradleFixer工具,通过领域特定抽象提升LLM修复Android构建错误的效率,解决LLM在低层执行中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23824 2026-04-03 cs.CL 79%

Reviewing Scientific Papers for Critical Problems With Reasoning LLMs: Baseline Approaches and Automatic Evaluation

利用推理LLM审查科学论文中的关键问题:基线方法与自动评估

Tianmai M. Zhang, Neil F. Abernethy

机构 * University of Washington(华盛顿大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出利用推理LLM作为论文质量检查器,介绍基线方法和自动评估框架,通过arXiv论文验证方法,并评估其在识别科学论文关键错误中的性能。

Comments Accepted and presented at NeurIPS 2025 AI for Science Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00568 2026-04-02 cs.CL 79%

A Japanese Benchmark for Evaluating Social Bias in Reasoning Based on Attribution Theory

一个用于评估基于归因理论的社会偏见的日本基准

Taihei Shiotani, Masahiro Kaneko, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) AIST(产业技术综合研究所) NII(国立信息学研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文基于归因理论,构建了新的日本基准JUBAKU-v2,用于评估推理中对内群体和外群体行为归因的偏见,通过固定结论来检测模型在文化偏见上的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29608 2026-04-01 cs.CL 79%

Learning Diagnostic Reasoning for Decision Support in Toxicology

学习毒理学诊断推理以支持决策

Nico Oberländer, David Bani-Harouni, Tobias Zellner, Nassir Navab, Florian Eyer, Matthias Keicher

机构 * Computer Aided Medical Procedures, Technical University of Munich, Germany(德国慕尼黑工业大学计算机辅助医疗程序研究所) Munich Center for Machine Learning (MCML), Germany(德国慕尼黑机器学习中心(MCML)) Department of Clinical Toxicology and Poison Control Center Munich, TUM Klinikum rechts der Isar, Germany(德国慕尼黑工业大学伊萨尔河右岸医院临床毒理学与毒物控制中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出DeToxR,通过强化学习处理毒理学中的多标签预测,结合未结构化和结构化数据提升诊断准确性,优于基线模型和专家。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28924 2026-04-01 cs.CL 79%

CrossTrace: A Cross-Domain Dataset of Grounded Scientific Reasoning Traces for Hypothesis Generation

CrossTrace:一种跨领域 grounded 科学推理轨迹数据集用于假设生成

Andrew Bouras, OMS-II Research Fellow

机构 * Nova Southeastern University Dr. Kiran C. Patel College of Osteopathic Medicine(诺瓦东南大学基兰·C·帕特尔骨科医学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 CrossTrace 是一个跨领域 grounded 科学推理轨迹数据集,包含 1389 个轨迹,涵盖生物医学研究、AI/ML 和跨领域工作。通过 QLoRA 微调 Qwen2.5-7B-Instruct,显著提升 IAScore 和结构合规性,验证跨领域推理轨迹的有效性。

Comments 14 pages, 1 figure, 8 tables. Dataset and code available at https://github.com/andrewbouras/crosstrace

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28474 2026-03-31 cs.CV cs.AI 79%

CiQi-Agent: Aligning Vision, Tools and Aesthetics in Multimodal Agent for Cultural Reasoning on Chinese Porcelains

CiQi-Agent:在多模态代理中对视觉、工具和美学的对齐用于中国瓷器的文化推理

Wenhan Wang, Zhixiang Zhou, Zhongtian Ma, Yanzhu Chen, Ziyu Lin, Hao Sheng, Pengfei Liu, Honglin Ma, Wenqi Shao, Qiaosheng Zhang, Yu Qiao

机构 * Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Shaanxi Academy of Cultural Relics Conservation(陕西省文物保护研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CiQi-Agent,通过多图像输入、视觉工具调用和多模态检索增强生成,实现对瓷器六个属性的精细分析,同时构建了专家标注的CiQi-VQA数据集和对齐的CiQi-Bench基准,实验表明其在六个属性上的准确率比GPT-5高12.2%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15090 2026-03-31 cs.DB cs.AI cs.CV 79%

SciEGQA: A Dataset for Scientific Evidence-Grounded Question Answering and Reasoning

SciEGQA:一个用于科学证据基础问题回答与推理的数据集

Wenhan Yu, Zhaoxi Zhang, Wang Chen, Guanqiang Qi, Weikang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Beihang University(北京航空航天大学) Peking University(北京大学) The University of Hong Kong(香港大学) Baidu Inc.(百度公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SciEGQA数据集通过精细标注和大规模自动构建,提升视觉语言模型在科学文档中的证据定位与推理能力。

Comments 8 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20964 2026-03-30 cs.CV cs.AI 79%

Evidence-based diagnostic reasoning with multi-agent copilot for human pathology

基于多智能体助手的证据驱动诊断推理

Luca L. Weishaupt, Chengkuan Chen, Drew F. K. Williamson, Richard J. Chen, Guillaume Jaume, Tong Ding, Bowen Chen, Anurag Vaidya, Long Phi Le, Guillaume Jaume, Ming Y. Lu, Faisal Mahmood

机构 * Health Sciences and Technology, Harvard-MIT(哈佛-MIT健康科学与技术) Department of Pathology, Massachusetts General Hospital, Harvard Medical School(麻省总医院病理科,哈佛医学院) Cancer Program, Broad Institute of Harvard and MIT(哈佛-MIT博德研究所癌症项目) Harvard John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保尔森工程与应用科学学院) Electrical Engineering and Computer Science, Massachusetts Institute of Technology (MIT)(麻省理工学院电气工程与计算机科学) Harvard Data Science Initiative, Harvard University(哈佛大学数据科学计划)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出PathChat+,一种专为人类病理设计的多模态大语言模型,通过大量病理特定指令样本训练,显著优于现有模型,在多图像理解与自主诊断推理方面表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21430 2026-03-26 cs.AI cs.SE 79%

DomAgent: Leveraging Knowledge Graphs and Case-Based Reasoning for Domain-Specific Code Generation

DomAgent:利用知识图谱和基于案例的推理进行领域特定代码生成

Shuai Wang, Dhasarathy Parthasarathy, Robert Feldt, Yinan Yu

机构 * Chalmers University of Technology(楚德斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 DomAgent通过结合知识图谱和基于案例的推理,提升领域特定代码生成能力,通过结构化推理和定向检索实现领域适应,实验表明其能显著提升复杂真实应用场景的代码生成性能。

Comments Accepted to AAMAS 2026 EA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23276 2026-03-25 cs.AI 79%

CXReasonAgent: Evidence-Grounded Diagnostic Reasoning Agent for Chest X-rays

CXReasonAgent:基于证据的胸部X光诊断推理代理

Hyungyung Lee, Hangyul Yoon, Edward Choi

机构 * KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出CXReasonAgent,结合大语言模型和临床诊断工具,通过图像生成的诊断和视觉证据进行证据导向的诊断推理,展示了其在多轮对话基准测试中的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09537 2026-03-25 cs.SE cs.AI 79%

From Context to Intent: Reasoning-Guided Function-Level Code Completion

从上下文到意图:基于推理的函数级代码补全

Yanzhou Li, Tianlin Li, Yiran Zhang, Shangqing Liu, Aishan Liu, Xianglong Liu, Yang Liu

机构 * Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种基于推理的提示框架,通过利用代码上下文中的隐含线索推断开发者意图,提升函数级代码补全的准确性,并通过实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07558 2026-03-23 cs.LG cs.CV 79%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 79%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18614 2026-03-20 cs.AI 79%

ZEBRAARENA: A Diagnostic Simulation Environment for Studying Reasoning-Action Coupling in Tool-Augmented LLMs

ZEBRAARENA:一种用于研究工具增强大语言模型中推理-动作耦合的诊断模拟环境

Wanjia Zhao, Ludwig Schmidt, James Zou, Vidhisha Balachandran, Lingjiao Chen

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ZEBRAARENA通过可控难度和知识最小化设计,研究工具增强大语言模型中的推理-动作耦合,强调深度推理与精准工具调用的结合,揭示理论最优与实际工具使用间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏