arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-03 至 2026-04-03 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2604.02155 2026-04-03 cs.CL 85%

Brief Is Better: Non-Monotonic Chain-of-Thought Budget Effects in Function-Calling Language Agents

简洁即更好:函数调用语言代理中的非单调链式思维预算效应

Xuan Qi

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院)

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL

AI总结 研究探讨了链式思维预算对函数调用代理性能的影响,发现简短的链式思维显著提升准确性,而延长的链式思维反而降低性能,提出Function-Routing CoT方法提升可靠性。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02230 2026-04-03 cs.AI 79%

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs

回答错误的问题:用于LLMs中退避的推理轨迹逆向

Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 79%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07995 2026-04-03 cs.IR cs.AI 79%

DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval

DIVER:一种用于推理密集型信息检索的多阶段方法

Duolin Sun, Meixiu Long, Dan Yang, Junjie Wang, Yecheng Luo, Yue Shen, Jian Wang, Hualei Zhou, Chunxiao Guo, Peng Wei, Jiahai Wang, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DIVER通过多阶段流程提升推理密集型信息检索性能,包含文档预处理、查询扩展、检索和重排序四个环节,有效应对需要抽象推理和多步推理的复杂查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24458 2026-04-03 cs.CV 78%

OmniWeaving: Towards Unified Video Generation with Free-form Composition and Reasoning

OmniWeaving:迈向统一视频生成的自由组合与推理

Kaihang Pan, Qi Tian, Jianwei Zhang, Weijie Kong, Jiangfeng Xiong, Yanxin Long, Shixue Zhang, Haiyi Qiu, Tan Wang, Zheqi Lv, Yue Wu, Liefeng Bo, Siliang Tang, Zhao Zhong

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯混元) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 本文提出OmniWeaving模型,通过大规模预训练数据学习多模态组合与推理能力,引入IntelligentVBench基准测试,展示其在开放源码统一视频生成中的领先性能。

Comments 32 pages, 22 figures. Project Page: https://omniweaving.github.io. Github: https://github.com/Tencent-Hunyuan/OmniWeaving. Model: https://huggingface.co/tencent/HY-OmniWeaving

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00261 2026-04-03 cs.CL 77%

Can Large Language Models Self-Correct in Medical Question Answering? An Exploratory Study

大语言模型能否在医疗问答中自我纠正?一项探索性研究

Zaifu Zhan, Mengyuan Cui, Rui Zhang

机构 * Department of Electrical and Computer Engineering, University of Minnesota(明尼苏达大学电气与计算机工程系) Division of Computational Health Sciences, Department of Surgery, University of Minnesota(明尼苏达大学外科学系计算健康科学部) Department of Software Engineering, University of St. Thomas(圣托马斯大学软件工程系)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文探讨大语言模型在医疗问答中的自我反思能力,通过比较标准Co-T提示与迭代自我反思循环,发现自我反思并不总能提升准确性,且效果依赖于数据集和模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01529 2026-04-03 cs.AI cs.MA 77%

A Role-Based LLM Framework for Structured Information Extraction from Healthy Food Policies

基于角色的LLM框架用于从健康食品政策中提取结构化信息

Congjing Zhang, Ruoxuan Bao, Jingyu Li, Yoav Ackerman, Shuai Huang, Yanfang Su

机构 * University of Washington(华盛顿大学) Shanghai University(上海大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出基于角色的LLM框架,通过分配专门角色提升健康食品政策信息提取的准确性与透明度,对比零样本、少样本和推理链基线,展现更优的复杂推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23752 2026-04-03 cs.CV 67%

ThinkGeo: Evaluating Tool-Augmented Agents for Remote Sensing Tasks

ThinkGeo: 评估用于遥感任务的工具增强代理

Akashah Shabbir, Muhammad Akhtar Munir, Akshay Dudhane, Muhammad Umer Sheikh, Muhammad Haris Khan, Paolo Fraccaro, Juan Bernabe Moreno, Fahad Shahbaz Khan, Salman Khan

机构 * Mohamed bin Zayed University of AI(穆罕默德·本·扎耶德人工智能大学) IBM Research(IBM研究院) Linköping University(林雪平大学) Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 ThinkGeo是一个针对遥感任务设计的代理基准,评估LLM驱动代理在结构化工具使用和多步骤规划中的能力,通过人类 curated 查询和专家验证的推理步骤测试不同模型的工具准确性和规划一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11298 2026-04-03 cs.RO 50%

ThinkGrasp: A Vision-Language System for Strategic Part Grasping in Clutter

ThinkGrasp: 一种用于杂乱环境战略部件抓取的视觉-语言系统

Yaoyao Qian, Xupeng Zhu, Ondrej Biza, Shuo Jiang, Linfeng Zhao, Haojie Huang, Yu Qi, Robert Platt

机构 * Northeastern University(东北大学) Boston Dynamics AI Institute(波士顿动力人工智能研究所)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ThinkGrasp利用GPT-4o的上下文推理能力,在复杂环境中实现高效抓取,通过目标导向语言逐步清除障碍物,提升抓取成功率。

Comments Accepted at CoRL 2024. Project Website:(https://h-freax.github.io/thinkgrasp_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏