arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2505.14231 2025-05-21 cs.CV 85%

UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning

Sule Bai, Mingxing Li, Yong Liu, Jing Tang, Haoji Zhang, Lei Sun, Xiangxiang Chu, Yansong Tang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) AMAP, Alibaba Group(阿里云研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10178 2025-04-28 cs.SE 85%

MSCoT: Structured Chain-of-Thought Generation for Multiple Programming Languages

Naizhu Jin, Zhong Li, Tian Zhang, Qingkai Zeng

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

Comments accepted in ijcnn 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15341 2025-03-20 cs.SE 85%

Uncertainty-Guided Chain-of-Thought for Code Generation with LLMs

Yuqi Zhu, Ge Li, Xue Jiang, Jia Li, Hong Mei, Zhi Jin, Yihong Dong

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05829 2025-03-11 cs.SE 85%

SABER: Model-agnostic Backdoor Attack on Chain-of-Thought in Neural Code Generation

Naizhu Jin, Zhong Li, Yinggang Guo, Chao Su, Tian Zhang, Qingkai Zeng

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

Comments UNDER REVIEW

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03283 2025-02-19 cs.AI cs.CL cs.LG 85%

SymAgent: A Neural-Symbolic Self-Learning Agent Framework for Complex Reasoning over Knowledge Graphs

Ben Liu, Jihai Zhang, Fangquan Lin, Cheng Yang, Min Peng, Wotao Yin

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.03971 2025-02-07 cs.CV cs.HC 85%

RWKV-UI: UI Understanding with Enhanced Perception and Reasoning

Jiaxi Yang, Haowen Hou

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

Comments 10 pages, 5figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18925 2024-12-30 cs.CL cs.AI cs.LG 85%

HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs

Junying Chen, Zhenyang Cai, Ke Ji, Xidong Wang, Wanlong Liu, Rongsheng Wang, Jianye Hou, Benyou Wang

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16579 2024-11-26 cs.CL cs.AI cs.LG 85%

Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision

Zhiheng Xi, Dingwen Yang, Jixuan Huang, Jiafu Tang, Guanyu Li, Yiwen Ding, Wei He, Boyang Hong, Shihan Do, Wenyu Zhan, Xiao Wang, Rui Zheng, Tao Ji, Xiaowei Shi, Yitao Zhai, Rongxiang Weng, Jingang Wang, Xunliang Cai, Tao Gui, Zuxuan Wu, Qi Zhang, Xipeng Qiu, Xuanjing Huang, Yu-Gang Jiang

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02658 2024-10-16 cs.AI cs.CL cs.LG 85%

Multi-step Problem Solving Through a Verifier: An Empirical Analysis on Model-induced Process Supervision

Zihan Wang, Yunxuan Li, Yuexin Wu, Liangchen Luo, Le Hou, Hongkun Yu, Jingbo Shang

专题命中 复杂问题求解 :verifier(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04521 2024-10-08 cs.CV 85%

MC-CoT: A Modular Collaborative CoT Framework for Zero-shot Medical-VQA with LLM and MLLM Integration

Lai Wei, Wenkai Wang, Xiaoyu Shen, Yu Xie, Zhihao Fan, Xiaojin Zhang, Zhongyu Wei, Wei Chen

专题命中 复杂问题求解 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract)

Comments 21 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.07496 2024-05-14 cs.CR 85%

Oedipus: LLM-enchanced Reasoning CAPTCHA Solver

Gelei Deng, Haoran Ou, Yi Liu, Jie Zhang, Tianwei Zhang, Yang Liu

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00216 2024-05-02 cs.CL cs.AI cs.LG 85%

Graphical Reasoning: LLM-based Semi-Open Relation Extraction

Yicheng Tao, Yiqun Wang, Longju Bai

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17076 2024-04-02 cs.CV cs.AI cs.CL cs.LG 85%

Compositional Chain-of-Thought Prompting for Large Multimodal Models

Chancharik Mitra, Brandon Huang, Trevor Darrell, Roei Herzig

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03843 2023-11-06 cs.AI cs.CL cs.LG 85%

Why think step by step? Reasoning emerges from the locality of experience

Ben Prystawski, Michael Y. Li, Noah D. Goodman

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.09842 2023-11-01 cs.CL cs.AI cs.CV cs.LG 85%

Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models

Pan Lu, Baolin Peng, Hao Cheng, Michel Galley, Kai-Wei Chang, Ying Nian Wu, Song-Chun Zhu, Jianfeng Gao

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 32 pages, 10 figures, 24 tables. Accepted to NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03188 2023-08-31 cs.CL cs.AI cs.LG 85%

Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies

Liangming Pan, Michael Saxon, Wenda Xu, Deepak Nathani, Xinyi Wang, William Yang Wang

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Work in Progress. Version 2

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.00720 2023-01-31 cs.CL cs.AI cs.LG 85%

Complexity-Based Prompting for Multi-Step Reasoning

Yao Fu, Hao Peng, Ashish Sabharwal, Peter Clark, Tushar Khot

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08607 2022-12-19 cs.CL cs.AI cs.LG 85%

MURMUR: Modular Multi-Step Reasoning for Semi-Structured Data-to-Text Generation

Swarnadeep Saha, Xinyan Velocity Yu, Mohit Bansal, Ramakanth Pasunuru, Asli Celikyilmaz

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 22 pages (9 figures, 18 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.14465 2022-05-23 cs.LG cs.AI cs.CL 85%

STaR: Bootstrapping Reasoning With Reasoning

Eric Zelikman, Yuhuai Wu, Jesse Mu, Noah D. Goodman

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04514 2026-06-10 cs.AI cs.CE cs.CL cs.CV stat.ME 版本更新 84%

ChartAgent: A Multimodal Agent for Visually Grounded Reasoning in Complex Chart Question Answering

ChartAgent: 一种用于复杂图表问答中视觉基础推理的多模态智能体

Rachneet Kaur, Nishan Srishankar, Zhen Zeng, Sumitra Ganesh, Manuela Veloso

机构 * J.P. Morgan AI Research(摩根大通人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出ChartAgent框架,通过迭代分解查询为视觉子任务并利用图表专用视觉工具(如绘制注释、裁剪区域)进行空间域推理,在ChartBench和ChartX上取得最先进性能,尤其对无标注图表提升显著。

Comments Accepted at ACL 2026 (Main Conference). Also presented as an oral paper at the NeurIPS 2025 Multimodal Algorithmic Reasoning Workshop (https://marworkshop.github.io/neurips25/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16867 2026-06-04 cs.LG cs.CL 84%

Efficient Reasoning on the Edge

边缘设备上的高效推理

Yelysei Bondarenko, Thomas Hehn, Rob Hesselink, Romain Lepert, Fabio Valerio Massoli, Evgeny Mironov, Leyla Mirvakhabova, Tribhuvanesh Orekondy, Spyridon Stasis, Andrey Kuzmin, Anna Kuzina, Markus Nagel, Ankita Nayak, Corrado Rainone, Ork de Rooij, Paul N Whatmough, Arash Behboodi, Babak Ehteshami Bejnordi

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 提出结合LoRA适配器、监督微调、强化学习预算控制、并行测试时缩放、动态适配器切换和KV缓存共享的方法,在资源受限的边缘设备上实现高效准确的推理。

Comments Project page: https://qualcomm-ai-research.github.io/llm-reasoning-on-edge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10338 2025-02-17 cs.CL cs.AI 84%

Evaluating the Meta- and Object-Level Reasoning of Large Language Models for Question Answering

Nick Ferguson, Liane Guillou, Alan Bundy, Kwabena Nuamah

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract,comments);分类 cs.CL、cs.AI

Comments 8 pages. Accepted to the Workshop on Planning in the Era of LLMs (LM4Plan @ AAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 84%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28063 2026-05-28 cs.SD cs.AI cs.MM 84%

Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts

自由文本提示的统一语音与声音合成

Yuyue Wang, Xihua Wang, Xin Cheng, Yijing Chen, Ruihua Song

机构 * Renmin University of China(中国人民大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 提出PlanAudio框架,利用大语言模型推理能力和语义潜在思维链机制,直接从自由文本生成包含语音和声音的统一音频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17610 2026-05-19 cs.CV cs.CL 84%

SafeLens: Deliberate and Efficient Video Guardrails with Fast-and-Slow Screening

SafeLens: 一种高效且可靠的视频护栏系统,采用快速和缓慢筛查

Shahriar Kabir Nahin, Hadi Askari, Muhao Chen, Anshuman Chhabra

机构 * University of South Florida(佛罗里达州立大学) University of California, Davis(加州大学戴维斯分校)

专题命中 复杂问题求解 :chain-of-thought(summary_cn,abstract);reasoning(abstract);分类 cs.CL

AI总结 本研究提出SafeLens视频护栏框架,通过快速和缓慢的推理架构实现高效的视频内容审核,同时构建高质量数据集并采用结构化Chain-of-Thought追踪来解决训练时间扩展的限制,从而在实际和AI生成视频基准测试中取得最佳性能,同时显著降低推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08243 2026-05-12 cs.CL 84%

Self-Debias: Self-correcting for Debiasing Large Language Models

Self-Debias:为大型语言模型引入自我纠正的去偏方法

Xuan Feng, Shuai Zhao, Luwei Xiao, Tianlong Gu, Bo An

机构 * Jinan University, China(济南大学,中国) Nanyang Technological University, Singapore(南洋理工大学,新加坡)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 本文提出Self-Debias框架,通过资源再分配策略使模型具备自我纠正能力,以解决去偏过程中持续的偏见传播问题,无需外部干预即可提升去偏效果。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02089 2026-08-04 cs.LG cs.AI 新提交 84%

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

推理摘要能透露多少信息?大语言模型的可观测性阶梯

Andres Algaba, Francesca Carlon, Lynn Delcon, Marthe Ballon, Bert Verbruggen, Vincent Ginis

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。

Comments 71 pages, 13 figures, 65 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05976 2026-08-03 cs.AI cs.CL 版本更新 84%

The Self-Correction Illusion: Role Relabeling Gates Explicit Error Flagging in Large Language Models

自我修正错觉:LLM 纠正他人但不纠正自己

Kuan-Yen Chen, Fang-Yi Su, Shih-Yen Lin, Bao Li, Jung-Hsien Chiang

机构 * National Taiwan University(国立台湾大学)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过保持错误声明字节一致仅改变角色标签,发现 LLM 无法自我修正并非能力缺陷,而是聊天模板角色标签的人为产物,并提出无需训练或模型修改的提示结构干预方法。

Comments 15 pages, 3 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 84%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 84%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏