arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2510.08521 2026-01-13 cs.AI 70%

FlowSearch: Advancing deep research with dynamic structured knowledge flow

FlowSearch: 通过动态结构化知识流推进深度研究

Yusong Hu, Runmin Ma, Yue Fan, Jinxin Shi, Zongsheng Cao, Yuhao Zhou, Jiakang Yuan, Shuaiyu Zhang, Shiyang Feng, Xiangchao Yan, Shufei Zhang, Wenlong Zhang, Lei Bai, Bo Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 FlowSearch通过动态结构化知识流提升多智能体系统在复杂任务中的推理与执行能力,实现跨学科研究的有效推进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24618 2026-01-06 cs.CL 70%

Youtu-LLM: Unlocking the Native Agentic Potential for Lightweight Large Language Models

Youtu-LLM:解锁轻量级大语言模型的原生代理潜力

Junru Lu, Jiarui Qin, Lingfeng Qiao, Yinghui Li, Xinyi Dai, Bo Ke, Jianfeng He, Ruizhi Qiao, Di Yin, Xing Sun, Yunsheng Wu, Yinsong Liu, Shuangyin Liu, Mingkong Tang, Haodong Lin, Jiayi Kuang, Fanxu Meng, Xiaojuan Tang, Yunjia Xi, Junjie Huang, Haotong Yang, Zhenyi Shen, Yangning Li, Qianwen Zhang, Yifei Yu, Siyu An, Junnan Dong, Qiufeng Wang, Jie Wang, Keyu Chen, Wei Wen, Taian Guo, Zhifeng Shen, Daohai Yu, Jiahao Li, Ke Li, Zongyi Li, Xiaoyu Tan

机构 * Youtu-LLM Team(Youtu-LLM团队)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 Youtu-LLM通过紧凑架构和长上下文支持,实现了轻量级大语言模型在代理任务中的高效推理与规划能力。

Comments 57 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18730 2025-12-23 cs.LG 70%

A Theoretical Lens for RL-Tuned Language Models via Energy-Based Models

通过能量模型的理论视角提升强化学习调优语言模型

Zhiquan Tan, Yinrong Hong

机构 * Tsinghua University(清华大学) Beihang University(北航)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 本文通过能量模型视角,揭示了强化学习调优语言模型的理论基础,证明了其在指令遵循和推理任务中的稳定性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16214 2025-12-23 cs.AI 70%

PDE-Agent: A toolchain-augmented multi-agent framework for PDE solving

PDE-Agent:一种增强工具链的多智能体框架用于PDE求解

Jianming Liu, Ren Zhu, Jian Xu, Kun Ding, Xu-Yao Zhang, Gaofeng Meng, Cheng-Lin Liu

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 PDE-Agent通过增强工具链的多代理协作框架,实现从自然语言描述中自动化的PDE求解。

Comments Adding Affiliation Information on arXiv

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.06813 2025-12-22 cs.AI cs.MA cs.SI 70%

Richelieu: Self-Evolving LLM-Based Agents for AI Diplomacy

Richelieu: 基于大语言模型的自进化AI外交代理

Zhenyu Guan, Xiangyu Kong, Fangwei Zhong, Yizhou Wang

机构 * Institute for Artificial Intelligence(人工智能研究院) Computer School(计算机学院) School of Artificial Intelligence(人工智能学院) Center on Frontiers of Computing Studies(计算前沿研究中心) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) State Key Lab of General Artificial Intelligence(通用人工智能国家重点实验室) BIGAI

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 Richelieu通过整合战略规划、目标导向谈判和自我进化能力,开发出能执行复杂多代理任务的AI外交代理。

Journal ref NuerIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17985 2025-12-17 cs.HC cs.AI 70%

How K-12 Educators Use AI: LLM-Assisted Qualitative Analysis at Scale

K-12教育工作者如何使用AI:大规模LLM辅助定性分析

Alex Liu, Lief Esbenshade, Shawon Sarkar, Victor Tian, Zachary Zhang, Kevin He, Min Sun

机构 * University of Washington(华盛顿大学) Hensun Innovation(翰森创新)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本研究通过大规模LLM辅助分析,探讨K-12教育工作者在教学中使用AI工具的模式与方法,揭示其教学推理过程并为教育工具设计提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07141 2025-12-09 cs.CV cs.CL 70%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06266 2025-12-09 cs.CL 70%

Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models

Nanbeige4-3B 技术报告:探索小型语言模型的前沿

Chen Yang, Guangyue Peng, Jiaying Zhu, Ran Le, Ruixiang Feng, Tao Zhang, Wei Ruan, Xiaoqi Liu, Xiaoxue Cheng, Xiyun Xu, Yang Song, Yanzipeng Gao, Yiming Jia, Yun Xing, Yuntao Wen, Zekai Wang, Zhenwei An, Zhicong Sun, Zongchao Chen

机构 * Nanbeige LLM Lab(纳布吉LLM实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 Nanbeige4-3B通过FG-WSD调度器、DPD蒸馏和强化学习技术,实现了小型语言模型在性能和扩展定律上的突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14096 2025-11-19 cs.IR cs.AI 70%

NeuroPath: Neurobiology-Inspired Path Tracking and Reflection for Semantically Coherent Retrieval

Junchen Li, Rongzheng Wang, Yihong Huang, Qizhi Chen, Jiasheng Zhang, Shuang Liang

机构 * Institute of Intelligent Computing, University of Electronic Science and Technology of China(电子科技大学智能计算研究院)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06190 2025-11-18 cs.LG 70%

On Powerful Ways to Generate: Autoregression, Diffusion, and Beyond

Chenxiao Yang, Cai Zhou, David Wipf, Zhiyuan Li

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02529 2025-11-17 cs.LG 70%

RetrySQL: text-to-SQL training with retry data for self-correcting query generation

Alicja Rączkowska, Riccardo Belluzzo, Piotr Zieliński, Joanna Baran, Paweł Olszewski

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

Comments AAAI 2026 Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06778 2025-11-12 cs.CL 70%

SAFENLIDB: A Privacy-Preserving Safety Alignment Framework for LLM-based Natural Language Database Interfaces

Ruiheng Liu, XiaoBing Chen, Jinyu Zhang, Qiongwen Zhang, Yu Zhang, Bailong Yang

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments AAAI 2026 Extended Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03961 2025-11-07 cs.LG cs.CC 70%

A Little Depth Goes a Long Way: The Expressive Power of Log-Depth Transformers

William Merrill, Ashish Sabharwal

机构 * Allen Institute for AI(阿伦人工智能研究所) New York University(纽约大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24719 2025-10-30 cs.CL cs.IR 70%

Iti-Validator: A Guardrail Framework for Validating and Correcting LLM-Generated Itineraries

Shravan Gadbail, Masumi Desai, Kamalakar Karlapalem

机构 * International Institute of Information Technology(国际信息科技学院)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07423 2025-10-14 cs.AI 70%

ProSEA: Problem Solving via Exploration Agents

William Nguyen, Vinh Luong, Christopher Nguyen

机构 * Aitomatic, Inc.(Aitomatic公司)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09244 2025-10-13 cs.AI 70%

Fundamentals of Building Autonomous LLM Agents

Victor de Lamo Castrillo, Habtom Kahsay Gidey, Alexander Lenz, Alois Knoll

机构 * Universitat Politècnica de Catalunya(巴塞罗那理工大学) Technische Universität München(慕尼黑技术大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02557 2025-10-06 cs.AI 70%

Orchestrating Human-AI Teams: The Manager Agent as a Unifying Research Challenge

Charlie Masters, Advaith Vellanki, Jiangbo Shangguan, Bart Kultys, Jonathan Gilmore, Alastair Moore, Stefano V. Albrecht

机构 * DeepFlow(深流)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

Comments Accepted as an oral paper for the conference for Distributed Artificial Intelligence (DAI 2025). 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20931 2025-09-03 cs.CL 70%

How Can Input Reformulation Improve Tool Usage Accuracy in a Complex Dynamic Environment? A Study on $τ$-bench

Venkatesh Mishra, Amir Saeidi, Satyam Raj, Mutsumi Nakamura, Jayanth Srinivasa, Gaowen Liu, Ali Payani, Chitta Baral

机构 * Arizona State University(亚利桑那州立大学) Cisco Research(思科研究)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00325 2025-09-03 cs.CL cs.IR 70%

GIER: Gap-Driven Self-Refinement for Large Language Models

Rinku Dewri

机构 * University of Denver(丹佛大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00272 2025-09-03 cs.AI cs.SE 70%

SHERPA: A Model-Driven Framework for Large Language Model Execution

Boqi Chen, Kua Chen, José Antonio Hernández López, Gunter Mussbacher, Dániel Varró, Amir Feizpour

机构 * Electrical and Computer Engineering, McGill University, Canada(麦吉尔大学电气与计算机工程系) Department of Computer Science and Systems, University of Murcia, Spain(穆尔西亚大学计算机科学与系统系) Aggregate Intellect Inc., Canada(聚合智力公司)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments MODELS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20453 2025-08-29 cs.CL 70%

MCP-Bench: Benchmarking Tool-Using LLM Agents with Complex Real-World Tasks via MCP Servers

Zhenting Wang, Qi Chang, Hemani Patel, Shashank Biju, Cheng-En Wu, Quan Liu, Aolin Ding, Alireza Rezazadeh, Ankit Shah, Yujia Bao, Eugene Siow

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18749 2025-08-27 cs.AI 70%

Reflection-Enhanced Meta-Optimization Integrating TextGrad-style Prompt Optimization with Memory-Driven Self-Evolution

Chunlong Wu, Zhibo Qu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23060 2025-08-26 cs.CL 70%

Self-Correcting Code Generation Using Small Language Models

Jeonghun Cho, Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

Comments Accepted at EMNLP 2025 (Findings, long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15164 2025-08-22 cs.CL 70%

ContextualLVLM-Agent: A Holistic Framework for Multi-Turn Visually-Grounded Dialogue and Complex Instruction Following

Seungmin Han, Haeun Kwon, Ji-jun Park, Taeyang Yoon

机构 * Dongguk University(东国大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14300 2025-08-21 cs.CR cs.CL cs.MA cs.NI 70%

MultiFuzz: A Dense Retrieval-based Multi-Agent System for Network Protocol Fuzzing

Youssef Maklad, Fares Wael, Ali Hamdi, Wael Elsersy, Khaled Shaban

机构 * Dept. of Computer Science, Qatar University, Doha, Qatar(计算机科学系,卡塔尔大学,多哈)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12314 2025-08-20 cs.MA cs.AI nlin.AO 70%

Synchronization Dynamics of Heterogeneous, Collaborative Multi-Agent AI Systems

Chiranjit Mitra

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14854 2025-08-06 cs.CL 70%

CLIPPER: Compression enables long-context synthetic data generation

Chau Minh Pham, Yapei Chang, Mohit Iyyer

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted to COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.20007 2025-07-30 eess.AS cs.CL cs.SD 70%

DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data

Ke-Han Lu, Zhehuai Chen, Szu-Wei Fu, Chao-Han Huck Yang, Jagadeesh Balam, Boris Ginsburg, Yu-Chiang Frank Wang, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(台湾大学通信工程研究所) NVIDIA(英伟达)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09374 2025-07-15 cs.AI 70%

EduFlow: Advancing MLLMs' Problem-Solving Proficiency through Multi-Stage, Multi-Perspective Critique

Chenglin Zhu, Tao Zhang, Chong Li, Mingan Lin, Zenan Zhou, Jian Xie

机构 * Baichuan Inc.(北京百川科技有限公司) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

Comments 14 pages,4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09259 2025-07-15 cs.CL 70%

Psychology-Driven Enhancement of Humour Translation

Yuchen Su, Yonghua Zhu, Yang Chen, Diana Benavides-Prado, Michael Witbrock

机构 * School of Computer Science, University of Auckland, New Zealand(奥克兰大学计算机科学学院) Singapore University of Technology and Design(新加坡科技设计大学) School of Electronic Engineering and Computer Science, Queen Mary University of London(伦敦玛丽女王大学电子工程与计算机科学学院)

专题命中 复杂问题求解 :chain-of-thought(abstract);CoT(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏