arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-02-26 至 2026-02-26 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2506.13793 2026-02-26 cs.AI 83%

Med-REFL: Medical Reasoning Enhancement via Self-Corrected Fine-grained Reflection

Med-REFL: 通过自我校正的细粒度反思增强医疗推理

Zongxian Yang, Jiayu Qian, Zegao Peng, Haoyu Zhang, Yu-An Huang, KC Tan, Zhi-An Huang

机构 * City University of Hong Kong (Dongguan), China(香港城市大学(东莞)) Northwestern Polytechnical University, China(西北工业大学) The Hong Kong Polytechnic University, China(香港理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 Med-REFL通过自我校正的细粒度反思提升医疗推理,有效解决验证瓶颈,提升模型性能并拓展至其他领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21496 2026-02-26 cs.AI 79%

Beyond Refusal: Probing the Limits of Agentic Self-Correction for Semantic Sensitive Information

超越拒绝:探求代理自我校正对语义敏感信息的极限

Umid Suleymanov, Zaur Rajabov, Emil Mirzazada, Murat Kantarcioglu

机构 * Department of Computer Science, Virginia Tech(弗吉尼亚理工大学计算机科学系) School of IT and Engineering, ADA University(ADA大学信息科技与工程学院)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.AI

AI总结 本文提出SemSIEdit框架,通过代理代理迭代批评和重写敏感信息,减少泄露并平衡隐私与效用,揭示规模依赖的安全分歧和推理悖论。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21087 2026-02-26 cs.CV 78%

MIRA: Multimodal Iterative Reasoning Agent for Image Editing

MIRA: 多模态迭代推理代理用于图像编辑

Ziyun Zeng, Hang Hua, Jiebo Luo

机构 * University of Rochester(罗切斯特大学) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 MIRA通过多模态迭代推理代理提升图像编辑的语义一致性和感知质量,结合自研数据集和训练流程,实现与专有系统相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21857 2026-02-26 cs.AI cs.CL cs.LG 75%

Distill and Align Decomposition for Enhanced Claim Verification

分解与对齐:提升声明验证的Distill和Align分解

Jabez Magomere, Elena Kochkina, Samuel Mensah, Simerjot Kaur, Fernando Acero, Arturo Oncevay, Charese H. Smiley, Xiaomo Liu, Manuela Veloso

专题命中 复杂问题求解 :reasoning(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种基于强化学习的分解与对齐方法,通过优化分解质量和验证器对齐,提升声明验证性能,达到71.75%的宏F1,优于现有方法。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14697 2026-02-26 cs.AI cs.LG 62%

Evolutionary System Prompt Learning for Reinforcement Learning in LLMs

强化学习中大语言模型的进化系统提示学习

Lunjun Zhang, Ryan Chen, Bradly C. Stadie

机构 * Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Department of Statistics(统计学系) Data Science, Northwestern University(数据科学,西北大学) Bridgewater AIA Labs(布里奇沃特AIA实验室)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 E-SPL通过结合强化学习和系统提示进化,提升大语言模型在推理和智能任务中的性能。

Comments 39 pages, 22 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03255 2026-02-26 cs.LG cs.AI 62%

SciTS: Scientific Time Series Understanding and Generation with LLMs

SciTS: 基于大语言模型的科学时间序列理解与生成

Wen Wu, Ziyang Zhang, Liwei Liu, Xuenan Xu, Jimin Zhuang, Ke Fan, Qitan Lv, Junlin Liu, Chen Zhang, Zheqi Yuan, Siyuan Hou, Tianyi Lin, Kai Chen, Bowen Zhou, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SciTS提出了一种基于LLM的科学时间序列理解与生成框架,通过基准测试发现通用LLM在泛化能力上优于专门模型,并引入TimeOmni框架提升性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21611 2026-02-26 cs.SE cs.AI 57%

Structurally Aligned Subtask-Level Memory for Software Engineering Agents

结构对齐的子任务级记忆用于软件工程代理

Kangning Shen, Jingyuan Zhang, Chenxi Sun, Wencong Zeng, Yang Yue

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构对齐的子任务级记忆方法,通过与代理功能分解对齐来提升软件工程代理的长周期推理能力,实验表明在多种backbone上均优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21351 2026-02-26 cs.AI cs.IR cs.MA 57%

A Hierarchical Multi-Agent System for Autonomous Discovery in Geoscientific Data Archives

面向地质数据档案的分层多智能体系统

Dmitrii Pantiukhin, Ivan Kuznetsov, Boris Shapkin, Antonia Anna Jost, Thomas Jung, Nikolay Koldunov

机构 * Alfred Wegener Institute for Polar and Marine Research(阿尔弗雷德·韦格ener极地和海洋研究所)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 PANGAEA-GPT通过分层多智能体框架实现地质数据自动发现与分析,具备复杂工作流执行能力,减少人工干预。

Comments 20 pages, 6 figures, 7 tables, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00024 2026-02-26 cs.SI cs.AI 57%

EpidemIQs: Prompt-to-Paper LLM Agents for Epidemic Modeling and Analysis

EpidemIQs: 用于流行病建模与分析的提示到论文LLM代理

Mohammad Hossein Samaei, Faryad Darabi Sahneh, Lee W. Cohnstaedt, Caterina Scoglio

机构 * Department of Electrical and Computer Engineering, Kansas State University(电气与计算机工程系,堪萨斯州立大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.AI

AI总结 EpidemIQs是一种多代理LLM框架,通过五个阶段实现流行病建模与分析的自动化,利用科学家代理和任务专家代理提高效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18952 2026-02-26 eess.AS 50%

MDM-ASR: Bridging Accuracy and Efficiency in ASR with Diffusion-Based Non-Autoregressive Decoding

MDM-ASR:基于扩散模型的非自回归解码在ASR中实现准确性和效率的平衡

Hao Yen, Pin-Jui Ku, Ante Jukić, Sabato Marco Siniscalchi

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 MDM-ASR通过基于扩散模型的非自回归解码框架,在保持并行解码效率的同时,提升了ASR的准确性和性能。

Comments 10 pages, submitted to Interspeech 2026 Long Paper track

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.13126 2026-02-26 cs.CY 50%

Generative agents in the streets: Exploring the use of Large Language Models (LLMs) in collecting urban perceptions

街道中的生成代理:探索大型语言模型(LLMs)在收集城市感知中的应用

Deepank Verma, Olaf Mumm, Vanessa Miriam Carlow

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究利用生成代理探索大型语言模型在模拟城市环境中人类行为中的应用,通过街景图像交互和感知评估提升AI在城市感知中的能力。

Comments 30 Pages, 15 Figures, Submitted in a Journal for Peer review

详情

展开后加载摘要…

URL PDF HTML 收藏