arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2512.11167 2025-12-15 cs.CV cs.AI 74%

Image Tiling for High-Resolution Reasoning: Balancing Local Detail with Global Context

图像分块用于高分辨率推理:在局部细节与全局上下文之间取得平衡

Anatole Jacquin de Margerie, Alexis Roger, Irina Rish

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

AI总结 本文通过图像分块技术实现高分辨率图像理解,验证了局部细节恢复的有效性,并探讨了全局上下文对模型性能的影响。

Comments Accepted in AAAI 2025 Workshop on Reproducible AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22805 2025-11-18 cs.CV cs.AI 74%

MoCHA: Advanced Vision-Language Reasoning with MoE Connector and Hierarchical Group Attention

Yuqi Pang, Bowen Yang, Yun Cao, Rong Fan, Xiaoyu Li, Chen He

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11067 2025-09-17 cs.AI cs.HC cs.MA 74%

Agentic Lybic: Multi-Agent Execution System with Tiered Reasoning and Orchestration

Liangxuan Guo, Bin Zhu, Qingqian Tao, Kangning Liu, Xun Zhao, Xianzhe Qin, Jin Gao, Guangfu Hao

机构 * Lybic

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06503 2025-08-12 q-bio.NC cs.AI 74%

Understanding Human Limits in Pattern Recognition: A Computational Model of Sequential Reasoning in Rock, Paper, Scissors

Logan Cross, Erik Brockbank, Tobias Gerstenberg, Judith E. Fan, Daniel L. K. Yamins, Nick Haber

机构 * Stanford Computer Science(斯坦福大学计算机科学系) Stanford Department of Psychology(斯坦福大学心理学系) Stanford Graduate School of Education(斯坦福大学教育研究生院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments To be published in Proceedings of the 8th Annual Conference on Cognitive Computational Neuroscience (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11310 2025-07-16 cs.CR cs.CL 74%

LRCTI: A Large Language Model-Based Framework for Multi-Step Evidence Retrieval and Reasoning in Cyber Threat Intelligence Credibility Verification

Fengxiao Tang, Huan Li, Ming Zhao, Zongzong Wu, Shisong Peng, Tao Yin

机构 * Central South University(中南大学) Zhongguancun Laboratory(中关村实验室)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20670 2025-06-06 cs.AI 74%

MIRROR: Multi-agent Intra- and Inter-Reflection for Optimized Reasoning in Tool Learning

Zikang Guo, Benfeng Xu, Xiaorui Wang, Zhendong Mao

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments Accepted to 34rd International Joint Conference on Artificial Intelligence (IJCAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00671 2025-06-03 cs.CL 74%

DeepRAG: Integrating Hierarchical Reasoning and Process Supervision for Biomedical Multi-Hop QA

Yuelyu Ji, Hang Zhang, Shiven Verma, Hui Ji, Chun Li, Yushui Han, Yanshan Wang

机构 * Department of Information Science, University of Pittsburgh(信息科学系,匹兹堡大学) Department of Biomedical Informatics, University of Pittsburgh(生物医学信息学系,匹兹堡大学) Department of Health Information Management and ISP, University of Pittsburgh(健康信息管理与信息科学系,匹兹堡大学)

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16293 2025-05-23 cs.CL 74%

Augmenting LLM Reasoning with Dynamic Notes Writing for Complex QA

Rishabh Maheshwary, Masoud Hashemi, Khyati Mahajan, Shiva Krishna Reddy Malay, Sai Rajeswar, Sathwik Tejaswi Madhusudhan, Spandana Gella, Vikas Yadav

机构 * ServiceNow

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06307 2025-05-13 cs.CR cs.AI 74%

Large Language Model-driven Security Assistant for Internet of Things via Chain-of-Thought

Mingfei Zeng, Ming Xie, Xixi Zheng, Chunhai Li, Chuan Zhang, Liehuang Zhu

机构 * Guangxi Power Grid Co., Ltd.(广西电网公司) School of Cyberspace Science and Technology, Beijing Institute of Technology(北京理工大学信息空间科学与技术学院) Guangxi Engineering Research Center of Industrial Internet Security and Blockchain, Guilin University of Electronic Technology(桂林电子科技大学工业互联网安全与区块链工程研究中心)

专题命中 复杂问题求解 :chain-of-thought(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09385 2025-04-23 cs.AI 74%

AI Predicts AGI: Leveraging AGI Forecasting and Peer Review to Explore LLMs' Complex Reasoning Capabilities

Fabrizio Davide, Pietro Torre, Leonardo Ercolani, Andrea Gaggioli

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments 47 pages, 8 figures, 17 tables, appendix with data and code

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06462 2025-04-21 cs.CV cs.LG 74%

VCR: A Task for Pixel-Level Complex Reasoning in Vision Language Models via Restoring Occluded Text

Tianyu Zhang, Suyuchen Wang, Lu Li, Ge Zhang, Perouz Taslakian, Sai Rajeswar, Jie Fu, Bang Liu, Yoshua Bengio

专题命中 复杂问题求解 :reasoning(title);分类 cs.LG

Comments Accepted at ICLR 2025. Original paper name: VCR: Visual Caption Restoration

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19743 2024-10-29 cs.SE cs.AI 74%

AppBench: Planning of Multiple APIs from Various APPs for Complex User Instruction

Hongru Wang, Rui Wang, Boyang Xue, Heming Xia, Jingtao Cao, Zeming Liu, Jeff Z. Pan, Kam-Fai Wong

专题命中 复杂问题求解 :planning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06273 2024-10-10 cs.AI cs.HC 74%

PREDICT: Preference Reasoning by Evaluating Decomposed preferences Inferred from Candidate Trajectories

Stephane Aroca-Ouellette, Natalie Mackraz, Barry-John Theobald, Katherine Metcalf

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11823 2024-10-08 cs.CV cs.CL 74%

On Efficient Language and Vision Assistants for Visually-Situated Natural Language Understanding: What Matters in Reading and Reasoning

Geewook Kim, Minjoon Seo

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

Comments EMNLP 2024 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.10133 2024-07-01 cs.AI 74%

Zero-Shot Reasoning: Personalized Content Generation Without the Cold Start Problem

Davor Hafnar, Jure Demšar

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments 9 pages, 6 figures. Paper accepted to IEEE Transactions on Games

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.18839 2024-06-28 cs.AI 74%

Disentangling Knowledge-based and Visual Reasoning by Question Decomposition in KB-VQA

Elham J. Barezi, Parisa Kordjamshidi

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06863 2024-06-12 cs.CR cs.AI cs.HC 74%

Ollabench: Evaluating LLMs' Reasoning for Human-centric Interdependent Cybersecurity

Tam n. Nguyen

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments 12 pages, 7 figures, 2 tables The final conference/journal version may have significantly more content updates

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.07960 2022-05-18 cs.CL 74%

Meta AI at Arabic Hate Speech 2022: MultiTask Learning with Self-Correction for Hate Speech Classification

Badr AlKhamissi, Mona Diab

专题命中 复杂问题求解 :self-correction(title);分类 cs.CL

Comments Accepted at the 5th Workshop on Open-Source Arabic Corpora and Processing Tools (OSACT5/LREC 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.08790 2022-03-23 cs.CL 74%

Misinfo Reaction Frames: Reasoning about Readers' Reactions to News Headlines

Saadia Gabriel, Skyler Hallinan, Maarten Sap, Pemi Nguyen, Franziska Roesner, Eunsol Choi, Yejin Choi

专题命中 复杂问题求解 :reasoning(title);分类 cs.CL

Comments ACL 2022 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
1506.05154 2015-06-18 cs.MA cs.AI cs.SI 74%

SNA-based reasoning for multiagent team composition

Andre Filipe de Moraes Batista, Maria das Graças Bruno Marietto

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Comments 10 pages

Journal ref International Journal of Artificial Intelligence & Applications (IJAIA) Vol. 6, No. 3, May 2015

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.4593 2014-01-21 cs.MA cs.AI 74%

Location-Based Reasoning about Complex Multi-Agent Behavior

Adam Sadilek, Henry Kautz

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI

Journal ref Journal Of Artificial Intelligence Research, Volume 43, pages 87-133, 2012

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18171 2026-08-20 cs.AI cs.LG 新提交 73%

Looped Language Models Improve Compositional Tool Calling

循环语言模型可提升组合式工具调用能力

Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò

机构 * University of Cambridge(剑桥大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究在组合式工具调用场景下,通过在多个数据集上对比循环与非循环语言模型,发现循环计算可提升组合式工具使用性能,自适应推理能实现更优计算-性能权衡,为智能体系统提供了有前景的架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11967 2026-08-13 cs.LG cs.AI 新提交 73%

LoongReflect: Boosting Long-Horizon Reflection in Search Agents via Global Perspective Distillation

LoongReflect:通过全局视角蒸馏提升搜索智能体的长程反思能力

Zhixin Zhang, Xinke Jiang, Zhibang Yang, Weixuan Xu, Guohong Qiu, Xu Chu, Junfeng Zhao, Yasha Wang

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 LoongReflect是将反思表述为记忆控制策略的训练框架,通过双信号通道结合全局视角蒸馏与结果导向GRPO优化,在多跳检索增强生成和数学推理任务上提升了搜索智能体的长程反思能力。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22122 2026-08-11 cs.RO cs.AI cs.CL cs.CV 版本更新 73%

REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation

REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架

Puzhen Yuan, Angyuan Ma, Yunchao Yao, Huaxiu Yao, Masayoshi Tomizuka, Mingyu Ding

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18767 2026-07-22 cs.CV cs.AI cs.CL 新提交 73%

Bounding Boxes to Improve Small Language Model Performance on Vision-Based Grading Tasks

使用边界框提高小语言模型在基于视觉的评分任务中的性能

Lachlan McGinness

机构 * Australian National University(澳大利亚国立大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究在基于视觉的简答题评分任务中,用边界框裁剪学生答案对小语言模型性能的影响,通过实验表明此方法能显著提高评分准确性并降低计算成本,是大规模视觉教育评估中部署小语言模型的关键预处理步骤。

Comments Accepted for 1st Workshop on Small Language Models for Education (SLM4ED '26) at AIED 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14113 2026-07-02 cs.CL cs.AI cs.CR 版本更新 73%

Toward Cybersecurity-Expert Small Language Models

面向网络安全专家的小型语言模型

Matan Levi, Daniel Ohayon, Ariel Blobstein, Ravid Sagi, Ian Molloy, Yair Allouche

机构 * IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 针对网络安全领域缺乏高质量领域模型和训练数据的问题,提出CyberPal 2.0系列小型语言模型(4B-20B参数),通过SecKnowledge 2.0管道生成增强的思维链指令数据集,在多项网络安全基准测试中超越基线并匹配或超越前沿模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13562 2026-06-30 cs.CR cs.AI cs.CL 73%

Mitigating the Safety-utility Trade-off in LLM Alignment via Adaptive Safe Context Learning

通过自适应安全上下文学习缓解LLM对齐中的安全性与效用权衡

Yanbo Wang, Minzheng Wang, Jian Liang, Lu Wang, Yongcan Yu, Ran He

机构 * Ritzz-AI

专题命中 复杂问题求解 :reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ASCL框架,通过多轮工具使用过程提升推理能力,引入IFPO平衡优势估计,实现更高的整体性能。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI 73%

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22826 2026-05-25 cs.CL cs.AI cs.GT cs.MA 73%

Evaluating Large Language Models in a Complex Hidden Role Game

评估大型语言模型在复杂隐藏角色游戏中的表现

Niklas Bauer

机构 * University of Göttingen(哥廷根大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过社交推理游戏《秘密希特勒》评估大型语言模型的推理、说服和欺骗能力,引入新指标并发现当前模型在复杂多轮操纵中效果不佳。

Comments Master's thesis, University of Göttingen

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16307 2026-05-19 cs.LG cond-mat.mtrl-sci cs.AI physics.chem-ph 73%

Perovskite-R1: a domain-specialized large language model for intelligent discovery of precursor additives and experimental design

钙钛矿-R1:一个专门领域的大型语言模型,用于智能发现前驱体添加剂和实验设计

Xin-De Wang, Zhi-Rui Chen, Peng-Jie Guo, Ze-Feng Gao, Cheng Mu, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院) School of Chemistry and Life Resource, Renmin University of China(中国人民大学化学与生命资源学院)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Perovskite-R1,一个专门用于发现钙钛矿太阳能电池前驱体添加剂和实验设计的大型语言模型,通过系统挖掘和整理1232篇高质量科学文献,并整合33269种候选材料,构建了领域特定的指令微调数据集,从而提升材料发现的效率。

Comments 24 pages; 5 figures

Journal ref Communications Materials 7, 86 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏