arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 2313 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 206 篇

2604.10842 2026-06-09 cs.SE cs.AI 版本更新 57%

Resilient Write: A Six-Layer Durable Write Surface for LLM Coding Agents

抗挫写入:一种六层耐用写入表面用于大语言模型编码代理

Justice Owusu Agyemang, Jerry John Kponyo, Elliot Amponsah, Godfred Manu Addo Boakye, Kwame Opuni-Boachie Obour Agyekum

机构 * Sperixlabs, Ghana(塞普里克斯实验室,加纳) Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(库马西技术大学,加纳) VIA Cybersecurity Lab, Kwame Nkrumah University of Science and Technology, Kumasi, Ghana(VIA网络安全实验室,库马西技术大学,加纳)

专题命中 复杂问题求解 :self-correction(abstract);分类 cs.AI

AI总结 本文提出Resilient Write,通过六层耐用写入表面提升编码代理在文件写入时的容错能力,减少恢复时间并提高自我纠正率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.02039 2026-06-09 cs.AI 版本更新 57%

A Survey on Large Language Model-Based Game Agents

基于大语言模型的游戏智能体综述

Sihao Hu, Tiansheng Huang, Gaowen Liu, Ramana Rao Kompella, Fatih Ilhan, Selim Furkan Tekin, Yichang Xu, Zachary Yahn, Ling Liu

机构 * Georgia Institute of Technology USA(佐治亚理工学院美国分校) Cisco Research USA(思科研究美国分公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 综述基于大语言模型的游戏智能体,提出统一参考架构,从单智能体(记忆、推理、感知-行动接口)和多智能体(通信协议、组织模型)层面总结研究,并建立挑战导向的分类法连接六种游戏类型与智能体需求。

Comments ACM Computing Surveys, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26615 2026-06-08 cs.CL 版本更新 57%

SlideAgent: Hierarchical Agentic Framework for Multi-Page Visual Document Understanding

SlideAgent:用于多页视觉文档理解的分层代理框架

Yiqiao Jin, Rachneet Kaur, Zhen Zeng, Sumitra Ganesh, Srijan Kumar

机构 * Georgia Institute of Technology(佐治亚理工学院) J.P. Morgan AI Research(摩根大通AI研究)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出SlideAgent,一种用于多模态多页文档(如幻灯片)理解的分层代理框架,通过全局、页面和元素三级推理构建结构化表示,在专有和开源模型上分别提升7.9%和9.8%的准确率。

Comments ACL 2026 Main Conference. https://slideagent.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13536 2026-08-17 cs.OS 版本更新 50%

Don't Let AI Agents YOLO Your Files: Information and Control in Agent-Native Filesystems

别让AI代理占用你的文件:将信息和控制移交给文件系统以实现代理安全和自主性

Shawn Wanxiang Zhong, Junxuan Liao, Jing Liu, Mai Zheng, Andrea C. Arpaci-Dusseau, Remzi H. Arpaci-Dusseau

专题命中 复杂问题求解 :self-correction(abstract)

AI总结 本文研究了AI代理对文件系统的滥用问题,提出YoloFS文件系统通过三种技术提升代理的安全性和自主性,减少用户交互并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16616 2026-08-13 cs.DB 版本更新 50%

LDI: Localized Data Imputation for Text-Rich Tables

LDI:面向文本丰富表的局部数据填补

Soroush Omidvartehrani, Davood Rafiei

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出LDI框架,通过局部推理利用LLM填补文本丰富表中的缺失值,提升准确性和可解释性,实验证明其优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23065 2026-08-11 cs.HC 版本更新 50%

Touching or Chatting: The Utility of LLMs and Tactile Charts for Learning about Complex Chart Types by BLV Individuals

触摸还是聊天:大语言模型和触觉图表对视力障碍者学习复杂图表类型的效用

Tingying He, Maggie McCracken, Daniel Hajas, Sarah Creem-Regehr, Alexander Lex

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究探讨大语言模型对视力障碍者图表类型学习的影响及触觉学习的作用,通过扩展触觉图表学习工具并比较两种学习形式,发现触觉模板有助于形成心理模型,利于后续数据探索,无触觉支持的文本加LLM解释在空间推理任务中有弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16623 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Minsky's Emotion-Machine Viewpoint

如何构建马库斯的代数思维:从明斯基的情感机器视角出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文从明斯基的《情感机器》视角解读VaCoAl架构,探讨如何构建马库斯的代数思维。通过精确可逆性实现内省,将思考分三层,还承载泛类比和信用分配观点,有助于提升到内省层次并找到交叉点,为构建代数思维提供新视角。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16573 2026-08-11 cs.NE 版本更新 50%

How to Build Marcus's Algebraic Mind: From Thagard's Brain--Mind Viewpoint

如何构建马库斯的代数思维:从萨伽德的脑-心观点出发

Hiroyuki Chuma, Kanji Otsuka, Yoichi Sato

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究从萨伽德的脑-心观点出发,探讨如何构建马库斯的代数思维。提出VaCoAl和PyVaCoAl架构,其绑定操作具有可逆等特性,能填补马库斯代数思维组件空缺,消除卷积退化,还通过相关主张阐述了能力、必要性及自身立场。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15428 2026-08-05 cs.IR 版本更新 50%

Fault Cause Identification across Manufacturing Lines through Ontology-Guided and Process-Aware FMEA Graph Learning with LLMs

基于本体引导和流程感知FMEA图学习结合大语言模型的跨生产线故障原因识别

Sho Okazaki, Kohei Kaminishi, Takuma Fujiu, Yusheng Wang, Manu Sasidharan, Jun Ota

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 该研究针对跨生产线故障原因识别难题,提出OGPAL框架,结合LLM与RGCN实现FMEA知识复用,在汽车压力传感器装配线案例中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05637 2026-08-04 cs.SE 版本更新 50%

Real Faults in Model Context Protocol (MCP) Software: a Comprehensive Taxonomy

模型上下文协议(MCP)软件中的真实故障:一种全面的分类

Mina Taraghi, Mohammad Mehdi Morovati, Foutse Khomh

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文首次提出MCP服务器故障的分类,通过实证研究识别出五个高层故障类别,揭示MCP特定故障与非MCP故障的区别,为提升AI软件系统的可靠性提供依据。

Comments Revised version following peer review. Expanded methodological details, practitioner-survey validation, statistical analyses, and discussion; main conclusions unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04630 2026-08-04 cs.CY 版本更新 50%

Reflection-Satisfaction Tradeoff: Investigating Impact of Reflection on Student Engagement with AI-Generated Programming Hints

反思与满足度的权衡:探讨反思对学生成就AI生成编程提示的影响

Heeryung Choi, Tung Phung, Mengyan Wu, Adish Singla, Christopher Brooks

专题命中 复杂问题求解 :planning(abstract)

AI总结 本研究探讨了反思提示对学生成就AI生成编程提示的影响,发现反思质量与提示满意度呈负相关,强调需重新考虑AI在教育中的训练和评估方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02061 2026-07-29 cs.IR 版本更新 50%

Reason4Rec: Deliberative User Preference Alignment of Large Language Models for Recommendation

Reason4Rec:用于推荐的大语言模型的审慎用户偏好对齐

Yi Fang, Wenjie Wang, Yang Zhang, Fengbin Zhu, Qifan Wang, Fuli Feng, Xiangnan He

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究旨在开发更可靠的推荐LLMs,引入“审慎推荐”任务并提出“推理驱动的推荐器”框架,利用语言化用户反馈增强推理能力,经实验验证该框架能提升预测准确性和推理质量。

Comments Accepted to IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11157 2026-07-28 hep-ph astro-ph.CO physics.comp-ph 版本更新 50%

DarkAgents

DarkAgents:利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道

Michele Lucente, Silvia Pascoli, Filippo Sala, Matteo Zandi

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 DarkAgents利用大语言模型和确定性测试代码构建理论天体粒子物理研究的协同管道,解决模型构建、复杂计算和假设审计等挑战,提供参数拟合、约束条件及假设审计报告。

Comments 12 pages, 2 figures, code at https://github.com/PhysicsZandi/DarkAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00031 2026-07-28 cs.SE 版本更新 50%

Git Context Controller: Manage the Context of LLM-based Agents like Git

Git Context Controller: 管理基于LLM的代理的上下文像Git一样

Junde Wu, Minhao Hu, Jiayuan Zhu, Jiazhen Pan, Yuyuan Liu, Min Xu, Yueming Jin

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 Git-Context-Controller通过版本化文件系统管理LLM代理上下文,提升多轨迹问题解决能力,在SWE-Bench等基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18681 2026-07-27 cs.CV 版本更新 50%

Moving Beyond Diversity: Visual Token Pruning as Subspace Reconstruction for Efficient VLMs

超越多样性:将视觉令牌剪枝视为子空间重建以实现高效视觉语言模型

Jaeyeon Lee, Shunjie Wen, Dong-Wan Choi

机构 * Inha University(延世大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出SPARE方法,将令牌剪枝重构为子空间重建问题,通过迭代选择投影残差大的令牌进行剪枝,并引入反相关性机制保留上下文信息,在LLaVA上剪枝94%令牌仍保持95%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00368 2026-07-27 cs.DC 版本更新 50%

TENT: A Declarative Slice Spraying Engine for Performant and Resilient Data Movement in Disaggregated LLM Serving

TENT:一种用于高性能和容错数据移动的声明式切片喷射引擎

Feng Ren, Ruoyu Qin, Teng Ma, Shangming Cai, Zheng Liu, Chao Lei, Dejiang Zhu, Ke Yang, Zheming Li, Jialei Cui, Weixiao Huang, Yikai Zhao, Yineng Zhang, Hao Wu, Xiang Gao, Yuhao Fu, Jinlei Jiang, Yongwei Wu, Mingxing Zhang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 TENT通过解耦传输意图与物理执行,统一异构互连技术为动态资源池,实现高效、容错的数据传输,提升LLM推理和RL流水线性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13359 2026-07-23 cs.MA 版本更新 50%

Learning Latency-Aware Orchestration for Multi-Agent Systems

学习多智能体系统的延迟感知编排

Xi Shi, Mengxin Zheng, Qian Lou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对多智能体系统推理延迟高的问题,提出延迟感知多智能体系统(LAMaS)。训练时通过约束优化学习延迟感知执行图,推理时用轻量级控制器补充。实验显示其在降低端到端延迟超50%的同时保持精度,且具模块化可移植性。

Comments This submission was intended to be an updated version of arXiv:2601.10560. Any subsequent updates will appear there

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20785 2026-07-17 cs.CV 版本更新 50%

ME-IQA: Memory-Enhanced Image Quality Assessment via Re-Ranking

ME-IQA: 通过重新排序增强的记忆图像质量评估

Kanglong Fan, Tianhe Wu, Wen Wen, Jianzhao Liu, Le Yang, Yabin Zhang, Yiting Liao, Junlin Li, Li Zhang

机构 * City University of Hong Kong(香港城市大学) ByteDance Inc.(字节跳动公司)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 ME-IQA通过构建记忆库和利用推理摘要检索语义和感知对齐的邻居,将VLM重构为概率比较器,并通过门控反思和记忆巩固提升未来决策,从而实现更密集的失真敏感预测,缓解离散崩溃问题。

Comments Published as a conference paper at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17848 2026-07-14 cs.CR cs.SE 版本更新 50%

RISKTAGGER: Evidence-Guided LLM Agent for Post-Incident Forensic Analysis of Money Laundering in Web3

RISKTAGGER:用于Web3中洗钱事件后法医分析的证据引导大语言模型智能体

Dan Lin, Yanli Ding, Weipeng Zou, Jiajing Wu, Zhiyin Wu, Jiachi Chen, Xiapu Luo, Zibin Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 针对Web3加密货币洗钱法医分析面临的挑战,提出RISKTAGGER,将大语言模型作为证据约束决策组件,从公共事件材料提取线索,递归扩展资金流图并生成报告。经多案例评估,能恢复资金路径、识别风险账户,组织证据成可验证报告。

Comments 11 pages(main text), 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04809 2026-07-09 cs.SE 版本更新 50%

Watts This Smell: A Comprehensive Taxonomy of Software Energy Smells

一种经过验证的软件能耗异味分类

Mohammadjavad Mehditabar, Saurabhsingh Rajput, Tushar Sharma

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出了一种全面的软件能耗异味分类,通过系统文献综述和雪球抽样,将320种低效模式分类为12种主要能耗异味和65种根本原因。通过实证验证,发现71%的样本存在多种共存的异味,内存相关异味的修复节能效果最高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23115 2026-07-07 cs.CV 版本更新 50%

AgentFoX: LLM Agent-Guided Fusion with eXplainability for AI-Generated Image Detection

AgentFoX: 基于可解释性的大语言模型引导融合的AI生成图像检测

Yangxin Yu, Yue Zhou, Bin Li, Kaiqing Lin, Haodong Li, Jiangqun Ni, Bo Cao

机构 * Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室) Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室) SZU-AFS Joint Innovation Center for AI Technology(深圳大学-AFS人工智能技术联合创新中心) Shenzhen University(深圳大学) School of Cyber Science and Technology(网络安全科学与技术学院) The Smart City Research Institute of China Electronics Technology Group Corporation(中国电子科技集团有限公司智慧城市研究院)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 AgentFoX通过多阶段分析流程提升AI生成图像检测的可靠性,结合专家和上下文聚类资料,生成可读性强的报告以增强可解释性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21573 2026-07-02 cs.CV 版本更新 50%

Rethinking Visual Privacy: A Compositional Privacy Risk Framework for Severity Assessment with VLMs

重新思考视觉隐私:一种用于严重性评估的组合隐私风险框架与VLM

Efthymios Tsaprazlis, Tiantian Feng, Anil Ramakrishna, Sai Praneeth Karimireddy, Rahul Gupta, Shrikanth Narayanan

机构 * University of Southern California(南加州大学) Meta Superintelligence Labs(Meta超级智能实验室) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出组合隐私风险分类法(CPRT),将视觉属性按独立可识别性和组合危害潜力分级,并构建6.7K图像数据集,评估VLM在组合隐私风险评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14792 2026-06-24 cs.CV 版本更新 50%

MSPL: Multi-Step Pseudo-Labeling for Open-Vocabulary Object Detection

MSPL: 用于开放词汇目标检测的多步伪标签方法

Hojun Choi, Youngsun Lim, Jaeyo Shin, Hyunjung Shim

机构 * KAIST AI(韩国韩世大学AI研究所) Boston University(波士顿大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MSPL框架,通过多步视觉推理(目标定位、类别识别、背景确认)生成伪标签,解决开放词汇检测中单步图像-文本匹配忽略中间推理步骤的问题,在OV-COCO和OV-LVIS上取得最优性能。

Comments This paper has been accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18288 2026-06-19 cs.SE 版本更新 50%

Can Large Language Models Reason About Complex Execution Paths? An Empirical Study on Python

大型语言模型能否推理复杂执行路径?基于Python的实证研究

Wenhan Wang, Kaibo Liu, Zeyu Sun, An Ran Chen, Ge Li, Gang Huang, Lei Ma

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文实证研究大型语言模型在Python执行路径推理中的可行性,构建测试用例生成和缺陷分类任务,发现LLM能提升路径覆盖率,但强推理模型不一定优于弱模型。

Comments Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07036 2026-06-18 physics.ed-ph 版本更新 50%

Using Large Language Models to Analyze Engagement in Computational Thinking via Computational Physics Essays

使用大型语言模型通过计算物理论文分析计算思维中的参与度

Sean Savage, Amir Bralin, Paul Hur, N. Sanjay Rebello

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本研究利用多模态大型语言模型自动评估100篇学生计算物理论文中的计算思维参与度,在明确子任务上达到84%的准确率,但主观整体质量评估准确率仅71%。

Comments 13 pages, 3 figures, 3 tables. Submitted to Physical Review Physics Education Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 50%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03852 2026-06-10 physics.geo-ph 版本更新 50%

Advancing Subsurface Discovery and Geothermal Monitoring with an Agentic Artificial Intelligence Framework

基于智能体人工智能框架推进地下发现与地热监测

Randy Harsuko, Zhengfa Bi, Guodong Chen, Nori Nakata

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出GAIA系统,结合大语言模型、数字孪生与检索增强生成,实现地热开发中的多学科任务自动化与智能决策。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16136 2026-06-09 cs.RO 版本更新 50%

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning

基于思维图的奖励进化:一种用于强化学习的双层语言模型框架

Changwei Yao, Xinzi Liu, Chen Li, Marios Savvides

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出RE-GoT框架,结合LLM与VLM的图思维推理,通过任务分解和视觉反馈迭代优化奖励函数,实验表明在RoboGen和ManiSkill2任务中均优于现有方法。

Journal ref IEEE International Conference on Robotics and Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 575 篇

2511.05747 2026-07-07 cs.AI 版本更新 93%

CoT-X: An Adaptive Framework for Cross-Model Chain-of-Thought Transfer and Optimization

CoT-X: 一种跨模型思维链迁移与优化的自适应框架

Ziqian Bi, Yinzhi Wang, Tianyang Wang, Junfeng Hao, Benji Peng, Wenqian Weng, Jiayi Gu, Jacqueline Pang, Xinyuan Song

机构 * Purdue University(普渡大学) Baruch College, City University of New York(纽约市立大学巴鲁克学院) The Ohio State University(俄亥俄州立大学) AI Agent Lab(AI Agent实验室) Appcubic Emory University(埃默里大学)

专题命中 推理评测 :CoT(title,title_cn);chain-of-thought(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出自适应推理摘要框架,通过语义分割、预算感知压缩和连贯性重建,在减少token用量的同时保留关键推理步骤,实现跨模型高效CoT迁移,在7501道医学题上准确率提升40%,评估成本降低84%。

Comments TKDD 2025 minor revision version

详情

展开后加载摘要…

URL PDF HTML 收藏