arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-26 至 2026-05-26 共收录 24 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 24 篇

2605.25958 2026-05-26 cs.CL cs.CE 87%

PolyGnosis 2.0: Enhancing LLM Reasoning via Agentic Harness Engineering for Polymarket and OSINT Insight Extraction

PolyGnosis 2.0: 通过智能体工程增强LLM推理,用于Polymarket和OSINT洞察提取

Daren Wang, Hong Xu, Jiawen Xian

机构 * The Chinese University of Hong Kong(香港中文大学) Evolution AI Lab(进化人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出PolyGnosis 2.0多智能体架构,通过融合Polymarket异常信号与全球开源情报(GDELT)来提取预测情报,并量化“视角错配”作为高阿尔法交易信号,同时评估“工具工程”技术(如反射循环、工具调用、分治和思维链)在高噪声金融领域的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23395 2026-05-26 cs.LG 79%

Convex Compositional Reasoning Models

凸组合推理模型

Meir Roketlishvili, Semyon Semenov, Maksim Bobrin, Viktor Kovalchuk, Albert Baichorov, Abduragim Shtanchaev, Fakhri Karray, Dmitry V. Dylov, Martin Takáč, Arip Asadulaev

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Applied AI Institute(应用人工智能研究所) Computational Imaging Lab(计算成像实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 针对组合推理中能量景观的非凸几何瓶颈,提出凸组合能量最小化框架,通过输入凸神经网络参数化因子并优化紧凸松弛,实现确定性投影一阶优化,在小问题上训练后可零样本迁移到大实例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24050 2026-05-26 cs.LG 79%

Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training

桥接设备端与云端大语言模型实现协作推理:本地路由与后训练的统一方法

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Evan Chen, Christopher Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 提出通过强化学习后训练使设备端LLM内部决定是否调用云端,结合分层奖励和自适应提示过滤,显著缩小与纯云端LLM的性能差距。

Comments We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25571 2026-05-26 cs.CV 78%

AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution

AnE: 通过锚点进化推动多模态大语言模型的推理前沿

Zehao Wang, Yihan Zeng, Zidong Gong, Yuanfan Guo, Feng Zhu, Hongzhi Zhang, Wei Zhang, Wangmeng Zuo

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah's Ark Lab(华为诺亚实验室) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 提出锚点进化(AnE)范式,通过真值锚点数据策展和脚手架剥离机制,解决多模态大模型推理中的认知漂移和幻觉路径问题,显著提升推理性能。

Comments 34 pages,10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24674 2026-05-26 cs.CV 78%

Reasoning to Align: Implicit Reasoning in Diffusion Transformers for Video Editing

推理对齐:扩散Transformer在视频编辑中的隐式推理

Yan Li, Lin Liu, Xiaopeng Zhang, Qi Tian

机构 * The Hongkong University of Science and Technology(香港科技大学) Huawei Inc.(华为公司)

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 针对指令式视频编辑中条件信号未分化及交叉注意力监督不足的问题,提出RVEDiT框架,通过粒度路由令牌条件和参考锚定注意力对齐实现粗到细编辑与内部推理正则化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24834 2026-05-26 cs.CR cs.AI 70%

Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection

Reflect-Guard: 通过逻辑自我反思增强大语言模型对对抗性提示的防护

Lixing Lin, Juli You, Yue Li, Luyun Lin, Yiqing Wang, Zhen Zhang, Moxuan Zheng

机构 * Yale University(耶鲁大学) Columbia University(哥伦比亚大学) Citigroup(摩根大通) Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出Reflect-Guard方法,通过参数高效微调为大语言模型安全分类器注入链式思维自我反思能力,显著提升对对抗性越狱攻击的检测性能。

Comments 12 pages, 2 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15922 2026-05-26 cs.AI 70%

Leveraging Spreading Activation for Improved Document Retrieval in Knowledge-Graph-Based RAG Systems

利用传播激活改进基于知识图谱的RAG系统中的文档检索

Jovan Pavlović, Miklós Krész, László Hajdu

机构 * UP FAMNIT, University of Primorska(普里摩里卡大学FAMNIT学院) InnoRenew CoE, UP IAM, University of Primorska(InnoRenew联合学院、UP IAM、普里摩里卡大学) University of Szeged, Department of Applied Informatics(塞格德大学应用信息学系)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出一种基于自动构建异构知识图谱的传播激活算法,用于多跳问答中的文档检索,减少对语义知识图谱和LLM引导的依赖,性能优于或持平现有方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03955 2026-05-26 cs.AI cs.MA 70%

AgentArk: Distilling Multi-Agent Intelligence into a Single LLM Agent

AgentArk:将多智能体智能蒸馏到单个LLM智能体中

Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li, Weijie Xu, Xin Chen, Jindong Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) William & Mary(威廉与玛丽学院) Georgia Institute of Technology(佐治亚理工学院) Amazon(亚马逊) University of British Columbia(不列颠哥伦比亚大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 提出AgentArk框架,通过三种分层蒸馏策略将多智能体系统的交互动态蒸馏到单个模型权重中,使单个智能体具备多智能体的推理和自校正能力,同时保持计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08558 2026-05-26 cs.AI cs.CL cs.IR cs.LG 67%

Agent Learning via Early Experience

通过早期经验进行智能体学习

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu, Jian Xie, Yuxuan Sun, Boyu Gou, Qi Qi, Zihang Meng, Jianwei Yang, Ning Zhang, Xian Li, Ashish Shah, Dat Huynh, Hengduo Li, Zi Yang, Sara Cao, Lawrence Jang, Shuyan Zhou, Jiacheng Zhu, Huan Sun, Jason Weston, Yu Su, Yifan Wu

机构 * Meta Superintelligence Labs(Meta超智能实验室) FAIR at Meta(Meta的FAIR部门) The Ohio State University(俄亥俄州立大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出早期经验范式,利用智能体自身动作生成的交互数据(无需奖励信号)通过隐式世界建模和自我反思两种策略提升智能体在多样化环境中的效果和跨域泛化能力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23989 2026-05-26 cs.AI cs.CL cs.CR 62%

Towards trustworthy agentic AI: a comprehensive survey of safety, robustness, privacy, and system security

迈向可信的自主AI:安全性、鲁棒性、隐私与系统安全的全面综述

Jinhu Qi, Muzhi Li, Jiahong Liu, Yuqin Shu, Dianzhi Yu, Shicheng Ma, Wenqian Cui, Yiyang Zhao, Yiyi Chen, Ruoxi Jiang, Irwin King, Zenglin Xu

机构 * Faculty of Engineering, Department of Computer Science and Engineering, The Chinese University of Hong Kong(香港中文大学工程学院、计算机科学与工程系) Artificial Intelligence Innovation and Incubation Institute, Fudan University(复旦大学人工智能创新与孵化院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了自主AI系统在安全鲁棒性与隐私系统安全两个核心维度的风险来源、阶段缓解策略及统一评估指标,并讨论了开放挑战。

Comments 36 pages, 4 figures. Survey/review article on trustworthy agentic AI. Published in Academia AI and Applications, 2026

Journal ref Academia AI and Applications, vol. 2, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15760 2026-05-26 cs.CL cs.AI 62%

LiveMCP-101: Stress Testing and Diagnosing MCP-enabled Agents on Challenging Queries

LiveMCP-101:对支持MCP的智能体进行压力测试与诊断

Ming Yin, Dinghan Shen, Silei Xu, Sixun Dong, Mian Zhang, Yebowen Hu, Shujian Liu, Jianbing Han, Simin Ma, Song Wang, Sathish Reddy Indurthi, Xun Wang, Yiran Chen, Kaiqiang Song

机构 * Duke University(杜克大学)

专题命中 复杂问题求解 :planning(abstract);分类 cs.CL、cs.AI

AI总结 针对MCP工具在动态多步任务中的评估空白,提出LiveMCP-101基准测试(101个真实查询),通过并行评估框架发现前沿LLM成功率低于60%,并识别出七种失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13878 2026-05-26 cs.LG cs.CL 62%

InfiFPO: Implicit Model Fusion via Preference Optimization in Large Language Models

InfiFPO:通过偏好优化实现大型语言模型的隐式模型融合

Yanggan Gu, Yuanyi Wang, Zhaoyi Yan, Yiming Zhang, Qi Zhou, Fei Wu, Hongxia Yang

机构 * The Hong Kong Polytechnic University (PolyU)(香港理工大学) Zhejiang University(浙江大学) PolyU-Daya Bay Technology and Innovation Research Institute(香港理工大学-大亚湾技术与创新研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出InfiFPO方法,通过将DPO中的参考模型替换为融合源模型,在序列级别合成多源概率,实现隐式模型融合,从而在偏好对齐阶段有效融合多个LLM并提升性能。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15173 2026-05-26 cs.CL cs.AI 62%

Uncovering Autoregressive LLM Knowledge of Thematic Fit in Event Representation

揭示自回归LLM在事件表示中主题适配性的知识

Safeyah Khaled Alshemali, Daniel Bauer, Yuval Marton

机构 * Imperial College London(伦敦帝国学院) Columbia University(哥伦比亚大学) University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 通过多种提示设计、输入上下文操作、推理和输出形式,研究自回归大语言模型是否具有一致且可表达的事件参数主题适配性知识,并在基准测试上取得新最优结果。

Comments Significant update with massive changes: all experiments rerun with current LLMs; includes new probability estimate analysis and expanded results in Sections 4 and 5. The paper has been accepted to CoNLL-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25534 2026-05-26 cs.AI 57%

StructBreak: Structural Cognitive Overload-Induced Safety Failures in MLLMs

StructBreak: 多模态大语言模型中结构性认知过载引发的安全故障

Yang Luo, Xinran Liu, Tiantian Ji, Zhiyi Yin, Lingyun Peng, Shuyu Li

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications(可信分布式计算与服务重点实验室(MoE),北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出StructBreak框架,通过量化结构性认知过载(SCO)揭示一种高阶认知过载攻击范式,在六种主流MLLM上实现92%平均攻击成功率,并证明该攻击通过结构性通道绕过安全过滤器。

Comments 23 pages; accepted to Findings of ACL 2026. This paper contains examples of harmful content

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25435 2026-05-26 cs.AI 57%

Security of OpenClaw Agents: Fundamentals, Attacks, and Countermeasures

OpenClaw 代理的安全性:基础、攻击与对策

Yuntao Wang, Jianle Ba, Han Liu, Yanghe Pan, Jintao Wei, Zhou Su, Tom H. Luan, Linkang Du

机构 * School of Cyber Science and Engineering, Xi'an Jiaotong University(西安交通大学网络科学与工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了 OpenClaw 代理的安全挑战,分类分析了技能投毒、认知操纵、多代理级联故障和供应链漏洞等威胁,并总结了现有防御机制。

Comments 17 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25389 2026-05-26 cs.CR cs.AI cs.MA 57%

Evo-Attacker: Memory-Augmented Reinforcement Learning for Long-Horizon Tool Attacks on LLM-MAS

Evo-Attacker: 用于LLM-MAS长时程工具攻击的记忆增强强化学习

Bingyu Yan, Xiaoming Zhang, Jinyu Hou, Chaozhuo Li, Ziyi Zhou, Yiming Hei, Litian Zhang

机构 * Beihang University(北航) Beijing University of Posts and Telecommunications(北京邮电大学) China Academy of Information and Communications Technology(信息通信技术研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出Evo-Attacker,通过记忆增强强化学习框架将工具攻击建模为自进化过程,并引入Attack-Flow GRPO优化长时程信用分配,实验表明其优于基线方法。

Comments ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24869 2026-05-26 cs.CL 57%

Lngram: N-gram Conditional Memory in Latent Space

Lngram: 潜在空间中的N-gram条件记忆

Yunao Zheng, Guoyang Xia, Xiaojie Wang, Lei Ren

机构 * Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学) Li Auto Inc.(Li Auto公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Lngram,一种在潜在空间中学习离散符号并执行N-gram查找的条件记忆模块,以解耦检索与骨干网络,提升长上下文语言建模和跨模态任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24675 2026-05-26 cs.CV cs.AI 57%

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

VaaWIT: 面向多语言网页图像翻译的大语言模型视觉感知适配

Bo Li, Ronghao Chen, Ningyuan Deng, Huacan Wang, Shaolin Zhu, Lijie Wen

机构 * The Hong Kong University of Science(香港科技大学) Tianjin University(天津大学) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 针对网页图像翻译中视觉表示差距问题,提出VaaWIT框架,通过双流注意力模块和视觉感知适配器,实现大语言模型对细粒度视觉特征的动态融合,在多个基准上超越开源模型并接近闭源模型性能。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13850 2026-05-26 cs.AI cs.MA cs.SE 57%

A Two-Dimensional Framework for AI Agent Design Patterns: Cognitive Function and Execution Topology

AI智能体设计模式的二维框架:认知功能与执行拓扑

Jia Huang, Joey Tianyi Zhou

机构 * Agency for Science, Technology and Research (A*STAR)(科技研究局(A*STAR)) Centre for Frontier AI Research (CFAR)(前沿人工智能研究中心(CFAR))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出一个结合认知功能(7类)和执行拓扑(6种结构)的二维分类框架,识别28种命名模式,并通过跨领域分析得出模式选择的五条经验法则。

Comments 10 pages, 6 tables, 28 named patterns

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24454 2026-05-26 cs.CL 57%

Decompose-and-Refine: Structured Legal Question Answering with Parametric Retrieval

分解与精炼:基于参数化检索的结构化法律问答

Jihyung lee, Hyounghun Kim, Gary Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(延世大学人工智能研究生院,韩国POSTECH) Department of Computer Science and Engineering, POSTECH, Republic of Korea(POSTECH计算机科学与工程系,韩国POSTECH)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 提出Decompose-and-Refine (DaR)框架,通过逐步分解复杂法律问题为原子子问题并生成与法规对齐的参数化查询,以解决多跳法律问答中的检索准确性和幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24410 2026-05-26 cs.AI 57%

Advancing Graph Few-Shot Learning via In-Context Learning

通过上下文学习推进图少样本学习

Renchu Guan, Yajun Wang, Chunli Guo, Bowen Cao, Fausto Giunchiglia, Wei Pang, Yonghao Liu, Xiaoyue Feng

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Software, Jilin University(吉林大学软件学院) Department of Computer Science and Technology, Yanbian University(延边大学计算机科学与技术系) Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) School of Mathematical and Computer Sciences, Heriot-Watt University(赫瑞斯泰大学数学与计算机科学学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 提出VISION模型,将图少样本学习重构为免微调的序列推理问题,利用无监督任务生成器从无标签数据中构建伪任务,通过上下文感知网络融合局部拓扑和全局任务依赖,实现高效推理。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04981 2026-05-26 cs.CV cs.LG 57%

Compositional Semantics for Open Vocabulary Spatio-semantic Representations

开放词汇时空语义表示的组合语义

Robin Karlsson, Francisco Lepe-Salazar, Kazuya Takeda

机构 * Graduate School of Informatics, Nagoya University(名古屋大学信息学研究科) Ludolab TIER IV

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 提出潜在组合语义嵌入z*作为可查询时空语义记忆的知识表示,证明其存在性、最优性及可发现性,并引入充分相似性推理方法提升重叠语义推理性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26005 2026-05-26 cs.SE 50%

CelerLog: Fast Log Parsing via Dynamic Routing

CelerLog: 通过动态路由实现快速日志解析

Shiwen Shan, Yintong Huo, Minxing Wang, Zhiying Wu, Yuxin Su, Zibin Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出CelerLog,通过动态路由将日志分为密集和稀疏组,分别用统计方法和LLM处理,在保持高精度的同时大幅提升速度和降低成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00777 2026-05-26 cs.CV 50%

DUCX: Decomposing Unfairness in Tool-Using Chest X-ray Agents

DUCX:分解使用工具的胸部X光代理中的不公平性

Zikang Xu, Ruinan Jin, Xiaoxiao Li

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center, Anhui, China(人工智能研究所,合肥国家科学中心,安徽,中国) The University of British Columbia, Vancouver, BC V6Z 1Z4, Canada(不列颠哥伦比亚大学,温哥华,BC V6Z 1Z4,加拿大) Vector Institute, Toronto, ON M5G 1M1, Canada(向量研究所,多伦多,ON M5G 1M1,加拿大)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 提出DUCK框架,通过阶段式公平性分解方法,系统审计使用工具的胸部X光代理中的工具暴露偏差、工具转换偏差和模型推理偏差,揭示端到端评估无法预测的群体差异。

Comments Early accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏