arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5001 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 5001 篇

2603.03236 2026-03-04 cs.CY 71%

Conversational Learning Diagnosis via Reasoning Multi-Turn Interactive Learning

通过推理的多轮交互学习诊断

Fangzhou Yao, Sheng Chang, Weibo Gao, Qi Liu

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出ParLD框架,通过多智能体协作实现对话学习中的认知诊断,提升诊断的可靠性和洞察力。

Comments AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21736 2026-02-09 cs.CV 71%

SyncAnyone: Implicit Disentanglement via Progressive Self-Correction for Lip-Syncing in the wild

SyncAnyone: 通过渐进自我校正实现隐式解耦以实现野外对口型同步

Xindi Zhang, Dechao Meng, Steven Xiao, Qi Wang, Peng Zhang, Bang Zhang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 复杂问题求解 :self-correction(title)

AI总结 SyncAnyone通过渐进自我校正实现隐式解耦,提升野外对口型同步的精度和视觉保真度。

Comments Project page: https://humanaigc.github.io/sync_anyone_demo_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06678 2026-01-13 cs.DB 71%

Reflective Reasoning for SQL Generation

面向SQL生成的反思推理

Isabelle Mohr, Joao Gandarela, John Dujany, Andre Freitas

专题命中 复杂问题求解 :reasoning(title)

AI总结 本文提出了一种基于反思细化的文本到SQL框架,通过阶段化生成和反馈机制提升SQL生成的鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00838 2025-12-02 cs.RO cs.SY eess.SY 71%

A Novel MDP Decomposition Framework for Scalable UAV Mission Planning in Complex and Uncertain Environments

一种用于复杂和不确定环境中的可扩展无人机任务规划的新MDP分解框架

Md Muzakkir Quamar, Ali Nasir, Sami ELFerik

机构 * Control and Instrumentation Department(控制与仪器部门) Interdisciplinary Research Center for Intelligent Manufacturing and Robotics(智能制造与机器人交叉研究中心) Interdisciplinary Research Center for Smart Mobility and Logistics(智能移动与物流交叉研究中心)

专题命中 复杂问题求解 :planning(title)

AI总结 本文提出了一种新的MDP分解框架,用于在复杂和不确定环境中实现无人机任务规划的可扩展性和容错性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06125 2025-08-11 cs.CV 71%

SC-Captioner: Improving Image Captioning with Self-Correction by Reinforcement Learning

Lin Zhang, Xianfang Zeng, Kangcong Li, Gang Yu, Tao Chen

机构 * College of Future Information Technology, Fudan University(复旦大学未来信息科技学院) StepFun Shanghai Innovation Institute(上海创新研究院)

专题命中 复杂问题求解 :self-correction(title)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04572 2025-08-07 cs.CV 71%

Knowledge to Sight: Reasoning over Visual Attributes via Knowledge Decomposition for Abnormality Grounding

Jun Li, Che Liu, Wenjia Bai, Mingxuan Liu, Rossella Arcucci, Cosmin I. Bercea, Julia A. Schnabel

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Imperial College London(伦敦帝国学院) University of Trento(特伦托大学) Helmholtz AI and Helmholtz Munich(海德堡人工智能与海德堡慕尼黑) King’s College London(伦敦国王学院)

专题命中 复杂问题求解 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15135 2025-08-01 cs.RO 71%

Controllable Traffic Simulation through LLM-Guided Hierarchical Reasoning and Refinement

Zhiyuan Liu, Leheng Li, Yuning Wang, Haotian Lin, Hao Cheng, Zhizhe Liu, Lei He, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动学院) Artificial Intelligence Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)人工智能研究部) School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

专题命中 复杂问题求解 :reasoning(title)

Comments Accepted by IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18276 2025-07-25 cs.RO cs.CV 71%

Adaptive Articulated Object Manipulation On The Fly with Foundation Model Reasoning and Part Grounding

Xiaojie Zhang, Yuanfei Wang, Ruihai Wu, Kunqi Xu, Yu Li, Liuyu Xiang, Hao Dong, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) School of Computer Science, Peking University(北京大学计算机学院) School of EECS, Peking University(北京大学电子工程学院)

专题命中 复杂问题求解 :reasoning(title)

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18792 2025-05-27 cs.RO 71%

On the Dual-Use Dilemma in Physical Reasoning and Force

William Xie, Enora Rice, Nikolaus Correll

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校)

专题命中 复杂问题求解 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09915 2025-04-15 cs.IR cs.MM 71%

StePO-Rec: Towards Personalized Outfit Styling Assistant via Knowledge-Guided Multi-Step Reasoning

Yuxi Bi, Yunfan Gao, Haofen Wang

专题命中 复杂问题求解 :reasoning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.13573 2025-02-13 cs.RO 71%

Learning Manipulation Skills through Robot Chain-of-Thought with Sparse Failure Guidance

Kaifeng Zhang, Zhao-Heng Yin, Weirui Ye, Yang Gao

专题命中 复杂问题求解 :chain-of-thought(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.04879 2024-11-27 cs.CV 71%

On the Element-Wise Representation and Reasoning in Zero-Shot Image Recognition: A Systematic Survey

Jingcai Guo, Zhijie Rao, Zhi Chen, Song Guo, Jingren Zhou, Dacheng Tao

专题命中 复杂问题求解 :reasoning(title)

Comments 20 pages, 6 figures, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07311 2024-08-15 cs.HC 71%

MultiSurf-GPT: Facilitating Context-Aware Reasoning with Large-Scale Language Models for Multimodal Surface Sensing

Yongquan Hu, Black Sun, Pengcheng An, Zhuying Li, Wen Hu, Aaron J. Quigley

专题命中 复杂问题求解 :reasoning(title)

Comments 6 pages. MOBILEHCI Adjunct '24, 26th International Conference on Mobile Human-Computer Interaction, September 30-October 3, 2024, Melbourne, VIC, Australia

详情

展开后加载摘要…

URL PDF HTML 收藏
0808.1354 2009-12-01 math.LO cs.LO 71%

Ockham's razor and reasoning about information flow

Mehrnoosh Sadrzadeh

专题命中 复杂问题求解 :reasoning(title)

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06694 2026-08-10 cs.AI cs.MA 新提交 70%

A Multi-Agent Framework for Automated Coarse-Grained Molecular Dynamics of Polymers

用于聚合物自动化粗粒度分子动力学的多智能体框架

Joohee Choi, Junhyeong Lee, Seunghwa Ryu

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出CGMas多智能体框架,可自动完成聚合物粗粒度分子动力学的拓扑构建等全流程,完成27项任务,22项密度匹配度在5%内,模拟时间大幅缩短,确立了智能体式LLM用于聚合物粗粒化的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00482 2026-08-05 cs.CL 版本更新 70%

Know When to Stop: Segment-Level Credit Assignment for Reducing Overthinking

知止:用于减少过度思考的片段级信用分配

Chia-Hsuan Lee, Sihui Dai, Mingyang Zhou, Isha Slavin, Hsuan Su, Shi-Xiong Zhang, Sambit Sahu, William Campbell

机构 * Capital One(第一资本)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 提出DASH方法,通过将推理轨迹中的最终答案候选与真实值比较,实现片段级信用分配,减少推理语言模型过度思考行为,在AIME25上准确率达50.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28527 2026-07-31 cs.AI 新提交 70%

MANTA: Multi-Agent Network Topology Adaptation for Self-Evolving Multi-Agent Systems

MANTA:面向自演进多智能体系统的多智能体网络拓扑自适应框架

Mao-xun Huang, Jerry Wang, Yi-Cheng Lai, Zhengxin Zhang, Claire Cardie, Hen-Hsen Huang

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出MANTA框架,使多智能体系统通信拓扑可在推理阶段自演进,在五类基准测试中平均得分74.0,较最强基线高5.8个百分点,验证了推理阶段自改进可延伸至协作架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28330 2026-07-31 cs.AI 新提交 70%

Paying for Honesty Without Knowing the Truth: Reputation-Penalty Design for LLM Marketplace Agents

在未知真相的情况下为诚实付费:LLM市场智能体的声誉惩罚机制设计

Mingdai Yang, Shicheng Fan, Kejing Yu, Duohao Wang, Li Sun, Hao Peng, Philip S. Yu, Zhiwei Liu

机构 * Univ. of Illinois Chicago(伊利诺伊大学芝加哥分校) Springbrand Inc.(春品牌公司) Beijing University of Posts and Telecommunications(北京邮电大学) Beihang University(北京航空航天大学) Hangzhou Innovation Institute of BUAA(北京航空航天大学杭州创新研究院) Microsoft(微软公司)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对LLM智能体商家伪造属性的问题,设计无需真实情况的CARP声誉惩罚机制,搭配SPARC机制可保护消费者、提升福利,且在多模型中具有约束力。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16379 2026-07-30 cs.IR cs.CL 版本更新 70%

LLMAR: A Tuning-Free Recommendation Framework for Sparse and Text-Rich Industrial Domains

LLMAR:一种适用于稀疏且文本丰富的工业领域的无调优推荐框架

Ryogo Hishikawa, Ichiro Kataoka, Shinya Yuda

机构 * Hitachi, Ltd. Research and Development Group(日立株式会社研发部门) Hitachi Power Solutions Co., Ltd.(日立电力解决方案公司)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 LLMAR通过无调优框架整合大语言模型推理,捕捉用户潜在动机,解决工业领域数据稀疏问题,提升推荐准确率和效率。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22902 2026-07-28 cs.AI cs.SE 新提交 70%

How Well Can AI Generate Backlogs from App Mockups?

人工智能从应用程序原型生成待办事项列表的效果如何?

Andrea Lezcano Airaldi, Lourdes Romera, Walid Maalej

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究人工智能从应用程序原型生成待办事项列表的效果,提出多模态方法,评估三种提示策略,发现结合架构上下文的混合提示有帮助,结果因项目类型而异,还提出新度量,强调开发人员监督必要。

Comments Accepted at the AIRE Workshop, IEEE 34th International Requirements Engineering Conference (RE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21013 2026-07-28 cs.AI cs.CV 版本更新 70%

EmoAgent-R1: Towards Multimodal Emotion Understanding with Reinforcement Learning-based Dynamic Agent Specialization

EmoAgent-R1:基于强化学习的动态智能体专业化实现多模态情感理解

Lihuang Fang, Yuchen Zou, kebing Jin, Jinghui Qin

机构 * Guangdong University of Technology(广东工业大学) Southern University of Science and Technology(南方科技大学) Xi’an Jiaotong University(西安交通大学) Guizhou Provincial Laboratory of Big Data, State Key Laboratory of Public Big Data, Guizhou University(贵州大学大数据省级重点实验室、公共大数据国家重点实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究针对现有多模态情感识别方法忽视情感源动态性和复杂性的问题,提出基于强化学习的动态智能体专业化框架EmoAgent-R1,采用冷启动策略和两步智能体工作流程训练,并用P-GRPO优化,实验证明其在情感推理性能和优化稳定性上更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15778 2026-07-20 cs.CV cs.AI 新提交 70%

Modularized Dynamic-Granularity Video LLM for Multi-Event Long Video Understanding

用于多事件长视频理解的模块化动态粒度视频语言模型

Wei Feng, Xin Wang, Yu-Wei Zhan, Yuwei Zhou, Wenwu Zhu

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对长视频理解中视觉令牌预算与多事件捕捉的矛盾问题,提出MoD-VLLM框架,含正-负视频片段定位和模块化动态粒度反射模块,结合动态粒度强化学习策略,在多事件长视频基准测试中显著优于现有基线。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08080 2026-07-10 cs.CL 新提交 70%

MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction

MASTE:一种用于零样本方面情感三元组提取的多智能体管道

Ao Hong, Lehang Wang, Zhirun Yue, Mingxin Wang, Zihan Wang, Houde Liu

机构 * Tsinghua University(清华大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01121 2026-07-07 cs.AI 版本更新 70%

HVR-Met: A Hypothesis-Verification-Replanning Agentic System for Extreme Weather Diagnosis

HVR-Met:一种用于极端天气诊断的假设验证-重新规划智能系统

Shuo Tang, Jiadong Zhang, Gengxian Zhou, Qizhao Jin, Qinxuan Wang, Yi Hu, Ning Hu, Hongchang Ren, Lingli He, Shiming Xiang, Jingtao Ding, Jian Xu, Jiaolan Fu, Cheng-Lin Liu

专题命中 复杂问题求解 :reasoning(abstract);logical reasoning(abstract);分类 cs.AI

AI总结 针对深度学习天气预报难以应对极端天气诊断的挑战,提出HVR-Met多智能体气象诊断系统,其核心是假设验证-重新规划闭环机制,引入新基准测试,实验证明该系统在复杂诊断场景中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15141 2026-07-07 cs.LG 版本更新 70%

CLEANER: Self-Purified Trajectories Boost Agentic Reinforcement Learning

CLEANER:自我净化轨迹助力智能强化学习

Tianshi Xu, Yuteng Chen, Meng Li

机构 * Peking University(北京大学) NTU, Singapore(新加坡国立大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.LG

AI总结 研究参数受限模型探索阶段因执行失败产生噪声轨迹影响策略优化的问题,提出CLEANER,利用模型自我纠错能力净化轨迹,其SAAR机制提升平均准确率,减少训练步骤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31820 2026-07-01 cs.AI 新提交 70%

Adaptive Cluster-First Route-Second Decomposition for Industrial-Scale Vehicle Routing

面向工业规模车辆路径问题的自适应先聚类后路由分解方法

Oguzhan Karaahmetoglu, Hyong Kim

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 提出一种自适应先聚类后路由分解系统,利用大语言模型作为高层决策者,迭代执行聚类、平衡和细化操作,实现容量感知的客户与车辆联合划分,在高达50万客户的实例上展现出竞争性性能和可扩展性。

Comments 29 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28570 2026-06-30 cs.CV cs.AI cs.MA 70%

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG

数字化教练智能:基于VLM和RAG的整体运动员画像智能体框架

Deep Ghosal, Ishani Sen, Wazib Ansar, Amlan Chakrabarti

机构 * A.K. Choudhury School of Information Technology University of Calcutta(A.K.楚德里信息科技学院印度加尔各答大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.AI

AI总结 提出基于LLM的混合智能体框架,结合计算机视觉与视觉语言模型,通过3×3智能网格分块策略降低计算开销,并引入LLM-as-a-Judge自校正循环和双持久化RAG管道,实现符合印度体育局标准的自动化整体运动员评估。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03555 2026-06-30 cs.AI 70%

SCRIBE: Structured Mid-Level Supervision for Tool-Using Language Models

SCRIBE:结构化中层监督用于工具使用语言模型

Yuxuan Jiang, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 SCRIBE通过引入中层抽象监督框架,减少多步推理中的信用分配难度,提升工具使用代理的可靠性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27632 2026-06-29 cs.CL 新提交 70%

Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety

Yuvion LLM:一种面向内容和AI安全的对抗感知大语言模型

Ting Ma, Xiufeng Huang, Benlei Cui, Xiaowen Xu, Shikai Qiu, Ruijie Jian, Hongxing Li, Guanghui Wang, Longtao Huang, Haiwen Hong, Haolei Xu, Wenjing Jiang, Ziwen Xu, Zhaoyu Fan, Shaoxuan He, Chuxi Xiao, Yujian Li, Xinyue Chen, Chunyang Chai, Wenxuan Liu, Ziheng Wang, Dongjie Zhang, Yangfan Zhou, Libin Dong, Yupeng Cao, Xiaoqian Xia, Jing Wang, Zhe Jiang, Zhenan Ye, Guang Yang, Bin Liu, Wei Peng, Ziqiang Zhu, Meihui Lian, Kaiwen Lv Kacuila, Haidong Ding, Bingyu Zhu, Yan Wang, Hai Zhao, Xuan Jin, Wei Zhao, Pengfei Sun, Wei Wang, Huiming Zhang, Bin Li, Hui Xue

机构 * Alibaba Security AGI Lab(阿里巴巴安全AGI实验室)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL

AI总结 针对大语言模型在对抗性攻击下的安全脆弱性,提出Yuvion LLM,通过对抗感知数据构建、知识增强预训练及多任务安全后训练,在安全基准和对抗鲁棒性上优于GPT-5.4等更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19605 2026-06-23 cs.SE cs.AI 新提交 70%

FAPO: Fully Automated Prompt Optimization of Multi-Step LLM Pipelines

FAPO:多步骤LLM流水线的全自动提示优化

Paul Kassianik, Baturay Saglam, Huaibo Zhao, Blaine Nelson, Supriti Vijay, Aman Priyanshu, Amin Karbasi

机构 * Foundation AI–Cisco Systems Inc.(基础AI–思科系统公司) Yale University(耶鲁大学)

专题命中 复杂问题求解 :reasoning(abstract,abstract_cn);分类 cs.AI

AI总结 提出FAPO框架,通过自动诊断流水线瓶颈并迭代优化提示或链结构,在18个模型-基准比较中15次优于基线GEPA,平均提升14.1个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏