arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4988 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4988 篇

2608.11772 2026-08-13 cs.CL 新提交 83%

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

修复前诊断:将智能体故障转化为选择性自修正

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong

机构 * Ant International(蚂蚁国际)

专题命中 复杂问题求解 :self-correction(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本研究提出诊断引导的修复框架DARC,通过先诊断故障类型再进行选择性自修正,在ALFWorld等三个任务场景中提升了智能体平均任务性能并减少资源消耗,为缺乏类编译器反馈的领域构建可靠智能体提供了实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11741 2026-08-11 cs.AI 版本更新 83%

Collaborative Multi-Agent Scripts Generation for Enhancing Imperfect-Information Reasoning in Murder Mystery Games

协作多智能体脚本生成以增强谋杀谜游戏中的不完全信息推理

Keyang Zhong, Junlin Xie, Hefeng Wu, Haofeng Li, Guanbin Li

机构 * Sun Yat-sen University(中山大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出协作多智能体框架,通过生成丰富多模态上下文提升VLMs在叙事推理和欺骗鲁棒性中的表现,解决多玩家游戏中不完全信息下的复杂推理问题。

Comments 9 pages, 5 figures, Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01095 2026-08-04 cs.CV cs.LG 版本更新 83%

NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding

NarrativeTrack: 评估实体中心推理在叙事理解中的表现

Hyeonjeong Ha, Jinjin Ge, Bo Feng, Kaixin Ma, Gargi Chakraborty

机构 * Apple(苹果公司) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 NarrativeTrack通过细粒度实体中心推理评估多模态大语言模型的叙事理解能力,揭示了感知接地与时间推理之间的根本权衡。

Comments Project Page: https://github.com/apple/ml-NarrativeTrack

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 83%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13156 2026-07-07 cs.CV cs.AI 新提交 83%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03741 2026-07-01 cs.AI 版本更新 83%

When to Re-Plan: Subgoal Persistence in Hierarchical Latent Reasoning

何时重新规划:分层潜在推理中的子目标持久性

Ayushi Chadha

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究分层潜在推理中稳定性与适应性的权衡,通过封建式管理-工人接口控制子目标持久周期,发现中等周期(3-6步)最优,内在对齐权重存在窄最优值(约0.05)。

Comments Accepted at the Workshop on Compositional Learning: Safety, Interpretability, and Agents (CompLearn), ICML 2026. 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23559 2026-06-30 cs.CR cs.AI cs.CV 83%

CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training

针对原生GUI代理的CAPTCHA解决:自动化推理-行动数据生成与自我纠正训练

Yuxi Chen, Haoyu Zhai, Chenkai Wang, Rui Yang, Lingming Zhang, Gang Wang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 本文提出ReCAP,一种能解决现代交互式CAPTCHA挑战的原生GUI代理,通过自动化数据生成和自我纠正训练提升CAPTCHA解决能力,同时保持通用GUI任务性能。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17524 2026-06-29 cs.LG 新提交 83%

Learning to Refine Hidden States for Reliable LLM Reasoning

学习精炼隐藏状态以实现可靠的LLM推理

Chia-Hsuan Hsu, Jui-Ming Yao

机构 * Tongyu0924

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。

Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 83%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17890 2026-06-17 cs.CL 新提交 83%

Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

动态展开编辑:减少RL训练推理模型中的过度思考

Zihao Wei, Wenjie Shi, Liang Pang, Jingcheng Deng, Shicheng Xu, Shasha Guo, Zenghao Duan, Jiahao Liu, Jingang Wang, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对GRPO强化学习训练中模型在得出正确答案后继续生成不必要推理的过度思考问题,提出动态展开编辑(DRE)方法,通过编辑成功轨迹中答案出现后的思考部分,削弱对不必要思考的偏好信号,实验证明其有效性。

Comments 21 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08234 2026-06-09 cs.AI 新提交 83%

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

SciTrace: 面向科学发现代理的轨迹感知安全推理

Tanush Swaminathan, Runmin Jiang, Letian Zhang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute(艾伦研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25928 2026-06-03 cs.CL 83%

CogRAG: Tackling Heterogeneous Cognitive Demands in RAG via Stratified Retrieval and Reasoning

CogRAG:通过分层检索与推理应对RAG中的异构认知需求

Xudong Wang, Zilong Wang, Kui Su, Zhaoyan Ming

机构 * School of Computer and Computing Science, Hangzhou City University(杭州城市大学计算机与计算科学学院) Innovation Center of Yangtze River Delta, Zhejiang University(长三角创新中心,浙江大学) Institute of Digital Twin, Eastern Institute of Technology(数字孪生研究院,东部技术研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出CogRAG框架,基于布鲁姆分类法预测查询的认知负荷,协调认知自适应证据精炼与认知分层结构化推理,解决RAG中不同任务的异构认知需求,在注册营养师资格考试中将Qwen3-8B准确率提升至85.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00832 2026-06-02 cs.CL 83%

Momento: Evaluating Persistent Memory and Reasoning with Multi-Session Agentic Conversations

Momento:评估多会话代理对话中的持久记忆与推理

Adril Putra Merin, David Anugraha, Ayu Purwarianti, Genta Indra Winata

机构 * Institut Teknologi Bandung(万隆技术大学) Stanford University(斯坦福大学) Capital One

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 提出Momento基准,通过多会话服务环境评估代理在跨会话中利用持久记忆和推理完成个性化任务的能力,发现现有代理因误估用户状态而表现不佳。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17621 2026-06-02 cs.AI 83%

KnowledgeBerg: Evaluating Systematic Knowledge Coverage and Compositional Reasoning in Large Language Models

KnowledgeBerg: 评估大语言模型中的系统性知识覆盖与组合推理

Xiao Zhang, Qianru Meng, Yongjian Chen, Yumeng Wang, Johan Bos

机构 * University of Groningen(Groningen大学) LIACS, Leiden University(莱顿大学LIACS)

专题命中 复杂问题求解 :reasoning(title,abstract);test-time compute(abstract);分类 cs.AI

AI总结 提出KnowledgeBerg基准,通过4800道选择题评估大模型在知识宽度和推理深度上的系统性覆盖与组合推理能力,发现现有模型存在严重不足。

Comments ACL Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27965 2026-05-28 cs.AI 83%

The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces

过度思考的形状:长推理轨迹中的回溯爆发

Navid Rezazadeh, Arash Gholami Davoodi

机构 * University of California, Irvine(加州大学尔湾分校) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 通过分析长推理轨迹中的回溯动态,发现早期孤立修复通常与正确推理兼容,而错误轨迹更常出现持续且聚集的晚期中度至重度回溯,并基于此提出爆发感知过滤策略以区分可恢复修复与潜在不稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27741 2026-05-28 cs.CL 83%

Escape the Language Prior: Mitigating Late-Stage Modality Collapse in Audio Reasoning via Modality-Aware Policy Optimization

逃离语言先验:通过模态感知策略优化缓解音频推理中的后期模态崩溃

Cihan Xiao, Yiwen Shao, Chenxing Li, Xiang He, Zhenwen Liang, Steve Yves, Sanjeev Khudanpur, Liefeng Bo

机构 * Johns Hopkins University(约翰霍普金斯大学) Tencent Hunyuan(腾讯文言)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对多模态大语言模型在强化学习后训练中因统一策略梯度忽略模态依赖性而导致的后期模态崩溃问题,提出模态感知策略优化(MAPO)框架,通过模态相关性掩码和辅助注意力损失分支动态聚焦梯度并维持跨模态推理,在复杂音频推理基准上取得新最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08525 2026-05-28 cs.CL 83%

Which Heads Matter for Reasoning? RL-Guided KV Cache Compression

哪些注意力头对推理重要?RL引导的KV缓存压缩

Wenjie Du, Li Jiang, Keda Tao, Xue Liu, Huan Wang

机构 * Westlake University(西华大学) McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究院) Zhejiang University(浙江大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德智能大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 提出RLKV方法,利用强化学习识别对推理质量关键的注意力头,并对其保留完整KV缓存而对其他头进行激进压缩,实现20-60%缓存减少且性能近乎无损。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02360 2026-05-27 cs.CV cs.CL 83%

LaRe: Latent Refocusing for Multimodal Reasoning

LaRe: 用于多模态推理的潜在重聚焦

Jizheng Ma, Xiaofei Zhou, Geyuan Zhang, Yanlong Song, Han Yan

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络与信息安全学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 提出LaRe范式,在潜在空间内进行视觉重聚焦,结合语义增强训练,在提升推理准确率的同时大幅减少推理所需token数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05678 2026-05-08 cs.AI 83%

Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering

风险链:大型推理模型中的安全故障及通过自适应多原则引导的缓解

Xiaomin Li, Jianheng Hou, Zheyuan Deng, Zhiwei Zhang, Taoran Li, Binghang Lu, Bing Hu, Yunhan Zhao, Yuexing Hao

机构 * Harvard University(哈佛大学) University of Southern California(南加州大学) Brown University(布朗大学) Pennsylvania State University(宾夕法尼亚州立大学) Texas A&M University(德克萨斯阿姆大学) Purdue University(普渡大学) University of California, Irvine(加州大学 Irvine 分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究发现大型推理模型在推理轨迹中存在额外安全风险,提出自适应多原则引导方法降低不安全内容出现率,提升整体安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00914 2026-05-05 cs.MA cs.AI 83%

The Cost of Consensus: Isolated Self-Correction Prevails Over Unguided Homogeneous Multi-Agent Debate

共识的成本:孤立自我修正胜过无指导的同质多智能体辩论

Blaž Bertalanič, Carolina Fortuna

机构 * Jo z ef Stefan Institute Ljubljana Slovenia Jo z ef Stefan Institute

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 研究探讨了同质多智能体辩论中共识失败的机制,发现孤立自我修正在成本与准确性上优于无指导的同伴交流,尤其在参数规模7-8B时效果更佳。

Comments 19 pages, ACM Conference on AI and Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06428 2026-04-24 cs.LG 83%

BackPlay: Head-Only Look-Back Self-Correction for Diffusion Language Models

BackPlay:用于扩散语言模型的头部-only回溯自校正

Liming Liu, Binxuan Huang, Zixuan Zhang, Xin Liu, Bing Yin, Tuo Zhao

机构 * Amazon(亚马逊)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.LG

AI总结 BackPlay通过在冻结的生成器上训练轻量级校正头,改进多token解码下的生成质量,利用回溯校正机制减少错误积累。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17944 2026-04-21 cs.CL 83%

ReCoQA: A Benchmark for Tool-Augmented and Multi-Step Reasoning in Real Estate Question and Answering

ReCoQA:一个用于房地产问答中工具增强和多步骤推理的基准

Yindong Zhang, Wenmian Yang, Yiquan Zhang, Weijia Jia

机构 * Hong Kong Baptist University(香港 Baptist大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港 Baptist大学) Beijing Normal University(北京师范大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.CL

AI总结 本文提出ReCoQA基准,包含29270个房地产实例,通过机器可验证的监督提升多步骤推理能力,并提出HIRE-Agent框架作为强基线,验证了层级协作在复杂现实任务中的必要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16396 2026-04-21 cs.CL 83%

QU-NLP at QIAS 2026: Multi-Stage QLoRA Fine-Tuning for Arabic Islamic Inheritance Reasoning

QU-NLP在QIAS 2026中的表现:针对阿拉伯伊斯兰继承推理的多阶段QLoRA微调

Mohammad AL-Smadi

机构 * Qatar University(卡塔尔大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出通过多阶段QLoRA微调策略提升阿拉伯伊斯兰继承推理能力,利用领域适应和任务特定训练,在低资源下实现高精度推理。

Comments Accepted for publication, The 7th Workshop on Open-Source Arabic Corpora and Processing Tools, LREC26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14847 2026-04-17 cs.AI 83%

TrigReason: Trigger-Based Collaboration between Small and Large Reasoning Models

TrigReason:基于触发的大小推理模型协作

Yi Zhao, Yajuan Peng, Cam-Tu Nguyen, Zuchao Li, Xiaoliang Wang, Xiaoming Fu, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(AGI研究院,计算机科学学院,上海交通大学,上海,中国) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University, Shanghai, China(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学,上海,中国) Shanghai Key Laboratory for Intelligent Information Processing, Fudan University(上海市智能信息处理重点实验室,复旦大学) State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Wuhan University(人工智能学院,武汉大学) Institute of Computer Science, University of Göttingen, Göttingen, Germany(计算机科学研究所,哥廷根大学,哥廷根,德国)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出TrigReason框架,通过触发机制将大部分推理任务交给小型模型,仅在必要时调用大模型,提升推理效率与准确性。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07518 2026-04-10 cs.CL 83%

Decompose, Look, and Reason: Reinforced Latent Reasoning for VLMs

分解、观察与推理:用于视觉语言模型的强化潜在推理

Mengdan Zhu, Senhao Cheng, Liang Zhao

机构 * Emory University(埃默里大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出DLR框架,通过动态分解查询、提取连续视觉潜在表示和基于 grounded rationales 推理,提升视觉语言模型在复杂视觉推理中的表现,实验表明其优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04325 2026-04-07 cs.CL 83%

Benchmarking Multi-turn Medical Diagnosis: Hold, Lure, and Self-Correction

多轮医学诊断基准测试:Hold、Lure 和 Self-Correction

Jinrui Fang, Runhan Chen, Xu Yang, Jian Yu, Jiawei Xu, Ashwin Vinod, Wenqi Shi, Tianlong Chen, Heng Ji, ChengXiang Zhai, Ying Ding, Yuji Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) New York University(纽约大学) The University of Texas Southwestern Medical Center(德克萨斯大学西南医学中心) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文通过MINT基准测试揭示了大语言模型在多轮证据积累中的行为模式,发现提前回答、自我修正和强诱因影响诊断决策,提出延迟提问和保留关键证据可提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02972 2026-04-06 cs.CL 83%

NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons

NeuReasoner:通过混合神经元实现可解释、可控和统一的推理

Haonan Dong, Kehan Jiang, Haoran Ye, Wenhao Zhu, Zhaolu Kang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL

AI总结 本文提出NeuReasoner框架,通过混合神经元解决推理中的内在错误、跨步震荡和实例适配问题,提升可解释性和可控性,实验显示在六个基准测试中性能提升达27.0%,token消耗降低19.6%-63.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29602 2026-04-01 cs.GR cs.AI cs.CV cs.MA 83%

IMAGAgent: Orchestrating Multi-Turn Image Editing via Constraint-Aware Planning and Reflection

IMAGAgent:通过约束感知规划与反思协调多轮图像编辑

Fei Shen, Chengyu Xie, Lihong Wang, Zhanyi Zhang, Xin Jiang, Xiaoyu Du, Jinhui Tang

机构 * National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学) Nanjing Forestry University(南京林业大学)

专题命中 复杂问题求解 :planning(title,abstract);self-correction(abstract);分类 cs.AI

AI总结 IMAGAgent通过闭环机制整合指令解析、工具调度与自适应修正,解决多轮图像编辑中的上下文感知与反馈问题,提升编辑精度与整体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19558 2026-03-23 cs.CL 83%

TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?

TextReasoningBench: 推理是否真的能提升大语言模型中的文本分类性能?

Xinyu Guo, Yazhou Zhang, Jing Qin

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文通过TextReasoningBench评估推理策略在文本分类中的有效性与效率,发现推理并非总能提升性能,且多数策略效率低下。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17312 2026-03-19 cs.CV cs.AI 83%

Recurrent Reasoning with Vision-Language Models for Estimating Long-Horizon Embodied Task Progress

基于视觉语言模型的递归推理用于估计长周期具身任务进度

Yuelin Zhang, Sijie Cheng, Chen Li, Zongzhao Li, Yuxin Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院) Beijing Key Laboratory of Research on Large Models and Intelligent Governance(北京大型模型与智能治理研究重点实验室) Engineering Research Center of Next-Generation Intelligent Search and Recommendation, MOE(教育部下一代智能搜索与推荐工程研究中心) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出R²VLM模型,通过递归推理框架处理局部视频片段,维护全局上下文,实现复杂时间依赖推理,提升长周期任务进度估计性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏