arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4109 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 356 篇

2608.02833 2026-08-05 cs.CV cs.AI cs.CL 新提交 86%

CURV: Enhancing Chart Understanding Through Curriculum Visual Grounded Reasoning

CURV:通过课程可视化接地推理增强图表理解

Xuehang Guo, Pingyue Zhang, Ruiyi Zhang, Zhenhailong Wang, Hanrui Lyu, Heng Ji, Tong Sun, Qingyun Wang, Manling Li

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉接地与推理不足的问题,提出CURV课程学习框架,结合CCQA数据集,在图表问答任务中实现显著性能提升并具备良好泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14003 2026-08-17 cs.CL 新提交 85%

Batch-wise Adaptive Pruning: Periodic Neuron Activation-Aware Weight Pruning for Language Reasoning Model

批量自适应剪枝:面向语言推理模型的周期性神经元激活感知权重剪枝

Yongmin Kim, Shota Takashiro, Yusuke Iwasawa, Takeshi Kojima, Yutaka Matsuo

机构 * The University of Tokyo(东京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究针对语言推理模型批量推理下自适应剪枝性能下降的问题,提出带周期性top-k选择和激活记忆的无训练剪枝方法,在DeepSeek-R1-Distill-Qwen-7B上实现39.7个百分点准确率提升与1.40倍推理加速。

Comments Accepted at COLM 2026. 28 pages, 12 figures, 18 tables. Code: https://github.com/matsuolab/batch-wise-prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16819 2026-07-21 cs.AI 新提交 85%

FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images

FUSAR-R1:一种用于合成孔径雷达图像智能解释的大规模推理模型

Yi Yang, Xiaokun Zhang, Yuxuan Li, Ruyi Zhang, Xinpeng Zhou, Haipeng Wang

机构 * Fudan University(复旦大学) Key Laboratory for Information Science of Electromagnetic Waves (MoE)(电磁波信息科学教育部重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);self-correction(abstract);分类 cs.AI

AI总结 针对SAR图像智能解释问题,提出FUSAR-R1模型。通过模拟专家解释构建思维链推理数据指导指令学习,赋予基本推理能力,再用强化学习策略优化输出。该模型在多种SAR解释任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11089 2026-07-14 cs.AI 新提交 85%

OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping

OS-Pruner:通过最优停止修剪推理模型的思维链

Mohammed Ehab, Aymane El Gadarri, Vivek F. Farias, Adam Jozefiak, Ciamac C. Moallemi

机构 * MIT(麻省理工学院) Columbia Business School(哥伦比亚商学院)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 研究针对大语言模型思维链推理存在计算过度问题,提出轻量级框架OS-Pruner,将思维链修剪转化为最优停止问题,通过优化效用动态评估终止点,在多基准和模型上减少生成长度且精度牺牲小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13760 2026-08-17 cs.CL cs.AI cs.CV cs.LG 新提交 85%

Amplified Does Not Mean Predictive: Reasoning Behaviors in Thinking Models

放大并不意味着具有预测性:思考模型中的推理行为

Jean de Dieu Nyandwi, Leena Mathur, Yonatan Bisk, Robert Hawkins, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究揭示思考模型存在“放大-提升差距”,即面向推理的训练放大了与正确性关联弱的推理行为,却未放大高提升值的关键行为,推动了过程级推理目标的研究。

Comments Published in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17884 2026-07-21 cs.AI 新提交 84%

ST-Veto: Spatio-Temporal Token Veto for Diffusion MLLMs via Taylor Prediction and Visual Grounding

ST-Veto:通过泰勒预测和视觉基础实现用于扩散多模态语言模型的时空令牌否决

Keuntae Kim, Beomseok Lee, Hyunwoo Kim, Yong Suk Choi

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 研究针对扩散多模态大语言模型推理不足问题,提出无需训练的ST-Veto方法,利用二阶泰勒预测和图像注意力质量否决不稳定及弱基础令牌,与更安全候选交换,在多基准测试中优于其他方法,提升准确率且无额外成本。

Comments ICML 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02089 2026-08-04 cs.LG cs.AI 新提交 84%

How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models

推理摘要能透露多少信息?大语言模型的可观测性阶梯

Andres Algaba, Francesca Carlon, Lynn Delcon, Marthe Ballon, Bert Verbruggen, Vincent Ginis

专题命中 复杂问题求解 :reasoning(title,abstract);self-correction(abstract);分类 cs.AI、cs.LG

AI总结 本文提出大语言模型的可观测性阶梯,通过实验发现有提示时摘要对正确性监测的帮助远小于完整轨迹,可监测性由显示内容和读者共同决定。

Comments 71 pages, 13 figures, 65 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26865 2026-07-30 stat.ML cs.AI cs.IT cs.LG math.IT 新提交 84%

Think Short, Defer Smart, Act, and Repeat: Calibrated Reasoning and Uncertainty-Aware Deferral for Edge LLM Agents

短思考、智能延迟、行动与循环:面向边缘大语言模型智能体的校准推理与感知不确定性的延迟机制

Amirmohammad Farzaneh, Osvaldo Simeone

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出TSDS框架,结合收敛探测器与困惑度延迟规则,经LTT流程校准后,可在边缘LLM智能体上减少43%-73%的思考计算量,同时保证奖励与云端调用率,在多类基准任务上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16409 2026-07-21 cs.CV cs.AI cs.LG 新提交 84%

Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models

思考、规划、绘制:统一模型中用于可控图像生成的布局感知推理

Junhao Liu, Jian-Wei Zhang, Tao Huang, Miles Yang, Zhao Zhong, Liefeng Bo

机构 * Tencent(腾讯) Peking University(北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对统一多模态大语言模型在可控图像生成中难以遵循复杂空间指令的问题,提出ATLAS框架,采用“思考、规划、绘制”范式及布局共享表示,经强化学习提升性能,在图像生成等任务中效果显著,还支持相关编辑与多模态基础,并引入评估基准。

Comments 22 pages, 12 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09803 2026-07-14 cs.LG cs.CL 新提交 84%

Spectral Origins of the Self-Correction Blind Spot in Autoregressive Generation

自回归生成中自我修正盲点的频谱起源

Ingrid Petrova, Luan Vejsiu

机构 * European University of Tirana(地拉那欧洲大学)

专题命中 复杂问题求解 :self-correction(title,abstract);verifier(abstract);分类 cs.CL、cs.LG

AI总结 研究大型自回归语言模型自我修正盲点问题,提出频谱代数理论SPARC,定义错误传播算子,推导激活阈值,证明基于强化学习的验证器-校正器训练收敛条件,实验验证定理,频谱预测与盲点率匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02885 2026-07-10 cs.CL cs.AI cs.HC cs.IR 新提交 84%

Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

大语言模型在认知行为疗法引导的情感推理中存在哪些不足?

Vaishnavi Sinha, Pooja Guttal, Pranay Deep Reddy Katike, Vishal Sinha, Gerald Ndawula, Lira Yoon, Andrea Kleinsmith, Manas Gaur

机构 * UMBC(美国马里兰大学) UC Irvine(美国加州大学 Irvine 分校)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在认知行为疗法引导的情感推理中的不足,采用知识引导框架,将用户叙述分解并基于临床概念验证,用协议杠杆力衡量引导效果,发现单链思维提示无效,多链思维能更好引导策略选择但效果有限。

Comments 12 pages, 7 figures, accepted for publication in Affective Computing and Intelligent Interaction (ACII) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23196 2026-06-23 cs.CL cs.AI 新提交 84%

When Does Intrinsic Self-Correction Help? A Task-Sensitive Analysis

内在自我纠正何时有效?一项任务敏感分析

Elroy Stav, Dvir Berlowitz, Maayan Orner, Sarit Kraus

机构 * Bar-Ilan University(巴伊兰大学) Independent Researcher(独立研究员)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本研究采用任务敏感视角分析内在自我纠正(SC),发现当任务结构支持验证约束、重新审视推理或提供第二意见时,SC能带来一致性能提升,表明其有效性取决于任务类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11772 2026-08-13 cs.CL 新提交 83%

Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction

修复前诊断:将智能体故障转化为选择性自修正

Pan Wang, Yihao Hu, Hang Wang, Zirui Lv, Xin Zhang, Jianshe Li, Jiang-Ming Yang, Wei Wu, Yongqi Tong

机构 * Ant International(蚂蚁国际)

专题命中 复杂问题求解 :self-correction(title,abstract);verifier(abstract);分类 cs.CL

AI总结 本研究提出诊断引导的修复框架DARC,通过先诊断故障类型再进行选择性自修正,在ALFWorld等三个任务场景中提升了智能体平均任务性能并减少资源消耗,为缺乏类编译器反馈的领域构建可靠智能体提供了实用路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07117 2026-07-09 cs.CV cs.AI 新提交 83%

Tree-of-Thoughts Reasoning for Text-to-Image In-Context Learning

用于文本到图像上下文学习的思维树推理

Stepanida Alekseeva, Jenifer Kalafatovich, Seong-Whan Lee

机构 * Korea University(韩国大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 研究文本到图像上下文学习中模型的推理问题,提出思维树推理框架,通过多阶段推理和选择层减轻提示模糊性与组合错误,实验表明该结构化多分支推理能提升图像生成效果,无需额外训练或微调。

Comments 6 pages, 3 figures, 4 tables. Accepted at IEEE SMC 2026. Code available at https://github.com/Pandastep/ToT-T2I-ICL

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13156 2026-07-07 cs.CV cs.AI 新提交 83%

Iterative Visual Thinking and the Self-Correction Mirage in VLM Grounding

迭代视觉思维:通过视觉反馈教会视觉语言模型空间自我修正

Animesh Tripathy, Aswanth Krishnan

机构 * QpiAI India Pvt. Ltd(QpiAI印度私人有限公司)

专题命中 复杂问题求解 :self-correction(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 提出迭代视觉思维(IVT)框架,通过视觉反馈闭环和两阶段训练(SFT+GRPO),使视觉语言模型具备空间自我修正能力,在三个基准上提升指标2.4-3.2个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17524 2026-06-29 cs.LG 新提交 83%

Learning to Refine Hidden States for Reliable LLM Reasoning

学习精炼隐藏状态以实现可靠的LLM推理

Chia-Hsuan Hsu, Jui-Ming Yao

机构 * Tongyu0924

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出ReLAR框架,通过强化学习引导的潜在状态精炼,自适应调整推理步数和方向,提升复杂多步推理的准确性和稳定性,降低推理开销。

Comments Code is available at tongyu0924/Learning-to-Refine-Hidden-States

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21734 2026-06-23 cs.CV cs.AI 新提交 83%

HPP: Hierarchical Programmatic Probing for Long Video Understanding by Decoupling Perception and Reasoning

HPP:通过解耦感知与推理的分层程序化探测用于长视频理解

Awais Rauf, Ahmed Hasssan, Greg Slabaugh

机构 * Queen’s University Belfast(贝尔法斯特女王大学) AMD(AMD公司) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 复杂问题求解 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出HPP框架,通过将长视频理解重构为分层视频的迭代程序化探索,解耦语义感知与高阶时序推理,在LongVideoBench等基准上取得显著提升。

Comments Project page: https://awaisrauf.com/HPP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17890 2026-06-17 cs.CL 新提交 83%

Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models

动态展开编辑:减少RL训练推理模型中的过度思考

Zihao Wei, Wenjie Shi, Liang Pang, Jingcheng Deng, Shicheng Xu, Shasha Guo, Zenghao Duan, Jiahao Liu, Jingang Wang, Huawei Shen, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 针对GRPO强化学习训练中模型在得出正确答案后继续生成不必要推理的过度思考问题,提出动态展开编辑(DRE)方法,通过编辑成功轨迹中答案出现后的思考部分,削弱对不必要思考的偏好信号,实验证明其有效性。

Comments 21 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08234 2026-06-09 cs.AI 新提交 83%

SciTrace: Trajectory-Aware Safety Reasoning for Scientific Discovery Agents

SciTrace: 面向科学发现代理的轨迹感知安全推理

Tanush Swaminathan, Runmin Jiang, Letian Zhang, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) Allen Institute(艾伦研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);verifier(abstract);分类 cs.AI

AI总结 提出SciTrace框架,通过安全内在推理循环和组合工具链验证器,在科学代理管道的每个阶段融入安全推理,实现工具调用安全性和对抗鲁棒性的SOTA提升。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02234 2026-07-03 cs.AI cs.LG 新提交 82%

Purified OPSD: On-Policy Self-Distillation Without Losing How to Think

纯化OPSD:在不失去思考能力的情况下进行在线自我蒸馏

Zhanming Shen, Jintao Tong, Shaotian Yan, Chen Shen, Hao Chen, Wentao Ye, Xiaomeng Hu, Rui Miao, Haobo Wang, Junbo Zhao, Gang Chen, Jieping Ye

机构 * Zhejiang University(浙江大学) Tongyi Lab, Alibaba Group(阿里云实验室,阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学) Jilin University(吉林大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 针对在线自我蒸馏(OPSD)在长链思维推理模型中失效的问题,通过分解教师监督信号,发现参考诱导成分导致死记硬背,提出基于点互信息的参考隔离方法,在保持模型认知行为的同时提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07548 2026-06-09 cs.IR cs.AI cs.CL 新提交 82%

Evaluating Advanced Prompting on Gemini Flash for Multi-Hop Biomedical QA

评估 Gemini Flash 上的高级提示工程用于多跳生物医学问答

Ahmed Bajaber, Mohammed Alliheedi

机构 * Saudi Med AI Lab (SMAIL)(沙特医学人工智能实验室(SMAIL)) Prince Sultan University(普森国王大学) Al-Baha University(阿勒巴哈大学)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过设计多组件提示(角色扮演、多步思维链示例和格式规则),在 Gemini 2.0 Flash 上实现概念级得分0.720,显著优于基线0.565,并接近下一代模型性能,证明高级提示设计对释放LLM推理能力至关重要。

Comments 8 pages, proceedings of the BioCreative IX Challenge and Workshop (BC9) at IJCAI 2025

Journal ref Proc. BioCreative IX Workshop (BC9), IJCAI 2025, Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16492 2026-07-21 cs.CV 新提交 82%

WeedExpert-R1: Incentivizing Botanical Reasoning in MLLMs with Reinforcement Learning for Precision Weed Grounding

WeedExpert-R1:通过强化学习激励多模态大语言模型进行精准杂草定位的植物推理

Zonglin Yang, Wei-Zhen Liang, Nevin Lawrence, Xin Qiao, Benjamin Riggan, Chi-En Chiang, Fuchen Li

机构 * University of Nebraska-Lincoln(内布拉斯加大学林肯分校) Panhandle Research and Extension Center(狭长地带研究与推广中心)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究针对精准杂草控制问题,提出通过可验证奖励学习视觉基础植物推理的WeedExpert-R1模型,利用特定合成管道生成数据微调,经群体相对策略优化训练。该模型在多种杂草测试中表现优异,优于同类模型,展现开放词汇能力和跨区域部署潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05911 2026-07-08 cs.CV 新提交 82%

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

基于原始校正的渐进推理用于组合零样本学习

Ziyi Chen, Haoyan Shi, Sunhan Xu, Congyan Lang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09937 2026-06-10 cs.LG cs.AI cs.CL 新提交 82%

RKSC: Reasoning-Aware KV Cache Sharing and Confident Early Exit for Multi-Step LLM Inference

RKSC:面向多步LLM推理的感知推理的KV缓存共享与自信提前退出

Anirudh Sekar

机构 * Anirudh Sekar(安尼鲁德·塞卡)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出RKSC框架,通过注意力相似性KV共享、置信门控提前退出和推理选择性块缓存管理,消除多分支LLM推理中的结构冗余,实现平均3.008倍加速,错误率仅0.37%。

Comments Accepted to the ICML 2026 Workshop on Statistical Frameworks for Uncertainty in Agentic Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11247 2026-08-13 cs.AI cs.MA 新提交 81%

Conformity Mitigations in Large Language Models Lie on a Single Resistance-Receptivity Frontier

大语言模型中的从众效应缓解措施存在于单一的抵抗-接受边界上

Zafar Hussain, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 复杂问题求解 :reasoning(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对大语言模型的从众效应,提出抵抗-接受双维度评估,发现多数缓解措施存在此消彼长的边界,仅Reasoning可同时提升抵抗性与接受性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22870 2026-06-23 cs.CV cs.AI 新提交 81%

VideoLatent: Video-Language Learning via Latent Self-Forcing

VideoLatent: 通过潜在自强制进行视频-语言学习

Zi-Yuan Hu, Zicong Tang, Shijia Huang, Yanyang Li, Michael R. Lyu, Liwei Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Weitu AI(微图AI)

专题命中 复杂问题求解 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出VideoLatent,一种通过潜在自强制训练范式(包括潜在对齐和潜在多样性目标)进行视觉潜在推理的多模态大语言模型,仅依赖标准视频-问答三元组,在14个基准上优于现有模型,并大幅降低训练/推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 81%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04444 2026-08-06 cs.CL cs.AI 新提交 81%

D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

D²F-ReAG:面向多跳推理增强生成的动态分解与过滤

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu

机构 * Northeastern University(东北大学) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research(NiuTrans研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有检索增强生成(RAG)处理多跳问题时缺乏动态分解与有效过滤的缺陷,提出D²F-ReAG范式,通过判断根级推理可靠性自适应控制推理深度,经实验验证其处理复杂多跳问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 81%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03048 2026-08-05 cs.CL cs.AI 新提交 81%

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏