arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2603.16256 2026-03-18 cs.CV 85%

When Thinking Hurts: Mitigating Visual Forgetting in Video Reasoning via Frame Repetition

当思考带来痛苦:通过帧重复缓解视频推理中的视觉遗忘

Xiaokun Sun, Yubo Wang, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出FrameRepeat框架,通过轻量级重复评分模块和Add-One-In策略,有效增强视频推理中的视觉线索,提升模型性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23359 2026-03-18 cs.CV 85%

VideoReasonBench: Can MLLMs Perform Vision-Centric Complex Video Reasoning?

VideoReasonBench: 大规模语言模型能否进行以视觉为中心的复杂视频推理?

Yuanxin Liu, Kun Ouyang, Haoning Wu, Yi Liu, Lin Sui, Xinhao Li, Yan Zhong, Y. Charles, Xinyu Zhou, Xu Sun

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Moonshot AI Nanjing University(南京大学) School of Mathematical Sciences, Peking University(数学科学学院,北京大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 VideoReasonBench评估了基于视觉的复杂视频推理能力,发现大多数先进多模态语言模型在复杂视频推理任务上表现不佳,而增强推理能力的Gemini-2.5-Pro表现突出。

Comments Project Page: https://llyx97.github.io/video_reason_bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05551 2026-03-18 cs.IR cs.CV 82%

AutothinkRAG: Complexity-Aware Control of Retrieval-Augmented Reasoning for Image-Text Interaction

AutothinkRAG: 多模态文档问答中检索增强推理的复杂度感知控制

Jiashu Yang, Chi Zhang, Abudukelimu Wuerkaixi, Xuxin Cheng, Cao Liu, Ke Zeng, Xu Jia, Xunliang Cai

机构 * Dalian University of Technology(大连理工大学) Tsinghua University(清华大学) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 复杂问题求解 :reasoning(title,abstract);logical reasoning(abstract)

AI总结 本文提出AutoThinkRAG,通过查询复杂度路由器和感知-推理解耦架构,提升多模态文档问答的效率与鲁棒性,实验表明在DocBench和MMLongBench上准确率提升,且降低计算与成本消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16415 2026-03-18 cs.CL cs.AI cs.IR 81%

IndexRAG: Bridging Facts for Cross-Document Reasoning at Index Time

IndexRAG:在索引时间进行跨文档推理的桥梁

Zhenghua Bao, Yi Shi

机构 * Continuum AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 IndexRAG通过在索引阶段进行跨文档推理,提升多跳问答的F1得分,无需额外训练,仅需单次检索和一次LLM调用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15726 2026-03-18 cs.CL cs.AI cs.IR cs.LG 75%

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

MiroThinker-1.7 与 H1:通过验证实现重型研究代理

MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, L. Wang, L. Wang, S. Wang, X. Wang, Y. Zhang, Z. Zhang, G. Chen, L. Chen, Z. Cheng, Y. Deng, Z. Huang, D. Ng, J. Ni, Q. Ren, X. Tang, B. L. Wang, H. Wang, N. Wang, C. Wei, Q. Wu, J. Xia, Y. Xiao, H. Xu, X. Xu, C. Xue, Z. Yang, Z. Yang, F. Ye, H. Ye, J. Yu, C. Zhang, W. Zhang, H. Zhao, P. Zhu

机构 * MiroMind Team(MiroMind团队)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MiroThinker-1.7和H1,通过结构化规划和验证机制提升多步推理能力,在复杂任务中实现高效可靠的研究代理。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16440 2026-03-18 cs.LG cs.CL 62%

Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models

基于能力的压缩:迈向大语言模型中可解释性感知的预算分配

Rishaank Gupta

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于能力的压缩方法,通过能力密度图分配不同压缩预算,解决传统压缩方法中缺乏对模型组件功能编码表示的问题,证明高能力密度组件具有更低的结构冗余和更早达到相变点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05549 2026-03-18 cs.LG cs.AI cs.IR 62%

AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs

AGRAG: 面向大语言模型的高级图基检索增强生成框架

Yubo Wang, Haoyang Li, Fei Teng, Lei Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) The Hong Kong Polytechnic University Hong Kong SAR(香港理工大学(香港特别行政区))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AGRAG通过统计方法构建图结构,解决LLM幻觉问题,并采用MCMI子图生成提升推理能力,实现更全面的推理路径,提升检索增强生成效果。

Comments ICDE 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16223 2026-03-18 cs.LG 57%

Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism

双重共识:通过两阶段投票机制摆脱无监督RLVR中的虚假多数

Kaixuan Du, Meng Cao, Hang Zhang, Yukun Wang, Xiangzhou Huang, Ni Li

机构 * School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DCRL,通过两阶段共识机制生成更可靠的训练信号,提升大语言模型在复杂推理任务中的表现,避免陷入主导模式。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16192 2026-03-18 cs.CL 57%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI 57%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16458 2026-03-18 cs.NI cs.SY eess.SY 50%

Agentic AI for SAGIN Resource Management_Semantic Awareness, Orchestration, and Optimization

面向SAGIN资源管理的代理AI:语义感知、编排与优化

Linghao Zhang, Haitao Zhao, Bo Xu, Hongbo Zhu, Xianbin Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于大语言模型的代理AI框架,用于自主管理空间-空气-地面一体化网络资源,通过语义感知、意图驱动编排和自适应学习代理协作,实现动态环境下的高效资源管理。

Comments eg.: 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏