arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4991 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4991 篇

2608.14659 2026-08-18 cs.AI cs.LG cs.SE 新提交 81%

When Uncertainty Isn't Enough: An Empirical Study of Self-Correction in Code Generation

当不确定性还不够时:代码生成中自校正的实证研究

Pranav Rakasi, Maanas Lalwani, Arnav Srivastava, Arya Palanivel, Tinuade Adeleke, Ruizhe Li, Sean Wu

机构 * University of Michigan(密歇根大学) New York University(纽约大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Algoverse AI University of Aberdeen(阿伯丁大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI、cs.LG

AI总结 本研究通过实证发现,针对代码生成的不确定性估计方法难以可靠提升生成准确率,仅基于验证的自校正策略可显著提升Pass@1指标,廉价不确定性估计器仅适合作为校正循环的门控信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10444 2026-08-13 cs.CL cs.AI 版本更新 81%

From Reasoning Depth to Reasoning Breadth: Evaluating Multi-Point Associative Reasoning in Large Language Models

从推理深度到推理广度:评估大型语言模型中的多点关联推理

Si'an Xie, Jiaxun Liu, Biao Yang, Wei Yuan, Fan Yang, Tingting Gao, Ming Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Peking University(北京大学) Kuaishou Technology(快手科技)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究构建了中英双语多点关联推理基准MPAR-Bench,发现大型语言模型的推理深度未自动带来稳健的推理广度,当前基准未充分覆盖推理广度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15062 2026-08-11 cs.CL cs.AI 版本更新 81%

SAKE: Structured Agentic Knowledge Extrapolation for Complex LLM Reasoning via Reinforcement Learning

SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推

Jiashu He, Jinxuan Fan, Bowen Jiang, Ignacio Hounie, Dan Roth, Alejandro Ribeiro

机构 * University of Pennsylvania(宾夕法尼亚大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04444 2026-08-06 cs.CL cs.AI 新提交 81%

D$^2$F-ReAG: Dynamic Decomposition and Filtering for Multi-Hop Reasoning-Augmented Generation

D²F-ReAG:面向多跳推理增强生成的动态分解与过滤

Jiaoyang Li, Junhao Ruan, Shengwei Tang, Kaiyan Chang, Zhengtao Yu, Tong Xiao, Jingbo Zhu

机构 * Northeastern University(东北大学) Kunming University of Science and Technology(昆明理工大学) NiuTrans Research(NiuTrans研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对现有检索增强生成(RAG)处理多跳问题时缺乏动态分解与有效过滤的缺陷,提出D²F-ReAG范式,通过判断根级推理可靠性自适应控制推理深度,经实验验证其处理复杂多跳问题的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04007 2026-08-05 cs.CL cs.AI 新提交 81%

TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning

TurnSight:面向工具集成推理的回合级事后自蒸馏方法

Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工具集成推理中现有方法缺乏细粒度监督的问题,提出TurnSight框架,通过回合级事后自蒸馏生成可靠监督信号,在三个基准上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03048 2026-08-05 cs.CL cs.AI 新提交 81%

PI-Mem: Pushing Long-Context Reasoning to 3.6M Tokens with Parallel-Iterative Memory

PI-Mem:通过并行迭代式记忆将长上下文推理推向360万 tokens

Dawei Liu, Haixu Song, Shuang Cheng, Shijie Wang, Haozheng Hou, Kaifeng Liu, Ermo Hua, Zhonghang Yuan, Zhijie Zhong, Yuchen Fan, Biqing Qi, Bowen Zhou

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 该研究提出PI-Mem并行迭代记忆机制,在360万 tokens长上下文下,使Qwen系列模型在HotpotQA基准上较循环记忆基线实现准确率提升与推理加速,打破长上下文推理的准确率-效率权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 81%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05158 2026-08-04 cs.CL cs.AI cs.MA 版本更新 81%

Streaming Communication in Multi-Agent Reasoning

多智能体推理中的流式通信

Zhen Yang, Xiaogang Xu, Wen Wang, Cong Chen, Xander Xu, Ying-Cong Chen

机构 * HKUST(GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) ZJU(浙江大学) HKUST(香港科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出流式多智能体推理系统StreamMA,通过将推理步骤实时流式传输给下游智能体来降低延迟,并意外地提升了效果,同时首次给出流式、串行和单协议三种模式的闭式联合分析。

Comments project page: https://zhenyangcs.github.io/StreamMA-website/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新 81%

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03595 2026-07-29 cs.AI cs.CL 版本更新 81%

Controllable LLM Reasoning via Sparse Autoencoder-Based Steering

通过稀疏自编码器基于的转向实现可控的大语言模型推理

Yi Fang, Wenjie Wang, Mingfeng Xue, Boyi Deng, Fengli Xu, Dayiheng Liu, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) Zhongguancun Academy(中关村学院) Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出SAE-Steering方法,通过稀疏自编码器分解隐藏状态,实现对大语言模型推理策略的高效控制,提升推理准确率和灵活性。

Comments Accepted to the ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 81%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19398 2026-07-23 cs.AI cs.CL 新提交 81%

HyGRL: Adaptive Hybrid Graph Reasoning for Multi-Entity Questions

HyGRL:用于多实体问题的自适应混合图推理

Junyi Wang

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多实体组合问题,传统方法有局限。本文提出HyGRL框架,将文本嵌入知识图谱创建异构网络,通过模仿学习和强化学习进行自适应结构归纳推理,实验证明其在答案准确性、推理保真度等方面表现出色,成本低且推理快。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14905 2026-07-21 cs.CL cs.AI 版本更新 81%

Show Me How You Reason and I'll Tell You Who You Are: Reasoning Graphs for Robust LLM Authorship Attribution

告诉我你如何推理,我就能说出你是谁:用于可靠大语言模型作者归属的推理图

Zlata Kikteva, Artur Romazanov, Annette Hautli-Janisz, Ramon Ruiz-Dolz

机构 * University of Passau(帕绍大学) University of Dundee(邓迪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM生成文本检测和作者归属问题,此前方法易受改写等影响。本文提出利用论证挖掘管道提取推理图的图神经网络方法,在混淆攻击及新模型版本文本评估中,相比传统基线展现更强鲁棒性和泛化能力,提升了检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20039 2026-07-20 cs.AI cs.LG 81%

Separable Pathways for Causal Reasoning: How Architectural Scaffolding Enables Hypothesis-Space Restructuring in LLM Agents

因果推理的可分离路径:建筑框架如何使LLM代理重构假设空间

John Alderete, Sebastian Benthall, Connie Xu, John Xing

机构 * Simon Fraser University(西蒙弗雷泽大学) International Computer Science Institute(国际计算机科学研究所) Amigo AI

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过建筑框架使LLM代理重构假设空间,通过实验发现上下文图和动态行为在因果推理中分别提升推理质量和有效性。

Comments 24 pages, 11 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07646 2026-07-09 cs.AI cs.CL 新提交 81%

RL Post-Training Builds Compositional Reasoning Strategies

强化学习后训练构建组合推理策略

Azwar Abdulsalam, Nishil Patel, Andrew Saxe

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究强化学习后训练能否组合原始技能成高级策略,通过在可观察环境实验发现,强化学习能解决预训练模型难题,通过分阶段组合机制重组能力,组合过程可复用巩固,与拒绝微调关键差异在选择性,预训练消融表明其对组合策略出现有影响。

Comments 8 pages, 6 figures. Accepted to the 2nd Workshop on Compositional Learning at ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02504 2026-07-03 cs.CL cs.AI cs.CV 新提交 81%

Reasoning LLM Improves Speaker Recognition in Long-form TV Dramas

推理大模型提升长篇电视剧中的说话人识别

Yuxuan Li, Lingxi Xie, Xinyue Huo, Jihao Qiu, Jiacheng Shao, Pengfei Chen, Jiannan Ge, Kaiwen Duan, Qi Tian

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出DramaSR-532K大规模基准和基于推理大模型的DramaSR-LRM方法,通过多模态工具使用聚合上下文证据,显著提升长篇电视剧中说话人识别准确率,尤其对短话语效果显著。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29164 2026-06-30 cs.LG cs.AI cs.CG 81%

Invariant Reasoning Directions in Latent Trajectories of Language Models

语言模型潜在轨迹中的不变推理方向

Arun Vignesh Malarkkan, Manan Roy Choudhury, Utkarsh Byahut, Yash Ravindra Charde, Vivek Gupta, Yanjie Fu

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 发现潜在推理轨迹中存在稳定不变方向,提出TILR方法通过低秩子空间干预提升推理一致性与稳定性。

Comments 9 main text pages and 6 appendix pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24060 2026-06-23 cs.CL cs.AI 81%

Task Complexity Matters: An Empirical Study of Reasoning in LLMs for Sentiment Analysis

任务复杂性至关重要:对LLM在情感分析中推理能力的实证研究

Donghao Huang, Zhaoxia Wang

机构 * School of Computing and Information Systems, Singapore Management University(新加坡管理学院) Research and Development, Mastercard(麦star公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究通过评估7种模型家族在不同粒度的情感分析数据集上的表现,发现推理效果高度依赖任务复杂性,二分类任务性能下降,多类情感识别性能提升,且少量样本学习在多数情况下优于零样本学习。

Comments 12 pages, 1 figure, 3 tables. Accepted at PAKDD 2026

Journal ref In: Wong, R.CW., et al. Advances in Knowledge Discovery and Data Mining. PAKDD 2026. Lecture Notes in Computer Science(), vol 16600. Springer, Singapore

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07459 2026-06-17 cs.CL cs.AI 版本更新 81%

MedicalAgentsBench for Complex Medical Reasoning: Comparing Internalized Reasoning Models versus Externalized Agent-based Frameworks

MedicalAgentsBench:复杂医学推理基准——比较内化推理模型与外化智能体框架

Yanjun Shao, Xiangru Tang, Jiwoong Sohn, Jiapeng Chen, Yuxuan Liao, Jiayi Zhang, Jinyu Xiang, Fang Wu, Yilun Zhao, Chenglin Wu, Wenqi Shi, Arman Cohan, Mark Gerstein

机构 * Program in Computational Biology & Biomedical Informatics, Yale University(计算生物学与生物医学信息学项目,耶鲁大学) Department of Biomedical Informatics & Data Science, Yale University(生物医学信息学与数据科学系,耶鲁大学) Department of Computer Science, Yale University(计算机科学系,耶鲁大学) Department of Biosystems Science and Engineering, ETH Zurich(生物系统科学与工程系,苏黎世联邦理工学院) Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Bioinformatics, UT Southwestern Medical Center(生物信息学系,德克萨斯西南医学中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出MedicalAgentsBench基准(862个复杂临床问题),比较内化推理模型与外化智能体框架在医学推理中的表现,发现两者效果可叠加,最优组合为o3-mini+MDAgents(准确率35.1%)。

Comments https://github.com/gersteinlab/MedicalAgentsBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16890 2026-06-16 cs.CL cs.AI 新提交 81%

Compositional Reasoning Depth Predicts Clinical AI Failure: Empirical Evidence Consistent with Transformer Compositionality Limits in Electronic Health Record Question Answering

组合推理深度预测临床AI失败:与电子健康记录问答中Transformer组合性限制一致的实证证据

Sanjay Basu

机构 * University of California San Francisco(加州大学旧金山分校) Waymark

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究引入推理步数(hop count)作为预测大型语言模型在电子健康记录问答中失败的理论驱动指标,发现准确率随步数增加单调下降,且扩展思考未能显著改善,提示组合推理深度是跨架构的失败预测因子。

Comments 20 pages, 5 figures. Code: https://github.com/sanjaybasu/compositional-depth-clinical-ehr

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13233 2026-06-12 cs.LG cs.AI 新提交 81%

ReSET: Accurate Latency-Critical NVFP4 Reasoning via Step-Aware Temperature Scaling

ReSET: 通过步骤感知温度缩放实现精确的延迟关键型NVFP4推理

Sihwa Lee, Janghwan Lee, Donghoon Yoo, Jae Gon Kim, Hanyul Ryu, Soojung Ryu, Jungwook Choi

机构 * Hanyang University(汉阳大学) Xenoscube Korean Inc.(Xenoscube韩国公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对大型推理模型在NVFP4低精度推理中精度下降和延迟问题,提出基于推理步骤熵的温度缩放方法ReSET,并设计CUDA小M核,在多个基准上提升精度约2点,解码速度提升2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02465 2026-06-11 cs.AI cs.CV cs.LG 版本更新 81%

MentisOculi: Revealing the Limits of Reasoning with Mental Imagery

MentisOculi: 揭示心智图像推理的局限性

Jana Zeller, Thaddäus Wiedemer, Fanfei Li, Thomas Klein, Prasanna Mayilvahanan, Matthias Bethge, Felix Wichmann, Ryan Cotterell, Wieland Brendel

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MentisOculi基准,通过多步推理问题测试前沿模型利用视觉表示辅助推理的能力,发现视觉策略普遍无法提升性能,且统一多模态模型存在生成错误累积和无法利用真实可视化的问题。

Comments 9 pages, 8 figures, Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08816 2026-06-09 cs.LG cs.AI 新提交 81%

Knowledge Graphs and Reasoning LLMs for Finding Simple Yet Effective Transcriptomic Perturbation Predictors

知识图谱与推理大语言模型用于寻找简单而有效的转录组扰动预测因子

Jake Fawkes, Liam Hodgson, Jason Hartford

机构 * University College London(伦敦大学学院) University of Manchester(曼彻斯特大学) Valence Labs(Valence实验室) Recursion(Recursion公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 利用知识图谱的K近邻方法在基因敲除扰动预测中表现优异,结合强化学习优化的LLM可达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03106 2026-06-09 cs.CL cs.AI 81%

Critique-GRPO: Advancing LLM Reasoning with Natural Language and Numerical Feedback

Critique-GRPO:通过自然语言和数值反馈提升大语言模型推理能力

Xiaoying Zhang, Yipeng Zhang, Hao Sun, Kaituo Feng, Chaochao Lu, Chao Yang, Helen Meng

机构 * HCCL, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能研究中心,香港,中国) University of Cambridge, Cambridge, United Kingdom(剑桥大学,剑桥,英国) MMLab, The Chinese University of Hong Kong, Hong Kong, China(香港中文大学人工智能实验室,香港,中国) Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室,上海,中国)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Critique-GRPO框架,结合自然语言和数值反馈提升LLM推理能力,实验显示其在多个任务中优于传统方法,显著提升推理性能。

Comments Accepted by ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04823 2026-06-04 cs.AI cs.CL cs.MA 81%

R-APS: Compositional Reasoning and In-Context Meta-Learning for Constrained Design via Reflective Adversarial Pareto Search

R-APS:基于反思性对抗帕累托搜索的组合推理与上下文元学习用于约束设计

João Pedro Gandarela, Thiago Rios, Stefan Menzel, André Freitas

机构 * Idiap Research Institute(Idiap研究 institute) École Polytechnique Fédérale de Lausanne(瑞士联邦理工学院) Honda Research Institute Europe(本田欧洲研究机构) Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标志物中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出R-APS方法,通过推理模式分解、分阶段组合推理、敏感性引导对抗测试和元归纳规则提取,联合解决LLM在代理设置中的错误传播、最坏情况扰动和知识失效问题,在平面机构合成任务上实现更紧的鲁棒性证书和更快的迭代速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28829 2026-06-04 cs.CL cs.AI cs.CY 81%

Aryabhata 2: Scaling Reinforcement Learning for Advanced STEM Reasoning

Aryabhata 2:扩展强化学习以提升高级STEM推理能力

Ritvik Rastogi, Vishal Singh, Tejas Chaudhari, Sandeep Varma

机构 * PhysicsWallah

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出Aryabhata 2,一个通过强化学习后训练在竞争性STEM考试中提升推理能力的语言模型,在JEE、NEET等基准上超越基础模型且输出token减少高达64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12329 2026-06-04 cs.CL cs.AI 81%

Speculative Thinking: Enhancing Small-Model Reasoning with Large Model Guidance at Inference Time

推测性思考:在推理时利用大模型指导增强小模型推理能力

Wang Yang, Xiang Yue, Vipin Chaudhary, Xiaotian Han

机构 * Case Western Reserve University(凯斯西储大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出一种无需训练的推测性思考框架,通过让大推理模型在推理层面引导小模型,在提升小模型推理准确率的同时缩短输出长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02465 2026-06-02 cs.CL cs.AI 81%

Learning When to Translate for Multilingual Reasoning

学习何时翻译以实现多语言推理

Deokhyung Kang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence(人工智能研究生院) Department of Computer Science & Engineering(计算机科学与工程系) POSTECH

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Luar框架,通过强化学习训练推理语言模型在直接理解不可靠时选择性调用翻译,从而缩小多语言推理差距。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01991 2026-06-02 cs.AI cs.CL cs.CY 81%

SafeMCP: Proactive Power Regulation for LLM Agent Defense via Environment-Grounded Look-Ahead Reasoning

SafeMCP:基于环境接地前瞻推理的LLM智能体防御主动功率调节

Lichao Wang, Zhaoxing Ren, Tianzhuo Yang, Jiaming Ji, Chi Harold Liu, Yaodong Yang, Juntao Dai

机构 * Beijing Institute of Technology(北京理工大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体因动作空间扩大而面临功率寻求风险,提出SafeMCP服务器端防御插件,通过内部世界模型进行前瞻推理,实现主动工具过滤和即时干预两级防御,在保持智能体效用的同时有效降低风险。

Comments Accepted to the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.21762 2026-06-01 cs.CL cs.AI 81%

Reasoning-Intensive Regression

推理密集型回归

Diane Tchuindjo, Omar Khattab

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对推理密集型回归任务,提出MENTAT方法,结合批量反思提示优化与神经集成学习,在基准测试中相比基线提升高达65%。

详情

展开后加载摘要…

URL PDF HTML 收藏