arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4999 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 4999 篇

2604.05620 2026-04-08 cs.CV cs.AI 79%

Semantic-Topological Graph Reasoning for Language-Guided Pulmonary Screening

语义-拓扑图推理用于语言引导的肺部筛查

Chenyu Xue, Yiran Liu, Mian Zhou, Jionglong Su, Zhixiang Lu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University College London(伦敦大学学院) University of Liverpool(利物浦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出语义-拓扑图推理框架,结合大语言模型与视觉基础模型,解决临床报告语义模糊和低对比度扫描的解歧问题,实现高精度肺部筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05477 2026-04-08 cs.CL 79%

Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction

不要盲目行动:通过动作-效果验证和自我修正实现鲁棒的GUI自动化

Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu, Xinran He, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang

机构 * Beijing University of Technology(北京工业大学) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.CL

AI总结 本文提出VeriGUI框架,通过动作-效果验证和自我修正机制,解决GUI自动化中环境噪声导致的失败问题,提升恢复性能。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04255 2026-04-07 cs.LG cs.CR 79%

Towards Unveiling Vulnerabilities of Large Reasoning Models in Machine Unlearning

面向揭示大规模推理模型在机器反向学习中的漏洞

Aobo Chen, Chenxu Zhao, Chenglin Miao, Mengdi Huai

机构 * Iowa State University(爱荷华州立大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文研究大规模推理模型在机器反向学习中的安全漏洞,提出一种能生成误导性推理轨迹的攻击方法,并通过白盒和黑盒实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04208 2026-04-07 cs.LG 79%

Towards Agentic Defect Reasoning: A Graph-Assisted Retrieval Framework for Laser Powder Bed Fusion

迈向代理缺陷推理:一种用于激光粉末床融合的图辅助检索框架

Muhammad Rizwan Awan, Volker Pickert, Muhammad Waqar Ashraf, Saleh Ali, Farshid Mahmouditabar, Shafiq Odhano

机构 * Department of Electrical and Electronic Engineering, The Newcastle University(纽卡斯尔大学电气与电子工程系) The Sargent Centre for Process Systems Engineering, Department of Chemical Engineering, University College London(伦敦大学学院化学工程系萨金特过程系统工程中心)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种图辅助检索框架,用于激光粉末床融合中的缺陷推理,通过构建知识图谱实现参数与缺陷之间的可解释路径识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11572 2026-04-07 cs.CY cs.AI 79%

Implicit Bias-Like Patterns in Reasoning Models

推理模型中的隐性偏见模式

Messi H. J. Lee, Calvin K. Lai

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Rutgers University(罗格斯大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究推理模型在处理关联不兼容任务时消耗更多推理token,揭示其隐性偏见特征及模型内部推理内容的影响

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03074 2026-04-06 eess.AS cs.CL cs.SD 79%

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR

Speaker-Reasoner: 通过扩展交互轮次和推理模式实现时间戳化的说话者归属ASR

Zhennan Lin, Shuai Wang, Zhaokai Sun, Pengyuan Xie, Chuan Xie, Jie Liu, Qiang Zhang, Lei Xie

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Shanghai Lingguang Zhaxian Technology(上海灵光乍现科技)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Speaker-Reasoner,一种端到端的语音大语言模型,通过迭代分析音频结构和自主预测时间边界,提升了多说话人对话的转录和理解能力,尤其在处理重叠语音和复杂轮次转换方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02230 2026-04-03 cs.AI 79%

Answering the Wrong Question: Reasoning Trace Inversion for Abstention in LLMs

回答错误的问题:用于LLMs中退避的推理轨迹逆向

Abinitha Gourabathina, Inkit Padhi, Manish Nagireddy, Subhajit Chaudhury, Prasanna Sattigeri

机构 * MIT(麻省理工学院) IBM Research(IBM研究院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出轨迹逆向方法,通过分析模型推理轨迹来改进LLMs的退避能力,实验表明其在多个数据集上显著提升退避性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01600 2026-04-03 cs.AI 79%

MM-ReCoder: Advancing Chart-to-Code Generation with Reinforcement Learning and Self-Correction

MM-ReCoder:通过强化学习和自我校正推进图表到代码生成

Zitian Tang, Xu Zhang, Jianbo Yuan, Yang Zou, Varad Gunjal, Songyao Jiang, Davide Modolo

机构 * Brown University(布朗大学) Amazon AGI(亚马逊AGI)

专题命中 复杂问题求解 :self-correction(title,abstract);分类 cs.AI

AI总结 MM-ReCoder通过强化学习和自我校正机制提升图表到代码生成能力,其两阶段多轮自我校正策略基于Group Relative Policy Optimization,提升代码准确性和可执行性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07995 2026-04-03 cs.IR cs.AI 79%

DIVER: A Multi-Stage Approach for Reasoning-intensive Information Retrieval

DIVER:一种用于推理密集型信息检索的多阶段方法

Duolin Sun, Meixiu Long, Dan Yang, Junjie Wang, Yecheng Luo, Yue Shen, Jian Wang, Hualei Zhou, Chunxiao Guo, Peng Wei, Jiahai Wang, Jinjie Gu

机构 * Ant Group(蚂蚁集团) Sun Yat-sen University(中山大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 DIVER通过多阶段流程提升推理密集型信息检索性能,包含文档预处理、查询扩展、检索和重排序四个环节,有效应对需要抽象推理和多步推理的复杂查询。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00818 2026-04-01 cs.AI cs.CV 79%

Med-CMR: A Fine-Grained Benchmark Integrating Visual Evidence and Clinical Logic for Medical Complex Multimodal Reasoning

Med-CMR:一个整合视觉证据和临床逻辑的细粒度基准,用于医疗复杂多模态推理

Haozhen Gong, Xiaozhong Ji, Yuansen Liu, Wenbin Wu, Xiaoxiao Yan, Jingjing Liu, Kai Wu, Jiazhen Pan, Bailiang Jian, Jiangning Zhang, Xiaobin Hu, Hongwei Bran Li

机构 * National University of Singapore(新加坡国立大学) Nanjing University(南京大学) Tongji University(同济大学) Ruijin Hospital(瑞金医院) Technical University of Munich(慕尼黑工业大学) Zhejiang University(浙江大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 Med-CMR通过细粒度分解医疗多模态推理能力,设计挑战性任务并覆盖广泛高质量数据,评估18种先进大语言模型,发现GPT-5在多项选择题和开放性评分中表现最佳,但专业医疗大语言模型并不总能超越强通用模型,长尾泛化成为主要失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08115 2026-04-01 cs.AI 79%

TeamMedAgents: Pareto-Efficient Multi-Agent Medical Reasoning Through Teamwork Theory

TeamMedAgents: 通过团队理论实现帕累托高效多智能体医疗推理

Pranav Pushkar Mishra, Mohammad Arvan, Mohan Zalake

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 TeamMedAgents基于团队理论构建模块化多智能体框架,通过共享心理模型、团队领导、团队导向等机制,提升医疗推理效率,实现帕累托效率前沿提升,并在低token成本下取得竞争性准确率。

Comments 19 pages, 6 figure, 12 tables, 2 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27376 2026-03-31 cs.HC cs.AI 79%

Where Does AI Leave a Footprint? Children's Reasoning About AI's Environmental Costs

AI留下什么足迹?儿童对AI环境成本的推理

Aayushi Dangol, Robert Wolfe, Nisha Devasia, Mitsuka Kiyohara, Jason Yip, Julie A. Kientz

机构 * University of Washington(华盛顿大学) Rutgers University(罗格斯大学) University of Toronto(多伦多大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究通过Ecoprompt系统帮助儿童理解AI的环境影响,揭示其对AI使用的社会与环境权衡及责任感的认知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27335 2026-03-31 cs.CL 79%

PubMed Reasoner: Dynamic Reasoning-based Retrieval for Evidence-Grounded Biomedical Question Answering

PubMed Reasoner: 基于动态推理的证据导向生物医学问答检索

Yiqing Zhang, Xiaozhong Liu, Fabricio Murai

机构 * PayPal Worcester Polytechnic Institute(伍斯特理工学院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 PubMed Reasoner通过动态推理机制提升生物医学问答的准确性与证据可靠性,采用三阶段框架优化检索过程并生成有据可查的回答。

Comments 20 pages; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27226 2026-03-31 cs.CL 79%

Rethinking Easy-to-Hard: Limits of Curriculum Learning in Post-Training for Deductive Reasoning

重新思考易到难:在后训练中课程学习在演绎推理中的局限性

Maximilian Mordig, Andreas Opedal, Weiyang Liu, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Tübingen(马克斯·普朗克智能系统研究所,图宾根) ETH Zürich(苏黎世联邦理工学院) The Chinese University of Hong Kong(香港中文大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究系统评估了课程学习在LLM后训练中的影响,发现基于难度的训练顺序在准确性及响应长度上无显著优势,挑战了课程学习在演绎推理中的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25848 2026-03-31 cs.CV cs.AI 79%

More Thought, Less Accuracy? On the Dual Nature of Reasoning in Vision-Language Models

更多思考,更少准确性?关于视觉-语言模型中推理的双重性质

Xinyu Tian, Shu Zou, Zhaoyuan Yang, Mengqi He, Fabian Waschkowski, Lukas Wesemann, Peter Tu, Jing Zhang

机构 * Australian National University(澳大利亚国立大学) University of Melbourne(墨尔本大学) GE Research(GE全球研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示了视觉-语言模型中推理的双重性质:虽然增强了逻辑推理能力,但可能导致感知基础能力下降,通过提出VAPO方法改进了模型对视觉信息的依赖。

Comments Accepted to ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26348 2026-03-30 cs.CV cs.AI 79%

Reflect to Inform: Boosting Multimodal Reasoning via Information-Gain-Driven Verification

反思以获取信息:通过信息增益驱动的验证提升多模态推理

Shuai Lv, Chang Liu, Feng Tang, Yujie Yuan, Aojun Zhou, Kui Zhang, Xi Yang, Yangqiu Song

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Foundation Model Department(华为基础模型部) The Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VRE框架,通过信息增益驱动的自我进化训练,提升多模态大语言模型的推理准确性和感知可靠性,减少幻觉,尤其在长链任务中效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08222 2026-03-30 cs.AI 79%

Selection, Reflection and Self-Refinement: Revisit Reasoning Tasks via a Causal Lens

选择、反思与自我完善:通过因果视角重新审视推理任务

Yunlong Deng, Boyang Sun, Yan Li, Lingjing Kong, Zeyu Tang, Kun Zhang, Guangyi Chen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文从因果视角重新审视推理任务,将其视为选择机制,通过引入潜变量反馈提升对潜在依赖关系的学习,显著提升了Sudoku和Maze任务的推理准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16507 2026-03-27 cs.AI cs.IR 79%

Agentic RAG with Knowledge Graphs for Complex Multi-Hop Reasoning in Real-World Applications

具有知识图谱的代理RAG用于现实世界应用中的复杂多跳推理

Jean Lelong, Adnane Errazine, Annabelle Blangero

机构 * Ekimetrics

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 INRAExplorer通过多工具架构和知识图谱实现复杂多跳推理,提升专业领域知识交互能力。

Comments ECAI 2025 demo track, 4 pages

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, vol. 413, pp. 5163-5166, IOS Press

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22754 2026-03-25 cs.CL 79%

PRISM: A Dual View of LLM Reasoning through Semantic Flow and Latent Computation

PRISM:通过语义流和潜在计算双重视角分析LLM推理

Ruidi Chang, Jiawei Zhou, Hanjie Chen

机构 * Rice University(里士大学) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 PRISM通过同时分析推理步骤和层的语义流与潜在计算,揭示LLM推理过程中的系统性模式,展示失败轨迹易陷入无效验证循环并转向不同模式,为分析LLM推理过程提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17963 2026-03-25 cs.CL 79%

Extracting and Following Paths for Robust Relational Reasoning with Large Language Models

基于大语言模型的稳健关系推理路径提取与追踪

Ge Zhang, Mohammad Ali Alomrani, Hongjian Gu, Jiaming Zhou, Yaochen Hu, Bin Wang, Qun Liu, Mark Coates, Yingxue Zhang, Jianye Hao

机构 * Huawei Technologies Canada(华为技术加拿大公司) Huawei Technologies(华为技术) McGill University(麦吉尔大学) Mila - Québec AI Institute(魁北克人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Path-of-Thoughts框架,通过图提取、路径识别和推理三个阶段解决关系推理问题,在四个数据集上超越现有方法,无需微调或大量LLM调用,且对LLM提取错误和输入模糊更具鲁棒性。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21719 2026-03-24 cs.CL 79%

Probing How Scalable Table Data Enhances General Long-Context Reasoning

探究表格数据如何提升长上下文推理的可扩展性

Huaibing Xie, Guoliang Zhao, Yang Liu, Shihan Dou, Siming Huang, Yanling Xiao, Shaolei Wang, Yiting Liu, Cheng Zhang, Shaofan Liu, Pluto Zhou

机构 * Large Language Model Department, Tencent(腾讯大语言模型部门) Xi'an Jiaotong University, Xi'an, China(西安交通大学) Fudan University, Shanghai, China(复旦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究表格数据对长上下文推理的增强作用,通过分析表格依赖结构揭示周期性非消失依赖,并提出TableLong框架提升推理能力,实验显示在多个基准上提升8.24%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21522 2026-03-24 cs.SE cs.AI 79%

Efficient Failure Management for Multi-Agent Systems with Reasoning Trace Representation

多代理系统中基于推理轨迹表示的高效故障管理

Lingzhe Zhang, Tong Jia, Mingyu Wang, Weijie Hong, Chiming Duan, Minghua He, Rongqian Wang, Xi Peng, Meiling Wang, Gong Zhang, Renhai Chen, Ying Li

机构 * Peking University(北京大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出EAGER框架,通过无监督对比学习编码代理内部推理和协调,实现实时故障检测与缓解,提升多代理系统可靠性。

Comments Accepted by FSE'26-IVR

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23667 2026-03-24 cs.AI 79%

Formula-R1: Incentivizing LLM Reasoning over Complex Tables with Numerical Computation via Formula-Driven Reinforcement Learning

Formula-R1:通过公式驱动强化学习激励LLM对复杂表格进行数值计算的推理

Lang Cao, Jingxian Xu, Hanbing Liu, Jinyu Wang, Mengyu Zhou, Haoyu Dong, Shi Han, Dongmei Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Nankai University(南开大学) Tsinghua University(清华大学) Shandong University(山东大学) Microsoft Research(微软研究院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出Formula-R1,通过公式驱动强化学习框架提升LLM对复杂表格的推理能力,尤其在多步数值计算任务中表现优异,且优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00479 2026-03-19 cs.AI 79%

Aligning Probabilistic Beliefs under Informative Missingness: LLM Steerability in Clinical Reasoning

在信息缺失下对概率信念进行对齐:临床推理中的LLM可引导性

Yuta Kobayashi, Vincent Jeanselme, Shalmali Joshi

机构 * Department of Biomedical Informatics(生物医学信息学系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文研究LLM能否利用信息性缺失进行预测推理,通过分析三种提示方法发现,尽管结构引导和上下文学习可提升概率对齐,但需精心干预才能利用信息性缺失。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13934 2026-03-17 cs.IR cs.AI 79%

Iterative Semantic Reasoning from Individual to Group Interests for Generative Recommendation with LLMs

基于个体到群体利益的迭代语义推理用于LLM生成推荐

Xiaofei Zhu, Jinfei Chen, Feiyang Yuan, Zhou Yang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ISRF框架,通过三次步骤实现从个体到群体的语义推理,提升生成推荐的准确性与全面性。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11631 2026-03-13 cs.AI cs.CV 79%

VisDoT : Enhancing Visual Reasoning through Human-Like Interpretation Grounding and Decomposition of Thought

VisDoT : 通过类人解释 grounding 和思维分解增强视觉推理

Eunsoo Lee, Jeongwoo Lee, Minki Hong, Jangho Choi, Jihie Kim

机构 * Department of Computer Science and Artificial Intelligence, Dongguk University(东国大学计算机科学与人工智能系) Department of Electronics and Electrical Engineering, Dongguk University(东国大学电子与电气工程系)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 VisDoT 通过类人解释 grounding 和思维分解提升视觉推理,显著提升图表问答和开放领域视觉问答性能。

Comments 30 pages, 21 figures, EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08317 2026-03-11 cs.CL 79%

Automatic Paper Reviewing with Heterogeneous Graph Reasoning over LLM-Simulated Reviewer-Author Debates

基于异构图推理的自动论文评审:LLM模拟的评审者-作者辩论

Shuaimin Li, Liyang Fan, Yufang Lin, Zeyang Li, Xian Wei, Shiwen Ni, Hamid Alinejad-Rokny, Min Yang

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 ReViewGraph通过异构图推理分析LLM模拟的评审者-作者辩论,提升论文评审的准确性和细致程度。

Journal ref AAAI-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07316 2026-03-10 cs.AI 79%

FinSheet-Bench: From Simple Lookups to Complex Reasoning, Where LLMs Break on Financial Spreadsheets

FinSheet-Bench:从简单查找至复杂推理,LLMs在金融表格中表现不佳

Jan Ravnik, Matjaž Ličen, Felix Bührmann, Bithiah Yuan, Felix Stinson, Tanvi Singh

机构 * Qubera AG(Qubera公司) University of Zurich(苏黎世大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 FinSheet-Bench通过合成数据评估LLM在复杂财务表格任务中的表现,揭示了LLM在结构化数据处理上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06503 2026-03-09 cs.CL 79%

Beyond Rows to Reasoning: Agentic Retrieval for Multimodal Spreadsheet Understanding and Editing

超越行到推理:面向多模态电子表格理解与编辑的智能检索

Anmol Gulati, Sahil Sen, Waqar Sarguroh, Kevin Paul

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 BRTR通过迭代工具调用框架实现多模态电子表格的端到端理解与编辑,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16069 2026-03-09 cs.SE cs.LG 79%

The Limits of Long-Context Reasoning in Automated Bug Fixing

长上下文推理在自动化Bug修复中的局限性

Ravi Raju, Mengmeng Ji, Shubhangi Upasani, Bo Li, Urmish Thakker

机构 * SambaNova Systems(SambaNova系统)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.LG

AI总结 本研究发现长上下文推理在自动化Bug修复中存在显著局限,现有模型在长上下文下的表现远低于预期。

Comments Accepted to ICLR 2026 ICBINB workshop

详情

展开后加载摘要…

URL PDF HTML 收藏