arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 105 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 11 篇

2603.15726 2026-03-18 cs.CL cs.AI cs.IR cs.LG 75%

MiroThinker-1.7 & H1: Towards Heavy-Duty Research Agents via Verification

MiroThinker-1.7 与 H1:通过验证实现重型研究代理

MiroMind Team, S. Bai, L. Bing, L. Lei, R. Li, X. Li, X. Lin, E. Min, L. Su, B. Wang, L. Wang, L. Wang, S. Wang, X. Wang, Y. Zhang, Z. Zhang, G. Chen, L. Chen, Z. Cheng, Y. Deng, Z. Huang, D. Ng, J. Ni, Q. Ren, X. Tang, B. L. Wang, H. Wang, N. Wang, C. Wei, Q. Wu, J. Xia, Y. Xiao, H. Xu, X. Xu, C. Xue, Z. Yang, Z. Yang, F. Ye, H. Ye, J. Yu, C. Zhang, W. Zhang, H. Zhao, P. Zhu

机构 * MiroMind Team(MiroMind团队)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出MiroThinker-1.7和H1,通过结构化规划和验证机制提升多步推理能力,在复杂任务中实现高效可靠的研究代理。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16440 2026-03-18 cs.LG cs.CL 62%

Capability-Guided Compression: Toward Interpretability-Aware Budget Allocation for Large Language Models

基于能力的压缩:迈向大语言模型中可解释性感知的预算分配

Rishaank Gupta

机构 * Independent Researcher(独立研究者)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出基于能力的压缩方法,通过能力密度图分配不同压缩预算,解决传统压缩方法中缺乏对模型组件功能编码表示的问题,证明高能力密度组件具有更低的结构冗余和更早达到相变点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05549 2026-03-18 cs.LG cs.AI cs.IR 62%

AGRAG: Advanced Graph-based Retrieval-Augmented Generation for LLMs

AGRAG: 面向大语言模型的高级图基检索增强生成框架

Yubo Wang, Haoyang Li, Fei Teng, Lei Chen

机构 * The Hong Kong University of Science(香港科学与技术大学) The Hong Kong Polytechnic University Hong Kong SAR(香港理工大学(香港特别行政区))

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AGRAG通过统计方法构建图结构,解决LLM幻觉问题,并采用MCMI子图生成提升推理能力,实现更全面的推理路径,提升检索增强生成效果。

Comments ICDE 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16223 2026-03-18 cs.LG 57%

Dual Consensus: Escaping from Spurious Majority in Unsupervised RLVR via Two-Stage Vote Mechanism

双重共识:通过两阶段投票机制摆脱无监督RLVR中的虚假多数

Kaixuan Du, Meng Cao, Hang Zhang, Yukun Wang, Xiangzhou Huang, Ni Li

机构 * School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 本文提出DCRL,通过两阶段共识机制生成更可靠的训练信号,提升大语言模型在复杂推理任务中的表现,避免陷入主导模式。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16192 2026-03-18 cs.CL 57%

Structured Semantic Cloaking for Jailbreak Attacks on Large Language Models

结构化语义遮蔽用于大型语言模型的对抗攻击

Xiaobing Sun, Perry Lam, Shaohua Li, Zizhou Wang, Rick Siow Mong Goh, Yong Liu, Liangli Zhen

机构 * Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR), Singapore(高性能计算研究所(IHPC),科技研究局(A*STAR),新加坡) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(信息技术与设计支柱,新加坡科技设计大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出结构化语义遮蔽(S2C)框架,通过重构恶意意图的多步骤推理过程,提升对抗攻击成功率,同时分析遮蔽程度与输入可恢复性之间的权衡。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15921 2026-03-18 cs.SE cs.AI 57%

VIBEPASS: Can Vibe Coders Really Pass the Vibe Check?

VIBEPASS:振动编码器真的能通过振动检查吗?

Srijan Bansal, Jiao Fangkai, Yilun Zhou, Austin Xu, Shafiq Joty, Semih Yavuz

机构 * Salesforce AI Research(Salesforce AI研究院) Nanyang Technological University(南洋理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了振动编码器在自主软件工程中的能力,发现故障定位推理是瓶颈,而非代码生成或测试有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16458 2026-03-18 cs.NI cs.SY eess.SY 50%

Agentic AI for SAGIN Resource Management_Semantic Awareness, Orchestration, and Optimization

面向SAGIN资源管理的代理AI:语义感知、编排与优化

Linghao Zhang, Haitao Zhao, Bo Xu, Hongbo Zhu, Xianbin Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出基于大语言模型的代理AI框架,用于自主管理空间-空气-地面一体化网络资源,通过语义感知、意图驱动编排和自适应学习代理协作,实现动态环境下的高效资源管理。

Comments eg.: 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 29 篇

2602.06533 2026-03-18 cs.AI cs.CL 84%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV 82%

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16112 2026-03-18 cs.CL cs.AI cs.CE 81%

ASDA: Automated Skill Distillation and Adaptation for Financial Reasoning

ASDA:自动化技能蒸馏与适应用于金融推理

Tik Yu Yim, Wenting Tan, Sum Yee Chan, Tak-Wah Lam, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ASDA通过迭代误差纠正学习生成结构化技能 artifact,无需修改模型权重,在金融推理任务中实现显著提升,优于无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14761 2026-03-18 cs.AI cs.CL 81%

BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

BrainBench:揭示大型语言模型在常识推理上的差距

Yuzhe Tang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BrainBench通过100道脑筋急转弯问题,揭示LLM在常识推理上的不足,评估八种前沿模型,发现其推理存在随机性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 79%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 79%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10477 2026-03-18 cs.CV cs.AI cs.CY 79%

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

城市社会语义分割与视觉-语言推理

Yu Wang, Yi Wang, Rui Dai, Yujie Wang, Kaikui Liu, Xiangxiang Chu, Yansheng Li

机构 * Wuhan University(武汉大学) Amap, Alibaba Group(阿里巴巴集团地图部门)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SocioReasoner框架,通过视觉-语言推理实现城市社会语义分割,引入SocioSeg数据集,实验显示优于现有方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23252 2026-03-18 cs.LG 79%

NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning

NanoFlux:对抗性双语言模型评估与蒸馏用于多领域推理

Raviteja Anantha, Soheil Hor, Teodor Nicola Antoniu, Layne C. Price

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 NanoFlux通过对抗性生成训练数据提升大语言模型推理能力,其生成数据在数学、科学和医学领域均优于传统微调方法,且计算成本降低3-14倍。

Comments Preprint version 3; Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 79%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15015 2026-03-18 cs.MA 78%

MetaCrit: A Critical Thinking Framework for Self-Regulated LLM Reasoning

MetaCrit: 一种用于自主LLM推理的批判性思维框架

Xinmeng Hou, Ziting Chang, Zhouquan Lu, Chen Wenli, Liang Wan, Wei Feng, Hai Hu, Qing Guo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出MetaCrit框架,通过多智能体机制提升LLM在多跳问题中的推理能力,增强逻辑严谨性并消除有毒输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 78%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 78%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16495 2026-03-18 cs.AI 77%

ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation

ExpressMind:一种用于高速公路运营的多模态预训练大语言模型

Zihe Wang, Yihuan Wang, Haiyang Yu. Zhiyong Cui, Xiaojian Liao, Chengcheng Wang, Yonglin Tian, Yongxin Tong

机构 * Beihang University(北航) Shandong Hi-speed Group Co., Ltd(山东高速集团有限公司) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出ExpressMind,一种针对高速公路运营的多模态预训练大语言模型,通过构建全栈数据集和双层预训练方法,提升事件检测、安全响应生成和复杂交通分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI 73%

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV 70%

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15803 2026-03-18 cs.LG 70%

Mask Is What DLLM Needs: A Masked Data Training Paradigm for Diffusion LLMs

掩码是DLLM所需:一种用于扩散语言模型的掩码数据训练范式

Linrui Ma, Yufei Cui, Kai Han, Yunhe Wang

机构 * Noah’s Ark Lab, Huawei Montreal, Canada & Beijing, China(华为蒙特利尔实验室及北京)

专题命中 推理评测 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出信息密度驱动的智能噪声调度器,通过提取信息密集 hubs 并应用互补优先级掩码,将单个训练实例解耦为相互增强的推理和语法样本,提升模型在代码和数学推理任务中的准确率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21991 2026-03-18 cs.CV cs.AI cs.CL cs.LG 67%

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

ERGO:高效高分辨率视觉理解用于视觉-语言模型

Jewon Lee, Wooksu Shin, Seungmin Yang, Ki-Ung Song, DongUk Lim, Jaeyeon Kim, Tae-Ho Kim, Bo-Kyeong Kim

机构 * Nota Inc.(Nota公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ERGO提出一种两阶段'粗到细'推理流程,通过下采样图像识别任务相关区域,再以全分辨率裁剪处理,从而在降低计算成本的同时保留必要的细粒度视觉细节,提升视觉-语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16557 2026-03-18 cs.AI cs.CL 62%

BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs

BenchPreS:面向持久内存LLM的上下文感知个性化偏好选择性基准

Sangyeon Yoon, Sunkyoung Kim, Hyesoo Hong, Wonje Jeung, Yongil Kim, Wooseok Seo, Heuiyeen Yeen, Albert No

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BenchPreS评估持久内存LLM在不同通信场景中对用户偏好是否恰当应用,发现前沿模型在上下文敏感应用上存在不足,偏好遵循性强的模型易出现过度应用,推理能力和提示防御无法彻底解决此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16124 2026-03-18 cs.SE cs.AI cs.CL 62%

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03378 2026-03-18 cs.LG cs.AI 62%

AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis

AOI: 将失败轨迹转化为自主云诊断的训练信号

Pei Yang, Wanyi Chen, Asuka Yuxi Zheng, Xueqian Li, Xiang Li, Haoqin Tu, Jie Xiao, Yifan Pang, Dongdong Zhang, Fuqiang Li, Alfred Long, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient Soochow University(苏州大学) UC Santa Cruz Georgia Institute of Technology(佐治亚理工学院) University College London(伦敦大学学院) WeJoy ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AOI通过结构化轨迹学习框架,在安全约束下实现自动化操作,结合可训练诊断系统、读写分离执行架构和失败轨迹闭环演进器,提升云诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22223 2026-03-18 cs.LG cs.AI cs.CR cs.NI 62%

ReGAIN: Retrieval-Grounded AI Framework for Network Traffic Analysis

ReGAIN:基于检索的网络流量分析人工智能框架

Shaghayegh Shajarian, Kennedy Marsh, James Benson, Sajad Khorsandroo, Mahmoud Abdelsalam

机构 * Computer Science(计算机科学) North Carolina A\&T State University(北卡罗来纳A&T州立大学) Institute for Cyber Security(网络安全研究所) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReGAIN结合流量摘要、检索增强生成和大语言模型推理,实现透明准确的网络流量分析,通过多阶段框架提升安全性和性能,验证结果显示其在不同攻击类型中准确率高达95.95%-98.82%。

Comments Accepted to ICNC 2026. This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 62%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏