arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-18 至 2026-03-18 共收录 29 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 29 篇

2602.06533 2026-03-18 cs.AI cs.CL 84%

LogicSkills: A Structured Benchmark for Formal Reasoning in Large Language Models

LogicSkills: 一个用于大语言模型形式推理的结构化基准

Brian Rabern, Philipp Mondorf, Barbara Plank

机构 * Niche, Inc.(Niche公司) Oregon State University – Cascades(俄勒冈州立大学-卡斯卡德分校) MaiNLP Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicSkills基准,评估大语言模型在形式符号化、反例构造和有效性评估三项核心逻辑技能中的表现,揭示高任务准确率可能掩盖核心技能弱点。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16189 2026-03-18 cs.CV 82%

Reliable Reasoning in SVG-LLMs via Multi-Task Multi-Reward Reinforcement Learning

通过多任务多奖励强化学习实现SVG-LLMs的可靠推理

Haomin Wang, Qi Wei, Qianli Ma, Shengyuan Ding, Jinhui Yin, Kai Chen, Hongjie Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 本文提出CTRL-S框架,通过多任务多奖励优化提升SVG生成的结构连贯性和视觉保真度,实验表明其在任务成功率和SVG代码质量上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16112 2026-03-18 cs.CL cs.AI cs.CE 81%

ASDA: Automated Skill Distillation and Adaptation for Financial Reasoning

ASDA:自动化技能蒸馏与适应用于金融推理

Tik Yu Yim, Wenting Tan, Sum Yee Chan, Tak-Wah Lam, Siu Ming Yiu

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 ASDA通过迭代误差纠正学习生成结构化技能 artifact,无需修改模型权重,在金融推理任务中实现显著提升,优于无训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14761 2026-03-18 cs.AI cs.CL 81%

BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

BrainBench:揭示大型语言模型在常识推理上的差距

Yuzhe Tang

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 BrainBench通过100道脑筋急转弯问题,揭示LLM在常识推理上的不足,评估八种前沿模型,发现其推理存在随机性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16463 2026-03-18 cs.AI cs.HC 79%

Follow the Clues, Frame the Truth: Hybrid-evidential Deductive Reasoning in Open-Vocabulary Multimodal Emotion Recognition

循证推断,还原真相:面向开放词汇多模态情感识别的混合证据推理

Yu Liu, Lei Zhang, Haoxun Li, Hanlei Shi, Yuxuan Ding, Leyuan Qu, Taihao Li

机构 * Hangzhou Institute for Advanced Study, University of Chinese Academy of Sciences, Hangzhou, China(杭州高等研究 institute,中国科学院大学,杭州,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出HyDRA架构,通过混合证据推理解决多模态情感识别中的歧义问题,通过强化学习优化推理过程,提升在复杂场景下的识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16445 2026-03-18 cs.AI 79%

Visual Distraction Undermines Moral Reasoning in Vision-Language Models

视觉干扰削弱了视觉语言模型中的道德推理

Xinyi Yang, Chenheng Xu, Weijun Hong, Ce Mo, Qian Wang, Fang Fang, Yixin Zhu

机构 * Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Yuanpei College, Peking University(北京大学元培学院) Department of Psychology, Sun Yat-sen University(中山大学心理学系) State Key Lab of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京大学行为与心理健康北京市重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究揭示视觉输入会改变视觉语言模型的道德决策,超越文本安全机制,提出多模态基准MDS以分析视觉与上下文变量对道德决策的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18466 2026-03-18 cs.CY cs.AI cs.CV 79%

Can Multimodal LLMs See Science Instruction? Benchmarking Pedagogical Reasoning in K-12 Classroom Videos

多模态大语言模型能否看见科学教学?K-12课堂视频中教学推理的基准测试

Yixuan Shen, Peng He, Honglu Liu, Jinxuan Fan, Yuyang Ji, Tingting Li, Tianlong Chen, Kaidi Xu, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Department of Teaching and Learning, Washington State University(华盛顿州立大学教学与学习系) College of Chemistry, Beijing Normal University(北京师范大学化学学院) Department of Computer Science, University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Department of Data Science, City University of Hong Kong(香港城市大学数据科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SciIBI视频基准,用于分析科学课堂讨论,评估多模态模型在教学推理中的表现,发现模型在区分教学实践时存在局限,需更深入的推理。

Comments 17pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10477 2026-03-18 cs.CV cs.AI cs.CY 79%

Urban Socio-Semantic Segmentation with Vision-Language Reasoning

城市社会语义分割与视觉-语言推理

Yu Wang, Yi Wang, Rui Dai, Yujie Wang, Kaikui Liu, Xiangxiang Chu, Yansheng Li

机构 * Wuhan University(武汉大学) Amap, Alibaba Group(阿里巴巴集团地图部门)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SocioReasoner框架,通过视觉-语言推理实现城市社会语义分割,引入SocioSeg数据集,实验显示优于现有方法且具备强零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23252 2026-03-18 cs.LG 79%

NanoFlux: Adversarial Dual-LLM Evaluation and Distillation For Multi-Domain Reasoning

NanoFlux:对抗性双语言模型评估与蒸馏用于多领域推理

Raviteja Anantha, Soheil Hor, Teodor Nicola Antoniu, Layne C. Price

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 NanoFlux通过对抗性生成训练数据提升大语言模型推理能力,其生成数据在数学、科学和医学领域均优于传统微调方法,且计算成本降低3-14倍。

Comments Preprint version 3; Updated References

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15897 2026-03-18 cs.CL cs.AI 79%

COGNAC at SemEval-2026 Task 5: LLM Ensembles for Human-Level Word Sense Plausibility Rating in Challenging Narratives

COGNAC在SemEval-2026任务5中的应用:用于挑战性叙事中人类水平词义可信度评估的LLM集成

Azwad Anjum Islam, Tisa Islam Erana

机构 * Florida International University Knight Foundation School of Computing and Information Sciences(佛罗里达国际大学骑士基金会计算与信息科学学院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出使用多个闭源商业LLM的集成方法,通过三种提示策略提升短篇故事中多义词词义可信度评估的准确性,最终在比赛中获得第四名。

Comments System description paper in SemEval-2026, Task 5

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15015 2026-03-18 cs.MA 78%

MetaCrit: A Critical Thinking Framework for Self-Regulated LLM Reasoning

MetaCrit: 一种用于自主LLM推理的批判性思维框架

Xinmeng Hou, Ziting Chang, Zhouquan Lu, Chen Wenli, Liang Wan, Wei Feng, Hai Hu, Qing Guo

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出MetaCrit框架,通过多智能体机制提升LLM在多跳问题中的推理能力,增强逻辑严谨性并消除有毒输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16181 2026-03-18 cs.CV cs.CR 78%

KidsNanny: A Two-Stage Multimodal Content Moderation Pipeline Integrating Visual Classification, Object Detection, OCR, and Contextual Reasoning for Child Safety

KidsNanny:一种集成视觉分类、目标检测、OCR和上下文推理的双阶段多模态内容审查流水线,用于儿童安全

Viraj Panchal, Tanmay Talsaniya, Parag Patel, Meet Patel

机构 * KidsNanny Research Team, Vartit Technology Inc.(KidsNanny研究团队,Vartit技术公司)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出KidsNanny,一种双阶段多模态内容审查架构,通过视觉Transformer和目标检测器进行视觉筛查,结合OCR和基于文本的7B语言模型进行上下文推理,以提高儿童安全的内容审查效率和准确性。

Comments 12 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03951 2026-03-18 cs.CV 78%

ANTS: Adaptive Negative Textual Space Shaping for OOD Detection via Test-Time MLLM Understanding and Reasoning

ANTS: 通过测试时MLLM理解和推理实现的自适应负文本空间塑造用于OOD检测

Wenjie Zhu, Yabin Zhang, Xin Jin, Wenjun Zeng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究院) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出ANTs通过利用多模态大语言模型的理解和推理能力,构建自适应负文本空间,提升OOD检测的准确性和适应性,实验表明在ImageNet上FPR95降低3.1%。

Comments Accepted by CVPR2026, Project Page: https://zhuwenjie98.github.io/ANTS-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16495 2026-03-18 cs.AI 77%

ExpressMind: A Multimodal Pretrained Large Language Model for Expressway Operation

ExpressMind:一种用于高速公路运营的多模态预训练大语言模型

Zihe Wang, Yihuan Wang, Haiyang Yu. Zhiyong Cui, Xiaojian Liao, Chengcheng Wang, Yonglin Tian, Yongxin Tong

机构 * Beihang University(北航) Shandong Hi-speed Group Co., Ltd(山东高速集团有限公司) Institute of automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出ExpressMind,一种针对高速公路运营的多模态预训练大语言模型,通过构建全栈数据集和双层预训练方法,提升事件检测、安全响应生成和复杂交通分析能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15563 2026-03-18 cs.LG cs.AI 73%

The PokeAgent Challenge: Competitive and Long-Context Learning at Scale

PokeAgent挑战:在大规模中实现竞争性和长上下文学习

Seth Karten, Jake Grigsby, Tersoo Upaa, Junik Bae, Seonghun Hong, Hyunyoung Jeong, Jaeyoon Jung, Kun Kerdthaisong, Gyungbo Kim, Hyeokgi Kim, Yujin Kim, Eunju Kwon, Dongyu Liu, Patrick Mariglia, Sangyeon Park, Benedikt Schink, Xianwei Shi, Anthony Sistilli, Joseph Twin, Arian Urdu, Matin Urdu, Qiao Wang, Ling Wu, Wenli Zhang, Kunsheng Zhou, Stephanie Milani, Kiran Vodrahalli, Amy Zhang, Fei Fang, Yuke Zhu, Chi Jin

机构 * Princeton(普林斯顿大学) UT-Austin(得克萨斯大学奥斯汀分校) CMU(卡内基梅隆大学) NYU(纽约大学) Google DeepMind(谷歌DeepMind) Team Heatz(团队Heatz) Team PA-Agent(团队PA-Agent) Team FoulPlay(团队FoulPlay) Team 4thLesson(团队4thLesson) Team Q(团队Q) Team Anthonys(团队Anthonys) Team Hamburg(团队Hamburg) Team Porygon2AI(团队Porygon2AI) Team Deepest(团队Deepest) Team August(团队August)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG

AI总结 PokeAgent挑战通过两个互补赛道,解决部分可观测性、博弈推理和长周期规划问题,提供大规模基准测试和首个RPG速run评估框架,揭示通用(LLM)、专业(RL)和精英人类表现间的差距。

Comments 41 pages, 26 figures, 5 tables. NeurIPS 2025 Competition Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13856 2026-03-18 cs.LG cs.CV 70%

OrigamiBench: An Interactive Environment to Synthesize Flat-Foldable Origamis

OrigamiBench: 一个用于合成可折叠折纸的交互环境

Naaisha Agarwal, Yihan Wu, Yichang Jian, Yikuan Hu, Nishad Mansoor, Mohan Li, Yifei Peng, Wang-Zhou Dai, Yao-Xiang Ding, Emanuele Sansone

机构 * Independent Researcher(独立研究者) State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与计算机图形学国家重点实验室) Computer Science Northeastern University(东北大学计算机科学系) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家实验室) CSAIL / ESAT MIT / KU Leuven(MIT / KU Leuven)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.LG

AI总结 OrigamiBench通过交互式环境测试模型在折叠策略中的因果推理能力,发现单纯扩大模型规模无法有效生成多步骤折叠策略,表明视觉与语言表征仍需加强整合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15803 2026-03-18 cs.LG 70%

Mask Is What DLLM Needs: A Masked Data Training Paradigm for Diffusion LLMs

掩码是DLLM所需:一种用于扩散语言模型的掩码数据训练范式

Linrui Ma, Yufei Cui, Kai Han, Yunhe Wang

机构 * Noah’s Ark Lab, Huawei Montreal, Canada & Beijing, China(华为蒙特利尔实验室及北京)

专题命中 推理评测 :reasoning(abstract);math reasoning(abstract);分类 cs.LG

AI总结 本文提出信息密度驱动的智能噪声调度器,通过提取信息密集 hubs 并应用互补优先级掩码,将单个训练实例解耦为相互增强的推理和语法样本,提升模型在代码和数学推理任务中的准确率。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21991 2026-03-18 cs.CV cs.AI cs.CL cs.LG 67%

ERGO: Efficient High-Resolution Visual Understanding for Vision-Language Models

ERGO:高效高分辨率视觉理解用于视觉-语言模型

Jewon Lee, Wooksu Shin, Seungmin Yang, Ki-Ung Song, DongUk Lim, Jaeyeon Kim, Tae-Ho Kim, Bo-Kyeong Kim

机构 * Nota Inc.(Nota公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ERGO提出一种两阶段'粗到细'推理流程,通过下采样图像识别任务相关区域,再以全分辨率裁剪处理,从而在降低计算成本的同时保留必要的细粒度视觉细节,提升视觉-语言模型的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16557 2026-03-18 cs.AI cs.CL 62%

BenchPreS: A Benchmark for Context-Aware Personalized Preference Selectivity of Persistent-Memory LLMs

BenchPreS:面向持久内存LLM的上下文感知个性化偏好选择性基准

Sangyeon Yoon, Sunkyoung Kim, Hyesoo Hong, Wonje Jeung, Yongil Kim, Wooseok Seo, Heuiyeen Yeen, Albert No

机构 * Yonsei University(延世大学) LG AI Research(LG AI研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BenchPreS评估持久内存LLM在不同通信场景中对用户偏好是否恰当应用,发现前沿模型在上下文敏感应用上存在不足,偏好遵循性强的模型易出现过度应用,推理能力和提示防御无法彻底解决此问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16124 2026-03-18 cs.SE cs.AI cs.CL 62%

SWE-QA-Pro: A Representative Benchmark and Scalable Training Recipe for Repository-Level Code Understanding

SWE-QA-Pro:一个代表性的基准和可扩展的训练配方用于仓库级代码理解

Songcheng Cai, Zhiheng Lyu, Yuansheng Ni, Xiangchao Chen, Baichuan Zhou, Shenzhe Zhu, Yi Lu, Haozhe Wang, Chi Ruan, Benjamin Schneider, Weixu Zhang, Xiang Li, Andy Zheng, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of Toronto(多伦多大学) The Hong Kong University of Science and Technology(香港科学与技术大学) McGill University & MILA(麦吉尔大学及MILA) Verdent AI, Inc.(Verdent AI公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SWE-QA-Pro基准,通过多样化的长尾仓库和可执行环境构建,验证了代理工作流在代码理解任务中的优势,并提出可扩展的合成数据管道和两阶段训练方法,使小型模型在复杂行为学习中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03378 2026-03-18 cs.LG cs.AI 62%

AOI: Turning Failed Trajectories into Training Signals for Autonomous Cloud Diagnosis

AOI: 将失败轨迹转化为自主云诊断的训练信号

Pei Yang, Wanyi Chen, Asuka Yuxi Zheng, Xueqian Li, Xiang Li, Haoqin Tu, Jie Xiao, Yifan Pang, Dongdong Zhang, Fuqiang Li, Alfred Long, Lynn Ai, Eric Yang, Bill Shi

机构 * Gradient Soochow University(苏州大学) UC Santa Cruz Georgia Institute of Technology(佐治亚理工学院) University College London(伦敦大学学院) WeJoy ByteDance(字节跳动)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AOI通过结构化轨迹学习框架,在安全约束下实现自动化操作,结合可训练诊断系统、读写分离执行架构和失败轨迹闭环演进器,提升云诊断性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22223 2026-03-18 cs.LG cs.AI cs.CR cs.NI 62%

ReGAIN: Retrieval-Grounded AI Framework for Network Traffic Analysis

ReGAIN:基于检索的网络流量分析人工智能框架

Shaghayegh Shajarian, Kennedy Marsh, James Benson, Sajad Khorsandroo, Mahmoud Abdelsalam

机构 * Computer Science(计算机科学) North Carolina A\&T State University(北卡罗来纳A&T州立大学) Institute for Cyber Security(网络安全研究所) University of Texas at San Antonio(德克萨斯大学圣安东尼奥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReGAIN结合流量摘要、检索增强生成和大语言模型推理,实现透明准确的网络流量分析,通过多阶段框架提升安全性和性能,验证结果显示其在不同攻击类型中准确率高达95.95%-98.82%。

Comments Accepted to ICNC 2026. This is the accepted author manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04017 2026-03-18 cs.AI cs.LG physics.ao-ph 62%

Zephyrus: An Agentic Framework for Weather Science

Zephyrus:一种用于气象科学的代理框架

Sumanth Varambally, Marshall Fisher, Jas Thakker, Yiwei Chen, Zhirui Xia, Yasaman Jafari, Ruijia Niu, Manas Jain, Veeramakali Vignesh Manivannan, Zachary Novack, Luyu Han, Srikar Eranky, Salva Rühling Cachay, Taylor Berg-Kirkpatrick, Duncan Watson-Parris, Yi-An Ma, Rose Yu

机构 * UC San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Zephyrus框架,结合大语言模型与天气数据交互,解决传统模型缺乏语言推理的问题,通过新基准测试展示其在天气任务中的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16862 2026-03-18 cs.CL 57%

Chronos: Temporal-Aware Conversational Agents with Structured Event Retrieval for Long-Term Memory

Chronos:具有结构化事件检索的时序感知对话代理以实现长期记忆

Sahil Sen, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

机构 * Commercial Technology and Innovation Office(商业技术与创新办公室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Chronos通过结构化事件日历和对话日历实现时序感知,有效处理长期对话记忆中的时间敏感查询,提升多跳推理能力,在LongMemEvalS基准测试中取得新高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15643 2026-03-18 cs.AI 57%

GSI Agent: Domain Knowledge Enhancement for Large Language Models in Green Stormwater Infrastructure

GSI代理:面向绿色雨水基础设施的大语言模型领域知识增强

Shaohuang Wang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出GSI代理,通过监督微调、检索增强生成和代理推理流程,提升大语言模型在绿色雨水基础设施任务中的领域知识能力,实验表明其在领域任务中的表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16544 2026-03-18 cs.CL 57%

How often do Answers Change? Estimating Recency Requirements in Question Answering

答案多久会变化?在问答中估计时效性需求

Bhawna Piryani, Zehra Mert, Adam Jatowt

机构 * University of Innsbruck(因斯布鲁克大学) MEF University(MEF大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出RecencyQA数据集,通过人类评估和实证分析,展示非平稳问题对LLM的挑战随更新频率增加而加剧,为时间推理提供细粒度基准和时效感知问答系统基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16107 2026-03-18 cs.SE cs.AI 57%

RepoReviewer: A Local-First Multi-Agent Architecture for Repository-Level Code Review

RepoReviewer: 一种面向仓库级别的多智能体架构

Peng Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RepoReviewer通过分解仓库获取、上下文合成、文件分析等步骤,提供一种实用的仓库级自动化审查架构,强调系统设计与可重用的评估工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07923 2026-03-18 cs.CV cs.AI 57%

Exploring the Underwater World Segmentation without Extra Training

探索无需额外训练的水下世界分割

Bingyu Li, Tao Huo, Da Zhang, Zhiyuan Zhao, Junyu Gao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom, China(人工智能研究院(TeleAI),中国电信,中国) University of Science and Technology of China, China(中国科学技术大学,中国) Northwestern Polytechnical University, China(西北工业大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AquaOV255水下分割数据集及Earth2Ocean框架,通过几何引导视觉掩码生成和类别-视觉语义对齐模块,在无需额外训练的情况下实现高效的水下开放词汇分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13397 2026-03-18 cs.CV 50%

TennisExpert: Towards Expert-Level Analytical Sports Video Understanding

TennisExpert: 向专家级分析体育视频理解迈进

Zhaoyu Liu, Xi Weng, Lianyu Hu, Zhe Hou, Kan Jiang, Jin Song Dong, Yang Liu

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出TennisExpert框架,通过整合视频语义解析器和基于Qwen3-VL-8B的记忆增强模型,实现高效多模态网球理解,提升战术分析和比赛动态捕捉能力。

详情

展开后加载摘要…

URL PDF HTML 收藏