Information-Aware KV Cache Compression for Long Reasoning
面向长推理的信息感知KV缓存压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向长推理的信息感知KV缓存压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。
检索预热能量基推理:结构化推理任务上扩散即推断的五臂消融方法
机构 * Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系) ; Department of Information Management, National Central University(国立中央大学信息管理系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出五臂消融方法(oracle、best-constant、per-query-random、shuffled、aligned)分离检索预热能量基推理中的三种混淆效应,在连通性-2任务上发现逐图对齐主导性能提升,而在数独任务上关键质量成为瓶颈。
Comments 8 Pages, 6 Figures
自适应智能释放:大型语言模型中知识迁移的可行性
专题命中 推理评测 :CoT(summary_cn,abstract)
AI总结 通过知识迁移提升大型语言模型在软件工程任务中的泛化能力,实验发现迁移跨度、策略和架构是关键因素,层次策略优于直接迁移,AI-Chain优于CoT。
Comments The paper is withdrawn for further clarification of the alignment between the proposed knowledge transfer framework and its implementation, and for refinement of the transfer span definition and experimental evaluation design
ReasonCLIP-58M: CLIP的视觉基础常识推理监督
机构 * Khalifa University(卡利法大学) ; University of Western Australia(西澳大学) ; The Chinese University of Hong Kong(香港中文大学) ; University of Melbourne(墨尔本大学) ; University of Central Florida(佛罗里达中央大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。
Comments Accepted to ECCV2026
跨语言推理的软令牌对齐
机构 * Georgia Institute of Technology(佐治亚理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 提出SOLAR方法,通过软令牌对齐跨语言表示,提升多语言推理准确率,尤其对低资源语言效果显著。
CORTEX:用于可信3D胸部CT多模态大语言模型的结构化推理基准
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; Hasso Plattner Institute(哈索·普拉特纳研究所) ; Khalifa University(哈利法大学)
专题命中 推理评测 :reasoning(title,abstract)
AI总结 提出CORTEX基准,通过四阶段诊断推理轨迹和阶段级评估协议,为3D胸部CT多模态大语言模型提供结构化监督与验证,包含76,177个验证推理轨迹。
评估深度研究代理在专家咨询工作中的表现:一个包含验证器、评分标准和认知陷阱的基准
机构 * Deccan AI Research(德克南人工智能研究所)
专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一个基准,通过42个专家编写的任务,使用确定性验证器和五维度评分标准评估三个前沿深度研究代理(Claude、OpenAI o3、Gemini)在管理咨询类结构化分析交付物上的表现,并嵌入认知陷阱,发现所有代理的联合接受率均较低(最高21.4%),且各有独特失败模式。
Comments Updating the paper with more data. Will resubmit
FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准
机构 * National Science Foundation(国家科学基金会) ; NASA(美国国家航空航天局)
专题命中 推理评测 :reasoning(abstract);planning(abstract)
AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。
长程LLM推理的上下文回收
机构 * Independent Researcher(独立研究员)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。
NuclearQAv2:评估大型语言模型领域科学能力的结构化基准
机构 * Los Alamos National Laboratory(洛斯阿拉莫斯国家实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出NuclearQAv2基准,包含约1240个核工程问答对,通过混合管道生成,评估LLM在事实、数值和概念推理上的表现,发现定量推理仍具挑战。
超越逻辑形式:LLM提取的谬误分类模式
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出利用大语言模型从谬误示例中归纳提取抽象逻辑结构与上下文线索的模式,用于谬误分类,在多个实验设置中显著优于零样本基线并跨数据集验证泛化性。
OpenFinGym: 一个可验证的多任务Gym环境,用于评估量化智能体
机构 * University of Edinburgh(爱丁堡大学) ; University College London(伦敦大学学院) ; Alan Turing Institute(艾伦·图灵研究所) ; University of Oxford(牛津大学)
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出OpenFinGym统一环境,覆盖预测、市场生成、实时交易和欺诈检测等量化金融任务,支持自动化任务构建、容器化验证和延迟解析,以全面评估LLM智能体。
红皇后哥德尔机:共同进化的智能体及其评估者
专题命中 推理评测 :verifier(abstract);分类 cs.AI、cs.LG
AI总结 提出红皇后哥德尔机(RQGM),一种在非平稳效用下实现递归自我改进的进化框架,通过受控效用演化在编码、论文写作和证明任务上超越现有自我改进智能体。
Comments 13 pages main text + 21 pages appendix (38 pages total, incl. references); 11 figures (7 main text + 4 appendix); 10 tables (2 main text + 8 appendix). Preliminary preprint; work in progress. Keywords: self-improving agents, learned evaluation, multi-agent systems, auto-mated scientific discovery, controlled utility evolution, co-evolutionary search, autoresearch
后训练配方,而非模型家族,塑造多智能体LLM对话行为
机构 * Carnegie Mellon University(卡内基梅隆大学) ; University of California, Santa Cruz(加州大学圣克鲁兹分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 研究通过大规模语料库和因子实验发现,后训练配方(如推理蒸馏)对多LLM对话行为(如回避性回答)的影响超过模型家族,表明模型家族不能完全代表对话多样性。
DEFault++: 用于变压器架构的自动故障检测、分类和诊断
机构 * Faculty of Computer Science(计算机科学系) ; Dalhousie University(达尔豪斯大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 DEFault++通过三级抽象检测、分类和诊断变压器故障,利用原型匹配与监督对比学习在DEFault-bench上实现高检测准确率和分类性能。
Comments Submitted in the ACM Transactions on Software Engineering and Methodology as Journal-First
ReportLogic: 评估深度研究报告的逻辑质量
机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿先进计算机科学研究所,莱顿大学) ; Ant Group(蚂蚁集团) ; CISPA Helmholtz Center for Information Security(信息安全霍普夫中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 提出ReportLogic基准,通过可审计性视角量化报告逻辑质量,包含宏观逻辑、阐述逻辑和结构逻辑三层评估,并训练开源LogicJudge进行可扩展评估。
Comments Accepted by ACL 2026 main
引导式基于人设的AI调查:能否利用LLMs在大规模上复制个人移动偏好
机构 * Chair of Transportation Systems Engineering, TUM School of Engineering and Design, TUM, Germany(交通系统工程教授、技术大学工程与设计学院、技术大学、德国)
专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI
AI总结 本研究探讨LLMs生成人工调查的潜力,通过'人设'结合现实数据,有效捕捉德国个人移动偏好中的复杂依赖关系,为交通规划提供可扩展、低成本的数据生成方案。
以真实意图铺路:意图感知训练提升跨训练机制下的LLM安全分类
机构 * University of Groningen(格罗宁根大学) ; University Politehnica of Bucharest(布加勒斯特理工大学) ; NVIDIA(英伟达)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出意图感知训练方法,通过显式建模用户意图信号提升安全分类器鲁棒性,在多个训练机制下取得最优平均性能。
HarmVideoBench:大型多模态模型中有害视频理解的基准测试
机构 * Central South University(中南大学) ; Tsinghua University(清华大学) ; South China Normal University(华南师范大学) ; ByteDance Inc(字节跳动公司) ; University of Zaragoza(阿拉维达大学) ; CosmosMind ; Wuhan University(武汉大学) ; University of California, Los Angeles(加州大学洛杉矶分校) ; Southeast University(东南大学) ; Tencent(腾讯公司) ; Nankai University(南开大学) ; Supermicro Computer Inc(Supermicro计算机公司) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出HarmVideoBench,一个包含1379个视频和4137道选择题的多层次诊断基准,从三个维度评估模型对有害视频的深层理解,并引入BCR方法将宏平均准确率从61.7%提升至84.4%。
置信度感知的工具编排用于鲁棒视频理解
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 针对视频推理模型盲目信任所有帧的问题,提出Robust-TO框架,通过每帧可信度评分、统一证据接口和三阶段合成机制,在八项任务上实现56.4%准确率,超越最强开源基线10.6%,并在五种真实扰动下保持54.3%准确率。
Comments Project page: https://rova-v2.github.io/
能力前沿:基准测试遗漏了82%的模型性能
机构 * Martian ; University of Oxford(牛津大学) ; ThoughtWorks
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出能力前沿概念,通过帕累托前沿量化多模型多生成下的最佳性能,纠正单模型单次评估偏差,在16个基准上实现82%性能提升和85%成本降低。
感知、判断与进化:基于事后洞察的自优化取证智能体用于AI生成图像检测
机构 * Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出ForeAgent框架,采用感知-判断架构融合多视图线索,并引入事后洞察驱动的自优化策略,通过采样-反思-进化范式持续提升检测能力,在多个基准上达到最优性能。
Comments 10 pages
大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究
专题命中 推理评测 :reasoning(abstract);分类 cs.LG
AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。
Comments 34 pages, 4 tables, 3 Annexes
WatchAct: 行为引导的机器人操作基准
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。
从自我未来学习:面向扩散LLM的在线自蒸馏
机构 * Tsinghua University(清华大学) ; Technical University of Munich(慕尼黑工业大学) ; Nanyang Technological University(南洋理工大学) ; University of British Columbia(不列颠哥伦比亚大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校) ; ELLIS Institute Tubingen(ELLIS蒂宾根研究所) ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; Tubingen AI Center(蒂宾根人工智能中心)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出首个面向扩散大语言模型的在线自蒸馏框架d-OPSD,通过自我生成答案作为后缀条件实现从自我未来经验学习,并将监督从词元级转向步骤级,在推理基准上以约10%的优化步骤超越RLVR和SFT基线。
Comments Preprint
在大语言模型时代的手语识别
机构 * University of West Bohemia(西波西米亚大学) ; Eindhoven University of Technology(埃因霍温理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 研究探讨现代VLMs在零样本条件下进行孤立手语识别的能力,发现开源模型表现欠佳,而大模型在精度上表现突出,强调模型规模和训练数据多样性的重要性。
Comments Accepted at the CVPR 2026 Workshop on Multimodal Sign Language Research (MSLR), 8 pages, 3 figures
Journal ref Proc. IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), 2026, pp. 10511-10519
OI-Bench:用于评估大语言模型对指令干扰敏感性的选项注入基准
机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国家阳明交通大学计算机科学系)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 提出选项注入基准OI-Bench,通过在多选题界面中嵌入误导性指令,系统评估12个LLM对16种指令干扰的脆弱性,揭示模型存在显著漏洞。
Qwen-Image-Bench:从生成到创造——文本到图像评估
机构 * Alibaba(阿里巴巴)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对现有文本到图像评估基准缺乏对真实世界保真度和创造性生成能力的考量,本文提出Qwen-Image-Bench,一个与专业艺术家共同设计的创作者中心基准,通过分层分类体系、1000个分层提示和基于Qwen3.6-27B的统一评判模型Q-Judger,实现细粒度、可归因的诊断,有效区分领先的T2I模型。
6根手指,1个肾脏:自然对抗性医学图像揭示视觉语言模型的关键弱点
机构 * German Cancer Research Center (DKFZ) Heidelberg, Division of Intelligent Medical Systems(德国癌症研究中心(DKFZ)海德堡,智能医学系统部门) ; Medical Faculty, Heidelberg University(海德堡大学医学院) ; Faculty of Mathematics and Computer Science, Heidelberg University(海德堡大学数学与计算机科学学院) ; HIDSS4Health - Helmholtz Information and Data Science School for Health, Karlsruhe/Heidelberg(HIDSS4Health - 哈勃-马克斯信息与数据科学健康学院,卡尔斯鲁厄/海德堡) ; Helmholtz Imaging, German Cancer Research Center (DKFZ)(哈勃-马克斯成像,德国癌症研究中心(DKFZ)) ; Engineering Faculty, Heidelberg University(海德堡大学工程学院) ; School of Computation, Information and Technology, TUM(技术大学(TUM)计算、信息与技术学院) ; Weldon School of Biomedical Engineering, Purdue University(普渡大学韦尔登生物医学工程学院) ; Department of Visceral, Thoracic and Vascular Surgery, University Hospital and Faculty of Medicine Carl Gustav Carus, TUD Dresden University of Technology(visceral、胸腔和血管外科部门,技术大学(TUD)德累斯顿大学医院和医学院) ; National Center for Tumor Diseases (NCT), NCT Heidelberg, a partnership between DKFZ and University Hospital Heidelberg(肿瘤疾病国家中心(NCT),海德堡NCT,DKFZ与海德堡大学医院之间的合作) ; Heidelberg University Hospital, Surgical Clinic, Surgical AI Research Group(海德堡大学医院,外科诊所,外科人工智能研究组) ; Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(Mohamed Bin Zayed人工智能大学(MBZUAI),阿布扎赫,阿拉伯联合酋长国)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出AdversarialAnatomyBench基准,测试25个视觉语言模型在罕见解剖变异上的表现,发现准确率从71%降至28%,且模型缩放和干预无法解决。