Information-Aware KV Cache Compression for Long Reasoning
面向长推理的信息感知KV缓存压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
面向长推理的信息感知KV缓存压缩
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。
检索预热能量基推理:结构化推理任务上扩散即推断的五臂消融方法
机构 * Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系) ; Department of Information Management, National Central University(国立中央大学信息管理系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出五臂消融方法(oracle、best-constant、per-query-random、shuffled、aligned)分离检索预热能量基推理中的三种混淆效应,在连通性-2任务上发现逐图对齐主导性能提升,而在数独任务上关键质量成为瓶颈。
Comments 8 Pages, 6 Figures
LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试
机构 * Independent researcher, Switzerland(瑞士独立研究员)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。
Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit
基于大语言模型的知识图谱推理中的幻觉检测
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Tsinghua University(清华大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出LUCID方法,结合LLM注意力分数、知识图谱语义和结构信息,利用图神经网络检测LLM在知识图谱推理中的幻觉,在九个数据集上达到最优性能。
欧盟法律自动化中的测量差距:欧盟AI法案下教义性法律推理的基准测试
机构 * Chair of Law and Artificial Intelligence and Director, CZS Institute for Artificial Intelligence and Law, University of Tübingen(法律与人工智能教授、人工智能与法律研究所主任,图宾根大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对当前缺乏评估大型语言模型进行教义性法律推理的基准,提出该能力对满足欧盟AI法案中“适当准确性”要求至关重要。
解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器
机构 * Zhejiang University(浙江大学) ; Griffith University(格里菲斯大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。
Comments Under review
ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DAMO Academy, Alibaba Group(阿里巴巴达摩院) ; Hupan Lab(湖畔实验室) ; Zhejiang University(浙江大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。
Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu
Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析
机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) ; Raeth AI
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。
Comments 33 pages, ICML Workshop
LLM作为调查员:基于证据优先的鲁棒交互式问题诊断
机构 * University of Calabria(卡拉布里亚大学) ; University of Cambridge(剑桥大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG
AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。
WorldReasoner: 评估语言模型代理是否通过有效推理预测事件
机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出WorldReasoner框架,通过时间有效检索、证据质量和因果图推理三个维度评估语言模型代理的事件预测能力,发现时间有效检索是结果准确性的最强驱动因素。
语言模型如何失败:承诺性和持续性推理错误的令牌级特征
机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 通过令牌级不确定性信号,将语言模型推理失败分为承诺性失败(早期锁定错误路径)和持续性不确定性(不确定性持续累积),并在23个模型-数据集配置中验证了可预测性,为自我一致性策略提供了指导。
为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预
机构 * California Institute of Technology(加州理工学院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。
Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning
ComBench: 奥林匹克级组合数学中严格证明推理与构造实现的基准测试
机构 * Shanghai AI Laboratory(上海人工智能实验室) ; Peking University(北京大学) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 提出ComBench基准,包含100道奥林匹克级组合问题,分分析和构造两类,通过评分与验证评估大模型推理能力,发现最强模型准确率仅65.4%,且证明推理与构造实现能力存在差异。
Comments 39 pages, 6 figures, 26 tables. Project page: https://simplified-reasoning.github.io/ComBench/docs/
基于智能体的多视角聚合测试断言生成
专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)
AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。
FinRCA-Bench:面向金融AI系统的证据检索与推理基准
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 该研究推出FinRCA-Bench基准,评估金融AI系统的证据检索与推理,发现检索架构影响性能,正确根本原因标签是可审计诊断的弱代理。
Comments 19 pages, 4 figures, 7 tables. Code and data: https://github.com/PratikGhawate/FinRCA-AI-Bench
IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛
机构 * University College London(伦敦大学学院) ; Meta ; CentraleSupélec(中央高等电力学院) ; McGill University(麦吉尔大学) ; Cohere Labs(Cohere实验室) ; Princeton University(普林斯顿大学) ; University of Amsterdam(阿姆斯特丹大学) ; Stockholm University(斯德哥尔摩大学) ; Faculty of Liberal Arts and Sciences(文理学院) ; Universidade Federal de Goiás(戈亚斯联邦大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。
ParaTempo:基于时间置信度的高效并行推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 ParaTempo 是一种基于时间置信度的无训练异步并行推理框架,可自适应分配计算资源,在保持推理准确率的同时降低延迟与 token 用量,且时间置信度性能优于其他信号。
Comments Code and dataset are available at https://github.com/ScottZhang812/ParaTempo
$R^3$-Bench:大语言模型在共享预算下的资源理性推理能力存在不足
机构 * The University of Hong Kong(香港大学) ; Hunyuan Team, Tencent(腾讯混元团队)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 $R^3$-Bench测试发现,大语言模型在共享预算下的资源理性推理存在不足,其表现出的单问题能力与共享预算下的实际表现存在差距。
Comments Code is available at https://github.com/NineAbyss/R-3-Bench . The dataset is available at https://huggingface.co/datasets/R-3-Bench/R-3-Bench
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。
Comments Paper is currently under review. The code and dataset will be made public upon acceptance
CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习
机构 * Sharif University of Technology(谢里夫理工大学) ; University of Tehran(德黑兰大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。
Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo
大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败
机构 * Institute of Science Tokyo(东京科学大学) ; Osaka University(大阪大学) ; NII LLMC(日本信息学研究所语言、语言学与媒体中心) ; Nara Institute of Science and Technology(奈良科学技术研究所) ; Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。
未书写基准:多模态机器学习在抽象感知推理领域的新挑战
机构 * Arizona State University(亚利桑那州立大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出The Unwritten Benchmark基准,针对多模态模型在抽象感知推理中的不足,开展声-运动学文字推理任务评估,发现模型性能远逊于人类且存在模态融合悖论。
Comments To be published in CVPR Findings 2026
MedClaw:用于长程手术视频推理的启发式智能体框架
机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) ; University of Maryland(马里兰大学) ; Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) ; University of British Columbia(不列颠哥伦比亚大学) ; Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。
Second Thought:LLM智能体行动与观察时的并行推理
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。
VAKRA:评估工具使用策略下跨API与检索的多跳推理能力
机构 * IBM(国际商业机器公司(IBM))
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。
推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统
机构 * Fudan University(复旦大学) ; College of Future Information Technology(未来信息技术学院) ; Shanghai Innovation Institute(上海创新研究院) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点
TRACES:用于评估大型语言模型科学推理中认知可靠性的基准
专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.AI
AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。
Comments 16 pages + appendices. 4 figures in the main text
复杂城市场景中基于证据的可信多模态推理与评估基准
机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) ; Tencent CDG(腾讯云与智慧产业事业群) ; Institute of Information Engineering, CAS(中国科学院信息工程研究所)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI
AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。
Comments Accepted by IJCV
顺序很重要:LVLMs作为图像序列时间推理的评判者
机构 * University of Bologna(博洛尼亚大学) ; NOVA School of Science and Technology(NOVA科技学院) ; NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)
专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。
Comments 34 pages, camera-ready