arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4155 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1018 篇

2606.26875 2026-06-26 cs.CL cs.AI 新提交 81%

Information-Aware KV Cache Compression for Long Reasoning

面向长推理的信息感知KV缓存压缩

Jushi Kai, Zhuiri Xiao, Alexandra Birch, Zhouhan Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出InfoKV框架,通过结合预测不确定性与注意力分数进行KV缓存压缩,在长上下文推理中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26476 2026-06-26 cs.LG cs.AI 新提交 81%

Retrieval-Warmed Energy-Based Reasoning: A Five-Arm Ablation Methodology for Diffusion-as-Inference on Structured Reasoning Tasks

检索预热能量基推理:结构化推理任务上扩散即推断的五臂消融方法

Libo Sun, Po-Wei Harn, Zewei Zhang, Peixiong He, Xiao Qin

机构 * Department of Computer Science and Software Engineering, Auburn University(奥本大学计算机科学与软件工程系) Department of Information Management, National Central University(国立中央大学信息管理系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出五臂消融方法(oracle、best-constant、per-query-random、shuffled、aligned)分离检索预热能量基推理中的三种混淆效应,在连通性-2任务上发现逐图对齐主导性能提升,而在数独任务上关键质量成为瓶颈。

Comments 8 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24391 2026-06-24 cs.AI cs.CL cs.GT cs.MA 新提交 81%

Age of LLM: A Strategic 1v1 Benchmark for Reasoning, Diplomacy and Reliability of Large Language Models under Fog of War

LLM时代:战争迷雾下大型语言模型的推理、外交与可靠性的战略1v1基准测试

Arnaud Ricci

机构 * Independent researcher, Switzerland(瑞士独立研究员)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Age of LLM基准,在13x7网格上让两个LLM进行1v1对战,包含战争迷雾、完全外交和严格JSON格式可靠性维度,通过54场比赛评估15个推理模型,发现核冲刺主导、外交频繁但极少达成、非法动作反映信念追踪,并初步关联可靠性与获胜。

Comments 25 pages including appendices, 8 figures, 4 tables; appendices include verbatim system prompt and engine resolution pseudocode. All correlations reported with p-values, 95% bootstrap confidence intervals and Spearman's rho; includes a Steiger test and Bradley-Terry fit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19351 2026-06-19 cs.CL cs.AI 新提交 81%

Detecting Hallucinations for Large Language Model-based Knowledge Graph Reasoning

基于大语言模型的知识图谱推理中的幻觉检测

Xinyan Zhu, Yaoqi Liu, Yue Gao, Huadong Ma, Cheng Yang, Chuan Shi

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出LUCID方法,结合LLM注意力分数、知识图谱语义和结构信息,利用图神经网络检测LLM在知识图谱推理中的幻觉,在九个数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18158 2026-06-17 cs.CY cs.AI cs.CL 新提交 81%

The Measurement Gap in the Automation of EU Law: Benchmarking Doctrinal Legal Reasoning under the EU AI Act

欧盟法律自动化中的测量差距:欧盟AI法案下教义性法律推理的基准测试

Michèle Finck

机构 * Chair of Law and Artificial Intelligence and Director, CZS Institute for Artificial Intelligence and Law, University of Tübingen(法律与人工智能教授、人工智能与法律研究所主任,图宾根大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对当前缺乏评估大型语言模型进行教义性法律推理的基准,提出该能力对满足欧盟AI法案中“适当准确性”要求至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17478 2026-06-17 cs.CL cs.AI 新提交 81%

Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing

解码推理型LLM中的隐藏欺骗:用于欺骗审计的激活解释器

Kexin Chen, Yi Liu, Haonan Zhang, Yanhui Li, Xinyu Deng, Dongxia Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出STATEWITNESS,一种通过解码目标模型隐藏状态来生成自然语言查询答案和结构化报告的激活解释器,在欺骗检测中平均AUROC达0.916,优于现有方法。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 81%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13815 2026-06-15 cs.AI cs.CL 新提交 81%

Poker Arena: Multi-Axis Profiling of Strategic Reasoning and Memory in LLMs

Poker Arena: 大型语言模型中策略推理与记忆的多轴剖析

Pratham Singla, Shivank Garg, Vihan Singh

机构 * Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出Poker Arena平台,通过三层记忆架构和九轴认知剖面分解策略推理,揭示标量排行榜系统性误排模型能力结构。

Comments 33 pages, ICML Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13220 2026-06-12 cs.AI cs.CE cs.ET cs.LG cs.MA 新提交 81%

LLM-as-an-Investigator: Evidence-First Reasoning for Robust Interactive Problem Diagnosis

LLM作为调查员:基于证据优先的鲁棒交互式问题诊断

Fabrizio Marozzo, Pietro Liò

机构 * University of Calabria(卡拉布里亚大学) University of Cambridge(剑桥大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出证据优先的AI方法LLM-as-an-Investigator,通过估计问题歧义、生成假设、提问澄清并更新概率,避免过早接受用户假设,提升诊断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11816 2026-06-11 cs.CL cs.AI 新提交 81%

WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning

WorldReasoner: 评估语言模型代理是否通过有效推理预测事件

Yizhou Chi, Eric Chamoun, Zifeng Ding, Andreas Vlachos

机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出WorldReasoner框架,通过时间有效检索、证据质量和因果图推理三个维度评估语言模型代理的事件预测能力,发现时间有效检索是结果准确性的最强驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06635 2026-06-08 cs.CL cs.AI 新提交 81%

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

语言模型如何失败:承诺性和持续性推理错误的令牌级特征

Tanvi Thoria, Kiana Jafari, Marc R. Schlichting, Mykel J. Kochenderfer

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过令牌级不确定性信号,将语言模型推理失败分为承诺性失败(早期锁定错误路径)和持续性不确定性(不确定性持续累积),并在23个模型-数据集配置中验证了可预测性,为自我一致性策略提供了指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09743 2026-07-14 cs.AI cs.GT 新提交 80%

Scaffolding the Strategist: Architecture-Dependent Reasoning Interventions in Hotelling Spatial Markets

为策略制定者搭建框架:霍特林空间市场中与架构相关的推理干预

Pratyush Singh

机构 * California Institute of Technology(加州理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 研究结构化推理干预对大语言模型战略经济推理的影响及与模型架构的关系,以霍特林模型评估GPT - 4.1 - mini和GPT - 5 - mini,发现支架类型与模型架构有交叉交互作用,对抗性测试有损害,还存在陈述性 - 程序性差距。

Comments 26 pages (11 main + 15 appendix), 6 figures, 4 tables. Accepted at the ICLR 2026 Workshop on LLM Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10479 2026-06-10 cs.AI 新提交 80%

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

ComBench: 奥林匹克级组合数学中严格证明推理与构造实现的基准测试

Shunkai Zhang, Haoran Zhang, Yun Luo, Qianjia Cheng, Haodi Lei, Yizhuo Li, Runzhe Zhan, Zhilin Wang, Bangjie Xu, Yucheng Su, Xinmiao Han, Xiaoye Qu, Dongrui Liu, Zhouchen Lin, Yu Qiao, Ning Ding, Yafu Li, Yu Cheng

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ComBench基准,包含100道奥林匹克级组合问题,分分析和构造两类,通过评分与验证评估大模型推理能力,发现最强模型准确率仅65.4%,且证明推理与构造实现能力存在差异。

Comments 39 pages, 6 figures, 26 tables. Project page: https://simplified-reasoning.github.io/ComBench/docs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05822 2026-08-07 cs.SE 新提交 80%

Agent-Based Test Assertion Generation via Diverse Perspective Aggregation

基于智能体的多视角聚合测试断言生成

Dong Wang, Qiaoyu Han, Lin Yang, Jianyi Zhou, Guangtai Liang, Junjie Chen

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract)

AI总结 针对现有LLM断言生成方法的局限,提出基于智能体的AssertMate框架,通过三个组件聚合多视角,在Defects4J和EvoSuite验证中性能显著优于现有技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18534 2026-08-20 cs.AI cs.IR 新提交 79%

FinRCA-Bench: Benchmarking Evidence Retrieval and Reasoning for Financial AI Systems

FinRCA-Bench:面向金融AI系统的证据检索与推理基准

Pratik Ghawate

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究推出FinRCA-Bench基准,评估金融AI系统的证据检索与推理,发现检索架构影响性能,正确根本原因标签是可审计诊断的弱代理。

Comments 19 pages, 4 figures, 7 tables. Code and data: https://github.com/PratikGhawate/FinRCA-AI-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18011 2026-08-19 cs.CL 新提交 79%

The IOL-AI Challenge: An Open Challenge towards Advancing Linguistic Reasoning

IOL-AI挑战赛:一项旨在推进语言推理的开放挑战赛

Eduardo Sánchez, Rita Berrada, Dan-Mircea Mirea, Sara Rajaee, Alexander Piperski, Ana Meta Dolinar, Boris Iomdin, Andrey Nikulin, Mariya Shmatova, Marzieh Fadaee, Julia Kreutzer

机构 * University College London(伦敦大学学院) Meta CentraleSupélec(中央高等电力学院) McGill University(麦吉尔大学) Cohere Labs(Cohere实验室) Princeton University(普林斯顿大学) University of Amsterdam(阿姆斯特丹大学) Stockholm University(斯德哥尔摩大学) Faculty of Liberal Arts and Sciences(文理学院) Universidade Federal de Goiás(戈亚斯联邦大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文介绍基于2026年IOL个人赛未公开题目的IOL-AI挑战赛,评估含自动与评审团评分,测试显示模型能力不由规模决定,语言推理是泛化推理技能的强基准代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16425 2026-08-18 cs.AI 新提交 79%

ParaTempo: Efficient Parallel Reasoning via Temporal Confidence

ParaTempo:基于时间置信度的高效并行推理

Xuteng Zhang, Wenhao Zeng, Xiaodong Gu, Chao Hu, Haotian Lin, Yuling Shi, Min Wang, Beijun Shen

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 ParaTempo 是一种基于时间置信度的无训练异步并行推理框架,可自适应分配计算资源,在保持推理准确率的同时降低延迟与 token 用量,且时间置信度性能优于其他信号。

Comments Code and dataset are available at https://github.com/ScottZhang812/ParaTempo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16033 2026-08-18 cs.CL 新提交 79%

$R^3$-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets

$R^3$-Bench:大语言模型在共享预算下的资源理性推理能力存在不足

Peisong Wang, Zhiwei Ma, Bowen Liu, Feixue Liu, Aochuan Chen, Chenyi Zi, Hongchuan Zeng, Yuhan Li, Jia Li

机构 * The University of Hong Kong(香港大学) Hunyuan Team, Tencent(腾讯混元团队)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 $R^3$-Bench测试发现,大语言模型在共享预算下的资源理性推理存在不足,其表现出的单问题能力与共享预算下的实际表现存在差距。

Comments Code is available at https://github.com/NineAbyss/R-3-Bench . The dataset is available at https://huggingface.co/datasets/R-3-Bench/R-3-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15594 2026-08-18 cs.AI 新提交 79%

TRACE: Trajectory Aware Reasoning for Multi-Turn Adversarial Conversation Evaluation

TRACE:面向多轮对抗对话评估的轨迹感知推理

Md Messal Monem Miah, Adrita Anika, Zhiyuan Yu, Ruihong Huang

机构 * Texas A&M University(德克萨斯农工大学) Amazon(亚马逊公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO cs.SY eess.SY 新提交 79%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14791 2026-08-18 cs.AI 新提交 79%

CEDAR-GRPO: Process-Aware Reinforcement Learning for General Abductive Reasoning in LLMs

CEDAR-GRPO:面向大语言模型通用溯因推理的过程感知强化学习

Moein Salimi, Danial Parnian, Shaygan Adim, Amirmohammad Ebrahiminasab, Nima Alighardashi, Parsa Gholami, Sahand Akramipour, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学) University of Tehran(德黑兰大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出过程感知强化学习框架CEDAR-GRPO,通过后训练提升LLM的通用溯因推理能力,在11个未见任务上实现显著性能提升,验证了其迁移有效性。

Comments Code and data are available at https://github.com/cedar-grpo/cedar-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14610 2026-08-18 cs.AI 新提交 79%

When Do LLMs Apply the Wrong Law? Diagnosing LLM Failures in Temporal Legal Reasoning

大型语言模型何时适用错误法律?诊断大型语言模型在时间法律推理中的失败

Yiqian Huang, Shuyuan Zheng, Qianying Liu, Shaowen Peng, Yuntao Kong, Kotaro Funakoshi, Chuan Xiao, Manabu Okumura, Yang Cao

机构 * Institute of Science Tokyo(东京科学大学) Osaka University(大阪大学) NII LLMC(日本信息学研究所语言、语言学与媒体中心) Nara Institute of Science and Technology(奈良科学技术研究所) Center of Juris-Informatics, ROIS-DS(日本学术研究推进机构跨学科科学研究中心法学信息学中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文构建基准评估LLMs的时间适用法律判定能力,发现LLMs存在适用最新法律的偏差,该偏差源于强化学习塑造的显式推理导致推理路径多样性减少,通用推理能力更强的模型在时间法律推理中表现更差,为相关优化提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14558 2026-08-18 cs.AI cs.CV 新提交 79%

The Unwritten Benchmark: A New Challenge for Multimodal Machine Learning in Abstract Perceptual Reasoning

未书写基准:多模态机器学习在抽象感知推理领域的新挑战

Garima Arya Yadav, Nilay Yilmaz, Yezhou Yang

机构 * Arizona State University(亚利桑那州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出The Unwritten Benchmark基准,针对多模态模型在抽象感知推理中的不足,开展声-运动学文字推理任务评估,发现模型性能远逊于人类且存在模态融合悖论。

Comments To be published in CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14015 2026-08-17 cs.CV cs.AI 新提交 79%

MedClaw: Heuristic Agent Harness for Long-Horizon Surgical Video Reasoning

MedClaw:用于长程手术视频推理的启发式智能体框架

Yingying Fan, Penghui Du, Leyan Zhu, Runze He, Zimeng Wu, Yuxuan Zhang, Liang Chen, Jiahao Xie, Jiangtang Wang, Shuai Shao, Anchao Yang, Yutong Bai, Yan Wang

机构 * School of Automation and Intelligence, Beijing Jiaotong University(北京交通大学自动化与智能学院) University of Maryland(马里兰大学) Suzhou Institute for Advanced Research, University of Science and Technology of China(中国科学技术大学苏州高等研究院) University of British Columbia(不列颠哥伦比亚大学) Beijing Tiantan Hospital, Capital Medical University(首都医科大学附属北京天坛医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究提出MedClaw智能体框架,通过分离推理与感知、启发式技能蒸馏循环,在仅需约100个标注示例的情况下,于自建及公开手术视频基准MedClawBench上,显著优于现有一次性VLM和通用视频智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13667 2026-08-17 cs.AI cs.SE 新提交 79%

Second Thought: Reasoning in Parallel as LLM Agents Act and Observe

Second Thought:LLM智能体行动与观察时的并行推理

Zhensu Sun, Chengran Yang, Yunbo Lyu, Jieke Shi, David Lo

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出无需训练的推理框架Second Thought,利用LLM智能体行动与观察的空闲窗口并行推理,在多基准测试中降低轮次、减少主线程解码量,且Pass@1表现优于计算匹配对照组。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12282 2026-08-13 cs.AI 新提交 79%

VAKRA: Evaluating Multi-Hop Reasoning Across APIs and Retrieval Under Tool-Use Policies

VAKRA:评估工具使用策略下跨API与检索的多跳推理能力

Ankita Rajaram Naik, Anupama Murthi, Benjamin Elder, Siyu Huo, Raavi Gupta, Abhinav Jain, Praveen Venkateswaran, Abdulhamid Adebayo, Danish Contractor

机构 * IBM(国际商业机器公司(IBM))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究推出VAKRA基准评估工具使用策略下跨API与检索的多跳推理,发现现有最优模型在相关任务上性能随推理深度显著下降,失败集中于语言介导推理环节。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11738 2026-08-13 cs.CV cs.AI 新提交 79%

Advancing MLLM-based UAV Image Understanding and Reasoning: A Benchmark and a Training-Free Multi-Agent System

推进基于多模态大语言模型(MLLM)的无人机(UAV)图像理解与推理:基准测试及无训练多智能体系统

Haoyu Zhang, Shuoxun Zhang, Peng Ye, Lin Zhang, Jiakang Yuan, Shenghong Yi, Yuening Wang, Tao Chen

机构 * Fudan University(复旦大学) College of Future Information Technology(未来信息技术学院) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本研究构建UAVQA-Bench基准,识别MLLM用于无人机图像理解的三类失效模式,提出含DSPE、CAIR、DAAS的无训练多智能体系统UAV-MAS,其32B版本在基准上准确率超Gemini 3 Pro 4.0个百分点

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11415 2026-08-13 cs.IR cs.AI 新提交 79%

TRACES: A Benchmark for Epistemic Reliability in Scientific Reasoning by LLMs

TRACES:用于评估大型语言模型科学推理中认知可靠性的基准

Valentin Rodionov, Shamil Assylbekov

专题命中 推理评测 :reasoning(title);verifier(abstract);分类 cs.AI

AI总结 该研究构建了名为TRACES的基准,发现30种大型语言模型在识别42篇不可靠科学论文的认知可靠性时表现不佳,仅少数模型能有效拒绝有缺陷前提,凸显科学部署需护栏。

Comments 16 pages + appendices. 4 figures in the main text

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-12 cs.CV cs.AI 新提交 79%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments Accepted by IJCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10908 2026-08-12 cs.CV cs.CL 新提交 79%

Order Matters: LVLMs as Judges for Temporal Reasoning in Image Sequences

顺序很重要:LVLMs作为图像序列时间推理的评判者

Martina Ianaro, Guilherme Fernandes, Maurizio Gabbrielli, Joao Magalhaes

机构 * University of Bologna(博洛尼亚大学) NOVA School of Science and Technology(NOVA科技学院) NOVA Laboratory for Computer Science and Informatics(NOVA计算机科学与信息实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究发现大视觉语言模型(LVLMs)作为多模态评判者存在时间顺序判别缺陷,受首因、近因等结构性偏差影响,呼吁构建时间感知的视觉序列评估范式。

Comments 34 pages, camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏