arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2602.19127 2026-07-03 cs.CL 版本更新 79%

AgenticRAGTracer: A Hop-Aware Benchmark for Diagnosing Multi-Step Retrieval Reasoning in Agentic RAG

AgenticRAGTracer:用于诊断Agentic RAG中多步检索推理的跳数感知基准

Qijie You, Wenkai Yu, Wentao Zhang

机构 * University of Science and Technology Beijing(北京科技大学) Peking University(北京大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京市数据智能与安全重点实验室(北京大学))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出首个由大语言模型自动构建的Agentic RAG基准AgenticRAGTracer,包含1305个跨领域数据点,支持逐跳验证,揭示模型在多步推理中推理链扭曲的问题。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29672 2026-07-01 cs.CL 版本更新 79%

How LLMs See Creativity: Zero-Shot Scoring of Visual Creativity with Interpretable Reasoning

LLM如何看待创造力:具有可解释推理的视觉创造力零样本评分

William Orwig, Roger E. Beaty

机构 * Harvard University(哈佛大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 研究多模态大模型能否零样本评估视觉创造力,并分析其推理过程的可解释性。实验表明模型评分与人类高度一致,但推理并未提升评分准确性。

Comments 21 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31608 2026-07-01 cs.CL 新提交 79%

CLExEval: A Human-in-the-Loop Framework for Qualitative Evaluation of LLM Clinical Reasoning

CLExEval: 一种用于定性评估LLM临床推理的人机协同框架

Ajmal M., Abin Roy, Afthab Salam Kanniyan, Jawadh Abdul Kabeer, Jerin James, Preslav Nakov, Zhuohan Xie

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) IIT Madras(印度理工学院马德拉斯分校) Calicut Medical College(卡利卡特医学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出CLExEval框架,通过渐进信息遮蔽和专家注释,揭示LLM临床推理中的冗长偏差、隐藏知识悖论和推理-输出不匹配问题,并验证了LLM作为评判者的局限性。

Comments 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11599 2026-07-01 cs.LG 版本更新 79%

Targeted Tests for LLM Reasoning: An Audit-Constrained Protocol

面向LLM推理的定向测试:一种受审计约束的协议

Hongmin Li

机构 * School of Life Science and Technology, Institute of Science Tokyo(生命科学与技术学院,科学东京研究所) Department of Computational Biology and Medical Sciences, Graduate School of Frontier Sciences(计算生物学与医学科学系,前沿科学研究生院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出一种受审计约束的协议,用于评估LLM推理能力,通过组件自适应提示采样与均匀采样对比,验证了在受控环境下研究定向提示变化的有效性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14200 2026-07-01 cs.LG 79%

TS-Haystack: A Multi-Task Retrieval Benchmark for Long-Context Time-Series Reasoning

TS-Haystack:一种用于长上下文时间序列推理的多任务检索基准

Nicolas Zumarraga, Thomas Kaar, Ning Wang, William Tennien, Alpay Hasanli, Max Rosenblattl, Fan Wu, Kevin Riehl, Maxwell A. Xu, Markus Kreft, Kevin O'Sullivan, Elgar Fleisch, Paul Schmiedmayer, Robert Jakob, Patrick Langer

机构 * Agentic Systems Lab, ETH Zurich(1 非常规系统实验室,苏黎世联邦理工学院) Stanford University(2 斯坦福大学) Traffic Engineering Group, Institute for Transport Planning and Systems, ETH Zurich(3 交通工程组,交通规划与系统研究所,苏黎世联邦理工学院) University of Illinois Urbana-Champaign(4 印第安纳大学厄巴纳-香槟分校) Google(5 谷歌) Centre for Digital Health Interventions, ETH Zurich(6 数字健康干预中心,苏黎世联邦理工学院) Centre for Digital Health Interventions, University of St. Gallen(7 数字健康干预中心,圣加尔登大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出TS-Haystack基准,评估长上下文时间序列推理能力,发现现有TSLMs存在长上下文退化问题,代理检索框架在9/10任务中表现优异。

Comments Workshop version of this paper published at ICLR TSALM 2026. Benchmark generation code and datasets: https://github.com/AI-X-Labs/TS-Haystack

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10652 2026-07-01 cs.CV cs.AI 版本更新 79%

Are Video Reasoning Models Ready to Go Outside?

视频推理模型是否已准备好走向户外?

Yangfan He, Changgyu Boo, Jaehong Yoon

机构 * NTU Singapore(新加坡国立大学) Korea University(韩国大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ROVA框架,通过时空腐蚀建模提升模型鲁棒性,并引入PVRBench基准测试真实环境扰动下的性能,验证了ROVA在准确性和推理质量上的显著提升。

Comments Project Page: https://robust-video-reason.github.io/, accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29067 2026-06-30 cs.CL 79%

ThinkProbe: Beyond Accuracy -- Structural Profiling of Open-Ended LLM Reasoning Traces via Non-Generative Thought Graphs

ThinkProbe:超越准确性——通过非生成式思维图对开放式LLM推理轨迹进行结构分析

Mohamed Amine Kerkouri, Simon D. Hernandez, Marouane Tliba, Yann Dauxais, Maha Ben-Fares, Pierre Holat

机构 * F-Initiatives Université sorbonne Paris Nord(巴黎-索邦大学 Nord)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出ThinkProbe框架,将LLM推理轨迹转化为思维图,通过非生成式管道提取五维认知特征,发现推理结构是模型级稳定属性,且结构维度对问题领域敏感。

Comments Under Review for EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28349 2026-06-30 cs.IR cs.AI 79%

HMARS: A Hierarchical Multi-Agent Memory System for Long-Context Reasoning

HMARS:用于长上下文推理的分层多智能体记忆系统

Zeju Li, Ziyang Zheng, Yizhou Zhou, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HMARS分层多智能体记忆系统,通过子智能体、中层智能体和前沿模型的分层结构管理长上下文,在长文档和多轮记忆任务中优于检索、重排序、全上下文、基于图和智能体基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09305 2026-06-30 cs.LG 79%

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation

基于强化学习的LLM推理中的奖励建模:设计、挑战与评估

Pei-Chi Pan, Yingbin Liang, Sen Lin

机构 * University of Houston(得克萨斯大学) The Ohio State University(俄亥俄州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 本文探讨了奖励建模在提升LLM推理性能中的关键作用,提出了一种以推理为中心的分类视角,分析了奖励机制、奖励黑客问题及评估挑战,旨在构建更稳健、可验证的推理模型。

Comments Accepted at Transactions on Machine Learning Research (TMLR), 2026. https://openreview.net/forum?id=TDfrN1TbGH

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28164 2026-06-29 cs.CV cs.LG 新提交 79%

EchoSonar-R: A Multi-View Reasoning-Enabled Model for Disease Classification and Report Generation in Echocardiography

EchoSonar-R: 一种用于超声心动图疾病分类和报告生成的多视图推理增强模型

Darya Taratynova, Ahmed Aly, Numan Saeed, Mohammad Yaqub

机构 * Division of Computing and Mathematical Sciences, Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学计算与数学科学系,阿布扎比,阿联酋)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 提出EchoSonar-R,一种结合时空视频编码器和结构感知心脏检测器的多视图推理视觉语言模型,通过两阶段训练(监督微调+组相对策略优化)联合实现多标签疾病分类和报告生成,在私有数据集和公共基准上分别提升宏平衡准确率17.1%和6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27981 2026-06-29 cs.CL 新提交 79%

ToxiREX: A Dataset on Toxic REasoning in ConteXt

ToxiREX: 上下文中的有毒推理数据集

Stefan F. Schouten, Ilia Markov, Piek Vossen

机构 * Vrije Universiteit Amsterdam(瓦赫宁海姆自由大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出ToxiREX多语言数据集,基于有毒推理模式标注Reddit评论的隐式上下文毒性,并建立基线模型评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 79%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03180 2026-06-29 cs.CL 79%

BengaliMoralBench: A Benchmark for Auditing Moral Reasoning in Large Language Models within Bengali Language and Culture

BengaliMoralBench:一种用于审计大型语言模型道德推理的基准,针对孟加拉语和文化

Shahriyar Zaman Ridoy, Azmine Toushik Wasi, Koushik Ahamed Tonmoy, Taki Hasan Rafi, Dong-Kyu Chae

机构 * North South University(北南大学) Computational Intelligence and Operations Laboratory(计算智能与运营实验室) Hanyang University(翰林大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出BengaliMoralBench,一个针对孟加拉语和文化背景的道德推理评估基准,涵盖五个道德领域,通过三种伦理框架进行标注,评估不同模型的性能差异及文化适应性问题。

Comments Accepted at ACM FAccT 2026

Journal ref ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26794 2026-06-26 cs.CV cs.AI 新提交 79%

ReasonCLIP-58M: Visually Grounded Commonsense Reasoning Supervision for CLIP

ReasonCLIP-58M: CLIP的视觉基础常识推理监督

Sicheng Zhang, Muzammal Naseer, Binzhu Xie, Naufal Suryanto, Shi Qiu, Jamal Bentahar, Naveed Akhtar, Mubarak Shah

机构 * Khalifa University(卡利法大学) University of Western Australia(西澳大学) The Chinese University of Hong Kong(香港中文大学) University of Melbourne(墨尔本大学) University of Central Florida(佛罗里达中央大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ReasonCLIP-58M框架,通过两阶段策略将大规模推理监督集成到CLIP模型中,构建ReasonLite-42M和ReasonPro-16M数据集及RCLIP-Bench基准,提升视觉基础常识推理和零样本检索性能。

Comments Accepted to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26466 2026-06-26 cs.CL 新提交 79%

Soft Token Alignment for Cross-Lingual Reasoning

跨语言推理的软令牌对齐

Jiayi He, Jungsoo Park, Wei Xu, Alan Ritter

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SOLAR方法,通过软令牌对齐跨语言表示,提升多语言推理准确率,尤其对低资源语言效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 79%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25757 2026-06-25 cs.CL 新提交 79%

OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning

OPERA: 通过基于客观困惑度的强化学习对齐开放式推理

Wenxuan Jiang, Zining Fan, Zijian Zhang, Xuecheng Wu, Hongming Tan, Haoyang Dai, Xiaoyu Li, Xuezhi Cao, Ninghao Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Meituan Longcat Team(美团龙猫团队) Peking University(北京大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出OPERA方法,利用困惑度动态作为内在奖励信号,结合冷启动数据合成和困惑度优先的推理轨迹选择,实现开放式任务中对齐,在Qwen3-8B上达到开源模型最优。

Comments 21 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24636 2026-06-24 cs.AI 新提交 79%

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning

CineCap: 基于时空锚点的结构化推理用于电影化视频描述

Xinyu Mao, Yuhui Zeng, Xiaokun Liu, Wenyu Qin, Meng Wang, Xin Tao, Pengfei Wan, Xiaohan Xing, Max Meng

机构 * The Chinese University of Hong Kong(香港中文大学) Xiamen University(厦门大学) Kling Team, Kuaishou Technology(快手科技Kling团队) National University of Singapore(新加坡国立大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CineCap框架,通过时空锚点结构化推理和强化学习(覆盖完整性、准确性和门控覆盖奖励)生成电影化视频描述,在CineCap Bench基准上达到新最优。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24526 2026-06-24 cs.CL 新提交 79%

AGORA: An Archive-Grounded Benchmark for Agentic Workplace Document Reasoning

AGORA:基于档案的智能体工作场所文档推理基准

Honglin Guo, Qi Zhang, Yu Zhang, Weijie Li, Rui Zheng, Zhikai Lei, Qiyuan Peng, Zhiheng Xi, Tao Gui, Qi Zhang

机构 * Fudan University(复旦大学) Zhejiang University(浙江大学) Shanghai Qiji Zhifeng Co., Ltd.(上海奇绩智峰有限公司)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出AGORA基准,包含362个问题、8个领域共9664份真实文档(3.72亿词元),要求智能体在超大档案中主动搜索稀疏证据并推理答案,最强模型准确率仅59.4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23716 2026-06-24 cs.CY cs.AI 新提交 79%

Legal Reasoning Is Not Lawyering: Rethinking Legal Benchmarks for Pro Se Access to Justice

法律推理不是律师工作:重新思考面向自助诉讼的司法基准

Andrew Lou, David Shin

机构 * Yale Law School, USA(耶鲁法学院,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文指出当前法律AI基准仅评估专家预处理后的输入,忽略了自助诉讼者提供的杂乱、有误的提示,导致模型性能高估;通过实验展示上下界差距,呼吁建立直接衡量鲁棒性的基准。

Comments Both authors contributed equally. Accepted to the AI4Law Workshop at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23687 2026-06-23 cs.CL 新提交 79%

Randomized YaRN Improves Length Generalization for Long-Context Reasoning

随机化 YaRN 提升长上下文推理的长度泛化能力

Manas Mehta, Fangcong Yin, Greg Durrett

机构 * New York University(纽约大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出随机化 YaRN 方法,通过结合 YaRN 位置外推、随机位置编码和长度课程,在短上下文训练数据上提升模型对长上下文(16K-128K)的推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23678 2026-06-23 cs.CV cs.AI 新提交 79%

AIR: Adaptive Interleaved Reasoning with Code in MLLMs

AIR: MLLMs中的自适应交错推理与代码

Cong Han, Xiaohan Lan, Haibo Qiu, Yujie Zhong

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出自适应交错推理框架AIR,通过强化学习训练代码增强的复杂数值计算任务,采用分组约束奖励函数和两阶段数据构建,使性能平均提升6.1个百分点。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23092 2026-06-23 cs.CL 新提交 79%

PIVOTSBench: Evaluating Fine-Grained Interpersonal Relationship Reasoning in Multimodal Large Language Models

PIVOTSBench:评估多模态大语言模型中的细粒度人际关系推理

Shuxiang Zhang, Yiting Yin, Wenxuan Song, Yuhang Wu, Miao Liu

机构 * Sun Yat-sen University(中山大学) University of Michigan(密歇根大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出PIVOTS基准,基于Social-IQ 2.0和YouTube数据,评估多模态大语言模型在心理学研究基础上预测双向人际关系维度的能力,并包含辅助任务分析关键视觉线索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21618 2026-06-23 cs.CL 新提交 79%

CulMind: Benchmarking Multimodal Understanding and Reasoning in Chinese Cultural Heritage

CulMind:中国文化遗产中的多模态理解与推理基准

Zhangwei Cao, Shuhan Fan, Yuting Wei, Jiajun Zhang, Yihang Peng, Qi Meng, Yangfu Zhu, Liangbin Yang

机构 * University of International Relations(国际关系学院) Kedge Business School(凯致商学院) Peking University(北京大学) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Capital Normal University(首都师范大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对现有基准忽视推理过程的问题,提出CulMind和CulMind-R基准,涵盖50个任务和24个推理子任务,并设计ReaScore指标评估推理质量,揭示答案与推理之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17642 2026-06-23 cs.AI 新提交 79%

FinAcumen: Financial Multimodal Reasoning via Self-Evolving Experience Memory Harness

FinAcumen: 通过自演化经验记忆实现的金融多模态推理

Pianran Guo, Pengcheng Zhou, Yucheng Jian, Shuhua Chen, Zhonfliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FinAcumen框架,通过选择性经验记忆机制增强工具增强型多模态推理,在四个金融基准上持续提升冻结的8B视觉语言模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13020 2026-06-23 cs.AI 新提交 79%

SciR: A Controllable Benchmark for Scientific Reasoning in LLMs

SciR: 面向LLM科学推理的可控基准

Pierre Beckmann, Marco Valentino, Andre Freitas

机构 * Idiap Research Institute(Idiap研究 institute) EPFL(瑞士联邦理工学院) School of Computer Science, University of Sheffield(谢菲尔德大学计算机科学学院) University of Manchester(曼彻斯特大学) National Biomarker Centre, CRUK Manchester Institute(国家生物标志物中心,CRUK曼彻斯特研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出SciR基准,通过形式对象生成可验证的多范式科学推理任务,并控制信息提取和推理难度两个维度,揭示LLM在科学推理中的弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08425 2026-06-23 cs.SD cs.CL eess.AS 新提交 79%

TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints

TinyGiantALM:面向资源约束下意图感知推理的紧凑型音频-语言模型

Vinh-Thuan Ly

机构 * University of Science, VNU-HCM(胡志明市国立大学下属理科大学) Vietnam National University, Ho Chi Minh City(胡志明市国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出紧凑型1.5B参数音频-语言模型TinyGiantALM,通过指令感知特征精炼框架(查询引导投影器+语义门控)过滤用户意图相关声学信号,在MMAR基准上零样本准确率46.4%,超越7B-13B基线,并优于8倍大模型。

Comments Accepted to Interspeech 2026. Project page: https://interspeech-tinygiant-alm.vercel.app

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04619 2026-06-23 cs.AI cs.LO 版本更新 79%

A Four-Valued Normative Intermediate Representation for ASP-Oriented Compliance Reasoning

基于ASP的合规推理的规范性中间表示

Huanyu Yang, Yangfan Wu, Jianmin Ji

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MONIR,一种用于ASP合规推理的模态化输出规范性中间表示,通过分阶段操作语义和可执行编译,结合LLM辅助流程应用于中国ADAS法规,并评估提取质量与模块化增量求解效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新 79%

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24776 2026-06-23 cs.CL 79%

Compute-Accuracy Pareto Frontiers for Open-Source Reasoning Large Language Models

开源推理大语言模型的计算-准确率帕累托前沿

Ákos Prucs, Nara Csutora, Mátyás Antal, Márk Marosi

机构 * E-Group Research(E-Group研究) Budapest University of Technology and Economics(布达佩斯技术大学和经济学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究了开源大语言模型在数学和推理任务中的计算与准确率平衡,发现MoE架构在性能和效率上表现优异,并揭示了计算资源与准确率增长的关系趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏