arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 102 篇

2605.10597 2026-05-12 cs.SE cs.AI 57%

CrackMeBench: Binary Reverse Engineering for Agents

CrackMeBench:用于代理的二进制逆向工程

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 CrackMeBench旨在评估语言模型代理在教育类CrackMe逆向工程任务中的能力,通过确定性二进制验证问题,结合公开校准CrackMe和生成任务,测试代理在无网络LinuxDocker沙箱中的表现,提供可重复的测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10397 2026-05-12 cs.CV cs.AI 57%

AnomalyClaw: A Universal Visual Anomaly Detection Agent via Tool-Grounded Refutation

AnomalyClaw:通过工具引导的反驳实现通用视觉异常检测代理

Xi Jiang, Yinjie Zhao, Zesheng Yang, Feng Zheng

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology (SUSTech), Shenzhen, China(南方科技大学计算机科学与工程系,深圳,中国) School of EEE, Nanyang Technological University (NTU), Singapore(南洋理工大学电子工程学院,新加坡) CFAR, Agency for Science, Technology and Research (A*STAR), Singapore(科技研究局(A*STAR)的CFAR,新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出AnomalyClaw,一种无需训练的视觉异常检测代理,通过多轮反驳过程提升异常判断。在CrossDomainVAD-12基准上,AnomalyClaw在多个模型上均取得显著提升,且引入自演化扩展提升模型性能。

Comments We release the agent, the benchmark, and the analysis artifacts at https://github.com/jam-cc/AnomalyClaw

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10339 2026-05-12 cs.CL 57%

An Annotation Scheme and Classifier for Personal Facts in Dialogue

对话中个人事实的标注方案与分类器

Konstantin Zaitsev

机构 * HSE University(俄罗斯莫斯科高等经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出改进的个人事实分类标注方案,引入新类别和属性以提升对话系统中的事实存储与过滤能力,并训练多头分类器,实现81.6%的宏F1分数,优于现有基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 57%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28902 2026-05-12 cs.AI 57%

ChartDiff: A Large-Scale Benchmark for Comprehending Pairs of Charts

ChartDiff:一种大规模的图表对理解基准

Rongtian Ye

机构 * Department of Computer Science, Aalto University(阿尔托大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ChartDiff,首个大规模多图表对比总结基准,通过8541对图表数据评估不同模型,揭示通用模型与专用模型在对比总结中的性能差异。

Comments 21 pages, 17 figures, accepted to ACL 2026: the 4th Workshop on Advances in Language and Vision Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22963 2026-05-12 cs.RO cs.AI 57%

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

通过自由形式语言控制人形机器人:一个统一动作词汇的大型语言动作模型

Zhirui Liu, Kaiyang Ji, Ke Yang, Yahao Fan, Jingyi Yu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出Humanoid-LLA模型,通过统一的人形机器人动作词汇解决语言与动作数据稀缺及物理稳定性问题,实现自由语言指令到全身动作的直接转换,提升人形机器人在真实环境中的泛化能力和动作多样性。

Comments Project page: https://humanoidlla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.18923 2026-05-12 cs.CL 57%

Holmes: A Benchmark to Assess the Linguistic Competence of Language Models

Holmes:一个评估语言模型语言能力的基准

Andreas Waldis, Yotam Perlitz, Leshem Choshen, Yufang Hou, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Technical University of Darmstadt(达姆施塔特技术大学) Information Systems Research Lab(信息系统研究实验室) Lucerne University of Applied Sciences and Arts(卢塞恩应用科学与艺术大学) IBM Research AI(IBM AI研究部) MIT CSAIL(MIT CSAIL实验室) MIT-IBM Watson AI Lab(MIT-IBM沃森AI实验室) IBM Research Europe - Ireland(IBM欧洲爱尔兰研究部)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Holmes基准通过分类器探测方法评估语言模型对语法、形态学等语言现象的理解,发现模型大小、架构和指令微调显著影响性能,提出FlashHolmes提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10038 2026-05-12 cs.AI 57%

TimeClaw: A Time-Series AI Agent with Exploratory Execution Learning

TimeClaw: 一种具备探索性执行学习的时间序列AI代理

Hangchen Liu, Dongyuan Li, Renhe Jiang, Jiewen Deng, Weiwei Ye, Yoshihide Sekimoto

机构 * The University of Tokyo(东京大学) Southern University of Science and Technology(南方科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 TimeClaw通过探索-比较-蒸馏-再注入四阶段循环,提升时间序列任务的探索性执行学习能力,在金融和天气预测中取得一致优势。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09295 2026-05-12 cs.CL 57%

LEAF-SQL: Level-wise Exploration with Adaptive Fine-graining for Text-to-SQL Skeleton Prediction

LEAF-SQL: 基于分层探索与自适应细化的文本到SQL骨架预测

Zhao Tan, Xiping Liu, Qing Shu, Qizhi Wan, Dexi Liu, Changxuan Wan

机构 * School of Computing(计算学院) Artificial Intelligence(人工智能) Jiangxi University of Finance(江西财经大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LEAF-SQL通过分层探索与自适应细化方法,提升复杂SQL生成性能,实验表明其在BIRD基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11087 2026-05-12 cs.LG 57%

CausalGaze: Unveiling Hallucinations via Counterfactual Graph Intervention in Large Language Models

CausalGaze: 通过反事实图干预揭示大语言模型的幻觉

Linggang Kong, Lei Wu, Yunlong Zhang, Xiaofeng Zhong, Zhen Wang, Yongjie Wang, Yao Pan

机构 * College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Anhui Province Key Laboratory of Cyberspace Security Situation Awareness and Evaluation(安徽省网络空间安全态势感知与评估重点实验室) Institute of Computer Application, China Academy of Engineering Physics(中国工程物理研究院计算机应用研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 CausalGaze通过反事实图干预揭示大语言模型的幻觉,利用结构因果模型提升模型可解释性,在四个数据集和三个常用LLM上实验表明其有效性,尤其在TruthfulQA数据集上比现有方法提升3.3%的AUROC。

Comments Accepted as ACL2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02954 2026-05-12 cs.SD cs.AI 57%

The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models

世界并非单一声场:为大型音频-语言模型启用空间理解

Yuhuan You, Lai Wei, Xihong Wu, Tianshu Qu

机构 * School of Intelligence Science and Technology(智能科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出TWNM框架,通过物理基础的FOA模拟和元数据引导训练,实现音频场景分析的三层次能力,提升空间音频语言理解的准确性和可审计性。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09222 2026-05-12 cs.DB cs.AI cs.SE 57%

Detect, Localize, and Explain: Interactive Hierarchical Log Anomaly Analytics with LLM Augmentation

检测、定位与解释:基于LLM增强的交互式分层日志异常分析

Lei Ma, Suhani Chaudhary, Ethan Shanbaum, Athanasios Tassiadamis, Peter M. VanNostrand, Dennis M. Hofmann, Haowen Xu, Elke Rundensteiner

机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09152 2026-05-12 cs.CL q-bio.NC 57%

Meow-Omni 1: A Multimodal Large Language Model for Feline Ethology

Meow-Omni 1:用于猫类行为学的多模态大语言模型

Jucheng Hu, Zhangquan Chen, Yulin Chen, Chengjie Hong, Liang Zhou, Tairan Wang, Sifei Li, Giulio Zhu, Feng Zhou, Yiheng Zeng, Suorong Yang, Dongzhan Zhou

机构 * University College London(伦敦大学学院) Tsinghua University(清华大学) Nanjing University(南京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 Meow-Omni 1通过融合视频、音频和生理时间序列数据,实现对动物意图的精准识别,其在MeowBench基准测试中达到71.16%的准确率,推动了跨物种意图理解及基础模型在兽医诊断和野生动物保护中的应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08942 2026-05-12 cs.CL 57%

Decomposing and Steering Functional Metacognition in Large Language Models

分解与引导大型语言模型中的功能元认知

Yanshi Li, Xueru Bai, Shuman Liu, Haibo Zhang, Anxiang Zeng

机构 * Shopee Shanghai China(Shopee上海中国) Shopee Beijing China(Shopee北京中国) Shopee Singapore Singapore(Shopee新加坡新加坡)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究通过分析大型语言模型的内部激活,揭示功能元认知状态的可分解性,并展示如何通过引导激活方向来调控推理行为。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08941 2026-05-12 cs.AI 57%

MDGYM: Benchmarking AI Agents on Molecular Simulations

MDGYM:在分子模拟上评估AI代理的基准测试

Vinay Kumar, Satyendra Rajput, Mausam, N. M. Anoop Krishnan

机构 * Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里人工智能学院) Department of Computer Science and Engineering, Indian Institute of Technology Delhi(印度理工学院德里计算机科学与工程系) Department of Civil and Environmental Engineering, Indian Institute of Technology Delhi(印度理工学院德里土木与环境工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过MDGYM基准测试,评估了AI代理在分子动力学模拟中的表现,发现现有代理在物理推理方面存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08905 2026-05-12 cs.AI 57%

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

Forge:面向NP难优化问题的质量感知强化学习

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen

机构 * Tongji University(同济大学) Shanghai AI Lab(上海人工智能实验室) Zhejiang University(浙江大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OPT-BENCH框架,通过质量感知强化学习提升大语言模型在NP难优化问题上的表现,实验表明其在多个任务上均优于现有模型,且任务多样性对泛化能力影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08533 2026-05-12 cs.AI 57%

Human-LLM Dialogue Improves Diagnostic Accuracy in Emergency Care

人类与大语言模型对话提高急诊护理的诊断准确性

Burcu Sayin, Ngoc Vo Hong, Ipek Baris Schlicht, Jacopo Staiano, Pasquale Minervini, Sara Allievi, Nicola Susca, Nicola Osti, Alberto Maino, Vito Racanelli, Andrea Passerini

机构 * Department of Information Engineering and Computer Science, University of Trento(特伦托大学信息工程与计算机科学系) Department of Medicine, Azienda Sanitaria Universitaria Integrata del Trentino (ASUIT)(特伦托大学整合卫生机构医学部) Center for Medical Sciences (CISMed), University of Trento(特伦托大学医学科学中心) Universitat Politècnica de València(瓦伦西亚理工大学) The University of Edinburgh(爱丁堡大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究探讨人类与大语言模型对话在急诊护理中的应用,通过对比基线和AI辅助会话,发现住院医师在复杂病例中的诊断准确性显著提升,且交互式LLM支持显著增强了诊断推理能力。

Comments Paper under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08503 2026-05-12 cs.CL cs.CY cs.HC 57%

NARRA-Gym for Evaluating Interactive Narrative Agents

NARRA-Gym用于评估交互叙事代理

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong He, Zhengqing Yuan, Yujun Zhou, Kehan Guo, Chaoran Chen, Toby Jia-Jun Li, Stefan Feuerriegel, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) University of Pennsylvania(宾夕法尼亚大学) Lehigh University(莱恩大学) Massachusetts Institute of Technology(麻省理工学院) Bake AI UC Santa Barbara(加州大学圣芭芭拉分校) University of Washington(华盛顿大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL

AI总结 本文提出NARRA-Gym,一个可执行评估环境,用于评估LLM在多轮交互中生成连贯故事的能力,通过模拟情感种子生成完整故事并记录完整模型在环轨迹,验证了不同模型在故事质量、鲁棒性和用户适应性上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG 57%

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12606 2026-05-12 cs.LG 57%

RelBench v2: A Large-Scale Benchmark and Repository for Relational Data

RelBench v2:关系数据的大型基准和存储库

Justin Gu, Rishabh Ranjan, Charilaos Kanatsoulis, Haiming Tang, Martin Jurkovic, Valter Hudovernik, Mark Znidar, Pranshu Chaturvedi, Parth Shroff, Fengyu Li, Jure Leskovec

机构 * Stanford University(斯坦福大学) National University of Singapore(新加坡国立大学) University of Ljubljana(卢布尔雅那大学) Kumo AI University of Oxford(牛津大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 RelBench v2引入了四个大规模关系数据集,扩展了基准测试,并引入了自动补全任务,展示了关系学习模型在多表预测中的优势。

Comments Published at ICLR 2026. Website: https://relbench.stanford.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20909 2026-05-12 cs.CL 57%

LogitTrace: Detecting Benchmark Contamination via Layerwise Logit Trajectories

LogitTrace:通过层间logit轨迹检测基准污染

Zirui He, Haiyan Zhao, Yingcong Li, Ali Payani, Mengnan du

机构 * New Jersey Institute of Technology(新泽西理工学院) Cisco Research(思科研究) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出LogitTrace框架,通过分析中间logit轨迹检测记忆化决策动态,发现污染样本更早承诺,而干净样本证据积累更渐进,帮助区分污染与干净样本。

Comments 23pages, 10 figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08441 2026-05-12 q-bio.QM cs.CE cs.LG 57%

SpectraLLM: Uncovering the Ability of LLMs for Molecular Structure Elucidation from Multi-Spectral Data

SpectraLLM:从多光谱数据中揭示LLMs对分子结构解析的能力

Yunyue Su, Jiahui Chen, Zao Jiang, Zhenyi Zhong, Liang Wang, Qiang Liu, Zhaoxiang Zhang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences (CASIA)(模式识别新技术实验室,自动化研究所,中国科学院) The Hong Kong Polytechnic University(香港理工大学) Tianjin University Peiyangyuan Campus(天津大学-pieceyang Campus)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SpectraLLM通过多光谱数据端到端预测分子结构,优于传统方法,具有鲁棒性和跨模态推理能力。

Comments 42 pages, 6 figures, 30 tables; Accepted to ICLR 2026

Journal ref Proceedings of the 14th International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.01307 2026-05-12 cs.SE cs.AI 57%

Document Retrieval Augmented Fine-Tuning (DRAFT) for safety-critical software assessments

用于安全关键软件评估的文档检索增强微调(DRAFT)

Regan Bolton, Mohammadreza Sheikhfathollahi, Simon Parkinson, Vanessa Vulovic, Gary Bamford, Dan Basher, Howard Parkinson

机构 * Digital Transit Limited, 3M Buckley Innovation Centre, UK, HD1 3BD(数字交通有限公司,3M Buckley创新中心,英国,HD1 3BD) Department of Computer Science, University of Huddersfield, UK, HD1 3DH(计算机科学系,赫德瑟菲尔德大学,英国,HD1 3DH)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出DRAFT方法,通过引入双检索架构和半自动化数据集生成,提升大型语言模型在安全关键合规评估中的准确性与证据处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08366 2026-05-12 cs.LG cs.SE 57%

SWE Atlas: Benchmarking Coding Agents Beyond Issue Resolution

SWE Atlas:超越问题解决的编码代理基准测试

Mohit Raghavendra, Soham Dan, Miguel Romero Calvo, Yannis Yiming He, Johannes Baptist Mols, Gautam Anand, Cole McCollum, Edgar Arakelyan, Vijay Bharadwaj, Andrew Park, Jeff Da, MohammadHossein Rezaei, Bing Liu, Brad Kenstler, Yunzhong He

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 SWE Atlas通过涵盖代码库问答、测试编写和重构三个软件工程流程,提供了一种新的基准测试套件,评估编码代理的正确性和工程质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08175 2026-05-12 cs.CV cs.AI 57%

KARMA-MV: A Benchmark for Causal Question Answering on Music Videos

KARMA-MV:音乐视频上的因果问答基准

Archishman Ghosh, Abhinaba Roy, Dorien Herremans

机构 * AMAAI Lab, Singapore University of Technology and Design(新加坡科技设计大学AMAAI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 KARMA-MV是一个基于2682个YouTube音乐视频构建的大规模多选问答数据集,旨在测试模型整合时序音频视觉线索和视觉到音乐影响的能力,通过因果知识图谱方法提升音乐视频因果推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08113 2026-05-12 cs.LG cs.CV 57%

Do Foundation Model Embeddings Improve Cross-Country Crop Yield Generalisation? A Leave-One-Country-Out Evaluation in Sub-Saharan Africa

基础模型嵌入是否能提升跨国家作物产量泛化?一种留一国家法的撒哈拉以南非洲评估

Yaw Osei Adjei

机构 * Department of Computer Science, Kwame Nkrumah University of Science and Technology(计算机科学系,库马西技术科学大学)

专题命中 推理评测 :planning(abstract);分类 cs.LG

AI总结 本文评估了地理空间基础模型嵌入在留一国家法交叉验证中的表现,发现跨国家预测效果不佳,主要受限于产量分布差异。

Comments 9 pages, 10 figures, appendix, code and processed results released publicly

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10904 2026-05-12 cs.RO 50%

MDrive: Benchmarking Closed-Loop Cooperative Driving for End-to-End Multi-agent Systems

MDrive:端到端多智能体系统的闭环协作驾驶基准测试

Marco Coscoy, Zewei Zhou, Seth Z. Zhao, Henry Wei, Angela Magtoto, Johnson Liu, Rui Song, Walter Zimmer, Zhiyu Huang, Chen Tang, Bolei Zhou, Jiaqi Ma

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :planning(abstract)

AI总结 MDrive基准测试通过225个基于NHTSA预碰撞类型和真实V2X数据的场景,评估多智能体系统在闭环驾驶中的性能,发现多智能体系统在规划方面通常优于单智能体系统,但面临感知共享和协商在复杂交通中的挑战。

Comments website:https://mdrive-challenge.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10858 2026-05-12 cs.CV cs.RO 50%

Is Your Driving World Model an All-Around Player?

你的驾驶世界模型是全能选手吗?

Lingdong Kong, Ao Liang, Tianyi Yan, Hongsi Liu, Wesley Yang, Ziqi Huang, Xian Sun, Wei Yin, Jialong Zuo, Yixuan Hu, Dekai Zhu, Dongyue Lu, Youquan Liu, Guangfeng Jiang, Linfeng Li, Xiangtai Li, Long Zhuo, Lai Xing Ng, Benoit R. Cottereau, Changxin Gao, Liang Pan, Wei Tsang Ooi, Ziwei Liu

专题命中 推理评测 :planning(abstract)

AI总结 本文提出WorldLens基准测试,评估驾驶世界模型在视觉和行为真实性方面的综合表现,揭示现有模型在不同维度上的不足,并引入WorldLens-26K和WorldLens-Agent提升评估的可解释性。

Comments CVPR 2026 VideoWorldModel Workshop; Project Page at https://worldbench.github.io/worldlens GitHub at https://github.com/worldbench/WorldLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10434 2026-05-12 cs.CV 50%

WorldReasonBench: Human-Aligned Stress Testing of Video Generators as Future World-State Predictors

WorldReasonBench: 视频生成器作为未来世界状态预测器的人类对齐压力测试

Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao Yang, Sudong Wang, Sicong Jiang, Haowei Zhu, Zihan Wang, Ping Nie, Wenhu Chen, Bin Wang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 推理评测 :reasoning(abstract)

AI总结 WorldReasonBench通过结构化地面真实QA注释,测试视频生成器能否在物理、社会、逻辑和信息层面保持一致性。该基准包含436个测试案例和22个子类别,结合人类对齐的两阶段方法评估生成视频的质量。

Comments Project Page: https://unix-ai-lab.github.io/WorldReasonBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10251 2026-05-12 cs.CV 50%

Efficient Hybrid CNN-GNN Architecture for Monocular Depth Estimation

高效混合CNN-GNN架构用于单目深度估计

Ishan Narayan

机构 * IMCS Lab, CSIR-CSIO(IMCS实验室,CSIR-CSIO)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出GraphDepth架构,通过在卷积编码器-解码器框架中整合图神经网络,有效建模长距离空间关系,提升单目深度估计的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏