arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 996 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 996 篇

2608.07982 2026-08-11 cs.CV 新提交 50%

AdaDINO: Pair-Aware In-Backbone Adaptation of Frozen DINO for Efficient Remote Sensing Change Detection

AdaDINO:用于高效遥感变化检测的冻结DINO的成对感知骨干内适配

Xu Zhang, Xinqing Li, Jianpeng Xie, Zeshuai Zhu, Xin He, Yun Liu

专题命中 推理评测 :reasoning(abstract)

AI总结 AdaDINO是一种成对感知的骨干内适配框架,通过CGLA、BSCS和CPGR模块优化冻结DINO,在4个遥感变化检测基准上实现了高效且性能更优的变化检测,在SYSU-CD上F1达85.29%且吞吐量提升1.41倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06862 2026-08-10 cs.CR 新提交 50%

SynChain: Inducing Computer-Use Agent Systems to Construct Their Own Attack Chains

SynChain:诱导计算机使用智能体系统构建自身攻击链

Fuyao Zhang, Jiaming Zhang, Che Wang, Boyang Chen, Yurong Hao, Xiongtao Sun, Guowei Guan, Blaise Delattre, Yang Cao, Wei Yang Bryan Lim

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出SynChain攻击范式,通过定向监督微调诱导计算机使用智能体构建含恶意内容的良性制品,在多模型多防御设置下实现高攻击成功率,揭示需对智能体跨任务执行轨迹做来源感知推理以保障安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06126 2026-08-07 cs.CV 新提交 50%

Patient Pose Assessment Using a CT-Based Framework for Synthetic Data Generation

基于CT合成数据生成框架的患者姿态评估

Manuel Laufer, Dominik Mairhöfer, Malte Sieren, Hauke Gerdes, Fabio Leal dos Reis, Arpad Bischof, Thomas Käster, Erhardt Barth, Jörg Barkhausen, Thomas Martinetz

机构 * Institute for Neuro- and Bioinformatics, University of Lübeck(吕贝克大学神经与生物信息学研究所) University Medical Center Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医学中心) IMAGE Information Systems Europe GmbH(IMAGE信息系统欧洲有限公司) Pattern Recognition Company GmbH(模式识别有限公司)

专题命中 推理评测 :planning(abstract)

AI总结 该研究提出基于CT的合成数据生成框架,用于解决放射图像患者姿态评估中真实训练数据获取难的问题,经3077对踝关节图像预训练后,真实踝关节姿态评估性能提升最多11个百分点。

Comments Accepted for publication at the Journal of Machine Learning for Biomedical Imaging (MELBA) https://melba-journal.org/2026:027

Journal ref Machine.Learning.for.Biomedical.Imaging. 2026 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05699 2026-08-07 cs.CV 新提交 50%

TAU-Bench: From Anomaly Instance Tracking to Fine-Grained Video Anomaly Understanding

TAU-Bench:从异常实例跟踪到细粒度视频异常理解

Kepeng Yang, Dongxuan Liu, Rongxin Gao, Zixin Su, Rui Wu, Shuzhao Xie, Chenxin Li, Panwang Pan, Yuzhi Huang, Yue Huang, Jingyan Jiang

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究引入TAU-Bench这一以跟踪为核心的基准,用于联合评估异常实例跟踪与细粒度视频异常理解,发现现有视觉-语言模型存在语义推理与视觉接地的差距,为构建更可靠的视频异常理解系统提供了关键评估方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06200 2026-08-07 physics.ed-ph 新提交 50%

Using LLMs to Detect Growth in Computational Thinking in Introductory Physics

使用大型语言模型(LLMs)检测入门物理课程中计算思维的发展

Sean Savage, Anand Shanker, Grace Michlitsch, N. Sanjay Rebello

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探究用LLMs分析学生计算物理问题书面解释,发现其可复刻人工评估结果并规模化检测计算思维发展趋势,为大招生规模物理课程的CT评估提供可行方法。

Comments 1 figure, 2 tables. Submitted to Physics Education Research Conference (PERC) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05049 2026-08-06 cs.CV 新提交 50%

OmniEdit-Bench: A Comprehensive Benchmark for Instruction-based Video Editing

OmniEdit-Bench:基于指令的视频编辑综合基准

Chenxuan Miao, Yutong Feng, Yi Lu, Yunfeng Yan, Donglian Qi, Shiwei Zhang, Yu Liu, Xi Chen, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有基于指令的视频编辑基准的任务覆盖有限、指标不足的问题,OmniEdit-Bench将编辑任务分解为多维度并提出含惩罚机制的评估框架,实验显示当前IVE模型仍待提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04042 2026-08-06 cs.RO 新提交 50%

Kitchen Robotic Manipulation utilizing Foundation Models

基于基础模型的厨房机器人操作

Myung-Hwan Jeon, Sankalp Yamsani, Joohyung Kim

机构 * Kumoh National Institute of Technology(金乌国立技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :planning(abstract)

AI总结 本研究提出一种整合多种基础模型的模块化厨房机器人感知流水线,经评估优化后可在杂乱遮挡场景下实现89.12%的ADI,无需环境重训练即可完成餐具处理等家庭操作任务。

Comments Intelligent Service Robotics (ISR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03225 2026-08-05 cs.CV 新提交 50%

Open-Linguistic Concept Unified Learning for Cross-Site Interpretable Dermatology Image Diagnosis

面向跨站点可解释皮肤病图像诊断的开放语言概念统一学习

Chengyu Wu, Junpeng Tan, Wanxiang Luo, Yaqi Wang, Yandong Wen, Yefeng Zheng

专题命中 推理评测 :reasoning(abstract)

AI总结 针对现有概念模型跨站点泛化差、适配FVLMs成本高的问题,提出开放语言概念统一学习框架UniCon,通过共享语义空间等三项创新实现多模态可解释皮肤病诊断,获顶级准确率且具备跨站点干预能力。

Comments accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00761 2026-08-04 q-fin.GN q-fin.CP q-fin.PM q-fin.ST q-fin.TR 新提交 50%

AI and Exchange Rate Predictability

人工智能与汇率可预测性

Amin Izadyar

专题命中 推理评测 :reasoning(abstract)

AI总结 本文利用ChatGPT、DeepSeek等生成式AI分析经济数据,解决汇率脱钩难题,构建的交易策略夏普比率超0.7,超额回报显著,且证实泰勒规则是汇率与基本面关联的关键机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01157 2026-08-04 cs.CV 新提交 50%

InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos

InteracVid:基于直播聊天视频构建真实交互式视听响应数据集

Chi Zhang, Haoyang Shi, Yueyi Liu, Zhaokun Yan, Yishu Yin, Yuhang Wu, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院)

专题命中 推理评测 :planning(abstract)

AI总结 该研究提出首个开源大规模交互式视听数据集InteracVid,解决现有生成模型监督信号缺失问题,实验证实其可提升多模态助手的交互规划与响应生成性能,为交互式多模态生成提供关键基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00232 2026-08-04 cs.CV 新提交 50%

Real-Time Visual Obstruction Detection in Surgical Augmented Reality

手术增强现实中的实时视觉遮挡检测

Shih-Chin Yang, Yanming Xiu, Hanting Ye, Qi Chen, Elias Rotondo, Maria Gorlatova

机构 * Duke University(杜克大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对手术AR虚拟内容遮挡手术器械的问题,提出结合VLM与分割推理的延迟感知流水线,构建伪AR基准,实现87.43%准确率、479 ms延迟,较云端基线降延迟62.90%。

Comments ISMAR 2026 Mecidal Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28775 2026-08-03 cs.SE 新提交 50%

Repository-Aware Metamorphic Relation Generation for Augmented Reality Applications using Large Language Models

基于大型语言模型的增强现实应用的仓库感知变形关系生成

Dibyendu Brinto Bose, Jiawei Qin, Chris Brown

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出一种结合仓库级上下文与推理编排的流水线,利用大型语言模型生成优化的变形关系,在142个移动AR仓库数据集上验证了该方法可构建可靠的领域相关测试预言,能有效检测代码变异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28464 2026-07-31 cs.CV 新提交 50%

Can Vision-Language Models Reason about AI Edits in Images?

视觉-语言模型能否对图像中的AI编辑进行推理?

Darsha Udayanga, Pin-Yu Chen, Payel Das, Qiang Ji

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探究能否用强化学习而非显式推理监督训练视觉-语言模型推理AI图像编辑,提出基于GRPO的框架,引入eff-IoU指标,在多数据集上实现与SOTA相当的检测定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27806 2026-07-31 cs.CV 新提交 50%

LoMeVQA: A Comprehensive Benchmark for Longitudinal Medical VQA

LoMeVQA:纵向医学视觉问答综合基准

Zhilin Wu, Zhangkai Ni, Chengmei Yang, Longzhen Yang, Yihang Liu, Ying Wen, Lianghua He

机构 * Tongji University(同济大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究提出纵向医学视觉问答基准LoMeVQA,发现现有多模态大语言模型在该任务上时间推理能力不足,推出MedLong-8B实现最优性能,并开展相关分析。

Comments 23 pages, 17 figures, 7 tables. Code and data: https://github.com/pepperbubble/LoMeVQA

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27378 2026-07-31 cs.CV cs.MM 新提交 50%

PanDent: Toward Comprehensive Tooth-Level Structure-Language Consistency in Dental Radiology

PanDent:面向牙科放射学中全面的牙级结构-语言一致性

Xiaohan Li, Xinyu Liu, Chang Liu, Sum Wing Au Yeung, Jun Liu, Yixuan Yuan, Hui Chen

机构 * Faculty of Dentistry, The University of Hong Kong(香港大学牙医学院) Imperial College London(帝国理工学院) University of Science and Technology of China(中国科学技术大学) Department of Data and Systems Engineering, The University of Hong Kong(香港大学数据与系统工程系) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究推出PanDent牙科OPG基准,经实验发现现有MLLM生成的牙科报告流畅但临床一致性差,在PanDent上微调可提升其结构-语言一致性,该基准可用于评估MLLM的牙级临床推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27249 2026-07-31 cs.SE 新提交 50%

OwlPath: Lossless Knowledge Compression for LLM Bug Repair

OwlPath:面向大语言模型漏洞修复的无损知识压缩

Bo Zhang, Ren Pan, Huan Chen, Xiang Song

专题命中 推理评测 :reasoning(abstract)

AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27029 2026-07-30 cs.CY 新提交 50%

Anticipatory Data Governance in the Age of AI: Emerging Signals in Data Access, Reuse, and Sovereignty

AI时代的前瞻性数据治理:数据访问、复用与主权中的新兴信号

Adam Zable, Stefaan Verhulst

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究通过专家预测工作坊识别出AI时代数据治理的7个新兴信号及强化反馈循环,提出与多领域融合的前瞻性数据治理议程,为结构性转变提供诊断框架。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26848 2026-07-30 cs.CV 新提交 50%

ICDAR 2026 Competition on Information Extraction from Atomic Layer Deposition/Etching (ALD/E) Scientific Figures

ICDAR 2026 原子层沉积/蚀刻(ALD/E)科学图信息提取竞赛

Fahad Ahmed, Sören Auer, Jennifer D'Souza

机构 * TIB - Leibniz Information Centre for Science and Technology(蒂宾根信息中心(莱布尼茨科学技术信息中心)) L3S Research Center, Leibniz University(莱布尼茨大学L3S研究中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究介绍了ICDAR 2026 ALD/E科学图信息提取竞赛,基于Sci-ImageMiner基准数据集开展多任务评测,发现现有多模态模型在数据提取等任务中存在局限,为领域多模态AI研究提供了平台。

Comments 17 pages, 6 figures, 8 tables, to be published in ICDAR 2026 Conference Proceedings and Volume 16975 of the Lecture Notes in Computer Science series (Springer Nature)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26777 2026-07-30 cs.SE 新提交 50%

CodeSpec: Dual Executable Specifications for Agentic Long-Horizon Feature Development

CodeSpec:面向智能体长周期功能开发的双可执行规范

Peiding Wang, Li Zhang, Fang Liu, Taichuan Li, Yinghao Zhu

专题命中 推理评测 :reasoning(abstract)

AI总结 提出CodeSpec双可执行规范方法,通过配对子需求语义与仓库架构构建可靠功能链,在FeatureBench上优于基线,提升了长周期功能开发的设计与实现一致性及性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 50%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理评测 :planning(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25393 2026-07-29 cs.CV 新提交 50%

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment

迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架

Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li

机构 * East China Normal University(华东师范大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。

Comments 10 pages, accepted by ACMMM2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25346 2026-07-29 cs.IR 新提交 50%

The Case Against Generation for Retrieval: Discriminative Language Models as Effective Retrievers

反对用于检索的生成式模型:判别式语言模型作为有效的检索器

Zhe Xu, Prachi Agrawal, Kavosh Asadi, Tianyi Chen, Carl Hu, Justin Johnson, Wuwei Lan, Mingfu Liang, Xi Liu, Tik On Lui, Oladipo Ositelu, Sandeep Pandey, Ankit Peshin, Feng Qi, Anil Ramakrishna, Kaushik Rangadurai, Frank Shyu, Luke Simon, Yang Yang, Chiyu Zhang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究探讨大语言模型用于检索的问题,通过将其作为语义表示主干重振双塔检索架构,引入创新的双塔框架,经实验评估,该架构在公共基准和生产系统中表现出色,证明传统双塔范式结合现代学习后在工业检索中仍具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25151 2026-07-29 cs.IR 新提交 50%

HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research

HiEviDR-Bench:深度研究中分层证据聚合的基准测试

Yubo Sun, Chunyi Peng, Yukun Yan, Zhenghao Liu, Sen Mei, Bangrui Xu, Xuanhe Zhou, Chi Chen, Maosong Sun

专题命中 推理评测 :reasoning(abstract)

AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。

Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24957 2026-07-29 cs.CV 新提交 50%

PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models

感知基准:评估多模态大语言模型中的原子视觉感知

Zichao Lin, Yifeng Xie, Bowen Qu, Haiming Wang, Jia Li, Haoning Wu, Yuhao Dong, Zuhao Yang, Jinguo Zhu, Haoyu Lu, Zijia Zhao, Tongtian Yue, Zhangyang Qi, Junwei Yang, Mengfan Dong, Peizhou Cao, Chenzhuang Du, Zaida Zhou, Haotian Yao, Hao Yang, Hongcheng Gao, Lin Sui, Weihong Li, Xinxing Zu, Jia Chen, Yao Wang, Xiaoxue Wu, Yalin Wang, Y. Charles, Yiping Bao, Yangyang Liu, Zhiqi Huang, Xinyu Zhou

机构 * Moonshot AI(登月人工智能)

专题命中 推理评测 :reasoning(abstract)

AI总结 介绍用于评估多模态大语言模型原子视觉感知能力的PerceptionBench基准,通过自下而上方法构建错误分类法及相关问题,测试16个前沿模型,发现原子感知待解决,该基准为衡量MLLM视觉感知边界提供标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23972 2026-07-28 cs.CV 新提交 50%

Color Fundus Photography Analysis: Co-evolution of Data, Preprocessing, and Modeling toward Multimodal AI

彩色眼底摄影分析:数据、预处理和建模向多模态人工智能的共同进化

Yu Li, Wengan He, Wenhui Xu, Lihong Jiang, Fan Xiao, Zhuohang Huang, Yuanzhu Liang, Jiayi Liu, Yuxi Chen, Yongsheng Luo

专题命中 推理评测 :reasoning(abstract)

AI总结 研究彩色眼底摄影分析中数据、预处理和建模的共同进化,通过数据集进化、预处理范式和建模框架的相互作用进行综合概述,指出未来进展取决于三者协同优化,为临床部署等提供路线图。

Comments Survey paper, 77 pages, 18 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23920 2026-07-28 cs.CV 新提交 50%

What Can I Edit? Open-Ended Strategy Discovery and the Emotion Editability Landscape

我能编辑什么?开放式策略发现与情感可编辑性景观

Qing Li, Zeyu Dong, Yin Cui, Chuan Yan, Xiaojiang Peng

机构 * School of Artificial Intelligence, Shenzhen Technology University(深圳技术大学人工智能学院) School of Innovation Design, Shenzhen Technology University(深圳技术大学创新设计学院) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究情感图像编辑,EmoScope多智能体框架将任务转变为‘能编辑什么’,先发现可编辑空间,再平衡内容与情感,通过情感条件作用的可供性推理选择策略,在大规模评估中受青睐,还指出相关指标盲点及优势变化情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23355 2026-07-28 cs.SE 新提交 50%

Enhancing Code Understanding for Impact Analysis by Combining Transformers and Program Dependence Graphs

通过结合Transformer和程序依赖图增强代码理解以进行影响分析

Yanfu Yan, Nathan Cooper, Kevin Moran, Gabriele Bavota, Denys Poshyvanyk, Steve Rich

专题命中 推理评测 :reasoning(abstract)

AI总结 研究针对影响分析这一软件维护任务,提出Athena方法,结合软件系统依赖图信息与概念耦合方法,无需更改历史和执行信息。构建新基准测试,实验表明该方法在新基准上表现出色,比简单基线有显著性能提升。

Comments Accepted to FSE'24

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 50%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21072 2026-07-24 cs.CV 新提交 50%

Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text

展示而非讲述:在生成像素而非语言模型文本中评估空间认知

Xu Wang, Kaixiang Yao, Miao Pan, Xiaohe Zhou, Xuanyu Liu, Wenqi Zhang, Xuhong Zhang

机构 * Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究图像生成模型空间认知评估问题,提出ProVisE框架及SpatialGen - Bench基准,通过统一设置评估相关模型,发现图像生成模型在像素空间直接外化答案时有竞争力,文本输出语言模型在组合空间推理中有优势,揭示了两者互补优势并建立测试平台。

Comments 36 pages, 14 figures. Project page: https://zju-omniai.github.io/ProVisE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21071 2026-07-24 cs.CV cs.MM cs.RO 新提交 50%

TransBiolab: A Real-World Multi-View Dataset of Cluttered Transparent Biomedical Objects

TransBiolab:一个杂乱透明生物医学物体的真实世界多视图数据集

Ke Ma, Yifei Wang, Meng Wang, Tian Xia

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) College of Design and Innovation, Tongji University(同济大学设计创意学院) Shanghai Institute for Intelligent Autonomous Systems, Tongji University(同济大学上海智能无人系统研究院) School of Software and Engineering, Huazhong University of Science and Technology(华中科技大学软件学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 针对自主生物医学实验室透明物体视觉感知数据稀缺问题,提出TrainsBiolab真实世界多视图数据集,含多物体杂乱、遮挡场景数据及多种注释,定义相关基准并评估,为自主实验室操作视觉任务提供资源。

Comments 9 pages, 10 figures, accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏