arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 3363 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 3363 篇

2602.18630 2026-02-24 cs.HC cs.AI 57%

Lost in Instructions: Study of Blind Users' Experiences with DIY Manuals and AI-Rewritten Instructions for Assembly, Operation, and Troubleshooting of Tangible Products

迷失在指令中:对盲人用户使用DIY手册和AI重写指令进行实物产品组装、操作和故障排除经验的研究

Monalika Padma Reddy, Aruna Balasubramanian, Jiawei Zhou, Xiaojun Bi, IV Ramakrishnan, Vikas Ashok

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨盲人用户在使用DIY手册和AI生成的指令进行实物产品组装、操作和故障排除时的体验,发现现有工具不足,需改进以提供更有效的指导。

Comments 28 pages incl. references, 7 figures. Full paper submission to CHI 2026. IRB-approved semi-structured interview and usability study with 15 blind participants

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01696 2026-02-24 cs.CV cs.AI 57%

Cross-Modal Purification and Fusion for Small-Object RGB-D Transmission-Line Defect Detection

跨模态净化与融合用于小物体RGB-D传输线缺陷检测

Jiaming Cui, Wenqiang Li, Shuai Zhou, Ruifeng Qin, Feng Shen

机构 * School of Mechatronics Engineering, Harbin Institute of Technology(机械电子工程学院,哈尔滨工业大学) School of Instrument Science and Engineering, Harbin Institute of Technology(仪器科学与工程学院,哈尔滨工业大学) Electric Power Research Institute, Yunnan Power Grid Co., Ltd.(电力研究院,云南电网公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CMAFNet通过跨模态净化与融合技术,提升小物体RGB-D传输线缺陷检测的精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17116 2026-02-20 cs.AI 57%

Epistemology of Generative AI: The Geometry of Knowing

生成AI的形而上学:认知的几何学

Ilya Levin

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于高维几何空间的指涉认识论,重新定义生成模型为流形导航者,引入导航知识作为知识生产的第三种模式。

Comments 27

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16105 2026-02-19 cs.AI 57%

GPSBench: Do Large Language Models Understand GPS Coordinates?

GPSBench: 大型语言模型是否理解GPS坐标?

Thinh Hung Truong, Jey Han Lau, Jianzhong Qi

机构 * University of Melbourne(墨尔本大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GPSBench通过评估14种LLMs在地理空间推理中的表现,揭示了其在GPS坐标理解和现实地理推理上的挑战与差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13476 2026-02-17 cs.RO cs.LG 57%

AsyncVLA: An Asynchronous VLA for Fast and Robust Navigation on the Edge

AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航

Noriaki Hirose, Catherine Glossop, Dhruv Shah, Sergey Levine

机构 * University of California, Berkeley(加州大学伯克利分校) Toyota Motor North America(丰田汽车北美公司) Princeton University(普林斯顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。

Comments 13 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11706 2026-02-13 cs.CV cs.AI cs.RO 57%

LLM-Driven 3D Scene Generation of Agricultural Simulation Environments

基于大语言模型的农业模拟环境3D场景生成

Arafa Yoncalik, Wouter Jansen, Nico Huebel, Mohammad Hasan Rahmani, Jan Steckel

机构 * Faculty of Applied Engineering – Dept. of Electronics and ICT, University of Antwerp(应用工程学院——电子与信息通信技术系,安特卫普大学) Flanders Make Strategic Research Centre(弗拉芒制造战略研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于多LLM流水线的农业模拟环境3D场景生成方法,通过模块化设计提升领域特定场景生成的可靠性与精度。

Comments Accepted at IEEE Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11598 2026-02-13 cs.RO cs.AI cs.CV 57%

ABot-N0: Technical Report on the VLA Foundation Model for Versatile Embodied Navigation

ABot-N0:关于VLA基础模型在多功能具身导航中的技术报告

Zedong Chu, Shichao Xie, Xiaolong Wu, Yanfen Shen, Minghua Luo, Zhengbo Wang, Fei Liu, Xiaoxu Leng, Junjun Hu, Mingyang Yin, Jia Lu, Yingnan Guo, Kai Yang, Jiawei Han, Xu Chen, Yanqing Zhu, Yuxiang Zhao, Xin Liu, Yirong Yang, Ye He, Jiahang Wang, Yang Cai, Tianlin Zhang, Li Gao, Liu Liu, Mingchao Sun, Fan Jiang, Chiyu Wang, Zhicheng Liu, Hongyu Pan, Honglin Han, Zhining Gu, Kuan Yang, Jianfang Zhang, Di Jing, Zihao Guan, Wei Guo, Guoqing Liu, Di Yang, Xiangpo Yang, Menglin Yang, Hongguang Xing, Weiguo Li, Mu Xu

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ABot-N0通过统一的VLA基础模型实现多功能具身导航,结合认知大脑与动作专家架构,在多个基准测试中超越专用模型,支持动态环境中的长周期任务。

Comments Project Page: https://amap-cvlab.github.io/ABot-Navigation/ABot-N0/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00148 2026-02-13 cs.CV cs.AI 57%

Learning Physics-Grounded 4D Dynamics with Neural Gaussian Force Fields

基于神经高斯力场的学习物理 grounded 4D 动力学

Shiqian Li, Ruihong Shen, Junfeng Ni, Chang Pan, Chi Zhang, Yixin Zhu

机构 * Institute for AI, Peking University(北京大学人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理学与认知科学学院) School of EECS, Peking University(北京大学电子工程学院) Department of Automation, Tsinghua University(清华大学自动化系) Yuanpei College, Peking University(北京大学元培学院) State Key Lab of General AI, Peking University(北京大学通用人工智能国家重点实验室) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出神经高斯力场(NGFF),通过结合3D高斯感知与物理动力学建模,从多视角RGB输入生成交互式、物理真实的4D视频,提升视频预测的物理 grounded 性。

Comments 43 pages, ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09701 2026-02-11 cs.CV cs.AI 57%

GenSeg-R1: RL-Driven Vision-Language Grounding for Fine-Grained Referring Segmentation

GenSeg-R1: 通过强化学习驱动的视觉-语言接地进行细粒度指称分割

Sandesh Hegde, Jaison Saji Chacko, Debarshi Banerjee, Uma Mahesh

机构 * Camcom Technologies Pvt. Ltd.(Camcom技术有限公司)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 GenSeg-R1 通过强化学习驱动的视觉-语言接地方法,在细粒度指称分割任务中实现了优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08448 2026-02-10 cs.CV cs.AI 57%

Vista: Scene-Aware Optimization for Streaming Video Question Answering under Post-Hoc Queries

Vista:面向事后查询的场景感知流视频问答优化

Haocheng Lu, Nan Zhang, Wei Tao, Xiaoyang Qu, Guokuan Li, Jiguang Wan, Jianzong Wang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 Vista通过场景感知分割、压缩和召回技术,实现了高效且可扩展的流视频问答,提升了长上下文推理能力,同时保持低延迟和内存效率。

Comments Accepted to AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07277 2026-02-10 cs.CV cs.LG 57%

Cross-View World Models

跨视角世界模型

Rishabh Sharma, Gijs Hogervorst, Wayne E. Mackey, David J. Heeger, Stefano Martiniani

机构 * Simons Center for Computational Physical Chemistry(Simon计算物理化学中心) Center for Soft Matter Research, Department of Physics(软物质研究中心,物理系) Statespace Labs, Inc.(Statespace公司) Center for Neural Science, New York University(神经科学中心,纽约大学) Department of Psychology, New York University(心理学系,纽约大学) Courant Institute of Mathematical Sciences, New York University(Courant数学科学研究所,纽约大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 本文提出跨视角世界模型,通过多视角预测训练智能体在不同视角下进行规划,提升空间感知与多智能体协作能力。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22894 2026-02-09 cs.CR cs.AI 57%

DECEPTICON: How Dark Patterns Manipulate Web Agents

DECEPTICON:暗模式如何操纵网络代理

Phil Cuvin, Hao Zhu, Diyi Yang

机构 * Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 DECEPTICON研究揭示暗模式通过引导代理轨迹对网络代理构成重大风险,表明需加强防御措施以应对操纵性设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01527 2026-02-03 cs.HC cs.AI cs.CV 57%

Toward a Machine Bertin: Why Visualization Needs Design Principles for Machine Cognition

迈向机器伯林:为什么可视化需要为机器认知设计原则

Brian Keith-Norambuena

机构 * Department of Computing & Systems Engineering, Universidad Católica del Norte(计算与系统工程系,北卡洛斯大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文主张可视化领域需研究面向机器的视觉设计,以弥补机器认知需求与现有以人类为中心的知识库之间的差距。

Comments Preprint submitted to IEEE TVCG on February 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00414 2026-02-03 cs.CV cs.LG 57%

Toward Autonomous Laboratory Safety Monitoring with Vision Language Models: Learning to See Hazards Through Scene Structure

迈向自主实验室安全监控:通过场景结构学习识别危险

Trishna Chakraborty, Udita Ghosh, Aldair Ernesto Gongora, Ruben Glatt, Yue Dong, Jiachen Li, Amit K. Roy-Chowdhury, Chengyu Song

机构 * Electrical and Computer Engineering, University of California, Riverside, USA(加州大学河滨分校电气与计算机工程系) Computer Science and Engineering, University of California, Riverside, USA(加州大学河滨分校计算机科学与工程系) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出通过场景图引导对齐方法,利用视觉语言模型提升实验室安全监控中危险识别的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18343 2026-02-03 cs.CL 57%

Model Editing with Graph-Based External Memory

基于图的外部记忆模型编辑

Yash Kumar Atri, Ahmed Alaa, Thomas Hartvigsen

机构 * University of Virginia(弗吉尼亚大学) UC Berkeley(伯克利大学) UCSF(旧金山加州大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 HYPE通过双曲几何和图神经网络实现稳定的模型编辑,提升编辑稳定性、事实准确性和多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20835 2026-02-02 cs.CV cs.AI 57%

Open-Vocabulary Functional 3D Human-Scene Interaction Generation

开放词汇功能3D人类-场景交互生成

Jie Liu, Yu Sun, Alpar Cseke, Yao Feng, Nicolas Heron, Michael J. Black, Yan Zhang

机构 * Meshcapade University of Amsterdam(阿姆斯特丹大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) Stanford University(斯坦福大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 FunHSI通过功能驱动框架生成开放词汇任务下的功能正确3D人类-场景交互。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22027 2026-01-30 cs.AI 57%

CAR-bench: Evaluating the Consistency and Limit-Awareness of LLM Agents under Real-World Uncertainty

CAR-bench: 评估在现实世界不确定性下LLM代理的一致性和限意识

Johannes Kirmayr, Lukas Stappen, Elisabeth André

机构 * BMW Group Research and Technology(宝马集团研究与技术) Augsburg University(艾希施泰特大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 CAR-bench旨在评估LLM代理在现实世界不确定性下的一致性、不确定性处理和能力意识,通过多轮对话和工具使用测试其可靠性和自我意识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20304 2026-01-29 cs.CV cs.AI 57%

Structure-constrained Language-informed Diffusion Model for Unpaired Low-dose Computed Tomography Angiography Reconstruction

结构约束的语言引导扩散模型用于无配对低剂量计算机断层扫描血管造影重建

Genyuan Zhang, Zihao Wang, Zhifan Gao, Lei Xu, Zhen Zhou, Haijun Yu, Jianjia Zhang, Xiujian Liu, Weiwei Zhang, Shaoyu Wang, Huazhu Fu, Fenglin Liu, Weiwen Wu

机构 * Key Lab of Optoelectronic Technology and Systems and Engineering Research Center of Industrial Computed Tomography Nondestructive Testing, Ministry of Education, Chongqing University(光电技术与系统国家重点实验室和工业计算机断层非破坏检测工程研究中心,教育部,重庆大学) School of Biomedical Engineering, Sun Yat-sen University(中山大学生物医学工程学院) Department of Radiology, Beijing Anzhen Hospital, Capital Medical University(北京安贞医院放射科,首都医科大学) School of Information Engineering, Nanchang, Jiangxi(信息工程学院,南昌,江西) Institute of High Performance Computing (IHPC), Agency for Science, Technology and Research (A*STAR)(高性能计算研究所(IHPC),科技研究局(A*STAR))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出结构约束的语言引导扩散模型,通过整合结构协同和空间智能,提升低剂量CT血管造影重建的准确性与对比度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20303 2026-01-29 cs.CV cs.AI 57%

Physically Guided Visual Mass Estimation from a Single RGB Image

基于单个RGB图像的物理引导视觉质量估计

Sungjae Lee, Junhan Jeong, Yeonjoo Hong, Kwang In Kim

机构 * Graduate School of Artificial Intelligence, POSTECH, South Korea(人工智能研究生院,POSTECH,韩国) Department of Electrical Engineering, POSTECH, South Korea(电气工程系,POSTECH,韩国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种基于物理引导的单图像质量估计方法,通过融合几何、语义和外观信息,实现对物体质量的准确预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19155 2026-01-28 cs.AI cs.CV 57%

LocationAgent: A Hierarchical Agent for Image Geolocation via Decoupling Strategy and Evidence from Parametric Knowledge

LocationAgent: 一种基于解耦策略和参数知识证据的图像地理定位分层代理

Qiujun Li, Zijin Xiao, Xulin Wang, Zhidan Ma, Cheng Yang, Haifeng Li

机构 * Central South University(中南大学) ByteDance (China)(字节跳动(中国))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 LocationAgent通过分层推理和外部证据验证,有效提升图像地理定位的准确性和泛化能力。

Comments 9 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-01-26 cs.CL cs.CV 57%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16378 2026-01-26 cs.CV cs.AI q-bio.NC 57%

Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models

具有认知启发的标记克服了多模态模型中的自我中心偏差

Bridget Leonard, Scott O. Murray

机构 * Department of Psychology University of Washington(心理学系华盛顿大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09588 2026-01-26 cs.LG 57%

Energy-Entropy Regularization: The True Power of Minimal Looped Transformers

能量-熵正则化:最小循环转换器的真实力量

Wai-Lun Lam

机构 * Wai-Lun Lam

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出利用Tsallis熵和哈密顿动力学改进循环转换器训练,成功解决长序列归纳任务,揭示其推理能力的内在机制。

Comments 19 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11666 2026-01-21 cs.CV cs.AI 57%

MATEX: Multi-scale Attention and Text-guided Explainability of Medical Vision-Language Models

MATEX: 医疗视觉-语言模型的多尺度注意力与文本引导可解释性

Muhammad Imran, Chi Lee, Yugyung Lee

机构 * Computer Science, School of Science and Engineering(科学与工程学院计算机科学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 MATEX通过多尺度注意力与文本引导方法提升医疗视觉-语言模型的可解释性,实现更精确和临床相关的梯度归因图。

Comments 12 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09031 2026-01-15 cs.RO cs.AI 57%

Generalizable Geometric Prior and Recurrent Spiking Feature Learning for Humanoid Robot Manipulation

可推广的几何先验与递归脉冲特征学习用于双足机器人操作

Xuetao Li, Wenke Huang, Mang Ye, Jifeng Xuan, Bo Du, Sheng Liu, Miao Li

机构 * School of Computer Science, School of Robotics, Institute of Technological Sciences, Wuhan University(计算机学院、机器人学院、技术科学研究院、武汉大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出RGMP-S方法,通过几何先验和递归脉冲网络提升双足机器人操作的泛化能力与数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08699 2026-01-14 cs.CL 57%

RAGShaper: Eliciting Sophisticated Agentic RAG Skills via Automated Data Synthesis

RAGShaper: 通过自动化数据合成激发复杂的代理RAG技能

Zhengwei Tao, Bo Li, Jialong Wu, Guochen Yan, Huanyao Zhang, Jiahao Xu, Haitao Mi, Wentao Zhang

机构 * Peking University(北京大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 RAGShaper通过自动化数据合成构建高质量RAG任务和代理轨迹,提升模型在复杂检索任务中的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16237 2026-01-14 cs.CL 57%

Align-GRAG: Anchor and Rationale Guided Dual Alignment for Graph Retrieval-Augmented Generation

Align-GRAG: 基于锚点和推理引导的双 Alignment 图检索增强生成

Derong Xu, Pengyue Jia, Xiaopeng Li, Yingyi Zhang, Maolin Wang, Qidong Liu, Xiangyu Zhao, Yichao Wang, Huifeng Guo, Ruiming Tang, Enhong Chen, Tong Xu

机构 * University of Science and Technology of China(中国科学技术大学) City University of Hong Kong(香港城市大学) Noah’s Ark Lab, Huawei(华为诺亚实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 Align-GRAG通过锚点和推理引导的双 Alignment 框架,提升图检索增强生成的准确性与语义对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03215 2026-01-14 cs.AI 57%

COSINT-Agent: A Knowledge-Driven Multimodal Agent for Chinese Open Source Intelligence

COSINT-Agent: 一种面向中文开源情报的知识驱动多模态智能体

Wentao Li, Congcong Wang, Xiaoxiao Cui, Zhi Liu, Wei Guo, Lizhen Cui

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 COSINT-Agent通过整合多模态大语言模型与实体-事件-场景知识图谱,提升中文开源情报的多模态推理能力与情报生成效率。

Comments This manuscript (arXiv:2503.03215) is being withdrawn at the supervisor's request. The content is preliminary and needs further internal revision and approval before public release. We will resubmit a revised version after completion. Apologies for the inconvenience

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06437 2026-01-13 cs.CL 57%

Time Travel Engine: A Shared Latent Chronological Manifold Enables Historical Navigation in Large Language Models

时间旅行引擎:共享的潜在时间流形使大型语言模型能够进行历史导航

Jingmin An, Wei Liu, Qian Wang, Fang Fang

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 时间旅行引擎通过共享的潜在时间流形,使大型语言模型能够导航历史,揭示语言模型中时间进程的连续几何结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04819 2026-01-09 cs.AI 57%

AECV-Bench: Benchmarking Multimodal Models on Architectural and Engineering Drawings Understanding

AECV-Bench:在建筑和工程图纸理解上的多模态模型评估基准

Aleksei Kondratenko, Mussie Birhane, Houssame E. Hsain, Guido Maciocci

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 AECV-Bench评估多模态模型在建筑图纸理解上的能力,发现OCR和文本问答表现最佳,但符号理解尤其是门窗计数仍存在较大误差,需改进领域特定表示和人机协作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏