arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-10 至 2026-03-10 共收录 130 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2603.07868 2026-03-10 cs.AI cs.LG 84%

Hospitality-VQA: Decision-Oriented Informativeness Evaluation for Vision-Language Models

Hospitality-VQA: 为视觉-语言模型的决策导向信息评估

Jeongwoo Lee, Baek Duhyeong, Eungyeol Han, Soyeon Shin, Gukin han, Seungduk Kim, Jaehyun Jeon, Taewoo Jeong

机构 * Yonsei University(延世大学) Yanolja NEXT

专题命中 视觉问答 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出Hospitality-VQA,通过构建专门针对旅游业的VQA数据集,评估视觉-语言模型在决策导向场景中的信息评估能力,并发现需通过领域微调提升其决策意识。

Comments Accepted at EACL 2026 SRW. 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05611 2026-03-10 cs.CV 83%

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶

Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Li Auto Inc.(Li汽车公司)

专题命中 视觉问答 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 79%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05143 2026-03-10 cs.CV cs.CL 79%

A Two-Stage Multitask Vision-Language Framework for Explainable Crop Disease Visual Question Answering

一种用于可解释作物疾病视觉问答的双阶段多任务视觉-语言框架

Md. Zahid Hossain, Most. Sharmin Sultana Samu, Md. Rakibul Islam, Md. Siam Ansary

专题命中 视觉问答 :visual question answering(title,abstract);分类 cs.CV

AI总结 本文提出了一种轻量且可解释的双阶段多任务视觉-语言框架,用于作物疾病视觉问答,实现了高准确率和良好的可解释性。

Comments Preprint, manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07394 2026-03-10 cs.CV cs.AI cs.CL 73%

AQuA: Toward Strategic Response Generation for Ambiguous Visual Questions

AQuA:迈向具有模糊性视觉问题的策略性响应生成

Jihyoung Jang, Hyounghun Kim

机构 * Graduate School of Artificial Intelligence, POSTECH(人工智能研究生院,POSTECH) Department of Computer Science and Engineering, POSTECH(计算机科学与工程系,POSTECH)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 AQuA通过细粒度数据集和策略微调,提升VLMs在模糊视觉问答中的策略性响应生成能力。

Comments ICLR 2026 (28 pages); Project website: https://aqua-iclr2026.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00312 2026-03-10 cs.AI cs.LG 62%

How Well Do Multimodal Models Reason on ECG Signals?

多模态模型在心电图信号上的推理能力如何?

Maxwell A. Xu, Harish Haresamudram, Catherine W. Liu, Patrick Langer, Jathurshan Pradeepkumar, Wanting Mao, Sunita J. Ferns, Aradhana Verma, Jimeng Sun, Paul Schmiedmayer, Xin Liu, Daniel McDuff, Emily B. Fox, James M. Rehg

机构 * University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Rush University(拉什大学) ETH Zurich(苏黎世联邦理工学院) St. Christopher's Hospital for Children(圣克里斯opher儿童医院) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Google Inc(谷歌公司)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种评估多模态模型在ECG信号上推理能力的框架,通过感知和演绎两个方面验证模型的逻辑和模式识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13795 2026-03-10 cs.CV cs.AI 62%

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

Bee:一个高质量语料库和全栈工具包,解锁高级完全开放的多模态大语言模型

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min Hu

机构 * Tsinghua University(清华大学) Tencent Hunyuan Team(腾讯文英团队)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Bee通过高质量数据集和全栈工具包,提升完全开放多模态大语言模型的性能,达到与半开放模型相当甚至超越的水平。

Comments homepage: https://open-bee.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09486 2026-03-10 cs.CV cs.AI cs.MM 62%

Video-EM: Event-Centric Episodic Memory for Long-Form Video Understanding

视频-EM:面向长视频理解的事件中心型片段记忆

Yun Wang, Long Zhang, Jingren Liu, Jiaqi Yan, Zhanjie Zhang, Jiahao Zheng, Ao Ma, Run Ling, Xun Yang, Dapeng Wu, Xiangyu Chen, Xuelong Li

机构 * City University of Hong Kong(香港城市大学) University of Science and Technology of China(中国科学技术大学) Tianjin University(天津大学) Nanjing University(南京大学) Zhejiang University(浙江大学) The Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究所(TeleAI))

专题命中 视觉问答 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 Video-EM通过事件中心型片段记忆框架,将长视频问答转化为事件构建与记忆细化,提升长视频理解的连贯性与可靠性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11952 2026-03-10 cs.CV 57%

UniUGG: Unified 3D Understanding and Generation via Geometric-Semantic Encoding

UniUGG: 通过几何-语义编码实现统一的3D理解与生成

Yueming Xu, Jiahui Zhang, Ze Huang, Yurui Chen, Yanpeng Zhou, Zhenyu Chen, Yu-Jie Yuan, Pengxiang Xia, Guowei Huang, Xinyue Cai, Zhongang Qi, Xingyue Quan, Jianye Hao, Hang Xu, Li Zhang

机构 * Fudan University(复旦大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV

AI总结 UniUGG通过几何-语义编码实现3D理解和生成的统一框架,结合大语言模型和潜在扩散模型,提升空间理解和生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 26 篇

2603.07888 2026-03-10 cs.CV cs.AI cs.LG 85%

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08497 2026-03-10 cs.CV 83%

Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models

阅读≠视觉:诊断和缩小视觉语言模型中的字形差距

Heng Zhou, Ao Yu, Li Kang, Yuchen Fan, Yutao Fan, Xiufeng Song, Hejia Geng, Yiran Qin

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文研究了视觉语言模型在字形识别上的不足,发现字体风格检测能力差,通过微调提升模型性能,揭示训练数据缺失问题,并提出需架构创新以改进关系性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16670 2026-03-10 cs.CV 83%

Learning to Think Fast and Slow for Visual Language Models

学习快速与缓慢思考以提升视觉语言模型

Chenyu Lin, Cheng Chi, Jinlin Wu, Sharon Li, Kaiyang Zhou

机构 * Hong Kong Baptist University(香港 Baptist 大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute of Automation, CAS(中国科学院自动化研究所) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 DualMindVLM通过双模式思考机制提升视觉语言模型的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11165 2026-03-10 cs.CV 83%

Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning

Traffic-MLLM: 基于好奇心正则化的交通场景案例推理监督学习

Waikit Xiu, Qiang Lu, Bingchen Liu, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学) University of Bristol(布里斯托大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 Traffic-MLLM通过好奇心驱动的结构化案例学习,提升多模态交通场景推理的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07786 2026-03-10 cs.CV 79%

OrdinalBench: A Benchmark Dataset for Diagnosing Generalization Limits in Ordinal Number Understanding of Vision-Language Models

OrdinalBench: 一种用于诊断视觉-语言模型在序数理解通用性限制的基准数据集

Yusuke Tozaki, Hisashi Miyamori

机构 * Division of Frontier Informatics, Kyoto Sangyo University, Kyoto, Japan(前沿信息学系,京都精华大学,京都,日本)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV

AI总结 OrdinalBench通过评估视觉-语言模型在序数理解上的表现,揭示其在大序数和复杂路径条件下的泛化能力不足问题。

Comments Accepted as a Short Paper at VISAPP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 77%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 73%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07901 2026-03-10 cs.RO cs.LG 70%

NaviDriveVLM: Decoupling High-Level Reasoning and Motion Planning for Autonomous Driving

NaviDriveVLM:解耦高层推理与运动规划用于自动驾驶

Ximeng Tao, Pardis Taghavi, Dimitar Filev, Reza Langari, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.LG

AI总结 NaviDriveVLM通过解耦高层推理与运动规划,提升自动驾驶中的推理能力与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18064 2026-03-10 cs.CV 70%

3DMedAgent: Unified Perception-to-Understanding for 3D Medical Analysis

3DMedAgent:面向3D医学分析的统一感知-理解框架

Ziyue Wang, Linghan Cai, Chang Han Low, Haofeng Liu, Junde Wu, Jingyu Wang, Rui Wang, Lei Song, Jiang Bian, Jingjing Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Microsoft Research(微软研究院) TUD Dresden University of Technology(德累斯顿技术大学) University of Oxford(牛津大学)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DMedAgent通过统一框架实现2D MLLMs在3D医学分析中的高效处理,无需3D特定微调,提升3D医学图像的感知与理解能力。

Comments 19 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16053 2026-03-10 cs.RO cs.AI 70%

Compose by Focus: Scene Graph-based Atomic Skills

通过聚焦:基于场景图的原子技能

Han Qi, Changhe Chen, Heng Yang

机构 * School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院) Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文提出了一种基于场景图的原子技能学习框架,结合图神经网络与扩散式模仿学习,并与视觉-语言模型结合,提升机器人在复杂任务中的稳健性和组合泛化能力。

Comments Acceptance to ICRA 2026. Website: https://computationalrobotics.seas.harvard.edu/SkillComposition/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 67%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20980 2026-03-10 cs.CV cs.AI 62%

CrystaL: Spontaneous Emergence of Visual Latents in MLLMs

CrystaL: MLLMs中视觉潜在特征的自发涌现

Yang Zhang, Danyang Li, Yuxuan Li, Xin Zhang, Tianyu Xie, Mingming Cheng, Xiang Li

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 CrystaL通过显式对齐注意力模式和预测分布,实现视觉潜在特征的自发涌现,提升细粒度视觉理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08007 2026-03-10 cs.CV cs.AI 62%

ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation

ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架

Haoyu Tong, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou, Chenghao Lin

机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07590 2026-03-10 cs.CV cs.LG 62%

Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints

模型作为乐高积木:通过语义蓝图从良性积木中组装恶意内容

Chenxi Li, Xianggan Liu, Dake Shen, Yaosong Du, Zhibo Yao, Hao Jiang, Linyi Jiang, Chengwei Cao, Jingzhe Zhang, RanYi Peng, Peiling Bai, Xiande Huang

机构 * DAIL Tech(DAIL科技) NLP & KG Lab, Huazhong University of Science and Technology(自然语言处理与知识图谱实验室,华中科技大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出StructAttack,通过语义蓝图将看似无害的槽类型组合成恶意内容,揭示LVLMs在视觉模态整合中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06680 2026-03-10 cs.CV cs.AI 62%

VB: Visibility Benchmark for Visibility and Perspective Reasoning in Images

VB:用于图像中可见性与视角推理的可见性基准

Neil Tripathi

机构 * New York University(纽约大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 VB基准测试视觉-语言模型在图像可见性推理中的能力,通过可见性声明和置信度评分评估模型性能。

Comments 18 pages, 1 figure, 3 tables. Code and data: https://github.com/neilt93/Paper-with-Davis

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06648 2026-03-10 cs.CV cs.AI 62%

ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments

ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化

Shiyi Ding, Shaoen Wu, Ying Chen

机构 * Kennesaw State University(肯纳邦大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。

Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19678 2026-03-10 cs.AI cs.LG 62%

From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review

从大语言模型推理到自主AI代理:全面综述

Mohamed Amine Ferrag, Norbert Tihanyi, Merouane Debbah

机构 * Department of Computer and Network Engineering(计算机与网络工程系) United Arab Emirates University(阿联酋大学) Technology Innovation Institute(技术创新研究院) Eötvös Loránd University(埃斯特哈齐·洛朗大学) Research Institute for Digital Future(数字未来研究院) Khalifa University(卡塔尔大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了大语言模型和自主AI代理的发展,提出了涵盖多种任务的基准分类法,并讨论了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08369 2026-03-10 cs.AI 57%

M$^3$-ACE: Rectifying Visual Perception in Multimodal Math Reasoning via Multi-Agentic Context Engineering

M$^3$-ACE: 通过多智能体上下文工程校正多模态数学推理中的视觉感知

Peijin Xie, Zhen Xu, Bingquan Liu, Baoxun Wang

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 M3-ACE 通过多智能体上下文工程校正多模态数学推理中的视觉感知问题,提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07515 2026-03-10 cs.CV 57%

EvolveReason: Self-Evolving Reasoning Paradigm for Explainable Deepfake Facial Image Identification

EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式

Binjia Zhou, Dawei Luo, Shuai Chen, Feng Xu, Seow, Haoyuan Li, Jiachi Wang, Jiawen Wang, Zunlei Feng, Yijun Bei

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 视觉推理 :VLM(abstract);分类 cs.CV

AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07401 2026-03-10 cs.CV 57%

VIVECaption: A Split Approach to Caption Quality Improvement

VIVECaption:一种改进标题质量的分步方法

Varun Ananth, Baqiao Liu, Haoran Cai

机构 * Adobe Inc.(Adobe公司)

专题命中 视觉推理 :visual language model(abstract);分类 cs.CV

AI总结 VIVECaption通过双面方法改进标题质量,利用分层抽样和模型对齐策略提升图像-标题对齐效果,提供高质量训练数据解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15828 2026-03-10 cs.RO cs.AI 57%

Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning

情境至关重要!利用LLMs进行可行的3D场景规划

Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(Sapienza大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 ContextMatters结合LLMs与经典规划,通过分层目标放松提升3D场景规划的成功率

详情

展开后加载摘要…

URL PDF HTML 收藏