arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-03-31 至 2026-03-31 共收录 33 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 33 篇

2603.28662 2026-03-31 cs.LG cs.AI 84%

AMIGO: Agentic Multi-Image Grounding Oracle Benchmark

AMIGO:代理多图像接地 oracle 评估基准

Min Wang, Ata Mahjoubfar

机构 * Target Corporation(塔吉特公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28333 2026-03-31 cs.CV cs.AI 84%

Integrating Multimodal Large Language Model Knowledge into Amodal Completion

将多模态大语言模型知识整合到无模态补全中

Heecheol Yun, Eunho Yang

机构 * KAIST(韩国科学技术院) AITRICS

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AmodalCG框架,利用多模态大语言模型知识指导无模态补全,通过评估遮挡程度选择性调用MLLM指导,结合视觉生成模型迭代优化补全结果,实验表明优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28069 2026-03-31 cs.CV cs.AI 84%

MolmoPoint: Better Pointing for VLMs with Grounding Tokens

MolmoPoint:通过接地标记提升VLMs的指针能力

Christopher Clark, Yue Yang, Jae Sung Park, Zixian Ma, Jieyu Zhang, Rohun Tripathi, Mohammadreza Salehi, Sangho Lee, Taira Anderson, Winson Han, Ranjay Krishna

机构 * Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MolmoPoint,通过直接选择包含目标概念的视觉标记来改进VLMs的指针机制,提升图像、GUI和视频指针任务性能,并提高样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09326 2026-03-31 cs.CV 83%

OddGridBench: Exposing the Lack of Fine-Grained Visual Discrepancy Sensitivity in Multimodal Large Language Models

OddGridBench: 暴露多模态大语言模型在细粒度视觉差异敏感性方面的不足

Tengjin Weng, Wenhao Jiang, Jingyi Wang, Ming Li, Lin Ma, Zhong Ming

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机与软件学院) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Shenzhen Technology University(深圳技术大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Meituan(美团)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出OddGridBench基准,评估多模态大语言模型的视觉差异敏感性,发现其检测能力远低于人类,提出OddGrid-GRPO框架提升模型细粒度视觉辨别能力。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27410 2026-03-31 q-bio.NC cs.AI cs.CV 81%

Grounding Social Perception in Intuitive Physics

将社会感知 grounded 在直观物理学中

Lance Ying, Aydan Y. Huang, Aviv Netanyahu, Andrei Barbu, Boris Katz, Joshua B. Tenenbaum, Tianmin Shu

机构 * Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学) Amazon(亚马逊)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出通过结合直观心理学与直观物理学的推理过程来解释社会感知,通过PHASE数据集和SIMPLE模型验证了物理基础的社会推理能力。

Comments 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28120 2026-03-31 cs.CV 79%

MedLoc-R1: Performance-Aware Curriculum Reward Scheduling for GRPO-Based Medical Visual Grounding

MedLoc-R1: 为基于GRPO的医疗视觉接地任务的性能感知课程奖励调度

Guangjing Yang, Ziyuan Qin, Chaoran Zhang, Chenlin Du, Jinlin Wang, Wanran Sun, Zhenyu Zhang, Bing Ji, Qicheng Lao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Emory University(埃默里大学) Peking University(北京大学) Shandong University(山东大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 本文提出MedLoc-R1框架,通过性能感知奖励调度提升医疗视觉接地任务的定位准确性和训练稳定性,无需引入辅助网络。

Comments 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26690 2026-03-31 cs.RO cs.AI cs.CV 73%

SpatialPoint: Spatial-aware Point Prediction for Embodied Localization

SpatialPoint: 体感-aware 点预测用于具身定位

Qiming Zhu, Zhirui Fang, Tianming Zhang, Chuanxiu Liu, Xiaoke Jiang, Lei Zhang

机构 * Visincept Research(Visincept 研究院) Tsinghua University(清华大学) International Digital Economy Academy (IDEA)(国际数字经济学院(IDEA))

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SpatialPoint框架,通过整合结构化深度信息提升具身定位性能,采用260万样本RGB-D数据集进行训练与评估,在真实机器人部署中验证了其在抓取、放置和导航任务中的有效性。

Comments 19 pages, 12 figures, supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27562 2026-03-31 cs.HC 71%

VoxAnchor: Grounding Speech Authenticity in Throat Vibration via mmWave Radar

VoxAnchor:通过毫米波雷达接地语音真实性 via 喉部振动

Mingda Han, Huanqi Yang, Chaoqun Li, Wenhao Li, Guoming Zhang, Yanni Yang, Yetong Cao, Weitao Xu, Pengfei Hu

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出VoxAnchor系统,通过毫米波雷达捕捉喉部振动,结合语音声学与雷达信号,实现细粒度语音真实性验证,有效检测编辑、拼接等伪造手段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV 70%

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27993 2026-03-31 cs.CV 70%

Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation

逐步引导的跨模态推理用于指代图像分割

Jiachen Li, Hongyun Wang, Jinyu Xu, Wenbo Jiang, Yanchun Ma, Yongjian Liu, Qing Xie, Bolong Zheng

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) University of Electronic Science and Technology of China(电子科技大学) Wuhan Vocational College of Software and Engineering(武汉软件工程职业学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PPCR框架,通过语义理解-空间定位-实例分割流程,改进指代图像分割中语言描述与视觉表示的连接,提升分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27500 2026-03-31 cs.CV 70%

Streamlined Open-Vocabulary Human-Object Interaction Detection

简化开放词汇人类-物体交互检测

Chang Sun, Dongliang Liao, Changxing Ding

机构 * South China University of Technology(华南理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SL-HOI框架,基于DINOv3模型简化开放词汇人类-物体交互检测,通过融合特征和跨注意力机制提升性能,实验显示在SWiG-HOI和HICO-DET基准上达到最新水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 70%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV 70%

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27014 2026-03-31 cs.CV 70%

GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection

GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测

Jiaming Li, Zhijia Liang, Weikai Chen, Lin Ma, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Meituan(美团) GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Research Institute, Sun Yat-sen University(中山大学深圳研究院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 GUIDED通过分解框架解决细粒度提示中主体与属性的语义纠缠问题,通过分离定位与识别任务提升细粒度开放词汇物体检测性能。

Comments NIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11479 2026-03-31 cs.RO 67%

OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation

OVSegDT:用于开放词汇物体目标导航的分割Transformer

Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) MIRAI NUST MISIS(国立研究型技术大学MISIS)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文提出OVSegDT,一种轻量级Transformer策略,通过语义分支和熵自适应损失调节解决开放词汇物体目标导航中的过拟合和安全问题,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 62%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08026 2026-03-31 cs.CV cs.AI cs.CL 62%

FigEx2: Visual-Conditioned Panel Detection and Captioning for Scientific Compound Figures

FigEx2: 科学复合图像的视觉条件化面板检测与标注

Jifeng Song, Arun Das, Pan Wang, Hui Ji, Kun Zhao, Yufei Huang

机构 * University of Pittsburgh(匹兹堡大学) UPMC Hillman Cancer Center(UPMC希尔曼癌症中心)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对科学复合图像中缺乏标注的问题,FigEx2通过视觉条件化框架直接从图像生成面板标注,提升下游预训练和检索性能,同时引入噪声感知门控融合模块和分阶段SFT+RL策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21428 2026-03-31 cs.CV cs.AI cs.RO 62%

From Observation to Action: Latent Action-based Primitive Segmentation for VLA Pre-training in Industrial Settings

从观察到行动:用于工业场景中VLA预训练的基于动作的潜在原始分割

Jiajie Zhang, Sören Schwertfeger, Alexander Kleiner

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种无监督框架,利用连续工业视频流中的大量未标记人类示范数据进行VLA模型预训练。方法首先训练了一个轻量级运动分词器来编码运动动态,然后利用新的'潜在动作能量'度量来发现和分割语义连贯的动作原始片段。

Comments 10 pages, 5 figures, Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13516 2026-03-31 cs.CV cs.AI 62%

Bidirectional Multimodal Prompt Learning with Scale-Aware Training for Few-Shot Multi-Class Anomaly Detection

双向多模态提示学习与尺度感知训练用于少样本多类异常检测

Yujin Lee, Sewon Kim, Daeun Moon, Seoyoon Jang, Hyunsoo Yoon

机构 * Yonsei University(延世大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出AnoPLe框架,通过双向交互文本与视觉提示,实现高效多类异常检测,在MVTec-AD等数据集上超越现有方法,且具备良好的泛化能力。

Comments accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03192 2026-03-31 cs.CV cs.CL cs.LG 62%

MoD-DPO: Towards Mitigating Cross-modal Hallucinations in Omni LLMs using Modality Decoupled Preference Optimization

MoD-DPO:通过模态解耦偏好优化缓解多模态幻觉

Ashutosh Chaubey, Jiacheng Pang, Mohammad Soleymani

机构 * University of Southern California(南加州大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出MoD-DPO框架,通过引入模态感知正则化项和语言先验去偏惩罚,提升多模态大模型的模态对齐能力,实验表明其在多模态幻觉基准测试中表现优异。

Comments CVPR 2026. Project Page: https://mod-dpo.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11967 2026-03-31 cs.CV cs.AI cs.RO 62%

Securing the Skies: A Comprehensive Survey on Anti-UAV Methods, Benchmarking, and Future Directions

守护天空:反无人机方法的全面调查、基准测试与未来方向

Yifei Dong, Fengyi Wu, Sanjian Zhang, Guangyu Chen, Yuzhi Hu, Masumi Yano, Jingdong Sun, Siyu Huang, Feng Liu, Qi Dai, Zhi-Qi Cheng

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文综述了反无人机领域,探讨了分类、检测与跟踪等核心方法,分析了数据合成、多模态融合等新兴技术,并指出实时性能、 stealth 检测等领域的不足,旨在推动下一代防御策略的发展。

Comments Accepted to CVPR 2025 Anti-UAV Workshop (Best Paper Award), 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28508 2026-03-31 cs.CV 57%

Generalizable Detection of AI Generated Images with Large Models and Fuzzy Decision Tree

基于大模型和模糊决策树的AI生成图像通用检测

Fei Wu, Guanghao Ding, Zijian Niu, Zhenrui Wang, Lei Yang, Zhuosheng Zhang, Shilin Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出结合轻量级特征感知检测器与大模型的模糊决策树框架,提升AI生成图像检测的准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28066 2026-03-31 cs.HC cs.AI 57%

Synonymix: Unified Group Personas for Generative Simulations

Synonymix:生成模拟的统一群体人格

Huanxing Chen, Aditesh Kumar

机构 * Stanford University(斯坦福大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Synonymix,通过图抽象和融合构建统一群体人格,实现群体层面的交互与模拟,验证了在社会调查中保留行为信号并保障隐私。

Comments 6 pages (excluding appendix), 3 figures, CHI'26 Extended Abstract (Poster)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20062 2026-03-31 cs.IR cs.AI 57%

The End of Rented Discovery: How AI Search Redistributes Power Between Hotels and Intermediaries

发现的终结:AI搜索如何在酒店与中介之间重新分配权力

Peiying Zhu, Sidi Chang

机构 * Blossom AI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文研究AI搜索如何通过意图-来源分歧影响酒店发现,发现体验型查询更依赖非OTA来源,挑战传统中介主导地位。

Comments 13 pages, 10 tables, Accepted to the 10th Hospitality Finance & Economics Conference (HFE 2026), Tokyo, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13953 2026-03-31 cs.CV 57%

From Unlearning to UNBRANDING: A Benchmark for Trademark-Safe Text-to-Image Generation

从去学习到去品牌化:一个商标安全的文本到图像生成基准测试

Dawid Malarz, Filip Manjak, Maciej Zięba, Przemysław Spurek, Artur Kasymov

机构 * Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 本文提出去品牌化任务,通过细粒度去除商标和隐含结构特征,同时保持语义连贯性,并构建基准数据集和评估框架,解决现有品牌检测器无法捕捉抽象商标的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12554 2026-03-31 cs.CV 57%

Multimodal Graph Network Modeling for Human-Object Interaction Detection with PDE Graph Diffusion

基于PDE图扩散的多模态图网络建模用于人-物交互检测

Wenxuan Ji, Haichao Shi, Xiao-Yu Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于PDE图扩散的多模态图网络模型,通过四阶段图结构建模人-物交互任务,利用白盒PDE扩散方程实现信息传播,并引入变分信息挤压机制优化CLIP提取的多模态特征,实验表明在HICO-DET和V-COCO基准上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27360 2026-03-31 cs.AI 57%

Defend: Automated Rebuttals for Peer Review with Minimal Author Guidance

Defend:用于同行评审的自动化反驳与最小作者指导

Jyotsana Khatri, Manasi Patwardhan

机构 * TCS Research(塔塔咨询服务研究实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出DEFEND工具,通过作者引导的结构化推理生成反驳,提升事实准确性与反驳力度,对比三种方法显示其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27059 2026-03-31 cs.CV 57%

Towards Intrinsic-Aware Monocular 3D Object Detection

面向内在感知的单目三维物体检测

Zhihao Zhang, Abhinav Kumar, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 本文提出MonoIA框架,通过语言引导表示建模和适应相机内在变化,实现鲁棒的三维物体检测,实验表明在KITTI等基准上取得新突破。

Comments This paper is accepted by CVPR 2026

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10652 2026-03-31 cs.CV cs.CR 57%

TriDF: Evaluating Perception, Detection, and Hallucination for Interpretable DeepFake Detection

TriDF:评估可解释深度伪造检测的感知、检测和幻觉

Jian-Yu Jiang-Lin, Kang-Yang Huang, Ling Zou, Ling Lo, Sheng-Ping Yang, Yu-Wen Tseng, Kun-Hsiang Lin, Chia-Ling Chen, Yu-Ting Ta, Yan-Tsung Wang, Po-Ching Chen, Hongxia Xie, Hong-Han Shuai, Wen-Huang Cheng

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) Jilin University(吉林大学) VinUniversity

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 TriDF提出一个全面的可解释深度伪造检测基准,评估模型感知、检测和幻觉能力,揭示三者间的相互作用,为构建可信系统提供基础。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21045 2026-03-31 cs.AI cs.DB cs.IR 57%

From Questions to Queries: An AI-powered Multi-Agent Framework for Spatial Text-to-SQL

从问题到查询:一种基于AI的多智能体框架用于空间文本到SQL

Ali Khosravi Kazazi, Zhenlong Li, M. Naser Lessani, Guido Cervone

机构 * Geoinformation and Big Data Research Laboratory, Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学地理系地理信息与大数据研究实验室) Institute for Computational and Data Sciences and Department of Geography, The Pennsylvania State University(宾夕法尼亚州立大学计算与数据科学研究所及地理系)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于AI的多智能体框架,解决空间文本到SQL中的复杂问题,通过分阶段解释、模式绑定、逻辑规划和执行审查提升空间查询的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏