arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 736 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 736 篇

2606.09507 2026-06-09 cs.CV 新提交 57%

Prisma-World: Camera-Controllable Multi-Agent Video World Model

Prisma-World: 相机可控的多智能体视频世界模型

Huiqiang Sun, Zhan Peng, Size Wu, Kun Wang, Kang Liao, Dianyi Wang, Xingyu Zeng, Sheng Jin, Yangguang Li, Zhiguo Cao, Ziwei Liu, Wei Li

机构 * School of AIA, HUST(华中科技大学人工智能与自动化学院) S-Lab, NTU(南洋理工大学S-Lab) SenseTime Research(商汤科技研究院) FDU(复旦大学) SUAT(深圳大学) HKU(香港大学) CUHK(香港中文大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出Prisma-World,通过联合几何感知去噪过程实现多智能体视频生成中的跨视角一致性,支持灵活智能体数量和相机控制。

Comments Project page: https://huiqiang-sun.github.io/prisma-world/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09474 2026-06-09 cs.CV 新提交 57%

Training-Free Generalized Few-Shot Segmentation through Open-Vocabulary Semantic Arbitration

无需训练的通用的少样本分割通过开放词汇语义仲裁

Silas Kwabla Gah, Ebenezer Owusu

机构 * University of Ghana(加纳大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出Open-V框架,通过推理时协调冻结的语义先验(SAM3 PCS与K-shot CLIP支持质心)实现无需训练的通用少样本分割,在多个基准上超越有监督方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09419 2026-06-09 cond-mat.mtrl-sci cs.AI 新提交 57%

Context-Aware Deep Learning for Defect Classification in Atomic-Resolution STEM

上下文感知深度学习用于原子分辨率扫描透射电镜中的缺陷分类

Jiadong Dan, Cheng Zhang, Leyi Loh, Ivan Verzhbitskiy, Yuan Chen, Goki Eda, Michel Bosman, N. Duane Loh

机构 * cond-mat.mtrl-sci(材料科学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出上下文感知学习框架,融合图像对比度与元数据(成分、束能、探测器几何),解决仅凭图像对比度进行缺陷分类的歧义性,在模拟数据上准确率超98%,实验数据接近人类水平。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08800 2026-06-09 cs.AI 新提交 57%

Bridging Expert Knowledge and Automated Feature Engineering via Self-Evolution

通过自进化桥接专家知识与自动化特征工程

Varun Khurana, Vijval Ekbote, Vashu Chauhan, Yaman Kumar Singla, Rajiv Ratn Shah, Balaji Krishnamurthy

机构 * Adobe Media and Data Science Research(Adobe媒体与数据科学研究) IIIT-Delhi(德里印度理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出FEST方法,结合双流特征生成、语义去重和树引导迭代进化,从原始文本和图像中发现可审计特征,在品牌分类等任务中平均提升4.2个百分点,并实现60-80%的专家特征覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08572 2026-06-09 cs.CV 新提交 57%

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

OmniCap-IF:全视频字幕遵循指令能力的基准测试与改进

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu

机构 * NJU-LINK Team, Nanjing University(南京大学 NJU-LINK 团队) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出首个全模态字幕指令遵循基准OmniCap-IF,通过格式与内容正确性评估50种约束类型,揭示格式-内容权衡,并构建54K指令微调数据集OmniCap-IF-54K及模型OmniCaptioner-IF。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08093 2026-06-09 cs.AI 新提交 57%

A Multi-modal Agentic Co-pilot for Evidence Grounded Computational Pathology

面向证据基础计算病理学的多模态智能体协同助手

Zhe Xu, Zhengyu Zhang, Zhiyuan Cai, Jiahao Xu, Yijie Lin, Ziyi Liu, Junlin Hou, Hongyi Wang, Yuxiang Nie, Ling Liang, Yihui Wang, Yingxue Xu, Ronald Cheong Kin Chan, Li Liang, Hao Chen

机构 * Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) Department of Pathology, Nanfang Hospital, Southern Medical University(南方医科大学南芳医院病理科) Department of Pathology, School of Basic Medical Sciences, Southern Medical University(南方医科大学基础医学学院病理科) Department of Anatomical and Cellular Pathology, Chinese University of Hong Kong(香港中文大学解剖与细胞病理学系) Guangdong Provincial Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory(锦风实验室) Department of Chemical and Biological Engineering, Hong Kong University of Science and Technology(香港科技大学化学与生物工程系) Division of Life Science, Hong Kong University of Science and Technology(香港科技大学生命科学系) State Key Laboratory of Nervous System Disorders, The Hong Kong University of Science and Technology(香港科技大学神经系统疾病国家重点实验室) HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute, The Hong Kong University of Science and Technology(香港科技大学深圳-香港协同创新研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出PathPocket,一种多模态AI协同助手,通过构建包含11万文档的病理证据语料库和455万实体的超图,实现基于证据的病理诊断,在20万真实案例上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08091 2026-06-09 cs.CV 新提交 57%

VideoWeaver: Evaluating and Evolving Skills for Agentic Long Video Generation

VideoWeaver: 评估与进化智能体长视频生成技能

Jianhui Wei, Jie Tan, Hengchuan Zhu, Xiaotian Zhang, Yan Zhang, Ziyi Chen, Daoan Zhang, Wei Xu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) ByteDance(字节跳动)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出VideoWeaver框架,让智能体自主组合基础技能生成视频,并设计智能体裁判评估过程与结果,通过技能进化算法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 57%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08041 2026-06-09 cs.GR cs.CV 新提交 57%

Wispy to Voluminous: Prior-free Multi-view Capture of Strand-level Facial Hair

从稀疏到浓密:无先验的多视角面部毛发级联重建

Jaeseong Lee, Giljoo Nam, Adrian Jarabo, Carlos Aliaga

机构 * KAIST(韩国科学技术院) Meta Codec Avatar Lab(Meta 编码人像实验室) Meta Reality Labs Research(Meta现实实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出从多视角图像自动重建面部毛发(胡须、眉毛等)的管线,将无结构3D高斯表示转换为显式曲线发丝,解决几何歧义,实现高保真发丝重建。

Comments 27 pages, 16 figures, supplementary included

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07775 2026-06-09 cs.CV 新提交 57%

DALE-CT: Depth-Aware Foundation Models for Computed Tomography

DALE-CT: 用于计算机断层扫描的深度感知基础模型

Evan W. Damron, Mahmut S. Gokmen, Mitchell A. Klusty, Caroline N. Leach, Emily B. Collier, V. K. Cody Bumgardner

机构 * University of Kentucky(肯塔基大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV

AI总结 提出DALE-CT,一种基于LeJEPA的2D切片模型,通过3D深度感知预训练(利用解剖掩膜和异常标注)提升表示质量,在CT多异常检测中达到与3D视觉语言模型近似的性能。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07326 2026-06-08 cs.CV 新提交 57%

AnchorWorld: Embodied Egocentric World Simulation with View-based Evolution Customization

AnchorWorld: 基于视图演化定制的具身自我中心世界模拟

Yu Li, Menghan Xia, Gongye Liu, Xintao Wang, Conglang Zhang, Lei Ke, Yuxuan Lin, Ruihang Chu, Pengfei Wan, Kun Gai, Yujiu Yang

机构 * Tsinghua University(清华大学) HUST(华中科技大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队) HKUST(香港科技大学) WHU(武汉大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 提出AnchorWorld框架,利用3D人体运动和外源视角辅助训练增强交互完整性,并通过锚点视图和文本描述实现自我演化世界的灵活定制,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07253 2026-06-08 cs.AI econ.EM 新提交 57%

TOPSIS-RAD: Ranking According to Desires

TOPSIS-RAD:根据期望排序

Leonardo Fernandes Costa, Helder Gomes Costa, Diogo Lima, Brunno Rodrigues

机构 * Universidade Federal Fluminense(联邦弗里蒙特大学) Leonardo Sistemas Consultoria LTDA(莱昂纳多咨询公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出TOPSIS-RAD方法,通过引入决策者定义的否决绩效水平和期望绩效水平,解决传统TOPSIS排序与决策者需求不一致、对异常值敏感及排名反转问题。

Comments 21 pages, 15 Tables and 6 figures. The numerical computation of the data that appear in the Toy Examples was Supported by the Visual TOPSIS RAD that is available at https://topsis-ranking.vercel.app/. The data of the Toy examples are also available in this URL and can be loaded in the app as the template "Article"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12951 2026-08-14 cs.SD 新提交 50%

VoxAudio: Vocalized Audio Synthesis via Multi-Reward Autoregressive Flow Matching

VoxAudio:基于多奖励自回归流匹配的发声音频合成

Wenxiang Guo, Changhao Pan, Ziyue Jiang, Fei Wu, Zhou Zhao

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VoxAudio是一种多奖励自回归流匹配模型,通过架构、偏好、数据层面的优化,解决现有T2A系统发声控制不足的问题,在多基准上验证了有效性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12707 2026-08-14 cs.RO 新提交 50%

SAP-Nav: Spatial Semantic Representation Meets Active Perception for Hierarchical Open-Vocabulary Object Navigation

SAP-Nav:空间语义表示与主动感知结合的分层开放词汇对象导航

Xuetong Pei, Jian Liu, Vidura Munasinghe, Bo Miao, U-Xuan Tan, Wenrui Ding, Na Zhao

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出SAP-Nav框架,结合空间语义表示与主动感知,解决分层开放词汇对象导航问题,在基准测试中性能最优且真实场景可行,无需特定训练或预计算场景地图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11033 2026-08-12 cs.MA 新提交 50%

Who Are You Explaining To? A Multi-Agent System for Audience-Aware XAI Narratives

你在向谁解释?面向受众感知的XAI叙事多智能体系统

Francesco Musicco, Danilo Danese, Giuseppe Fasano, Angela Lombardi, Alberto Carlo Maria Mancino, Tommaso Di Noia

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对现有XAI叙事无法适配不同受众的问题,提出XstrAI多智能体框架,结合三类LLM智能体与修正循环,在糖尿病、中风风险预测任务中,其叙事适配性与保真度优于多数基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09698 2026-08-11 cs.HC cs.CL 新提交 50%

VeriForge: Mitigating Latent Knowledge Gaps in Narrative Drafting via Mixed-Initiative Scaffolding

VeriForge:通过混合式主动脚手架缓解叙事创作中的潜在知识缺口

Ruqi Sun, Jiaping Li, Wenhui Tao, Ximing Zheng, Yuefeng Tan, Jiahao Wei, Yuxin Ma

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 VeriForge是混合式主动写作系统,通过主动内联高亮、双流查询、空间知识画布三种机制,帮助作者识别叙事创作中的潜在知识缺口,提升领域知识整合能力,获用户与专家认可。

Comments 14 pages, 5 figures, Accepted by UIST'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09588 2026-08-11 cs.CL 新提交 50%

MDB-Link: Hierarchical Schema Linking for Multi-Database Text-to-SQL

MDB-Link:面向多数据库Text-to-SQL的分层模式链接方法

Beiyu Xu, Zhenyu Wu, Jiaoyan Chen, Riza theresa Batista-navarro

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文针对多数据库Text-to-SQL场景提出分层模式链接框架MDB-Link,结合LLM实现数据库定位与列选择,在多个数据集上性能及运行速度均优于基线方法,可高效支撑SQL生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08927 2026-08-11 cs.SE 新提交 50%

Biomedical Knowledge Composition: A Software Engineering Perspective

生物医学知识构建:软件工程视角

Natallia Kokash, Adam S. Z. Bellouma, Paola Grosso

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文从软件工程视角,阐述生物医学知识图谱的核心地位与相关挑战,提出需借鉴Web工程的可组合可复现实践,为生物医学知识基础设施构建提供研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08543 2026-08-11 cs.CY 新提交 50%

Rethinking Higher Education: From Fixed Curricula to Learnity Graphs

重新思考高等教育:从固定课程到学习图谱(Learnity Graphs)

Smadar Szekely, Judith Gal-Ezer, David Harel

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文针对高等教育在AI时代的转型需求,提出以学习图谱为核心的终身学习框架,整合多类学习以拓展传统课程的培养维度。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07497 2026-08-11 cs.HC cs.CL 新提交 50%

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

EvalConvoLearn:一个用于评估辅导对话中具身学习者模拟的开源框架

Baptiste Moreau-Pernet

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvalConvoLearn是评估辅导对话中学习者模拟的开源框架,从学习行为与对话质量两个维度开展评估,验证了其在辅导对话数据集上的有效性并公开了代码。

Comments Poster at the Impactful and Responsible AI Systems for Education workshop, as part of the Festival of Learning 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06495 2026-08-10 cs.CL 新提交 50%

ConstructCIE: A Dataset for Extracting Causal Information from Construction Accident Narratives

ConstructCIE:用于从施工事故叙述中提取因果信息的数据集

Hung Nguyen, Jaehoon Lee, Namgyun Kim, Kuan-Hao Huang

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究构建了用于提取施工事故因果信息的ConstructCIE数据集,评估了相关模型的性能,发现模型在精确跨度提取上存在局限,需强化领域基础与证据提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06022 2026-08-07 cs.CL q-bio.GN 新提交 50%

EpiBench: Can LLMs Understand Epitopes for Antibody Drug Discovery?

EpiBench:大型语言模型能否为抗体药物发现表位?

Zirui Wang, Jiaqi Wang, Qinghan Wang, Yuzhi Xu, Gang Du, Tingjun Hou, Odin Zhang

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出用于评估大型语言模型表位推理能力的基准EpiBench,发现现有通用LLMs在抗体药物发现相关表位推理上仍存局限,为改进序列感知型生物医学LLMs提供了测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05917 2026-08-07 cs.SE 新提交 50%

Escaping the Self-Repair Trap: Improving Test Oracle Generation via Dual-Context Awareness

跳出自修复陷阱:通过双上下文感知改进测试预言生成

Kefan Li, Hongyue Yu, Yuan Yuan

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 针对迭代自修复引发的自修复陷阱问题,提出非迭代高效框架DCAware,结合结构化静态上下文与动态状态,在低计算成本下提升测试预言的故障检测效果

Comments Accepted to ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05957 2026-08-07 cond-mat.mtrl-sci 新提交 50%

ASE2SPRKKR: a unified Python framework integrating the Spin-Polarized Relativistic Korringa-Kohn-Rostoker method into the Atomic Simulation Environment

ASE2SPRKKR:将自旋极化相对论Korringa-Kohn-Rostoker(SPR-KKR)方法集成到原子模拟环境(ASE)的统一Python框架

Ridha Eddhib, Matyáš Novák, Hubert Ebert, Aki Pulkkinen, Ján Minár

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究人员开发了将SPR-KKR集成到ASE的Python框架ASE2SPRKKR,扩展了Atoms对象功能,支持多类材料计算,符合FAIR原则,为相关代码融入现代材料发现工作流提供了蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04645 2026-08-06 cs.PL 新提交 50%

Towards Datalog on Quantum Annealers: Compiling Recursive Logic Programs with Bottom-up Semantics to 2-local Ising Models

面向量子退火器的Datalog:将具有自底向上语义的递归逻辑程序编译为2局域伊辛模型

Bruno Rucy Carneiro Alves de Lima, Victor Henrique Cabral Pinheiro, Evgenii Dolzhkov, Joseph Haske

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究将递归Datalog程序编译为量子退火器可处理的2局域伊辛模型,经Lean 4验证正确性,还映射到商用退火器拓扑并表征基态获取情况。

Comments 12 pages, 4 pages of appendix, Datalog 2.0 preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04195 2026-08-06 cs.SE 新提交 50%

SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References

SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)

Simantika Bhattacharjee Dristi, Matthew B. Dwyer

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04002 2026-08-05 cs.HC 新提交 50%

Semantic Bundling: Interactive Node and Edge Bundling to Simplify Knowledge Graphs using Large Language Models

语义捆绑:使用大语言模型简化知识图谱的交互式节点与边捆绑

Adam Coscia, Zeyu Hua, Eric Krokos, Timothy Lin, Alex Endert

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 该研究提出基于LLM的语义捆绑技术,在开源系统AgentK中实现,用于简化知识图谱,通过节点边捆绑形成高级结构,在电影评论等场景中可揭示文档集合新见解。

Comments Under review. 12 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03872 2026-08-05 cs.RO 新提交 50%

EvoHIL: Self-Evolving Reward and Flow-Matched Policy Optimization for Robust Human-in-the-Loop Reinforcement Learning

EvoHIL:用于鲁棒交互式强化学习的自演化奖励与流匹配策略优化

Shuoqin Zhang, Tongtong Cheng, Xiru Gao, Jinzhuo Peng, Bin Zheng, Jiahao Tu, Ke Wang, Jia Pan, Zhe Hu, Kai Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 EvoHIL是适配奖励模型、动作生成器和视觉域的统一交互式学习框架,在六类机械臂操纵任务中提升了成功率、运动平滑度等性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03735 2026-08-05 cs.MA cs.CL 新提交 50%

An Actionable Diagnosis of Multilingual, Multi-Agent Planning Failures

多语言多智能体规划失败的可操作诊断

Vikas Pahuja, Jonathan Brokman, Omer Hofman, Tamir Nizri, Daniel Vishna, Seraphina Goldfarb-Tarrant, Kelly Marchisio, Hisashi Kojima, Roman Vainshtein

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究针对多语言多智能体系统在非英语场景下的规划失败问题,提出规划-接地失败分类法,开发TART方法,在多语言任务中显著提升了现有系统的性能。

Comments 22 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02959 2026-08-05 cs.MA 新提交 50%

SABRE: A Multi-Agent Approach for Selecting Out-of-Distribution Detectors Under a Budget

SABRE:预算约束下选择分布外检测器的多智能体方法

Mary Wisell, Salimeh Sekeh

专题命中 视觉定位与Grounding :vision-language model(abstract)

AI总结 SABRE是一种多智能体方法,可在预算约束下针对视觉-语言模型的分布外检测,自动选择各领域最优检测器,解决固定检测器跨领域失效的问题,实现可靠检测。

详情

展开后加载摘要…

URL PDF HTML 收藏