arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-18 至 2026-08-18 共收录 45 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 45 篇

2608.15004 2026-08-18 cs.CV cs.AI 新提交 93%

FZ-VLM: A Two Stage Florence-Zephyr Vision Language Model Framework for Pulmonary Nodule Characterization and Clinical Decision Making

FZ-VLM:用于肺结节特征表征与临床决策的两阶段Florence-Zephyr视觉语言模型框架

Pramit Dutta, Jenita Manokaran, Richa Mittal, Ryan Appleby, Eranga Ukwatta

机构 * College of Engineering, University of Guelph(圭尔夫大学工程学院) Holland Bloorview Kids Rehabilitation Hospital(霍兰德布鲁尔维尤儿童康复医院) Guelph General Hospital(圭尔夫综合医院) Ontario Veterinary College, University of Guelph(圭尔夫大学安大略兽医学院)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision language model(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出首个两阶段视觉语言模型框架FZ-VLM,通过微调Florence-2与Zephyr-7B模型,实现肺CT中肺结节的结构化特征表征与临床决策,性能优于GPT-4基线及人类基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21576 2026-08-18 cs.CL 版本更新 92%

Vision Language Models Cannot Plan, but Can They Formalize?

视觉语言模型(VLMs)无法规划,但它们能进行形式化吗?

Muyu He, Yuxi Zheng, Yuchen Liu, Zijian An, Bill Cai, Jiani Huang, Lifeng Zhou, Feng Liu, Ziyang Li, Li Zhang

机构 * Drexel University(德雷塞尔大学) University of Pennsylvania(宾夕法尼亚大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);grounding(summary_cn,abstract);vision language model(title,abstract)

AI总结 本研究提出5种VLM作为形式化器的流水线,评估后发现其表现优于端到端规划生成,较弱VLMs的瓶颈为物体关系视觉grounding,较强模型已克服该限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15410 2026-08-18 cs.DC cs.AI cs.CV cs.RO eess.SY 新提交 91%

FloodReasonBench: Benchmarking VLM Reasoning Segmentation for Embodied Flood Response at the Edge

FloodReasonBench:面向边缘端具身洪水响应的VLM推理分割基准

Rajat Bhattacharjya, Yoomee Jung, Minwoo Kim, Sing-Yao Wu, Eli Bozorgzadeh, Nalini Venkatasubramanian, Nikil Dutt

专题命中 视觉定位与Grounding :VLM(title,title_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 FloodReasonBench针对边缘端具身洪水响应,构建专用数据集并刻画推理分割流水线的性能权衡,为资源受限场景提供任务与系统层面的基准支持。

Comments Paper is currently under review. The code and dataset will be made public upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15238 2026-08-18 cs.CV 新提交 90%

UC-VLM: Consistency-Driven Learning for AI-Generated Image Detection with Vision-Language Large Models

UC-VLM:基于一致性驱动学习的视觉语言大模型生成图像检测方法

Lei Tan, Shuwei Li, Mohan Kankanhalli, Robby T. Tan

机构 * National University of Singapore(新加坡国立大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);分类 cs.CV

AI总结 UC-VLM是仅依赖二元监督的多阶段框架,通过复用真实性标签实现视觉适配与文本生成,在GenImage、Chameleon等数据集上显著提升了AI生成图像检测的准确率。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16004 2026-08-18 cs.IR 新提交 89%

LineageRAG: Harnessing GraphRAG by Constructing Evidence Lineages with Source Grounding

LineageRAG:通过构建带源 grounding 的证据谱系来利用 GraphRAG

Linyao Zheng, Xuhang Shi, Zhifang Mao, Sai Zhou, Shuaixian An, Xiuquan Hou, Jinze Li

专题命中 视觉定位与Grounding :grounding(title,title_cn)

AI总结 LineageRAG 针对现有 GraphRAG 未明确证据发现与源 grounding 关联的问题,构建带源 grounding 的证据谱系,在三个多跳问答数据集上较基线实现多项指标提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16447 2026-08-18 cs.AI cs.RO 新提交 87%

HaReCAP: Habitual-action Grounding for Recursive Large Language Model Agents

HaReCAP:面向递归大语言模型智能体的习惯性动作 grounding 方法

Shen Liu, Zhenguo Xu, Shaopu Wang, Yike Gao, Chunlei Wang

机构 * North China Institute of Computer System Engineering(华北计算机系统工程研究所) University of Science and Technology of China(中国科学技术大学) China Information Security Research Institute Co., Ltd.(中国信息安全研究院有限公司)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.AI

AI总结 HaReCAP 是针对 ReCAP 的低侵入性扩展,通过编译叶子反射规则减少长视距具身任务中 LLM 的重复调用,在 Robotouille 和 ALFWorld 上显著降低了 token 消耗。

Comments 15 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15061 2026-08-18 cs.CV 新提交 87%

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

视觉定位解码器是否需要前馈网络?基于冻结的视觉-语言特征的受控研究

Tarun Tomar

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过受控实验对比不同视觉定位解码器,发现仅注意力的4块解码器(A4)性能与含FFN的4块解码器相当,8块仅注意力解码器(A8)可弥补A4的微小差距且更优,同时A4能减少参数量与延迟。

Comments 14 pages, 8 figures, 5 tables. Code and project page: this https URL (https://github.com/TarunTomar122/attention-is-all-you-need-for-vlms)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-18 cs.CV 版本更新 84%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14724 2026-08-18 cs.CV cs.AI cs.LG 新提交 83%

Privacy-Preserving Dataset Curation for Kuala Lumpur Urban Traffic: Grounded Vision-Language Detection with Spatial Vehicle-Context Filtering

面向吉隆坡城市交通的隐私保护数据集构建:结合空间车辆上下文过滤的接地视觉-语言检测

Mohammed Abdul Al Arafat Tanzin, Rudzidatul Akmam Dziyauddin

机构 * Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚理工大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(summary_cn,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对吉隆坡热带城市交通场景的隐私保护数据集构建难题,提出结合Grounding DINO与空间车辆ROI包含引擎的自动化匿名化框架,在1266帧图像上实现约95%的匿名化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15517 2026-08-18 cs.CV 新提交 83%

GLaQ: Grounding Latent Queries in Visual Evidence for Multimodal Reasoning

GLaQ:基于视觉证据的潜在查询定位用于多模态推理

Zesheng Yang, Lingling Zhang, Xinyu Zhang, Cheng Zhang, Pengyu Li, Heng Wang, Lin Wu

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出GLaQ框架,用定位的上下文条件查询替代顺序潜在展开,经训练后在五个视觉理解基准上优于基础模型及其他视觉潜在方法,可高效恢复局部视觉证据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15802 2026-08-18 cs.CV cs.LG 新提交 82%

PWLR: Pairwise Witness Local Rejection for Boundary-Aware Out-of-Distribution Detection

PWLR:用于边界感知分布外检测的成对见证局部拒绝

Chengyao Jia, Ruixuan Wang

机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)

专题命中 视觉定位与Grounding :MLLM(summary_cn,abstract);分类 cs.CV、cs.LG

AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09761 2026-08-18 cs.LG cs.AI 版本更新 81%

Grounding LTL Tasks in Sub-Symbolic RL Environments for Zero-Shot Generalization

在子符号强化学习环境中将LTL任务接地以实现零样本泛化

Matteo Pannacci, Andrea Fanti, Elena Umili, Roberto Capobianco

机构 * Sapienza University of Rome(萨皮恩扎大学罗马分校) Sony AI(索尼人工智能)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出在子符号强化学习环境中通过联合训练多任务策略和符号接地器,实现LTL任务的零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15419 2026-08-18 cs.CV 新提交 79%

ArtLang: Structured Language-to-Kinematics Grounding for Articulated 3D Actuation

ArtLang:面向铰接3D驱动的结构化语言到运动学的绑定

Sylvia Yuan, Dan Wang, Ravi Ramamoorthi, Xinrui Cui

机构 * University of California San Diego(加利福尼亚大学圣迭戈分校) University of North Texas(北得克萨斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV

AI总结 研究针对铰接物体控制的语义匿名问题,提出ArtLang框架,通过语义-运动学铰接图等技术实现开放词汇语言控制,经多类实验验证了可靠的语言绑定与连续铰接控制能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15382 2026-08-18 cs.AI cs.IR 新提交 79%

Grounding Healthcare LLMs in a Causal Knowledge Graph: Framework, Metrics, and a Cardiovascular Pilot

将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究

Ummara Mumtaz, Aimen Noor, Awais Ahmed

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16259 2026-08-18 cs.CV cs.AI 新提交 79%

Defake-o3: From Speculative Rationales to Verifiable Evidence for Explainable AIGI Detection

Defake-o3:从推测性理由到可验证证据的可解释AIGI检测

Bowen Deng, Jiahui Zhan, Yikun Ji, Haozhen Yan, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Defake-o3是结合交互式视觉搜索与证据验证器的可解释AIGI检测器,构建了GroundFake数据集和FakeFrontier基准,在多基准上同时提升了AIGI检测准确率与解释质量。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11426 2026-08-18 cs.RO 版本更新 78%

Grounding Robot Generalization in Training Data via Retrieval-Augmented VLMs

通过检索增强的视觉语言模型实现机器人在训练数据中的泛化

Jensen Gao, Dorsa Sadigh, Sandy Huang, Dhruv Shah

机构 * Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :grounding(title);vision-language model(abstract)

AI总结 本文提出RADAR框架,通过检索和视觉语言模型分析,评估机器人策略在不同场景下的泛化能力,验证了其在大规模数据集中的有效性。

Comments IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16806 2026-08-18 cs.RO cs.AI 新提交 77%

When State Becomes an Attack Surface: State-Semantic Injection in LLM-Driven Embodied Agents

当状态成为攻击面:大语言模型驱动的具身智能体中的状态语义注入

Jiawei Liu, Jiacheng Guo, Tian Zhang, Yiwei Xu, Juan Wang, Jinlin Fan, Bowen Xiao, Chi Guo, Keyan Guo, Hongxin Hu

机构 * Wuhan University(武汉大学) University at Buffalo(布法罗大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 该文聚焦LLM驱动的具身智能体,梳理其技术演进与现有模型,指出其需结合多类信息完成任务落地后执行,为后续状态语义注入攻击研究奠定基础。

Comments submitted to USENIX Security 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16794 2026-08-18 cs.RO cs.AI cs.CL 新提交 70%

Neurosymbolic Embodied Agents

神经符号具身智能体

Mohammad Albinhassan, Yuming Feng, Alessandra Russo, Pranava Madhyastha

机构 * Imperial College London(帝国理工学院) Johns Hopkins University(约翰斯·霍普金斯大学) City, University of London(伦敦城市大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 该研究提出一种神经符号具身智能体,将长周期家庭任务分解为视觉探索与符号规划,在VirtualHome、ALFWorld基准测试中表现优异,约束与搜索结合可大幅提升任务解决率,且无需专门训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15685 2026-08-18 cs.CV 新提交 70%

Counterfactual Sensitivity Is Not Repairability: Auditing Replay Probes for Video Evidence

反事实敏感性不等于可修复性:针对视频证据的重播探针审计

Rama AlHamidi, Rasul Khanbayov, Erchin Serpedin, Hasan Kurban

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究提出黑盒反事实探针 CARVE,通过对比 SHAM 与 DESTROY 重播下的答案变化,审计视频智能体的证据依赖,在 LVBench 上取得准确率提升,验证了反事实敏感性与可修复性的差异。

Comments 23 pages, 2 figures. Code: this https URL (https://github.com/KurbanIntelligenceLab/CARVE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27856 2026-08-18 cs.CV 版本更新 70%

Benchmarking Foundation and Large Language Models for Few-Shot Medical Image Segmentation

基准测试用于小样本医学图像分割的基础模型与大语言模型

Jinghong Liu, Yuchuan Deng, Fanping Liu, Meng Huang, Xirong Li

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出统一基准FAME,涵盖四类模型,含14958个样本,评估得出小样本分割的关键规律,助力开发更有效的小样本医学分割方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11427 2026-08-18 cs.CV 版本更新 70%

Comprehension of Multilingual Expressions Referring to Target Objects in Visual Inputs

视觉输入中指代目标对象的多语言表达式理解

Francisco Nogueira, Alexandre Bernardino, Bruno Martins

机构 * Instituto Superior Técnico(技术高等学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本研究针对多语言指代表达式理解问题,构建了含10种语言的统一多语言数据集,提出基于多语言SigLIP2编码器的注意力锚定高效架构,验证了该模型在多语言视觉定位任务上的竞争力与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16188 2026-08-18 cs.OS 新提交 67%

AdaSprite: Resource-efficient Online Co-Adaptation for V2I Systems Under Large-scale Data Drifts

AdaSprite:大规模数据漂移下车路协同(V2I)系统的资源高效在线协同自适应

Lehao Wang, Zhiwen Yu, Sicong Liu, Kefan Chen, Fengmin Wu, Bin Guo

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 针对V2I系统大规模数据漂移下边缘资源受限的协同自适应问题,AdaSprite通过协同弹性扩缩等技术,使弱边缘支持17个并发V2I任务,SLO达成率与吞吐量分别提升1.6倍、2.1倍。

Comments MobiSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00600 2026-08-18 cs.RO 版本更新 67%

I-Perceive: A Foundation Model for Active Perception with Language Instructions

I-Perceive:一种基于语言指令的主动感知基础模型

Yongxi Huang, Zhuohang Wang, Wenjing Tang, Xinyu He, Cewu Lu, Panpan Cai

机构 * Shanghai Innovation Institute(上海创新研究院) Beihang University(北京航空航天大学)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract)

AI总结 I-Perceive是一种基于自然语言指令的主动感知基础模型,通过融合视觉-语言模型与几何基础模型,实现了对开放意图场景的有效感知与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16622 2026-08-18 cs.CV cs.AI 新提交 62%

HarmTrace: Anchor-Calibrated Decoupled Optimization for Fine-Grained Target Identification in Harmful Memes

HarmTrace:用于恶意梗图细粒度目标识别的锚定校准解耦优化方法

Yujia Li, Yiqun Zhang, Zihan Cheng, Yijie Huang, Tenglong Ye, Zihan Wang, Xiaocui Yang, Shi Feng, Yifei Zhang, Daling Wang

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对多模态恶意梗图检测中存在的目标识别错误问题,提出HarmTrace框架,结合实体感知微调与CTPO方法,在Qwen3-VL-8B上JRA提升至52.51%,还构建了Meme3W数据集与JRA指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15863 2026-08-18 cs.RO cs.AI cs.CL cs.CV cs.MM 新提交 62%

Scaling Manual-Grounded Appliance Manipulation with Data Synthesis and Unified Planning

通过数据合成与统一规划扩展基于手册的家电操作规模

Yuxing Long, Lei Kang, Ziyan Yu, Yuzheng Gao, Bin Cheng, Jiyao Zhang, Xiaoqi Li, Haolin Yang, Dongjiang Li, Hui Shen, Hao Dong

机构 * Center on Frontiers of Computing Studies, School of Computer Science, Peking University(北京大学计算机学院计算前沿研究中心) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Jingdong Technology Information Technology Co., Ltd(京东科技信息技术有限公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对现有大模型缺乏支持基于手册的家电操作规划的数据集的问题,提出MAGE数据合成流水线构建UseAppliance数据集,开发AppliancePlan模型,在RealAppliance-Bench和真实机器人实验中表现优异,推进通用家用机器人发展。

Comments Accepted by ACM MM 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15032 2026-08-18 cs.CL cs.AI cs.CV 新提交 62%

Handoff-H1: An Orchestrated Vision-Agent System for Material Quantity Takeoff from Construction Blueprints

Handoff-H1:一种用于从建筑蓝图中提取材料工程量的协同视觉智能体系统

Bruno Chicelli, Henrique Alves, Rodrigo Anselmo, Joshua Weinberg, Felipe Lemos, Jan Baryla

机构 * Handoff AI Research(汉德夫人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出Handoff-H1视觉智能体系统,结合专用计算机视觉模型、工具智能体与建筑知识库,在建筑蓝图工程量提取基准上,性能优于前沿模型和人类专业估算师。

Comments 15 pages, 7 figures. Evaluation harness available on this https URL (https://github.com/handoffai/residential-takeoff-benchmark/). Request data via e-mail to research@handoff.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14391 2026-08-18 cs.CV cs.AI 版本更新 62%

Can We Defend Against AI-Generated Video Attacks on Real-World Crisis Events? A Systematic Evaluation of Detectors, Generators and Social Dissemination

我们能否防御AI生成视频对现实世界危机事件的攻击?对检测器、生成器及社交传播的系统性评估

Shuo Liang, Yixing Ma, Pengfei Zhou, Zhenglin Wan, Xingyan Chen, Zihan Mei, Manting Li, Feihan Chen, Zhiwen Wang, Bin Xu, Haotian Zhang, Jiajun Song, Shiya Su, Run Liu, Zhenghang Ni, Yifa Yu, Jintao Hong, Bolong Feng, Yifei Liu, Zirui Zhang, Jingxuan Zhang, Songlin Zhao, Yifan Bai, Kang Tan, Yizhe Liu, Junhao Du, Yongtao Ge, Zhaopan Xv, Xinyuan Zhang, Mengru Ma, Chunhua Shen, Wei Wang, Yang You, Zheng Zhu, Kaipeng Zhang, Wangbo Zhao

专题命中 视觉定位与Grounding :MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究推出RA-Bench基准,系统评估AI生成视频检测器、生成器及社交传播特性,发现现有检测器泛化性差、难以检测逼真生成视频,需鲁棒检测器。

Comments 63 pages, 20 figures, 32 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09562 2026-08-18 cs.CV cs.AI 版本更新 62%

Prompt Engineering in Segment Anything Model: Methodologies, Applications, and Emerging Challenges

分割一切模型中的提示工程:方法、应用与新兴挑战

Yidong Jiang, Jiangtong Li, Daiwei Cheng

机构 * School of Computer Science and Technology, Tongji University(计算机科学与技术学院,同济大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本综述系统梳理了SAM的提示工程技术,将其分为三类并分析方法演变,探讨其跨领域应用,指出三大挑战并提出有前景的研究方向,为相关领域提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16515 2026-08-18 cs.CL cs.AI 新提交 57%

When Context Misleads: Intent-Guided Decoding for Robust Retrieval-Augmented Generation

当上下文产生误导时:用于稳健检索增强生成的意图引导解码

Haolin Jin, Pengyue Yang, Huaming Chen

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对现有RAG系统固定信任策略的缺陷,提出意图引导解码(IGD)框架,经多基准评估,可显著提升事实恢复能力,同时保持或改善上下文遵循行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16222 2026-08-18 cs.RO cs.AI 新提交 57%

HiPHI: A Large-Scale Benchmark for High-Precision Human Motion and Object-Interaction

HiPHI:面向高精度人体运动与物体交互的大规模基准测试集

Jiahao Ji, Ji Ma, Runhan Zhang, Runyi Yu, Wenjia Wang, Weiheng Chi, Qianqian Peng, Weichao Yan, Yongfei Gu, Ye Tian, Ting Wu, Longwei Li, Chun Yuan, Ruoli Dai, Lei Han

机构 * National University of Singapore(新加坡国立大学) The University of Hong Kong(香港大学) SIGS, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Noitom Robotics(诺亦腾机器人公司)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对现有具身数据集的局限,提出基于FrameNet的600+小时高保真人体运动与物体交互基准HiPHI,配套评估套件,为类人策略学习及计算机图形学运动先验模型提供数据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏