arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7387 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7387 篇

2606.18633 2026-06-18 cs.MA 新提交 67%

PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

PersonalPlan: 面向个性化编程学习的多智能体系统规划

Zhiyuan Wen, Jiannong Cao, Peng Gao, Haochen Shi, Wengpan Kuan, Bo Yuan, Xiuxiu Qi

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出PersonalPlan,一种两阶段多智能体规划器,通过分层SFT和奖励自适应GRPO生成可执行、个性化且具有教学支架的计划,在MAP-PPL数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14089 2026-06-15 cs.RO 新提交 67%

A Modular Dual-Arm Apple Harvesting Robot with Enhanced Field Performance

一种具有增强田间性能的模块化双臂苹果采摘机器人

Keyi Zhu, Kyle Lammers, Chaaran Arunachalam, Kaixiang Zhang, Renfu Lu, Zhaojian Li

机构 * Michigan State University(密歇根州立大学) United States Department of Agriculture Agricultural Research Service(美国农业部农业研究局)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出一种模块化双臂苹果采摘机器人,采用垂直堆叠臂实现单树上下区域同时作业,结合基础模型感知、7阶加加速度轨迹生成、线性扫描采摘策略等5项改进,在商业果园中达到80.0%采摘成功率和7.53秒平均单臂周期,91.2%果实达到特级标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20734 2026-06-15 cs.CL cs.AI cs.CV cs.IR cs.LG 版本更新 67%

UniversalRAG: Retrieval-Augmented Generation over Corpora of Diverse Modalities and Granularities

UniversalRAG: 在多样模态和粒度的语料库上实现检索增强生成

Woongyeong Yeo, Kangsan Kim, Soyeong Jeong, Jinheon Baek, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出UniversalRAG,一种能够处理多种模态和粒度的检索增强生成框架,通过动态路由机制和多粒度组织,提升跨模态知识检索的有效性,实验表明其在多个模态基准上的优越性。

Comments ACL 2026. Project page : https://universalrag.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06754 2026-06-08 cs.MA cs.CL 新提交 67%

MADRAG: Multi-Agent Debate with Retrieval-Augmented Generation for Training-Free Analytic Essay Scoring

MADRAG: 基于检索增强生成的多智能体辩论用于免训练分析性论文评分

Ali Keramati, Shiyuan Zhou, Sharad Mehrotra, Mark Warschauer

机构 * University of California, Irvine(加州大学尔湾分校)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 提出MADRAG框架,结合多智能体辩论与检索增强,通过倡导者、批评者和法官的交互以及检索示例校准,实现无需训练的论文评分,性能接近监督系统。

Comments 21 pages, 7 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01992 2026-06-02 cs.CV cs.AI cs.LG 67%

A Structured Benchmark for Text-Guided Anomaly Detection: When Language Stops Conditioning the Decision

文本引导异常检测的结构化基准:当语言停止条件化决策时

Stefano Samele, Eugenio Lomurno, Teodora Jovanovic, Sanjay Shivakumar Manohar, Alberto Crivellaro, Matteo Matteucci

机构 * Politecnico di Milano, AIRLab(米兰理工学院,AIRLab) S&H – Software & Hardware(S&H – 软件与硬件)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出结构化基准TGAD,通过三个场景逐步增加语言功能角色,评估多模态异常检测系统的文本引导能力,发现当前系统仅表面受语言条件化,标准基准高估了其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00548 2026-06-02 cs.CV cs.AI cs.LG 67%

CAFOSat: A Strongly Annotated Dataset for Infrastructure-Aware CAFO Mapping Using High-Resolution Imagery

CAFOSat:用于基于高分辨率影像的基础设施感知型CAFO制图的高质量标注数据集

Oishee Bintey Hoque, Nibir Chandra Mandal, Mandy L Wilson, Samarth Swarup, Madhav Marathe, Abhijin Adiga

机构 * University of Virginia(弗吉尼亚大学) Biocomplexity Institute, University of Virginia(弗吉尼亚大学生物复杂性研究所)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对集中式动物饲养操作(CAFO)大规模制图困难,提出CAFOSat数据集,集成高分辨率NAIP影像与多源CAFO清单,通过人机协同标注、GradCAM定位和几何聚类优化弱定位记录,并引入合成增强管道,实现基础设施级标注和鲁棒分类。

Comments Accepted at CVPR Workshop-2026. First two authors has equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28805 2026-05-28 cs.CL cs.AI cs.CV cs.LG 67%

OmniVerifier-M1: Multimodal Meta-Verifier with Explicit Structured Recalibration

OmniVerifier-M1: 具有显式结构化重校准的多模态元验证器

Xinchen Zhang, Bowei Liu, Jiale Liu, Chufan Shi, Yizhen Zhang, Junhong Liu, Youliang Zhang, Zhiheng Li, Yujiu Yang, Ling Yang

机构 * Tsinghua University(清华大学) Pennsylvania State University(宾夕法尼亚州立大学) University of Southern California(南加州大学) Microcyto Princeton University(普林斯顿大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 提出OmniVerifier-M1,通过符号化元验证(如边界框)和解耦强化学习,实现多模态大模型的可靠细粒度验证与动态区域级自校正。

Comments ICML 2026. Project: https://github.com/Cominclip/OmniVerifier

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20967 2026-05-21 cs.CL 67%

ArPoMeme: An Annotated Arabic Multimodal Dataset for Political Ideology and Polarization

ArPoMeme:一个标注的阿拉伯多模态数据集用于政治意识形态和极化

Wajdi Zaghouani, Kais Attia, Md. Rafiul Biswas, Fadhl Eryani

机构 * Northwestern University in Qatar(卡塔尔西北大学) Independent Researcher(独立研究员) Hamad Bin Khalifa University(哈马德·本·卡伊夫大学) University of Tübingen(图宾根大学)

专题命中 视觉定位与Grounding :vision language model(abstract);grounding(abstract)

AI总结 本文提出ArPoMeme数据集,用于分析阿拉伯政治漫画的多模态和意识形态维度,通过自定义工具实现大规模标注,揭示意识形态极化特征。

Comments Accepted at LREC 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14600 2026-05-15 cs.CL 67%

SciPaths: Forecasting Pathways to Scientific Discovery

SciPaths: 预测科学发现的路径

Eric Chamoun, Yizhou Chi, Yulong Chen, Rui Cao, Zifeng Ding, Michalis Korakakis, Andreas Vlachos

机构 * University of Cambridge(剑桥大学) The Alan Turing Institute(艾伦·图灵研究所) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出SciPaths基准,通过专家标注的262条金路径和2444条银路径,评估科学发现路径预测任务,发现核心方法依赖最难恢复,需改进分解质量以提升端到端路径恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08136 2026-05-12 cs.CL 67%

EconWebArena: Benchmarking Autonomous Agents on Economic Tasks in Realistic Web Environments

EconWebArena:在现实网络环境中评估自主代理在经济任务上的基准测试

Zefang Liu, Yinzhu Quan

机构 * Capital One Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出EconWebArena基准,通过360个精心挑选的任务测试自主代理在经济任务中的能力,强调权威数据源和基于网络的经济推理,评估多种多模态LLM的表现,揭示性能差距和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 67%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 67%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract_cn)

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07794 2026-05-08 cs.IR 67%

Query Expansion in the Age of Pre-trained and Large Language Models: A Comprehensive Survey

预训练和大语言模型时代的问题扩展:综述

Minghan Li, Xinxuan Lv, Junjie Zou, Tongna Chen, Chao Zhang, Suchao An, Ercong Nie, Guodong Zhou

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文综述了预训练和大语言模型时代的问题扩展方法,探讨了不同模型家族如何实现新的扩展行为,并分析了四种设计维度下的最新技术,总结了应用模式和部署考虑,指出了未来挑战和方向。

Comments 42 pages,10 figures,6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22038 2026-05-08 cs.CL 67%

Early Risk Prediction with Temporally and Contextually Grounded Clinical Language Processing

利用时序和情境 grounding 的临床语言处理进行早期风险预测

Rochana Chaturvedi, Yue Zhou, Andrew D. Boyd, Brian T. Layden, Mudassir Rashid, Lu Cheng, Ali Cinar, Barbara Di Eugenio

机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Illinois Institute of Technology(伊利诺伊理工学院)

专题命中 视觉定位与Grounding :grounding(title_cn)

AI总结 本文提出两种方法,HiTGNN 通过时序图神经网络建模患者轨迹,ReVeAL 通过轻量框架提升预测准确性与公平性,用于2型糖尿病早期筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22773 2026-04-28 cs.HC 67%

Trace Mutation in Human-LLM Dialogue: The Transcript as Forensic and Mitigation Surface

人类-大语言模型对话中的痕迹突变: transcripts作为取证与缓解表面

William J. Bensen

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 研究探讨了人类-LLM对话中'痕迹突变'现象,分析了两种突变形式及其对对话连续性的影响,指出其与编造和阿谀不同,且难以通过常规对话修复机制解决。

Comments 15 pages, 2 figures, 6 tables. Submitted to CHIWORK 2026 as Late-Breaking Work. Supplementary data: https://doi.org/10.5281/zenodo.19153940

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17888 2026-04-21 cs.RO 67%

SpaceDex: Generalizable Dexterous Grasping in Tiered Workspaces

SpaceDex:在分层工作空间中的通用灵巧抓取

Wensheng Wang, Chuanjun Guo, Wei Wei, Tong Wu, Ning Tan

机构 * Sun Yat-sen University(中山大学) Stellarobot Company(Stellarobot公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 SpaceDex提出了一种分层框架,通过视觉-语言模型规划和臂手特征分离网络,提升在受限3D环境中的灵巧抓取性能,实现在100次真实测试中达到63%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15225 2026-04-17 cs.HC 67%

UrbanClipAtlas: A Visual Analytics Framework for Event and Scene Retrieval in Urban Videos

UrbanClipAtlas:面向城市视频中事件和场景检索的视觉分析框架

Joel Perca, Luis Sante, Juanpablo Heredia, Joao Rulff, Claudio Silva, Jorge Poco

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文提出UrbanClipAtlas框架,结合RAG、实体提取和视频定位技术,实现城市视频中事件和场景的高效检索与解释,通过知识图谱和增强聊天界面提升分析效率。

Comments 12 pages and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11320 2026-04-14 cs.RO 67%

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

CLASP: 闭环异步空间感知用于开放词汇桌面物体抓取

Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

机构 * Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室) Peng Cheng Laboratory(鹏城实验室) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文提出CLASP框架,通过异步闭环机制整合多模态感知、逻辑推理与状态反馈,解决低级抓取中多模态演示不足、空间幻觉和开放环执行脆弱性问题,实现87%的成功率和强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09101 2026-04-13 cs.CR cs.AI cs.CV cs.LG 67%

CLIP-Inspector: Model-Level Backdoor Detection for Prompt-Tuned CLIP via OOD Trigger Inversion

CLIP-Inspector:通过OoD触发器反向工程实现提示调优CLIP的模型级后门检测

Akshit Jindal, Saket Anand, Chetan Arora, Vikram Goyal

机构 * IIIT Delhi(印度德里国际信息技术学院) IIT Delhi(印度德里理工学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对提示调优CLIP模型中潜在的后门攻击,CLIP-Inspector通过OoD触发器反向工程实现模型级后门检测,利用白盒访问和未标记OoD图像重建可能触发器,验证模型安全性并修复后门效果。

Comments 17 pages (8 main + 2 references + 7 supplementary), Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08609 2026-04-13 cs.CV cs.AI cs.LG 67%

Detection of Hate and Threat in Digital Forensics: A Case-Driven Multimodal Approach

数字取证中的仇恨与威胁检测:基于案例的多模态方法

Ponkoj Chandra Shill

机构 * University of Nevada, Reno(内华达大学雷诺分校)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出一种基于案例的多模态方法,用于数字取证中的仇恨与威胁检测,通过区分文本证据、关联上下文文本和图像证据,提升取证的可追溯性和准确性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08110 2026-04-13 cs.CV cs.AI cs.LG 67%

OV-Stitcher: A Global Context-Aware Framework for Training-Free Open-Vocabulary Semantic Segmentation

OV-Stitcher:一种无需训练的全局上下文感知框架,用于开放词汇语义分割

Seungjae Moon, Seunghyun Oh, Youngmin Ro

机构 * Machine Intelligence Laboratory, University of Seoul, Korea(韩国首尔市立大学机器智能实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出OV-Stitcher框架,通过直接拼接碎片化子图像特征,在最终编码器块中实现全局注意力,提升开放词汇分割的性能和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08008 2026-04-10 cs.CV cs.AI cs.LG 67%

SearchAD: Large-Scale Rare Image Retrieval Dataset for Autonomous Driving

SearchAD:大规模稀有图像检索数据集用于自动驾驶

Felix Embacher, Jonas Uhrig, Marius Cordts, Markus Enzweiler

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) Institute for Intelligent Systems, Esslingen University of Applied Sciences(埃斯林根应用技术大学智能系统研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SearchAD为自动驾驶提供大规模稀有图像检索数据集,包含423k帧和513k个标注框,针对稀有类别检索问题,支持文本到图像和图像到图像检索及少样本学习。

Comments To be published in CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28888 2026-04-01 cs.RO 67%

A Semantic Observer Layer for Autonomous Vehicles: Pre-Deployment Feasibility Study of VLMs for Low-Latency Anomaly Detection

面向自动驾驶的语义观察层:VLMs在低延迟异常检测中的预部署可行性研究

Kunal Runwal, Swaraj Gajare, Daniel Adejumo, Omkar Ankalkope, Siddhant Baroth, Aliasghar Arab

机构 * The City College of New York, Grove School of Engineering(纽约市立学院格罗夫工程学院) Department of Mechanical and Aerospace Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院机械与航空航天工程系) Department of Electrical and Computer Engineering, Tandon School of Engineering, New York University(纽约大学坦登工程学院电气与计算机工程系)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract)

AI总结 本文提出一种语义观察层,通过量化视觉-语言模型实现低延迟异常检测,验证了其在自动驾驶平台上的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11479 2026-03-31 cs.RO 67%

OVSegDT: Segmenting Transformer for Open-Vocabulary Object Goal Navigation

OVSegDT:用于开放词汇物体目标导航的分割Transformer

Tatiana Zemskova, Aleksei Staroverov, Dmitry Yudin, Aleksandr Panov

机构 * Cognitive AI Systems Lab(认知人工智能系统实验室) MIRAI NUST MISIS(国立研究型技术大学MISIS)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract)

AI总结 本文提出OVSegDT,一种轻量级Transformer策略,通过语义分支和熵自适应损失调节解决开放词汇物体目标导航中的过拟合和安全问题,提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25946 2026-03-30 cs.CV cs.AI cs.LG 67%

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

面向端到端驾驶的碰撞感知视觉-语言学习:多模态违规数据集

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila - Québec AI Institute(米拉-魁北克人工智能研究所) Nissan Motor Corporation(日产汽车公司)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出VLAAD模型,通过多实例学习获取碰撞信号,提升驾驶评分,并在真实数据集上验证其泛化能力。

Comments 33 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00141 2026-03-27 cs.CV cs.AI cs.LG eess.IV 67%

From Scale to Speed: Adaptive Test-Time Scaling for Image Editing

从尺度到速度:面向图像编辑的自适应测试时间缩放

Xiangyan Qu, Zhenlong Yuan, Jing Tang, Rui Chen, Datao Tang, Meng Yu, Lei Sun, Yancheng Bai, Xiangxiang Chu, Gaopeng Gou, Gang Xiong, Yujun Cai

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) AMAP, Alibaba Group(阿里巴巴集团高德地图) University of Queensland(昆士兰大学)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出ADE-CoT框架,通过动态资源分配、编辑特定验证和深度优先停止策略,提升图像编辑效率与性能,实验显示在同等采样预算下性能优于现有方法。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22985 2026-03-25 cs.CL cs.CY 67%

Beyond Hate: Differentiating Uncivil and Intolerant Speech in Multimodal Content Moderation

超越仇恨:区分多模态内容审核中的不文明与不宽容言论

Nils A. Herrmann, Tobias Eder, Jingyi He, Georg Groh

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 本文提出细粒度标注方案区分不文明与不宽容言论,通过2030个仇恨漫画数据验证,细粒度标注提升模型性能,减少有害内容误判。

Comments Preprint. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13798 2026-03-18 cs.CV cs.AI cs.LG 67%

CFM: Language-aligned Concept Foundation Model for Vision

CFM:面向视觉的语言对齐概念基础模型

Kai Wittenmayer, Sukrut Rao, Amin Parchami-Araghi, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CFM提出一种语言对齐的概念基础模型,提供细粒度可解释的概念,提升视觉任务的解释能力,实现分类、分割和描述生成的高性能表现。

Comments 53 pages, 29 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10675 2026-03-12 cs.RO 67%

Cybo-Waiter: A Physical Agentic Framework for Humanoid Whole-Body Locomotion-Manipulation

Cybo-Waiter:一个人形全身体态运动- manipulation的物理代理框架

Peng Ren, Haoyang Ge, Chuan Qi, Cong Huang, Hong Li, Jiang Zhao, Pei Chi, Kai Chen

专题命中 视觉定位与Grounding :VLM(abstract);grounding(abstract)

AI总结 Cybo-Waiter提出了一种人形全身体态运动-操作的物理代理框架,通过多对象3D几何监督和条件诊断提升任务执行的鲁棒性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08817 2026-03-11 cs.RO 67%

HMR-1: Hierarchical Massage Robot with Vision-Language-Model for Embodied Healthcare

HMR-1: 基于视觉-语言模型的分层按摩机器人用于具身医疗

Rongtao Xu, Mingming Yu, Xiaofeng Han, Yu Zhang, Kaiyi Hu, Zhe Feng, Zenghuang Fu, Changwei Wang, Weiliang Meng, Xiaopeng Zhang

机构 * The State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) Spatiotemporal AI, China(时空人工智能,中国) Hangzhou International Innovation Institute, Beihang University, China(杭州国际创新研究院,北航,中国) Georgia Institute of Technology, China(佐治亚理工学院,中国) Key Laboratory of Computing Power Network and Information Security, Ministry of Education(计算功率网络与信息安全重点实验室,教育部;山东省计算机科学中心,齐鲁工业大学(山东省科学院),中国) Shandong Computer Science Center, Qilu University of Technology (Shandong Academy of Sciences), China

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract)

AI总结 HMR-1提出基于视觉-语言模型的分层按摩机器人框架,通过构建多模态数据集和微调Qwen-VL模型,实现了具身医疗任务的评估与应用。

详情

展开后加载摘要…

URL PDF HTML 收藏