arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-05-11 至 2026-05-11 共收录 31 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 31 篇

2605.07141 2026-05-11 cs.CV cs.AI 88%

Qwen3-VL-Seg: Unlocking Open-World Referring Segmentation with Vision-Language Grounding

Qwen3-VL-Seg: 解锁基于视觉-语言接地的开放世界指代分割

Yuan Yao, Qiushi Yang, Humen Zhong, Jiangning Wei, Yifang Men, Shuai Bai, Miaomiao Cui, Zhibo Yang

机构 * Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(title,abstract);MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL-Seg通过视觉-语言接地框架实现开放世界指代分割,采用轻量级的框引导掩码解码器,结合多尺度空间特征注入和迭代掩码感知查询优化,实现参数高效且精确的像素级分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01586 2026-05-11 cs.CV 87%

InterCoG: Towards Spatially Precise Image Editing with Interleaved Chain-of-Grounding Reasoning

InterCoG:迈向空间精确图像编辑的交错链式 grounding 推理

Yecong Wan, Fan Li, Chunwei Wang, Hao Wu, Mingwen Shao, Wangmeng Zuo

机构 * Faculty of Computing, Harbin Institute of Technology(哈尔滨工业大学计算机学院) Zhengzhou Advanced Research Institute of Harbin Institute of Technology(哈尔滨工业大学郑州先进研究院) Huawei Noah’s Ark Lab(华为诺亚实验室) Artificial Intelligence Research Institute, Shenzhen University of Advanced Technology(深圳先进技术大学人工智能研究院)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出InterCoG框架,通过文本与视觉的交错链式推理实现复杂场景中精细图像编辑,结合文本空间关系和视觉定位提升编辑精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06173 2026-05-11 cs.CV cs.AI 81%

Retina-RAG: Retrieval-Augmented Vision-Language Modeling for Joint Retinal Diagnosis and Clinical Report Generation

Retina-RAG:基于检索增强的视觉-语言模型用于联合视网膜诊断和临床报告生成

Abdelrahman Zaian, Sheethal Bhat, Mohamed Abdalkader, Andreas Maier

机构 * Friedrich-Alexander-Universität(弗里德里希-亚历山大大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Retina-RAG通过整合高精度视网膜分类器和参数高效视觉语言模型,实现糖尿病视网膜病变分级、黄斑水肿检测及报告生成,优于现有方法,且在单块消费级GPU上运行。

Comments 10 pages, 5 figures. Submitted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03454 2026-05-11 cs.CV cs.AI 81%

Think Before You Drive: World Model-Inspired Multimodal Grounding for Autonomous Vehicles

在驾驶前思考:基于世界模型的多模态接地用于自动驾驶车辆

Haicheng Liao, Huanming Shen, Bonan Wang, Yongkang Li, Yihong Tang, Chengyue Wang, Dingyi Zhuang, Kehua Chen, Hai Yang, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) UESTC(电子科技大学) Purdue University(普渡大学) McGill University(麦吉尔大学) Massachusetts Institute of Technology(麻省理工学院) University of Washington(华盛顿大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出ThinkDeeper框架,通过预测未来空间状态提升自动驾驶车辆的自然语言指令理解能力,结合超图引导解码器融合多模态输入,提出DrivePilot数据集并在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26272 2026-05-11 cs.CV cs.LG 73%

PRPO: Paragraph-level Policy Optimization for Vision-Language Deepfake Detection

PRPO:用于视觉-语言深度伪造检测的段级策略优化

Tuan Nguyen, Naseem Khan, Khang Tran, NhatHai Phan, Issa Khalil

机构 * Qatar Computing Research Institute, Hamad Bin Khalifa University, Doha, Qatar(卡塔尔计算研究所,哈马德·本·哈利法大学,多哈) New Jersey Institute of Technology, NJ, USA(新泽西理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出PRPO算法,通过段级相对策略优化提升深度伪造检测的准确性与推理能力,实验显示其在检测准确率和推理评分上均显著优于现有方法。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07209 2026-05-11 cs.CL cs.AI cs.LG 73%

Hallucination Detection via Activations of Open-Weight Proxy Analyzers

通过开放权重代理分析器的激活进行幻觉检测

Akshita Singh, Prabesh Paudel, Siddhartha Roy

机构 * Khoury College of Computer Sciences(科里学院计算机科学学院) Northeastern University(东北大学)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种代理分析器框架,通过本地部署的小型开放权重模型检测大语言模型的幻觉,采用变压器文本处理特性构建18种特征,并在多个模型架构上训练堆叠集成模型,最终在RAGTruth数据集上取得优于ReDeEP的AUC和F1分数。

Comments 12 pages, 4 figures. Code available at https://github.com/hallu-detect/llm_hallucination_detection

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21824 2026-05-11 cs.CV cs.AI 73%

SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis

SteelDefectX:一种用于钢铁表面缺陷分析的多形式视觉-语言数据集和基准

Shuxian Zhao, Jie Gui, Baosheng Yu, Dacheng Tao

机构 * Southeast University(东南大学) Purple Mountain Laboratories(紫金山实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SteelDefectX数据集,包含7778张图像和25种缺陷类别,提供多形式文本标注,涵盖视觉-语言分类、分割及跨数据集迁移等任务,揭示文本设计对工业视觉-语言学习的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05687 2026-05-11 cs.RO 71%

Contact-Grounded Policy: Dexterous Visuotactile Policy with Generative Contact Grounding

接触导向策略:具备生成接触基础的灵活视觉-触觉策略

Zhengtong Xu, Yeping Wang, Ben Abbatematteo, Jom Preechayasomboon, Sonny Chan, Nick Colonnese, Amirhossein H. Memar

机构 * Purdue University(普渡大学) Meta Reality Labs Research(Meta现实实验室) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 本文提出Contact-Grounded Policy,通过预测机器人状态和触觉反馈的耦合轨迹,生成接触基础的灵活视觉-触觉策略,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07457 2026-05-11 cs.CV 70%

EditRefiner: A Human-Aligned Agentic Framework for Image Editing Refinement

EditRefiner:一种对齐人类的代理框架用于图像编辑细化

Zitong Xu, Huiyu Duan, Yifei Nie, Mingda Du, Sijing Wu, Xiongkuo Min, Tianyi Zheng, Jian Zhang, Shusong Xu, Jinwei Chen, Bo Li, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Vivo Mobile Communication Co., Ltd(Vivo移动通信有限公司) University of Electronic Science and Technology of China(电子科学与技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出EditRefiner,一种对齐人类的代理框架,通过人类反馈数据集改进图像编辑的细粒度问题,通过感知-推理-行动-评估循环提升编辑质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07334 2026-05-11 cs.CV 70%

RCoT-Seg: Reinforced Chain-of-Thought for Video Reasoning and Segmentation

RCoT-Seg:强化链式推理用于视频推理与分割

Junwei Wen, Deshui Miao, Guangming Lu, Xin Li, Wenjie Pei

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Pengcheng Laboratory(鹏城实验室) Pazhou Lab (Huangpu)(琶洲实验室(黄埔))

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RCoT-Seg框架,通过分离时间推理与空间感知,改进视频分割中关键帧选择与定位,提升多目标场景下的鲁棒性与精度。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07613 2026-05-11 cs.CL 67%

Intent-Driven Semantic ID Generation for Grounded Conversational News Recommendation

基于意图的语义ID生成用于 grounded 对话新闻推荐

Hongyang Su, Beibei Kong, Lei Cheng, Chengxiang Zhuo, Zang Li, Chenyun Yu

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Platform and Content Group, Tencent(腾讯平台与内容部)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本文提出意图驱动的语义ID生成方法,通过多任务对齐和GPT-4链式推理蒸馏,实现意图到层级SID前缀的映射,提升新闻推荐的 grounded 性和冷启动用户推荐效果。

Comments Accepted at ACL 2026 Industry Track (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04565 2026-05-11 cs.MA cs.CL 67%

From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems

从独立大语言模型到整合智能:复合AI系统综述

Jiayi Chen, Junyi Ye, Guiling Wang

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);MLLM(abstract_cn)

AI总结 本文综述了复合AI系统,探讨了其整合大语言模型与外部组件的方法,分析了四种基础范式,并指出规模化、互操作性等挑战及未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08043 2026-05-11 cs.CV cs.AI 62%

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

SCOPE:结构分解与条件技能协调用于复杂图像生成

Tianfei Ren, Zhipeng Yan, Yiming Zhao, Zhen Fang, Yu Zeng, Guohui Zhang, Hang Xu, Xiaoxiao Ma, Shiting Huang, Ke Xu, Wenxuan Huang, Lionel Z. Wang, Lin Chen, Zehui Chen, Jie Huang, Feng Zhao

机构 * MoE Key Laboratory of Brain-inspired Intelligent Perception and Cognition, University of Science and Technology of China(脑启发智能感知与认知 MOE 实验室,中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SCOPE框架,通过结构化规范和条件技能协调解决复杂图像生成中语义承诺的持续跟踪问题,通过Gen-Arena基准验证其有效性,取得优于基线的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07646 2026-05-11 cs.CL cs.AI cs.LG 62%

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

MAVEN:具有步骤内认知审计的多智能体验证-扩展网络

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng

机构 * Tongji University(同济大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 MAVEN通过显式角色解耦将LLM转化为有意识的推理者,采用对抗性Skeptic-Researcher-Judge循环,生成可验证的模块化推理轨迹,提升多任务推理质量。

Comments 24 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07395 2026-05-11 cs.LG cs.AI cs.CL 62%

Unsolvability Ceiling in Multi-LLM Routing: An Empirical Study of Evaluation Artifacts

多LLM路由中的不可解上限:评估 artifacts 的实证研究

Saloni Garg, Amit Sagtani

机构 * Independent Researcher(独立研究者) San Francisco State University(圣弗朗西斯科州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过206000个查询-模型对研究多级LLM路由,发现大量不可解问题源于评估 artifacts,如判断偏差、截断和格式不匹配,并提出改进方法以减少不可解性。

Comments 12 pages, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08003 2026-05-11 cs.CV 57%

SphereVAD: Training-Free Video Anomaly Detection via Geodesic Inference on the Unit Hypersphere

SphereVAD: 基于单位超球面几何推断的无训练视频异常检测

Chao Huang, Penfei Wei, Wei Wang, Jie Wen, Zhihua Wang, Li Shen, Wenqi Ren, Xiaochun Cao

机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 SphereVAD通过几何推断在单位超球面上实现无训练视频异常检测,利用预训练多模态大语言模型的中间层特征,通过Frechet均值中心化、Holistic Scene Attention和vMF引导的球面几何拉近技术,实现零样本异常识别。

Comments 48 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07986 2026-05-11 cs.HC cs.AI cs.CY 57%

Towards Apples to Apples for AI Evaluations: From Real-World Use Cases to Evaluation Scenarios

迈向公平的AI评估:从现实使用案例到评估场景

Yee-Yin Choong, Kristen Greene, Alice Qian, Meryem Marasli, Ziqi Yang, Sophia Chen, Laura Dabbish, Anand Rao, Hong Shen

机构 * National Institute of Standards and Technollogy(国家标准与技术研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种可重复的流程,通过结构化AI使用案例工作表将高层使用案例转化为详细场景,结合LLM提示和人工审查,生成107个场景,确保评估场景的现实性和人类需求。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07677 2026-05-11 cs.IR cs.AI cs.CL 57%

TRACE: Tourism Recommendation with Accountable Citation Evidence

TRACE:基于可问责引用证据的旅游推荐

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao

机构 * UNSW Sydney(新南威尔士大学悉尼分校) University of Adelaide(阿德莱德大学) Yonsei University(延世大学) USTC(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 TRACE通过多轮对话结合评论引用和显式拒绝机制,解决旅游推荐中信任、可验证性和适应性问题,提出三项能力差距并验证评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07584 2026-05-11 cs.AI 57%

Parallel Lifted Planning via Semi-Naive Datalog Evaluation

通过半 naive Datalog 评估实现并行提升规划

Dominik Drexler, Oliver Joergensen, Jendrik Seipp

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于半 naive Datalog 评估的并行提升规划方法,通过两级并行性提升规划效率,在多核环境下实现显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07561 2026-05-11 cs.CV 57%

Multimodal Stepwise Clinically-Guided Attention Learning for Pathological Complete Response Prediction in Breast Cancer

多模态逐步临床引导注意力学习用于乳腺癌病理完全响应预测

Alice Natalina Caragliano, Valerio Guarrasi, Michela Gravina, Carlo Sansone, Paolo Soda

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Electrical Engineering and Information Technology, University of Naples Federico II(电气工程与信息科技系,那不勒斯费德里科二世大学) Department of Diagnostics and Intervention, Radiation Physics, Biomedical Engineering, Umeå University(诊断与介入系,辐射物理,生物医学工程,乌梅大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态逐步临床引导注意力学习框架,通过医学引导的空间指导和多模态整合,提升乳腺MRI中病理完全响应预测的敏感性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03479 2026-05-11 cs.CV 57%

ProcObject-10K: Benchmarking Object-Centric Procedural Understanding in Instructional Videos

ProcObject-10K:面向教学视频中以对象为中心的程序理解的基准测试

Wenliang Guo, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ProcObject-10K,首个评估教学视频中以对象为中心推理和时间证据定位的基准,涵盖137个任务和五种推理类型,揭示模型在对象动态理解上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07195 2026-05-11 cs.CV 57%

See Tomorrow, Act Today: Foresight-Driven Autonomous Driving

预见未来,立即行动:基于预见的自动驾驶

Bozhou Zhang, Nan Song, Yuang Wang, Jiankang Deng, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) Imperial College London(伦敦帝国理工学院) University of Surrey(萨里大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出ForeSight框架,通过生成未来场景并据此规划动作,实现前瞻性决策,实验表明其在动态场景中优于现有方法。

Comments CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06963 2026-05-11 cs.HC cs.AI cs.CL cs.IR 57%

From Surface Learning to Deep Understanding: A Grounded AI Tutoring System for Moodle

从表层学习到深度理解:面向Moodle的 grounded AI 教学系统

Anna Ostrowska, Michał Kukla, Gabriela Majstrak, Jan Opala, Sebastian Pergała, Jan Skwarek, Anna Wróblewska

机构 * Faculty of Mathematics and Information Sciences, Warsaw University of Technology(数学与信息科学学院,华沙技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出一种基于Moodle的AI教学助手,利用检索增强生成技术提供高质量教育,通过双核心设计实现学生互动式辅导和教师监督内容生成,有效减少信息误导并促进深度理解。

Comments 5 pages, accepted as demo paper at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06717 2026-05-11 cs.SE cs.AI 57%

Agentic Coding Needs Proactivity, Not Just Autonomy

代理编码需要主动性,而非仅仅自主性

Nghi D. Q. Bui, Georgios Evangelopoulos

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文探讨了软件开发中代理编码的主动性与自主性区别,提出主动性分类和评估标准,旨在提升编码代理的洞察力和适应性。

Comments Position Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00663 2026-05-11 cs.RO cs.CV 57%

Affordance Agent Harness: Verification-Gated Skill Orchestration

可及性代理框架:验证门控技能协调

Haojian Huang, Jiahao Shi, Yinchuan Li, Yingcong Chen

机构 * HKUST(GZ)(香港理工大学(广州)) Knowin AI Harbin Engineering University(哈尔滨工程大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出一种闭环运行时系统,统一异构技能并利用证据存储和成本控制,通过路由器自适应选择技能,利用验证器通过自一致性、跨尺度稳定性等验证证据充分性,从而提升可及性定位的准确性和效率。

Comments 43 pages, 22 figures, 8 tables. Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15189 2026-05-11 cs.IR cs.AI cs.CL 57%

ScrapeGraphAI-100k: Dataset for Schema-Constrained LLM Generation

ScrapeGraphAI-100k:用于模式约束LLM生成的数据集

William Brach, Francesco Zuppichini, Marco Vinciguerra, Lorenzo Padoan

机构 * Slovak University of Technology(斯洛伐克技术大学) ScrapeGraphAI

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出ScrapeGraphAI-100k数据集,包含93695个模式约束提取事件,通过真实用户数据和结构化标注,用于评估LLM在模式约束下的生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18700 2026-05-11 cs.AI 57%

TEA-Bench: A Systematic Benchmarking of Tool-enhanced Emotional Support Dialogue Agent

TEA-Bench: 一种工具增强情感支持对话代理的系统性基准测试

Xingyu Sui, Yanyan Zhao, Yulin Hu, Jiahe Guo, Weixiang Zhao, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出TEA-Bench,首个评估工具增强情感支持对话代理的交互式基准,通过真实情感场景和工具环境评估情感支持质量和事实性。实验表明工具增强提升情感支持质量并减少幻觉,但效果依赖模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07789 2026-05-11 cs.HC 50%

Analyzing Human Heuristics and Strategies in Everyday Decision-Making Conversations for Conversational AI Design

分析日常决策对话中的人类启发式与策略以指导对话AI设计

Sora Kang, Soyun Jeon, Jinsu Eun, Kwangwon Lee, Chaerin Song, Minyoung Joo, Joonhwan Lee

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过分析955个真实韩国对话,揭示人们在决策中优先满足而非优化,发现启发式策略在探索阶段维持对话流畅,而规则策略在利用阶段有效推动解决,为对话AI设计提供认知理论支持。

Comments CogSci 2026 (Annual Meeting of the Cognitive Science Society 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07605 2026-05-11 cs.RO 50%

BrickCraft: Visuomotor Skill Composition with Situated Manual Guidance for Long-Horizon Interlocking Brick Assembly

BrickCraft: 基于情境手动指导的长视界互锁积木组装技能组合

Jichuan Yu, Bowei Li, Zhenran Tang, Guanxing Lu, Chuxiong Hu, Ruixuan Liu, Changliu Liu

机构 * Tsinghua University(清华大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 BrickCraft通过情境手册将高层装配计划与物理执行连接,利用相对公式分解复杂任务为可重用的原始技能,实现长视界互锁积木组装。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07249 2026-05-11 cs.IR 50%

MLAIRE: Multilingual Language-Aware Information Retrieval Evaluation Protocal

MLAIRE: 多语言语言感知信息检索评估协议

Youngjoon Jang, Seongtae Hong, Hyeonseok Moon, Heuiseok Lim

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出MLAIRE评估协议,用于评估多语言信息检索中语言感知维度,引入语言偏好率和Lang-nDCG等指标,分析语义检索与查询语言偏好之间的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏