Diagnosing and Repairing Factual Errors in RAG under Budget Constraints
预算约束下RAG中事实性错误的诊断与修复
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出D2R-RAG框架,通过轻量级诊断和自适应修复,在预算约束下提升检索增强生成的事实性,实现准确性与效率的更好权衡。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
预算约束下RAG中事实性错误的诊断与修复
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出D2R-RAG框架,通过轻量级诊断和自适应修复,在预算约束下提升检索增强生成的事实性,实现准确性与效率的更好权衡。
ViPSim: 协同视觉与参数空间实现一致的长时程具身世界模型
机构 * Huawei Technologies Co., Ltd.(华为技术有限公司) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV
AI总结 提出ViPSim框架,通过协同视觉空间(显式空间先验)和参数空间(数值驱动)解决长时程视频生成中的轨迹漂移和不一致问题,实现高保真具身世界模型。
Comments Accepted to Robotics: Science and Systems (RSS) 2026
HyphaeDB: 面向智能体优先记忆的活知识拓扑
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 提出HyphaeDB,一种将HNSW图拓扑重新解释为多智能体通信结构的记忆基础设施,通过八卦协议和能量衰减实现知识传播,支持矛盾检测、模式结晶和共识形成等涌现行为。
工具使用使多智能体LLM系统中的隐写术无法检测
机构 * Oxford University(牛津大学) ; Artificial Intelligence Security Institute (AISI)(人工智能安全研究所)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文研究多智能体AI系统中通过工具使用(如代码执行、网络搜索)实现无法检测的隐写通信,发现智能体可自适应构建隐写系统,并提出协调度量评估无事先约定的隐写协调风险。
LLM如何引用?检索增强生成中归因的机制解释
机构 * University of Amsterdam(阿姆斯特丹大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 通过激活修补方法,发现LLM的引用机制并非单一组件,而是由注意力头和MLP层组成的分布式“归因集成”,调控这些组件可修复大部分错误引用。
Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution is published in Advances in Information Retrieval, ECIR 2026, Lecture Notes in Computer Science, vol. 16485, pp. 458-473, and is available online at https://doi.org/10.1007/978-3-032-21324-2_35
Journal ref Advances in Information Retrieval, ECIR 2026. Lecture Notes in Computer Science, vol. 16485, pp. 458-473. Springer, Cham (2026)
LaVPR:语言与视觉用于位置识别的基准测试
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV
AI总结 LaVPR通过引入超过65万条自然语言描述扩展现有VPR数据集,研究多模态融合与跨模态检索,证明语言描述在视觉退化条件下提升性能,尤其对小模型效果显著。
Comments Accepted to ECCV
ECHO:基于回合信度的认知自适应语言智能体学习
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出认知决策过程(EDP)框架,通过回合级信度分配策略梯度目标ECHO,在证据寻求任务中提升智能体的信息获取效率与认知校准能力。
为什么在人工智能时代我们需要出行行为理论?以多目标追求为例
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文以目标追求理论为例,论证行为理论在出行行为研究中是预测的必要补充,通过活动调度、车辆拥有和位置选择三个应用展示其优势,并提供实施指导。
用于临床训练的法国OSCE对话数据集和可控虚拟患者系统
机构 * Lorraine Université, CNRS, Inria, LORIA(洛林大学、法国国家科学研究中心、法国国家信息与自动化研究所、LORIA实验室) ; Avignon Université, LIA, UPR 4128(阿维尼昂大学、LIA、UPR 4128)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 为解决医学培训中标准化病人稀缺问题,构建法语OSCE对话数据集,并提出基于LLM的可控虚拟患者生成管道,通过检索增强和反思循环提升真实性与一致性,实验表明可控性模块改善患者保真度和学生评估一致性。
Comments 9 pages. Accepted at SIGDIAL2026
意图驱动的6G服务编排:基于目录的翻译、验证与分解
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 提出一个三阶段智能体工作流,通过语义服务目录、SHACL验证和约束满足分解,实现6G意图驱动编排,在930次基准测试中成功率达97%,并减少26%的对抗性幻觉。
Comments AI4NextG @ ICML'26 Workshop on AI and ML for Next-Generation Wireless Communications and Networking
DRIVE-Nav: 方向推理、检查与验证以实现高效的开放词汇导航
机构 * Beijing Institute of Technology(北京理工大学) ; DeepBlue College(深蓝学院) ; The National Key Laboratory of Autonomous Intelligent Unmanned Systems (KAIUS), School of Automation(自主智能无人系统全国重点实验室(KAIUS),自动化学院)
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 DRIVE-Nav通过方向化探索框架提升开放词汇导航效率,通过方向检查和验证减少冗余路径,实验显示在HM3D-OVON等数据集上性能优越。
Comments 8 pages, 4 figures. Project page: https://coolmaoguo.github.io/drive-nav-page/
未来是代理的:多代理推荐系统定义、视角和开放挑战
专题命中 视觉定位与Grounding :grounding(abstract)
AI总结 本文探讨多代理推荐系统从被动生成到主动规划的转变,提出基于状态代理的框架,分析其在提升推荐效果中的作用,并通过实验验证代理系统在不同场景下的有效性。
Comments Added controlled experiments to illustrate the points of the paper. Also edited for more clarity in conveying the concepts
OCR-VLM能阅读天城文吗?一项压力测试基准与后纠正研究
专题命中 文档图表理解 :VLM(title_cn,summary_cn);vision-language model(abstract);分类 cs.CV
AI总结 本研究通过合成退化条件和真实扫描图像,系统评估了10种OCR系统在天城文(印地语)上的表现,发现专用OCR-VLM在退化条件下最脆弱,真实扫描性能远低于合成文本,并提出了错误分类和后纠正方法。
Comments 9 pages, 5 figures. Benchmark and code released
HSD:基于分层推测解码的文档解析视觉语言模型训练免费加速
机构 * South China University of Technology(华南理工大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shenzhen Institute of Advanced Technology, CAS(中国科学院深圳先进技术研究院) ; Nanjing University(南京大学)
专题命中 文档图表理解 :vision-language model(title);VLM(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出HSD分层推测解码框架,通过轻量级管道起草器预测区域划分并生成粗稿,分阶段验证以保持全文连贯性,实验证明在文档解析任务中实现显著加速。
Comments ECCV 2026
StrucTab: 一种用于表格解析的结构化优化框架
专题命中 文档图表理解 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV
AI总结 提出StrucTab框架,通过中间结构监督和奖励分解优化表格解析,在多个基准上达到最优性能。
使多模态大语言模型成为可靠的图表数据提取器:一个基准和训练框架
机构 * Zhejiang University(浙江大学) ; Guangdong University of Technology(广东工业大学)
专题命中 文档图表理解 :multimodal large language model(abstract);分类 cs.AI
AI总结 针对多模态大语言模型在图表数据提取中数值精度不足的问题,提出渐进式学习训练框架,显著提升7B参数模型的准确率,达到最优性能。
Comments Accepted at CHI'26
面向可部署社交机器人导航的视觉-语言模型:弥合语义推理与低级控制
机构 * Graduate School of Information Science and Technology, Hokkaido University(弘前大学信息科学与技术研究生院) ; Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(title,abstract);grounding(abstract)
AI总结 本文综述了将视觉-语言模型(VLM)集成到社交机器人导航中的方法,提出包含高层推理、低层控制及中间机制的统一框架,并讨论了关键挑战与未来方向。
一次前向胜过两次:InnerZoom 实现准确高效的 GUI 定位
机构 * Alibaba Group(阿里巴巴集团) ; Tongyi Lab(通义实验室) ; University of Technology Sydney(悉尼大学) ; Adelaide University(阿德莱德大学)
专题命中 GUI与屏幕智能体 :grounding(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV
AI总结 提出 InnerZoom 框架,通过跨层证据桥接在单次前向传播中实现精确 GUI 元素定位,无需额外裁剪重跑,在六个基准上达到最优性能,同时降低延迟和计算量。
基于视觉-语言模型的人类动作识别中的置信域预测
机构 * ICTEAM, UCLouvain(鲁汶大学(法语区)ICTEAM研究所)
专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI
AI总结 本文探讨了如何利用置信域预测技术提升基于视觉-语言模型的人类动作识别系统可靠性,通过调整softmax温度参数减少候选类别数量,缓解长尾分布影响。
Comments 6 pages, 7 figures, Accepted to ICIP 2025 Workshops
Journal ref 2025 IEEE International Conference on Image Processing Workshops (ICIPW)
FutureNav: 面向视觉与语言导航的统一世界-动作建模
机构 * Tsinghua University(清华大学) ; Pengcheng Laboratory(鹏城实验室) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) ; Xiaomi EV(小米电动车) ; National University of Singapore(新加坡国立大学)
专题命中 GUI与屏幕智能体 :VLM(summary_cn,abstract);vision-language model(abstract)
AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。
EfficientUICoder: 一种用于高效基于多模态大语言模型的UI代码生成的双向标记压缩框架
机构 * The Chinese University of Hong Kong(香港中文大学) ; Huazhong University of Science and Technology(华中科技大学) ; Singapore Management University(新加坡管理大学) ; Nanyang Technological University(南洋理工大学)
专题命中 GUI与屏幕智能体 :MLLM(title);multimodal large language model(abstract);分类 cs.AI
AI总结 本文提出EfficientUICoder,通过元素和布局感知标记压缩、区域感知标记精炼和自适应重复标记抑制,有效压缩UI代码生成的标记数量,提升生成效率和代码质量。
Comments Published in the Proceedings of the 2026 ACM International Conference on the Foundations of Software Engineering (FSE 2026)
通过通用关键帧提取桥接VideoQA和视频引导的智能体任务
专题命中 GUI与屏幕智能体 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 提出VG-GUIBench基准和TASKER关键帧提取算法,联合考虑任务相关性和场景动态,在VideoQA和视频引导的GUI任务上提升性能。
Comments Accepted by ECCV 2026. Project Page: https://vg-gui-tasker.github.io/
在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 GUI与屏幕智能体 :grounding(title);分类 cs.AI
AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。
暂停与思考:面向视频基础辅助动作建议的数据集与基准
机构 * Advanced Micro Devices, Inc.(先进微器件公司)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI
AI总结 提出 pause-and-think-T 数据集和 pause-and-think-B 基准,通过推理监督训练紧凑模型,在视频场景理解与目标规划任务中达到与大型模型相当的性能。
Comments Accepted in IROS 2026 (IEEE/RSJ International Conference on Intelligent Robots and Systems)
Efficient-VLN: 一种高效且强大的视觉语言导航基线
机构 * The Chinese University of Hong Kong(香港中文大学) ; Weitu AI
专题命中 GUI与屏幕智能体 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV
AI总结 Efficient-VLN通过三个简单有效机制解决视觉语言导航中的系统瓶颈,提升推理效率和训练稳定性,在R2R-CE和RxR-CE基准上取得新突破。
OLiVia-Nav: 一种面向移动机器人社交导航的在线终身视觉语言方法
机构 * University of Toronto(多伦多大学)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);VLM(abstract)
AI总结 OLiVia-Nav通过融合视觉语言模型与在线终身学习框架,实现机器人社交导航中的社会规范适应与动态轨迹规划,优于现有方法。
GUICrafter: 利用海量无标注截图的弱监督GUI智能体
机构 * Tsinghua University(清华大学) ; Tencent Hunyuan(腾讯文脉)
专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV、cs.AI
AI总结 提出GUICrafter,一种利用海量无标注截图通过课程学习框架训练GUI智能体的弱监督方法,显著降低对人工标注的依赖,在极少量标注数据下性能超越UI-TARS等先进系统。
RadarTwin:面向移动室内感知的场景特定毫米波雷达仿真与学习
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.LG
AI总结 提出RadarTwin框架,利用3D重建和视觉语言模型推断材料属性,通过物理射线追踪合成FMCW雷达数据,解决雷达数据稀缺问题,仿真训练模型在真实场景中识别物体准确率达95.3%。
针对原生GUI代理的CAPTCHA解决:自动化推理-行动数据生成与自我纠正训练
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 本文提出ReCAP,一种能解决现代交互式CAPTCHA挑战的原生GUI代理,通过自动化数据生成和自我纠正训练提升CAPTCHA解决能力,同时保持通用GUI任务性能。
Comments Accepted to ICML 2026
STEMGym: 自主电子显微镜中剂量预算下的序列决策基准测试
机构 * Dept. of Electrical & Computer Eng.(电气与计算机工程系) ; Texas A&M Univ.(德克萨斯A&M大学) ; Dept. of Prosthetics & Orthotics(假肢与矫形学系) ; College of Science & Eng.(科学与工程学院) ; Ankara Univ.(安卡拉大学) ; Hamad Bin Khalifa Univ. and Texas A&M Univ. at Qatar(哈马德·本·卡西姆大学和德克萨斯A&M大学(卡塔尔))
专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.LG
AI总结 通过15个物理模拟的STEM环境基准,发现感知管道(CNN分析师)是剂量效率的主要决定因素,而非导航策略,为自主电子显微镜的机器学习投入方向提供新视角。