LPG: Balancing Efficiency and Policy Reasoning in Latent Policy Guardrails
LPG: 在潜在策略护栏中平衡效率与政策推理
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
LPG: 在潜在策略护栏中平衡效率与政策推理
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 本文提出LPG框架,通过学习动态政策的语义潜在推理,在保持高安全准确率的同时实现低延迟的政策执行。
EgoIntrospect: 一个用于用户中心内部状态推理的注视数据集和基准
机构 * Tsinghua University(清华大学) ; Tongji University(同济大学) ; Renmin University of China(中国人民大学) ; The University of Tokyo(东京大学) ; Lenovo Group(联想集团) ; Peking University(北京大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Shanghai Qi Zhi Institute(上海启智研究院)
专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出EgoIntrospect数据集,用于研究用户中心内部状态推理,通过自注释揭示用户与AI助手的交互意图,评估多模态大语言模型在从注视观察中推理用户内部状态的能力。
PluRule:一种用于社交媒体上多元社区调节的基准测试
机构 * Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国) ; Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI
AI总结 研究探讨了AI模型在调节社交媒体上多元社区中的挑战,提出PluRule基准测试以检测13371条规则违规情况,发现即使使用最先进的视觉语言模型,也难以有效识别违规行为。
Comments Accepted to ACL 2026 Main Conference
如何指导你的机器人:密集语言标注助力机器人策略学习
机构 * University of California, San Diego(加州大学圣地亚哥分校) ; NVIDIA
专题命中 视觉推理 :VLM(abstract);分类 cs.AI
AI总结 本研究通过密集语言标注提升机器人策略学习效率,提出DeMiAn方法,利用视觉语言模型生成多方面标注,提升策略和世界模型性能,无需新增演示数据。
当机器人做家务:一个基准和代理用于长期家庭任务执行
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Zhongguancun Academy(中关村学院) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 视觉推理 :VLM(abstract);分类 cs.AI
AI总结 本文提出LongAct基准和HoloMind代理,用于评估长期家庭任务执行中的高层自主能力,实验显示HoloMind在减少模型规模依赖的同时提升了长期性能,但目标完成率仍较低,凸显了长期规划的挑战。
通过翻译决策关键特征实现零样本文本解释
机构 * Chiba University(千叶大学) ; National Institute of Informatics(国家信息研究所)
专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出TEXTER方法,通过隔离决策关键特征生成更准确的文本解释,提升模型可解释性。
Comments Accepted to CVPR 2026 Findings
GVGAI-LLM:通过无限游戏评估大语言模型代理
机构 * New York University(纽约大学) ; University of the Witwatersrand(沃尔特·斯通大学) ; Meta ; Lingnan University(岭南大学)
专题命中 视觉推理 :grounding(abstract);分类 cs.AI
AI总结 GVGAI-LLM通过 arcade 式游戏测试大语言模型的推理与问题解决能力,定义了可解释的评估指标,揭示了模型在空间推理和基本规划中的局限性。
从像素到地点:一个系统性基准,用于评估大语言模型中的图像地理定位能力
机构 * University of South Florida Tampa USA ; University of Alabama Tuscaloosa USA ; University of Michigan Ann Arbor USA ; Texas Tech University Lubbock USA ; Texas A \& M University College Station USA ; University of Pittsburgh Pittsburgh USA ; University of South Florida ; University of Alabama ; University of Michigan ; Texas Tech University ; Texas A \& M University ; University of Pittsburgh
专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV
AI总结 本文提出IMAGEO-Bench基准,系统评估大语言模型在图像地理定位中的准确性、距离误差、地理偏见和推理过程,揭示闭源模型在高资源区域表现优于欠代表区域。
FinDocMRE:一个文档级金融多模态推理评估基准
专题命中 视觉推理 :grounding(abstract)
AI总结 本文提出FinDocMRE基准,用于评估金融多模态模型在文档级推理中的能力,通过构建包含12,207个样本的金融报告数据集,评估多图像处理和文档理解能力,发现现有模型在复杂文档环境中整合视觉基础与逻辑推理存在挑战。
Comments 25 pages, 9 figures
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
机构 * X-Humanoid ; Fudan University(复旦大学) ; University of Science and Technology of China(中国科学技术大学) ; University of Manchester(曼彻斯特大学) ; Monash University(墨尔本大学) ; Celonis AI ; University of New South Wales(新南威尔士大学)
专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(title,abstract);分类 cs.CV
AI总结 本文提出 EPIC-Bench,一种以感知为中心的细粒度具身视觉 grounding 基准,旨在系统评估 VLMs 在现实世界具身环境中的视觉感知能力。该基准包含 6.6k 个精心标注的元组(图像,文本,掩码),涵盖 23 个细粒度任务,涉及具身交互管道的三个核心阶段:目标定位、导航和操作。评估结果显示,尽管先进推理模型表现出潜力,但当前 VLMs 在复杂视觉-文本对齐方面普遍存在困难,特别是在多目标计数、部分-整体关系理解和 affordance 区域检测方面存在瓶颈。
TIGER-FG: 基于文本引导的隐式细粒度 grounding 用于电商检索
机构 * Kuaishou Technology(快手科技)
专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV
AI总结 本文提出TIGER-FG框架,通过文本引导生成目标聚焦的物品表示,解决电商检索中模态和粒度不匹配的问题,并在两个基准测试中提升了检索精度。
Aurora: 一种基于工具使用的统一视频编辑框架
机构 * MIT-IBM(MIT-IBM研究院) ; NVIDIA(NVIDIA公司)
专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV
AI总结 本文提出Aurora框架,通过结合增强的视觉语言模型(VLM)代理和统一视频扩散变换器,解决视频编辑中的文本和视觉不充分问题,提升了视频编辑的灵活性和准确性。
Comments Code: https://github.com/yeates/Aurora
吸引子-血管耦合理论:为基于智能手机光电容积图的AAMI标准无创血压估计提供形式基础和实证验证
机构 * Department of Computer Science, Morgan State University(莫根州立大学计算机科学系)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出了一种数学框架,证明心脏吸引子几何编码了足够的血压信息,用于AAMI标准估计,并通过校准的无创血压模型验证了该理论,利用光电容积图(PPG)进行血压估计。
个性化悖论:语义损失与推理增益在代理AI问答中的权衡
专题命中 视觉定位与Grounding :grounding(summary_cn,abstract)
AI总结 本文研究了个性化对系统性能的影响,通过比较不同配置发现个性化虽提升推理和 grounding 能力,但导致语义相似度下降,揭示了现有 LLM 评估方法的不足。
Journal ref Cloud Computing and Data Science 2026 May 18;7(2):290-313
CompassAD: 基于意图的多功能竞争物体3D affordance 地标
机构 * MARS Lab, Nanyang Technological University, Singapore(MARS实验室,南洋理工大学,新加坡)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.CV
AI总结 该研究提出了一种新的3D affordance设定,即意图驱动的可混淆地标,旨在预测多物体点云中正确物体的每点affordance掩码,基于隐含的自然语言意图。通过构建CompassAD基准,该研究展示了在具有隐含意图的多物体组合中的先进结果,并在机器人机械臂上验证了其在真实世界抓取中的有效性。
BioProAgent:用于受限科学规划的神经符号接地
机构 * School of AI for Science, Peking University(科学人工智能学院,北京大学) ; School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) ; School of Computer Science, Peking University(计算机科学学院,北京大学)
专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI
AI总结 BioProAgent通过神经符号框架将概率规划锚定在确定性有限状态机中,解决复杂设备模式中的上下文瓶颈,提升物理执行的可靠性。
无需训练的零样本时序动作检测与视觉-语言模型
机构 * Southeast University School of Cyber Science and Engineering(东南大学网络安全科学与工程学院) ; Southeast University School of Computer Science and Engineering(东南大学计算机科学与工程学院) ; Nanjing Normal University School of Electrical Engineering and Automation(南京师范大学电气工程与自动化学院)
专题命中 视觉定位与Grounding :vision-language model(title);分类 cs.CV
AI总结 本文提出一种无需训练的零样本时序动作检测方法FreeZAD,利用现有的视觉-语言模型直接对未标记视频中的未知活动进行分类和定位,无需额外微调或适应,并通过LogOIC和频率基于的动作校准以及测试时适应策略提升性能。
Journal ref IEEE Transactions on Multimedia, 2026
GCE-MIL: 多实例学习中全滑片成像的可信且可恢复的证据
机构 * College of Intelligence and Computing(智能与计算学院)
专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 该研究提出GCE-MIL方法,通过优化S/N/R标准直接提升多实例学习中全滑片成像的预测性能和证据质量,改进了宏F1分数和C-index,并减少了连续-离散差距。
Comments 10 pages, 17 figures, 24 table
它会流行吗?基于开放网络的微视频流行度预测
专题命中 视觉定位与Grounding :grounding(title)
AI总结 本文提出了一种基于开放网络的微视频流行度预测方法,通过引入实时开放网络上下文来提升预测准确性,展示了WEBSHORTS数据集和SHORTS-CAST框架在预测微视频流行度方面的有效性。
Comments Working Progress
并非你所要求的:家庭机器人操作中的字体攻击
机构 * Cyber Security Lab(网络安全实验室) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; State College, USA(州立学院,美国)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本研究探讨了字体攻击对家庭机器人操作全流程的影响,提出了一种解耦感知架构,并发现感知错误会通过持久的3D语义地图导致物理性故障,揭示了字体误分类对机器人安全性的实际威胁。
Comments 10 pages, 1 figure, IEEE conference format
VISAFF: 以说话者为中心的视觉情感特征学习用于对话中的情感识别
机构 * Zhejiang University of Technology(浙江工业大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本文提出VISAFF框架,通过以说话者为中心的视觉情感特征学习方法,解决对话中情感识别中的复杂场景问题,提升计算效率并避免大规模模型微调的高成本。
多模态文化遗产品知图扩展与语言和视觉模型
机构 * Center for Studies and Research in Computer Science and Communication, CNAM(计算机科学与通信研究所以及CNAME)
专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.AI
AI总结 本文提出了一种多模态方法,利用语言和视觉模型扩展文化遗产品知图,通过构建多模态知识图谱WJoconde并建立评估基准,提高知识图谱的扩展效率和可靠性。
CT-DegradBench:一种用于CT退化检测和严重程度估计的物理引导基准
机构 * Université Sorbonne Paris Nord(索邦巴黎北大学) ; University of Dubai(迪拜大学) ; Northwestern University(西北大学) ; IULM University(IULM大学) ; Norwegian University of Science and Technology(挪威科学与技术大学) ; University of Geneva(日内瓦大学)
专题命中 视觉定位与Grounding :vision-language model(abstract,abstract_cn);分类 cs.CV
AI总结 本文提出CT-DegradBench,一个用于评估CT退化检测和严重程度估计的基准,结合语义先验和频域线索,提出SeSpeCT框架,在多模态嵌入空间中构建免训练的语义质量轴,实现退化类型和严重程度的联合预测。
Comments Accepted in CVPR 2026 VISION Workshop (DEXTER track)
多模态大语言模型是否准备好用于监控?对零样本异常检测在现实中的检验
机构 * Electrical and Computer Engineering Department(电气与计算机工程系)
专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结 本文研究了多模态大语言模型在现实中的零样本异常检测性能,发现其存在保守偏差,通过特定指令可以提升F1分数,但召回率仍是关键瓶颈。
3DPhysVideo: 通过3D场景重建和物理模拟的一致性引导流SDE用于视频生成
机构 * KAIST(韩国科学技术院)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI
AI总结 本文提出了一种无需训练的管道,通过3D场景重建和物理模拟生成逼真视频,利用一致性引导流SDE分解预测速度以确保条件输入的一致性,从而在多物体和流体交互场景中实现从单张图像到物理合理视频的过渡。
Comments Project page: https://hwidong-kim.github.io/projects/3DPhysVideo
ClawArena:在演化的信息环境中评估AI代理的基准测试
机构 * UNC-Chapel Hill(北卡罗来纳州立大学夏洛特分校) ; University of California, Santa Cruz(加州大学圣克鲁兹分校) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 ClawArena评估AI代理在信息环境动态变化中的能力,通过多源冲突推理、动态信念更新和隐式个性化三个挑战,测试代理在多通道会话、工作区文件和阶段更新中的表现。
RadGame:一种基于人工智能的放射学教育平台
机构 * Harvard Medical School(哈佛医学院) ; Mass General Brigham(麻省总医院) ; Maastricht University(马斯特里赫特大学) ; Department of Medical Imaging, King Abdulaziz Medical City, Ministry of National Guard, Riyadh, Saudi Arabia(国王阿卜杜勒-阿齐兹医疗城医学影像科,沙特阿拉伯) ; National Strategic Technology Research Institute, Seoul National University Hospital(全国战略技术研究所,首尔国立大学医院) ; Saint Louis University School of Medicine(圣路易斯大学医学院) ; College of Medicine, King Saud bin Abdulaziz University for Health Sciences(国王萨勒曼·本·阿卜杜勒阿齐兹大学医学院) ; Tufts University School of Medicine(塔夫茨大学医学院) ; Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系)
专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI
AI总结 RadGame通过结合游戏化与大规模公开数据集,提供AI驱动的反馈,提升放射学教育中的定位和报告撰写能力,显著提高学习效果。
Comments ML4H Version
DeepArrhythmia: 基于选择性证据获取的段落上下文化ECG心律失常分类
机构 * University of Georgia(佐治亚大学)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG
AI总结 DeepArrhythmia通过选择性证据获取实现段落上下文化ECG心律失常分类,结合原始ECG信号和渲染波形图像,利用专门工具分离生理测量与证据整合,提升多beat节奏上下文下的心律失常检测精度。
SCICONVBENCH: 评估LLM在计算科学任务公式化中的多轮澄清能力
机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) ; University of Texas at Arlington(德克萨斯大学阿灵顿分校) ; Pacific Northwest National Laboratory(太平洋西北国家实验室) ; National Renewable Energy Laboratory(国家可再生能源实验室)
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 该研究提出SCICONVBENCH基准,用于评估LLM在计算科学任务公式化中的多轮澄清能力,重点在于获取缺失信息和解决请求中的矛盾,通过结构化任务本体和基于标准的评估框架,系统测量LLM在澄清行为、对话基础性和最终规格忠实度三个维度上的表现。
Causely: 企业AI中的因果智能层 一项关于SRE和可靠性工作流的基准研究
机构 * Causely
专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI
AI总结 本文提出Causely,一种企业AI的因果智能层,通过维护环境拓扑、属性依赖性和因果关系的结构化表示,为AI代理提供语义和因果基础,以诊断、评估影响并安全地在生产环境中操作。通过在受控环境下注入故障的24微服务OpenTelemetry演示应用进行基准研究,评估了Causely的价值主张。