Semantic- and Density-Aware Planning for Accessibility-Preserving Multi-Object Placement
面向可访问性保持的多物体放置的语义与密度感知规划
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
面向可访问性保持的多物体放置的语义与密度感知规划
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO
AI总结 针对在线多物体货架放置场景,提出SDPP方法,结合语义-密度评分与AM,在提升语义放置质量和货架密度的同时,减少可行位姿识别时间,适用于家庭货架存储场景。
面向机器人视觉的深度引导多视图曝光 bracketing(HDR 成像技术)
机构 * POSTECH(浦项科技大学)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.CV
AI总结 针对多传感器机器人系统 HDR 感知评估基准缺失的问题,构建含真实与合成场景的大规模数据集,提出深度引导多视图曝光 bracketing(DMEB)单帧 HDR 方法,经评估该方法可作为参考基准且具应用潜力。
Comments 14 pages, ECCV 2026 accepted
TRACE:面向多轮对抗对话评估的轨迹感知推理
机构 * Texas A&M University(德克萨斯农工大学) ; Amazon(亚马逊公司)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 针对LLM多轮越狱攻击,提出具备轨迹感知推理的Trace防御方法,训练Llama-3.1-8B-Instruct实现安全与实用平衡,在多轮攻击基准中显著降低攻击成功率并提升合规率。
CrossView:视觉-语言模型能否跨相机进行推理?
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。
Comments ECCV 2026
Twin:利用测试时数字孪生玩未知游戏
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI
AI总结 该研究提出Twin系统,通过测试时数字孪生构建可执行世界模型,在ARC-AGI-3等未知游戏中通关率达97.8%,效率优于人类,核心是通过模拟交互和反例修复推断游戏规则与目标。
Comments Project website with action-by-action replays of all 25 runs: https://arc-agi-3-twin.vercel.app/ Code: AGI-3" target="_blank" rel="noopener">https://github.com/Alexyskoutnev/TWIN-ARC-AGI-3
AI科学家的过去与未来
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI
AI总结 本文综述AI科学家的过去与未来,指出其核心挑战是多技术集成,现有技术已支持构建更通用系统,其有望变革科学,诺贝尔图灵挑战目标进展超前。
通过小型语言模型(SLMs)与边缘计算增强虚拟智能体:对思考与记忆过程的探索性评估
机构 * University of Central Lancashire(中央兰开夏大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI
AI总结 本文探索利用SLMs与边缘计算支持CEAA的“思考”“记忆”组件,在NVIDIA Jetson Orin NX上用Qwen2.5模型开发边缘虚拟智能体网关,经模拟实验验证其可高效运行部分CEAA过程,助力沉浸式虚拟世界具身智能体开发。
受控持久内存:长程智能体的源绑定状态语义与故障关闭式释放
机构 * Qingdao Guodongxiansheng Network Technology Co., Ltd.(青岛果动先生网络科技有限公司)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI
AI总结 本文针对长程智能体内存的矛盾记录问题,提出受控持久内存(GPM)模型,经多组基准测试与服务评估,其在GPM-ReleaseBench、中英文指令分支等场景均实现零不匹配,修复大量基线故障且无退化。
Comments 23 pages, 2 figures, 11 tables. Includes a sealed end-to-end governed-memory service evaluation with an ungoverned local Qwen2.5-7B comparison
面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码
机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG
AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。
HUGIN:增强自主物流分拣的视觉-语言规划能力
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI
AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。
基于良性用户更新的电动汽车充电基础设施网络攻击检测基准测试
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.LG
AI总结 本文构建了保留真实ACN会话的泄漏控制会话级基准,提出双分支Masked-AE转换增强模型,在多类模型对比中实现最强鲁棒验证性能,可检测电动汽车充电基础设施的恶意请求操纵且不拒绝合法用户选择。
当你的状态估计器“迷失方向”时:通过频谱分析检测估计器故障
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本研究提出一种与传感器无关的频域分析方法,用于检测状态估计器故障,在三类里程计框架中可检测51%-58%的故障,精度达60%-84%,可作为轻量级自省工具。
评估协议决定结果:在TwoRoom上独立复现LeWorldModel
专题命中 机器人数据与评测 :world model(abstract);分类 cs.LG
AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。
Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab
无验证器的测试时扩展的一致性方法
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。
MADBench:面向模态感知音频深度伪造检测的基准
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 MADBench是首个区分语音与环境音频的音频深度伪造检测基准,测试发现环境音频操纵更易检测,现有预训练检测器在两类声学成分上均失效,为相关研究提供严谨基础。
Comments 11 pages, 1 figure
基于TDMA的协同搬运通信控制协同设计:时延校准与采样率优化
机构 * Institute for Smart Electronics and Systems, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学智能电子与系统研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本文针对多机器人协同搬运的通信挑战,在MuJoCo仿真中评估三种控制方法,发现动态采样降开销、轮换领导提公平性且不影响搬运能力,为通信受限场景部署协同机器人提供指导。
面向人-场景交互的高效人体接触表示
机构 * AIOZ ; University of Liverpool(利物浦大学) ; NTHU(国立清华大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 针对人-场景交互中接触表示效率不足的问题,提出稀疏接触掩码与稀疏算子,在三个基准数据集的接触预测和场景合成任务上,实现至少12倍提速且精度优于现有最优模型。
Comments Accepted in ECCV 2026 Workshops
SHRIMP:机器人任务计划的迭代优化
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 针对协作机器人任务计划的语义歧义与透明度不足问题,提出SHRIMP系统,可通过自然语言生成分层机器人原语计划并迭代修正,经35人用户研究验证其能提升用户感知控制与机器人透明度。
Comments 11 pages, 8 figures, The 39th Annual ACM Symposium on User Interface Software and Technology (UIST '26)
Vid2WAM:将视频扩散先验蒸馏为世界动作模型
专题命中 机器人数据与评测 :robot policy(abstract);分类 cs.RO
AI总结 Vid2WAM是将视频扩散先验蒸馏为WAM的离线框架,通过双监督通道与源感知残差动作适配,提升了机器人策略的新任务泛化性与数据效率,且推理高效。
Comments Project website: https://qch-fa.github.io/vid2wam-website/
SurgWMBench:面向世界建模的手术器械运动规划视觉基准
机构 * University of Macau(澳门大学) ; National University of Singapore(新加坡国立大学) ; Xiamen University(厦门大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO
AI总结 本文提出SurgWMBench,一种面向短程手术运动规划的视觉基准,可评估手术世界模型的器械运动预测与连续回推稳定性,解决现有指标与器械规划需求不匹配的问题。
回到未来:用于电子表格创建基准测试的工作簿时光机
机构 * Microsoft(微软公司)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI
AI总结 本研究提出workbook time machine流水线,构建了含150个任务的电子表格创建评估基准wtmbench,揭示了查询特异性等因素对大语言模型Excel任务性能的关键影响。
Comments COLM 2026
面向复杂动态系统反馈控制器设计的大语言模型基准测试与推理蒸馏
机构 * The University of Tokyo(东京大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Chiba University(千叶大学) ; Tongji University(同济大学) ; Shanghai Research Institute for Intelligent Autonomous Systems(上海智能自主系统研究院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 该研究构建了CoDyControlBench基准,评估了6种LLMs的控制器设计性能,开发的15亿参数推理蒸馏模型可实现边缘部署,在机械臂试验中成功完成目标跟踪。
Capek 0.5:面向具身智能的以执行为中心的视觉语言模型
机构 * Xiaopeng(小鹏汽车)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI
AI总结 提出以执行为中心的具身视觉语言模型Capek 0.5,通过分类法整合四类具身能力,在多维度评估中表现优于初始化模型,可迁移至闭环具身任务执行。
StepJack:针对多步骤间接提示注入的计算机使用智能体安全基准测试
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI
AI总结 本文提出多步骤间接提示注入新型攻击,构建含480个测试样例的StepJack基准,评估六款先进CUAs,发现多步骤攻击可提升部分CUAs的攻击成功率。
GST-Bench:视觉语言模型能否从视频中发展出全局空间感知能力?
机构 * ByteDance Seed(字节跳动 Seed) ; Zhejiang University(浙江大学) ; National University of Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.CV
AI总结 该研究提出GST-Bench基准评估VLMs的视频全局空间感知,发现其与人类存在显著差距,构建GST-Bench-Local探究原因,还提供GST-Train数据集助力相关研究。
从透明实验器皿分割到避障:一种实时边缘感知感知流水线
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 本文提出边缘感知实例分割框架,构建含透明实验器皿的LabGlass-IS数据集,实现机器人对透明器皿的实时避障,在边界F值等指标上优于现有方法,真实机器人试验避障成功率达93.3%。
基于稀疏直接飞行时间传感器的密集度量深度补全
机构 * KAIST(韩国科学技术院) ; USTC(中国科学技术大学) ; Microsoft Research Asia(微软亚洲研究院)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.CV
AI总结 本文提出一种深度引导双分支视觉Transformer框架,结合dToF模拟流程,实现稀疏dToF到密集度量深度的零样本泛化补全,性能优于现有方法且高效。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026
OmniRouting:面向PCB布线中约束感知空间推理的语义耦合多模态基准
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.CV
AI总结 本研究针对LLMs在PCB布线推理上的能力缺口,构建了OmniRouting基准,含1681个工业级PCB设计及四项任务,发现现有LMMs存在显著局限并计划开源相关资源。
Faster-WAM:面向鲁棒世界动作模型的高效推理时未来条件化方法
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.CV
AI总结 本文提出Faster-WAM,通过稀疏未来条件化框架等技术解决现有WAMs的性能效率矛盾,在多个机器人操控基准上实现更优权衡,提升了分布外泛化能力与鲁棒性。
NeuroPB:利用预训练行为表示扩展神经解码
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.LG
AI总结 本文提出NeuroPB框架,通过预训练大规模行为表示并对齐有限配对神经-行为数据,提升神经解码性能,在猕猴数据集上R²提升11%与8%,且泛化能力强,为高效BCI提供可行方向。