arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

European Conference on Computer Vision · 会议 · Computer Vision

2026-07-20 至 2026-07-20 共收录 9
2607.15868 2026-07-20 cs.CV cs.AI cs.GR cs.HC cs.RO 新提交

EgoExoMoCap: Distributed Ego-Exo Human Motion Capture

EgoExoMoCap:分布式自我-外部人体运动捕捉

Jiaxi Jiang, Bharat Lal Bhatnagar, Nan Yang, Lingni Ma, Sebastian Starke, Robin Kips, Nadine Bertsch, Christian Holz, Federica Bogo

机构 * Meta Reality Labs(元现实实验室) ETH Zürich(苏黎世联邦理工学院)

AI总结 针对头戴式设备人体运动捕捉,提出EgoExoMoCap分布式框架,联合自我与外部中心多模态信号,利用头部等跟踪信号及DINOv3特征,能在复杂场景中稳健重建运动,突破了两种范式孤立的局限。

Comments Accepted by ECCV 2026, Project page and code: https://siplab.org/projects/EgoExoMoCap

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15806 2026-07-20 cs.CV 新提交

HybridSim: A Physics-Learning Hybrid Digital Twin for mmWave Human Sensing

HybridSim:用于毫米波人体感知的物理学习混合数字孪生

Weitao Xiong, Tianyu Liu, Peng Li, Kok Chung Chua, Toa Chean Khim, Pu Wang, Hongfei Xue

机构 * Xiamen University Malaysia(厦门大学马来西亚分校) The Hong Kong University of Science and Technology(香港科技大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

AI总结 研究针对毫米波雷达信号模拟成本高问题,提出HybridSim混合模拟器,用三平面和图卷积网络等提取人体特征、稳定优化,通过逆渲染等建模信号路径,实验显示其能有效增强特定地点数据,提升人体感知任务表现。

Comments Accepted to ECCV 2026. Project Page: https://weitao-xiong.github.io/HybridSim/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15699 2026-07-20 cs.CV 新提交

GoStop: Reinforcement Learning for Adaptive Temporal Aggregation in Event-Based Feature Tracking

GoStop:基于强化学习的事件驱动特征跟踪中的自适应时间聚合

Youngho Kim, Hoonhee Cho, Jae-Young Kang, Kuk-Jin Yoon

机构 * KAIST(韩国科学技术院)

AI总结 研究基于事件相机的特征跟踪问题,提出用强化学习框架自适应控制事件累积过程,训练智能体依运动线索决策,引入新数据集评估,集成该框架到现有方法可提升性能,在动态运动下更具鲁棒性且平衡跟踪精度与效率。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15652 2026-07-20 cs.CV 新提交

CSS-BA: Gate-Guided Column Space Search for Bundle Adjustment

CSS-BA:用于光束法平差的门控列空间搜索

Ayano Kaneda, Takafumi Taketomi, Shugo Yamaguchi, Shigeo Morishima

机构 * Waseda University(早稻田大学) CyberAgent, Inc.(株式会社CyberAgent)

AI总结 针对低视差和近旋转情况下传统BA法病态问题,提出门控引导的CSS-BA,通过结合CSS和几何感知门控稳定舒尔-LM更新,所有参数保留在优化中,仅限制更新方向,实验显示其优化稳定、姿态精度提高且校准有竞争力。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15491 2026-07-20 cs.CV 新提交

Trajectory-aware Cross-view Geo-localization with Sequential Observations

基于序列观测的轨迹感知跨视角地理定位

Tianyi Gao, Jiayu Lin, Danielle Beaulieu, Nathan Jacobs

机构 * Washington University in St. Louis(圣路易斯华盛顿大学)

AI总结 研究跨视角地理定位,提出TrajLoc统一框架处理视频片段和路线描述,利用视觉与语言语义相互强化匹配,还提出TrajMod模块,实验显示该框架在视频和文本地理定位上比现有方法有显著优势。

Comments Accepted to ECCV 2026. Project Page: https://humblegamer.github.io/trajloc/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19235 2026-07-20 cs.CV cs.RO 版本更新

Generation Models Know Space: Unleashing Implicit 3D Priors for Scene Understanding

生成模型了解空间:解锁隐式3D先验用于场景理解

Xianjin Wu, Dingkang Liang, Tianrui Feng, Kui Xia, Yumeng Zhang, Xiaofan Li, Xiao Tan, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Baidu Inc.(百度公司)

AI总结 本文提出通过大规模视频生成模型的隐式空间先验提升场景理解,引入VEGA-3D框架,利用预训练视频扩散模型作为潜在世界模拟器,通过时空特征提取与语义融合增强大语言模型的几何信息,实验验证其在3D场景理解、空间推理和具身操控中的优越性。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12262 2026-07-20 cs.CV 版本更新

Video Streaming Thinking: VideoLLMs Can Watch and Think Simultaneously

视频流思考:VideoLLMs可以同时观看和思考

Yiran Guan, Liang Yin, Dingkang Liang, Jianzhong Ju, Zhenbo Luo, Jian Luan, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) MiLM Plus Xiaomi Inc.(小米公司)

AI总结 VST提出了一种视频流理解的新范式,通过在流式过程中激活推理,提高实时响应和理解能力,同时在多个基准测试中表现出更高的效率和泛化能力。

Comments Accepted by ECCV 2026, project page https://1ranguan.github.io/VST/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13636 2026-07-20 cs.CV cs.RO 版本更新

MindDrive: A Vision-Language-Action Model for Autonomous Driving via Online Reinforcement Learning

MindDrive: 一种通过在线强化学习实现自动驾驶的视觉-语言-动作模型

Haoyu Fu, Diankun Zhang, Zongchuang Zhao, Jianfeng Cui, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Dingkang Liang, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) Xiaomi EV(小米电动车)

AI总结 MindDrive通过在线强化学习实现自动驾驶中的视觉-语言-动作模型,结合决策专家和动作专家,提升复杂场景下的驾驶决策与探索效率。

Comments Accepted by ECCV 2026; Project Page: https://xiaomi-mlab.github.io/MindDrive/

详情

展开后加载摘要…

URL PDF HTML 收藏