arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-01 至 2026-07-01 共收录 56 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 4 篇

2606.31407 2026-07-01 cs.CV cs.AI cs.CL 新提交 86%

Visual Semantic Entropy: Do Vision Language Models Recognize Visual Ambiguity?

视觉语义熵:视觉语言模型能否识别视觉模糊性?

Ta Duc Huy, Trang Nguyen, Townim Chowdhury, Ankit Yadav, Minh-Son To, Zhibin Liao, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, Adelaide University(澳大利亚机器学习研究所,阿德莱德大学) Flinders University(弗林德斯大学)

专题命中 视觉问答 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型在模糊输入下产生自信错误预测的问题,提出视觉语义熵(VSE),通过仅扰动图像并聚类生成答案的语义原型来量化不确定性,在五个模型和五个基准上达到最优。

Comments Accepted at ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31903 2026-07-01 cs.CV cs.AI 新提交 79%

Attend, Transform, or Silence: Operator-Level Visual Skipping for Efficient Multimodal LLM Inference

关注、变换或静默:面向高效多模态大语言模型推理的算子级视觉跳跃

Zhaoyang Luo, Runmin Dong, Miao Yang, Fan Wei, Yushan Lai, Bin Luo, Haohuan Fu

机构 * Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Sun Yat-sen University(中山大学) National Supercomputing Center in Shenzhen(国家超级计算深圳中心) Tsinghua University(清华大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉令牌计算冗余问题,提出算子级视觉跳跃框架,选择性跳过冗余注意力或FFN算子,在Qwen3-VL上减少33.7%计算量并保持99.5%性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31825 2026-07-01 cs.CV cs.AI 新提交 79%

Breaking Failure Cascades: Step-Aware Reinforcement Learning for Medical Multimodal Reasoning

打破失败级联:面向医学多模态推理的步骤感知强化学习

Junha Jung, Minbyul Jeong, Suhyeon Lim, Sungwook Jung, Jaehoon Yun, Taeyun Roh, Mujeen Sung, Jaewoo Kang

机构 * Korea University(高丽大学) Upstage AI Kyung Hee University(庆熙大学) KAIST(韩国科学技术院) Hanyang University College of Medicine(汉阳大学医学院) AIGEN Sciences

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出步骤感知强化学习算法MRPO,通过为早期错误推理步骤分配指数级惩罚,打破失败级联,显著提升医学视觉问答准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31800 2026-07-01 cs.AI 新提交 57%

Evo-PI: Aligning Medical Reasoning via Evolving Principle-Guided Supervision

Evo-PI:通过演化原则引导的对齐医学推理

Xianda Zheng, Huan Gao, Meng-Fen Chiang, Michael Witbrock, Kaiqi Zhao, Shangyang Li

机构 * School of Computer Science, University of Auckland(奥克兰大学计算机科学学院) Beijing University of Posts and Telecommunications(北京邮电大学) Renyixun Health Technology Co., Ltd.(仁医讯健康科技有限公司) National Yang Ming Chiao Tung University(国立阳明交通大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI

AI总结 提出Evo-PI框架,将推理原则作为可演化的语言监督信号,通过协同进化循环动态调整模型推理,在医学视觉问答中提升准确率最高达24.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 11 篇

2606.31200 2026-07-01 cs.AI 新提交 91%

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交 90%

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24814 2026-07-01 cs.RO 新提交 87%

Vision-Language Model Reasoning for Contextual Semantic Mapping in Intralogistics

面向内部物流的上下文语义建图中的视觉-语言模型推理

Marvin Rüdt, Hao Pang, Constantin Enke, Zäzilia Seibold, Kai Furmans

机构 * Institute for Material Handling and Logistics, Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院物流与物料搬运研究所)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title)

AI总结 提出结合SLAM、SAM、实例聚类和VLM多视角推理的上下文语义建图流程,零样本推断物体可移动性,实现语义分类98.93% mIoU和可移动性估计89.17% mAcc。

Comments Accepted for publication at the 31st IEEE International Conference on Emerging Technologies and Factory Automation (ETFA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22158 2026-07-01 cs.CV 新提交 83%

Improving Reasoning in Vision-Language Models via Perception Verified Self-Training

通过感知验证自训练提升视觉-语言模型的推理能力

Sourabh Sharma, Sonam Gupta, Sadbhawna

机构 * Malaviya National Institute of Technology Jaipur(马拉维亚国家理工学院斋浦尔分校) IBM Research(IBM研究院)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出感知验证自训练框架,通过解耦感知与推理的CoT模板和无监督评估方法PerceptEval,结合两阶段课程学习,提升视觉-语言模型在视觉推理中的准确性并减少幻觉。

Comments Accepted at The European Conference on Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31100 2026-07-01 cs.CV 新提交 77%

TaxoMIL: Taxonomy-Constrained Learning for Hierarchical Whole Slide Image Analysis

TaxoMIL:用于层次化全切片图像分析的分层约束学习

Chaeyeon Lee, Khang Nguyen Quoc, Jinsol Song, Yosep Chong, Kwangil Yim, Jin Tae Kwak

机构 * School of Electrical Engineering, Korea University(韩国大学电气工程学院) Department of Hospital Pathology, The Catholic University of Korea College of Medicine(韩国天主教大学医学院医院病理学系)

专题命中 视觉推理 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 提出TaxoMIL框架,将WSI诊断重构为多粒度文本生成任务,通过双头Transformer解码器和分类学引导目标,实现层次感知的准确预测。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30698 2026-07-01 cs.RO 新提交 75%

Vision-Language Procedural Reasoning for Context-Aware Reward Modeling of Robotic Endovascular Guidewire Navigation

面向机器人血管内导丝导航的视觉-语言程序化推理与上下文感知奖励建模

Wentong Tian, Jiyuan Zhao, Tianliang Yao, Yuxiang Fan, Zhengyu Shi, Dong Liu, Peng Qi

机构 * Department of Control Science and Engineering, College of Electronic and Information Engineering, and Shanghai Institute of Intelligent Science and Technology, Tongji University(同济大学电子与信息工程学院控制科学与工程系,以及上海智能科学与技术研究院) Department of Electronic Engineering, Faculty of Engineering, The Chinese University of Hong Kong(香港中文大学工程学院电子工程系) Shanghai Operation Robot Co., Ltd.(上海微创医疗机器人(集团)股份有限公司)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract)

AI总结 提出视觉-语言程序化推理框架,利用多模态大模型实时理解视觉上下文,动态调整奖励权重,实现单策略适应复杂血管导航任务,提升可靠性与效率。

Comments This paper has been accepted by IEEE/RSJ IROS 2026. 7 pages, 4 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31599 2026-07-01 cs.CV cs.AI 新提交 73%

Token-Sparse Medical Multimodal Reasoning via Dual-Stream Reinforcement Learning

通过双流强化学习实现令牌稀疏的医学多模态推理

Kaitao Chen, Weiqian Zhao, Jiamin Wu, Qihao Zheng, Shangquan Sun, Chunfeng Song, Xiaosong Wang, Mu Zhou, Mianxin Liu

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出双流强化学习框架ViToS,通过主动视觉令牌剪枝实现令牌稀疏的医学多模态推理,在七个医学基准上减少77%令牌并提升性能。

Comments ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31543 2026-07-01 cs.AI cs.CL cs.LG 新提交 62%

Modality-Driven Search with Holistic Trace Judging for ARC-AGI-2

基于模态驱动与整体轨迹判断的ARC-AGI-2求解方法

Johan Land

机构 * Independent Researcher(独立研究者)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对抽象推理中候选轨迹选择难题,提出模态驱动搜索生成多样化候选,并结合整体判断模型在长上下文中联合比较所有轨迹,在ARC-AGI-2上以低成本达到72.9%准确率,超越前沿模型。

Comments 37 pages, 4 figures; source code available at AGI" target="_blank" rel="noopener">https://github.com/beetree/ARC-AGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31645 2026-07-01 cs.CV 新提交 57%

Technical Report of RoboSpatial Challenge at CVPR 2026: Selective Reasoning Activation and Reference-Frame Disambiguation for Embodied Spatial Reasoning

RoboSpatial Challenge at CVPR 2026技术报告:选择性推理激活与参考框架消歧用于具身空间推理

Yuxiang Xie, Qi Lv, Jianming Xing, Zijian Hong, Xiang Deng, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Ruoyu Technology(若愚科技)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 提出RoboSpatialBrain,通过强制<think>前缀激活和参考框架重定向两种无训练推理机制,解决具身空间推理中的歧义问题,在RoboSpatial-Home上达到80.9%成功率,获得挑战赛第一名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31383 2026-07-01 cs.CV 新提交 57%

MS-Resampler: Multi-Scope Visual Resampling for Efficient Multimodal LLMs

MS-Resampler: 用于高效多模态大语言模型的多范围视觉重采样

Zhongyang Li, Yaqian Li, Faming Fang, Rinyoichi Takezoe, Zi-Hao Bo, Cheng Qian, Mo Guang, Guixu Zhang, Kaiwen Long

机构 * Li Auto Inc.(理想汽车) East China Normal University(华东师范大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出MS-Resampler,通过多范围视觉重采样框架,注入显式空间范围先验,使模型在固定令牌预算内同时捕获局部细节和全局上下文,提升多模态理解与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31169 2026-07-01 cs.CV 新提交 57%

Beyond Single Character: Evaluating MLLMs for Sentence-Level Oracle Bone Inscription Understanding

超越单字符:评估多模态大语言模型在句子级甲骨文理解中的表现

Ziqi Li, Zijian Chen, Tingzhu Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Nanjing University of Science and Technology(南京理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 提出S-OBI基准,通过字形替换与组合合成清晰标准的句子级甲骨文实例,设计语义匹配、语义槽提取和上下文推理任务,评估多模态大语言模型在句子级甲骨文理解中的表现,发现当前模型仍依赖字符级识别。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 12 篇

2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交 88%

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31471 2026-07-01 cs.CV 新提交 81%

Think While You Map: Asynchronous Vision-Language Agents for Incremental 3D Scene Graphs

边建图边思考:用于增量式3D场景图的异步视觉-语言智能体

Deniz Bickici, Michael Pabst, Shohei Mori, Dieter Schmalstieg

机构 * University of Stuttgart(斯图加特大学) Graz University of Technology(格拉茨技术大学) IMPRS-IS(国际马克斯·普朗克智能系统研究学院)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 提出异步架构,轻量在线建图与重型语义精化并发运行,通过语义闭环、属性标注和空间关系推导,实现探索时可查询且语义渐增的3D场景图,在多个基准上超越现有方法。

Comments Accepted to ECCV 2026. Project page: https://denizbickici.github.io/thinkgraphs/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31338 2026-07-01 cs.SD cs.AI eess.AS 新提交 79%

Beyond Binary Instrument QA: Probing Instrument Grounding in Music Audio-Language Models

超越二元乐器问答:探究音乐音频-语言模型中的乐器接地

Yujun Lee, Joonhyeok Shin, Hyoeun Kim, Kyuhong Shim

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文通过多轴诊断基准测试发现,音乐音频-语言模型在二元乐器问答中的高准确率常掩盖选项位置偏差、易混淆乐器错误和时间响应偏差等问题,表明乐器接地评估需采用多维度基准而非单一准确率。

Comments Workshop on Machine Learning for Audio, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 73%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31367 2026-07-01 cs.MM cs.CV 新提交 70%

Evidence Triangulation for Multimodal Fact-Checking in the Wild

野外多模态事实核查的证据三角测量

Stefanos-Iordanis Papadopoulos, Zacharias Chrysidis, Christos Koutlis, Symeon Papadopoulos, Panagiotis C. Petrantonakis

机构 * Information Technologies Institute, Centre for Research & Technology, Hellas(希腊研究与技术中心信息技术研究所) Department of Electrical and Computer Engineering, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学电气与计算机工程系)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对多模态事实核查中合成数据与真实数据差距大的问题,提出X-POSE基准和TRENT模型,通过三个并行交叉注意力流和关系融合机制进行证据三角测量,在真实数据上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31919 2026-07-01 cs.RO cs.AI cs.CV 新提交 62%

MVP-Nav: Multi-layer Value Map Planner Navigator

MVP-Nav: 多层价值地图规划导航器

Wenyuan Xie, Shaokai Wu, Yijin Zhou, Yanbiao Ji, Guodong Zhang, Bayram Bayramli, Qiuchang Li, Xunchu Zhou, Yue Ding, Hongtao Lu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对零样本目标导航中缺乏深度信息导致的物理不确定性,提出MVP-Nav框架,通过3D基础模型重建物理占用并构建多层价值地图,实现语义与物理约束的统一规划,达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31614 2026-07-01 eess.SY cs.AI cs.SY 新提交 57%

Automating Cause-Effect Specification with Knowledge Graphs and Large Language Models

利用知识图谱和大语言模型自动化因果规范生成

Javal Vyas, Milapji Singh Gill, Mehmet Mercangöz

机构 * Autonomous Industrial Systems Lab, Imperial College London(帝国理工学院自主工业系统实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 提出一种语义AI框架,结合知识图谱与约束大语言模型,自动生成因果逻辑和操作安全叙述,减少手动工作。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31682 2026-07-01 cs.RO 新提交 50%

HABIT: Human-Aware Behavior and Interaction Training Dataset for Robot Manipulation

HABIT:用于机器人操作的人类感知行为与交互训练数据集

Jaehwi Song, Suchae Jeong, Byeongguk Jeon, Sungdong Kim, Minjoon Seo, Hyungmok Son, Kimin Lee

机构 * KAIST(韩国科学技术院)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出HABIT数据集,包含10K+集、160+小时的人类在场机器人演示,覆盖协作、共事和监督三类交互任务,训练出人类感知行为(时空同步、避让、手势理解)并支持快速适应新交互任务。

Comments 30 pages, 26 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31339 2026-07-01 cs.RO 新提交 50%

Verification-Gated Agentic Mission-State Governance for Intelligent Industrial Multi-Robot Systems

验证门控的智能工业多机器人系统任务状态治理

Guoqin Tang, Qingxuan Jia, Yichen Tan, Zeyuan Huang, Ning Ji, Gang Chen

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出验证门控任务状态治理框架,通过同步任务森林与黑板状态,经确定性验证后原子提交,减少无效提交和冲突,提升工业多机器人系统安全与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31041 2026-07-01 cs.CL 新提交 50%

A Semantic-Layer-Mediated Agent for Natural Language to SQL over Heterogeneous Enterprise Databases

一种语义层中介的智能体,用于异构企业数据库的自然语言到SQL转换

Ha Jeong Kim, Saksonita Khoeurn, Ye Ji Yoon

机构 * DAQUV Corp.(DAQUV公司) Chungbuk National University(忠北大学) BigDataLabs, Co., Ltd.(BigDataLabs有限公司)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出一种通过语义层中介的NL2SQL智能体,利用语义模型查询(SMQ)解耦语义与物理SQL,在Spider2-snow基准上达到94.15%执行准确率,排名第三。

Comments Submitted to FITAT 2026 for peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30973 2026-07-01 cs.CL 新提交 50%

From Propositional to Perceptual Asymmetry: Extending Frictive Policy Optimization to Asymmetric Partial Information Dialogue

从命题不对称到感知不对称:将摩擦策略优化扩展到非对称部分信息对话

Yifan Zhu, Kyeongmin Rim, James Pustejovsky

机构 * Brandeis University(布兰迪斯大学)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 将摩擦策略优化从共享感知场景扩展到感知不对称场景,通过跨语料库分析和LLM探测验证,发现摩擦函数仅在参与者信息视野内有效,并提出标注改进。

Comments 11 pages. To appear in Proceedings of SIGDIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26276 2026-07-01 cs.CR 新提交 50%

Expecting (Targeted Ads)? Network Analysis of User Health Data Leakage in Fertility Tracking Apps

期待(定向广告)?生育追踪应用中用户健康数据泄露的网络分析

Yeeun Jo, Shahanaasree Sivakumar, Mahnoor Jameel, Camille Cobb, Adam Bates, Brad Reaves

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 通过对20款Android生育追踪应用的网络测量,发现部分应用存在显式或隐式的用户健康数据泄露给第三方广告服务,同时也有应用在无泄露情况下使用广告变现。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2606.31388 2026-07-01 cs.CV 新提交 57%

One Video, One World: Turning Monocular Video into Physical 4D Scenes

一视频一世界:将单目视频转化为物理4D场景

Junhao Chen, Boran Zhang, Mingjin Chen, Henghaofan Zhang, Saining Zhang, Congcong Zhu, Hao Zhao, Ruqi Huang, Zhihao Li, Yufei Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) SparcAI Inc(SparcAI公司) University of Science and Technology of China(中国科学技术大学) The Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.CV

AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。

Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 8 篇

2606.31382 2026-07-01 cs.RO 新提交 90%

Revisiting Parameter Redundancy in Vision-Language-Action Models: Insights from VLM-to-VLA Adaptation

重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解

Fengnian Zhang, Tao Huang, Siyu Xu, Zhong Jin, Chang Xu

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 GUI与屏幕智能体 :VLM(title,title_cn);vision-language model(abstract)

AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。

Comments 22 pages, 3 figures, ECCV 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30696 2026-07-01 cs.RO cs.CL cs.LG 新提交 85%

ViTL: Temporal Logic-Guided Zero-Shot Natural Language Navigation via Vision-Language Models

ViTL:基于视觉语言模型的时间逻辑引导零样本自然语言导航

Kaier Liang, Hengde Dai, Cristian-Ioan Vasile

机构 * Lehigh University(里海大学)

专题命中 GUI与屏幕智能体 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出ViTL框架,利用大语言模型将自然语言命令编译为线性时序逻辑公式,并引入方向性评分,实现零样本多目标时序约束导航。

详情

展开后加载摘要…

URL PDF HTML 收藏