arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-07-28 至 2026-07-28 共收录 80 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3 篇

2607.23921 2026-07-28 cs.CV 新提交 88%

DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering

DDVT:用于视觉问答中答案定位的动态双级视觉Transformer融合网络

Yue Zhang, Xiangyu Li, Wanshu Fan, Xin Yang, Dongsheng Zhou

机构 * National and Local Joint Engineering Laboratory of Computer Aided Design, School of Software Engineering, Dalian University(大连大学软件工程学院计算机辅助设计国家地方联合工程实验室) School of Computer Science and Technology, Dalian University of Technology(大连理工大学计算机科学与技术学院)

专题命中 视觉问答 :visual question answering(title,abstract);grounding(title,abstract);分类 cs.CV

AI总结 研究视觉问答中答案定位问题,提出动态双级视觉Transformer融合网络DDVT,含问题引导的动态区域级模块和跨模态多尺度聚合模块,能精确定位相关视觉内容并融合文本特征,实验证明其性能优于现有方法。

Comments Accepted by CGI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24354 2026-07-28 cs.AI 新提交 84%

Are Prompt Optimizers Blind? Cross-Modal Visual Feedback for Automatic Prompt Optimization

提示优化器是盲目运行的吗?用于自动提示优化的跨模态视觉反馈

Haoyue Liu, Xiaoyu Ma, Ye Chen, Yuexian Zou, Xiaoying Tang

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.AI

AI总结 研究多模态任务中自动提示优化的盲目性问题,提出跨模态视觉反馈方法,含故障条件视觉诊断和错误感知聚合阶段,在多个VQA数据集和目标VLM上效果显著,能提升分数且优化器可跨模型转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交 79%

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 12 篇

2607.24707 2026-07-28 cs.AI cs.CV cs.DB 新提交 84%

ERUnderstand: Evaluating Vision-Language Models on Structured ER Diagrams

ERUnderstand:在结构化实体关系图上评估视觉语言模型

Ali Ansari, Yasmin Mohammadi, Farnoush Nili, Parsa Esmaeilkhani, Longin Jan Latecki, Eduard Dragut

机构 * Temple University(天普大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对实体关系图仅为图像限制AI辅助数据库工程的问题,引入ERUnderstand基准测试。通过对2960个图表及标准化表示评估视觉语言模型,发现常见元素恢复良好,但特定元素性能差,推理增强模型可提升性能,为评估多模态理解提供基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24471 2026-07-28 cs.CL 新提交 71%

Grounding latent algorithm routing in transformer reasoning

在变压器推理中为潜在算法路由建立基础

Xiangbo Zhang, Xiaoxu Ma

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉推理 :grounding(title)

AI总结 研究变压器能否围绕不同归纳偏差族组织情节级适应,通过潜在算法路由及ROUTEBENCH基准实验,发现从零训练的密集仅解码器变压器能开发类似路由的内部变量,缩小最优路由差距,但未建立通用路由。

Comments Accepted by COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24199 2026-07-28 cs.CV 新提交 70%

Reasoning to Regulate: Chain-of-Thought for Traffic Rule Understanding

推理以规范:用于交通规则理解的思维链

Yueru Luo, Xu Yan, Changqing Zhou, Yiming Yang, Chao Zhan, Shuqi Mei, Chao Zheng, Zhen Li

机构 * CUHK-SZ, Shenzhen-FNii(香港中文大学(深圳),深圳高等金融研究院) HKUST(GZ)(香港科技大学(广州)) Tencent T Lab(腾讯T实验室)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 针对交通规则理解这一自动驾驶关键挑战,提出为视觉语言模型配备思维链能力的框架,设计整理管道,采用两阶段训练方案,显著提升了可解释性和准确性,建立首个基于推理的自动驾驶框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23472 2026-07-28 cs.CV 新提交 70%

VIPER: Visual In-Context Physics Reasoning for Physically Plausible Video Generation

VIPER:用于物理上合理的视频生成的视觉上下文物理推理

Tianxiao Chen, Hanmo Chen, Huajin Chen, Bo Li, Qi Ye, Peng-Tao Jiang

机构 * Zhejiang University(浙江大学) vivo Mobile Communication Co., Ltd.(维沃移动通信有限公司)

专题命中 视觉推理 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 研究针对视频生成模型控制物理行为难的问题,提出VIPER框架,利用多模态大语言模型提取物理线索,通过分层训练引导图像到视频生成器,构建VIPER-19K数据集,实验证明该框架能实现物理行为转移且效果良好。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24582 2026-07-28 cs.CV cs.AI 新提交 62%

CADER: Confidence-Aware Dynamic Evidence Reasoning for Long-Video Understanding

CADER:用于长视频理解的置信度感知动态证据推理

Jinlong Yang, Wenhao Zhang, Kuanwei Lin, Sijie Cheng

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对长视频理解中现有系统推理过程不考虑难度的问题,提出CADER框架。它先全局推理估计置信度让高置信度示例提前退出,对不确定示例激活第二阶段工具增强循环定位证据,实验证明其能提升长视频推理能力并提供实用推理路线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24064 2026-07-28 cs.CV cs.AI 新提交 62%

MarineEVT: Advancing Event-Centric Marine Video Understanding via Visual Tool Reasoning

MarineEVT:通过视觉工具推理推进以事件为中心的海洋视频理解

Tuan-An To, Yuk-Kwan Wong, Tuan-Anh Vu, Ziqiang Zheng, Sai-Kit Yeung

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 针对海洋视频理解面临的挑战,构建MarineEVT数据集,将其理解分解为EVT-R1过程,利用视觉工具驱动模型。实验显示EVT-R1优于多个SOTA VLMs,为海洋相关发展奠定基础并推动VLMs进步。

Comments Accepted to The 19th European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22864 2026-07-28 cs.CV cs.AI 新提交 62%

Spatial-IQ: Deconstructing Spatial Intelligence via Hierarchical Capability Tests

空间智商:通过分层能力测试解构空间智能

Patrick Rim, Tom Long, Ekta Prashnani, Ruth Rosenholtz, Ben Boudaoud, Peter Xenopoulos, Alex Wong, Joohwan Kim, Jae-Hyun Jung

机构 * NVIDIA Research(英伟达研究院) Yale University(耶鲁大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型空间推理能力不足问题,提出Spatial-IQ分层诊断框架,分解物体计数任务为子任务,生成数据集评估模型,发现模型存在问题,且用思维链监督和强化学习训练可提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24191 2026-07-28 cs.CL cs.AI 新提交 57%

StanceFlip: A Comprehensive Multi-Dimensional Benchmark for Multimodal Conversational Stance Flipping Forecasting

StanceFlip:用于多模态对话立场翻转预测的综合多维基准测试

Heyan Chai, Xin Li, Wenjie Wang, Jianyang Qin, Chaoyang Li, Lu Wang, Hao Chen, Qing Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件学院) Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)) City University of Macau(澳门城市大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对现有对话立场检测基准测试的局限,提出StanceFlip基准测试及ConStaFF框架,含多模态立场六元组提取和动态立场翻转归因两个新子任务,基于大语言模型实现端到端立场推理,实验显示该方法性能领先。

Comments 17pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23917 2026-07-28 cs.CV 新提交 57%

Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention

凝视到文本生成:超越人类注意力的分类解码

Sounak Mondal, Dimitris Samaras, Gregory Zelinsky, Minh Hoai

机构 * Stony Brook University(纽约州立大学石溪分校) Australian Institute for Machine Learning(澳大利亚机器学习研究所) Adelaide University(阿德莱德大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出将凝视解码为自然语言描述人类目标的新问题,构建Gazette框架,基于多模态大语言模型,利用新颖策略合成出声思考转录本并指令调优,使其在多任务凝视解码中达最优性能,能推断多样场景下人类目标意图。

Comments To appear in European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23700 2026-07-28 cs.AI 新提交 57%

Offline-Online Curriculum RL for Multimodal Reasoning

用于多模态推理的离线-在线课程强化学习

Wendi Deng, Hang Du, Guoshun Nan, Haokun Tian, Jiaqi Yu, Xinlei Cao, Jaile Li, Jingfeng Chen, Ling Deng, Ting Li, Hao Yang, Jun Liu, Xudong Jiang, Sicong Leng

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) BUPT Shenzhen Institute(北京邮电大学深圳研究院) Carnegie Mellon University(卡内基梅隆大学) Lancaster University(兰卡斯特大学) Nanyang Technological University(南洋理工大学) China Telecom Corporation Limited Sichuan Branch(中国电信股份有限公司四川分公司) Changsha University of Science & Technology(长沙理工大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.AI

AI总结 研究多模态推理中模型中间步骤有缺陷的问题,提出$O^2$-CritiCuRL框架,通过离线多步展开分析和在线渐进式强化学习策略,区分关键与冗余步骤,提升模型性能及训练和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23019 2026-07-28 cs.AI cs.LO cs.SC 新提交 57%

Reason Popper-ly: Patching In-Context Reasoning with Inductive Logic Programming

合理地运用波普尔方法:用归纳逻辑编程修补上下文推理

Zirong Chen, Meiyi Ma

机构 * Vanderbilt University(范德堡大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 研究针对思维链提示中间步骤逻辑不合理问题,提出Reason Popper-ly框架,用归纳逻辑编程学习规则作在线验证器校正步骤,在CLUTRR基准测试中提升了模型准确率,还产生细粒度错误分类法,优于完全外部符号管道。

Comments Accepted at the 20th Conference on Neurosymbolic Learning and Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22715 2026-07-28 cs.CV cs.MM 新提交 57%

Child-Oriented AIGC Video Risk Reviewing: A Benchmark and Knowledge-Supported Iterative Reasoning Framework

面向儿童的AIGC视频风险审查:一个基准和知识支持的迭代推理框架

Lewen Mi, Manyi Li, Yuling Sun, Yufan Zhang, Yuxin Shi, Yulong Bian, Xiangxian Li, Juan Liu

机构 * Shandong University(山东大学) Fudan University(复旦大学) Beijing Jiaotong University(北京交通大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 研究面向儿童的AIGC视频审查问题,构建CAVSR基准和分层风险分类法,提出结合多智能体协作与知识经验的QVRS-E框架,实验证明该方法能增强儿童相关风险审查,产生更可靠报告。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 23 篇

2607.24730 2026-07-28 cs.CV cs.AI 新提交 87%

KANEx: Translating Kolmogorov-Arnold Networks' Interpretability to Medical Explainability

KANEx:将柯尔莫哥洛夫-阿诺德网络的可解释性转化为医学可解释性

Krithi Shailya, Ananya Lakshmi Ravi, Venkatanathan K. V., Sowmya S. Sundaram, Gokul S. Krishnan, Aditi Anand, Balaraman Ravindran

机构 * Indian Institute of Technology Madras(印度理工学院马德拉斯分校) Vanderbilt University School of Medicine(范德堡大学医学院)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 研究针对医学应用中视觉模型黑箱问题,提出KANEx框架,利用柯尔莫哥洛夫-阿诺德网络的符号透明度为VLM推理奠基,设计KAN-Map热图生成方法,经实验验证该方法能提升语义相似度、视觉定位及推理质量,为可信医学人工智能发展助力。

Comments MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23962 2026-07-28 cs.CV cs.CR 新提交 85%

Development of Vision-Language Model-based GNSS Spoofing Detection for Autonomous Vehicle Navigation

基于视觉语言模型的自动驾驶车辆导航GNSS欺骗检测技术发展

Mohammed Aldeen, Muhammad Sami Irfan, Sagar Dasgupta, Long Cheng, Mizanur Rahman, Mashrur Chowdhury

专题命中 视觉定位与Grounding :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究自动驾驶车辆GNSS欺骗检测问题,提出基于视觉语言模型的框架,融合多源数据,经三阶段微调及自适应推理策略,大幅提升检测准确率与效率,并生成数据集验证跨区域泛化能力,为自动驾驶提供实用道路防御层。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23951 2026-07-28 cs.CV 新提交 85%

TimePLE: Rethinking Temporal Representation for Video Temporal Grounding

TimePLE:重新思考视频时间定位的时间表示

Yuhui Zeng, Xinyu Mao, Xiaokun Liu, Xin Tao, Jinfa Huang, Jiayi Ji, Xiawu Zheng

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 研究视频时间定位问题,提出TimePLE方法,通过预测有效时间区间的联合分布将VTG从端点预测转为区间原生定位,经实验验证该方法优于端点预测基线,在短和中等持续时间事件上表现出色。

Comments 25 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23132 2026-07-28 cs.CV 新提交 85%

DispatchRAG: Grounding Emergency Dispatch Decisions in Real-World Protocols from Traffic Accident Video

DispatchRAG:基于交通事故视频中的现实世界协议进行应急调度决策

Muhammad Sulthan Adhipradhana, Ehsan Javanmardi, Naren Bao, Manabu Tsukada

机构 * Graduate School of Information Science and Technology, University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 视觉定位与Grounding :grounding(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 研究旨在通过DispatchRAG框架,利用基于RAG的检索机制和大型语言模型驱动的推理器,根据日本现实交通事故响应协议进行事故评估和调度,引入事故调度数据集验证框架,为自动驾驶车辆事故报告提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24570 2026-07-28 cs.CV cs.AI 新提交 84%

The Visual Bottleneck: Sparse-Frame Adaptation of MLLMs for Joint Spatial-Temporal Video Grounding

视觉瓶颈:用于联合时空视频定位的多模态大语言模型的稀疏帧适配

Jiameng Zhang, Srikanth Madikeri

机构 * University of Zurich(苏黎世大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型在视频定位中训练与部署条件不匹配问题,通过实验表明视觉特征提取是稀疏帧输入瓶颈,提出适配特定层及边界感知采样策略,证明训练策略对稀疏帧视频定位比模型规模更关键。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24407 2026-07-28 cs.CV 新提交 83%

Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding

思想令牌混合:统一感知与推理以实现自由形式多模态基础定位

Tianyi Gao, Han Fang, Tianyi Ding, Hao Li, Xin Wei, Hongbo Sun, Xiaodong Dong, Ye Yuan, Jinglin Xu, Kongming Liang, Hao Sun, Jingmin Xin

机构 * Institute of Artificial Intelligence and Robotics, Xi’an Jiaotong University(西安交通大学人工智能与机器人研究所) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究旨在统一多模态基础定位中的感知与推理。提出思想令牌混合(Motto)方法,通过空间接地思想令牌化及上下文自适应令牌链实现,构建PR-Bench基准,实验证明该方法在自由形式接地任务中达领先性能。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22586 2026-07-28 cs.AI cs.CL 新提交 83%

MM-ShiftKV: Decode-Aware Prefill-Stage KV Selection for Multimodal Large Language Models

MM-ShiftKV:用于多模态大语言模型的解码感知预填充阶段键值选择

Jinsong Shu, Chenyang Wu, Zhongle Xie, Baokun Wang, Lidan Shou

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术产业开发区(滨江)区块链与数据安全研究院)

专题命中 视觉定位与Grounding :multimodal large language model(title,abstract);grounding(abstract);分类 cs.AI

AI总结 研究多模态大语言模型中KV缓存问题,提出MM-ShiftKV方法,通过构建方差扩展查询代理近似解码时查询行为,基于聚合注意力质量估计KV重要性,在严格缓存预算下性能优于现有方法。

Comments 19 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22572 2026-07-28 cs.AI 新提交 79%

Schema-Aware Localisation (SAL): Live Schema Grounding and Hallucination Validation for Oracle NL2SQL

模式感知本地化(SAL):用于Oracle NL2SQL的实时模式基础与幻觉验证

Sanjay Mishra, Divya Chukkapalli, Ganesh R. Naik

机构 * Torrens University Australia(澳大利亚托伦斯大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 研究大型语言模型在Oracle数据库执行SQL失败的问题,提出模式感知本地化(SAL)轻量级中间件,通过构建实时模式映射、注入上下文及幻觉索引验证等方法,提升执行基础真值,减少执行失败率。

Comments 18 pages , 3 figures , 14 tables ,1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24539 2026-07-28 cs.AI cs.SY eess.SY 新提交 70%

Task-Conditional Faithfulness Auditing of Multimodal LLMs for Grid Diagnosis

用于电网诊断的多模态大语言模型的任务条件忠实性审计

Tianqiao Zhao, Meng Yue, Jianhui Wang

机构 * The University of Texas at Arlington(德克萨斯大学阿灵顿分校) Brookhaven National Laboratory(布鲁克海文国家实验室) Southern Methodist University(南卫理公会大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型用于电网诊断时答案准确性与证据使用的问题,提出通用框架进行任务条件忠实性审计,通过比较多种依赖并设计校正和重新审计机制,经案例研究验证了框架检测、诊断及纠正相关失败的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24098 2026-07-28 cs.CV 新提交 70%

ReflexTrack: A Feedback-Driven Agent for Training-Free Referring Video Object Segmentation

ReflexTrack:一种用于无训练的引用视频对象分割的反馈驱动智能体

Yuanjia Li, Tianyang Xu, Tao Zhou, Zhangyong Tang, Xiao-Jun Wu, Josef Kittler

机构 * School of Artificial Intelligence and Computer Science, Jiangnan University(江南大学人工智能与计算机科学学院) Centre for Vision, Speech and Signal Processing, University of Surrey(萨里大学视觉、语音和信号处理中心)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对引用视频对象分割问题,提出无训练、反馈驱动的ReflexTrack智能体。通过掩码引导空间细化和视频级掩码反射实现空间与时间层面反馈,提升预测可靠性,在Ref-VPS和ReasonVOS上取得较好分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23797 2026-07-28 cs.RO 新提交 67%

Memory for Attention: Language-Conditioned Re-Perception with a Vision--Language--Motion Map

注意力的记忆:通过视觉-语言-运动地图进行语言条件下的重新感知

Dibyendu Ghosh

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn)

AI总结 研究携带行为注释地图的机器人的规划问题,通过将重新感知视为注意力决策,利用持久地图的记忆实现资源分配优化,在语言条件任务中表现出色,证明地图能指导机器人关注重点,而非空间导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23739 2026-07-28 cs.SI 新提交 67%

Separating Clicks from Baits: Using Large Language Models to Detect Misleading YouTube Thumbnails

从诱饵中分离点击:使用大语言模型检测误导性的YouTube缩略图

Wajiha Naveed, Muhammad Muneeb Pervez, Zaeem Mohtashim Khan, Zafar Ayyub Qazi, Zartash Afzal Uzmi

专题命中 视觉定位与Grounding :vision-language model(abstract);LLaVA(abstract)

AI总结 研究针对YouTube等平台误导性缩略图问题,提出用大语言模型的多模态检测管道,构建数据集并评估多个模型,发现Claude 3.5 Sonnet性能突出,通过失败分析为视频平台发展提供方向。

Comments Accepted to the 21st International AAAI Conference on Web and Social Media (ICWSM 2027)

Journal ref Proceedings of the International AAAI Conference on Web and Social Media, 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22612 2026-07-28 cs.SC cs.AI cs.LG cs.MS 新提交 62%

Quotient Tree Arithmetic: Deferred-Division Computation with Bounded Symbolic Depth and Cross-Subtree Cancellation

商树算法:具有有界符号深度和跨子树抵消的延迟除法计算

Gregory Magarshak

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 研究提出商树算法(QTA),值以延迟商对表示,比值延迟求值。有界深度增长、跨子树抵消和延迟稳定性三个定理支撑。用于机器学习训练有多种优势,还提出矢量化硬件归一化指令,代数基础是环的局部化,联系代数结构理论与硬件原生算术。

Comments 20 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24449 2026-07-28 cs.IR cs.AI 新提交 57%

Evaluating RAG for French immigration law: a benchmark and baseline study

评估法国移民法的RAG:一项基准和基线研究

Annia Abtout, Julien Delaunay, Monika Ewa Rakoczy

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究法国国际招聘的法律框架,通过公开基准比较参数化语言模型基线与密集检索增强在两种模型规模下对52个合成档案的效果,发现检索能改进行政指导,凸显检索基础的重要性,推动混合检索策略研究。

Journal ref International workshop on AI for Human Resources and Public Employment Services (ECML-PKDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24280 2026-07-28 cs.AI 新提交 57%

From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search

从专有模型到开源模型:通过智能体搜索中的多智能体协议蒸馏弥合分布差距

Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou

机构 * Beijing Institute of Technology(北京理工大学) East China Normal University(华东师范大学) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 研究旨在弥合专有与开源模型分布差距,提出多智能体协议蒸馏(MAPD)框架,利用结构化协议作中间表示,结合蒸馏与强化学习,在问答基准测试中表现出色,有效减轻学生策略问题,优于其他竞争方法。

详情

展开后加载摘要…

URL PDF HTML 收藏