arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-11 至 2026-08-11 共收录 31 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 31 篇

2608.08477 2026-08-11 cs.CL 新提交 92%

VectraYX-Vision-1B: A Sub-2B Spanish/LATAM Cybersecurity Vision-Language Model with Structured Visual Reasoning and Native Tool Use

VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型

Juan S. Santillana

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn)

AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交 89%

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

专题命中 视觉推理 :visual reasoning(title);VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract)

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05833 2026-08-11 cs.AI 版本更新 89%

ViSR-KGC: Visual Subgraph Reasoning with Vision-Language Models for Multimodal Knowledge Graph Completion

ViSR-KGC:结合视觉语言模型的视觉子图推理用于多模态知识图谱补全

Jiafan Li, Mengxue Yang, Jiaqi Zhu, Liang Chang, Ying Li, Hongan Wang

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学) CITIC Securities(中信证券) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 针对多模态知识图谱补全的痛点,提出ViSR-KGC方法,结合表示学习、视觉语言模型与预训练常识,通过提取查询感知子图并转换为可视化内容辅助VLM推理缺失实体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18121 2026-08-11 cs.CV cs.AI 版本更新 85%

VCU-Bridge: Hierarchical Visual Connotation Understanding via Semantic Bridging

VCU-Bridge: 通过语义桥梁实现层次化视觉隐喻理解

Ming Zhong, Yuanlei Wang, Liuzhou Zhang, Ruichuan An, Renrui Zhang, Hao Liang, Ming Lu, Ying Shen, Wentao Zhang

机构 * Zhejiang University(浙江大学) Peking University(北京大学) Sun Yat-sen University(中山大学) CUHK(香港中文大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VCU-Bridge通过语义桥梁实现层次化视觉隐喻理解,构建了HVCU-Bench基准,并展示了提升MLLM能力的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08648 2026-08-11 cs.CV 新提交 83%

Agentic Visual Reasoning in Whole-Slide Pathology Images via Active Perception

基于主动感知的全切片病理图像智能体视觉推理

Jingyun Chen, Fengchun Liu, Linghan Cai, Songhan Jiang, Shenjin Huang, Hongpeng Wang, Lequan Yu, Yongbing Zhang

机构 * College of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出AdaptivePath主动感知框架,通过序列决策实现千兆像素病理切片的视觉推理,在病理VQA基准及TCGA六队列癌症亚型分类上取得最优性能,辅助病理学家诊断。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09281 2026-08-11 cs.AI 新提交 81%

MMArch: Benchmarking Multimodal Reasoning Grounded in Architectural Evidence

MMArch:基于建筑证据的多模态推理基准测试

Chenxu Du, Kang An, Tengyue Wang, Zhongyu Yang, Xinqi Yang, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 视觉推理 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 研究针对多模态大语言模型(MLLM)在工程多模态推理基准上的表现,构建MMArch基准,发现现有MLLM与人类专家存在差距,为相关研究提供评估基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07581 2026-08-11 cs.CV cs.AI 新提交 81%

Multi-Branch Policy Optimization for Multimodal Large Language Models

面向多模态大语言模型的多分支策略优化

Shuai Lyu, Yuning Gong, Ruiling Gao, Xiaoran Shang, Zhonghong Ou, Ping Zong, Yifan Zhu, Yuan Sun, Yang Qin, Peng Hu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Sichuan University(四川大学) Shanghai University(上海大学) Huawei Technologies Ltd.(华为技术有限公司)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。

Comments 10 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09682 2026-08-11 cs.CV 新提交 79%

Thinking With Tools, Not With Pixels: Tool Calls as Text Scaffolds for Visual Reasoning

用工具思考,而非用像素思考:工具调用作为视觉推理的文本支架

Jiahao Shao, Yuanbo Yang, Yiyi Liao, Yujun Shen, Ceyuan Yang, Yinghao Xu

机构 * Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 视觉推理 :visual reasoning(title);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出工具调用支架假设,引入TextCall方法验证返回图像冗余,仅用结构化文本支架即可实现视觉推理,降低延迟并消除工具API调用,结论适用于现有相关基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09873 2026-08-11 cs.CV cs.AI 新提交 79%

Sci-VBench: Evaluating Knowledge- and Reasoning-Intensive Video Generation in Science Domains

Sci-VBench:面向科学领域知识与推理密集型视频生成的评估

Diandian Zhang, Tingyu Song, Lin Fu, Zheyuan Yang, Yilun Zhao

机构 * Zhejiang University(浙江大学) UCAS(中国科学院大学) Tongji University(同济大学) Yale University(耶鲁大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究推出Sci-VBench基准,评估科学领域视频生成,测试16个模型后发现,视觉真实感提升未转化为科学与因果动态建模能力,且专有模型性能优于开源模型。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02927 2026-08-11 cs.CV cs.AI 79%

PrismVAU: Prompt-Refined Inference System for Multimodal Video Anomaly Understanding

PrismVAU: 用于多模态视频异常理解的提示优化推理系统

Iñaki Erregue, Kamal Nasrollahi, Sergio Escalera

机构 * Universitat de Barcelona(巴塞罗那大学) Computer Vision Center(计算机视觉中心) Aalborg University(奥胡斯大学) Milestone Systems(Milestone系统)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 PrismVAU通过轻量级系统和自动提示工程实现高效的多模态视频异常理解,无需复杂标注和外部模块。

Comments This paper has been accepted to the 6th Workshop on Real-World Surveillance: Applications and Challenges (WACV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08053 2026-08-11 cs.RO cs.CV 新提交 77%

PhysX-CoT: Structured Physical Reasoning from a Single Image to Simulation-Ready 3D Assets

PhysX-CoT:从单张图像生成可用于仿真的3D资产的结构化物理推理

Jie Huang, Xiaohe Li, Jiahao Li, Fangli Mou, Chen Qian, Yuqiang Fang, Junhao Fan, Kaixin Zhang, Zide Fan

机构 * Space Engineering University(航天工程大学)

专题命中 视觉推理 :grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 PhysX-CoT将单张图像生成仿真3D资产视为显式结构化物理推理过程,通过分解部件级状态轨迹优化相关指标,在多方面优于基线,生成资产在Unreal Engine 5中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05137 2026-08-11 cs.CV 版本更新 77%

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

SmartMage:面向3D场景理解的动态模态编排

Yue Zhang, Yingzhao Jian, Yunqiu Xu, Xiaoxiao Sun, Hehe Fan

机构 * Zhejiang University(浙江大学) Stanford University(斯坦福大学)

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对现有MLLMs采用固定模态组合的缺陷,提出SmartMage模型,通过SMART和MAGE模块动态编排模态,在5个3D场景理解基准上取得最优性能,在RGB视频理解基准上表现具竞争力。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05695 2026-08-11 cs.CV 版本更新 77%

Let Geometry GUIDE: Layer-wise Unrolling of Geometric Priors in Multimodal LLMs

让几何引导:在多模态大语言模型中逐层展开几何先验

Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) InspireOmni

专题命中 视觉推理 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GUIDE框架,通过多级采样和逐步融合几何先验,提升多模态大语言模型在空间推理任务中的性能。

Comments Revised manuscript with updated experiments, figures, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09435 2026-08-11 cs.AI 新提交 70%

Listen, See and Track: Spatio-Temporal Audio-Visual Sound Event Reasoning for Omni-Modal Language Models

听、看与跟踪:面向全模态大模型的时空视听声音事件推理

Zhi Zeng, Cheng Zhang, Zesheng Yang, Rendong Pi, Jiaying Wu, Di Zhang, Zihan Ma, Guodong Li, Zhou Yang, Yu Xiang, Yifei Zheng, Minnan Luo

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);分类 cs.AI

AI总结 针对现有模型缺失的时空视听推理能力,构建ST-OmniQA基准,提出ST-Omni-R1模型,在该基准上平均语义准确率达77.83%,且空间运动表示可跨基准迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08935 2026-08-11 cs.AI 新提交 70%

Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis

用于检索增强推理、物体感知与损伤分析的集成多模态AI系统

Kalelo Dukuray, Israel Pina, Evan Perez, Erika Ardiles-Cruz, Jie Wei

机构 * City College of New York(纽约城市学院) Air Force Research Lab(空军研究实验室)

专题命中 视觉推理 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 本研究提出整合RAG、热谱感知等技术的多模态AI系统,用于损伤评估,通过多模块对比实验验证了其在提升推理准确性、鲁棒性及跨场景检测方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19341 2026-08-11 cs.CV 版本更新 70%

ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis

ExpertVerse:知识密集型视觉合成中专家级推理的通用基准

Yuan Wang, Yongchao Du, Mengting Chen, Jinsong Lan, Jiaxuan Luo, Xuetao Feng, Xiaoyong Zhu

专题命中 视觉推理 :VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 研究针对多模态生成模型在知识密集型生成的不足,开发ExpertVerse基准,涵盖多种认知能力和专家学科,生成相关数据集,训练KnowThinker并提出BPPO优化方法,揭示模型推理缺陷,强调知识密集型基准对下一代视觉生成的重要性。

Comments 14 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00506 2026-08-11 cs.CV 版本更新 70%

Affordance-Guided Diffusion Prior for 3D Hand Reconstruction

用于3D手部重建的可负担性引导扩散先验

Naru Suzuki, Takehiko Ohkawa, Tatsuro Banno, Jihyun Lee, Ryosuke Furuta, Yoichi Sato

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 研究在手部大量被遮挡时3D手部姿势重建问题;核心方法是用基于扩散的生成模型,由视觉语言模型推断的可负担性描述引导;主要贡献是显著提升手部姿势估计准确性,优于现有方法。

Comments Accepted to ECCV 2026. Project page: https://narusuzuki.github.io/projects/26-affhandgen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19990 2026-08-11 cs.AI 版本更新 70%

LEGO-Puzzles: How Good Are MLLMs at Multi-Step Spatial Reasoning?

LEGO-Puzzles:多模态大语言模型(MLLMs)在多步骤空间推理上的表现如何?

Kexian Tang, Junyao Gao, Yanhong Zeng, Haodong Duan, Yanan Sun, Zhening Xing, Wenran Liu, Kai Chen, Kaifeng Lyu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tongji University(同济大学) Tsinghua University(清华大学)

专题命中 视觉推理 :multimodal large language model(abstract,abstract_cn);分类 cs.AI

AI总结 该研究推出多步骤空间推理基准LEGO-Puzzles,评估29个顶尖MLLMs,发现其在基础空间推理、多步骤规划任务上远逊于人类,凸显其空间推理能力存在关键局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09410 2026-08-11 cs.RO 新提交 67%

Skills in Weights, Memory in Code: Hybrid Learning for Memory-Dependent Robot Manipulation

权重中的技能,代码中的记忆:面向依赖记忆的机器人操作的混合学习

Yunhao Zhao, Zhenyang Ni, Haoyang Chen, Ruohan Zhang, Qi Zhu

专题命中 视觉推理 :VLM(abstract,abstract_cn)

AI总结 针对现实机器人操作的非马尔可夫性,提出混合学习框架 HyMeS,结合编码智能体与马尔可夫 VLA,在 RoboMemArena 上显著提升操作成功率,实现数据高效的组合泛化。

Comments 9 pages, 4 figures, and 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09296 2026-08-11 cs.AI cs.CV cs.LG cs.RO 新提交 67%

CADEngBench: It Looks Like CAD, but Does It Work? Evaluating Parametric Design, Assembly Reasoning, and Physics Simulation

CADEngBench:它看起来像CAD,但真的能用吗?——参数化设计、装配推理与物理仿真的评估

Harmanjot Singh, Abhra Dubey, Jorge Alejandro Amador Herrera

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CADEngBench双轨基准,从参数化设计、装配推理等维度评估8种多模态代码模型,发现编辑现有CAD更易,复杂编辑与匹配FEA仍难,装配预测存在缺陷,强调CAD评估需关注工程行为而非外观。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09374 2026-08-11 cs.AI cs.CV 新提交 62%

CircuitReason-1k: Benchmarking Long-Horizon Visual-to-Symbolic Reasoning inElectrical Circuits

CircuitReason-1k:电路中的长程视觉到符号推理基准测试

Xinqi Yang, Kang An, Tengyue Wang, Zhongyu Yang, Chenxu Du, Yuanchi Zhu, Hebao Zhu, Ziliang Wang, Faqiang Qian, Yunli Yang, Qibing Ren

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 CircuitReason-1k是含1000个真实教材电路问题的基准,用于评估多模态模型的长程视觉到符号推理,现有模型在长程问题上表现差,该基准为相关测试提供了聚焦平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14363 2026-08-11 cs.CL cs.AI cs.CV 版本更新 62%

The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models

语言的成本:质心擦除揭示并利用多模态语言模型中的模态竞争

Akshay Paruchuri, Ishan Chatterjee, Henry Fuchs, Ehsan Adeli, Piotr Didyk

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学) UNC Chapel Hill(北卡罗来纳大学教堂山分校) USI Lugano(卢加诺大学)

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 研究发现多模态语言模型在视觉任务中表现不佳,通过质心替换方法揭示语言表征优于视觉,通过文本质心对比解码提升准确率,不同训练方法影响结果。

Comments 37 pages, 8 figures, 28 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10168 2026-08-11 cs.CV cs.AI cs.RO 版本更新 62%

RAG-3DSG: Enhancing 3D Scene Graphs with Re-Shot Guided Retrieval-Augmented Generation

RAG-3DSG: 通过重拍引导的检索增强生成增强3D场景图

Yue Chang, Rufeng Chen, Zhaofan Zhang, Yi Chen, Yifan Tian, Sihong Xie

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 RAG-3DSG通过重拍引导的不确定性估计缓解3D场景图中的语义不一致问题,利用对象级检索增强生成方法提升机器人任务中的场景表示可靠性。

Comments Accepted by ECCV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22122 2026-08-11 cs.RO cs.AI cs.CL cs.CV 版本更新 62%

REMAC: Self-Reflective and Self-Evolving Multi-Agent Collaboration for Long-Horizon Robot Manipulation

REMAC:用于长时程机器人操作的自反思与自进化多智能体协作框架

Puzhen Yuan, Angyuan Ma, Yunchao Yao, Huaxiu Yao, Masayoshi Tomizuka, Mingyu Ding

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出REMAC自适应多智能体规划框架,通过自反思与自进化实现多机器人长时程任务规划,在RoboCasa基准测试中使任务平均成功率提升40%、执行效率提升52.7%。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09591 2026-08-11 cs.RO cs.CV 新提交 57%

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07987 2026-08-11 cs.CV 新提交 57%

Advantage-Guided Gate: Reshaping Open-Ended Reasoning for Vision-Based Spatial Intelligence

优势引导门:重塑基于视觉的空间智能的开放式推理

Ling Lin, Yang Bai, Congcong Zhu, Jiangming Shi, Meng Wang, Yang Long, Jingrun Chen, Ling Shao, Huazhu Fu

机构 * University of Science and Technology of China(中国科学技术大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Institute of Advanced Intelligence and Computing (IAIC), Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高级智能与计算研究所) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学) Durham University(杜伦大学) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 视觉推理 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对MLLMs开放式推理易出错的问题,提出优势引导门框架,结合蒙特卡洛价值评估与两类优势门,构建Reasoning-Tree-160k数据集并经两阶段学习,有效提升了基准MLLMs的视觉空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07959 2026-08-11 cs.AI 新提交 57%

SCOUT: Self-Checking and Recovery-Aware Tool-Thought Agents for Ultra-Long Egocentric Video Reasoning

SCOUT:面向超长时长自我中心视频推理的自检查与恢复感知工具思维智能体

Keyang Zhong, Kuo Wang, Peng Liu, Quanlong Zheng, Junlin Xie, Zhijia Liang, Yanhao Zhang, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Shenzhen Loop Area Institute(深圳河套学院) Guangdong OPPO Mobile Telecommunications Corp., Ltd.(广东欧珀移动通信有限公司) OPPO AI Center(OPPO人工智能中心) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本研究提出SCOUT智能体框架,结合自适应策略与UPS-GRPO方法,解决超长自我中心视频推理的错误传播及信用分配问题,在对应基准上达最优性能且短时长场景仍具竞争力。

Comments Accepted by ACM Multimedia 2026 (MM '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07955 2026-08-11 cs.AI 新提交 57%

Self-Evolving Neuro-Symbolic Skills for Tool-Augmented Spatial Reasoning

面向工具增强空间推理的自演化神经符号技能

Shi-Yu Tian, Zhuo-Xia Wang, Xuan-Yi Zhu, Zhi Zhou, Xinwei Yang, Kun-Yang Yu, Ming Yang, Yang Chen, Yu-Feng Li

专题命中 视觉推理 :vision-language model(abstract);分类 cs.AI

AI总结 该研究针对视觉-语言模型在细粒度空间任务上的不可靠问题,提出神经符号框架NeSy-Spatial,通过自演化空间技能提升工具利用精度与空间推理准确率。

Comments 25 pages, 9 figures, 10 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07796 2026-08-11 cs.AI 新提交 57%

CliniCARE-Bench: Clinical Calibrated Audit of Medical Reasoning in EHR

CliniCARE-Bench:电子健康记录中医疗推理的临床校准审计

Veronica Chatrath, Bryan Zhu, George Pu, Jingxuan Fan, Apaar Shanker, Varun Ursekar, Anahita Sharma, Jason Qin, Keqi Han, Soham Dinesh Tiwari, Soham Dan, Vijay Kalmath, Yuan Li, Daniel Yue Zhang, Chenguang Wang, Zainab Doctor, Zhijun Yin, Nigam H. Shah, Yuan Xue

机构 * Scale AI Emory University(埃默里大学) University of California, Santa Cruz(加州大学圣克鲁兹分校) Vanderbilt University Medical Center(范德堡大学医学中心) Stanford School of Medicine(斯坦福医学院) Stanford Health Care(斯坦福医疗保健系统) Clinical Excellence Research Center(临床卓越研究中心)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 本研究推出首个面向部署的临床智能体基准CliniCARE-Bench,评估智能体对真实纵向电子健康记录的医疗推理,发现原始准确率夸大调查质量,无缺陷准确率更低且会重新排序排行榜。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10744 2026-08-11 cs.CV cs.RO 版本更新 57%

Traj-VLN: Learning Pixel-Space Interaction via Autoregressive Trajectory Generation

Traj-VLN:通过自回归轨迹生成学习像素空间交互

Changfei Fu, Guangcheng Chen, Aoxiang Gu, Haoxiang Liang, Wenjun Xu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Peng Cheng National Laboratory(鹏城国家实验室) Guangdong University of Technology(广东工业大学)

专题命中 视觉推理 :vision-language model(abstract);分类 cs.CV

AI总结 研究连续环境中视觉与语言导航问题,提出通过自回归轨迹生成在2D像素空间微调视觉语言模型来学习导航交互的方法,实验验证该方法能显著提升性能,旗舰模型在有限资源和数据下达最优水平。

详情

展开后加载摘要…

URL PDF HTML 收藏