arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-08-12 至 2026-08-12 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 13 篇

2605.02937 2026-08-12 cs.LG cs.AI cs.CE 版本更新 81%

Proteo-R1: Reasoning Foundation Models for De Novo Protein Design

Proteo-R1:用于从头蛋白质设计的推理基础模型

Fang Wu, Weihao Xuan, Heli Qi, Hanqun Cao, Heng-Jui Chang, Zeqi Zhou, Haokai Zhao, Ma Jian, Carl Ma, Yu-Chi Cheng, Kuan Pang, Xiangru Tang, Zehong Wang, Guanlue Li, Hanchen Wang, Kejun Ying, Pan Lu, Chiho Im, Seungju Han, Peng Xia, Tinson Xu, Yinxi Li, Deyao Zhu, Pheng-Ann Heng, Naoto Yokoya, Masashi Sugiyama, Li Erran Li, Jure Leskovec, Yejin Choi

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对现有从头蛋白质设计模型缺乏推理能力的问题,本文提出 Proteo-R1 双专家架构框架,通过 MLLM 识别关键功能残基作为硬约束,结合扩散模型实现稳定可解释的蛋白质设计。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16411 2026-08-12 cs.CV cs.AI cs.CL cs.DB cs.LG 版本更新 80%

Grounded Post-Training with Hard Examples for Reducing Hallucination in Multimodal Large Language Models

通过分布偏移下的分阶段偏好优化减少视觉-语言模型中的幻觉

Qinwu Xu

机构 * Meta AI

专题命中 视觉空间推理 :reasoning(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出分阶段偏好优化框架,通过构建针对幻觉问题的数据集,提升视觉-语言模型的 grounded reasoning,减少幻觉并提高响应信息量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23399 2026-08-12 cs.AI 版本更新 79%

GAM-Agent: Game-Theoretic and Uncertainty-Aware Collaboration for Complex Visual Reasoning

GAM-Agent:面向复杂视觉推理的博弈论与感知不确定性感知协作框架

Jusheng Zhang, Yijia Fan, Wenjun Lin, Ruiqi Chen, Haoyi Jiang, Wenhao Chai, Jian Wang, Keze Wang

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 该研究提出GAM-Agent博弈论多智能体框架,通过基础感知智能体与关键验证智能体的非零和博弈及不确定性感知协作,在四个视觉推理基准上显著提升了中小及强规模VLM的性能,为可靠可解释多模态推理提供了新路径。

Comments Accepted at NeurIPS 2025. Code available at https://github.com/jushengzhang/Gam-Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10886 2026-08-12 cs.CV cs.RO 新提交 78%

GESTO: Human-Centric Spatio-Temporal Memory for Reasoning in Dynamic Scenes

GESTO:面向动态场景推理的以人为中心的时空记忆

Ermanno Bartoli, Buwei He, Dennis Rotondi, Sebastian Koch, Federico Tombari, Kai O. Arras, Patric Jensfelt, Yixi Cai, Iolanda Leite

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院) University of Stuttgart(斯图加特大学) Max Planck Research School for Intelligent Systems(马克斯·普朗克智能系统研究所) Google Research(谷歌研究院) TU Munich(慕尼黑工业大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 该研究提出GESTO时空记忆模型,结合4D场景图与人机交互、目标事件的两级结构,在基准测试中表现优异,可支撑动态人类环境下的以活动为中心的时空推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10864 2026-08-12 cs.CV 新提交 78%

Multi-View Relational Distillation for Spatial Reasoning with Vision-Language Models

面向视觉语言模型空间推理的多视图关系蒸馏

Kiet T. Nguyen, Hanbo Shim, Jinwoo Kim, Seunghoon Hong

机构 * KAIST(韩国科学技术院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 针对视觉语言模型空间推理的几何脆弱性问题,提出多视图关系蒸馏方法,在保留语言对齐的同时提升视觉空间推理性能,可泛化至3D场景理解任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25467 2026-08-12 cs.CV 版本更新 71%

GridVAD: Open-Set Video Anomaly Detection via Spatial Reasoning over Stratified Frame Grids

GridVAD: 通过分层帧网格上的空间推理实现开放集视频异常检测

Mohamed Eltahir, Ahmed O. Ibrahim, Obada Siralkhatim, Tabarak Abdallah, Sondos Mohamed

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) Independent Researcher(独立研究员) National Center for Research (NCR)(国家研究中心)

专题命中 视觉空间推理 :reasoning(title)

AI总结 GridVAD通过分层帧网格的空间推理生成开放集候选描述,结合自一致性巩固和空间跟踪模块实现像素级异常掩码,其在UCSD Ped2上达到77.59的Pixel-AUROC,优于其他方法。

Comments Accepted at the Large-scale Video Object Segmentation (LVOS) Workshop in conjunction with ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10278 2026-08-12 cs.CV 新提交 67%

Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models

空间思维链:面向视觉语言模型的模态无关空间定位

Hunter Schofield, Mohammed Elmahgiubi, Mohammad Mahdavian, Richard Shi, Jinjun Shan, Amir Rasouli, Dongfeng Bai

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 该研究提出轻量架构无关框架Space Tokens,将空间信息蒸馏为连续token融入VLMs的思维链,在VSI-Bench上提升两款模型性能,在尺寸估计任务达SOTA,实现高效空间推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11027 2026-08-12 cs.LG cs.CL 新提交 62%

Mapping and Measuring the Behavioral Evolution of Large Language Models

大型语言模型行为演化的映射与测量

Dong Qiao, Chris Ding, Jicong Fan

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建三种互补差异度,分析32个大型语言模型的行为,发现模型家族形成聚类、跨家族距离随时间减小等规律,且该方法具有标签无关性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10430 2026-08-12 cs.LG cs.AI 新提交 62%

Actionable Hallucination Detection: Translating Latent Uncertainty into Agentic Critique

可操作的幻觉检测:将潜在不确定性转化为智能体批判

Sanidhya Vijayvargiya, Rahul Lokesh

机构 * Samsung Research America(美国三星研究院)

专题命中 视觉空间推理 :self-correction(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Latent Critic轻量级LoRA适配器,可实时检测LLM智能体的幻觉,定位准确率超80%、AUROC达0.966,能拦截幻觉并助力智能体自我修正,效能优于同类基线方法。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10835 2026-08-12 cs.CV cs.LG 新提交 57%

UniProbe: A Learnable Token-Level Hallucination Detector for Large VLMs using Multi-Structural Internal Representations

UniProbe:基于多结构内部表征的可学习大视觉语言模型(VLM) token 级幻觉检测器

Dvir Samuel, Guy Bar-Shalom, Fabrizio Frasca, Ethan Fetaya, Yftah Ziser, Gal Chechik, Haggai Maron

机构 * NVIDIA Research(英伟达研究院) Technion(以色列理工学院) Bar-Ilan University(巴伊兰大学) University of Groningen(格罗宁根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 UniProbe 是基于 LVLM 异构计算轨迹的可学习 token 级幻觉检测器,通过多结构模块交互实现 SOTA 检测性能,解码时可降 55% 对象幻觉且延迟仅增 6%

Comments Project Page: https://research.nvidia.com/labs/par/uniprobe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23452 2026-08-12 cs.CV cs.CL 版本更新 57%

FoR-SALE: Frame of Reference-guided Spatial Adjustment in LLM-based Diffusion Editing

FoR-SALE:基于参考坐标系引导的LLM驱动扩散编辑中的空间调整

Tanawan Premsri, Parisa Kordjamshidi

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Michigan State University(密歇根州立大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL

AI总结 FoR-SALE是SLD的扩展,通过参考坐标系引导的潜在空间操作调整图像朝向与深度,在三个空间理解基准上仅单轮校正就将SOTA T2I模型性能提升最高7.0个百分点,解决了非相机视角空间表达的生成偏差问题。

Comments Published in COLM 2026. 10 main pages, 4 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10057 2026-08-12 cs.CV 新提交 50%

LEGO: Leveled Language Gaussian Splatting

LEGO:分层语言高斯溅射

Yuning Peng, Haiping Wang, Yuan Liu, Yipeng Lu, Zhen Dong, Bisheng Yang

机构 * Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 LEGO是一种新方法,通过将多视角SAM粒度转为3D一致层级,结合CLIP嵌入构建分层语言场景图,在3D分割基准上取得最优性能,可赋能大语言模型的空间推理与视觉定位。

Comments Accepted to ECCV 2026. Project page: https://pz0826.github.io/LEGO-Webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07218 2026-08-12 cs.CV 版本更新 50%

SceneNAT: Masked Generative Modeling for Language-Guided Indoor Scene Synthesis

SceneNAT:基于语言引导的室内场景合成的掩码生成模型

Jeongjun Choi, Yeonsoo Park, H. Jin Kim

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 SceneNAT通过掩码非自回归Transformer实现语言引导的室内场景合成,提升性能与效率,同时降低计算成本。

Comments Under review. Project page: https://scenenat.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏