arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-23 至 2026-04-23 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 7 篇

2604.20749 2026-04-23 cs.AI 79%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 78%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL 62%

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19902 2026-04-23 cs.CV cs.AI cs.LG 62%

MMCORE: MultiModal COnnection with Representation Aligned Latent Embeddings

MMCORE:多模态连接与表征对齐的潜在嵌入

Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo, Xiaochen Lian, Peihao Zhu, Yu Tian, Zhonghua Zhai, Peng Wang

机构 * ByteDance Seed(字节跳动种子)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 MMCORE通过预训练视觉-语言模型生成语义视觉嵌入,结合扩散模型实现多模态图像生成与编辑,提升生成质量并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20304 2026-04-23 cond-mat.mtrl-sci cs.AI 57%

LLM-guided phase diagram construction through high-throughput experimentation

通过高通量实验构建LLM引导的相图

Ryo Tamura, Haruhiko Morito, Yuna Oikawa, Guillaume Deffrennes, Shoichi Matsuda, Naruki Yoshikawa, Tomoaki Takayama, Taichi Abe, Koji Tsuda, Kei Terayama

机构 * Center for Basic Research on Materials(材料基础研究中心) National Institute for Materials Science(国家材料科学研究所) Graduate School of Frontier Sciences(前沿科学研究生院) The University of Tokyo(东京大学) RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心) Core Facility Center(核心设施中心) Tohoku University(东北大学) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) CNRS(法国国家科学研究中心) Grenoble INP(格勒诺布尔INP) SIMaP Center for Green Research on Energy and Environmental Materials(能源与环境材料绿色研究中心) Nara Institute of Science and Technology(奈良科学技术大学) Research Center for Structural Materials(结构材料研究中心) Graduate School of Medical Life Science(医学生命科学研究生院) Tokyo Institute of Technology(东京技术大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文研究LLM在构建多组分合金相图中的应用,通过高通量实验和X射线衍射分析,展示了LLM在实验规划中的互补优势,验证了其在相图构建中的潜力。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.09591 2026-04-23 cs.CV cs.AI 57%

Variational Visual Question Answering for Uncertainty-Aware Selective Prediction

变分视觉问答用于不确定性感知的选择性预测

Tobias Jan Wieczorek, Nathalie Daun, Mohammad Emtiyaz Khan, Marcus Rohrbach

机构 * TU Darmstadt(图宾根大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出变分VQA方法,通过变分贝叶斯方法提升视觉问答和视觉推理任务的可靠性,尤其在低误差容忍度下表现优异,且优于AdamW训练模型。

Comments TMLR April 2026 version. 13 pages main paper, 31 pages with appendix. Updated bibliography

Journal ref Transactions on Machine Learning Research (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20841 2026-04-23 cs.CV 50%

DeVI: Physics-based Dexterous Human-Object Interaction via Synthetic Video Imitation

DeVI:基于物理的灵巧人-物体交互通过合成视频模仿

Hyeonwoo Kim, Jeonghwan Kim, Kyungwon Cho, Hanbyul Joo

机构 * Seoul National University(首尔国立大学)

专题命中 视觉空间推理 :planning(abstract)

AI总结 DeVI通过合成视频模仿实现基于物理的灵巧人-物体交互,结合3D人体跟踪与鲁棒2D物体跟踪,提升对未知目标物体的控制能力,优于现有方法。

Comments Project Page: https://snuvclab.github.io/devi/

详情

展开后加载摘要…

URL PDF HTML 收藏