arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-27 至 2026-04-27 共收录 4 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 4 篇

2411.08027 2026-04-27 cs.LG cs.AI cs.CV cs.RO 81%

LLMPhy: Parameter-Identifiable Physical Reasoning Combining Large Language Models and Physics Engines

LLMPhy: 结合大语言模型和物理引擎的参数可识别物理推理

Anoop Cherian, Radu Corcodel, Siddarth Jain, Diego Romeres

机构 * Mitsubishi Electric Research Labs (MERL)(三菱电机研究实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 LLMPhy通过整合大语言模型与物理引擎,解决复杂物理推理中参数识别问题,提出数字孪生构建方法,引入新数据集验证性能,实现更准确的参数恢复与稳定收敛。

Comments Accepted at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11103 2026-04-27 cs.SD cs.AI 79%

ActorMind: Emulating Human Actor Reasoning for Speech Role-Playing

ActorMind:模拟人类演员推理的语音角色扮演

Xi Chen, Wei Xue, Yike Guo

机构 * The Hong Kong University of Science and Technology(香港理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出ActorMind框架,通过多代理推理模拟人类演员在舞台上的表演,提升语音角色扮演能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00813 2026-04-27 cs.CV cs.AI cs.RO 57%

DVGT-2: Vision-Geometry-Action Model for Autonomous Driving at Scale

DVGT-2:面向大规模自动驾驶的视觉-几何-动作模型

Sicheng Zuo, Zixun Xie, Wenzhao Zheng, Shaoqing Xu, Fang Li, Hanbing Li, Long Chen, Zhi-Xin Yang, Jiwen Lu

机构 * Tsinghua University(清华大学) Xiaomi EV(小米电动车) University of Macau(澳门大学) Peking University(北京大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 本文提出VGA范式,通过密集3D几何信息提升自动驾驶决策,引入DVGT-2实现在线处理,结合时间因果注意力和滑动窗口策略,提升效率与重建性能。

Comments Code is available at https://github.com/wzzheng/DVGT

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22519 2026-04-27 cs.RO 50%

Clutter-Robust Vision-Language-Action Models through Object-Centric and Geometry Grounding

通过对象中心和几何约束实现抗杂波的视觉-语言-动作模型

Khoa Vo, Taisei Hanyu, Yuki Ikebe, Trong Thang Pham, Nhat Chung, Minh Nhat Vu, Duy Nguyen Ho Minh, Anh Nguyen, Anthony Gunderman, Chase Rainwater, Ngan Le

机构 * University of Arkansas(阿拉巴马大学) National University of Singapore(新加坡国立大学) TU Wien(维也纳技术大学) Max Planck Research School for Intelligent Systems(智能系统马克斯·普朗克研究学校) University of Stuttgart(斯图加特大学) University of Liverpool(利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出OBEYED-VLA框架,通过分离感知接地与动作推理提升视觉-语言-动作模型在现实环境中的鲁棒性,特别是在存在干扰物、目标缺失和背景变化等挑战性场景中表现优异。

Comments Under review. Project website: https://uark-aicv.github.io/OBEYED_VLA

详情

展开后加载摘要…

URL PDF HTML 收藏