arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-09 至 2026-06-09 共收录 249 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 45 篇

2606.08828 2026-06-09 cs.RO 新提交 50%

Video2Sim2Real: Full-Stack Autonomous Dexterous Skill Acquisition from a Single Human Video

Video2Sim2Real:从单个人类视频实现全栈自主灵巧技能获取

Yunhai Han, Jianuo Qiu, Linhao Bai, Ziyu Xiao, Zihang Zeng, Yangcen Liu, Zhaodong Yang, Shalin Jain, Wenrui Ma, Jiaqi Fu, Yuqian Zheng, Manisha Natarajan, Muhammad Zubair Irshad, Kenneth Shaw, Matthew Gombolay, Zsolt Kira, Harish Ravichandar

机构 * Georgia Institute of Technology(佐治亚理工学院) University of Pennsylvania(宾夕法尼亚大学) Toyota Research Institute(丰田研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 规划推理 :planning(abstract)

AI总结 提出Video2Sim2Real框架,从单个人类操作视频中重建数字孪生并提取运动先验,通过物体关键帧优化机器人配置,结合残差强化学习与碰撞感知规划,实现从仿真到真实世界的灵巧技能迁移。

Comments Website: https://video2sim2real.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07940 2026-06-09 cs.CR 新提交 50%

SGTO-MAS: Secure Gorilla Troops Optimization for Multi-Agent LLM Systems

SGTO-MAS:面向多智能体大语言模型系统的安全大猩猩部队优化

Saeid Jamshidi

专题命中 规划推理 :reasoning(abstract)

AI总结 提出一种基于大猩猩部队优化的安全感知多智能体LLM协调方法,通过信任建模、风险感知和集体智能的联合优化,在性能、安全性和效率间取得平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25531 2026-06-09 eess.SP 版本更新 50%

From Denoising to Decision Making: A Survey on Diffusion Model-Enabled Deep Reinforcement Learning for Wireless Networks

从去噪到决策:面向无线网络的扩散模型赋能深度强化学习综述

Nguyen Cong Luong, Zeping Sui, Jie Cao, Min Xu, Nguyen Duc Hai, Zhihao Dong, Nguyen Duc Duy Anh, Qiushi Zhao, Nguyen Quoc Khanh, Zhe Fu, Shaohan Feng, Bo Ma

专题命中 规划推理 :planning(abstract)

AI总结 本文综述了扩散模型与深度强化学习结合的方法,通过捕捉无线资源管理中的复杂多模态动作结构,提升决策质量,并系统总结了其在移动边缘计算、无人机辅助、车联网、AIGC驱动系统、无线资源分配、物理层安全及机器人/无人机规划等领域的应用。

Comments 22 pages, 7 figures, Author list corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22208 2026-06-09 cs.CV 版本更新 50%

EvoIR-Agent: Self-Evolving Image Restoration Agentic System via Experience-Driven Learning

EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体

Kailin Zhuang, Jiawei Wu, Zhi Jin

专题命中 规划推理 :planning(abstract)

AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。

Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10999 2026-06-09 cs.CV 版本更新 50%

TraversalBench: Challenging Paths to Follow for Vision Language Models

TraversalBench: 为视觉语言模型设计的复杂路径挑战测试集

Clara Petrova, Zhuo Chen, Marin Soljačić

机构 * Massachusetts Institute of Technology, Department of Physics(麻省理工学院物理系) Massachusetts Institute of Technology, Institute for Data, Systems, and Society(麻省理工学院数据、系统与社会研究所) NSF AI Institute for Artificial Intelligence and Fundamental Interactions(国家科学基金会人工智能与基本相互作用AI研究所)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出TraversalBench,一个用于评估视觉语言模型复杂视觉路径跟随能力的受控基准测试集,发现自相交是主要困难来源,揭示了模型在路径感知上的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-06-09 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index for Structure-Aware JSONL Retrieval in Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 规划推理 :reasoning(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 22 篇

2606.08992 2026-06-09 cs.RO cs.AI cs.CV 新提交 87%

SpaceVLN: A Zero-Shot Vision-and-Language Navigation Agent with Online Spatial Cognitive Memory and Reasoning

SpaceVLN:具有在线空间认知记忆与推理的零样本视觉与语言导航智能体

Yucheng Deng, Pingrui Lai, Xinhai Li, Chenjia Bai, Xiaoheng Deng, Chengnuo Sun, Xuelong Li, Hua Yang

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Central South University(中南大学) Jiangsu University(江苏大学)

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);planning(abstract);分类 cs.AI

AI总结 提出SpaceVLN,通过空间认知记忆和任务引导的空间推理,在零样本设置下实现连续环境中的视觉与语言导航,在多个基准上达到最优性能。

Comments 23 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08035 2026-06-09 cs.CV 新提交 87%

DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning

DyCo-RL: 用于视觉推理的动态跨模态协调

Hangui Lin, Yan Shu, Zhengyang Liang, Chi Liu, Xiangrui Liu, Minghao Qin, Teng Long, Zheng Liu, Nicu Sebe

机构 * University of Trento(特伦托大学) BAAI(北京智源人工智能研究院) Singapore Management University(新加坡管理大学) IQuest Research

专题命中 视觉空间推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出DyCo-RL,通过Fisher-Rao测地距离量化模态内注意力转移,实现动态跨模态协调,并利用对齐引导的优势重加权优化策略,提升多模态大模型在视觉推理中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04627 2026-06-09 cs.AI 版本更新 83%

MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models

MIRAGE: 具有隐式推理和生成世界模型的移动智能体

Zhichao Yang, Yuanze Hu, Haojie Hao, Longkun Hao, Dongshuo Huang, Hongyu Lin, Gen Li, Lanqing Hong, Yihang Lou, Yan Bai

机构 * Beihang University(北京航空航天大学) Northwestern Polytechnical University(西北工业大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National University of Singapore(新加坡国立大学) Peking University(北京大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出MIRAGE框架,通过从显式推理轨迹学习连续潜在表示,使移动智能体能够内部推理并预测未来屏幕状态,在减少生成token的同时提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07529 2026-06-09 cs.CL cs.AI cs.CV cs.LG cs.MM 新提交 82%

CAPruner: Conceptual-Adjacent Scene Graph Pruner for Enhancing 3D Spatial Reasoning of Large Language Models

CAPruner: 概念相邻场景图剪枝器以增强大语言模型的3D空间推理

Shengli Zhou, Xiangchen Wang, Guanhua Chen, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) SpatialTemporal AI(时空人工智能)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出概念相邻场景图剪枝器(CAPruner),通过融合模糊语义相关性和空间邻近性估计关系重要性,在任务特定上下文中选择关键关系,避免关系级标注,显著提升大语言模型在3D视觉语言任务上的空间推理性能。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08952 2026-06-09 cs.AI 新提交 79%

AlloSpatial: Agentic Harness Framework for Spatial Reasoning in Foundation Models

AlloSpatial:基础模型中空间推理的智能体框架

Shouwei Ruan, Bin Wang, Zhenyu Wu, Qihui Zhu, Yuxiang Zhang, Jingzhi Li, Yubin Wang, Xingxing Wei

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室) University of Science and Technology Beijing(北京科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 提出AlloSpatial框架,通过World2Mind认知映射沙箱将自我中心观察转化为异中心空间先验,并利用空间推理工具实现几何语义仲裁,在VSI-Bench和MindCube上提升模型5%-18%的空间推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22766 2026-06-09 cs.CL 版本更新 79%

Imagination Helps Visual Reasoning, But Not Yet in Latent Space

想象力有助于视觉推理,但尚未在潜在空间中实现

You Li, Chi Chen, Yanghao Li, Fanhu Zeng, Kaiyu Huang, Jinan Xu, Maosong Sun

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 通过因果中介分析发现,多模态大语言模型中的潜在推理存在输入-潜在和潜在-答案两个关键断连,表明其有效性有限,并提出显式想象方法CapImagine,在视觉推理任务中表现更优。

Comments ICML 2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09285 2026-06-09 cs.LG cond-mat.mtrl-sci 版本更新 79%

Enhancing Spatial Reasoning in Large Language Models for Metal-Organic Frameworks Structure Prediction

增强大型语言模型在金属有机框架结构预测中的空间推理能力

Mianzhi Pan, JianFei Li, Peishuo Liu, Botian Wang, Yawen Ouyang, Yiming Rong, Hao Zhou, Jianbing Zhang

机构 * National Key Laboratory for Novel Software Technology(新型软件技术国家重点实验室) Nanjing University(南京大学) Institute of AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) ChemBIC(化学信息学中心)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.LG

AI总结 针对MOF结构预测中原子数量多、复杂度高的问题,提出MOF-LLM框架,通过空间感知持续预训练、结构监督微调和匹配驱动强化学习,增强Qwen-3 8B模型的空间推理能力,实现35.78%匹配率和0.04秒/结构的采样效率。

Comments KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09290 2026-06-09 cs.CV 新提交 78%

Visual Para-Thinker++: A Single-Policy Multi-Agent Framework for Visual Reasoning

Visual Para-Thinker++:用于视觉推理的单策略多智能体框架

Haoran Xu, Hongyu Wang, Yifei Gao, Jiaze Li, Zizhao Tong, Xiaofeng Zhang, Xiaosong Yuan

机构 * Zhejiang University(浙江大学) Hunan University(湖南大学) Tianjin University(天津大学) University of Chinese Academy of Sciences(中国科学院大学) Shanghai Jiao Tong University(上海交通大学) Jilin University(吉林大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 提出Visual Para-Thinker++框架,通过共享MLLM策略实例化为多个角色智能体并行推理,结合多智能体能力注入和角色解耦优化,有效缓解视觉推理中的早期感知承诺和幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07528 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

BEACON: Behavioral Entropy Aggregation for Cross-Model Hallucination Detection in Large Language Models

BEACON: 面向大语言模型跨模型幻觉检测的行为熵聚合

Naveen Bera, Pulijala Sai Nikhila, Kondaguduru Abhiram, Shaik Gayaz Ali, Shoaib Sadiq Salehmohamed, Shaik Mohammed Omar, Jinal Prashant Thakkar, Hansika Aredla, Shalmali Ayachit

机构 * LLM Lens

专题命中 视觉空间推理 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BEACON框架,通过多维度行为特征(语义熵、嵌入几何、思维链一致性、释义稳定性)的黑盒检测方法,在7个基准上达到0.8123 AUROC,优于现有方法。

Comments 12 pages, 6 tables, 1 figure. Code and data available upon request

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10376 2026-06-09 cs.CV 版本更新 67%

SleepWalk: A Three-Tier Benchmark for Stress-Testing Instruction-Guided Vision-Language Navigation

SleepWalk:一种三层压力测试基准,用于指导的视觉-语言导航

Niyati Rawal, Sushant Ravva, Shah Alam Abir, Saksham Jain, Aman Chadha, Vinija Jain, Suranjana Trivedy, Amitava Das

机构 * Indian AI Research Organization (IAIRO)(印度人工智能研究组织) ĸragya Lab, BITS Pilani Goa(BITS Pilani Goa 的 ĸragya 实验室) University of Dhaka(达卡大学) Delhi Technological University(德里技术大学) Apple(苹果公司) Meta

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 本文提出SleepWalk基准,用于评估基于指令的轨迹预测,针对局部化、交互导向的具身推理,揭示当前VLM在空间推理中的系统性失败。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09134 2026-06-09 cs.RO cs.AI cs.CL cs.CV cs.GR 新提交 62%

From USD Scenes to Knowledge Graphs: Zero-Shot Ontology Grounding with LLMs

从USD场景到知识图谱:基于LLM的零样本本体接地

Jiangtao Shuai, Zongxiong Chen, Manfred Hauswirth, Sonja Schimmler

机构 * Technical University of Berlin(柏林工业大学) Fraunhofer FOKUS(弗劳恩霍夫开放通信系统研究所)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究利用大语言模型(LLM)零样本地将3D场景对象自动映射到本体类别,无需训练,在厨房场景中达到90-96%准确率,并揭示语义线索是关键。

Comments Accepted to the IEEE ICRA 2026 International Joint Workshop on Ontologies, Semantic Maps and Autonomous Robotics Standardization (J-WOSMARS 2026), Vienna, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09151 2026-06-09 cs.CV cs.AI cs.LG 版本更新 62%

Video Understanding by Design: How Datasets Shape Video Models

通过设计理解视频:数据集如何塑造视频模型

Lei Wang, Syuan-Hao Li, Piotr Koniusz, Yongsheng Gao

机构 * School of Engineering and Built Environment, Electrical and Electronic Engineering, Griffith University(工程与建筑环境学院,电气与电子工程学院,格里菲斯大学) School of Computer Science and Engineering, University of New South Wales(计算机科学与工程学院,新南威尔士大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文从数据集视角出发,提出统一框架连接数据集结构、归纳偏差与架构设计,分析数据集特性如何驱动视频理解架构创新,并讨论不同数据体制下的表征偏差。

Comments Research report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09399 2026-06-09 cs.AI 新提交 57%

RunAgent SuperBrowser: A Theory of Autonomous Web Navigation Grounded in Human Browsing Behaviour

RunAgent SuperBrowser: 基于人类浏览行为的自主网页导航理论

Radeen Mostafa, Sawradip Saha

机构 * RunAgent AI

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出SuperBrowser自主网页导航代理,通过模仿人类浏览的感知-认知-行动三元机制,在Mind2Web Hard基准上以89.47%成功率超越现有开源研究代理。

Comments 31 pages, 8 figures, preprint/work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08945 2026-06-09 cs.LG 新提交 57%

From Hazard Functions to Language Space: Cox-Supervised Distillation of Survival Risk into a Large Language Model

从风险函数到语言空间:Cox监督的生存风险蒸馏到大语言模型

Nicholas I-Hsien Kuo, Blanca Gallego, Louisa Jorm

机构 * Centre for Big Data Research in Health, the University of New South Wales(新南威尔士大学健康大数据研究中心)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 提出将Cox比例风险模型的时间事件风险信息迁移到大语言模型中的方法,通过文本提示微调Qwen模型,在三个数据集上取得有竞争力的区分度和校准性,并发现隐藏状态呈现连续风险梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08710 2026-06-09 cs.SE cs.AI 新提交 57%

Structuring agentic AI for HPC code modernization

构建用于HPC代码现代化的智能体AI

Anthony Marinov, Igor Sfiligoi

机构 * San Diego Supercomputer Center(圣地亚哥超级计算机中心) University of California, San Diego(加州大学圣地亚哥分校) La Jolla, California, United States(圣地亚哥, 加州, 美国)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出一种结构化智能体AI方法,通过手动示例、持续可构建性和限制会话范围,成功将6万行Fortran MPI代码在数月内转换为C++ OpenMP并行代码。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08500 2026-06-09 cs.SE cs.AI 新提交 57%

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

通过发起野生的代码理解之旅来投射SWE代理新兴思维模式

Zhengyi Zhuo, Yan Liu

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过有限工具接口让SWE代理在真实代码库中探索,提出Ada框架,利用观察透镜分析代理的导航、证据选择、综合、基础化和停止行为,将轨迹数据转化为可比较的行为画像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08014 2026-06-09 cs.CV cs.AI 新提交 57%

GVC-Seg: Training-Free 3D Instance Segmentation via Geometric Visual Correspondence

GVC-Seg: 基于几何视觉对应的免训练3D实例分割

Liang Xu, Fangjing Wang, Jinyu Yang, Feng Zheng

机构 * Victoria University of Wellington(惠灵顿维多利亚大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Southern University of Science and Technology(南方科技大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出GVC-Seg,一种免训练的3D实例分割方法,通过几何与视觉特征对应消除多模型集成中的置信度偏差,在多个基准上达到最优性能。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07861 2026-06-09 cs.CV cs.AI 新提交 57%

The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models

最后一个可见像素:探究视觉-语言模型中的精细尺度感知

Lujun Li, Lama Sleem, Niccolo Gentile, Yangjie Xu, Yewei Song, Wenbo Wu, Radu State

机构 * University of Luxembourg(卢森堡大学) Foyer S.A. Université Paris-Saclay(巴黎-萨克雷大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 提出FineSightBench基准,通过4-48像素尺度分离感知与推理任务,发现视觉-语言模型感知在12像素饱和,推理在更大尺度仍受限,揭示精细视觉推理的根本缺陷。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18493 2026-06-09 eess.IV cs.AI cs.CV 版本更新 57%

SAGE: Shape-Adapting Gated Experts for Adaptive Histopathology Image Segmentation

SAGE:适应性组织病理图像分割的形状自适应门控专家

Gia Huy Thai, Hoang-Nguyen Vu, Anh-Minh Phan, Quang-Thinh Ly, Thi-Ngoc-Truc Nguyen, Nhat Ho

机构 * University of Science, VNU-HCM(越南国家大学科学学院) Trivita AI University of Technology, VNU-HCM(越南国家大学技术学院) Michigan State University, USA(美国密歇根州立大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 SAGE通过动态专家路由框架提升异构视觉网络中细胞形态变化的适应性,实现高精度分割与稳健泛化。

Comments Accepted to CVPR 2026 (Findings Track). Project Page: https://oxyzgiahuy.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09314 2026-06-09 cs.RO 新提交 50%

KPGrasp: Scalable Keypoint Flow Matching for Dexterous Grasp Generation

KPGrasp: 可扩展的关键点流匹配用于灵巧抓取生成

Yuansen Huang, Jiayi Chen, Haoran Liu, Yubin Ke, Bing Han, Jiangran Lyu, Mi Yan, Li Yi, He Wang

机构 * Peking University(北京大学) Galbot Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出KPGrasp框架,通过全欧几里得手部关键点参数化和Transformer流模型,从大规模数据学习灵巧抓取先验,无需接触损失或测试时优化,在模拟和真实场景中实现高成功率与低穿透深度。

Comments 14 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08688 2026-06-09 cs.RO cs.CV 新提交 50%

PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback

PhysAgent: 通过轨迹驱动的多智能体反馈实现基于物理的4D合成自动化

Chunji Lv, Jiaxi Ye, Yuchen Jiang, Rexar Lin, Changsheng Li

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 提出PhysAgent,首个模拟器在环的多智能体框架,通过解耦材料与外力、利用视觉基础模型提取轨迹并借助LLM常识推理,实现自动化、物理可信的4D运动合成,显著提升生成多样性与物理准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08277 2026-06-09 cs.CV 新提交 50%

Remember with Confidence: Uncertainty Quantification for Spatio-temporal Memory with Probabilistic Guarantees

自信记忆:具有概率保证的时空记忆不确定性量化

Harry Zhang, Nicolas Gorlo, Luca Carlone

机构 * MIT(麻省理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 针对机器人长期操作中VLM描述噪声大、视角不一致的问题,提出目标级语义不确定性评分,并集成到UQ-DAAAM系统中,通过主动选择高质量视图和融合多视角描述来降低不确定性,同时提供概率保证。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 14 篇

2606.06915 2026-06-09 cs.CL cs.AI cs.LG 版本更新 87%

ThinkBooster: A Unified Framework for Seamless Test-Time Scaling of LLM Reasoning

ThinkBooster: 一种用于LLM推理无缝测试时扩展的统一框架

Vladislav Smirnov, Chieu Nguyen, Sergey Senichev, Minh Ngoc Ta, Ekaterina Fadeeva, Artem Vazhentsev, Daria Galimzianova, Nikolai Rozanov, Viktor Mazanov, Jingwei Ni, Tianyi Wu, Igor Kiselev, Mrinmaya Sachan, Iryna Gurevych, Preslav Nakov, Timothy Baldwin, Artem Shelmanov

机构 * MBZUAI ETH Zürich(苏黎世联邦理工学院) Imperial College London(伦敦帝国理工学院) NUS(国立大学新加坡) Accenture(埃森哲) Innopolis University(因诺普里斯大学) Independent Researcher(独立研究者)

专题命中 测试时计算 :reasoning(title,abstract);test-time compute(abstract);verifier(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ThinkBooster框架,通过模块化库、联合评估基准和可部署代理服务,实现LLM推理的测试时计算扩展,在数学和编码任务上验证了性能-计算权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07602 2026-06-09 cs.LG cs.AI 新提交 81%

Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning

面向LEGO空间物理推理的样本高效后训练

Yuhuan Yuan, Zhouliang Yu, Minghao Liu, Weiyang Liu, Ge Lin Kan

机构 * HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZODA

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 针对LLM生成LEGO组装时出现的物理有效但几何语义错位问题,提出基于模型的数据选择方法和样本高效强化学习PVPO,结合体素空间几何奖励,提升结构、语义对齐和物理有效性。

Comments Technical Report V1, 15 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏