arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-25 至 2026-03-25 共收录 104 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 7 篇

2603.22871 2026-03-25 cs.AI cs.LG math.DS 81%

Dynamical Systems Theory Behind a Hierarchical Reasoning Model

层次推理模型背后的动力系统理论

Vasiliy A. Es'kin, Mikhail E. Smorkalov

机构 * Department of Radiophysics, University of Nizhny Novgorod(尼日尼诺夫戈罗德大学无线电物理系) Huawei Nizhny Novgorod Research Center(华为尼日尼诺夫戈罗德研究中心) Skolkovo Institute of Science and Technology(斯克洛科夫科学与技术研究院)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出Contraction Mapping Model,通过将离散递归推理转化为连续的NODEs/NSDEs,提供数学严谨且稳定的推理引擎,在Sudoku-Extreme基准测试中取得93.7%的准确率,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21289 2026-03-25 cs.CV cs.AI 79%

When Models Judge Themselves: Unsupervised Self-Evolution for Multimodal Reasoning

当模型自我评判:多模态推理的无监督自进化

Zhengxian Wu, Kai Shi, Chuanrui Zhang, Zirui Liao, Jun Yang, Ni Yang, Qiuying Peng, Luyuan Zhang, Hangrui Xu, Tianhuang Su, Zhenyu Yang, Haonan Lu, Haoqian Wang

机构 * OPPO AI Center(OPPO人工智能中心) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Hefei University of Technology(合肥工业大学)

专题命中 数学推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种无监督自进化框架,通过自一致性信号和动态调节机制,在无需人工标注或外部奖励模型的情况下提升多模态推理性能。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23414 2026-03-25 cs.LG cs.AI 73%

SortedRL: Accelerating RL Training for LLMs through Online Length-Aware Scheduling

SortedRL: 通过在线长度感知调度加速大语言模型的强化学习训练

Yiqi Zhang, Huiqiang Jiang, Xufang Luo, Zhihe Yang, Chengruidong Zhang, Yifei Shen, Dongsheng Li, Yuqing Yang, Lili Qiu, Yang You

机构 * National University of Singapore(新加坡国立大学) Microsoft Research Asia(微软亚洲研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 数学推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 SortedRL通过在线长度感知调度策略提升大语言模型强化学习训练效率,减少训练气泡比例并提升性能,实验表明在不同任务中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23004 2026-03-25 cs.AI cs.LG 62%

Can Large Language Models Reason and Optimize Under Constraints?

大型语言模型能否在约束下进行推理和优化?

Fabien Bernier, Salah Ghamizi, Pantelis Dogoulis, Maxime Cordy

机构 * SnT – University of Luxembourg(卢森堡大学SnT分校) Luxembourg Institute of Health (LIH)(卢森堡健康研究院)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了大型语言模型在最优功率流问题物理和操作约束下的推理与优化能力,发现现有模型在多数任务中表现不足,揭示了LLM在约束下结构推理的关键差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17074 2026-03-25 cs.LG 57%

PRISM: Demystifying Retention and Interaction in Mid-Training

PRISM:解开中期训练中保留与交互的谜团

Bharat Runwal, Ashish Agrawal, Anurag Roy, Rameswar Panda

机构 * IBM Research, MIT-IBM Watson AI Lab(IBM研究院,MIT-IBM沃森人工智能实验室)

专题命中 数学推理 :reasoning(abstract);分类 cs.LG

AI总结 PRISM通过七种基础模型的受控实验,发现中期训练能显著提升数学、代码和科学基准测试成绩,同时保持整体性能,且数据组成比强化学习更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02050 2026-03-25 cs.AI cs.SE 57%

Rethinking the Role of Entropy in Optimizing Tool-Use Behaviors for Large Language Model Agents

重新思考熵在优化大语言模型代理工具使用行为中的作用

Zeping Li, Hongru Wang, Yiwen Zhao, Guanhua Chen, Yixia Li, Keyang Chen, Yixin Cao, Guangnan Ye, Hongfeng Chai, Zhenfei Yin

机构 * Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Oxford University(牛津大学) Haven

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文通过熵基实验发现熵减与高质量工具调用正相关,提出两种奖励策略优化工具使用行为,实验表明熵减可提升代理适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22363 2026-03-25 cs.SE cs.AI 57%

Early Discoveries of Algorithmist I: Promise of Provable Algorithm Synthesis at Scale

算法主义I:大规模可证明算法合成的前景

Janardhan Kulkarni

机构 * Microsoft(微软)

专题命中 数学推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过LLM生成可证明的算法,结合理论与实践,展示Algorithmist在隐私、近似和可解释性任务中的有效算法生成与验证。

Comments 75 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 代码与定理证明 2 篇

2603.23470 2026-03-25 cs.SE 78%

ConceptCoder: Improve Code Reasoning via Concept Learning

ConceptCoder: 通过概念学习提升代码推理

Md Mahbubur Rahman, Hengbo Tong, Wei Le

专题命中 代码与定理证明 :reasoning(title,abstract)

AI总结 ConceptCoder通过学习代码概念提升代码推理能力,在漏洞检测任务中显著提高F1值,优于现有方法,并扩展至分支预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01969 2026-03-25 cs.CV cs.AI 57%

Mitigating Object Hallucinations in Large Vision-Language Models via Attention Calibration

通过注意力校准缓解大视觉-语言模型中的物体幻觉

Younan Zhu, Linwei Tao, Minjing Dong, Chang Xu

专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI

AI总结 本文提出动态注意力校准方法,通过对比学习动态强制位置不变性,有效缓解大视觉-语言模型中的物体幻觉问题,并在多个基准测试中取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 逻辑推理 3 篇

2603.22289 2026-03-25 cs.CL cs.AI 79%

MERIT: Memory-Enhanced Retrieval for Interpretable Knowledge Tracing

MERIT: 用于可解释知识追踪的记忆增强检索

Runze Li, Kedi Chen, Guwei Feng, Mo Yu, Jun Wang, Wei Zhang

机构 * School of Computer Science and Technology, East China Normal University(东华师范大学计算机科学与技术学院) Shanghai Innovation Institute(上海创新研究院) WeChat AI, Tencent(微信AI,腾讯)

专题命中 逻辑推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 MERIT提出一种无需训练的框架,结合冻结LLM推理与结构化教学记忆,通过语义去噪将学生分类为潜在认知模式,并构建模式库生成显式推理依据,提升教育诊断的可解释性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07315 2026-03-25 cs.MA cs.AI cs.AR 57%

VLM-CAD: VLM-Optimized Collaborative Agent Design Workflow for Analog Circuit Sizing

VLM-CAD:面向模拟电路尺寸设计的VLM优化协作代理设计流程

Guanyuan Pan, Shuai Wang, Yugui Lin, Tiansheng Zhou, Pietro Liò, Zhenxin Zhao, Yaqi Wang

机构 * Hangzhou Dianzi University(杭州电子科技大学) SCBC, Guangdong University of Foreign Studies(广东外语外贸大学) University of Cambridge(剑桥大学)

专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VLM-CAD流程,通过神经符号结构解析模块和ExTuRBO方法提升多模态推理的鲁棒性和可解释性,实验表明其在模拟电路设计中具有高准确性和低功耗。

Comments submitted to the 34th ACM International Conference on Multimedia (ACMMM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22708 2026-03-25 cs.DB 50%

Why Database Manuals Are Not Enough: Efficient and Reliable Configuration Tuning for DBMSs via Code-Driven LLM Agents

为何数据库手册不够:通过代码驱动的LLM代理实现DBMS的高效可靠配置调优

Xinyi Zhang, Tiantian Chen, Zhentao Han, Zhaoyan Hong, Wei Lu, Sheng Wang, Mo Sha, Anni Wang, Shuang Liu, Yakun Zhang, Feifei Li, Xiaoyong Du

专题命中 逻辑推理 :reasoning(abstract)

AI总结 本文提出SysInsight系统,通过代码分析和LLM推理从DBMS源代码中提取细粒度调优知识,加速稳定调优过程,实现7.11倍更快收敛和19.9%性能提升。

Comments Accepted by VLDB 2026

Journal ref VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 规划推理 13 篇

2603.21376 2026-03-25 cs.AI 83%

A transformer architecture alteration to incentivise externalised reasoning

一种变换器架构的修改以激励外部化推理

Elizabeth Pavlova, Mariia Koroliuk, Karthik Viswanathan, Cameron Tice, Edward James Young, Puria Radmard

机构 * MARS University of Amsterdam(阿姆斯特丹大学) Geodesic Research

专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一种变换器架构修改和训练流程,使大语言模型更倾向于产生详细推理。通过在中间层加入早退机制,训练模型在预测下一个token时提前退出计算,从而减少冗余计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22856 2026-03-25 eess.IV 82%

Retrieval-Guided Photovoltaic Inventory Estimation from Satellite Imagery for Distribution Grid Planning

基于卫星图像的检索引导光伏库存估计用于配电网规划

Muhao Guo, Lihao Mai, Erik Blasch, Jafarali Parol, Turki Rakan, Yang Weng

专题命中 规划推理 :planning(title,abstract);reasoning(abstract)

AI总结 本文提出Solar-RAG框架,通过图像检索与多模态视觉语言推理结合,提升光伏部署估计的鲁棒性,减少配电网规划中的电压偏差和承载能力误差。

Comments 38 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20502 2026-03-25 cs.CL cs.AI 81%

MARS: toward more efficient multi-agent collaboration for LLM reasoning

MARS:迈向更高效的多智能体协作以提升大语言模型推理

Xiao Wang, Jia Wang, Yijie Wang, Pengtao Dang, Sha Cao, Chi Zhang

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Oregon Health & Science University(俄勒冈健康与科学大学)

专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS框架,通过角色化协作提升LLM推理能力,相比MAD等方法,在多个基准测试中实现准确率相当但token消耗和推理时间减少约50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06796 2026-03-25 cs.RO 78%

db-LaCAM: Fast and Scalable Multi-Robot Kinodynamic Motion Planning with Discontinuity-Bounded Search and Lightweight MAPF

db-LaCAM:基于断点有界的快速可扩展多机器人运动规划与轻量级MAPF

Akmaral Moldagalieva, Keisuke Okumura, Amanda Prorok, Wolfgang Hönig

专题命中 规划推理 :planning(title,abstract)

AI总结 本文提出db-LaCAM,结合现代MAPF算法的高效性和 kinodynamic 规划器的动态感知能力,通过预计算的运动原语生成运动序列,实现高效多机器人运动规划,实验表明其在50个机器人场景中运行速度提升十倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23271 2026-03-25 cs.RO cs.AI 70%

A Multimodal Framework for Human-Multi-Agent Interaction

人-多智能体交互的多模态框架

Shaid Hasan, Breenice Lee, Sujan Sarker, Tariq Iqbal

机构 * University of Virginia(弗吉尼亚大学)

专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出一个多模态框架,用于人与多智能体交互,通过集成多模态感知和大语言模型驱动的规划,实现自主认知代理的协调决策,解决现有系统在统一框架下整合多模态感知、具身表达和协同决策的难题。

Comments 4 pages, 3 figures. Accepted at ACM/IEEE HRI 2026 Workshop (MAgicS-HRI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14967 2026-03-25 cs.CL cs.AI cs.LG 67%

Information Gain-based Policy Optimization: A Simple and Effective Approach for Multi-Turn Search Agents

基于信息增益的策略优化:一种用于多轮搜索代理的简单而有效的方法

Guoqing Wang, Sunhao Dai, Guangze Ye, Zeyu Gan, Wei Yao, Yong Deng, Xiaofeng Wu, Zhenzhe Ying

机构 * Venus Team, Ant Group(蚂蚁集团 Venus 团队) Renmin University of China(中国人民大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于信息增益的策略优化框架,通过密集内在监督提升多轮代理训练效果,实验表明其在多轮场景中优于现有方法,准确性和数据效率更高。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22293 2026-03-25 cs.CL cs.AI cs.LG 67%

TIPS: Turn-Level Information-Potential Reward Shaping for Search-Augmented LLMs

TIPS: 用于搜索增强的大语言模型的回合级信息潜力奖励塑造

Yutao Xie, Nathaniel Thomas, Nicklas Hansen, Yang Fu, Li Erran Li, Xiaolong Wang

机构 * UC San Diego(加州大学圣地亚哥分校) AWS AI(亚马逊人工智能)

专题命中 规划推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TIPS方法,通过回合级信息潜力奖励塑造提升搜索增强LLM的训练稳定性与性能,优于GRPO/PPO基线,在多个问答基准上取得显著提升。

Comments Code: https://github.com/ucsd-wang-lab-lm/tips

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22577 2026-03-25 cs.CR cs.AI cs.MA 57%

STRIATUM-CTF: A Protocol-Driven Agentic Framework for General-Purpose CTF Solving

STRIATUM-CTF: 一种基于协议的代理框架用于通用CTF求解

James Hugglestone, Samuel Jacob Chacko, Dawson Stoller, Ryan Schmidt, Xiuwen Liu

机构 * Department of Computer Science, Florida State University, Tallahassee, USA(计算机科学系,佛罗里达州立大学,塔拉萨斯,美国)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出STRIATUM-CTF框架,通过Model Context Protocol标准化工具接口,提升CTF求解的自主性和适应性,在真实竞赛中取得第一名。

Comments 8 pages, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21597 2026-03-25 cs.AI cs.CV 57%

Cerebra: A Multidisciplinary AI Board for Multimodal Dementia Characterization and Risk Assessment

Cerebra:一个多学科AI平台用于多模态痴呆症特征化和风险评估

Sheng Liu, Long Chen, Zeyun Zhao, Qinglin Gou, Qingyue Wei, Arjun Masurkar, Kevin M. Spiegler, Philip Kuball, Stefania C. Bray, Megan Bernath, Deanna R. Willis, Jiang Bian, Lei Xing, Eric Topol, Kyunghyun Cho, Yu Huang, Ruogu Fang, Narges Razavian, James Zou

机构 * Department of Biomedical Data Science, Stanford University(斯坦福大学生物医学数据科学系) Department of Radiation Oncology, Stanford University(斯坦福大学放射肿瘤科) Center for Data Science, New York University(纽约大学数据科学中心) J. Crayton Pruitt Family Department of Biomedical Engineering, University of Florida(佛罗里达大学杰·克雷顿·普瑞特家庭生物医学工程系) Department of Biomedical Engineering and Informatics, Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校生物医学工程与信息学系) Department of Neurology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科) Department of Neuroscience, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院神经科学系) UF Health Family Medicine – Haile Plantation(佛罗里达大学健康家庭医学-海莱种植园) Department of Family Medicine, Indiana University School of Medicine(印第安纳大学医学院家庭医学系) Department of Biostatistics and Health Data Science, Indiana University School of Medicine(印第安纳大学医学院生物统计学与健康数据科学系) Scripps Research Translational Institute(斯克里普斯研究转化研究所) Courant Institute, New York University(纽约大学柯朗研究所) Center for Biomedical Informatics, Regenstrief Institute(再生斯蒂夫研究所生物医学信息中心) Center for Cognitive Aging and Memory, McKnight Brain Institute, University of Florida(佛罗里达大学麦金托神经研究所认知衰老与记忆中心) Population Health Department, NYU Langone Health(纽约大学兰戈恩健康人口健康部) Radiology Department, NYU Langone Health(纽约大学兰戈恩健康放射科)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 Cerebra通过多智能体协调处理电子病历、临床笔记和医学影像,提供可视化分析和对话界面,提升临床决策支持的可解释性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22060 2026-03-25 cs.CV cs.AI 57%

Vision-DeepResearch: Incentivizing DeepResearch Capability in Multimodal Large Language Models

Vision-DeepResearch: 促进多模态大语言模型中的深度研究能力

Wenxuan Huang, Yu Zeng, Qiuchen Wang, Zhen Fang, Shaosheng Cao, Zheng Chu, Qingyu Yin, Shuang Chen, Zhenfei Yin, Lin Chen, Zehui Chen, Xu Tang, Yao Hu, Shaohui Lin, Philip Torr, Feng Zhao, Wanli Ouyang

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出Vision-DeepResearch,通过多轮、多实体和多尺度的视觉与文本搜索,提升多模态大语言模型在噪声环境下的深度研究能力,实现更高效的多模态深度研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23344 2026-03-25 cs.CV 50%

An Explainable AI-Driven Framework for Automated Brain Tumor Segmentation Using an Attention-Enhanced U-Net

基于可解释AI的自动化脑肿瘤分割框架:使用增强注意力的U-Net

MD Rashidul Islam, Bakary Gibba

机构 * School of Computing and Informatics(计算机与信息学学院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于增强注意力U-Net的框架,利用BraTS 2020数据集进行脑肿瘤分割,通过自定义损失函数和可解释AI提升分割精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23079 2026-03-25 cs.RO 50%

AirSimAG: A High-Fidelity Simulation Platform for Air-Ground Collaborative Robotics

AirSimAG:一种高保真空地协同机器人仿真平台

Yangjie Cui, Xin Dong, Boyang Gao, Jinwu Xiang, Daochun Li, Zhan Tu

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院) Institution of Unmanned System, Beihang University(北京航空航天大学无人系统研究院)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出AirSimAG,一种高保真的空地协同机器人仿真平台,支持多智能体同步仿真和异构传感控制接口,通过多个代表性任务验证其在多智能体协调和跨模态数据一致性方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22866 2026-03-25 cs.IT math.IT 50%

Aerial Agentic AI: Synergizing LLM and SLM for Low-Altitude Wireless Networks

空域代理AI:融合LLM和SLM用于低空无线网络

Li Dong, Feibo Jiang, Kezhi Wang, Cunhua Pan, Dong In Kim, Ekram Hossain

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出空域代理AI框架,通过融合小型语言模型和大型语言模型,解决低空无线网络中的计算、通信和实时性冲突问题,实现高效协同与决策优化。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 视觉空间推理 13 篇

2603.22847 2026-03-25 cs.CV 85%

Rethinking Token-Level Policy Optimization for Multimodal Chain-of-Thought

重新思考多模态链式推理的令牌级策略优化

Yunheng Li, Hangyi Kuang, Hengrui Zhang, Jiangxia Cao, Zhaojie Liu, Qibin Hou, Ming-Ming Cheng

机构 * VCIP, School of Computer Science, Nankai University(VCIP,计算机科学学院,南开大学)

专题命中 视觉空间推理 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract)

AI总结 本文提出PEPO方法,通过令牌级分析多模态推理轨迹,结合感知先验和熵整合机制,提升多模态推理性能,实验显示在多种基准上优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22641 2026-03-25 cs.CV 85%

Q-Tacit: Image Quality Assessment via Latent Visual Reasoning

Q-Tacit: 通过潜在视觉推理进行图像质量评估

Yuxuan Jiang, Yixuan Li, Hanwei Zhu, Siyue Teng, Fan Zhang, David Bull

机构 * Visual Information Lab, University of Bristol(布里斯托大学视觉信息实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出Q-Tacit方法,通过在潜在质量空间中超越自然语言进行视觉推理,提升图像质量评估效果,实验表明其在更少token下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02487 2026-03-25 cs.CV cs.AI 79%

Masking Matters: Unlocking the Spatial Reasoning Capabilities of LLMs for 3D Scene-Language Understanding

掩码至关重要:解锁LLMs的三维场景-语言理解的空间推理能力

Yerim Jeon, Miso Lee, WonJun Moon, Jae-Pil Heo

机构 * Sungkyunkwan University(庆尚国立大学)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出3D-SLIM掩码策略,通过适应性注意力掩码提升LLMs在三维场景-语言理解中的空间推理能力,解决传统因果掩码导致的顺序偏差和注意力受限问题。

Comments Accepted to CVPR 2026. GitHub Page: https://github.com/Jyerim/3D-SLIM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23023 2026-03-25 cs.CV 78%

Cog3DMap: Multi-View Vision-Language Reasoning with 3D Cognitive Maps

Cog3DMap:基于3D认知地图的多视角视觉语言推理

Chanyoung Gwak, Yoonwoo Jeong, Byungwoo Jeon, Hyunseok Lee, Jinwoo Shin, Minsu Cho

机构 * POSTECH KAIST(韩国科学技术院) RLWRLD

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 本文提出Cog3DMap框架,通过构建显式的3D记忆,使多视角图像中的每个token都具备语义和几何信息,从而提升多模态大语言模型的空间推理能力。

Comments Project Page: https://cog3dmap.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22796 2026-03-25 cs.CV cs.AI cs.RO 77%

PhotoAgent: A Robotic Photographer with Spatial and Aesthetic Understanding

PhotoAgent:一种具有空间与审美理解的机器人摄影师

Lirong Che, Zhenfeng Gan, Yanbo Chen, Junbo Tan, Xueqian Wang

机构 * Center for Artificial Intelligence and Robotics, Shenzhen International Graduate School, Tsinghua University(人工智能与机器人中心,深圳国际研究生院,清华大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 PhotoAgent通过整合大多模态模型与新型控制范式,将主观审美目标转化为几何约束,利用内部视觉模拟实现快速收敛于高质量图像结果。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏