arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-10 至 2026-03-10 共收录 196 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 39 篇

2603.07650 2026-03-10 cs.RO 50%

Multi-Agent Off-World Exploration for Sparse Evidence Discovery via Gaussian Belief Mapping and Dual-Domain Coverage

多智能体非世界探索用于稀疏证据发现的高斯信念映射与双域覆盖

Zhuoran Qiao, Tianxin Hu, Thien-Minh Nguyen, Shenghai Yuan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) The University of Queensland(昆士兰大学)

专题命中 规划推理 :planning(abstract)

AI总结 本文提出基于高斯信念映射和双域覆盖的多智能体路径规划框架,用于非世界稀疏证据发现,通过平衡信息获取与操作安全,提升探索效率和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07562 2026-03-10 cs.CV 50%

Brain-WM: Brain Glioblastoma World Model

Brain-WM: 脑部胶质瘤世界模型

Chenhui Wang, Boyun Zheng, Liuxin Bao, Zhihao Peng, Peter Y. M. Woo, Hongming Shan, Yixuan Yuan

专题命中 规划推理 :planning(abstract)

AI总结 Brain-WM通过统一治疗预测与MRI生成,实现了肿瘤与治疗的共进化动态建模,提升了治疗计划的准确率和MRI生成的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06342 2026-03-10 physics.ed-ph 50%

How undergraduate physics students use generative AI for computational modeling

大学物理学生如何利用生成式人工智能进行计算建模

Karl Henrik Fredly, Tor Ole B. Odden, Benjamin M. Zwickl

专题命中 规划推理 :planning(abstract)

AI总结 研究探讨了大学物理学生使用生成式AI进行计算建模的方式,发现其影响包括建模规划、实现和调试,同时指出过度依赖AI带来的挑战及教学改进的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05611 2026-03-10 cs.CV 50%

FLARE: Learning Future-Aware Latent Representations from Vision-Language Models for Autonomous Driving

FLARE: 从视觉-语言模型中学习未来感知的潜在表示以实现自动驾驶

Chengen Xie, Chonghao Sima, Tianyu Li, Bin Sun, Junjie Wu, Zhihui Hao, Hongyang Li

机构 * Shanghai Jiaotong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) OpenDriveLab at The University of Hong Kong(香港大学OpenDrive实验室) Li Auto Inc.(Li汽车公司)

专题命中 规划推理 :planning(abstract)

AI总结 FLARE通过自监督的未来特征预测目标,从大规模未标记数据中学习鲁棒驾驶表示,无需语言监督,提升自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22975 2026-03-10 eess.SY cs.SY 50%

An LLM-Assisted Multi-Agent Control Framework for Roll-to-Roll Manufacturing Systems

用于卷对卷制造系统的基于LLM的多智能体控制框架

Jiachen Li, Shihao Li, Christopher Martin, Zijun Chen, Dongmei Chen, Wei Li

专题命中 规划推理 :planning(abstract)

AI总结 本文提出一种基于LLM的多智能体框架,用于自动化卷对卷制造系统的控制设计与适应,通过五个阶段实现安全、高效的控制性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03758 2026-03-10 eess.IV cs.CV 50%

TransUNet-GradCAM: A Hybrid Transformer-U-Net with Self-Attention and Explainable Visualizations for Foot Ulcer Segmentation

TransUNet-GradCAM: 一种融合自注意力机制和可解释可视化的小说Transformer-U-Net用于足部溃疡分割

Akwasi Asare, Mary Sagoe, Justice Williams Asare, Stephen Edward Moore

专题命中 规划推理 :planning(abstract)

AI总结 TransUNet-GradCAM通过融合自注意力机制和可解释可视化,实现足部溃疡分割的高精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.01358 2026-03-10 cs.MA stat.AP 50%

Agent based decision making for Integrated Air Defense system

基于代理的决策制定用于综合防空系统

Sumanta Kumar Das, Sumant Mukherjee

专题命中 规划推理 :reasoning(abstract)

AI总结 本文提出了一种基于代理的综合防空系统,通过自动检测目标和分配武器实现自主决策,提升网络中心战中的作战效能。

Comments 8 pages,9 figure,2 tables

Journal ref Journal of Battlefield Technology, 2011,vol 14,no 1

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 18 篇

2603.06985 2026-03-10 cs.CV 85%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08007 2026-03-10 cs.CV cs.AI 83%

ViSA-Enhanced Aerial VLN: A Visual-Spatial Reasoning Enhanced Framework for Aerial Vision-Language Navigation

ViSA增强的空中视觉语言导航:一种增强视觉空间推理能力的空中视觉语言导航框架

Haoyu Tong, Xiangyu Dong, Xiaoguang Ma, Haoran Zhao, Yaoming Zhou, Chenghao Lin

机构 * Tianmushan Laboratory, Beihang University(北航之梦实验室,北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(杭州国际创新研究院,北京航空航天大学) Foshan Graduate School of Innovation, Northeastern University(佛山创新研究生学院,东北大学) School of Aeronautic Science and Engineering, Beihang University(航空科学与工程学院,北京航空航天大学) Faculty of Robot Science and Engineering, Northeastern University(机器人科学与工程学院,东北大学)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ViSA增强框架通过结构化视觉提示提升空中VLN的空间推理能力,显著提高成功率,为该领域提供有力支持。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15828 2026-03-10 cs.RO cs.AI 83%

Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning

情境至关重要!利用LLMs进行可行的3D场景规划

Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. Bloisi

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(Sapienza大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 视觉空间推理 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 ContextMatters结合LLMs与经典规划,通过分层目标放松提升3D场景规划的成功率

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09820 2026-03-10 cs.RO cs.AI 83%

ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation

ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航

Mohamed Elnoor, Kasun Weerakoon, Gershom Seneviratne, Jing Liang, Vignesh Rajagopal, Dinesh Manocha

机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09587 2026-03-10 cs.RO 82%

GeoNav: Empowering MLLMs with dual-scale geospatial reasoning for language-goal aerial navigation

GeoNav: 通过双尺度地理推理赋能大语言模型实现语言目标的空中导航

Haotian Xu, Yue Hu, Chen Gao, Zhengqiu Zhu, Yong Zhao, Yong Li, Quanjun Yin

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学) State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) BNRist, Tsinghua University(清华大学BNRist)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 GeoNav通过双尺度地理推理赋能大语言模型,实现语言目标的空中导航,提升城市场景下的导航成功率和精度。

Comments Published in Pattern Recognition (2026)

Journal ref Pattern Recognition, Volume 177, 113365, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06400 2026-03-10 cs.CV 82%

DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation

DivCon:用于文本到图像生成中复杂数值和空间推理的分而治之

Yuhao Jia, Wenhan Tan

机构 * Individual Researcher(独立研究者)

专题命中 视觉空间推理 :reasoning(title,abstract);planning(abstract)

AI总结 DivCon通过分而治之的方法提升文本到图像生成中复杂数值和空间推理的能力,通过分解任务提高布局生成和图像合成的精度与质量。

Comments Accepted to ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 ECAI 2025 pp 4081-4088

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07989 2026-03-10 cs.CV 75%

AutoTraces: Autoregressive Trajectory Forecasting via Multimodal Large Language Models

AutoTraces:通过多模态大语言模型实现自回归轨迹预测

Teng Wang, Yanting Lu, Ruize Wang

机构 * Southeast University(东南大学)

专题命中 视觉空间推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 AutoTraces通过多模态大语言模型实现自回归轨迹预测,采用创新的轨迹标记方案和自动链式推理机制,提升长周期预测精度与跨场景泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08475 2026-03-10 cs.RO cs.AI 70%

R2F: Repurposing Ray Frontiers for LLM-free Object Navigation

R2F:利用射线前沿进行无需大语言模型的对象导航

Francesco Argenziano, John Mark Alexis Marcelo, Michele Brienza, Abdel Hakim Drid, Emanuele Musumeci, Daniele Nardi, Domenico D. Bloisi, Vincenzo Suriani

机构 * Department of Computer, Automation and Management Engineering, Sapienza University of Rome(罗马萨皮恩扎大学计算机、自动化与管理工程系) Department of Electronics and Automation, Mohamed Khider University of Biskra(比斯克拉Mohamed Khider大学电子与自动化系) International University of Rome UNINT, Rome(罗马国际大学UNINT)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 R2F通过重新利用射线前沿技术,开发无需大语言模型的室内开放词汇对象导航框架,实现实时高效导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08113 2026-03-10 cs.CV 67%

SAMoE-VLA: A Scene Adaptive Mixture-of-Experts Vision-Language-Action Model for Autonomous Driving

SAMoE-VLA:一种面向自动驾驶的场景自适应混合专家视觉-语言-动作模型

Zihan You, Hongwei Liu, Chenxu Dang, Zhe Wang, Sining Ang, Aoqi Wang, Yan Wang

机构 * Institute for AI Industry Research (AIR), Tsinghua University(人工智能产业研究院(AIR),清华大学) School of Instrument Science and Engineering, Southeast University(仪器科学与工程学院,东南大学) Zhili College, Tsinghua University(紫荆学院,清华大学) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(人工智能与自动化学院,华中科技大学) Department of Automation, University of Science and Technology of China(自动化学院,中国科学技术大学) Department of Automation, University of Science and Technology Beijing(自动化学院,北京科技大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SAMoE-VLA通过场景自适应混合专家机制提升自动驾驶中的视觉-语言-动作推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06918 2026-03-10 cs.RO 67%

T2Nav Algebraic Topology Aware Temporal Graph Memory and Loop Detection for ZeroShot Visual Navigation

T2Nav 基于代数拓扑的时序图记忆与循环检测用于零样本视觉导航

Quang-Anh N. D., Duc Pham, Minh-Anh Nguyen, Tung Doan, Tuan Dang

机构 * International School, Vietnam National University, Hanoi, Vietnam(越南国家大学河内国际学校) Hanoi University of Science, Vietnam National University, Hanoi, Vietnam(越南国家大学河内科学大学) Hanoi University of Science and Technology, Hanoi, Vietnam(河内科学技术大学) Cognitive Robotics Lab, Department of Electrical Engineering and Computer Science, University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校电气工程与计算机科学系认知机器人实验室) University of Arkansas, Fayetteville, AR, USA(美国阿肯色大学富尔顿分校)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 T2Nav通过整合异构数据和基于图的推理,实现零样本视觉导航,具备高效探索和路径规划能力,适用于视觉相似但空间不同的目标实例导航。

Journal ref EEE International Conference on Robotics & Automation 2026 (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06914 2026-03-10 cs.RO 67%

SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object Navigation

SysNav:多级系统性合作实现现实世界跨载体物体导航

Haokun Zhu, Zongtai Li, Zihan Liu, Kevin Guo, Zhengzhi Lin, Yuxin Cai, Guofei Chen, Chen Lv, Wenshan Wang, Jean Oh, Ji Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract)

AI总结 SysNav通过多级系统性合作实现现实世界跨载体物体导航,提升复杂环境下的导航效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 62%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07970 2026-03-10 cs.AI 57%

Advancing Automated Algorithm Design via Evolutionary Stagewise Design with LLMs

通过基于大语言模型的进化分阶段设计推进自动化算法设计

Chen Lu, Ke Xue, Chengrui Gao, Yunqi Shi, Siyuan Xu, Mingxuan Yuan, Chao Qian, Zhi-Hua Zhou

机构 * National Key Laboratory for Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) Huawei Noah’s Ark Lab, China(华为诺亚实验室)

专题命中 视觉空间推理 :CoT(abstract);分类 cs.AI

AI总结 本文提出EvoStage方法,通过分阶段进化设计提升自动化算法设计效率,实现超越人类专家和现有LLM方法的性能。

Comments 28 pages, 19 figures and 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06704 2026-03-10 cs.CV cs.LG 57%

On the Generalization Capacities of MLLMs for Spatial Intelligence

关于多模态大语言模型在空间智能中的泛化能力

Gongjie Zhang, Wenhao Li, Quanhao Qian, Jiuniu Wang, Deli Zhao, Shijian Lu, Ran Xu

机构 * DAMO Academy, Alibaba Group(达摩院,阿里巴巴集团) HuPan Lab(虎朋实验室) Nanyang Technological University(南洋理工大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出Camera-Aware MLLM框架,通过注入相机内参、数据增强和蒸馏几何先验,提升多模态大语言模型在空间任务中的泛化能力与鲁棒性。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08497 2026-03-10 cs.CV 50%

Reading $\neq$ Seeing: Diagnosing and Closing the Typography Gap in Vision-Language Models

阅读≠视觉:诊断和缩小视觉语言模型中的字形差距

Heng Zhou, Ao Yu, Li Kang, Yuchen Fan, Yutao Fan, Xiufeng Song, Hejia Geng, Yiran Qin

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文研究了视觉语言模型在字形识别上的不足,发现字体风格检测能力差,通过微调提升模型性能,揭示训练数据缺失问题,并提出需架构创新以改进关系性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08086 2026-03-10 cs.CV 50%

From Reactive to Map-Based AI: Tuned Local LLMs for Semantic Zone Inference in Object-Goal Navigation

从反应式到基于地图的AI:针对目标导航的语义区域推断的调优本地LLM

Yudai Noda, Kanji Tanaka

机构 * Graduate School of Engineering, University of Fukui(福井大学工学研究科)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种基于地图的AI方法,利用调优的本地LLM进行语义区域推断,以提升对象-目标导航任务中的成功率和路径效率。

Comments 6 pages, 5 figures, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07660 2026-03-10 cs.CV 50%

Holi-Spatial: Evolving Video Streams into Holistic 3D Spatial Intelligence

Holi-Spatial: 将视频流转化为整体3D空间智能

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao, Fangfu Liu, Manyuan Zhang, Yuchen Yang, Dan Xu, Xue Yang, Huaxi Huang, Hongjie Zhang, Ziwei Liu, Xiao Sun, Dingwen Zhang, Zhihang Zhong

机构 * Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Nanyang Technological University(南洋理工大学) Beihang University(北京航空航天大学) Sichuan University(四川大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 Holi-Spatial通过自动化方法构建大规模多模态3D空间数据集,提升空间推理任务的模型性能。

Comments project page: https://visionary-laboratory.github.io/holi-spatial/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07624 2026-03-10 cs.RO 50%

GeoLoco: Leveraging 3D Geometric Priors from Visual Foundation Model for Robust RGB-Only Humanoid Locomotion

GeoLoco: 利用视觉基础模型中的3D几何先验实现稳健的纯RGB人形机器人运动

Yufei Liu, Xieyuanli Chen, Hainan Pan, Chenghao Shi, Yanjie Chen, Kaihong Huang, Zhiwen Zeng, Huimin Lu

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 GeoLoco通过利用视觉基础模型的3D几何先验,实现纯RGB驱动的人形机器人稳健运动,解决仿真到现实迁移难题。

Comments 8 pages, 6 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 15 篇

2603.07197 2026-03-10 cs.AI 87%

$\textbf{Re}^{2}$: Unlocking LLM Reasoning via Reinforcement Learning with Re-solving

Re²:通过强化学习与重解解锁LLM推理

Pinzheng Wang, Shuli Xu, Juntao Li, Yu Luo, Dong Li, Jianye Hao, Min Zhang

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);test-time compute(abstract)

AI总结 Re²通过强化学习与重解方法,使LLM能够灵活放弃无效推理路径并重新开始,从而提升推理性能和测试效率。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 85%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 测试时计算 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07159 2026-03-10 cs.AI 83%

Improving reasoning at inference time via uncertainty minimisation

通过不确定性最小化提升推理时间的推理能力

Nicolas Legrand, Kenneth Enevoldsen, Márton Kardos, Kristoffer Nielbo

机构 * Aarhus University(奥胡斯大学)

专题命中 测试时计算 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 通过在单个思想层面最大化自我确定性,提升推理能力并实现高效推理时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07725 2026-03-10 cs.IR 82%

Verifiable Reasoning for LLM-based Generative Recommendation

基于LLM的生成推荐的可验证推理

Xinyu Lin, Hanqing Zeng, Hanchao Yu, Yinglong Xia, Jiang Zhang, Aashu Singh, Fei Liu, Wenjie Wang, Fuli Feng, Tat-Seng Chua, Qifan Wang

专题命中 测试时计算 :reasoning(title,abstract);verifier(abstract)

AI总结 VRec通过引入推理-验证-推荐范式,提升LLM生成推荐的准确性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07494 2026-03-10 cs.CV 82%

DocCogito: Aligning Layout Cognition and Step-Level Grounded Reasoning for Document Understanding

DocCogito: 对齐布局认知与分步 grounded 推理以实现文档理解

Yuchuan Wu, Minghan Zhuo, Teng Fu, Mengyang Zhao, Bin Li, Xiangyang Xue

机构 * Fudan University(复旦大学)

专题命中 测试时计算 :reasoning(title,abstract);CoT(abstract)

AI总结 DocCogito通过整合布局感知与结构化推理,提升文档理解的准确性和推理过程的系统性。

详情

展开后加载摘要…

URL PDF HTML 收藏