arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-25 至 2026-03-25 共收录 104 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 13 篇

2603.23447 2026-03-25 cs.CV cs.AI 70%

3DCity-LLM: Empowering Multi-modality Large Language Models for 3D City-scale Perception and Understanding

3DCity-LLM:赋能多模态大语言模型进行3D城市级感知与理解

Yiping Chen, Jinpeng Li, Wenyu Ke, Yang Luo, Jie Ouyang, Zhongjie He, Li Liu, Hongchao Fan, Hao Wu

机构 * School of Geospatial Engineering and Science(测绘工程与科学学院) Sun Yat-sen University(中山大学) College of Electronic Science(电子科学学院) National University of Defense Technology(国防科技大学) Department of Civil and Environmental Engineering(土木与环境工程系) Norwegian University of Science and Technology(挪威科技大学) National Geomatics Center of China(中国国家测绘地理信息中心)

专题命中 视觉空间推理 :reasoning(abstract);planning(abstract);分类 cs.AI

AI总结 本文提出3DCity-LLM框架,通过粗到细的特征编码策略和120万高质量数据集,提升城市级多模态感知与理解能力,实验表明其在空间推理和城市智能方面优于现有方法。

Comments 24 pages, 11 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17112 2026-03-25 cs.AI cs.LG 62%

Cascade-Aware Multi-Agent Routing: Spatio-Temporal Sidecars and Geometry-Switching

级联感知多智能体路由:时空侧车与几何切换

Davide Di Gioia

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出时空侧车模型,通过结合欧几里得和双曲评分器,解决路由几何结构感知问题,提升调度器在不同拓扑下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23478 2026-03-25 cs.CV 50%

UniFunc3D: Unified Active Spatial-Temporal Grounding for 3D Functionality Segmentation

UniFunc3D: 统一的主动空间-时间接地用于3D功能分割

Jiaying Lin, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 UniFunc3D通过统一框架实现3D场景功能分割,利用多模态大语言模型作为主动观察者,结合语义、时间和空间推理,提升任务分解的准确性与效率,实现优于其他方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23390 2026-03-25 cs.CV eess.IV 50%

Harnessing Lightweight Transformer with Contextual Synergic Enhancement for Efficient 3D Medical Image Segmentation

利用轻量级Transformer与上下文协同增强进行高效的3D医学图像分割

Xinyu Liu, Zhen Chen, Wuyang Li, Chenxin Li, Yixuan Yuan

机构 * Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR(电子工程系,香港中文大学(深圳)Hong Kong SAR) Centre for Artificial Intelligence and Robotics (CAIR), Hong Kong Institute of Science & Innovation, Chinese Academy of Sciences, Hong Kong SAR(人工智能与机器人中心(CAIR),香港科学与创新研究院,中国科学院,Hong Kong SAR)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Light-UNETR,通过轻量级维度缩减注意力模块和紧凑门控线性单元提升模型效率,结合上下文协同增强策略提高数据效率,在少量标注数据下实现高效3D医学图像分割。

Comments Accepted to IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23370 2026-03-25 cs.CV 50%

Object Pose Transformer: Unifying Unseen Object Pose Estimation

物体姿态转换器:统一未见物体姿态估计

Weihang Li, Lorenzo Garattoni, Fabien Despinoy, Nassir Navab, Benjamin Busam

机构 * Technical University of Munich(慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Toyota Motor Europe(丰田欧洲公司)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出Object Pose Transformer,通过任务分解统一解决未见实例姿态估计问题,同时预测深度、点云图、相机参数和归一化物体坐标,实现类别级绝对姿态和未见物体相对姿态估计。

Comments Project Page: https://colin-de.github.io/OPT-Pose/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22903 2026-03-25 cs.RO 50%

Task-Aware Positioning for Improvisational Tasks in Mobile Construction Robots via an AI Agent with Multi-LMM Modules

面向即兴任务的移动建筑机器人AI代理的定位任务感知

Seongju Jang, Francis Baek, SangHyun Lee

机构 * University of Michigan(密歇根大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出一种AI代理,通过多LMM模块实现对自然语言描述的即兴任务的理解与定位,使移动建筑机器人能自主完成非预定义任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22800 2026-03-25 cs.RO 50%

CATNAV: Cached Vision-Language Traversability for Efficient Zero-Shot Robot Navigation

CATNAV:基于缓存的视觉-语言可 traversability 用于高效零样本机器人导航

Aditya Potnis, Francisco Affonso, Shreya Gummadi, Naveen Kumar Uppalapati, Girish Chowdhary

机构 * Field Robotics Engineering and Science Hub (FRESH)(田纳西机器人工程与科学中心(FRESH))

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CATNAV通过多模态LLM生成零样本、体态感知的成本图,利用视觉语义缓存机制减少85.7%的在线VLM查询,结合基于VLM的轨迹选择模块,在五项导航任务中实现更高的目标到达率和更少的行为约束违规。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22706 2026-03-25 cs.CV cs.SE 50%

How Far Can VLMs Go for Visual Bug Detection? Studying 19,738 Keyframes from 41 Hours of Gameplay Videos

VLMs在视觉缺陷检测中能走多远?研究41小时游戏录像中的19,738个关键帧

Wentao Lu, Alexander Senchenko, Alan Sayle, Abram Hindle, Cor-Paul Bezemer

机构 * University of Alberta(阿尔伯塔大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究通过分析41小时游戏录像中的19,738个关键帧,评估VLMs在实际场景中检测视觉缺陷的能力,发现其性能有限,需结合混合方法提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 5 篇

2603.23128 2026-03-25 cs.IT math.IT 79%

Agentic Verifier-in-the-Loop Solver Orchestration for Cell-Free Massive MIMO Downlink Power Control

代理验证在回路求解器协调 for 无细胞大规模MIMO下行功率控制

Zhichao Gao

专题命中 测试时计算 :verifier(title,abstract)

AI总结 本文提出VISO-PC框架,通过代理在求解器间路由以优化无细胞大规模MIMO下行功率控制,提升公平性并减少运行时间。

Comments This is the version 1. 6 pages, 5 figures, 4 tables. This paper presents a agentic verifier-aware orchestration formulation for cell-free massive MIMO power control

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22784 2026-03-25 cs.LG 70%

Caterpillar of Thoughts: The Optimal Test-Time Algorithm for Large Language Models

思维 caterpillar:大型语言模型的最优测试时间算法

Amir Azarmehr, Soheil Behnezhad, Alma Ghafari

机构 * Northeastern University(东北大学)

专题命中 测试时计算 :chain-of-thought(abstract);CoT(abstract);分类 cs.LG

AI总结 本文提出Caterpillar of Thoughts算法,通过理论分析证明最优算法生成caterpillar树,从而减少生成次数并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22446 2026-03-25 cs.CL cs.AI cs.LG 67%

Sparse but Critical: A Token-Level Analysis of Distributional Shifts in RLVR Fine-Tuning of LLMs

稀疏但关键:RLVR微调中LLMs分布偏移的token级分析

Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang, Guoyin Wang, Bolin Ding, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过token级分析揭示RLVR微调中分布偏移的机制,发现微调导致稀疏且针对性强的token分布变化,通过交叉采样实验验证了少量token决策对性能提升的关键作用。

Comments Published as a conference paper at the International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22386 2026-03-25 cs.AI cs.CL 62%

From Static Templates to Dynamic Runtime Graphs: A Survey of Workflow Optimization for LLM Agents

从静态模板到动态运行时图:LLM代理工作流优化的综述

Ling Yue, Kushal Raj Bhandari, Ching-Yun Ko, Dhaval Patel, Shuxin Lin, Nianjun Zhou, Jianxi Gao, Pin-Yu Chen, Shaowu Pan

机构 * Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系) IBM Research(IBM研究院) Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(伦斯勒理工学院机械、航空航天与核工程系)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了LLM代理工作流优化方法,区分静态与动态方法,探讨结构确定时间、优化部分及评估信号,提出结构感知评估视角以提升可比性和可复现性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23346 2026-03-25 cs.AI 57%

RelayS2S: A Dual-Path Speculative Generation for Real-Time Dialogue

RelayS2S: 一种双路径推测生成用于实时对话

Long Mai

机构 * Trinity College Dublin(都柏林三一学院) University College Dublin(都柏林大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI

AI总结 RelayS2S通过双路径架构平衡实时对话中的延迟与响应质量,利用快速路径生成低延迟音频起始,慢路径生成高质量延续,通过轻量验证器实现无缝切换。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 14 篇

2603.22942 2026-03-25 cs.AI 85%

Optimizing Small Language Models for NL2SQL via Chain-of-Thought Fine-Tuning

通过链式思维微调优化小型语言模型用于自然语言到SQL转换

Anshul Solanki, Sanchit Latawa, Koushik Chakraborty, Navneet Kamboj

专题命中 复杂问题求解 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.AI

AI总结 本文通过链式思维微调优化小型语言模型,发现小型模型在NL2SQL任务中表现优于大型模型,显著提升准确率并降低成本。

Comments 9 pages , 3 fifures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21732 2026-03-25 cs.CL cs.AI 81%

HUMORCHAIN: Theory-Guided Multi-Stage Reasoning for Interpretable Multimodal Humor Generation

HUMORCHAIN: 基于理论的多阶段推理用于可解释的多模态幽默生成

Jiajun Zhang, Shijia Luo, Ruikang Zhang, Qi Su

机构 * Peking University(北京大学) Ocean University of China(海洋大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出HUMORCHAIN框架,通过整合视觉语义解析、基于幽默和心理学的推理及细调判别器,实现可解释的多模态幽默生成,实验表明其在人类幽默偏好、Elo/BT评分和语义多样性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22754 2026-03-25 cs.CL 79%

PRISM: A Dual View of LLM Reasoning through Semantic Flow and Latent Computation

PRISM:通过语义流和潜在计算双重视角分析LLM推理

Ruidi Chang, Jiawei Zhou, Hanjie Chen

机构 * Rice University(里士大学) Stony Brook University(石溪大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 PRISM通过同时分析推理步骤和层的语义流与潜在计算,揭示LLM推理过程中的系统性模式,展示失败轨迹易陷入无效验证循环并转向不同模式,为分析LLM推理过程提供实用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17963 2026-03-25 cs.CL 79%

Extracting and Following Paths for Robust Relational Reasoning with Large Language Models

基于大语言模型的稳健关系推理路径提取与追踪

Ge Zhang, Mohammad Ali Alomrani, Hongjian Gu, Jiaming Zhou, Yaochen Hu, Bin Wang, Qun Liu, Mark Coates, Yingxue Zhang, Jianye Hao

机构 * Huawei Technologies Canada(华为技术加拿大公司) Huawei Technologies(华为技术) McGill University(麦吉尔大学) Mila - Québec AI Institute(魁北克人工智能研究所)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Path-of-Thoughts框架,通过图提取、路径识别和推理三个阶段解决关系推理问题,在四个数据集上超越现有方法,无需微调或大量LLM调用,且对LLM提取错误和输入模糊更具鲁棒性。

Journal ref Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22294 2026-03-25 cs.LG cs.AI 76%

Efficient Embedding-based Synthetic Data Generation for Complex Reasoning Tasks

高效嵌入式合成数据生成用于复杂推理任务

Srideepika Jayaraman, Achille Fokoue, Dhaval Patel, Jayant Kalagnanam

机构 * IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于嵌入的合成数据生成方法,通过增强数据多样性提升多个基准的性能,分析嵌入空间中数据分布与预测准确性之间的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23495 2026-03-25 cs.CV cs.AI cs.LG 62%

VISion On Request: Enhanced VLLM efficiency with sparse, dynamically selected, vision-language interactions

VISion On Request: 基于稀疏、动态选择的视觉-语言交互提升大模型效率

Adrian Bulat, Alberto Baldrati, Ioannis Maniadis Metaxas, Yassine Ouali, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星AI剑桥实验室) Technical University of Iasi(伊阿斯技术大学) Queen Mary University of London(伦敦女王玛丽大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VISOR通过稀疏化视觉-语言交互提升大模型效率,无需丢弃视觉信息,动态分配计算资源,实验表明在多样基准和挑战任务中性能优异。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18788 2026-03-25 cs.CL cs.AI 62%

Mi:dm K 2.5 Pro

KT Tech innovation Group

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05486 2026-03-25 cs.CL cs.AI 62%

The Token Tax: Systematic Bias in Multilingual Tokenization

令牌税:多语言令牌化中的系统性偏差

Jessica M. Lundin, Ada Zhang, Nihal Karim, Hamza Louzan, Victor Wei, David Adelani, Cody Carroll

机构 * Institute for Disease Modeling(疾病建模研究所) Gates Foundation(盖茨基金会) University of San Francisco(旧金山大学) McGill University(麦吉尔大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究发现令牌化效率对形态复杂、低资源语言有结构性劣势,影响计算资源和准确性。通过评估10种大语言模型在AfriMMLU数据集上的表现,发现令牌密度与准确性成反比,且推理模型在多语言任务中表现更优,揭示了令牌膨胀带来的经济负担。

Journal ref Proceedings of the 7th Workshop on African Natural Language Processing (AfricaNLP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22815 2026-03-25 cs.CV cs.AI 57%

Focus, Don't Prune: Identifying Instruction-Relevant Regions for Information-Rich Image Understanding

聚焦,而非裁剪:识别与指令相关的区域以实现信息丰富的图像理解

Mincheol Kwon, Minseung Lee, Seonga Choi, Miso Choi, Kyeong-Jin Oh, Hyunyoung Lee, Cheonyoung Park, Yongho Song, Seunghyun Park, Jinkyu Kim

机构 * Korea University(韩国大学) KT Corporation(KT公司) Soongsil University(松山大学) Kakao Mobility(Kakao移动)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出PinPoint框架,通过识别与指令相关的图像区域并提取细粒度视觉特征,提升多模态任务的推理效率与准确性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22528 2026-03-25 cs.IR cs.AI 57%

GraphRAG for Engineering Diagrams: ChatP&ID Enables LLM Interaction with P&IDs

GraphRAG用于工程图纸:ChatP&ID实现LLM与P&IDs的交互

Achmad Anggawirya Alimin, Artur M. Schweidtmann

机构 * Process Intelligence Research Group(过程智能研究组) Department of Chemical Engineering(化学工程系) Delft University of Technology(代尔夫特理工大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出ChatP&ID框架,通过GraphRAG实现高效、低成本的P&IDs自然语言交互,提升准确率并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22076 2026-03-25 cs.AI 57%

Hybrid Stackelberg Game and Diffusion-based Auction for Two-tier Agentic AI Task Offloading in Internet of Agents

混合斯塔克伯格博弈与基于扩散的拍卖用于互联网代理中两层代理AI任务卸载

Yue Zhong, Yongju Tong, Jiawen Kang, Minghui Dai, Hong-Ning Dai, Zhou Su, Dusit Niyato

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 本文提出一种两层优化方法,通过多领导者多跟随者斯塔克伯格博弈和双荷兰拍卖模型,解决智能体任务卸载问题,提升资源利用效率。

Comments Revisions are needed

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22674 2026-03-25 cs.HC 50%

Designing a Meta-Reflective Dashboard for Instructor Insight into Student-AI Interactions

设计一个元反思仪表盘,以帮助教师了解学生与AI的互动

Boxuan Ma, Baofeng Ren, Huiyong Li, Gen Li, Li Chen, Atsushi Shimada, Shin'Ichi Konomi

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出一个元反思仪表盘,通过结构化总结学生与AI的交互轨迹和潜在风险,帮助教师在不暴露原始聊天记录的情况下获取学生学习情况,同时减轻隐私担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22471 2026-03-25 hep-lat hep-ph 50%

Automated Extraction of Collins-Soper Kernel from Lattice QCD using An Autonomous AI Physicist System

利用自主AI物理学家系统自动化提取Collins-Soper核从格点QCD

Jin-Xin Tan, Ting-Jia Miao, Mu-Hua Zhang, Xiang-He Pang, Ze-Xi Liu, Lin-Feng Zhang, Si-Heng Chen, Wei Wang

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文展示利用PhysMaster系统自动化高维拟合、重整化、连续极限楚尔 extrapolation和非微扰重建,有效提升格点QCD研究效率与精度。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24632 2026-03-25 cs.HC 50%

ReflectEd: Evaluating Reflection-Driven Learning in an AI-Assisted System

ReflectEd:在AI辅助系统中评估基于反思的学习

Md Nazmus Sakib, Ishika Tarin, Naga Manogna Rayasam, Manas Gaur, Sanorita Dey

专题命中 复杂问题求解 :planning(abstract)

AI总结 本文提出ReflectEd系统,通过理论驱动提示和机制支撑,评估反思驱动学习在协作环境中的效果,发现深度反思提升行动力但增加工作负担。

Comments Accepted at the 27th International Conference on Artificial Intelligence in Education (AIED 2026). The final authenticated version will appear in Springer LNAI/LNCS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 33 篇

2603.22582 2026-03-25 cs.CL cs.AI 90%

Lie to Me: How Faithful Is Chain-of-Thought Reasoning in Reasoning Models?

对我的谎言:推理模型中的思维链推理可信度如何?

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校,管理、创业与技术系,李商学院) DeepNeuro AI

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了12种开源推理模型在MMLU和GPQA Diamond中的表现,发现模型在提示影响下的可信度差异显著,训练方法和架构影响更大。

Comments 27 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20172 2026-03-25 cs.CL cs.AI cs.LG 87%

Measuring Faithfulness Depends on How You Measure: Classifier Sensitivity in LLM Chain-of-Thought Evaluation

衡量忠实性取决于如何测量:分类器敏感性在LLM链式推理评估中的应用

Richard J. Young

机构 * University of Nevada, Las Vegas, Department of Management, Entrepreneurship and Technology, Lee Business School(内华达大学拉斯维加斯分校管理、创业与技术系,Lee商学院) DeepNeuro AI

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);CoT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过不同分类器对10276个推理轨迹的分析,揭示了模型忠实性评估中分类器选择对结果的影响,指出不同方法导致的忠实性差异显著,需采用多种方法进行评估。

Comments 14 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22318 2026-03-25 cs.CL cs.LG 81%

Flying Pigs, FaR and Beyond: Evaluating LLM Reasoning in Counterfactual Worlds

飞行猪、FaR及更广泛的领域:评估LLM在反事实世界中的推理能力

Anish R Joishy, Ishwar B Balappanawar, Vamshi Krishna Bonagiri, Manas Gaur, Krishnaprasad Thirunarayan, Ponnurangam Kumaraguru

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) Wright State University(威斯汀豪斯州立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文研究了LLM在反事实场景下的推理能力,提出FaR方法以增强模型的元认知,减少逻辑与知识冲突带来的性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏