arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 9 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 9 篇

2511.17910 2026-03-23 cs.CL 92%

L2V-CoT: Cross-Modal Transfer of Chain-of-Thought Reasoning via Latent Intervention

L2V-CoT:通过潜在干预实现链式推理的跨模态转移

Yuliang Zhan, Xinyu Tang, Han Wan, Jian Li, Ji-Rong Wen, Hao Sun

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(title,abstract);分类 cs.CL

AI总结 本文提出L2V-CoT方法,通过潜在干预将链式推理从LLM转移到VLM,利用低频潜在表示提升多步推理能力,实验表明优于无训练基线和监督方法。

Comments AAAI 2026 oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19558 2026-03-23 cs.CL 83%

TextReasoningBench: Does Reasoning Really Improve Text Classification in Large Language Models?

TextReasoningBench: 推理是否真的能提升大语言模型中的文本分类性能?

Xinyu Guo, Yazhou Zhang, Jing Qin

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院) School of Nursing, The Hong Kong Polytechnic University(香港理工大学护理学院)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract);分类 cs.CL

AI总结 本文通过TextReasoningBench评估推理策略在文本分类中的有效性与效率,发现推理并非总能提升性能,且多数策略效率低下。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03018 2026-03-23 cs.CL cs.AI cs.LG 82%

Dementia-R1: Reinforced Pretraining and Reasoning from Unstructured Clinical Notes for Real-World Dementia Prognosis

Dementia-R1: 从无结构临床笔记中通过强化预训练和推理进行真实世界痴呆症预后预测

Choonghan Kim, Hyunmin Hwang, Hangeol Chang, Jaemin Kim, Jinse Park, Jae-Sung Lim, Jong Chul Ye

机构 * Graduate School of AI, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) Haeundae Paik Hospital, Inje University, Republic of Korea(韩国延世大学海云台医院) Asan Medical Center, University of Ulsan College of Medicine, Republic of Korea(韩国釜山大学医学院阿桑医院)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Dementia-R1框架,通过强化学习解决长期痴呆症预后预测问题,通过预训练提升疾病进展推理能力,在真实世界数据集上达到84.02%的AUROC,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18533 2026-03-23 cs.LG cs.CL 81%

Balancing the Reasoning Load: Difficulty-Differentiated Policy Optimization with Length Redistribution for Efficient and Robust Reinforcement Learning

平衡推理负担:基于长度再分配的难度差异化策略优化用于高效且鲁棒的强化学习

Yinan Xia, Haotian Zhang, Huiming Wang

机构 * Tianjin University(天津大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出DDPO算法,通过区分任务难度优化输出长度,提升强化学习的效率与鲁棒性,实验表明在多个基准上准确率提升1.85%的同时平均回答长度减少12%。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16665 2026-03-23 cs.LG cs.AI cs.DC 81%

Taming the Long-Tail: Efficient Reasoning RL Training with Adaptive Drafter

驯服长尾:通过自适应草案器实现高效的推理强化学习训练

Qinghao Hu, Shang Yang, Junxian Guo, Xiaozhe Yao, Yujun Lin, Yuxian Gu, Han Cai, Chuang Gan, Ana Klimovic, Song Han

机构 * MIT(麻省理工学院) ETH Zurich(苏黎世联邦理工学院) NVIDIA(英伟达) MIT-IBM AI Lab(麻省理工-IBM人工智能实验室) MIT, NVIDIA(麻省理工学院、英伟达)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出TLT系统,通过自适应草案器和自适应回放引擎,解决强化学习训练中响应生成的长尾分布问题,实现1.7倍的训练加速并保持模型精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19293 2026-03-23 cs.CL cs.AI 81%

LLM-MRD: LLM-Guided Multi-View Reasoning Distillation for Fake News Detection

LLM-MRD: 基于大语言模型的多视角推理蒸馏用于虚假新闻检测

Weilin Zhou, Shanwen Tan, Enhao Gu, Yurong Qian

机构 * Xinjiang University, Urumqi, China(新疆大学) Sichuan University, Chengdu, China(四川大学) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University, Urumqi, China(丝绸之路多语种认知计算国际联合实验室)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LLM-MRD框架,通过多视角推理蒸馏提升虚假新闻检测性能,实验显示在准确率和F1-Fake指标上均优于现有方法。

Comments Accepted at DASFAA 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24903 2026-03-23 cs.CV cs.CE 78%

FinMMDocR: Benchmarking Financial Multimodal Reasoning with Scenario Awareness, Document Understanding, and Multi-Step Computation

FinMMDocR:基于场景意识、文档理解与多步骤计算的金融多模态推理基准测试

Zichen Tang, Haihong E, Rongjin Li, Jiacheng Liu, Linwei Jia, Zhuodi Hao, Zhongjun Yang, Yuanze Li, Haolin Tian, Xinyi Hu, Peizhi Zhao, Yuan Liu, Zhengyu Wang, Xianghe Wang, Yiling Huang, Xueyuan Lin, Ruofei Bai, Zijian Xie, Qian Huang, Ruining Cao, Haocheng Gao

专题命中 复杂问题求解 :reasoning(title,abstract)

AI总结 FinMMDocR通过引入场景意识、文档理解和多步骤计算,推动多模态大语言模型在现实金融场景中的推理能力提升,其包含12种隐含金融场景、9类丰富文档及平均11步推理任务。

Comments Accepted by AAAI-26 Main Track

Journal ref Proc. AAAI 2026 (Vol. 40, No. 30), pages 25858-25866

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19574 2026-03-23 cs.HC cs.AI cs.CL cs.CY cs.SI 62%

AI Psychosis: Does Conversational AI Amplify Delusion-Related Language?

AI精神病:对话AI是否会放大妄想相关语言?

Soorya Ram Shimgekar, Vipin Gunda, Jiwon Kim, Violeta J. Rodriguez, Hari Sundaram, Koustuv Saha

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨对话AI对妄想相关语言的影响,通过模拟用户和三种模型家族分析妄想语言的变化,发现高妄想用户对话中妄想得分持续上升,而AI响应可有效降低此趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20143 2026-03-23 cs.CV 50%

Synergistic Perception and Generative Recomposition: A Multi-Agent Orchestration for Expert-Level Building Inspection

协同感知与生成重组:一种多智能体协作方法用于专家级建筑检查

Hui Zhong, Yichun Gao, Luyan Liu, Xusen Guo, Zhaonian Kuang, Qiming Zhang, Xinhu Zheng

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 本文提出FacadeFixer框架,通过多智能体协作解决建筑立面缺陷检测难题,利用生成代理实现语义重组,提升检测与分割模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏