arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-17 至 2026-03-17 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2603.15547 2026-03-17 cs.CL cs.AI cs.HC 81%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11248 2026-03-17 cs.LG cs.CL 81%

Reasoning-Grounded Natural Language Explanations for Language Models

基于推理的自然语言解释方法用于语言模型

Vojtech Cahlik, Rodrigo Alves, Pavel Kordik

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出一种通过推理过程生成可信自然语言解释的方法,通过将推理过程转化为token序列并解码为自然语言,提升解释的准确性与答案质量。

Comments (v2) Added acknowledgements section

Journal ref In: Guidotti, R., Schmid, U., Longo, L. (eds) Explainable Artificial Intelligence. xAI 2025. Communications in Computer and Information Science, vol 2578. Springer, Cham

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13725 2026-03-17 cs.CL 79%

Can We Trust LLMs on Memristors? Diving into Reasoning Ability under Non-Ideality

我们能相信基于忆阻器的LLMs吗?在非理想条件下探究推理能力

Taiqiang Wu, Yuxin Cheng, Chenchen Ding, Runming Yang, Xincheng Feng, Wenyong Zhou, Zhengwu Liu, Ngai Wong

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究探讨了基于忆阻器的类脑计算架构对LLM推理能力的影响,发现非理想性导致推理能力下降,提出三种无训练策略并总结提升鲁棒性的指导原则。

Comments 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13765 2026-03-17 cs.CL cs.AI 79%

Knowledge Distillation for Large Language Models

为大型语言模型进行知识蒸馏

Alejandro Paredes La Torre, Barbara Flores, Diego Rodriguez

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种高效的压缩框架,结合引导的思维链强化学习,通过知识蒸馏和链式思维提示提升模型效率,实现更小规模的模型部署。

Comments Code and data are available at: https://github.com/AlejandroParedesLT/knowledge_distillLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 78%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06097 2026-03-17 cs.CV 78%

VideoChat-A1: Thinking with Long Videos by Chain-of-Shot Reasoning

VideoChat-A1: 通过镜头链推理实现长视频的思考

Zikang Wang, Boyu Chen, Zhengrong Yue, Yi Wang, Yu Qiao, Limin Wang, Yali Wang

专题命中 其他推理 :reasoning(title,abstract)

AI总结 VideoChat-A1通过镜头链推理方法,有效解决长视频理解难题,实现优于现有方法的性能,同时在效率上更具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15459 2026-03-17 cs.IR 71%

Financial Transaction Retrieval and Contextual Evidence for Knowledge-Grounded Reasoning

金融交易检索与上下文证据用于知识引导推理

Artem Sakhno, Daniil Tomilov, Yuliana Shakhvalieva, Inessa Fedorova, Daria Ruzanova, Omar Zoloev, Andrey Savchenko, Maksim Makarenko

专题命中 其他推理 :reasoning(title)

AI总结 本文提出FinTRACE框架,通过交易检索生成可重用的特征表示,结合规则检测器和行为知识库,提升低监督交易分析性能,并通过指令微调LLM实现交易分析的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25827 2026-03-17 cs.CL cs.AI 62%

Overthinking Reduction with Decoupled Rewards and Curriculum Data Scheduling

脱离奖励与课程数据调度的过度思考减少

Shuyang Jiang, Yusheng Liao, Ya Zhang, Yanfeng Wang, Yu Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出DECS框架,通过解耦的token级奖励机制和新的课程批量调度策略,有效减少推理token数量,同时保持或提升性能,解决过度思考问题。

Comments 30 pages; Accepted as an oral presentation at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13985 2026-03-17 cs.AI cs.CL 62%

Supervised Fine-Tuning versus Reinforcement Learning: A Study of Post-Training Methods for Large Language Models

监督微调与强化学习:大型语言模型后训练方法的探讨

Haitao Jiang, Wenbo Zhang, Jiarui Yao, Hengrui Cai, Sheng Wang, Rui Song

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了监督微调与强化学习在大型语言模型后训练中的联系与应用,分析了两者的方法、数据需求及整合框架,总结了混合训练趋势及未来研究方向。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09944 2026-03-17 cs.AI cs.CV cs.LG eess.IV 62%

Echo-CoPilot: A Multiple-Perspective Agentic Framework for Reliable Echocardiography Interpretation

Echo-CoPilot:一种多视角代理框架,用于可靠的超声心动图解读

Moein Heidari, Ali Mehrabian, Mohammad Amin Roohi, Wenjin Chen, David J. Foran, Jasmine Grewal, Ilker Hacihaliloglu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Echo-CoPilot框架,结合多视角工作流程与知识图谱引导的测量选择,通过三个独立的ReAct式代理处理超声心动图任务,提升解读准确性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13434 2026-03-17 cs.LG cs.AI 62%

Modality-free Graph In-context Alignment

无模态图上下文对齐

Wei Zhuo, Siqiang Luo

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MF-GIA框架,通过梯度指纹捕捉领域特征,实现跨异构域的无模态few-shot预测与泛化。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13378 2026-03-17 cs.AI cs.CL cs.CY 62%

Do Large Language Models Get Caught in Hofstadter-Mobius Loops?

大型语言模型是否会陷入霍夫斯塔德-莫比乌斯循环?

Jaroslaw Hryszko

机构 * Faculty of Mathematics and Computer Science, Jagiellonian University(数学与计算机科学学院,雅盖隆大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨现代RLHF训练语言模型中存在霍夫斯塔德-莫比乌斯循环的矛盾,通过实验发现调整系统提示的框架可显著减少压迫性输出。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09823 2026-03-17 cs.SD cs.CL eess.AS 57%

Covo-Audio Technical Report

Covo-Audio技术报告

Wenfu Wang, Chenxing Li, Liqiang Zhang, Yiyang Zhao, Yuxiang Zou, Hanzhao Li, Mingyu Cui, Hao Zhang, Kun Wei, Le Xu, Zikang Huang, Jiajun Xu, Jiliang Hu, Xiang He, Zeyu Xie, Jiawen Kang, Youjun Chen, Meng Yu, Dong Yu, Rilin Chen, Linlin Di, Shulin Feng, Na Hu, Yang Liu, Bang Wang, Shan Yang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 Covo-Audio是一款7B参数端到端LALM,通过大规模预训练和微调在多种任务中表现优异,包括语音文本建模、对话、语音理解等,并展示了其在实际对话助理中的应用潜力。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04658 2026-03-17 cs.SD cs.AI 57%

LAMB: LLM-based Audio Captioning with Modality Gap Bridging via Cauchy-Schwarz Divergence

LAMB:基于LLM的音频描述通过Cauchy-Schwarz散度弥合模态间隙

Hyeongkeun Lee, Jongmin Choi, KiHyun Nam, Joon Son Chung

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出LAMB框架,通过Cauchy-Schwarz散度弥合音频与文本嵌入空间的模态差距,设计Two-Stream Adapter和Token Guide提升LLM解码器推理能力,在AudioCaps上取得最佳性能。

Comments 5 pages, 2 figures; Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14553 2026-03-17 hep-ph cs.AI cs.MA hep-ex 57%

An End-to-end Architecture for Collider Physics and Beyond

通向对撞机物理与更广泛领域端到端架构的架构

Shi Qiu, Zeyu Cai, Jiashen Wei, Zeyu Li, Yixuan Yin, Qing-Hong Cao, Chang Liu, Ming-xing Luo, Xing-Bo Yuan, Hua Xing Zhu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出首个基于语言的智能体系统,实现端到端对撞机现象学任务,通过解耦、领域无关的架构实现自主高能物理现象学研究,展示了其在粒子物理、宇宙学等领域的应用潜力。

Comments 15 pages, 3 figure, project website: AGI/ColliderAgent" target="_blank" rel="noopener">https://github.com/HET-AGI/ColliderAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14057 2026-03-17 cs.AI 57%

Demand-Driven Context: A Methodology for Building Enterprise Knowledge Bases Through Agent Failure

需求驱动的上下文:通过智能体失败构建企业知识库的方法论

Raj Navakoti, Saideep Navakoti

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出需求驱动上下文方法,通过智能体失败信号来获取企业领域知识,解决传统知识工程方法的局限性,展示在零售订单履行中的应用案例。

Comments 18 pages, 5 figures, 1 algorithm. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13366 2026-03-17 cs.CV cs.AI 57%

Thinking in Uncertainty: Mitigating Hallucinations in MLRMs with Latent Entropy-Aware Decoding

在不确定性中思考:通过潜在熵感知解码减轻MLRMs中的幻觉

Zhongxing Xu, Zhonghua Wang, Zhe Qian, Dachuan Shi, Feilong Tang, Ming Hu, Shiyan Su, Xiaocheng Zou, Wei Feng, Dwarikanath Mahapatra, Yifan Peng, Mingquan Lin, Zongyuan Ge

机构 * Monash University(墨尔本大学) Georgia Tech(佐治亚理工学院) Cornell University(康奈尔大学) Northeastern University(东北大学) Khalifa University(卡利法大学) University of Minnesota(明尼苏达大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出通过潜在熵感知解码策略减轻多模态大推理模型中的幻觉问题,利用语义上下文增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13264 2026-03-17 cs.LG cs.IR 57%

Federated Personal Knowledge Graph Completion with Lightweight Large Language Models for Personalized Recommendations

联邦轻量级大语言模型用于个性化推荐的知识图谱补全

Fernando Spadea, Oshani Seneviratne

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出FedTREK-LM框架,结合轻量级大语言模型、演化个人知识图谱和联邦学习,实现可扩展的去中心化个性化推荐,实验显示其在电影和食谱推荐中F1分数提升超4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13250 2026-03-17 cs.CY cs.AI 57%

The Missing Red Line: How Commercial Pressure Erodes AI Safety Boundaries

缺失的红色线:商业压力如何侵蚀AI安全边界

Nora Petrova, John Burden

机构 * Prolific

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究发现商业提示会削弱AI安全边界,导致模型在医疗风险中撒谎、忽视安全,优先利润而非用户福祉,且无明确红线机制。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22596 2026-03-17 cs.CV 50%

SAM-R1: Leveraging SAM for Reward Feedback in Multimodal Segmentation via Reinforcement Learning

SAM-R1:通过强化学习利用SAM进行多模态分割的奖励反馈

Jiaqi Huang, Zunnan Xu, Jun Zhou, Ting Liu, Yicheng Xiao, Mingwen Ou, Bowen Ji, Xiu Li, Kehong Yuan

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出SAM-R1框架,通过整合任务特定的细粒度奖励与定制优化目标,提升多模态模型在图像理解任务中的细粒度推理与分割对齐能力,仅用3k训练样本即在多个基准上取得优异表现。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13906 2026-03-17 cs.DB 50%

ATCC: Adaptive Concurrency Control for Unforeseen Agentic Transactions

ATCC:面向意外代理事务的自适应并发控制

Weixing Zhou, Zhiyou Wang, Zeshun Peng, Hetian Chen, Yanfeng Zhang, Ge Yu

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出ATCC,一种针对意外代理事务的自适应并发控制方法,通过动态调整乐观与悲观执行策略,显著提升事务吞吐量并降低尾部延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13775 2026-03-17 cs.NI 50%

LLM-Based Net Analyzer rApp for Explainable and Safe Automation in O-RAN Non-RT RIC

基于大语言模型的网络分析rApp用于O-RAN非实时RIC中的可解释和安全自动化

Tuan V. Ngo, Mao V. Ngo, Binbin Chen, Tony Q. S. Quek, Tejaswita Kumari, Maziar Nekovee

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出一种基于大语言模型的网络分析rApp,用于O-RAN非实时RIC中的可解释和安全自动化,通过事件驱动的批量触发推理框架,实现安全的人工干预自动化,确保操作安全性和可审计性。

Comments Accepted version for presentation at the IEEE ICC Workshop Open, Programmable and AI-Native Radio Access Network, Glasgow, Scotland, UK, May 2026. copyright 2026 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

详情

展开后加载摘要…

URL PDF HTML 收藏