arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-17 至 2026-03-17 共收录 507 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 94 篇

2603.11820 2026-03-17 cs.DB cs.AI 77%

OMNIA: Closing the Loop by Leveraging LLMs for Knowledge Graph Completion

OMNIA:通过利用LLMs进行知识图谱补全闭合循环

Frédéric Ieng, Soror Sahri, Mourad Ouzzani, Massinissa Hammaz, Salima Benbernou, Hanieh Khorashadizadeh, Sven Groppe, Farah Benamara

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 OMNIA提出一种两阶段方法,结合结构和语义推理补全知识图谱,通过聚类生成候选三元组并利用轻量嵌入过滤和LLM验证,提升F1分数,减少搜索空间和验证成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15668 2026-03-17 cs.SD 75%

EmotionThinker: Prosody-Aware Reinforcement Learning for Explainable Speech Emotion Reasoning

EmotionThinker: 基于语调感知的强化学习用于可解释的语音情绪推理

Dingdong Wang, Shujie Liu, Tianhua Zhang, Youjun Chen, Jinyu Li, Helen Meng

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文提出EmotionThinker,通过强化学习将语音情绪识别转化为深度推理问题,利用细粒度声学线索生成可解释的情绪预测,改进了语音大语言模型的语调感知能力。

Comments ICLR 2026 (Oral). Project page: https://github.com/dingdongwang/EmotionThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13890 2026-03-17 cs.MA 75%

Beyond Self-Interest: Modeling Social-Oriented Motivation for Human-like Multi-Agent Interactions

超越自我利益:为类人多智能体交互建模社会导向动机

Jingzhe Lin, Ceyao Zhang, Yaodong Yang, Yizhou Wang, Song-Chun Zhu, Fangwei Zhong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ASVO智能体,通过整合欲望驱动自主性与社会价值导向理论,实现类人多智能体交互中的社会导向动机建模,提升行为自然性和人类拟真性。

Comments 9 pages, 6 figures. Accepted to AAMAS 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13807 2026-03-17 cs.GT 75%

Decision Aggregation under Quantal Response

在量回应下做出决策聚合

Zhihuan Huang, Yichong Xia, Yuqing Kong

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究在个体理性低于阈值时,多数投票是最佳稳健聚合器,且此类群体能超越完全理性主体,通过决策随机性编码弱但信息性信号。

Comments 47 pages, 8 figures. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15547 2026-03-17 cs.CL cs.AI cs.HC 73%

Can LLMs Model Incorrect Student Reasoning? A Case Study on Distractor Generation

大语言模型能否建模错误学生推理?一种关于干扰项生成的案例研究

Yanick Zengaffinen, Andreas Opedal, Donya Rooein, Kv Aditya Srivatsa, Shashank Sonkar, Mrinmaya Sachan

机构 * ETH Zürich, Switzerland(苏黎世联邦理工学院,瑞士) Bocconi University, Italy(博科尼大学,意大利) University of Central Florida, USA(中央佛罗里达大学,美国)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在生成多项选择题干扰项时对错误推理的建模能力,发现模型通常先正确解决问题,再模拟可能的误解,最后选择干扰项,且正确解的提示能提升干扰项质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14486 2026-03-17 cs.CL cs.AI 73%

Infinite Problem Generator: Verifiably Scaling Physics Reasoning Data with Agentic Workflows

无限问题生成器:通过代理工作流可验证地扩展物理推理数据

Aditya Sharan, Sriram Hebbale, Dhruv Kumar

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出IPG框架,通过公式-as-代码方法生成可解物理问题,解决大语言模型训练中高质量数据稀缺的问题,发布包含1335个经典力学问题的ClassicalMechanicsV1数据集,展示高结构多样性及复杂度与代码长度的强相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14458 2026-03-17 cs.CL cs.AI cs.IR 73%

Distilling Reasoning Without Knowledge: A Framework for Reliable LLMs

提炼知识而不依赖知识:一种可靠大语言模型的框架

Auksarapak Kietkajornrit, Jad Tarifi, Nima Asgharbeygi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种模块化框架,通过显式分离规划与事实检索及回答合成,提升大语言模型在需要最新或冲突信息时的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05197 2026-03-17 cs.AI cs.CL cs.CV 73%

QA-Dragon: Query-Aware Dynamic RAG System for Knowledge-Intensive Visual Question Answering

QA-Dragon:面向知识密集型视觉问答的查询感知动态RAG系统

Zhuohang Jiang, Pangjing Wu, Xu Yuan, Wenqi Fan, Qing Li

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 QA-Dragon通过引入领域路由器和搜索路由器,实现多模态、多轮和多跳推理,提升复杂视觉问答任务的推理性能,实验显示其在单源、多源和多轮任务中均优于基线模型。

Comments The source code for our system is released in https://github.com/jzzzzh/QA-Dragon

Journal ref 2025 KDD Cup Workshop for Multimodal Retrieval Augmented Generation

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13941 2026-03-17 cs.LG cs.AI 73%

Nemotron-CrossThink: Scaling Self-Learning beyond Math Reasoning

Nemotron-CrossThink: 在数学推理之外实现自学习的扩展

Syeda Nahida Akter, Shrimai Prabhumoye, Matvei Novikov, Seungju Han, Ying Lin, Evelina Bakhturina, Eric Nyberg, Yejin Choi, Mostofa Patwary, Mohammad Shoeybi, Bryan Catanzaro

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NEMOTRON-CROSSTHINK框架,通过整合多领域数据提升推理泛化能力,改进数学和非数学任务的准确性与效率。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13594 2026-03-17 cs.AI cs.LG 73%

EnterpriseOps-Gym: Environments and Evaluations for Stateful Agentic Planning and Tool Use in Enterprise Settings

EnterpriseOps-Gym:面向企业场景的状态ful代理规划与工具使用的环境与评估

Shiva Krishna Reddy Malay, Shravan Nayak, Jishnu Sethumadhavan Nair, Sagar Davasam, Aman Tiwari, Sathwik Tejaswi Madhusudhan, Sridhar Krishna Nemala, Srinivas Sunkara, Sai Rajeswar

机构 * ServiceNow Research(ServiceNow研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EnterpriseOps-Gym基准,用于评估企业环境中代理的规划能力。通过164个数据库表和512个功能工具模拟真实工作摩擦,评估14种前沿模型,发现状态-of-the-art模型在战略推理上存在显著不足,且代理常无法拒绝不可行任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13274 2026-03-17 cs.LG cs.AI 73%

Learning from Partial Chain-of-Thought via Truncated-Reasoning Self-Distillation

通过截断推理自蒸馏学习部分推理链

Gianluigi Silvestri, Edoardo Cetin

机构 * Radboud University(拉德堡德大学) Sakana AI(萨卡纳人工智能)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出TRSD方法,通过自蒸馏提升模型在截断推理下的鲁棒性,减少计算开销并提高推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15617 2026-03-17 cs.LG 70%

HorizonMath: Measuring AI Progress Toward Mathematical Discovery with Automatic Verification

HorizonMath:通过自动验证衡量AI向数学发现的进步

Erik Y. Wang, Sumeet Motwani, James V. Roggeveen, Eliot Hodges, Dulhan Jayalath, Charles London, Kalyan Ramakrishnan, Flaviu Cipcigan, Philip Torr, Alessandro Abate

机构 * University of Oxford(牛津大学) Benchmark Harvard University(哈佛大学) Princeton University(普林斯顿大学) Ellison Institute of Technology(Ellison技术研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 HorizonMath通过自动验证框架评估AI在数学发现中的进展,针对需要深入数学洞察但验证简单的难题,发现部分模型提出改进现有结果的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15542 2026-03-17 cs.CY cs.AI 70%

InterveneBench: Benchmarking LLMs for Intervention Reasoning and Causal Study Design in Real Social Systems

InterveneBench:用于干预推理和真实社会系统因果研究设计的LLM基准测试

Shaojie Shi, Zhengyu Shi, Lingran Zheng, Xinyu Su, Anna Xie, Bohao Lv, Rui Xu, Zijian Chen, Zhichao Chen, Guolei Liu, Naifu Zhang, Mingjian Dong, Zhuo Quan, Bohao Chen, Teqi Hao, Yuan Qi, Yinghui Xu, Libo Wu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 InterveneBench通过真实社会科学研究评估LLM在干预推理和因果研究设计中的能力,发现现有模型表现不足,并提出STRIDES多智能体框架提升性能。

Comments 35pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15351 2026-03-17 cs.AI cs.MA 70%

PMAx: An Agentic Framework for AI-Driven Process Mining

PMAx:一种用于AI驱动流程挖掘的代理框架

Anton Antonov, Humam Kourani, Alessandro Berti, Gyunam Park, Wil M. P. van der Aalst

机构 * Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息科技研究所) RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 PMAx通过隐私保护的多代理架构,使非技术人员能将业务问题转化为可靠流程洞察,避免LLM的确定性推理和隐私泄露问题。

Comments Submitted to EMMSAD 2026 (tool demonstration track), under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06460 2026-03-17 cs.CL 70%

Can LLMs Simulate Personas with Reversed Performance? A Systematic Investigation for Counterfactual Instruction Following in Math Reasoning Context

LLMs能否通过反向表现模拟人物角色?一种针对数学推理情境中反事实指令跟随的系统性调查

Sai Adith Senthil Kumar, Hao Yan, Saipavan Perepa, Murong Yue, Ziyu Yao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出首个评估LLM反事实指令跟随能力的基准数据集,发现主流模型在模拟反向表现人物时表现不佳,揭示了反事实指令跟随的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14703 2026-03-17 cs.SE cs.AI 70%

Beyond Local Code Optimization: Multi-Agent Reasoning for Software System Optimization

超越局部代码优化:软件系统优化的多智能体推理

Huiyun Peng, Parth Vinod Patil, Antonio Zhong Qiu, George K. Thiruvathukal, James C. Davis

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多智能体框架,通过整合控制流、数据流与架构依赖信号,实现微服务系统的整体优化,提升吞吐量和响应时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14057 2026-03-17 cs.AI 70%

Demand-Driven Context: A Methodology for Building Enterprise Knowledge Bases Through Agent Failure

需求驱动的上下文:通过智能体失败构建企业知识库的方法论

Raj Navakoti, Saideep Navakoti

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出需求驱动上下文方法,通过智能体失败信号来获取企业领域知识,解决传统知识工程方法的局限性,展示在零售订单履行中的应用案例。

Comments 18 pages, 5 figures, 1 algorithm. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13934 2026-03-17 cs.IR cs.AI 70%

Iterative Semantic Reasoning from Individual to Group Interests for Generative Recommendation with LLMs

基于个体到群体利益的迭代语义推理用于LLM生成推荐

Xiaofei Zhu, Jinfei Chen, Feiyang Yuan, Zhou Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出ISRF框架,通过三次步骤实现从个体到群体的语义推理,提升生成推荐的准确性与全面性。

Comments Accepted at The Web Conference (WWW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12071 2026-03-17 cs.CV cs.AI 70%

LoV3D: Grounding Cognitive Prognosis Reasoning in Longitudinal 3D Brain MRI via Regional Volume Assessments

LoV3D:通过区域体积评估在纵向3D脑MRI中实现认知预后推理

Zhaoyang Jiang, Zhizhong Fu, David McAllister, Yunsoo Kim, Honghan Wu

专题命中 推理与问题求解 :language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 LoV3D通过纵向3D脑MRI的区域体积评估,实现认知预后推理,其核心方法是结合3D视觉-语言模型,通过区域解剖评估、纵向对比和诊断输出,提高诊断准确性与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22955 2026-03-17 cs.CL 70%

Diversity or Precision? A Deep Dive into Next Token Prediction

多样性还是精度?对下个token预测的深入探讨

Haoyuan Wu, Hai Wang, Jiajia Wu, Jinxiang Ou, Keyao Wang, Weile Chen, Zihao Zheng, Bei Yu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文通过重新审视交叉熵损失,提出一种结合在线强化学习原则的预训练目标,平衡多样性与精度,优化语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.08203 2026-03-17 cs.CL 70%

ArithmAttack: Evaluating Robustness of LLMs to Noisy Context in Math Problem Solving

ArithmAttack:评估LLMs在数学问题解决中对噪声上下文的鲁棒性

Zain Ul Abedin, Shahzeb Qamar, Lucie Flek, Akbar Karimi

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ArithmAttack方法,评估LLMs在包含标点符号噪声的提示下鲁棒性,发现所有模型在噪声增加时表现下降。

Comments Accepted to LLMSEC Workshop at ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13236 2026-03-17 cs.AI cs.CY 70%

Human Attribution of Causality to AI Across Agency, Misuse, and Misalignment

人类对AI在代理、滥用和偏差中的因果归因

Maria Victoria Carro, David Lagnado

机构 * Università degli Studi di Genova(热那亚大学) FAIR IALAB University of Buenos Aires(布宜诺斯艾利斯大学) University College London(伦敦大学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究探讨了人类在AI导致有害结果时对因果责任的归因,发现AI代理程度越高,责任归于AI;开发者虽远离事件但被归责高,用户责任降低;分解AI为大语言模型和代理组件时,代理部分更易被归责。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22442 2026-03-17 cs.AI 70%

A Framework for Assessing AI Agent Decisions and Outcomes in AutoML Pipelines

评估自动化机器学习流水线中AI代理决策与结果的框架

Gaoyuan Du, Amit Ahlawat, Xiaoyang Liu, Jing Wu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出评估代理(EA)用于评估自动化机器学习代理的决策质量,通过四个维度检测决策错误、识别推理不一致并归因下游性能变化,提升自动化机器学习系统的可解释性和可控性。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15459 2026-03-17 cs.IR 67%

Financial Transaction Retrieval and Contextual Evidence for Knowledge-Grounded Reasoning

金融交易检索与上下文证据用于知识引导推理

Artem Sakhno, Daniil Tomilov, Yuliana Shakhvalieva, Inessa Fedorova, Daria Ruzanova, Omar Zoloev, Andrey Savchenko, Maksim Makarenko

专题命中 推理与问题求解 :LLM(abstract);instruction tuning(abstract)

AI总结 本文提出FinTRACE框架,通过交易检索生成可重用的特征表示,结合规则检测器和行为知识库,提升低监督交易分析性能,并通过指令微调LLM实现交易分析的SOTA结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15087 2026-03-17 cs.SE 67%

Beyond Monolithic Models: Symbolic Seams for Composable Neuro-Symbolic Architectures

超越单体模型:符号缝合用于可组合的神经符号架构

Nicolas Schuler, Vincenzo Scotti, Raffaela Mirandola

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出符号缝合概念,旨在通过可组合的神经符号架构提升AI系统的可扩展性和透明性,结合数据驱动的适应性与显式约束的可验证性。

Comments Submitted to New and Emerging Ideas (NEMI) track at ICSA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15008 2026-03-17 cs.CV 67%

Clue Matters: Leveraging Latent Visual Clues to Empower Video Reasoning

线索至关重要:利用潜在视觉线索增强视频推理

Kaixin zhang, Xiaohe Li, Jiahao Li, Haohua Wu, Xinyu Zhao, Zide Fan, Lei Wang

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航天信息研究所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出ClueNet框架,通过两阶段监督微调方法,解决视频推理中视觉线索提取、过滤与推理对齐问题,提升视频问答的准确性和可解释性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17741 2026-03-17 cs.CV 67%

Reasoning to Attend: Try to Understand How <SEG> Token Works

推理以关注:尝试理解<SEG>标记的作用

Rui Qian, Xin Yin, Dejing Dou

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文研究了<SEG>标记在多模态模型中的作用,通过可视化相似性图揭示其在图像-文本对中的语义相似性贡献,并提出READ方法提升模型的推理能力。

Comments This work has been accepted to CVPR 2025, please refer to https://github.com/rui-qian/READ

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05530 2026-03-17 cs.RO cs.CV 67%

ProFocus: Proactive Perception and Focused Reasoning in Vision-and-Language Navigation

ProFocus:面向视觉-语言导航的前瞻性感知与聚焦推理

Wei Xue, Mingcheng Li, Xuecheng Wu, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ProFocus通过大语言模型与视觉-语言模型的协作,实现前瞻性感知和聚焦推理,提升视觉-语言导航任务的效率与准确性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13833 2026-03-17 cs.RO 67%

ImagiNav: Scalable Embodied Navigation via Generative Visual Prediction and Inverse Dynamics

ImagiNav:通过生成性视觉预测和逆动力学实现可扩展的具身导航

Jie Chen, Yuxin Cai, Yizhuo Wang, Ruofei Bai, Yuhong Cao, Jun Li, Yau Wei Yun, Guillaume Sartoretti

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract)

AI总结 本文提出ImagiNav框架,通过解耦视觉规划与机器人动作,利用真实世界导航视频实现零样本迁移,无需机器人演示即可实现通用机器人自主导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13723 2026-03-17 cs.SE 67%

Do AI Agents Really Improve Code Readability?

AI代理真的能提高代码可读性吗?

Kyogo Horikawa, Kosei Horikawa, Yutaro Kashiwa, Hidetake Uwano, Hajimu Iida

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究探讨AI代理重构对代码可读性的影响,通过分析403个提交发现,AI主要改进逻辑复杂度和文档,但导致传统质量指标下降。

Comments 5 pages

Journal ref 23rd International Conference on Mining Software Repositories (MSR '26) , 2026

详情

展开后加载摘要…

URL PDF HTML 收藏