arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18810 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18810 篇

2605.17353 2026-05-19 cs.CY 89%

You Can't Fool Us: Understanding the Resilience of LLM-driven Agent Communities to Misinformation

你无法欺骗我们:理解由LLM驱动的代理社区对谣言的韧性

Chichen Lin, Yijie Jin, Kangbo Hu, Weijian Fan, Han Xiao, Yongbin Wang, Zhihui Ying, Zhanzhan Zhao

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文研究了由LLM驱动的代理社区在面对可信谣言冲击时的韧性,通过构建基于LLM的代理模拟,从主动开放思维(AOT)和政治意识形态(PI)两个维度分析社区对谣言的反应机制,发现高AOT提升抗谣言冲击能力和恢复力,而PI影响恢复路径,中等意识形态社区恢复更可靠,极化社区则保留更多支持。

Comments 26 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17290 2026-05-19 cs.SE 89%

Debug Like a Human: Scaling LLM-based Fault Localization to Processor Design via Block-Level Instruction-Oriented Slicing

像人类一样调试:通过块级指令导向切片扩展基于LLM的故障定位到处理器设计

Zizhen Liu, Xiaoguang Mao, Deheng Yang, Jiayu He, Yihao Qin, Guangda Zhang, Yan Lei, Jianjun Xu, Jiang Wu

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出BluesFL框架,通过块级指令导向切片算法,利用LLM模拟人类调试过程,有效定位处理器设计中的故障,相比现有方法提升了242.9%的定位准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14801 2026-05-15 cs.RO 89%

Exploring Bottlenecks in VLM-LLM Navigation: How 3D Scene Understanding Capability Impacts Zero-Shot VLN

探索VLM-LLM导航中的瓶颈:3D场景理解能力如何影响零样本VLN

Ziyi Xia, Chaoran Xiong, Litao Wei, Xinhao Hu, Ling Pei

机构 * Shanghai Key Laboratory of Navigation and Location Based Services, Shanghai Jiao Tong University(上海导航与基于位置的服务关键实验室,上海交通大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了零样本视觉-语言导航中3D场景理解能力对性能的影响,提出了统计成功率上限,揭示了感知饱和现象,建议转向导航相关的核心词汇和准确的边界框比例。

Comments Accepted by ICRA Workshop MM-Spatial AI, Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13716 2026-05-14 cs.SE cs.MA 89%

SkillOps: Managing LLM Agent Skill Libraries as Self-Maintaining Software Ecosystems

SkillOps:将LLM代理技能库视为自维护的软件生态系统进行管理

Hongji Pu, Xinyuan Song, Liang Zhao

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 SkillOps通过自维护软件生态系统方法管理LLM代理技能库,解决技能库中的技术债务问题,提升技能检索、组合和执行效率,实验表明其在ALFWorld上任务成功率高达79.5%。

Comments 23 pages, 9 figures. Submitted to NeurIPS 2026. Code is available at https://github.com/Hik289/SkillOps.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04165 2026-05-14 cs.SE 89%

PoC-Gym: Towards More Reliable LLM-Assisted Proof-of-Concept Exploit Generation

PoC-Gym: 向更可靠的LLM辅助漏洞利用证明概念生成迈进

Derin Gezgin, Amartya Das, Shinhae Kim, Zhengdong Huang, Nevena Stojkovic, Claire Wang

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 PoC-Gym通过结合静态与动态信息,迭代生成Java漏洞PoC,并通过多阶段验证提升可靠性,覆盖12个CVE,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12163 2026-05-14 cs.CV 89%

Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model

自洽潜在推理:面向视觉语言模型的长潜在序列推理

Chenfeng Wang, Wei He, Xuhan Zhu, Chunpeng Zhou, Qizhen Li, Song Yan, Yufei Zheng, Chengjun Yu, Fan Lu, Wei Zhai, Yang Cao, Pengfei Yu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Li Auto Inc.(利亚自动化公司)

专题命中 推理与问题求解 :SFT(summary_cn,abstract);language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出SCOLAR模型,通过轻量级detransformer生成辅助视觉token,结合三阶段SFT和ALPO强化学习,显著提升视觉语言模型的长序列推理能力,达到开源模型在现实任务中的最佳性能。

Comments 17 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25880 2026-04-29 cs.SE 89%

From Threads to Trajectories: A Multi-LLM Pipeline for Community Knowledge Extraction from GitHub Issue Discussions

从线程到轨迹:一个多LLM管道用于从GitHub问题讨论中提取社区知识

Nazia Shehnaz Joynab, Soneya Binta Hossain

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 本文提出SWE-MIMIC-Bench数据集,通过多LLM管道从GitHub讨论生成问题轨迹,用于提取复杂问题的结构化知识,提升软件工程社区的协作理解与LLM训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19558 2026-04-22 cs.SE 89%

On Reasoning-Centric LLM-based Automated Theorem Proving

基于推理的LLM自动定理证明方法

Yican Sun, Chengwei Shi, Hangzhou Lyu, Yingfei Xiong

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出ReCent-Prover,通过引入反思验证和规划检索技术,提升自动定理证明能力,在CoqStoq基准测试中实现22.58%的定理证明提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16615 2026-04-15 cs.RO 89%

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning

基于大型语言模型的任务与能力层面探索的强化学习

Jelle Luijkx, Runyu Ma, Zlatan Ajanović, Jens Kober

机构 * RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出LLM-TALE框架,利用大型语言模型的规划能力引导强化学习探索,提升学习效率和任务成功率,实验证明在抓取放置任务中表现出更高的样本效率和成功率。

Comments 8 pages, 7 figures, ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12753 2026-03-04 cs.RO 89%

osmAG-LLM: Zero-Shot Open-Vocabulary Object Navigation via Semantic Maps and Large Language Models Reasoning

osmAG-LLM: 通过语义地图和大语言模型推理实现零样本开放词汇物体导航

Fujing Xie, Sören Schwertfeger, Hermann Blum

机构 * Key Laboratory of Intelligent Perception and Human-Machine Collaboration – ShanghaiTech University, Ministry of Education, China(智能感知与人机协作重点实验室——上海科技大学,教育部,中国) University of Bonn(波恩大学) Lamarr Institute for ML and AI(Lamarr 人工智能与机器学习研究所)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title)

AI总结 osmAG-LLM通过语义地图和大语言模型推理实现零样本开放词汇物体导航,结合环境基础与上下文推断,提升动态和未映射物体的导航性能。

Comments accepted at RA-L 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13930 2025-12-17 cond-mat.mtrl-sci cs.AI cs.CL cs.LG cs.MA 89%

Hierarchical Multi-agent Large Language Model Reasoning for Autonomous Functional Materials Discovery

分层多智能体大语言模型推理用于自主功能材料发现

Samuel Rothfarb, Megan C. Davis, Ivana Matanovic, Baikun Li, Edward F. Holby, Wilton J. M. Kort-Kamp

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MASTER通过多代理协作提升材料发现的自主性,利用大语言模型进行推理驱动的原子模拟优化,减少90%的计算需求。

Comments Keywords: Multi-agent reasoning; Large language models; Active learning; AI-driven simulation; Materials discovery; Density functional theory; Surface chemistry

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17566 2025-03-25 cs.RO 89%

LLM-Drone: Aerial Additive Manufacturing with Drones Planned Using Large Language Models

Akshay Raman, Chad Merrill, Abraham George, Amir Barati Farimani

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title);language model(title)

Comments 26 Pages, 6 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14511 2024-08-29 cs.AI cs.CL cs.LG math.ST stat.ML stat.TH 89%

Unveiling the Statistical Foundations of Chain-of-Thought Prompting Methods

Xinyang Hu, Fengzhuo Zhang, Siyu Chen, Zhuoran Yang

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

Comments 150 pages, 18 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.17076 2024-04-02 cs.CV cs.AI cs.CL cs.LG 89%

Compositional Chain-of-Thought Prompting for Large Multimodal Models

Chancharik Mitra, Brandon Huang, Trevor Darrell, Roei Herzig

专题命中 推理与问题求解 :prompting(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17491 2023-11-20 cs.CL cs.AI cs.HC cs.LG 89%

Language Models can Solve Computer Tasks

Geunwoo Kim, Pierre Baldi, Stephen McAleer

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);RLHF(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.02144 2023-09-06 cs.CL cs.AI cs.LG 89%

Making Large Language Models Better Reasoners with Alignment

Peiyi Wang, Lei Li, Liang Chen, Feifan Song, Binghuai Lin, Yunbo Cao, Tianyu Liu, Zhifang Sui

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments Large Language Models; Reasoning; Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.00900 2025-12-15 cs.AI cs.CL 89%

From Next-Token to Mathematics: The Learning Dynamics of Mathematical Reasoning in Language Models

从单个词到数学:语言模型中数学推理学习动态

Shubhra Mishra, Gabriel Poesia, Noah D. Goodman

机构 * Department of Computer Science 1 and Psychology 2(计算机科学系和心理学系) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract);large language model(abstract);instruction tuning(abstract)

AI总结 本研究分析了语言模型在预训练和后训练过程中数学推理能力的发展,揭示了数学技能学习顺序与课程设计的相关性,并探讨了指令微调对不同数学技能的影响。

Comments Accepted to COLM 2025. Dataset and code: https://github.com/gpoesia/mathcamps/

Journal ref Conference on Language Modeling (COLM), Montreal, Canada, October 7-10, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14615 2026-08-18 cs.AI 新提交 89%

Large Language Models and their Awareness of Mechanics and Spatial Geometry

大语言模型及其对力学与空间几何的认知能力

Johannes Gerstmayr, Sebastian Weyrer, Tobias Möltner, Peter Manzl, Michael Pieber

机构 * University of Innsbruck(因斯布鲁克大学) University of Augsburg(奥格斯堡大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究构建了全自动基准MecEng,评估32个开放权重及2个专有LLMs的机械工程认知,发现其刚体任务成功率达86.0%,但柔性多体任务仍具挑战,且该能力正快速提升但仍易出错。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12875 2026-08-14 cs.CL 新提交 89%

The Embedder's Dilemma: LLMs Are Better, but at What Cost?

嵌入器的困境:大型语言模型(LLM)性能更优,但代价是什么?

Adnan El Assadi, Niklas Muennighoff, Jinhyuk Lee

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究对比LLM与嵌入模型在37项任务的性能与成本,发现二者性能接近但LLM成本高、速度慢,建议嵌入模型用于通用任务,LLM用于推理密集型检索。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10530 2026-08-12 cs.CR cs.AI 新提交 89%

On Understanding, Identifying, and Mitigating Vulnerabilities in Agentic Large Language Models

关于智能体大语言模型漏洞的理解、识别与缓解

Md Jafrin Hossain, Mohammad Arif Hossain, Nirwan Ansari

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本研究针对智能体大语言模型安全开展系统文献综述,提出四层漏洞分类法,发现攻击研究多于防御研究、感知层漏洞研究占比偏高等现状,识别7个开放问题及架构耦合的核心不安全根源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06756 2026-08-10 cs.CL 版本更新 89%

How Long Reasoning Chains Influence LLMs' Judgment of Answer Factuality

推理链长度如何影响LLM对答案事实性的判断

Minzhu Tu, Shiyu Ni, Keping Bi

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing University of Post and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨了推理链对LLM判断答案事实性的影响,发现弱判官易受推理存在影响,而强判官部分利用推理作为证据,但仍易被高质量推理链误导。

Comments ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14591 2026-08-06 cs.SD cs.AI 版本更新 89%

AudioDER: A Deduplication-Enhanced Reasoning Dataset for Post-Training Large Audio-Language Models

AudioDER: 一种用于后训练大型音频语言模型的去重增强推理数据集

Hui Geng, Yi Su, Zijian Gao, Tianjiao Wan, Qisheng Xu, Jiaxin Chen, Hengzhu Liu, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) Shanghai Jiaotong University(上海交通大学)

专题命中 推理与问题求解 :language model(title,abstract);post-training(title,abstract);pretraining(abstract);分类 cs.AI

AI总结 针对现有音频-语言数据集冗余导致后训练效果下降的问题,提出基于声学相似性去重的数据构建流程,生成包含191k样本的推理导向数据集AudioDER,显著提升LALM在多个音频推理基准上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00198 2026-08-04 cs.GT cs.CL 89%

Fairshare Data Pricing via Data Valuation for Large Language Models

Luyang Zhang, Cathy Jiao, Beibei Li, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28478 2026-07-31 cs.CL 新提交 89%

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

你会步行去洗车吗?揭示大型语言模型在常识推理中的显著性偏差

Zheng Wu, Chenhao Xue, Shijie Zheng, Yijie Lu, Cheng Yang, Zhuosheng Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本研究构建SaliTrap基准数据集,发现主流LLMs存在显著性偏差,其常识推理失败源于知识被干扰项抑制,而非知识缺失,轻量级推理时提示可大幅缓解该问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01427 2026-07-31 cs.AI 版本更新 89%

A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining

小型语言模型代理实现高效高质量的知识挖掘

Sipeng Zhang, Longfei Yun, Zilong Wang, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校) Carneigie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);small language model(title);LLM(abstract_cn);large language model(abstract)

AI总结 提出Falconer框架,结合大语言模型的代理推理与轻量级代理模型,通过规划与标注实现可扩展的知识挖掘,在保持指令遵循精度的同时降低90%推理成本并加速20倍以上。

Comments Code available: https://github.com/LongfeiYun17/falconer

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21438 2026-07-28 cs.AI 版本更新 89%

Evo-DKD: Dual-Knowledge Decoding for Autonomous Ontology Evolution in Large Language Models

Evo-DKD:用于大语言模型中自主本体进化的双知识解码

Vishal Raman, Vijai Aravindh R, Abhijith Ragav

机构 * Radian Group Inc.(Radian集团) Sri Sivasubramaniya Nadar College Of Engineering(纳德工程学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究针对本体和知识图谱进化难题,提出Evo-DKD双解码器框架,结合结构化遍历与非结构化推理,通过动态注意力机制协调,经模拟在单流模式下近似双解码,实验证明其在多领域用例中优于基线,为知识库维护提供新范式。

Comments 6 pages, 6 figures, 2 tables. Accepted for publication at IEEE ICMLA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11169 2026-07-28 cs.CL 89%

CMCTS: A Constrained Monte Carlo Tree Search Framework for Mathematical Reasoning in Large Language Model

CMCTS:一种用于大语言模型数学推理的约束蒙特卡洛树搜索框架

Qingwen Lin, Boyan Xu, Guimin Hu, Zijian Li, Zhifeng Hao, Keli Zhang, Ruichu Cai

机构 * Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 CMCTS通过约束动作空间、过程奖励模型和偏序规则提升大语言模型的数学推理能力,实验表明其在多个基准测试中表现优异。

Journal ref Applied Intelligence 56, 13 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03367 2026-07-28 cs.AI 89%

CLMASP: Coupling Large Language Models with Answer Set Programming for Robotic Task Planning

CLMASP:将大语言模型与答案集编程耦合用于机器人任务规划

Xinrui Lin, Yangfan Wu, Huanyu Yang, Yu Zhang, Yanyong Zhang, Jianmin Ji

机构 * University of Science and Technology of China(中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 本文提出CLMASP方法,结合大语言模型和答案集编程,解决机器人任务规划中计划落地问题,实验显示其执行率显著提升。

Comments 9 pages, accepted to IJCAI 2025 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13248 2026-07-16 cs.CL 新提交 89%

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

机构 * Southeast University(东南大学) Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22511 2026-07-08 cs.CL stat.ML 新提交 89%

Breaking the Likelihood Trap: Variance-Calibrated Modulation for Large Language Model Decoding

打破似然陷阱:面向大语言模型解码的方差校准调制

Yuanhao Ding, Meimingwei Li, Esteban Garces Arias, Matthias Aßenmacher, Christian Heumann, Chongsheng Zhang

机构 * School of Computer and Information Engineering, Henan University(河南大学计算机与信息工程学院) Department of Statistics, LMU Munich(慕尼黑大学统计系) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);分类 cs.CL

AI总结 提出方差校准调制(VCM),通过上下文PMI搜索和自适应自去偏置两种动态机制,在截断前重塑概率分布,以缓解LLM的似然陷阱问题,提升生成多样性、连贯性和推理准确性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏