arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 18731 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18731 篇

2511.10394 2025-11-14 cs.CV 91%

LLM-YOLOMS: Large Language Model-based Semantic Interpretation and Fault Diagnosis for Wind Turbine Components

Yaru Li, Yanxue Wang, Meng Li, Xinming Li, Jianbo Feng

机构 * School of Mechanical-Electronic and Vehicle Engineering, Beijing University of Civil Engineering and Architecture(机械电子与车辆工程学院,北京建筑大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Journal resubmission

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14387 2025-08-21 cs.RO 91%

DEXTER-LLM: Dynamic and Explainable Coordination of Multi-Robot Systems in Unknown Environments via Large Language Models

Yuxiao Zhu, Junfeng Chen, Xintong Zhang, Meng Guo, Zhongkui Li

机构 * College of Engineering, Peking University(北京大学工程学院) Division of Natural and Applied Sciences, Duke Kunshan University(杜克昆山大学自然科学与应用科学系)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments submitted to IROS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12728 2025-08-19 eess.SP 91%

LLM-RIMSA: Large Language Models driven Reconfigurable Intelligent Metasurface Antenna Systems

Yunsong Huang, Hui-Ming Wang, Qingli Yan, Zhaowei Wang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06519 2025-06-10 eess.SY cs.SY 91%

Hierarchical Debate-Based Large Language Model (LLM) for Complex Task Planning of 6G Network Management

Yuyan Lin, Hao Zhou, Chengming Hu, Xue Liu, Hao Chen, Yan Xin, Jianzhong, Zhang

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24476 2025-06-02 cs.CV 91%

Period-LLM: Extending the Periodic Capability of Multimodal Large Language Model

Yuting Zhang, Hao Lu, Qingyong Hu, Yin Wang, Kaishen Yuan, Xin Liu, Kaishun Wu

机构 * The Hong Kong University of Science & Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science & Technology(香港科技大学) Zhejiang University(浙江大学) Lappeenranta-Lahti University of Technology(拉佩兰塔-拉赫蒂技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06513 2025-05-13 cs.RO 91%

LLM-Flock: Decentralized Multi-Robot Flocking via Large Language Models and Influence-Based Consensus

Peihan Li, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15505 2025-03-10 cs.RO 91%

Discovering Object Attributes by Prompting Large Language Models with Perception-Action APIs

Angelos Mavrogiannis, Dehao Yuan, Yiannis Aloimonos

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments ICRA 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06419 2025-02-11 cs.RO 91%

Occ-LLM: Enhancing Autonomous Driving with Occupancy-Based Large Language Models

Tianshuo Xu, Hao Lu, Xu Yan, Yingjie Cai, Bingbing Liu, Yingcong Chen

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Accepted in 2025 IEEE International Conference on Robotics and Automation (ICRA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21040 2024-10-29 cs.RO 91%

LiP-LLM: Integrating Linear Programming and dependency graph with Large Language Models for multi-robot task planning

Kazuma Obata, Tatsuya Aoki, Takato Horii, Tadahiro Taniguchi, Takayuki Nagai

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.01202 2024-05-03 cs.SE cs.CR 91%

DLAP: A Deep Learning Augmented Large Language Model Prompting Framework for Software Vulnerability Detection

Yanjing Yang, Xin Zhou, Runfeng Mao, Jinwei Xu, Lanxin Yang, Yu Zhangm, Haifeng Shen, He Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.18778 2024-03-28 cs.RO 91%

3P-LLM: Probabilistic Path Planning using Large Language Model for Autonomous Robot Navigation

Ehsan Latif

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Exploratory Study

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.13655 2024-03-05 cs.CV 91%

LLM-grounded Diffusion: Enhancing Prompt Understanding of Text-to-Image Diffusion Models with Large Language Models

Long Lian, Boyi Li, Adam Yala, Trevor Darrell

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

Comments Transactions on Machine Learning Research (TMLR) 2024, with Featured Certification

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.20034 2023-11-01 cs.RO 91%

GG-LLM: Geometrically Grounding Large Language Models for Zero-shot Human Activity Forecasting in Human-Aware Task Planning

Moritz A. Graule, Volkan Isler

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03653 2023-05-08 cs.IR 91%

Query Expansion by Prompting Large Language Models

Rolf Jagerman, Honglei Zhuang, Zhen Qin, Xuanhui Wang, Michael Bendersky

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(title);LLM(abstract)

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12348 2026-08-17 cs.DB cs.AI 版本更新 91%

Can Large Language Models Reason about Event-Time Stream-Processing Semantics?

StreamReason-Bench:大型语言模型能否推理事件时间流处理语义?

Zhuoxi Wang, Shibo Zheng, Haoyu Zhang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 该研究构建了StreamReason-Bench基准测试,发现LLM在事件时间流处理语义推理任务上表现不佳,思维链可提升其性能,难点在于事件时间与延迟数据处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20520 2026-07-24 cs.AI cs.HC cs.PL 新提交 91%

Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving

数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性

Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。

Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24902 2026-06-25 cs.DL cs.AI 新提交 91%

Failure Modes of Large Language Models on Research-Level Mathematics: A Taxonomy and an Empirical Characterisation

大语言模型在研究级数学问题上的失败模式:分类与实证刻画

Arnesh Banerjee, Ayushi Bhattacharjee

机构 * Dept. of CSE (Data Science) Heritage Institute of Technology(计算机科学与工程系(数据科学)哈里特技术学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文通过分析“First Proof”基准测试中LLM的错误,识别出四种失败模式(F1-F4),并审计Gemini 2.5 Flash生成的证明,发现前提走私(F2)普遍存在且无法被引文验证检测,提出应构建推理时管道预防而非事后检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03818 2026-06-23 cs.CL 版本更新 91%

Empirical Prompt Engineering for Construct Identification with Large Language Models

改善人机编码对齐:心理学构念识别中提示工程的实证评估

Kylie L. Anglin, Stephanie Milan, Brittney Hernandez, Claudia Ventura

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17312 2026-06-17 cs.AI 新提交 91%

Quantifying Consistency in LLM Logical Reasoning via Structural Uncertainty

通过结构不确定性量化LLM逻辑推理中的一致性

Baishali Chaudhury, Mengdie Flora Wang, Hyunji Hayley Park, Rahul Ghosh, Sungmin Hong, Jae Oh Woo

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI

AI总结 提出结构不确定性框架,通过自偏好排序的稳定性评估LLM推理一致性,在逻辑和数学任务中与答案分散度互补,提升不可靠实例识别。

Comments Published at ICLR 2026 Workshop on Logical Reasoning of Large Language Models. Accepted as best paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09484 2026-06-09 cs.CL 新提交 91%

Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

检测差异不等于理解结构:大型语言模型在图同构任务中失败

Kumar Thushalika, Sukumar Kishanthan, Asela Hevapathige

机构 * University of Ruhuna(鲁胡纳大学) University of Moratuwa(莫拉图瓦大学) University of Melbourne(墨尔本大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本研究通过图同构检测任务揭示LLM的“虚假成功”:虽然LLM在检测同构时准确率接近完美,但面对节点标签置换的相同图时却无法识别,表明其依赖模式而非抽象结构推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03858 2026-06-03 cs.AI 91%

PyraMathBench: Evaluating and Improving Mathematical Capability in Large Language Models

PyraMathBench: 评估与提升大型语言模型的数学能力

Zetian Ouyang, Linlin Wang, Gerard de Melo, Liang He

机构 * East China Normal University(东华师范大学) Hasso Plattner Institute, University of Potsdam(波茨坦大学哈索普兰特纳研究所)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出PyraMathBench分层基准测试,通过整合数值处理与数学推理评估LLM,并引入SOLVE模块和IRPO优化方法提升数值-数学协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10398 2026-05-29 cs.CE cs.AI 91%

Are LLMs Socially Adaptive? Contrasting Belief Evolution in Large Language Models and Humans

大型语言模型是否具有社会适应性?对比大型语言模型与人类的信念演化

Yu Lei, Hao Liu, Chengxing Xie, Songjia Liu, Zhiyu Yin, Canyu Chen, Guohao Li, Philip Torr, Zhen Wu

机构 * Tsinghua University(清华大学) Department of Psychological and Cognitive Sciences(心理与认知科学系) College AI(人工智能学院) School of Management(管理学院) Fudan University(复旦大学) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本研究提出基于社会心理学的仿真基准FairMindSim和信念-奖励对齐行为演化模型BREM,通过连续经济游戏对比人类与LLM的决策动态,发现中等能力模型表现出过度惩罚的刚性攻击性,而前沿模型随推理能力提升趋向人类式的克制与宽容。

Comments KDD 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24050 2026-05-26 cs.LG 91%

Bridging On-Device and Cloud LLMs for Collaborative Reasoning: A Unified Methodology for Local Routing and Post-Training

桥接设备端与云端大语言模型实现协作推理:本地路由与后训练的统一方法

Wenzhi Fang, Dong-Jun Han, Liangqi Yuan, Evan Chen, Christopher Brinton

机构 * Purdue University(普渡大学) Yonsei University(延世大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);post-training(title,abstract);large language model(abstract);language model(abstract)

AI总结 提出通过强化学习后训练使设备端LLM内部决定是否调用云端,结合分层奖励和自适应提示过滤,显著缩小与纯云端LLM的性能差距。

Comments We propose a unified post-training framework that integrates routing optimization, enabling the on-device LLM to improve its problem-solving ability while learning routing strategies

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22238 2026-05-22 cs.AI 91%

Evaluating Large Language Models as Live Strategic Agents: Provider Performance, Hybrid Decomposition, and Operational Gaps in Timed Risk Play

评估大型语言模型作为实时战略代理:提供商性能、混合分解及时间风险游戏中的操作差距

H. C. Ekne

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 本文研究了大型语言模型在实时策略环境中的表现,发现其性能受目标跟踪、执行转换、成本和运行时可靠性等因素影响,支持将LLM作为受限制工作流中的组件进行评估,而非孤立的基准测试对象。

Comments 13 pages, 7 figures. Code and tracked notes: https://github.com/hcekne/risk-game . Public runtime artifact index: https://github.com/hcekne/risk-game/blob/main/docs/article-plans/public_experiment_artifacts.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14004 2026-05-19 cs.CL 91%

Early Stopping Chain-of-thoughts in Large Language Models

大语言模型中的早期停止思维链

Minjia Mao, Bowen Yin, Yu Zhu, Xiao Fang

机构 * University of Delaware(德克萨斯大学) Peking University(北京大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本文提出了一种在推理阶段减少思维链生成长度的方法ES-CoT,通过检测答案收敛并提前停止来降低推理成本,同时保持与标准思维链相当的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10825 2026-05-19 cs.AI 91%

CheeseBench: Evaluating Large Language Models on Rodent Behavioral Neuroscience Paradigms

CheeseBench:在啮齿类行为神经科学范式上评估大语言模型

Zacharie Bugaud

机构 * Astera Institute(Astera研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 CheeseBench通过九种经典行为神经科学范式评估大语言模型,发现模型规模、上下文历史、提示方式和架构对性能有显著影响,且当前模型在空间导航等任务上仍低于啮齿类动物基准。

Comments 8 pages, 6 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17677 2026-05-05 cs.AI 91%

EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving

EngiBench:用于评估大型语言模型在工程问题解决上的基准

Xiyuan Zhou, Xinlei Wang, Yirui He, Yang Wu, Ruixi Zou, Yuheng Cheng, Yulu Xie, Wenxuan Liu, Huan Zhao, Yan Xu, Jinjin Gu, Junhua Zhao

机构 * Nanyang Technological University(南洋理工大学) The University of Sydney(悉尼大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) The University of Hong Kong(香港大学) Hong Kong Polytechnic University(香港理工大学) AIRS

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 EngiBench是一个分层基准,用于评估大型语言模型在解决工程问题上的能力,涵盖基础知识检索、情境推理和开放性建模三个层次,揭示当前LLM在现实工程中仍缺乏高级推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19125 2026-04-22 cs.CL 91%

Do Emotions Influence Moral Judgment in Large Language Models?

情绪是否影响大语言模型的道德判断?

Mohammad Saim, Tianyu Jiang

机构 * University of Cincinnati(辛辛那提大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 研究通过情感诱导流程评估多组数据和LLM中道德可接受性变化,发现积极情绪提升道德可接受性,负面情绪降低,且部分情绪表现与预期相反,揭示了当前LLM与人类在道德判断上的差异。

Comments 18 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12995 2026-04-15 cs.CL cs.CY 91%

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models

PolicyLLM:迈向大型语言模型在公共政策领域的卓越理解

Han Bao, Penghao Zhang, Yue Huang, Zhengqing Yuan, Yanchi Ru, Rui Su, Yujun Zhou, Xiangqi Wang, Kehan Guo, Nitesh V Chawla, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出PolicyBench基准和PolicyMoE模型,评估大型语言模型在公共政策理解中的能力,发现其在应用任务中表现更优,揭示了当前LLM在政策理解中的局限性。

Comments Accepted by ACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23206 2026-02-02 cs.AI 91%

High-quality generation of dynamic game content via small language models: A proof of concept

通过小型语言模型实现高质量动态游戏内容生成:概念验证

Morten I. K. Munk, Arturo Valdivia, Paolo Burelli

机构 * brAIn lab\ University of Copenhagen Copenhagen Denmark \&\ Power Labs Copenhagen Denmark Data Science Section\ University of Copenhagen Copenhagen Denmark brAIn lab\ University of Copenhagen \&\ Power Labs Data Science Section\ University of Copenhagen

专题命中 推理与问题求解 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 本文提出通过激进微调小型语言模型生成高质量动态游戏内容的方法,并通过概念验证展示其在实时生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏