arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 18 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 18 篇

2602.18232 2026-02-23 cs.CL cs.AI 86%

Thinking by Subtraction: Confidence-Driven Contrastive Decoding for LLM Reasoning

通过减法思考:基于置信度的对比解码用于大语言模型推理

Lexiang Tang, Weihao Gao, Bingchen Zhao, Lu Ma, Qiao jin, Bang Yang, Yuexian Zou

机构 * Peking University, Beijing, China(北京大学) University of Edinburgh, Edinburgh, UK(爱丁堡大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过置信度驱动的对比解码方法提升大语言模型推理可靠性,减少输出长度并提高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14556 2026-02-23 cs.AI cs.ET cs.LG cs.RO 86%

LLM-Enabled In-Context Learning for Data Collection Scheduling in UAV-assisted Sensor Networks

基于大语言模型的上下文学习用于无人机辅助传感器网络中的数据采集调度

Yousef Emami, Hao Zhou, SeyedSina Nabavirazani, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时与嵌入式计算系统研究中心(CISTER)) Faculdade de Engenharia da Universidade do Porto(葡萄牙波尔图大学工程学院) School of Computer Science, McGill University(麦吉尔大学计算机科学学院) Knight Foundation School of Computing and Information Sciences, Florida International University(国际大学计算与信息科学学院(Knight基金会))

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于大语言模型的上下文学习数据采集调度系统,用于解决无人机辅助传感器网络中的紧急调度问题,通过自然语言任务描述和安全验证机制提升调度效率和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17937 2026-02-23 cs.CL cs.PL 85%

Analyzing LLM Instruction Optimization for Tabular Fact Verification

分析用于表格事实验证的LLM指令优化

Xiaotang Du, Giwon Hong, Wai-Chung Kwan, Rohit Saxena, Ivan Titov, Pasquale Minervini, Emily Allaway

机构 * University of Edinburgh(爱丁堡大学)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文研究了指令优化在表格事实验证中的应用,发现MiPROv2在CoT中表现最佳,SIMBA在ReAct中效果显著,且CoT在小模型中仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10134 2026-02-23 cs.AI 85%

FRSICL: LLM-Enabled In-Context Learning Flight Resource Allocation for Fresh Data Collection in UAV-Assisted Wildfire Monitoring

FRSICL: 基于大语言模型的上下文学习飞行资源分配用于无人机辅助 wildfire 监测中的新鲜数据采集

Yousef Emami, Hao Zhou, Miguel Gutierrez Gaitan, Kai Li, Luis Almeida

机构 * Real-Time and Embedded Computing Systems Research Centre (CISTER)(实时嵌入式计算系统研究中心) Carnegie Mellon University(卡内基梅隆大学) Pontificia Universidad Católica de Chile(天主教智利大学) Instituto de Telecomunicações(电信研究院) Faculdade de Engenharia, Universidade do Porto(工程学院,葡萄牙里斯本大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的上下文学习飞行资源分配方法,用于无人机辅助森林火灾监测中的实时数据采集优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17680 2026-02-23 cs.LG 81%

BioBridge: Bridging Proteins and Language for Enhanced Biological Reasoning with LLMs

BioBridge: 蛋白质与语言的桥梁:利用大语言模型增强生物推理

Yujia Wang, Jihong Guan, Wengen Li, Shuigeng Zhou, Xuhong Wang

机构 * School of Computer Science and Technology(计算机科学与技术学院) College of Computer Science and Artificial Intelligence(计算机科学与人工智能学院) Fudan University(复旦大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 BioBridge结合蛋白质领域知识与通用语言能力,通过领域自适应持续预训练框架提升生物推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11409 2026-02-23 cs.LG cs.AI cs.CL cs.CV 80%

Visual Planning: Let's Think Only with Images

视觉规划:只用图像来思考

Yi Xu, Chengzu Li, Han Zhou, Xingchen Wan, Caiqi Zhang, Anna Korhonen, Ivan Vulić

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室) Google(谷歌公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出视觉规划范式,通过图像进行推理,优于纯文本推理,在视觉导航任务中表现更优。

Comments ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10855 2026-02-23 cs.LG 79%

ExPairT-LLM: Exact Learning for LLM Code Selection by Pairwise Queries

ExPairT-LLM:通过成对查询实现LLM代码选择的精确学习

Tom Yuviler, Dana Drachsler-Cohen

机构 * Tom Yuviler(独立研究者) Dana Drachsler-Cohen(独立研究者)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.LG

AI总结 ExPairT-LLM通过成对查询提升LLM代码选择的精确性,实现更高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04108 2026-02-23 cs.CL 79%

Batch Prompting Suppresses Overthinking Reasoning Under Constraint: How Batch Prompting Suppresses Overthinking in Reasoning Models

批量提示抑制约束下的过度推理:如何通过批量提示抑制推理模型中的过度推理

Saurabh Srivastava, Janit Bidhan, Hao Yan, Abhishek Dey, Tanu Kansal, Paras Kath, Sina Mansouri, Mohit Marvania, Vamsi Shankar Simhadri, Gaurav Singh

机构 * George Mason University(乔治·马歇尔大学) Google(谷歌) eBay

专题命中 推理与问题求解 :prompting(title,abstract);分类 cs.CL

AI总结 批量提示通过减少推理标记和抑制过度推理行为,提升推理模型的效率和可靠性。

Comments New version with updated author list

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18307 2026-02-23 cs.SE cs.CL cs.LG cs.PL 79%

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

VeriSoftBench: 仓库级形式验证基准测试用于Lean

Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig

机构 * New York University(纽约大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 VeriSoftBench通过500个Lean 4证明义务评估LLM和证明器在仓库级形式验证中的表现,揭示了依赖闭包对证明成功率的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18424 2026-02-23 cs.CV cs.RO 78%

CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation

CapNav:基于能力条件的室内导航基准测试

Xia Su, Ruiqi Chen, Benlin Liu, Jingwei Ma, Zonglin Di, Ranjay Krishna, Jon Froehlich

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 CapNav基准测试评估VLMs在不同移动约束下室内导航能力,发现其性能随约束增加而下降,且先进模型仍难以处理空间推理任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18429 2026-02-23 cs.CL cs.IR 77%

VIRAASAT: Traversing Novel Paths for Indian Cultural Reasoning

VIRAASAT:为印度文化推理开辟新路径

Harshul Raj Surana, Arijit Maji, Aryan Vats, Akash Ghosh, Sriparna Saha, Amit Sheth

机构 * AI Institute, University of South Carolina(AI研究所,南卡罗来纳大学) Indian Institute of Technology Patna(帕纳大学印度理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 VIRAASAT通过半自动化多跳方法生成印度文化多跳问题-答案数据集,提出SCoM框架提升文化推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18095 2026-02-23 cs.AI 77%

Neurosymbolic Language Reasoning as Satisfiability Modulo Theory

神经符号语言推理作为可满足性模理论

Hyunseok Oh, Sam Stern, Youngki Lee, Matthai Philipose

机构 * Seoul National University(首尔国立大学) U. Mass. Amherst(马萨诸塞大学阿姆赫斯特分校) Microsoft(微软公司)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Logitext通过结合LLM和SMT求解,实现自然语言与逻辑推理的联合处理,提升内容审核和法律任务的准确性和覆盖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08364 2026-02-23 cs.CL 77%

Structure-Augmented Reasoning Generation

结构增强的推理生成

Jash Rajesh Parekh, Pengcheng Jiang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 结构增强的推理生成通过显式推理结构提升多跳查询的准确性和连贯性,兼容现有RAG流程,无需定制检索器或微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17037 2026-02-23 cs.SE cs.AI cs.HC cs.PL 70%

Wink: Recovering from Misbehaviors in Coding Agents

Wink: 代码代理中行为失误的恢复

Rahul Nanda, Chandra Maddila, Smriti Jha, Euna Mehnaz Khan, Matteo Paltenghi, Satish Chandra

机构 * Meta Platforms, Inc.(Meta平台公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Wink通过异步自我干预系统有效恢复代码代理的行为失误,减少工具调用失败和人工干预需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17734 2026-02-23 cs.SE cs.AI 70%

Five Fatal Assumptions: Why T-Shirt Sizing Systematically Fails for AI Projects

五项致命假设:为何T恤 sizing 系统性地失败于AI项目

Raja Soundaramourty, Ozkan Kilic, Ramu Chenchaiah

机构 * Cisco Systems, Inc.(思科系统公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文指出T恤 sizing在AI项目中失效的五项致命假设,并提出Checkpoint Sizing作为更人性化的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18297 2026-02-23 cs.LG cs.AI cs.CL cs.IT math.IT 67%

Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory

通过信息论分析和改进链式思维可监控性

Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos

机构 * University of Cambridge(剑桥大学) Qualcomm AI Research(高通人工智能研究)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过信息论分析,提出两种方法改进链式思维监控器的可监控性,以提高监控准确性并防止奖励黑客问题。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18351 2026-02-23 cs.CL cs.AI 62%

Validating Political Position Predictions of Arguments

验证论证中政治立场预测的准确性

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出双尺度验证框架,通过点评和成对验证方法验证论证中政治立场预测的准确性,构建了大规模政治立场知识库,提升了政治领域知识表示能力。

Comments 13 pages, 6 figures, 6 tables. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17688 2026-02-23 cs.LG cs.PL 57%

AnCoder: Anchored Code Generation via Discrete Diffusion Models

AnCoder:通过离散扩散模型实现锚定代码生成

Anton Xue, Litu Rout, Constantine Caramanis, Sanjay Shakkottai

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 AnCoder通过结构化锚定扩散模型实现高质量代码生成,解决了传统方法无法尊重编程语言结构的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏